6.png


本教程将指导您如何为“中国新闻网”频道创建一个自定义采集规则。通过配置,软件可以自动识别并抓取指定范围内的所有文章链接及内容。

第一步:分析目标网站与列表页规则

在创建规则前,首先需要分析目标网站的URL结构,这是实现批量采集的基础。

观察URL规律:打开目标网站“中国新闻网-滚动新闻”。

第1页网址为:https://www.chinanews.com.cn/scroll-news/news1.html

第2页网址为:https://www.chinanews.com.cn/scroll-news/news2.html

以此类推,可以发现页码数字是递增的。

确定采集范围:根据URL规律,我们可以设定一个页码区间(例如1-10),让软件自动遍历这些页面。

第二步:新建采集规则

进入功能入口:在软件主界面,点击 “数据采集”,然后选择 “新建” 来创建一个新的采集规则。

填写列表页网址:

在“采集的列表网址”输入框中,填入分析好的URL模板:https://www.chinanews.com.cn/scroll-news/news(*).html

注意:(*) 是软件识别的页码占位符,代表这里的数字会变化。

设置页码区间:

在“开启分页”中,填写您希望采集的页码范围,例如 1-10。

第三步:定义内容网址提取规则

审查网页元素:

在浏览器中打开任意一个列表页(如 news1.html)。

在文章列表区域点击鼠标右键,选择 “审查元素” (Inspect)。

在开发者工具中,找到包裹所有文章链接的最外层HTML标签。

确定内容区域边界:

列表页开始代码:通过审查元素,我们发现所有文章链接都被包含在 <div class="content_list"> 这个标签内。您可以使用 Ctrl+F 在源代码中搜索此代码,确认其唯一性。

列表页结尾代码:同样地,我们找到该区域的结束标签,例如 <div id="more">。

因此,所有文章链接都位于 <div class="content_list"> 和 <div id="more"> 之间。

填写提取规则:

内容网址区域匹配:填写 <div class="content_list">[内容]<div id="more">。[内容] 是软件识别的变量,代表我们需要提取的目标区域。

内容网址包含字符:观察区域内的文章链接,发现它们都包含年份数字(如 2026),-和 .shtml 后缀。为了精准过滤,我们填写 ([0-9]+).shtml,-

注意:这里用英文逗号 , 隔开两个不连续的字符,支持正则写法。

第四步:定义内容采集规则(可选)

在成功提取到文章列表页的所有链接后,软件需要知道如何进入每一篇文章内部,把标题和正文“扣”出来,默认提供了“公共规则”会自动抓取标题和正文。

虽然系统提供了“公共规则”作为默认选项(通常能应对大部分标准网站),但在面对结构特殊的网站时,您需要手动定义提取逻辑。以下是三种核心提取方式的详细教程:

1. 前后截取法(最常用、最简单)

这是最直观的方法。原理是告诉软件:“我要的内容在代码A和代码B之间”。

适用场景:网页源代码结构清晰,目标内容前后有独特的HTML标签或文字。

填写格式:前缀代码[内容]后缀代码

操作演示:

您应填写:<div id="article_body">[内容]</div>

您应填写:<h1 class="title">[内容]</h1>

解释:软件会找到 <h1 class="title"> 作为起点,</h1> 作为终点,中间的就是标题。

提取标题:假设网页源码中标题长这样 <h1 class="title">这里是标题</h1>。

提取正文:假设正文被包裹在 <div id="article_body">...正文...</div> 中。

2. XPath 定位法(精准、专业)

XPath 是一种在 XML/HTML 文档中查找信息的语言。如果您的目标网站结构很复杂,或者没有明显的文本特征,用 XPath 是最稳妥的。

适用场景:深层嵌套的标签、类名动态变化、或者通过 ID 定位。

常见写法示例:

含义:选取 ID 为 news 的 div 下面的所有段落 p。

含义:选取 class 为 main-text 的 div 标签内容。

含义:选取 ID 为 content 的元素下的所有内容。

通过 ID 定位(最稳)://*[@id="content"]

通过 Class 定位://div[@class="main-text"]

层级定位://div[@id="news"]/p

如何获取:在浏览器按 F12 打开开发者工具 -> 选中目标元素 -> 右键 -> Copy -> Copy XPath,然后粘贴进去即可。

3. 正则表达式法(灵活、强大)

正则表达式(Regex)是一种强大的文本匹配工具,适合处理非标准 HTML 或需要清洗数据的场景。

适用场景:目标内容没有固定的 HTML 标签包裹,或者需要去除特定的干扰字符。

填写格式:需要使用捕获组 ([内容]) 或软件特定的 [内容] 标记。

操作演示:

假设源码是:发布时间:2023-10-01,你想只抓取日期。

规则可写为:发布时间:(.*?)

解释:.*? 代表匹配任意字符直到遇到下一个条件。

第五步:保存并开始采集

配置基本信息:

采集名称:填写一个易于识别的名称,如 中国新闻网-滚动新闻。

分类:为采集到的文章指定一个分类,如 中国新闻网。

保存规则:

点击 “保存” 按钮,将这套采集规则保存下来,方便以后重复使用。

执行采集:

点击 “开始采集”。软件将根据规则自动遍历所有列表页,抓取文章链接,并进入每个链接抓取标题和正文内容。

查看结果:

采集完成后,点击 “刷新” 查看采集到的文章总数。

进入 “文章库”,即可详细查看和管理所有采集到的文章内容。