
本教程将指导您如何为“中国新闻网”频道创建一个自定义采集规则。通过配置,软件可以自动识别并抓取指定范围内的所有文章链接及内容。
第一步:分析目标网站与列表页规则
在创建规则前,首先需要分析目标网站的URL结构,这是实现批量采集的基础。
观察URL规律:打开目标网站“中国新闻网-滚动新闻”。
第1页网址为:https://www.chinanews.com.cn/scroll-news/news1.html
第2页网址为:https://www.chinanews.com.cn/scroll-news/news2.html
以此类推,可以发现页码数字是递增的。
确定采集范围:根据URL规律,我们可以设定一个页码区间(例如1-10),让软件自动遍历这些页面。
第二步:新建采集规则
进入功能入口:在软件主界面,点击 “数据采集”,然后选择 “新建” 来创建一个新的采集规则。
填写列表页网址:
在“采集的列表网址”输入框中,填入分析好的URL模板:https://www.chinanews.com.cn/scroll-news/news(*).html
注意:(*) 是软件识别的页码占位符,代表这里的数字会变化。
设置页码区间:
在“开启分页”中,填写您希望采集的页码范围,例如 1-10。
第三步:定义内容网址提取规则
审查网页元素:
在浏览器中打开任意一个列表页(如 news1.html)。
在文章列表区域点击鼠标右键,选择 “审查元素” (Inspect)。
在开发者工具中,找到包裹所有文章链接的最外层HTML标签。
确定内容区域边界:
列表页开始代码:通过审查元素,我们发现所有文章链接都被包含在 <div class="content_list"> 这个标签内。您可以使用 Ctrl+F 在源代码中搜索此代码,确认其唯一性。
列表页结尾代码:同样地,我们找到该区域的结束标签,例如 <div id="more">。
因此,所有文章链接都位于 <div class="content_list"> 和 <div id="more"> 之间。
填写提取规则:
内容网址区域匹配:填写 <div class="content_list">[内容]<div id="more">。[内容] 是软件识别的变量,代表我们需要提取的目标区域。
内容网址包含字符:观察区域内的文章链接,发现它们都包含年份数字(如 2026),-和 .shtml 后缀。为了精准过滤,我们填写 ([0-9]+).shtml,-。
注意:这里用英文逗号 , 隔开两个不连续的字符,支持正则写法。
第四步:定义内容采集规则(可选)
在成功提取到文章列表页的所有链接后,软件需要知道如何进入每一篇文章内部,把标题和正文“扣”出来,默认提供了“公共规则”会自动抓取标题和正文。
虽然系统提供了“公共规则”作为默认选项(通常能应对大部分标准网站),但在面对结构特殊的网站时,您需要手动定义提取逻辑。以下是三种核心提取方式的详细教程:
1. 前后截取法(最常用、最简单)
这是最直观的方法。原理是告诉软件:“我要的内容在代码A和代码B之间”。
适用场景:网页源代码结构清晰,目标内容前后有独特的HTML标签或文字。
填写格式:前缀代码[内容]后缀代码
操作演示:
您应填写:<div id="article_body">[内容]</div>
您应填写:<h1 class="title">[内容]</h1>
解释:软件会找到 <h1 class="title"> 作为起点,</h1> 作为终点,中间的就是标题。
提取标题:假设网页源码中标题长这样 <h1 class="title">这里是标题</h1>。
提取正文:假设正文被包裹在 <div id="article_body">...正文...</div> 中。
2. XPath 定位法(精准、专业)
XPath 是一种在 XML/HTML 文档中查找信息的语言。如果您的目标网站结构很复杂,或者没有明显的文本特征,用 XPath 是最稳妥的。
适用场景:深层嵌套的标签、类名动态变化、或者通过 ID 定位。
常见写法示例:
含义:选取 ID 为 news 的 div 下面的所有段落 p。
含义:选取 class 为 main-text 的 div 标签内容。
含义:选取 ID 为 content 的元素下的所有内容。
通过 ID 定位(最稳)://*[@id="content"]
通过 Class 定位://div[@class="main-text"]
层级定位://div[@id="news"]/p
如何获取:在浏览器按 F12 打开开发者工具 -> 选中目标元素 -> 右键 -> Copy -> Copy XPath,然后粘贴进去即可。
3. 正则表达式法(灵活、强大)
正则表达式(Regex)是一种强大的文本匹配工具,适合处理非标准 HTML 或需要清洗数据的场景。
适用场景:目标内容没有固定的 HTML 标签包裹,或者需要去除特定的干扰字符。
填写格式:需要使用捕获组 ([内容]) 或软件特定的 [内容] 标记。
操作演示:
假设源码是:发布时间:2023-10-01,你想只抓取日期。
规则可写为:发布时间:(.*?)
解释:.*? 代表匹配任意字符直到遇到下一个条件。
第五步:保存并开始采集
配置基本信息:
采集名称:填写一个易于识别的名称,如 中国新闻网-滚动新闻。
分类:为采集到的文章指定一个分类,如 中国新闻网。
保存规则:
点击 “保存” 按钮,将这套采集规则保存下来,方便以后重复使用。
执行采集:
点击 “开始采集”。软件将根据规则自动遍历所有列表页,抓取文章链接,并进入每个链接抓取标题和正文内容。
查看结果:
采集完成后,点击 “刷新” 查看采集到的文章总数。
进入 “文章库”,即可详细查看和管理所有采集到的文章内容。