
“种子网址”模式是智能采集中最灵活、最高效的功能之一。它不需要您去分析复杂的网页结构或编写正则表达式,只需要提供几个目标网站的首页或栏目页链接(即“种子”),软件就会像爬虫一样,自动从这些页面出发,顺藤摸瓜地发现并抓取内部的所有文章链接。
这种方式特别适合那些结构不统一、没有明显分页规律、或者通过JS动态加载的网站。
以下是详细的操作教程:
第一步:进入配置界面
点击入口:在软件顶部导航栏点击 “数据采集”。
选择模式:在弹出的窗口中,点击 “添加-智能采集” 选项卡,然后内部还有一个选项卡切换到种子网址。
第二步:设置基础参数
在配置面板的顶部,填写任务的基本信息:
智能采集任务名称:给任务起个名字,例如“某行业网站深度采集”。
采集任务分类:选择文章发布的目标栏目。
采集最大值:设置计划采集的文章总数上限(建议设置一个合理的数值,防止无限采集)。
采集间隔时间:建议设置为 200 - 300 毫秒,模拟人工访问速度,避免被封禁。
第三步:配置种子网址
输入网址:
在大的文本框中,输入您想要采集的网站地址。
格式要求:每行一个网址。
技巧:您可以直接复制网站的首页,或者某个列表页/栏目页的地址。软件会自动识别这些页面上的所有链接,并尝试点击进入详情页采集。
https://www.example.com/news/
https://www.example.com/tech/
第四步:设置过滤规则(精准控制)
为了防止软件抓取到无关的页面(如“关于我们”、“联系方式”、“登录页”等),您需要设置过滤规则。
网址包含:
这里填写文章详情页URL中必须包含的特征字符。
默认值:(\.shtml|\.html|\.htm),这意味着只采集以 .html、.htm 或 .shtml 结尾的链接。
自定义:如果您的网站文章链接是 .../view?id=123 这种形式,您可以将其修改为 view?id= 或者 .php 等特征词。支持正则表达式。
过滤规则:
这里填写您不想采集的链接特征。
示例:如果您不想采集包含 login 或 admin 的页面,可以填入 (login|admin)。
为什么使用“种子网址”?
无需写规则:不用懂代码,不用找 <div> 标签,只要给个链接就能采。
自动发现:它能自动跟踪链接跳转,哪怕网站改版了,只要链接结构没大变,通常都能继续采集。
批量处理:一次可以扔进去几十个网站的链接,软件会自动轮询采集。