
搜索引擎模块是“数据采集 - 智能采集 - 搜索引擎”功能的基石。通过配置这个模块,您可以让软件自动在百度、谷歌、必应等各大引擎中搜索关键词,并抓取搜索结果页面的链接和标题,从而实现全网内容的自动化发现与采集。
以下是详细的自定义配置指南:
第一步:进入搜索引擎管理
点击入口:在顶部导航栏点击 “功能中心”。
打开模块:在图标列表中找到并点击 “搜索引擎”。
界面概览:您会看到一个预设了百度、搜狗、360等常用引擎的列表。如果默认的不满足需求,我们需要手动添加。
第二步:添加自定义搜索引擎
点击左上角的绿色 “添加” 按钮,弹出配置窗口。
1. 基础信息
搜索引擎类型:
输入该引擎的分类名称,例如 百度、Google、Bing 或 知乎。这主要用于左侧列表的分类筛选。
自定义名称:
给这个规则起个名字,方便自己识别,例如 百度搜索-PC端 或 微信搜一搜。
2. 核心配置:请求网址格式
这是最关键的一步,您需要填入搜索引擎的搜索 URL 模板。软件通过这个模板来拼接真实的搜索地址。
如何获取:
打开浏览器,手动在目标搜索引擎(如百度)搜索一个词(例如“测试”)。
复制地址栏的完整 URL。
将 URL 中的关键词部分替换为 {keywords}。
将页码数字部分替换为分页参数。
参数语法说明:
{keywords}:必填。代表搜索关键词,软件运行时会自动替换为您设置的词。
(pid:递增数值,[第一页数值,最后一页数值]):选填。用于控制翻页。
递增数值:每翻一页增加的数值(通常是1)。
[第一页数值,最后一页数值]:定义起始页和结束页的参数值。
💡 举例说明(以百度为例)
假设百度搜索第一页URL是 ...&pn=0,第二页是 ...&pn=10。
您的配置应该是:
https://www.baidu.com/s?wd={keywords}&pn=(pid:10,[0,9999])
解释:每次翻页 pn 增加 10,从 0 开始。
3. 高级过滤:搜索网址包含
作用:这是一个过滤器。软件在搜索结果页提取链接时,只保留符合这里规则的链接。
用法:支持正则表达式。
示例:如果您只想采集 .html 结尾的网页,可以填入 (\.shtml|\.html|\.htm)。如果不填,则默认采集所有外链。
第三步:保存与使用
保存:填写完毕后,点击绿色的 “添加” 按钮保存规则。
调用:回到 “数据采集” -> “智能采集” 模块,在创建任务选择“搜索引擎”作为来源时,您刚才自定义的引擎就会出现在下拉列表中供您选择。