CONTACT联系九鸣
← 返回新闻中心

让 ChatGPT 和 Perplexity 找到官网 先分清搜索爬虫与训练爬虫

OAI-SearchBot、GPTBot 与 PerplexityBot 承担的任务并不相同。企业可以分别管理搜索展示、模型训练和内容访问,而不必在“全部开放”和“全部拒绝”之间二选一。

搜索发现与模型训练沿不同访问路径进入内容库
搜索发现与模型训练沿不同访问路径进入内容库

不少企业做了大量 GEO 内容,却从未检查 AI 搜索能不能访问官网。也有企业因为担心内容被训练,直接屏蔽所有 AI 爬虫,结果同时失去了进入搜索答案的机会。

解决这个问题,第一步是分清不同爬虫的用途。

已确认的官方事实

OpenAI 将 OAI-SearchBot 与 GPTBot 作为两个独立控制项。OAI-SearchBot 用于让网页出现在 ChatGPT 搜索结果中;GPTBot 对应内容是否可用于改进和训练 OpenAI 的生成式基础模型。

因此,网站可以允许 OAI-SearchBot,同时拒绝 GPTBot。OpenAI 表示,robots.txt 规则调整后,系统可能需要约 24 小时更新。允许抓取也不能保证靠前展示,站点的 CDN 或防火墙还必须接受来自官方 IP 范围的真实请求。

Perplexity 的官方文档同样区分 PerplexityBot 与用户触发型访问。PerplexityBot 用于发现网页、建立搜索索引和展示来源链接,不用于训练基础模型。官方建议同时核验 User-Agent 与公开 IP,避免把伪装爬虫误认为合法请求。

一个常见的策略示例如下:

User-agent: OAI-SearchBot
Allow: /

User-agent: GPTBot
Disallow: /

User-agent: PerplexityBot
Allow: /

这只是“允许搜索、拒绝训练”的示例,企业仍需根据版权、合规和商业目标自行决定。

九鸣观察

robots.txt 解决的是访问许可,不是推荐理由。打开爬虫之后,还要继续检查四件事:

  • 页面是否有稳定、唯一且可索引的 URL
  • 正文是否以服务器可读取的文本呈现
  • Sitemap、Canonical 和内部链接是否指向同一版本
  • CDN、WAF、验证码或登录墙是否误伤合法爬虫

对于不希望出现在搜索中的页面,应使用合适的 noindex 规则,而不是只依赖 robots.txt。因为爬虫若完全无法访问页面,也可能无法读取页面里的 noindex 指令。

GEO 的技术起点并不神秘:先决定哪些内容可以公开,再让搜索爬虫可靠访问这些内容。只有进入候选信息池,后续的内容质量、证据与品牌可信度才有发挥空间。

参考资料