GPTBot、OAI-SearchBot 与 Googlebot:AI SEO 的 robots.txt 规则
AI crawler 策略已经是技术 SEO 决策,不再是附带项。
Googlebot、GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot、Bingbot 等 crawler 访问网站的原因可能完全不同。全部屏蔽很简单,理解后再控制更好。
这篇文章提供一套 AI SEO 的 robots.txt 决策框架。
先看用途
不要把所有 AI 相关 user agent 都放进同一个篮子。
先问它是做什么的:
| Crawler 类型 | 常见用途 | SEO 问题 |
|---|---|---|
| 搜索 crawler | 发现并索引网页 | 我们是否需要可见性? |
| AI 训练 crawler | 收集模型训练数据 | 是否允许训练用途? |
| 用户触发 agent | 为用户请求抓取页面 | 是否允许用户通过助手访问? |
| 预览或集成 bot | 渲染卡片或读取 metadata | 预览是否重要? |
OpenAI 的 crawler 文档区分了 GPTBot、OAI-SearchBot、ChatGPT-User 等。Google 也单独说明了 Googlebot 与验证方式。
同一条 robots 规则不应该自动应用给所有 crawler。
建立策略矩阵
修改 robots.txt 之前,先做一个策略矩阵:
| 内容类型 | 搜索引擎 | AI 搜索 crawler | 训练 crawler | 用户 agent |
|---|---|---|---|---|
| 公开博客 | Allow | 通常 Allow | 决定 | Allow |
| 产品页 | Allow | Allow | 决定 | Allow |
| 文档 | Allow | Allow | 决定 | Allow |
| 价格页 | Allow | Allow | 决定 | Allow |
| 私有 app URL | Disallow | Disallow | Disallow | Disallow |
| Staging URL | Disallow | Disallow | Disallow | Disallow |
这样可以避免情绪化屏蔽 crawler 影响搜索可见性。
robots.txt 示例
允许正常抓取,屏蔽某个训练 crawler:
User-agent: GPTBot
Disallow: /
User-agent: *
Allow: /
屏蔽私有路径:
User-agent: *
Disallow: /app/
Disallow: /admin/
Disallow: /checkout/
保持 sitemap 发现清楚:
Sitemap: https://example.com/sitemap.xml
上线前用 robots.txt checker 验证自己的规则。
不要误伤公开 SEO 内容
常见错误:
- 想屏蔽
/app/,结果误屏蔽/blog/ - 不理解搜索影响就屏蔽全部 AI crawler
- 屏蔽渲染内容需要的 CSS 或 JavaScript
- 把 staging robots.txt 发到生产环境
- 忘记移动端或多语言路径
- 同时错误使用 noindex 和 robots.txt
如果 robots.txt 阻止 Google 抓取页面,Google 可能看不到页面上的 noindex 信号。
用日志和模拟验证
robots.txt 只是其中一层。
还要检查:
- 服务器日志中的 user agent
- 可用时做反向 DNS 或官方验证
- 不同 crawler 的 HTTP 状态
- 重定向行为
- 渲染内容
- canonical 标签
- meta robots
Fennec 的 Bot Simulator 可以比较不同 user agent 获得的页面。高价值页面建议结合 Link Checker 和 Technical SEO Audit。
注意服务器成本
AI crawler 流量可能带来真实成本。如果某个 crawler 访问过于频繁,可以考虑:
- 限速
- CDN bot controls
- 缓存
- 更窄的 allow 规则
- 大媒体文件单独规则
- 按 user agent 监控
不要只靠 robots.txt 控制成本。它是自愿协议,挡不住恶意访问。
实用决策框架
逐项回答:
- 这个 crawler 是否支持我们在意的搜索可见性?
- 内容是否公开且希望被发现?
- 是否有版权或商业原因限制复用?
- crawler 流量是否造成性能或成本问题?
- 能否验证 crawler 身份?
- 修改规则后能否监控结果?
不确定时,先在有限路径测试,不要直接全站应用。
总结
AI crawler SEO 不是“全部允许”或“全部屏蔽”。
区分搜索发现、训练用途、用户触发访问和私有内容,再写符合业务目标的 robots.txt,并用日志、模拟和技术审计验证。
控制是好事,意外隐身很昂贵。