GPTBot、OAI-SearchBot 与 Googlebot:AI SEO 的 robots.txt 规则
Technical SEO June 27, 2026 6 分钟阅读

GPTBot、OAI-SearchBot 与 Googlebot:AI SEO 的 robots.txt 规则

AI crawler 策略已经是技术 SEO 决策,不再是附带项。

Googlebot、GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot、Bingbot 等 crawler 访问网站的原因可能完全不同。全部屏蔽很简单,理解后再控制更好。

这篇文章提供一套 AI SEO 的 robots.txt 决策框架。

AI 爬虫 robots.txt 策略流程图

先看用途

不要把所有 AI 相关 user agent 都放进同一个篮子。

先问它是做什么的:

Crawler 类型常见用途SEO 问题
搜索 crawler发现并索引网页我们是否需要可见性?
AI 训练 crawler收集模型训练数据是否允许训练用途?
用户触发 agent为用户请求抓取页面是否允许用户通过助手访问?
预览或集成 bot渲染卡片或读取 metadata预览是否重要?

OpenAI 的 crawler 文档区分了 GPTBotOAI-SearchBotChatGPT-User 等。Google 也单独说明了 Googlebot 与验证方式

同一条 robots 规则不应该自动应用给所有 crawler。

建立策略矩阵

修改 robots.txt 之前,先做一个策略矩阵:

内容类型搜索引擎AI 搜索 crawler训练 crawler用户 agent
公开博客Allow通常 Allow决定Allow
产品页AllowAllow决定Allow
文档AllowAllow决定Allow
价格页AllowAllow决定Allow
私有 app URLDisallowDisallowDisallowDisallow
Staging URLDisallowDisallowDisallowDisallow

这样可以避免情绪化屏蔽 crawler 影响搜索可见性。

robots.txt 示例

允许正常抓取,屏蔽某个训练 crawler:

User-agent: GPTBot
Disallow: /

User-agent: *
Allow: /

屏蔽私有路径:

User-agent: *
Disallow: /app/
Disallow: /admin/
Disallow: /checkout/

保持 sitemap 发现清楚:

Sitemap: https://example.com/sitemap.xml

上线前用 robots.txt checker 验证自己的规则。

不要误伤公开 SEO 内容

常见错误:

  • 想屏蔽 /app/,结果误屏蔽 /blog/
  • 不理解搜索影响就屏蔽全部 AI crawler
  • 屏蔽渲染内容需要的 CSS 或 JavaScript
  • 把 staging robots.txt 发到生产环境
  • 忘记移动端或多语言路径
  • 同时错误使用 noindex 和 robots.txt

如果 robots.txt 阻止 Google 抓取页面,Google 可能看不到页面上的 noindex 信号。

用日志和模拟验证

robots.txt 只是其中一层。

还要检查:

  • 服务器日志中的 user agent
  • 可用时做反向 DNS 或官方验证
  • 不同 crawler 的 HTTP 状态
  • 重定向行为
  • 渲染内容
  • canonical 标签
  • meta robots

Fennec 的 Bot Simulator 可以比较不同 user agent 获得的页面。高价值页面建议结合 Link CheckerTechnical SEO Audit

注意服务器成本

AI crawler 流量可能带来真实成本。如果某个 crawler 访问过于频繁,可以考虑:

  • 限速
  • CDN bot controls
  • 缓存
  • 更窄的 allow 规则
  • 大媒体文件单独规则
  • 按 user agent 监控

不要只靠 robots.txt 控制成本。它是自愿协议,挡不住恶意访问。

实用决策框架

逐项回答:

  1. 这个 crawler 是否支持我们在意的搜索可见性?
  2. 内容是否公开且希望被发现?
  3. 是否有版权或商业原因限制复用?
  4. crawler 流量是否造成性能或成本问题?
  5. 能否验证 crawler 身份?
  6. 修改规则后能否监控结果?

不确定时,先在有限路径测试,不要直接全站应用。

总结

AI crawler SEO 不是“全部允许”或“全部屏蔽”。

区分搜索发现、训练用途、用户触发访问和私有内容,再写符合业务目标的 robots.txt,并用日志、模拟和技术审计验证。

控制是好事,意外隐身很昂贵。

Sources

Privacy & Cookies

We use cookies to enhance your experience. By continuing to visit this site you agree to our use of cookies.