ClaudeBot:Anthropic 的模型开发爬虫

ClaudeBot 抓取可能用于模型开发的公开网页。修改 robots.txt 前,应先区分 Claude-SearchBot 与 Claude-User。

发布于 2026-06-19
·
更新于 2026-07-22
·
2 分钟阅读

ClaudeBot

ClaudeBot 是 Anthropic 用于收集可能进入未来模型训练数据集的公开网页爬虫。Anthropic 将它与支持搜索结果质量的 Claude-SearchBot,以及按用户要求获取内容的 Claude-User 分开。

这种拆分让站长可以分别表达模型开发、搜索发现与用户发起获取的政策。

Anthropic 的三种机器人

User-agent官方说明的用途屏蔽后的含义
ClaudeBot潜在的模型训练内容收集表示未来网站内容不应进入训练数据集
Claude-SearchBot搜索索引与结果质量可能降低在 Claude 搜索结果中的可见性
Claude-UserClaude 用户发起的页面获取阻止这类用户请求获取内容

所以,“屏蔽 ClaudeBot”不等于“屏蔽 Claude 的所有网页访问”。

分用途 robots.txt 策略

User-agent: ClaudeBot
Disallow: /

User-agent: Claude-SearchBot
Allow: /

User-agent: Claude-User
Allow: /

只有当它符合组织的法律与产品政策时才使用该配置,并在每个相关主机名重复部署。

实施和验证

  1. 绕过浏览器缓存抓取线上 /robots.txt,确认规则组没有意外合并。
  2. 在 CDN 与 WAF 中检查三种 token;边缘拒绝会覆盖 robots.txt 的允许。
  3. 查看真实正文 URL 的响应,而不只检查 robots.txt。
  4. 上线后监控抓取量,并记录修改日期。
  5. 定期复查 Anthropic 官方文档,因为爬虫名称和行为可能变化。

Anthropic 目前表示不公布这些机器人稳定的 IP 段,因此不应声称可以通过其“官方 IP 列表”确认。User-Agent 观察可作为运营证据,但字符串本身可以伪造。

允许访问不代表什么

允许 Claude-SearchBot 不保证索引、引用、排名或 AI 引荐流量。应分别用日志、分析平台引荐与固定问题集衡量,并避免在没有受控前后测试时,把引用变化归因于一次 robots.txt 修改。

robots.txt 也不是隐私边界。敏感或授权内容必须使用认证、授权和合同控制。

主要来源

延伸阅读:AI 爬虫robots.txt引用率

Privacy & Cookies

We use cookies to enhance your experience. By continuing to visit this site you agree to our use of cookies.