ClaudeBot:Anthropic 的模型开发爬虫
ClaudeBot 抓取可能用于模型开发的公开网页。修改 robots.txt 前,应先区分 Claude-SearchBot 与 Claude-User。
ClaudeBot
ClaudeBot 是 Anthropic 用于收集可能进入未来模型训练数据集的公开网页爬虫。Anthropic 将它与支持搜索结果质量的 Claude-SearchBot,以及按用户要求获取内容的 Claude-User 分开。
这种拆分让站长可以分别表达模型开发、搜索发现与用户发起获取的政策。
Anthropic 的三种机器人
| User-agent | 官方说明的用途 | 屏蔽后的含义 |
|---|---|---|
ClaudeBot | 潜在的模型训练内容收集 | 表示未来网站内容不应进入训练数据集 |
Claude-SearchBot | 搜索索引与结果质量 | 可能降低在 Claude 搜索结果中的可见性 |
Claude-User | Claude 用户发起的页面获取 | 阻止这类用户请求获取内容 |
所以,“屏蔽 ClaudeBot”不等于“屏蔽 Claude 的所有网页访问”。
分用途 robots.txt 策略
User-agent: ClaudeBot
Disallow: /
User-agent: Claude-SearchBot
Allow: /
User-agent: Claude-User
Allow: /
只有当它符合组织的法律与产品政策时才使用该配置,并在每个相关主机名重复部署。
实施和验证
- 绕过浏览器缓存抓取线上
/robots.txt,确认规则组没有意外合并。 - 在 CDN 与 WAF 中检查三种 token;边缘拒绝会覆盖 robots.txt 的允许。
- 查看真实正文 URL 的响应,而不只检查 robots.txt。
- 上线后监控抓取量,并记录修改日期。
- 定期复查 Anthropic 官方文档,因为爬虫名称和行为可能变化。
Anthropic 目前表示不公布这些机器人稳定的 IP 段,因此不应声称可以通过其“官方 IP 列表”确认。User-Agent 观察可作为运营证据,但字符串本身可以伪造。
允许访问不代表什么
允许 Claude-SearchBot 不保证索引、引用、排名或 AI 引荐流量。应分别用日志、分析平台引荐与固定问题集衡量,并避免在没有受控前后测试时,把引用变化归因于一次 robots.txt 修改。
robots.txt 也不是隐私边界。敏感或授权内容必须使用认证、授权和合同控制。
主要来源
延伸阅读:AI 爬虫、robots.txt 与 引用率。