AI 爬虫:区分训练、搜索与用户触发访问
AI 服务商可能分别使用训练、搜索索引和用户触发访问代理。应核对官方文档、robots 规则、IP 证据与服务器日志,并把访问和引用结果分开。
AI 爬虫
“AI 爬虫”是与 AI 服务商相关自动网络访问的统称。同一家公司可能分别使用模型开发爬虫、搜索发现爬虫和用户触发的页面读取代理。这些角色不能互换。
允许某个代理,只代表遵守规则的爬虫可以请求被允许的网址;它不保证索引、训练使用、检索、引用或流量。屏蔽一个代理,也不一定覆盖该服务商的其他代理、授权数据、既有副本或用户提供的内容。
建立按角色区分的登记表
针对与网站有关的每个代理记录:
| 字段 | 作用 |
|---|---|
| 服务商和准确 User-Agent 令牌 | 相似名称可能承担不同用途 |
| 官方说明的用途 | 训练、搜索、用户读取或其他产品功能 |
| robots.txt 行为 | 不同代理与服务商规则可能不同 |
| 身份验证方法 | IP 范围、反向 DNS、签名或没有验证方法 |
| 政策网址与复查日期 | 文档会随时间改变 |
| 实际请求 | 日志证明访问事实,而非服务商意图 |
当前例子包括 OpenAI 分开的 GPTBot、OAI-SearchBot 与 ChatGPT-User,Anthropic 公布的不同机器人,PerplexityBot 与 Perplexity-User,Google 的 Google-Extended 产品令牌,以及 Applebot-Extended。不要在不核对服务商的情况下复制静态清单。
应使用当前一手文档:OpenAI 的发布者与开发者 FAQ、Anthropic 爬虫控制、Perplexity 爬虫、Google 的爬虫清单与 Applebot 文档。
做出访问决定
- 界定内容类型:公开营销、文档、授权资料、付费内容、个人数据或机密内容。
- 确定业务目标,以及与目标直接相关的具体代理。
- 检查合同、版权、隐私、安全和发布政策,而不只考虑 SEO 流量。
- 应用能够表达决定的最窄规则,并在相关子域名重复配置。
- 测试
robots.txt、边缘规则、认证与缓存行为。 - 监控已验证请求、状态码、字节量、延迟及滥用模式。
Robots.txt 是给合作型代理的抓取指令,不是访问控制。敏感内容必须依靠身份认证与授权。Schema 不能控制爬虫可读取什么,llms.txt 也不是权限机制。
正确解释日志
User-Agent 字符串可以被伪造。应在可用时采用服务商公布的验证方法,并把未验证流量单独标记。成功请求只证明某次请求获得响应。爬虫访问、索引、引用、引荐会话和转化必须分别衡量。