AI 爬虫:区分训练、搜索与用户触发访问

AI 服务商可能分别使用训练、搜索索引和用户触发访问代理。应核对官方文档、robots 规则、IP 证据与服务器日志,并把访问和引用结果分开。

发布于 2026-06-19
·
更新于 2026-07-22
·
3 分钟阅读

AI 爬虫

“AI 爬虫”是与 AI 服务商相关自动网络访问的统称。同一家公司可能分别使用模型开发爬虫、搜索发现爬虫和用户触发的页面读取代理。这些角色不能互换。

允许某个代理,只代表遵守规则的爬虫可以请求被允许的网址;它不保证索引、训练使用、检索、引用或流量。屏蔽一个代理,也不一定覆盖该服务商的其他代理、授权数据、既有副本或用户提供的内容。

建立按角色区分的登记表

针对与网站有关的每个代理记录:

字段作用
服务商和准确 User-Agent 令牌相似名称可能承担不同用途
官方说明的用途训练、搜索、用户读取或其他产品功能
robots.txt 行为不同代理与服务商规则可能不同
身份验证方法IP 范围、反向 DNS、签名或没有验证方法
政策网址与复查日期文档会随时间改变
实际请求日志证明访问事实,而非服务商意图

当前例子包括 OpenAI 分开的 GPTBot、OAI-SearchBot 与 ChatGPT-User,Anthropic 公布的不同机器人,PerplexityBot 与 Perplexity-User,Google 的 Google-Extended 产品令牌,以及 Applebot-Extended。不要在不核对服务商的情况下复制静态清单。

应使用当前一手文档:OpenAI 的发布者与开发者 FAQAnthropic 爬虫控制Perplexity 爬虫、Google 的爬虫清单Applebot 文档

做出访问决定

  1. 界定内容类型:公开营销、文档、授权资料、付费内容、个人数据或机密内容。
  2. 确定业务目标,以及与目标直接相关的具体代理。
  3. 检查合同、版权、隐私、安全和发布政策,而不只考虑 SEO 流量。
  4. 应用能够表达决定的最窄规则,并在相关子域名重复配置。
  5. 测试 robots.txt、边缘规则、认证与缓存行为。
  6. 监控已验证请求、状态码、字节量、延迟及滥用模式。

Robots.txt 是给合作型代理的抓取指令,不是访问控制。敏感内容必须依靠身份认证与授权。Schema 不能控制爬虫可读取什么,llms.txt 也不是权限机制。

正确解释日志

User-Agent 字符串可以被伪造。应在可用时采用服务商公布的验证方法,并把未验证流量单独标记。成功请求只证明某次请求获得响应。爬虫访问、索引、引用、引荐会话和转化必须分别衡量。

相关 Wiki 词条

Privacy & Cookies

We use cookies to enhance your experience. By continuing to visit this site you agree to our use of cookies.