过去,网络上只有一个真正举足轻重的爬虫:Googlebot。如今,越来越多出于不同目的的 AI 爬虫开始访问您的网站,决定谁能获得访问权限是一项主动的商业抉择,而非偶然。关键之举是将爬虫的目的与其所有者分离开来:有些 Bot 收集数据以训练模型,有些对您的网页进行索引以用于 AI 搜索回答,还有一些则因用户提问而实时抓取网页。拦截其中一个并不等于拦截其他爬虫。以下是 2026 年真实的爬虫现状、robots.txt 如何让您表达偏好(以及为什么它仅仅是一项请求)、Cloudflare 改变了什么,以及在保护内容与保持在 AI 回答中的可见性之间坦诚的权衡。
三项任务:训练、搜索索引和实时获取
AI 爬虫之间最重要的区别不在于公司,而在于目的。训练或数据收集爬虫收集内容以帮助构建或改进 AI 模型。搜索索引爬虫对您的网页进行编目,以便您能在 AI 产品的搜索式回答中展现并被引用。实时、按需的获取程序在用户提问或点击 AI 产品内部链接时实时检索网页。这些爬虫有着不同的目的,拦截其中一个通常不等于拦截其他爬虫。许多服务商会针对不同目的提供独立的 Token,但这并非普适规律:Meta-ExternalAgent 是明确的多用途爬虫,而 Google 没有提供任何可以在保留经典 Search 索引的同时阻止其 Search AI 功能的 robots.txt Token——因此这三种目的并不总是能独立控制。在它们相互独立的情况下,您可以拒绝将内容用于训练,同时仍允许进行搜索索引和实时抓取,从而使您能够出现在 AI 回答中。
2026 年需要了解的真实 user-agents
如果没有具体名称,关于“阻止 AI Bot”的含糊建议毫无用处。OpenAI:GPTBot(训练)、OAI-SearchBot(搜索式索引和呈现)、ChatGPT-User(实时获取)——每个都是独立的 robots.txt Token。Anthropic 的官方文档提及的爬虫:ClaudeBot(训练)、Claude-SearchBot(浏览和分析网页以提高 Claude 的搜索结果质量)、Claude-User(用户发起的实时抓取);旧的 anthropic-ai Token 已弃用,且 Anthropic 未针对 Claude Code 发布单独的 robots.txt Token(其 URL 抓取无法通过专用 user agent 进行独立控制)。其他:PerplexityBot(搜索索引)和 Perplexity-User(实时抓取);CCBot(Common Crawl,许多模型使用的庞大开源数据集);Google,其中 Googlebot 仍同时处理 Search 和 Google 的 AI 功能,Google-Extended 是一个 AI 训练选择退出的 Token(并非独立的爬虫),而 Google-CloudVertexBot 是一个独立的爬虫,在客户构建 Vertex AI 智能体或进行 grounding 时,根据网站所有者的要求抓取网站;Applebot 及其 Applebot-Extended 选择退出 Token;Amazonbot、Bytespider(字节跳动)、Meta-ExternalAgent(Meta 的多用途爬虫,包括 AI 训练、索引和产品改进)以及 facebookexternalhit(Meta 链接预览)。这些是主要的 Agent,也是您在规则中引用的名称,但此列表并未涵盖所有且一直在变化,因此请查看各服务商的最新文档。
robots.txt 表达了偏好,但它是自愿遵循的
robots.txt 是位于您域名根目录下的纯文本文件,数十年来一直根据机器人排除协议(Robots Exclusion Protocol,于 2022 年 9 月正式成为 RFC 9309 标准)管理着爬虫的行为。您可以通过指定 user-agent 并允许或禁止路径,来做到在禁止 GPTBot 的同时让 Googlebot 正常访问。核心的警告在于:robots.txt 是一项请求,而非强制执行。行为良好的爬虫通常会遵守它,且各大服务商也公布了对其 Token 的支持,但该协议中没有任何机制能从物理上阻断 Bot 忽略它。它并非一种安全控制手段。另一个限制是:robots.txt 能够可靠地管理自主爬虫(GPTBot、ClaudeBot、CCBot),但用户触发的实时获取程序则情况各异。Anthropic 的文档指出 Claude-User 遵守它;ChatGPT-User 是一个公开且可识别的 user-agent Token,但用户发起的抓取与 robots.txt 的具体交互方式仍在不断演变——请参阅 OpenAI 的最新文档以了解权威规则,不要假设仅凭 robots.txt 就能可靠地拦截用户触发的抓取。相比之下,Cloudflare 在 2025 年 8 月报告称,Perplexity 持续通过未声明的 user-agents 和轮换 IP 访问被屏蔽的内容,并将其从已验证的 Bot 列表中除名(Perplexity 对此表示异议)。因此,不要指望仅靠 robots.txt 就能在所有地方阻止用户触发的抓取。
Cloudflare 在礼貌请求之外,增加了真正的强制执行手段
由于 robots.txt 纯属自愿遵守,基础设施层面的控制就显得至关重要。作为承载了很大一部分网站流量的服务商,Cloudflare 已开始为网站所有者提供针对 AI 爬虫的更强控制能力,包括默认对新网站拦截许多 AI Bot。2025 年 7 月 1 日,它推出了内测版的“按抓取量付费”(pay-per-crawl)机制,该机制利用 HTTP 402 (Payment Required) 响应,使网站运营者可以向 AI 公司收取访问费,而不是免费为其提供内容,其范围更广的 AI Crawl Control 仪表板随后也正式可用。在 Pay Per Crawl 发布时,Cloudflare 将向基于使用量(“pay per inference”)的补偿机制过渡描述为未来方向;目前尚未公布具体日期——请查看 Cloudflare 的最新文档了解进展。这里的具体细节变化很快,但有一点是长久不变的:访问权限已从网站发起的“请求”,转变为了网络运营商控制的“强制关口”,这是相比单纯 robots.txt 时代的真正转变。
权衡,以及 llms.txt 的适用之处
这一决定是一个真正的商业权衡。拦截已识别的训练爬虫可以限制该 Bot 未来的收集(它无法回收已搜集、授权、通过第三方数据集获得或由伪装 Agent 收集的副本),这对于出版商和原创内容企业至关重要;但拦截实时抓取和搜索索引获取程序可能会直接降低您在 AI 回答中被检索和引用的机会。并没有放之四海而皆准的设置,请根据可见性与保护哪一个对您更有价值,来针对不同目的做出决策。此外,不要夸大 llms.txt 的作用:它是一项提议性的、非官方的惯例,没有任何主流服务商必须遵守,它只是一个可选的信号,而非控制机制,更不能替代 robots.txt。
- 将目的与所有者分离开来:训练/数据收集爬虫、搜索索引爬虫以及用户触发的实时获取程序是三项不同的任务,拦截其中一个不会阻断其他程序。
- 使用真实且最新的 user-agent 名称,而非含糊的“AI Bot”建议,例如 GPTBot、OAI-SearchBot、ChatGPT-User(OpenAI);ClaudeBot、Claude-SearchBot、Claude-User(Anthropic;旧的 anthropic-ai Token 已弃用,且 Anthropic 未针对 Claude Code 发布单独的 robots.txt Token);PerplexityBot、Perplexity-User;CCBot; Googlebot、Google-Extended 和 Google-CloudVertexBot;Applebot 和 Applebot-Extended;Amazonbot、Bytespider、Meta-ExternalAgent、facebookexternalhit;此列表并未详尽且在不断演变,因此请查看各服务商的文档。
- robots.txt(机器人排除协议,RFC 9309,2022 年 9 月)规定了每个 user-agent 的偏好,但是自愿遵守的:合作的 Bot 通常会遵守它,但它既非强制性也非安全措施,并且相比于用户触发的获取程序,它对自主爬虫的管理更可靠;Anthropic 文档指出 Claude-User 遵守它,而 ChatGPT-User 是一个公开且可识别的 Token,其与 robots.txt 的具体交互仍然是一个不断演变的领域(请查看 OpenAI 的最新文档,不要假设仅凭 robots.txt 就能可靠阻断用户触发的抓取),Cloudflare 曾在 2025 年 8 月报告称 Perplexity 的 Agent 规避了拦截。
- Cloudflare 的默认 AI Bot 拦截及其“按抓取量付费”模式(2025 年 7 月 1 日起内测,使用 HTTP 402,发布时将基于使用量的“pay per inference”补偿机制描述为未来方向且未公布具体日期),是超越自愿性 robots.txt 的真正的基础设施级强制执行手段,如果对内容保护有严肃要求,极具参考价值。
- 是否拦截的决定是在保护内容与保持在 AI 回答中可被引用之间进行的真正权衡;请针对不同目的做出决策,并仅将 llms.txt 视为可选的非官方信号。
