AI 可见性

AI 爬虫访问权限:控制 GPTBot、ClaudeBot 及其他爬虫

一波 AI 爬虫正因各种原因访问您的网站,决定允许还是阻止它们,是在保护内容与保持在 AI 回答中的可见性之间进行的一场真正的商业权衡。

提供支持,NYFTY Labs AI 内容引擎

过去,网络上只有一个真正举足轻重的爬虫:Googlebot。如今,越来越多出于不同目的的 AI 爬虫开始访问您的网站,决定谁能获得访问权限是一项主动的商业抉择,而非偶然。关键之举是将爬虫的目的与其所有者分离开来:有些 Bot 收集数据以训练模型,有些对您的网页进行索引以用于 AI 搜索回答,还有一些则因用户提问而实时抓取网页。拦截其中一个并不等于拦截其他爬虫。以下是 2026 年真实的爬虫现状、robots.txt 如何让您表达偏好(以及为什么它仅仅是一项请求)、Cloudflare 改变了什么,以及在保护内容与保持在 AI 回答中的可见性之间坦诚的权衡。

AI crawler access Three jobs, training, search-index, live fetch, meet a gate Training GPTBot, ClaudeBot, CCBot Search-index OAI-SearchBot, Claude-SearchBot Live fetch ChatGPT-User, Claude-User The gate robots.txt a request, voluntary Cloudflare HTTP 402 enforced toll Your site allow, charge, block robots.txt asks; Cloudflare Pay Per Crawl can enforce with HTTP 402.
AI 爬虫执行三种不同的任务:训练、搜索索引以及实时的用户发起式抓取。它们在网关处与您的网站交汇:robots.txt 声明了抓取偏好(自愿遵守),而 Cloudflare Pay Per Crawl 则可以通过 HTTP 402 限制手段强制执行有偿访问。

三项任务:训练、搜索索引和实时获取

AI 爬虫之间最重要的区别不在于公司,而在于目的。训练或数据收集爬虫收集内容以帮助构建或改进 AI 模型。搜索索引爬虫对您的网页进行编目,以便您能在 AI 产品的搜索式回答中展现并被引用。实时、按需的获取程序在用户提问或点击 AI 产品内部链接时实时检索网页。这些爬虫有着不同的目的,拦截其中一个通常不等于拦截其他爬虫。许多服务商会针对不同目的提供独立的 Token,但这并非普适规律:Meta-ExternalAgent 是明确的多用途爬虫,而 Google 没有提供任何可以在保留经典 Search 索引的同时阻止其 Search AI 功能的 robots.txt Token——因此这三种目的并不总是能独立控制。在它们相互独立的情况下,您可以拒绝将内容用于训练,同时仍允许进行搜索索引和实时抓取,从而使您能够出现在 AI 回答中。

AI VISIBILITY 1Training bots2Search-index bots3Live fetchersBlocking one is not blocking the others NYFTYLABS
核心区别在于目的:训练、搜索索引和实时按需抓取是截然不同的任务。

2026 年需要了解的真实 user-agents

如果没有具体名称,关于“阻止 AI Bot”的含糊建议毫无用处。OpenAI:GPTBot(训练)、OAI-SearchBot(搜索式索引和呈现)、ChatGPT-User(实时获取)——每个都是独立的 robots.txt Token。Anthropic 的官方文档提及的爬虫:ClaudeBot(训练)、Claude-SearchBot(浏览和分析网页以提高 Claude 的搜索结果质量)、Claude-User(用户发起的实时抓取);旧的 anthropic-ai Token 已弃用,且 Anthropic 未针对 Claude Code 发布单独的 robots.txt Token(其 URL 抓取无法通过专用 user agent 进行独立控制)。其他:PerplexityBot(搜索索引)和 Perplexity-User(实时抓取);CCBot(Common Crawl,许多模型使用的庞大开源数据集);Google,其中 Googlebot 仍同时处理 Search 和 Google 的 AI 功能,Google-Extended 是一个 AI 训练选择退出的 Token(并非独立的爬虫),而 Google-CloudVertexBot 是一个独立的爬虫,在客户构建 Vertex AI 智能体或进行 grounding 时,根据网站所有者的要求抓取网站;Applebot 及其 Applebot-Extended 选择退出 Token;Amazonbot、Bytespider(字节跳动)、Meta-ExternalAgent(Meta 的多用途爬虫,包括 AI 训练、索引和产品改进)以及 facebookexternalhit(Meta 链接预览)。这些是主要的 Agent,也是您在规则中引用的名称,但此列表并未涵盖所有且一直在变化,因此请查看各服务商的最新文档。

AI VISIBILITYOpenAI tokensGPTBot (training)OAI-SearchBot (index)ChatGPT-User (live)Anthropic tokensClaudeBot (training)Claude-SearchBot (search)Claude-User (live)vsNYFTYLABS
每个服务商都会针对不同目的提供独立的 robots.txt 标识(token);旧版的 anthropic-ai 标识已被废弃。

robots.txt 表达了偏好,但它是自愿遵循的

robots.txt 是位于您域名根目录下的纯文本文件,数十年来一直根据机器人排除协议(Robots Exclusion Protocol,于 2022 年 9 月正式成为 RFC 9309 标准)管理着爬虫的行为。您可以通过指定 user-agent 并允许或禁止路径,来做到在禁止 GPTBot 的同时让 Googlebot 正常访问。核心的警告在于:robots.txt 是一项请求,而非强制执行。行为良好的爬虫通常会遵守它,且各大服务商也公布了对其 Token 的支持,但该协议中没有任何机制能从物理上阻断 Bot 忽略它。它并非一种安全控制手段。另一个限制是:robots.txt 能够可靠地管理自主爬虫(GPTBot、ClaudeBot、CCBot),但用户触发的实时获取程序则情况各异。Anthropic 的文档指出 Claude-User 遵守它;ChatGPT-User 是一个公开且可识别的 user-agent Token,但用户发起的抓取与 robots.txt 的具体交互方式仍在不断演变——请参阅 OpenAI 的最新文档以了解权威规则,不要假设仅凭 robots.txt 就能可靠地拦截用户触发的抓取。相比之下,Cloudflare 在 2025 年 8 月报告称,Perplexity 持续通过未声明的 user-agents 和轮换 IP 访问被屏蔽的内容,并将其从已验证的 Bot 列表中除名(Perplexity 对此表示异议)。因此,不要指望仅靠 robots.txt 就能在所有地方阻止用户触发的抓取。

AI VISIBILITY 1Name user-agent2Allow/disallowpaths3Bots may honor4Not enforcedA request, not a security control NYFTYLABS
robots.txt (RFC 9309) 按 token 声明偏好,但遵守它是自愿的,而非强制性的。

Cloudflare 在礼貌请求之外,增加了真正的强制执行手段

由于 robots.txt 纯属自愿遵守,基础设施层面的控制就显得至关重要。作为承载了很大一部分网站流量的服务商,Cloudflare 已开始为网站所有者提供针对 AI 爬虫的更强控制能力,包括默认对新网站拦截许多 AI Bot。2025 年 7 月 1 日,它推出了内测版的“按抓取量付费”(pay-per-crawl)机制,该机制利用 HTTP 402 (Payment Required) 响应,使网站运营者可以向 AI 公司收取访问费,而不是免费为其提供内容,其范围更广的 AI Crawl Control 仪表板随后也正式可用。在 Pay Per Crawl 发布时,Cloudflare 将向基于使用量(“pay per inference”)的补偿机制过渡描述为未来方向;目前尚未公布具体日期——请查看 Cloudflare 的最新文档了解进展。这里的具体细节变化很快,但有一点是长久不变的:访问权限已从网站发起的“请求”,转变为了网络运营商控制的“强制关口”,这是相比单纯 robots.txt 时代的真正转变。

AI VISIBILITY 1AI crawlerrequest2Cloudflare gate3HTTP 402 toll4Charge or blockPay Per Crawl launched Jul 1, 2025 NYFTYLABS
Cloudflare Pay Per Crawl 使用 HTTP 402,以便网站运营者可以向 AI 公司收费,而不是免费为它们提供服务。

权衡,以及 llms.txt 的适用之处

这一决定是一个真正的商业权衡。拦截已识别的训练爬虫可以限制该 Bot 未来的收集(它无法回收已搜集、授权、通过第三方数据集获得或由伪装 Agent 收集的副本),这对于出版商和原创内容企业至关重要;但拦截实时抓取和搜索索引获取程序可能会直接降低您在 AI 回答中被检索和引用的机会。并没有放之四海而皆准的设置,请根据可见性与保护哪一个对您更有价值,来针对不同目的做出决策。此外,不要夸大 llms.txt 的作用:它是一项提议性的、非官方的惯例,没有任何主流服务商必须遵守,它只是一个可选的信号,而非控制机制,更不能替代 robots.txt。

AI VISIBILITYBlock crawlersLimits future collectionProtects contentFor publishersAllow crawlersEnables retrievalChance to be citedFor visibilityvsNYFTYLABS
针对不同目的做出的真正权衡:是选择保护,还是选择获得被检索和引用的机会。
核心要点
  • 将目的与所有者分离开来:训练/数据收集爬虫、搜索索引爬虫以及用户触发的实时获取程序是三项不同的任务,拦截其中一个不会阻断其他程序。
  • 使用真实且最新的 user-agent 名称,而非含糊的“AI Bot”建议,例如 GPTBot、OAI-SearchBot、ChatGPT-User(OpenAI);ClaudeBot、Claude-SearchBot、Claude-User(Anthropic;旧的 anthropic-ai Token 已弃用,且 Anthropic 未针对 Claude Code 发布单独的 robots.txt Token);PerplexityBot、Perplexity-User;CCBot; Googlebot、Google-Extended 和 Google-CloudVertexBot;Applebot 和 Applebot-Extended;Amazonbot、Bytespider、Meta-ExternalAgent、facebookexternalhit;此列表并未详尽且在不断演变,因此请查看各服务商的文档。
  • robots.txt(机器人排除协议,RFC 9309,2022 年 9 月)规定了每个 user-agent 的偏好,但是自愿遵守的:合作的 Bot 通常会遵守它,但它既非强制性也非安全措施,并且相比于用户触发的获取程序,它对自主爬虫的管理更可靠;Anthropic 文档指出 Claude-User 遵守它,而 ChatGPT-User 是一个公开且可识别的 Token,其与 robots.txt 的具体交互仍然是一个不断演变的领域(请查看 OpenAI 的最新文档,不要假设仅凭 robots.txt 就能可靠阻断用户触发的抓取),Cloudflare 曾在 2025 年 8 月报告称 Perplexity 的 Agent 规避了拦截。
  • Cloudflare 的默认 AI Bot 拦截及其“按抓取量付费”模式(2025 年 7 月 1 日起内测,使用 HTTP 402,发布时将基于使用量的“pay per inference”补偿机制描述为未来方向且未公布具体日期),是超越自愿性 robots.txt 的真正的基础设施级强制执行手段,如果对内容保护有严肃要求,极具参考价值。
  • 是否拦截的决定是在保护内容与保持在 AI 回答中可被引用之间进行的真正权衡;请针对不同目的做出决策,并仅将 llms.txt 视为可选的非官方信号。

← 更多指南

常见问题

疑问,为您解答。

训练或数据收集爬虫(如 GPTBot 或 ClaudeBot)收集用于帮助构建或改进 AI 模型的内容。实时获取程序(如 ChatGPT-User 或 Claude-User)则因用户提问或点击 AI 产品内部链接而实时检索网页。第三类是搜索质量爬虫(如 OAI-SearchBot、Claude-SearchBot 或 PerplexityBot),它们浏览和分析网络,以便使您能够在 AI 搜索式回答中展现并被引用。它们各司其职,拦截其中一个并不会拦截其他爬虫,因此您可以放心地限制训练用途,同时仍允许进行搜索索引和实时抓取,以保证依然能够被引用。一个警告是:对于行为良好的自主爬虫,robots.txt 是可靠的控制手段,但某些用户触发的获取程序并不会可靠地遵守它。Anthropic 文档指出 Claude-User 遵守 robots.txt;ChatGPT-User 是一个公开且可识别的 user-agent Token,但用户发起的抓取与 robots.txt 具体的交互方式一直在演变——请参阅 OpenAI 的最新文档以了解权威规则,不要假设仅凭 robots.txt 就能可靠地拦截用户触发的抓取。Cloudflare 在 2025 年 8 月报告称,Perplexity 的 Agent 规避了拦截,因此拦截用户触发的获取程序可行度较低。

它表达了一种行为良好的爬虫通常会遵守的请求,且 OpenAI 发布了对其 user-agent 属性以及独立的 GPTBot、OAI-SearchBot 和 ChatGPT-User 控制的支持。但 robots.txt 在设计上是自愿遵守的;它是 Robots Exclusion Protocol(于 2022 年 9 月正式确立为 RFC 9309)的一部分,该协议记录了这一约定但并不强制执行。协议中没有任何内容能从物理上阻止不合规的 bot 忽略该文件。屏蔽 GPTBot 专门管理 OpenAI 的训练爬虫;它本身并不会影响 OAI-SearchBot 或 ChatGPT-User,后两者需要通过它们自己的 token 进行控制。因此,robots.txt 是表达偏好的首选工具,但它并不是一种安全控制手段,也无法提供保证。

它们是控制 token,而不是独立的爬虫。根据 Google 的说法,Google-Extended 可以让你选择不将内容用于训练其生成式 AI 模型(例如 Gemini 及其 Vertex AI 生成式功能);Google 表示,使用它不会影响 Googlebot 在 Search 中索引你的页面或对其进行排名。请注意一个重要的限制:由于 Googlebot 是同时服务于 Search 和 Google AI 功能的单一爬虫,Google-Extended 虽然可以控制生成式模型训练,但并不会将你的页面从 Google Search 内的 AI Overviews 中移除。Applebot-Extended 针对 Apple 的 AI 模型训练发挥着类似的退订作用,它叠加在正常的 Applebot 搜索爬虫之上,因此屏蔽它不会将你从 Apple 的搜索功能中移除。两者都允许你将“为搜索索引我”与“为 AI 训练使用我”区分开来,这正是本主题所讨论的基于目的的控制。(Google 还运行着一个独立的 Google-CloudVertexBot,当客户构建 Vertex AI 智能体或进行 grounding 时,它会根据网站所有者的请求抓取网站,这与 Google-Extended token 不同。)

这是一个真正的业务权衡,没有标准答案。屏蔽已被识别的训练爬虫可以限制该 bot 未来的数据收集,这对于出版商和原创内容企业来说最为重要,尽管它无法撤回已经收集、获得授权、通过第三方数据集获取或由伪装的代理收集的分组。但特别是屏蔽实时提取器和搜索索引爬虫,可能会降低当用户在 AI 工具中提出相关问题时你被检索和引用的机会。实际的方法是根据目的来决定:许多企业允许实时和搜索类型的提取器以保持可见性,同时限制或就批量训练爬虫进行谈判。

它是可选且实验性的,并非强制要求。llms.txt 文件是一个由社区发起的拟议约定,一个指向 AI 系统你关键内容的 Markdown 文件,其精神类似于站点地图。它的采用成本很低,但它不是官方标准,没有哪家主流 AI 提供商有义务遵守它。如果需要,你可以将其开发为额外的信号,而不是作为控制机制,也不能替代 robots.txt 或深思熟虑的爬虫访问决策。

希望这一方案能够服务于您的品牌?