从开放式抓取到默认需授权
2025年7月1日,Cloudflare成为首家默认拦截AI爬虫的主要互联网基础设施提供商,其在每个新域名注册时都会询问是允许还是拒绝AI机器人,而不是让站长手动去选择退出。Cloudflare承载了全球约 20% 的网页流量,因此这一转变将大部分网站从开放式抓取基线推向了基于许可的抓取。此重大变革重新定义了AI访问权限,使其变成发布商有意识的授权,而非悄无声息的后台操作。对于内容所有者来说,新接入Cloudflare域名的实际效果是,无需任何操作默认即为“受控”而非“暴露”;而现有站点和非Cloudflare域名则应当检查并更新其AI爬虫设置。
Pay Per Crawl与402响应的工作机制
与默认拦截机制同步进行内测的Pay Per Crawl,为发布商提供了针对每种爬虫的三种处理方案:允许免费访问、收取全站统一费用,或者完全拦截。想要获取页面的爬虫可以在请求头中标记其付费意愿以此获得HTTP 200响应,或者跳过此步从而接收包含报价的HTTP 402 'Payment Required'。Cloudflare扮演计费中介的角色,负责结算AI公司与发布商之间的交易。所有Cloudflare付费客户均可自定义402响应,且据公司报告,Cloudflare客户每天在其网络中向机器人及爬虫发送超10亿次HTTP 402响应(不限于AI Crawl Control渠道)。
在 2025 年 7 月,Anthropic's ClaudeBot 每引流一个访问者,就要抓取大约 38,000 个页面。这种极其失衡的数据正是 Cloudflare 推动让出版商向 AI 机器人收费,而不是免费向其提供数据背后的核心逻辑。
导致这一问题至关重要的“抓取引流比”差距
Cloudflare's 自身的数据揭示了为什么出版商正在奋起反抗:AI 爬虫索取的远比它们回报的要多。在 2025 年 7 月,Anthropic's ClaudeBot 每引流一个访问者,就要抓取大约 38,000 个页面;而在此期间,OpenAI's GPTBot 的比例通常在大约 900 到 1,250 比 1 之间,并在 3 月份达到了约 3,700 比 1 的峰值;Perplexity 的比例则更低,通常在 400 比 1 以下。在同一时期内,Google 的传统搜索抓取引流比保持在低得多的水平,2025 年全年的范围大约在 3 比 1 到 30 比 1 之间,并在 7 月份稳定在 9 比 1 左右。而用户驱动的 AI crawling(即机器人响应实时用户查询而获取页面)在 2025 年(1 月至 12 月初)增长了 15 倍以上,这表明这种失衡在数量层面上正在加速加剧。
内容所有者应该权衡的因素
首要决策是确定态度:屏蔽、允许还是收费,以及是否对训练爬虫、搜索或推理爬虫区别对待,因为 Cloudflare 允许 AI 公司声明爬虫的用途。只有当您的内容独特到 AI 实验室宁愿付费也不愿放弃时,收费才行得通。因此,通用的同质化页面几乎没有议价筹码,而独有数据、历史档案或专业内容则拥有更多主动权。屏蔽 AI 搜索爬虫也可能将网站排除在 AI 生成的解答之外,因此想要借助 AI 提升曝光率的所有者,应当将可能带来引流的机器人与纯训练机器人区分开来。坦白地说,定价权机制尚未完全确立,目前很少有出版商提供公开的费率卡。
核心要点
- 自 2025 年 7 月 1 日起,Cloudflare 默认对新域名屏蔽 AI 爬虫,覆盖了其承载的全球大约 20% 的网站网络。
- Pay per crawl 允许出版商对 AI 机器人设置允许、收费或屏蔽,利用 HTTP 402 响应和请求头中的支付意图进行交互,并由 Cloudflare 充当收款商户;该功能目前仍处于私测阶段。
- Cloudflare 客户每天在其网络上发送超过 10 亿次 HTTP 402 'payment required' 响应,同时,用户驱动的 AI crawling 在 2025 年期间(1 月至 12 月初)增长了 15 倍以上。
- 抓取引流比严重失衡(2025 年 7 月 ClaudeBot 接近 38,000:1),因此网站主应针对每个爬虫确定应对态度,并在全面屏蔽之前仔细权衡 AI-search 的曝光率。
