Del scraping abierto al permiso por defecto
El 1 de julio de 2025, Cloudflare se convirtió en el primer gran proveedor de infraestructura de internet en bloquear los rastreadores de AI por defecto, preguntando a cada nuevo dominio al registrarse si desea permitir o denegar los bots de AI en lugar de obligar a los propietarios a autoexcluirse. Cloudflare gestiona el tráfico de aproximadamente el 20 por ciento de la web, por lo que este cambio traslada una gran parte de los sitios de un modelo de scraping abierto a uno basado en permisos. El cambio redefine el acceso de la AI como algo que el editor concede a propósito, no algo que ocurre en silencio. Para los propietarios de contenido, el efecto práctico para los dominios recién incorporados a Cloudflare es que no hacer nada ahora tiende por defecto al control en lugar de la exposición, mientras que los sitios existentes y los dominios que no usan Cloudflare deberían revisar y actualizar su configuración relativa a los rastreadores de AI.
Cómo funcionan pay per crawl y la respuesta 402
El pago por rastreo, lanzado en versión beta privada junto con el cambio de bloqueo por defecto, ofrece a los editores tres opciones de configuración por rastreador: permitir el acceso gratuito, cobrar un precio fijo para todo el dominio o bloquearlo por completo. Un rastreador que desee acceder a la página puede indicar su disposición a pagar en las cabeceras de la solicitud y recibir un HTTP 200 de vuelta, o saltarse ese paso y recibir un HTTP 402 'Payment Required' que indique el precio en su lugar. Cloudflare actúa como intermediario de facturación, liquidando los pagos entre las empresas de IA y los editores. Las respuestas 402 personalizables ahora están disponibles para todos los clientes de pago de Cloudflare, y la compañía informa que sus clientes envían más de mil millones de respuestas HTTP 402 al día a bots y rastreadores en toda su red, no solo a través de AI Crawl Control.
En julio de 2025, ClaudeBot de Anthropic rastreó aproximadamente 38,000 páginas por cada visitante que remitió, el tipo de matemática desproporcionada que motivó la decisión de Cloudflare de permitir que los editores cobraran a los bots de AI en lugar de alimentarlos de forma gratuita.
La brecha entre rastreo y derivación de tráfico que hace que esto sea importante
Los propios datos de Cloudflare muestran por qué los editores se están resistiendo: los rastreadores de IA toman mucho más de lo que devuelven. En julio de 2025, ClaudeBot de Anthropic rastreó aproximadamente 38.000 páginas por cada visitante que remitió, mientras que GPTBot de OpenAI por lo general registró una relación de aproximadamente 900 a 1.250 a 1 durante el mismo período, alcanzando un pico de aproximadamente 3.700 a 1 en marzo, y Perplexity se mantuvo más bajo, generalmente por debajo de 400 a 1. El ratio tradicional de rastreo frente a referencia de la búsqueda de Google se mantuvo mucho más bajo durante el mismo período, oscilando por lo general entre aproximadamente 3 a 1 y unos 30 a 1 a lo largo de 2025 y estabilizándose en torno a 9 a 1 en julio. El rastreo de IA impulsado por el usuario, en el que un bot recupera una página en respuesta a una consulta de usuario en vivo, creció más de 15 veces a lo largo de 2025 (de enero a principios de diciembre), por lo que el lado del volumen del desequilibrio se está acelerando.
Qué deben evaluar los propietarios de contenido
La primera decisión es la postura: bloquear, permitir o cobrar, y si se debe tratar a los rastreadores de entrenamiento de manera diferente a los de búsqueda o inferencia, ya que Cloudflare permite a las empresas de IA declarar el propósito de su rastreador. Cobrar solo tiene sentido si su contenido es lo suficientemente distintivo como para que un laboratorio de IA prefiera pagar antes que omitirlo; por lo tanto, las páginas genéricas tienen poca influencia, mientras que los datos propietarios, los archivos o el contenido experto tienen más. Bloquear los rastreadores de búsqueda de IA también puede dejar a un sitio fuera de las respuestas generadas por IA, por lo que los propietarios que dependen de su visibilidad en la IA deberían separar los bots que pueden remitir tráfico de aquellos que solo entrenan. La lectura honesta es que el poder de fijación de precios aún se está consolidando y pocos editores tienen tarifas públicas todavía.
Puntos clave
- Cloudflare bloquea los rastreadores de IA por defecto para los nuevos dominios a partir del 1 de julio de 2025, cubriendo una red que impulsa aproximadamente el 20 por ciento de la web.
- El pago por rastreo permite a los editores autorizar, cobrar o bloquear bots de IA, utilizando respuestas HTTP 402 e intenciones de pago en las cabeceras de solicitud, con Cloudflare como comerciante oficial (merchant of record); la función sigue en versión beta privada.
- Los clientes de Cloudflare envían más de mil millones de respuestas HTTP 402 'payment required' al día a través de su red, y el rastreo de IA impulsado por el usuario creció más de 15 veces a lo largo de 2025 (de enero a principios de diciembre).
- Los ratios de rastreo frente a referencia están extremadamente desequilibrados (ClaudeBot cerca de 38.000:1 en julio de 2025), por lo que los propietarios deben decidir su postura por cada rastreador y evaluar la visibilidad en búsquedas de IA antes de bloquear todo por completo.
