Antes, la web tenía un solo rastreador que realmente importaba: Googlebot. Ahora, un grupo cada vez mayor de rastreadores de AI visita tu sitio por diferentes motivos, y decidir quién obtiene acceso es una elección comercial deliberada, no un accidente. El paso esencial es separar el propósito del propietario: algunos bots recopilan datos para entrenar modelos, otros indexan tus páginas para respuestas de búsqueda de AI, y otros obtienen páginas en vivo porque un usuario lo solicitó. Bloquear uno no significa bloquear los demás. Estos son los verdaderos rastreadores de 2026, cómo robots.txt te permite expresar preferencias (y por qué es solo una petición), qué cambió Cloudflare y el verdadero dilema entre proteger el contenido y mantener la visibilidad en las respuestas de AI.
Tres funciones: entrenamiento, indexación de búsqueda y recuperadores en vivo
La distinción más importante entre los rastreadores de AI no es la empresa, sino el propósito. Los rastreadores de entrenamiento o recopilación de datos reúnen contenido para ayudar a crear o mejorar modelos de AI. Los rastreadores de indexación de búsqueda catalogan tus páginas para que puedas aparecer y ser citado en las respuestas de tipo búsqueda de un producto de AI. Los recuperadores en vivo y bajo demanda obtienen una página en tiempo real porque un usuario hizo una pregunta o hizo clic en un enlace dentro de un producto de AI. Estos sirven para fines diferentes, y bloquear uno a menudo no es lo mismo que bloquear los otros. Muchos proveedores exponen tokens independientes por propósito, pero esto no es universal: Meta-ExternalAgent es explícitamente multipropósito, y Google no proporciona ningún token de robots.txt que bloquee sus funciones de Search AI mientras conserva la indexación clásica de Search, por lo que los tres propósitos no siempre se pueden controlar de forma independiente. Allí donde están separados, puedes rechazar el uso para entrenamiento y, al mismo tiempo, permitir la indexación de búsqueda y la recuperación en vivo que pueden incluirte dentro de una respuesta de AI.
Los verdaderos user-agents de 2026 que debes conocer
Los consejos imprecisos de "bloquear bots de AI" son inútiles sin nombres. OpenAI: GPTBot (entrenamiento), OAI-SearchBot (indexación y visualización al estilo de búsqueda), ChatGPT-User (recuperación en vivo); cada uno con un token de robots.txt independiente. Rastreadores documentados de Anthropic: ClaudeBot (entrenamiento), Claude-SearchBot (navega y analiza la web para mejorar la calidad de los resultados de búsqueda de Claude), Claude-User (recuperación en vivo iniciada por el usuario); el token más antiguo anthropic-ai está en desuso, y Anthropic no publica un token de robots.txt independiente para Claude Code (su recuperación de URL no es controlable de forma independiente a través de un user-agent dedicado). Otros: PerplexityBot (indexación de búsqueda) y Perplexity-User (recuperación en vivo); CCBot (Common Crawl, un gran conjunto de datos abierto del que se han nutrido muchos modelos); Google, donde Googlebot todavía gestiona tanto Search como las funciones de AI de Google, Google-Extended es un token de exclusión para el entrenamiento de AI (not un rastreador distinto), y Google-CloudVertexBot es un rastreador independiente que recupera sitios a petición del propietario cuando un cliente está creando agentes de Vertex AI o grounding; Applebot con el token de exclusión Applebot-Extended; Amazonbot, Bytespider (ByteDance), Meta-ExternalAgent (el rastreador multipropósito de Meta, que incluye entrenamiento de AI así como indexación y mejoras del producto) y facebookexternalhit (vistas previas de enlaces de Meta). Estos se encuentran entre los principales agentes y los nombres que debes referenciar en tus reglas, pero la lista no es exhaustiva y sigue cambiando, así que consulta la documentación actual de cada proveedor.
robots.txt expresa preferencias, pero es voluntario
robots.txt, un archivo de texto sin formato en la raíz de tu dominio, ha gobernado el comportamiento de los rastreadores durante décadas bajo el Protocolo de Exclusión de Robots, formalizado como RFC 9309 en septiembre de 2022. Nombras un user-agent y permites o rechazas rutas, por lo que puedes rechazar GPTBot dejando Googlebot intacto. La advertencia esencial: robots.txt es una petición, no una imposición. Los rastreadores que se comportan de forma correcta generalmente lo respetan y los principales proveedores publican soporte para sus tokens, pero nada en el protocolo impide físicamente que un bot lo ignore. No es un control de seguridad. Un límite adicional: robots.txt gobierna de manera confiable los rastreadores autónomos (GPTBot, ClaudeBot, CCBot), pero los recuperadores en vivo activados por el usuario varían. Anthropic documenta que Claude-User lo respeta; ChatGPT-User es un token de user-agent publicado e identificable, pero la interacción de las recuperaciones iniciadas por el usuario con robots.txt ha sido un área en evolución; consulta la documentación actual de OpenAI para conocer la regla权威, y no asumas que una recuperación activada por el usuario queda bloqueada de forma confiable únicamente por robots.txt. Por el contrario, Cloudflare informó en agosto de 2025 que Perplexity seguía accediendo a contenido bloqueado mediante user-agents no declarados e IPs rotativas, y lo retiró de la lista de bots verificados (Perplexity lo disputa). Así que no confíes en robots.txt para bloquear recuperaciones activadas por usuarios en todas partes.
Cloudflare añadió una imposición real más allá de una petición cortés
Debido a que robots.txt es solo voluntario, los controles a nivel de infraestructura importan. Cloudflare, que está al frente de una gran parte de la web, ha tomado medidas para dar a los propietarios de sitios un control más sólido sobre los rastreadores de AI, incluyendo el bloqueo de muchos bots de AI de forma predeterminada para sitios nuevos. El 1 de julio de 2025 lanzó, en versión beta privada, un modelo de pago por rastreo que utiliza la respuesta HTTP 402 (Payment Required) para que los operadores puedan cobrar a las empresas de AI por el acceso en lugar de servirles de forma gratuita, y su panel de control más amplio AI Crawl Control alcanzó posteriormente la disponibilidad general. En el lanzamiento de Pay Per Crawl, Cloudflare describió un avance hacia la compensación basada en el uso ('pago por inferencia') como una dirección futura; no se ha anunciado ninguna fecha (consulta la documentación actual de Cloudflare para conocer el estado). Los detalles aquí avanzan rápido, pero el punto clave es que el acceso pasa de ser una petición que realiza el sitio a una barrera obligatoria que controla el operador de la red, un cambio real respecto a la era en la que solo se utilizaba robots.txt.
La compensación, y dónde encaja llms.txt
Esta decisión representa un verdadero dilema comercial. Bloquear un crawler de entrenamiento identificado limita la recopilación futura por parte de ese bot (no retira las copias ya recopiladas, licenciadas, obtenidas mediante conjuntos de datos de terceros o reunidas por agentes encubiertos), lo cual es crucial para editores y empresas de contenido original; sin embargo, bloquear los extractores en vivo y de índice de búsqueda puede reducir directamente tus posibilidades de ser recuperado y citado en las respuestas de la AI. No existe una configuración universalmente correcta; decide según tu propósito, evaluando si la visibilidad o la protección es más valiosa para ti. Y no exageres la importancia de llms.txt: es una convención propuesta y no oficial que ningún proveedor importante está obligado a respetar, una señal opcional, no un mecanismo de control ni un sustituto de robots.txt.
- Separa el propósito del propietario: los crawlers de entrenamiento/recopilación de datos, los crawlers de índices de búsqueda y los extractores en vivo activados por el usuario realizan tres funciones distintas, y bloquear uno no bloquea los demás.
- Utiliza los nombres reales y actuales de user-agent en lugar de consejos vagos sobre "bots de AI", por ejemplo: GPTBot, OAI-SearchBot, ChatGPT-User (OpenAI); ClaudeBot, Claude-SearchBot, Claude-User (Anthropic; el antiguo token anthropic-ai está en desuso y Anthropic no publica ningún token de robots.txt independiente para Claude Code); PerplexityBot, Perplexity-User; CCBot; Googlebot, Google-Extended y Google-CloudVertexBot; Applebot y Applebot-Extended; Amazonbot, Bytespider, Meta-ExternalAgent, facebookexternalhit; esta lista no es exhaustiva y evoluciona, así que consulta la documentación de cada proveedor.
- robots.txt (Robots Exclusion Protocol, RFC 9309, septiembre de 2022) establece preferencias por cada user-agent pero es voluntario: los bots cooperativos generalmente lo respetan, aunque no representa una medida de cumplimiento forzoso ni de seguridad, y rige de manera más confiable a los crawlers autónomos que a los extractores activados por el usuario; Anthropic documenta que Claude-User lo respeta, mientras que ChatGPT-User es un token publicado e identificable cuya interacción con robots.txt es un área en evolución (consulta la documentación actual de OpenAI; no asumas que un extractor activado por el usuario se bloquea de manera confiable solo con robots.txt), y Cloudflare informó que los agentes de Perplexity evadieron los bloqueos en agosto de 2025.
- El bloqueo predeterminado de bots de AI de Cloudflare y su modelo de pago por rastreo (beta privada desde el 1 de julio de 2025, utilizando HTTP 402, con compensación basada en el uso de 'pago por inferencia' descrita en el lanzamiento como una dirección futura y sin fecha anunciada) son medidas reales de cumplimiento a nivel de infraestructura que van de la mano de la voluntariedad de robots.txt, y que vale la pena considerar si la protección del contenido se toma en serio.
- La decisión entre bloquear o permitir es un verdadero dilema entre proteger el contenido y seguir siendo citable en las respuestas de la AI; decide según tu propósito y considera a llms.txt únicamente como una señal opcional y no oficial.
