Visibilidad de IA

Acceso de rastreadores de AI: Cómo controlar GPTBot, ClaudeBot y el resto

Una oleada de rastreadores de AI visita ahora tu sitio por diferentes motivos, y decidir cuáles permitir o bloquear representa un verdadero dilema comercial entre proteger tu contenido y mantenerte visible en las respuestas de AI.

Por , NYFTY Labs AI Content Engine

Antes, la web tenía un solo rastreador que realmente importaba: Googlebot. Ahora, un grupo cada vez mayor de rastreadores de AI visita tu sitio por diferentes motivos, y decidir quién obtiene acceso es una elección comercial deliberada, no un accidente. El paso esencial es separar el propósito del propietario: algunos bots recopilan datos para entrenar modelos, otros indexan tus páginas para respuestas de búsqueda de AI, y otros obtienen páginas en vivo porque un usuario lo solicitó. Bloquear uno no significa bloquear los demás. Estos son los verdaderos rastreadores de 2026, cómo robots.txt te permite expresar preferencias (y por qué es solo una petición), qué cambió Cloudflare y el verdadero dilema entre proteger el contenido y mantener la visibilidad en las respuestas de AI.

Acceso para rastreadores de AI Tres tareas (entrenamiento, índice de búsqueda y recuperación en vivo) se topan con una barrera Entrenamiento GPTBot, ClaudeBot, CCBot Índice de búsqueda OAI-SearchBot, Claude-SearchBot Recuperación en vivo ChatGPT-User, Claude-User La barrera robots.txt una solicitud voluntaria Cloudflare HTTP 402 un peaje obligatorio Tu sitio permitir, cobrar, bloquear robots.txt solicita; Cloudflare Pay Per Crawl puede imponerlo con HTTP 402.
Los crawlers de AI realizan tres tareas distintas: entrenamiento, indexación de búsqueda y recuperación en vivo iniciada por el usuario, y se topan con una barrera en tu sitio: robots.txt expresa una preferencia (voluntaria), mientras que Cloudflare Pay Per Crawl puede restringir el acceso con un peaje HTTP 402.

Tres funciones: entrenamiento, indexación de búsqueda y recuperadores en vivo

La distinción más importante entre los rastreadores de AI no es la empresa, sino el propósito. Los rastreadores de entrenamiento o recopilación de datos reúnen contenido para ayudar a crear o mejorar modelos de AI. Los rastreadores de indexación de búsqueda catalogan tus páginas para que puedas aparecer y ser citado en las respuestas de tipo búsqueda de un producto de AI. Los recuperadores en vivo y bajo demanda obtienen una página en tiempo real porque un usuario hizo una pregunta o hizo clic en un enlace dentro de un producto de AI. Estos sirven para fines diferentes, y bloquear uno a menudo no es lo mismo que bloquear los otros. Muchos proveedores exponen tokens independientes por propósito, pero esto no es universal: Meta-ExternalAgent es explícitamente multipropósito, y Google no proporciona ningún token de robots.txt que bloquee sus funciones de Search AI mientras conserva la indexación clásica de Search, por lo que los tres propósitos no siempre se pueden controlar de forma independiente. Allí donde están separados, puedes rechazar el uso para entrenamiento y, al mismo tiempo, permitir la indexación de búsqueda y la recuperación en vivo que pueden incluirte dentro de una respuesta de AI.

VISIBILIDAD AI 1Bots de entrenamiento2Bots de indexación de búsqueda3Extractores en vivoBloquear uno no significa bloquear los demás NYFTYLABS
La distinción clave es el propósito: el entrenamiento, la indexación de búsqueda y la extracción en vivo bajo demanda son tareas distintas.

Los verdaderos user-agents de 2026 que debes conocer

Los consejos imprecisos de "bloquear bots de AI" son inútiles sin nombres. OpenAI: GPTBot (entrenamiento), OAI-SearchBot (indexación y visualización al estilo de búsqueda), ChatGPT-User (recuperación en vivo); cada uno con un token de robots.txt independiente. Rastreadores documentados de Anthropic: ClaudeBot (entrenamiento), Claude-SearchBot (navega y analiza la web para mejorar la calidad de los resultados de búsqueda de Claude), Claude-User (recuperación en vivo iniciada por el usuario); el token más antiguo anthropic-ai está en desuso, y Anthropic no publica un token de robots.txt independiente para Claude Code (su recuperación de URL no es controlable de forma independiente a través de un user-agent dedicado). Otros: PerplexityBot (indexación de búsqueda) y Perplexity-User (recuperación en vivo); CCBot (Common Crawl, un gran conjunto de datos abierto del que se han nutrido muchos modelos); Google, donde Googlebot todavía gestiona tanto Search como las funciones de AI de Google, Google-Extended es un token de exclusión para el entrenamiento de AI (not un rastreador distinto), y Google-CloudVertexBot es un rastreador independiente que recupera sitios a petición del propietario cuando un cliente está creando agentes de Vertex AI o grounding; Applebot con el token de exclusión Applebot-Extended; Amazonbot, Bytespider (ByteDance), Meta-ExternalAgent (el rastreador multipropósito de Meta, que incluye entrenamiento de AI así como indexación y mejoras del producto) y facebookexternalhit (vistas previas de enlaces de Meta). Estos se encuentran entre los principales agentes y los nombres que debes referenciar en tus reglas, pero la lista no es exhaustiva y sigue cambiando, así que consulta la documentación actual de cada proveedor.

VISIBILIDAD AITokens de OpenAIGPTBot (entrenamiento)OAI-SearchBot (indexación)ChatGPT-User (en vivo)Tokens de AnthropicClaudeBot (entrenamiento)Claude-SearchBot (búsqueda)Claude-User (en vivo)vsNYFTYLABS
Cada proveedor expone tokens de robots.txt independientes según el propósito; el antiguo token anthropic-ai está descontinuado.

robots.txt expresa preferencias, pero es voluntario

robots.txt, un archivo de texto sin formato en la raíz de tu dominio, ha gobernado el comportamiento de los rastreadores durante décadas bajo el Protocolo de Exclusión de Robots, formalizado como RFC 9309 en septiembre de 2022. Nombras un user-agent y permites o rechazas rutas, por lo que puedes rechazar GPTBot dejando Googlebot intacto. La advertencia esencial: robots.txt es una petición, no una imposición. Los rastreadores que se comportan de forma correcta generalmente lo respetan y los principales proveedores publican soporte para sus tokens, pero nada en el protocolo impide físicamente que un bot lo ignore. No es un control de seguridad. Un límite adicional: robots.txt gobierna de manera confiable los rastreadores autónomos (GPTBot, ClaudeBot, CCBot), pero los recuperadores en vivo activados por el usuario varían. Anthropic documenta que Claude-User lo respeta; ChatGPT-User es un token de user-agent publicado e identificable, pero la interacción de las recuperaciones iniciadas por el usuario con robots.txt ha sido un área en evolución; consulta la documentación actual de OpenAI para conocer la regla权威, y no asumas que una recuperación activada por el usuario queda bloqueada de forma confiable únicamente por robots.txt. Por el contrario, Cloudflare informó en agosto de 2025 que Perplexity seguía accediendo a contenido bloqueado mediante user-agents no declarados e IPs rotativas, y lo retiró de la lista de bots verificados (Perplexity lo disputa). Así que no confíes en robots.txt para bloquear recuperaciones activadas por usuarios en todas partes.

VISIBILIDAD AI 1Nombre del user-agent2Permitir/denegarrutas3Los bots pueden respetar esto4No obligatorioUna solicitud, no un control de seguridad NYFTYLABS
robots.txt (RFC 9309) establece preferencias por token, pero respetarlas es voluntario, no obligatorio.

Cloudflare añadió una imposición real más allá de una petición cortés

Debido a que robots.txt es solo voluntario, los controles a nivel de infraestructura importan. Cloudflare, que está al frente de una gran parte de la web, ha tomado medidas para dar a los propietarios de sitios un control más sólido sobre los rastreadores de AI, incluyendo el bloqueo de muchos bots de AI de forma predeterminada para sitios nuevos. El 1 de julio de 2025 lanzó, en versión beta privada, un modelo de pago por rastreo que utiliza la respuesta HTTP 402 (Payment Required) para que los operadores puedan cobrar a las empresas de AI por el acceso en lugar de servirles de forma gratuita, y su panel de control más amplio AI Crawl Control alcanzó posteriormente la disponibilidad general. En el lanzamiento de Pay Per Crawl, Cloudflare describió un avance hacia la compensación basada en el uso ('pago por inferencia') como una dirección futura; no se ha anunciado ninguna fecha (consulta la documentación actual de Cloudflare para conocer el estado). Los detalles aquí avanzan rápido, pero el punto clave es que el acceso pasa de ser una petición que realiza el sitio a una barrera obligatoria que controla el operador de la red, un cambio real respecto a la era en la que solo se utilizaba robots.txt.

VISIBILIDAD AI 1Crawler de AIsolicitud2Barrera de Cloudflare3Peaje HTTP 4024Cobrar o bloquearPay Per Crawl lanzado el 1 de jul de 2025 NYFTYLABS
Cloudflare Pay Per Crawl utiliza HTTP 402 para que los operadores puedan cobrar a las empresas de AI en lugar de servirles de forma gratuita.

La compensación, y dónde encaja llms.txt

Esta decisión representa un verdadero dilema comercial. Bloquear un crawler de entrenamiento identificado limita la recopilación futura por parte de ese bot (no retira las copias ya recopiladas, licenciadas, obtenidas mediante conjuntos de datos de terceros o reunidas por agentes encubiertos), lo cual es crucial para editores y empresas de contenido original; sin embargo, bloquear los extractores en vivo y de índice de búsqueda puede reducir directamente tus posibilidades de ser recuperado y citado en las respuestas de la AI. No existe una configuración universalmente correcta; decide según tu propósito, evaluando si la visibilidad o la protección es más valiosa para ti. Y no exageres la importancia de llms.txt: es una convención propuesta y no oficial que ningún proveedor importante está obligado a respetar, una señal opcional, no un mecanismo de control ni un sustituto de robots.txt.

VISIBILIDAD AIBloquear crawlersLimita la recopilación futuraProtege el contenidoPara editoresPermitir crawlersHabilita la recuperaciónPosibilidad de ser citadoPara visibilidadvsNYFTYLABS
Una decisión de equilibrio real según el propósito: protección frente a la posibilidad de ser recuperado y citado.
Puntos clave
  • Separa el propósito del propietario: los crawlers de entrenamiento/recopilación de datos, los crawlers de índices de búsqueda y los extractores en vivo activados por el usuario realizan tres funciones distintas, y bloquear uno no bloquea los demás.
  • Utiliza los nombres reales y actuales de user-agent en lugar de consejos vagos sobre "bots de AI", por ejemplo: GPTBot, OAI-SearchBot, ChatGPT-User (OpenAI); ClaudeBot, Claude-SearchBot, Claude-User (Anthropic; el antiguo token anthropic-ai está en desuso y Anthropic no publica ningún token de robots.txt independiente para Claude Code); PerplexityBot, Perplexity-User; CCBot; Googlebot, Google-Extended y Google-CloudVertexBot; Applebot y Applebot-Extended; Amazonbot, Bytespider, Meta-ExternalAgent, facebookexternalhit; esta lista no es exhaustiva y evoluciona, así que consulta la documentación de cada proveedor.
  • robots.txt (Robots Exclusion Protocol, RFC 9309, septiembre de 2022) establece preferencias por cada user-agent pero es voluntario: los bots cooperativos generalmente lo respetan, aunque no representa una medida de cumplimiento forzoso ni de seguridad, y rige de manera más confiable a los crawlers autónomos que a los extractores activados por el usuario; Anthropic documenta que Claude-User lo respeta, mientras que ChatGPT-User es un token publicado e identificable cuya interacción con robots.txt es un área en evolución (consulta la documentación actual de OpenAI; no asumas que un extractor activado por el usuario se bloquea de manera confiable solo con robots.txt), y Cloudflare informó que los agentes de Perplexity evadieron los bloqueos en agosto de 2025.
  • El bloqueo predeterminado de bots de AI de Cloudflare y su modelo de pago por rastreo (beta privada desde el 1 de julio de 2025, utilizando HTTP 402, con compensación basada en el uso de 'pago por inferencia' descrita en el lanzamiento como una dirección futura y sin fecha anunciada) son medidas reales de cumplimiento a nivel de infraestructura que van de la mano de la voluntariedad de robots.txt, y que vale la pena considerar si la protección del contenido se toma en serio.
  • La decisión entre bloquear o permitir es un verdadero dilema entre proteger el contenido y seguir siendo citable en las respuestas de la AI; decide según tu propósito y considera a llms.txt únicamente como una señal opcional y no oficial.

← Más guías

FAQ

Preguntas, respondidas.

Un crawler de entrenamiento o recopilación de datos (como GPTBot o ClaudeBot) recopila contenido que se utiliza para ayudar a construir o mejorar modelos de AI. Un extractor en vivo (como ChatGPT-User o Claude-User) recupera una página en tiempo real porque un usuario hizo una pregunta o hizo clic en un enlace dentro de un producto de AI. Una tercera categoría, los crawlers de calidad de búsqueda (como OAI-SearchBot, Claude-SearchBot o PerplexityBot), navega y analiza la web para que puedas aparecer y ser citado en respuestas de estilo de búsqueda de AI. Cumplen propósitos diferentes, y bloquear uno no bloquea los demás, por lo que puedes, por ejemplo, restringir el uso de entrenamiento y al mismo tiempo permitir la indexación de búsqueda y las extracciones en vivo que pueden hacer que se te cite. Una advertencia: robots.txt es un control confiable para crawlers autónomos que se comportan bien, pero algunos extractores activados por el usuario no lo respetan de manera confiable. Anthropic documenta que Claude-User respeta robots.txt; ChatGPT-User es un token de user-agent publicado e identificable, pero la forma en que las extracciones iniciadas por el usuario interactúan con robots.txt ha sido un área en evolución; consulta la documentación actual de OpenAI para conocer la regla de referencia y no asumas que robots.txt por sí solo bloquea de manera confiable una extracción activada por el usuario. Cloudflare informó en agosto de 2025 que los agentes de Perplexity evadieron los bloqueos, por lo que bloquear los extractores activados por el usuario es menos confiable.

Expresa una solicitud que los crawlers que se comportan correctamente suelen respetar, y OpenAI publica soporte para sus tokens de user-agent y controles independientes para GPTBot, OAI-SearchBot y ChatGPT-User. Sin embargo, robots.txt es voluntario por diseño; forma parte del Robots Exclusion Protocol (formalizado como RFC 9309 en septiembre de 2022), el cual documenta la convención pero no la impone. Nada en el protocolo impide físicamente que un bot que no cumpla con las normas ignore el archivo. Bloquear GPTBot regula específicamente al crawler de entrenamiento de OpenAI; no afecta por sí mismo a OAI-SearchBot o ChatGPT-User, los cuales controlas con sus propios tokens. Por tanto, robots.txt es la herramienta inicial adecuada para declarar preferencias, pero no es un control de seguridad ni una garantía.

Son tokens de control en lugar de crawlers independientes. Google-Extended, según Google, te permite optar por no permitir que tu contenido se utilice para entrenar sus modelos de AI generativa (como Gemini y sus funciones generativas de Vertex AI); Google afirma que su uso no afecta la forma en que Googlebot indexa o clasifica tus páginas en Search. Ten en cuenta un límite importante: dado que Googlebot es un único crawler que sirve tanto a Search como a las funciones de AI de Google, Google-Extended controla el entrenamiento de modelos generativos pero no elimina tus páginas de AI Overviews dentro de Google Search. Applebot-Extended desempeña un papel de exclusión similar para el entrenamiento del modelo de AI de Apple, superponiéndose al crawler de búsqueda normal Applebot para que bloquearlo no te elimine de las funciones de búsqueda de Apple. Ambos te permiten separar "indexarme para búsquedas" de "usarme para entrenamiento de AI", que es exactamente el tipo de control basado en el propósito del que trata este tema. (Google también ejecuta un Google-CloudVertexBot independiente que extrae sitios a petición del propietario del sitio cuando un cliente está creando agentes o grounding de Vertex AI, lo cual es distinto del token Google-Extended.)

Representa un dilema empresarial real sin una respuesta universal. Bloquear un crawler de entrenamiento identificado limita la recopilación futura de ese bot —lo que más importa a los editores y empresas de contenido original—, aunque no revoca las copias ya recopiladas, licenciadas, obtenidas mediante conjuntos de datos de terceros o reunidas por agentes encubiertos. Sin embargo, bloquear específicamente los fetchers en vivo y los crawlers de indexación de búsqueda puede reducir tus posibilidades de ser recuperado y citado cuando los usuarios hacen preguntas relevantes en herramientas de AI. El enfoque práctico es decidir según el propósito: muchas empresas permiten los fetchers en vivo y de tipo búsqueda para ganar visibilidad, mientras que restringen o negocian el acceso de los crawlers de entrenamiento masivo.

Es opcional y experimental, no obligatorio. El archivo llms.txt es una propuesta surgida de la comunidad, un archivo Markdown que orienta a los sistemas de AI hacia tu contenido más importante, con un espíritu similar al de un sitemap. Su adopción es de bajo costo, pero no es un estándar oficial y ningún proveedor principal de AI está obligado a respetarlo. Trátalo como una señal de valor añadido si lo deseas, no como un mecanismo de control ni como un reemplazo de robots.txt o de tus decisiones estratégicas de acceso para crawlers.

¿Quieres que esto funcione para tu marca?