Herramienta gratuita · AI Crawler Auditor

¿Estás dejando entrar a la IA?

Tu robots.txt decide silenciosamente si los crawls detrás de ChatGPT, Claude, Gemini, Perplexity y más tienen permitido leer tu sitio. Esta herramienta lo contrasta con los 13 principales AI crawlers de 2026 y muestra una matriz simple de permitir/bloquear, dividida entre crawlers que extraen páginas para responder preguntas de AI en vivo, crawlers que solo recopilan datos para entrenamiento de modelos, y crawlers que hacen ambas cosas, para que puedas distinguir entre autoexcluirte del entrenamiento y quedar fuera de las respuestas de AI por accidente. Funciona completamente en tu navegador, sin API key, sin enviarnos nada.

Definición

¿Qué es AI Crawler Auditor?

El AI Crawler Auditor es una herramienta gratuita en el navegador que lee el robots.txt de tu sitio y muestra una matriz simple de permitir/bloquear para los 13 principales AI crawlers de 2026: GPTBot, OAI-SearchBot, ClaudeBot, Claude-SearchBot, PerplexityBot, Google-Extended, Googlebot, CCBot, Bytespider, Amazonbot, Amzn-SearchBot, Amzn-User y meta-externalagent. Separa los crawlers que extraen páginas para responder preguntas de AI en vivo de aquellos que solo recopilan datos para el entrenamiento de modelos (y marca los que, como Amazonbot, hacen ambas cosas), para que puedas ver si te estás autoexcluyendo del entrenamiento o si te estás quedando fuera de las respuestas de AI por accidente.

Cómo funciona

Introduce tu dominio y la herramienta intentará obtener tu /robots.txt público a través de HTTPS. Debido a que los navegadores bloquean la mayoría de las solicitudes de sitios cruzados, si la obtención falla, simplemente abre tu robots.txt, cópialo y pégalo; el análisis es idéntico en ambos casos.

Todo se analiza en tu dispositivo: el user-agent documentado de cada AI crawler se contrasta con tus reglas (fusionando cada grupo de robots.txt coincidente y evaluando la precedencia de comodines, terminal-$ y coincidencia más larga) y se marca como permitido, parcialmente permitido o bloqueado, junto con una recomendación en lenguaje sencillo. No se sube nada y no se necesita ninguna API key.

Para quién es

Para propietarios de sitios, profesionales de marketing y desarrolladores que desean una lectura rápida y privada de qué AI crawlers permite entrar su robots.txt. El resultado es la claridad: mantener permitidos los crawlers de recuperación en vivo para seguir siendo apto para ser citado en las respuestas de AI, y hacer que la autoexclusión del entrenamiento de modelos (GPTBot, Google-Extended, CCBot y similares) sea una decisión deliberada y separada en lugar de un accidente.

En la práctica

Una clínica pega su robots.txt y observa que una regla Disallow genérica está bloqueando a OAI-SearchBot y PerplexityBot, indicando a estos rastreadores compatibles que no indexen sus páginas. Esto puede reducir drásticamente la frecuencia con la que la clínica aparece cuando la gente pregunta a ChatGPT o Perplexity por un proveedor local. (robots.txt es una guía voluntaria: los motores de búsqueda aún pueden mencionar una marca basándose en datos ya indexados o en fuentes de terceros). La matriz muestra exactamente qué rastreadores están bloqueados y por qué, y confirma que es correcto mantener la exclusión de entrenamiento para GPTBot mientras que los rastreadores de búsqueda en vivo deberían volver a habilitarse.

Ejecutar la auditoría

Quién puede leer tu sitio, y a quién dejas fuera.

Ingresa tu dominio e intentaremos obtener tu /robots.txt. Los navegadores suelen bloquear las solicitudes entre sitios a los archivos de otro dominio, por lo que si la extracción falla, simplemente abre tu robots.txt, pégalo y analízalo. Todo se procesa en tu dispositivo frente a los user-agents documentados detrás de ChatGPT, Claude, Perplexity, Google-Extended (que controla el entrenamiento y fundamentación de Gemini, no las AI Overviews), Googlebot (que alimenta Google Search y AI Overviews), Common Crawl, ByteDance, Amazon y Meta. robots.txt solo rige para bots que cumplen las normas; el contenido que ya está en los datos de entrenamiento de un modelo persiste independientemente.

Pega tu robots.txt en su lugar (se usa si el navegador no puede obtenerlo)

Nada se sube ni se almacena, el archivo se procesa completamente en tu navegador. Recuerda: robots.txt se respeta de forma voluntaria (los rastreadores bien fundamentados lo respetan, algunos lo ignoran), y el contenido que ya está en el conjunto de entrenamiento de un modelo permanece allí de todos modos. ¿Quieres que vigilemos esto por ti? Contáctanos.

FAQ

Preguntas, respondidas.

Sí, es completamente gratuito, sin registro y sin API key. Lee las reglas de tu robots.txt y muestra qué rastreadores de AI permites o bloqueas.

No. La herramienta se ejecuta completamente en tu navegador. Cuando introduces tu dominio o pegas tu robots.txt, este se procesa en tu dispositivo y nosotros nunca lo subimos, registramos ni almacenamos.

Los navegadores bloquean la mayoría de las solicitudes entre sitios a los archivos de otro dominio por razones de seguridad, por lo que la obtención directa de tu robots.txt a menudo falla. Cuando eso suceda, puedes abrir tu robots.txt, copiarlo, pegarlo y la herramienta lo analizará exactamente de la misma manera.

Comprueba los user-agents documentados de los principales AI crawlers de 2026, incluidos GPTBot y OAI-SearchBot (OpenAI), ClaudeBot y Claude-SearchBot (Anthropic), PerplexityBot, Google-Extended y Googlebot (Google), CCBot (Common Crawl), Bytespider (ByteDance), Amazonbot, Amzn-SearchBot y Amzn-User (Amazon), y meta-externalagent (Meta).

Los crawlers de entrenamiento (como GPTBot, ClaudeBot, Google-Extended, CCBot) recopilan datos que pueden usarse para entrenar modelos. Los crawlers de recuperación de búsqueda (como OAI-SearchBot, Claude-SearchBot, PerplexityBot) extraen páginas para responder preguntas en vivo. Algunos crawlers, como Amazonbot, hacen ambas cosas. Bloquear los crawlers de recuperación puede eliminarte de las respuestas de AI ahora, mientras que bloquear los crawlers exclusivos de entrenamiento es una opción de exclusión diferente y válida.

No. Google-Extended solo controla si tu contenido se puede utilizar para el entrenamiento y la fundamentación del modelo Gemini. Las AI Overviews se basan en el índice estándar de Googlebot, por lo que bloquear Google-Extended no te elimina de las AI Overviews, y permitirlo no te añade a ellas.

No. Informa una lectura a nivel de sitio de tu robots.txt en comparación con los user-agents documentados. El robots.txt se respeta de manera voluntaria, las reglas a nivel de ruta aún pueden restringir secciones, los bots pueden cambiar y el contenido que ya está en los datos de entrenamiento de un modelo permanece allí independientemente.

¿Quieres acceso para tus crawlers de IA configurado correctamente?