HERRAMIENTA GRATIS

¿Los rastreadores de IA pueden entrar en tu sitio?

Comprueba en un clic si GPTBot, ClaudeBot, Google-Extended y otros rastreadores de IA pueden leer tus páginas — o si tu robots.txt los está bloqueando sin que lo sepas.

Leemos tu archivo público /robots.txt. No guardamos nada.

¿Qué es un rastreador de IA?

Los rastreadores de IA son bots de empresas como OpenAI, Anthropic y Google que leen páginas públicas para alimentar sus modelos y motores de respuesta. Si pueden leer tu sitio, tu marca puede aparecer en ChatGPT, Claude, Perplexity y las AI Overviews.

Tu archivo robots.txt — un archivo de texto en la raíz de tu dominio — indica a estos bots a qué pueden acceder. Una sola línea Disallow puede eliminarte sin más de las respuestas de IA.

Cómo funciona

1

Introduce tu dominio

Escribe la dirección de tu sitio. Recuperamos tu archivo público /robots.txt.

2

Analizamos las reglas

Comparamos cada gran rastreador de IA con tus reglas User-agent y Disallow.

3

Mira quién está bloqueado

Obtén un estado claro permitido / bloqueado para cada rastreador de IA en segundos.

Cómo robots.txt controla los rastreadores de IA en 2026

Tu archivo robots.txt es un archivo de texto plano ubicado en la raíz de tu dominio que indica a los bots automatizados qué partes de tu sitio pueden y no pueden recuperar. Durante dos décadas rigió a los rastreadores de buscadores como Googlebot. Hoy tiene una segunda tarea igual de importante: decidir qué rastreadores de IA — los bots que alimentan ChatGPT, Perplexity, Claude y las respuestas generativas de Google — pueden leer tu contenido.

Los proveedores de IA usan user-agents distintos para fines distintos. OpenAI usa GPTBot para recopilar datos de entrenamiento, OAI-SearchBot para impulsar las respuestas de búsqueda en vivo dentro de ChatGPT, y ChatGPT-User para recuperaciones bajo demanda cuando un usuario pide a ChatGPT que abra un enlace. Anthropic opera ClaudeBot y el antiguo anthropic-ai. Perplexity usa PerplexityBot. Google usa Google-Extended como token de exclusión para el entrenamiento de Gemini, separado de su rastreador de búsqueda Googlebot. El CCBot de Common Crawl alimenta a muchos modelos posteriores, y Bytespider (ByteDance), Amazonbot y Applebot-Extended completan la lista.

La clave es que estos bots hacen cosas diferentes, así que un bloqueo general rara vez es la decisión correcta. Bloquear un rastreador de entrenamiento protege tu contenido de ser absorbido en un modelo, pero bloquear un bot de recuperación en vivo como OAI-SearchBot o PerplexityBot puede retirarte silenciosamente de las respuestas de IA que ven tus compradores — el equivalente en IA de desindexarte de Google. La mayoría de las marcas quiere lo contrario: máxima visibilidad en las respuestas de IA, con control selectivo del scraping masivo.

robots.txt es una directiva, no un muro infranqueable. Los rastreadores respetables de OpenAI, Anthropic, Perplexity y Google lo respetan, pero depende de que el bot decida obedecer. Es la forma estándar y sin fricción de expresar tus preferencias, y combinarlo con un archivo llms.txt ofrece a los sistemas de IA bien educados un mapa claro del contenido que más quieres que utilicen.

Cómo controlar los rastreadores de IA con robots.txt

Una secuencia práctica para auditar qué permites hoy, abrir las puertas que aumentan tu visibilidad IA y cerrar las que no quieres — sin esconderte por accidente de ChatGPT y Perplexity.

1

Audita tus reglas actuales

Pasa tu dominio por este verificador para ver qué user-agents de IA permites, bloqueas o bloqueas parcialmente hoy. Muchos sitios bloquean GPTBot o PerplexityBot sin saberlo, por una regla copiada y pegada o un ajuste por defecto de un plugin de seguridad.

2

Define tu estrategia de permitir/bloquear

Separa los bots de recuperación en vivo (OAI-SearchBot, ChatGPT-User, PerplexityBot) de los bots de entrenamiento (GPTBot, Google-Extended, CCBot, ClaudeBot). La mayoría de las marcas permite los bots de recuperación por visibilidad y decide deliberadamente sobre los de entrenamiento.

3

Permite los rastreadores de IA que importan

Para aparecer en las respuestas de ChatGPT y Perplexity, permite explícitamente OAI-SearchBot, ChatGPT-User y PerplexityBot. Si quieres que tu contenido se use también en el entrenamiento, permite además GPTBot y ClaudeBot.

4

Bloquea los scrapers que no quieres

Si te preocupa el ancho de banda, el scraping masivo o la reutilización sin atribución, añade reglas Disallow para rastreadores agresivos como Bytespider, CCBot o Amazonbot, dejando permitidos los bots de los motores de respuesta.

5

Escribe una sintaxis correcta y específica

Usa un bloque User-agent por bot, nombra el user-agent de forma idéntica y coloca Allow: / o Disallow: / debajo. Una regla final demasiado amplia puede bloquear mucho más de lo previsto, así que mantén cada directiva bien acotada.

6

Prueba antes y después de publicar

Vuelve a ejecutar este verificador tras editar robots.txt para confirmar que cada bot se lee como pretendías. Verifica que el archivo devuelve un HTTP 200 en /robots.txt y que no lo bloquea un firewall, una CDN o una regla WAF.

7

Añade un llms.txt para guiar a los buenos bots

Publica un llms.txt que enumere tus páginas y documentación más importantes. Complementa a robots.txt apuntando a los sistemas de IA bien educados hacia el contenido que más quieres que se cite.

8

Monitoriza la actividad de los rastreadores con el tiempo

Los proveedores de IA añaden y renombran user-agents con frecuencia. Vuelve a revisar cada trimestre, vigila tus registros de servidor en busca de nuevos bots de IA y confirma que una actualización de CDN o un nuevo plugin no haya cambiado tus reglas en silencio.

Glosario de rastreadores de IA y robots.txt

El vocabulario para controlar los bots de IA, en lenguaje claro.

robots.txt
Un archivo de texto plano en la raíz de tu dominio (tusitio.com/robots.txt) que indica a los rastreadores qué rutas pueden y no pueden recuperar. La forma estándar de expresar tus preferencias de rastreo a los bots de búsqueda y de IA.
User-agent
El identificador que un bot envía para anunciar quién es. En robots.txt, cada línea User-agent nombra el bot al que se aplica un bloque de reglas, como GPTBot o PerplexityBot.
Disallow
Una directiva que pide a un user-agent nombrado que no recupere la ruta indicada. Disallow: / bloquea todo el sitio para ese bot; Disallow: /private/ solo bloquea esa carpeta.
Allow
Una directiva que permite explícitamente una ruta, usada para crear excepciones dentro de un Disallow más amplio o para conceder acceso claro a un bot concreto.
Crawl-delay
Una directiva opcional que solicita un número mínimo de segundos entre las peticiones de un bot, para limitar la carga del servidor. La respetan algunos rastreadores pero no todos los bots de IA.
GPTBot
El rastreador de OpenAI que recopila contenido web usado para entrenar sus modelos. Bloquear GPTBot excluye tu contenido del entrenamiento, pero no te retira por sí solo de las respuestas de búsqueda en vivo de ChatGPT.
Google-Extended
Un token de robots.txt que Google usa para permitirte excluir tu contenido del entrenamiento y la fundamentación de Gemini, separado del rastreador Googlebot que impulsa la Búsqueda. Bloquearlo no afecta tu posicionamiento en Google Search.
llms.txt
Un archivo de texto propuesto que enumera tus páginas y documentación clave en una forma limpia y legible por máquina, para que los sistemas de IA encuentren tu contenido más importante. Complementa a robots.txt en lugar de reemplazarlo.
Rastreador de IA
Un bot operado por un proveedor de IA para recuperar páginas web con fines de entrenamiento, recuperación en vivo o navegación bajo demanda. Ejemplos: GPTBot, OAI-SearchBot, ClaudeBot, PerplexityBot y CCBot.
Bot de recuperación en vivo
Un rastreador de IA que recupera páginas en el momento de responder para fundamentar una respuesta, como OAI-SearchBot, ChatGPT-User y PerplexityBot. Bloquearlos puede retirarte de las respuestas de IA.
Rastreador de entrenamiento
Un bot que recopila contenido para entrenar un modelo en lugar de responder a una consulta en vivo, como GPTBot, Google-Extended, CCBot y Bytespider.

Quién usa el verificador de Robots.txt

Si los compradores te investigan a través de asistentes de IA, tu robots.txt ahora decide si pueden leerte.

Editores y medios

Decide de forma deliberada si permites rastreadores de entrenamiento como GPTBot y CCBot, manteniendo permitidos los bots de motores de respuesta como OAI-SearchBot y PerplexityBot para que tus contenidos sigan siendo citados.

SaaS y software

Confirma que ChatGPT y Perplexity pueden leer tu documentación y tus páginas de funcionalidades, para que cuando los compradores pregunten a la IA por la mejor herramienta de tu categoría, tu sitio esté disponible para ser citado.

E-commerce y DTC

Asegúrate de que tus páginas de producto y categoría sean rastreables por las respuestas de compra de IA, y limita selectivamente los scrapers agresivos que cargan tus servidores sin enviar tráfico.

Agencias y consultores

Audita el robots.txt de un cliente en segundos, detecta bloqueos accidentales de GPTBot o PerplexityBot y convierte la corrección en una victoria de visibilidad IA clara y medible.

Preguntas frecuentes

¿Qué es GPTBot?
GPTBot es el rastreador web de OpenAI. Lee páginas públicas para entrenar y nutrir sus modelos. Bloquearlo en robots.txt impide que OpenAI use tu contenido.
¿Debería permitir los rastreadores de IA?
Para la mayoría de las marcas, sí. Permitirlos hace que tu contenido aparezca en las respuestas de ChatGPT, Claude y Perplexity — una fuente de descubrimiento en plena expansión.
¿Bloquear robots.txt me elimina de ChatGPT?
Bloquear ChatGPT-User y GPTBot detiene el rastreo y la recuperación en vivo, lo que reduce tus citas. No borra lo ya aprendido, pero limita tu visibilidad futura.
¿Qué es Google-Extended?
Google-Extended es un token de robots.txt que controla si Google puede usar tu contenido para Gemini y sus funciones de IA, de forma independiente a la indexación normal de Google Search.
¿En qué se diferencia de Rankfender?
Esta herramienta comprueba el acceso. Rankfender va más allá: mide si los motores de IA mencionan realmente tu marca y muestra cómo ganar esas citas.
¿Debería bloquear los rastreadores de IA?
Para la mayoría de las marcas, no — al menos no los bots de recuperación en vivo. Bloquear OAI-SearchBot, ChatGPT-User o PerplexityBot puede retirarte de las respuestas que los compradores ven en ChatGPT y Perplexity. La decisión matizada está en los rastreadores de entrenamiento como GPTBot, Google-Extended y CCBot: bloquéalos si no quieres que tu contenido se absorba en modelos, pero ten en cuenta que bloquearlo todo sacrifica tu visibilidad IA para proteger contenido que quizá quieras que se descubra de todos modos.
¿Bloquear GPTBot me elimina de ChatGPT?
No directamente. GPTBot es el rastreador de entrenamiento de OpenAI, no el bot que recupera páginas para las respuestas en vivo. Las respuestas de búsqueda de ChatGPT las impulsa OAI-SearchBot, y la apertura de enlaces bajo demanda la realiza ChatGPT-User. Si quieres quedar fuera del entrenamiento pero seguir visible en las respuestas de ChatGPT, bloquea GPTBot y permite OAI-SearchBot y ChatGPT-User.
¿Qué es Google-Extended?
Google-Extended es un token de user-agent de robots.txt que te permite excluir tu contenido del entrenamiento y la fundamentación de los modelos Gemini de Google. Es independiente de Googlebot. Bloquear Google-Extended no afecta tu posicionamiento en Google Search ni tu presencia en la búsqueda normal — solo rige el entrenamiento y la fundamentación de la IA generativa.
¿Permitir bots de IA es malo para el SEO?
No. Permitir rastreadores de IA no perjudica tu posicionamiento clásico en Google; Googlebot y los tokens de entrenamiento de IA como Google-Extended se rigen por separado. Permitir los bots de motores de respuesta en realidad te ayuda a aparecer en ChatGPT y Perplexity, lo que cada vez forma más parte de cómo los compradores descubren marcas. No hay penalización SEO por dejar que los rastreadores de IA lean tu contenido público.
¿Cómo bloqueo un rastreador de IA en robots.txt?
Añade un bloque que nombre al user-agent y luego una regla Disallow. Por ejemplo: User-agent: GPTBot y después Disallow: / bloquea a GPTBot en todo el sitio. Repite un bloque por cada bot que quieras restringir. Tras editar, vuelve a ejecutar este verificador y confirma que /robots.txt devuelve un HTTP 200 para que la regla se sirva realmente.
¿Cuál es la diferencia entre robots.txt y llms.txt?
robots.txt controla qué bots pueden recuperar qué rutas — es una capa de permisos. llms.txt es un archivo propuesto que enumera tus páginas y documentación más importantes para que los sistemas de IA encuentren rápido tu mejor contenido. Funcionan juntos: robots.txt define el acceso y llms.txt orienta a la IA bien educada hacia lo que más quieres que se cite.
¿Obedecerán los rastreadores de IA mi robots.txt?
Los rastreadores respetables de OpenAI, Anthropic, Perplexity y Google se comprometen públicamente a respetar robots.txt. Es una directiva, no un bloqueo absoluto, así que un scraper malicioso puede ignorarlo, pero los grandes proveedores de IA que impulsan las respuestas de ChatGPT, Claude, Perplexity y Gemini sí lo respetan, lo que convierte a robots.txt en el punto de control práctico de la visibilidad IA.
¿Con qué frecuencia debo revisar mi robots.txt para los bots de IA?
Al menos cada trimestre, y tras cualquier cambio de CDN, plugin de seguridad o plataforma. Los proveedores de IA añaden o renombran user-agents con regularidad — Applebot-Extended y OAI-SearchBot son ejemplos recientes — así que un archivo que era correcto el año pasado puede omitir ahora nuevos bots o arrastrar un bloqueo obsoleto. Volver a ejecutar este verificador lleva segundos y detecta los cambios silenciosos.

Permitido no es lo mismo que mencionado

El acceso es solo el primer paso. Descubre si los motores de IA recomiendan de verdad tu marca — y cómo lograrlo.

Obtener mi puntuación RAIVE gratis