Comprueba en un clic si GPTBot, ClaudeBot, Google-Extended y otros rastreadores de IA pueden leer tus páginas — o si tu robots.txt los está bloqueando sin que lo sepas.
Los rastreadores de IA son bots de empresas como OpenAI, Anthropic y Google que leen páginas públicas para alimentar sus modelos y motores de respuesta. Si pueden leer tu sitio, tu marca puede aparecer en ChatGPT, Claude, Perplexity y las AI Overviews.
Tu archivo robots.txt — un archivo de texto en la raíz de tu dominio — indica a estos bots a qué pueden acceder. Una sola línea Disallow puede eliminarte sin más de las respuestas de IA.
Escribe la dirección de tu sitio. Recuperamos tu archivo público /robots.txt.
Comparamos cada gran rastreador de IA con tus reglas User-agent y Disallow.
Obtén un estado claro permitido / bloqueado para cada rastreador de IA en segundos.
Tu archivo robots.txt es un archivo de texto plano ubicado en la raíz de tu dominio que indica a los bots automatizados qué partes de tu sitio pueden y no pueden recuperar. Durante dos décadas rigió a los rastreadores de buscadores como Googlebot. Hoy tiene una segunda tarea igual de importante: decidir qué rastreadores de IA — los bots que alimentan ChatGPT, Perplexity, Claude y las respuestas generativas de Google — pueden leer tu contenido.
Los proveedores de IA usan user-agents distintos para fines distintos. OpenAI usa GPTBot para recopilar datos de entrenamiento, OAI-SearchBot para impulsar las respuestas de búsqueda en vivo dentro de ChatGPT, y ChatGPT-User para recuperaciones bajo demanda cuando un usuario pide a ChatGPT que abra un enlace. Anthropic opera ClaudeBot y el antiguo anthropic-ai. Perplexity usa PerplexityBot. Google usa Google-Extended como token de exclusión para el entrenamiento de Gemini, separado de su rastreador de búsqueda Googlebot. El CCBot de Common Crawl alimenta a muchos modelos posteriores, y Bytespider (ByteDance), Amazonbot y Applebot-Extended completan la lista.
La clave es que estos bots hacen cosas diferentes, así que un bloqueo general rara vez es la decisión correcta. Bloquear un rastreador de entrenamiento protege tu contenido de ser absorbido en un modelo, pero bloquear un bot de recuperación en vivo como OAI-SearchBot o PerplexityBot puede retirarte silenciosamente de las respuestas de IA que ven tus compradores — el equivalente en IA de desindexarte de Google. La mayoría de las marcas quiere lo contrario: máxima visibilidad en las respuestas de IA, con control selectivo del scraping masivo.
robots.txt es una directiva, no un muro infranqueable. Los rastreadores respetables de OpenAI, Anthropic, Perplexity y Google lo respetan, pero depende de que el bot decida obedecer. Es la forma estándar y sin fricción de expresar tus preferencias, y combinarlo con un archivo llms.txt ofrece a los sistemas de IA bien educados un mapa claro del contenido que más quieres que utilicen.
Una secuencia práctica para auditar qué permites hoy, abrir las puertas que aumentan tu visibilidad IA y cerrar las que no quieres — sin esconderte por accidente de ChatGPT y Perplexity.
Pasa tu dominio por este verificador para ver qué user-agents de IA permites, bloqueas o bloqueas parcialmente hoy. Muchos sitios bloquean GPTBot o PerplexityBot sin saberlo, por una regla copiada y pegada o un ajuste por defecto de un plugin de seguridad.
Separa los bots de recuperación en vivo (OAI-SearchBot, ChatGPT-User, PerplexityBot) de los bots de entrenamiento (GPTBot, Google-Extended, CCBot, ClaudeBot). La mayoría de las marcas permite los bots de recuperación por visibilidad y decide deliberadamente sobre los de entrenamiento.
Para aparecer en las respuestas de ChatGPT y Perplexity, permite explícitamente OAI-SearchBot, ChatGPT-User y PerplexityBot. Si quieres que tu contenido se use también en el entrenamiento, permite además GPTBot y ClaudeBot.
Si te preocupa el ancho de banda, el scraping masivo o la reutilización sin atribución, añade reglas Disallow para rastreadores agresivos como Bytespider, CCBot o Amazonbot, dejando permitidos los bots de los motores de respuesta.
Usa un bloque User-agent por bot, nombra el user-agent de forma idéntica y coloca Allow: / o Disallow: / debajo. Una regla final demasiado amplia puede bloquear mucho más de lo previsto, así que mantén cada directiva bien acotada.
Vuelve a ejecutar este verificador tras editar robots.txt para confirmar que cada bot se lee como pretendías. Verifica que el archivo devuelve un HTTP 200 en /robots.txt y que no lo bloquea un firewall, una CDN o una regla WAF.
Publica un llms.txt que enumere tus páginas y documentación más importantes. Complementa a robots.txt apuntando a los sistemas de IA bien educados hacia el contenido que más quieres que se cite.
Los proveedores de IA añaden y renombran user-agents con frecuencia. Vuelve a revisar cada trimestre, vigila tus registros de servidor en busca de nuevos bots de IA y confirma que una actualización de CDN o un nuevo plugin no haya cambiado tus reglas en silencio.
El vocabulario para controlar los bots de IA, en lenguaje claro.
Si los compradores te investigan a través de asistentes de IA, tu robots.txt ahora decide si pueden leerte.
Decide de forma deliberada si permites rastreadores de entrenamiento como GPTBot y CCBot, manteniendo permitidos los bots de motores de respuesta como OAI-SearchBot y PerplexityBot para que tus contenidos sigan siendo citados.
Confirma que ChatGPT y Perplexity pueden leer tu documentación y tus páginas de funcionalidades, para que cuando los compradores pregunten a la IA por la mejor herramienta de tu categoría, tu sitio esté disponible para ser citado.
Asegúrate de que tus páginas de producto y categoría sean rastreables por las respuestas de compra de IA, y limita selectivamente los scrapers agresivos que cargan tus servidores sin enviar tráfico.
Audita el robots.txt de un cliente en segundos, detecta bloqueos accidentales de GPTBot o PerplexityBot y convierte la corrección en una victoria de visibilidad IA clara y medible.
El acceso es solo el primer paso. Descubre si los motores de IA recomiendan de verdad tu marca — y cómo lograrlo.
Obtener mi puntuación RAIVE gratis