Free Tool

Verificador de rastreabilidad GEO gratuito

Descubre si los motores de IA pueden rastrear y renderizar realmente tus páginas — antes de que decidan leerte, confiar en ti y citarte.

¿Qué es la rastreabilidad GEO?

La optimización para motores generativos (GEO) empieza con una pregunta: ¿puede la IA siquiera llegar a tu contenido? Bots como GPTBot, ClaudeBot y PerplexityBot deben obtener y renderizar una página antes de que pueda aparecer en una respuesta. Si están bloqueados o el contenido solo carga con JavaScript, eres invisible.

El verificador de rastreabilidad GEO prueba tus reglas de robots.txt, el acceso de los bots de IA, las respuestas del servidor y si tu contenido clave se renderiza sin JavaScript. Te dice, en términos claros, si los motores que alimentan las respuestas de IA pueden leer tu sitio.

Cómo funciona

1

Pega tu URL

Introduce una página y simulamos cómo los rastreadores de IA la solicitan y cargan.

2

Probamos el acceso de los bots

Comprobamos robots.txt, las reglas de user-agents de IA, los códigos de estado y el contenido dependiente de JavaScript.

3

Recibe tu lista de acciones

Descubre qué bloquea a los motores de IA y cómo abrirles tu contenido.

Preguntas frecuentes

Guía completa sobre crawlabilidad GEO: ¿pueden los motores de IA leer tu sitio?

La optimización para motores generativos (GEO) comienza al nivel más fundamental: ¿puede la IA ver siquiera tu contenido? Antes de que cualquier modelo pueda decidir confiar, resumir o citar tus páginas, un rastreador debe obtenerlas y renderizarlas correctamente. Los motores de IA envían bots especializados — GPTBot para OpenAI, ClaudeBot para Anthropic, PerplexityBot para Perplexity, Google-Extended para Gemini. Si tu servidor o robots.txt los rechaza, ese motor no puede incluir tu contenido en sus respuestas.

La mayoría de los sitios web fueron configurados para rastreadores de motores de búsqueda, no para bots de IA. Un archivo robots.txt editado por última vez en 2019 casi con certeza no tiene en cuenta GPTBot (introducido en 2023) o ClaudeBot. Sin una directiva Allow explícita, algunas configuraciones de servidor bloquean por defecto a los agentes desconocidos. El resultado es silencioso.

El contenido renderizado con JavaScript es una segunda barrera importante para la crawlabilidad GEO. Muchos frameworks modernos (React, Vue, Angular) entregan un esqueleto HTML casi vacío y cargan el contenido real en el lado del cliente después de que se ejecuta JavaScript. Muchos bots de IA no ejecutan JavaScript, por lo que este contenido es invisible para ellos.

Las cadenas de redireccionamiento, los soft 404 y los muros de inicio de sesión completan los fallos más comunes de crawlabilidad GEO. Una cadena de tres o más redireccionamientos antes de llegar a la página final puede hacer que un rastreador se rinda. Las páginas que devuelven 200 OK pero muestran "contenido no encontrado" desperdician el presupuesto de rastreo.

Manual de corrección de crawlabilidad GEO

Ocho pasos para garantizar que cada motor de IA pueda llegar y leer tus páginas.

1

Auditar robots.txt para user-agents de IA

Abre tu robots.txt y busca GPTBot, ClaudeBot, PerplexityBot y Google-Extended. Si estos agentes están explícitamente bloqueados o ausentes de una regla Allow en un sitio con wildcard bloqueado, los motores de IA no pueden rastrearte.

2

Probar respuestas del servidor con encabezados user-agent de IA

Usa curl o una herramienta similar para solicitar tus páginas con cada cadena user-agent de IA. Busca 403, 429 o bucles de redirección que solo aparecen para agentes específicos.

3

Identificar bloques de contenido solo con JavaScript

Desactiva JavaScript en tu navegador y visita cada página clave. Cualquier contenido que desaparezca es invisible para los rastreadores de IA que no ejecutan JS. Prioriza mover este contenido a HTML renderizado en el servidor.

4

Añadir o actualizar tu archivo llms.txt

llms.txt es un estándar emergente que señala a los rastreadores de IA qué páginas son autoritativas y contienen el contenido más valioso. Colócalo en la raíz de tu sitio (/llms.txt).

5

Auditar cadenas de redirección en páginas importantes

Usa un verificador de redirecciones para rastrear la cadena completa de tus URLs más importantes. Cualquier cadena de más de dos saltos debe colapsarse en una redirección directa única.

6

Asegurarse de que las páginas clave devuelvan 200 OK

Ejecuta un rastreo completo y marca cualquier página que devuelva un código de estado no-200 o que devuelva 200 pero entregue ningún contenido significativo. Los soft 404 son especialmente costosos.

7

Probar con múltiples user-agents de IA

No asumas que permitir GPTBot es suficiente. Cada motor de IA tiene su propio bot con su propio user-agent. Prueba GPTBot, ClaudeBot, PerplexityBot, Google-Extended y Applebot-Extended individualmente.

8

Monitorear la crawlabilidad con un verificador GEO

La crawlabilidad GEO no es una propiedad estática — cambia cuando actualizas robots.txt, despliegas nuevos cambios de framework o añades un CDN o WAF. Ejecuta una verificación después de cada despliegue técnico importante.

Glosario de crawlabilidad GEO

Definiciones en lenguaje claro de cada término técnico relacionado con la accesibilidad de motores de IA.

GPTBot
Rastreador web de OpenAI, usado para recopilar información para ChatGPT y modelos relacionados. Identificado por la cadena user-agent "GPTBot". Puede ser permitido o bloqueado en robots.txt.
ClaudeBot
Rastreador web de Anthropic, usado para recopilar información para los modelos Claude. Debe ser explícitamente permitido en robots.txt para que Anthropic pueda rastrear tu sitio.
PerplexityBot
Rastreador web de Perplexity AI, usado para búsqueda web en tiempo real que impulsa las respuestas de Perplexity. Especialmente importante para la visibilidad de IA en tiempo real.
Google-Extended
Mecanismo de exclusión de Google para el entrenamiento de IA. Configurar "User-agent: Google-Extended / Disallow: /" evita que Google use tu contenido para entrenar Gemini y Bard.
GEO (Optimización para Motores Generativos)
Práctica de hacer que el contenido sea accesible, analizable y confiable para los motores de IA generativos que sintetizan respuestas del contenido web.
robots.txt
Archivo de texto en la raíz de un dominio que indica a los rastreadores qué páginas o rutas están permitidas o prohibidas de acceder.
User-Agent
Cadena enviada en los encabezados de solicitud HTTP que identifica el navegador, bot o rastreador que realiza la solicitud.
Renderizado JavaScript
Proceso de ejecutar JavaScript en una página para generar su HTML final. Las páginas que requieren renderizado JS pueden ser parcial o totalmente invisibles para los rastreadores de IA.
Renderizado del lado del servidor (SSR)
Arquitectura web donde el HTML completo de una página se genera en el servidor antes de entregarlo al navegador. El contenido SSR es inmediatamente legible por cualquier rastreador.
llms.txt
Archivo estándar emergente (ubicado en /llms.txt) que proporciona a los modelos de IA orientación estructurada sobre el contenido de un sitio: qué páginas son más importantes y hechos clave sobre la organización.
Presupuesto de rastreo
Número de páginas que un rastreador obtendrá de un sitio en un período de tiempo determinado. El presupuesto desperdiciado en cadenas de redirección y soft 404 reduce la cantidad de contenido valioso indexado.
Directiva Disallow
Instrucción robots.txt que prohíbe a un user-agent nombrado acceder a una ruta especificada. Ejemplo: "User-agent: GPTBot / Disallow: /" bloquea GPTBot en todo el sitio.

Quién necesita un Verificador de Crawlabilidad GEO

Sitios y escenarios donde los fallos de crawlabilidad de IA son más probables y costosos.

Sitios SPA y React/Next.js

Las aplicaciones de página única que dependen del renderizado JavaScript del lado del cliente tienen el mayor riesgo de contenido invisible para los rastreadores de IA. Cualquier página donde el contenido se carga a través de llamadas API necesita revisión SSR.

Empresas con robots.txt complejo

Los grandes sitios corporativos a menudo tienen archivos robots.txt mantenidos por múltiples equipos durante años, resultando en reglas contradictorias y bloqueos involuntarios.

Editores controlando el entrenamiento de IA

Los editores que quieren controlar si su contenido se usa para el entrenamiento de IA necesitan saber exactamente qué bots los rastrean. El verificador muestra el estado de acceso actual para cada bot de IA importante.

E-commerce con productos cargados en JS

Las páginas de detalle de productos que cargan precios, disponibilidad y descripciones a través de JavaScript son comunes en e-commerce. Si esos elementos son invisibles para los rastreadores de IA, los productos no pueden aparecer en respuestas de compras de IA.

Agencias auditando sitios de clientes

Las agencias que lanzan o migran sitios de clientes necesitan verificar la crawlabilidad GEO como parte del QA previo al lanzamiento. Un verificador detecta problemas de acceso antes de que degraden silenciosamente la visibilidad de IA.

Nuevos sitios estableciendo política de IA

Las organizaciones que crean nuevos sitios tienen la oportunidad de establecer su política de acceso IA desde el primer día: qué bots permitir, si publicar un llms.txt, y cómo estructurar el contenido.