Descubre si los motores de IA pueden rastrear y renderizar realmente tus páginas — antes de que decidan leerte, confiar en ti y citarte.
La optimización para motores generativos (GEO) empieza con una pregunta: ¿puede la IA siquiera llegar a tu contenido? Bots como GPTBot, ClaudeBot y PerplexityBot deben obtener y renderizar una página antes de que pueda aparecer en una respuesta. Si están bloqueados o el contenido solo carga con JavaScript, eres invisible.
El verificador de rastreabilidad GEO prueba tus reglas de robots.txt, el acceso de los bots de IA, las respuestas del servidor y si tu contenido clave se renderiza sin JavaScript. Te dice, en términos claros, si los motores que alimentan las respuestas de IA pueden leer tu sitio.
Introduce una página y simulamos cómo los rastreadores de IA la solicitan y cargan.
Comprobamos robots.txt, las reglas de user-agents de IA, los códigos de estado y el contenido dependiente de JavaScript.
Descubre qué bloquea a los motores de IA y cómo abrirles tu contenido.
La optimización para motores generativos (GEO) comienza al nivel más fundamental: ¿puede la IA ver siquiera tu contenido? Antes de que cualquier modelo pueda decidir confiar, resumir o citar tus páginas, un rastreador debe obtenerlas y renderizarlas correctamente. Los motores de IA envían bots especializados — GPTBot para OpenAI, ClaudeBot para Anthropic, PerplexityBot para Perplexity, Google-Extended para Gemini. Si tu servidor o robots.txt los rechaza, ese motor no puede incluir tu contenido en sus respuestas.
La mayoría de los sitios web fueron configurados para rastreadores de motores de búsqueda, no para bots de IA. Un archivo robots.txt editado por última vez en 2019 casi con certeza no tiene en cuenta GPTBot (introducido en 2023) o ClaudeBot. Sin una directiva Allow explícita, algunas configuraciones de servidor bloquean por defecto a los agentes desconocidos. El resultado es silencioso.
El contenido renderizado con JavaScript es una segunda barrera importante para la crawlabilidad GEO. Muchos frameworks modernos (React, Vue, Angular) entregan un esqueleto HTML casi vacío y cargan el contenido real en el lado del cliente después de que se ejecuta JavaScript. Muchos bots de IA no ejecutan JavaScript, por lo que este contenido es invisible para ellos.
Las cadenas de redireccionamiento, los soft 404 y los muros de inicio de sesión completan los fallos más comunes de crawlabilidad GEO. Una cadena de tres o más redireccionamientos antes de llegar a la página final puede hacer que un rastreador se rinda. Las páginas que devuelven 200 OK pero muestran "contenido no encontrado" desperdician el presupuesto de rastreo.
Ocho pasos para garantizar que cada motor de IA pueda llegar y leer tus páginas.
Abre tu robots.txt y busca GPTBot, ClaudeBot, PerplexityBot y Google-Extended. Si estos agentes están explícitamente bloqueados o ausentes de una regla Allow en un sitio con wildcard bloqueado, los motores de IA no pueden rastrearte.
Usa curl o una herramienta similar para solicitar tus páginas con cada cadena user-agent de IA. Busca 403, 429 o bucles de redirección que solo aparecen para agentes específicos.
Desactiva JavaScript en tu navegador y visita cada página clave. Cualquier contenido que desaparezca es invisible para los rastreadores de IA que no ejecutan JS. Prioriza mover este contenido a HTML renderizado en el servidor.
llms.txt es un estándar emergente que señala a los rastreadores de IA qué páginas son autoritativas y contienen el contenido más valioso. Colócalo en la raíz de tu sitio (/llms.txt).
Usa un verificador de redirecciones para rastrear la cadena completa de tus URLs más importantes. Cualquier cadena de más de dos saltos debe colapsarse en una redirección directa única.
Ejecuta un rastreo completo y marca cualquier página que devuelva un código de estado no-200 o que devuelva 200 pero entregue ningún contenido significativo. Los soft 404 son especialmente costosos.
No asumas que permitir GPTBot es suficiente. Cada motor de IA tiene su propio bot con su propio user-agent. Prueba GPTBot, ClaudeBot, PerplexityBot, Google-Extended y Applebot-Extended individualmente.
La crawlabilidad GEO no es una propiedad estática — cambia cuando actualizas robots.txt, despliegas nuevos cambios de framework o añades un CDN o WAF. Ejecuta una verificación después de cada despliegue técnico importante.
Definiciones en lenguaje claro de cada término técnico relacionado con la accesibilidad de motores de IA.
Sitios y escenarios donde los fallos de crawlabilidad de IA son más probables y costosos.
Las aplicaciones de página única que dependen del renderizado JavaScript del lado del cliente tienen el mayor riesgo de contenido invisible para los rastreadores de IA. Cualquier página donde el contenido se carga a través de llamadas API necesita revisión SSR.
Los grandes sitios corporativos a menudo tienen archivos robots.txt mantenidos por múltiples equipos durante años, resultando en reglas contradictorias y bloqueos involuntarios.
Los editores que quieren controlar si su contenido se usa para el entrenamiento de IA necesitan saber exactamente qué bots los rastrean. El verificador muestra el estado de acceso actual para cada bot de IA importante.
Las páginas de detalle de productos que cargan precios, disponibilidad y descripciones a través de JavaScript son comunes en e-commerce. Si esos elementos son invisibles para los rastreadores de IA, los productos no pueden aparecer en respuestas de compras de IA.
Las agencias que lanzan o migran sitios de clientes necesitan verificar la crawlabilidad GEO como parte del QA previo al lanzamiento. Un verificador detecta problemas de acceso antes de que degraden silenciosamente la visibilidad de IA.
Las organizaciones que crean nuevos sitios tienen la oportunidad de establecer su política de acceso IA desde el primer día: qué bots permitir, si publicar un llms.txt, y cómo estructurar el contenido.