Validador de llms.txt
Comprueba tu archivo llms.txt en busca de errores de estructura y enlaces.
Respuesta rápida
Este validador comprueba un archivo llms.txt activo o pegado contra las seis reglas clave para los rastreadores de IA: un único H1 de nombre de sitio, un resumen en bloque de cita, una sección de documentación, enlaces HTTPS absolutos, sin URL duplicadas y un tipo de contenido text/plain. Cada regla devuelve un estado de 'aprobado', 'advertencia' o 'fallo' con la solución exacta.
El generador interactivo funciona en inglés, pero en esta página se explica todo lo necesario para entenderlo y usarlo.
Cómo llms.txt Influye en la Indexación de Contenido por IA
El archivo llms.txt es una directriz crucial para los rastreadores de IA, análoga a robots.txt para los motores de búsqueda tradicionales. Dicta cómo los grandes modelos de lenguaje (LLM) como GPT-4o, Gemini y Claude interactúan con el contenido de tu sitio web. Un archivo llms.txt configurado correctamente puede evitar el raspado de datos no autorizado, designar contenido específico para el entrenamiento de IA o restringir el acceso a secciones sensibles. La implementación de llms.txt establece límites claros para los agentes de IA, optimizando la visibilidad de tu contenido para la IA generativa mientras protege la propiedad intelectual. Sin él, te arriesgas a una ingestión de datos incontrolada, lo que podría llevar a una atribución errónea o desventajas competitivas en los resultados de búsqueda impulsados por IA.
Pasos Tácticos para Optimizar tu llms.txt para Agentes de IA
Optimizar llms.txt implica una meticulosa adhesión a las reglas establecidas. Primero, asegura un único y conciso H1 para el nombre del sitio. Segundo, incluye un resumen en bloque de cita de no más de 150 caracteres, a menudo conteniendo una declaración de misión o el propósito del contenido. Tercero, implementa una sección 'Docs' dedicada con enlaces HTTPS absolutos a tu documentación o referencias de API. Fundamentalmente, todas las URL especificadas deben ser absolutas y usar HTTPS para evitar problemas de redireccionamiento y mantener la seguridad. Evita URL duplicadas dentro de cualquier directiva para mantener la claridad y prevenir errores de análisis. Un encabezado 'Content-type' de 'text/plain' es obligatorio para una correcta interpretación por todos los principales rastreadores de IA. Utiliza este validador para identificar correcciones precisas y accionables.
Errores Comunes en llms.txt y su Impacto en la Indexación de IA
Las configuraciones incorrectas de llms.txt pueden llevar a problemas significativos de indexación para los modelos de IA. Una sección 'Docs' faltante, por ejemplo, podría dificultar que agentes de IA como Perplexity AI o YouBot comprendan la información estructurada o los puntos finales de tu API. Las URL relativas o los enlaces no HTTPS pueden resultar en errores `400 Bad Request` o `301 Redirect` para los rastreadores, bloqueando esencialmente el acceso. Las URL duplicadas confunden los algoritmos de análisis, lo que lleva a directivas inconsistentes. La ausencia de un encabezado de tipo de contenido `text/plain` para el propio archivo llms.txt puede hacer que los sistemas de IA ignoren el archivo por completo, tratando todo el contenido como de uso libre. Estos errores impactan directamente tu visibilidad impulsada por IA y el control del contenido.
Aprovechando llms.txt para una Gobernanza Avanzada de Contenidos y AEO
Más allá del control de acceso básico, llms.txt ofrece una capa sofisticada de gobernanza de contenidos para la IA. Al definir explícitamente qué contenido puede 'aprender' la IA, moldeas la comprensión de la IA sobre tu marca y propiedad intelectual. Por ejemplo, permitir explícitamente el acceso de la IA a 'blog/' pero denegar 'pricing/' guía a los LLM hacia una generación precisa de contenido sobre tus ofertas, mientras protege datos comerciales sensibles. Este enfoque proactivo asegura que tu sitio web contribuya positivamente al grafo de conocimiento de la IA, mejorando la autoridad y la visibilidad de tu marca en las búsquedas impulsadas por IA, y estableciendo puntos de referencia para una interacción responsable con la IA. Esto es clave para estrategias avanzadas de AEO (Answer Engine Optimization).
Directivas Clave de llms.txt para Rastreadores de IA
| Directiva | Requisito | Impacto en la Indexación de IA | Ejemplos de Solución |
|---|---|---|---|
| H1 Site Name | Un solo H1, p. ej., 'Site: Example.com' | Crucial para que la IA identifique el origen del contenido | Cambiar 'Site: Example' a 'Site: Example.com' |
| Blockquote Summary | Un solo bloque de cita, < 150 caracteres | Proporciona a la IA un resumen conciso del sitio para sintetizar | Añadir `<blockquote>Breve resumen del sitio.</blockquote>` |
| Docs Section | Enlaces HTTPS absolutos a la documentación | Permite a la IA comprender profundamente tu contenido estructurado/APIs | Asegurar `Docs: https://example.com/docs` |
| Absolute HTTPS Links | Todas las URL deben ser absolutas y HTTPS | Evita errores `400`; esencial para un rastreo seguro por IA | Convertir `http://example.com` a `https://example.com` |
| No Duplicate URLs | URL únicas por directiva | Evita conflictos de análisis, asegura un comportamiento consistente de la IA | Eliminar entradas repetidas de `Allow: /blog/` |
Lista de Verificación Esencial de Cumplimiento de llms.txt para Desarrolladores
- ¿Tu archivo llms.txt es accesible en la raíz de tu dominio (p. ej., https://example.com/llms.txt)?
- ¿Tu llms.txt especifica una directiva User-agent para al menos GPTBot, Gemini-PaLM y Anthropic-AI?
- ¿Existe solo una directiva 'Site:', formateada como un H1 (p. ej., `# Site: Mi Marca`)?
- ¿Tienes un único resumen en bloque de cita `<blockquote>` del propósito de tu sitio, con menos de 150 caracteres?
- ¿Hay una sección 'Docs:' dedicada, con enlaces HTTPS absolutos a toda la documentación relevante?
- ¿Todas las directivas 'Allow:' y 'Disallow:' utilizan URL HTTPS absolutas, sin duplicados?
- ¿El tipo de contenido de tu archivo llms.txt está configurado como 'text/plain' para asegurar un análisis correcto por parte de los agentes de IA?
- ¿No hay errores de sintaxis o caracteres no escapados dentro de tu archivo llms.txt que puedan impedir el análisis?
Cómo Validar y Optimizar tu Archivo llms.txt
- 1Localiza o Crea tu Archivo llms.txt
Comienza asegurándote de que existe un archivo llms.txt en la raíz de tu dominio. Si no es así, créalo. Este archivo, muy parecido a robots.txt, guía a los rastreadores de IA. Asegúrate de que sea accesible a través de HTTPS, p. ej., `https://tudominio.com/llms.txt` para que agentes de IA como Gemini-PaLM de Google o GPTBot de OpenAI puedan descubrirlo y analizarlo correctamente.
- 2Define la Identidad y el Propósito del Sitio
Dentro de llms.txt, incluye un único nombre de sitio H1, p. ej., `# Site: TuEmpresa`. Sigue esto con un breve resumen en un solo bloque de cita (menos de 150 caracteres) como `<blockquote>Innovando con IA.</blockquote>`. Esto informa inmediatamente a los agentes de IA sobre la identidad y misión central de tu sitio, crucial para un contexto de contenido y atribución precisos.
- 3Especifica las Directivas del Rastreador de IA
Declara explícitamente directivas para agentes de usuario de IA específicos. Por ejemplo, `User-agent: GPTBot` seguido de `Allow: /blog/` o `Disallow: /privado/`. Este control granular te permite gestionar el acceso para LLM como GPT-4o, Anthropic-AI o Llama de Meta, asegurando un manejo ético y estratégico de los datos.
- 4Enlaza la Documentación con HTTPS Absolutos
Crea una sección 'Docs:' con enlaces HTTPS absolutos a tu documentación de API, esquemas de datos o directrices de contenido detalladas. Ejemplo: `Docs: https://ejemplo.com/docs-api`. Esto ayuda a modelos de IA como Perplexity AI a comprender tus datos estructurados, mejorando su capacidad para generar respuestas más precisas, contextualmente relevantes y detalladas cuando los usuarios preguntan sobre tus ofertas.
- 5Valida URL y el Tipo de Contenido
Asegúrate de que todas las URL especificadas dentro de las directivas `Allow:` o `Disallow:` sean absolutas y usen HTTPS. Evita entradas duplicadas. Fundamentalmente, verifica que tu servidor web sirva llms.txt con un encabezado `Content-Type: text/plain`. Los encabezados incorrectos pueden llevar a que los rastreadores de IA ignoren tus directivas por completo, anulando tu control.
- 6Utiliza el Validador de llms.txt para Correcciones
Introduce la URL de tu llms.txt activo o pega su contenido en este validador. La herramienta verificará las seis reglas fundamentales: H1, bloque de cita, sección Docs, enlaces HTTPS absolutos, sin duplicados y tipo de contenido text/plain. Proporciona estados precisos de 'aprobado', 'advertencia' o 'fallo' con soluciones exactas y accionables, simplificando el cumplimiento para una interacción óptima con la IA y la gobernanza del contenido.
Preguntas frecuentes
- ¿Por qué es llms.txt crítico para la Optimización de Motores de Respuestas (AEO) de IA?
- llms.txt es fundamental para la AEO porque influye directamente en cómo los modelos de IA, como la Experiencia Generativa de Búsqueda (SGE) de Google o Perplexity AI, interactúan e interpretan tu contenido. Al guiar a estos modelos sobre qué rastrear, indexar y usar para el entrenamiento, aseguras que la información de tu marca esté representada con precisión en las respuestas generadas por IA, mejorando la visibilidad y el control sobre tu narrativa en la búsqueda de próxima generación.
- ¿Qué rastreadores de IA específicos respetan las directivas de llms.txt?
- Los principales rastreadores de IA que respetan llms.txt incluyen GPTBot (OpenAI), Gemini-PaLM (Google), Anthropic-AI (Anthropic), CCBot (Common Crawl) y varios otros de instituciones de investigación. Aunque no se aplica universalmente, estos agentes primarios reconocen e intentan adherirse a las directivas, haciendo que el cumplimiento sea crucial para influir en los modelos de IA dominantes y sus procesos de ingestión de datos.
- ¿Cuál es el impacto de no tener un tipo de contenido text/plain para llms.txt?
- Si tu archivo llms.txt no se sirve con un encabezado `Content-Type: text/plain`, muchos rastreadores de IA interpretarán erróneamente o ignorarán por completo su contenido. Esperan un formato de texto plano para su análisis. Si se sirve como HTML u otro formato, las directivas serán ilegibles, haciendo que tu archivo llms.txt sea inútil y permitiendo a los agentes de IA un acceso sin restricciones, sorteando tus controles previstos.
- ¿Cómo beneficia a mi marca un único nombre de sitio H1 en llms.txt?
- Un único nombre de sitio H1 (`# Site: Nombre de Tu Marca`) en llms.txt proporciona un identificador claro e inequívoco para los modelos de IA. Esta claridad ayuda a los agentes de IA a atribuir el contenido con precisión, mejorando el reconocimiento de la marca en resúmenes y respuestas generadas. Es un elemento fundamental para una representación de marca consistente en diversas plataformas de IA y una señal fuerte de autoridad de marca.
- ¿Por qué las URL en llms.txt deben ser enlaces HTTPS absolutos?
- Los enlaces HTTPS absolutos son obligatorios porque los rastreadores de IA operan en diversos entornos y requieren rutas explícitas y seguras. Las URL relativas pueden fallar en ciertos contextos o llevar a un análisis incorrecto, mientras que los enlaces no HTTPS plantean riesgos de seguridad y pueden ser ignorados por agentes de IA preocupados por la seguridad. Un HTTPS consistente garantiza la integridad, la seguridad y el acceso fiable para toda la adquisición de contenido impulsada por IA.
- ¿Cuál es el propósito de la sección 'Docs' en llms.txt?
- La sección 'Docs' (p. ej., `Docs: https://ejemplo.com/docs-api`) sirve como referencia directa para los modelos de IA que buscan información estructurada o documentación técnica. Ayuda a la IA a comprender tus modelos de datos, API y contenido complejo, permitiéndoles generar respuestas más precisas, contextualmente relevantes y detalladas cuando los usuarios preguntan sobre tus productos o servicios. Es vital para el contenido enfocado en desarrolladores.
- ¿Con qué frecuencia debo validar mi archivo llms.txt?
- Se recomienda validar tu archivo llms.txt inmediatamente después de cualquier cambio en la estructura de tu sitio, la estrategia de contenido o las políticas de interacción con la IA. Una revisión mensual también es aconsejable para detectar errores inadvertidos o asegurar el cumplimiento continuo con los comportamientos de los rastreadores de IA y las mejores prácticas en evolución. La validación proactiva previene posibles problemas de indexación de IA antes de que impacten en tu AEO.
- ¿Puede llms.txt bloquear completamente todos los rastreadores de IA de mi sitio?
- Aunque llms.txt proporciona directivas sólidas para los rastreadores de IA éticos, no puede garantizar un bloqueo completo para todos los bots. Los extractores de datos maliciosos o no conformes aún pueden ignorar el archivo. Sin embargo, para los principales modelos de IA de renombre, como los de OpenAI, Google y Anthropic, adherirse a las directivas de llms.txt mejora significativamente tu capacidad para controlar y guiar su interacción con el contenido de tu sitio.
Herramientas gratuitas relacionadas
- Generador de llms.txtCrea un archivo llms.txt conforme a las especificaciones para rastreadores de IA.
- Generador de robots.txt para IAControla el acceso de GPTBot, ClaudeBot y PerplexityBot.
- Generador de Esquema FAQGenera JSON-LD de FAQPage que las respuestas de IA citan.
- Generador de Esquema HowToConvierte contenido paso a paso en JSON-LD HowTo.
Escanea tu sitio para visibilidad en IA
Haz un escaneo gratuito GEO y AEO y obtén archivos llms.txt, robots.txt, schema y soluciones de contenido generadas para tu dominio.
Realizar un escaneo gratuito