Qué es el llms.txt

Posicionamiento web agéntica · Guía

Qué es el llms.txt

25 de agosto de 2026

El posicionamiento web entra en una etapa nueva con el auge de los LLMs generativos, tras décadas de un SEO ya muy especializado. El llms.txt es un ejemplo directo de esa etapa: una propuesta de 2024 para declarar qué contenido de un sitio merece la pena leer y citar un LLM. Este artículo explica su origen, cómo se diferencia del robots.txt, qué dice la adopción real hasta ahora y cómo lo implementa este mismo sitio.

Una nueva etapa en el posicionamiento web

El SEO (Search Engine Optimization) lleva más de dos décadas afinándose: desde los años 90, buscadores como Google fueron publicando —y los profesionales del sector, descifrando— señales cada vez más precisas para determinar qué página merece aparecer primero en una lista de resultados. Enlaces entrantes, velocidad de carga, datos estructurados, experiencia de usuario… el terreno ya está muy recorrido, con reglas razonablemente estables y herramientas maduras para medirlas.

Con el auge de los LLMs generativos —sistemas que no devuelven una lista de enlaces, sino una respuesta sintetizada, citando o no las fuentes que la sostienen— ese terreno tan recorrido volvió a abrirse. No es que el SEO deje de valer: sigue siendo la base de la indexación y de la visibilidad en buscadores clásicos. Es que apareció un espacio nuevo, donde todavía no hay reglas asentadas ni herramientas maduras equivalentes —el GEO— y donde todos los actores, desde los sitios web hasta los propios proveedores de LLMs, están todavía probando qué señales importan de verdad.

El llms.txt es un ejemplo directo de esa etapa inicial: una propuesta concreta, no un estándar consolidado, que trata de resolver un problema real —cómo hacer que un sitio web declare qué contenido merece la pena leer— sin que todavía se sepa con certeza si los proveedores grandes lo van a adoptar de modo generalizado. Este artículo explica qué es, de dónde viene y qué dice la adopción real hasta ahora.

Qué es el llms.txt

llms.txt es un fichero de texto en formato markdown que se publica en la raíz de un sitio web (/llms.txt) para declarar explícitamente qué contenido está pensado para ser leído, fragmentado y citado por sistemas generativos basados en modelos de lenguaje —GPTBot (OpenAI), ClaudeBot (Anthropic), PerplexityBot y otros crawlers de IA. No tiene un organismo de estandarización formal único: es una convención propuesta, adoptada de modo creciente por sitios que practican GEO.

La definición corta sirve como respuesta autocontenida: el llms.txt es el fichero que declara, en la raíz de un sitio, qué contenido merece la pena que lea y cite un LLM, sin que el agente tenga que rastrear y deducirlo por su cuenta.

De dónde viene la propuesta

El llms.txt no es un estándar impuesto por un consorcio web ni por un proveedor de LLMs: lo propuso Jeremy Howard, cofundador de Answer.AI y de fast.ai, en septiembre de 2024, publicado en llmstxt.org. La motivación de partida era concreta: las ventanas de contexto de los LLMs son pequeñas en comparación con el volumen total de un sitio web, y las páginas HTML —con navegación, publicidad y JavaScript— son costosas de procesar para una máquina que solo necesita el contenido real. El formato propuesto es deliberadamente mínimo: un título H1, un párrafo resumen en cita, secciones H2 con enlaces a recursos, y una sección opcional para contenido secundario.

Analogía y diferencia con robots.txt

El nombre y la ubicación (en la raíz del dominio) evocan deliberadamente al clásico robots.txt, pero la función es distinta:

  • robots.txt declara permisos de rastreo: qué rutas puede o no puede visitar un crawler determinado. Es una lista de reglas de acceso.
  • llms.txt declara legibilidad y citabilidad: qué contenido existe, qué merece la pena leer y cómo está organizado para ser resumido o citado con precisión. No es una lista de reglas de acceso, es un índice orientado a máquinas.

Ambos ficheros pueden convivir en un mismo sitio sin conflicto: robots.txt sigue controlando qué puede rastrearse, y llms.txt muestra, dentro de lo permitido, qué es lo más relevante para citar.

La extensión llms-full.txt

Junto al llms.txt básico (un índice corto con enlaces y resúmenes) se extendió una segunda convención, llms-full.txt, que incluye el contenido completo del sitio embebido directamente en formato markdown. La diferencia práctica es el coste de consulta para el agente: con el llms.txt solo, un LLM tiene que hacer una petición HTTP adicional por cada página que quiera leer entera; con el llms-full.txt, todo el contenido llega en una única respuesta, sin round-trips adicionales.

Cuánto se adoptó de verdad

La adopción real del llms.txt se midió en varias ocasiones desde que se propuso. A mediados de 2025 ya había miles de sitios web con un llms.txt publicado, entre ellos empresas técnicas conocidas como Anthropic, Stripe, Cloudflare y Vercel; los sectores con más adopción son los que dependen más de la precisión técnica —inteligencia artificial, herramientas para desarrolladores, SaaS. Existen incluso directorios comunitarios que catalogan sitios con llms.txt implementado.

Pero la adopción del formato no es lo mismo que su lectura real por parte de los proveedores de LLMs. En junio de 2025, John Mueller (Google) declaró públicamente que ningún sistema de IA usa el llms.txt de modo confirmado, y que los registros de servidor muestran que los crawlers de IA no le hacen peticiones con volumen significativo. Ninguno de los grandes proveedores —OpenAI, Google, Anthropic— publicó documentación que confirme que lo consultan en tiempo de inferencia. Esto no invalida la práctica —un fichero declarativo barato, sin coste real de mantenimiento automatizado, sigue siendo razonable— pero sí matiza cualquier promesa de que exponer un llms.txt vaya, por sí mismo, a mejorar la citabilidad de un sitio de modo mensurable a corto plazo.

Caso real: implementación en Xiringase-web

Este mismo sitio implementa ambos ficheros en producción, generados automáticamente a partir del contenido real del sitio (no se mantienen a mano):

  • /llms.txt genera un listado resumido: los proyectos propios de Xiringase, los artículos del blog (con enlace y resumen corto) y las páginas indexables (manifiesto, soporte).
  • /llms-full.txt embebe el contenido completo en markdown: el cuerpo entero de cada artículo del blog, los reportajes de los proyectos y las secciones editoriales de la home, todo en un único fichero de texto plano.

Ambos se sirven solo en asturiano (la lengua canon del sitio); las traducciones a español, inglés y francés viven bajo /es, /en y /fr respectivamente, sin duplicarse en el llms.txt.

Relación con el GEO

El llms.txt es una de las prácticas concretas que definen el GEO: es literalmente uno de los “feeds pensados para máquinas” que se cita como pilar práctico en esa disciplina —ficheros que facilitan a un agente automático saber qué contenido existe en un sitio y dónde se encuentra, sin tener que rastrear toda la web para deducirlo.

Importa marcar el límite: el llms.txt no es la fuente de la citabilidad de un sitio, es solo una capa de índice encima de ella. Un sitio que tenga contenido bien estructurado —atómico, con datos estructurados, factualmente verificable— sigue siendo citable aunque no exponga un llms.txt. Y a la inversa, exponer un llms.txt sin contenido de calidad debajo no mejora la citabilidad real: solo facilita el descubrimiento de un contenido que, por sí mismo, tiene o no tiene valor para ser citado.

Fuentes