Posicionamiento web agéntica · Guía
Qué es el llms.txt
25 de agosto de 2026
El posicionamiento web entra en una etapa nueva con el auge de los LLMs generativos, tras décadas de un SEO ya muy especializado. El llms.txt es un ejemplo directo de esa etapa: una propuesta de 2024 para declarar qué contenido de un sitio merece la pena leer y citar un LLM. Este artículo explica su origen, cómo se diferencia del robots.txt, qué dice la adopción real hasta ahora y cómo lo implementa este mismo sitio.
Una nueva etapa en el posicionamiento web
El SEO (Search Engine Optimization) lleva más de dos décadas afinándose: desde los años 90, buscadores como Google fueron publicando —y los profesionales del sector, descifrando— señales cada vez más precisas para determinar qué página merece aparecer primero en una lista de resultados. Enlaces entrantes, velocidad de carga, datos estructurados, experiencia de usuario… el terreno ya está muy recorrido, con reglas razonablemente estables y herramientas maduras para medirlas.
Con el auge de los LLMs generativos —sistemas que no devuelven una lista de enlaces, sino una respuesta sintetizada, citando o no las fuentes que la sostienen— ese terreno tan recorrido volvió a abrirse. No es que el SEO deje de valer: sigue siendo la base de la indexación y de la visibilidad en buscadores clásicos. Es que apareció un espacio nuevo, donde todavía no hay reglas asentadas ni herramientas maduras equivalentes —el GEO— y donde todos los actores, desde los sitios web hasta los propios proveedores de LLMs, están todavía probando qué señales importan de verdad.
El llms.txt es un ejemplo directo de esa etapa inicial: una propuesta concreta, no un estándar consolidado, que trata de resolver un problema real —cómo hacer que un sitio web declare qué contenido merece la pena leer— sin que todavía se sepa con certeza si los proveedores grandes lo van a adoptar de modo generalizado. Este artículo explica qué es, de dónde viene y qué dice la adopción real hasta ahora.
Qué es el llms.txt
llms.txt es un fichero de texto en formato
markdown que se publica en la raíz de un
sitio web (/llms.txt) para declarar explícitamente qué contenido está
pensado para ser leído, fragmentado y citado por sistemas generativos
basados en modelos de lenguaje —GPTBot (OpenAI), ClaudeBot (Anthropic),
PerplexityBot y otros crawlers de IA. No tiene un organismo de
estandarización formal único: es una convención propuesta, adoptada
de modo creciente por sitios que practican GEO.
La definición corta sirve como respuesta autocontenida: el llms.txt es el fichero que declara, en la raíz de un sitio, qué contenido merece la pena que lea y cite un LLM, sin que el agente tenga que rastrear y deducirlo por su cuenta.
De dónde viene la propuesta
El llms.txt no es un estándar impuesto por un consorcio web ni por un
proveedor de LLMs: lo propuso Jeremy Howard, cofundador de Answer.AI
y de fast.ai, en septiembre de 2024, publicado en llmstxt.org. La
motivación de partida era concreta: las ventanas de contexto de los LLMs
son pequeñas en comparación con el volumen total de un sitio web, y las
páginas HTML —con navegación, publicidad y JavaScript— son costosas de
procesar para una máquina que solo necesita el contenido real. El
formato propuesto es deliberadamente mínimo: un título H1, un párrafo
resumen en cita, secciones H2 con enlaces a recursos, y una sección
opcional para contenido secundario.
Analogía y diferencia con robots.txt
El nombre y la ubicación (en la raíz del dominio) evocan deliberadamente
al clásico robots.txt, pero la función es distinta:
robots.txtdeclara permisos de rastreo: qué rutas puede o no puede visitar un crawler determinado. Es una lista de reglas de acceso.llms.txtdeclara legibilidad y citabilidad: qué contenido existe, qué merece la pena leer y cómo está organizado para ser resumido o citado con precisión. No es una lista de reglas de acceso, es un índice orientado a máquinas.
Ambos ficheros pueden convivir en un mismo sitio sin conflicto:
robots.txt sigue controlando qué puede rastrearse, y llms.txt
muestra, dentro de lo permitido, qué es lo más relevante para citar.
La extensión llms-full.txt
Junto al llms.txt básico (un índice corto con enlaces y resúmenes) se
extendió una segunda convención, llms-full.txt, que incluye el
contenido completo del sitio embebido directamente en formato markdown.
La diferencia práctica es el coste de consulta para el agente: con el
llms.txt solo, un LLM tiene que hacer una petición HTTP adicional por
cada página que quiera leer entera; con el llms-full.txt, todo el
contenido llega en una única respuesta, sin round-trips adicionales.
Cuánto se adoptó de verdad
La adopción real del llms.txt se midió en varias ocasiones desde que se propuso. A mediados de 2025 ya había miles de sitios web con un llms.txt publicado, entre ellos empresas técnicas conocidas como Anthropic, Stripe, Cloudflare y Vercel; los sectores con más adopción son los que dependen más de la precisión técnica —inteligencia artificial, herramientas para desarrolladores, SaaS. Existen incluso directorios comunitarios que catalogan sitios con llms.txt implementado.
Pero la adopción del formato no es lo mismo que su lectura real por parte de los proveedores de LLMs. En junio de 2025, John Mueller (Google) declaró públicamente que ningún sistema de IA usa el llms.txt de modo confirmado, y que los registros de servidor muestran que los crawlers de IA no le hacen peticiones con volumen significativo. Ninguno de los grandes proveedores —OpenAI, Google, Anthropic— publicó documentación que confirme que lo consultan en tiempo de inferencia. Esto no invalida la práctica —un fichero declarativo barato, sin coste real de mantenimiento automatizado, sigue siendo razonable— pero sí matiza cualquier promesa de que exponer un llms.txt vaya, por sí mismo, a mejorar la citabilidad de un sitio de modo mensurable a corto plazo.
Caso real: implementación en Xiringase-web
Este mismo sitio implementa ambos ficheros en producción, generados automáticamente a partir del contenido real del sitio (no se mantienen a mano):
/llms.txtgenera un listado resumido: los proyectos propios de Xiringase, los artículos del blog (con enlace y resumen corto) y las páginas indexables (manifiesto, soporte)./llms-full.txtembebe el contenido completo en markdown: el cuerpo entero de cada artículo del blog, los reportajes de los proyectos y las secciones editoriales de la home, todo en un único fichero de texto plano.
Ambos se sirven solo en asturiano (la lengua canon del sitio); las
traducciones a español, inglés y francés viven bajo /es, /en y /fr
respectivamente, sin duplicarse en el llms.txt.
Relación con el GEO
El llms.txt es una de las prácticas concretas que definen el
GEO: es literalmente uno de los “feeds pensados
para máquinas” que se cita como pilar práctico en esa disciplina
—ficheros que facilitan a un agente automático saber qué contenido
existe en un sitio y dónde se encuentra, sin tener que rastrear toda la
web para deducirlo.
Importa marcar el límite: el llms.txt no es la fuente de la
citabilidad de un sitio, es solo una capa de índice encima de ella. Un
sitio que tenga contenido bien estructurado —atómico, con datos
estructurados, factualmente verificable— sigue siendo citable aunque no
exponga un llms.txt. Y a la inversa, exponer un llms.txt sin
contenido de calidad debajo no mejora la citabilidad real: solo facilita
el descubrimiento de un contenido que, por sí mismo, tiene o no tiene
valor para ser citado.
Fuentes
- Howard, J. The /llms.txt file. Answer.AI, septiembre 2024. https://llmstxt.org
- Sherman, C. Meet llms.txt, a proposed standard for AI website content crawling. Search Engine Land, septiembre 2024. https://searchengineland.com/llms-txt-proposed-standard-453676
- Implementación real de este sitio: https://xiringase.com/llms.txt y https://xiringase.com/llms-full.txt.