llms.txt: qué es, para qué sirve y por qué no hará que la IA te cite
«Nos han dicho que con un llms.txt apareceremos en ChatGPT.»
Señales que lo confirman
Un llms.txt es un archivo de texto en la raíz de la web que resume qué es el sitio y enlaza a sus páginas más importantes, en un formato pensado para que lo lea un modelo de lenguaje. No es un estándar ni un interruptor: publicarlo no hace que ChatGPT, Gemini o Google empiecen a citar tu marca.
Qué es un llms.txt
Es una propuesta de Jeremy Howard, de Answer.AI, publicada en septiembre de 2024 en llmstxt.org. El archivo va en /llms.txt, está escrito en Markdown y tiene tres partes: el nombre del sitio, un resumen corto y listas de enlaces a las páginas clave, cada una con una línea de descripción. Se confunde a menudo con otros dos archivos que hacen cosas distintas.
| Archivo | Para qué sirve | Quién lo usa |
|---|---|---|
| robots.txt | Indicar a los rastreadores qué pueden rastrear y qué no | Buscadores y rastreadores de IA, de forma generalizada |
| sitemap.xml | Listar las URLs que se quieren indexar | Buscadores |
| llms.txt | Resumir el sitio y señalar sus páginas clave en un formato fácil de leer para un modelo | Sobre todo herramientas para desarrolladores que consultan documentación. Google ha dicho que su buscador no lo usa |
Qué ha dicho Google
Que sus sistemas de búsqueda no lo usan. John Mueller lo ha comparado con la antigua etiqueta meta keywords, y la guía de optimización para IA que Google publicó en mayo de 2026 lo incluye entre lo que se puede ignorar: sus respuestas de IA salen del mismo índice que la búsqueda de siempre, así que el archivo no cambia lo que aparece en ellas.
A la vez, Chrome ha añadido a Lighthouse una categoría de auditoría para agentes de navegación que sí comprueba el llms.txt. No es una contradicción: una cosa es que un buscador descubra y elija tu contenido, y otra que un agente que ya está dentro de la web la entienda rápido. El archivo puede ayudar a lo segundo; no hay evidencia de que ayude a lo primero.
Sobre el resto de motores: a fecha de octubre de 2026 no me consta que ninguno de los grandes haya confirmado que usa el llms.txt para decidir a quién cita.
Qué suele haber debajo
Cuando una marca no aparece en las respuestas de IA, la causa casi nunca es que falte este archivo. Suele ser una de estas:
- Los rastreadores de IA no pueden entrar. El robots.txt o el cortafuegos bloquean a OAI-SearchBot, PerplexityBot o ClaudeBot, a veces sin que nadie lo haya decidido.
- El contenido depende de JavaScript. Lo que solo aparece al ejecutar scripts puede no llegar a un rastreador que lee el HTML tal como lo sirve el servidor.
- La marca no existe fuera de su web. Los motores se apoyan en fuentes que pueden contrastar: medios, directorios del sector, comparativas, reseñas.
- No hay nada que citar. Páginas con adjetivos y sin afirmaciones concretas, datos ni autoría.
Lo primero que miro
Si alguien ha medido algo. Sin una batería de preguntas hecha antes de publicar el archivo, no se puede saber si ha servido. Después reviso el robots.txt y los registros del servidor para ver qué rastreadores de IA entran y a cuáles se les cierra la puerta. Un matiz frecuente: bloquear Google-Extended impide el uso del contenido para entrenar los modelos de Google, pero no saca la web de sus respuestas de IA en el buscador.
Entonces, ¿lo pongo?
Sí, si no te quita tiempo de lo importante. Es barato, no perjudica y tiene sentido sobre todo en webs con documentación. Tres condiciones: que responda bien y en texto plano, que sea corto y que alguien lo mantenga al día cuando cambien las páginas. Esta web tiene el suyo en javibenito.com/llms.txt, y no lo cuento como la razón de nada.
Qué cambia cuando se arregla
El llms.txt deja de ser la táctica estrella y pasa a ser un detalle de mantenimiento. El trabajo se va a donde sí hay efecto: que los rastreadores entren, que la marca se entienda igual en todas partes, que el contenido tenga algo citable y que otras fuentes hablen de ti. Es lo que reviso en una auditoría GEO.