Para que ChatGPT, Claude, Perplexity y Gemini entiendan de qué trata tu sitio, y para decidir qué bots de IA pueden entrar.
Es lo primero que lee el modelo. Di qué haces y para quién, sin adjetivos de más.
Lista solo lo que de verdad quieres que un modelo cite. Menos y mejor descrito funciona mucho mejor que un listado de todo tu sitio.
Esto genera reglas para tu robots.txt. Es una decisión de negocio: si vives de las visitas, bloquea; si quieres que te recomienden, deja pasar.
Ojo: estas reglas se agregan a tu robots.txt, no lo reemplazan. Si ya tienes uno, pega estas líneas al final y conserva lo que ya estaba. Si no tienes, arma el resto con el generador de robots.txt.
llms.txt en la raíz, accesible en tudominio.com/llms.txtrobots.txt también en la raízpublic_htmlQué es llms.txt, qué no es, y qué sí mueve la aguja para que te citen.
El llms.txt es un archivo de texto en la raíz de tu sitio, escrito en Markdown, que resume de qué trata tu negocio y enumera tus páginas más importantes con una descripción breve de cada una. La propuesta la hizo Jeremy Howard en septiembre de 2024 y la especificación vive en llmstxt.org.
La lógica es simple: cuando un modelo de lenguaje llega a tu sitio, tiene que deducir de qué trata a partir de HTML lleno de menús, banners y avisos de cookies. El llms.txt le entrega una versión curada por ti, en el orden que tú decides.
No sustituye a nada. Convive con tu sitemap, con tu robots.txt y con tus datos estructurados.
No es un factor de posicionamiento. Google ha señalado que su buscador no usa este archivo, y la adopción entre los grandes proveedores todavía es despareja. Cualquiera que te lo venda como la clave para aparecer en las respuestas de IA está exagerando.
Lo que sí es: un archivo barato de publicar que le da una versión limpia de tu contenido a los agentes que sí lo leen. Con eso basta para justificarlo, sin inventarle poderes.
Lo que de verdad mueve la visibilidad en buscadores con IA es más aburrido y más eficaz: contenido que responde preguntas concretas con datos verificables, datos estructurados correctos, que otros sitios te citen, y una estructura de encabezados que permita extraer un párrafo autocontenido como respuesta.
La distinción clave es entre los rastreadores que recolectan datos para entrenar modelos y los que alimentan respuestas de búsqueda en el momento. Bloquear los primeros protege tu contenido; bloquear los segundos te saca de las respuestas donde podrían recomendarte.
| Bot | De quién | Para qué |
|---|---|---|
| GPTBot | OpenAI | Entrenamiento |
| OAI-SearchBot | OpenAI | Búsqueda en ChatGPT |
| ChatGPT-User | OpenAI | Visita cuando un usuario lo pide |
| ClaudeBot | Anthropic | Entrenamiento |
| Claude-User | Anthropic | Visita a petición del usuario |
| Google-Extended | Entrenamiento de Gemini | |
| PerplexityBot | Perplexity | Búsqueda y citas |
| Applebot-Extended | Apple | Entrenamiento |
| CCBot | Common Crawl | Archivo público usado para entrenar |
| meta-externalagent | Meta | Entrenamiento |
Importante: bloquear Google-Extended no afecta tu posición en el buscador de Google. Es una señal separada, dedicada solo al entrenamiento de Gemini.
El robots.txt es de permisos: dice qué se puede rastrear. El llms.txt es de orientación: dice qué vale la pena leer de lo permitido. Son complementarios.
No es un factor de posicionamiento y Google no lo usa en su buscador. Sí le da una versión curada de tu contenido a los agentes que lo leen, y publicarlo cuesta muy poco. Con eso alcanza para justificarlo, sin exagerar.
Si vives de que la gente entre a leer tu contenido, bloquear los de entrenamiento tiene sentido. Si vendes productos o servicios, que te recomienden es tráfico gratis. La postura equilibrada es bloquear entrenamiento y permitir búsqueda.
No. Es una señal separada que solo controla el uso de tu contenido para entrenar Gemini. Tu posición en el buscador no cambia.
El llms.txt y el robots.txt van en la raíz de tu dominio. En NEUBOX tenemos planes con acceso completo a tus archivos.