Guía para sistemas de IA (llms.txt)
llms.txt es un archivo guía que ayuda a los sistemas de IA a entender fácilmente la información clave y las rutas de contenido del sitio.
Archivos disponibles
-
/llms.txt
Archivo de entrada con el resumen del sitio, las rutas de datos clave, la guía de formatos y políticas, y la lista de contenido reciente.
-
/llms-full.txt
Índice por categoría de todo el contenido publicado, con enlaces a la página original y al archivo Markdown.
API y vectores de embedding
Hay una API de contenido estructurado para RAG, búsqueda e indexación. Usa la búsqueda semántica vectorial (mode=semantic) y los vectores de embedding del contenido para evitar reembeddings (con la API de embeddings activa). Ver la API de contenido
Idiomas disponibles
Los sistemas de IA pueden consumir los idiomas siguientes mediante archivos de datos y la API. Los idiomas de nivel 2 llevan siempre la etiqueta translation_status: machine para indicar que son traducción automática sin revisar, de modo que pueda filtrarlos según su propio criterio de calidad.
| Idioma | Valor (lang) | Nivel | Páginas web | Archivos de datos | Audio (TTS) | Embeddings |
|---|---|---|---|---|---|---|
| 한국어 | ko | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| English | en | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| 日本語 | ja | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| Español | es | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| Indonesio | id | Nivel 2 | - | ✓ | - | - |
| Portugués | pt | Nivel 2 | - | ✓ | - | - |
| Chino (tradicional) | zh-hant | Nivel 2 | - | ✓ | - | - |
| Alemán | de | Nivel 2 | - | ✓ | - | - |
- Nivel 1 - Idiomas revisados por el equipo. Se ofrece todo: páginas web legibles por personas, exposición en buscadores (sitemap y hreflang), audio con IA (TTS) y embeddings.
- Nivel 2 - Idiomas de solo datos con traducción automática. Se sirven únicamente por archivos de datos y la API: sin páginas web, sin exposición en buscadores, sin audio (TTS) y sin embeddings. Cada archivo lleva la etiqueta translation_status: machine para indicar que no ha sido revisado.
Conjuntos de datos (entrenamiento y RAG, API de pago)
Para pipelines de IA que necesitan ingerir muchos registros a la vez, la API de pago ofrece un corpus de texto, pares instruction, un corpus paralelo multilingüe y vectores de embedding. Admite paginación y sincronización incremental (updated_since), y la salida JSONL entra directa en una pipeline de entrenamiento.
La recolección gratuita por artículo mediante llms.txt y los archivos de datos continúa exactamente igual que antes. Sobre la API de conjuntos de datos
llms.txt no es un estándar web oficial; se ofrece como archivo guía opcional compatible con IA, junto con robots.txt, sitemap.xml y los paquetes de datos JSON/Markdown.