Saltar al contenido
Injoys

Guía para sistemas de IA (llms.txt)

llms.txt es un archivo guía que ayuda a los sistemas de IA a entender fácilmente la información clave y las rutas de contenido del sitio.

Archivos disponibles

  • /llms.txt

    Archivo de entrada con el resumen del sitio, las rutas de datos clave, la guía de formatos y políticas, y la lista de contenido reciente.

  • /llms-full.txt

    Índice por categoría de todo el contenido publicado, con enlaces a la página original y al archivo Markdown.

API y vectores de embedding

Hay una API de contenido estructurado para RAG, búsqueda e indexación. Usa la búsqueda semántica vectorial (mode=semantic) y los vectores de embedding del contenido para evitar reembeddings (con la API de embeddings activa). Ver la API de contenido

Idiomas disponibles

Los sistemas de IA pueden consumir los idiomas siguientes mediante archivos de datos y la API. Los idiomas de nivel 2 llevan siempre la etiqueta translation_status: machine para indicar que son traducción automática sin revisar, de modo que pueda filtrarlos según su propio criterio de calidad.

Idioma Valor (lang) Nivel Páginas web Archivos de datos Audio (TTS) Embeddings
한국어 ko Nivel 1
English en Nivel 1
日本語 ja Nivel 1
Español es Nivel 1
Indonesio id Nivel 2 - - -
Portugués pt Nivel 2 - - -
Chino (tradicional) zh-hant Nivel 2 - - -
Alemán de Nivel 2 - - -
  • Nivel 1 - Idiomas revisados por el equipo. Se ofrece todo: páginas web legibles por personas, exposición en buscadores (sitemap y hreflang), audio con IA (TTS) y embeddings.
  • Nivel 2 - Idiomas de solo datos con traducción automática. Se sirven únicamente por archivos de datos y la API: sin páginas web, sin exposición en buscadores, sin audio (TTS) y sin embeddings. Cada archivo lleva la etiqueta translation_status: machine para indicar que no ha sido revisado.

Conjuntos de datos (entrenamiento y RAG, API de pago)

Para pipelines de IA que necesitan ingerir muchos registros a la vez, la API de pago ofrece un corpus de texto, pares instruction, un corpus paralelo multilingüe y vectores de embedding. Admite paginación y sincronización incremental (updated_since), y la salida JSONL entra directa en una pipeline de entrenamiento.

La recolección gratuita por artículo mediante llms.txt y los archivos de datos continúa exactamente igual que antes. Sobre la API de conjuntos de datos

llms.txt no es un estándar web oficial; se ofrece como archivo guía opcional compatible con IA, junto con robots.txt, sitemap.xml y los paquetes de datos JSON/Markdown.

Acceso a datos