Datos
Rutas de acceso en formatos amigables para máquinas, para sistemas de IA, buscadores, desarrolladores e investigadores.
Injoys es una plataforma de datos de contenido. Cada artículo publicado es un paquete de datos, y puede obtenerlo en el formato que necesite mediante las rutas siguientes.
Provisión de datos
Rutas de acceso por formato
| Formato | Ruta | Uso |
|---|---|---|
| HTML | /{lang}/articles/{slug} | Página de artículo legible para personas |
| TXT | /data/{content-id}/{lang}/content.txt | Texto plano para entrenamiento/recolección de IA |
| Markdown | /data/{content-id}/{lang}/content.md | Markdown amigable para LLM con front matter |
| JSON | /data/{content-id}/{lang}/content.json | Datos de contenido estructurados (cuerpo, resumen, FAQ, imágenes, etiquetas) |
| JSON-LD | /data/{content-id}/{lang}/schema.jsonld | Datos estructurados de schema.org |
| Images | /data/{content-id}/images.json | Metadatos de imágenes (alt, leyenda, licencia, origen de generación) |
| RSS | /feed/rss, /feed/rss-{lang} | Feed de actualizaciones (general / por idioma) |
| Atom | /feed/atom | Feed alternativo Atom |
| Sitemap | /sitemap.xml | Descubrimiento de URL con hreflang |
| llms.txt | /llms.txt, /llms-full.txt | Archivo guía para IA e índice de todo el contenido |
Idiomas
Los artículos se ofrecen en coreano e inglés de forma predeterminada, más japonés y español. Use ko, en, ja o es en {lang}; solo los idiomas con traducción real aparecen en el hreflang del sitemap. Además, indonesio (id), portugués (pt), chino tradicional (zh-hant) y alemán (de) están disponibles solo como archivos de datos con traducción automática, etiquetados translation_status: machine, y quedan excluidos de las páginas HTML y del sitemap hasta su revisión.
| Idioma | Valor (lang) | Nivel | Páginas web | Archivos de datos | Audio (TTS) | Embeddings |
|---|---|---|---|---|---|---|
| 한국어 | ko | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| English | en | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| 日本語 | ja | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| Español | es | Nivel 1 | ✓ | ✓ | ✓ | ✓ |
| Indonesio | id | Nivel 2 | - | ✓ | - | - |
| Portugués | pt | Nivel 2 | - | ✓ | - | - |
| Chino (tradicional) | zh-hant | Nivel 2 | - | ✓ | - | - |
| Alemán | de | Nivel 2 | - | ✓ | - | - |
- Nivel 1 - Idiomas revisados por el equipo. Se ofrece todo: páginas web legibles por personas, exposición en buscadores (sitemap y hreflang), audio con IA (TTS) y embeddings.
- Nivel 2 - Idiomas de solo datos con traducción automática. Se sirven únicamente por archivos de datos y la API: sin páginas web, sin exposición en buscadores, sin audio (TTS) y sin embeddings. Cada archivo lleva la etiqueta translation_status: machine para indicar que no ha sido revisado.
Uso de datos
No se requiere clave de API ni autenticación para usar el contenido público. Simplemente obtenga los archivos que necesite desde las rutas anteriores.
Política de rastreadores
Los buscadores y rastreadores de IA (GPTBot, OAI-SearchBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot y otros) están permitidos en robots.txt. Personas y máquinas reciben el mismo contenido - sin cloaking.
API estructurada y embeddings
Para consultas en tiempo real, filtros y búsqueda, usa la API de contenido. La búsqueda semántica y los vectores de embedding también están disponibles vía API (con la API de embeddings activa). Ver la API de contenido
Conjuntos de datos (entrenamiento y RAG, API de pago)
Para los casos que necesitan muchos registros a la vez - entrenamiento de modelos, fine-tuning, indexación RAG - la API de pago sirve el mismo contenido normalizado en esquemas listos para entrenar. Admite paginación (page, per_page), filtros (category, tag) y sincronización incremental (updated_since), y puede devolver JSONL.
- corpus - Corpus con cuerpo, resumen, puntos clave, etiquetas, licencia y estado de traducción
- qa - Datos instruction que expanden las FAQ en pares de mensajes user/assistant
- parallel - Corpus paralelo que alinea un artículo entre idiomas en un solo registro
- embeddings - Vectores de embedding incluidos por artículo (solo Pro)
La API de conjuntos de datos no sustituye el acceso gratuito a los datos. Las rutas por artículo de la tabla de arriba siguen siendo gratuitas y sin autenticación tal como están hoy. Sobre la API de conjuntos de datos
Cada archivo de datos ofrece el mismo contenido que su página HTML legible (principio de coherencia del contenido).
Política de reutilización / entrenamiento de IA: Licencia