Saltar al contenido
Injoys

Datos

Rutas de acceso en formatos amigables para máquinas, para sistemas de IA, buscadores, desarrolladores e investigadores.

Injoys es una plataforma de datos de contenido. Cada artículo publicado es un paquete de datos, y puede obtenerlo en el formato que necesite mediante las rutas siguientes.

Provisión de datos

Rutas de acceso por formato

Formato Ruta Uso
HTML /{lang}/articles/{slug} Página de artículo legible para personas
TXT /data/{content-id}/{lang}/content.txt Texto plano para entrenamiento/recolección de IA
Markdown /data/{content-id}/{lang}/content.md Markdown amigable para LLM con front matter
JSON /data/{content-id}/{lang}/content.json Datos de contenido estructurados (cuerpo, resumen, FAQ, imágenes, etiquetas)
JSON-LD /data/{content-id}/{lang}/schema.jsonld Datos estructurados de schema.org
Images /data/{content-id}/images.json Metadatos de imágenes (alt, leyenda, licencia, origen de generación)
RSS /feed/rss, /feed/rss-{lang} Feed de actualizaciones (general / por idioma)
Atom /feed/atom Feed alternativo Atom
Sitemap /sitemap.xml Descubrimiento de URL con hreflang
llms.txt /llms.txt, /llms-full.txt Archivo guía para IA e índice de todo el contenido

Idiomas

Los artículos se ofrecen en coreano e inglés de forma predeterminada, más japonés y español. Use ko, en, ja o es en {lang}; solo los idiomas con traducción real aparecen en el hreflang del sitemap. Además, indonesio (id), portugués (pt), chino tradicional (zh-hant) y alemán (de) están disponibles solo como archivos de datos con traducción automática, etiquetados translation_status: machine, y quedan excluidos de las páginas HTML y del sitemap hasta su revisión.

Idioma Valor (lang) Nivel Páginas web Archivos de datos Audio (TTS) Embeddings
한국어 ko Nivel 1
English en Nivel 1
日本語 ja Nivel 1
Español es Nivel 1
Indonesio id Nivel 2 - - -
Portugués pt Nivel 2 - - -
Chino (tradicional) zh-hant Nivel 2 - - -
Alemán de Nivel 2 - - -
  • Nivel 1 - Idiomas revisados por el equipo. Se ofrece todo: páginas web legibles por personas, exposición en buscadores (sitemap y hreflang), audio con IA (TTS) y embeddings.
  • Nivel 2 - Idiomas de solo datos con traducción automática. Se sirven únicamente por archivos de datos y la API: sin páginas web, sin exposición en buscadores, sin audio (TTS) y sin embeddings. Cada archivo lleva la etiqueta translation_status: machine para indicar que no ha sido revisado.

Uso de datos

No se requiere clave de API ni autenticación para usar el contenido público. Simplemente obtenga los archivos que necesite desde las rutas anteriores.

Política de rastreadores

Los buscadores y rastreadores de IA (GPTBot, OAI-SearchBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot y otros) están permitidos en robots.txt. Personas y máquinas reciben el mismo contenido - sin cloaking.

API estructurada y embeddings

Para consultas en tiempo real, filtros y búsqueda, usa la API de contenido. La búsqueda semántica y los vectores de embedding también están disponibles vía API (con la API de embeddings activa). Ver la API de contenido

Conjuntos de datos (entrenamiento y RAG, API de pago)

Para los casos que necesitan muchos registros a la vez - entrenamiento de modelos, fine-tuning, indexación RAG - la API de pago sirve el mismo contenido normalizado en esquemas listos para entrenar. Admite paginación (page, per_page), filtros (category, tag) y sincronización incremental (updated_since), y puede devolver JSONL.

  • corpus - Corpus con cuerpo, resumen, puntos clave, etiquetas, licencia y estado de traducción
  • qa - Datos instruction que expanden las FAQ en pares de mensajes user/assistant
  • parallel - Corpus paralelo que alinea un artículo entre idiomas en un solo registro
  • embeddings - Vectores de embedding incluidos por artículo (solo Pro)

La API de conjuntos de datos no sustituye el acceso gratuito a los datos. Las rutas por artículo de la tabla de arriba siguen siendo gratuitas y sin autenticación tal como están hoy. Sobre la API de conjuntos de datos

Cada archivo de datos ofrece el mismo contenido que su página HTML legible (principio de coherencia del contenido).

Política de reutilización / entrenamiento de IA: Licencia