データ
AIシステム・検索エンジン・開発者・研究者のための機械フレンドリーなフォーマットのアクセス経路です。
Injoysはコンテンツデータプラットフォームです。公開されたすべての記事はひとつのデータパッケージであり、以下の経路から必要なフォーマットのデータを取得できます。
データ提供
フォーマット別アクセス経路
| フォーマット | パス | 用途 |
|---|---|---|
| HTML | /{lang}/articles/{slug} | 人が読む記事ページ |
| TXT | /data/{content-id}/{lang}/content.txt | AI学習・収集用のプレーンテキスト |
| Markdown | /data/{content-id}/{lang}/content.md | front-matter を含むLLMフレンドリーなMarkdown |
| JSON | /data/{content-id}/{lang}/content.json | 構造化コンテンツデータ (本文、要約、FAQ、画像、タグ) |
| JSON-LD | /data/{content-id}/{lang}/schema.jsonld | schema.org 構造化データ |
| Images | /data/{content-id}/images.json | 画像メタデータ (alt、キャプション、ライセンス、生成元) |
| RSS | /feed/rss, /feed/rss-{lang} | 更新フィード (全体/言語別) |
| Atom | /feed/atom | Atom 代替フィード |
| Sitemap | /sitemap.xml | hreflang を含むURL発見 |
| llms.txt | /llms.txt, /llms-full.txt | AI案内ファイルと全コンテンツインデックス |
言語
記事は韓国語と英語を基本に、日本語・スペイン語でも提供されます。{lang} には ko、en、ja、es を使用でき、実際に翻訳が存在する言語のみが sitemap の hreflang に露出されます。さらに、インドネシア語(id)、ポルトガル語(pt)、中国語繁体(zh-hant)、ドイツ語(de)は機械翻訳データファイルとしてのみ提供されます。該当ファイルには translation_status: machine ラベルが明示され、検収まではHTMLページと sitemap に露出されません。
| 言語 | 設定値(lang) | 区分 | Webページ | データファイル | 音声(TTS) | 埋め込み |
|---|---|---|---|---|---|---|
| 한국어 | ko | 1ティア | ✓ | ✓ | ✓ | ✓ |
| English | en | 1ティア | ✓ | ✓ | ✓ | ✓ |
| 日本語 | ja | 1ティア | ✓ | ✓ | ✓ | ✓ |
| Español | es | 1ティア | ✓ | ✓ | ✓ | ✓ |
| インドネシア語 | id | 2ティア | - | ✓ | - | - |
| ポルトガル語 | pt | 2ティア | - | ✓ | - | - |
| 中国語(繁体) | zh-hant | 2ティア | - | ✓ | - | - |
| ドイツ語 | de | 2ティア | - | ✓ | - | - |
- 1ティア - 運営者が検収した言語です。人が読むWebページ・検索露出(sitemap・hreflang)・AI音声(TTS)・埋め込みまですべて提供されます。
- 2ティア - 機械翻訳のデータ専用言語です。データファイルとAPIでのみ提供され、Webページ・検索露出・音声(TTS)・埋め込みは提供されません。検収前であることを示す translation_status: machine ラベルが常に併記されます。
データ利用
公開コンテンツの利用にAPIキーや認証は不要です。上記の経路から必要なフォーマットのファイルを直接取得してください。
クローラーポリシー
検索エンジンとAIクローラー(GPTBot、OAI-SearchBot、ClaudeBot、Google-Extended、PerplexityBot、CCBot など)を robots.txt で許可しています。人にも機械にも同一のコンテンツを提供し、クローキングは行いません。
構造化 API・埋め込み
リアルタイムの取得・フィルタ・検索にはコンテンツ API をご利用ください。セマンティック(意味)検索と埋め込みベクトル原本も API で提供します(埋め込み API 有効時)。 コンテンツ API を見る
データセット (学習·RAG、有料API)
モデル学習·ファインチューニング·RAGインデックスのように複数件を一度に取得する場合のために、コンテンツを学習用スキーマへ正規化したデータセットを有料APIで提供します。上の無料経路と同一のコンテンツで、ページネーション(page·per_page)·フィルタ(category·tag)·差分同期(updated_since)に対応し、JSONLでも受け取れます。
- corpus - 本文·要約·キーポイント·タグ·ライセンス·翻訳状態を含むコーパス
- qa - FAQをuser/assistantメッセージペアに展開したinstructionデータ
- parallel - 同じ記事の複数言語を1行に整列したパラレルコーパス
- embeddings - 埋め込みベクトルを記事単位で同梱 (Pro限定)
データセットAPIは無料データ提供を置き換えるものではありません。上の表の単件経路は、認証不要でこれまでどおり無料で提供され続けます。 データセットAPIのご案内
すべてのデータファイルは人間向けHTMLページと同一の内容を提供します(コンテンツ一貫性の原則)。
再利用・AI学習ポリシー: ライセンス