運営者が自ら制作・検収した信頼できるコンテンツのみを公開し、一般ユーザーの投稿や大量自動生成ページは扱いません。
すべてのコンテンツは韓国語・英語を必須とし、日本語・スペイン語を追加で提供します。人に見える内容とAI・検索エンジンに提供するデータは常に一致します。
運営者がすべての記事を執筆・検収し、AIが構造化・翻訳・画像を補助します。成果物は人が読むページと機械フレンドリーなファイルセットとして同時に公開されます。
信頼できる構造化知識をグローバルな検索・AIエコシステムに供給することが目標です。
公開された記事をAI音声で聴くことができます。音声はサーバーで事前生成されたファイルとして提供され、モバイルを含むほとんどの端末ですぐに再生できます。料金やログインは不要です。
コンテンツは検収の有無によって2段階に分けて提供されます。検収済みの1ティア言語は人が読むページから音声・埋め込みまですべて提供され、機械翻訳の2ティア言語はデータファイルとAPIでのみ提供されます。検収していない翻訳を人向けページとして出さないことが、この区分の理由です。
コンテンツは、人が読むページと機械用データファイルに加えて、モデル学習·ファインチューニング·RAGインデックスにそのまま使えるデータセットとしても提供されます。本文コーパス、FAQベースのinstructionデータ、同じ記事を複数言語で整列したパラレルコーパス、埋め込みベクトルの4種類で、翻訳の検収状態が常に併記されます。
複数件を一度に取得するデータセットは有料APIで提供し、コンテンツを1件ずつ取得する認証不要のデータファイルは、これまでどおり無料で提供し続けます。
データセットAPIのご案内