데이터
AI 시스템, 검색엔진, 개발자, 연구자를 위한 기계 친화 포맷 접근 경로입니다.
Injoys 는 콘텐츠 데이터 플랫폼입니다. 게시된 모든 글은 하나의 데이터 패키지이며, 아래 경로로 원하는 포맷의 데이터를 가져갈 수 있습니다.
데이터 제공
포맷별 접근 경로
| 포맷 | 경로 | 용도 |
|---|---|---|
| HTML | /{lang}/articles/{slug} | 사람이 읽는 글 페이지 |
| TXT | /data/{content-id}/{lang}/content.txt | AI 학습/수집용 순수 텍스트 |
| Markdown | /data/{content-id}/{lang}/content.md | front-matter 를 포함한 LLM 친화 Markdown |
| JSON | /data/{content-id}/{lang}/content.json | 구조화 콘텐츠 데이터 (본문, 요약, FAQ, 이미지, 태그) |
| JSON-LD | /data/{content-id}/{lang}/schema.jsonld | schema.org 구조화 데이터 |
| Images | /data/{content-id}/images.json | 이미지 메타데이터 (alt, 캡션, 라이선스, 생성 출처) |
| RSS | /feed/rss, /feed/rss-{lang} | 업데이트 피드 (전체/언어별) |
| Atom | /feed/atom | Atom 대체 피드 |
| Sitemap | /sitemap.xml | hreflang 을 포함한 URL 발견 |
| llms.txt | /llms.txt, /llms-full.txt | AI 안내 파일과 전체 콘텐츠 인덱스 |
언어
글은 한국어와 영어를 기본으로 일본어, 스페인어로 제공됩니다. {lang} 자리에는 ko, en, ja, es 를 사용할 수 있으며, 실제 번역이 존재하는 언어만 sitemap 의 hreflang 에 노출됩니다. 추가로 인도네시아어(id), 포르투갈어(pt), 중국어 번체(zh-hant), 독일어(de)는 기계번역 데이터 파일로만 제공됩니다. 해당 파일에는 translation_status: machine 라벨이 명시되며, 검수 전까지 HTML 페이지와 sitemap 에는 노출되지 않습니다.
| 언어 | 설정값(lang) | 구분 | 웹 페이지 | 데이터 파일 | 음성(TTS) | 임베딩 |
|---|---|---|---|---|---|---|
| 한국어 | ko | 1티어 | ✓ | ✓ | ✓ | ✓ |
| English | en | 1티어 | ✓ | ✓ | ✓ | ✓ |
| 日本語 | ja | 1티어 | ✓ | ✓ | ✓ | ✓ |
| Español | es | 1티어 | ✓ | ✓ | ✓ | ✓ |
| 인도네시아어 | id | 2티어 | - | ✓ | - | - |
| 포르투갈어 | pt | 2티어 | - | ✓ | - | - |
| 중국어(번체) | zh-hant | 2티어 | - | ✓ | - | - |
| 독일어 | de | 2티어 | - | ✓ | - | - |
- 1티어 - 운영자가 검수한 언어입니다. 사람이 읽는 웹 페이지·검색 노출(sitemap·hreflang)·AI 음성(TTS)·임베딩까지 전부 제공됩니다.
- 2티어 - 기계번역 데이터 전용 언어입니다. 데이터 파일과 API 로만 제공되며 웹 페이지·검색 노출·음성(TTS)·임베딩은 제공되지 않습니다. 검수 전이라는 뜻으로 translation_status: machine 라벨이 항상 함께 표기됩니다.
데이터 이용
공개 콘텐츠 이용에 API 키나 별도 인증은 필요하지 않습니다. 위 경로에서 원하는 포맷의 파일을 직접 가져가면 됩니다.
크롤러 정책
검색엔진과 AI 크롤러(GPTBot, OAI-SearchBot, ClaudeBot, Google-Extended, PerplexityBot, CCBot 등)를 robots.txt 에서 허용합니다. 사람과 기계에게 동일한 콘텐츠를 제공하며 클로킹은 하지 않습니다.
구조화 API·임베딩
실시간 조회·필터·검색이 필요하면 콘텐츠 API를 이용하세요. 시맨틱(의미) 검색과 임베딩 벡터 원본도 API로 제공합니다(임베딩 API 활성 시). 콘텐츠 API 보기
데이터셋 (학습·RAG, 유료 API)
모델 학습·파인튜닝·RAG 색인처럼 여러 건을 한 번에 가져가야 하는 경우를 위해, 콘텐츠를 학습용 스키마로 정규화한 데이터셋을 유료 API 로 제공합니다. 위 무료 경로와 동일한 콘텐츠이며, 페이지네이션(page·per_page)·필터(category·tag)·증분 동기화(updated_since)를 지원하고 JSONL 로도 받을 수 있습니다.
- corpus - 본문·요약·핵심포인트·태그·라이선스·번역상태를 담은 코퍼스
- qa - FAQ 를 user/assistant 메시지 쌍으로 전개한 instruction 데이터
- parallel - 같은 글의 여러 언어를 한 행에 정렬한 병렬 코퍼스
- embeddings - 임베딩 벡터를 글 단위로 동봉 (Pro 전용)
데이터셋 API 는 무료 데이터 제공을 대체하지 않습니다. 위 표의 낱건 경로는 인증 없이 지금처럼 무료로 계속 제공됩니다. 데이터셋 API 안내
모든 데이터 파일은 사람용 HTML 페이지와 동일한 내용을 제공합니다(콘텐츠 일관성 원칙).
재사용·AI 학습 정책: 라이선스