{"content_id":"aillofw1zj","slug":"openai-gpt-5-6-price-performance-model-routing","locale":"ko","schema_type":"TechArticle","category":"ai_data","category_name":"AI 데이터","title":"OpenAI GPT-5.6 가격·속도 개편과 모델 선택 전략","summary":"OpenAI는 2026년 7월 30일부터 GPT-5.6 Luna와 Terra의 API 가격을 각각 80%, 20% 인하하고 Sol에 Fast mode를 도입했다. 이번 개편은 모든 작업에 최상위 모델을 쓰기보다 계획·실행·검증 단계에 맞춰 모델을 배치해 결과당 비용을 낮추는 전략에 초점을 둔다.","author":{"name":"인조이스 편집팀","url":"https://injoys.com/ko/about"},"key_points":["GPT-5.6 Luna의 API 가격은 입력 100만 토큰당 0.20달러, 출력 100만 토큰당 1.20달러로 인하됐다.","GPT-5.6 Terra의 API 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 12달러로 인하됐다.","GPT-5.6 Sol의 Fast mode는 발표 기준 Standard 처리보다 최대 2.5배 빠르고 가격은 2배이며 모델의 지능 수준은 유지한다.","기업은 Sol로 복잡한 판단과 계획을 수행하고 Luna 또는 Terra로 반복 실행과 검증을 처리하는 계층형 구성을 적용할 수 있다.","OpenAI는 모델, 추론 인프라, 에이전트 하네스의 공동 최적화가 가격 인하와 처리량 개선을 가능하게 했다고 설명한다."],"content_markdown":"OpenAI는 GPT-5.6 제품군의 실행 효율 개선을 API 가격 인하와 처리 속도 향상으로 연결했다. 핵심은 가장 강한 모델 하나를 모든 작업에 적용하는 것이 아니라, 작업의 위험도·복잡도·지연시간·검증 가능성에 따라 Sol, Terra, Luna를 조합해 결과당 비용을 낮추는 것이다.\n\n가격과 성능 수치는 OpenAI가 2026년 7월 30일 발표한 내용을 기준으로 한다. 고객사 벤치마크와 효율 개선 수치는 OpenAI 또는 발표에 인용된 기업의 측정 결과이므로 모든 환경에서 동일하게 재현된다고 볼 수는 없다.\n\n## 2026년 7월 30일 API 가격 변경\n\nGPT-5.6 Luna와 Terra의 변경된 API 가격은 다음과 같다.\n\n| 모델 | 입력 100만 토큰 | 출력 100만 토큰 | 인하 폭 | 주된 역할 |\n|---|---:|---:|---:|---|\n| GPT-5.6 Luna | 0.20달러 | 1.20달러 | 80% | 대량 처리, 반복 작업, 명확한 실행 업무 |\n| GPT-5.6 Terra | 2달러 | 12달러 | 20% | 품질·비용·속도의 균형이 필요한 일상 업무 |\n| GPT-5.6 Sol | 발표에서 변경 없음 | 발표에서 변경 없음 | 없음 | 복잡한 추론, 계획, 중요한 의사결정 |\n\nChatGPT와 Codex의 유료 구독 가격이나 전체 할당량 예산은 이번 발표로 바뀌지 않는다. 다만 Terra와 Luna를 사용할 때 차감되는 크레딧이 줄어든다. AWS를 통한 가격 변경은 7월 30일 늦게부터 순차 적용된다고 OpenAI는 안내했다.\n\n### API 비용 계산 예시\n\n토큰 비용은 다음과 같이 계산할 수 있다.\n\n`총비용 = 입력 토큰 수 ÷ 1,000,000 × 입력 단가 + 출력 토큰 수 ÷ 1,000,000 × 출력 단가`\n\n예를 들어 입력 1,000만 토큰과 출력 200만 토큰을 처리한다면 단순 토큰 단가 기준 비용은 다음과 같다.\n\n| 모델 | 입력 비용 | 출력 비용 | 합계 |\n|---|---:|---:|---:|\n| Luna | 2달러 | 2.40달러 | 4.40달러 |\n| Terra | 20달러 | 24달러 | 44달러 |\n\n실제 청구액에는 캐시 적용 여부, 선택한 처리 방식, 도구 호출 구조 등 서비스별 조건이 영향을 줄 수 있다.\n\n## GPT-5.6 제품군의 역할\n\nGPT-5.6은 단일 모델이 아니라 비용과 성능이 다른 계층형 제품군으로 구성된다.\n\n### GPT-5.6 Sol\n\nSol은 가장 높은 수준의 추론과 복잡한 문제 해결을 담당한다. 요구사항이 모호하거나 실패 비용이 큰 판단, 장기 계획, 중요한 결과 검토에 적합하다.\n\n### GPT-5.6 Terra\n\nTerra는 성능, 비용, 응답 속도 사이의 균형을 목표로 한다. 조직 내부 질의응답, 범위가 정해진 에이전트 업무, 일반적인 분석 및 코딩처럼 Luna보다 높은 판단력이 필요하지만 Sol을 항상 사용할 필요는 없는 작업에 적합하다.\n\n### GPT-5.6 Luna\n\nLuna는 가장 빠르고 저렴한 계층이다. 단순한 짧은 문장 생성뿐 아니라 도구 호출과 여러 단계의 워크플로를 지원하므로, 명확하게 정의된 작업을 대규모로 반복하는 실행 모델로 활용할 수 있다.\n\n대표적인 적용 업무는 다음과 같다.\n\n- 대량 문서 및 고객 문의 분류\n- 정형화된 데이터 추출\n- 반복적인 코드 수정\n- 테스트 작성과 실행\n- 규칙이 명확한 문서 생성\n- 대규모 콘텐츠 검토\n- 백그라운드 에이전트 자동화\n- 반복적인 리서치 보조\n\nOpenAI는 Luna가 1년 전 최첨단급으로 평가됐던 모델과 비슷한 수준의 성능을 추정 작업당 약 6%의 비용과 거의 9배의 속도로 제공한다고 주장한다. 여기서 6%는 토큰 단가의 직접 비교가 아니라 같은 작업 결과를 얻는 데 드는 추정 비용을 비교한 값이다.\n\n## Sol Fast mode의 특징\n\nGPT-5.6 Sol에는 API용 Fast mode가 도입됐다. 이는 기존 Priority Processing을 대체하며 Codex의 `/fast` 기능과 대응하는 개념이다.\n\n| 항목 | Fast mode |\n|---|---|\n| 속도 | Standard 처리보다 최대 2.5배 빠름 |\n| 모델 지능 | OpenAI 발표 기준 Standard와 동일 |\n| 가격 | Standard 처리 가격의 2배 |\n| 기존 호환성 | `priority` 태그 요청을 Fast mode로 자동 처리 |\n\nFast mode의 최대 2.5배라는 표현은 모든 요청의 지연시간이 정확히 같은 비율로 줄어든다는 보장이 아니다. 프롬프트 길이, 출력 길이, 서비스 부하, 도구 호출 횟수에 따라 실제 체감 속도는 달라질 수 있다.\n\n### Fast mode가 적합한 경우\n\n- 사용자가 응답을 기다리는 실시간 서비스\n- 코드 수정과 확인을 빠르게 반복하는 개발 환경\n- Sol 호출이 전체 에이전트의 지연시간을 결정하는 작업\n- 사고 대응이나 장애 분석처럼 몇 분의 지연도 중요한 상황\n- 처리 지연으로 발생하는 비용이 추가 API 비용보다 큰 업무\n\n백그라운드 배치, 야간 분석, 비동기 처리처럼 완료 시점이 급하지 않은 작업은 Standard 처리가 더 경제적일 수 있다.\n\n## 결과 중심의 모델 선택 기준\n\n모델 선택은 순위표에서 가장 높은 모델을 고르는 문제가 아니다. 다음 질문을 작업별로 검토해야 한다.\n\n| 판단 요소 | 확인할 질문 |\n|---|---|\n| 실패 영향 | 오류가 고객, 매출, 보안 또는 규제 준수에 어떤 영향을 주는가? |\n| 오류 허용도 | 사람이 검토하거나 자동 규칙으로 오류를 잡을 수 있는가? |\n| 지연시간 | 사용자가 실시간으로 기다리는가, 비동기로 처리해도 되는가? |\n| 처리량 | 하루 또는 한 달에 몇 건을 처리해야 하는가? |\n| 문제의 명확성 | 입력, 규칙, 기대 출력이 충분히 정의돼 있는가? |\n| 추론 가치 | 더 강한 추론이 실제 결과 품질을 의미 있게 높이는가? |\n| 검증 가능성 | 테스트, 스키마, 교차 확인으로 결과를 판정할 수 있는가? |\n\n명확하고 자동 검증이 가능한 작업은 Luna에 적합할 가능성이 크다. 일정한 판단력이 필요하면 Terra를 고려할 수 있다. 모호성 해소, 고위험 판단 또는 실패 결과의 최종 검토에는 Sol이 적합하다.\n\n## Sol로 계획하고 Luna로 실행하는 구조\n\n하나의 에이전트 작업 안에서도 단계별로 모델을 다르게 배치할 수 있다. 예를 들어 코딩 에이전트는 다음과 같이 구성할 수 있다.\n\n1. Sol이 요구사항의 모호성을 찾고 질문을 정리한다.\n2. Sol이 구현 계획, 변경 범위, 위험 요소를 결정한다.\n3. Luna가 명확해진 변경 사항을 코드로 구현한다.\n4. Luna가 테스트를 작성하고 실행한다.\n5. Luna 또는 Terra가 테스트 결과와 코드 차이를 평가한다.\n6. 실패 가능성이 높거나 중요한 결론만 Sol이 다시 검토한다.\n\n이 구조는 모든 단계에 Sol을 쓰는 방식보다 비용을 낮추면서 중요한 판단에 높은 추론 능력을 집중할 수 있다. 단, 모델을 나누면 라우팅 규칙, 오류 처리, 로그 추적과 평가 체계를 별도로 설계해야 한다.\n\n## 가격 인하를 뒷받침한 세 가지 효율 계층\n\nOpenAI는 비용 절감이 단순한 가격 정책이 아니라 세 계층의 기술적 개선에서 나왔다고 설명한다.\n\n1. 모델 자체의 토큰 효율\n2. 추론 시스템의 하드웨어 효율\n3. 모델·도구·컨텍스트를 연결하는 에이전트 하네스의 효율\n\n이 설명은 OpenAI가 공개한 기술 자료를 바탕으로 하며, 세부 비용 구조 전체가 외부에 공개된 것은 아니다. 따라서 가격 인하 중 기술 효율과 전략적 가격 정책이 각각 얼마나 기여했는지는 외부에서 확정하기 어렵다.\n\n## 모델과 추론 시스템 최적화\n\n### 토큰당 작업 수행량 개선\n\nGPT-5.6은 작업 성공률뿐 아니라 처리 효율도 함께 최적화하도록 훈련됐다는 것이 OpenAI의 설명이다. 불필요하게 긴 추론이나 반복을 줄이고 더 적은 토큰으로 필요한 결과에 도달하도록 설계해 토큰당 지능과 작업 수행량을 높였다는 의미다.\n\n### 부하 분산과 요청 라우팅\n\n추론 시스템은 지역, 가용 용량, 가속기 종류를 기준으로 요청을 데이터센터와 클러스터에 분배한다. 클러스터 내부에서는 현재 부하, 입력 컨텍스트 길이, 캐시 사용 가능성, 요청 특성 등을 고려해 모델 인스턴스를 선택한다.\n\nOpenAI는 GPT-5.6 Sol과 Codex를 프로덕션 트래픽 분석, 부하 불균형 원인 탐색, 라우팅 전략 시험과 휴리스틱 조정에 활용했다고 밝혔다.\n\n### GPU 커널 최적화\n\nGPU 커널은 모델의 수학 연산을 하드웨어에서 실행하는 핵심 코드다. 메모리 이동, 동기화, 데이터 배열과 병렬화 방식에 따라 같은 GPU에서도 처리 비용이 달라진다.\n\nOpenAI에 따르면 GPT-5.6 Sol은 Codex 환경에서 Triton과 Gluon을 사용해 프로덕션 커널을 작성하고 최적화하는 데 참여했다. 커널 개선과 관련 최적화를 합친 결과 모델 제공의 종단 간 비용이 20% 줄었다고 회사는 밝혔다.\n\n종단 간 비용은 특정 연산 하나가 아니라 라우팅, 데이터 이동, 모델 실행과 출력 생성 등 실제 요청 처리 전체에 드는 비용을 뜻한다.\n\n### 커널의 정확성 검증\n\n빠른 커널도 수치적으로 잘못된 결과를 만들면 사용할 수 없다. OpenAI는 AI가 작성한 커널의 정확성을 점검하기 위해 FpSan을 포함한 검증 도구에 투자했다고 설명한다. FpSan은 Floating-Point Sanitizer의 약자로 부동소수점 연산 관련 오류를 탐지하는 오픈소스 도구다.\n\n이는 AI가 프로덕션 인프라 코드를 생성할 때 성능 벤치마크뿐 아니라 수치 검증, 회귀 테스트, 실패 시 복구 절차가 함께 필요하다는 점을 보여준다.\n\n## 추측 디코딩과 KV 캐시\n\n### 추측 디코딩\n\n추측 디코딩은 작은 초안 모델이 앞으로 생성될 토큰을 먼저 제안하고, 큰 주 모델이 여러 후보를 병렬로 검증하는 방식이다. 제안이 받아들여지면 주 모델의 비싼 순차 계산 횟수를 줄일 수 있다.\n\nOpenAI는 GPT-5.6 Sol이 초안 모델의 크기와 구조를 바꾸는 수백 건의 실험을 설계·실행하고 학습을 모니터링했다고 밝혔다. 그 결과 토큰 생성 효율이 15% 이상 향상됐다는 설명이다.\n\n### KV 캐시와 워크로드별 설정\n\n모델은 입력을 처리하면서 Key-Value 캐시, 즉 KV 캐시를 만든다. 최적 설정은 입력과 출력 길이, 배치 크기, 캐시 적중률, 동시 요청 수, 메모리 용량과 모델 샤딩 방식에 따라 달라진다.\n\nOpenAI는 Sol과 Codex로 실제 워크로드를 분석하고 설정 후보를 평가해 작업 유형별 엔진 구성을 세밀하게 조정했다고 설명한다. 목적은 같은 하드웨어에서 더 많은 요청을 처리하는 것이다.\n\n## 에이전트 하네스와 컨텍스트 비용\n\n에이전트는 한 번의 사용자 요청을 해결하기 위해 모델과 도구를 여러 번 호출한다. 모델 호출이 30번 필요한 작업에서 각 호출에 1초의 불필요한 지연이 발생하면 전체 지연은 약 30초 늘어날 수 있다.\n\nOpenAI는 모델, 도구, 사용자 환경을 연결하는 Rust 기반 오케스트레이션 계층을 에이전트 하네스로 설명한다.\n\n### 필요한 도구만 지연 노출\n\n도구, 플러그인, 스킬, MCP 통합 정보를 처음부터 모두 프롬프트에 넣으면 입력 토큰과 지연시간이 증가한다. 하네스는 필요한 시점에만 관련 도구 정보를 노출하는 지연 탐색 방식을 사용한다. 도구 출력은 모델이 별도 한도를 요청하지 않는 한 기본적으로 1만 토큰으로 제한된다고 OpenAI는 밝혔다.\n\n### 정확한 접두사 보존과 프롬프트 캐시\n\n프롬프트 캐싱은 이전에 처리한 입력의 동일한 앞부분을 재사용해 중복 연산을 줄인다. 캐시를 재사용하려면 프롬프트 접두사가 정확히 일치해야 한다.\n\nOpenAI의 하네스는 기록을 추가 전용 구조로 관리하고 새 메시지와 도구 결과를 끝에 붙인다. 도구는 결정론적인 순서로 제시하며 승인 정책 같은 실행 설정은 도구 정의 자체를 바꾸지 않고 런타임에 적용한다. 이 방식은 반복적인 에이전트 루프의 캐시 적중률을 높이는 데 유리하다.\n\n## 기업 사례 수치를 읽는 방법\n\nOpenAI 공식 발표에는 Replit, Notion, Ramp, Blitzy, Cognition, Dust 등의 평가가 포함됐다.\n\n- Notion은 자체 평가에서 Terra가 GPT-5.5와 비슷한 품질을 작업당 절반의 비용과 60% 짧은 시간으로 제공했다고 밝혔다.\n- Blitzy는 Luna 적용 후 프롬프트 캐시 재사용률이 24%에서 90%로 상승했으며 이전 기본 모델보다 비용이 87% 낮았다고 설명했다.\n- Dust는 같은 에이전트 업무에서 Luna가 이전 기본 모델보다 40% 빠르고 40% 저렴했다고 밝혔다.\n- Ramp 측은 Luna를 백그라운드 에이전트 자동화의 기본 모델로 사용한다고 밝혔다.\n\n이 수치는 각 기업의 내부 작업, 프롬프트, 평가 기준과 시스템 구조에서 측정한 사례다. 독립적인 공통 벤치마크가 아니므로 다른 조직의 업무에 그대로 적용해서는 안 된다. 도입 전에는 실제 데이터와 오류 비용을 반영한 자체 평가가 필요하다.\n\n## 도입 전 검증 체크리스트\n\n1. 대표 작업 표본과 정답 또는 평가 기준을 준비한다.\n2. Luna, Terra, Sol의 성공률과 재시도율을 같은 조건에서 비교한다.\n3. 토큰 비용뿐 아니라 도구 호출, 검토 인력, 실패 복구 비용을 포함한다.\n4. 평균 지연시간과 함께 상위 95% 또는 99% 지연시간을 측정한다.\n5. 자동 테스트나 스키마 검증이 가능한 단계를 저가 모델 후보로 분류한다.\n6. 개인정보, 보안, 규제 관련 작업에는 별도의 승인과 기록 정책을 적용한다.\n7. 저신뢰 결과를 Terra 또는 Sol로 승격하는 라우팅 기준을 정한다.\n8. Fast mode의 추가 비용보다 지연 감소의 가치가 큰지 실제 트래픽으로 검증한다.\n\n## 의미와 한계\n\n이번 개편은 AI 모델 경쟁의 기준이 최고 점수 하나에서 결과당 비용으로 이동하고 있음을 보여준다. 대규모 반복 작업에는 Luna, 일상적인 지식 업무에는 Terra, 모호하고 중요한 판단에는 Sol을 배치하면 지능·속도·비용을 업무별로 조합할 수 있다.\n\n다만 80% 가격 인하가 기술 효율 개선과 시장 전략에서 각각 얼마나 비롯됐는지는 공개 정보만으로 분리하기 어렵다. 또한 저가 모델의 경제성은 토큰 가격만으로 결정되지 않는다. 오류율이 높아 재시도와 사람 검토가 늘어나면 전체 작업 비용이 오를 수 있다.\n\n따라서 핵심 지표는 모델 호출 1회의 가격이 아니라 검증을 통과한 결과 1건을 만드는 데 든 총비용이다. 모델별 성공률, 재시도 횟수, 지연시간, 검토 비용을 함께 측정해야 GPT-5.6의 가격 인하가 실제 사업 가치로 이어지는지 판단할 수 있다.","content_html":"\u003cp\u003eOpenAI는 GPT-5.6 제품군의 실행 효율 개선을 API 가격 인하와 처리 속도 향상으로 연결했다. 핵심은 가장 강한 모델 하나를 모든 작업에 적용하는 것이 아니라, 작업의 위험도·복잡도·지연시간·검증 가능성에 따라 Sol, Terra, Luna를 조합해 결과당 비용을 낮추는 것이다.\u003c/p\u003e\n\u003cp\u003e가격과 성능 수치는 OpenAI가 2026년 7월 30일 발표한 내용을 기준으로 한다. 고객사 벤치마크와 효율 개선 수치는 OpenAI 또는 발표에 인용된 기업의 측정 결과이므로 모든 환경에서 동일하게 재현된다고 볼 수는 없다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#2026%EB%85%84-7%EC%9B%94-30%EC%9D%BC-api-%EA%B0%80%EA%B2%A9-%EB%B3%80%EA%B2%BD\" class=\"anchor\" id=\"2026년-7월-30일-api-가격-변경\"\u003e\u003c/a\u003e2026년 7월 30일 API 가격 변경\u003c/h2\u003e\n\u003cp\u003eGPT-5.6 Luna와 Terra의 변경된 API 가격은 다음과 같다.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003e모델\u003c/th\u003e\n\u003cth\u003e입력 100만 토큰\u003c/th\u003e\n\u003cth\u003e출력 100만 토큰\u003c/th\u003e\n\u003cth\u003e인하 폭\u003c/th\u003e\n\u003cth\u003e주된 역할\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"모델\"\u003eGPT-5.6 Luna\u003c/td\u003e\n\u003ctd data-label=\"입력 100만 토큰\"\u003e0.20달러\u003c/td\u003e\n\u003ctd data-label=\"출력 100만 토큰\"\u003e1.20달러\u003c/td\u003e\n\u003ctd data-label=\"인하 폭\"\u003e80%\u003c/td\u003e\n\u003ctd data-label=\"주된 역할\"\u003e대량 처리, 반복 작업, 명확한 실행 업무\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"모델\"\u003eGPT-5.6 Terra\u003c/td\u003e\n\u003ctd data-label=\"입력 100만 토큰\"\u003e2달러\u003c/td\u003e\n\u003ctd data-label=\"출력 100만 토큰\"\u003e12달러\u003c/td\u003e\n\u003ctd data-label=\"인하 폭\"\u003e20%\u003c/td\u003e\n\u003ctd data-label=\"주된 역할\"\u003e품질·비용·속도의 균형이 필요한 일상 업무\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"모델\"\u003eGPT-5.6 Sol\u003c/td\u003e\n\u003ctd data-label=\"입력 100만 토큰\"\u003e발표에서 변경 없음\u003c/td\u003e\n\u003ctd data-label=\"출력 100만 토큰\"\u003e발표에서 변경 없음\u003c/td\u003e\n\u003ctd data-label=\"인하 폭\"\u003e없음\u003c/td\u003e\n\u003ctd data-label=\"주된 역할\"\u003e복잡한 추론, 계획, 중요한 의사결정\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eChatGPT와 Codex의 유료 구독 가격이나 전체 할당량 예산은 이번 발표로 바뀌지 않는다. 다만 Terra와 Luna를 사용할 때 차감되는 크레딧이 줄어든다. AWS를 통한 가격 변경은 7월 30일 늦게부터 순차 적용된다고 OpenAI는 안내했다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#api-%EB%B9%84%EC%9A%A9-%EA%B3%84%EC%82%B0-%EC%98%88%EC%8B%9C\" class=\"anchor\" id=\"api-비용-계산-예시\"\u003e\u003c/a\u003eAPI 비용 계산 예시\u003c/h3\u003e\n\u003cp\u003e토큰 비용은 다음과 같이 계산할 수 있다.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003e총비용 = 입력 토큰 수 ÷ 1,000,000 × 입력 단가 + 출력 토큰 수 ÷ 1,000,000 × 출력 단가\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003e예를 들어 입력 1,000만 토큰과 출력 200만 토큰을 처리한다면 단순 토큰 단가 기준 비용은 다음과 같다.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003e모델\u003c/th\u003e\n\u003cth\u003e입력 비용\u003c/th\u003e\n\u003cth\u003e출력 비용\u003c/th\u003e\n\u003cth\u003e합계\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"모델\"\u003eLuna\u003c/td\u003e\n\u003ctd data-label=\"입력 비용\"\u003e2달러\u003c/td\u003e\n\u003ctd data-label=\"출력 비용\"\u003e2.40달러\u003c/td\u003e\n\u003ctd data-label=\"합계\"\u003e4.40달러\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"모델\"\u003eTerra\u003c/td\u003e\n\u003ctd data-label=\"입력 비용\"\u003e20달러\u003c/td\u003e\n\u003ctd data-label=\"출력 비용\"\u003e24달러\u003c/td\u003e\n\u003ctd data-label=\"합계\"\u003e44달러\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003e실제 청구액에는 캐시 적용 여부, 선택한 처리 방식, 도구 호출 구조 등 서비스별 조건이 영향을 줄 수 있다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#gpt-56-%EC%A0%9C%ED%92%88%EA%B5%B0%EC%9D%98-%EC%97%AD%ED%95%A0\" class=\"anchor\" id=\"gpt-56-제품군의-역할\"\u003e\u003c/a\u003eGPT-5.6 제품군의 역할\u003c/h2\u003e\n\u003cp\u003eGPT-5.6은 단일 모델이 아니라 비용과 성능이 다른 계층형 제품군으로 구성된다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-sol\" class=\"anchor\" id=\"gpt-56-sol\"\u003e\u003c/a\u003eGPT-5.6 Sol\u003c/h3\u003e\n\u003cp\u003eSol은 가장 높은 수준의 추론과 복잡한 문제 해결을 담당한다. 요구사항이 모호하거나 실패 비용이 큰 판단, 장기 계획, 중요한 결과 검토에 적합하다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-terra\" class=\"anchor\" id=\"gpt-56-terra\"\u003e\u003c/a\u003eGPT-5.6 Terra\u003c/h3\u003e\n\u003cp\u003eTerra는 성능, 비용, 응답 속도 사이의 균형을 목표로 한다. 조직 내부 질의응답, 범위가 정해진 에이전트 업무, 일반적인 분석 및 코딩처럼 Luna보다 높은 판단력이 필요하지만 Sol을 항상 사용할 필요는 없는 작업에 적합하다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-luna\" class=\"anchor\" id=\"gpt-56-luna\"\u003e\u003c/a\u003eGPT-5.6 Luna\u003c/h3\u003e\n\u003cp\u003eLuna는 가장 빠르고 저렴한 계층이다. 단순한 짧은 문장 생성뿐 아니라 도구 호출과 여러 단계의 워크플로를 지원하므로, 명확하게 정의된 작업을 대규모로 반복하는 실행 모델로 활용할 수 있다.\u003c/p\u003e\n\u003cp\u003e대표적인 적용 업무는 다음과 같다.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e대량 문서 및 고객 문의 분류\u003c/li\u003e\n\u003cli\u003e정형화된 데이터 추출\u003c/li\u003e\n\u003cli\u003e반복적인 코드 수정\u003c/li\u003e\n\u003cli\u003e테스트 작성과 실행\u003c/li\u003e\n\u003cli\u003e규칙이 명확한 문서 생성\u003c/li\u003e\n\u003cli\u003e대규모 콘텐츠 검토\u003c/li\u003e\n\u003cli\u003e백그라운드 에이전트 자동화\u003c/li\u003e\n\u003cli\u003e반복적인 리서치 보조\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eOpenAI는 Luna가 1년 전 최첨단급으로 평가됐던 모델과 비슷한 수준의 성능을 추정 작업당 약 6%의 비용과 거의 9배의 속도로 제공한다고 주장한다. 여기서 6%는 토큰 단가의 직접 비교가 아니라 같은 작업 결과를 얻는 데 드는 추정 비용을 비교한 값이다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#sol-fast-mode%EC%9D%98-%ED%8A%B9%EC%A7%95\" class=\"anchor\" id=\"sol-fast-mode의-특징\"\u003e\u003c/a\u003eSol Fast mode의 특징\u003c/h2\u003e\n\u003cp\u003eGPT-5.6 Sol에는 API용 Fast mode가 도입됐다. 이는 기존 Priority Processing을 대체하며 Codex의 \u003ccode\u003e/fast\u003c/code\u003e 기능과 대응하는 개념이다.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003e항목\u003c/th\u003e\n\u003cth\u003eFast mode\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"항목\"\u003e속도\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eStandard 처리보다 최대 2.5배 빠름\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"항목\"\u003e모델 지능\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eOpenAI 발표 기준 Standard와 동일\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"항목\"\u003e가격\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eStandard 처리 가격의 2배\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"항목\"\u003e기존 호환성\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003e\n\u003ccode\u003epriority\u003c/code\u003e 태그 요청을 Fast mode로 자동 처리\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eFast mode의 최대 2.5배라는 표현은 모든 요청의 지연시간이 정확히 같은 비율로 줄어든다는 보장이 아니다. 프롬프트 길이, 출력 길이, 서비스 부하, 도구 호출 횟수에 따라 실제 체감 속도는 달라질 수 있다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#fast-mode%EA%B0%80-%EC%A0%81%ED%95%A9%ED%95%9C-%EA%B2%BD%EC%9A%B0\" class=\"anchor\" id=\"fast-mode가-적합한-경우\"\u003e\u003c/a\u003eFast mode가 적합한 경우\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003e사용자가 응답을 기다리는 실시간 서비스\u003c/li\u003e\n\u003cli\u003e코드 수정과 확인을 빠르게 반복하는 개발 환경\u003c/li\u003e\n\u003cli\u003eSol 호출이 전체 에이전트의 지연시간을 결정하는 작업\u003c/li\u003e\n\u003cli\u003e사고 대응이나 장애 분석처럼 몇 분의 지연도 중요한 상황\u003c/li\u003e\n\u003cli\u003e처리 지연으로 발생하는 비용이 추가 API 비용보다 큰 업무\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003e백그라운드 배치, 야간 분석, 비동기 처리처럼 완료 시점이 급하지 않은 작업은 Standard 처리가 더 경제적일 수 있다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EA%B2%B0%EA%B3%BC-%EC%A4%91%EC%8B%AC%EC%9D%98-%EB%AA%A8%EB%8D%B8-%EC%84%A0%ED%83%9D-%EA%B8%B0%EC%A4%80\" class=\"anchor\" id=\"결과-중심의-모델-선택-기준\"\u003e\u003c/a\u003e결과 중심의 모델 선택 기준\u003c/h2\u003e\n\u003cp\u003e모델 선택은 순위표에서 가장 높은 모델을 고르는 문제가 아니다. 다음 질문을 작업별로 검토해야 한다.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003e판단 요소\u003c/th\u003e\n\u003cth\u003e확인할 질문\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"판단 요소\"\u003e실패 영향\u003c/td\u003e\n\u003ctd data-label=\"확인할 질문\"\u003e오류가 고객, 매출, 보안 또는 규제 준수에 어떤 영향을 주는가?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"판단 요소\"\u003e오류 허용도\u003c/td\u003e\n\u003ctd data-label=\"확인할 질문\"\u003e사람이 검토하거나 자동 규칙으로 오류를 잡을 수 있는가?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"판단 요소\"\u003e지연시간\u003c/td\u003e\n\u003ctd data-label=\"확인할 질문\"\u003e사용자가 실시간으로 기다리는가, 비동기로 처리해도 되는가?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"판단 요소\"\u003e처리량\u003c/td\u003e\n\u003ctd data-label=\"확인할 질문\"\u003e하루 또는 한 달에 몇 건을 처리해야 하는가?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"판단 요소\"\u003e문제의 명확성\u003c/td\u003e\n\u003ctd data-label=\"확인할 질문\"\u003e입력, 규칙, 기대 출력이 충분히 정의돼 있는가?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"판단 요소\"\u003e추론 가치\u003c/td\u003e\n\u003ctd data-label=\"확인할 질문\"\u003e더 강한 추론이 실제 결과 품질을 의미 있게 높이는가?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"판단 요소\"\u003e검증 가능성\u003c/td\u003e\n\u003ctd data-label=\"확인할 질문\"\u003e테스트, 스키마, 교차 확인으로 결과를 판정할 수 있는가?\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003e명확하고 자동 검증이 가능한 작업은 Luna에 적합할 가능성이 크다. 일정한 판단력이 필요하면 Terra를 고려할 수 있다. 모호성 해소, 고위험 판단 또는 실패 결과의 최종 검토에는 Sol이 적합하다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#sol%EB%A1%9C-%EA%B3%84%ED%9A%8D%ED%95%98%EA%B3%A0-luna%EB%A1%9C-%EC%8B%A4%ED%96%89%ED%95%98%EB%8A%94-%EA%B5%AC%EC%A1%B0\" class=\"anchor\" id=\"sol로-계획하고-luna로-실행하는-구조\"\u003e\u003c/a\u003eSol로 계획하고 Luna로 실행하는 구조\u003c/h2\u003e\n\u003cp\u003e하나의 에이전트 작업 안에서도 단계별로 모델을 다르게 배치할 수 있다. 예를 들어 코딩 에이전트는 다음과 같이 구성할 수 있다.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eSol이 요구사항의 모호성을 찾고 질문을 정리한다.\u003c/li\u003e\n\u003cli\u003eSol이 구현 계획, 변경 범위, 위험 요소를 결정한다.\u003c/li\u003e\n\u003cli\u003eLuna가 명확해진 변경 사항을 코드로 구현한다.\u003c/li\u003e\n\u003cli\u003eLuna가 테스트를 작성하고 실행한다.\u003c/li\u003e\n\u003cli\u003eLuna 또는 Terra가 테스트 결과와 코드 차이를 평가한다.\u003c/li\u003e\n\u003cli\u003e실패 가능성이 높거나 중요한 결론만 Sol이 다시 검토한다.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003e이 구조는 모든 단계에 Sol을 쓰는 방식보다 비용을 낮추면서 중요한 판단에 높은 추론 능력을 집중할 수 있다. 단, 모델을 나누면 라우팅 규칙, 오류 처리, 로그 추적과 평가 체계를 별도로 설계해야 한다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EA%B0%80%EA%B2%A9-%EC%9D%B8%ED%95%98%EB%A5%BC-%EB%92%B7%EB%B0%9B%EC%B9%A8%ED%95%9C-%EC%84%B8-%EA%B0%80%EC%A7%80-%ED%9A%A8%EC%9C%A8-%EA%B3%84%EC%B8%B5\" class=\"anchor\" id=\"가격-인하를-뒷받침한-세-가지-효율-계층\"\u003e\u003c/a\u003e가격 인하를 뒷받침한 세 가지 효율 계층\u003c/h2\u003e\n\u003cp\u003eOpenAI는 비용 절감이 단순한 가격 정책이 아니라 세 계층의 기술적 개선에서 나왔다고 설명한다.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003e모델 자체의 토큰 효율\u003c/li\u003e\n\u003cli\u003e추론 시스템의 하드웨어 효율\u003c/li\u003e\n\u003cli\u003e모델·도구·컨텍스트를 연결하는 에이전트 하네스의 효율\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003e이 설명은 OpenAI가 공개한 기술 자료를 바탕으로 하며, 세부 비용 구조 전체가 외부에 공개된 것은 아니다. 따라서 가격 인하 중 기술 효율과 전략적 가격 정책이 각각 얼마나 기여했는지는 외부에서 확정하기 어렵다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EB%AA%A8%EB%8D%B8%EA%B3%BC-%EC%B6%94%EB%A1%A0-%EC%8B%9C%EC%8A%A4%ED%85%9C-%EC%B5%9C%EC%A0%81%ED%99%94\" class=\"anchor\" id=\"모델과-추론-시스템-최적화\"\u003e\u003c/a\u003e모델과 추론 시스템 최적화\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#%ED%86%A0%ED%81%B0%EB%8B%B9-%EC%9E%91%EC%97%85-%EC%88%98%ED%96%89%EB%9F%89-%EA%B0%9C%EC%84%A0\" class=\"anchor\" id=\"토큰당-작업-수행량-개선\"\u003e\u003c/a\u003e토큰당 작업 수행량 개선\u003c/h3\u003e\n\u003cp\u003eGPT-5.6은 작업 성공률뿐 아니라 처리 효율도 함께 최적화하도록 훈련됐다는 것이 OpenAI의 설명이다. 불필요하게 긴 추론이나 반복을 줄이고 더 적은 토큰으로 필요한 결과에 도달하도록 설계해 토큰당 지능과 작업 수행량을 높였다는 의미다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%EB%B6%80%ED%95%98-%EB%B6%84%EC%82%B0%EA%B3%BC-%EC%9A%94%EC%B2%AD-%EB%9D%BC%EC%9A%B0%ED%8C%85\" class=\"anchor\" id=\"부하-분산과-요청-라우팅\"\u003e\u003c/a\u003e부하 분산과 요청 라우팅\u003c/h3\u003e\n\u003cp\u003e추론 시스템은 지역, 가용 용량, 가속기 종류를 기준으로 요청을 데이터센터와 클러스터에 분배한다. 클러스터 내부에서는 현재 부하, 입력 컨텍스트 길이, 캐시 사용 가능성, 요청 특성 등을 고려해 모델 인스턴스를 선택한다.\u003c/p\u003e\n\u003cp\u003eOpenAI는 GPT-5.6 Sol과 Codex를 프로덕션 트래픽 분석, 부하 불균형 원인 탐색, 라우팅 전략 시험과 휴리스틱 조정에 활용했다고 밝혔다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpu-%EC%BB%A4%EB%84%90-%EC%B5%9C%EC%A0%81%ED%99%94\" class=\"anchor\" id=\"gpu-커널-최적화\"\u003e\u003c/a\u003eGPU 커널 최적화\u003c/h3\u003e\n\u003cp\u003eGPU 커널은 모델의 수학 연산을 하드웨어에서 실행하는 핵심 코드다. 메모리 이동, 동기화, 데이터 배열과 병렬화 방식에 따라 같은 GPU에서도 처리 비용이 달라진다.\u003c/p\u003e\n\u003cp\u003eOpenAI에 따르면 GPT-5.6 Sol은 Codex 환경에서 Triton과 Gluon을 사용해 프로덕션 커널을 작성하고 최적화하는 데 참여했다. 커널 개선과 관련 최적화를 합친 결과 모델 제공의 종단 간 비용이 20% 줄었다고 회사는 밝혔다.\u003c/p\u003e\n\u003cp\u003e종단 간 비용은 특정 연산 하나가 아니라 라우팅, 데이터 이동, 모델 실행과 출력 생성 등 실제 요청 처리 전체에 드는 비용을 뜻한다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%EC%BB%A4%EB%84%90%EC%9D%98-%EC%A0%95%ED%99%95%EC%84%B1-%EA%B2%80%EC%A6%9D\" class=\"anchor\" id=\"커널의-정확성-검증\"\u003e\u003c/a\u003e커널의 정확성 검증\u003c/h3\u003e\n\u003cp\u003e빠른 커널도 수치적으로 잘못된 결과를 만들면 사용할 수 없다. OpenAI는 AI가 작성한 커널의 정확성을 점검하기 위해 FpSan을 포함한 검증 도구에 투자했다고 설명한다. FpSan은 Floating-Point Sanitizer의 약자로 부동소수점 연산 관련 오류를 탐지하는 오픈소스 도구다.\u003c/p\u003e\n\u003cp\u003e이는 AI가 프로덕션 인프라 코드를 생성할 때 성능 벤치마크뿐 아니라 수치 검증, 회귀 테스트, 실패 시 복구 절차가 함께 필요하다는 점을 보여준다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EC%B6%94%EC%B8%A1-%EB%94%94%EC%BD%94%EB%94%A9%EA%B3%BC-kv-%EC%BA%90%EC%8B%9C\" class=\"anchor\" id=\"추측-디코딩과-kv-캐시\"\u003e\u003c/a\u003e추측 디코딩과 KV 캐시\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#%EC%B6%94%EC%B8%A1-%EB%94%94%EC%BD%94%EB%94%A9\" class=\"anchor\" id=\"추측-디코딩\"\u003e\u003c/a\u003e추측 디코딩\u003c/h3\u003e\n\u003cp\u003e추측 디코딩은 작은 초안 모델이 앞으로 생성될 토큰을 먼저 제안하고, 큰 주 모델이 여러 후보를 병렬로 검증하는 방식이다. 제안이 받아들여지면 주 모델의 비싼 순차 계산 횟수를 줄일 수 있다.\u003c/p\u003e\n\u003cp\u003eOpenAI는 GPT-5.6 Sol이 초안 모델의 크기와 구조를 바꾸는 수백 건의 실험을 설계·실행하고 학습을 모니터링했다고 밝혔다. 그 결과 토큰 생성 효율이 15% 이상 향상됐다는 설명이다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#kv-%EC%BA%90%EC%8B%9C%EC%99%80-%EC%9B%8C%ED%81%AC%EB%A1%9C%EB%93%9C%EB%B3%84-%EC%84%A4%EC%A0%95\" class=\"anchor\" id=\"kv-캐시와-워크로드별-설정\"\u003e\u003c/a\u003eKV 캐시와 워크로드별 설정\u003c/h3\u003e\n\u003cp\u003e모델은 입력을 처리하면서 Key-Value 캐시, 즉 KV 캐시를 만든다. 최적 설정은 입력과 출력 길이, 배치 크기, 캐시 적중률, 동시 요청 수, 메모리 용량과 모델 샤딩 방식에 따라 달라진다.\u003c/p\u003e\n\u003cp\u003eOpenAI는 Sol과 Codex로 실제 워크로드를 분석하고 설정 후보를 평가해 작업 유형별 엔진 구성을 세밀하게 조정했다고 설명한다. 목적은 같은 하드웨어에서 더 많은 요청을 처리하는 것이다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EC%97%90%EC%9D%B4%EC%A0%84%ED%8A%B8-%ED%95%98%EB%84%A4%EC%8A%A4%EC%99%80-%EC%BB%A8%ED%85%8D%EC%8A%A4%ED%8A%B8-%EB%B9%84%EC%9A%A9\" class=\"anchor\" id=\"에이전트-하네스와-컨텍스트-비용\"\u003e\u003c/a\u003e에이전트 하네스와 컨텍스트 비용\u003c/h2\u003e\n\u003cp\u003e에이전트는 한 번의 사용자 요청을 해결하기 위해 모델과 도구를 여러 번 호출한다. 모델 호출이 30번 필요한 작업에서 각 호출에 1초의 불필요한 지연이 발생하면 전체 지연은 약 30초 늘어날 수 있다.\u003c/p\u003e\n\u003cp\u003eOpenAI는 모델, 도구, 사용자 환경을 연결하는 Rust 기반 오케스트레이션 계층을 에이전트 하네스로 설명한다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%ED%95%84%EC%9A%94%ED%95%9C-%EB%8F%84%EA%B5%AC%EB%A7%8C-%EC%A7%80%EC%97%B0-%EB%85%B8%EC%B6%9C\" class=\"anchor\" id=\"필요한-도구만-지연-노출\"\u003e\u003c/a\u003e필요한 도구만 지연 노출\u003c/h3\u003e\n\u003cp\u003e도구, 플러그인, 스킬, MCP 통합 정보를 처음부터 모두 프롬프트에 넣으면 입력 토큰과 지연시간이 증가한다. 하네스는 필요한 시점에만 관련 도구 정보를 노출하는 지연 탐색 방식을 사용한다. 도구 출력은 모델이 별도 한도를 요청하지 않는 한 기본적으로 1만 토큰으로 제한된다고 OpenAI는 밝혔다.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#%EC%A0%95%ED%99%95%ED%95%9C-%EC%A0%91%EB%91%90%EC%82%AC-%EB%B3%B4%EC%A1%B4%EA%B3%BC-%ED%94%84%EB%A1%AC%ED%94%84%ED%8A%B8-%EC%BA%90%EC%8B%9C\" class=\"anchor\" id=\"정확한-접두사-보존과-프롬프트-캐시\"\u003e\u003c/a\u003e정확한 접두사 보존과 프롬프트 캐시\u003c/h3\u003e\n\u003cp\u003e프롬프트 캐싱은 이전에 처리한 입력의 동일한 앞부분을 재사용해 중복 연산을 줄인다. 캐시를 재사용하려면 프롬프트 접두사가 정확히 일치해야 한다.\u003c/p\u003e\n\u003cp\u003eOpenAI의 하네스는 기록을 추가 전용 구조로 관리하고 새 메시지와 도구 결과를 끝에 붙인다. 도구는 결정론적인 순서로 제시하며 승인 정책 같은 실행 설정은 도구 정의 자체를 바꾸지 않고 런타임에 적용한다. 이 방식은 반복적인 에이전트 루프의 캐시 적중률을 높이는 데 유리하다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EA%B8%B0%EC%97%85-%EC%82%AC%EB%A1%80-%EC%88%98%EC%B9%98%EB%A5%BC-%EC%9D%BD%EB%8A%94-%EB%B0%A9%EB%B2%95\" class=\"anchor\" id=\"기업-사례-수치를-읽는-방법\"\u003e\u003c/a\u003e기업 사례 수치를 읽는 방법\u003c/h2\u003e\n\u003cp\u003eOpenAI 공식 발표에는 Replit, Notion, Ramp, Blitzy, Cognition, Dust 등의 평가가 포함됐다.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNotion은 자체 평가에서 Terra가 GPT-5.5와 비슷한 품질을 작업당 절반의 비용과 60% 짧은 시간으로 제공했다고 밝혔다.\u003c/li\u003e\n\u003cli\u003eBlitzy는 Luna 적용 후 프롬프트 캐시 재사용률이 24%에서 90%로 상승했으며 이전 기본 모델보다 비용이 87% 낮았다고 설명했다.\u003c/li\u003e\n\u003cli\u003eDust는 같은 에이전트 업무에서 Luna가 이전 기본 모델보다 40% 빠르고 40% 저렴했다고 밝혔다.\u003c/li\u003e\n\u003cli\u003eRamp 측은 Luna를 백그라운드 에이전트 자동화의 기본 모델로 사용한다고 밝혔다.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003e이 수치는 각 기업의 내부 작업, 프롬프트, 평가 기준과 시스템 구조에서 측정한 사례다. 독립적인 공통 벤치마크가 아니므로 다른 조직의 업무에 그대로 적용해서는 안 된다. 도입 전에는 실제 데이터와 오류 비용을 반영한 자체 평가가 필요하다.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EB%8F%84%EC%9E%85-%EC%A0%84-%EA%B2%80%EC%A6%9D-%EC%B2%B4%ED%81%AC%EB%A6%AC%EC%8A%A4%ED%8A%B8\" class=\"anchor\" id=\"도입-전-검증-체크리스트\"\u003e\u003c/a\u003e도입 전 검증 체크리스트\u003c/h2\u003e\n\u003col\u003e\n\u003cli\u003e대표 작업 표본과 정답 또는 평가 기준을 준비한다.\u003c/li\u003e\n\u003cli\u003eLuna, Terra, Sol의 성공률과 재시도율을 같은 조건에서 비교한다.\u003c/li\u003e\n\u003cli\u003e토큰 비용뿐 아니라 도구 호출, 검토 인력, 실패 복구 비용을 포함한다.\u003c/li\u003e\n\u003cli\u003e평균 지연시간과 함께 상위 95% 또는 99% 지연시간을 측정한다.\u003c/li\u003e\n\u003cli\u003e자동 테스트나 스키마 검증이 가능한 단계를 저가 모델 후보로 분류한다.\u003c/li\u003e\n\u003cli\u003e개인정보, 보안, 규제 관련 작업에는 별도의 승인과 기록 정책을 적용한다.\u003c/li\u003e\n\u003cli\u003e저신뢰 결과를 Terra 또는 Sol로 승격하는 라우팅 기준을 정한다.\u003c/li\u003e\n\u003cli\u003eFast mode의 추가 비용보다 지연 감소의 가치가 큰지 실제 트래픽으로 검증한다.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#%EC%9D%98%EB%AF%B8%EC%99%80-%ED%95%9C%EA%B3%84\" class=\"anchor\" id=\"의미와-한계\"\u003e\u003c/a\u003e의미와 한계\u003c/h2\u003e\n\u003cp\u003e이번 개편은 AI 모델 경쟁의 기준이 최고 점수 하나에서 결과당 비용으로 이동하고 있음을 보여준다. 대규모 반복 작업에는 Luna, 일상적인 지식 업무에는 Terra, 모호하고 중요한 판단에는 Sol을 배치하면 지능·속도·비용을 업무별로 조합할 수 있다.\u003c/p\u003e\n\u003cp\u003e다만 80% 가격 인하가 기술 효율 개선과 시장 전략에서 각각 얼마나 비롯됐는지는 공개 정보만으로 분리하기 어렵다. 또한 저가 모델의 경제성은 토큰 가격만으로 결정되지 않는다. 오류율이 높아 재시도와 사람 검토가 늘어나면 전체 작업 비용이 오를 수 있다.\u003c/p\u003e\n\u003cp\u003e따라서 핵심 지표는 모델 호출 1회의 가격이 아니라 검증을 통과한 결과 1건을 만드는 데 든 총비용이다. 모델별 성공률, 재시도 횟수, 지연시간, 검토 비용을 함께 측정해야 GPT-5.6의 가격 인하가 실제 사업 가치로 이어지는지 판단할 수 있다.\u003c/p\u003e\n","tags":["OpenAI","GPT-5.6","API 가격","추론 효율","에이전트"],"faqs":[{"question":"GPT-5.6 Luna의 변경된 API 가격은 얼마인가요?","answer":"2026년 7월 30일 기준 Luna는 입력 100만 토큰당 0.20달러, 출력 100만 토큰당 1.20달러다. OpenAI가 발표한 기존 가격 대비 인하 폭은 80%다."},{"question":"GPT-5.6 Terra의 변경된 API 가격은 얼마인가요?","answer":"Terra는 입력 100만 토큰당 2달러, 출력 100만 토큰당 12달러다. OpenAI가 발표한 가격 인하 폭은 20%다."},{"question":"GPT-5.6 Sol의 가격도 인하됐나요?","answer":"아니다. OpenAI의 이번 발표에서 Sol의 Standard 처리 가격은 변경되지 않았다. 대신 Standard보다 최대 2.5배 빠르고 가격이 2배인 Fast mode가 추가됐다."},{"question":"Fast mode를 사용하면 모델의 답변 품질이 낮아지나요?","answer":"OpenAI는 Fast mode가 Sol의 지능 수준을 낮추지 않고 처리 속도를 높인다고 설명한다. 다만 최대 2.5배라는 속도는 상한 표현이며 실제 지연시간은 요청 길이, 출력량, 도구 호출과 시스템 부하에 따라 달라질 수 있다."},{"question":"기존 Priority Processing 요청을 수정해야 하나요?","answer":"OpenAI 발표 기준 기존 API 요청의 `priority` 태그는 계속 작동하며 자동으로 Fast mode 처리에 연결된다. 운영 환경에서는 적용 시점과 실제 청구 내역을 별도로 확인하는 것이 안전하다."},{"question":"어떤 작업에 Luna를 사용하는 것이 적합한가요?","answer":"규칙과 기대 출력이 명확하고 자동 검증할 수 있는 대량·반복 작업에 적합하다. 문서 분류, 데이터 추출, 반복 코드 수정, 테스트 실행, 콘텐츠 검토와 백그라운드 자동화가 대표적인 예다."},{"question":"Terra와 Luna 중 어떤 모델을 선택해야 하나요?","answer":"낮은 비용과 높은 처리량이 우선이고 작업이 명확하면 Luna부터 평가할 수 있다. 더 많은 맥락 이해와 판단력이 필요하지만 Sol 수준의 고급 추론까지 필요하지 않다면 Terra가 적합할 수 있다."},{"question":"모든 에이전트 단계에 Sol을 사용하면 안 되나요?","answer":"사용할 수 있지만 비용 효율이 낮아질 수 있다. Sol이 계획과 고위험 판단을 맡고 Luna나 Terra가 명확한 실행·테스트를 처리하도록 분리하면 중요한 단계의 품질을 유지하면서 전체 비용을 줄일 가능성이 있다."},{"question":"Luna의 6% 작업 비용은 토큰 단가 비교인가요?","answer":"아니다. OpenAI가 말한 약 6%는 비교 대상과 비슷한 작업 결과를 얻는 데 필요한 추정 작업당 비용이다. 토큰 단가만 직접 나눈 수치가 아니며 평가 과제와 성공률이 포함된 비교로 이해해야 한다."},{"question":"API 모델의 실제 경제성은 어떻게 평가해야 하나요?","answer":"토큰 가격뿐 아니라 성공률, 재시도 횟수, 도구 호출 비용, 응답 지연, 사람의 검토 시간과 오류 복구 비용을 포함해야 한다. 가장 유용한 지표는 검증을 통과한 결과 1건당 총비용이다."}],"sources":[{"url":"https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/","title":"Advancing the price-performance frontier with GPT-5.6 | OpenAI","type":"source"},{"url":"https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/","title":"How GPT-5.6 fuses frontier intelligence with frontier efficiency | OpenAI","type":"source"}],"images":[{"id":395,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--5c50f46b468b0057808eb3e6351730cbce2f4b78/ai-4f6037ef.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"퍼즐, AI 칩 계층, 작업 컨베이어, 감소하는 동전 더미로 표현한 모델 선택 흐름","caption":"AI 모델의 작업 분배와 비용 절감, 검증 과정을 시각화한 개념도다.","description":null},"en":{"alt":"Model selection flow with puzzles, layered AI chips, a task conveyor, and shrinking coin stacks","caption":"The diagram visualizes AI task routing, cost reduction, and output verification.","description":null},"ja":{"alt":"パズル、階層化AIチップ、タスク用コンベア、減っていくコインで示すモデル選択フロー","caption":"AIモデルのタスク振り分け、コスト削減、検証の流れを表した概念図。","description":null},"es":{"alt":"Flujo de selección de modelos con piezas, chips de IA, cinta de tareas y pilas de monedas decrecientes","caption":"El diagrama representa la asignación de tareas, la reducción de costes y la verificación con IA.","description":null},"id":{"alt":"Alur pemilihan model dengan puzzle, chip AI bertingkat, konveyor tugas, dan tumpukan koin yang menyusut","caption":"Diagram ini menggambarkan perutean tugas AI, penghematan biaya, dan verifikasi hasil.","description":null},"pt":{"alt":"Fluxo de seleção de modelos com peças, chips de IA, esteira de tarefas e pilhas de moedas decrescentes","caption":"O diagrama mostra o roteamento de tarefas, a redução de custos e a verificação por IA.","description":null},"zh-hant":{"alt":"以拼圖、分層 AI 晶片、任務輸送帶與遞減硬幣堆呈現模型選擇流程","caption":"此概念圖呈現 AI 任務分流、成本降低與結果驗證流程。","description":null},"de":{"alt":"Modellauswahl mit Puzzleteilen, gestaffelten KI-Chips, Aufgabenband und schrumpfenden Münzstapeln","caption":"Die Grafik veranschaulicht KI-Aufgabenverteilung, Kostensenkung und Ergebnisprüfung.","description":null}}},{"id":396,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY3NSwicHVyIjoiYmxvYl9pZCJ9fQ==--920476799a53738205d619a3a057685b5af9d05d/ai-334533bc.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 모델별 처리 흐름과 속도, 비용, 하드웨어 구성을 비교한 인포그래픽","caption":"세 가지 AI 처리 경로의 성능과 비용 차이 및 연결된 인프라를 시각화한다.","description":null},"en":{"alt":"Infographic comparing AI model processing flows, speed, cost, and hardware infrastructure","caption":"Three AI processing paths visualize differences in performance, cost, and connected infrastructure.","description":null},"ja":{"alt":"AIモデル別の処理フロー、速度、コスト、ハードウェア構成を比較する図","caption":"3つのAI処理経路について、性能とコスト、接続インフラの違いを可視化している。","description":null},"es":{"alt":"Infografía comparativa de flujos, velocidad, coste e infraestructura de modelos de IA","caption":"Tres rutas de procesamiento de IA muestran diferencias de rendimiento, coste e infraestructura conectada.","description":null},"id":{"alt":"Infografik perbandingan alur, kecepatan, biaya, dan infrastruktur perangkat keras model AI","caption":"Tiga jalur pemrosesan AI memperlihatkan perbedaan kinerja, biaya, dan infrastruktur yang terhubung.","description":null},"pt":{"alt":"Infográfico comparando fluxos, velocidade, custo e infraestrutura de modelos de IA","caption":"Três rotas de processamento de IA mostram diferenças de desempenho, custo e infraestrutura conectada.","description":null},"zh-hant":{"alt":"比較各種 AI 模型處理流程、速度、成本與硬體架構的資訊圖表","caption":"三條 AI 處理路徑呈現效能、成本與連接基礎設施的差異。","description":null},"de":{"alt":"Infografik zum Vergleich von KI-Modellabläufen, Geschwindigkeit, Kosten und Hardware","caption":"Drei KI-Verarbeitungspfade zeigen Unterschiede bei Leistung, Kosten und verbundener Infrastruktur.","description":null}}},{"id":397,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY4MSwicHVyIjoiYmxvYl9pZCJ9fQ==--06646a4df935b106736b85a79416e02dcc8d90cc/ai-ee49e3ec.webp","is_representative":false,"generation_method":"ai_infographic","license":"ai_generated","mime_type":"image/webp","visible_locales":["ko"],"translations":{"ko":{"alt":"GPT-5.6 가격·속도 개편과 Luna·Terra·Sol 모델 선택 전략을 5단계로 정리한 인포그래픽","caption":"Luna 80%·Terra 20% 가격 인하, Sol Fast의 최대 2.5배 속도와 단계별 모델 배치를 요약한다.","description":null},"en":{"alt":"GPT-5.6 pricing and speed changes with a five-step strategy for choosing Luna, Terra, and Sol","caption":"It summarizes Luna and Terra price cuts, Sol Fast’s 2.5× speed, and staged model deployment.","description":null},"ja":{"alt":"GPT-5.6の価格・速度改定とLuna・Terra・Solの選択戦略を5段階で示す図解","caption":"Lunaは80％、Terraは20％の値下げ、Sol Fastは最大2.5倍の高速化と段階的なモデル配置を示す。","description":null},"es":{"alt":"Cambios de precio y velocidad de GPT-5.6 y estrategia en cinco pasos para Luna, Terra y Sol","caption":"Resume las rebajas de Luna y Terra, la velocidad 2,5 veces mayor de Sol Fast y el uso escalonado de modelos.","description":null},"id":{"alt":"Perubahan harga dan kecepatan GPT-5.6 serta strategi lima tahap untuk Luna, Terra, dan Sol","caption":"Infografik merangkum potongan harga Luna dan Terra, Sol Fast hingga 2,5 kali lebih cepat, dan penerapan model bertahap.","description":null},"pt":{"alt":"Mudanças de preço e velocidade do GPT-5.6 e estratégia em cinco etapas para Luna, Terra e Sol","caption":"O gráfico resume os cortes de preço de Luna e Terra, o Sol Fast até 2,5 vezes mais rápido e a implantação por etapas.","description":null},"zh-hant":{"alt":"GPT-5.6 價格與速度調整，以及 Luna、Terra、Sol 五階段模型選擇策略資訊圖","caption":"圖表整理 Luna 降價 80%、Terra 降價 20%、Sol Fast 最高快 2.5 倍及分階段模型配置。","description":null},"de":{"alt":"GPT-5.6-Infografik zu Preisen, Tempo und der Modellwahl für Luna, Terra und Sol in fünf Schritten","caption":"Die Grafik fasst Preissenkungen für Luna und Terra, Sol Fast mit bis zu 2,5-fachem Tempo und den gestuften Modelleinsatz zusammen.","description":null}}}],"published_at":"2026-08-01T07:15:42+09:00","updated_at":"2026-08-01T07:15:42+09:00","license":"cc_by","translation_status":"original","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/ko/articles/openai-gpt-5-6-price-performance-model-routing"}