{"content_id":"aillofw1zj","slug":"openai-gpt-5-6-price-performance-model-routing","locale":"id","schema_type":"TechArticle","category":"ai_data","category_name":"Data AI","title":"Perombakan Harga dan Kecepatan OpenAI GPT-5.6 serta Strategi Pemilihan Model","summary":"Mulai 30 Juli 2026, OpenAI menurunkan harga API GPT-5.6 Luna dan Terra masing-masing sebesar 80% dan 20%, serta memperkenalkan Fast mode pada Sol. Perombakan ini berfokus pada strategi menekan biaya per hasil dengan menempatkan model sesuai tahap perencanaan, eksekusi, dan verifikasi, alih-alih menggunakan model teratas untuk semua pekerjaan.","author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["Harga API GPT-5.6 Luna diturunkan menjadi 0.20 dolar per 1 juta token input dan 1.20 dolar per 1 juta token output.","Harga API GPT-5.6 Terra diturunkan menjadi 2 dolar per 1 juta token input dan 12 dolar per 1 juta token output.","Menurut pengumuman, Fast mode GPT-5.6 Sol hingga 2.5 kali lebih cepat daripada pemrosesan Standard, dengan harga 2 kali lipat, sekaligus mempertahankan tingkat kecerdasan model.","Perusahaan dapat menerapkan konfigurasi berjenjang dengan Sol untuk pertimbangan dan perencanaan yang kompleks, serta Luna atau Terra untuk menangani eksekusi dan verifikasi berulang.","OpenAI menjelaskan bahwa optimalisasi bersama atas model, infrastruktur penalaran, dan harness agen memungkinkan penurunan harga serta peningkatan throughput."],"content_markdown":"OpenAI menghubungkan peningkatan efisiensi operasional lini produk GPT-5.6 dengan penurunan harga API dan peningkatan kecepatan pemrosesan. Intinya bukan menerapkan satu model terkuat untuk semua pekerjaan, melainkan mengombinasikan Sol, Terra, dan Luna berdasarkan tingkat risiko, kompleksitas, latensi, serta keterverifikasian pekerjaan untuk menurunkan biaya per hasil.\n\nAngka harga dan kinerja mengacu pada pengumuman OpenAI tanggal 30 Juli 2026. Tolok ukur pelanggan dan angka peningkatan efisiensi merupakan hasil pengukuran OpenAI atau perusahaan yang dikutip dalam pengumuman, sehingga tidak dapat dianggap akan direproduksi secara identik di semua lingkungan.\n\n## Perubahan harga API pada 30 Juli 2026\n\nHarga API GPT-5.6 Luna dan Terra yang telah diubah adalah sebagai berikut.\n\n| Model | 1 juta token input | 1 juta token output | Besaran penurunan | Peran utama |\n|---|---:|---:|---:|---|\n| GPT-5.6 Luna | 0.20 dolar | 1.20 dolar | 80% | Pemrosesan massal, pekerjaan berulang, tugas eksekusi yang jelas |\n| GPT-5.6 Terra | 2 dolar | 12 dolar | 20% | Pekerjaan sehari-hari yang memerlukan keseimbangan kualitas, biaya, dan kecepatan |\n| GPT-5.6 Sol | Tidak berubah dalam pengumuman | Tidak berubah dalam pengumuman | Tidak ada | Penalaran kompleks, perencanaan, pengambilan keputusan penting |\n\nHarga langganan berbayar ChatGPT dan Codex maupun keseluruhan anggaran kuota tidak berubah akibat pengumuman ini. Namun, kredit yang dikurangi saat menggunakan Terra dan Luna menjadi lebih sedikit. OpenAI menjelaskan bahwa perubahan harga melalui AWS akan diterapkan secara bertahap mulai akhir 30 Juli.\n\n### Contoh perhitungan biaya API\n\nBiaya token dapat dihitung sebagai berikut.\n\n`Total biaya = jumlah token input ÷ 1,000,000 × tarif input + jumlah token output ÷ 1,000,000 × tarif output`\n\nSebagai contoh, jika memproses 10 juta token input dan 2 juta token output, biaya berdasarkan tarif token sederhana adalah sebagai berikut.\n\n| Model | Biaya input | Biaya output | Total |\n|---|---:|---:|---:|\n| Luna | 2 dolar | 2.40 dolar | 4.40 dolar |\n| Terra | 20 dolar | 24 dolar | 44 dolar |\n\nJumlah tagihan sebenarnya dapat dipengaruhi oleh ketentuan setiap layanan, seperti penerapan cache, metode pemrosesan yang dipilih, dan struktur pemanggilan alat.\n\n## Peran lini produk GPT-5.6\n\nGPT-5.6 bukan satu model tunggal, melainkan lini produk berjenjang dengan biaya dan kinerja yang berbeda.\n\n### GPT-5.6 Sol\n\nSol menangani penalaran tingkat tertinggi dan penyelesaian masalah yang kompleks. Model ini cocok untuk keputusan dengan persyaratan ambigu atau biaya kegagalan tinggi, perencanaan jangka panjang, serta peninjauan hasil penting.\n\n### GPT-5.6 Terra\n\nTerra bertujuan menyeimbangkan kinerja, biaya, dan kecepatan respons. Model ini cocok untuk pekerjaan yang membutuhkan kemampuan penilaian lebih tinggi daripada Luna, tetapi tidak selalu perlu menggunakan Sol, seperti tanya jawab internal organisasi, tugas agen dengan cakupan tertentu, serta analisis dan coding umum.\n\n### GPT-5.6 Luna\n\nLuna adalah jenjang yang paling cepat dan murah. Selain pembuatan kalimat pendek yang sederhana, model ini mendukung pemanggilan alat dan alur kerja multilangkah, sehingga dapat digunakan sebagai model eksekusi untuk mengulangi pekerjaan yang didefinisikan dengan jelas dalam skala besar.\n\nContoh pekerjaan penerapannya adalah sebagai berikut.\n\n- Klasifikasi dokumen dan pertanyaan pelanggan dalam jumlah besar\n- Ekstraksi data terstruktur\n- Modifikasi kode berulang\n- Penulisan dan pelaksanaan pengujian\n- Pembuatan dokumen dengan aturan yang jelas\n- Peninjauan konten dalam skala besar\n- Otomatisasi agen latar belakang\n- Bantuan riset berulang\n\nOpenAI mengklaim Luna memberikan tingkat kinerja yang serupa dengan model yang dinilai sebagai model mutakhir satu tahun lalu, dengan biaya sekitar 6% per pekerjaan yang diperkirakan dan kecepatan hampir 9 kali lipat. Angka 6% di sini bukan perbandingan langsung tarif token, melainkan nilai perbandingan perkiraan biaya untuk memperoleh hasil pekerjaan yang sama.\n\n## Karakteristik Fast mode Sol\n\nFast mode untuk API diperkenalkan pada GPT-5.6 Sol. Mode ini menggantikan Priority Processing yang sudah ada dan merupakan konsep yang sepadan dengan fitur `/fast` pada Codex.\n\n| Item | Fast mode |\n|---|---|\n| Kecepatan | Hingga 2.5 kali lebih cepat daripada pemrosesan Standard |\n| Kecerdasan model | Sama dengan Standard menurut pengumuman OpenAI |\n| Harga | 2 kali harga pemrosesan Standard |\n| Kompatibilitas sebelumnya | Permintaan dengan tag `priority` diproses secara otomatis sebagai Fast mode |\n\nPernyataan hingga 2.5 kali lebih cepat pada Fast mode bukan jaminan bahwa latensi semua permintaan akan berkurang dengan rasio yang persis sama. Kecepatan yang benar-benar dirasakan dapat berbeda bergantung pada panjang prompt, panjang output, beban layanan, dan jumlah pemanggilan alat.\n\n### Kondisi yang cocok untuk Fast mode\n\n- Layanan waktu nyata ketika pengguna menunggu respons\n- Lingkungan pengembangan yang mengulangi modifikasi dan pemeriksaan kode dengan cepat\n- Pekerjaan ketika pemanggilan Sol menentukan latensi keseluruhan agen\n- Situasi ketika keterlambatan beberapa menit pun penting, seperti respons insiden atau analisis gangguan\n- Pekerjaan ketika biaya akibat keterlambatan pemrosesan lebih besar daripada biaya API tambahan\n\nUntuk pekerjaan yang waktu penyelesaiannya tidak mendesak, seperti batch latar belakang, analisis malam hari, dan pemrosesan asinkron, pemrosesan Standard mungkin lebih ekonomis.\n\n## Kriteria pemilihan model yang berorientasi pada hasil\n\nPemilihan model bukan sekadar memilih model dengan posisi tertinggi di papan peringkat. Pertanyaan berikut perlu ditinjau untuk setiap pekerjaan.\n\n| Faktor penilaian | Pertanyaan yang perlu diperiksa |\n|---|---|\n| Dampak kegagalan | Apa dampak kesalahan terhadap pelanggan, pendapatan, keamanan, atau kepatuhan regulasi? |\n| Toleransi kesalahan | Dapatkah manusia meninjau atau aturan otomatis mendeteksi kesalahan? |\n| Latensi | Apakah pengguna menunggu secara waktu nyata, atau dapatkah diproses secara asinkron? |\n| Volume pemrosesan | Berapa banyak kasus yang harus diproses per hari atau per bulan? |\n| Kejelasan masalah | Apakah input, aturan, dan output yang diharapkan telah didefinisikan dengan memadai? |\n| Nilai penalaran | Apakah penalaran yang lebih kuat benar-benar meningkatkan kualitas hasil secara signifikan? |\n| Keterverifikasian | Dapatkah hasil dinilai melalui pengujian, skema, atau pemeriksaan silang? |\n\nPekerjaan yang jelas dan dapat diverifikasi secara otomatis kemungkinan besar cocok untuk Luna. Jika memerlukan kemampuan penilaian tertentu, Terra dapat dipertimbangkan. Sol cocok untuk mengatasi ambiguitas, mengambil keputusan berisiko tinggi, atau meninjau secara final konsekuensi kegagalan.\n\n## Struktur perencanaan dengan Sol dan eksekusi dengan Luna\n\nDalam satu pekerjaan agen pun, model yang berbeda dapat ditempatkan pada setiap tahap. Sebagai contoh, agen coding dapat disusun sebagai berikut.\n\n1. Sol menemukan ambiguitas persyaratan dan menyusun pertanyaan.\n2. Sol menentukan rencana implementasi, cakupan perubahan, dan faktor risiko.\n3. Luna mengimplementasikan perubahan yang telah diperjelas menjadi kode.\n4. Luna menulis dan menjalankan pengujian.\n5. Luna atau Terra mengevaluasi hasil pengujian dan perbedaan kode.\n6. Sol meninjau kembali hanya kesimpulan penting atau yang memiliki kemungkinan kegagalan tinggi.\n\nStruktur ini dapat menurunkan biaya dibandingkan penggunaan Sol pada semua tahap, sekaligus memusatkan kemampuan penalaran tinggi pada keputusan penting. Namun, jika model dipisahkan, aturan perutean, penanganan kesalahan, pelacakan log, dan sistem evaluasi harus dirancang secara terpisah.\n\n## Tiga lapisan efisiensi yang mendukung penurunan harga\n\nOpenAI menjelaskan bahwa penghematan biaya bukan sekadar kebijakan harga, melainkan berasal dari peningkatan teknis pada tiga lapisan.\n\n1. Efisiensi token model itu sendiri\n2. Efisiensi perangkat keras pada sistem inferensi\n3. Efisiensi harness agen yang menghubungkan model, alat, dan konteks\n\nPenjelasan ini didasarkan pada materi teknis yang dipublikasikan OpenAI, dan keseluruhan rincian struktur biaya tidak diungkapkan kepada publik. Karena itu, sulit untuk memastikan dari luar seberapa besar kontribusi efisiensi teknis dan kebijakan harga strategis terhadap penurunan harga.\n\n## Optimalisasi model dan sistem inferensi\n\n### Peningkatan jumlah pekerjaan per token\n\nMenurut penjelasan OpenAI, GPT-5.6 dilatih untuk mengoptimalkan bukan hanya tingkat keberhasilan pekerjaan, tetapi juga efisiensi pemrosesan. Artinya, model ini dirancang untuk mengurangi penalaran atau pengulangan yang tidak perlu dan mencapai hasil yang dibutuhkan dengan lebih sedikit token, sehingga meningkatkan kecerdasan dan jumlah pekerjaan per token.\n\n### Penyeimbangan beban dan perutean permintaan\n\nSistem inferensi mendistribusikan permintaan ke pusat data dan klaster berdasarkan wilayah, kapasitas yang tersedia, dan jenis akselerator. Di dalam klaster, instans model dipilih dengan mempertimbangkan beban saat ini, panjang konteks input, kemungkinan penggunaan cache, dan karakteristik permintaan.\n\nOpenAI menyatakan telah menggunakan GPT-5.6 Sol dan Codex untuk menganalisis lalu lintas produksi, menelusuri penyebab ketidakseimbangan beban, menguji strategi perutean, dan menyesuaikan heuristik.\n\n### Optimalisasi kernel GPU\n\nKernel GPU adalah kode inti yang menjalankan operasi matematis model pada perangkat keras. Biaya pemrosesan dapat berbeda bahkan pada GPU yang sama, bergantung pada perpindahan memori, sinkronisasi, susunan data, dan metode paralelisasi.\n\nMenurut OpenAI, GPT-5.6 Sol berpartisipasi dalam penulisan dan optimalisasi kernel produksi menggunakan Triton dan Gluon di lingkungan Codex. Perusahaan menyatakan bahwa gabungan peningkatan kernel dan optimalisasi terkait menurunkan biaya menyeluruh penyediaan model sebesar 20%.\n\nBiaya menyeluruh berarti biaya seluruh proses penanganan permintaan aktual, termasuk perutean, perpindahan data, eksekusi model, dan pembuatan output, bukan hanya satu operasi tertentu.\n\n### Verifikasi akurasi kernel\n\nKernel yang cepat tidak dapat digunakan jika menghasilkan keluaran yang salah secara numerik. OpenAI menjelaskan bahwa perusahaan berinvestasi dalam alat verifikasi, termasuk FpSan, untuk memeriksa akurasi kernel yang ditulis AI. FpSan adalah singkatan dari Floating-Point Sanitizer, sebuah alat sumber terbuka untuk mendeteksi kesalahan terkait operasi bilangan floating-point.\n\nHal ini menunjukkan bahwa ketika AI menghasilkan kode infrastruktur produksi, diperlukan bukan hanya tolok ukur kinerja, tetapi juga verifikasi numerik, pengujian regresi, dan prosedur pemulihan saat terjadi kegagalan.\n\n## Decoding spekulatif dan cache KV\n\n### Decoding spekulatif\n\nDecoding spekulatif adalah metode ketika model draf kecil terlebih dahulu mengusulkan token yang akan dihasilkan berikutnya, lalu model utama yang lebih besar memverifikasi beberapa kandidat secara paralel. Jika usulan diterima, jumlah komputasi sekuensial yang mahal pada model utama dapat dikurangi.\n\nOpenAI menyatakan bahwa GPT-5.6 Sol merancang dan menjalankan ratusan eksperimen yang mengubah ukuran serta struktur model draf, lalu memantau pelatihannya. Hasilnya, efisiensi pembuatan token meningkat setidaknya 15%.\n\n### Cache KV dan konfigurasi per beban kerja\n\nSaat memproses input, model membuat cache Key-Value, yaitu cache KV. Konfigurasi optimal berbeda-beda bergantung pada panjang input dan output, ukuran batch, tingkat cache hit, jumlah permintaan simultan, kapasitas memori, serta metode sharding model.\n\nOpenAI menjelaskan bahwa perusahaan menganalisis beban kerja aktual dengan Sol dan Codex, mengevaluasi kandidat konfigurasi, lalu menyempurnakan konfigurasi mesin berdasarkan jenis pekerjaan. Tujuannya adalah memproses lebih banyak permintaan pada perangkat keras yang sama.\n\n## Harness agen dan biaya konteks\n\nAgen memanggil model dan alat beberapa kali untuk menyelesaikan satu permintaan pengguna. Dalam pekerjaan yang membutuhkan 30 pemanggilan model, jika setiap pemanggilan mengalami latensi tidak perlu selama 1 detik, total latensi dapat bertambah sekitar 30 detik.\n\nOpenAI menjelaskan lapisan orkestrasi berbasis Rust yang menghubungkan model, alat, dan lingkungan pengguna sebagai harness agen.\n\n### Mengekspos hanya alat yang diperlukan secara tertunda\n\nJika informasi tentang alat, plugin, skill, dan integrasi MCP dimasukkan seluruhnya ke dalam prompt sejak awal, jumlah token input dan latensi akan meningkat. Harness menggunakan metode pencarian tertunda yang mengekspos informasi alat terkait hanya saat diperlukan. OpenAI menyatakan bahwa output alat secara default dibatasi hingga 10 ribu token, kecuali jika model meminta batas terpisah.\n\n### Mempertahankan prefiks yang tepat dan cache prompt\n\nCaching prompt menggunakan kembali bagian awal identik dari input yang sebelumnya telah diproses untuk mengurangi komputasi berulang. Agar cache dapat digunakan kembali, prefiks prompt harus sama persis.\n\nHarness OpenAI mengelola riwayat dengan struktur append-only dan menambahkan pesan baru serta hasil alat di bagian akhir. Alat disajikan dalam urutan deterministik, sedangkan konfigurasi eksekusi seperti kebijakan persetujuan diterapkan saat runtime tanpa mengubah definisi alat itu sendiri. Metode ini bermanfaat untuk meningkatkan tingkat cache hit dalam loop agen berulang.\n\n## Cara membaca angka studi kasus perusahaan\n\nPengumuman resmi OpenAI mencakup evaluasi dari Replit, Notion, Ramp, Blitzy, Cognition, Dust, dan lainnya.\n\n- Notion menyatakan bahwa dalam evaluasi internalnya, Terra memberikan kualitas serupa dengan GPT-5.5 dengan setengah biaya per pekerjaan dan waktu 60% lebih singkat.\n- Blitzy menjelaskan bahwa setelah menerapkan Luna, tingkat penggunaan kembali cache prompt meningkat dari 24% menjadi 90%, sedangkan biayanya 87% lebih rendah dibandingkan model default sebelumnya.\n- Dust menyatakan bahwa untuk pekerjaan agen yang sama, Luna 40% lebih cepat dan 40% lebih murah dibandingkan model default sebelumnya.\n- Ramp menyatakan bahwa pihaknya menggunakan Luna sebagai model default untuk otomatisasi agen latar belakang.\n\nAngka-angka ini merupakan kasus yang diukur berdasarkan pekerjaan internal, prompt, kriteria evaluasi, dan struktur sistem masing-masing perusahaan. Karena bukan tolok ukur umum yang independen, angka tersebut tidak boleh diterapkan begitu saja pada pekerjaan organisasi lain. Sebelum penerapan, diperlukan evaluasi mandiri yang mencerminkan data aktual dan biaya kesalahan.\n\n## Daftar periksa verifikasi sebelum penerapan\n\n1. Siapkan sampel pekerjaan yang representatif beserta jawaban benar atau kriteria evaluasinya.\n2. Bandingkan tingkat keberhasilan dan tingkat percobaan ulang Luna, Terra, dan Sol dalam kondisi yang sama.\n3. Sertakan bukan hanya biaya token, tetapi juga pemanggilan alat, tenaga peninjau, dan biaya pemulihan kegagalan.\n4. Ukur latensi persentil ke-95 atau ke-99 bersama dengan latensi rata-rata.\n5. Klasifikasikan tahap yang memungkinkan pengujian otomatis atau validasi skema sebagai kandidat untuk model berbiaya rendah.\n6. Terapkan kebijakan persetujuan dan pencatatan terpisah untuk pekerjaan yang berkaitan dengan informasi pribadi, keamanan, dan regulasi.\n7. Tetapkan kriteria perutean untuk meningkatkan hasil dengan tingkat kepercayaan rendah ke Terra atau Sol.\n8. Verifikasi dengan lalu lintas aktual apakah nilai pengurangan latensi lebih besar daripada biaya tambahan Fast mode.\n\n## Makna dan keterbatasan\n\nPerombakan ini menunjukkan bahwa tolok ukur persaingan model AI sedang bergeser dari satu skor tertinggi menuju biaya per hasil. Dengan menempatkan Luna untuk pekerjaan berulang dalam skala besar, Terra untuk pekerjaan pengetahuan sehari-hari, dan Sol untuk keputusan yang ambigu serta penting, kecerdasan, kecepatan, dan biaya dapat dikombinasikan sesuai jenis pekerjaan.\n\nNamun, berdasarkan informasi yang dipublikasikan saja, sulit memisahkan seberapa besar penurunan harga sebesar 80% berasal dari peningkatan efisiensi teknis dan seberapa besar berasal dari strategi pasar. Selain itu, keekonomisan model berbiaya rendah tidak hanya ditentukan oleh harga token. Jika tingkat kesalahan tinggi sehingga percobaan ulang dan peninjauan manusia meningkat, total biaya pekerjaan dapat naik.\n\nKarena itu, metrik utamanya bukan harga satu kali pemanggilan model, melainkan total biaya untuk menghasilkan satu hasil yang lolos verifikasi. Tingkat keberhasilan setiap model, jumlah percobaan ulang, latensi, dan biaya peninjauan harus diukur bersama-sama untuk menilai apakah penurunan harga GPT-5.6 benar-benar menghasilkan nilai bisnis.","content_html":"\u003cp\u003eOpenAI menghubungkan peningkatan efisiensi operasional lini produk GPT-5.6 dengan penurunan harga API dan peningkatan kecepatan pemrosesan. Intinya bukan menerapkan satu model terkuat untuk semua pekerjaan, melainkan mengombinasikan Sol, Terra, dan Luna berdasarkan tingkat risiko, kompleksitas, latensi, serta keterverifikasian pekerjaan untuk menurunkan biaya per hasil.\u003c/p\u003e\n\u003cp\u003eAngka harga dan kinerja mengacu pada pengumuman OpenAI tanggal 30 Juli 2026. Tolok ukur pelanggan dan angka peningkatan efisiensi merupakan hasil pengukuran OpenAI atau perusahaan yang dikutip dalam pengumuman, sehingga tidak dapat dianggap akan direproduksi secara identik di semua lingkungan.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#perubahan-harga-api-pada-30-juli-2026\" class=\"anchor\" id=\"perubahan-harga-api-pada-30-juli-2026\"\u003e\u003c/a\u003ePerubahan harga API pada 30 Juli 2026\u003c/h2\u003e\n\u003cp\u003eHarga API GPT-5.6 Luna dan Terra yang telah diubah adalah sebagai berikut.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModel\u003c/th\u003e\n\u003cth\u003e1 juta token input\u003c/th\u003e\n\u003cth\u003e1 juta token output\u003c/th\u003e\n\u003cth\u003eBesaran penurunan\u003c/th\u003e\n\u003cth\u003ePeran utama\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Model\"\u003eGPT-5.6 Luna\u003c/td\u003e\n\u003ctd data-label=\"1 juta token input\"\u003e0.20 dolar\u003c/td\u003e\n\u003ctd data-label=\"1 juta token output\"\u003e1.20 dolar\u003c/td\u003e\n\u003ctd data-label=\"Besaran penurunan\"\u003e80%\u003c/td\u003e\n\u003ctd data-label=\"Peran utama\"\u003ePemrosesan massal, pekerjaan berulang, tugas eksekusi yang jelas\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Model\"\u003eGPT-5.6 Terra\u003c/td\u003e\n\u003ctd data-label=\"1 juta token input\"\u003e2 dolar\u003c/td\u003e\n\u003ctd data-label=\"1 juta token output\"\u003e12 dolar\u003c/td\u003e\n\u003ctd data-label=\"Besaran penurunan\"\u003e20%\u003c/td\u003e\n\u003ctd data-label=\"Peran utama\"\u003ePekerjaan sehari-hari yang memerlukan keseimbangan kualitas, biaya, dan kecepatan\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Model\"\u003eGPT-5.6 Sol\u003c/td\u003e\n\u003ctd data-label=\"1 juta token input\"\u003eTidak berubah dalam pengumuman\u003c/td\u003e\n\u003ctd data-label=\"1 juta token output\"\u003eTidak berubah dalam pengumuman\u003c/td\u003e\n\u003ctd data-label=\"Besaran penurunan\"\u003eTidak ada\u003c/td\u003e\n\u003ctd data-label=\"Peran utama\"\u003ePenalaran kompleks, perencanaan, pengambilan keputusan penting\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eHarga langganan berbayar ChatGPT dan Codex maupun keseluruhan anggaran kuota tidak berubah akibat pengumuman ini. Namun, kredit yang dikurangi saat menggunakan Terra dan Luna menjadi lebih sedikit. OpenAI menjelaskan bahwa perubahan harga melalui AWS akan diterapkan secara bertahap mulai akhir 30 Juli.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#contoh-perhitungan-biaya-api\" class=\"anchor\" id=\"contoh-perhitungan-biaya-api\"\u003e\u003c/a\u003eContoh perhitungan biaya API\u003c/h3\u003e\n\u003cp\u003eBiaya token dapat dihitung sebagai berikut.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003eTotal biaya = jumlah token input ÷ 1,000,000 × tarif input + jumlah token output ÷ 1,000,000 × tarif output\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eSebagai contoh, jika memproses 10 juta token input dan 2 juta token output, biaya berdasarkan tarif token sederhana adalah sebagai berikut.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eModel\u003c/th\u003e\n\u003cth\u003eBiaya input\u003c/th\u003e\n\u003cth\u003eBiaya output\u003c/th\u003e\n\u003cth\u003eTotal\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Model\"\u003eLuna\u003c/td\u003e\n\u003ctd data-label=\"Biaya input\"\u003e2 dolar\u003c/td\u003e\n\u003ctd data-label=\"Biaya output\"\u003e2.40 dolar\u003c/td\u003e\n\u003ctd data-label=\"Total\"\u003e4.40 dolar\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Model\"\u003eTerra\u003c/td\u003e\n\u003ctd data-label=\"Biaya input\"\u003e20 dolar\u003c/td\u003e\n\u003ctd data-label=\"Biaya output\"\u003e24 dolar\u003c/td\u003e\n\u003ctd data-label=\"Total\"\u003e44 dolar\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eJumlah tagihan sebenarnya dapat dipengaruhi oleh ketentuan setiap layanan, seperti penerapan cache, metode pemrosesan yang dipilih, dan struktur pemanggilan alat.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#peran-lini-produk-gpt-56\" class=\"anchor\" id=\"peran-lini-produk-gpt-56\"\u003e\u003c/a\u003ePeran lini produk GPT-5.6\u003c/h2\u003e\n\u003cp\u003eGPT-5.6 bukan satu model tunggal, melainkan lini produk berjenjang dengan biaya dan kinerja yang berbeda.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-sol\" class=\"anchor\" id=\"gpt-56-sol\"\u003e\u003c/a\u003eGPT-5.6 Sol\u003c/h3\u003e\n\u003cp\u003eSol menangani penalaran tingkat tertinggi dan penyelesaian masalah yang kompleks. Model ini cocok untuk keputusan dengan persyaratan ambigu atau biaya kegagalan tinggi, perencanaan jangka panjang, serta peninjauan hasil penting.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-terra\" class=\"anchor\" id=\"gpt-56-terra\"\u003e\u003c/a\u003eGPT-5.6 Terra\u003c/h3\u003e\n\u003cp\u003eTerra bertujuan menyeimbangkan kinerja, biaya, dan kecepatan respons. Model ini cocok untuk pekerjaan yang membutuhkan kemampuan penilaian lebih tinggi daripada Luna, tetapi tidak selalu perlu menggunakan Sol, seperti tanya jawab internal organisasi, tugas agen dengan cakupan tertentu, serta analisis dan coding umum.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#gpt-56-luna\" class=\"anchor\" id=\"gpt-56-luna\"\u003e\u003c/a\u003eGPT-5.6 Luna\u003c/h3\u003e\n\u003cp\u003eLuna adalah jenjang yang paling cepat dan murah. Selain pembuatan kalimat pendek yang sederhana, model ini mendukung pemanggilan alat dan alur kerja multilangkah, sehingga dapat digunakan sebagai model eksekusi untuk mengulangi pekerjaan yang didefinisikan dengan jelas dalam skala besar.\u003c/p\u003e\n\u003cp\u003eContoh pekerjaan penerapannya adalah sebagai berikut.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eKlasifikasi dokumen dan pertanyaan pelanggan dalam jumlah besar\u003c/li\u003e\n\u003cli\u003eEkstraksi data terstruktur\u003c/li\u003e\n\u003cli\u003eModifikasi kode berulang\u003c/li\u003e\n\u003cli\u003ePenulisan dan pelaksanaan pengujian\u003c/li\u003e\n\u003cli\u003ePembuatan dokumen dengan aturan yang jelas\u003c/li\u003e\n\u003cli\u003ePeninjauan konten dalam skala besar\u003c/li\u003e\n\u003cli\u003eOtomatisasi agen latar belakang\u003c/li\u003e\n\u003cli\u003eBantuan riset berulang\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eOpenAI mengklaim Luna memberikan tingkat kinerja yang serupa dengan model yang dinilai sebagai model mutakhir satu tahun lalu, dengan biaya sekitar 6% per pekerjaan yang diperkirakan dan kecepatan hampir 9 kali lipat. Angka 6% di sini bukan perbandingan langsung tarif token, melainkan nilai perbandingan perkiraan biaya untuk memperoleh hasil pekerjaan yang sama.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#karakteristik-fast-mode-sol\" class=\"anchor\" id=\"karakteristik-fast-mode-sol\"\u003e\u003c/a\u003eKarakteristik Fast mode Sol\u003c/h2\u003e\n\u003cp\u003eFast mode untuk API diperkenalkan pada GPT-5.6 Sol. Mode ini menggantikan Priority Processing yang sudah ada dan merupakan konsep yang sepadan dengan fitur \u003ccode\u003e/fast\u003c/code\u003e pada Codex.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eItem\u003c/th\u003e\n\u003cth\u003eFast mode\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eKecepatan\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eHingga 2.5 kali lebih cepat daripada pemrosesan Standard\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eKecerdasan model\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003eSama dengan Standard menurut pengumuman OpenAI\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eHarga\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003e2 kali harga pemrosesan Standard\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Item\"\u003eKompatibilitas sebelumnya\u003c/td\u003e\n\u003ctd data-label=\"Fast mode\"\u003ePermintaan dengan tag \u003ccode\u003epriority\u003c/code\u003e diproses secara otomatis sebagai Fast mode\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003ePernyataan hingga 2.5 kali lebih cepat pada Fast mode bukan jaminan bahwa latensi semua permintaan akan berkurang dengan rasio yang persis sama. Kecepatan yang benar-benar dirasakan dapat berbeda bergantung pada panjang prompt, panjang output, beban layanan, dan jumlah pemanggilan alat.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#kondisi-yang-cocok-untuk-fast-mode\" class=\"anchor\" id=\"kondisi-yang-cocok-untuk-fast-mode\"\u003e\u003c/a\u003eKondisi yang cocok untuk Fast mode\u003c/h3\u003e\n\u003cul\u003e\n\u003cli\u003eLayanan waktu nyata ketika pengguna menunggu respons\u003c/li\u003e\n\u003cli\u003eLingkungan pengembangan yang mengulangi modifikasi dan pemeriksaan kode dengan cepat\u003c/li\u003e\n\u003cli\u003ePekerjaan ketika pemanggilan Sol menentukan latensi keseluruhan agen\u003c/li\u003e\n\u003cli\u003eSituasi ketika keterlambatan beberapa menit pun penting, seperti respons insiden atau analisis gangguan\u003c/li\u003e\n\u003cli\u003ePekerjaan ketika biaya akibat keterlambatan pemrosesan lebih besar daripada biaya API tambahan\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eUntuk pekerjaan yang waktu penyelesaiannya tidak mendesak, seperti batch latar belakang, analisis malam hari, dan pemrosesan asinkron, pemrosesan Standard mungkin lebih ekonomis.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#kriteria-pemilihan-model-yang-berorientasi-pada-hasil\" class=\"anchor\" id=\"kriteria-pemilihan-model-yang-berorientasi-pada-hasil\"\u003e\u003c/a\u003eKriteria pemilihan model yang berorientasi pada hasil\u003c/h2\u003e\n\u003cp\u003ePemilihan model bukan sekadar memilih model dengan posisi tertinggi di papan peringkat. Pertanyaan berikut perlu ditinjau untuk setiap pekerjaan.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eFaktor penilaian\u003c/th\u003e\n\u003cth\u003ePertanyaan yang perlu diperiksa\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Faktor penilaian\"\u003eDampak kegagalan\u003c/td\u003e\n\u003ctd data-label=\"Pertanyaan yang perlu diperiksa\"\u003eApa dampak kesalahan terhadap pelanggan, pendapatan, keamanan, atau kepatuhan regulasi?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Faktor penilaian\"\u003eToleransi kesalahan\u003c/td\u003e\n\u003ctd data-label=\"Pertanyaan yang perlu diperiksa\"\u003eDapatkah manusia meninjau atau aturan otomatis mendeteksi kesalahan?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Faktor penilaian\"\u003eLatensi\u003c/td\u003e\n\u003ctd data-label=\"Pertanyaan yang perlu diperiksa\"\u003eApakah pengguna menunggu secara waktu nyata, atau dapatkah diproses secara asinkron?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Faktor penilaian\"\u003eVolume pemrosesan\u003c/td\u003e\n\u003ctd data-label=\"Pertanyaan yang perlu diperiksa\"\u003eBerapa banyak kasus yang harus diproses per hari atau per bulan?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Faktor penilaian\"\u003eKejelasan masalah\u003c/td\u003e\n\u003ctd data-label=\"Pertanyaan yang perlu diperiksa\"\u003eApakah input, aturan, dan output yang diharapkan telah didefinisikan dengan memadai?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Faktor penilaian\"\u003eNilai penalaran\u003c/td\u003e\n\u003ctd data-label=\"Pertanyaan yang perlu diperiksa\"\u003eApakah penalaran yang lebih kuat benar-benar meningkatkan kualitas hasil secara signifikan?\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Faktor penilaian\"\u003eKeterverifikasian\u003c/td\u003e\n\u003ctd data-label=\"Pertanyaan yang perlu diperiksa\"\u003eDapatkah hasil dinilai melalui pengujian, skema, atau pemeriksaan silang?\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003ePekerjaan yang jelas dan dapat diverifikasi secara otomatis kemungkinan besar cocok untuk Luna. Jika memerlukan kemampuan penilaian tertentu, Terra dapat dipertimbangkan. Sol cocok untuk mengatasi ambiguitas, mengambil keputusan berisiko tinggi, atau meninjau secara final konsekuensi kegagalan.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#struktur-perencanaan-dengan-sol-dan-eksekusi-dengan-luna\" class=\"anchor\" id=\"struktur-perencanaan-dengan-sol-dan-eksekusi-dengan-luna\"\u003e\u003c/a\u003eStruktur perencanaan dengan Sol dan eksekusi dengan Luna\u003c/h2\u003e\n\u003cp\u003eDalam satu pekerjaan agen pun, model yang berbeda dapat ditempatkan pada setiap tahap. Sebagai contoh, agen coding dapat disusun sebagai berikut.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eSol menemukan ambiguitas persyaratan dan menyusun pertanyaan.\u003c/li\u003e\n\u003cli\u003eSol menentukan rencana implementasi, cakupan perubahan, dan faktor risiko.\u003c/li\u003e\n\u003cli\u003eLuna mengimplementasikan perubahan yang telah diperjelas menjadi kode.\u003c/li\u003e\n\u003cli\u003eLuna menulis dan menjalankan pengujian.\u003c/li\u003e\n\u003cli\u003eLuna atau Terra mengevaluasi hasil pengujian dan perbedaan kode.\u003c/li\u003e\n\u003cli\u003eSol meninjau kembali hanya kesimpulan penting atau yang memiliki kemungkinan kegagalan tinggi.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eStruktur ini dapat menurunkan biaya dibandingkan penggunaan Sol pada semua tahap, sekaligus memusatkan kemampuan penalaran tinggi pada keputusan penting. Namun, jika model dipisahkan, aturan perutean, penanganan kesalahan, pelacakan log, dan sistem evaluasi harus dirancang secara terpisah.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#tiga-lapisan-efisiensi-yang-mendukung-penurunan-harga\" class=\"anchor\" id=\"tiga-lapisan-efisiensi-yang-mendukung-penurunan-harga\"\u003e\u003c/a\u003eTiga lapisan efisiensi yang mendukung penurunan harga\u003c/h2\u003e\n\u003cp\u003eOpenAI menjelaskan bahwa penghematan biaya bukan sekadar kebijakan harga, melainkan berasal dari peningkatan teknis pada tiga lapisan.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003eEfisiensi token model itu sendiri\u003c/li\u003e\n\u003cli\u003eEfisiensi perangkat keras pada sistem inferensi\u003c/li\u003e\n\u003cli\u003eEfisiensi harness agen yang menghubungkan model, alat, dan konteks\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003ePenjelasan ini didasarkan pada materi teknis yang dipublikasikan OpenAI, dan keseluruhan rincian struktur biaya tidak diungkapkan kepada publik. Karena itu, sulit untuk memastikan dari luar seberapa besar kontribusi efisiensi teknis dan kebijakan harga strategis terhadap penurunan harga.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#optimalisasi-model-dan-sistem-inferensi\" class=\"anchor\" id=\"optimalisasi-model-dan-sistem-inferensi\"\u003e\u003c/a\u003eOptimalisasi model dan sistem inferensi\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#peningkatan-jumlah-pekerjaan-per-token\" class=\"anchor\" id=\"peningkatan-jumlah-pekerjaan-per-token\"\u003e\u003c/a\u003ePeningkatan jumlah pekerjaan per token\u003c/h3\u003e\n\u003cp\u003eMenurut penjelasan OpenAI, GPT-5.6 dilatih untuk mengoptimalkan bukan hanya tingkat keberhasilan pekerjaan, tetapi juga efisiensi pemrosesan. Artinya, model ini dirancang untuk mengurangi penalaran atau pengulangan yang tidak perlu dan mencapai hasil yang dibutuhkan dengan lebih sedikit token, sehingga meningkatkan kecerdasan dan jumlah pekerjaan per token.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#penyeimbangan-beban-dan-perutean-permintaan\" class=\"anchor\" id=\"penyeimbangan-beban-dan-perutean-permintaan\"\u003e\u003c/a\u003ePenyeimbangan beban dan perutean permintaan\u003c/h3\u003e\n\u003cp\u003eSistem inferensi mendistribusikan permintaan ke pusat data dan klaster berdasarkan wilayah, kapasitas yang tersedia, dan jenis akselerator. Di dalam klaster, instans model dipilih dengan mempertimbangkan beban saat ini, panjang konteks input, kemungkinan penggunaan cache, dan karakteristik permintaan.\u003c/p\u003e\n\u003cp\u003eOpenAI menyatakan telah menggunakan GPT-5.6 Sol dan Codex untuk menganalisis lalu lintas produksi, menelusuri penyebab ketidakseimbangan beban, menguji strategi perutean, dan menyesuaikan heuristik.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#optimalisasi-kernel-gpu\" class=\"anchor\" id=\"optimalisasi-kernel-gpu\"\u003e\u003c/a\u003eOptimalisasi kernel GPU\u003c/h3\u003e\n\u003cp\u003eKernel GPU adalah kode inti yang menjalankan operasi matematis model pada perangkat keras. Biaya pemrosesan dapat berbeda bahkan pada GPU yang sama, bergantung pada perpindahan memori, sinkronisasi, susunan data, dan metode paralelisasi.\u003c/p\u003e\n\u003cp\u003eMenurut OpenAI, GPT-5.6 Sol berpartisipasi dalam penulisan dan optimalisasi kernel produksi menggunakan Triton dan Gluon di lingkungan Codex. Perusahaan menyatakan bahwa gabungan peningkatan kernel dan optimalisasi terkait menurunkan biaya menyeluruh penyediaan model sebesar 20%.\u003c/p\u003e\n\u003cp\u003eBiaya menyeluruh berarti biaya seluruh proses penanganan permintaan aktual, termasuk perutean, perpindahan data, eksekusi model, dan pembuatan output, bukan hanya satu operasi tertentu.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#verifikasi-akurasi-kernel\" class=\"anchor\" id=\"verifikasi-akurasi-kernel\"\u003e\u003c/a\u003eVerifikasi akurasi kernel\u003c/h3\u003e\n\u003cp\u003eKernel yang cepat tidak dapat digunakan jika menghasilkan keluaran yang salah secara numerik. OpenAI menjelaskan bahwa perusahaan berinvestasi dalam alat verifikasi, termasuk FpSan, untuk memeriksa akurasi kernel yang ditulis AI. FpSan adalah singkatan dari Floating-Point Sanitizer, sebuah alat sumber terbuka untuk mendeteksi kesalahan terkait operasi bilangan floating-point.\u003c/p\u003e\n\u003cp\u003eHal ini menunjukkan bahwa ketika AI menghasilkan kode infrastruktur produksi, diperlukan bukan hanya tolok ukur kinerja, tetapi juga verifikasi numerik, pengujian regresi, dan prosedur pemulihan saat terjadi kegagalan.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#decoding-spekulatif-dan-cache-kv\" class=\"anchor\" id=\"decoding-spekulatif-dan-cache-kv\"\u003e\u003c/a\u003eDecoding spekulatif dan cache KV\u003c/h2\u003e\n\u003ch3\u003e\n\u003ca href=\"#decoding-spekulatif\" class=\"anchor\" id=\"decoding-spekulatif\"\u003e\u003c/a\u003eDecoding spekulatif\u003c/h3\u003e\n\u003cp\u003eDecoding spekulatif adalah metode ketika model draf kecil terlebih dahulu mengusulkan token yang akan dihasilkan berikutnya, lalu model utama yang lebih besar memverifikasi beberapa kandidat secara paralel. Jika usulan diterima, jumlah komputasi sekuensial yang mahal pada model utama dapat dikurangi.\u003c/p\u003e\n\u003cp\u003eOpenAI menyatakan bahwa GPT-5.6 Sol merancang dan menjalankan ratusan eksperimen yang mengubah ukuran serta struktur model draf, lalu memantau pelatihannya. Hasilnya, efisiensi pembuatan token meningkat setidaknya 15%.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#cache-kv-dan-konfigurasi-per-beban-kerja\" class=\"anchor\" id=\"cache-kv-dan-konfigurasi-per-beban-kerja\"\u003e\u003c/a\u003eCache KV dan konfigurasi per beban kerja\u003c/h3\u003e\n\u003cp\u003eSaat memproses input, model membuat cache Key-Value, yaitu cache KV. Konfigurasi optimal berbeda-beda bergantung pada panjang input dan output, ukuran batch, tingkat cache hit, jumlah permintaan simultan, kapasitas memori, serta metode sharding model.\u003c/p\u003e\n\u003cp\u003eOpenAI menjelaskan bahwa perusahaan menganalisis beban kerja aktual dengan Sol dan Codex, mengevaluasi kandidat konfigurasi, lalu menyempurnakan konfigurasi mesin berdasarkan jenis pekerjaan. Tujuannya adalah memproses lebih banyak permintaan pada perangkat keras yang sama.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#harness-agen-dan-biaya-konteks\" class=\"anchor\" id=\"harness-agen-dan-biaya-konteks\"\u003e\u003c/a\u003eHarness agen dan biaya konteks\u003c/h2\u003e\n\u003cp\u003eAgen memanggil model dan alat beberapa kali untuk menyelesaikan satu permintaan pengguna. Dalam pekerjaan yang membutuhkan 30 pemanggilan model, jika setiap pemanggilan mengalami latensi tidak perlu selama 1 detik, total latensi dapat bertambah sekitar 30 detik.\u003c/p\u003e\n\u003cp\u003eOpenAI menjelaskan lapisan orkestrasi berbasis Rust yang menghubungkan model, alat, dan lingkungan pengguna sebagai harness agen.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#mengekspos-hanya-alat-yang-diperlukan-secara-tertunda\" class=\"anchor\" id=\"mengekspos-hanya-alat-yang-diperlukan-secara-tertunda\"\u003e\u003c/a\u003eMengekspos hanya alat yang diperlukan secara tertunda\u003c/h3\u003e\n\u003cp\u003eJika informasi tentang alat, plugin, skill, dan integrasi MCP dimasukkan seluruhnya ke dalam prompt sejak awal, jumlah token input dan latensi akan meningkat. Harness menggunakan metode pencarian tertunda yang mengekspos informasi alat terkait hanya saat diperlukan. OpenAI menyatakan bahwa output alat secara default dibatasi hingga 10 ribu token, kecuali jika model meminta batas terpisah.\u003c/p\u003e\n\u003ch3\u003e\n\u003ca href=\"#mempertahankan-prefiks-yang-tepat-dan-cache-prompt\" class=\"anchor\" id=\"mempertahankan-prefiks-yang-tepat-dan-cache-prompt\"\u003e\u003c/a\u003eMempertahankan prefiks yang tepat dan cache prompt\u003c/h3\u003e\n\u003cp\u003eCaching prompt menggunakan kembali bagian awal identik dari input yang sebelumnya telah diproses untuk mengurangi komputasi berulang. Agar cache dapat digunakan kembali, prefiks prompt harus sama persis.\u003c/p\u003e\n\u003cp\u003eHarness OpenAI mengelola riwayat dengan struktur append-only dan menambahkan pesan baru serta hasil alat di bagian akhir. Alat disajikan dalam urutan deterministik, sedangkan konfigurasi eksekusi seperti kebijakan persetujuan diterapkan saat runtime tanpa mengubah definisi alat itu sendiri. Metode ini bermanfaat untuk meningkatkan tingkat cache hit dalam loop agen berulang.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#cara-membaca-angka-studi-kasus-perusahaan\" class=\"anchor\" id=\"cara-membaca-angka-studi-kasus-perusahaan\"\u003e\u003c/a\u003eCara membaca angka studi kasus perusahaan\u003c/h2\u003e\n\u003cp\u003ePengumuman resmi OpenAI mencakup evaluasi dari Replit, Notion, Ramp, Blitzy, Cognition, Dust, dan lainnya.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eNotion menyatakan bahwa dalam evaluasi internalnya, Terra memberikan kualitas serupa dengan GPT-5.5 dengan setengah biaya per pekerjaan dan waktu 60% lebih singkat.\u003c/li\u003e\n\u003cli\u003eBlitzy menjelaskan bahwa setelah menerapkan Luna, tingkat penggunaan kembali cache prompt meningkat dari 24% menjadi 90%, sedangkan biayanya 87% lebih rendah dibandingkan model default sebelumnya.\u003c/li\u003e\n\u003cli\u003eDust menyatakan bahwa untuk pekerjaan agen yang sama, Luna 40% lebih cepat dan 40% lebih murah dibandingkan model default sebelumnya.\u003c/li\u003e\n\u003cli\u003eRamp menyatakan bahwa pihaknya menggunakan Luna sebagai model default untuk otomatisasi agen latar belakang.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eAngka-angka ini merupakan kasus yang diukur berdasarkan pekerjaan internal, prompt, kriteria evaluasi, dan struktur sistem masing-masing perusahaan. Karena bukan tolok ukur umum yang independen, angka tersebut tidak boleh diterapkan begitu saja pada pekerjaan organisasi lain. Sebelum penerapan, diperlukan evaluasi mandiri yang mencerminkan data aktual dan biaya kesalahan.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#daftar-periksa-verifikasi-sebelum-penerapan\" class=\"anchor\" id=\"daftar-periksa-verifikasi-sebelum-penerapan\"\u003e\u003c/a\u003eDaftar periksa verifikasi sebelum penerapan\u003c/h2\u003e\n\u003col\u003e\n\u003cli\u003eSiapkan sampel pekerjaan yang representatif beserta jawaban benar atau kriteria evaluasinya.\u003c/li\u003e\n\u003cli\u003eBandingkan tingkat keberhasilan dan tingkat percobaan ulang Luna, Terra, dan Sol dalam kondisi yang sama.\u003c/li\u003e\n\u003cli\u003eSertakan bukan hanya biaya token, tetapi juga pemanggilan alat, tenaga peninjau, dan biaya pemulihan kegagalan.\u003c/li\u003e\n\u003cli\u003eUkur latensi persentil ke-95 atau ke-99 bersama dengan latensi rata-rata.\u003c/li\u003e\n\u003cli\u003eKlasifikasikan tahap yang memungkinkan pengujian otomatis atau validasi skema sebagai kandidat untuk model berbiaya rendah.\u003c/li\u003e\n\u003cli\u003eTerapkan kebijakan persetujuan dan pencatatan terpisah untuk pekerjaan yang berkaitan dengan informasi pribadi, keamanan, dan regulasi.\u003c/li\u003e\n\u003cli\u003eTetapkan kriteria perutean untuk meningkatkan hasil dengan tingkat kepercayaan rendah ke Terra atau Sol.\u003c/li\u003e\n\u003cli\u003eVerifikasi dengan lalu lintas aktual apakah nilai pengurangan latensi lebih besar daripada biaya tambahan Fast mode.\u003c/li\u003e\n\u003c/ol\u003e\n\u003ch2\u003e\n\u003ca href=\"#makna-dan-keterbatasan\" class=\"anchor\" id=\"makna-dan-keterbatasan\"\u003e\u003c/a\u003eMakna dan keterbatasan\u003c/h2\u003e\n\u003cp\u003ePerombakan ini menunjukkan bahwa tolok ukur persaingan model AI sedang bergeser dari satu skor tertinggi menuju biaya per hasil. Dengan menempatkan Luna untuk pekerjaan berulang dalam skala besar, Terra untuk pekerjaan pengetahuan sehari-hari, dan Sol untuk keputusan yang ambigu serta penting, kecerdasan, kecepatan, dan biaya dapat dikombinasikan sesuai jenis pekerjaan.\u003c/p\u003e\n\u003cp\u003eNamun, berdasarkan informasi yang dipublikasikan saja, sulit memisahkan seberapa besar penurunan harga sebesar 80% berasal dari peningkatan efisiensi teknis dan seberapa besar berasal dari strategi pasar. Selain itu, keekonomisan model berbiaya rendah tidak hanya ditentukan oleh harga token. Jika tingkat kesalahan tinggi sehingga percobaan ulang dan peninjauan manusia meningkat, total biaya pekerjaan dapat naik.\u003c/p\u003e\n\u003cp\u003eKarena itu, metrik utamanya bukan harga satu kali pemanggilan model, melainkan total biaya untuk menghasilkan satu hasil yang lolos verifikasi. Tingkat keberhasilan setiap model, jumlah percobaan ulang, latensi, dan biaya peninjauan harus diukur bersama-sama untuk menilai apakah penurunan harga GPT-5.6 benar-benar menghasilkan nilai bisnis.\u003c/p\u003e\n","tags":["OpenAI","GPT-5.6","Harga API","Efisiensi penalaran","Agen"],"faqs":[{"question":"Berapa harga API GPT-5.6 Luna yang telah diubah?","answer":"Per 30 Juli 2026, harga Luna adalah 0,20 dolar per 1 juta token input dan 1,20 dolar per 1 juta token output. Besaran penurunan dibandingkan harga sebelumnya yang diumumkan OpenAI adalah 80%."},{"question":"Berapa harga API GPT-5.6 Terra yang telah diubah?","answer":"Harga Terra adalah 2 dolar per 1 juta token input dan 12 dolar per 1 juta token output. Besaran penurunan harga yang diumumkan OpenAI adalah 20%."},{"question":"Apakah harga GPT-5.6 Sol juga diturunkan?","answer":"Tidak. Dalam pengumuman OpenAI kali ini, harga pemrosesan Standard untuk Sol tidak berubah. Sebagai gantinya, Fast mode ditambahkan, yang hingga 2,5 kali lebih cepat daripada Standard dan harganya 2 kali lipat."},{"question":"Apakah kualitas jawaban model menurun jika menggunakan Fast mode?","answer":"OpenAI menjelaskan bahwa Fast mode meningkatkan kecepatan pemrosesan tanpa menurunkan tingkat kecerdasan Sol. Namun, kecepatan hingga 2,5 kali merupakan batas atas, dan latensi aktual dapat berbeda tergantung pada panjang permintaan, jumlah output, pemanggilan alat, dan beban sistem."},{"question":"Apakah permintaan Priority Processing yang sudah ada perlu diubah?","answer":"Menurut pengumuman OpenAI, tag `priority` pada permintaan API yang sudah ada akan terus berfungsi dan secara otomatis terhubung ke pemrosesan Fast mode. Dalam lingkungan operasional, lebih aman untuk memeriksa secara terpisah waktu penerapan dan detail tagihan aktual."},{"question":"Untuk pekerjaan apa penggunaan Luna cocok?","answer":"Luna cocok untuk pekerjaan bervolume besar dan berulang dengan aturan serta output yang diharapkan jelas dan dapat diverifikasi secara otomatis. Contoh utamanya adalah klasifikasi dokumen, ekstraksi data, modifikasi kode berulang, pelaksanaan pengujian, peninjauan konten, dan otomatisasi latar belakang."},{"question":"Model mana yang sebaiknya dipilih antara Terra dan Luna?","answer":"Jika biaya rendah dan throughput tinggi menjadi prioritas serta pekerjaannya jelas, Luna dapat dievaluasi terlebih dahulu. Jika diperlukan pemahaman konteks dan kemampuan penilaian yang lebih tinggi, tetapi tidak memerlukan penalaran tingkat lanjut setara Sol, Terra mungkin cocok."},{"question":"Apakah Sol tidak boleh digunakan untuk semua tahap agen?","answer":"Sol dapat digunakan, tetapi efisiensi biayanya dapat menurun. Dengan memisahkan tugas sehingga Sol menangani perencanaan dan penilaian berisiko tinggi, sedangkan Luna atau Terra menangani pelaksanaan dan pengujian yang jelas, ada kemungkinan untuk mengurangi biaya keseluruhan sambil mempertahankan kualitas pada tahap-tahap penting."},{"question":"Apakah biaya pekerjaan Luna sebesar 6% merupakan perbandingan harga per token?","answer":"Tidak. Sekitar 6% yang disebutkan OpenAI adalah estimasi biaya per pekerjaan yang diperlukan untuk memperoleh hasil pekerjaan serupa dengan pembanding. Angka ini bukan hasil pembagian langsung harga per token saja dan harus dipahami sebagai perbandingan yang mencakup tugas evaluasi dan tingkat keberhasilan."},{"question":"Bagaimana cara menilai keekonomisan aktual model API?","answer":"Penilaian harus mencakup bukan hanya harga token, tetapi juga tingkat keberhasilan, jumlah percobaan ulang, biaya pemanggilan alat, latensi respons, waktu peninjauan manusia, dan biaya pemulihan kesalahan. Metrik yang paling berguna adalah total biaya per satu hasil yang lolos verifikasi."}],"sources":[{"url":"https://openai.com/index/advancing-the-price-performance-frontier-with-gpt-5-6/","title":"Memajukan batas terdepan antara harga dan performa dengan GPT-5.6 | OpenAI","type":"source"},{"url":"https://openai.com/index/gpt-5-6-frontier-intelligence-efficiency/","title":"Bagaimana GPT-5.6 memadukan kecerdasan terdepan dengan efisiensi terdepan | OpenAI","type":"source"}],"images":[{"id":395,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY2OSwicHVyIjoiYmxvYl9pZCJ9fQ==--5c50f46b468b0057808eb3e6351730cbce2f4b78/ai-4f6037ef.webp","is_representative":true,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"퍼즐, AI 칩 계층, 작업 컨베이어, 감소하는 동전 더미로 표현한 모델 선택 흐름","caption":"AI 모델의 작업 분배와 비용 절감, 검증 과정을 시각화한 개념도다.","description":null},"en":{"alt":"Model selection flow with puzzles, layered AI chips, a task conveyor, and shrinking coin stacks","caption":"The diagram visualizes AI task routing, cost reduction, and output verification.","description":null},"ja":{"alt":"パズル、階層化AIチップ、タスク用コンベア、減っていくコインで示すモデル選択フロー","caption":"AIモデルのタスク振り分け、コスト削減、検証の流れを表した概念図。","description":null},"es":{"alt":"Flujo de selección de modelos con piezas, chips de IA, cinta de tareas y pilas de monedas decrecientes","caption":"El diagrama representa la asignación de tareas, la reducción de costes y la verificación con IA.","description":null},"id":{"alt":"Alur pemilihan model dengan puzzle, chip AI bertingkat, konveyor tugas, dan tumpukan koin yang menyusut","caption":"Diagram ini menggambarkan perutean tugas AI, penghematan biaya, dan verifikasi hasil.","description":null},"pt":{"alt":"Fluxo de seleção de modelos com peças, chips de IA, esteira de tarefas e pilhas de moedas decrescentes","caption":"O diagrama mostra o roteamento de tarefas, a redução de custos e a verificação por IA.","description":null},"zh-hant":{"alt":"以拼圖、分層 AI 晶片、任務輸送帶與遞減硬幣堆呈現模型選擇流程","caption":"此概念圖呈現 AI 任務分流、成本降低與結果驗證流程。","description":null},"de":{"alt":"Modellauswahl mit Puzzleteilen, gestaffelten KI-Chips, Aufgabenband und schrumpfenden Münzstapeln","caption":"Die Grafik veranschaulicht KI-Aufgabenverteilung, Kostensenkung und Ergebnisprüfung.","description":null}}},{"id":396,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6NDY3NSwicHVyIjoiYmxvYl9pZCJ9fQ==--920476799a53738205d619a3a057685b5af9d05d/ai-334533bc.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"AI 모델별 처리 흐름과 속도, 비용, 하드웨어 구성을 비교한 인포그래픽","caption":"세 가지 AI 처리 경로의 성능과 비용 차이 및 연결된 인프라를 시각화한다.","description":null},"en":{"alt":"Infographic comparing AI model processing flows, speed, cost, and hardware infrastructure","caption":"Three AI processing paths visualize differences in performance, cost, and connected infrastructure.","description":null},"ja":{"alt":"AIモデル別の処理フロー、速度、コスト、ハードウェア構成を比較する図","caption":"3つのAI処理経路について、性能とコスト、接続インフラの違いを可視化している。","description":null},"es":{"alt":"Infografía comparativa de flujos, velocidad, coste e infraestructura de modelos de IA","caption":"Tres rutas de procesamiento de IA muestran diferencias de rendimiento, coste e infraestructura conectada.","description":null},"id":{"alt":"Infografik perbandingan alur, kecepatan, biaya, dan infrastruktur perangkat keras model AI","caption":"Tiga jalur pemrosesan AI memperlihatkan perbedaan kinerja, biaya, dan infrastruktur yang terhubung.","description":null},"pt":{"alt":"Infográfico comparando fluxos, velocidade, custo e infraestrutura de modelos de IA","caption":"Três rotas de processamento de IA mostram diferenças de desempenho, custo e infraestrutura conectada.","description":null},"zh-hant":{"alt":"比較各種 AI 模型處理流程、速度、成本與硬體架構的資訊圖表","caption":"三條 AI 處理路徑呈現效能、成本與連接基礎設施的差異。","description":null},"de":{"alt":"Infografik zum Vergleich von KI-Modellabläufen, Geschwindigkeit, Kosten und Hardware","caption":"Drei KI-Verarbeitungspfade zeigen Unterschiede bei Leistung, Kosten und verbundener Infrastruktur.","description":null}}}],"published_at":"2026-08-01T07:15:42+09:00","updated_at":"2026-08-01T07:15:42+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/openai-gpt-5-6-price-performance-model-routing"}