{"content_id":"flazlbamrl","slug":"why-most-ai-inference-will-remain-in-data-centers","locale":"id","schema_type":"TechArticle","category":"trends","category_name":"Tren","title":"Mengapa Inferensi Pusat Data Kemungkinan Besar Tetap Dominan Meski AI Lokal Maju","summary":"AI lokal akan memainkan peran penting dalam perlindungan data pribadi, pengoperasian offline, dan respons instan, tetapi pusat performa tertinggi dan pemrosesan skala besar kemungkinan besar akan tetap berada di pusat data. Penyebab utamanya adalah standar performa yang terus bergeser, batching dan tingkat utilisasi akselerator yang tinggi, perangkat keras untuk pusat data, serta tugas agen yang makin kompleks.","sponsorship_disclosure":null,"affiliate_disclosure":null,"commerce_disclosure":null,"author":{"name":"injoys","url":"https://injoys.com/ko/about"},"key_points":["Fakta bahwa model open-weight dapat digunakan berbeda dengan fakta bahwa model tersebut dapat dijalankan secara efisien pada perangkat pribadi.","Meskipun laptop masa depan dapat menjalankan model terbaik saat ini, model pusat data pada masa itu mungkin menawarkan performa yang lebih tinggi dan kemampuan menjalankan tugas lebih lama.","Pusat data dapat menggabungkan berbagai permintaan secara dinamis dan berbagi akselerator untuk mencapai throughput serta tingkat utilisasi yang lebih tinggi daripada perangkat pribadi.","Biaya inferensi lokal harus dihitung dengan mencakup bukan hanya biaya pembelian GPU, tetapi juga depresiasi, listrik, pendinginan, pemeliharaan, dan tingkat penggunaan yang rendah.","Pasar nyata kemungkinan besar akan lebih mendekati struktur hibrida yang menghubungkan kedua lingkungan sesuai tugas, alih-alih salah satu dari lokal atau cloud menghilang."],"content_markdown":"Seiring model bobot terbuka dan model bahasa kecil berkembang pesat, prediksi bahwa pada akhirnya semua AI akan dijalankan di PC atau ponsel pintar terus bermunculan. Eksekusi lokal memiliki keunggulan yang jelas: mengurangi biaya penggunaan API, tidak mengirim data sensitif ke pihak luar, dan tetap berfungsi tanpa internet.\n\nNamun, pertumbuhan AI lokal dan kemunduran AI pusat data bukanlah pernyataan yang sama. Meskipun AI yang dijalankan di perangkat pribadi akan meningkat pesat pada masa mendatang, jika dilihat dari total komputasi dan tugas berkesulitan tinggi, pusat data kemungkinan besar akan tetap menjadi pusat inferensi. Alasannya bukan hanya ukuran model, melainkan juga interaksi antara persaingan kinerja, permintaan pengguna, batching, tingkat pemanfaatan perangkat keras, dan total biaya kepemilikan.\n\n## Tiga konsep yang harus dibedakan terlebih dahulu\n\nDalam perdebatan tentang AI lokal, beberapa dimensi yang berbeda sering kali tercampur.\n\n| Kategori | Arti | Konsep yang berlawanan |\n|---|---|---|\n| Bobot terbuka | Model yang bobot terlatihnya dapat diunduh dan digunakan dalam cakupan lisensi yang ditentukan | Model yang bobotnya tidak dipublikasikan |\n| Inferensi lokal·di perangkat | Metode yang dijalankan langsung di PC, ponsel pintar, kendaraan, atau perangkat internal perusahaan | Metode yang dijalankan di pusat data eksternal |\n| Hosting mandiri | Metode pengoperasian model di server atau pusat data yang dipilih pengguna | Metode yang menggunakan API penyedia model |\n\nBobot terbuka tidak selalu berarti lokal. Perusahaan dapat menyediakan layanan model bobot terbuka melalui klaster GPU sewaan atau pusat data miliknya sendiri. Sebaliknya, produsen perangkat juga dapat memasang model kecil yang tidak dipublikasikan pada ponsel pintar.\n\nKarena itu, pertanyaan sebenarnya bukanlah ‘apakah model terbuka berkembang’, melainkan ‘di lingkungan komputasi mana setiap tugas lebih menguntungkan untuk diproses dari sisi kinerja, biaya, perlindungan privasi, dan operasional’.\n\nBobot terbuka juga tidak serta-merta berarti sumber terbuka sepenuhnya. Karena ketentuan yang berlaku untuk penggunaan, redistribusi, dan model turunan berbeda-beda menurut lisensi model, lisensi terkait harus diperiksa secara terpisah sebelum penerapan komersial.\n\n## Model lokal masa depan dapat menyamai model terbaik saat ini\n\nPerkembangan kuantisasi, distilasi pengetahuan, pruning, optimalisasi mesin inferensi, dan NPU khusus memungkinkan tugas pada tingkat yang sama diproses dengan lebih sedikit memori dan daya. Prediksi bahwa sebagian kemampuan yang saat ini memerlukan server dapat berpindah ke laptop atau ponsel pintar beberapa tahun lagi cukup masuk akal.\n\nNamun, tolok ukurnya tidak tetap. Sementara model lokal masa depan menjadi setara dengan model terbaik saat ini, model pusat data juga dapat berkembang ke arah berikut.\n\n- Penalaran dan perencanaan yang lebih kompleks\n- Pemrosesan konteks yang lebih panjang dan hasil pencarian berskala besar\n- Tugas multimodal yang menggabungkan gambar, suara, dan video\n- Penggunaan banyak alat dan sistem eksternal secara stabil\n- Penalaran dengan memanfaatkan banyak agen atau jalur kandidat\n- Kemampuan menemukan dan memulihkan kesalahan selama tugas berdurasi panjang\n\nKarena itu, pernyataan ‘suatu saat kinerja terbaik saat ini dapat diwujudkan secara lokal’ berbeda dari pernyataan ‘kinerja terbaik pada saat itu juga dapat diwujudkan secara lokal’. Pernyataan pertama sangat mungkin terwujud melalui peningkatan efisiensi teknologi, tetapi pernyataan kedua dapat terus sulit diwujudkan selama skala daya, memori, jaringan, dan akselerator yang disediakan pusat data juga terus berkembang.\n\n## Standar kinerja yang dianggap memadai oleh pengguna juga meningkat\n\nTugas representatif AI generatif pada tahap awal adalah menjawab pertanyaan, merangkum dokumen pendek, menyusun draf surel, dan menghasilkan kode sederhana. Tugas-tugas seperti ini dapat ditangani secara berguna bahkan oleh model lokal kecil.\n\nSebaliknya, agen AI membaca seluruh repositori kode, mengubah banyak berkas, menjalankan pengujian, serta berulang kali melakukan pencarian dan memanggil alat eksternal. Agen riset harus bekerja dalam waktu lama sambil membandingkan berbagai materi dan menyimpan hasil antara. Agen otomatisasi pekerjaan bahkan harus menangani hak akses, basis data, dan sistem internal perusahaan.\n\nDalam tugas berdurasi panjang, kesalahan pada setiap tahap akan terakumulasi. Meskipun tingkat keberhasilan satu tahap tinggi, jika puluhan keputusan dan pemanggilan alat dilakukan secara berurutan, peluang keberhasilan keseluruhan tugas dapat turun drastis. Karena itu, pengguna akan menilai kemampuan berikut, bukan sekadar kualitas satu jawaban.\n\n- Apakah tujuan dan batasan dapat dipertahankan dalam waktu lama\n- Apakah pemanggilan alat yang gagal dapat didiagnosis dan dipulihkan\n- Apakah informasi yang belum dikonfirmasi tidak dibuat seolah-olah merupakan fakta\n- Apakah konteks luas kode dan dokumen dipahami secara konsisten\n- Apakah jumlah intervensi manusia dapat dikurangi\n\nJika model yang lebih kuat dapat mengurangi pengerjaan ulang dan waktu pengawasan, total biaya pekerjaan dapat lebih rendah meskipun harga per token lebih tinggi. Sebaliknya, untuk tugas pendek dan berulang, model lokal yang murah lebih masuk akal. Pada akhirnya, kriteria pemilihan bukan hanya harga model, tetapi biaya untuk satu tugas yang selesai dan risiko kegagalannya.\n\n## Keunggulan utama pusat data adalah batching dan berbagi sumber daya\n\nPembuatan token pada model bahasa besar sangat bergantung pada proses membaca bobot model secara berulang dari memori akselerator. Jika hanya satu permintaan yang diproses, sebagian kemampuan perangkat komputasi paralel berskala besar dan bandwidth memori mungkin tidak dimanfaatkan sepenuhnya.\n\nSistem penyajian menggabungkan permintaan dari pengguna yang berbeda ke dalam satu batch untuk melakukan operasi matriks. Dengan cara ini, beberapa permintaan dapat diproses bersama dalam satu proses komputasi sehingga kepadatan komputasi dan throughput meningkat. Batching berkelanjutan, yang mengeluarkan permintaan yang telah selesai dan memasukkan permintaan baru, merupakan teknologi utama untuk meningkatkan tingkat pemanfaatan dalam layanan nyata yang panjang masukan dan keluarannya berbeda-beda.\n\nBatching tidak sepenuhnya menghilangkan biaya secara proporsional terhadap jumlah permintaan. Setiap permintaan memiliki token yang harus dihitung dan cache KV, sedangkan batch yang lebih besar juga meningkatkan penggunaan memori dan waktu tunggu. Operator harus menyeimbangkan unsur-unsur berikut.\n\n- Jumlah token yang diproses per detik\n- Latensi hingga token pertama muncul\n- Latensi token keluaran untuk setiap permintaan\n- Memori yang digunakan cache KV\n- Campuran permintaan dengan konteks panjang dan pendek\n- Sasaran tingkat layanan dan jumlah maksimum permintaan simultan\n\nMeski demikian, layanan berskala besar terus menerima permintaan sehingga lebih mudah mengurangi waktu menganggur dibandingkan GPU pribadi. Replika model dapat digunakan bersama oleh banyak pelanggan, jumlah server dapat disesuaikan menurut lalu lintas, dan sebagian tugas juga dapat dipindahkan ke akselerator yang sesuai.\n\n## GPU pribadi cenderung memiliki tingkat pemanfaatan rata-rata yang rendah\n\nPerangkat pribadi dapat digunakan seketika saat diperlukan, tetapi dapat berada dalam kondisi siaga hampir sepanjang hari. Bahkan jika beberapa agen dijalankan secara bersamaan, sulit untuk terus mengisi permintaan dengan berbagai panjang seperti pada layanan berskala besar.\n\nKelayakan ekonomi perangkat lokal bergantung bukan pada kecepatan pemrosesan maksimum, melainkan pada tingkat penggunaan sebenarnya. Meskipun memiliki GPU mahal, jika hanya digunakan beberapa jam seminggu, biaya modal per token efektif akan membesar. Sebaliknya, jika ada pekerjaan berkelanjutan seperti produksi video, pengujian perangkat lunak, atau pemrosesan dokumen dalam jumlah besar, tingkat pemanfaatan perangkat lokal dapat meningkat dan menjadi kompetitif dari sisi biaya.\n\nJika server lokal dibuka untuk banyak orang, tingkat pemanfaatan dan peluang batching akan meningkat. Namun, pada saat itu autentikasi, kontrol akses, antrean tugas, penanganan gangguan, pendinginan, dan pemantauan menjadi diperlukan. Meskipun skalanya kecil, masalah yang serupa dengan pengoperasian pusat data pun muncul.\n\n## Akselerator untuk pusat data memiliki tujuan dan konfigurasi yang berbeda\n\nGPU konsumen juga kuat untuk AI generatif, tetapi dirancang dengan mempertimbangkan gim, grafis, dan komputasi serbaguna secara bersamaan. Akselerator pusat data berfokus pada memori berkapasitas besar dan berbandwidth tinggi, koneksi antarakselerator, ekspansi pada tingkat rak, dan komputasi AI berpresisi rendah.\n\nGeForce RTX 4090 adalah GPU konsumen, sedangkan NVIDIA B200 adalah akselerator AI untuk pusat data. Menurut estimasi yang dibandingkan penulis, pada tingkat daya yang sama, kinerja komputasi NVIDIA B200 sekitar 3 kali lebih tinggi daripada RTX 4090, sedangkan bandwidth memorinya mendekati sekitar 4 kali lebih tinggi. Perbedaan ini menguntungkan pusat data ketika model besar dimuat ke memori dan disediakan sebagai layanan dengan throughput tinggi.\n\nNamun, angka kinerja kedua produk tidak boleh dibandingkan dengan rasio sederhana. Kapasitas komputasi AI yang dipublikasikan dapat berbeda dalam hal presisi, penerapan sparsitas, batas daya, dan konfigurasi sistem. Kinerja inferensi aktual harus dinilai melalui benchmark yang menyamakan arsitektur model, metode kuantisasi, ukuran batch, panjang konteks, dan tumpukan perangkat lunak.\n\nJika model besar dibagi ke beberapa akselerator, biaya komunikasi juga akan timbul. Pusat data menyediakan interkoneksi berkecepatan tinggi dan jaringan yang dioptimalkan, tetapi inferensi terdistribusi bukanlah sesuatu yang gratis. Untuk model kecil, menjalankannya pada satu GPU konsumen justru dapat lebih sederhana dan efisien.\n\n## Cara menghitung biaya aktual inferensi lokal\n\nPerhitungan ‘karena GPU sudah dibeli, inferensi berikutnya gratis’ mengabaikan biaya modal dan biaya operasional. Semua unsur berikut harus disertakan.\n\n**Total biaya kepemilikan lokal**\n\n`biaya pembelian - perkiraan nilai jual kembali + biaya listrik + biaya pendinginan + biaya perbaikan·penggantian + nilai waktu operasional`\n\nJika jumlah ini dibagi dengan jumlah token efektif yang benar-benar dihasilkan atau jumlah tugas yang diselesaikan, akan diperoleh biaya satuan yang dapat dibandingkan. Perhitungan akan lebih akurat jika didasarkan pada hasil yang dapat digunakan setelah pemeriksaan, bukan sekadar token keluaran.\n\nBiaya listrik dapat diperkirakan sebagai berikut.\n\n`konsumsi daya rata-rata(kW) × waktu operasi(h) × tarif listrik`\n\nKonsumsi daya akibat kehilangan pada catu daya, CPU dan memori, perangkat penyimpanan, serta peralatan pendingin juga harus disertakan. Karena tarif listrik dan waktu penggunaan perangkat sangat berbeda menurut wilayah, menetapkan biaya listrik bulanan tetap yang berlaku bagi semua pengguna tidaklah tepat.\n\n**Total biaya cloud** dapat mencakup transfer data, waktu tunggu, biaya pergantian penyedia, batas penggunaan, dan biaya pengelolaan informasi sensitif, selain biaya API atau langganan. Jika penggunaan kecil atau tidak teratur, layanan bayar sesuai penggunaan cenderung lebih menguntungkan. Jika terdapat pekerjaan massal yang stabil dan dapat diprediksi, perangkat milik sendiri atau infrastruktur berbasis reservasi dapat menjadi lebih menguntungkan.\n\n## Bidang yang jelas menguntungkan bagi AI lokal\n\nKelayakan ekonomi pusat data tidak menghilangkan kebutuhan akan AI lokal. Dalam kondisi berikut, kontrol data, ketersediaan, atau waktu respons dapat lebih penting daripada model terbaik.\n\n| Situasi | Keunggulan eksekusi lokal | Batasan yang harus diperiksa |\n|---|---|---|\n| Lingkungan offline | Berfungsi tanpa terpengaruh gangguan internet atau pembatasan komunikasi | Kinerja perangkat dan konsumsi baterai |\n| Pemrosesan informasi sensitif | Data asli tidak perlu dikirim ke server eksternal | Pencurian perangkat, malware, dan perlindungan log lokal |\n| Bantuan papan ketik·suara | Latensi singkat dan respons seketika | Ukuran model dan akurasi |\n| Klasifikasi skala kecil yang berulang | Biaya marjinal rendah jika volume penggunaan memadai | Biaya pengembangan·perangkat awal |\n| Pengendalian kendaraan·pabrik·lapangan | Pengambilan keputusan cepat tanpa perjalanan bolak-balik melalui jaringan | Verifikasi keselamatan dan sistem pembaruan |\n| Fitur personalisasi | Memanfaatkan konteks pengguna di dalam perangkat | Pengelolaan hak akses dan penghapusan data |\n\nPerlindungan privasi juga tidak dapat dinilai secara dikotomis sebagai ‘lokal berarti aman, cloud berarti berbahaya’. Jika perangkat lokal terinfeksi atau disknya tidak dienkripsi, data dapat terekspos. Sebaliknya, layanan cloud juga dapat menyediakan pembatasan penyimpanan data, enkripsi, dan lingkungan eksekusi terisolasi, tetapi pengguna harus memeriksa struktur teknis serta ketentuan kontrak yang sebenarnya.\n\n## Bentuk yang paling mungkin adalah AI hibrida\n\nAI lokal dan pusat data kemungkinan besar akan membagi peran, bukan saling menggantikan sepenuhnya.\n\n1. Perangkat menangani deteksi suara, penghapusan informasi pribadi, klasifikasi singkat, dan pembuatan sederhana.\n2. Router lokal menilai tingkat kesulitan dan sensitivitas tugas.\n3. Model pusat data hanya dipanggil ketika diperlukan penalaran kompleks, konteks panjang, atau pencarian berskala besar.\n4. Sebagian hasil diverifikasi secara lokal atau digabungkan dengan data pengguna.\n5. Jika koneksi terputus, sistem beralih ke model lokal dengan fungsi terbatas.\n\nStruktur ini memungkinkan penggunaan model yang kuat saat diperlukan sambil mengurangi jumlah panggilan cloud. Penyedia dapat menggunakan model kecil untuk pemfilteran·routing·pembuatan draf, lalu mengalokasikan model besar hanya untuk permintaan yang sulit. Pengguna juga dapat menjalankan model terbuka secara lokal sekaligus menghubungkan model pusat data terpisah sebagai sarana pendukung.\n\n## Harus ditentukan terlebih dahulu apa metrik untuk ‘sebagian besar inferensi’\n\nProporsi AI lokal dan AI pusat data dapat terlihat sepenuhnya berbeda menurut satuan pengukuran. Pembedaan ini sering terlewat dalam perdebatan sederhana mengenai pangsa pasar.\n\n- **Jumlah permintaan:** Jika pelengkapan otomatis singkat atau klasifikasi pada ponsel pintar meningkat, proporsi lokal dapat menjadi tinggi.\n- **Jumlah token yang dihasilkan:** Jika dokumen panjang dan tugas agen terkonsentrasi di cloud, proporsi pusat data dapat menjadi tinggi.\n- **Jumlah komputasi:** Penalaran sulit, pembuatan banyak kandidat, dan pemrosesan multimodal dapat meningkatkan total komputasi pusat data.\n- **Jumlah pengeluaran:** Layanan dan infrastruktur perusahaan yang mahal dapat meningkatkan proporsi pengeluaran untuk pusat data.\n- **Waktu yang dirasakan pengguna:** Karena fitur bantuan lokal selalu aktif, pengguna dapat merasa lebih sering menggunakan AI lokal.\n\nKarena itu, pada masa depan jumlah permintaan lokal dapat meningkat, sementara total komputasi AI, tugas berkesulitan tinggi, dan pengeluaran terkait tetap terkonsentrasi di pusat data. Ungkapan ‘semua AI akan berpindah ke lokal’ maupun ‘AI lokal tidak penting’ sama-sama mengabaikan perbedaan ini.\n\n## Variabel yang dapat mengubah prospek\n\nProspek yang berpusat pada pusat data bukanlah hukum yang telah ditetapkan. Jika perubahan berikut terjadi, proporsi lokal dapat tumbuh lebih cepat daripada perkiraan.\n\n- Ketika kemampuan model benar-benar mencapai kejenuhan dalam banyak pekerjaan sehingga nilai model yang lebih kuat menjadi lebih kecil\n- Ketika perangkat berdaya rendah dengan kapasitas dan bandwidth memori tinggi menjadi umum\n- Ketika distilasi dan kuantisasi dapat mengecilkan model secara drastis hampir tanpa kehilangan kemampuan penalaran berkesulitan tinggi\n- Ketika regulasi privasi·keamanan nasional sangat membatasi pengiriman ke server eksternal\n- Ketika ekspansi pusat data melambat akibat keterbatasan jaringan listrik, air pendingin, pasokan semikonduktor, atau perizinan\n- Ketika teknologi dan sistem kompensasi untuk menggabungkan sumber daya perangkat terdistribusi secara aman telah matang\n\nSebaliknya, jika tugas agen menjadi lebih panjang, pembuatan video dan pemrosesan multimodal waktu nyata menjadi umum, serta tingkat pemanfaatan akselerator dan efisiensi daya pusat data terus meningkat, keunggulan inferensi terpusat dapat semakin kuat.\n\n## Kesimpulan\n\nAI lokal bukanlah teknologi pinggiran yang akan menghilang. Teknologi ini kemungkinan besar akan menjadi lapisan penting dalam fitur bantuan ponsel pintar, pemrosesan informasi sensitif, pekerjaan offline, dan layanan yang mementingkan latensi. Model bobot terbuka juga memperluas pilihan dan kemampuan hosting mandiri serta membantu mengurangi ketergantungan pada penyedia.\n\nNamun, sulit untuk menganggap kebutuhan akan pusat data akan hilang hanya karena peningkatan efisiensi model. Standar kinerja terbaik dan tuntutan pengguna meningkat secara bersamaan, sedangkan pusat data memiliki keunggulan struktural dalam batching, tingkat pemanfaatan akselerator yang tinggi, memori berkapasitas besar dan berbandwidth tinggi, serta berbagi sumber daya.\n\nProspek jangka panjang yang paling meyakinkan bukanlah kemenangan AI lokal ataupun monopoli cloud. Bentuknya adalah struktur berlapis yang menangani tugas singkat, sensitif, dan mendesak di perangkat, sementara tugas kompleks, panjang, dan berbiaya tinggi dikirim ke pusat data. Dalam lingkungan ini, daya saing yang penting bukanlah ukuran satu model, melainkan routing yang mengirim tugas ke lokasi eksekusi yang tepat, pengendalian biaya, dan tata kelola data.","content_html":"\u003cp\u003eSeiring model bobot terbuka dan model bahasa kecil berkembang pesat, prediksi bahwa pada akhirnya semua AI akan dijalankan di PC atau ponsel pintar terus bermunculan. Eksekusi lokal memiliki keunggulan yang jelas: mengurangi biaya penggunaan API, tidak mengirim data sensitif ke pihak luar, dan tetap berfungsi tanpa internet.\u003c/p\u003e\n\u003cp\u003eNamun, pertumbuhan AI lokal dan kemunduran AI pusat data bukanlah pernyataan yang sama. Meskipun AI yang dijalankan di perangkat pribadi akan meningkat pesat pada masa mendatang, jika dilihat dari total komputasi dan tugas berkesulitan tinggi, pusat data kemungkinan besar akan tetap menjadi pusat inferensi. Alasannya bukan hanya ukuran model, melainkan juga interaksi antara persaingan kinerja, permintaan pengguna, batching, tingkat pemanfaatan perangkat keras, dan total biaya kepemilikan.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#tiga-konsep-yang-harus-dibedakan-terlebih-dahulu\" class=\"anchor\" id=\"tiga-konsep-yang-harus-dibedakan-terlebih-dahulu\"\u003e\u003c/a\u003eTiga konsep yang harus dibedakan terlebih dahulu\u003c/h2\u003e\n\u003cp\u003eDalam perdebatan tentang AI lokal, beberapa dimensi yang berbeda sering kali tercampur.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eKategori\u003c/th\u003e\n\u003cth\u003eArti\u003c/th\u003e\n\u003cth\u003eKonsep yang berlawanan\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategori\"\u003eBobot terbuka\u003c/td\u003e\n\u003ctd data-label=\"Arti\"\u003eModel yang bobot terlatihnya dapat diunduh dan digunakan dalam cakupan lisensi yang ditentukan\u003c/td\u003e\n\u003ctd data-label=\"Konsep yang berlawanan\"\u003eModel yang bobotnya tidak dipublikasikan\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategori\"\u003eInferensi lokal·di perangkat\u003c/td\u003e\n\u003ctd data-label=\"Arti\"\u003eMetode yang dijalankan langsung di PC, ponsel pintar, kendaraan, atau perangkat internal perusahaan\u003c/td\u003e\n\u003ctd data-label=\"Konsep yang berlawanan\"\u003eMetode yang dijalankan di pusat data eksternal\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Kategori\"\u003eHosting mandiri\u003c/td\u003e\n\u003ctd data-label=\"Arti\"\u003eMetode pengoperasian model di server atau pusat data yang dipilih pengguna\u003c/td\u003e\n\u003ctd data-label=\"Konsep yang berlawanan\"\u003eMetode yang menggunakan API penyedia model\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003eBobot terbuka tidak selalu berarti lokal. Perusahaan dapat menyediakan layanan model bobot terbuka melalui klaster GPU sewaan atau pusat data miliknya sendiri. Sebaliknya, produsen perangkat juga dapat memasang model kecil yang tidak dipublikasikan pada ponsel pintar.\u003c/p\u003e\n\u003cp\u003eKarena itu, pertanyaan sebenarnya bukanlah ‘apakah model terbuka berkembang’, melainkan ‘di lingkungan komputasi mana setiap tugas lebih menguntungkan untuk diproses dari sisi kinerja, biaya, perlindungan privasi, dan operasional’.\u003c/p\u003e\n\u003cp\u003eBobot terbuka juga tidak serta-merta berarti sumber terbuka sepenuhnya. Karena ketentuan yang berlaku untuk penggunaan, redistribusi, dan model turunan berbeda-beda menurut lisensi model, lisensi terkait harus diperiksa secara terpisah sebelum penerapan komersial.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#model-lokal-masa-depan-dapat-menyamai-model-terbaik-saat-ini\" class=\"anchor\" id=\"model-lokal-masa-depan-dapat-menyamai-model-terbaik-saat-ini\"\u003e\u003c/a\u003eModel lokal masa depan dapat menyamai model terbaik saat ini\u003c/h2\u003e\n\u003cp\u003ePerkembangan kuantisasi, distilasi pengetahuan, pruning, optimalisasi mesin inferensi, dan NPU khusus memungkinkan tugas pada tingkat yang sama diproses dengan lebih sedikit memori dan daya. Prediksi bahwa sebagian kemampuan yang saat ini memerlukan server dapat berpindah ke laptop atau ponsel pintar beberapa tahun lagi cukup masuk akal.\u003c/p\u003e\n\u003cp\u003eNamun, tolok ukurnya tidak tetap. Sementara model lokal masa depan menjadi setara dengan model terbaik saat ini, model pusat data juga dapat berkembang ke arah berikut.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003ePenalaran dan perencanaan yang lebih kompleks\u003c/li\u003e\n\u003cli\u003ePemrosesan konteks yang lebih panjang dan hasil pencarian berskala besar\u003c/li\u003e\n\u003cli\u003eTugas multimodal yang menggabungkan gambar, suara, dan video\u003c/li\u003e\n\u003cli\u003ePenggunaan banyak alat dan sistem eksternal secara stabil\u003c/li\u003e\n\u003cli\u003ePenalaran dengan memanfaatkan banyak agen atau jalur kandidat\u003c/li\u003e\n\u003cli\u003eKemampuan menemukan dan memulihkan kesalahan selama tugas berdurasi panjang\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eKarena itu, pernyataan ‘suatu saat kinerja terbaik saat ini dapat diwujudkan secara lokal’ berbeda dari pernyataan ‘kinerja terbaik pada saat itu juga dapat diwujudkan secara lokal’. Pernyataan pertama sangat mungkin terwujud melalui peningkatan efisiensi teknologi, tetapi pernyataan kedua dapat terus sulit diwujudkan selama skala daya, memori, jaringan, dan akselerator yang disediakan pusat data juga terus berkembang.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#standar-kinerja-yang-dianggap-memadai-oleh-pengguna-juga-meningkat\" class=\"anchor\" id=\"standar-kinerja-yang-dianggap-memadai-oleh-pengguna-juga-meningkat\"\u003e\u003c/a\u003eStandar kinerja yang dianggap memadai oleh pengguna juga meningkat\u003c/h2\u003e\n\u003cp\u003eTugas representatif AI generatif pada tahap awal adalah menjawab pertanyaan, merangkum dokumen pendek, menyusun draf surel, dan menghasilkan kode sederhana. Tugas-tugas seperti ini dapat ditangani secara berguna bahkan oleh model lokal kecil.\u003c/p\u003e\n\u003cp\u003eSebaliknya, agen AI membaca seluruh repositori kode, mengubah banyak berkas, menjalankan pengujian, serta berulang kali melakukan pencarian dan memanggil alat eksternal. Agen riset harus bekerja dalam waktu lama sambil membandingkan berbagai materi dan menyimpan hasil antara. Agen otomatisasi pekerjaan bahkan harus menangani hak akses, basis data, dan sistem internal perusahaan.\u003c/p\u003e\n\u003cp\u003eDalam tugas berdurasi panjang, kesalahan pada setiap tahap akan terakumulasi. Meskipun tingkat keberhasilan satu tahap tinggi, jika puluhan keputusan dan pemanggilan alat dilakukan secara berurutan, peluang keberhasilan keseluruhan tugas dapat turun drastis. Karena itu, pengguna akan menilai kemampuan berikut, bukan sekadar kualitas satu jawaban.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eApakah tujuan dan batasan dapat dipertahankan dalam waktu lama\u003c/li\u003e\n\u003cli\u003eApakah pemanggilan alat yang gagal dapat didiagnosis dan dipulihkan\u003c/li\u003e\n\u003cli\u003eApakah informasi yang belum dikonfirmasi tidak dibuat seolah-olah merupakan fakta\u003c/li\u003e\n\u003cli\u003eApakah konteks luas kode dan dokumen dipahami secara konsisten\u003c/li\u003e\n\u003cli\u003eApakah jumlah intervensi manusia dapat dikurangi\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eJika model yang lebih kuat dapat mengurangi pengerjaan ulang dan waktu pengawasan, total biaya pekerjaan dapat lebih rendah meskipun harga per token lebih tinggi. Sebaliknya, untuk tugas pendek dan berulang, model lokal yang murah lebih masuk akal. Pada akhirnya, kriteria pemilihan bukan hanya harga model, tetapi biaya untuk satu tugas yang selesai dan risiko kegagalannya.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#keunggulan-utama-pusat-data-adalah-batching-dan-berbagi-sumber-daya\" class=\"anchor\" id=\"keunggulan-utama-pusat-data-adalah-batching-dan-berbagi-sumber-daya\"\u003e\u003c/a\u003eKeunggulan utama pusat data adalah batching dan berbagi sumber daya\u003c/h2\u003e\n\u003cp\u003ePembuatan token pada model bahasa besar sangat bergantung pada proses membaca bobot model secara berulang dari memori akselerator. Jika hanya satu permintaan yang diproses, sebagian kemampuan perangkat komputasi paralel berskala besar dan bandwidth memori mungkin tidak dimanfaatkan sepenuhnya.\u003c/p\u003e\n\u003cp\u003eSistem penyajian menggabungkan permintaan dari pengguna yang berbeda ke dalam satu batch untuk melakukan operasi matriks. Dengan cara ini, beberapa permintaan dapat diproses bersama dalam satu proses komputasi sehingga kepadatan komputasi dan throughput meningkat. Batching berkelanjutan, yang mengeluarkan permintaan yang telah selesai dan memasukkan permintaan baru, merupakan teknologi utama untuk meningkatkan tingkat pemanfaatan dalam layanan nyata yang panjang masukan dan keluarannya berbeda-beda.\u003c/p\u003e\n\u003cp\u003eBatching tidak sepenuhnya menghilangkan biaya secara proporsional terhadap jumlah permintaan. Setiap permintaan memiliki token yang harus dihitung dan cache KV, sedangkan batch yang lebih besar juga meningkatkan penggunaan memori dan waktu tunggu. Operator harus menyeimbangkan unsur-unsur berikut.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eJumlah token yang diproses per detik\u003c/li\u003e\n\u003cli\u003eLatensi hingga token pertama muncul\u003c/li\u003e\n\u003cli\u003eLatensi token keluaran untuk setiap permintaan\u003c/li\u003e\n\u003cli\u003eMemori yang digunakan cache KV\u003c/li\u003e\n\u003cli\u003eCampuran permintaan dengan konteks panjang dan pendek\u003c/li\u003e\n\u003cli\u003eSasaran tingkat layanan dan jumlah maksimum permintaan simultan\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eMeski demikian, layanan berskala besar terus menerima permintaan sehingga lebih mudah mengurangi waktu menganggur dibandingkan GPU pribadi. Replika model dapat digunakan bersama oleh banyak pelanggan, jumlah server dapat disesuaikan menurut lalu lintas, dan sebagian tugas juga dapat dipindahkan ke akselerator yang sesuai.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#gpu-pribadi-cenderung-memiliki-tingkat-pemanfaatan-rata-rata-yang-rendah\" class=\"anchor\" id=\"gpu-pribadi-cenderung-memiliki-tingkat-pemanfaatan-rata-rata-yang-rendah\"\u003e\u003c/a\u003eGPU pribadi cenderung memiliki tingkat pemanfaatan rata-rata yang rendah\u003c/h2\u003e\n\u003cp\u003ePerangkat pribadi dapat digunakan seketika saat diperlukan, tetapi dapat berada dalam kondisi siaga hampir sepanjang hari. Bahkan jika beberapa agen dijalankan secara bersamaan, sulit untuk terus mengisi permintaan dengan berbagai panjang seperti pada layanan berskala besar.\u003c/p\u003e\n\u003cp\u003eKelayakan ekonomi perangkat lokal bergantung bukan pada kecepatan pemrosesan maksimum, melainkan pada tingkat penggunaan sebenarnya. Meskipun memiliki GPU mahal, jika hanya digunakan beberapa jam seminggu, biaya modal per token efektif akan membesar. Sebaliknya, jika ada pekerjaan berkelanjutan seperti produksi video, pengujian perangkat lunak, atau pemrosesan dokumen dalam jumlah besar, tingkat pemanfaatan perangkat lokal dapat meningkat dan menjadi kompetitif dari sisi biaya.\u003c/p\u003e\n\u003cp\u003eJika server lokal dibuka untuk banyak orang, tingkat pemanfaatan dan peluang batching akan meningkat. Namun, pada saat itu autentikasi, kontrol akses, antrean tugas, penanganan gangguan, pendinginan, dan pemantauan menjadi diperlukan. Meskipun skalanya kecil, masalah yang serupa dengan pengoperasian pusat data pun muncul.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#akselerator-untuk-pusat-data-memiliki-tujuan-dan-konfigurasi-yang-berbeda\" class=\"anchor\" id=\"akselerator-untuk-pusat-data-memiliki-tujuan-dan-konfigurasi-yang-berbeda\"\u003e\u003c/a\u003eAkselerator untuk pusat data memiliki tujuan dan konfigurasi yang berbeda\u003c/h2\u003e\n\u003cp\u003eGPU konsumen juga kuat untuk AI generatif, tetapi dirancang dengan mempertimbangkan gim, grafis, dan komputasi serbaguna secara bersamaan. Akselerator pusat data berfokus pada memori berkapasitas besar dan berbandwidth tinggi, koneksi antarakselerator, ekspansi pada tingkat rak, dan komputasi AI berpresisi rendah.\u003c/p\u003e\n\u003cp\u003eGeForce RTX 4090 adalah GPU konsumen, sedangkan NVIDIA B200 adalah akselerator AI untuk pusat data. Menurut estimasi yang dibandingkan penulis, pada tingkat daya yang sama, kinerja komputasi NVIDIA B200 sekitar 3 kali lebih tinggi daripada RTX 4090, sedangkan bandwidth memorinya mendekati sekitar 4 kali lebih tinggi. Perbedaan ini menguntungkan pusat data ketika model besar dimuat ke memori dan disediakan sebagai layanan dengan throughput tinggi.\u003c/p\u003e\n\u003cp\u003eNamun, angka kinerja kedua produk tidak boleh dibandingkan dengan rasio sederhana. Kapasitas komputasi AI yang dipublikasikan dapat berbeda dalam hal presisi, penerapan sparsitas, batas daya, dan konfigurasi sistem. Kinerja inferensi aktual harus dinilai melalui benchmark yang menyamakan arsitektur model, metode kuantisasi, ukuran batch, panjang konteks, dan tumpukan perangkat lunak.\u003c/p\u003e\n\u003cp\u003eJika model besar dibagi ke beberapa akselerator, biaya komunikasi juga akan timbul. Pusat data menyediakan interkoneksi berkecepatan tinggi dan jaringan yang dioptimalkan, tetapi inferensi terdistribusi bukanlah sesuatu yang gratis. Untuk model kecil, menjalankannya pada satu GPU konsumen justru dapat lebih sederhana dan efisien.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#cara-menghitung-biaya-aktual-inferensi-lokal\" class=\"anchor\" id=\"cara-menghitung-biaya-aktual-inferensi-lokal\"\u003e\u003c/a\u003eCara menghitung biaya aktual inferensi lokal\u003c/h2\u003e\n\u003cp\u003ePerhitungan ‘karena GPU sudah dibeli, inferensi berikutnya gratis’ mengabaikan biaya modal dan biaya operasional. Semua unsur berikut harus disertakan.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eTotal biaya kepemilikan lokal\u003c/strong\u003e\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003ebiaya pembelian - perkiraan nilai jual kembali + biaya listrik + biaya pendinginan + biaya perbaikan·penggantian + nilai waktu operasional\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eJika jumlah ini dibagi dengan jumlah token efektif yang benar-benar dihasilkan atau jumlah tugas yang diselesaikan, akan diperoleh biaya satuan yang dapat dibandingkan. Perhitungan akan lebih akurat jika didasarkan pada hasil yang dapat digunakan setelah pemeriksaan, bukan sekadar token keluaran.\u003c/p\u003e\n\u003cp\u003eBiaya listrik dapat diperkirakan sebagai berikut.\u003c/p\u003e\n\u003cp\u003e\u003ccode\u003ekonsumsi daya rata-rata(kW) × waktu operasi(h) × tarif listrik\u003c/code\u003e\u003c/p\u003e\n\u003cp\u003eKonsumsi daya akibat kehilangan pada catu daya, CPU dan memori, perangkat penyimpanan, serta peralatan pendingin juga harus disertakan. Karena tarif listrik dan waktu penggunaan perangkat sangat berbeda menurut wilayah, menetapkan biaya listrik bulanan tetap yang berlaku bagi semua pengguna tidaklah tepat.\u003c/p\u003e\n\u003cp\u003e\u003cstrong\u003eTotal biaya cloud\u003c/strong\u003e dapat mencakup transfer data, waktu tunggu, biaya pergantian penyedia, batas penggunaan, dan biaya pengelolaan informasi sensitif, selain biaya API atau langganan. Jika penggunaan kecil atau tidak teratur, layanan bayar sesuai penggunaan cenderung lebih menguntungkan. Jika terdapat pekerjaan massal yang stabil dan dapat diprediksi, perangkat milik sendiri atau infrastruktur berbasis reservasi dapat menjadi lebih menguntungkan.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#bidang-yang-jelas-menguntungkan-bagi-ai-lokal\" class=\"anchor\" id=\"bidang-yang-jelas-menguntungkan-bagi-ai-lokal\"\u003e\u003c/a\u003eBidang yang jelas menguntungkan bagi AI lokal\u003c/h2\u003e\n\u003cp\u003eKelayakan ekonomi pusat data tidak menghilangkan kebutuhan akan AI lokal. Dalam kondisi berikut, kontrol data, ketersediaan, atau waktu respons dapat lebih penting daripada model terbaik.\u003c/p\u003e\n\u003cdiv class=\"overflow-x-auto\"\u003e\u003ctable\u003e\n\u003cthead\u003e\n\u003ctr\u003e\n\u003cth\u003eSituasi\u003c/th\u003e\n\u003cth\u003eKeunggulan eksekusi lokal\u003c/th\u003e\n\u003cth\u003eBatasan yang harus diperiksa\u003c/th\u003e\n\u003c/tr\u003e\n\u003c/thead\u003e\n\u003ctbody\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situasi\"\u003eLingkungan offline\u003c/td\u003e\n\u003ctd data-label=\"Keunggulan eksekusi lokal\"\u003eBerfungsi tanpa terpengaruh gangguan internet atau pembatasan komunikasi\u003c/td\u003e\n\u003ctd data-label=\"Batasan yang harus diperiksa\"\u003eKinerja perangkat dan konsumsi baterai\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situasi\"\u003ePemrosesan informasi sensitif\u003c/td\u003e\n\u003ctd data-label=\"Keunggulan eksekusi lokal\"\u003eData asli tidak perlu dikirim ke server eksternal\u003c/td\u003e\n\u003ctd data-label=\"Batasan yang harus diperiksa\"\u003ePencurian perangkat, malware, dan perlindungan log lokal\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situasi\"\u003eBantuan papan ketik·suara\u003c/td\u003e\n\u003ctd data-label=\"Keunggulan eksekusi lokal\"\u003eLatensi singkat dan respons seketika\u003c/td\u003e\n\u003ctd data-label=\"Batasan yang harus diperiksa\"\u003eUkuran model dan akurasi\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situasi\"\u003eKlasifikasi skala kecil yang berulang\u003c/td\u003e\n\u003ctd data-label=\"Keunggulan eksekusi lokal\"\u003eBiaya marjinal rendah jika volume penggunaan memadai\u003c/td\u003e\n\u003ctd data-label=\"Batasan yang harus diperiksa\"\u003eBiaya pengembangan·perangkat awal\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situasi\"\u003ePengendalian kendaraan·pabrik·lapangan\u003c/td\u003e\n\u003ctd data-label=\"Keunggulan eksekusi lokal\"\u003ePengambilan keputusan cepat tanpa perjalanan bolak-balik melalui jaringan\u003c/td\u003e\n\u003ctd data-label=\"Batasan yang harus diperiksa\"\u003eVerifikasi keselamatan dan sistem pembaruan\u003c/td\u003e\n\u003c/tr\u003e\n\u003ctr\u003e\n\u003ctd data-label=\"Situasi\"\u003eFitur personalisasi\u003c/td\u003e\n\u003ctd data-label=\"Keunggulan eksekusi lokal\"\u003eMemanfaatkan konteks pengguna di dalam perangkat\u003c/td\u003e\n\u003ctd data-label=\"Batasan yang harus diperiksa\"\u003ePengelolaan hak akses dan penghapusan data\u003c/td\u003e\n\u003c/tr\u003e\n\u003c/tbody\u003e\n\u003c/table\u003e\u003c/div\u003e\n\u003cp\u003ePerlindungan privasi juga tidak dapat dinilai secara dikotomis sebagai ‘lokal berarti aman, cloud berarti berbahaya’. Jika perangkat lokal terinfeksi atau disknya tidak dienkripsi, data dapat terekspos. Sebaliknya, layanan cloud juga dapat menyediakan pembatasan penyimpanan data, enkripsi, dan lingkungan eksekusi terisolasi, tetapi pengguna harus memeriksa struktur teknis serta ketentuan kontrak yang sebenarnya.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#bentuk-yang-paling-mungkin-adalah-ai-hibrida\" class=\"anchor\" id=\"bentuk-yang-paling-mungkin-adalah-ai-hibrida\"\u003e\u003c/a\u003eBentuk yang paling mungkin adalah AI hibrida\u003c/h2\u003e\n\u003cp\u003eAI lokal dan pusat data kemungkinan besar akan membagi peran, bukan saling menggantikan sepenuhnya.\u003c/p\u003e\n\u003col\u003e\n\u003cli\u003ePerangkat menangani deteksi suara, penghapusan informasi pribadi, klasifikasi singkat, dan pembuatan sederhana.\u003c/li\u003e\n\u003cli\u003eRouter lokal menilai tingkat kesulitan dan sensitivitas tugas.\u003c/li\u003e\n\u003cli\u003eModel pusat data hanya dipanggil ketika diperlukan penalaran kompleks, konteks panjang, atau pencarian berskala besar.\u003c/li\u003e\n\u003cli\u003eSebagian hasil diverifikasi secara lokal atau digabungkan dengan data pengguna.\u003c/li\u003e\n\u003cli\u003eJika koneksi terputus, sistem beralih ke model lokal dengan fungsi terbatas.\u003c/li\u003e\n\u003c/ol\u003e\n\u003cp\u003eStruktur ini memungkinkan penggunaan model yang kuat saat diperlukan sambil mengurangi jumlah panggilan cloud. Penyedia dapat menggunakan model kecil untuk pemfilteran·routing·pembuatan draf, lalu mengalokasikan model besar hanya untuk permintaan yang sulit. Pengguna juga dapat menjalankan model terbuka secara lokal sekaligus menghubungkan model pusat data terpisah sebagai sarana pendukung.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#harus-ditentukan-terlebih-dahulu-apa-metrik-untuk-sebagian-besar-inferensi\" class=\"anchor\" id=\"harus-ditentukan-terlebih-dahulu-apa-metrik-untuk-sebagian-besar-inferensi\"\u003e\u003c/a\u003eHarus ditentukan terlebih dahulu apa metrik untuk ‘sebagian besar inferensi’\u003c/h2\u003e\n\u003cp\u003eProporsi AI lokal dan AI pusat data dapat terlihat sepenuhnya berbeda menurut satuan pengukuran. Pembedaan ini sering terlewat dalam perdebatan sederhana mengenai pangsa pasar.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003e\n\u003cstrong\u003eJumlah permintaan:\u003c/strong\u003e Jika pelengkapan otomatis singkat atau klasifikasi pada ponsel pintar meningkat, proporsi lokal dapat menjadi tinggi.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eJumlah token yang dihasilkan:\u003c/strong\u003e Jika dokumen panjang dan tugas agen terkonsentrasi di cloud, proporsi pusat data dapat menjadi tinggi.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eJumlah komputasi:\u003c/strong\u003e Penalaran sulit, pembuatan banyak kandidat, dan pemrosesan multimodal dapat meningkatkan total komputasi pusat data.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eJumlah pengeluaran:\u003c/strong\u003e Layanan dan infrastruktur perusahaan yang mahal dapat meningkatkan proporsi pengeluaran untuk pusat data.\u003c/li\u003e\n\u003cli\u003e\n\u003cstrong\u003eWaktu yang dirasakan pengguna:\u003c/strong\u003e Karena fitur bantuan lokal selalu aktif, pengguna dapat merasa lebih sering menggunakan AI lokal.\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eKarena itu, pada masa depan jumlah permintaan lokal dapat meningkat, sementara total komputasi AI, tugas berkesulitan tinggi, dan pengeluaran terkait tetap terkonsentrasi di pusat data. Ungkapan ‘semua AI akan berpindah ke lokal’ maupun ‘AI lokal tidak penting’ sama-sama mengabaikan perbedaan ini.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#variabel-yang-dapat-mengubah-prospek\" class=\"anchor\" id=\"variabel-yang-dapat-mengubah-prospek\"\u003e\u003c/a\u003eVariabel yang dapat mengubah prospek\u003c/h2\u003e\n\u003cp\u003eProspek yang berpusat pada pusat data bukanlah hukum yang telah ditetapkan. Jika perubahan berikut terjadi, proporsi lokal dapat tumbuh lebih cepat daripada perkiraan.\u003c/p\u003e\n\u003cul\u003e\n\u003cli\u003eKetika kemampuan model benar-benar mencapai kejenuhan dalam banyak pekerjaan sehingga nilai model yang lebih kuat menjadi lebih kecil\u003c/li\u003e\n\u003cli\u003eKetika perangkat berdaya rendah dengan kapasitas dan bandwidth memori tinggi menjadi umum\u003c/li\u003e\n\u003cli\u003eKetika distilasi dan kuantisasi dapat mengecilkan model secara drastis hampir tanpa kehilangan kemampuan penalaran berkesulitan tinggi\u003c/li\u003e\n\u003cli\u003eKetika regulasi privasi·keamanan nasional sangat membatasi pengiriman ke server eksternal\u003c/li\u003e\n\u003cli\u003eKetika ekspansi pusat data melambat akibat keterbatasan jaringan listrik, air pendingin, pasokan semikonduktor, atau perizinan\u003c/li\u003e\n\u003cli\u003eKetika teknologi dan sistem kompensasi untuk menggabungkan sumber daya perangkat terdistribusi secara aman telah matang\u003c/li\u003e\n\u003c/ul\u003e\n\u003cp\u003eSebaliknya, jika tugas agen menjadi lebih panjang, pembuatan video dan pemrosesan multimodal waktu nyata menjadi umum, serta tingkat pemanfaatan akselerator dan efisiensi daya pusat data terus meningkat, keunggulan inferensi terpusat dapat semakin kuat.\u003c/p\u003e\n\u003ch2\u003e\n\u003ca href=\"#kesimpulan\" class=\"anchor\" id=\"kesimpulan\"\u003e\u003c/a\u003eKesimpulan\u003c/h2\u003e\n\u003cp\u003eAI lokal bukanlah teknologi pinggiran yang akan menghilang. Teknologi ini kemungkinan besar akan menjadi lapisan penting dalam fitur bantuan ponsel pintar, pemrosesan informasi sensitif, pekerjaan offline, dan layanan yang mementingkan latensi. Model bobot terbuka juga memperluas pilihan dan kemampuan hosting mandiri serta membantu mengurangi ketergantungan pada penyedia.\u003c/p\u003e\n\u003cp\u003eNamun, sulit untuk menganggap kebutuhan akan pusat data akan hilang hanya karena peningkatan efisiensi model. Standar kinerja terbaik dan tuntutan pengguna meningkat secara bersamaan, sedangkan pusat data memiliki keunggulan struktural dalam batching, tingkat pemanfaatan akselerator yang tinggi, memori berkapasitas besar dan berbandwidth tinggi, serta berbagi sumber daya.\u003c/p\u003e\n\u003cp\u003eProspek jangka panjang yang paling meyakinkan bukanlah kemenangan AI lokal ataupun monopoli cloud. Bentuknya adalah struktur berlapis yang menangani tugas singkat, sensitif, dan mendesak di perangkat, sementara tugas kompleks, panjang, dan berbiaya tinggi dikirim ke pusat data. Dalam lingkungan ini, daya saing yang penting bukanlah ukuran satu model, melainkan routing yang mengirim tugas ke lokasi eksekusi yang tepat, pengendalian biaya, dan tata kelola data.\u003c/p\u003e\n","tags":["Semikonduktor","AI generatif","Pusat data AI","Perlindungan data pribadi","Chip AI","Strategi teknologi"],"faqs":[{"question":"Apakah semua model open-weight dapat dijalankan di PC pribadi?","answer":"Tidak. Open-weight berarti bobot model dapat digunakan, bukan berarti model tersebut cocok untuk perangkat keras pribadi. Hal ini bergantung pada ukuran model, presisi, kapasitas memori, dan ketentuan lisensi. Model open-weight berukuran besar mungkin memerlukan beberapa GPU pusat data."},{"question":"Apakah ponsel pintar masa depan dapat menghadirkan performa AI terbaik saat ini?","answer":"Dengan kemajuan kuantisasi, distilasi, dan NPU, besar kemungkinan sebagian kemampuan kelas server saat ini akan berpindah ke ponsel pintar. Namun, model pusat data pada saat itu juga akan berkembang, sehingga ini bukan berarti ponsel pintar akan mampu menyamai model terbaik di masa depan."},{"question":"Jika membeli GPU, apakah AI lokal selalu lebih murah daripada API?","answer":"Tidak selalu. Biaya pembelian, nilai jual kembali, listrik, pendinginan, pemeliharaan, dan tingkat penggunaan aktual semuanya harus diperhitungkan. Jika penggunaan sedikit atau tidak teratur, layanan berbasis pemakaian mungkin lebih menguntungkan, sedangkan eksekusi lokal mungkin lebih menguntungkan untuk pekerjaan bervolume besar yang menggunakan perangkat secara terus-menerus."},{"question":"Mengapa batching menurunkan biaya dalam inferensi AI?","answer":"Memproses beberapa permintaan secara bersamaan memungkinkan kemampuan komputasi paralel dan bandwidth memori akselerator digunakan dengan lebih efisien. Batching berkelanjutan meningkatkan tingkat pemanfaatan dengan menghapus permintaan yang telah selesai dan menambahkan permintaan baru, tetapi ukuran batch tidak dapat diperbesar tanpa batas karena cache KV dan latensi."},{"question":"Apakah AI lokal selalu lebih aman dalam melindungi informasi pribadi?","answer":"AI lokal memiliki keunggulan karena data tidak dikirim ke server eksternal, tetapi hal itu tidak serta-merta membuatnya aman. Diperlukan enkripsi perangkat, perlindungan dari malware, pengaturan hak akses, serta pengelolaan log dan cadangan. Saat menggunakan cloud, kebijakan penyimpanan data, apakah data digunakan untuk pelatihan, serta metode enkripsi dan isolasi harus diperiksa."},{"question":"Bolehkah performa AI GPU konsumen dan GPU pusat data dibandingkan hanya berdasarkan FLOPS?","answer":"Tidak boleh. Presisi, sparsitas, batas daya, dan kondisi pengukuran dapat berbeda. Inferensi LLM yang sebenarnya juga sangat dipengaruhi oleh kapasitas dan bandwidth memori, ukuran batch, panjang konteks, cache KV, koneksi antar-akselerator, dan perangkat lunak penyajian."},{"question":"Pekerjaan apa yang paling cocok untuk AI lokal?","answer":"AI lokal cocok untuk pekerjaan yang mengutamakan latensi dan kendali data, seperti pelengkapan otomatis pada papan ketik, peringkasan dan klasifikasi singkat, pemrosesan suara luring, prapemrosesan informasi sensitif, dan pengendalian di lokasi. Pusat data kemungkinan besar lebih unggul untuk pekerjaan agen berdurasi panjang, pemrosesan multimodal berskala besar, dan inferensi yang membutuhkan performa terbaik."},{"question":"Dalam jangka panjang, mana yang akan menang antara AI lokal dan AI cloud?","answer":"Alih-alih salah satunya menggantikan yang lain sepenuhnya, struktur hibrida lebih mungkin digunakan. Perangkat menangani pekerjaan sederhana dan sensitif, sementara hanya permintaan kompleks yang dikirim ke pusat data. Meskipun jumlah permintaan yang ditangani secara lokal lebih banyak, total komputasi dan pekerjaan berkompleksitas tinggi dapat terpusat di pusat data."}],"sources":[{"url":"https://arxiv.org/abs/2309.06180","title":"Manajemen Memori yang Efisien untuk Penyajian Model Bahasa Besar dengan PagedAttention","type":"source"},{"url":"https://arxiv.org/abs/2206.02658","title":"Orca: Sistem Penyajian Terdistribusi untuk Model Generatif Berbasis Transformer","type":"source"},{"url":"https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/","title":"Arsitektur NVIDIA Blackwell","type":"data_point"},{"url":"https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/","title":"NVIDIA GeForce RTX 4090","type":"data_point"},{"url":"https://mlcommons.org/benchmarks/inference-datacenter/","title":"Inferensi MLPerf: Pusat Data","type":"source"},{"url":"https://security.apple.com/blog/private-cloud-compute/","title":"Private Cloud Compute: Terobosan Baru untuk Privasi AI di Cloud","type":"source"},{"url":"https://developer.android.com/ai/gemini-nano","title":"Google AI Edge SDK dengan Gemini Nano","type":"source"}],"images":[{"id":932,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTAsInB1ciI6ImJsb2JfaWQifX0=--34abeef97dfe63b15e2b649c2c6ae8c564924b28/ai-0fdb0281.webp","is_representative":true,"generation_method":"ai_photo","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"서버 랙 앞에서 소형 장비에 케이블을 연결하는 데이터센터 기술자","caption":"기술자가 데이터센터 서버 옆에서 네트워크 장비와 모니터링 노트북을 점검하고 있다.","description":null},"en":{"alt":"Data center technician connecting a cable to a compact device beside server racks","caption":"A technician checks network hardware and a monitoring laptop beside data center servers.","description":null},"ja":{"alt":"サーバーラックの前で小型機器にケーブルを接続するデータセンター技術者","caption":"技術者がデータセンターのサーバー脇でネットワーク機器と監視用ノートPCを点検している。","description":null},"es":{"alt":"Técnico de centro de datos conectando un cable a un equipo compacto junto a servidores","caption":"Un técnico revisa el equipo de red y un portátil de monitoreo junto a los servidores.","description":null},"id":{"alt":"Teknisi pusat data menghubungkan kabel ke perangkat ringkas di depan rak server","caption":"Teknisi memeriksa perangkat jaringan dan laptop pemantau di samping server pusat data.","description":null},"pt":{"alt":"Técnico de data center conectando um cabo a um equipamento compacto junto aos servidores","caption":"Um técnico verifica o equipamento de rede e um notebook de monitoramento ao lado dos servidores.","description":null},"zh-hant":{"alt":"資料中心技術人員在伺服器機櫃前為小型設備連接纜線","caption":"技術人員在資料中心伺服器旁檢查網路設備與監控筆電。","description":null},"de":{"alt":"Rechenzentrumstechniker verbindet vor Serverracks ein Kabel mit einem kompakten Gerät","caption":"Ein Techniker prüft neben den Servern Netzwerkhardware und einen Monitoring-Laptop.","description":null}}},{"id":933,"url":"https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTYsInB1ciI6ImJsb2JfaWQifX0=--4b642e72ce104856aa40ed5bc224e337cf7877c2/ai-70dfbb70.webp","is_representative":false,"generation_method":"ai_image","license":"ai_generated","mime_type":"image/webp","translations":{"ko":{"alt":"노트북과 스마트폰의 로컬 AI가 서버, GPU, 데이터센터와 연결된 구조를 비교한 도식","caption":"로컬 기기와 대규모 데이터센터 추론 인프라의 연결과 자원 차이를 보여준다.","description":null},"en":{"alt":"Diagram comparing local AI on a laptop and phone with servers, GPUs, and data center infrastructure","caption":"The graphic contrasts connected local devices with large-scale data center inference resources.","description":null},"ja":{"alt":"ノートPCとスマートフォンのローカルAIをサーバー、GPU、データセンターと比較した図","caption":"ローカル端末と大規模なデータセンター推論基盤の接続や資源の違いを示している。","description":null},"es":{"alt":"Diagrama que compara IA local en portátil y móvil con servidores, GPU e infraestructura de centro de datos","caption":"El gráfico contrasta los dispositivos locales conectados con los recursos de inferencia de un centro de datos.","description":null},"id":{"alt":"Diagram perbandingan AI lokal di laptop dan ponsel dengan server, GPU, dan infrastruktur pusat data","caption":"Grafik ini membandingkan perangkat lokal terhubung dengan sumber daya inferensi pusat data berskala besar.","description":null},"pt":{"alt":"Diagrama compara IA local em notebook e celular com servidores, GPUs e infraestrutura de data center","caption":"O gráfico contrasta dispositivos locais conectados com recursos de inferência de data center em grande escala.","description":null},"zh-hant":{"alt":"比較筆電與手機本地 AI 和伺服器、GPU及資料中心基礎設施的示意圖","caption":"圖中對比連網的本地裝置與大規模資料中心推論資源。","description":null},"de":{"alt":"Schaubild vergleicht lokale KI auf Laptop und Smartphone mit Servern, GPUs und Rechenzentrum","caption":"Die Grafik stellt vernetzte lokale Geräte den umfangreichen Inferenzressourcen eines Rechenzentrums gegenüber.","description":null}}}],"published_at":"2026-08-28T11:45:54+09:00","updated_at":"2026-08-28T11:45:54+09:00","license":"cc_by","translation_status":"reviewed","available_locales":["ko","en","ja","es"],"data_locales":["ko","en","ja","es","id","pt","zh-hant","de"],"url":"https://injoys.com/en/articles/why-most-ai-inference-will-remain-in-data-centers"}