---
title: "Mengapa Inferensi Pusat Data Kemungkinan Besar Tetap Dominan Meski AI Lokal Maju"
locale: id
category: trends
category_name: "Tren"
translation_status: reviewed
license: cc_by
author: "injoys"
source_url: https://injoys.com/en/articles/why-most-ai-inference-will-remain-in-data-centers
published_at: 2026-08-28T11:45:54+09:00
---

# Mengapa Inferensi Pusat Data Kemungkinan Besar Tetap Dominan Meski AI Lokal Maju

> AI lokal akan memainkan peran penting dalam perlindungan data pribadi, pengoperasian offline, dan respons instan, tetapi pusat performa tertinggi dan pemrosesan skala besar kemungkinan besar akan tetap berada di pusat data. Penyebab utamanya adalah standar performa yang terus bergeser, batching dan tingkat utilisasi akselerator yang tinggi, perangkat keras untuk pusat data, serta tugas agen yang makin kompleks.

## Key Points

- Fakta bahwa model open-weight dapat digunakan berbeda dengan fakta bahwa model tersebut dapat dijalankan secara efisien pada perangkat pribadi.
- Meskipun laptop masa depan dapat menjalankan model terbaik saat ini, model pusat data pada masa itu mungkin menawarkan performa yang lebih tinggi dan kemampuan menjalankan tugas lebih lama.
- Pusat data dapat menggabungkan berbagai permintaan secara dinamis dan berbagi akselerator untuk mencapai throughput serta tingkat utilisasi yang lebih tinggi daripada perangkat pribadi.
- Biaya inferensi lokal harus dihitung dengan mencakup bukan hanya biaya pembelian GPU, tetapi juga depresiasi, listrik, pendinginan, pemeliharaan, dan tingkat penggunaan yang rendah.
- Pasar nyata kemungkinan besar akan lebih mendekati struktur hibrida yang menghubungkan kedua lingkungan sesuai tugas, alih-alih salah satu dari lokal atau cloud menghilang.

Seiring model bobot terbuka dan model bahasa kecil berkembang pesat, prediksi bahwa pada akhirnya semua AI akan dijalankan di PC atau ponsel pintar terus bermunculan. Eksekusi lokal memiliki keunggulan yang jelas: mengurangi biaya penggunaan API, tidak mengirim data sensitif ke pihak luar, dan tetap berfungsi tanpa internet.

Namun, pertumbuhan AI lokal dan kemunduran AI pusat data bukanlah pernyataan yang sama. Meskipun AI yang dijalankan di perangkat pribadi akan meningkat pesat pada masa mendatang, jika dilihat dari total komputasi dan tugas berkesulitan tinggi, pusat data kemungkinan besar akan tetap menjadi pusat inferensi. Alasannya bukan hanya ukuran model, melainkan juga interaksi antara persaingan kinerja, permintaan pengguna, batching, tingkat pemanfaatan perangkat keras, dan total biaya kepemilikan.

## Tiga konsep yang harus dibedakan terlebih dahulu

Dalam perdebatan tentang AI lokal, beberapa dimensi yang berbeda sering kali tercampur.

| Kategori | Arti | Konsep yang berlawanan |
|---|---|---|
| Bobot terbuka | Model yang bobot terlatihnya dapat diunduh dan digunakan dalam cakupan lisensi yang ditentukan | Model yang bobotnya tidak dipublikasikan |
| Inferensi lokal·di perangkat | Metode yang dijalankan langsung di PC, ponsel pintar, kendaraan, atau perangkat internal perusahaan | Metode yang dijalankan di pusat data eksternal |
| Hosting mandiri | Metode pengoperasian model di server atau pusat data yang dipilih pengguna | Metode yang menggunakan API penyedia model |

Bobot terbuka tidak selalu berarti lokal. Perusahaan dapat menyediakan layanan model bobot terbuka melalui klaster GPU sewaan atau pusat data miliknya sendiri. Sebaliknya, produsen perangkat juga dapat memasang model kecil yang tidak dipublikasikan pada ponsel pintar.

Karena itu, pertanyaan sebenarnya bukanlah ‘apakah model terbuka berkembang’, melainkan ‘di lingkungan komputasi mana setiap tugas lebih menguntungkan untuk diproses dari sisi kinerja, biaya, perlindungan privasi, dan operasional’.

Bobot terbuka juga tidak serta-merta berarti sumber terbuka sepenuhnya. Karena ketentuan yang berlaku untuk penggunaan, redistribusi, dan model turunan berbeda-beda menurut lisensi model, lisensi terkait harus diperiksa secara terpisah sebelum penerapan komersial.

## Model lokal masa depan dapat menyamai model terbaik saat ini

Perkembangan kuantisasi, distilasi pengetahuan, pruning, optimalisasi mesin inferensi, dan NPU khusus memungkinkan tugas pada tingkat yang sama diproses dengan lebih sedikit memori dan daya. Prediksi bahwa sebagian kemampuan yang saat ini memerlukan server dapat berpindah ke laptop atau ponsel pintar beberapa tahun lagi cukup masuk akal.

Namun, tolok ukurnya tidak tetap. Sementara model lokal masa depan menjadi setara dengan model terbaik saat ini, model pusat data juga dapat berkembang ke arah berikut.

- Penalaran dan perencanaan yang lebih kompleks
- Pemrosesan konteks yang lebih panjang dan hasil pencarian berskala besar
- Tugas multimodal yang menggabungkan gambar, suara, dan video
- Penggunaan banyak alat dan sistem eksternal secara stabil
- Penalaran dengan memanfaatkan banyak agen atau jalur kandidat
- Kemampuan menemukan dan memulihkan kesalahan selama tugas berdurasi panjang

Karena itu, pernyataan ‘suatu saat kinerja terbaik saat ini dapat diwujudkan secara lokal’ berbeda dari pernyataan ‘kinerja terbaik pada saat itu juga dapat diwujudkan secara lokal’. Pernyataan pertama sangat mungkin terwujud melalui peningkatan efisiensi teknologi, tetapi pernyataan kedua dapat terus sulit diwujudkan selama skala daya, memori, jaringan, dan akselerator yang disediakan pusat data juga terus berkembang.

## Standar kinerja yang dianggap memadai oleh pengguna juga meningkat

Tugas representatif AI generatif pada tahap awal adalah menjawab pertanyaan, merangkum dokumen pendek, menyusun draf surel, dan menghasilkan kode sederhana. Tugas-tugas seperti ini dapat ditangani secara berguna bahkan oleh model lokal kecil.

Sebaliknya, agen AI membaca seluruh repositori kode, mengubah banyak berkas, menjalankan pengujian, serta berulang kali melakukan pencarian dan memanggil alat eksternal. Agen riset harus bekerja dalam waktu lama sambil membandingkan berbagai materi dan menyimpan hasil antara. Agen otomatisasi pekerjaan bahkan harus menangani hak akses, basis data, dan sistem internal perusahaan.

Dalam tugas berdurasi panjang, kesalahan pada setiap tahap akan terakumulasi. Meskipun tingkat keberhasilan satu tahap tinggi, jika puluhan keputusan dan pemanggilan alat dilakukan secara berurutan, peluang keberhasilan keseluruhan tugas dapat turun drastis. Karena itu, pengguna akan menilai kemampuan berikut, bukan sekadar kualitas satu jawaban.

- Apakah tujuan dan batasan dapat dipertahankan dalam waktu lama
- Apakah pemanggilan alat yang gagal dapat didiagnosis dan dipulihkan
- Apakah informasi yang belum dikonfirmasi tidak dibuat seolah-olah merupakan fakta
- Apakah konteks luas kode dan dokumen dipahami secara konsisten
- Apakah jumlah intervensi manusia dapat dikurangi

Jika model yang lebih kuat dapat mengurangi pengerjaan ulang dan waktu pengawasan, total biaya pekerjaan dapat lebih rendah meskipun harga per token lebih tinggi. Sebaliknya, untuk tugas pendek dan berulang, model lokal yang murah lebih masuk akal. Pada akhirnya, kriteria pemilihan bukan hanya harga model, tetapi biaya untuk satu tugas yang selesai dan risiko kegagalannya.

## Keunggulan utama pusat data adalah batching dan berbagi sumber daya

Pembuatan token pada model bahasa besar sangat bergantung pada proses membaca bobot model secara berulang dari memori akselerator. Jika hanya satu permintaan yang diproses, sebagian kemampuan perangkat komputasi paralel berskala besar dan bandwidth memori mungkin tidak dimanfaatkan sepenuhnya.

Sistem penyajian menggabungkan permintaan dari pengguna yang berbeda ke dalam satu batch untuk melakukan operasi matriks. Dengan cara ini, beberapa permintaan dapat diproses bersama dalam satu proses komputasi sehingga kepadatan komputasi dan throughput meningkat. Batching berkelanjutan, yang mengeluarkan permintaan yang telah selesai dan memasukkan permintaan baru, merupakan teknologi utama untuk meningkatkan tingkat pemanfaatan dalam layanan nyata yang panjang masukan dan keluarannya berbeda-beda.

Batching tidak sepenuhnya menghilangkan biaya secara proporsional terhadap jumlah permintaan. Setiap permintaan memiliki token yang harus dihitung dan cache KV, sedangkan batch yang lebih besar juga meningkatkan penggunaan memori dan waktu tunggu. Operator harus menyeimbangkan unsur-unsur berikut.

- Jumlah token yang diproses per detik
- Latensi hingga token pertama muncul
- Latensi token keluaran untuk setiap permintaan
- Memori yang digunakan cache KV
- Campuran permintaan dengan konteks panjang dan pendek
- Sasaran tingkat layanan dan jumlah maksimum permintaan simultan

Meski demikian, layanan berskala besar terus menerima permintaan sehingga lebih mudah mengurangi waktu menganggur dibandingkan GPU pribadi. Replika model dapat digunakan bersama oleh banyak pelanggan, jumlah server dapat disesuaikan menurut lalu lintas, dan sebagian tugas juga dapat dipindahkan ke akselerator yang sesuai.

## GPU pribadi cenderung memiliki tingkat pemanfaatan rata-rata yang rendah

Perangkat pribadi dapat digunakan seketika saat diperlukan, tetapi dapat berada dalam kondisi siaga hampir sepanjang hari. Bahkan jika beberapa agen dijalankan secara bersamaan, sulit untuk terus mengisi permintaan dengan berbagai panjang seperti pada layanan berskala besar.

Kelayakan ekonomi perangkat lokal bergantung bukan pada kecepatan pemrosesan maksimum, melainkan pada tingkat penggunaan sebenarnya. Meskipun memiliki GPU mahal, jika hanya digunakan beberapa jam seminggu, biaya modal per token efektif akan membesar. Sebaliknya, jika ada pekerjaan berkelanjutan seperti produksi video, pengujian perangkat lunak, atau pemrosesan dokumen dalam jumlah besar, tingkat pemanfaatan perangkat lokal dapat meningkat dan menjadi kompetitif dari sisi biaya.

Jika server lokal dibuka untuk banyak orang, tingkat pemanfaatan dan peluang batching akan meningkat. Namun, pada saat itu autentikasi, kontrol akses, antrean tugas, penanganan gangguan, pendinginan, dan pemantauan menjadi diperlukan. Meskipun skalanya kecil, masalah yang serupa dengan pengoperasian pusat data pun muncul.

## Akselerator untuk pusat data memiliki tujuan dan konfigurasi yang berbeda

GPU konsumen juga kuat untuk AI generatif, tetapi dirancang dengan mempertimbangkan gim, grafis, dan komputasi serbaguna secara bersamaan. Akselerator pusat data berfokus pada memori berkapasitas besar dan berbandwidth tinggi, koneksi antarakselerator, ekspansi pada tingkat rak, dan komputasi AI berpresisi rendah.

GeForce RTX 4090 adalah GPU konsumen, sedangkan NVIDIA B200 adalah akselerator AI untuk pusat data. Menurut estimasi yang dibandingkan penulis, pada tingkat daya yang sama, kinerja komputasi NVIDIA B200 sekitar 3 kali lebih tinggi daripada RTX 4090, sedangkan bandwidth memorinya mendekati sekitar 4 kali lebih tinggi. Perbedaan ini menguntungkan pusat data ketika model besar dimuat ke memori dan disediakan sebagai layanan dengan throughput tinggi.

Namun, angka kinerja kedua produk tidak boleh dibandingkan dengan rasio sederhana. Kapasitas komputasi AI yang dipublikasikan dapat berbeda dalam hal presisi, penerapan sparsitas, batas daya, dan konfigurasi sistem. Kinerja inferensi aktual harus dinilai melalui benchmark yang menyamakan arsitektur model, metode kuantisasi, ukuran batch, panjang konteks, dan tumpukan perangkat lunak.

Jika model besar dibagi ke beberapa akselerator, biaya komunikasi juga akan timbul. Pusat data menyediakan interkoneksi berkecepatan tinggi dan jaringan yang dioptimalkan, tetapi inferensi terdistribusi bukanlah sesuatu yang gratis. Untuk model kecil, menjalankannya pada satu GPU konsumen justru dapat lebih sederhana dan efisien.

## Cara menghitung biaya aktual inferensi lokal

Perhitungan ‘karena GPU sudah dibeli, inferensi berikutnya gratis’ mengabaikan biaya modal dan biaya operasional. Semua unsur berikut harus disertakan.

**Total biaya kepemilikan lokal**

`biaya pembelian - perkiraan nilai jual kembali + biaya listrik + biaya pendinginan + biaya perbaikan·penggantian + nilai waktu operasional`

Jika jumlah ini dibagi dengan jumlah token efektif yang benar-benar dihasilkan atau jumlah tugas yang diselesaikan, akan diperoleh biaya satuan yang dapat dibandingkan. Perhitungan akan lebih akurat jika didasarkan pada hasil yang dapat digunakan setelah pemeriksaan, bukan sekadar token keluaran.

Biaya listrik dapat diperkirakan sebagai berikut.

`konsumsi daya rata-rata(kW) × waktu operasi(h) × tarif listrik`

Konsumsi daya akibat kehilangan pada catu daya, CPU dan memori, perangkat penyimpanan, serta peralatan pendingin juga harus disertakan. Karena tarif listrik dan waktu penggunaan perangkat sangat berbeda menurut wilayah, menetapkan biaya listrik bulanan tetap yang berlaku bagi semua pengguna tidaklah tepat.

**Total biaya cloud** dapat mencakup transfer data, waktu tunggu, biaya pergantian penyedia, batas penggunaan, dan biaya pengelolaan informasi sensitif, selain biaya API atau langganan. Jika penggunaan kecil atau tidak teratur, layanan bayar sesuai penggunaan cenderung lebih menguntungkan. Jika terdapat pekerjaan massal yang stabil dan dapat diprediksi, perangkat milik sendiri atau infrastruktur berbasis reservasi dapat menjadi lebih menguntungkan.

## Bidang yang jelas menguntungkan bagi AI lokal

Kelayakan ekonomi pusat data tidak menghilangkan kebutuhan akan AI lokal. Dalam kondisi berikut, kontrol data, ketersediaan, atau waktu respons dapat lebih penting daripada model terbaik.

| Situasi | Keunggulan eksekusi lokal | Batasan yang harus diperiksa |
|---|---|---|
| Lingkungan offline | Berfungsi tanpa terpengaruh gangguan internet atau pembatasan komunikasi | Kinerja perangkat dan konsumsi baterai |
| Pemrosesan informasi sensitif | Data asli tidak perlu dikirim ke server eksternal | Pencurian perangkat, malware, dan perlindungan log lokal |
| Bantuan papan ketik·suara | Latensi singkat dan respons seketika | Ukuran model dan akurasi |
| Klasifikasi skala kecil yang berulang | Biaya marjinal rendah jika volume penggunaan memadai | Biaya pengembangan·perangkat awal |
| Pengendalian kendaraan·pabrik·lapangan | Pengambilan keputusan cepat tanpa perjalanan bolak-balik melalui jaringan | Verifikasi keselamatan dan sistem pembaruan |
| Fitur personalisasi | Memanfaatkan konteks pengguna di dalam perangkat | Pengelolaan hak akses dan penghapusan data |

Perlindungan privasi juga tidak dapat dinilai secara dikotomis sebagai ‘lokal berarti aman, cloud berarti berbahaya’. Jika perangkat lokal terinfeksi atau disknya tidak dienkripsi, data dapat terekspos. Sebaliknya, layanan cloud juga dapat menyediakan pembatasan penyimpanan data, enkripsi, dan lingkungan eksekusi terisolasi, tetapi pengguna harus memeriksa struktur teknis serta ketentuan kontrak yang sebenarnya.

## Bentuk yang paling mungkin adalah AI hibrida

AI lokal dan pusat data kemungkinan besar akan membagi peran, bukan saling menggantikan sepenuhnya.

1. Perangkat menangani deteksi suara, penghapusan informasi pribadi, klasifikasi singkat, dan pembuatan sederhana.
2. Router lokal menilai tingkat kesulitan dan sensitivitas tugas.
3. Model pusat data hanya dipanggil ketika diperlukan penalaran kompleks, konteks panjang, atau pencarian berskala besar.
4. Sebagian hasil diverifikasi secara lokal atau digabungkan dengan data pengguna.
5. Jika koneksi terputus, sistem beralih ke model lokal dengan fungsi terbatas.

Struktur ini memungkinkan penggunaan model yang kuat saat diperlukan sambil mengurangi jumlah panggilan cloud. Penyedia dapat menggunakan model kecil untuk pemfilteran·routing·pembuatan draf, lalu mengalokasikan model besar hanya untuk permintaan yang sulit. Pengguna juga dapat menjalankan model terbuka secara lokal sekaligus menghubungkan model pusat data terpisah sebagai sarana pendukung.

## Harus ditentukan terlebih dahulu apa metrik untuk ‘sebagian besar inferensi’

Proporsi AI lokal dan AI pusat data dapat terlihat sepenuhnya berbeda menurut satuan pengukuran. Pembedaan ini sering terlewat dalam perdebatan sederhana mengenai pangsa pasar.

- **Jumlah permintaan:** Jika pelengkapan otomatis singkat atau klasifikasi pada ponsel pintar meningkat, proporsi lokal dapat menjadi tinggi.
- **Jumlah token yang dihasilkan:** Jika dokumen panjang dan tugas agen terkonsentrasi di cloud, proporsi pusat data dapat menjadi tinggi.
- **Jumlah komputasi:** Penalaran sulit, pembuatan banyak kandidat, dan pemrosesan multimodal dapat meningkatkan total komputasi pusat data.
- **Jumlah pengeluaran:** Layanan dan infrastruktur perusahaan yang mahal dapat meningkatkan proporsi pengeluaran untuk pusat data.
- **Waktu yang dirasakan pengguna:** Karena fitur bantuan lokal selalu aktif, pengguna dapat merasa lebih sering menggunakan AI lokal.

Karena itu, pada masa depan jumlah permintaan lokal dapat meningkat, sementara total komputasi AI, tugas berkesulitan tinggi, dan pengeluaran terkait tetap terkonsentrasi di pusat data. Ungkapan ‘semua AI akan berpindah ke lokal’ maupun ‘AI lokal tidak penting’ sama-sama mengabaikan perbedaan ini.

## Variabel yang dapat mengubah prospek

Prospek yang berpusat pada pusat data bukanlah hukum yang telah ditetapkan. Jika perubahan berikut terjadi, proporsi lokal dapat tumbuh lebih cepat daripada perkiraan.

- Ketika kemampuan model benar-benar mencapai kejenuhan dalam banyak pekerjaan sehingga nilai model yang lebih kuat menjadi lebih kecil
- Ketika perangkat berdaya rendah dengan kapasitas dan bandwidth memori tinggi menjadi umum
- Ketika distilasi dan kuantisasi dapat mengecilkan model secara drastis hampir tanpa kehilangan kemampuan penalaran berkesulitan tinggi
- Ketika regulasi privasi·keamanan nasional sangat membatasi pengiriman ke server eksternal
- Ketika ekspansi pusat data melambat akibat keterbatasan jaringan listrik, air pendingin, pasokan semikonduktor, atau perizinan
- Ketika teknologi dan sistem kompensasi untuk menggabungkan sumber daya perangkat terdistribusi secara aman telah matang

Sebaliknya, jika tugas agen menjadi lebih panjang, pembuatan video dan pemrosesan multimodal waktu nyata menjadi umum, serta tingkat pemanfaatan akselerator dan efisiensi daya pusat data terus meningkat, keunggulan inferensi terpusat dapat semakin kuat.

## Kesimpulan

AI lokal bukanlah teknologi pinggiran yang akan menghilang. Teknologi ini kemungkinan besar akan menjadi lapisan penting dalam fitur bantuan ponsel pintar, pemrosesan informasi sensitif, pekerjaan offline, dan layanan yang mementingkan latensi. Model bobot terbuka juga memperluas pilihan dan kemampuan hosting mandiri serta membantu mengurangi ketergantungan pada penyedia.

Namun, sulit untuk menganggap kebutuhan akan pusat data akan hilang hanya karena peningkatan efisiensi model. Standar kinerja terbaik dan tuntutan pengguna meningkat secara bersamaan, sedangkan pusat data memiliki keunggulan struktural dalam batching, tingkat pemanfaatan akselerator yang tinggi, memori berkapasitas besar dan berbandwidth tinggi, serta berbagi sumber daya.

Prospek jangka panjang yang paling meyakinkan bukanlah kemenangan AI lokal ataupun monopoli cloud. Bentuknya adalah struktur berlapis yang menangani tugas singkat, sensitif, dan mendesak di perangkat, sementara tugas kompleks, panjang, dan berbiaya tinggi dikirim ke pusat data. Dalam lingkungan ini, daya saing yang penting bukanlah ukuran satu model, melainkan routing yang mengirim tugas ke lokasi eksekusi yang tepat, pengendalian biaya, dan tata kelola data.

## FAQ

### Apakah semua model open-weight dapat dijalankan di PC pribadi?
Tidak. Open-weight berarti bobot model dapat digunakan, bukan berarti model tersebut cocok untuk perangkat keras pribadi. Hal ini bergantung pada ukuran model, presisi, kapasitas memori, dan ketentuan lisensi. Model open-weight berukuran besar mungkin memerlukan beberapa GPU pusat data.

### Apakah ponsel pintar masa depan dapat menghadirkan performa AI terbaik saat ini?
Dengan kemajuan kuantisasi, distilasi, dan NPU, besar kemungkinan sebagian kemampuan kelas server saat ini akan berpindah ke ponsel pintar. Namun, model pusat data pada saat itu juga akan berkembang, sehingga ini bukan berarti ponsel pintar akan mampu menyamai model terbaik di masa depan.

### Jika membeli GPU, apakah AI lokal selalu lebih murah daripada API?
Tidak selalu. Biaya pembelian, nilai jual kembali, listrik, pendinginan, pemeliharaan, dan tingkat penggunaan aktual semuanya harus diperhitungkan. Jika penggunaan sedikit atau tidak teratur, layanan berbasis pemakaian mungkin lebih menguntungkan, sedangkan eksekusi lokal mungkin lebih menguntungkan untuk pekerjaan bervolume besar yang menggunakan perangkat secara terus-menerus.

### Mengapa batching menurunkan biaya dalam inferensi AI?
Memproses beberapa permintaan secara bersamaan memungkinkan kemampuan komputasi paralel dan bandwidth memori akselerator digunakan dengan lebih efisien. Batching berkelanjutan meningkatkan tingkat pemanfaatan dengan menghapus permintaan yang telah selesai dan menambahkan permintaan baru, tetapi ukuran batch tidak dapat diperbesar tanpa batas karena cache KV dan latensi.

### Apakah AI lokal selalu lebih aman dalam melindungi informasi pribadi?
AI lokal memiliki keunggulan karena data tidak dikirim ke server eksternal, tetapi hal itu tidak serta-merta membuatnya aman. Diperlukan enkripsi perangkat, perlindungan dari malware, pengaturan hak akses, serta pengelolaan log dan cadangan. Saat menggunakan cloud, kebijakan penyimpanan data, apakah data digunakan untuk pelatihan, serta metode enkripsi dan isolasi harus diperiksa.

### Bolehkah performa AI GPU konsumen dan GPU pusat data dibandingkan hanya berdasarkan FLOPS?
Tidak boleh. Presisi, sparsitas, batas daya, dan kondisi pengukuran dapat berbeda. Inferensi LLM yang sebenarnya juga sangat dipengaruhi oleh kapasitas dan bandwidth memori, ukuran batch, panjang konteks, cache KV, koneksi antar-akselerator, dan perangkat lunak penyajian.

### Pekerjaan apa yang paling cocok untuk AI lokal?
AI lokal cocok untuk pekerjaan yang mengutamakan latensi dan kendali data, seperti pelengkapan otomatis pada papan ketik, peringkasan dan klasifikasi singkat, pemrosesan suara luring, prapemrosesan informasi sensitif, dan pengendalian di lokasi. Pusat data kemungkinan besar lebih unggul untuk pekerjaan agen berdurasi panjang, pemrosesan multimodal berskala besar, dan inferensi yang membutuhkan performa terbaik.

### Dalam jangka panjang, mana yang akan menang antara AI lokal dan AI cloud?
Alih-alih salah satunya menggantikan yang lain sepenuhnya, struktur hibrida lebih mungkin digunakan. Perangkat menangani pekerjaan sederhana dan sensitif, sementara hanya permintaan kompleks yang dikirim ke pusat data. Meskipun jumlah permintaan yang ditangani secara lokal lebih banyak, total komputasi dan pekerjaan berkompleksitas tinggi dapat terpusat di pusat data.

## Sources

- [Manajemen Memori yang Efisien untuk Penyajian Model Bahasa Besar dengan PagedAttention](https://arxiv.org/abs/2309.06180)
- [Orca: Sistem Penyajian Terdistribusi untuk Model Generatif Berbasis Transformer](https://arxiv.org/abs/2206.02658)
- [Arsitektur NVIDIA Blackwell](https://www.nvidia.com/en-us/data-center/technologies/blackwell-architecture/)
- [NVIDIA GeForce RTX 4090](https://www.nvidia.com/en-us/geforce/graphics-cards/40-series/rtx-4090/)
- [Inferensi MLPerf: Pusat Data](https://mlcommons.org/benchmarks/inference-datacenter/)
- [Private Cloud Compute: Terobosan Baru untuk Privasi AI di Cloud](https://security.apple.com/blog/private-cloud-compute/)
- [Google AI Edge SDK dengan Gemini Nano](https://developer.android.com/ai/gemini-nano)

## Images

![Teknisi pusat data menghubungkan kabel ke perangkat ringkas di depan rak server](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTAsInB1ciI6ImJsb2JfaWQifX0=--34abeef97dfe63b15e2b649c2c6ae8c564924b28/ai-0fdb0281.webp)
![Diagram perbandingan AI lokal di laptop dan ponsel dengan server, GPU, dan infrastruktur pusat data](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI2NTYsInB1ciI6ImJsb2JfaWQifX0=--4b642e72ce104856aa40ed5bc224e337cf7877c2/ai-70dfbb70.webp)