---
title: "Akankah Model Bobot Terbuka dan AI Lokal Menggantikan Inferensi Pusat Data"
locale: id
category: ai_data
category_name: "Data AI"
translation_status: reviewed
license: cc_by
author: "injoys"
source_url: https://injoys.com/en/articles/open-weight-local-ai-vs-datacenter-inference
published_at: 2026-08-29T01:01:28+09:00
---

# Akankah Model Bobot Terbuka dan AI Lokal Menggantikan Inferensi Pusat Data

> Meskipun model bobot terbuka dan perangkat keras pribadi terus berkembang, pusat inferensi berkinerja tinggi kemungkinan besar akan tetap berada di pusat data karena kesenjangan relatif dengan model pusat data teratas, batching dan tingkat pemanfaatan perangkat, serta permintaan akan agen AI yang kompleks. Namun, untuk pekerjaan yang mengutamakan latensi, privasi, dan operasi luring, arsitektur hibrida yang menggabungkan model lokal dan model pusat data merupakan pilihan yang menjanjikan.

## Key Points

- Model lokal masa depan harus dibandingkan bukan dengan model teratas saat ini, melainkan dengan model pusat data pada waktu yang sama.
- Memilih model kecil dan menjalankan model secara lokal merupakan dua keputusan yang berbeda.
- Pusat data dapat menurunkan biaya per permintaan melalui batching, akselerator khusus, dan tingkat pemanfaatan perangkat yang tinggi, tetapi tidak selalu lebih murah untuk setiap pekerjaan.
- AI lokal unggul di lingkungan yang mengutamakan latensi singkat, operasi luring, privasi, pengoperasian dalam jaringan tertutup, dan kendali atas model.
- Struktur masa depan yang praktis cenderung berupa pendekatan hibrida, dengan model lokal menangani pemrosesan langsung dan klasifikasi permintaan, sedangkan model pusat data menjalankan inferensi tingkat lanjut.

Model open-weight berkembang menjadi semakin kecil dan efisien sehingga dapat berjalan cepat bahkan di PC pribadi dan smartphone. Namun, tidak dapat dipastikan bahwa dalam jangka panjang sebagian besar inferensi AI berperforma tinggi akan berpindah dari pusat data ke perangkat pribadi. Sebab, sementara model lokal berkembang, model teratas, akselerator, dan perangkat lunak inferensi di pusat data juga berkembang bersamaan.

Pertanyaan utamanya bukanlah “apakah laptop masa depan dapat menjalankan model teratas saat ini”. Yang harus dibandingkan adalah apakah model lokal atau model pusat data yang tersedia pada waktu yang sama dapat menyelesaikan tugas yang diinginkan dengan lebih akurat dan ekonomis.

## Empat konsep yang harus dibedakan terlebih dahulu

Dalam perdebatan AI lokal, cara model dipublikasikan, ukuran, dan lokasi eksekusinya sering tercampur. Konsep-konsep berikut merupakan sumbu yang terpisah.

| Konsep | Makna | Hal yang tidak selalu berarti |
|---|---|---|
| Open-weight | Model yang bobot terlatihnya dapat diunduh dan dijalankan | AI sumber terbuka yang juga memublikasikan data pelatihan dan seluruh kode pelatihan |
| Model kecil | Model dengan jumlah parameter dan kebutuhan komputasi yang relatif kecil | Model yang hanya berjalan di perangkat pribadi |
| Inferensi lokal·on-device | Berjalan dekat dengan pengguna, seperti di smartphone, laptop, atau workstation | Cara eksekusi yang selalu murah atau ramah lingkungan |
| Hosting mandiri | Berjalan di server atau pusat data privat yang dikendalikan organisasi | Berjalan di perangkat pribadi |

Open-weight disediakan bersama lisensi yang memberikan hak distribusi dan modifikasi, tetapi cakupan penggunaan serta ketentuan redistribusi berbeda untuk setiap model. Fakta bahwa bobot dipublikasikan tidak boleh dianggap berarti bahwa data pelatihan, prosedur pelatihan, dan kode sumber juga dipublikasikan seluruhnya.

Selain itu, dikotomi “lokal versus cloud” tidaklah memadai. Ada berbagai lokasi eksekusi di antara perangkat dan cloud publik berskala besar, seperti server GPU internal perusahaan, server edge operator telekomunikasi, dan cloud privat.

## Model lokal masa depan bersaing dengan model pusat data masa depan

Jika kompresi model, kuantisasi, distilasi pengetahuan, dan optimalisasi mesin inferensi berkembang, performa yang kini membutuhkan perangkat kelas server dapat diwujudkan di perangkat pribadi masa depan. Namun, ini tidak berarti bahwa model lokal akan mengejar model teratas pada masa tersebut.

Di sisi pusat data, unsur-unsur berikut juga berkembang bersama.

- Struktur baru seperti model yang lebih besar dan model mixture-of-experts
- Memori berbandwidth tinggi dan koneksi berkecepatan tinggi antar-akselerator
- Sistem inferensi yang memanfaatkan konteks panjang dan alat eksternal
- Optimalisasi penyajian seperti batching, pengelolaan cache, kuantisasi, dan speculative decoding
- Sistem gabungan yang mengintegrasikan beberapa model dengan alat pencarian dan eksekusi kode

Karena itu, standar perbandingannya harus berupa performa relatif, bukan performa absolut. Meskipun beberapa tahun mendatang laptop dapat menjalankan model kuat setingkat model saat ini, sistem pusat data pada waktu yang sama kemungkinan mampu menangani tugas yang lebih panjang, konteks yang lebih besar, dan lebih banyak pemanggilan alat.

Tentu saja, tidak ada jaminan bahwa kesenjangan ini akan bertahan selamanya. Jika peningkatan performa model besar melambat atau model kecil melampaui ambang kualitas untuk sebagian besar pekerjaan praktis, daya saing eksekusi lokal dapat meningkat secara signifikan.

## Seiring meningkatnya ekspektasi pengguna, standar “model yang cukup baik” juga bergeser

Tugas representatif AI generatif pada tahap awal adalah menjawab pertanyaan singkat, menulis kalimat, merangkum, dan menghasilkan potongan kode. Kini pengguna menuntut tugas jangka panjang berikut.

- Membaca seluruh codebase dan memodifikasi beberapa file secara konsisten
- Menjalankan pengujian, melacak penyebab kegagalan, lalu memperbaikinya kembali
- Meneliti berbagai materi dan membandingkan bukti yang saling bertentangan
- Menggunakan beberapa alat secara berurutan, seperti browser, basis data, dan terminal
- Menyelesaikan rencana jangka panjang sambil mengingat hasil antara

Dalam permintaan singkat dan sederhana, perbedaan kualitas yang kecil mungkin tidak terlalu terlihat. Namun, dalam tugas agen AI dengan banyak tahapan, kesalahan pada setiap tahap akan terakumulasi. Model yang relatif lebih lemah lebih mungkin kehilangan sasaran atau batasan, memilih alat yang salah, atau mengulangi kegagalan yang sama.

Karena itu, pengguna dapat memilih model yang memiliki peluang tinggi untuk menyelesaikan tugas dalam batas anggaran dan waktu latensi, alih-alih sekadar model yang dapat dijalankan. Bahkan model yang dahulu unggul dapat terasa menghambat untuk pekerjaan kompleks setelah pengguna merasakan model yang lebih stabil.

Ada pula efek ke arah sebaliknya. Jika peningkatan kualitas di atas tingkat tertentu hampir tidak mengubah hasil pekerjaan nyata, model kecil yang murah merupakan pilihan rasional. Pada akhirnya, pemilihan model harus dievaluasi berdasarkan tingkat penyelesaian tugas sendiri, jumlah percobaan ulang, dan waktu pemeriksaan, bukan skor benchmark.

## Keunggulan struktural pusat data dalam biaya inferensi

### Batching mendistribusikan biaya pembacaan bobot model ke beberapa permintaan

Untuk menghasilkan token, LLM harus berulang kali mengakses bobot berskala besar dan status antara yang berada di memori GPU. Terutama pada tahap decoding dengan batch kecil, keterbatasan bukan hanya berasal dari kemampuan komputasi, tetapi juga dapat sangat dipengaruhi oleh bandwidth memori.

Pusat data dapat mengelompokkan permintaan dari beberapa pengguna atau menjalankannya melalui continuous batching untuk memproses beberapa token dalam satu kali akses bobot. Jika banyak permintaan terus masuk, waktu menganggur akselerator dapat dikurangi dengan mengisi tempat yang ditinggalkan oleh permintaan yang selesai menggunakan permintaan lain.

Karena pengguna pribadi hanya menghasilkan sedikit permintaan secara bersamaan, efek ini sulit diperoleh dalam skala yang sama. Namun, memperbesar batch tanpa batas akan meningkatkan latensi token pertama dan waktu respons per permintaan, serta membutuhkan lebih banyak memori KV cache. Keunggulan pusat data bukanlah batching itu sendiri, melainkan kemampuannya mengatur banyak permintaan sesuai target latensi.

### Akselerator khusus dan konfigurasi sistem berbeda

GPU konsumen juga memberikan performa unggul untuk inferensi lokal. Namun, pusat data besar umumnya dapat memanfaatkan memori akselerator yang lebih besar, bandwidth memori tinggi, koneksi berkecepatan tinggi antar-akselerator, dan jaringan kelas server. Perbedaan ini menjadi penting ketika model besar didistribusikan ke beberapa perangkat atau ketika konteks panjang diproses.

Namun, ini tidak berarti GPU pusat data lebih ekonomis daripada GPU konsumen dalam semua kondisi. Jika model kecil digunakan sesekali dan perangkat yang sesuai sudah dimiliki, pengeluaran tunai untuk eksekusi lokal bisa rendah. Sebaliknya, jika throughput tinggi berlangsung terus-menerus atau digunakan bersama oleh beberapa pengguna, keunggulan perangkat server dan perangkat lunak penyajian khusus menjadi lebih besar.

### Tingkat pemanfaatan mengubah biaya total

Jika biaya inferensi dihitung sebagai 0 hanya karena harga pembelian GPU lokal sudah dibayar, biaya ekonominya akan diremehkan. Biaya total mencakup hal-hal berikut.

- Biaya pembelian GPU, memori, penyimpanan, dan catu daya
- Depresiasi atau biaya peluang berdasarkan masa penggunaan perangkat
- Biaya listrik dan pendinginan selama inferensi
- Waktu untuk instalasi, pembaruan, penanganan gangguan, dan pengelolaan keamanan
- Rendahnya tingkat pemanfaatan ketika perangkat menganggur

Layanan pusat data juga memasukkan biaya akselerator, jaringan, listrik, tenaga kerja, dan margin operator ke dalam tarif. Karena itu, apakah lokal atau API lebih murah bergantung pada volume penggunaan, ukuran model, kepemilikan perangkat, tarif listrik, kecepatan respons, dan tenaga operasional.

Perkiraan bahwa dalam lingkungan tertentu dapat terjadi perbedaan efisiensi puluhan kali lipat tidak boleh digunakan sebagai rasio universal untuk semua lingkungan. Jika ukuran batch, panjang input dan output, struktur model, tingkat kuantisasi, perangkat keras, serta target latensi berbeda, hasilnya juga dapat berubah secara signifikan.

## Model kecil dan eksekusi lokal bukanlah pilihan yang sama

Model kecil mungkin memadai untuk klasifikasi sederhana, ekstraksi informasi terstruktur, rangkuman singkat, routing perintah, dan koreksi dasar. Namun, memilih model kecil tidak berarti model tersebut harus dijalankan di perangkat pengguna.

Model kecil pun dapat memperoleh tingkat pemanfaatan tinggi jika permintaan dalam jumlah besar di-batch di pusat data. Sebaliknya, model open-weight besar yang perlu dikendalikan oleh organisasi dapat dijalankan di server sendiri. Pengambilan keputusan lebih tepat jika dibagi menjadi dua tahap.

1. Pilih ukuran dan jenis model yang memenuhi kualitas serta fungsi yang diperlukan untuk tugas.
2. Pilih lokasi eksekusi yang sesuai dengan latensi, biaya, keamanan, dan kondisi operasional.

Jika kedua tahap ini dicampur, dapat muncul kesimpulan keliru bahwa “model kecil efisien, jadi lokal efisien” atau “model besar diperlukan, jadi harus menggunakan cloud publik”.

## Kondisi ketika AI lokal jelas menguntungkan

### Antarmuka yang sangat membutuhkan latensi singkat

Dalam percakapan suara, koreksi keyboard, pemrosesan kamera, dan kontrol waktu nyata, waktu perjalanan bolak-balik jaringan serta fluktuasi koneksi sangat memengaruhi pengalaman pengguna. Model lokal kecil dapat menangani deteksi wake word, prapemrosesan suara, perintah sederhana, dan umpan balik seketika.

### Lingkungan tanpa internet atau dengan koneksi tidak stabil

Di pesawat, kapal, lokasi bencana, wilayah terpencil, dan perangkat yang sedang bergerak, kemampuan beroperasi secara offline merupakan fungsi inti. Sekalipun kualitas model pusat data lebih tinggi, model tersebut bukan pilihan jika tidak dapat dihubungkan.

### Lingkungan yang tidak mengizinkan informasi pribadi dan rahasia dikirim ke luar

Peraturan dan kontrak yang membatasi pengiriman ke API eksternal dapat berlaku pada bidang medis, keuangan, pertahanan, penelitian dan pengembangan, pekerjaan hukum, atau materi internal perusahaan. Model lokal atau yang di-hosting sendiri memiliki nilai berupa kemampuan mengendalikan batas data secara langsung.

Namun, “lokal berarti otomatis aman” tidak dapat dijadikan asumsi. Pencurian perangkat, malware, kesalahan hak akses, log dan file sementara, serta masalah rantai pasok model tetap harus dikelola. Tingkat keamanan cloud publik juga berbeda-beda bergantung pada enkripsi, masa retensi, pilihan wilayah, dan ketentuan kontrak.

### Ketika model harus dikendalikan dan diuji secara langsung

Model open-weight berguna bagi peneliti untuk menganalisis cara kerja internal, serta bagi pengembang untuk mengubah kuantisasi, fine-tuning, dan mesin inferensi. Nilai eksekusi mandiri juga meningkat ketika dibutuhkan penguncian versi model, logging terperinci, reproduktibilitas, atau penerapan khusus yang tidak disediakan melalui API.

## Kondisi ketika inferensi pusat data unggul

Tugas-tugas berikut umumnya memiliki alasan kuat untuk memanfaatkan sumber daya pusat data.

- Tugas yang membutuhkan model sangat besar atau konteks panjang
- Tugas yang menganalisis repositori kode dan kumpulan dokumen berskala besar sekaligus
- Tugas agen AI jangka panjang yang menggunakan beberapa alat
- Layanan yang terus-menerus memproses permintaan dari banyak pengguna
- Organisasi yang harus menyerahkan penanganan gangguan, penskalaan, dan pembaruan model kepada tim operasi profesional
- Pemrosesan multimodal yang membutuhkan beberapa akselerator dan memori berkapasitas besar

Nilai pusat data tidak hanya terletak pada performa pembuatan token dari satu model. Kemampuan mengoperasikan indeks pencarian, basis data, eksekusi kode dalam sandbox, alat observasi, dan kebijakan keselamatan sebagai satu sistem juga penting.

## Alasan AI hibrida menjadi pilihan yang kuat

Desain yang realistis adalah membagi tugas, alih-alih secara tetap memilih salah satu antara lokal dan pusat data.

| Tahap | Fungsi yang cocok ditangani model lokal | Fungsi yang cocok ditangani model pusat data |
|---|---|---|
| Pemrosesan input | Deteksi suara, bantuan transkripsi, penyamaran informasi pribadi | Pemahaman multimodal berskala besar |
| Penilaian permintaan | Klasifikasi maksud, perintah sederhana, routing | Interpretasi tujuan yang ambigu dan perencanaan kompleks |
| Eksekusi | Pengaturan perangkat, rangkuman singkat, jawaban dalam cache | Riset mendalam, analisis kode berskala besar, tugas agen jangka panjang |
| Keselamatan dan pemulihan | Pemfilteran informasi sensitif sebelum transmisi, alternatif offline | Penerapan kebijakan pusat, deteksi risiko tingkat lanjut, analisis seluruh catatan |

Sebagai contoh, model lokal di smartphone dapat memproses suara dan menghapus informasi sensitif, lalu hanya mengirim bagian yang kompleks ke model pusat data. Ketika jaringan terputus, fungsi terbatas dapat terus disediakan secara lokal, kemudian tugas sulit dialihkan setelah koneksi pulih.

Dalam struktur ini, meskipun pengguna merasa sedang berinteraksi dengan AI lokal, komputasi tersulit dapat dilakukan di pusat data. Sebaliknya, cakupan paparan informasi pribadi dapat dikurangi karena hanya informasi yang diperlukan yang dikirimkan, tanpa mengirim seluruh data asli ke server.

## Variabel yang mudah terlewatkan: keandalan operasional dan biaya routing

Perbandingan model sering kali terbatas pada akurasi, kecepatan token, dan harga API. Dalam sistem nyata, keandalan operasional dan kegagalan routing menentukan efisiensi keseluruhan.

Sistem hibrida harus menentukan permintaan mana yang diselesaikan secara lokal dan mana yang dikirim ke server. Jika model lemah keliru mengambil alih tugas sulit, model tersebut akan gagal beberapa kali sebelum akhirnya memanggil model pusat data. Dalam kasus ini, pengguna harus membayar komputasi lokal, waktu latensi, dan biaya server sekaligus.

Sebaliknya, jika permintaan sederhana pun selalu dikirim ke model teratas, biaya yang tidak perlu dan transmisi data akan meningkat. Karena itu, router yang baik memerlukan fungsi berikut.

- Kriteria untuk memperkirakan tingkat kesulitan tugas dan konteks yang diperlukan
- Metode untuk mendeteksi ketidakpastian hasil lokal
- Kebijakan untuk beralih ke model tingkat atas ketika jumlah kegagalan atau batas waktu terlampaui
- Prosedur untuk menghapus informasi sensitif atau memperoleh persetujuan sebelum dikirim ke server
- Sistem evaluasi untuk mengelola perbedaan versi antara model lokal dan server

Hal ini merupakan unsur yang mudah terlewatkan dalam perbandingan perangkat keras sederhana. Daya saing masa depan mungkin lebih bergantung pada seberapa akurat tugas dialokasikan ke model dan lokasi eksekusi yang tepat daripada pada apakah seseorang memiliki model terbesar.

## Cara membandingkan biaya dan performa secara langsung

Untuk memilih antara lokal dan pusat data, setidaknya hal-hal berikut harus dibandingkan berdasarkan periode dan unit tugas yang sama.

### Biaya lokal yang dikonversi per bulan

`Biaya perangkat yang dikonversi per bulan + biaya listrik·pendinginan + nilai waktu operasional + biaya gangguan·penggantian`

Biaya per tugas dapat diperkirakan dengan membaginya dengan jumlah tugas yang berhasil diselesaikan selama satu bulan. Agar biaya percobaan ulang dan pemeriksaan manusia tercermin, standar yang digunakan harus berupa tugas yang berhasil, bukan sekadar jumlah token.

### Biaya pusat data per bulan

`Biaya penggunaan input·output + biaya penyimpanan·pencarian·penggunaan alat + biaya jaringan + biaya pengelolaan`

Jika menggunakan instans reservasi atau khusus, waktu yang tidak digunakan juga harus dimasukkan ke dalam biaya.

### Indikator kualitas yang harus diukur bersama

- Persentase tugas yang selesai tanpa modifikasi
- Rata-rata jumlah percobaan ulang
- Waktu hingga respons pertama dan penyelesaian penuh
- Waktu yang dibutuhkan manusia untuk memeriksa dan memperbaiki
- Tingkat penghentian layanan dan kegagalan jaringan
- Cakupan informasi sensitif yang dikirim ke luar

Jangan menarik kesimpulan hanya dari beberapa permintaan pengujian singkat. Sebaiknya buat set evaluasi tetap yang mewakili pekerjaan nyata untuk dibandingkan.

## Energi dan dampak lingkungan juga tidak dapat dinilai hanya dari lokasi eksekusi

Pemrosesan lokal tidak selalu menggunakan lebih sedikit energi hanya karena mengurangi transmisi jaringan. Pusat data dapat memanfaatkan tingkat penggunaan perangkat yang tinggi dan pendinginan efisien, tetapi pengoperasian fasilitas berskala besar serta beban pada jaringan listrik juga muncul.

Untuk membandingkan dampak lingkungan, unsur-unsur berikut harus dipertimbangkan bersama.

- Konsumsi listrik aktual per tugas
- Rata-rata tingkat pemanfaatan perangkat
- Pendinginan dan kehilangan daya di pusat data
- Intensitas karbon sumber listrik di setiap wilayah
- Emisi bawaan yang terkandung dalam produksi GPU dan perangkat
- Jumlah komputasi yang terbuang akibat kegagalan model dan percobaan ulang

Bahkan untuk model yang sama, energi per tugas dapat berbeda antara GPU pribadi dengan waktu menganggur panjang dan server yang dioperasikan dengan batch tinggi. Sebaliknya, tugas yang menjalankan model kecil secara singkat di perangkat hemat daya yang sudah dimiliki dapat lebih efisien daripada memanggil server. Klaim ramah lingkungan universal yang tidak menjelaskan cakupan pengukuran dan kondisi tugas harus diwaspadai.

## Tiga perubahan yang dapat menjadikan AI lokal sebagai pusat utama

Prospek yang berpusat pada pusat data juga dapat berubah.

1. **Ketika pasokan pusat data dibatasi oleh kondisi eksternal**: Perluasan inferensi terpusat berskala besar dapat menjadi sulit akibat jaringan listrik, pasokan semikonduktor, regulasi, atau masalah kedaulatan data.
2. **Ketika efisiensi model kecil meningkat jauh lebih cepat daripada model besar**: Jika model yang dapat dijalankan di perangkat pribadi mendekati model besar dalam kualitas pekerjaan nyata, alasan untuk membayar performa tambahan akan berkurang.
3. **Ketika sebagian besar pekerjaan mencapai titik jenuh kualitas**: Jika model yang lebih besar hampir tidak meningkatkan tingkat keberhasilan tugas secara nyata bagi pengguna, keunggulan lokal dari sisi biaya, latensi, dan keamanan dapat menjadi lebih dominan.

Namun, tidak ada cukup dasar untuk berasumsi bahwa hanya model besar yang akan berhenti berkembang atau bahwa tingkat tuntutan pengguna akan tetap. Sebab, semakin kuat model, pengguna cenderung menyerahkan tugas yang lebih panjang dan masalah yang lebih sulit kepadanya.

## Kesimpulan

AI lokal tidak akan menghilang. Kemungkinan besar, perannya justru semakin penting dalam bidang yang membutuhkan antarmuka suara, respons seketika, fungsi offline, perlindungan informasi pribadi, jaringan tertutup, dan kendali atas model.

Namun, fakta bahwa model lokal berkembang saja tidak cukup untuk menyimpulkan bahwa inferensi pusat data berperforma tinggi akan tergantikan. Pusat data juga berkembang bersama berkat model yang lebih kuat, perangkat khusus, batching, dan tingkat pemanfaatan tinggi. Dalam inferensi kompleks dan tugas agen AI jangka panjang, perbedaan performa yang kecil dapat menghasilkan perbedaan besar pada tingkat keberhasilan akhir dan biaya pemeriksaan.

Karena itu, dalam jangka panjang, pembagian peran lebih penting daripada menentukan pemenang antara lokal dan pusat data. Arah paling realistis adalah struktur hibrida, dengan model lokal menangani pemrosesan input, respons seketika, perlindungan informasi sensitif, dan routing permintaan, sementara model pusat data menangani pekerjaan yang membutuhkan sumber daya berskala besar dan kemampuan inferensi tinggi.

## FAQ

### Apakah model open-weight memiliki arti yang sama dengan AI sumber terbuka?
Tidak. Open-weight berarti bobot yang telah dilatih dapat diunduh dan dijalankan, tetapi tidak berarti bahwa data pelatihan, seluruh kode pelatihan, dan proses pengembangannya juga telah dipublikasikan. Kemungkinan untuk memodifikasi, menggunakan secara komersial, dan mendistribusikan ulang juga harus diperiksa dalam masing-masing lisensi.

### Apakah pada masa mendatang ponsel pintar dapat menjalankan model AI tercanggih saat ini?
Hal itu mungkin dapat dilakukan jika kuantisasi, distilasi, perangkat keras, dan mesin inferensi terus berkembang. Namun, model tercanggih di pusat data pada saat itu juga akan berkembang, sehingga fakta bahwa ponsel dapat menjalankan model saat ini saja tidak cukup untuk menyimpulkan bahwa kemampuannya telah menyamai tingkat cloud.

### Jika sudah memiliki GPU, apakah biaya inferensi AI lokal gratis?
Mungkin tidak ada biaya API, tetapi biaya ekonominya tidak nol. Perhitungannya harus mencakup biaya listrik, penyusutan peralatan, pendinginan, pemeliharaan, penanganan gangguan, dan tingkat pemanfaatan yang rendah.

### Mengapa batching di pusat data dapat mengurangi biaya?
Karena dengan memproses token dari beberapa permintaan secara bersamaan, biaya akses bobot model dan penggunaan akselerator dapat dibagi di antara banyak pengguna. Namun, batch yang besar dapat meningkatkan latensi dan penggunaan memori, sehingga perlu disesuaikan dengan volume permintaan dan target waktu respons.

### Apakah menjalankan model kecil secara lokal selalu efisien?
Tidak. Model kecil pun dapat mencapai tingkat pemanfaatan peralatan yang tinggi jika banyak permintaan diproses secara batching di pusat data. Ukuran model dan lokasi eksekusi harus ditentukan secara terpisah.

### Apakah AI lokal selalu lebih baik dalam hal perlindungan data pribadi dibandingkan AI cloud?
AI lokal lebih unggul karena data asli tidak perlu dikirim ke server eksternal. Namun, risiko pencurian perangkat, malware, pengaturan izin, log lokal, dan rantai pasok model tetap ada, sehingga keamanan tidak otomatis terjamin hanya dengan menjalankannya secara lokal.

### Tugas apa yang cocok diserahkan kepada model lokal?
Tugas yang memerlukan latensi rendah dan komputasi terbatas cocok untuk model lokal, seperti prapemrosesan suara, klasifikasi dan peringkasan sederhana, perutean perintah, penyamaran data pribadi, serta fungsi luring.

### Tugas apa yang lebih cocok untuk model pusat data?
Tugas yang memerlukan banyak memori dan kemampuan inferensi tinggi termasuk analisis kode berskala besar, riset mendalam, pemrosesan konteks panjang, penyusunan rencana yang kompleks, dan tugas agen AI jangka panjang yang menggunakan berbagai alat.

### Apa itu AI hibrida?
Ini adalah arsitektur di mana model lokal pada perangkat pengguna menangani tugas yang sederhana, sensitif, atau harus segera diproses, sedangkan hanya tugas yang lebih kompleks yang dikirim ke model pusat data. Kebijakan perutean dan prosedur peralihan ke model yang lebih tinggi saat terjadi kegagalan menentukan kualitas sistem.

### Apakah AI lokal lebih ramah lingkungan daripada AI pusat data?
Hal itu tidak dapat dinilai hanya berdasarkan lokasi eksekusi. Tingkat pemanfaatan peralatan, konsumsi daya per tugas, efisiensi pendinginan, sumber listrik setempat, produksi perangkat keras, dan percobaan ulang model harus dibandingkan dalam cakupan yang sama.

## Sources

- [Manajemen Memori yang Efisien untuk Penyajian Model Bahasa Besar dengan PagedAttention](https://arxiv.org/abs/2309.06180)
- [NVIDIA Triton Inference Server: Pengelompokan Model](https://docs.nvidia.com/deeplearning/triton-inference-server/user-guide/docs/user_guide/batcher.html)
- [GPU NVIDIA H100 Tensor Core](https://www.nvidia.com/en-us/data-center/h100/)
- [llama.cpp](https://github.com/ggml-org/llama.cpp)
- [MLC LLM](https://llm.mlc.ai/)
- [Definisi AI Sumber Terbuka](https://opensource.org/ai/open-source-ai-definition)
- [Definisi Komputasi Awan NIST](https://nvlpubs.nist.gov/nistpubs/Legacy/SP/nistspecialpublication800-145.pdf)
- [Kerangka Kerja Privasi NIST](https://www.nist.gov/privacy-framework)

## Images

![Teknisi perempuan menghubungkan kabel jaringan ke komputer ringkas di ruang server](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI4MzQsInB1ciI6ImJsb2JfaWQifX0=--5e4537efdba3022405de8e104a427be983bc2583/ai-1a48fd1a.webp)
![Diagram perbandingan AI lokal di laptop dan ponsel dengan server pusat data, alur kerja, dan metrik](https://injoys.com/rails/active_storage/blobs/proxy/eyJfcmFpbHMiOnsiZGF0YSI6MTI4NDIsInB1ciI6ImJsb2JfaWQifX0=--a8be6416f77c81039aabe891f1acfde95507c889/ai-c2164fd3.webp)