Gemini 3.8 Flash resmi GA—tarif tetap, token bisa membengkak

Google merilis Gemini 3.8 Flash secara general availability (GA) pada 2 September 2026. Dokumentasi Gemini API yang diperbarui pada tanggal tersebut mencantumkan endpoint gemini-3.8-flash sebagai stable, dengan batas masukan 1.048.576 token, keluaran maksimum 65.536 token, serta thinking level low, medium, dan high.
Model ini tersedia melalui Gemini API dan Google AI Studio. Liputan peluncuran 9to5Google pada 2 September mencatat tarif perkenalan US$0,75 per satu juta token masukan dan US$3,75 per satu juta token keluaran hingga 31 Desember 2026—setara dengan tarif Gemini 3.7 Flash—serta kemungkinan pemakaian token yang lebih besar pada effort tinggi.
Konsekuensinya, harga satuan yang tidak berubah belum tentu menghasilkan biaya tugas yang sama. Tagihan tetap dipengaruhi oleh jumlah token yang benar-benar dikonsumsi, sementara pekerjaan kompleks dapat membuat model menjalankan lebih banyak langkah penalaran dan pemanggilan alat.
Status GA dan kemampuan API
Status stable membedakan Gemini 3.8 Flash dari endpoint preview atau experimental yang lebih mungkin berubah. Masukannya dapat berupa teks, gambar, video, audio, dan PDF, sedangkan keluarannya berupa teks.
Fitur yang tersedia meliputi function calling, structured outputs, code execution, caching, file search, URL context, search grounding, Google Maps grounding, dan thinking. Computer use masih berstatus preview; Live API, pembuatan gambar, dan pembuatan audio tidak didukung oleh model ini.
Konteks sekitar satu juta token memberi ruang untuk dokumen besar atau riwayat kerja panjang. Namun, kapasitas maksimum bukan jaminan bahwa permintaan sebesar itu akan cepat atau ekonomis: panjang masukan, keluaran, pemanggilan alat, dan percobaan ulang tetap menambah beban pemrosesan.
Tarif tetap, biaya tugas dapat berubah

Tarif per token hanya menentukan harga setiap unit konsumsi. Biaya akhir mengikuti volume token pada permintaan dan respons, ditambah konsumsi yang timbul dari alur berulang seperti pemanggilan alat atau retry.
Sebagai contoh bersyarat, 1.000 token keluaran pada tarif perkenalan bernilai sekitar US$0,00375, sedangkan 10.000 token bernilai sekitar US$0,0375. Perhitungan itu belum memasukkan token masukan, caching, grounding, pemanggilan alat, atau retry. Dengan harga satuan identik, keluaran sepuluh kali lebih panjang membuat komponen biaya keluaran menjadi sepuluh kali lebih besar.
Karena itu, angka yang perlu dibandingkan bukan hanya biaya per permintaan. Untuk alur produksi, ukuran yang lebih berguna adalah biaya per hasil yang lolos pemeriksaan, sebab respons gagal dan permintaan yang harus diulang tetap dapat mengonsumsi sumber daya.
Matriks effort, token, timeout, dan tugas

Tidak tersedia pengali token universal untuk setiap thinking level. Matriks berikut merupakan kerangka pengujian operasional, bukan benchmark atau jaminan konsumsi.
- Low: cocok dijadikan titik pembanding untuk ekstraksi terstruktur, klasifikasi, perubahan format, respons singkat, dan pekerjaan yang sensitif terhadap latensi. Risiko pembengkakan token relatif perlu diukur terhadap kualitas keluaran yang dihasilkan.
- Medium: merupakan konfigurasi tengah untuk sintesis dokumen, analisis beberapa langkah, atau alur dengan pemanggilan alat. Bandingkan tambahan token dan latensi dengan persentase keluaran yang berhasil.
- High: relevan untuk debugging kompleks, matematika, penalaran mendalam, dan alur agen panjang. Perhatikan ekor latensi, token yang digunakan, timeout, serta retry karena usaha tambahan tidak memiliki pengali biaya yang tetap.
High bukan otomatis pilihan paling akurat atau paling ekonomis bagi setiap permintaan. Jika tambahan pemrosesan tidak meningkatkan jumlah hasil yang dapat digunakan, biaya per hasil memburuk; bila konfigurasi itu mengurangi kegagalan dan retry pada tugas tertentu, biaya per permintaannya yang lebih tinggi mungkin tetap lebih efisien.
Konteks besar tetap memiliki batas
Model card Gemini 3.8 Flash memperingatkan bahwa effort tinggi dapat memakai lebih banyak token dan kadang mengalami kelambatan atau timeout; dokumen yang diterbitkan 2 September 2026 itu juga menetapkan batas pengetahuan Maret 2026, dengan sebagian domain mungkin hanya mencakup informasi hingga Januari 2025.
Jendela konteks besar dengan demikian tidak sama dengan pengetahuan yang selalu mutakhir. Aplikasi yang memerlukan fakta setelah batas pengetahuan tetap membutuhkan materi eksternal atau grounding, yang dapat menambah token, latensi, dan pemanggilan layanan.
Dalam evaluasi otomatis yang dimuat pada dokumen tersebut, multilingual safety memburuk 5,4 poin persentase dibandingkan Gemini 3.7 Flash pada metrik yang menganggap angka lebih rendah lebih baik. Hasil itu bukan evaluasi manusia atau red teaming; peninjauan manual atas kasus yang ditandai menemukan sebagian besar penurunan berupa positif palsu atau kasus yang tidak berat, sementara red teaming umum menunjukkan keselamatan serupa atau lebih baik.
Temuan lintas bahasa itu tidak membuktikan regresi khusus dalam bahasa Indonesia. Namun, layanan berbahasa Indonesia perlu memperlakukan keselamatan multibahasa sebagai variabel pengujian tersendiri, bukan menganggap hasil agregat otomatis berlaku sama pada setiap bahasa dan jenis prompt.
Checklist menguji biaya pada beban nyata

Perbandingan yang dapat ditindaklanjuti harus menjalankan sampel permintaan yang sama pada low, medium, dan high melalui endpoint stabil yang sama. Tujuannya adalah menemukan konfigurasi dengan biaya terendah untuk hasil yang memenuhi kriteria aplikasi, bukan sekadar konsumsi token terendah.
- Kelompokkan sampel menurut jenis tugas, panjang konteks, bahasa, tingkat kesulitan, dan penggunaan alat.
- Catat token masukan dan keluaran, latensi, timeout, retry, jumlah pemanggilan alat, serta hasil yang lolos pemeriksaan.
- Bandingkan median dan persentil tinggi agar permintaan sangat lambat atau lonjakan token tidak tersembunyi oleh nilai rata-rata.
- Hitung biaya per hasil yang berhasil, termasuk konsumsi dari keluaran gagal dan percobaan ulang.
- Evaluasi sampel berbahasa Indonesia secara terpisah untuk akurasi, penolakan yang semestinya, penolakan yang tidak beralasan, dan penggunaan fakta terbaru.
Pada saat peluncuran, status GA, endpoint stabil, batas konteks, pilihan effort, dan tarif perkenalan telah tersedia. Yang belum tersedia adalah rasio token tetap bagi setiap level atau jaminan bahwa high selalu memperbaiki hasil. Dampak biaya sebenarnya karena itu bergantung pada telemetri beban kerja yang sebanding.
Baca juga:
Berlangganan buletin kami
Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.