Panduan Praktis

Gemini 3.5 Flash-Lite murah per token—batas 1 juta token perlu diuji

|Penulis: Tim Redaksi QUASA|5 mnt baca
Gemini 3.5 Flash-Lite murah per token—batas 1 juta token perlu diuji

Gemini 3.5 Flash-Lite layak dipertimbangkan untuk ekstraksi dokumen sederhana, klasifikasi massal, dan subagen dengan tugas sempit ketika biaya serta latensi menjadi prioritas. Tarif API-nya rendah, tetapi keputusan produksi tidak boleh hanya bertumpu pada kapasitas konteks sekitar satu juta token.

Kapasitas itu menunjukkan banyaknya token yang dapat diterima, bukan jaminan bahwa model akan menemukan dan memakai setiap fakta secara konsisten. Tim tetap perlu menghitung biaya berdasarkan pemakaian nyata serta menguji akurasi pada panjang, posisi bukti, format, dan kualitas dokumen yang benar-benar akan diproses.

Kemampuan dan saluran akses

Spesifikasi resmi Gemini 3.5 Flash-Lite mencantumkan input teks, gambar, video, audio, dan PDF, sedangkan output-nya berupa teks. Batas input adalah 1.048.576 token dan batas output 65.536 token; ID model stabilnya ialah gemini-3.5-flash-lite.

Structured outputs, function calling, file search, code execution, thinking, URL context, caching, dan sejumlah fitur grounding didukung. Computer use berstatus pratinjau, sedangkan pembuatan gambar, pembuatan audio, dan Live API tidak didukung. Artinya, model ini dapat menjadi komponen pipeline multimodal atau agen berbasis alat, tetapi bukan model untuk menghasilkan media maupun percakapan suara waktu nyata.

Model tersedia melalui Gemini App, Google AI Studio, Gemini Enterprise Agent Platform, dan Gemini API. Untuk evaluasi terkontrol dan integrasi aplikasi, AI Studio dan API merupakan saluran yang paling relevan; pemilihan saluran tetap harus mempertimbangkan tata kelola data, kuota, dan kebutuhan operasional masing-masing tim.

Harga rendah harus dihitung per alur kerja

Daftar harga Gemini Developer API menetapkan tarif Standard berbayar sebesar US$0,30 per satu juta token input dan US$2,50 per satu juta token output, termasuk thinking tokens. Batch dan Flex masing-masing mengenakan US$0,15 untuk input dan US$1,25 untuk output; context caching mempunyai tarif token dan penyimpanan tersendiri.

Sebagai contoh hipotetis, permintaan dengan 100.000 token input dan 1.000 token output menelan biaya sekitar US$0,0325 pada tarif Standard: US$0,03 untuk input dan US$0,0025 untuk output. Jika 100.000 dokumen per bulan masing-masing memakai 20.000 token input dan menghasilkan 500 token, biaya token kasarnya menjadi US$600 untuk input dan US$125 untuk output, atau US$725 sebelum caching, grounding, percobaan ulang, dan infrastruktur aplikasi.

Harga per sejuta token memang rendah, tetapi memasukkan konteks yang tidak diperlukan dapat mengikis penghematan pada volume besar. Output juga jauh lebih mahal per token daripada input, sehingga skema keluaran yang ringkas, validasi terstruktur, dan batas output yang tepat dapat memengaruhi biaya lebih besar daripada selisih kecil dalam panjang prompt.

Satu juta token bukan ukuran ketelitian

Model card Google DeepMind mencatat skor GDM-MRCR v2 delapan-needle sebesar 72,2% pada 128 ribu token dengan agregasi rata-rata dan 21,3% pada satu juta token dengan pengukuran pointwise. Karena cara agregasinya berbeda, kedua angka itu tidak boleh dibaca sebagai pengukuran penurunan yang sepenuhnya sebanding; hasil satu juta token tetap menunjukkan bahwa muat di dalam jendela konteks tidak sama dengan keberhasilan mengambil seluruh bukti. Dokumen yang sama menyebut halusinasi serta kemungkinan kelambatan atau timeout sesekali sebagai keterbatasan.

Benchmark tersebut juga bukan pengganti evaluasi pada kontrak, laporan, hasil pindai, atau arsip perusahaan tertentu. Informasi penting di tengah dokumen, nilai yang berubah antarbab, tabel kompleks, dan bukti yang tersebar di beberapa lampiran dapat menghasilkan pola kegagalan berbeda. Karena itu, angka resmi berguna sebagai peringatan dan titik pembanding, bukan jaminan akurasi untuk domain produksi.

Matriks keputusan berdasarkan beban kerja

  • Ekstraksi berulang: kandidat kuat jika bidang keluaran jelas, format dokumen relatif konsisten, dan hasil dapat diperiksa terhadap aturan atau data acuan. Kolom kosong, konflik, dan nilai tanpa bukti perlu memicu eskalasi.
  • Subagen: sesuai untuk memilih alat, mengklasifikasikan permintaan, menyaring kandidat, atau mengubah format. Keputusan akhir yang berisiko tinggi sebaiknya tidak diserahkan kepadanya hanya karena biaya setiap panggilan rendah.
  • Input multimodal: relevan ketika satu pekerjaan menggabungkan teks, PDF, gambar, audio, atau video. Dukungan teknis terhadap semua modalitas tidak berarti tingkat akurasinya identik, sehingga setiap jenis input perlu dinilai terpisah.
  • Konteks panjang: berguna apabila tugas benar-benar membutuhkan hubungan antarbab atau antarlampiran. Untuk arsip yang dapat diindeks, retrieval dan pemotongan terarah sering lebih mudah dievaluasi serta lebih hemat daripada mengirim seluruh korpus.
  • Penalaran kompleks: bandingkan dengan model yang lebih kuat ketika tugas melibatkan banyak pengecualian, bukti ambigu, atau rangkaian keputusan panjang. Model yang lebih mahal dapat menghasilkan biaya total lebih rendah jika mengurangi percobaan ulang dan pemeriksaan manusia.

Uji dokumen nyata sebelum produksi

  1. Bangun set representatif. Ambil sampel dari distribusi produksi, termasuk variasi panjang, bahasa, kualitas pindai, tabel, lampiran, serta kasus pengecualian. Pisahkan bahan penyetelan dari set evaluasi akhir.
  2. Tentukan jawaban acuan. Tandai nilai yang benar, lokasi bukti, bidang wajib, dan keadaan ketika sistem seharusnya tidak menjawab. Untuk ekstraksi, ukur exact match atau F1 per bidang, bukan sekadar menilai apakah respons terlihat masuk akal.
  3. Uji panjang dan posisi bukti. Buat kelompok sekitar 32 ribu, 128 ribu, 512 ribu, dan mendekati satu juta token jika data memungkinkan. Letakkan fakta uji di awal, tengah, dan akhir, lalu sertakan dokumen dengan nilai lama dan baru agar kemampuan memilih bukti yang tepat dapat diukur.
  4. Catat kegagalan operasional. Ukur bidang yang hilang, klaim tanpa bukti, JSON tidak valid, latensi persentil, timeout, percobaan ulang, jumlah token, serta biaya per dokumen yang berhasil. Nilai rata-rata saja dapat menyembunyikan kasus ekor yang mengganggu antrean produksi.
  5. Tetapkan ambang dan fallback. Lepaskan sistem hanya jika kategori penting memenuhi target yang ditentukan tim. Alihkan dokumen panjang, ambigu, atau gagal validasi ke model yang lebih kuat atau pemeriksaan manusia, lalu evaluasi ulang ketika model, prompt, atau distribusi data berubah.

Ukuran keputusan yang berguna bukan sekadar apakah Gemini 3.5 Flash-Lite menerima sekitar satu juta token, melainkan sampai panjang berapa akurasi, latensi, dan biaya efektifnya memenuhi kebutuhan. Model ini paling masuk akal ketika tugas dapat dibatasi, output dapat divalidasi, dan kasus sulit dapat dipisahkan sebelum hasil mencapai pengguna.

Baca juga:

Bagikan:

Berlangganan buletin kami

Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.

0