API GPT-6 Astra bisa mahal setelah 272 ribu token—hitung sebelum migrasi

Untuk memakai GPT-6 Astra melalui API, kirim permintaan ke Responses API dengan model gpt-6-astra, pilih reasoning effort mulai dari low, lalu catat pemakaian token pada respons. Sebelum memindahkan trafik produksi, hitung biaya dengan ukuran input yang nyata karena tarif seluruh permintaan naik ketika input melampaui 272 ribu token.
Pada pemrosesan Standard, tarif dasarnya US$10 per satu juta token input dan US$50 per satu juta token output. Di atas ambang 272 ribu token input, tarif input dan cache menjadi dua kali lipat serta tarif output menjadi 1,5 kali lipat untuk seluruh permintaan—bukan hanya bagian yang melewati ambang.
1. Kirim permintaan melalui Responses API

Simpan API key sebagai variabel lingkungan, inisialisasi klien OpenAI, lalu buat respons dengan model dan input yang diperlukan. Referensi pembuatan respons juga menyediakan max_output_tokens, yaitu batas gabungan token penalaran dan keluaran yang dapat dihasilkan.
Contoh JavaScript: const response = await client.responses.create({ model: "gpt-6-astra", input: "Tinjau perubahan kode ini dan sebutkan risiko regresinya.", reasoning: { effort: "low" }, max_output_tokens: 4000 }); Setelah permintaan selesai, baca hasil melalui response.output_text dan simpan objek usage untuk menghitung konsumsi aktual.
Contoh tersebut memakai input ringkas dan effort rendah sebagai titik awal, bukan konfigurasi universal. Batasi dokumen dan riwayat percakapan pada bagian yang relevan; max_output_tokens berfungsi sebagai pagar konsumsi, bukan target jumlah token yang harus dihabiskan.
2. Hitung dampak ambang 272 ribu token

Spesifikasi GPT-6 Astra mencantumkan jendela konteks 1,05 juta token, keluaran maksimum 128 ribu token, serta tarif per satu juta token sebesar US$10 untuk input, US$1 untuk cached input, US$12,50 untuk cache write, dan US$50 untuk output. Untuk input di atas 272 ribu token, tarif input dan cache menjadi dua kali lipat, sementara tarif output menjadi 1,5 kali lipat untuk seluruh permintaan.
Di bawah atau tepat pada ambang, rumus sederhananya ialah (input ÷ 1.000.000 × US$10) + (output ÷ 1.000.000 × US$50). Di atas ambang, gunakan US$20 per satu juta token input dan US$75 per satu juta token output. Tiga contoh bersyarat berikut hanya menghitung token input baru dan output pada pemrosesan Standard; cached input, cache write, alat, Batch, Flex, dan Fast mode tidak dimasukkan.
- 20.000 input + 2.000 output: US$0,20 + US$0,10 = US$0,30 per permintaan.
- 200.000 input + 10.000 output: US$2,00 + US$0,50 = US$2,50 per permintaan.
- 300.000 input + 20.000 output: US$6,00 + US$1,50 = US$7,50 per permintaan.
Pada contoh terakhir, tambahan 100 ribu token input dan 10 ribu token output bukan satu-satunya penyebab kenaikan. Setelah input melewati ambang, 200 ribu token awal pun dinilai dengan tarif konteks panjang. Tepat 272 ribu token belum masuk kategori “lebih dari 272K”, tetapi batas operasional sebaiknya menyisakan ruang untuk instruksi, riwayat, hasil alat, dan representasi dokumen yang ikut dihitung sebagai input.
3. Sesuaikan reasoning effort dengan tugas
GPT-6 Astra menerima low, medium, high, xhigh, dan max; effort none tidak didukung. Mulailah dengan low untuk alur yang ruang keputusannya sudah sempit, kemudian naikkan effort hanya jika evaluasi pada tugas produksi menunjukkan peningkatan hasil yang berarti.
Panduan migrasi GPT-6 Astra mengarahkan integrasi yang memakai none atau minimal untuk memulai dari low, sedangkan effort efektif lain dapat dipertahankan sebagai titik pembanding. Panduan yang sama meminta penghapusan temperature, top_p, dan top_logprobs; pada Chat Completions, logprobs juga tidak didukung, sedangkan tool calling untuk model ini harus memakai Responses API.
Effort yang lebih tinggi tidak mempunyai tambahan biaya tetap yang bisa dihitung sebelum permintaan berjalan. Jumlah token penalaran, keluaran, dan pemakaian alat bergantung pada tugas, sehingga metrik yang lebih berguna ialah biaya per hasil yang lulus evaluasi—bukan harga per token saja.
4. Audit fitur dan ukuran konteks
GPT-6 Astra mendukung streaming, function calling, Structured Outputs, input gambar, dan berbagai alat melalui Responses API. Model menghasilkan teks; input audio dan video serta fine-tuning tidak didukung. Periksa setiap parameter, modalitas, dan alat pada integrasi lama sebelum mengganti model ID.
Jendela konteks 1,05 juta token adalah kapasitas maksimum, bukan anjuran untuk mengisinya. Gunakan retrieval untuk memilih bagian dokumen yang relevan, ringkas riwayat yang sudah stabil, dan pertahankan prefiks yang konsisten bila prompt caching cocok dengan pola aplikasi. Pantau token input baru, cached input, cache write, output, biaya alat, latensi, kegagalan, dan percobaan ulang secara terpisah.
Jika aplikasi perlu mengubah effort di tengah percakapan, configuration_update tersedia untuk permintaan Standard beragen tunggal dengan batas kompatibilitas tertentu. Fitur ini dapat mempertahankan prefiks prompt untuk caching, tetapi migrasi awal lebih mudah dibandingkan bila setiap skenario evaluasi memakai effort yang tetap.
5. Putuskan migrasi berdasarkan biaya per hasil

- Ganti model pada lingkungan uji menjadi gpt-6-astra dan gunakan Responses API untuk alur yang memanggil alat.
- Hapus parameter yang tidak didukung serta ubah effort none atau minimal menjadi low.
- Susun evaluasi dari tugas produksi yang telah dianonimkan dan tetapkan kriteria lulus yang dapat diperiksa.
- Catat distribusi token per permintaan, bukan hanya rata-rata, agar permintaan panjang yang melewati 272 ribu token terlihat.
- Hitung biaya per tugas berhasil dengan memasukkan output, cache, alat, kegagalan, dan pengulangan.
- Tetapkan batas konteks di bawah ambang jika manfaat tambahan konteks tidak menutup kenaikan tarif, atau pisahkan pekerjaan panjang ke jalur khusus.
- Naikkan reasoning effort hanya setelah evaluasi membuktikan manfaatnya, lalu alihkan trafik secara bertahap dengan batas anggaran.
GPT-6 Astra ditujukan untuk pekerjaan end-to-end yang sulit, termasuk penalaran kompleks, rekayasa perangkat lunak, riset, dan penggunaan komputer. Migrasi layak bila kualitas atau berkurangnya pengulangan menutup biaya per tugas; untuk permintaan sederhana dan bervolume tinggi, pertahankan model yang lebih ekonomis sampai evaluasi menunjukkan keuntungan yang terukur.
Baca juga:
Berlangganan buletin kami
Dapatkan berita Web3, AI, dan kripto terbaru langsung di kotak masuk Anda.