Gemini 3.5 Flash-Lite o GPT-5.4 mini: kalahating gastos, dikit ang scores

|May-akda: QUASA Editorial Team|6 minutong pagbasa
Gemini 3.5 Flash-Lite o GPT-5.4 mini: kalahating gastos, dikit ang scores

Sa karaniwang bayad na text API, mas mura ang Gemini 3.5 Flash-Lite kaysa GPT-5.4 mini sa parehong dami ng token. Sa standard na presyo ng Gemini API, $0.30 ang bawat milyong input token at $2.50 ang bawat milyong output token; sa presyo ng GPT-5.4 mini, $0.75 at $4.50 ang katumbas na singil. Sa tatlong halimbawang halo ng chat, repository review at coding sa ibaba, halos kalahati ang kalkuladong gastos sa Gemini.

Para sa chat at paulit-ulit na pagsusuri ng repository, Gemini ang mas matipid na panimulang pagpili kung magkalapit ang kalidad ng sagot. Sa coding, maaaring mabawi ng mas matagumpay na output ang mas mataas na singil bawat token, ngunit hindi sapat ang magkakalapit na pampublikong benchmark score upang ipalagay na iisang modelo ang panalo sa lahat ng gawain. May hiwalay ding usapin ang haba ng input: mas malaki ang dokumentadong context window ng Gemini.

Magkano ang chat, repository review at coding?

Para maihambing ang dalawang presyo, pareho ang ipinapalagay na bilang ng input at output token sa bawat modelo. Mga kondisyunal na kalkulasyon ito para sa standard na text API: walang cached input, batch processing, paggamit ng tool o dagdag na singil. Imumultiply ang input token sa input rate at ang output token sa output rate, saka pagsasamahin ang dalawa. Nasa dolyar ang mga rate; mag-iiba ang katumbas na piso ayon sa palitan at paraan ng pagbabayad.

  • Chat: Kung ang maraming pag-uusap ay kumonsumo ng kabuuang 1 milyong input at 250,000 output token, $0.925 ang kalkuladong gastos sa Gemini laban sa $1.875 sa GPT. Humigit-kumulang 51% ang matitipid. Kung mas maikli ang mga sagot, liliit ang output bill ng pareho, kaya mas magiging mahalaga sa kabuuan ang agwat sa input rate.
  • Repository review: Sa kabuuang 5 milyong input at 500,000 output token na hinati sa maraming request, $2.75 sa Gemini laban sa $6.00 sa GPT ang kalkulasyon, o humigit-kumulang 54% na mas mababa. Ipinapalagay na kasya sa context window ang bawat indibidwal na request. Kapag paulit-ulit na ipinapadala ang parehong malalaking bahagi ng code, lalaki ang input bill; ibang kalkulasyon ang kailangan kung gumagamit ng caching.
  • Coding assistant: Sa kondisyunal na 2 milyong input at 1 milyong output token, $3.10 sa Gemini at $6.00 sa GPT ang lalabas, o humigit-kumulang 48% na diperensiya. Mas malaki ang ambag ng output sa bill na ito kaysa sa halimbawa ng chat. Maaari ring magkaiba ang token na magagamit nila sa totoong gawain kung mas mahaba ang nabubuong code o mas maraming pagtatangka ang kailangan.

Ipinapakita ng magkakaibang halo kung saan nagmumula ang halos kalahating gastos: mas mababa ang parehong input at output rate ng Gemini, bagaman hindi eksaktong pareho ang porsiyento ng tipid sa bawat workload. Hindi rin awtomatikong katumbas ng mas mababang singil bawat token ang mas mababang gastos bawat tinatanggap na resulta. Sa coding, may halaga rin ang muling pagtakbo, pagwawasto at oras ng taong sumusuri sa pagbabago.

Ano ang sinasabi ng magkakalapit na scores?

Sa paghahambing ng BenchLM, 55.64 ang overall point estimate ng GPT-5.4 mini laban sa 51.54 ng Gemini 3.5 Flash-Lite; nag-o-overlap ang kanilang 90% interval na 45.2–66.1 at 39.4–63.6, samantalang sa coding category ay bahagyang nauuna ang Gemini, 38.2 laban sa 36.9, na may nag-o-overlap ding interval. May nakikitang lamang sa bawat estimate, ngunit hindi sapat ang agwat upang ituring na tiyak ang pagkakasunod ng dalawang modelo.

Limitado rin ang direktang paghahambing sa pinagsamang score: anim na public result lamang ang magkapareho sa dalawang modelo, habang may mga resultang available para sa isa ngunit wala sa kabila. Ang category score ay nagsasama ng mga gawaing may sariling setup at pamantayan. Kaya maaaring mas may saysay para sa isang coding assistant ang resulta sa pagkukumpuni ng code sa repository kaysa sa overall ranggo na sumasaklaw sa iba pang kakayahan.

Magkapareho ba ang larawan sa mga coding test?

Hindi pareho ang direksiyon ng lahat ng inilathalang coding result. Sa model card ng Google DeepMind, 54.2% ang Gemini laban sa 54.4% ng GPT-5.4 mini sa SWE-Bench Pro (Public); sa Terminal-bench 2.1 gamit ang Terminus-2 harness, 54.0% laban sa 59.2% ang resulta. Magkalapit ang una, samantalang mas malinaw ang lamang ng GPT sa ikalawang pagsubok. Ang bahagyang pangunguna ng Gemini sa pinagsamang coding category ay hindi salungat dito: magkaiba ang hanay ng gawain at paraan ng pagbuo ng category score at ng dalawang partikular na test.

Mahalaga rin ang salitang harness sa resulta ng terminal coding. Kabilang sa sinusukat ang pagganap ng modelo sa loob ng itinakdang proseso at mga tool, kaya hindi ligtas na ipalagay na makukuha ang kaparehong porsiyento sa ibang coding assistant. Para sa trabahong mahal ang maling pagbabago, mas makabuluhang ihambing ang bilang ng tinatanggap na pag-aayos at kabuuang token na nagastos sa parehong mga gawain at kondisyon.

Kailan nagiging mahalaga ang context window?

Hanggang 1 milyong token ang context window ng Gemini, samantalang 400,000 token ang nakalista para sa GPT-5.4 mini. Kung, bilang kondisyunal na halimbawa, kailangang ipasok nang sabay ang 600,000 token ng repository at mga kaugnay na tagubilin, lampas iyon sa bintana ng GPT. Maaari itong hatiin, salain o ibuod, ngunit babaguhin ng mga paraang iyon ang kontekstong nakikita sa bawat request at posibleng ang dami ng request na babayaran.

Ang mas malaking bintana ay kapasidad, hindi pangako na mahahanap at magagamit nang tama ang bawat detalye sa mahabang input. May output limit din ang bawat modelo, kaya hindi maaaring ilaan ang buong context window sa ipinapasok na materyal. Kung kasya naman sa pareho ang isang repository review, ang kalidad ng natukoy na problema at gastos bawat natapos na review ang mas kapaki-pakinabang na batayan kaysa sa laki ng bintana lamang.

Alin ang mas sulit para sa workload?

Sa maraming chat turn at text review na kasya sa dalawang modelo, pabor sa Gemini 3.5 Flash-Lite ang nakalistang standard rates at ang mga kondisyunal na kalkulasyon. Pabor din dito ang kapasidad kung kailangang manatili sa isang request ang input na mas mahaba sa bintana ng GPT-5.4 mini. Para sa coding, walang tiyak na panalo mula sa pinagsamang benchmark: bahagyang nauuna ang Gemini sa isang category estimate, ngunit may partikular na agentic coding test na mas mataas ang GPT.

Kung magkalapit ang kalidad ng output sa mismong gawain, mas mababang token bill ang magpapasulit sa Gemini. Kung mas maraming pagbabago ang natatanggap nang walang pagwawasto mula sa GPT-5.4 mini, maaari namang mabawi ang dagdag na singil nito. Ang mahalagang sukat para sa huling pagpili ay gastos bawat matagumpay na gawain, kasama ang mga pagtatangkang kinailangan upang matapos iyon.

Basahin din:

I-share:

Mag-subscribe sa aming newsletter

Matanggap ang pinakabagong balita tungkol sa Web3, AI at crypto nang diretso sa iyong inbox.

0