A Gemini 4 Argon erős benchmarkokat hozott, de még alig érhető el

|Szerző: A QUASA szerkesztősége|5 perc olvasás| 1
A Gemini 4 Argon erős benchmarkokat hozott, de még alig érhető el

Az Axios szeptember 30-i tudósítása szerint a Google 2026. szeptember 30-án bemutatta a Gemini 4 Argont, és kezdetben egy szűk kibervédelmi partnerkör számára teszi elérhetővé; Tulsee Doshi, a Google DeepMind Gemini-termékekért felelős vezetője így jellemezte a modellt: „Argon is a well-rounded model that has frontier capabilities across several domains”. A bemutató tehát megtörtént, az általános fejlesztői hozzáférés még nem indult el.

A TechCrunch beszámolója szerint az első külső felhasználók a Fairwind program kiválasztott kibervédelmi partnerei, akik sérülékenységek felkutatására, ellenőrzésére és javítására próbálhatják ki az Argont. A modellhez már közöltek teszteredményeket és tervezett API-árakat, de a fizetős ügyfelek szélesebb körű hozzáférésének nincs bejelentett napja. Magyar fejlesztők számára ez egyelőre bejelentett képességeket és feltételeket jelent, nem általánosan használható szolgáltatást.

Mit mérnek az Argon erős teszteredményei?

A Google részletes bejelentése 77,9%-os eredményt közöl a DeepSWE v1.1 feladatsoron, 51,3%-ot a Zapier AutomationBench tesztjén és holtversenyes első helyet érő 68%-ot a CWE-bench v1-en; emellett egymillió tokenes kimeneti korlátot, valamint egymillió bemeneti tokenre 2 dolláros és egymillió kimeneti tokenre 10 dolláros bevezető API-árat ad meg, amely a bevezető időszak után 4, illetve 20 dollárra emelkedik. Ezek a számok különböző feladatokra és a későbbi API-használat feltételeire vonatkoznak, ezért nem olvashatók egyetlen általános teljesítménymutatóként.

A DeepSWE hosszabb, valós szoftvermérnöki feladatok megoldását méri. Az AutomationBench azt vizsgálja, végig tud-e vinni a rendszer több lépésből álló üzleti folyamatokat, míg a CWE-bench a szoftveres sérülékenységek javítására összpontosít. Egy kódjavítás sikere, egy üzleti folyamat befejezése és egy biztonsági hiba kezelése más feltételektől függ; a közzétett százalékok közvetlen összehasonlítása félrevezető lenne.

Az Argon a Vals Indexen is vezető helyen szerepel a bemutatott eredmények szerint. Ez a külső rangsor pénzügyi, programozási, jogi és adózási feladatokat fog össze, az ágazatok súlyát pedig az amerikai gazdasághoz igazítja. Hasznos jelzés a modell szélesebb képességeiről, de a magyar fejlesztők saját kódbázisán végzett, megismételhető próba más kérdésre adna választ. Az eredménytábla jelenleg megelőzi azt az időszakot, amikor sok egymástól független felhasználó mérheti ugyanazt a modellt.

A gyártó belső példái az Argont hibakeresésben, algoritmusok tervezésében és nagy kódbázisok átalakításában mutatják be. Az egyik ismertetett munka egy videodekóder Rust-változatának gyorsításához kapcsolódik; más migrációknál a készülő változtatásokat automatizált és kézi ellenőrzésnek vetik alá, mielőtt éles rendszerbe kerülnének. Ez megmutatja, milyen tartós mérnöki munkára szánják a modellt, de az üzembe helyezett szoftver megbízhatósága az ellenőrzési folyamattól is függ.

Miért a Fairwind partnerei kerültek előre?

A korlátozott indulás központi területe a védekező kibervédelem. Az Argont olyan feladatra készítették fel, amelyben egy lehetséges sérülékenységet nem elég megnevezni: meg kell találni az érintett kódot, ellenőrizni kell a kockázatot, majd olyan módosítást kell készíteni, amely ténylegesen kezeli a hibát. Ez hosszabb munkafolyamat, mint egy egyszeri kérdésre adott válasz, és a hibás javítás ugyanúgy további ellenőrzést igényel, mint maga a felismerés.

A közzétett korai példában a Wiz a Scan for Good kezdeményezésében használja az Argont, amely kritikus közszolgáltatási rendszerek védelmére irányul. A bemutatott esetben a modell egészségügyi intézmények által használt szoftver érzékeny személyes adatokat érintő sérülékenységére hívta fel a figyelmet. Ez konkrét alkalmazási példa, de a nyilvánosság számára nem helyettesíti a sokféle rendszeren végzett, függetlenül megismételhető értékelést.

A biztonsági feladatokban különösen fontos, ki milyen hozzáférést kap. A megbízható védelmi partnerek és a Google belső csapatai a modell teljesebb kibervédelmi képességeivel dolgozhatnak, miközben a szélesebb kiadás előtt további visszaélés elleni korlátok készülnek. A fokozatos bevezetésben a korai felhasználók tapasztalata a védelem kialakításához is adatot ad; ettől azonban a pilot eredménye még nem válik automatikusan minden fejlesztői környezetre érvényessé.

A sérülékenységek javítására vonatkozó szabványosított tesztet és a belső próbákat érdemes külön kezelni. Az előbbi összehasonlítható feladatokat ad a részt vevő rendszereknek, az utóbbi valósabb munkafolyamatokat mutathat meg, de a teljes körülmények nem feltétlenül hozzáférhetők kívülről. A modell teljesítményéről ezért most egyszerre áll rendelkezésre mérési eredmény és néhány korai használati példa, míg a szélesebb körű tapasztalat a hozzáférés bővítésére vár.

Mennyibe kerülhet az API, és mit jelent a kimeneti korlát?

A meghirdetett tokendíj a jövőbeli API-használat ára, nem annak bizonyítéka, hogy az API már minden fizető fejlesztő számára megnyílt. A bemenet a modellnek átadott tartalom, a kimenet a létrehozott válasz; a két irány külön árazása miatt egy hosszú munkafolyamat költsége a hívások számától és a válaszok terjedelmétől is függ. A gyorsítótárból felhasznált bemeneti tokenekre külön kedvezményt is jeleztek.

A nagy kimeneti keret arra ad mozgásteret, hogy a modell egy futás alatt hosszabb, több lépésből álló választ állítson elő. Nem a bemeneti kontextus méretét jelöli, és önmagában nem mond semmit egy feladat futási idejéről vagy a végső számláról. Egy sérülékenység vizsgálatánál vagy egy nagyobb kódmódosításnál a valódi értéke attól függ majd, hogy a hosszú válasz mennyi ellenőrizhető, használható munkát tartalmaz.

A magasabb, későbbi díjszintet már megadták, a bevezető időszak végét viszont nem kötötték nyilvános dátumhoz. Ez lényeges különbség egy olyan csapatnak, amely rendszeres, nagy mennyiségű API-hívással számolna: ugyanaz a feladatsor a kedvezményes időszak után többe kerülhet. Az ár tehát ismert tervezési adat, a tényleges hozzáférési és használati feltételek teljes képe még nem.

Mikor használhatják szélesebb körben a fejlesztők?

A következő megnevezett kör a fizetős API-ügyfeleké és a Google AI Ultra előfizetőié. A bővítés előtt a korai tesztelők visszajelzéseit és a biztonsági korlátokat dolgozzák fel; az indulás pontos időpontját nem közölték. A szeptember végi bemutató ezért nem jelent magyarországi, általános API-rajtót, és a meghirdetett tokendíj sem jelent jelenlegi vásárlási lehetőséget minden érdeklődőnek.

A szélesebb kiadás egyben a teljesítményről alkotott kép következő próbája lesz. Akkor válhatnak összevethetővé a közzétett benchmarkok a különböző fejlesztői csapatok saját feladataival, és akkor derülhet ki, hogyan működik az Argon eltérő kódbázisokon, jogi vagy pénzügyi munkafolyamatokban. A magyar fejlesztők számára a következő érdemi hír az lesz, amikor a Google megnyitja a fizetős hozzáférést, és közzéteszi annak pontos feltételeit.

Olvassa el ezt is:

Megosztás:

Iratkozzon fel hírlevelünkre

A legfrissebb Web3-, MI- és kriptohírek egyenesen a postafiókjába.

0