
A Gemini 4 Argon erős benchmarkokat hozott, de még alig érhető el

Az Axios szeptember 30-i tudósítása szerint a Google 2026. szeptember 30-án bemutatta a Gemini 4 Argont, és kezdetben egy szűk kibervédelmi partnerkör számára teszi elérhetővé; Tulsee Doshi, a Google DeepMind Gemini-termékekért felelős vezetője így jellemezte a modellt: „Argon is a well-rounded model that has frontier capabilities across several domains”. A bemutató tehát megtörtént, az általános fejlesztői hozzáférés még nem indult el.
A TechCrunch beszámolója szerint az első külső felhasználók a Fairwind program kiválasztott kibervédelmi partnerei, akik sérülékenységek felkutatására, ellenőrzésére és javítására próbálhatják ki az Argont. A modellhez már közöltek teszteredményeket és tervezett API-árakat, de a fizetős ügyfelek szélesebb körű hozzáférésének nincs bejelentett napja. Magyar fejlesztők számára ez egyelőre bejelentett képességeket és feltételeket jelent, nem általánosan használható szolgáltatást.
Mit mérnek az Argon erős teszteredményei?
A Google részletes bejelentése 77,9%-os eredményt közöl a DeepSWE v1.1 feladatsoron, 51,3%-ot a Zapier AutomationBench tesztjén és holtversenyes első helyet érő 68%-ot a CWE-bench v1-en; emellett egymillió tokenes kimeneti korlátot, valamint egymillió bemeneti tokenre 2 dolláros és egymillió kimeneti tokenre 10 dolláros bevezető API-árat ad meg, amely a bevezető időszak után 4, illetve 20 dollárra emelkedik. Ezek a számok különböző feladatokra és a későbbi API-használat feltételeire vonatkoznak, ezért nem olvashatók egyetlen általános teljesítménymutatóként.
A DeepSWE hosszabb, valós szoftvermérnöki feladatok megoldását méri. Az AutomationBench azt vizsgálja, végig tud-e vinni a rendszer több lépésből álló üzleti folyamatokat, míg a CWE-bench a szoftveres sérülékenységek javítására összpontosít. Egy kódjavítás sikere, egy üzleti folyamat befejezése és egy biztonsági hiba kezelése más feltételektől függ; a közzétett százalékok közvetlen összehasonlítása félrevezető lenne.
Az Argon a Vals Indexen is vezető helyen szerepel a bemutatott eredmények szerint. Ez a külső rangsor pénzügyi, programozási, jogi és adózási feladatokat fog össze, az ágazatok súlyát pedig az amerikai gazdasághoz igazítja. Hasznos jelzés a modell szélesebb képességeiről, de a magyar fejlesztők saját kódbázisán végzett, megismételhető próba más kérdésre adna választ. Az eredménytábla jelenleg megelőzi azt az időszakot, amikor sok egymástól független felhasználó mérheti ugyanazt a modellt.
A gyártó belső példái az Argont hibakeresésben, algoritmusok tervezésében és nagy kódbázisok átalakításában mutatják be. Az egyik ismertetett munka egy videodekóder Rust-változatának gyorsításához kapcsolódik; más migrációknál a készülő változtatásokat automatizált és kézi ellenőrzésnek vetik alá, mielőtt éles rendszerbe kerülnének. Ez megmutatja, milyen tartós mérnöki munkára szánják a modellt, de az üzembe helyezett szoftver megbízhatósága az ellenőrzési folyamattól is függ.
Miért a Fairwind partnerei kerültek előre?
A korlátozott indulás központi területe a védekező kibervédelem. Az Argont olyan feladatra készítették fel, amelyben egy lehetséges sérülékenységet nem elég megnevezni: meg kell találni az érintett kódot, ellenőrizni kell a kockázatot, majd olyan módosítást kell készíteni, amely ténylegesen kezeli a hibát. Ez hosszabb munkafolyamat, mint egy egyszeri kérdésre adott válasz, és a hibás javítás ugyanúgy további ellenőrzést igényel, mint maga a felismerés.
A közzétett korai példában a Wiz a Scan for Good kezdeményezésében használja az Argont, amely kritikus közszolgáltatási rendszerek védelmére irányul. A bemutatott esetben a modell egészségügyi intézmények által használt szoftver érzékeny személyes adatokat érintő sérülékenységére hívta fel a figyelmet. Ez konkrét alkalmazási példa, de a nyilvánosság számára nem helyettesíti a sokféle rendszeren végzett, függetlenül megismételhető értékelést.
A biztonsági feladatokban különösen fontos, ki milyen hozzáférést kap. A megbízható védelmi partnerek és a Google belső csapatai a modell teljesebb kibervédelmi képességeivel dolgozhatnak, miközben a szélesebb kiadás előtt további visszaélés elleni korlátok készülnek. A fokozatos bevezetésben a korai felhasználók tapasztalata a védelem kialakításához is adatot ad; ettől azonban a pilot eredménye még nem válik automatikusan minden fejlesztői környezetre érvényessé.
A sérülékenységek javítására vonatkozó szabványosított tesztet és a belső próbákat érdemes külön kezelni. Az előbbi összehasonlítható feladatokat ad a részt vevő rendszereknek, az utóbbi valósabb munkafolyamatokat mutathat meg, de a teljes körülmények nem feltétlenül hozzáférhetők kívülről. A modell teljesítményéről ezért most egyszerre áll rendelkezésre mérési eredmény és néhány korai használati példa, míg a szélesebb körű tapasztalat a hozzáférés bővítésére vár.
Mennyibe kerülhet az API, és mit jelent a kimeneti korlát?
A meghirdetett tokendíj a jövőbeli API-használat ára, nem annak bizonyítéka, hogy az API már minden fizető fejlesztő számára megnyílt. A bemenet a modellnek átadott tartalom, a kimenet a létrehozott válasz; a két irány külön árazása miatt egy hosszú munkafolyamat költsége a hívások számától és a válaszok terjedelmétől is függ. A gyorsítótárból felhasznált bemeneti tokenekre külön kedvezményt is jeleztek.
A nagy kimeneti keret arra ad mozgásteret, hogy a modell egy futás alatt hosszabb, több lépésből álló választ állítson elő. Nem a bemeneti kontextus méretét jelöli, és önmagában nem mond semmit egy feladat futási idejéről vagy a végső számláról. Egy sérülékenység vizsgálatánál vagy egy nagyobb kódmódosításnál a valódi értéke attól függ majd, hogy a hosszú válasz mennyi ellenőrizhető, használható munkát tartalmaz.
A magasabb, későbbi díjszintet már megadták, a bevezető időszak végét viszont nem kötötték nyilvános dátumhoz. Ez lényeges különbség egy olyan csapatnak, amely rendszeres, nagy mennyiségű API-hívással számolna: ugyanaz a feladatsor a kedvezményes időszak után többe kerülhet. Az ár tehát ismert tervezési adat, a tényleges hozzáférési és használati feltételek teljes képe még nem.
Mikor használhatják szélesebb körben a fejlesztők?
A következő megnevezett kör a fizetős API-ügyfeleké és a Google AI Ultra előfizetőié. A bővítés előtt a korai tesztelők visszajelzéseit és a biztonsági korlátokat dolgozzák fel; az indulás pontos időpontját nem közölték. A szeptember végi bemutató ezért nem jelent magyarországi, általános API-rajtót, és a meghirdetett tokendíj sem jelent jelenlegi vásárlási lehetőséget minden érdeklődőnek.
A szélesebb kiadás egyben a teljesítményről alkotott kép következő próbája lesz. Akkor válhatnak összevethetővé a közzétett benchmarkok a különböző fejlesztői csapatok saját feladataival, és akkor derülhet ki, hogyan működik az Argon eltérő kódbázisokon, jogi vagy pénzügyi munkafolyamatokban. A magyar fejlesztők számára a következő érdemi hír az lesz, amikor a Google megnyitja a fizetős hozzáférést, és közzéteszi annak pontos feltételeit.
Olvassa el ezt is:
Kapcsolódó cikkek


A GPT-6.1 Sol ötödáron közelít az Astrához – de lassabb a gyakorlatban

ChatGPT vagy Gemini Deep Research: a több forrás nem mindig jobb

Az MI felgyorsítja a támadásokat, de egy 2020-as hiba viszi a találatok 58%-át

Az Adobe beköltözik a Geminibe és a Claude-ba – 80 eszköz jön egy chatbe

OpenAI-ágensek adatoldalakat támadtak – több kísérlet elbukott
Iratkozzon fel hírlevelünkre
A legfrissebb Web3-, MI- és kriptohírek egyenesen a postafiókjába.