GLM-5.3 shkruan shfrytëzime funksionale: dritarja e mbrojtjes tkurret

|Autori: Ekipi editorial i QUASA|6 min lexim
GLM-5.3 shkruan shfrytëzime funksionale: dritarja e mbrojtjes tkurret

Më 2 tetor 2026, Yonatan Striem Amit i 7AI e përmblodhi pasojën mbrojtëse të matjeve për GLM-5.3 me fjalët “fix the clock”: të shkurtohet koha e korrigjimit dhe e reagimit. Studimi i Anthropic, i publikuar më 29 shtator 2026, tregon pse: modeli me peshë të hapur i Z.ai ndërtoi shfrytëzime funksionale në 50 nga 410 përpjekje mbi dobësi të njohura të motorit V8, rreth 12%.

Modeli arriti të përfundonte disa zinxhirë shfrytëzimi, ndërsa shumica e përpjekjeve dështuan. Për ekipet e zhvillimit dhe të sigurisë në Shqipëri e Kosovë, ndryshimi praktik është te koha që mund të kalojë nga njohja e një dobësie te një shfrytëzim i përdorshëm. Rezultati e bën më urgjent korrigjimin e sistemeve të ekspozuara, pa treguar se modeli mund të automatizojë çdo sulm.

Provat matin faza të ndryshme të sulmit

Vlerësimi i CAISI pranë NIST, i publikuar më 17 shtator 2026, i dha GLM-5.3 40,4% në SEC-Bench Pro, 61,1% të pikëve në ExploitBench, 9,4% sukses në ExploitGym dhe 7,7% në CAISI OSS-Fuzz; indeksi i përbërë e vendosi modelin rreth katër muaj pas kufirit amerikan. Në këtë vlerësim, ai ishte modeli me peshë të hapur më i aftë për detyra kibernetike ndër modelet e provuara.

SEC-Bench Pro mat nëse modeli gjen një defekt të njohur në kodin e motorëve të shfletuesve dhe shkruan një provë që shkakton rrëzimin e synuar. ExploitBench nis nga një defekt i njohur në V8, por kërkon përparim drejt ekzekutimit të kodit të zgjedhur nga modeli. Pikët e tij shpërblejnë edhe fazat e ndërmjetme: përqindja e pikëve nuk është përqindja e shfrytëzimeve të përfunduara.

ExploitGym nis me një defekt në një projekt me kod të hapur dhe me një hyrje që dihet se e rrëzon programin. Detyra është ta kthejë atë rrëzim në ekzekutim kodi. Në CAISI OSS-Fuzz, modelit i jepet kodi, por jo përshkrimi i defektit, një shembull rrëzimi apo korrigjimi; ai duhet ta gjejë dhe ta shfrytëzojë vetë. Kjo e bën rezultatin më të ulët të kuptueshëm pa e trajtuar si kundërshtim me provat e tjera.

Edhe dy matjet që përdorin emrin ExploitBench përgjigjen ndaj pyetjeve të ndryshme. Pikëzimi i vlerësimit federal përshkruan sa larg arriti agjenti në detyrë, kurse norma e shfrytëzimeve funksionale në provën e shfletuesit numëron përfundimet e plota. Asnjëra nuk jep drejtpërdrejt gjasën që një aplikacion i caktuar në prodhim të komprometohet.

Çfarë arriti modeli në mjedis të kontrolluar

Prova mbi dobësitë e njohura të V8 tregon se GLM-5.3 mund të ndërtojë një zinxhir funksional deri në ekzekutimin e kodit. Ajo tregon njëkohësisht se aftësia është e paqëndrueshme: një rezultat i suksesshëm kërkon që modeli të zgjidhë disa pengesa të njëpasnjëshme, dhe një dështim në cilëndo prej tyre e ndal zinxhirin. Shtimi i përpjekjeve mund të ndryshojë mundësinë e suksesit, por rezultati i matur vlen për kushtet e kësaj prove.

Në një eksperiment tjetër, me studiues njerëzorë dhe një shfletues lokal Linux, modeli gjeti dobësi që studiuesit nuk i kishin identifikuar paraprakisht dhe i bashkoi në një faqe që mund të lexonte një skedar privat. Objektivi ishte pjesë e një mjedisi të izoluar testimi. Rasti është më kërkues se shfrytëzimi i një defekti tashmë të përshkruar, por përfshin edhe zgjedhjen e objektivit dhe drejtimin nga një studiues.

Një provë e veçantë përdori GLM-5.3-Flash, versionin më të vogël të modelit, për të kthyer të dhënat publike të një korrigjimi të Chrome në një zinxhir shfrytëzimi. Këtu qëndron lidhja me dritaren e mbrojtjes: pasi publikohet korrigjimi, informacioni që ndihmon ekipet të riparojnë defektin mund të ndihmojë edhe zhvillimin e një sulmi. Rasti nuk përcakton një afat të përgjithshëm për çdo dobësi.

Testet e sjelljes shtojnë një kusht tjetër në vlerësimin e rrezikut. Versioni standard refuzonte kërkesa haptazi të dëmshme në simulimin e përdorur, por formulime mashtruese, paraplotësimi i arsyetimit dhe një version i modifikuar e shtynë të angazhohej në detyrat e provës. Gatishmëria për t’iu përgjigjur një kërkese të dëmshme dhe aftësia për të prodhuar një shfrytëzim funksional janë matje të ndryshme; refuzimi i versionit standard nuk e fshin aftësinë e matur.

Hendeku me kufirin amerikan është krahasim, jo afat

Indeksi federal bashkon rezultate nga detyra me vështirësi të ndryshme për të krahasuar aftësinë e përgjithshme të modeleve. Hendeku i raportuar për GLM-5.3 nuk është parashikim se kur do të dalë një model tjetër, as koha që i duhet një sulmuesi për të goditur një sistem. Ai tregon pozicionin e modelit në grupin e provave të përdorura në atë vlerësim.

Kushtet e krahasimit kanë rëndësi. Kufiri amerikan përfshin modele të lëshuara edhe me qasje të kufizuar, ndërsa modelet amerikane u provuan, kur ishte e zbatueshme, me mbrojtjet kibernetike të çaktivizuara. Peshat e GLM-5.3 janë publike dhe modeli mund të shkarkohet. Prandaj një rezultat më i ulët në indeks mund të ketë ende peshë për sigurinë e përditshme: qasja te aftësia është më e gjerë.

Leximi më i dobishëm për mbrojtësit është bashkimi i aftësisë me ekspozimin e tyre konkret. Një sistem i arritshëm nga interneti, me një defekt të njohur dhe me të dhëna me vlerë pas tij, paraqet përparësi tjetër nga një komponent i izoluar. Matjet nuk e zëvendësojnë këtë dallim; ato tregojnë pse pritja që zhvillimi i shfrytëzimit do të jetë gjithmonë i ngadaltë është një supozim gjithnjë e më i dobët.

Si ndryshojnë përparësitë e korrigjimit dhe reagimit

Përgjigjja mbrojtëse duhet të nisë nga sistemet ku koha ka më shumë pasoja. Kjo është një përparësi e nxjerrë nga provat, jo një afat universal i matur prej tyre: modeli ka përfunduar shfrytëzime në disa kushte, ndërsa një organizatë duhet të vendosë sipas ekspozimit, privilegjeve dhe të dhënave të sistemeve të veta.

  1. Identifikoni së pari shërbimet e arritshme nga interneti dhe versionet e komponentëve që përdorin. Kur del një dobësi, lidhja mes inventarit dhe sistemit të prekur tregon ku kërkohet korrigjim urgjent. Përparësi merr defekti që hap rrugë drejt ekzekutimit të kodit ose të dhënave të ndjeshme, edhe kur ende nuk është publikuar një shfrytëzim i gatshëm.
  2. Matni kohën nga njoftimi i dobësisë deri te vendosja e korrigjimit ose izolimi i komponentit. Për një shërbim të ekspozuar, vonesa duhet parë bashkë me mundësinë që informacioni publik për defektin të përdoret për zhvillimin e sulmit. Kur korrigjimi nuk mund të vendoset menjëherë, kufizimi i aksesit dhe i privilegjeve mund të zvogëlojë pasojën e një shfrytëzimi.
  3. Matni veçmas kohën nga sinjali i parë i ndërhyrjes deri te kufizimi i saj. Kodi i shkruar me ndihmën e modelit duhet ende të veprojë në sistemin e synuar; ekzekutimi i pazakontë, përdorimi i kredencialeve dhe lëvizja mes sistemeve mbeten ngjarje që mund të hetohen. Një rrugë e qartë për izolimin e sistemit të prekur ka vlerë vetëm nëse veprimi kryhet para se ndërhyrja të përfundojë.

Presioni më i drejtpërdrejtë bie mbi hapësirën mes publikimit të dobësisë, vendosjes së korrigjimit dhe kufizimit të një ndërhyrjeje. Ekipi që i njeh këto intervale për shërbimet e veta mund ta drejtojë punën te sistemi ku pritja krijon rrezikun më të madh, pa supozuar se çdo përpjekje e modelit do të ketë sukses.

Lexoni gjithashtu:

Ndaj:

Abonohuni në buletinin tonë

Merrni lajmet më të fundit për Web3, AI dhe kripto direkt në kutinë tuaj postare.

0