
16 000 bandymų išgauti DI mąstymą: „OpenAI“ uždarė atkūrimo kelią

2026 m. rugsėjo 30 d. „OpenAI“ incidento aprašyme nurodyta, kad liepos 24–25 d. daugiau kaip 4 000 naudotojų pateikė 16 000 užklausų, atitikusių modelių samprotavimo išgavimo schemą; išnašoje jos apibūdintos „attempted, not necessarily successful“. Bendrovė sustabdė kampaniją ir uždarė kelią, kuriuo jau turint kito naudotojo užšifruotą samprotavimo artefaktą buvo galima mėginti atkurti jo turinį kitame pokalbyje. Užklausų skaičius rodo bandymų mastą, o ne sėkmingų išgavimų kiekį.
Nepriklausoma „Tom’s Hardware“ publikacija išskyrė pagrindinės aktyvumo grupės sąsają su „Kimi“ kūrėja „Moonshot AI“, tačiau visų pastebėtų veikėjų nepriskyrė vienam organizatoriui. Taikinys buvo vidinis modelio samprotavimo įrašas, kurio įprastas atsakymas naudotojui nerodo. Kampanija rėmėsi manipuliavimu modelių sąveika, o ne įsilaužimu į saugomų pokalbių duomenų bazę ar šifravimo pralaužimu.
Kaip užšifruotas įrašas galėjo tapti atsakymu
Samprotavimo įrašas yra tarpiniai modelio žingsniai sprendžiant užduotį. Klientui perduodamas užšifruotas jo blokas gali būti grąžinamas modeliui tęsiant sąveiką, todėl jis tampa atskiru, perkeliamu artefaktu. Aprašytoje kampanijoje operatoriai kopijavo tokį bloką iš vieno pokalbio ir kitame prašė modelio jį iššifruoti bei perrašyti įskaitomu tekstu. Būtent perėjimas tarp kontekstų sudarė kelią turiniui patekti į prašančiajam matomą išvestį.
Nepriklausomų tyrėjų darbe aprašytas susijęs mechanizmas: kai kurie užšifruoti samprotavimo blokai buvo suderinami tarp to paties tiekėjo sesijų, naudotojų ir modelių, o silpniau apsaugotas modelis galėjo išvesti jų turinį paprastu tekstu. Tyrėjai tokį būdą demonstravo su „OpenAI“, „Anthropic“ ir „Google“ modeliais. Šie bandymai parodo pažeidžiamumo klasę, bet jų rezultatai nėra duomenys apie rugsėjį paskelbtos kampanijos sėkmę.
Techninis skirtumas nuo duomenų bazės vagystės svarbus galimam poveikiui. Išpuolio grandinei reikėjo prieigos prie konkretaus užšifruoto bloko ir galimybės jį pateikti modelio sąveikoje; užklausų vykdytojai negavo tiesioginės prieigos prie visų saugomų pokalbių. Vis dėlto atkurtas samprotavimo tekstas galėtų atskleisti tarpines išvadas ar informaciją, kuri nebuvo įtraukta į galutinį atsakymą. Tokie įrašai taip pat gali suteikti medžiagos kito modelio gebėjimams atkartoti, užuot mokius jį vien iš įprastų atsakymų.
Ką iš tiesų reiškia užklausų mastas
Aktyvumas prasidėjo liepos pradžioje, o didžiausias šuolis teko dviem liepos paroms. Platesnis susijusių užklausų šablonų tyrimas apėmė daugiau kaip 15 000 naudotojų; šios grupės veikla buvo sustabdyta iki liepos 28 d. Šio platesnio skaičiaus negalima sudėti su piko laikotarpio naudotojų skaičiumi, nes matuojamos skirtingos apimtys. Pirmasis nusako susijusią grupę, antrasis – išgavimo šabloną atitikusį piko srautą.
Vienas bandymas galėjo baigtis atsisakymu, nepilnu atsakymu arba tekstu, kuriame ieškomo samprotavimo nebuvo. Viešai nepateiktas sėkmingų atkūrimų skaičius, taikinių modelių sąrašas ar duomenys, leidžiantys apskaičiuoti sėkmės dalį. Dėl to užklausų apimtis leidžia vertinti koordinavimą ir apkrovą apsaugoms, tačiau iš jos negalima apskaičiuoti, kiek paslėpto turinio pasiekė operatorius.
Priskyrimas taip pat turi siauras ribas. Pagrindinė grupė susieta su žmonėmis, siejamais su „Moonshot AI“; tai neįrodo, kad kiekvieną panašaus šablono užklausą pateikė bendrovė arba kad atkurtas tekstas buvo panaudotas mokant „Kimi“. Modelių distiliavimo siekis reiškia mėginimą neleistinai perkelti vieno modelio išvesties ar samprotavimo naudą kitam modeliui. Ar šis siekis davė apčiuopiamą rezultatą, pagal paskelbtus duomenis nustatyti negalima.
Kur „OpenAI“ uždarė atkūrimo kelią
Uždarytas kelias turėjo konkrečią išankstinę sąlygą: užklausos teikėjas jau turėjo turėti kitam naudotojui priklausantį užšifruotą samprotavimo artefaktą. Jį pakartotinai pateikus buvo galima mėginti gauti įskaitomą turinį. Naujos ribos tarp naudotojų, darbo sričių, organizacijų ir modelių šeimų skirtos tam, kad viename kontekste sukurtas blokas nebūtų priimamas kitame. Ši kontrolė nukreipta į artefakto pakartotinį panaudojimą, kuris ir sudarė aprašyto būdo pagrindą.
Atskirai įdiegtos patikros srautu siunčiamai išvesčiai: jos turi aptikti ir sulaikyti atsakymą, kuris galėtų atskleisti paslėptą samprotavimą. Apribotos ar uždraustos su kampanija susijusios paskyros, sustiprinta registracijos bei infrastruktūros kontrolė ir išplėsta susijusių tinklų stebėsena. Kai aktyvumas vyko per trečiųjų šalių paslaugas, paskyrų identifikavimas ir trikdymas priklausė ir nuo tų paslaugų teikėjų bendradarbiavimo.
Ką incidentas keičia modelių tarpininkams
Tarpininkams ir debesijos diegėjams svarbiausia riba yra artefakto kilmė bei jo panaudojimo vieta. Užšifruotas blokas gali atrodyti kaip techninis pokalbio tęsinys, nors kitoje paskyroje, darbo srityje ar modelyje jis tampa bandymo įvestimi. Iš paskelbtos atakos grandinės kyla trumpas kontrolinis sąrašas sistemoms, kurios tokius blokus priima, saugo arba persiunčia:
- ar užšifruotas samprotavimo blokas susietas su jį sukūrusiu naudotoju, sesija ir modeliu;
- ar pasikartojantys išgavimo šablonai atpažįstami per susijusias paskyras ir paslaugas;
- ar srautu siunčiamas atsakymas gali būti sulaikytas prieš atskleidžiant paslėptą turinį;
- ar partnerių valdomuose diegimuose galioja tokios pačios perėjimo tarp kontekstų ribos.
Šie klausimai seka iš konkretaus atkūrimo kelio, o ne iš prielaidos, kad visi diegimai veikia vienodai. Tolesnis darbas apima tų pačių apsaugų perkėlimą į partnerių valdomas aplinkas ir priemones, kurios atpažintų atakas per įrankių išvestį. Kol tokios ribos nuosekliai veiks visose sąveikos grandyse, nešiojami ar pakartotinai pateikiami samprotavimo artefaktai liks svarbiu saugumo tašku.
Taip pat skaitykite:
Susiję straipsniai


„Meta“ uždarė 3,64 mln. puslapių dar prieš jiems tampant apgavikais

„Flow Engineering“ gavo 50 mln. dolerių: DI agentai žengia iš kodo į CAD

Kalifornija pareikalavo „OpenAI“ atsakymų dėl DI kibernetinių incidentų

Pomodoro ar laiko blokai: greitesnis darbas gali padauginti klaidų

JAV FTC tiria OpenAI ir Anthropic: teks aiškinti DI agentų žalą
Prenumeruokite mūsų naujienlaiškį
Gaukite naujausias Web3, DI ir kriptovaliutų naujienas tiesiai į savo el. pašto dėžutę.