
OpenAI zastavilo 16 000 pokusů o vytažení skrytého uvažování modelů

OpenAI v bezpečnostním rozboru z 30. září 2026 uvedlo, že narušilo koordinovanou kampaň proti chráněnému uvažování svých modelů, jejíž vrchol zahrnoval 16 000 požadavků s extrakčním vzorcem od více než 4 000 uživatelů. Vrchol nastal 24. a 25. července a související aktivitu firma zastavila do 28. července. Zveřejněný počet vyjadřuje pokusy; kolik z nich vedlo k získání skrytého obsahu, známo není.
Jádro kampaně OpenAI připisuje lidem spojeným s Moonshot AI, vývojářem modelu Kimi, ale všechny pozorované operátory jedné skupině nepřiřadilo. Podle zprávy Tom’s Hardware z 1. října 2026 nejsou veřejně známy úspěšnost pokusů, konkrétní cílové modely ani počet uživatelů spojených s Moonshot AI. Operátoři neprolomili šifrování, nepronikli do databáze a nezískali přímý přístup k uloženým uživatelským konverzacím. Snažili se přimět modely, aby jim zobrazily obsah, který běžná odpověď neobsahuje.
Červencový vrchol a hranice přisouzení
První zachycené požadavky se objevily 1. července v malém objemu. Vyšetřování pak zachytilo související vzorce zadání v širší skupině více než 15 000 uživatelů. The Next Web popisuje posloupnost od slabého začátku přes vrchol 24. a 25. července až po zásah dokončený do 28. července. Širší skupina zahrnuje uživatele s podobnou aktivitou, zatímco údaj o více než 4 000 uživatelích se vztahuje k nejvýraznějšímu dvoudennímu vrcholu.
Tato dvě měřítka proto nelze zaměňovat za počet lidí, kteří skutečně získali skrytý obsah. Účet navíc nemusí odpovídat jednomu člověku a společný vzorec požadavků sám neurčuje, kdo všechny účty řídil. Přisouzení lidem spojeným s Moonshot AI se týká jádra aktivity; další zachycené operátory OpenAI s jistotou k téže skupině nepřipojilo. Rozsah zjištěných požadavků je tedy popsán přesněji než rozsah případného získání chráněného uvažování.
Co chtěli získat a jak fungoval přenos bloku
Chráněné uvažování je interní záznam postupu modelu při řešení úlohy. Od výsledné odpovědi je oddělené, protože může obsahovat informace, které se uživateli nemají zobrazit. Pro někoho, kdo se snaží napodobit schopnosti cizího modelu, by právě takový postup mohl být cennější než samotná hotová odpověď. Popsané chování odpovídá nepovolené destilaci: systematickému využití výstupů nebo uvažování jednoho modelu pro trénování, reprodukci či zlepšení jiného modelu bez souhlasu poskytovatele.
Jeden z pozorovaných postupů začínal zašifrovaným blokem uvažování z jedné konverzace. Operátor ho vložil do jiné konverzace a požádal model, aby skrytý obsah dešifroval a přepsal čitelně. Pokus mířil na to, jak model zpracuje znovu předložený blok a co z něj vypíše, nikoli na získání šifrovacího klíče. Problém tak může vzniknout při opětovném použití dat, přestože vlastní šifra zůstává neprolomená.
Nezávislí bezpečnostní výzkumníci popsali také související slabiny při přenosu mezi modely a při zkracování konverzací. OpenAI jejich zjištění prověřilo a příslušné cesty útoku označilo za reálné. Jde o širší třídu způsobů, jak může chráněný obsah proniknout do viditelného výstupu; zjištění výzkumníků samo neurčuje výsledek jednotlivých požadavků z červencové kampaně. Společným rizikem je přenos artefaktu s interním obsahem do kontextu, v němž ho model může zpracovat jinak, než bylo zamýšleno.
Proč nejde o krádež databáze chatů
V popsaném případě operátoři posílali požadavky modelům a snažili se z odpovědí dostat chráněné uvažování. Přístup k uloženým uživatelským rozhovorům by vyžadoval jinou cestu: získání samotných záznamů nebo oprávnění k úložišti. Popsaný postup takový průnik nezahrnoval. Rozdíl ukazuje, jaká data byla cílem: interní postup při interakci má jiný původ a účel než historie chatů uložená ve službě.
Ani zmínka o zašifrovaném bloku neznamená, že někdo rozluštil šifru. Blok lze předat dál jako celek, aniž by jeho držitel přečetl jeho obsah; riziko vzniká, pokud jiná interakce přiměje model obsah reprodukovat. Uzavřena byla cesta, která umožňovala člověku s již získaným blokem uvažování jiného uživatele tento blok znovu použít a obnovit jeho obsah. Toto opatření se týká zneužití přenositelného artefaktu, nikoli opravy kompromitované databáze.
Jak OpenAI kampaň přerušilo a co následuje
OpenAI omezilo nebo zakázalo podvodné účty, zpřísnilo registraci a sledování souvisejících sítí. Zároveň posílilo oddělení chráněného uvažování mezi uživateli, pracovními prostory, organizacemi a rodinami modelů. Přidalo kontroly průběžně odesílaných odpovědí, které mají zachytit a zadržet výstup odhalující interní postup. Zásah tedy spojil práci s účty s technickými kontrolami nad tím, co se může objevit ve výstupu modelu.
Část související aktivity procházela službami dalších poskytovatelů, s nimiž OpenAI spolupracovalo na zastavení zapojených účtů. Informace předalo také přes Frontier Model Forum a příslušné vládní kanály. Spolupráce mezi poskytovateli má v tomto případě konkrétní důvod: související požadavky se objevily i mimo vlastní služby OpenAI a ochrana chráněného uvažování se musí uplatnit všude, kde lze s takovým obsahem pracovat.
Další oznámenou prací je přenést stejné ochrany do nasazení provozovaných partnery a rozšířit kontroly útoků vedených přes výstupy nástrojů. Pro posouzení skutečného dopadu by bylo zásadní znát, kolik pokusů vedlo k viditelnému získání uvažování; tento údaj zveřejněn nebyl. Ochrana před obdobným přehráním zašifrovaného bloku teď závisí také na tom, zda budou nové kontroly fungovat napříč konverzacemi, modely a partnerskými službami.
Související články


Midjourney, nebo Firefly: kvalita obrazu naráží na licenci a workflow

OpenAI Dots pracují bez dozoru, levnější účty si je zatím nevyzkoušejí

Tři AI tarify proti sobě: rozhodují limity, ne jen nejlepší model

Ecomail, nebo MailerLite: české integrace stojí proti levnému startu

Cloudflare R2, nebo Amazon S3: účet mění hlavně odchozí data
Přihlaste se k odběru newsletteru
Nejnovější zprávy ze světa Web3, AI a kryptoměn přímo do vaší schránky.