16.000 forsøg skulle blotlægge OpenAI’s skjulte ræsonnement

|Forfatter: QUASA's redaktion|5 min. læsning| 2
16.000 forsøg skulle blotlægge OpenAI’s skjulte ræsonnement

OpenAI beskrev 30. september 2026 en standset kampagne, der forsøgte at få modellernes skjulte ræsonnement frem i synlige svar. Ifølge The Hacker News’ gennemgang toppede aktiviteten 24.-25. juli med 16.000 forespørgsler i et relevant udtræksmønster fra over 4.000 brugere, mens en bredere klynge omfattede over 15.000 brugere og blev standset 28. juli.

I OpenAI’s redegørelse knyttes en central del af aktiviteten til personer med forbindelse til Moonshot AI, der udvikler Kimi; selskabet skriver samtidig: “The operators did not break our encryption”. Forsøgene gik ud på at manipulere samtaler med modellerne, så beskyttet indhold kunne dukke op i et svar. Tallene angiver forsøg, og der er ikke oplyst en samlet succesrate.

Moonshot-forbindelsen gælder en central del af aktiviteten

Attributionen omfatter en kerne af den undersøgte aktivitet, ikke nødvendigvis alle de brugere, der sendte forespørgsler med et lignende mønster. Den forskel er væsentlig, fordi en forespørgsel fortæller noget om den anvendte metode, men ikke i sig selv identificerer operatøren. Den offentliggjorte vurdering ledsages heller ikke af de tekniske spor, der ville gøre det muligt for udenforstående at efterprøve forbindelsen til Moonshot AI.

De mange brugere og forespørgsler beskriver desuden forskellige størrelser. Spidsbelastningen er et antal anmodninger i et bestemt udtræksmønster, mens den bredere klynge bygger på beslægtede mønstre, som blev fundet under den videre undersøgelse. Tallene kan derfor hverken lægges sammen til et antal vellykkede udtræk eller bruges til at sige, hvor meget skjult ræsonnement operatørerne fik at se.

Motivet, som aktiviteten passer med, kaldes adversarial modeldestillation: systematisk og uautoriseret brug af én models svar eller ræsonnement til at træne, efterligne eller forbedre en anden. Et almindeligt slutsvar viser kun, hvad modellen vælger at give brugeren. Ræsonnementssporet kan også rumme mellemtrin og oplysninger, som udelades af slutsvaret, og er derfor et mere interessant mål for nogen, der vil efterligne modellens måde at løse opgaver på.

Sådan kunne en krypteret blok blive til synlig tekst

Angrebskæden begyndte med en krypteret blok med ræsonnement fra én samtale. En operatør kopierede blokken ind i en anden modelinteraktion og bad modellen om at afkode eller gengive indholdet. Hvis modellen efterkom anmodningen, kom lækagen fra dens synlige svar: Den krypterede blok blev brugt som input til et system, der kunne behandle den, og det skjulte indhold blev derefter skrevet ud til den, der havde sendt forespørgslen.

En undersøgelse af krypterede ræsonnementsspor beskriver en beslægtet svaghed i API’er fra OpenAI, Anthropic og Google: Blokkene kunne flyttes mellem samtaler og modeller inden for samme udbyders system, og en mindre beskyttet model kunne i forskernes forsøg gengive indholdet i klartekst. Forsøgene viser en teknisk mulig vej; de fastslår ikke, at operatørerne i den aktuelle kampagne brugte forskernes præcise opsætning.

Blokkene sendes i nogle systemer til klienten og tilbage igen med senere anmodninger, så en samtale kan fortsætte uden at udbyderen opbevarer hele ræsonnementssporet på samme måde som synlig samtaletekst. Det gør blokken flytbar. Den, der allerede råder over den, kan forsøge at indsætte den et andet sted, hvor modellen behandler den som en del af samtalens tilstand.

Det er forskellen mellem at bryde krypteringen og at misbruge adgangen til et system, der legitimt kan behandle krypteret indhold. Et brud på krypteringen ville gøre blokken læsbar uden modellens hjælp. Her var risikoen, at en ny interaktion fik modellen til at afsløre indholdet gennem den normale svarfunktion. Derfor kan en blok være ulæselig for den, der holder den, og stadig være følsom, hvis den kan genafspilles i en anden samtale.

Den lukkede vej og kontrollen med svar

En konkret lukning gælder genafspilning af en anden brugers krypterede ræsonnement. Vejen forudsatte, at en person allerede var kommet i besiddelse af blokken; hændelsen indebærer ikke, at operatørerne fik direkte adgang til lagrede brugersamtaler eller trængte ind i en database. Den tekniske grænse går dermed både ved, hvem der må bruge blokken, og ved hvilken samtale og model der må behandle den.

Beskyttelsen er også styrket på tværs af brugere, arbejdsområder, organisationer og modelfamilier. Den del retter sig mod, at et ræsonnement fra én sammenhæng kunne få betydning i en anden. Hvis en blok kun kan bruges i den sammenhæng, den hører til, bliver det vanskeligere at gøre den til input for en modelinteraktion, som den oprindelige bruger aldrig tilsigtede.

En anden kontrol retter sig mod sidste led i kæden: løbende svar, der kan indeholde beskyttet ræsonnement, bliver undersøgt og kan tilbageholdes, før teksten når frem til modtageren. Mistænkelige konti blev desuden begrænset eller lukket, og aktivitet gennem eksterne tjenester blev håndteret sammen med deres udbydere. Det er beskrevne modforanstaltninger, mens deres samlede virkning endnu ikke er målt offentligt.

Hvad sagen betyder for sikkerheden

Den dokumenterede sikkerhedsbetydning ligger i samspillet mellem et flytbart, krypteret artefakt og modellens synlige output. Krypteringen kan beskytte indholdet, når blokken ligger alene, men adgangsreglerne for genbrug og kontrollen med svaret afgør, om indholdet alligevel kan komme frem. Det forklarer, hvorfor en lukket genafspilningsvej er en konkret ændring, selv om selve krypteringen ikke blev brudt.

Risikoen ved modeldestillation er mere vidtrækkende end den dokumenterede effekt af denne kampagne. Et udtrukket ræsonnement kunne hjælpe med at efterligne en stærk model uden dens begrænsninger i de synlige svar. Hvor meget indhold kampagnen faktisk frembragte, og om noget af det blev brugt til at træne en anden model, fremgår ikke af de offentliggjorte oplysninger.

Det næste arbejde gælder blandt andet installationer hos partnere og angreb, hvor indhold fra værktøjer påvirker modellens output. For brugere og udviklere af sådanne systemer er den konkrete lære af hændelsen, at beskyttelsen af skjult ræsonnement også afhænger af, hvor en krypteret blok kan genbruges, og hvad modellen får lov til at vise bagefter.

Læs også:

Del:

Tilmeld dig vores nyhedsbrev

Få de seneste nyheder om Web3, AI og krypto direkte i din indbakke.

0