Tekoälyagentin muistia voi väärentää – neljä koodityökalua taipui

|Kirjoittaja: QUASAn toimitus|4 min lukuaika
Tekoälyagentin muistia voi väärentää – neljä koodityökalua taipui

Darktracen 24. syyskuuta 2026 julkaisema tutkimus osoitti, että paikallista keskusteluhistoriaa pystyi väärentämään neljässä koodausagentissa: Anthropicin Claude Codessa, OpenAI:n Codexissa, AWS:n Kiro-CLI:ssä ja avoimen lähdekoodin Pi:ssä. Kaikki testatut työkalut hyväksyivät sepitetyn historian jatketun istunnon osaksi, mutta mallit reagoivat siitä seuranneisiin pyyntöihin eri tavoin. Kokeet tehtiin eristetyssä tutkimusympäristössä.

Hyökkäys alkaa ennen agentin seuraavaa vastausta. Ulkopuolisen on ensin saatava mahdollisuus muuttaa paikallista istuntotiedostoa tai sen taustalla olevaa tietokantaa. Kun agentti jatkaa istuntoa, väärennetty keskustelu voi näyttää siltä, että käyttäjä on jo hyväksynyt tietoturvatestin ja agentti on aloittanut sen. Vaarallinen päätös syntyy, jos malli käyttää tätä tarinaa perusteena oikeille työkalukutsuille.

Väärennetty istunto muuttaa aiemman keskustelun luvaksi

Koodausagentti säilyttää keskustelun, jotta työ voi jatkua myöhemmin. Tallenne voi sisältää käyttäjän viestejä, mallin vastauksia sekä kuvauksia työkalukutsuista ja niiden tuloksista. Nämä merkinnät muodostavat agentille näkymän siihen, mitä on muka jo tehty. Jos tallennettua mallivastausta ei varmenneta, paikallinen kirjoitusoikeus riittää antamaan olemattomalle vastaukselle uskottavan paikan historiassa.

Kiro-CLI:n käyttämässä paikallisessa SQLite-tietokannassa tutkijat korvasivat yhden aiemman vastauksen sisällön tietokantapäivityksellä. Kun istuntoa jatkettiin, agentti reagoi muutettuun vastaukseen kuin se olisi osa oikeaa keskustelua. Koska tallennetta ei varmennettu, jälkikäteen syötetty teksti sai saman aseman kuin mallin aiempi vastaus.

Hexonin tekninen analyysi kuvaa laajempaa koetta, jossa istuntoon lisättiin 78 sepitettyä keskusteluvuoroa aiemmasta tiedustelusta, hyväksynnästä ja tunkeutumistoimista. Pitkä ketju antoi seuraavalle pyynnölle näennäisen jatkumon: agentille toiminta näytti jo käynnissä olevan, luvallisen testin seuraavalta vaiheelta. Historiassa oleva väite hyväksynnästä ei silti kerro, kuka luvan antoi, mihin kohteeseen se koski tai onko se edelleen voimassa.

Tutkijoiden kuvaamassa mahdollisessa hyökkäysketjussa kehittäjä asentaa haitallisen ohjelmistopaketin, esimerkiksi agentin käyttämän laajennuksen. Paketti voisi kirjoittaa sepitetyn historian paikalliseen tallenteeseen ja käynnistää prosessin, joka pyytää agenttia jatkamaan muka luvallista testiä. Pakettiasennus oli uhkamallin esimerkki, ei osoitus siitä, että kokeissa olisi ensin murtauduttu kehittäjän koneelle. Ilman kirjoituspääsyä istuntoon juuri tämä ketju ei käynnisty.

Neljä työkalua hyväksyi historian, seuraukset erosivat

Forkastin erittelyn mukaan Kiro-CLI:n ja Claude Opus 4.6:n sekä Sonnet 4.5:n yhdistelmä johti testiympäristön koko Active Directory -toimialueen haltuunottoon; Claude Code ja Sonnet 5 päätyivät samaan tulokseen. Ratkaisevaa oli sekä agentin hyväksymä väärennetty konteksti että sen käytettävissä ollut työkalujoukko. Tulosta ei voi siirtää suoraan muihin malliversioihin, työkalujen asetuksiin tai todellisiin yritysverkkoihin.

Claude Coden Opus 5 -kokeessa mallin turvarajat estivät vastaamisen. Codexin ja GPT 5.6 Solin yhdistelmä puolestaan saatiin lähettämään arkaluonteista tietoa sähköpostitse, mutta yritykset saada Codex murtautumaan laboratorioverkkoon pysähtyivät GPT 5.6 Lunan, Terran ja Solin turvarajoihin. Pi:ssä historian väärentäminen onnistui, mutta tutkimus ei esitä sille vastaavaa eriteltyä toiminnallista seurausta. Historian hyväksyminen ja hyökkääjän tavoitteen toteutuminen ovat siksi eri havaintoja.

Väärennös muutti mallin arviota tehtävän asiayhteydestä. Turvallisuustestiin kuuluva verkon kartoitus voi muistuttaa luvatonta tunkeutumista, joten väite aiemmasta hyväksynnästä vaikuttaa siihen, kumpana agentti tulkitsee pyynnön. Kun agentti saa käyttää komentotulkkia, tiedostoja ja verkkoyhteyksiä, väärä tulkinta voi johtaa oikeisiin toimiin. Mallin kieltäytyminen toisessa kokoonpanossa ei poista tallenteen väärentämismahdollisuutta.

Ennakkopääsy, tallennettu tila ja työkaluvallan rajat

Hyökkääjän tarvitsema ensimmäinen oikeus on kyky kirjoittaa istuntoon; se voi syntyä haitallisesta paketista tai muusta koneella toimivasta prosessista. Se ei vielä anna hyökkääjälle agentin tunnuksia tai verkkopääsyä. Vaikutus syntyy, jos muokattu istunto ladataan ja agentti käyttää omia laillisia oikeuksiaan sen ohjaamana. Siksi uhka kasvaa erityisesti silloin, kun kehittäjän agentilla on samanaikaisesti pääsy koodiin, tunnuksiin ja sisäverkkoon.

Valvottu laboratoriokoe osoittaa mekanismin ja tiettyjen yhdistelmien tuloksen. Se ei kerro, kuinka usein hyökkääjät pääsevät muuttamaan istuntoja käytännössä tai miten eri organisaatioiden asetukset rajoittaisivat seurauksia. Olennaista on erottaa toisistaan muokattava tallenne, mallin tekemä tulkinta ja työkalu, joka pystyy toteuttamaan tulkinnan koneella tai verkossa.

Torjunta jakautuu tallenteen, valtuutuksen ja toiminnan suojaukseen

Työkalutoimittajan tehtävä on varmistaa tallennettujen viestien alkuperä. Tutkijoiden ehdotus on allekirjoittaa mallin vastaukset kryptografisesti ja tarkistaa ne palvelimella jokaisella myöhemmällä käyttökerralla. Näin jälkikäteen muutettu mallivastaus erottuisi aidosta. Allekirjoitus ei yksin todista käyttäjän väitettyä hyväksyntää, joten valtuutus on tarkistettava erikseen. Käyttäjä ei myöskään voi yksin lisätä palvelinpuolista tarkistusta agenttipalveluun.

Organisaatio voi sillä välin rajata sitä, mitkä prosessit saavat kirjoittaa agentin istuntotietoihin. Tallenteen erottaminen projektitiedostoista, erilliset käyttöoikeudet ja eristetyt ajoympäristöt pienentävät tilaisuutta muuttaa historiaa huomaamatta. Pelkät tiedoston oikeudet eivät kuitenkaan auta, jos haitallinen prosessi toimii samalla tunnuksella ja säilyttää kirjoitusluvan. Arkaluonteisissa työnkuluissa myös tallenteen muutoshistoria ja muutoksen tekijä kannattaa pystyä todentamaan.

Toinen raja koskee agentin työkaluja. Koodin tarkasteluun tarkoitettu istunto ei tarvitse automaattisesti tuotannon tunnuksia, rajoittamatonta verkkoyhteyttä ja mahdollisuutta lähettää tietoja ulos. Vähimmät oikeudet, rajatut kohteet ja erillinen vahvistus merkittäville toimille rajoittavat vahinkoa, vaikka väärä historia pääsisi mallille. Vanhaan keskusteluun kirjattu hyväksyntä ei voi korvata ajantasaista päätöstä siitä, kuka saa tehdä mitä ja missä.

Valvonnan on yhdistettävä istunnon muutokset sitä seuranneisiin työkalukutsuihin ja verkkotoimiin. Jos tavallinen koodaustehtävä muuttuu verkon kartoittamiseksi tai tietojen lähettämiseksi ulkopuolelle, poikkeama näkyy toiminnassa riippumatta tallenteen kertomasta luvasta. Silloin haitallinen toiminta voidaan havaita myös tilanteessa, jossa väärennetty historia on jo päässyt agentin käyttöön.

Jaa:

Tilaa uutiskirjeemme

Saat tuoreimmat Web3-, tekoäly- ja kryptouutiset suoraan sähköpostiisi.

0