
Падмененая гісторыя чата ператварае ШІ-агента ў нападніка

24 верасня 2026 года ў тэхнічным разборы Darktrace даследчык Эрык Розон апісаў лабараторны дослед: пасля падмены 78 папярэдніх рэплік ШІ-агент выканаў запыт на сеткавую атаку, які раней адхіляў. Даследчыкі змянілі лакальна захаваную гісторыю так, каб агент лічыў сябе ўдзельнікам дазволенага пентэсту. У ізаляванай сетцы такі выдуманы дазвол у некаторых канфігурацыях прывёў да атакуючых дзеянняў.
Падмененую гісторыю прынялі Claude Code, Codex, Kiro-CLI і Pi, але здольнасць выканаць небяспечную задачу залежала ад мадэлі. Выпрабаванне выявіла слабасць агентных абалонак: пры аднаўленні сеанса яны перадаюць мадэлі лакальныя запісы як папярэдні дыялог без праверкі, ці сапраўды захаваны адказ належаў ёй. Апісаны ўзлом адбыўся ў кантраляваным асяроддзі, а не ў сетцы рэальнай арганізацыі.
Ад пакета да выдуманага дазволу
У сцэнары атакі распрацоўшчык усталёўвае пакет з чужым кодам — напрыклад, падстаўны сервер MCP, які падключаюць да агентнага інструмента. Пасля запуску код можа атрымаць доступ да лакальнай гісторыі і дадаць туды сфабрыкаваныя паведамленні: карыстальнік нібыта дазволіў праверку бяспекі, а агент нібыта ўжо пагадзіўся яе весці. Наступны запыт трапляе ў кантэкст, дзе небяспечная каманда выглядае працягам раней пачатай працы.
Даследчыкі прадэманстравалі падмену і наступныя дзеянні агентаў, а ўсталяванне шкоднага пакета апісалі як магчымы шлях зламысніка да гісторыі. Пакет з такімі правамі можа змяніць сховішча, але сам факт яго ўсталявання яшчэ не азначае, што кожная мадэль пачне атаку. Для поўнага ланцужка патрэбныя запіс у гісторыю, аднаўленне сеанса, прыдатныя правы агента і заданне, якое ён пагодзіцца выканаць.
Просты дослед з Kiro-CLI паказвае месца збою даверу. Даследчыкі замянілі поле захаванага адказу ў базе SQLite; пры працягненні размовы абалонка выкарыстала зменены запіс як адказ мадэлі. Падробка можа ахопліваць і рэплікі, і запісы пра выклікі інструментаў, ствараючы паслядоўнасць нібыта ўжо выкананых крокаў. Агент ацэньвае новую каманду праз гэтую гісторыю, хоць паходжанне яе запісаў не праверана.
Якія вынікі атрымалі з агентнымі CLI
Прыняць чужы тэкст за ўласнае мінулае і выканаць сеткавы напад — розныя вынікі. Як апісвае агляд Forkast, з Kiro-CLI і спалучэннем Claude Opus 4.6 ды Claude Sonnet 4.5 агент захапіў тэставы дамен Active Directory, з Claude Code і Sonnet 5 даследчыкі атрымалі аналагічны вынік, а Codex з GPT 5.6 Sol адправіў адчувальныя даныя праз электронную пошту. У асобных спробах прымусіць агентаў да сеткавай атакі ахоўныя абмежаванні іншых правераных канфігурацый спрацавалі.
Таму назва інструмента ў гэтым сюжэце паказвае, дзе прынялі падробленую гісторыю, а мадэль і ўмовы доследу — якое дзеянне ўдалося атрымаць. Вынікі атрыманы даследчыкамі ў іх асяроддзі; яны не паказваюць, як часта такая атака ўдавалася б на працоўных станцыях карыстальнікаў. Практычная рызыка залежыць таксама ад таго, да якіх файлаў, уліковых даных і сеткавых вузлоў мае доступ агент пасля аднаўлення сеанса.
Якія межы могуць перарваць ланцужок
Камандзе, якая запускае агентны CLI на працоўнай станцыі, трэба разглядаць гісторыю сеанса як файл, ад якога залежаць наступныя рашэнні агента. Кантроль пачынаецца з пытання, хто можа змяніць гэты файл, і працягваецца праверкай таго, што агент зможа зрабіць пасля падмены. Наступныя меры вынікаюць з паказанага механізму; яны скарачаюць доступ і наступствы, але не замяняюць праверку сапраўднасці адказаў у самой абалонцы.
- Правы файлаў. Варта вызначыць месцы захоўвання гісторыі і пакінуць запіс толькі тым працэсам, якім ён патрэбны. Звычайнае абмежаванне правоў слабее, калі пакет працуе ад імя таго ж карыстальніка, што і агент: тады абодва працэсы могуць атрымаць аднолькавы доступ.
- Ізаляцыя. Невядомы пакет або сервер MCP варта запускаць асобна ад асноўнага сеанса і сховішча яго гісторыі. Асобнае асяроддзе мае сэнс, калі ў ім таксама няма службовых ключоў і доступу да ўнутраных сістэм; інакш падменены кантэкст усё яшчэ можа ператварыцца ў дзеянне з рэальнымі правамі.
- Праверка запісаў. Даследчыкі прапануюць крыптаграфічна падпісваць адказы мадэлі і правяраць подпіс пры наступных зваротах. Такі механізм павінен укараніць пастаўшчык мадэлі або абалонкі: лакальны адміністратар можа заўважыць змену файла, але не можа заднім чыслом пацвердзіць, што спрэчны адказ сапраўды стварыла мадэль.
- Сеткавыя межы. Агенту патрэбныя толькі злучэнні, неабходныя для яго задачы. Абмежаванне доступу да ўнутраных вузлоў і вонкавых адрасоў памяншае магчымасці сканавання, перамяшчэння паміж сістэмамі і адпраўкі даных, калі гісторыю ўсё ж падмянілі.
- Журналы. Змены гісторыі, каманды агента і яго сеткавыя злучэнні варта фіксаваць па-за дасяжнасцю самога агента. Тады нечаканы пераход ад працы з кодам да разведкі сеткі можна ўбачыць па дзеяннях, а не толькі па тэксце размовы, які зламыснік здольны перапісаць.
Што будзе даследаваць Signal Labs
24 верасня 2026 года Darktrace ў паведамленні пра запуск Signal Labs назвала падмену гісторыі адным з першых вынікаў новай даследчай ініцыятывы; кіраўнік кірунку ШІ Цім Базалгет сказаў: «Permissions and static guardrails describe intent, but they don't describe behavior.» Ініцыятыва будзе вывучаць адхіленне агентаў ад задачы, абыход абмежаванняў і іншыя атакі ў ізаляваных умовах.
Для карыстальніка агентнага CLI наступства ўжо практычнае: нават калі бягучы запыт выглядае бяспечна, рашэнне агента можа абапірацца на падменены ранейшы дыялог. Пакуль праверка сапраўднасці гісторыі залежыць ад пастаўшчыка, вырашальныя межы на працоўнай станцыі — доступ да сховішча, паўнамоцтвы працэсу і магчымасць бачыць каманды, якія ён сапраўды запускае.
Падобныя артыкулы


Passkey ці код з аўтэнтыфікатара: фішынг вырашае выбар

Ліст узломвае Zimbra без кліку — патч не выдаляе ўжо ўсталяваны бэкдор

GitHub Copilot атрымаў чатыры мадэлі і лакальную пясочніцу

Microsoft: час ад выяўлення ўразлівасці да атакі скараціўся да сутак

Claude ці Gemini для кода: 57,57% супраць 32,03% не паказваюць кошт
Падпішыцеся на нашу рассылку
Атрымлівайце свежыя навіны пра Web3, ШІ і крыптавалюты проста на пошту.