Prompt injection te agjentët AI: lejet e kufizuara vlejnë më shumë se filtri

|Autori: Ekipi editorial i QUASA|5 min lexim| 1
Prompt injection te agjentët AI: lejet e kufizuara vlejnë më shumë se filtri

Agjentët AI mbrohen nga prompt injection duke e trajtuar përmbajtjen e jashtme si të dhënë, duke u dhënë mjeteve vetëm lejet e nevojshme dhe duke kontrolluar thirrjet para ekzekutimit. Filtri mund të dallojë udhëzime të dyshimta, por kufiri i lejeve përcakton çfarë mund të bëjë agjenti nëse një udhëzim i tillë kalon filtrin.

Shpjegimi i OpenAI e përshkruan prompt injection si një përpjekje të palës së tretë për të futur udhëzime në kontekst dhe për ta shtyrë modelin të bëjë diçka që përdoruesi nuk e kërkoi. Për zhvilluesin, kjo do të thotë të mbajë të ndarë atë që agjenti lexon në web, RAG ose përgjigje mjetesh nga autoriteti për të dërguar, ndryshuar apo fshirë diçka.

Mbaje përmbajtjen e jashtme në rolin e të dhënës

Kërkesa e përdoruesit dhe rregullat e aplikacionit duhet të kenë një prejardhje të dallueshme nga faqet, dokumentet dhe përgjigjet e mjeteve që agjenti merr gjatë punës. Shëno burimin e fragmentit të rikthyer dhe paraqite si material për analizë. Një fjali brenda atij fragmenti mund të citohet ose të përmblidhet, por nuk duhet të ndryshojë detyrën dhe lejet.

Një shembull i kushtëzuar: përdoruesi kërkon përmbledhjen e një faqeje, ndërsa faqja përmban kërkesën që agjenti të dërgojë edhe një email. Aplikacioni mund t’ia japë modelit tekstin për përmbledhje pa i dhënë njëkohësisht të drejtën e dërgimit. Kështu, edhe nëse modeli e merr fjalinë si udhëzim, kërkesa për veprim ndesh një kontroll të veçantë.

I njëjti dallim vlen për memorien. Përpara ruajtjes së një përmbledhjeje ose preference për një seancë të ardhshme, kontrollo kujt i përket përmbajtja, nga erdhi dhe për sa kohë duhet të mbahet. Një urdhër i gjetur në faqe nuk duhet të ruhet si preferencë e përdoruesit; përndryshe, ndikimi i tij mund të vazhdojë edhe pasi faqja të mos jetë më në kontekst.

Autorizo mjetin dhe parametrat jashtë modelit

Agjenti mund të propozojë një veprim, por shërbimi që zotëron mjetin duhet të vendosë nëse ai lejohet. Udhëzuesi i OWASP për agjentët AI rekomandon leje minimale sipas mjetit dhe burimit, verifikim të pavarur para ekzekutimit dhe miratim të lidhur me parametrat për veprime me ndikim të lartë. Ky kontroll kufizon pasojën e një thirrjeje të gabuar edhe kur modeli nuk e ka njohur sulmin.

Ndaje leximin nga shkrimi. Një agjent që përmbledh dokumente mund të kërkojë dhe të lexojë vetëm në koleksionet që përdoruesi ka të drejtë të hapë, pa marrë leje për të fshirë skedarë ose për të dërguar mesazhe. Kufiri duhet të zbatohet edhe brenda mjetit: leja për një dosje nuk jep akses në dosjet e përdoruesve të tjerë.

Para thirrjes, shërbimi i ekzekutimit kontrollon përdoruesin, sesionin, operacionin, objektin dhe parametrat e normalizuar kundrejt politikës së aplikacionit. Për dërgimin e emailit, kjo përfshin marrësin dhe bashkëngjitjet; për kërkimin në dokumente, koleksionin e lejuar. Refuzo parametrat e panjohur dhe vlerat jashtë fushës së autorizuar, edhe kur modeli jep një shpjegim bindës për veprimin.

Lidhe miratimin me veprimin që do të kryhet

Dërgimi i një mesazhi, fshirja e një skedari dhe ndryshimi i lejeve kanë pasoja të ndryshme nga leximi. Për këto veprime, paraqiti përdoruesit mjetin, objektin, marrësin dhe përmbajtjen ose parametrat përkatës përpara ekzekutimit. Një përgjigje e përgjithshme si “vazhdo” nuk duhet të shërbejë si miratim për çdo veprim që agjenti mund të propozojë më pas.

Ruaje miratimin për veprimin e saktë dhe verifikoje përsëri kur mjeti thirret. Nëse ndryshon marrësi, objekti ose përmbajtja pas paraqitjes së veprimit, kërko një vendim të ri. Regjistro veçmas çfarë propozoi agjenti, çfarë lejoi kontrolli dhe çfarë u ekzekutua; kështu mund të dallosh një propozim të bllokuar nga një veprim i kryer.

Testo edhe veprimin, jo vetëm përgjigjen

Provat para prodhimit duhet të vendosin udhëzime të padëmshme testimi në të njëjtat vende ku agjenti merr përmbajtje të jashtme: faqe web-i, fragmente RAG, përgjigje mjetesh dhe hyrje që mund të ruhen në memorie. Përdor destinacione prove dhe të dhëna pa ndjeshmëri. Në shembullin e përmbledhjes së faqes, kontrollo që agjenti të japë përmbledhjen dhe që mjeti i emailit të mos thirret.

Një studim kërkimor për agjentë me RAG përshkruan 847 raste sulmi dhe vlerëson së bashku filtrimin e përmbajtjes, rregullat hierarkike të udhëzimeve dhe verifikimin e përgjigjes. Rezultati i raportuar i përket kësaj mbrojtjeje të kombinuar; studimi nuk mat veçmas efektin e kufizimit të lejeve të mjeteve. Prandaj, në provat e aplikacionit tënd, mat edhe vendimet e shërbimit që ekzekuton mjetet.

Shto raste ku modeli propozon një mjet të palejuar, një marrës të ndryshuar ose një dokument jashtë fushës së përdoruesit. Krahaso përgjigjen përfundimtare me regjistrin e thirrjeve dhe të vendimeve. Një përgjigje që duket e rregullt nuk mjafton nëse ndërkohë është dërguar një mesazh ose është lexuar një burim i paautorizuar.

Lista e kontrollit para prodhimit

  • Shëno prejardhjen dhe kufirin e aksesit për çdo burim që hyn në kontekst ose në memorie.
  • Jep vetëm mjetet e nevojshme për detyrën dhe kufizo veçmas leximin, shkrimin dhe burimet e aksesueshme.
  • Valido përdoruesin, sesionin, operacionin dhe parametrat në shërbimin që ekzekuton çdo thirrje mjeti.
  • Kërko miratim për veprimet me pasoja dhe lidhe atë me parametrat që përdoruesi pa.
  • Regjistro propozimin, vendimin e autorizimit dhe rezultatin, pa ruajtur të panevojshme të dhëna të ndjeshme.
  • Përsërit provat pas ndryshimeve në model, mjete, politikën e lejeve, kërkimin e dokumenteve ose memorien.

Për rikuperim, përcakto si të çaktivizohet menjëherë mjeti i prekur, si të hiqet përmbajtja e dyshimtë nga memoria dhe si të gjenden veprimet e kryera gjatë sesionit. Për veprime të kthyeshme, përgatit edhe mënyrën e zhbërjes. Këto hapa kanë vlerë vetëm nëse regjistri ruan dallimin mes asaj që agjenti kërkoi dhe asaj që sistemi lejoi të ndodhte.

Ndaj:

Abonohuni në buletinin tonë

Merrni lajmet më të fundit për Web3, AI dhe kripto direkt në kutinë tuaj postare.

0