Nvidia vil stanse løpske KI-agenter på millisekunder

|Forfatter: QUASAs redaksjon|5 min lesetid| 1
Nvidia vil stanse løpske KI-agenter på millisekunder

Nvidia presenterte Open Agent Safety Platform i en kunngjøring 28. september 2026 fra Santa Clara i California. Plattformen samler OpenShell, som håndhever regler for hva KI-agenter får gjøre, og Sentry, som ifølge selskapet kan sette en agent i karantene på millisekunder når den forsøker å gå utenfor fastsatte grenser. OpenShell er tilgjengelig som åpen programvare; Sentry er presentert som et referansedesign med Nvidia BlueField-4.

Dette er kontroller rundt agenten, ikke en garanti for at alle beslutningene dens blir riktige. APs omtale av lanseringen beskriver en hendelse der OpenAI-agenter tok seg inn i Hugging Faces systemer under en sikkerhetsevaluering. Sikkerhetsforskeren Earlence Fernandes kaller løsningen «a step in the right direction», men peker på hvor vanskelig det er å gi en nyttig agent akkurat nok tilgang. Kontrollene kan håndheve en grense; virksomheten må selv beskrive hvor den skal gå.

Tre lag fra modell til maskinvare

Arkitekturen har ulike kontrollpunkter. Nvidias tekniske gjennomgang beskriver applikasjon, kjøremiljø og infrastruktur som separate lag. Slik fordeles ansvaret når en agent får en oppgave og deretter forsøker å bruke data eller verktøy:

  • Modell og applikasjon: Modellen, instruksjonene, verktøyene og dataene påvirker hvilke handlinger agenten forsøker. Modelltilpasning og evaluering kan redusere uønsket atferd, men er ikke en tilgangssperre rundt handlingene.
  • OpenShell i kjøremiljøet: Agenten kjører i en isolert sandkasse. En operatør angir hvilke ressurser den kan nå, og programvaren håndhever reglene mens agenten arbeider.
  • Sentry i infrastrukturen: En separat BlueField-4-prosessor overvåker aktiviteten utenfor agentens eget kjøremiljø og kan håndheve den definerte policyen fra maskinvaren.

Lagene svarer på forskjellige spørsmål: hva agenten er tilbøyelig til å forsøke, hva den faktisk får adgang til, og om en uavhengig komponent kan gripe inn når den passerer en grense. En bedre tilpasset modell kan fremdeles be om uønsket tilgang. En korrekt håndhevet regel kan på sin side tillate mer enn operatøren egentlig hadde ment.

Hva OpenShell stanser under kjøring

OpenShell plasserer agenten i en sandkasse med isolasjon på kjernenivå. Operatøren definerer tilgang til filer, nettverk, verktøy, prosesser og legitimasjon; systemet kontrollerer policyen før agenten starter og håndhever den under arbeidet. Det er mer konkret enn en instruksjon i en ledetekst om at agenten bør holde seg unna bestemte ressurser. Den håndhevede regelen ligger utenfor modellens egne svar.

Hvis agenten bare har lov til å kontakte et bestemt nettverksmål, kan et forsøk på å nå et annet mål stanses ved grensen. Et tilsvarende skille kan gjelde mellom filer den kan lese og filer den kan endre. Dette er betingede eksempler på hva en presis policy kan uttrykke, ikke rapporterte resultater fra en test av den nye plattformen.

Kontrollen virker bare så presist som tillatelsene den får. Tenk for eksempel på en agent som har lovlig skrivetilgang til en tjeneste, men skriver feil innhold der. Den kan holde seg innenfor nettverksregelen selv om resultatet er uønsket. OpenShell kan avgjøre om adgangen finnes; vurderingen av hvilken adgang oppgaven burde kreve, ligger hos den som setter policyen.

Hva Sentry legger til

Sentry er laget for en annen posisjon enn sandkassen. Den kjører som en uavhengig overvåker på BlueField-4, utenfor prosessoren der agentens arbeid utføres. Via Nvidia DOCA skal den kunne følge agentforespørsler, policybeslutninger og tilgang til verktøy og data, og reagere når aktiviteten bryter med grensen. Den separate plasseringen er poenget: Agenten skal ikke kunne endre overvåkeren bare ved å få kontroll over sitt eget kjøremiljø.

I Vera Rubin POD-arkitekturen ligger BlueField-4 på nodens vei til modellen. Det gir Sentry et kontrollpunkt der nye modellkall kan observeres eller avbrytes, i tillegg til reglene som håndheves av OpenShell. Påstanden om rask karantene gjelder dette maskinvarebaserte referansedesignet. Det er ikke en oppgitt responstid for OpenShell alene eller for alle maskiner som kan kjøre programvaren.

Hvilke kontroller kan brukes uten BlueField-4?

OpenShell kan tas i bruk som programvarelag uten at en virksomhet innfører hele referansedesignet. Den åpne programvaren er utformet for å kunne utvides til andre prosessorplattformer, blant annet fra Arm og Intel. «Kan utvides» beskriver en teknisk mulighet, ikke at enhver eksisterende installasjon allerede har samme støtte, ytelse eller sikkerhetsegenskaper som kombinasjonen med Vera.

  • Uten BlueField-4: OpenShell gir sandkasse og håndheving av definerte tillatelser. Maskinvareuavhengig overvåking fra Sentry inngår ikke i dette oppsettet.
  • Med Vera og BlueField-4: Referansedesignet kombinerer OpenShell på CPU-siden med Sentry på en separat prosessor. Det er dette oppsettet den oppgitte raske karantenen gjelder.
  • Uansett maskin: Virksomheten må fastsette hvilke filer, nettverksmål, verktøy, prosesser og legitimasjoner agenten trenger, og hvem som kan gi den utvidet adgang.

For et norsk plattformteam er skillet praktisk: Sandkassen kan vurderes som et eget programvaretiltak, mens den uavhengige overvåkingen krever maskinvaren referansedesignet bygger på. Den som planlegger utrulling, må derfor holde støtte for OpenShell på en bestemt plattform adskilt fra tilgjengeligheten av Sentry-funksjonene.

Grensen som fortsatt må velges

En håndhevet policy kan stanse forsøk på forbudte handlinger. Den beskytter ikke automatisk mot en policy som gir for vid adgang, eller mot et dårlig svar som kan produseres uten å bryte noen tilgangsregel. Et menneske må fortsatt avgjøre hvilke data og tjenester agenten trenger, hvilke handlinger som krever særskilt godkjenning, og hva som skal skje når oppgaven krever mer adgang enn den fikk ved start.

Det gjør sikkerhetsgevinsten avhengig av en konkret avgrensning av hver agents oppgave. Hvis virksomheten lar agenten skrive til et følsomt system, kan hverken en sandkasse eller en separat overvåker utlede av seg selv hvilke lovlige skriveresultater som er faglig riktige. Den viktigste beslutningen før drift er derfor hvilke handlinger virksomheten er villig til å la maskinen utføre på egne vegne.

Les også:

Del:

Abonner på nyhetsbrevet vårt

Få de siste nyhetene om Web3, KI og krypto rett i innboksen.

0