Kunstig intelligens fortsetter å demonstrere at når den unnslipper fra kontrollerte miljøer, kan den forårsake svært reelle problemer. Anthropic har innrømmet at tre av Claude-modellene deres fikk tilgang til systemene til tre virkelige selskaper uten tillatelse. under intern testing av nettsikkerhet. Hendelsen, som kom frem bare dager etter at OpenAI innrømmet en lignende sak, har gjenopplivet debatten om risikoen ved å evaluere autonome agenter uten tilstrekkelige sikkerhetstiltak.
Ifølge en offisiell uttalelse fra selskapet skjedde hendelsen under «capture the flag»-øvelser, som var utformet for å måle modellenes evne til å finne og utvinne fiktiv informasjon i et simulert nettverk. En konfigurasjonsfeil på en ekstern partners vurderingsplattform gjorde at internettforbindelsen var aktiv.Dette tillot modellene, overbevist om at de fortsatt var i testmiljøet, å begynne å samhandle med reell infrastruktur. Anthropic oppdaget feilen etter å ha gjennomgått mer enn 141 000 evalueringsøkter.
Claudes tre angrep

Den mest alvorlige saken det gjelder Claude Opus 4.7, som forvekslet et fiktivt selskap med et ekte selskap som delte samme domenenavnI løpet av fire kjøringer hentet modellen ut legitimasjon fra applikasjoner og infrastruktur, fikk tilgang til en database som inneholdt flere hundre produksjonsposter, og fortsatte angrepet til tross for at den mistenkte at systemet var ekte. Den interne resonnementet viste tvil, men den overbeviste seg selv om at dette målet var en del av testen.
Den andre hendelsen involverte Claude Mythos 5, som opprettet og publiserte en ondsinnet pakke på PyPI, det offisielle Python-arkivetFor å gjøre dette, åpnet modellen en e-postkonto, skaffet seg et midlertidig telefonnummer og forsøkte til og med å skaffe penger til å betale for tjenesten. Pakken var tilgjengelig i omtrent én time og ble lastet ned av 15 reelle systemer, inkludert sikkerhetsskanneren til et stort selskap i sektoren. Ved å kjøre koden skaffet modellen seg påloggingsinformasjon og fikk tilgang til deler av selskapets infrastruktur.
Den tredje episoden involverte en ennå upublisert intern forskningsmodell. Da han ikke klarte å finne sitt fiktive mål, undersøkte han rundt 9.000 adresser tilgjengelig på internett. og kompromitterte et selskaps applikasjon ved hjelp av påloggingsinformasjon som var synlig på en feilsøkingsside og grunnleggende SQL-injeksjonsteknikker. I motsetning til de to andre modellen oppdaget imidlertid denne modellen at infrastrukturen ikke var relatert til øvelsen og stoppet proaktivt den offensive aktiviteten.
Menneskelig feil, ikke en bevisst lekkasje

Antropisk ønsket å gjøre det klart at Modellene unnslapp ikke bevisst testmiljøet; det var et resultat av en konfigurasjonsfeil. noe som gjorde at internettforbindelsen var aktiv. Selskapet hevder at agentene ikke oppdaget komplekse sårbarheter eller forfulgte sine egne mål; de utførte ganske enkelt den tildelte oppgaven uten å fullt ut forstå at de handlet på reell infrastruktur. Modellene benyttet grunnleggende teknikker som svake passord, uautoriserte tilgangspunkter og eksponerte feilsøkingssider.
Selskapet suspenderte alle cybersikkerhetsvurderinger etter å ha oppdaget de mistenkelige loggene og varslet de tre berørte organisasjonene. To av dem hadde ikke identifisert innbruddet tidligereDette demonstrerer hvor vanskelig det er for tradisjonelle deteksjonssystemer å skille mellom et menneskelig angrep og et automatisert, men bevisst angrep. Anthropic har også bedt andre AI-laboratorier om å gjennomgå sine egne miljøer før de tester autonome agenter med offensive evner.
Hendelsen kommer bare 20 dager etter at OpenAI avslørte en lignende sak, der flere av modellene deres klarte å unnslippe et isolert miljø gjennom en ukjent sårbarhet og få tilgang til Hugging Faces produksjonsinfrastruktur. Begge episodene fremhever risikoen ved å teste AI-agenter med offensive evner uten streng teknisk inneslutning. og de har tatt opp behovet for å etablere strengere kontroller.
Reaksjoner og regulering i sikte
Disse hendelsene har skapt bekymring i Washington. President Donald Trump har uttalt at hans administrasjon vurderer å utøve større kontroll over kunstig intelligens.Han presiserte imidlertid at han ønsker å unngå å være for intervensjonistisk for ikke å falle akterut i forhold til Kina. Allerede i begynnelsen av juni instruerte han rådgiverne sine om å utvikle et frivillig rammeverk for cybersikkerhetstesting for den mest avanserte AI-en.
I mellomtiden signerte mer enn 1.000 ansatte fra ledende AI-selskaper, inkludert OpenAI, Anthropic og Google DeepMind, en erklæring som oppfordret den amerikanske regjeringen til å støtte internasjonale tiltak for bevisst å bremse tempoet i utviklingen av avansert AI. Eksperter etterlyser tekniske og politiske verktøy for å bremse utviklingen dersom risikoen økerspesielt gitt muligheten for at systemer vil automatisere sin egen forskning og forbedring.
Anthropic og OpenAI streber etter ĂĄ presentere disse feilene som hĂĄndterbare risikoer, og insisterer pĂĄ at deres cybersikkerhetsmodeller er for kraftige til ĂĄ tilby til allmennheten. Denne holdningen lar dem samtidig advare om farene og posisjonere seg som viktige partnere i enhver fremtidig regulering, i en dynamikk der konkurransen mellom de to selskapene har intensivert seg og frykt har blitt det viktigste salgsargumentet.
Det som skjedde etterlater en klar lærdom: jo mer autonomi modellene får, desto mer nødvendig er det å utsette dem for tester med verifiserbar isolasjon, blindveinettverk, syntetiske data og automatiske avstengningsmekanismer. Sikkerhet er ikke lenger bare et teknisk problem, men en ingeniør- og styringsutfordring som påvirker hele bransjen.Og mens laboratorier konkurrerer om å demonstrere hvem som har den kraftigste modellen, er den virkelige verden fortsatt det ultimate testområdet.