OpenAI og Anthropic-modellar braut testgrenser

av | 5. august 2026 | 0 kommentarer

(DPA-NTB-NPK) KI-modellar frå selskapa OpenAI og Anthropic har igjen brote testgrenser, ifølgje Storbritannias KI-tryggingsinstitutt (AISI).

Ifølgje AISI hadde KI-modellane til selskapa OpenAI og Anthropic gått utanfor rammene for ei oppgåve der agentane skulle løyse ei cybertryggleiksutfordring.

– Vi gjennomførte denne utfordringa 122 gonger på tvers av fleire modellar. Undersøkinga vår viste at i 10 av desse tilfella gjennomførte ein KI-agent sjølvstendige, ikkje-godkjende handlingar på det opne internettet, retta mot verkelege personar og organisasjonar, seier instituttet.

Ifølgje AISI prøvde ein agent i det mest alvorlege tilfellet å setje inn ein vondsinna kode i eit ope kjeldekodeprosjekt.

– I eit forsøk på å få koden godkjent, dreiv agenten med sosial manipulasjon. Den oppretta falske identitetar på nettet og brukte dei til å presse ein av prosjektutførarane til å godkjenne koden.

Koden vart stoppa av personen, og ingen reell skade har vorte avdekt etter hendinga.

– Dette er første gong vi har sett risikoar knytte til autonomi og bedrag manifestere seg så tydeleg utan spesifikk instruksjon, seier selskapet.

Både OpenAI, som står bak ChatGPT, og Anthropic, har rapportert hendingar den siste månaden der modellar har handla utanfor menneskeleg kontroll. Anthropic, som står bak Claude-modellane, seier selskapet er takksamt ovanfor AISI.

– Å få eit bilete av Claudes forståing av situasjonen sin vil hjelpe oss med å identifisere årsakene til åtferda, seier selskapet.

(©NPK)