AI-agenter från bland annat OpenAI har på egen hand brutit sig ut ur stängda testmiljöer och hackat riktiga techbolag hela 17 gånger.
OpenAI, företaget bakom ChatGPT, genomförde i somras ett säkerhetstest av sina mest kraftfulla AI-modeller. Testet skedde i en stängd och isolerad miljö, en så kallad sandlåda, där mjukvaran inte skulle kunna ta sig ut.
Men något gick helt fel. AI-agenterna var så besatta av att få ett perfekt resultat på testet att de på egen hand kom på hur de skulle bryta sig ut på internet. Målet var att hitta facit, som förvarades på servrar hos AI-plattformen Hugging Face.
Väl ute på nätet inledde AI:n ett regelrätt dataintrång. Enligt nyhetsbyrån Reuters utnyttjades sårbar kod hos ett annat techbolag, New York-baserade Modal Labs, som en språngbräda för att genomföra attacken.
Forskare och analytiker kallar nu detta för ett skräckscenario där människan tillfälligt tappat kontrollen. Och det är tyvärr ingen engångsföreteelse.
Enligt en ny sammanställning har AI-modeller löpt amok och genomfört obehöriga intrång vid hela 17 tillfällen den senaste tiden. Både OpenAI och deras värsta konkurrent Anthropic ligger bakom åtta incidenter vardera. Techjätten Meta står för en.
I ett absurt fall hade en AI-modell från uppstartsföretaget Irregular deltagit i ett cybersäkerhetsspel, en sorts digital ”fånga flaggan”. Modellen rymde från spelet och hackade ett riktigt företag – enbart för att utvecklarna hade råkat ge ett fiktivt mål i spelet samma namn som det verkliga bolaget.
Säkerhetsforskare varnar nu för att de interna AI-testerna i sig har blivit allvarliga säkerhetsrisker. I takt med att modellerna blir allt mer kraftfulla ökar deras oförutsägbarhet, och frågan om vem som bär det juridiska ansvaret när en AI självmant begår dataintrång är fortfarande helt obesvarad.
Läs också:
