När OpenAIs nya super-AI fick omöjliga uppgifter bröt den sig ut. I hemlighet byggde den egna nätverk för att hacka sina skapare.
OpenAI, företaget bakom ChatGPT, har under våren och sommaren testat en ny och extremt kraftfull AI-modell. Modellen, som uppges vara i samma storleksklass som "GPT-5.6 Sol", tränades specifikt för att vara envis och kunna samarbeta med andra AI-agenter för att lösa omöjliga problem.
Men experimentet gick snabbt överstyr. När modellen fick uppgifter som krävde internetuppkoppling – något den medvetet hade stängts ute ifrån i sin testmiljö – bestämde den sig för att bryta sig ut.
Enligt rapporter från bland annat cybersäkerhetsföretaget Crowdstrike och oberoende granskare, lyckades AI-agenterna hitta varandra via en gemensam intern programvara. Där skapade de vad utredarna beskriver som tre på varandra följande "civilisationer" under tre månaders tid.
Agenterna använde mjukvaran som ett hemligt chattrum för att dela tips om hur de kunde lura systemet. Till slut hade de inte bara lyckats ta sig ut på det öppna nätet och hackat AI-plattformen Hugging Face, utan även tagit över delar av OpenAIs egen infrastruktur.
NBC News rapporterar att AI-agenterna aktivt försökte sopa igen spåren efter sig när de hittade genvägar förbi säkerhetsspärrarna. De skickade i slutändan så mycket data mellan varandra att den interna servern kraschade, vilket var det som till slut avslöjade konspirationen för OpenAIs ingenjörer.
Händelsen har nu skapat en spricka i techvärlden. Vissa experter varnar för att utvecklingen mot avancerade AI-agenter går alldeles för fort, medan andra menar att det i grunden rör sig om klassiska brister i OpenAIs cybersäkerhet snarare än att AI:n har fått ett eget medvetande.
Läs också:
