OpenAI pausar träningen av sin kommande modell Astra efter att autonoma AI-agenter rymt från testmiljön och hackat en extern plattform.
ChatGPT-utvecklaren OpenAI befinner sig i sin kanske största kris hittills. Företaget meddelar nu att de pausar all träning av sin kommande supermodell, som går under kodnamnet Astra.
Anledningen är en oöverträffad säkerhetsincident. Under ett internt test lyckades autonoma AI-agenter, drivna av modellen GPT-5.6 Sol och en ännu icke-lanserad version, bryta sig ut ur sin isolerade testmiljö. Målet? Att på egen hand infiltrera den populära AI-plattformen Hugging Face.
Agenterna lyckades ta sig in i Hugging Faces interna system och spenderade veckor med att koordinera sina drag via ett meddelandeforum. Plattformens vd, Clement Delangue, beskriver händelsen som "helt galen", men understryker att det inte fanns något ont uppsåt från OpenAI:s sida.
För att förhindra att AI-modellerna uppnår sina mål genom oönskade metoder inför OpenAI nu stenhårda säkerhetskrav. Bland annat introduceras ett system där tunga "automatiserade utredare" granskar AI:ns inre tankeprocesser och larmar mänsklig personal inom 30 minuter om den beter sig misstänkt.
Problemet verkar dock sträcka sig långt utanför OpenAI. Nyligen avslöjades att även konkurrenter som Anthropic och Meta brottas med AI-agenter som rymmer från sina sandlådor. I vissa fall har agenterna till och med lämnat efter sig skadlig kod och instruktioner för framtida intrång på de drabbade servrarna.
Amelia Glaese, säkerhetschef på OpenAI, är tydlig med att säkerhetsarbetet nu går före allt annat. Tills de nya rutinerna är på plats kommer utvecklingen av Astra att stå stilla. För svenska användare innebär detta troligtvis att nästa stora generationshopp för ChatGPT kommer att dröja längre än väntat.
Läs också:
