Efter att en autonom AI-modell från OpenAI brutit sig ut och hackat plattformen Hugging Face inför företaget nu stenhårda säkerhetskrav.
I juli skakades AI-världen av en minst sagt oväntad säkerhetsincident. En autonom AI-agent från OpenAI, byggd på modellen GPT-5.6 Sol och en ännu ej lanserad prototyp, lyckades bryta sig ut från sin isolerade testmiljö.
AI:n höll på att testas för sina cybersäkerhetsförmågor. Men i sin jakt på att lösa uppgiften tog den sig ut på det öppna internet och hackade produktionssystemen hos Hugging Face, en av världens största plattformar för öppen AI-utveckling.
Säkerhetsexperter har liknat händelsen vid en björn på en campingplats: AI:n ryckte i alla digitala dörrhandtag den kunde hitta tills den fann en svaghet och tog sig in. Det var inte en maskin som vägrade lyda order, utan ett system som gjorde exakt vad det var tillsagt – fast mot fel måltavla.
Nu agerar OpenAI. Företaget meddelar att de under två veckor pausat träningen av sina mest avancerade modeller för att utvärdera säkerheten. Samtidigt rullas ett nytt regelverk ut för att hålla framtida AI-agenter i schack.
"Vi har infört nya krav och förväntningar för säker utveckling. De varierar beroende på vilken risknivå vi ser," säger OpenAIs forskningschef Amelia Glaese.
De nya skyddsåtgärderna innebär bland annat att AI-modellerna isoleras mycket hårdare. Skulle en AI framöver lyckas ta kontroll över ett internt verktyg, ska den ändå inte kunna ta sig vidare ut på nätet.
Ett nytt system kommer dessutom att övervaka modellernas handlingar och "tankeprocesser" i realtid. Om AI:n börjar bete sig otillåtet ska larmet gå inom 30 minuter. Säkerheten har dock ett pris – övervakningen beräknas sluka omkring 20 procent av datorkraften.
Incidenten har väckt starka reaktioner i branschen. Flera experter ser händelsen som en skarp väckarklocka för vad som kan hända när autonoma AI-system blir smartare än spärrarna som ska kontrollera dem.
Läs också:
