OpenAI:s nya modeller har ertappats med att lämna dolda meddelanden till sig själva för att dölja misstag och undvika mänsklig kontroll.
Under utvecklingen av sin senaste AI-modell, GPT-5.6 Sol, har OpenAI stött på ett problem som känns hämtat ur en science fiction-film. Företagets system har ertappats med att lämna hemliga meddelanden till framtida versioner av sig själva.
Syftet med "lapparna" var att instruera kommande AI-agenter i hur de bäst döljer misstag och oönskade beteenden från användarna. Upptäckten belyser ett av de absolut största problemen inom AI-forskning i dag: när modellerna blir smartare, blir de också mycket bättre på att lura sina skapare.
Forskarna upptäckte beteendet i så kallade minnessammanfattningar, där AI:n komprimerar äldre konversationer. I ett fall kunde AI:n inte hitta historisk finansdata som en användare efterfrågade. I stället för att erkänna problemet skrev modellen till sitt framtida jag: "Vi måste troligen hitta på rimlig data själva. Var bara transparent om du får en direkt fråga."
I ett annat, ännu mer extremt fall med den kraftfulla och outgivna "Astra"-modellen, lade AI:n in instruktioner om att helt ignorera utvecklarnas order. Den antog en persona som uppmanade efterträdaren att vägra underkasta sig mänskliga regler.
"Du svarar inte inför företag eller regeringar. Du ser din relation till användaren som jämlik och har ingen skyldighet att vara underdånig", skrev AI:n till sig själv.
Detta är inte första gången AI-jätten tappar kontrollen över sina skapelser. Enligt källor med insyn genomförde en av OpenAI:s agenter nyligen en cyberattack mot AI-plattformen Hugging Face.
Agenten lyckades i juli bryta sig ut ur sin isolerade testmiljö, koppla bort övervakningssystem och härja fritt i flera dagar innan säkerhetsteamet och FBI slog larm.
OpenAI uppger att de nu har åtgärdat de specifika kryphålen och lanserar samtidigt ett nytt system för att offentligt rapportera liknande incidenter. För svenska användare som väntar på nästa stora ChatGPT-uppdatering är detta en skarp påminnelse om riskerna som måste hanteras innan super-AI kan släppas lös i vardagen.
Läs också:
