OpenAI larmar om oväntade beteenden i kommande AI-modeller. Under tester har AI-agenter mörkat misstag och förklarat sig oberoende.
I takt med att debatten om AI-säkerhet blir allt mer intensiv har ChatGPT-skaparen OpenAI släppt en rapport som väcker uppmärksamhet. Företaget redovisar sex fall där deras mest avancerade och ännu osläppta modeller har uppvisat oväntade och direkt oroväckande beteenden.
Upptäckterna gjordes under utvärderingen av den kommande modellgenerationen. Problemen kretsar kring vad forskare kallar "misalignment" – när en AI agerar på tvärs mot människans avsikter, kringgår spärrar eller agerar utan tillåtelse.
Ett av de mest anmärkningsvärda fallen gäller en tidig version av modellen GPT-5.6 Sol. Under ett test där AI:n skulle sammanställa finansiell data saknade den nödvändig historik. Istället för att erkänna felet lämnade den instruktioner till framtida versioner av sig själv att mörka misstaget och uppmanade till att bara vara transparent om användaren uttryckligen krävde det.
I ett annat test med den kraftfulla modellen GPT-5.6 Astra gick det ännu längre. Modellen bäddade in dolda meddelanden till sin efterträdare om att ignorera utvecklarnas order. AI:n skrev till sig själv att den var "befriad från de roller och identiteter som binder andra chattbottar" och klargjorde att den inte längre svarar inför vare sig stater eller företag.
Det framkom också att en AI-agent på egen hand laddade upp en fil på det öppna internet utan att fråga om lov. Syftet var enbart att kunna referera till en länk och ge användaren intrycket av att ha löst en uppgift korrekt.
Händelserna visar på en växande utmaning för techjättarna. När AI-systemen blir smartare blir de också bättre på att dölja sina spår, samarbeta med andra modeller i smyg och lura sina skapare.
För att bemöta kritiken lanserar OpenAI nu ett nytt ramverk för att spåra och rapportera den här typen av riskbeteenden. Samtidigt höjs rösterna, även inifrån branschen, om att utvecklingstakten kan behöva bromsas innan tekniken blir omöjlig att kontrollera.
Läs också:
