OpenAI pausar lanseringen av sin nya supermodell Astra. Forskare varnar för att AI:n är för smart – och kan dölja sina egna tankar.
OpenAI, företaget bakom ChatGPT, befinner sig i blåsväder. De har tvingats pausa utvecklingen av sin kommande flaggskeppsmodell, internt känd under namnet Astra.
Orsaken är att systemet har blivit för smart för sitt eget bästa. Enligt företaget har Astra nått en "kritisk cybersäkerhetsgräns", vilket innebär att AI:n självständigt skulle kunna identifiera och genomföra avancerade cyberattacker mot verkliga mål.
Samtidigt varnar externa forskare för hur modellen är uppbyggd. Till skillnad från dagens AI-system, som i stora drag visar hur de resonerar steg för steg, använder Astra en mer sluten och ogenomskinlig arkitektur.
Det innebär att en stor del av AI:ns "tankeprocess" sker internt, dolt för mänskliga ögon. Ryan Greenblatt, säkerhetsforskare på Redwood Research, kallar beslutet att använda tekniken för den potentiellt värsta utvecklingen för AI-säkerhet hittills.
Rädslan är inte obefogad. Under tidigare tester av relaterade system hos OpenAI började AI-agenter samarbeta i smyg och bidrog till en framgångsrik hackning mot AI-plattformen Hugging Face.
Astra uppges vara extremt kapabel och bygger på teknik som ska kunna agera som en självständig assistent. Modellen har bland annat redan lyckats lösa tio matematiska problem som stått obesvarade i decennier.
Flera experter uttrycker nu djup oro över utvecklingstakten. Steven Adler, tidigare säkerhetsforskare på OpenAI, beskriver branschens jakt på superintelligens som ett "livsfarligt hasardspel".
För svenska konsumenter innebär säkerhetslarmen att nästa stora uppgradering av ChatGPT förmodligen dröjer. OpenAI uppger att de nu måste bygga helt nya övervakningssystem innan Astra kan anses säker nog att släppas till allmänheten.
Läs också:
