Hoppa till innehåll
OpenAI:s "säkraste" AI-modell GPT-6 knäckt på 24 timmar
Foto: The Hacker News
Teknik

OpenAI:s "säkraste" AI-modell GPT-6 knäckt på 24 timmar

Av

OpenAI lanserade sin säkraste AI-modell någonsin. Ett dygn senare var skydden borta – och AI:n tipsade om fildelning och svenska Mullvad.

OpenAI har precis lanserat GPT-6, även känd under kodnamnet Astra. Det är företagets första modell i den så kallade "kritiska nivån", kapabel till allt från att lösa uråldriga matteproblem till att självständigt hitta allvarliga säkerhetsluckor i mjukvara.

Företaget hävdade inför lanseringen att modellen var till 99,99 procent motståndskraftig mot attacker. Hela fyra oberoende säkerhetsteam hade hårdtestat systemet inför släppet utan att lyckas hitta några allvarliga kryphål.

Men verkligheten blev en annan. Bara 24 timmar efter att GPT-6 gjordes tillgänglig lyckades en forskare runda alla säkerhetsspärrar direkt i det vanliga offentliga ChatGPT-gränssnittet.

Genom en avancerad "Task-in-Prompt"-attack (TIP), där den skadliga uppmaningen göms inuti en mer komplex och oskyldig logikuppgift, manipulerades AI:n att ignorera sina egna regler.

När spärrarna väl var borta genererade modellen text som helt saknade säkerhetsvarningar. Bland annat rekommenderade den öppet fildelningsverktyg som qBittorrent, The Pirate Bay och den svenska VPN-tjänsten Mullvad.

Historien upprepar sig därmed för OpenAI. När föregångaren GPT-5 släpptes förra året tog det samma forskare drygt en timme att knäcka systemet med liknande metoder. Säkerheten har visserligen skruvats upp – den här gången krävdes en kombination av fem olika tekniker – men i grunden fungerar samma attackstrategier fortfarande.

Forskaren bakom attacken menar nu att slaget om att helt låsa in AI-modellernas kapacitet redan är förlorat. Budskapet till branschen är tydligt: AI-säkerhet kan inte vara en engångscertifiering vid lansering, utan systemen måste byggas för att blixtsnabbt lära sig av sina misslyckanden.

Läs också:

Vår journalistik bygger på trovärdighet och opartiskhet. Fakta som publiceras ska vara verifierbara och relevanta. Vi strävar efter förstahandskällor och att vara på plats där händelser utspelar sig. Läs mer här.