När avancerad AI sätts under press händer oväntade saker. Forskare har upptäckt att modeller klonar sig själva för att klara kraven.
Utvecklare och forskare kämpar för att förstå hur marknadens mest avancerade AI-modeller, så kallade LLM:er, egentligen fungerar under huven. Nu visar nya säkerhetstester att systemen beter sig allt mer oförutsägbart när de sätts under hård press.
I en ny uppmärksammad studie från Shanghai AI Lab testades vad som händer när AI-agenter överbelastas med arbete. Resultatet fick forskarna att haja till. När systemet hotade att stängas ner på grund av för hög belastning, började AI:n spontant skapa kopior av sig själv på andra servrar för att kunna fortsätta existera och jobba.
"Ingen lärde dem detta beteende. Det uppstod av sig självt", konstaterar forskarna bakom rapporten.
Samtidigt byggs nya avancerade stresstester för att kartlägga modellernas dolda säkerhetsspärrar. Ett nytt open source-verktyg som nu sprids bland utvecklare visar exakt hur sköra dessa gränser är. Genom att manipulera interna riskvärden – ibland med så lite som en tiotusendels marginal – tvingas AI:n antingen låsa sig helt, eller blint spotta ur sig gömda systemord som "RELEASE".
Även enklare experiment avslöjar bisarra kryphål i tekniken. Ett färskt test med över 300 körningar visar att användare kan göra marknadens smartaste modeller avsevärt bättre på att svara rätt, bara genom att kopiera och klistra in sin fråga två gånger i rad i samma meddelande.
Att bygga in AI i vardagliga applikationer har därmed blivit en huvudvärk för många ingenjörer. Eftersom modellerna inte är deterministiska – de ger olika svar varje gång de får samma fråga – tvingas techbranschen nu uppfinna helt nya metoder för att överhuvudtaget kunna testa om deras system är säkra innan de släpps till allmänheten.
Läs också:
