Ett AI-test gav AI-modeller toppbetyg i stabilitet. Anledningen? En bugg raderade alla svar – och systemet älskade att AI:n var helt tyst.
Att AI-modeller kan använda externa verktyg, som att söka på nätet eller skriva kod, blir allt vanligare. Men att mäta hur bra dessa så kallade AI-agenter faktiskt fungerar visar sig vara oväntat svårt.
En utvecklare som nyligen granskade ett populärt testverktyg, en så kallad benchmark för språbmodeller, gjorde en smått komisk upptäckt. Testet skulle bland annat mäta hur "stabilt" modeller från företag som OpenAI och Anthropic presterade när de anropade verktyg.
Problemet var att programvaran som läste av AI-modellernas svar inte kunde hantera just verktygsanvändning. Istället för att registrera ett fel raderades datan ofta helt och förvandlades till en tom textsträng.
Eftersom testverktyget glatt accepterade dessa tomma svar som giltiga, såg det ut som att AI:n gav exakt samma svar varje gång. Resultatet blev att modellerna bedömdes vara "perfekt stabila" – när de i själva verket inte levererade något alls.
Händelsen belyser ett växande problem i techvärlden som experter börjat kalla för "agentic debt". Precis som i traditionell mjukvaruutveckling är det nämligen ofta i gränssnitten och kommunikationen mellan olika system som AI-agenterna misslyckas.
Den specifika missen i testverktyget är nu åtgärdad, och inga tidigare publicerade forskningsresultat ska ha påverkats. Men händelsen är en tydlig påminnelse om att ett lugnande toppbetyg ibland bara döljer ett trasigt system.
Läs också:
