Ny forskning visar att AI nu på egen hand kan koda om och förbättra andra AI-agenter. Ramverket visar sig vara viktigare än själva modellen.
När vi pratar om artificiell intelligens ligger fokus ofta på själva modellen, som GPT-4 eller Claude. Men för att en AI ska kunna utföra komplexa uppgifter, som att boka möten eller felsöka system, krävs ett ramverk runt den – bestående av prompter, verktyg och minneshantering.
Nu visar ny forskning att vi kanske har stirrat oss blinda på fel sak. Enligt det nysläppta testet HarnessOpt-Bench är detta ramverk ofta mycket viktigare för prestandan än vilken specifik AI-modell som används i grunden.
Forskarna bakom testet lät fem av dagens mest avancerade AI-modeller agera optimerare. Deras uppgift var att på egen hand granska, utvärdera och skriva om koden och prompterna för andra AI-agenter i syfte att göra dem mer effektiva.
Resultaten är slående. Utan mänsklig inblandning kunde AI-modellerna analysera fel, testa nya lösningar och avsevärt förbättra de andra agenternas förmåga att lösa uppgifter. I det liknande testet Evo-Bench har autonoma AI-system till och med lyckats slå ramverk som designats av mänskliga experter när det gäller allmänna sök- och assistentuppgifter.
Detta markerar ett stort skifte i hur AI utvecklas. I stället för att teknikjättarna enbart måste träna massiva, dyra nya modeller, kan befintliga system göras drastiskt mycket smartare bara genom att låta en annan AI städa upp i deras kod.
För vanliga konsumenter innebär detta att framtidens AI-assistenter snabbare kommer att bli bättre på att använda verktyg och lösa komplexa problem i vardagen – helt enkelt för att de numera hjälper till att utveckla sig själva.
Läs också:
