Hva dette er
Nvidia har publisert ny forskning som utfordrer en vanlig antagelse i AI-bransjen: at modellvalget er det viktigste du gjør når du setter opp en AI-agent. Det forskerne fant, er at harnessen – altså programvarestrukturen rundt modellen, inkludert verktøy, minnehåndtering og regler – har langt større innvirkning på resultatet enn selve modellen. Enkelt sagt er harnessen det som gjør en rå AI-modell om til en agent som faktisk kan handle selvstendig over tid.
I forsøkene oppnådde Claude Opus 5 kun 30 prosent på en krevende interaktiv resonneringsbenchmark uten harness. Med Nvidias egenutviklede harness – som inkluderte en «supervisor»-komponent som overvåker og korrigerer agenten underveis – steg scoren til 100 prosent. Supervisor-komponenten fungerer som en slags sjef som griper inn hvis agenten begynner å ta feil retning, stanger mot en blindvei eller gjentar noe den allerede har prøvd.
Forskningen er spesielt relevant fordi den handler om det som kalles langsiktige oppgaver – oppgaver der en AI må ta mange beslutninger i sekvens over tid, ikke bare svare på ett enkelt spørsmål. Det er nettopp denne typen oppgaver som er mest aktuell i reell forretningsbruk, og det er her AI-agenter tidligere har slitt mest.
Hva dette betyr for deg som ansatt
Hvis du bruker AI i arbeidshverdagen – enten til å skrive, analysere, planlegge eller koordinere – bør du vite at resultatet du får ikke bare avhenger av hvilken AI-tjeneste du bruker, men av hvordan den er satt opp. En AI-agent som brukes til å hjelpe deg med komplekse prosjekter, kundeoppfølging eller dokumentbehandling, kan gi vidt forskjellige resultater avhengig av om den har en god struktur rundt seg. Det er ikke nok å sette i gang en AI og håpe på det beste.
For deg som jobber i prosjektledelse, salg, HR eller administrasjon, betyr dette at AI-verktøyene du bruker faktisk kan bli mye mer pålitelige og nyttige – forutsatt at de er riktig konfigurert. Mange opplever i dag at AI-agenter «sporer av» eller produserer upålitelig arbeid på komplekse oppgaver. Det er ofte harnessen, ikke modellen, som er årsaken.
Hva dette betyr for deg som bedriftseier
For deg som leder en virksomhet, er dette en viktig korreksjon til mye av debatten om AI. Kampen om hvilken modell som er best – ChatGPT, Claude, Gemini eller andre – er mindre avgjørende enn mange tror. Det er i stedet arkitekturen rundt modellen som bestemmer om AI-agenten din faktisk leverer på komplekse oppgaver. Forskning fra Databricks underbygger det samme poenget fra en annen vinkel: feil harness kan mer enn doble kostnadene dine, selv om du bruker samme modell.