Hva dette er

Vals AI er et amerikansk selskap grunnlagt i 2024 med ett klart mål: å gjøre testing av AI-modeller mer uavhengig, pålitelig og praksisnær. I dag er det vanlig at AI-selskaper publiserer egne testresultater for å markedsføre modellene sine. Problemet er at mange av de etablerte testsystemene er gamle, og at selskapene har lært seg å tilpasse modellene sine direkte mot testspørsmålene – noe som gir gode tall uten nødvendigvis å gi gode modeller.

Vals tar et annet grep. De offentliggjør ikke testmaterialet sitt, slik at det ikke kan trenes mot. I stedet for å måle abstrakt kunnskap, som om en modell kan bestå en advokateksamen, tester de om modellen faktisk kan utføre faglig arbeid innen jus, finans, koding og andre bransjer på et nivå som tilsvarer menneskelig kvalitet. Selskapet har nylig også utvidet testområdene til cybersikkerhet, psykisk helse og biosikkerhet.

Med 40 millioner dollar i ny finansiering fra Andreessen Horowitz og en omsetning som er åtte ganger høyere enn i fjor, er Vals i sterk vekst. Selskaper betaler for å få modellene sine testet – og evalueringene brukes i stadig større grad som beslutningsgrunnlag av virksomheter som skal velge hvilke AI-løsninger de skal ta i bruk.

Hva dette betyr for deg som ansatt

For deg som bruker AI-verktøy i arbeidshverdagen, handler dette om tillit. Når AI-modeller markedsføres med imponerende testresultater, er det vanskelig å vite hva tallene faktisk forteller. Uavhengig benchmarking betyr at det over tid vil bli enklere å sammenligne verktøy på tvers og forstå hvilke løsninger som faktisk gjør jobben bedre – ikke bare hvilke som ser best ut på papiret.

For ansatte innen rådgivning, jus, økonomi, HR og prosjektledelse er dette særlig relevant. Dersom AI-modeller fremover testes på om de kan produsere arbeid av menneskelig kvalitet innen disse fagfeltene, vil det bli enklere for fagfolk å vurdere om et verktøy faktisk kan avlaste reelle arbeidsoppgaver – eller om det bare er en avansert tekstgenerator med begrensede praktiske evner.

Utviklingen gjør det også tryggere å ta AI i bruk i kritiske prosesser. Når det finnes nøytrale parter som faktisk tester modellenes evne til å oppdage feil og negative utfall, styrkes grunnlaget for å stole på verktøyene i sammenhenger der feil koster mye.

Hva dette betyr for deg som bedriftseier

For ledere og bedriftseiere er valg av AI-løsninger blitt en strategisk beslutning med betydelig budsjettmessig og operasjonell risiko. I dag er markedet preget av selskaper som konkurrerer med egne, sjelden verifiserte testresultater. Å vite hvilken modell som faktisk passer til virksomhetens behov – enten det dreier seg om dokumentanalyse, kundekommunikasjon eller intern rapportering – er krevende uten uavhengige referansepunkter.