Terug naar kennisbank
Kennisbank · Basis

Wat zijn AI-benchmarks en wat zeggen ze?

5 min lezenUitleg door de AI Dagblad-redactie

Het examen voor taalmodellen

Een benchmark is een vaste set opgaven waarmee modellen onderling vergeleken worden: wiskundevragen, programmeeropdrachten, kennisvragen, redeneerpuzzels. Elke aankondiging van een nieuw model komt met staafdiagrammen waarin het net iets hoger scoort dan de concurrentie.

Vier redenen om die cijfers met zout te nemen

1. De opgaven lekken naar de training

Benchmarks staan openbaar op internet. Modellen worden getraind op internet. Er is dus een reële kans dat een model de antwoorden ergens is tegengekomen — dan meet je geheugen in plaats van vermogen. Dit heet besmetting en het is een structureel probleem.

2. Je kunt eropaf trainen

Weet je waarop je beoordeeld wordt, dan kun je daar gericht op oefenen. Dat maakt de score hoger zonder het model in de praktijk beter te maken.

3. Wie test, wint

De cijfers in een aankondiging komen van de maker zelf. Onafhankelijke herhaling geeft geregeld lagere uitkomsten, of laat zien dat de winst binnen de foutmarge valt.

4. Ze meten zelden jouw werk

Dat een model wiskundeolympiadeopgaven oplost, zegt weinig over hoe goed het jouw offertes schrijft of jouw handleidingen doorzoekt.

Welke er wél iets zeggen

Benchmarks waarbij mensen twee antwoorden naast elkaar krijgen en kiezen welke beter is, zijn moeilijker te manipuleren en sluiten dichter aan bij praktisch gebruik. Ook tests op materiaal dat ná de training is gemaakt, ontlopen het besmettingsprobleem.

Wat je zelf moet doen

Maak een eigen toets van twintig taken die lijken op wat jij dagelijks doet, en draai die door elke kandidaat. Dat kost een middag en zegt meer dan elke gepubliceerde grafiek. Zie ook de gids welke AI is het beste.

Lees ook

Persoonlijke hulp

Vragen na het lezen?

Onze AI-experts leggen het je persoonlijk uit en helpen je het toe te passen in je eigen bedrijf. Plan een vrijblijvende afspraak.

Boek een afspraak met een expert