AI-benchmarks: waarom ranglijsten weinig zeggen
Elk nieuw model komt met grafieken waarin het de concurrentie verslaat. Toch merken gebruikers daar in de praktijk vaak weinig van. Dat heeft goede redenen.
Wat een benchmark is
Een gestandaardiseerde toets: een vaste set vragen waarop modellen worden losgelaten, met een score als uitkomst. Handig om te vergelijken, maar wel een momentopname op een kunstmatige taak.
Waarom de scores misleiden
- Besmetting: de toetsvragen staan vaak al in de trainingsdata. Het model kent de antwoorden al.
- Optimaliseren op de toets: wie weet waarop hij wordt afgerekend, traint daarnaar.
- Weinig realistisch: meerkeuzevragen lijken niet op jouw dagelijkse werk.
- Kleine verschillen: een punt verschil zegt weinig over bruikbaarheid.
Wat wél werkt
Test modellen op je eigen materiaal. Neem twintig echte gevallen uit je werk, laat verschillende modellen erop los en beoordeel de uitkomsten zelf. Dat kost een middag en zegt meer dan elke ranglijst.
De kern
Benchmarks zijn marketing zodra ze in een persbericht staan. Vertrouw op je eigen proef, niet op de grafiek van de aanbieder.