Een eval (afkorting van evaluation) is een gestructureerde test die meet of een taalmodel of AI-systeem de juiste output produceert voor een gegeven input. Evals variëren van eenvoudige geautomatiseerde checks tot door mensen beoordeelde assessments, en ze zijn de voornaamste manier waarop teams kunnen nagaan of een model zich gedraagt zoals bedoeld.
Waarom evals bestaan
Taalmodellen falen niet op de manier waarop deterministische software faalt. Een functie die het verkeerde gehele getal teruggeeft is duidelijk kapot. Een model dat een plausibel maar subtiel fout antwoord geeft, is moeilijker te ontdekken. Evals bieden een herhaalbare methode om die fouten boven water te halen voordat ze productie bereiken.
Zonder evals zijn gebruikersklachten of handmatige inspectie de enige signalen, en geen van beide schaalt.
Wat een eval bevat
De meeste evals hebben dezelfde structuur:
- Input: een prompt, een document, een zoekopdracht of een gespreksbeurt
- Verwachte output: het juiste antwoord, een referentierespons of een rubric die beschrijft hoe goed eruitziet
- Scoringsmethode: exacte overeenkomst, semantische gelijkenis, een tweede model als beoordelaar, of menselijke beoordeling
De verzameling inputs die in een eval wordt gebruikt, heet een eval-dataset of benchmark. Een goed onderhouden eval-dataset groeit in de loop van de tijd, met name wanneer echte fouten worden toegevoegd nadat ze zijn ontdekt.
Typen evals
Geautomatiseerde evals vergelijken modeloutput met een vaste referentie. Ze zijn snel en goedkoop. Ze werken goed wanneer het juiste antwoord ondubbelzinnig is: feitelijk ophalen, gestructureerde extractie, classificatie.
Door modellen beoordeelde evals gebruiken een tweede taalmodel om de output van het eerste te scoren. Ze zijn geschikt voor open taken waarbij exacte overeenkomst niet praktisch is. Het nadeel is dat het beoordelende model zelf ook fouten kan maken, zodat de betrouwbaarheid ervan apart moet worden vastgesteld.
Menselijke evals laten mensen outputs beoordelen of vergelijken. Ze geven het betrouwbaarste signaal, maar zijn het duurst om uit te voeren. Menselijke evals worden doorgaans gebruikt om geautomatiseerde evals te kalibreren of om taken te beoordelen waarvoor geen afdoende geautomatiseerde proxy bestaat.
Evals in een RAG- of agentsysteem
In een RAG-pipeline worden evals vaak opgesplitst in twee afzonderlijke vragen: heeft de retrieval-stap relevante context opgehaald, en heeft het model die context correct gebruikt? Als je die twee combineert, wordt het moeilijk om fouten te diagnosticeren.
In agentsystemen worden evals complexer omdat het systeem een reeks acties uitvoert in plaats van één enkele respons te produceren. De eval moet rekening houden met tussenstappen, niet alleen met de eindoutput.
Wat een eval nuttig maakt
Een eval is alleen zo nuttig als de dataset en de scoringsmethode. Veel voorkomende faalwijzen:
- Dataset-lekkage: het model heeft de eval-inputs tijdens de training al gezien, waardoor scores misleidend hoog uitvallen
- Proxy-verval: de gemeten metric wijkt af van wat er werkelijk toe doet
- Dekkingsgaten: de eval test enge condities en mist de gevallen die in productie fout gaan
- Geen regressiebewaking: scores worden eenmalig gecontroleerd maar niet gevolgd over modelversies of promptwijzigingen heen
Teams die evals serieus nemen, behandelen de eval-suite als een langlevend engineeringartefact, niet als een eenmalige check.
Evals en promptwijzigingen
Elke keer dat een prompt verandert, kan het gedrag van het model veranderen. Evals fungeren als regressiesuite voor prompt engineering, net zoals unit tests als regressiesuite voor code dienen. Dit is een van de redenen waarom prompt engineering minder ad hoc is dan soms wordt gesuggereerd: de discipline wordt pas beheersbaar wanneer er evals zijn om te verifiëren dat een wijziging de zaken overall heeft verbeterd en niets stiekem heeft kapotgemaakt.
Waar we op testen
Voor AI engineer-kandidaten is evaluatieontwerp een van de twee aanvullende gebieden die we beoordelen naast de standaard vetsessies. In de AI-native beoordeling kijken we of een kandidaat een geldige eval kan opzetten voor een realistische taak, een scoringsmethode kan kiezen die past bij het type output, en kan uitleggen waar de eval mogelijk misleidend is. Nauw verwant hieraan is weten wanneer een model überhaupt het verkeerde instrument is. Volledige details over hoe beide sessies zijn opgebouwd en gescoord staan op hoe we vetten.
Korte antwoorden
Wat is het verschil tussen een eval en een benchmark?
Een benchmark is een gepubliceerde, gestandaardiseerde eval-dataset die wordt gebruikt om modellen breed te vergelijken. Een eval is de algemene term en omvat ook private, taakspecifieke testsuites die een team voor hun eigen systeem bouwt. De meeste productieteams vertrouwen op interne evals in plaats van publieke benchmarks.
Hoeveel voorbeelden heb je nodig in een eval-dataset?
Schattingen lopen sterk uiteen. Genoeg om de belangrijkste invoertypes en randgevallen te dekken, zonder zo klein te zijn dat één uitbijter de resultaten scheefttrekt. Honderden voorbeelden is een redelijk startpunt voor een gerichte taak; bredere systemen hebben meer nodig. Kwaliteit en dekking zijn belangrijker dan pure aantallen.
Kun je een taalmodel gebruiken om de output van een ander taalmodel te beoordelen?
Ja, en dat is gangbare praktijk bij open-ended taken. Het beoordelingsmodel moet eerst gevalideerd worden aan de hand van menselijke oordelen, en de eigen vooroordelen ervan, zoals een voorkeur voor langere of zelfverzekerdere antwoorden, moeten bekend zijn voordat je de scores kunt vertrouwen.