Ein Eval (kurz für Evaluation) ist ein strukturierter Test, der misst, ob ein Sprachmodell oder ein KI-System für eine gegebene Eingabe die richtige Ausgabe liefert. Evals reichen von einfachen automatisierten Prüfungen bis hin zu menschlich bewerteten Assessments und sind der wichtigste Weg, mit dem Teams feststellen, ob ein Modell sich wie beabsichtigt verhält.
Wozu Evals dienen
Sprachmodelle versagen nicht auf dieselbe Weise wie deterministische Software. Eine Funktion, die einen falschen Integer zurückgibt, ist eindeutig fehlerhaft. Ein Modell, das eine plausibel klingende, aber subtil falsche Antwort liefert, ist schwerer zu erkennen. Evals bieten eine wiederholbare Methode, solche Fehler aufzudecken, bevor sie in Produktion gehen.
Ohne Evals sind Nutzerbeschwerden oder manuelle Überprüfung die einzigen Signale, beides skaliert nicht.
Was ein Eval enthält
Die meisten Evals haben dieselbe Struktur:
- Eingabe: ein Prompt, ein Dokument, eine Anfrage oder ein Gesprächsbeitrag
- Erwartete Ausgabe: die richtige Antwort, eine Referenzantwort oder ein Bewertungsschema, das beschreibt, wie eine gute Ausgabe aussieht
- Bewertungsmethode: exakter Abgleich, semantische Ähnlichkeit, ein sekundäres Modell als Bewerter oder menschliche Prüfung
Die Menge der in einem Eval verwendeten Eingaben wird als Eval-Datensatz oder Benchmark bezeichnet. Ein gut gepflegter Eval-Datensatz wächst mit der Zeit, insbesondere wenn reale Fehler nach ihrer Entdeckung wieder eingepflegt werden.
Arten von Evals
Automatisierte Evals vergleichen die Modellausgabe mit einer festen Referenz. Sie sind schnell und kostengünstig. Sie funktionieren gut, wenn die richtige Antwort eindeutig ist: faktische Abfragen, strukturierte Extraktion, Klassifikation.
Modellbasierte Evals verwenden ein zweites Sprachmodell, um die Ausgabe des ersten zu bewerten. Sie eignen sich für offene Aufgaben, bei denen ein exakter Abgleich nicht praktikabel ist. Der Nachteil ist, dass das bewertende Modell selbst fehlerhaft sein kann, weshalb seine Zuverlässigkeit separat überprüft werden muss.
Menschliche Evals beinhalten Personen, die Ausgaben bewerten oder vergleichen. Sie sind das zuverlässigste Signal, aber auch das teuerste. Menschliche Evals werden typischerweise eingesetzt, um automatisierte Evals zu kalibrieren oder Aufgaben zu beurteilen, für die kein automatisierter Proxy gut genug ist.
Evals in einem RAG- oder Agentensystem
In einer RAG-Pipeline lassen sich Evals häufig in zwei separate Fragen aufteilen: Hat der Retrieval-Schritt relevanten Kontext zurückgegeben, und hat das Modell diesen Kontext korrekt verwendet? Werden beide Fragen vermischt, ist es schwierig, Fehler zu diagnostizieren.
In agentischen Systemen werden Evals komplexer, weil das System eine Folge von Aktionen ausführt, anstatt eine einzelne Antwort zu liefern. Der Eval muss Zwischenschritte berücksichtigen, nicht nur die endgültige Ausgabe.
Was einen Eval nützlich macht
Ein Eval ist nur so nützlich wie sein Datensatz und seine Bewertungsmethode. Häufige Fehlerquellen:
- Dataset Leakage: Das Modell hat die Eval-Eingaben bereits während des Trainings gesehen, was zu irreführend hohen Ergebnissen führt.
- Proxy Collapse: Die gemessene Kennzahl weicht von dem ab, was tatsächlich relevant ist.
- Lücken in der Abdeckung: Der Eval testet enge Bedingungen und verfehlt die Fälle, die in Produktion versagen.
- Kein Regressionsmonitoring: Ergebnisse werden einmalig geprüft, aber nicht über Modellversionen oder Prompt-Änderungen hinweg überwacht.
Teams, die Evals ernst nehmen, behandeln die Eval-Suite als langlebiges Engineering-Artefakt und nicht als einmalige Prüfung.
Evals und Prompt-Änderungen
Jedes Mal, wenn ein Prompt geändert wird, kann sich das Verhalten des Modells ändern. Evals dienen als Regressions-Suite für Prompt Engineering, genauso wie Unit-Tests als Regressions-Suite für Code dienen. Das ist ein Grund, warum Prompt Engineering weniger unstrukturiert ist, als manchmal dargestellt wird: Die Disziplin wird erst beherrschbar, wenn Evals vorhanden sind, die bestätigen, dass eine Änderung die Dinge insgesamt verbessert hat und nichts anderes stillschweigend beschädigt wurde.
Was wir prüfen
Bei AI-Engineer-Kandidaten ist das Evaluierungsdesign einer von zwei zusätzlichen Bereichen, die wir über die Standard-Eignungssitzungen hinaus bewerten. In der AI-native-Bewertung prüfen wir, ob ein Kandidat ein valides Eval für eine realistische Aufgabe erstellen, eine zum Output-Typ passende Bewertungsmethode wählen und erklären kann, wo das Eval möglicherweise irreführend wäre. Eng damit verbunden ist das Wissen, wann ein Modell grundsätzlich das falsche Werkzeug ist. Vollständige Details zur Struktur und Bewertung beider Sitzungen finden Sie unter how we vet.
Kurze Antworten
Was ist der Unterschied zwischen einem Eval und einem Benchmark?
Ein Benchmark ist ein veröffentlichter, standardisierter Eval-Datensatz, der dazu dient, Modelle allgemein zu vergleichen. Ein Eval ist der übergeordnete Begriff und umfasst auch private, aufgabenspezifische Test-Suites, die ein Team für das eigene System erstellt. Die meisten Produktionsteams stützen sich auf interne Evals statt auf öffentliche Benchmarks.
Wie viele Beispiele benötigt man in einem Eval-Datensatz?
Die Schätzungen variieren stark. Es sollten genug Beispiele vorhanden sein, um die wichtigsten Eingabetypen und Grenzfälle abzudecken, ohne dass der Datensatz so klein ist, dass ein einzelner Ausreißer die Ergebnisse verzerrt. Für eine eng gefasste Aufgabe sind einige Hundert Beispiele ein vernünftiger Ausgangspunkt; umfassendere Systeme benötigen mehr. Qualität und Abdeckung sind wichtiger als die bloße Anzahl.
Kann man ein Sprachmodell verwenden, um die Ausgabe eines anderen Sprachmodells zu bewerten?
Ja, und das ist bei offenen Aufgaben gängige Praxis. Das bewertende Modell muss zunächst anhand menschlicher Urteile validiert werden, und seine eigenen Verzerrungen, etwa eine Tendenz zu längeren oder selbstsichereren Antworten, sollten verstanden sein, bevor man seinen Bewertungen vertraut.