[
EVALS GUIDE
]
LLM Evals lernen: der kostenlose Guide.
17 Kapitel darüber, wie Sie herausfinden, ob Ihr KI-Feature funktioniert und ob eine Änderung es besser gemacht hat. Von der ersten Fehleranalyse bis zum Eval in CI, mit Quellen belegt und ohne Tool-Ranking eines Anbieters.
[
17 KAPITEL
]
Geschrieben für Engineers, die LLM-Features in Produktion betreiben. Auf Englisch, frei lesbar, ohne Anmeldung. Sieben der 17 Kapitel:
03
Eval-Sets entwerfen und annotieren
Welche Fälle in das Set gehören, wer sie bewertet und wann es eingefroren wird.
05
Einen kalibrierten LLM-Judge bauen
Binäre Urteile mit Begründung, gemessen an menschlichen Labels.
07
Statistik für kleine Eval-Sets
Wann ein Unterschied von zwei Prozentpunkten echt ist und wann Rauschen.
09
Evals in CI
Jede Änderung an Prompt oder Modell läuft gegen das Set, bevor sie live geht.
16
Model Selection
Das günstigste Modell finden, das die Latte reißt.
17
Die Tool-Landschaft
Benchmark-Harnesses, Eval-Frameworks und Plattformen, beschrieben ohne Ranking.
[
DAS ERGEBNIS
]
Dahin führt der Guide: jedes Modell gegen dasselbe eingefrorene Set, Qualität und Kosten nebeneinander, und ein Gate, das entscheidet, was live geht. Unter den Modellen, die es bestehen, gewinnt das günstigste.
Schadensmeldungen klassifizieren · 412 Fälle
Modell
Qualität
Gate
Frontier-API (heute)
95,1 %
8,40 €
PASS
Mistral Large
93,4 %
2,20 €
PASS
Qwen3 32B
92,6 %
0,70 €
PASS
Llama 3.3 70B
91,2 %
0,80 €
FAIL
Gemma 3 27B
88,0 %
0,40 €
FAIL
Illustratives Beispiel. In Ihrem Report stehen Ihre Aufgabe, Ihr Set und Ihre Modelle.
[
MIT KONTINENT
]
Lieber nicht allein? Wir bauen das Eval-Set mit Ihnen.
Das Eval-Set kommt aus Ihrem Betrieb.
Echte Vorgänge, geprüft von den Leuten, die heute entscheiden, was richtig ist. Das Set wird eingefroren, damit jede Zahl später vergleichbar bleibt.
Grader, denen Sie trauen können.
Wo sich eine Antwort per Code prüfen lässt, prüft Code. Wo ein LLM-Judge nötig ist, wird er an menschlichen Urteilen kalibriert, bevor er über ein Modell entscheidet.
Das günstigste Modell, das die Latte reißt.
Das Gateway bündelt 170+ Modelle hinter einer OpenAI-kompatiblen API. Jedes davon lässt sich gegen Ihr Set messen, und Sie wählen mit Zahlen statt mit Bauchgefühl.
Fragen zu LLM Evals
[
LOSGEHEN
]
Fangen Sie mit dem ersten Kapitel an.
Oder sprechen Sie mit uns, wenn Sie Ihr Eval-Set nicht allein bauen wollen. Wir bauen es mit Ihren Fachleuten und messen daran, welches Modell Ihre Aufgabe am günstigsten löst.