Orchestrierung
Was ist ein KI-Judge?
Ein KI-Judge ist ein Modell, das die Antworten anderer Modelle bewertet. Wozu er dient, welche Verzerrungen er trägt und warum er keine echte Prüfung ersetzt.
Alle Erklärungen · Zuletzt geprüft:
Was ein Judge tut
Ein Judge erhält die ursprüngliche Frage und zwei oder mehr Antworten und liefert eine Rangfolge oder Bewertung, meist mit Begründung. Er ist der Auswahlschritt bei Best-of-N und der Schlichtungsschritt, wenn Modelle uneins sind.
Der Reiz liegt auf der Hand: Er skaliert, wie menschliche Prüfung es nicht tut, und ist weit günstiger als die Person, für die er einspringt.
Die Verzerrungen, die konsistent sind
Judges bevorzugen längere Antworten gegenüber kürzeren, selbst wenn die kürzere vollständig ist. Sie bevorzugen selbstsichere Formulierungen gegenüber vorsichtigen, ob berechtigt oder nicht. Sie reagieren auf die Reihenfolge, in der Kandidaten präsentiert werden. Und ein Modell, das seine eigene Ausgabe bewerten soll, neigt dazu, sie zu bevorzugen.
Nichts davon ist subtil, und alles ist beherrschbar — Reihenfolge mischen, ein anderes Modell als Judge und als Autor einsetzen, konkrete Kriterien statt einer allgemeinen Präferenz verlangen. Aber es muss bewusst gesteuert werden, denn die Standardkonfiguration zeigt alle vier.
Ein Judge ist kein Verifizierer
Ein Judge vergleicht Antworten miteinander. Er vergleicht sie nicht mit der Wirklichkeit. Bei drei falschen Antworten wird er sie selbstbewusst ordnen, und der Sieger bleibt falsch.
Wo eine externe Prüfung existiert — Tests, ein Schema, eine Suche — schlägt diese Prüfung einen Judge, weil sie unabhängig vom Geprüften ist. Ein Judge ist das, was Sie nutzen, wenn es keine solche Prüfung gibt.
Häufige Fragen
- Sollte der Judge das stärkste Modell sein?
- Meist ein starkes, und vorzugsweise nicht dasselbe, das die Kandidaten geschrieben hat. Selbstbevorzugung ist real, und die günstigste Abhilfe ist ein anderes Modell.
- Kann ein Judge eine einzelne Antwort bewerten?
- Er kann, aber vergleichendes Urteilen ist verlässlicher als absolutes Bewerten. Modelle sind besser bei „welche davon ist besser“ als bei „ist das eine 7 oder eine 8“.
- Woher weiß ich, dass der Judge richtig liegt?
- Prüfen Sie ihn stichprobenartig gegen Ihr eigenes Urteil. Wenn Sie nie prüfen, haben Sie das Vertrauen verschoben statt es verdient.
Ausprobieren statt darüber lesen
ClawAI führt das Judging als eigene Fläche über einem Vergleichslauf aus — eine bewertete Antwort hält sowohl die Modelle fest, die die Kandidaten schrieben, als auch das, welches sie bewertete.