Orchestrierung
Was ist Best-of-N-Sampling?
Best-of-N erzeugt mehrere Antwortkandidaten und behält den besten. Wie Kandidaten gewählt werden, warum der Selektor wichtiger ist als N und wann es einen guten Prompt schlägt.
Alle Erklärungen · Zuletzt geprüft:
Warum es überhaupt funktioniert
Die Ausgabe eines Sprachmodells wird gesampelt, nicht deterministisch erzeugt. Zwei Läufe desselben Prompts liefern unterschiedliche Antworten unterschiedlicher Qualität. Überwiegen die guten Antworten des Modells die schlechten, erhöht mehrfaches Sampling die Chance, dass mindestens eine gut ist.
Das ist der ganze Mechanismus. Er macht das Modell nicht klüger; er gibt Ihnen mehr Versuche auf dessen bestehendes Können.
Den Sieger zu wählen ist der schwere Teil
Kandidaten zu erzeugen ist leicht. Zwischen ihnen zu wählen ist das eigentliche Problem, und dort liegt der meiste Wert der Technik und ihr meistes Scheitern.
Auswahl durch eine automatische Prüfung — kompiliert es, bestehen die Tests, erfüllt es das Schema — ist mit Abstand am verlässlichsten, weil die Prüfung unabhängig vom Modell ist. Auswahl durch ein anderes Modell ist ein Judge mit allen Vorbehalten jener Seite. Auswahl durch einen Menschen ist am genauesten und am wenigsten skalierbar.
N wählen
Der Ertrag fällt schnell ab. Von einem Kandidaten auf drei ist eine große Verbesserung; von drei auf zehn eine kleine zum mehr als dreifachen Preis. Die meisten praktischen Anwendungen liegen bei drei bis fünf.
N vervielfacht die Kosten exakt. Fünf Kandidaten sind fünfmal die Generierungstoken, plus was die Auswahl kostet.
Wann man es nicht nutzt
Haben Sie keine Möglichkeit, eine gute von einer schlechten Antwort zu unterscheiden, kann Best-of-N Ihnen nicht helfen — Sie wählen zufällig aus einem größeren Topf und zahlen mehr dafür. Sein natürliches Zuhause ist Arbeit mit objektiver Prüfung: Code, strukturierte Ausgaben, alles, was entweder parst oder nicht.
Häufige Fragen
- Ist Best-of-N dasselbe wie eine höhere Temperatur?
- Nein, auch wenn beides zusammenwirkt. Temperatur steuert, wie unterschiedlich jede Antwort ausfällt. Best-of-N geht darum, wie viele Sie nehmen und wie Sie wählen. Etwas Vielfalt hilft, denn identische Kandidaten geben nichts zu wählen.
- Kann ich verschiedene Modelle für die Kandidaten nutzen?
- Ja, und es hilft oft — Modelle scheitern unterschiedlich, der Topf ist also vielfältiger als wiederholte Stichproben aus einem. An dem Punkt sind Sie nahe am Konsens, mit Auswahl statt Übereinstimmung.
- Hilft es bei faktischer Genauigkeit?
- Nur wenn Ihr Selektor faktische Fehler erkennen kann. Ohne externe Prüfung wählen Sie zwischen selbstbewussten Antworten, und Selbstbewusstsein ist nicht Genauigkeit.
Ausprobieren statt darüber lesen
Best-of-N ist einer von ClawAIs 9 Orchestrierungsmodi, und jeder erzeugte Kandidat wird gegen die Kosten des Laufs festgehalten.