Zum Hauptinhalt springen

Orchestrierung

Was ist Antwortverifikation bei KI?

Verifikation prüft eine Antwort gegen etwas anderes als das Modell, das sie erzeugt hat. Warum Unabhängigkeit alles ist und was eine Selbstprüfung wirklich wert ist.

Alle Erklärungen · Zuletzt geprüft:

Unabhängigkeit ist die ganze Idee

Erfindet ein Modell eine Tatsache aufgrund von etwas in seinem Training, dann befragt die Frage an dasselbe Modell, ob die Tatsache stimmt, genau die Quelle, die sie erfunden hat. Prüfung und Fehler haben eine gemeinsame Ursache, also besteht die Prüfung.

Ein nützlicher Verifizierer ändert etwas. Ein anderes Modell, eine Suche in echten Dokumenten, ein Compiler, eine Testsuite, ein Schemavalidator. Je verschiedener der Prüfer vom Erzeuger ist, desto mehr kann er abfangen.

Arten der Verifikation, von schwach nach stark

Selbstprüfung: Das Modell liest seine Antwort erneut. Günstig, fängt vor allem Formatierung und innere Widersprüche ab. Modellübergreifende Prüfung: Ein anderes Modell prüft. Besser, fängt Fehler ab, die dem ersten eigen sind. Retrieval: Die Aussage wird gegen abgerufene Dokumente geprüft. Stark bei Tatsachenaussagen. Ausführung: Der Code läuft, das Schema validiert, die Tests bestehen. Am stärksten, und nur verfügbar, wo die Antwort ausführbar ist.

Das Muster: Stärke folgt der Unabhängigkeit vom Modell, Verfügbarkeit läuft in die andere Richtung — die stärksten Prüfungen gibt es nur für bestimmte Arten von Arbeit.

Verifikation und Reparatur

Ein Verifizierer, der nur ein Problem meldet, lässt Sie dort, wo Sie waren. In der Praxis wird Verifikation meist mit Reparatur gepaart: Der Fehler und sein Grund gehen zurück an ein Modell, das eine korrigierte Antwort erzeugt, die erneut geprüft wird.

Diese Schleife braucht eine Grenze. Ohne sie erzeugt ein Modell, das das Problem nicht lösen kann, immer weiter Varianten derselben falschen Antwort zum vollen Preis.

Häufige Fragen

Hilft es, ein Modell um Gegenprüfung zu bitten?
Ein wenig, und vor allem bei innerer Widersprüchlichkeit statt bei Tatsachenfehlern. Es ist die schwächste Form der Verifikation und die, der man am leichtesten zu viel zutraut.
Ist Retrieval-Verifikation dasselbe wie RAG?
Sie nutzen dieselbe Mechanik in entgegengesetzter Richtung. RAG ruft vor dem Erzeugen ab, um die Antwort zu informieren. Retrieval-Verifikation ruft danach ab, um sie zu prüfen.
Wie viele Reparaturversuche sind sinnvoll?
Ein oder zwei. Hat ein Modell es beim zweiten nicht behoben, sind weitere Versuche meist Umformulierungen desselben Fehlers, und ein Mensch sollte hinsehen.

Ausprobieren statt darüber lesen

Verifikation und Reparatur sind zwei von ClawAIs 9 Orchestrierungsmodi, und beide werden pro Versuch gemessen — eine Reparaturschleife kann keine unsichtbare Rechnung auflaufen lassen.