Grundlagen
Was ist LLM-Orchestrierung?
LLM-Orchestrierung ist die Schicht, die entscheidet, welches Modell läuft, in welcher Reihenfolge und was mit der Ausgabe geschieht. Der Unterschied zu Prompting und Agenten.
Alle Erklärungen · Zuletzt geprüft:
Es ist kein Prompt-Engineering
Prompt-Engineering verbessert einen einzelnen Aufruf. Orchestrierung entscheidet, wie viele Aufrufe es gibt, welche Modelle sie ausführen und wie ihre Ausgaben zusammenkommen. Man kann hervorragende Prompts und keine Orchestrierung haben — das Ergebnis fällt aus, sobald ein Anbieter eine schlechte Stunde hat.
Der Unterschied zählt, weil beide anders optimiert werden. Ein besserer Prompt ist günstig und hebt die Qualität etwas. Bessere Orchestrierung kostet Token und hebt die Verlässlichkeit deutlich.
Was eine Orchestrierungsschicht entscheidet
Welches Modell. Ob mehr als eines gefragt wird. Ob die Antwort vor der Rückgabe geprüft wird. Was bei einer Ablehnung, einer Zeitüberschreitung oder einer Ratenbegrenzung geschieht. Ob die Ausgabe dieses Schritts die Eingabe des nächsten wird. Ob das Ganze bezahlbar ist, bevor es beginnt.
Jede dieser Fragen ist eine Richtlinie, und jede kann unabhängig falsch sein. Deshalb lohnt es sich, Orchestrierung als eigene Schicht zu benennen, statt die Entscheidungen über den Anwendungscode zu verstreuen.
Die gängigen Techniken
Routing schickt eine Anfrage an ein passendes Modell. Fallback behandelt Fehler. Konsens fragt mehrere und betrachtet die Übereinstimmung. Best-of-N erzeugt Kandidaten und behält einen. Ein Judge bewertet Antworten. Verifikation prüft eine Aussage gegen etwas außerhalb des Modells. Pipelines verketten Schritte. Aufgabenzerlegung teilt eine große Anfrage in kleinere.
ClawAI setzt neun davon als eigene Orchestrierungsmodi um, dazu Judge und Vergleich als eigene Flächen. Zu jeder gibt es hier eine Seite, die erklärt, was sie ist, bevor Sie entscheiden, ob Sie sie wollen.
Wann nicht orchestriert werden sollte
Orchestrierung vervielfacht Kosten und Latenz. Ein Konsens über drei Modelle kostet etwa das Dreifache an Token und dauert so lange wie das langsamste. Für eine Frage, deren Antwort Sie auf einen Blick prüfen, ist das ein schlechter Handel.
Die Faustregel, die hält: orchestrieren Sie, wenn Irren teuer und Prüfen schwer ist. Sonst schicken Sie eine Anfrage an ein Modell und lesen die Antwort.
Häufige Fragen
- Ist Orchestrierung dasselbe wie ein Agenten-Framework?
- Überschneidend, aber nicht identisch. Ein Agent entscheidet seinen nächsten Schritt selbst, meist mit Werkzeugen. Orchestrierung ist die umgebende Richtlinie — welches Modell, wie viele, was bei Fehlern — und gilt genauso für einen Ablauf ganz ohne Agent.
- Braucht Orchestrierung ein Framework?
- Nein. Ein Wiederholungsversuch mit einem anderen Modell ist bereits Orchestrierung. Frameworks helfen, wenn die Richtlinien so zahlreich werden, dass Sie sie sonst pro Funktion neu bauen würden.
- Wie viel kostet das?
- In Token etwa proportional dazu, wie viele Modellaufrufe die Richtlinie macht. Ein einzelner gerouteter Aufruf kostet ungefähr so viel wie ein ungerouteter; ein Konsens über drei Modelle etwa das Dreifache. Die Kosten sind vorhersehbar, und genau das macht es zu einer Budgetentscheidung statt zu einem Glücksspiel.
Ausprobieren statt darüber lesen
ClawAI führt 9 Orchestrierungsmodi neben dem normalen Chat aus und protokolliert, welche Modelle ein Lauf verwendet hat — die Kosten einer Technik sind sichtbar statt geschätzt.