Vai al contenuto principale

Fondamenti

Che cos’è l’orchestrazione LLM?

L’orchestrazione LLM è lo strato che decide quale modello viene eseguito, in che ordine e cosa accade all’output. In cosa differisce dal prompting e dagli agenti.

Tutte le guide · Ultima verifica:

Non è prompt engineering

Il prompt engineering migliora una singola chiamata. L’orchestrazione decide quante chiamate ci sono, quali modelli le fanno e come si combinano gli output. Puoi avere prompt eccellenti e nessuna orchestrazione: il risultato è un sistema che cade appena un fornitore ha un’ora storta.

La distinzione conta perché i due si ottimizzano in modo diverso. Un prompt migliore costa poco e alza un po’ la qualità. Un’orchestrazione migliore costa token e alza parecchio l’affidabilità.

Cosa decide uno strato di orchestrazione

Quale modello. Se interrogarne più di uno. Se controllare la risposta prima di restituirla. Cosa fare di fronte a un rifiuto, un timeout o un limite di frequenza. Se l’output di questo passo diventa l’input del prossimo. Se il tutto è sostenibile prima di iniziare.

Ognuna di queste è una politica, e ognuna può sbagliare per conto suo. Per questo vale la pena chiamare l’orchestrazione uno strato a sé invece di spargere le decisioni nel codice applicativo.

Le tecniche comuni

Il routing manda una richiesta a un modello adatto. Il fallback gestisce il guasto. Il consenso interroga più modelli e guarda l’accordo. Il best-of-N genera candidate e ne tiene una. Un giudice valuta le risposte. La verifica confronta un’affermazione con qualcosa fuori dal modello. Le pipeline concatenano passi. La scomposizione divide una richiesta grande in richieste minori.

ClawAI ne implementa nove come modalità di orchestrazione distinte, più giudice e confronto come superfici proprie. Ognuna ha qui una pagina che spiega cos’è prima che tu decida se la vuoi.

Quando non orchestrare

L’orchestrazione moltiplica costo e latenza. Un consenso su tre modelli costa circa il triplo dei token e dura quanto il più lento. Per una domanda la cui risposta verifichi a colpo d’occhio, è un cattivo affare.

La regola che regge: orchestra quando sbagliare costa caro e verificare è difficile. Altrimenti manda una richiesta a un modello e leggi la risposta.

Domande frequenti

L’orchestrazione è la stessa cosa di un framework di agenti?
Si sovrappongono ma non coincidono. Un agente decide da sé il passo successivo, spesso con strumenti. L’orchestrazione è la politica che lo circonda — quale modello, quanti, cosa fare in caso di errore — e vale allo stesso modo per un flusso senza alcun agente.
Serve un framework per orchestrare?
No. Un nuovo tentativo con un modello diverso è già orchestrazione. I framework aiutano quando le politiche diventano tante al punto che altrimenti le riscriveresti funzione per funzione.
Quanto costa?
In token, più o meno in proporzione a quante chiamate fa la politica. Una chiamata instradata costa quasi quanto una non instradata; un consenso su tre modelli circa il triplo. Il costo è prevedibile, ed è questo che ne fa una decisione di budget e non una scommessa.

Provalo invece di leggerne

ClawAI esegue 9 modalità di orchestrazione accanto alla chat normale e registra quali modelli ha usato ogni esecuzione: il costo di una tecnica si vede invece di essere dedotto.