Vai al contenuto principale

Routing

Che cos’è il fallback tra modelli?

Il fallback è ciò che accade quando il primo modello fallisce: giù, limitato o in rifiuto. Come funzionano le catene di fallback e perché quello silenzioso è pericoloso.

Tutte le guide · Ultima verifica:

Perché non è opzionale

Un flusso con un solo fornitore ne eredita esattamente la disponibilità. I limiti di frequenza in particolare non sono eventi rari: sono la conseguenza normale di un’ora affollata, e un flusso senza fallback semplicemente si ferma.

Il fallback trasforma un guasto netto in una risposta degradata. Che sia un miglioramento dipende interamente dal fatto che te lo dicano.

Scegliere l’ordine

L’ordine intuitivo è «il modello successivo», ma spesso è sbagliato. Se la prima scelta è fallita perché la richiesta era troppo lunga, anche un modello più piccolo fallirà. Se ha rifiutato per motivi di contenuto, uno simile rifiuterà allo stesso modo.

Un ordine più utile cambia qualcosa di strutturale: un fornitore del tutto diverso, o un modello locale con altre regole, invece di un fratello che fallirà allo stesso modo.

La variante pericolosa

Il fallback silenzioso è un sistema che risponde di nascosto con un altro modello e non dice nulla. Ottieni una risposta peggiore, che attribuisci mentalmente al modello che hai scelto, e ne trai una conclusione sbagliata.

Quando il fallback attraversa un confine di riservatezza è peggio di una conclusione sbagliata. Passare da un modello locale a un fornitore cloud manda dati esattamente dove l’utente aveva scelto di non mandarli. Una catena che può lasciare l’esecuzione locale dovrebbe essere una catena accettata esplicitamente.

Come lo fa ClawAI

Le modalità di routing definiscono catene proprie, e la modalità solo locale tiene la sua su fornitori locali invece di cercare un modello cloud quando quello locale è occupato. Ogni messaggio registra il modello che ha davvero risposto: un fallback si vede a posteriori invece di dedurlo da un cambio di tono.

Domande frequenti

Il fallback è lo stesso di un nuovo tentativo?
Un nuovo tentativo manda la stessa richiesta allo stesso modello, e aiuta con un errore passeggero. Il fallback cambia modello, e aiuta quando il primo non può servire la richiesta affatto. I sistemi robusti fanno entrambe le cose, in quest’ordine.
Il fallback dovrebbe mai passare da locale a cloud?
Solo se l’utente lo ha chiesto. L’esecuzione locale si sceglie di solito per un motivo che un fallback non può rispettare, quindi la cosa sicura è fallire e dirlo invece di riuscire altrove.
Quanti modelli dovrebbe avere una catena?
Due o tre bastano di solito. Le catene lunghe aggiungono soprattutto latenza, perché ogni tentativo fallito si paga in tempo prima che inizi il successivo.

Provalo invece di leggerne

Le modalità di routing di ClawAI portano catene di fallback proprie, e solo locale tiene la sua in locale invece di raggiungere in silenzio un fornitore cloud.