Routage
Qu’est-ce que le repli entre modèles ?
Le repli, c’est ce qui se passe quand le premier modèle échoue : en panne, limité ou refusant. Comment fonctionnent les chaînes de repli et pourquoi le repli silencieux est dangereux.
Toutes les explications · Dernière vérification:
Pourquoi ce n’est pas optionnel
Un flux à fournisseur unique hérite exactement de sa disponibilité. Les limites de débit en particulier ne sont pas des événements rares : elles sont la conséquence normale d’une heure chargée, et un flux sans repli s’arrête simplement.
Le repli transforme un échec net en réponse dégradée. Que ce soit une amélioration dépend entièrement du fait qu’on vous le dise.
Choisir l’ordre
L’ordre intuitif est « le modèle suivant », mais il est souvent mauvais. Si le premier choix a échoué parce que la requête était trop longue, un modèle plus petit échouera aussi. S’il a refusé pour des raisons de contenu, un modèle semblable refusera pareillement.
Un ordre plus utile change quelque chose de structurel : un tout autre fournisseur, ou un modèle local avec d’autres règles, plutôt qu’un cousin qui échouera de la même façon.
La variante dangereuse
Le repli silencieux, c’est un système qui répond discrètement avec un autre modèle sans rien dire. Vous obtenez une moins bonne réponse, que vous attribuez mentalement au modèle choisi, et vous tirez une conclusion fausse sur ce modèle.
Quand le repli franchit une frontière de confidentialité, c’est pire qu’une conclusion fausse. Passer d’un modèle local à un fournisseur cloud envoie des données précisément là où l’utilisateur avait choisi de ne pas aller. Une chaîne pouvant quitter l’exécution locale devrait être une chaîne explicitement acceptée.
Comment ClawAI procède
Les modes de routage définissent leurs propres chaînes, et le mode local seul garde la sienne chez des fournisseurs locaux au lieu d’aller chercher un modèle cloud quand le local est occupé. Chaque message consigne le modèle qui a réellement répondu : un repli se voit après coup au lieu de se deviner à un changement de ton.
Questions fréquentes
- Le repli est-il la même chose qu’une nouvelle tentative ?
- Une nouvelle tentative renvoie la même requête au même modèle, ce qui aide sur une erreur passagère. Le repli change de modèle, ce qui aide quand le premier ne peut pas traiter la requête du tout. Les systèmes robustes font les deux, dans cet ordre.
- Le repli doit-il jamais passer du local au cloud ?
- Seulement si l’utilisateur l’a demandé. L’exécution locale est en général choisie pour une raison qu’un repli ne peut pas respecter : le plus sûr est d’échouer et de le dire plutôt que de réussir ailleurs.
- Combien de modèles dans une chaîne ?
- Deux ou trois suffisent généralement. Les longues chaînes ajoutent surtout de la latence, car chaque tentative ratée se paie en temps avant que la suivante commence.
Essayez plutôt que de lire
Les modes de routage de ClawAI portent leurs propres chaînes de repli, et le mode local seul garde la sienne en local au lieu d’atteindre silencieusement un fournisseur cloud.