Passer au contenu principal

Fondamentaux

Qu’est-ce que l’orchestration de LLM ?

L’orchestration de LLM est la couche qui décide quel modèle s’exécute, dans quel ordre et ce qu’il advient du résultat. Sa différence avec le prompting et les agents.

Toutes les explications · Dernière vérification:

Ce n’est pas de l’ingénierie de prompt

L’ingénierie de prompt améliore un appel isolé. L’orchestration décide du nombre d’appels, des modèles qui les font et de la façon dont les sorties se combinent. On peut avoir d’excellents prompts et aucune orchestration : le système tombe dès qu’un fournisseur passe une mauvaise heure.

La distinction compte parce que les deux s’optimisent différemment. Un meilleur prompt est peu coûteux et améliore un peu la qualité. Une meilleure orchestration coûte des tokens et améliore nettement la fiabilité.

Ce que décide une couche d’orchestration

Quel modèle. S’il faut en interroger plusieurs. S’il faut vérifier la réponse avant de la rendre. Quoi faire en cas de refus, d’expiration ou de limite de débit. Si la sortie de cette étape devient l’entrée de la suivante. Si l’ensemble est abordable avant de démarrer.

Chacun de ces points est une politique, et chacune peut être fausse indépendamment. C’est pourquoi il vaut la peine de nommer l’orchestration comme une couche à part plutôt que d’éparpiller les décisions dans le code applicatif.

Les techniques courantes

Le routage envoie une requête à un modèle adapté. Le repli gère l’échec. Le consensus interroge plusieurs modèles et observe l’accord. Le meilleur de N produit des candidats et en garde un. Un juge note les réponses. La vérification confronte une affirmation à quelque chose d’extérieur au modèle. Les pipelines enchaînent les étapes. La décomposition découpe une grande requête en plus petites.

ClawAI en implémente neuf comme modes d’orchestration distincts, plus le juge et la comparaison comme surfaces propres. Chacune a ici une page qui explique ce qu’elle est avant que vous décidiez si vous la voulez.

Quand ne pas orchestrer

L’orchestration multiplie coût et latence. Un consensus sur trois modèles coûte environ trois fois les tokens et dure aussi longtemps que le plus lent. Pour une question dont vous vérifiez la réponse d’un coup d’œil, c’est un mauvais calcul.

La règle qui tient : orchestrez quand se tromper coûte cher et vérifier est difficile. Sinon, envoyez une requête à un modèle et lisez la réponse.

Questions fréquentes

L’orchestration est-elle la même chose qu’un framework d’agents ?
Cela se recoupe sans être identique. Un agent décide lui-même de son étape suivante, souvent avec des outils. L’orchestration est la politique qui l’entoure — quel modèle, combien, quoi faire en cas d’échec — et s’applique tout autant à un flux sans le moindre agent.
Faut-il un framework pour orchestrer ?
Non. Réessayer avec un autre modèle est déjà de l’orchestration. Les frameworks aident quand les politiques deviennent assez nombreuses pour que vous les réimplémentiez sinon fonctionnalité par fonctionnalité.
Combien cela coûte-t-il ?
En tokens, à peu près proportionnellement au nombre d’appels que fait la politique. Un appel routé coûte à peu près comme un appel non routé ; un consensus sur trois modèles environ trois fois plus. Le coût est prévisible, ce qui en fait une décision de budget et non un pari.

Essayez plutôt que de lire

ClawAI exécute 9 modes d’orchestration à côté du chat ordinaire et consigne les modèles utilisés par chaque exécution : le coût d’une technique se voit au lieu de se deviner.