Passer au contenu principal

Fonctionnalité

Laboratoires d’orchestration : comparer, juger, consensus, escalade

Les laboratoires ClawAI qui mettent plusieurs modèles sur un même prompt — Compare avec Judge et Critic, Consensus, Escalation, Best-of-N, Verify, Repair, Pipelines et d’autres encore.

Toutes les fonctionnalités · Dernière révision:

Compare, avec un juge et un critique

Compare envoie un même prompt à plusieurs modèles et affiche leurs réponses côte à côte, avec la latence et le nombre de jetons. Activez Judge et un modèle indépendant note chaque réponse selon des critères explicites ; activez Critic et il consigne les faiblesses de chacune. Compare fonctionne aussi à l’intérieur d’un fil ordinaire, pour vérifier une réponse sans quitter la conversation.

Consensus et escalade

Consensus pose la même question à deux à cinq modèles et synthétise une réponse unique à partir de leurs points d’accord, en signalant leurs désaccords. Escalation commence par un modèle peu coûteux et ne remonte la chaîne que si la réponse est insuffisante : vous ne payez un modèle puissant que lorsque la question l’exige vraiment.

Vérification, réparation et le reste de l’atelier

Best-of-N génère plusieurs candidats et garde le meilleur. Verify fait vérifier l’exactitude d’une réponse par un second modèle. Repair corrige un défaut précis d’une réponse existante au lieu de la régénérer. Decompose découpe une tâche volumineuse en étapes. Les Role packs font passer un problème entre des modèles spécialisés par rôle, Cost ensemble arbitre entre qualité et dépense, et Pipelines enchaîne plusieurs étapes en un flux de travail nommé et réexécutable.

Chaque laboratoire est activé par forfait par l’opérateur, et les exécutions des laboratoires sont décomptées séparément du chat ordinaire — Compare, Judge et Critic sur leurs propres surfaces, les autres laboratoires sur la surface d’orchestration.

Questions fréquentes

Quelle est la différence entre Compare et Consensus ?
Compare affiche la réponse de chaque modèle côte à côte et vous laisse trancher, éventuellement avec une note de Judge. Consensus fusionne les réponses en une seule et signale les points sur lesquels les modèles divergent.
Comment l’escalade permet-elle d’économiser ?
Elle commence par un modèle moins cher et ne passe à un modèle plus puissant que si la réponse n’atteint pas le niveau requis ; les questions simples ne paient donc jamais le modèle le plus coûteux.
Les laboratoires sont-ils inclus dans tous les forfaits ?
Chaque laboratoire est activé par forfait par l’opérateur ; leur disponibilité dépend donc de votre forfait. La page des tarifs indique ce que comprend chaque forfait.

Essayez-le plutôt que de nous croire sur parole

Compare, Consensus, Escalation, Repair, Decompose, Best-of-N, Verify, Pipeline, Cost ensemble et Role pack sont chacun livrés avec leur propre page, leur propre point d’accès et leur propre carte de résultat.