Passer au contenu principal

Cas d’usage

Comparer les réponses de plusieurs modèles avec ClawAI

Comment les modes Compare et Judge de ClawAI exécutent un même prompt sur plusieurs modèles côte à côte et font évaluer les résultats par un modèle juge — fondé sur la fonctionnalité déployée, sans classement inventé.

Tous les cas d’usage · Dernière relecture:

Ce que fait le mode Compare

Le mode Compare envoie un prompt à plusieurs modèles à la fois et affiche les réponses côte à côte, de sorte qu’une décision importante — un jugement, une requête ambiguë, un cas où le cadrage d’un modèle pourrait être erroné — bénéficie de plus d’un point de vue. C’est une fonctionnalité réservée à certains plans, mesurée par voie plutôt que par exécution, si bien que le coût augmente avec le nombre de modèles comparés.

Le consensus et le best-of-N, expliqués correctement

Deux notions décrivent ce que l’on fait de plusieurs réponses une fois qu’on les a : le consensus, où l’accord entre modèles est en soi une information utile, et le best-of-N, où l’on génère plusieurs candidats puis on choisit ou synthétise le plus solide. Voir qu’est-ce que le consensus IA et qu’est-ce que le best-of-N, tous deux liés ci-dessous, pour comment chacun fonctionne réellement plutôt qu’un vernis marketing.

Faire évaluer les autres réponses par un modèle

Le mode Judge est une fonctionnalité distincte, réservée à certains plans, qui fait un second passage sur une exécution Compare, avec un modèle qui évalue les autres plutôt que vous lisant chaque réponse à la main. La relecture critique est une fonctionnalité liée mais distincte, pour un second regard sur une seule réponse plutôt qu’une comparaison entre modèles — voir qu’est-ce qu’un juge IA, lié ci-dessous, pour comment fonctionne réellement cette évaluation.

Questions fréquentes

Quelle est la différence entre le mode Compare et le mode Judge ?
Le mode Compare exécute un prompt sur plusieurs modèles et affiche chaque réponse côte à côte. Le mode Judge est un second passage distinct, réservé à certains plans, qui fait évaluer les résultats d’une exécution Compare par un modèle au lieu que vous lisiez chacune vous-même.
Le mode Compare coûte-t-il plus cher qu’un message de conversation ordinaire ?
L’usage de Compare est mesuré par voie, pas par exécution — exécuter le même prompt sur davantage de modèles coûte proportionnellement plus. Vérifiez le quota actuel sur la page tarifs.
Qu’est-ce que le best-of-N, et est-ce la même chose que le consensus ?
Non — le consensus considère l’accord entre les réponses des modèles comme informatif en soi, tandis que le best-of-N génère plusieurs candidats puis choisit ou synthétise le plus solide. Voir qu’est-ce que le consensus IA et qu’est-ce que le best-of-N, tous deux liés ci-dessous.

Essayez plutôt que de nous croire sur parole

Les modes Compare et Judge de ClawAI sont des fonctionnalités réelles, déployées et réservées à certains plans — un prompt sur plusieurs modèles, avec en option un second modèle pour évaluer les résultats.