Passer au contenu principal

Orchestration

Qu’est-ce que l’échantillonnage meilleur de N ?

Le meilleur de N produit plusieurs réponses candidates et garde la meilleure. Comment les candidates sont choisies, pourquoi le sélecteur compte plus que N.

Toutes les explications · Dernière vérification:

Pourquoi cela fonctionne

La sortie d’un modèle de langage est échantillonnée, pas déterministe. Deux exécutions du même prompt donnent des réponses différentes de qualité variable. Si les bonnes réponses du modèle l’emportent sur les mauvaises, prendre plusieurs échantillons augmente la chance qu’au moins une soit bonne.

C’est tout le mécanisme. Il ne rend pas le modèle plus intelligent ; il vous donne plus de tentatives sur la capacité qu’il a déjà.

Choisir la gagnante est le plus dur

Produire des candidates est facile. Choisir entre elles est le vrai problème, et c’est là que se logent l’essentiel de la valeur de la technique et l’essentiel de ses échecs.

La sélection par contrôle automatique — cela compile-t-il, les tests passent-ils, le schéma est-il respecté — est de loin la plus fiable, car le contrôle est indépendant du modèle. La sélection par un autre modèle est un juge, avec toutes les réserves de cette page. La sélection humaine est la plus exacte et la moins scalable.

Choisir N

Le rendement décroît vite. Passer d’une candidate à trois est une grosse amélioration ; de trois à dix, une petite pour plus du triple du coût. La plupart des usages pratiques se situent entre trois et cinq.

N multiplie le coût exactement. Cinq candidates, c’est cinq fois les tokens de génération, plus ce que coûte la sélection.

Quand ne pas l’utiliser

Si vous n’avez aucun moyen de distinguer une bonne réponse d’une mauvaise, le meilleur de N ne peut pas vous aider : vous choisirez au hasard dans un plus grand tas et paierez davantage. Son terrain naturel est le travail à contrôle objectif : code, sortie structurée, tout ce qui s’analyse ou non.

Questions fréquentes

Est-ce la même chose qu’augmenter la température ?
Non, même si les deux interagissent. La température règle la variété de chaque réponse. Le meilleur de N porte sur le nombre que vous prenez et sur votre façon de choisir. Un peu de variété aide, car des candidates identiques ne laissent rien à départager.
Puis-je utiliser des modèles différents pour les candidates ?
Oui, et cela aide souvent : les modèles échouent différemment, donc le lot est plus varié que des échantillons répétés d’un seul. À ce stade vous êtes proche du consensus, avec sélection au lieu d’accord.
Cela aide-t-il pour l’exactitude factuelle ?
Seulement si votre sélecteur détecte les erreurs factuelles. Sans contrôle externe, vous choisissez entre des réponses assurées, et l’assurance n’est pas l’exactitude.

Essayez plutôt que de lire

Le meilleur de N est l’un des 9 modes d’orchestration de ClawAI, et chaque candidate produite est consignée au regard du coût de l’exécution.