Saltar para o conteúdo principal

Orquestração

O que é amostragem melhor de N?

O melhor de N gera várias respostas candidatas e fica com a melhor. Como as candidatas são escolhidas e por que o seletor importa mais do que N.

Todos os guias · Última revisão:

Por que funciona

A saída de um modelo de linguagem é amostrada, não determinística. Duas execuções do mesmo prompt dão respostas diferentes de qualidade variável. Se as boas superam as ruins, tirar várias amostras aumenta a chance de pelo menos uma ser boa.

Esse é todo o mecanismo. Não deixa o modelo mais inteligente; dá mais chances sobre a capacidade que ele já tem.

Escolher a vencedora é a parte difícil

Gerar candidatas é fácil. Escolher entre elas é o problema real, e é aí que estão a maior parte do valor da técnica e a maior parte das suas falhas.

A seleção por verificação automática — compila, os testes passam, o esquema é respeitado — é de longe a mais confiável, porque a verificação independe do modelo. A seleção por outro modelo é um juiz, com todas as ressalvas daquela página. A seleção por uma pessoa é a mais exata e a menos escalável.

Escolher N

Os retornos caem rápido. De uma candidata para três é uma melhoria grande; de três para dez é pequena a mais do triplo do custo. Quase todos os usos práticos ficam entre três e cinco.

N multiplica o custo exatamente. Cinco candidatas são cinco vezes os tokens de geração, mais o que a seleção custar.

Quando não usar

Se você não tem como distinguir uma resposta boa de uma ruim, o melhor de N não ajuda: você escolherá ao acaso num monte maior e pagará mais por isso. Seu lugar natural é trabalho com verificação objetiva: código, saída estruturada, qualquer coisa que ou analisa ou não.

Perguntas frequentes

Melhor de N é o mesmo que aumentar a temperatura?
Não, embora interajam. A temperatura controla o quanto cada resposta varia. O melhor de N trata de quantas você pega e de como escolhe. Alguma variedade ajuda, porque candidatas idênticas não dão o que escolher.
Posso usar modelos diferentes para as candidatas?
Sim, e costuma ajudar: modelos falham de formas diferentes, então o conjunto é mais variado do que amostras repetidas de um só. Nesse ponto você está perto do consenso, com seleção no lugar da concordância.
Ajuda na exatidão factual?
Só se o seu seletor detectar erros factuais. Sem verificação externa você escolhe entre respostas confiantes, e confiança não é exatidão.

Experimente em vez de ler sobre isso

O melhor de N é um dos 9 modos de orquestração do ClawAI, e cada candidata gerada fica registrada frente ao custo da execução.