Saltar para o conteúdo principal

Caso de uso

Comparar respostas de modelos com a ClawAI

Como os modos Compare e Judge da ClawAI executam um prompt em vários modelos lado a lado e deixam um modelo juiz avaliar os resultados — baseado na funcionalidade real, sem rankings inventados.

Todos os casos de uso · Última revisão:

O que faz o modo Compare

O modo Compare envia um prompt a vários modelos ao mesmo tempo e mostra as respostas lado a lado, para que uma decisão importante — uma questão de julgamento, um pedido ambíguo, um caso em que a interpretação de um modelo pode estar errada — receba mais do que uma perspetiva. É uma funcionalidade sujeita ao plano, medida por via e não por execução, pelo que o custo aumenta conforme o número de modelos comparados.

Consenso e best-of-N, explicados devidamente

Duas ideias descrevem o que fazer com várias respostas depois de as ter: o consenso, em que a concordância entre modelos já é informativa por si só, e o best-of-N, em que se geram vários candidatos e se escolhe ou sintetiza o mais forte. Veja o que é o consenso de IA e o que é best-of-N, ambos ligados abaixo, para como cada um funciona realmente, sem uma versão de marketing.

Deixar um modelo avaliar os restantes

O modo Judge é uma funcionalidade separada, sujeita ao plano, que executa uma segunda passagem sobre uma execução do Compare, com um modelo a avaliar os restantes em vez de o obrigar a ler cada resposta à mão. A revisão crítica é uma funcionalidade relacionada, mas separada, para um segundo olhar sobre uma única resposta em vez de uma comparação entre modelos — veja o que é um juiz de IA, ligado abaixo, para como a avaliação realmente funciona.

Perguntas frequentes

Qual é a diferença entre o modo Compare e o modo Judge?
O modo Compare executa um prompt em vários modelos e mostra todas as respostas lado a lado. O modo Judge é uma segunda passagem separada, sujeita ao plano, que faz um modelo avaliar os resultados de uma execução do Compare em vez de os ler um a um.
O modo Compare custa mais do que uma mensagem de chat comum?
O uso do Compare é medido por via, não por execução — executar o mesmo prompt contra mais modelos custa proporcionalmente mais. Confirme o limite atual na página de preços.
O que é o best-of-N, e é o mesmo que consenso?
Não — o consenso trata a concordância entre respostas de modelos como informativa por si só, enquanto o best-of-N gera vários candidatos e escolhe ou sintetiza o mais forte. Veja o que é o consenso de IA e o que é best-of-N, ambos ligados abaixo.

Experimente em vez de confiar apenas na nossa palavra

Os modos Compare e Judge da ClawAI são funcionalidades reais, já disponíveis e sujeitas ao plano — um prompt em vários modelos, com um segundo modelo opcional para avaliar os resultados.