Saltar para o conteúdo principal

Recurso

Laboratórios de orquestração: comparar, julgar, consenso, escalonamento

Os laboratórios da ClawAI que colocam vários modelos no mesmo prompt — Compare com Judge e Critic, Consensus, Escalation, Best-of-N, Verify, Repair, Pipelines e outros.

Todos os recursos · Última revisão:

Compare, com um juiz e um crítico

O Compare envia um único prompt a vários modelos e mostra as respostas lado a lado, com latência e contagem de tokens. Ative o Judge e um modelo independente pontua cada resposta segundo critérios explícitos; ative o Critic e ele registra por escrito os pontos fracos de cada uma. O Compare também funciona dentro de uma conversa comum, então você pode checar uma resposta sem sair dela.

Consenso e escalonamento

O Consensus faz a mesma pergunta a dois a cinco modelos e sintetiza uma única resposta a partir dos pontos em que concordam, sinalizando onde divergem. O Escalation começa com um modelo barato e só sobe na cadeia quando a resposta não é suficiente, para que você pague por um modelo forte apenas quando a pergunta realmente precisa dele.

Verificar, reparar e o restante da bancada

O Best-of-N gera vários candidatos e fica com o mais forte. O Verify coloca um segundo modelo para checar se uma resposta está correta. O Repair corrige um defeito específico de uma resposta existente em vez de gerá-la de novo. O Decompose divide uma tarefa grande em etapas. Os Role packs passam um problema entre modelos especializados por papel, o Cost ensemble equilibra qualidade e gasto, e os Pipelines encadeiam várias etapas em um único fluxo nomeado e reexecutável.

Cada laboratório é habilitado por plano pelo operador, e as execuções dos laboratórios são medidas separadamente do chat comum — Compare, Judge e Critic em superfícies próprias, os demais laboratórios na superfície de orquestração.

Perguntas frequentes

Qual é a diferença entre Compare e Consensus?
O Compare mostra a resposta de cada modelo lado a lado e deixa o veredito com você, opcionalmente com uma nota do Judge. O Consensus funde as respostas em uma só e sinaliza os pontos em que os modelos discordam.
Como o escalonamento economiza dinheiro?
Ele começa com um modelo mais barato e só passa para um mais forte quando a resposta não atinge o nível esperado, então perguntas fáceis nunca pagam pelo modelo mais caro.
Os laboratórios estão em todos os planos?
Cada laboratório é ativado por plano pelo operador, então a disponibilidade depende do seu plano. A página de preços lista o que cada plano inclui.

Experimente em vez de confiar na nossa palavra

Compare, Consensus, Escalation, Repair, Decompose, Best-of-N, Verify, Pipeline, Cost ensemble e Role pack estão disponíveis, cada um com sua própria página, endpoint e cartão de resultado.