Saltar al contenido principal

Función

Laboratorios de orquestación: comparar, juzgar, consenso, escalado

Los laboratorios de ClawAI que ponen a varios modelos sobre un mismo prompt: Compare con Judge y Critic, Consensus, Escalation, Best-of-N, Verify, Repair, Pipelines y más.

Todas las funciones · Última revisión:

Compare, con un juez y un crítico

Compare envía un mismo prompt a varios modelos y muestra sus respuestas lado a lado con la latencia y el recuento de tokens. Activa Judge y un modelo independiente puntúa cada respuesta según criterios explícitos; activa Critic y anota los puntos débiles de cada una. Compare también funciona dentro de un hilo normal, así que puedes contrastar una sola respuesta sin salir de la conversación.

Consenso y escalado

Consensus plantea la misma pregunta a entre dos y cinco modelos y sintetiza una sola respuesta a partir de sus coincidencias, señalando dónde discrepan. Escalation empieza con un modelo económico y sube por la cadena solo cuando la respuesta se queda corta, así que pagas por un modelo potente cuando la pregunta realmente lo necesita.

Verificar, reparar y el resto del banco de pruebas

Best-of-N genera varios candidatos y se queda con el mejor. Verify hace que un segundo modelo compruebe si una respuesta es correcta. Repair corrige un defecto concreto de una respuesta existente en lugar de regenerarla. Decompose divide una tarea grande en pasos. Role packs pasa un problema entre modelos especializados por rol, Cost ensemble equilibra la calidad con el gasto, y Pipelines encadena varias etapas en un único flujo de trabajo con nombre que se puede volver a ejecutar.

El operador habilita cada laboratorio por plan, y las ejecuciones de los laboratorios se miden por separado del chat normal: Compare, Judge y Critic en sus propias superficies, y los demás laboratorios en la superficie de orquestación.

Preguntas frecuentes

¿Qué diferencia hay entre Compare y Consensus?
Compare muestra la respuesta de cada modelo lado a lado y te deja el veredicto a ti, opcionalmente con una puntuación de Judge. Consensus fusiona las respuestas en una sola y señala los puntos en los que los modelos discrepan.
¿Cómo ahorra dinero el escalado?
Empieza con un modelo más barato y solo pasa a uno más potente cuando la respuesta no alcanza el nivel exigido, así que las preguntas fáciles nunca pagan por el modelo más caro.
¿Los laboratorios están en todos los planes?
El operador activa cada laboratorio por plan, así que la disponibilidad depende de tu plan. La página de precios indica qué incluye cada plan.

Pruébalo en lugar de confiar en nuestra palabra

Compare, Consensus, Escalation, Repair, Decompose, Best-of-N, Verify, Pipeline, Cost ensemble y Role pack se han lanzado cada uno con su propia página, su endpoint y su tarjeta de resultados.