Saltar al contenido principal

Caso de uso

Comparar respuestas de modelos con ClawAI

Cómo los modos Compare y Judge de ClawAI ejecutan un mismo prompt en varios modelos a la vez y hacen que un modelo juez evalúe los resultados — basado en la función real ya publicada, sin rankings inventados.

Todos los casos de uso · Última revisión:

Qué hace el modo Compare

El modo Compare envía un mismo prompt a varios modelos a la vez y muestra las respuestas una junto a otra, de modo que una decisión que importa —un juicio de valor, una solicitud ambigua, un caso en el que el enfoque de un modelo podría estar equivocado— recibe más de una perspectiva. Es una función limitada por plan, medida por carril y no por ejecución, así que el coste crece según cuántos modelos compares.

Consenso y best-of-N, explicados con precisión

Dos ideas describen qué hacer con varias respuestas una vez que las tienes: consenso, donde el propio acuerdo entre modelos aporta información, y best-of-N, donde generas varios candidatos y eliges o sintetizas el más fuerte. Consulta qué es el consenso de IA y qué es best-of-N, ambos enlazados más abajo, para saber cómo funciona cada uno en realidad y no en el discurso comercial.

Hacer que un modelo juzgue el resto

El modo Judge es una función separada, limitada por plan, que ejecuta una segunda pasada sobre una ejecución de Compare, con un modelo evaluando a los demás en lugar de que tú leas cada respuesta a mano. La revisión crítica es una función relacionada pero distinta, para una segunda mirada sobre una sola respuesta en lugar de una comparación entre modelos — consulta qué es un juez de IA, enlazado más abajo, para saber cómo funciona realmente la evaluación.

Preguntas frecuentes

¿Cuál es la diferencia entre el modo Compare y el modo Judge?
El modo Compare ejecuta un mismo prompt en varios modelos y muestra cada respuesta una junto a otra. El modo Judge es una segunda pasada separada, limitada por plan, que hace que un modelo evalúe los resultados de una ejecución de Compare en lugar de que tú leas cada una.
¿El modo Compare cuesta más que un mensaje de chat normal?
El uso de Compare se mide por carril, no por ejecución — comparar el mismo prompt contra más modelos cuesta proporcionalmente más. Confirma el límite vigente en la página de precios.
¿Qué es best-of-N, y es lo mismo que el consenso?
No — el consenso trata el acuerdo entre las respuestas de los modelos como información en sí misma, mientras que best-of-N genera varios candidatos y elige o sintetiza el más fuerte. Consulta qué es el consenso de IA y qué es best-of-N, ambos enlazados más abajo.

Pruébalo en vez de creer solo nuestra palabra

Los modos Compare y Judge de ClawAI son funciones reales, ya publicadas y limitadas por plan — un mismo prompt en varios modelos, con un modelo adicional opcional para evaluar los resultados.