Orquestación
¿Qué es un juez de IA?
Un juez de IA es un modelo que puntúa las respuestas de otros modelos. Para qué se usa, qué sesgos arrastra y por qué no sustituye a una comprobación real.
Todas las guías · Última revisión:
Qué hace un juez
Un juez recibe la pregunta original y dos o más respuestas, y devuelve un orden o una puntuación, normalmente con un motivo. Es el paso de selección del mejor de N y el de arbitraje cuando los modelos discrepan.
El atractivo es evidente: escala como la revisión humana no puede, y es mucho más barato que la persona a la que sustituye.
Los sesgos, que son consistentes
Los jueces prefieren respuestas largas a cortas, aunque la corta esté completa. Prefieren la redacción segura a la matizada, esté o no justificada esa seguridad. Son sensibles al orden en que se presentan las candidatas. Y un modelo al que se pide juzgar su propia salida tiende a preferirla.
Ninguno es sutil y todos son manejables: baraja el orden, usa un modelo distinto como juez y como autor, y pide criterios concretos en vez de una preferencia general. Pero hay que gestionarlos a propósito, porque la configuración por defecto exhibe los cuatro.
Un juez no es un verificador
Un juez compara respuestas entre sí. No las compara con la realidad. Dadas tres respuestas erróneas las ordenará con aplomo, y la ganadora seguirá siendo errónea.
Donde exista una comprobación externa —tests, un esquema, una búsqueda— esa comprobación gana al juez, porque es independiente de lo que se juzga. Un juez es lo que usas cuando no hay tal comprobación.
Preguntas frecuentes
- ¿El juez debería ser el modelo más potente?
- Normalmente uno potente, y preferiblemente distinto del que escribió las candidatas. La autopreferencia existe y la solución más barata es usar otro modelo.
- ¿Puede un juez puntuar una sola respuesta?
- Puede, pero el juicio comparativo es más fiable que la puntuación absoluta. Los modelos se dan mejor con «cuál de estas es mejor» que con «esto es un 7 o un 8».
- ¿Cómo sé que el juez acierta?
- Contrástalo con tu propio criterio sobre una muestra. Si nunca lo compruebas, has desplazado la confianza en vez de ganártela.
Pruébalo en lugar de leer sobre ello
ClawAI ejecuta el juicio como superficie propia sobre una comparación, así que una respuesta puntuada registra tanto los modelos que escribieron las candidatas como el que las juzgó.