Orquestación
¿Qué es el muestreo mejor de N?
El mejor de N genera varias respuestas candidatas y se queda con la mejor. Cómo se eligen, por qué el selector importa más que N y cuándo gana a un buen prompt.
Todas las guías · Última revisión:
Por qué funciona
La salida de un modelo de lenguaje se muestrea, no es determinista. Dos ejecuciones del mismo prompt dan respuestas distintas y de calidad variable. Si las buenas superan a las malas, tomar varias muestras aumenta la probabilidad de que al menos una lo sea.
Ese es todo el mecanismo. No hace al modelo más listo; te da más oportunidades sobre la capacidad que ya tiene.
Elegir la ganadora es lo difícil
Generar candidatas es fácil. Elegir entre ellas es el problema real, y ahí está casi todo el valor de la técnica y casi todo su fallo.
La selección por comprobación automática —compila, pasa los tests, cumple el esquema— es con diferencia la más fiable, porque la comprobación es independiente del modelo. La selección por otro modelo es un juez, con todas las salvedades de esa página. La selección por una persona es la más exacta y la menos escalable.
Elegir N
Los rendimientos caen deprisa. Pasar de una candidata a tres es una mejora grande; de tres a diez es pequeña y cuesta más del triple. Casi todos los usos prácticos se quedan entre tres y cinco.
N multiplica el coste exactamente. Cinco candidatas son cinco veces los tokens de generación, más lo que cueste la selección.
Cuándo no usarlo
Si no tienes forma de distinguir una respuesta buena de una mala, el mejor de N no puede ayudarte: elegirás al azar de un montón mayor y pagarás más por ello. Su sitio natural es el trabajo con comprobación objetiva: código, salida estructurada, cualquier cosa que se analice o no.
Preguntas frecuentes
- ¿El mejor de N es lo mismo que subir la temperatura?
- No, aunque interactúan. La temperatura controla cuánto varía cada respuesta. El mejor de N va de cuántas tomas y cómo eliges. Algo de variedad ayuda, porque candidatas idénticas no te dan nada entre lo que elegir.
- ¿Puedo usar modelos distintos para las candidatas?
- Sí, y suele ayudar: los modelos fallan de forma distinta, así que el conjunto es más variado que varias muestras de uno. En ese punto estás cerca del consenso, con selección en lugar de acuerdo.
- ¿Ayuda con la exactitud factual?
- Solo si tu selector detecta errores factuales. Sin una comprobación externa estás eligiendo entre respuestas seguras de sí mismas, y la seguridad no es exactitud.
Pruébalo en lugar de leer sobre ello
El mejor de N es uno de los 9 modos de orquestación de ClawAI, y cada candidata que genera queda registrada frente al coste de la ejecución.