Orchestrazione
Che cos’è il campionamento best-of-N?
Il best-of-N genera più risposte candidate e tiene la migliore. Come si scelgono, perché il selettore conta più di N e quando batte un buon prompt.
Tutte le guide · Ultima verifica:
Perché funziona
L’output di un modello linguistico è campionato, non deterministico. Due esecuzioni dello stesso prompt danno risposte diverse di qualità variabile. Se le buone superano le cattive, prendere più campioni aumenta la probabilità che almeno una sia buona.
È tutto il meccanismo. Non rende il modello più intelligente; ti dà più tentativi sulla capacità che già ha.
Scegliere la vincitrice è la parte difficile
Generare candidate è facile. Sceglierne una è il problema vero, ed è lì che sta gran parte del valore della tecnica e gran parte dei suoi fallimenti.
La selezione tramite controllo automatico — compila, i test passano, lo schema è rispettato — è di gran lunga la più affidabile, perché il controllo è indipendente dal modello. La selezione tramite un altro modello è un giudice, con tutte le riserve di quella pagina. La selezione umana è la più accurata e la meno scalabile.
Scegliere N
I rendimenti calano in fretta. Da una candidata a tre è un grande miglioramento; da tre a dieci è piccolo a più del triplo del costo. Quasi tutti gli usi pratici stanno tra tre e cinque.
N moltiplica il costo esattamente. Cinque candidate sono cinque volte i token di generazione, più quanto costa la selezione.
Quando non usarlo
Se non hai modo di distinguere una risposta buona da una cattiva, il best-of-N non può aiutarti: sceglierai a caso da un mucchio più grande pagando di più. Il suo terreno naturale è il lavoro con controllo oggettivo: codice, output strutturato, tutto ciò che si analizza oppure no.
Domande frequenti
- Il best-of-N equivale ad alzare la temperatura?
- No, anche se interagiscono. La temperatura regola quanto varia ogni risposta. Il best-of-N riguarda quante ne prendi e come scegli. Un po’ di varietà aiuta, perché candidate identiche non lasciano nulla da scegliere.
- Posso usare modelli diversi per le candidate?
- Sì, e spesso aiuta: i modelli falliscono in modi diversi, quindi il gruppo è più vario di campioni ripetuti da uno solo. A quel punto sei vicino al consenso, con selezione al posto dell’accordo.
- Aiuta con l’accuratezza fattuale?
- Solo se il tuo selettore rileva errori fattuali. Senza un controllo esterno stai scegliendo tra risposte sicure di sé, e la sicurezza non è accuratezza.
Provalo invece di leggerne
Il best-of-N è una delle 9 modalità di orchestrazione di ClawAI, e ogni candidata generata viene registrata a fronte del costo dell’esecuzione.