Vai al contenuto principale

Orchestrazione

Che cos’è il campionamento best-of-N?

Il best-of-N genera più risposte candidate e tiene la migliore. Come si scelgono, perché il selettore conta più di N e quando batte un buon prompt.

Tutte le guide · Ultima verifica:

Perché funziona

L’output di un modello linguistico è campionato, non deterministico. Due esecuzioni dello stesso prompt danno risposte diverse di qualità variabile. Se le buone superano le cattive, prendere più campioni aumenta la probabilità che almeno una sia buona.

È tutto il meccanismo. Non rende il modello più intelligente; ti dà più tentativi sulla capacità che già ha.

Scegliere la vincitrice è la parte difficile

Generare candidate è facile. Sceglierne una è il problema vero, ed è lì che sta gran parte del valore della tecnica e gran parte dei suoi fallimenti.

La selezione tramite controllo automatico — compila, i test passano, lo schema è rispettato — è di gran lunga la più affidabile, perché il controllo è indipendente dal modello. La selezione tramite un altro modello è un giudice, con tutte le riserve di quella pagina. La selezione umana è la più accurata e la meno scalabile.

Scegliere N

I rendimenti calano in fretta. Da una candidata a tre è un grande miglioramento; da tre a dieci è piccolo a più del triplo del costo. Quasi tutti gli usi pratici stanno tra tre e cinque.

N moltiplica il costo esattamente. Cinque candidate sono cinque volte i token di generazione, più quanto costa la selezione.

Quando non usarlo

Se non hai modo di distinguere una risposta buona da una cattiva, il best-of-N non può aiutarti: sceglierai a caso da un mucchio più grande pagando di più. Il suo terreno naturale è il lavoro con controllo oggettivo: codice, output strutturato, tutto ciò che si analizza oppure no.

Domande frequenti

Il best-of-N equivale ad alzare la temperatura?
No, anche se interagiscono. La temperatura regola quanto varia ogni risposta. Il best-of-N riguarda quante ne prendi e come scegli. Un po’ di varietà aiuta, perché candidate identiche non lasciano nulla da scegliere.
Posso usare modelli diversi per le candidate?
Sì, e spesso aiuta: i modelli falliscono in modi diversi, quindi il gruppo è più vario di campioni ripetuti da uno solo. A quel punto sei vicino al consenso, con selezione al posto dell’accordo.
Aiuta con l’accuratezza fattuale?
Solo se il tuo selettore rileva errori fattuali. Senza un controllo esterno stai scegliendo tra risposte sicure di sé, e la sicurezza non è accuratezza.

Provalo invece di leggerne

Il best-of-N è una delle 9 modalità di orchestrazione di ClawAI, e ogni candidata generata viene registrata a fronte del costo dell’esecuzione.