Vai al contenuto principale

Caso d’uso

Confrontare le risposte dei modelli con ClawAI

Come le modalità Compare e Judge di ClawAI eseguono un prompt su più modelli fianco a fianco e fanno valutare i risultati a un modello giudice — basato sulla funzionalità reale, nessuna classifica inventata.

Tutti gli scenari d’uso · Ultima revisione:

Cosa fa la modalità Compare

La modalità Compare invia un prompt a più modelli contemporaneamente e mostra le risposte fianco a fianco, così una decisione che conta — una valutazione soggettiva, una richiesta ambigua, un caso in cui l’impostazione di un modello potrebbe essere sbagliata — riceve più di una prospettiva. È una funzionalità legata al piano, misurata per corsia anziché per esecuzione, quindi il costo cresce in base a quanti modelli confronti.

Consenso e best-of-N, spiegati correttamente

Due idee descrivono cosa fare con più risposte una volta ottenute: il consenso, in cui l’accordo tra modelli è di per sé informativo, e il best-of-N, in cui generi più candidati e scegli o sintetizzi il migliore. Consulta cos’è il consenso AI e cos’è il best-of-N, entrambi linkati più sotto, per come funziona davvero ciascuno, senza toni pubblicitari.

Far giudicare le risposte a un modello

La modalità Judge è una funzionalità separata, legata al piano, che esegue un secondo passaggio su un’esecuzione di Compare, con un modello che valuta gli altri invece che tu legga ogni risposta a mano. La revisione critica è una funzionalità correlata, ma distinta, per un secondo sguardo su una singola risposta invece che un confronto tra modelli — consulta cos’è un giudice AI, linkato più sotto, per come funziona davvero la valutazione.

Domande frequenti

Qual è la differenza tra la modalità Compare e la modalità Judge?
La modalità Compare esegue un prompt su più modelli e mostra ogni risposta fianco a fianco. La modalità Judge è un secondo passaggio separato, legato al piano, che fa valutare a un modello i risultati di un’esecuzione di Compare invece che tu legga ognuna.
La modalità Compare costa più di un normale messaggio di chat?
L’uso di Compare è misurato per corsia, non per esecuzione — eseguire lo stesso prompt su più modelli costa proporzionalmente di più. Verifica il limite attuale nella pagina dei prezzi.
Cos’è il best-of-N, ed è lo stesso del consenso?
No — il consenso considera informativo di per sé l’accordo tra le risposte dei modelli, mentre il best-of-N genera più candidati e sceglie o sintetizza il migliore. Consulta cos’è il consenso AI e cos’è il best-of-N, entrambi linkati più sotto.

Provalo invece di fidarti della nostra parola

Le modalità Compare e Judge di ClawAI sono funzionalità reali, già disponibili e legate al piano — un prompt su più modelli, con un modello opzionale in più per valutare i risultati.