Fondamenti
Prompting vs. RAG vs. fine-tuning: qual è la differenza?
Tre modi diversi di cambiare ciò che un modello produce: istruzioni migliori, contesto recuperato o un modello modificato. Cosa risolve davvero ciascuno, cosa non può risolvere, e perché molti prodotti non hanno mai bisogno del terzo.
Tutte le guide · Ultima verifica:
Tre soluzioni diverse per tre problemi diversi
Il prompting cambia ciò che dici al modello per una richiesta: istruzioni, esempi, regole di formattazione. La generazione aumentata dal recupero, o RAG, cambia ciò che il modello può vedere per una richiesta, recuperando materiale pertinente e aggiungendolo al contesto — vedi cos’è il RAG per come funziona questo passaggio di recupero. Il fine-tuning cambia il modello stesso, regolando i suoi pesi in modo che uno schema venga incorporato e disponibile senza doverlo ripetere ogni volta. Non sono tre livelli di difficoltà della stessa soluzione; rispondono a tre tipi diversi di lacuna.
Il prompting cambia solo la richiesta che hai davanti
Un prompt è fatto di istruzioni, esempi e vincoli inclusi in un’unica richiesta. Nulla di tutto ciò persiste una volta arrivata la risposta — la richiesta successiva riparte dallo stesso foglio bianco a meno che tu non includa di nuovo le stesse istruzioni. Questo rende il prompting la tecnica più economica e veloce su cui iterare: una modifica di formulazione si testa in pochi secondi, senza infrastruttura né riaddestramento.
Il prompting è anche la prima cosa da esaurire prima di ricorrere a qualsiasi altra cosa. Una quota sorprendente di problemi del tipo "il modello non sa fare X" sono in realtà problemi del tipo "le istruzioni non hanno mai detto di fare X".
Il RAG aggiunge fatti e documenti senza toccare il modello
Il RAG risolve un problema diverso: informazioni su cui il modello non è mai stato addestrato, o informazioni che cambiano troppo in fretta perché l’addestramento possa starci dietro — i tuoi documenti, dati aggiornati, qualsiasi cosa privata. Invece di insegnare quell’informazione al modello, un passaggio di recupero trova i brani pertinenti e li inserisce direttamente nella richiesta come contesto, usando gli embedding per cercare per significato invece che per formulazione esatta — vedi cosa sono gli embedding per come funziona questa ricerca sotto il cofano.
Poiché nel modello non cambia nulla, aggiornare i documenti sottostanti aggiorna immediatamente ciò a cui il sistema può rispondere, senza alcun passaggio di riaddestramento. Il compromesso è che la qualità della risposta è limitata dalla qualità del recupero: se il brano giusto non viene mai trovato, il modello non può usare un’informazione che non ha mai visto.
Il fine-tuning cambia il modello stesso
Il fine-tuning regola i pesi di un modello usando esempi di addestramento aggiuntivi, in modo che uno schema di comportamento — un tono, un formato di risposta, un’abilità specializzata dimostrata negli esempi — diventi parte del modello invece di qualcosa da ripetere in ogni prompt o fornire tramite recupero. Una volta addestrato, il modello si comporta così per impostazione predefinita, su qualsiasi richiesta, senza istruzioni aggiuntive.
Ha anche costi reali che prompting e RAG non hanno: gli esempi di addestramento vanno preparati e curati, un’esecuzione di addestramento va eseguita e valutata, e il risultato è un artefatto di modello specifico che va ospitato e mantenuto sincronizzato mano a mano che i modelli base migliorano. Il fine-tuning non aggiunge nemmeno fatti in tempo reale o mutevoli: incorpora uno schema da un set di addestramento fisso, e diventa obsoleto come qualsiasi addestramento statico.
Far corrispondere la tecnica al fallimento reale, non all’opzione più sofisticata
Tono sbagliato, formato sbagliato, istruzioni ignorate: di solito un problema di prompting. Fatti sbagliati o mancanti, specialmente su materiale proprio o che cambia in fretta: di solito un problema di recupero. Un comportamento specializzato che vuoi applicato in modo coerente, a ogni richiesta, senza doverlo rispiegare ogni volta: il caso per cui il fine-tuning è davvero pensato. Non si escludono a vicenda — a un modello con fine-tuning si può comunque dare un prompt e contesto recuperato — ma ciascuna risolve solo il fallimento per cui è costruita, e usare quella sbagliata lascia irrisolto il problema reale aggiungendo costo e complessità.
Perché molti prodotti non ricorrono mai al fine-tuning
Prompting e RAG lasciano intatto il modello sottostante, quindi passare a un modello base più recente o migliore è per lo più solo un cambio di configurazione. Un modello con fine-tuning resta legato al modello base da cui è stato addestrato — un aggiornamento significativo del modello base di solito significa ripreparare i dati e riaddestrare invece di semplicemente passare all’altro. Per questo molti prodotti risolvono l’intero problema con prompting più recupero, e ricorrono al fine-tuning solo quando un comportamento specifico e ben definito deve restare coerente su un volume enorme di richieste senza il costo di ripetere istruzioni e contesto ogni volta.
Domande frequenti
- Il RAG aggiorna la conoscenza del modello in modo permanente?
- No. Il RAG cambia ciò che è incluso nel contesto di una richiesta; il modello sottostante non viene mai modificato. La richiesta successiva che non recupera lo stesso materiale riparte senza di esso, esattamente come qualsiasi altro prompt.
- Il fine-tuning è sempre più accurato del prompting o del RAG?
- No. Il fine-tuning incorpora uno schema dai suoi esempi di addestramento, ma non aggiunge fatti assenti da quei dati di addestramento, e non mantiene i fatti aggiornati come può fare il recupero. Un modello con fine-tuning può comunque sbagliare con sicurezza su tutto ciò che è fuori dal suo addestramento.
- Prompting, RAG e fine-tuning si possono combinare?
- Sì. Cambiano parti diverse del sistema, quindi a un modello con fine-tuning si può comunque dare contesto recuperato e istruzioni esplicite nella stessa richiesta. Combinarli è comune; non serve trattarli come scelte reciprocamente esclusive.
- Quale dovrei provare per primo?
- Il prompting, quasi sempre. Non richiede infrastruttura e una modifica di formulazione si testa in pochi secondi. Passa al recupero quando la lacuna è informazione mancante o obsoleta, e considera il fine-tuning solo quando un comportamento specifico e ben definito deve restare coerente su un volume di richieste abbastanza grande da giustificare il costo di addestramento e manutenzione.
Provalo invece di leggerne
I pacchetti di contesto di ClawAI e il recupero da file e workspace aggiungono materiale pertinente a una richiesta senza toccare il modello sottostante; ClawAI non offre fine-tuning dei modelli — i modelli cloud e locali verso cui instrada vengono usati così come sono già addestrati.