Vai al contenuto principale

Contesto

Che cos’è il RAG (generazione aumentata dal recupero)?

Il RAG recupera i passaggi rilevanti dai tuoi documenti e li mette davanti al modello. Come la suddivisione e la qualità del recupero decidono se funziona.

Tutte le guide · Ultima verifica:

Come funziona

I documenti vengono divisi in blocchi e ogni blocco è convertito in un vettore, una rappresentazione numerica del suo significato. La domanda è convertita allo stesso modo, e vengono recuperati i blocchi i cui vettori sono più vicini.

Quei blocchi vengono inseriti nel prompt, di solito con l’istruzione di rispondere a partire da essi. Il modello fa il lavoro linguistico; il recupero fa il sapere.

La qualità del recupero è tutto il sistema

Se il passaggio giusto non viene recuperato, nessun modello salverà la risposta: risponderà con conoscenze generali e suonerà altrettanto sicuro. Quasi tutti i sistemi RAG deludenti sono problemi di recupero travestiti da generazione.

La suddivisione è dove si decide. Blocchi troppo piccoli perdono il contesto che li rendeva significativi; troppo grandi e ciascuno diluisce la corrispondenza. Suddividere secondo la struttura del documento — sezioni, titoli — batte di solito la suddivisione a lunghezza fissa.

Cosa risolve e cosa no

Il RAG risolve «il modello non ha mai visto i miei documenti». Riduce le allucinazioni sulle domande a cui i documenti rispondono, perché la risposta è davanti al modello.

Non risolve il ragionamento e non impedisce al modello di rispondere a memoria quando il recupero non restituisce nulla di utile. L’ancoraggio è una forte tendenza, non una garanzia, e la modalità di fallimento è una risposta sicura senza fonte.

Domande frequenti

Il RAG è lo stesso del fine-tuning?
No, e risolvono problemi diversi. Il fine-tuning cambia come si comporta un modello; il RAG cambia cosa sa per una richiesta. Per «rispondi a domande sui miei documenti», il RAG è quasi sempre lo strumento giusto e molto più economico da tenere aggiornato.
Le finestre grandi rendono il RAG obsoleto?
No. Puoi incollare di più, ma paghi ogni token a ogni messaggio e i modelli distribuiscono male l’attenzione su input molto lunghi. Il recupero è anche l’unico approccio che scala oltre ciò che sta in qualsiasi finestra.
Il RAG manda i miei documenti al fornitore del modello?
I passaggi recuperati sì, perché è così che il modello li vede. Se è inaccettabile, il modello deve girare in un posto che controlli, ed è a questo che serve l’esecuzione locale.

Provalo invece di leggerne

ClawAI recupera dai file che alleghi e lo combina con l’esecuzione locale, così i passaggi recuperati possono restare sul tuo hardware.