Passer au contenu principal

Contexte

Qu’est-ce que le RAG (génération augmentée par récupération) ?

Le RAG récupère les passages pertinents de vos documents et les place devant le modèle. Comment le découpage et la qualité de récupération décident du résultat.

Toutes les explications · Dernière vérification:

Comment cela fonctionne

Les documents sont découpés en morceaux et chaque morceau est converti en vecteur — une représentation numérique de son sens. La question est convertie de la même façon, et les morceaux dont les vecteurs sont les plus proches sont récupérés.

Ces morceaux sont insérés dans le prompt, généralement avec l’instruction d’y répondre à partir d’eux. Le modèle fait le travail de langue ; la récupération fait le savoir.

La qualité de récupération est tout le système

Si le bon passage n’est pas récupéré, aucun modèle ne sauvera la réponse : il répondra depuis ses connaissances générales et paraîtra tout aussi sûr. La plupart des systèmes RAG décevants sont des problèmes de récupération déguisés en génération.

Le découpage est là où cela se joue. Des morceaux trop petits perdent le contexte qui les rendait signifiants ; trop grands, chacun dilue la correspondance. Découper selon la structure du document — sections, titres — bat en général le découpage à longueur fixe.

Ce que cela corrige et ne corrige pas

Le RAG corrige « le modèle n’a jamais vu mes documents ». Il réduit les hallucinations sur les questions auxquelles les documents répondent, car la réponse est sous les yeux du modèle.

Il ne corrige pas le raisonnement et n’empêche pas le modèle de répondre de mémoire quand la récupération ne renvoie rien d’utile. L’ancrage est une forte tendance, pas une garantie, et le mode d’échec est une réponse assurée sans source.

Questions fréquentes

Le RAG est-il la même chose que le fine-tuning ?
Non, et ils résolvent des problèmes différents. Le fine-tuning change le comportement d’un modèle ; le RAG change ce qu’il sait pour une requête. Pour « réponds à des questions sur mes documents », le RAG est presque toujours le bon outil et bien moins cher à maintenir à jour.
Les grandes fenêtres rendent-elles le RAG obsolète ?
Non. Vous pouvez coller davantage, mais vous payez chaque token à chaque message et les modèles répartissent mal leur attention sur de très longues entrées. La récupération est aussi la seule approche qui passe à l’échelle au-delà de ce que contient une fenêtre.
Le RAG envoie-t-il mes documents au fournisseur du modèle ?
Les passages récupérés, oui — c’est ainsi que le modèle les voit. Si c’est inacceptable, le modèle doit tourner à un endroit que vous contrôlez, et c’est le rôle de l’exécution locale.

Essayez plutôt que de lire

ClawAI récupère depuis les fichiers que vous joignez et associe cela à l’exécution locale, pour que les passages récupérés puissent rester sur votre propre matériel.