Zum Hauptinhalt springen

Kontext

Was ist RAG (Retrieval-Augmented Generation)?

RAG ruft passende Passagen aus Ihren Dokumenten ab und legt sie dem Modell vor. Wie Chunking und Retrieval-Qualität entscheiden, ob es funktioniert.

Alle Erklärungen · Zuletzt geprüft:

Wie es funktioniert

Dokumente werden in Abschnitte geteilt, und jeder Abschnitt wird in einen Vektor umgewandelt — eine numerische Darstellung seiner Bedeutung. Die Frage wird genauso umgewandelt, und die Abschnitte mit den nächstliegenden Vektoren werden abgerufen.

Diese Abschnitte werden in den Prompt eingefügt, meist mit der Anweisung, daraus zu antworten. Das Modell leistet die Sprachar­beit; das Retrieval leistet das Wissen.

Die Retrieval-Qualität ist das ganze System

Wird die richtige Passage nicht abgerufen, kann kein Modell die Antwort retten — es antwortet aus Allgemeinwissen und klingt genauso selbstsicher. Die meisten enttäuschenden RAG-Systeme sind Retrieval-Probleme im Generierungskostüm.

Beim Chunking entscheidet sich das. Zu kleine Abschnitte verlieren den Kontext, der sie bedeutsam machte; zu große verwässern jeweils die Übereinstimmung. Nach Dokumentstruktur zu teilen — Abschnitte, Überschriften — schlägt meist das Teilen nach fester Länge.

Was es behebt und was nicht

RAG behebt „das Modell hat meine Dokumente nie gesehen“. Es verringert Halluzinationen bei Fragen, die die Dokumente beantworten, weil die Antwort dem Modell vorliegt.

Es behebt kein Reasoning und hindert das Modell nicht daran, aus dem Gedächtnis zu antworten, wenn das Retrieval nichts Brauchbares liefert. Erdung ist eine starke Tendenz, keine Garantie, und der Fehlerfall ist eine selbstsichere Antwort ohne Quelle.

Häufige Fragen

Ist RAG dasselbe wie Fine-Tuning?
Nein, und beide lösen andere Probleme. Fine-Tuning ändert, wie sich ein Modell verhält; RAG ändert, was es für eine Anfrage weiß. Für „beantworte Fragen zu meinen Dokumenten“ ist RAG fast immer das richtige Werkzeug und weit günstiger aktuell zu halten.
Machen große Kontextfenster RAG überflüssig?
Nein. Sie können mehr hineinkopieren, zahlen aber jedes Token bei jeder Nachricht, und Modelle achten bei sehr langen Eingaben ungleichmäßig. Retrieval ist zudem der einzige Ansatz, der über das hinausskaliert, was in irgendein Fenster passt.
Schickt RAG meine Dokumente an den Modellanbieter?
Die abgerufenen Passagen ja — so sieht das Modell sie. Ist das inakzeptabel, muss das Modell an einem Ort laufen, den Sie kontrollieren, und genau dafür gibt es lokale Ausführung.

Ausprobieren statt darüber lesen

ClawAI ruft aus Dateien ab, die Sie anhängen, und kombiniert das mit lokaler Ausführung, sodass die abgerufenen Passagen auf Ihrer eigenen Hardware bleiben können.