Contexto
¿Qué es RAG (generación aumentada por recuperación)?
RAG recupera fragmentos relevantes de tus documentos y los pone delante del modelo. Cómo el troceado y la calidad de la recuperación deciden si funciona.
Todas las guías · Última revisión:
Cómo funciona
Los documentos se trocean y cada fragmento se convierte en un vector, una representación numérica de su significado. La pregunta se convierte igual, y se recuperan los fragmentos cuyos vectores estén más cerca.
Esos fragmentos se insertan en el prompt, normalmente con la instrucción de responder a partir de ellos. El modelo pone el lenguaje; la recuperación pone el conocimiento.
La calidad de la recuperación es todo el sistema
Si el fragmento correcto no se recupera, ningún modelo salva la respuesta: contestará desde su conocimiento general y sonará igual de seguro. Casi todos los sistemas RAG decepcionantes son problemas de recuperación disfrazados de generación.
El troceado es donde se decide. Fragmentos demasiado pequeños pierden el contexto que los hacía significativos; demasiado grandes y cada uno diluye la coincidencia. Trocear por la estructura del documento —secciones, encabezados— suele ganar a trocear por longitud fija.
Qué arregla y qué no
RAG arregla «el modelo nunca ha visto mis documentos». Reduce las alucinaciones en preguntas que los documentos responden, porque la respuesta está delante del modelo.
No arregla el razonamiento, y no impide que el modelo conteste de memoria cuando la recuperación no devuelve nada útil. El anclaje es una tendencia fuerte, no una garantía, y el modo de fallo es una respuesta segura sin fuente.
Preguntas frecuentes
- ¿RAG es lo mismo que el ajuste fino?
- No, y resuelven problemas distintos. El ajuste fino cambia cómo se comporta un modelo; RAG cambia lo que sabe para una petición. Para «responde preguntas sobre mis documentos», RAG es casi siempre la herramienta correcta y mucho más barata de mantener al día.
- ¿Las ventanas de contexto grandes dejan RAG obsoleto?
- No. Puedes pegar más, pero pagas cada token en cada mensaje y los modelos atienden de forma desigual a entradas muy largas. La recuperación es además el único enfoque que escala más allá de lo que cabe en cualquier ventana.
- ¿RAG manda mis documentos al proveedor del modelo?
- Los fragmentos recuperados sí, porque así es como el modelo los ve. Si eso es inaceptable, el modelo tiene que ejecutarse en un sitio que controles, y para eso está la ejecución local.
Pruébalo en lugar de leer sobre ello
ClawAI recupera de los archivos que adjuntas, y lo combina con ejecución local para que los fragmentos recuperados puedan quedarse en tu propio hardware.