Fundamentos
Prompting vs. RAG vs. fine-tuning: ¿en qué se diferencian?
Tres formas distintas de cambiar lo que produce un modelo: mejores instrucciones, contexto recuperado o un modelo modificado. Qué arregla realmente cada una, qué no puede arreglar, y por qué muchos productos nunca necesitan la tercera.
Todas las guías · Última revisión:
Tres arreglos distintos para tres problemas distintos
El prompting cambia lo que le dices al modelo para una petición: instrucciones, ejemplos, reglas de formato. La generación aumentada por recuperación, o RAG, cambia lo que el modelo puede ver en una petición, recuperando material relevante y añadiéndolo al contexto —consulta qué es RAG para ver cómo funciona ese paso de recuperación—. El fine-tuning cambia el modelo mismo, ajustando sus pesos para que un patrón quede fijado y disponible sin repetirlo cada vez. No son tres niveles de dificultad de un mismo arreglo; responden a tres tipos distintos de carencia.
El prompting solo cambia la petición que tienes delante
Un prompt son instrucciones, ejemplos y restricciones incluidos en una única petición. Nada de eso persiste una vez llega la respuesta: la siguiente petición vuelve a partir del mismo estado en blanco a menos que incluyas de nuevo las mismas instrucciones. Esto hace del prompting la técnica más barata y rápida para iterar: un cambio de redacción se puede probar en segundos, sin infraestructura ni reentrenamiento.
El prompting también es lo primero que conviene agotar antes de recurrir a cualquier otra cosa. Una proporción sorprendente de problemas de "el modelo no sabe hacer X" son en realidad problemas de "las instrucciones nunca dijeron que hiciera X".
RAG añade hechos y documentos sin tocar el modelo
RAG resuelve un problema distinto: información con la que el modelo nunca se entrenó, o información que cambia demasiado rápido para que el entrenamiento le siga el ritmo —tus propios documentos, registros actuales, cualquier cosa privada—. En vez de enseñarle esa información al modelo, un paso de recuperación encuentra los pasajes relevantes y los coloca directamente en la petición como contexto, usando embeddings para buscar por significado en vez de por el texto exacto —consulta qué son los embeddings para ver cómo funciona esa búsqueda por debajo—.
Como nada del modelo cambia, actualizar los documentos subyacentes actualiza al instante lo que el sistema puede responder, sin ningún paso de reentrenamiento. La contrapartida es que la calidad de la respuesta está limitada por la calidad de la recuperación: si el pasaje correcto nunca se encuentra, el modelo no puede usar información que nunca vio.
El fine-tuning cambia el propio modelo
El fine-tuning ajusta los pesos de un modelo usando ejemplos de entrenamiento adicionales, de modo que un patrón de comportamiento —un tono, un formato de respuesta, una habilidad especializada demostrada en los ejemplos— pasa a formar parte del modelo en vez de algo que tienes que repetir en cada prompt o aportar mediante recuperación. Una vez entrenado, el modelo se comporta así por defecto, en cualquier petición, sin instrucciones adicionales.
También tiene costes reales que el prompting y el RAG no tienen: hay que preparar y seleccionar ejemplos de entrenamiento, hay que ejecutar y evaluar una ronda de entrenamiento, y el resultado es un artefacto de modelo específico que hay que alojar y mantener sincronizado a medida que mejoran los modelos base. El fine-tuning tampoco añade hechos vivos o cambiantes: fija un patrón a partir de un conjunto de entrenamiento fijo, y queda desactualizado igual que cualquier entrenamiento estático.
Ajusta la técnica al fallo real, no a la opción más sofisticada
Tono equivocado, formato equivocado, instrucciones pasadas por alto: normalmente un problema de prompting. Hechos erróneos o ausentes, sobre todo de material propio o que cambia rápido: normalmente un problema de recuperación. Un comportamiento especializado que quieres que se aplique de forma constante, en cada petición, sin volver a explicarlo cada vez: el caso para el que realmente está pensado el fine-tuning. No son mutuamente excluyentes —un modelo con fine-tuning puede seguir recibiendo un prompt y contexto recuperado—, pero cada técnica solo arregla el fallo para el que está construida, y usar la equivocada deja el problema real sin resolver mientras añade coste y complejidad.
Por qué muchos productos nunca recurren al fine-tuning
El prompting y el RAG dejan intacto el modelo subyacente, así que actualizar a un modelo base más nuevo o mejor suele ser solo un cambio de configuración. Un modelo con fine-tuning queda atado al modelo base del que se entrenó: una actualización relevante del modelo base suele implicar volver a preparar datos y reentrenar en vez de simplemente cambiar. Por eso muchos productos resuelven todo su problema con prompting más recuperación, y solo recurren al fine-tuning cuando un comportamiento específico y bien definido necesita ser constante en un volumen enorme de peticiones sin el coste de repetir instrucciones y contexto cada vez.
Preguntas frecuentes
- ¿RAG actualiza el conocimiento del modelo de forma permanente?
- No. RAG cambia lo que se incluye en el contexto de una petición; el modelo subyacente nunca se modifica. La siguiente petición que no recupere el mismo material empieza sin él, igual que cualquier otro prompt.
- ¿El fine-tuning es siempre más preciso que el prompting o el RAG?
- No. El fine-tuning fija un patrón a partir de sus ejemplos de entrenamiento, pero no añade hechos ausentes de esos datos de entrenamiento, y no mantiene los hechos al día como puede hacerlo la recuperación. Un modelo con fine-tuning puede seguir estando equivocado con total confianza sobre cualquier cosa fuera de lo que se le entrenó.
- ¿Se pueden combinar prompting, RAG y fine-tuning?
- Sí. Cambian partes distintas del sistema, así que un modelo con fine-tuning puede seguir recibiendo contexto recuperado e instrucciones explícitas en la misma petición. Combinarlos es habitual; no hace falta tratarlos como opciones mutuamente excluyentes.
- ¿Cuál debería probar primero?
- El prompting, casi siempre. No requiere infraestructura y un cambio de redacción se puede probar en segundos. Pasa a la recuperación cuando la carencia sea información ausente o desactualizada, y considera el fine-tuning solo cuando un comportamiento específico y bien definido deba ser constante en un volumen de peticiones lo bastante grande como para justificar el coste de entrenamiento y mantenimiento.
Pruébalo en lugar de leer sobre ello
Los paquetes de contexto de ClawAI y la recuperación de archivos y del espacio de trabajo añaden material relevante a una petición sin tocar el modelo subyacente; ClawAI no ofrece fine-tuning de modelos: los modelos en la nube y locales a los que enruta se usan tal como ya están entrenados.