Saltar para o conteúdo principal

Contexto

O que é RAG (geração aumentada por recuperação)?

O RAG recupera trechos relevantes dos seus documentos e os coloca diante do modelo. Como a divisão em blocos e a qualidade da recuperação decidem o resultado.

Todos os guias · Última revisão:

Como funciona

Os documentos são divididos em blocos e cada bloco é convertido em vetor — uma representação numérica do seu significado. A pergunta é convertida do mesmo jeito, e os blocos com vetores mais próximos são recuperados.

Esses blocos são inseridos no prompt, normalmente com a instrução de responder a partir deles. O modelo faz o trabalho de linguagem; a recuperação faz o saber.

A qualidade da recuperação é o sistema inteiro

Se o trecho certo não for recuperado, nenhum modelo salva a resposta: ele responderá com conhecimento geral e soará igualmente confiante. Quase todo sistema RAG decepcionante é um problema de recuperação fantasiado de geração.

A divisão em blocos é onde isso se decide. Blocos pequenos demais perdem o contexto que os tornava significativos; grandes demais e cada um dilui a correspondência. Dividir pela estrutura do documento — seções, títulos — costuma vencer a divisão por tamanho fixo.

O que resolve e o que não resolve

O RAG resolve «o modelo nunca viu meus documentos». Reduz alucinações em perguntas que os documentos respondem, porque a resposta está diante do modelo.

Não resolve raciocínio, e não impede o modelo de responder de memória quando a recuperação não traz nada útil. O ancoramento é uma tendência forte, não uma garantia, e o modo de falha é uma resposta confiante sem fonte.

Perguntas frequentes

RAG é o mesmo que fine-tuning?
Não, e resolvem problemas diferentes. O fine-tuning muda como um modelo se comporta; o RAG muda o que ele sabe para uma requisição. Para «responda perguntas sobre meus documentos», o RAG é quase sempre a ferramenta certa e muito mais barato de manter atualizado.
Janelas de contexto grandes tornam o RAG obsoleto?
Não. Você pode colar mais, mas paga cada token em cada mensagem e os modelos distribuem mal a atenção em entradas muito longas. A recuperação também é a única abordagem que escala além do que cabe em qualquer janela.
O RAG manda meus documentos ao provedor do modelo?
Os trechos recuperados, sim — é assim que o modelo os vê. Se isso for inaceitável, o modelo precisa rodar num lugar que você controla, e é para isso que serve a execução local.

Experimente em vez de ler sobre isso

O ClawAI recupera dos arquivos que você anexa e combina isso com execução local, para que os trechos recuperados possam ficar no seu próprio hardware.