Como o RAG faz a IA responder com seus documentos
RAG (retrieval-augmented generation) é a técnica que busca trechos relevantes dos seus documentos num banco vetorial e injeta esse texto no prompt antes da IA responder, sem treinar o modelo de novo. Diferente do fine-tuning, que muda os pesos do modelo, o RAG muda só o que o modelo lê antes de responder.
Monte o seu agente e veja ele respondendo com as informações do seu negócio.
Criar meu agente de graça Montar é livre, sem cadastro e sem cartão.O que você vai encontrar neste artigo
Em resumo
- RAG busca trechos dos seus documentos num banco vetorial antes de responder.
- Embeddings viram vetores de texto; chunking divide documentos em pedaços pesquisáveis.
- Fine-tuning muda os pesos do modelo; RAG só muda o que ele lê.
O que é RAG na prática
RAG significa retrieval-augmented generation, ou geração aumentada por busca. A ideia central é simples: antes de responder, o modelo busca trechos de texto relevantes num banco de dados e cola esses trechos dentro do prompt. O modelo não aprende nada novo. Ele só lê um texto extra na hora de responder.
- O usuário faz uma pergunta.
- O sistema transforma essa pergunta num embedding (um vetor de números).
- O banco vetorial procura os pedaços de texto com embedding mais parecido.
- Esses pedaços entram no prompt, junto com a pergunta original.
- O modelo de linguagem gera a resposta usando esse texto como base.
RAG não muda o modelo. Ele muda o que o modelo lê antes de responder.
Como funcionam os embeddings no RAG
Embedding é um vetor de números que representa o significado de um texto. Frases parecidas em sentido ficam com vetores próximos no espaço; frases sem relação ficam distantes. Um modelo de embedding transforma cada frase, parágrafo ou documento nesse vetor antes de guardar no banco.
A busca não compara palavras iguais, compara distância entre vetores, normalmente usando similaridade de cosseno. É por isso que uma pergunta como 'como cancelar minha assinatura' acha um trecho que fala em 'encerrar o plano', mesmo sem repetir as mesmas palavras. Modelos de embedding conhecidos incluem os da OpenAI, os da Cohere e opções abertas como a família BGE.
O que é chunking e por que ele importa
Chunking é dividir um documento grande em pedaços menores antes de gerar os embeddings. Um contrato de 40 páginas não cabe inteiro numa busca útil: o sistema precisa achar o parágrafo certo, não o documento inteiro. Cada pedaço vira um embedding separado e entra no banco vetorial como um item independente.
Qual o tamanho certo para um chunk?
Não existe tamanho único. Chunk pequeno demais perde contexto: o trecho recuperado não faz sentido sozinho. Chunk grande demais dilui o significado: o embedding mistura vários assuntos e a busca fica menos precisa.
- Textos com definições curtas: chunks pequenos, de um parágrafo.
- Manuais e contratos com raciocínio encadeado: chunks maiores, com sobreposição entre pedaços vizinhos.
- Sobreposição de frases entre chunks evita cortar uma ideia no meio.
O que é banco vetorial e para que serve
Banco vetorial é o banco de dados feito para guardar embeddings e achar os mais parecidos rápido, mesmo com milhões de itens. Ele usa índices como HNSW para encontrar vizinhos próximos sem comparar vetor por vetor um por um; uma busca exata seria lenta demais em escala.
| Tipo | Exemplo | Quando usar |
|---|---|---|
| Banco vetorial dedicado | Pinecone, Weaviate, Qdrant | Projeto que já nasce em escala, com time de dados |
| Extensão de banco relacional | pgvector no Postgres | Time que já usa Postgres e quer menos peças novas |
| Busca local | Chroma, FAISS | Protótipo, teste ou projeto pequeno sem servidor dedicado |
Para um protótipo ou uma base pequena, pgvector dentro do Postgres já resolve. Só vale trocar por um banco vetorial dedicado quando o volume de documentos ou o número de buscas por segundo pedir um servidor a mais para manter.
RAG ou fine-tuning: qual usar
Fine-tuning é treinar o modelo de novo com exemplos, mudando os pesos internos dele. O modelo passa a 'saber' aquilo de cor, sem precisar buscar nada na hora da resposta. RAG faz o oposto: o modelo continua o mesmo, e o conhecimento novo entra como texto no prompt, a cada pergunta.
| Critério | RAG | Fine-tuning |
|---|---|---|
| Dado muda com frequência | Atualiza na hora, só troca o documento | Precisa treinar de novo a cada mudança |
| Custo para manter | Menor, é mais texto no prompt | Maior, exige rodada de treino |
| Ensinar um tom ou estilo de resposta | Fraco nisso | Forte nisso |
| Mostrar de onde veio a resposta | Fácil, dá pra citar o trecho | Difícil, a resposta se mistura nos pesos |
Para responder com base em documentos que mudam, como contrato, manual ou base de conhecimento, RAG é a escolha certa. Fine-tuning vale quando o objetivo é mudar o jeito do modelo escrever ou raciocinar, não o que ele sabe.
Quando o RAG não funciona bem
RAG depende inteiro da qualidade da busca. Se o chunk certo não é achado, o modelo responde sem essa informação e pode inventar uma resposta que soa certa mesmo assim. Isso não é falha do RAG em si; é falha de busca, que geralmente vem de chunking ruim ou de uma pergunta escrita muito diferente do documento original.
- Perguntas que exigem juntar informação espalhada em vários documentos diferentes
- Perguntas que pedem comparar números que estão em várias tabelas
- Base de documentos desatualizada ou com informação contraditória entre arquivos
Nesses casos, aumentar o número de trechos buscados de uma vez ajuda um pouco. Mas o ganho maior quase sempre vem de revisar o chunking e testar a busca com perguntas reais antes de confiar no sistema em produção.
Leia também
Perguntas frequentes
- RAG substitui o fine-tuning?
- Não. Eles resolvem problemas diferentes: RAG traz informação nova para o prompt, fine-tuning muda o comportamento do modelo. Muitos sistemas usam os dois juntos.
- Preciso saber matemática para usar RAG?
- Não. As bibliotecas de embedding e os bancos vetoriais escondem a conta de similaridade; o trabalho do desenvolvedor é escolher o modelo de embedding certo e ajustar o chunking.
- RAG funciona com PDF e planilha?
- Sim, desde que o texto seja extraído antes do chunking. Tabela e imagem dentro do PDF costumam precisar de um passo extra de conversão para não perder a estrutura.
- Quanto custa montar um sistema de RAG?
- O custo depende do modelo de embedding, do banco vetorial escolhido e do volume de texto guardado. Consulte a página de preços oficial de cada provedor antes de decidir.