Contexto
O que é uma janela de contexto?
A janela de contexto é quanto texto um modelo consegue considerar numa requisição. Por que não é memória, por que enchê-la piora a qualidade e como eleva o custo.
Todos os guias · Última revisão:
Não é memória
Um modelo não se lembra da sua conversa anterior. A ilusão de memória vem de a aplicação reenviar as mensagens anteriores a cada nova requisição. A janela é área de trabalho para uma chamada, não armazenamento.
Disso decorre uma consequência direta que as pessoas descobrem por surpresa: uma conversa longa fica mais cara a cada mensagem, porque todo o histórico é reenviado e recobrado toda vez.
Uma janela cheia não é uma janela bem usada
Uma janela grande é uma folga, não uma meta. Modelos distribuem a atenção de forma desigual ao longo de um contexto extenso: o que está no meio de uma entrada muito longa tem mais chance de ser tratado de leve do que o que está nas pontas.
Na prática, dez páginas focadas costumam vencer duzentas dispersas. A recuperação existe justamente para escolher essas dez páginas em vez de mandar tudo e torcer.
Como eleva o custo
Quase todos os provedores cobram por token, entrada e saída separadamente, e a entrada costuma ser mais barata. Um documento grande anexado a cada mensagem de uma conversa longa é cobrado em cada mensagem, não uma vez.
É a causa mais comum de uma conta surpreendente, e a solução é estrutural: anexe o que a pergunta precisa em vez de tudo que possa ser relevante.
Perguntas frequentes
- Uma janela maior é sempre melhor?
- Ela remove um limite, o que é bom, mas não melhora como o modelo usa o que recebe. Uma janela maior compra principalmente a possibilidade de cometer um erro mais caro.
- O que é um token?
- Aproximadamente um fragmento de palavra. Em inglês dá cerca de três quartos de palavra por token, então mil tokens são umas setecentas e cinquenta palavras — mas isso varia por idioma, e alfabetos não latinos costumam gastar mais tokens por palavra.
- O que acontece se eu exceder?
- A requisição falha, ou a aplicação descarta em silêncio as mensagens mais antigas. O segundo caso é mais comum e mais confuso, porque o modelo parece esquecer algo que você disse.
Experimente em vez de ler sobre isso
O ClawAI registra os tokens que cada mensagem consumiu, então uma conversa que está ficando cara aparece antes da fatura, não depois.