Saltar para o conteúdo principal

Contexto

O que é uma janela de contexto?

A janela de contexto é quanto texto um modelo consegue considerar numa requisição. Por que não é memória, por que enchê-la piora a qualidade e como eleva o custo.

Todos os guias · Última revisão:

Não é memória

Um modelo não se lembra da sua conversa anterior. A ilusão de memória vem de a aplicação reenviar as mensagens anteriores a cada nova requisição. A janela é área de trabalho para uma chamada, não armazenamento.

Disso decorre uma consequência direta que as pessoas descobrem por surpresa: uma conversa longa fica mais cara a cada mensagem, porque todo o histórico é reenviado e recobrado toda vez.

Uma janela cheia não é uma janela bem usada

Uma janela grande é uma folga, não uma meta. Modelos distribuem a atenção de forma desigual ao longo de um contexto extenso: o que está no meio de uma entrada muito longa tem mais chance de ser tratado de leve do que o que está nas pontas.

Na prática, dez páginas focadas costumam vencer duzentas dispersas. A recuperação existe justamente para escolher essas dez páginas em vez de mandar tudo e torcer.

Como eleva o custo

Quase todos os provedores cobram por token, entrada e saída separadamente, e a entrada costuma ser mais barata. Um documento grande anexado a cada mensagem de uma conversa longa é cobrado em cada mensagem, não uma vez.

É a causa mais comum de uma conta surpreendente, e a solução é estrutural: anexe o que a pergunta precisa em vez de tudo que possa ser relevante.

Perguntas frequentes

Uma janela maior é sempre melhor?
Ela remove um limite, o que é bom, mas não melhora como o modelo usa o que recebe. Uma janela maior compra principalmente a possibilidade de cometer um erro mais caro.
O que é um token?
Aproximadamente um fragmento de palavra. Em inglês dá cerca de três quartos de palavra por token, então mil tokens são umas setecentas e cinquenta palavras — mas isso varia por idioma, e alfabetos não latinos costumam gastar mais tokens por palavra.
O que acontece se eu exceder?
A requisição falha, ou a aplicação descarta em silêncio as mensagens mais antigas. O segundo caso é mais comum e mais confuso, porque o modelo parece esquecer algo que você disse.

Experimente em vez de ler sobre isso

O ClawAI registra os tokens que cada mensagem consumiu, então uma conversa que está ficando cara aparece antes da fatura, não depois.