Vai al contenuto principale

Contesto

Che cos’è una finestra di contesto?

La finestra di contesto è quanto testo un modello può considerare in una richiesta. Perché non è memoria, perché riempirla peggiora la qualità e come alza il costo.

Tutte le guide · Ultima verifica:

Non è memoria

Un modello non ricorda la tua conversazione precedente. L’illusione di memoria nasce dal fatto che l’applicazione rimanda i messaggi precedenti a ogni nuova richiesta. La finestra è spazio di lavoro per una chiamata, non archiviazione.

Ne segue una conseguenza diretta che molti scoprono per caso: una conversazione lunga diventa più cara a ogni messaggio, perché l’intera cronologia viene rimandata e riaddebitata ogni volta.

Una finestra piena non è una finestra usata bene

Una finestra grande è un margine, non un obiettivo. I modelli distribuiscono l’attenzione in modo disuguale su un contesto lungo: ciò che sta a metà di un input molto lungo rischia più di essere trattato di sfuggita rispetto a ciò che sta agli estremi.

In pratica dieci pagine mirate battono di solito duecento pagine sparse. Il recupero esiste proprio per scegliere quelle dieci pagine invece di mandare tutto e sperare.

Come alza il costo

Quasi tutti i fornitori fatturano a token, input e output separatamente, e l’input di solito costa meno. Un documento grande allegato a ogni messaggio di una conversazione lunga viene addebitato a ogni messaggio, non una volta.

È la causa più comune di una bolletta sorprendente, e il rimedio è strutturale: allega ciò che la domanda richiede invece di tutto ciò che potrebbe servire.

Domande frequenti

Una finestra più grande è sempre meglio?
Toglie un limite, il che è positivo, ma non migliora come il modello usa ciò che riceve. Una finestra più grande ti compra soprattutto la possibilità di commettere un errore più costoso.
Che cos’è un token?
All’incirca un frammento di parola. In inglese si aggira sui tre quarti di parola per token, quindi mille token sono circa settecentocinquanta parole — ma varia molto per lingua, e gli alfabeti non latini spesso consumano più token per parola.
Cosa succede se la supero?
La richiesta fallisce, oppure l’applicazione scarta in silenzio i messaggi più vecchi. Il secondo caso è più frequente e più confuso, perché il modello sembra dimenticare qualcosa che hai detto.

Provalo invece di leggerne

ClawAI registra i token consumati da ogni messaggio: una conversazione che sta diventando cara si vede prima della fattura, non dopo.