Contesto
Che cos’è una finestra di contesto?
La finestra di contesto è quanto testo un modello può considerare in una richiesta. Perché non è memoria, perché riempirla peggiora la qualità e come alza il costo.
Tutte le guide · Ultima verifica:
Non è memoria
Un modello non ricorda la tua conversazione precedente. L’illusione di memoria nasce dal fatto che l’applicazione rimanda i messaggi precedenti a ogni nuova richiesta. La finestra è spazio di lavoro per una chiamata, non archiviazione.
Ne segue una conseguenza diretta che molti scoprono per caso: una conversazione lunga diventa più cara a ogni messaggio, perché l’intera cronologia viene rimandata e riaddebitata ogni volta.
Una finestra piena non è una finestra usata bene
Una finestra grande è un margine, non un obiettivo. I modelli distribuiscono l’attenzione in modo disuguale su un contesto lungo: ciò che sta a metà di un input molto lungo rischia più di essere trattato di sfuggita rispetto a ciò che sta agli estremi.
In pratica dieci pagine mirate battono di solito duecento pagine sparse. Il recupero esiste proprio per scegliere quelle dieci pagine invece di mandare tutto e sperare.
Come alza il costo
Quasi tutti i fornitori fatturano a token, input e output separatamente, e l’input di solito costa meno. Un documento grande allegato a ogni messaggio di una conversazione lunga viene addebitato a ogni messaggio, non una volta.
È la causa più comune di una bolletta sorprendente, e il rimedio è strutturale: allega ciò che la domanda richiede invece di tutto ciò che potrebbe servire.
Domande frequenti
- Una finestra più grande è sempre meglio?
- Toglie un limite, il che è positivo, ma non migliora come il modello usa ciò che riceve. Una finestra più grande ti compra soprattutto la possibilità di commettere un errore più costoso.
- Che cos’è un token?
- All’incirca un frammento di parola. In inglese si aggira sui tre quarti di parola per token, quindi mille token sono circa settecentocinquanta parole — ma varia molto per lingua, e gli alfabeti non latini spesso consumano più token per parola.
- Cosa succede se la supero?
- La richiesta fallisce, oppure l’applicazione scarta in silenzio i messaggi più vecchi. Il secondo caso è più frequente e più confuso, perché il modello sembra dimenticare qualcosa che hai detto.
Provalo invece di leggerne
ClawAI registra i token consumati da ogni messaggio: una conversazione che sta diventando cara si vede prima della fattura, non dopo.