Passer au contenu principal

Contexte

Qu’est-ce qu’une fenêtre de contexte ?

La fenêtre de contexte est la quantité de texte qu’un modèle peut considérer en une requête. Pourquoi ce n’est pas de la mémoire et comment elle fait grimper le coût.

Toutes les explications · Dernière vérification:

Ce n’est pas de la mémoire

Un modèle ne se souvient pas de votre conversation précédente. L’illusion de mémoire vient de ce que l’application renvoie les messages antérieurs à chaque nouvelle requête. La fenêtre est un plan de travail pour un appel, pas un stockage.

Cela a une conséquence directe que l’on découvre par surprise : une longue conversation devient plus chère à chaque message, car tout l’historique est renvoyé et refacturé à chaque fois.

Une fenêtre pleine n’est pas une fenêtre bien utilisée

Une grande fenêtre est une marge, pas un objectif. Les modèles répartissent leur attention inégalement sur un long contexte : ce qui se trouve au milieu d’une très longue entrée risque davantage d’être traité à la légère que ce qui est aux extrémités.

En pratique, dix pages ciblées battent souvent deux cents pages dispersées. La récupération existe précisément pour choisir ces dix pages plutôt que de tout envoyer en espérant.

Comment elle fait grimper le coût

Presque tous les fournisseurs facturent au token, entrée et sortie séparément, l’entrée étant en général moins chère. Un gros document joint à chaque message d’une longue conversation est facturé à chaque message, pas une fois.

C’est la cause la plus fréquente d’une facture surprenante, et le remède est structurel : joignez ce dont la question a besoin plutôt que tout ce qui pourrait servir.

Questions fréquentes

Une plus grande fenêtre est-elle toujours meilleure ?
Elle lève une limite, ce qui est bien, mais n’améliore pas la façon dont le modèle exploite ce qu’il reçoit. Une fenêtre plus grande vous achète surtout la possibilité d’une erreur plus coûteuse.
Qu’est-ce qu’un token ?
À peu près un fragment de mot. En anglais, cela tourne autour de trois quarts de mot par token, donc mille tokens font environ sept cent cinquante mots — mais cela varie selon la langue, et les écritures non latines consomment souvent plus de tokens par mot.
Que se passe-t-il si je la dépasse ?
La requête échoue, ou l’application supprime silencieusement les messages les plus anciens. Le second cas est plus fréquent et plus déroutant, car le modèle semble oublier ce que vous avez dit.

Essayez plutôt que de lire

ClawAI consigne les tokens consommés par chaque message : une conversation qui devient coûteuse se voit avant la facture, pas après.