Перейти к основному содержимому

Контекст

Что такое контекстное окно?

Контекстное окно — это сколько текста модель может учесть за один запрос. Почему это не память, почему его заполнение вредит качеству и как оно влияет на цену.

Все разборы · Последняя проверка:

Это не память

Модель не помнит ваш предыдущий разговор. Иллюзию памяти создаёт то, что приложение заново отправляет прежние сообщения с каждым новым запросом. Окно — рабочая поверхность одного вызова, а не хранилище.

Отсюда прямое следствие, с которым люди сталкиваются как с неожиданностью: длинный разговор дорожает с каждым сообщением, потому что вся история пересылается и заново тарифицируется каждый раз.

Полное окно — не значит хорошо использованное

Большое окно — это запас, а не цель. Модели распределяют внимание по длинному контексту неравномерно: то, что лежит в середине очень длинного входа, скорее будет обработано вскользь, чем то, что по краям.

На практике десять сфокусированных страниц обычно выигрывают у двухсот несфокусированных. Поиск существует ровно для того, чтобы выбрать эти десять страниц, а не отправлять всё и надеяться.

Как это разгоняет стоимость

Почти все поставщики берут плату за токен, отдельно за вход и выход, причём вход обычно дешевле. Большой документ, приложенный к каждому сообщению длинного разговора, тарифицируется в каждом сообщении, а не однажды.

Это самая частая причина неожиданного счёта, и решение структурное: прикладывайте то, что нужно вопросу, а не всё, что может пригодиться.

Частые вопросы

Всегда ли большее окно лучше?
Оно снимает ограничение, и это хорошо, но не улучшает того, как модель пользуется полученным. Большее окно в основном покупает вам возможность совершить более дорогую ошибку.
Что такое токен?
Примерно фрагмент слова. В английском выходит около трёх четвертей слова на токен, так что тысяча токенов — это примерно семьсот пятьдесят слов. Но это сильно зависит от языка, и нелатинские письменности часто тратят больше токенов на слово.
Что будет, если я его превышу?
Запрос упадёт, либо приложение молча отбросит самые старые сообщения. Второе встречается чаще и сбивает с толку сильнее, потому что модель как будто забывает сказанное вами.

Лучше попробовать, чем читать

ClawAI записывает, сколько токенов израсходовало каждое сообщение, поэтому дорожающий разговор виден до счёта, а не после.