Контекст
Что такое контекстное окно?
Контекстное окно — это сколько текста модель может учесть за один запрос. Почему это не память, почему его заполнение вредит качеству и как оно влияет на цену.
Все разборы · Последняя проверка:
Это не память
Модель не помнит ваш предыдущий разговор. Иллюзию памяти создаёт то, что приложение заново отправляет прежние сообщения с каждым новым запросом. Окно — рабочая поверхность одного вызова, а не хранилище.
Отсюда прямое следствие, с которым люди сталкиваются как с неожиданностью: длинный разговор дорожает с каждым сообщением, потому что вся история пересылается и заново тарифицируется каждый раз.
Полное окно — не значит хорошо использованное
Большое окно — это запас, а не цель. Модели распределяют внимание по длинному контексту неравномерно: то, что лежит в середине очень длинного входа, скорее будет обработано вскользь, чем то, что по краям.
На практике десять сфокусированных страниц обычно выигрывают у двухсот несфокусированных. Поиск существует ровно для того, чтобы выбрать эти десять страниц, а не отправлять всё и надеяться.
Как это разгоняет стоимость
Почти все поставщики берут плату за токен, отдельно за вход и выход, причём вход обычно дешевле. Большой документ, приложенный к каждому сообщению длинного разговора, тарифицируется в каждом сообщении, а не однажды.
Это самая частая причина неожиданного счёта, и решение структурное: прикладывайте то, что нужно вопросу, а не всё, что может пригодиться.
Частые вопросы
- Всегда ли большее окно лучше?
- Оно снимает ограничение, и это хорошо, но не улучшает того, как модель пользуется полученным. Большее окно в основном покупает вам возможность совершить более дорогую ошибку.
- Что такое токен?
- Примерно фрагмент слова. В английском выходит около трёх четвертей слова на токен, так что тысяча токенов — это примерно семьсот пятьдесят слов. Но это сильно зависит от языка, и нелатинские письменности часто тратят больше токенов на слово.
- Что будет, если я его превышу?
- Запрос упадёт, либо приложение молча отбросит самые старые сообщения. Второе встречается чаще и сбивает с толку сильнее, потому что модель как будто забывает сказанное вами.
Лучше попробовать, чем читать
ClawAI записывает, сколько токенов израсходовало каждое сообщение, поэтому дорожающий разговор виден до счёта, а не после.