Основы
Что такое оркестрация LLM?
Оркестрация LLM — это слой, который решает, какая модель запускается, в каком порядке и что происходит с ответом. Чем она отличается от промптинга и агентов.
Все разборы · Последняя проверка:
Это не промпт-инжиниринг
Промпт-инжиниринг улучшает один вызов. Оркестрация решает, сколько вызовов будет, какие модели их сделают и как соединятся выводы. Можно иметь отличные промпты и никакой оркестрации — и система упадёт, как только у поставщика случится плохой час.
Различие важно, потому что оптимизируются они по-разному. Лучший промпт дёшев и немного повышает качество. Лучшая оркестрация стоит токенов и заметно повышает надёжность.
Что решает слой оркестрации
Какая модель. Спрашивать ли больше одной. Проверять ли ответ перед выдачей. Что делать при отказе, тайм-ауте или лимите. Становится ли вывод этого шага входом следующего. По карману ли всё это ещё до старта.
Каждый из пунктов — это политика, и каждая может быть неверной независимо от других. Поэтому оркестрацию стоит назвать отдельным слоем, а не разбрасывать решения по коду приложения.
Распространённые техники
Маршрутизация отправляет запрос подходящей модели. Резервирование обрабатывает сбой. Консенсус спрашивает нескольких и смотрит на согласие. «Лучший из N» порождает варианты и оставляет один. Судья оценивает ответы. Верификация сверяет утверждение с чем-то вне модели. Конвейеры соединяют шаги. Декомпозиция делит большой запрос на меньшие.
ClawAI реализует девять из них как отдельные режимы оркестрации, плюс судью и сравнение как самостоятельные поверхности. У каждой здесь есть страница, объясняющая, что это, — до того как вы решите, нужно ли вам это.
Когда не оркестрировать
Оркестрация умножает стоимость и задержку. Консенсус по трём моделям стоит примерно втрое больше токенов и длится столько же, сколько самая медленная. Для вопроса, ответ на который вы проверяете взглядом, это плохой размен.
Правило, которое держится: оркестрируйте, когда ошибка дорога, а проверка сложна. Иначе отправьте один запрос одной модели и прочитайте ответ.
Частые вопросы
- Оркестрация — это то же, что фреймворк агентов?
- Пересекается, но не совпадает. Агент сам решает следующий шаг, обычно с инструментами. Оркестрация — окружающая политика: какая модель, сколько, что делать при сбое — и она в той же мере применима к процессу вообще без агента.
- Нужен ли для оркестрации фреймворк?
- Нет. Повтор с другой моделью — это уже оркестрация. Фреймворки помогают, когда политик становится столько, что иначе вы бы переписывали их в каждой функции заново.
- Сколько это стоит?
- В токенах — примерно пропорционально числу вызовов, которые делает политика. Один маршрутизированный вызов стоит примерно как немаршрутизированный; консенсус по трём моделям — примерно втрое дороже. Стоимость предсказуема, и это делает вопрос бюджетным решением, а не ставкой.
Лучше попробовать, чем читать
ClawAI выполняет 9 режимов оркестрации рядом с обычным чатом и записывает, какие модели использовал каждый запуск: стоимость техники видна, а не выводится догадками.