Перейти к основному содержимому

Основы

Что такое оркестрация LLM?

Оркестрация LLM — это слой, который решает, какая модель запускается, в каком порядке и что происходит с ответом. Чем она отличается от промптинга и агентов.

Все разборы · Последняя проверка:

Это не промпт-инжиниринг

Промпт-инжиниринг улучшает один вызов. Оркестрация решает, сколько вызовов будет, какие модели их сделают и как соединятся выводы. Можно иметь отличные промпты и никакой оркестрации — и система упадёт, как только у поставщика случится плохой час.

Различие важно, потому что оптимизируются они по-разному. Лучший промпт дёшев и немного повышает качество. Лучшая оркестрация стоит токенов и заметно повышает надёжность.

Что решает слой оркестрации

Какая модель. Спрашивать ли больше одной. Проверять ли ответ перед выдачей. Что делать при отказе, тайм-ауте или лимите. Становится ли вывод этого шага входом следующего. По карману ли всё это ещё до старта.

Каждый из пунктов — это политика, и каждая может быть неверной независимо от других. Поэтому оркестрацию стоит назвать отдельным слоем, а не разбрасывать решения по коду приложения.

Распространённые техники

Маршрутизация отправляет запрос подходящей модели. Резервирование обрабатывает сбой. Консенсус спрашивает нескольких и смотрит на согласие. «Лучший из N» порождает варианты и оставляет один. Судья оценивает ответы. Верификация сверяет утверждение с чем-то вне модели. Конвейеры соединяют шаги. Декомпозиция делит большой запрос на меньшие.

ClawAI реализует девять из них как отдельные режимы оркестрации, плюс судью и сравнение как самостоятельные поверхности. У каждой здесь есть страница, объясняющая, что это, — до того как вы решите, нужно ли вам это.

Когда не оркестрировать

Оркестрация умножает стоимость и задержку. Консенсус по трём моделям стоит примерно втрое больше токенов и длится столько же, сколько самая медленная. Для вопроса, ответ на который вы проверяете взглядом, это плохой размен.

Правило, которое держится: оркестрируйте, когда ошибка дорога, а проверка сложна. Иначе отправьте один запрос одной модели и прочитайте ответ.

Частые вопросы

Оркестрация — это то же, что фреймворк агентов?
Пересекается, но не совпадает. Агент сам решает следующий шаг, обычно с инструментами. Оркестрация — окружающая политика: какая модель, сколько, что делать при сбое — и она в той же мере применима к процессу вообще без агента.
Нужен ли для оркестрации фреймворк?
Нет. Повтор с другой моделью — это уже оркестрация. Фреймворки помогают, когда политик становится столько, что иначе вы бы переписывали их в каждой функции заново.
Сколько это стоит?
В токенах — примерно пропорционально числу вызовов, которые делает политика. Один маршрутизированный вызов стоит примерно как немаршрутизированный; консенсус по трём моделям — примерно втрое дороже. Стоимость предсказуема, и это делает вопрос бюджетным решением, а не ставкой.

Лучше попробовать, чем читать

ClawAI выполняет 9 режимов оркестрации рядом с обычным чатом и записывает, какие модели использовал каждый запуск: стоимость техники видна, а не выводится догадками.