Fundamentos
O que é orquestração de LLM?
Orquestração de LLM é a camada que decide qual modelo roda, em que ordem e o que acontece com a saída. Como difere de prompting e de agentes.
Todos os guias · Última revisão:
Não é engenharia de prompt
Engenharia de prompt melhora uma chamada isolada. A orquestração decide quantas chamadas existem, quais modelos as fazem e como as saídas se combinam. Dá para ter prompts excelentes e nenhuma orquestração, e o resultado é um sistema que cai assim que um fornecedor tem uma hora ruim.
A distinção importa porque os dois se otimizam de formas diferentes. Um prompt melhor é barato e melhora um pouco a qualidade. Uma orquestração melhor custa tokens e melhora bastante a confiabilidade.
O que uma camada de orquestração decide
Qual modelo. Se pergunta a mais de um. Se confere a resposta antes de devolver. O que fazer diante de uma recusa, um tempo esgotado ou um limite de uso. Se a saída deste passo vira a entrada do próximo. Se o conjunto é viável antes de começar.
Cada um desses pontos é uma política, e cada uma pode errar isoladamente. Por isso vale nomear a orquestração como camada própria em vez de espalhar as decisões pelo código da aplicação.
As técnicas comuns
O roteamento envia a requisição a um modelo adequado. O fallback trata a falha. O consenso pergunta a vários e observa a concordância. O melhor de N gera candidatas e fica com uma. Um juiz pontua respostas. A verificação confronta uma afirmação com algo fora do modelo. Pipelines encadeiam passos. A decomposição divide uma requisição grande em menores.
O ClawAI implementa nove delas como modos de orquestração separados, mais juiz e comparação como superfícies próprias. Cada uma tem aqui uma página explicando o que é antes de você decidir se quer.
Quando não orquestrar
A orquestração multiplica custo e latência. Um consenso com três modelos custa cerca de três vezes os tokens e demora o que o mais lento demorar. Para uma pergunta cuja resposta você confere de relance, é um mau negócio.
A regra que se sustenta: orquestre quando errar sai caro e conferir é difícil. Caso contrário, mande uma requisição a um modelo e leia a resposta.
Perguntas frequentes
- Orquestração é o mesmo que framework de agentes?
- Há sobreposição, mas não são a mesma coisa. Um agente decide o próprio passo seguinte, em geral com ferramentas. A orquestração é a política ao redor — qual modelo, quantos, o que fazer em caso de falha — e vale igualmente para um fluxo sem agente algum.
- Orquestração exige um framework?
- Não. Repetir com outro modelo já é orquestração. Frameworks ajudam quando as políticas ficam numerosas a ponto de você reimplementá-las funcionalidade a funcionalidade.
- Quanto custa?
- Em tokens, mais ou menos proporcional a quantas chamadas a política faz. Uma chamada roteada custa quase o mesmo que uma não roteada; um consenso com três modelos, cerca de três vezes mais. O custo é previsível, e é isso que torna a decisão orçamentária em vez de aposta.
Experimente em vez de ler sobre isso
O ClawAI executa 9 modos de orquestração ao lado do chat comum e registra quais modelos cada execução usou: o custo de uma técnica se vê em vez de se deduzir.