Saltar al contenido principal

Fundamentos

¿Qué es la orquestación de LLM?

La orquestación de LLM es la capa que decide qué modelo se ejecuta, en qué orden y qué pasa con el resultado. En qué se diferencia del prompting y de los agentes.

Todas las guías · Última revisión:

No es ingeniería de prompts

La ingeniería de prompts mejora una llamada concreta. La orquestación decide cuántas llamadas hay, qué modelos las hacen y cómo se combinan sus salidas. Puedes tener prompts excelentes y ninguna orquestación, y el resultado es un sistema que se cae en cuanto un proveedor tiene una mala hora.

La distinción importa porque se optimizan de forma distinta. Un prompt mejor es barato y sube algo la calidad. Una orquestación mejor cuesta tokens y sube bastante la fiabilidad.

Qué decide una capa de orquestación

Qué modelo. Si preguntar a más de uno. Si comprobar la respuesta antes de devolverla. Qué hacer ante una negativa, un tiempo agotado o un límite de uso. Si la salida de este paso es la entrada del siguiente. Si todo el conjunto es asumible antes de empezar.

Cada una de esas cosas es una política y cada una puede equivocarse por separado. Por eso merece la pena nombrar la orquestación como su propia capa en vez de repartir las decisiones por el código de la aplicación.

Las técnicas habituales

El enrutado manda la petición a un modelo adecuado. El respaldo gestiona los fallos. El consenso pregunta a varios y mira el acuerdo. El mejor de N genera candidatas y se queda con una. Un juez puntúa respuestas. La verificación contrasta una afirmación con algo externo al modelo. Los pipelines encadenan pasos. La descomposición divide una petición grande en otras menores.

ClawAI implementa nueve de ellas como modos de orquestación separados, más el juez y la comparación como superficies propias. Cada una tiene aquí una página que explica qué es antes de que decidas si la quieres.

Cuándo no orquestar

La orquestación multiplica coste y latencia. Un consenso a tres modelos cuesta unas tres veces los tokens y tarda lo que el más lento. Para una pregunta cuya respuesta compruebas de un vistazo, es un mal trato.

La regla que aguanta: orquesta cuando equivocarse sale caro y comprobarlo es difícil. En el resto de casos, manda una petición a un modelo y lee la respuesta.

Preguntas frecuentes

¿La orquestación es lo mismo que un framework de agentes?
Se solapan, pero no son lo mismo. Un agente decide su propio siguiente paso, normalmente con herramientas. La orquestación es la política que lo envuelve —qué modelo, cuántos, qué hacer si falla— y se aplica igual a un flujo sin ningún agente.
¿Hace falta un framework para orquestar?
No. Reintentar con otro modelo ya es orquestación. Los frameworks ayudan cuando las políticas se multiplican lo bastante como para que estuvieras reimplementándolas en cada funcionalidad.
¿Cuánto cuesta?
En tokens, más o menos en proporción a cuántas llamadas hace la política. Una llamada enrutada cuesta casi lo mismo que una sin enrutar; un consenso a tres modelos cuesta unas tres veces más. El coste es predecible, y eso lo convierte en una decisión de presupuesto y no en una apuesta.

Pruébalo en lugar de leer sobre ello

ClawAI ejecuta 9 modos de orquestación junto al chat normal, y registra qué modelos usó cada ejecución, así que el coste de una técnica se ve en lugar de deducirse.