基础
什么是 LLM 编排?
LLM 编排是决定哪个模型运行、以什么顺序运行、输出如何处理的那一层,是位于单次调用之上的一层策略。这篇文章说明它和提示词工程、和智能体框架之间的区别,以及为什么值得把它当作独立的一层来看待。
全部文章 · 最近核实:
这不是提示词工程
提示词工程改进的是单次调用。编排决定有多少次调用、哪些模型来做、它们的输出如何组合。你可以有出色的提示词却完全没有编排,结果就是一个供应商一有状况系统就崩的系统。
这个区别之所以重要,是因为二者的优化方式不同。更好的提示词便宜,只能小幅提升质量。更好的编排要花 token,但能大幅提升可靠性。
编排层决定什么
用哪个模型。要不要问不止一个。返回前要不要核实答案。遇到拒绝、超时或速率限制怎么办。这一步的输出是否成为下一步的输入。整件事在开始前是否负担得起。
这些每一条都是一项策略,且每一条都可能各自出错。这就是为什么值得把编排称为独立的一层,而不是把这些决定散落在应用代码各处。
常见技术
路由把请求发给合适的模型。回退处理失败。共识询问多个模型并观察一致性。「N 选一最优」生成候选并保留一个。裁判给答案打分。验证用模型之外的东西核对某个说法。流水线把步骤串联起来。任务拆解把一个大请求拆成小的。
ClawAI 把其中九种实现为独立的编排模式,另外裁判和对比各自是独立的功能面。每一种在这里都有自己的一页,先说明它是什么,再由你决定要不要用。
什么时候不要编排
编排会成倍增加成本和延迟。三个模型的共识大约要花三倍 token,耗时和最慢的那个一样长。对于一眼就能核实答案的问题,这是笔亏本买卖。
站得住脚的经验法则是:当出错代价高、核实又困难时才编排。否则,把一个请求发给一个模型,读答案就好。
常见问题
- 编排和智能体框架是一回事吗?
- 两者有重叠但不是一回事。智能体通常借助工具自行决定下一步。编排是围绕它的策略——用哪个模型、几个、失败怎么办——这同样适用于完全没有智能体的工作流。
- 编排需要框架吗?
- 不需要。换个模型重试,本身就已经是编排了。当策略多到不用框架你就得在每个功能里重新实现一遍时,框架才派上用场。
- 编排要花多少钱?
- 按 token 算,大致和策略发起的模型调用次数成正比。一次路由过的调用花费和未路由的差不多;三个模型的共识大约是三倍。成本是可预测的,这正是它成为预算决策而非赌博的原因。
与其阅读,不如亲自试试
ClawAI 在普通聊天之外还运行着 9 种编排模式,并记录每次运行用了哪些模型——技术的成本看得见,不用靠猜。