Session 0006

Agent Orchestration 编排设计

编排不是“多放几个 agent”。P6+ 要能判断 workflow、single agent、multi-agent、handoff 和 human-in-the-loop 的边界,并能解释状态、恢复、审计和成本。

1. 训练目标

本页要练会:根据任务稳定性、风险、权限、上下文隔离和评价标准,选择 workflow、single agent、multi-agent 或 HITL,并设计 handoff contract。

可靠依据:LangGraph workflows/HITL / OpenAI agent orchestration patterns。本页把官方能力和生产工程约束转成面试题,而不是堆概念定义。

题量标准:5 个中大型深题 + 7 个知识广度题。深题用于系统设计和追问承压,广度题用于查漏补缺。

2. 五个深题

深题 01

设计一个合同审核系统:抽取条款、比对模板、识别风险、生成修改建议。哪些用 workflow,哪些用 agent,是否需要 multi-agent?

考察点:考可控性和边界。

7+ 分回答骨架:文档解析、条款抽取、模板比对、风险打分用 graph workflow,因为步骤稳定、可恢复、可审计。非标准条款解释和修改建议可用受限 agent。多 agent 只有在法律、财务、业务有清晰工具/权限/评价边界时使用。高风险输出和外发前走 HITL。

继续追问会衍生:衍生知识点:workflow vs agent、handoff contract、HITL、state persistence。

知识展开

概念是什么工程落点面试表达 / 常见坑
workflow vs agentworkflow 适合步骤稳定、输入输出明确、需要恢复审计;agent 适合路径不确定、需要动态工具选择。合同解析和模板比对用 workflow,非标准条款解释用受限 agent。面试表达:不是 agent 越多越好,稳定流程应优先确定性编排。
handoff contracthandoff contract 定义上游交给下游的任务、证据、约束和输出 schema。payload 包含 task、evidence ids、risk flags、expected_output、trace_id。常见坑是把全量聊天直接交给下一个 agent,导致上下文污染和责任不清。
HITLHITL 是高风险节点的人类审批或编辑机制,不是随时问人。定义触发条件、审批内容、审批人、暂停状态、恢复节点和审计。强回答要说 HITL 会增加延迟,所以要按风险分层触发。
深题 02

什么时候 multi-agent 是合理设计,什么时候是过度设计?

考察点:考架构判断。

7+ 分回答骨架:合理:角色有不同工具权限、上下文需要隔离、可并行、评价标准清晰、handoff 输出可结构化。过度:只是想让 agent 互相讨论、没有独立状态和指标、成本延迟不可控、失败难定位。

继续追问会衍生:衍生知识点:role boundary、parallelism、evaluation boundary、coordination cost。

知识展开

概念是什么工程落点面试表达 / 常见坑
role boundaryrole boundary 是不同 agent 的职责、工具、权限和评价标准边界。法律 agent 只看条款和法规工具,财务 agent 只看金额和付款条款,输出结构化结论。面试中如果说“多个 agent 分工”但没有边界,会显得只是套概念。
parallelism并行适合互不依赖的子任务,能降低延迟,但会增加合并和冲突处理成本。条款抽取、风险初筛可并行;依赖前置结果的审批不能并行。常见坑是为了快而并行有副作用的工具调用。
coordination costcoordination cost 是多 agent 带来的 token、延迟、调试、状态同步和错误归因成本。trace 要记录每个 agent 的输入、输出、handoff、工具调用和合并决策。强回答要能说明为什么有时 single agent 或 workflow 更好。
深题 03

handoff 传什么,不能传什么?

考察点:考上下文最小化。

7+ 分回答骨架:传 task contract、input subset、证据引用、已知约束、expected output schema、trace id、risk flags。不要传全量聊天、无关 memory、权限 token、可被下游当作指令的不可信内容。

继续追问会衍生:衍生知识点:handoff payload、least context、schema contract、trace continuity。

知识展开

概念是什么工程落点面试表达 / 常见坑
handoff payloadhandoff payload 是上下游交换的最小必要状态,不是完整上下文复制。包含证据引用、已知约束、当前决策点、输出 schema、风险标记。面试表达:handoff 传“可执行任务包”,不是传聊天记录。
least contextleast context 是只给下游完成任务所需的信息,减少泄露、污染和成本。context builder 按角色和权限裁剪 memory、tool results、documents。常见坑是为了保险给所有信息,反而降低准确性和安全性。
trace continuitytrace continuity 保证跨 agent、跨节点仍能追踪同一个业务任务。所有节点和 handoff 共享 run_id/trace_id,并记录 parent span。强回答要说没有 trace continuity,就无法定位哪个 agent 或节点出错。
深题 04

Graph 中某个节点失败,如何恢复和补偿?

考察点:考 durable workflow。

7+ 分回答骨架:每个节点有输入、输出、状态版本和错误类型。纯读节点可重跑;写节点必须幂等,失败后先查询外部状态;不可幂等动作设计补偿动作。workflow 保存 checkpoint,可从失败节点 resume,不从头盲跑。

继续追问会衍生:衍生知识点:checkpoint、idempotent node、compensation、resume from node。

知识展开

概念是什么工程落点面试表达 / 常见坑
checkpointcheckpoint 是 workflow 在关键节点保存的可恢复状态。保存 node input/output、state version、tool results、error type、pending approvals。面试里要说失败后从 checkpoint resume,而不是从头重跑所有动作。
idempotent nodeidempotent node 重复执行不会产生重复副作用。读节点天然接近幂等,写节点要用业务 idempotency key 和状态查询。常见坑是节点失败后整条 graph 重跑,导致重复发邮件或重复付款。
resume from node从节点恢复意味着沿用上次 checkpoint 和状态版本继续执行。恢复前校验外部状态、审批有效性、schema/policy version 兼容性。强回答要解释恢复语义,而不是只说“支持重试”。
深题 05

如何给 orchestration 做 eval?

考察点:考中间路径评估。

7+ 分回答骨架:不仅评最终答案,还评节点选择、handoff payload 完整性、工具顺序、HITL 触发、失败恢复、成本步骤数。用 trace replay 检查不同 prompt/model 版本是否保持关键路径稳定。

继续追问会衍生:衍生知识点:trajectory eval、node-level eval、handoff eval、cost-step budget。

知识展开

概念是什么工程落点面试表达 / 常见坑
trajectory evaltrajectory eval 评估 agent 或 graph 的中间路径是否合理。检查节点顺序、工具选择、handoff 内容、HITL 触发和停止条件。面试中要强调最终答案正确但路径危险,仍然不能上线。
node-level evalnode-level eval 单独评估每个 workflow 节点的输入输出质量。抽取节点 golden cases,分别测抽取准确率、风险分类、建议质量。常见坑是只做端到端 eval,定位失败时不知道坏在哪个节点。
cost-step budget编排系统的成本不仅来自模型 token,还来自节点数、agent 往返、工具调用和人工审批。为 graph 设置 max nodes、max agent steps、per-node timeout、parallelism limit。强回答要把质量、延迟、成本和风险一起作为编排选择依据。

3. 七个广度题

编号问题准确回答
广度 01Workflow 的优势是什么?确定性、可恢复、易审计、适合稳定流程和高风险业务。
广度 02Single agent 适合什么?目标清楚但路径不固定,需要动态选择工具或分步推理。
广度 03HITL 不是“问人”这么简单,关键是什么?触发条件、状态保存、审批身份、恢复位置和审计记录。
广度 04为什么多 agent 会更难 debug?多个上下文、handoff、并发和评价边界会让失败归因更复杂。
广度 05编排中的状态放哪里?放 durable state store,不依赖模型聊天历史。
广度 06什么时候应该并行执行?子任务相互独立、工具无共享副作用、结果可合并且延迟收益大于协调成本。
广度 07Orchestration 的红线是什么?让多个 agent 自由对话后直接执行高风险动作,没有状态、权限和审批。

4. 知识索引

workflow vs agent

workflow 适合步骤稳定、输入输出明确、需要恢复审计;agent 适合路径不确定、需要动态工具选择。

handoff contract

handoff contract 定义上游交给下游的任务、证据、约束和输出 schema。

HITL

HITL 是高风险节点的人类审批或编辑机制,不是随时问人。

role boundary

role boundary 是不同 agent 的职责、工具、权限和评价标准边界。

parallelism

并行适合互不依赖的子任务,能降低延迟,但会增加合并和冲突处理成本。

coordination cost

coordination cost 是多 agent 带来的 token、延迟、调试、状态同步和错误归因成本。

handoff payload

handoff payload 是上下游交换的最小必要状态,不是完整上下文复制。

least context

least context 是只给下游完成任务所需的信息,减少泄露、污染和成本。

trace continuity

trace continuity 保证跨 agent、跨节点仍能追踪同一个业务任务。

checkpoint

checkpoint 是 workflow 在关键节点保存的可恢复状态。

idempotent node

idempotent node 重复执行不会产生重复副作用。

resume from node

从节点恢复意味着沿用上次 checkpoint 和状态版本继续执行。

trajectory eval

trajectory eval 评估 agent 或 graph 的中间路径是否合理。

node-level eval

node-level eval 单独评估每个 workflow 节点的输入输出质量。

cost-step budget

编排系统的成本不仅来自模型 token,还来自节点数、agent 往返、工具调用和人工审批。

5. 巩固训练

练习要求自检
8 分钟口述任选一个深题,先给架构,再讲风险、指标、恢复和上线。是否覆盖状态、权限、失败、eval、成本或延迟。
追问压缩把每个深题的回答压缩成 5 句话。每句话必须包含一个工程事实,不能是空泛判断。
反例修正先故意给一个弱回答,再补齐缺失模块。能否说出弱在哪里,以及如何验证强答案。

6. 弱回答红线