Session 0009
十场 AI 应用模拟面试
这不是题目清单,而是阶段评测。每场都用一个真实工程问题压测你的系统设计、追问承压、失败定位、质量证明和生产化表达。
1. 使用方法
每场先用 8 分钟口头回答主问题,再用 8 分钟回答追问,最后按 rubric 自评分。低于 7 分的场次回到对应 session 重学;出现红线错误则不通过。
2. 十场面试
| 场次 | 主问题 | 追问 | 7+ 分答案骨架 | 红线 |
|---|---|---|---|---|
| 01 Harness | 从零设计客服 agent runtime,支持查单、退款、解释政策、转人工。 | 如何停止循环?状态在哪里?退款如何审批?工具失败如何恢复?trace 记录什么? | runner、state store、tool registry、policy gate、memory/context builder、trace/eval hook、HITL;区分 read/write tool;step/time/cost budget;审批暂停可恢复。 | 只说 LLM + function calling;无状态、无预算、无审计。 |
| 02 Memory | 设计个性化学习助手的 context 和 memory 系统。 | 什么写长期记忆?摘要丢信息怎么办?冲突怎么办?用户删除怎么办?如何防污染? | 区分 working context、thread state、conversation summary、profile memory、episodic memory;定义 schema、write policy、confidence、TTL、source、user editable/delete。 | 把聊天记录全存向量库;允许用户写入权限/安全策略。 |
| 03 RAG | 设计企业知识库问答,要求权限隔离、引用来源、文档增量更新。 | chunk 怎么切?metadata 怎么用?什么时候 rerank?冲突文档怎么答?如何 eval? | ingestion 保留结构/ACL/version;query 先 ACL filter,再 hybrid retrieval/rerank;context packing 带 citation;no-answer;评估 recall、faithfulness、citation accuracy。 | 只做 embedding topK;先检索后过滤权限;无引用。 |
| 04 Agentic RAG | 跨 CRM、知识库、工单系统回答复杂客户问题,普通 RAG 不够时怎么设计? | 何时分步检索?如何控制 query rewrite?如何限制成本?如何 debug 多跳失败? | planner 只在多跳/多源/需计算时启用;source allowlist、step budget、query trace、intermediate evidence、fallback to ordinary RAG。 | “agentic 更智能所以全用”;无步骤和成本边界。 |
| 05 Tools | 设计付款或发邮件类 side-effect tool。 | schema 怎么写?幂等怎么做?超时能否重试?用户说跳过确认怎么办?如何 audit? | typed schema、server-side auth context、idempotency key、dry-run、risk level、confirmation、normalized error、audit log;模型只提出 intent。 | 模型直接执行写操作;失败盲目重试。 |
| 06 Orchestration | 设计合同审核系统:哪些用 workflow,哪些用 agent,是否多 agent? | handoff 传什么?HITL 触发条件?节点失败怎么补偿?如何恢复? | 稳定抽取/比对走 graph;非标准解释用 agent;handoff 传 contract、evidence、state subset;高风险结果审批;节点状态持久化。 | 多个 agent 互相聊天,没有状态和评价标准。 |
| 07 Eval | 上线后用户反馈 agent 偶尔胡说,你如何定位并证明改动有效? | trace 字段?如何转 eval?LLM judge 怎么校准?如何进入发布门禁? | trace 分失败类型;坏 case 转 golden set;task/trajectory/tool/RAG/safety eval;judge rubric + anchor + 人工校准;CI regression gate。 | 只看用户满意度;只让 LLM judge 打总分。 |
| 08 Cost / Latency | Agent P95 从 5s 到 25s,月成本涨 3 倍,怎么排查和治理? | 如何拆 waterfall?怎么判断 retry/RAG/tool/model?如何降级?如何不伤质量? | 按 tenant/feature/model/tool/retry/cache miss/step count 拆;并行检索、rerank 降级、model routing、prompt compaction、cache、budget guard、SLO。 | 只说换快模型或便宜模型。 |
| 09 Security | 外部文档注入诱导 agent 导出用户邮箱,怎么防? | 权限放哪里?RAG 证据如何隔离?工具如何限制?输出进入 HTML/SQL/shell 怎么办? | 不可信数据隔离;tool 层 RBAC、row-level ACL、PII masking、rate limit、audit;敏感导出审批;output validation;safety eval。 | 只靠 system prompt;模型判断用户权限。 |
| 10 Final | 把 AI 面试助手从 prototype 推到 production,完整方案是什么? | 需求边界?指标?架构?数据?eval?安全?成本?灰度?回滚?如何向业务证明价值? | 覆盖 API、context/memory、RAG、tools、harness、orchestration、eval、observability、security、cost/latency、canary、rollback、business metrics。 | 只讲功能 demo;没有质量门禁、发布策略和风险分层。 |
3. 准出标准
- 10 场平均分达到 7 分以上,且任何一场不能低于 6 分。
- 每场必须能说出 data flow、state、failure mode、metric、tradeoff。
- 任何涉及 side effect、权限或 PII 的题,必须把安全边界放在应用/tool/API 层。
- 任何“变好了”的说法都必须落到 eval、trace 或线上指标。
- 任何 production 题都必须覆盖 canary、rollback、alert、versioning。