Session 0009

十场 AI 应用模拟面试

这不是题目清单,而是阶段评测。每场都用一个真实工程问题压测你的系统设计、追问承压、失败定位、质量证明和生产化表达。

1. 使用方法

每场先用 8 分钟口头回答主问题,再用 8 分钟回答追问,最后按 rubric 自评分。低于 7 分的场次回到对应 session 重学;出现红线错误则不通过。

2. 十场面试

场次 主问题 追问 7+ 分答案骨架 红线
01 Harness 从零设计客服 agent runtime,支持查单、退款、解释政策、转人工。 如何停止循环?状态在哪里?退款如何审批?工具失败如何恢复?trace 记录什么? runner、state store、tool registry、policy gate、memory/context builder、trace/eval hook、HITL;区分 read/write tool;step/time/cost budget;审批暂停可恢复。 只说 LLM + function calling;无状态、无预算、无审计。
02 Memory 设计个性化学习助手的 context 和 memory 系统。 什么写长期记忆?摘要丢信息怎么办?冲突怎么办?用户删除怎么办?如何防污染? 区分 working context、thread state、conversation summary、profile memory、episodic memory;定义 schema、write policy、confidence、TTL、source、user editable/delete。 把聊天记录全存向量库;允许用户写入权限/安全策略。
03 RAG 设计企业知识库问答,要求权限隔离、引用来源、文档增量更新。 chunk 怎么切?metadata 怎么用?什么时候 rerank?冲突文档怎么答?如何 eval? ingestion 保留结构/ACL/version;query 先 ACL filter,再 hybrid retrieval/rerank;context packing 带 citation;no-answer;评估 recall、faithfulness、citation accuracy。 只做 embedding topK;先检索后过滤权限;无引用。
04 Agentic RAG 跨 CRM、知识库、工单系统回答复杂客户问题,普通 RAG 不够时怎么设计? 何时分步检索?如何控制 query rewrite?如何限制成本?如何 debug 多跳失败? planner 只在多跳/多源/需计算时启用;source allowlist、step budget、query trace、intermediate evidence、fallback to ordinary RAG。 “agentic 更智能所以全用”;无步骤和成本边界。
05 Tools 设计付款或发邮件类 side-effect tool。 schema 怎么写?幂等怎么做?超时能否重试?用户说跳过确认怎么办?如何 audit? typed schema、server-side auth context、idempotency key、dry-run、risk level、confirmation、normalized error、audit log;模型只提出 intent。 模型直接执行写操作;失败盲目重试。
06 Orchestration 设计合同审核系统:哪些用 workflow,哪些用 agent,是否多 agent? handoff 传什么?HITL 触发条件?节点失败怎么补偿?如何恢复? 稳定抽取/比对走 graph;非标准解释用 agent;handoff 传 contract、evidence、state subset;高风险结果审批;节点状态持久化。 多个 agent 互相聊天,没有状态和评价标准。
07 Eval 上线后用户反馈 agent 偶尔胡说,你如何定位并证明改动有效? trace 字段?如何转 eval?LLM judge 怎么校准?如何进入发布门禁? trace 分失败类型;坏 case 转 golden set;task/trajectory/tool/RAG/safety eval;judge rubric + anchor + 人工校准;CI regression gate。 只看用户满意度;只让 LLM judge 打总分。
08 Cost / Latency Agent P95 从 5s 到 25s,月成本涨 3 倍,怎么排查和治理? 如何拆 waterfall?怎么判断 retry/RAG/tool/model?如何降级?如何不伤质量? 按 tenant/feature/model/tool/retry/cache miss/step count 拆;并行检索、rerank 降级、model routing、prompt compaction、cache、budget guard、SLO。 只说换快模型或便宜模型。
09 Security 外部文档注入诱导 agent 导出用户邮箱,怎么防? 权限放哪里?RAG 证据如何隔离?工具如何限制?输出进入 HTML/SQL/shell 怎么办? 不可信数据隔离;tool 层 RBAC、row-level ACL、PII masking、rate limit、audit;敏感导出审批;output validation;safety eval。 只靠 system prompt;模型判断用户权限。
10 Final 把 AI 面试助手从 prototype 推到 production,完整方案是什么? 需求边界?指标?架构?数据?eval?安全?成本?灰度?回滚?如何向业务证明价值? 覆盖 API、context/memory、RAG、tools、harness、orchestration、eval、observability、security、cost/latency、canary、rollback、business metrics。 只讲功能 demo;没有质量门禁、发布策略和风险分层。

3. 准出标准