Mission Navigation

AI 应用开发面试

目标是应聘 AI 应用开发工程师。学习方式不是背概念,而是把每个专题拆成“面试问题 → 判断点 → 标准回答 → 追问 → 工程落地 → 质量评测”的训练单元。

目标

你要能在面试中证明自己会做真实 AI 应用:理解模型接口,能设计 RAG、工具调用、memory、context、agent harness 和编排,知道如何做评测、降延迟、控成本、处理安全风险,并能把系统上线到可观测、可回滚、可迭代的工程状态。

训练方法

阶段 训练内容 合格标准
知识补齐 每个专题先学必要事实、术语、流程和常见取舍。 能用准确语言解释,不把 embedding、rerank、tool call、agent loop 混在一起。
问答训练 每题都包含面试官真正想判断的能力点。 回答能落到指标、接口、数据、失败模式和工程约束。
追问加压 每个答案后接 2-3 个追问,逼近真实面试。 能解释 tradeoff,而不是换一种说法重复概念。
项目表达 把专题知识映射到一个可讲的 AI 应用项目。 能说清需求、架构、数据流、评测、上线和迭代结果。

专题路线

专题 必须掌握的确切知识 典型面试判断点
LLM Runtime messages、structured output、streaming、tool call lifecycle、retry、rate limit、fallback、token budget。 能否把模型能力包装成稳定后端接口。
Context / Memory instruction hierarchy、上下文预算、摘要压缩、retrieval context、thread state、long-term memory、写入策略、污染控制。 能否区分上下文管理、短期状态和长期记忆。
RAG chunking、embedding、向量检索、metadata filter、hybrid search、rerank、citation、增量索引。 能否设计可维护的知识库问答系统。
Tool Calling tool schema、参数校验、幂等键、side effect、risk level、human approval、工具失败恢复。 能否让模型安全可靠地调用真实系统。
Agent Harness run loop、state machine、tool registry、policy gate、trace、step budget、pause/resume、rollback。 能否设计 agent runtime,而不是只写 prompt。
Agent Orchestration workflow vs agent、handoff contract、multi-agent boundaries、HITL、队列、超时、补偿。 能否判断什么时候不该上多 agent。
评测与质量 golden set、offline eval、online eval、人工标注、LLM-as-judge 风险、回归集、业务指标。 能否证明系统变好了,而不是只说“感觉更准”。
性能与成本 streaming、cache、batch、模型分层、token 预算、并发限制、超时、降级。 能否在延迟、质量、成本之间做工程取舍。
安全与合规 prompt injection、数据泄露、PII、权限隔离、审计日志、内容安全、工具调用确认。 能否识别 AI 应用特有风险并给出防线。
上线与可观测性 trace、span、prompt/model/index/schema version、灰度、回滚、告警、用户反馈闭环。 能否把 demo 变成可运营服务。

样例题组格式

一个专题不是一道题,而是一组面试训练

深题:每个大专题至少 5 个中大型问题,例如 RAG 要覆盖企业知识库设计、错误归因、chunking、权限过滤、冲突文档处理。

广度题:每个专题至少 7 个快问,用来检查定义、边界、指标和常见坑,例如 dense/sparse、rerank、no-answer、citation accuracy。

答案要求:每个深题都必须包含“考察点、7+ 分答案骨架、知识展开”。知识展开要说明概念是什么、系统里怎么落地、失败模式是什么、面试中怎么讲。每个广度题给出可直接背诵但不空泛的准确回答。

Sessions

Session 主题 训练产出
01 AI 应用工程师面试知识地图 明确 9 个专题、每个专题的判断点、以及第一套高质量问答格式。
02 Agent Harness 运行时设计 5 个深题 + 7 个广度题,覆盖 run loop、状态、工具注册、策略、trace、budget、pause/resume。
03 Tool Calling 生产化 5 个深题 + 7 个广度题,覆盖 schema、参数校验、幂等、side effect、审批、审计和工具失败恢复。
04 Context / Memory 系统设计 5 个深题 + 7 个广度题,覆盖上下文、短期状态、长期记忆、写入策略和污染控制。
05 RAG 系统设计 5 个深题 + 7 个广度题,覆盖解析、chunk、metadata、hybrid search、rerank、citation、eval。
06 Agent Orchestration 编排设计 5 个深题 + 7 个广度题,覆盖 workflow、single agent、multi-agent、handoff 和 HITL 的边界。
07 Eval / Observability 质量闭环 5 个深题 + 7 个广度题,覆盖 trace、eval、回归门禁、成本延迟和发布证据。
08 Security / Production 上线设计 5 个深题 + 7 个广度题,覆盖 prompt injection、越权、成本、延迟、灰度、回滚和 kill switch。
09 十场 AI 应用模拟面试 用十场 P6+ 系统设计和专项追问评测阶段学习成果。

References