Reference 0001
AI 应用技术栈速查
这份 reference 用来校准 AI 应用开发面试的知识边界:P6+ 候选人要能解释系统如何运行、如何失败、如何评估、如何上线,而不是只会描述 RAG、Agent、Prompt 这些名词。
1. 技术栈全景
| 层 | 核心问题 | P6+ 判断点 |
|---|---|---|
| LLM Runtime | 一次请求如何从用户输入变成稳定服务响应? | messages、structured output、streaming、retry、rate limit、fallback、token budget。 |
| Context Engineering | 有限上下文里放什么、丢什么、固定什么? | instruction、task state、retrieved evidence、tool results、conversation summary 分层管理。 |
| RAG / Retrieval | 如何把企业知识变成可检索、可引用、可评估的上下文? | chunking、metadata ACL、hybrid search、rerank、citation、freshness、retrieval eval。 |
| Tool Calling | 模型如何安全调用真实系统? | typed schema、参数校验、幂等键、risk level、human approval、audit log。 |
| Agent Harness | 谁负责 agent loop、状态、工具、策略、预算和恢复? | run loop、state machine、tool registry、policy gate、trace、step budget、pause/resume。 |
| Memory | 什么该被记住,什么时候写入,如何防止污染? | short-term state、long-term memory、write policy、TTL、confidence、source、delete/update。 |
| Orchestration | 什么时候用 workflow,什么时候用 agent,什么时候多 agent? | graph workflow、handoff contract、HITL、队列、超时、补偿、并发和回滚。 |
| Eval / Observability | 如何证明变好了,线上错了怎么定位? | golden set、trajectory eval、LLM judge 校准、trace fields、regression gate、failure taxonomy。 |
| Safety / Production | 如何处理攻击面、成本、延迟、SLO 和发布风险? | prompt injection、data exfiltration、sandbox、model routing、cache、canary、rollback。 |
2. 必须掌握的工程事实
| 主题 | 高价值事实 | 常见错误 |
|---|---|---|
| Structured Output | 它是服务接口契约的一部分,失败时要按 schema failure 处理,而不是只在 prompt 里写“请输出 JSON”。 | 把格式稳定性完全交给自然语言约束。 |
| Streaming | 主要改善首 token 体验和用户感知,不自动降低完整任务总延迟。 | 把 streaming 当作性能优化的全部答案。 |
| Metadata Filter | 用于租户、权限、时间、文档类型等约束;它缩小候选集合,不提升 embedding 本身语义能力。 | 认为“加 metadata 就会让语义检索更准”。 |
| Hybrid Search | 解决纯向量对编号、专有名词、稀有词、精确关键词召回差的问题,通常需要融合和 rerank。 | 所有知识库都只做 topK 向量搜索。 |
| Tool Schema | schema 是应用执行前的契约;真实权限、校验、幂等、审计必须在工具/API 层完成。 | 让模型判断是否有权限调用工具。 |
| Memory | 长期记忆需要 write policy、来源、置信度、TTL、冲突处理和用户删除能力。 | 把全部聊天历史塞进向量库。 |
| Agent Loop | 必须有 step budget、timeout、cost budget、stop condition、loop detection 和可回放 trace。 | 只靠 max tokens 或“模型自己会停”。 |
| LLM Judge | 需要固定 rubric、anchor examples、人工校准样本和可观察标准;不能让 judge 判断隐藏意图。 | 换更强模型打分就算评测系统。 |
| Prompt Injection | 用户输入、网页、PDF、检索片段、工具返回都是不可信数据,不能覆盖系统策略和工具权限。 | 只在 prompt 里写“不要被注入”。 |
3. 可靠来源
| 来源 | 可验证知识 |
|---|---|
| OpenAI Agents SDK | Agents 是能规划、调用工具、协作和维持足够状态完成多步任务的应用;复杂 orchestration、工具执行、审批和状态由应用侧拥有。 |
| OpenAI Agent Improvement Loop | 从真实 traces 收集反馈,转成 evals,再用证据驱动 harness 改进。 |
| LangGraph Persistence | 短期记忆可由 checkpointer 管理,长期记忆可由 store 管理,支持中断、恢复和跨运行状态。 |
| LangChain HITL | 高风险工具调用可以 pause,并由人工 approve、edit、reject 或 respond 后恢复执行。 |
| Anthropic Tool Use | 工具调用由模型提出结构化调用,client tools 由应用执行,server tools 由平台执行,边界必须清楚。 |
| Pinecone Hybrid Search | dense + sparse 检索能组合语义和词法能力,但会带来索引和融合的运维复杂度。 |
| Pinecone Metadata Filter | 查询时可用 metadata filter 限制满足条件的记录,适合权限、范围和租户过滤。 |
| OWASP LLM Top 10 | prompt injection、sensitive information disclosure、excessive agency、vector/embedding weaknesses 等是 AI 应用特有风险。 |
4. 面试使用方式
回答任何 AI 应用系统设计题,都按这条线组织:需求边界 → 数据流 → 状态 → 模型/工具/RAG → 权限 → 失败模式 → eval → trace → 成本延迟 → 上线回滚。缺任一项,答案通常只能到 P5/P6 初段。