Reference 0001

AI 应用技术栈速查

这份 reference 用来校准 AI 应用开发面试的知识边界:P6+ 候选人要能解释系统如何运行、如何失败、如何评估、如何上线,而不是只会描述 RAG、Agent、Prompt 这些名词。

1. 技术栈全景

核心问题 P6+ 判断点
LLM Runtime 一次请求如何从用户输入变成稳定服务响应? messages、structured output、streaming、retry、rate limit、fallback、token budget。
Context Engineering 有限上下文里放什么、丢什么、固定什么? instruction、task state、retrieved evidence、tool results、conversation summary 分层管理。
RAG / Retrieval 如何把企业知识变成可检索、可引用、可评估的上下文? chunking、metadata ACL、hybrid search、rerank、citation、freshness、retrieval eval。
Tool Calling 模型如何安全调用真实系统? typed schema、参数校验、幂等键、risk level、human approval、audit log。
Agent Harness 谁负责 agent loop、状态、工具、策略、预算和恢复? run loop、state machine、tool registry、policy gate、trace、step budget、pause/resume。
Memory 什么该被记住,什么时候写入,如何防止污染? short-term state、long-term memory、write policy、TTL、confidence、source、delete/update。
Orchestration 什么时候用 workflow,什么时候用 agent,什么时候多 agent? graph workflow、handoff contract、HITL、队列、超时、补偿、并发和回滚。
Eval / Observability 如何证明变好了,线上错了怎么定位? golden set、trajectory eval、LLM judge 校准、trace fields、regression gate、failure taxonomy。
Safety / Production 如何处理攻击面、成本、延迟、SLO 和发布风险? prompt injection、data exfiltration、sandbox、model routing、cache、canary、rollback。

2. 必须掌握的工程事实

主题 高价值事实 常见错误
Structured Output 它是服务接口契约的一部分,失败时要按 schema failure 处理,而不是只在 prompt 里写“请输出 JSON”。 把格式稳定性完全交给自然语言约束。
Streaming 主要改善首 token 体验和用户感知,不自动降低完整任务总延迟。 把 streaming 当作性能优化的全部答案。
Metadata Filter 用于租户、权限、时间、文档类型等约束;它缩小候选集合,不提升 embedding 本身语义能力。 认为“加 metadata 就会让语义检索更准”。
Hybrid Search 解决纯向量对编号、专有名词、稀有词、精确关键词召回差的问题,通常需要融合和 rerank。 所有知识库都只做 topK 向量搜索。
Tool Schema schema 是应用执行前的契约;真实权限、校验、幂等、审计必须在工具/API 层完成。 让模型判断是否有权限调用工具。
Memory 长期记忆需要 write policy、来源、置信度、TTL、冲突处理和用户删除能力。 把全部聊天历史塞进向量库。
Agent Loop 必须有 step budget、timeout、cost budget、stop condition、loop detection 和可回放 trace。 只靠 max tokens 或“模型自己会停”。
LLM Judge 需要固定 rubric、anchor examples、人工校准样本和可观察标准;不能让 judge 判断隐藏意图。 换更强模型打分就算评测系统。
Prompt Injection 用户输入、网页、PDF、检索片段、工具返回都是不可信数据,不能覆盖系统策略和工具权限。 只在 prompt 里写“不要被注入”。

3. 可靠来源

来源 可验证知识
OpenAI Agents SDK Agents 是能规划、调用工具、协作和维持足够状态完成多步任务的应用;复杂 orchestration、工具执行、审批和状态由应用侧拥有。
OpenAI Agent Improvement Loop 从真实 traces 收集反馈,转成 evals,再用证据驱动 harness 改进。
LangGraph Persistence 短期记忆可由 checkpointer 管理,长期记忆可由 store 管理,支持中断、恢复和跨运行状态。
LangChain HITL 高风险工具调用可以 pause,并由人工 approve、edit、reject 或 respond 后恢复执行。
Anthropic Tool Use 工具调用由模型提出结构化调用,client tools 由应用执行,server tools 由平台执行,边界必须清楚。
Pinecone Hybrid Search dense + sparse 检索能组合语义和词法能力,但会带来索引和融合的运维复杂度。
Pinecone Metadata Filter 查询时可用 metadata filter 限制满足条件的记录,适合权限、范围和租户过滤。
OWASP LLM Top 10 prompt injection、sensitive information disclosure、excessive agency、vector/embedding weaknesses 等是 AI 应用特有风险。

4. 面试使用方式

回答任何 AI 应用系统设计题,都按这条线组织:需求边界 → 数据流 → 状态 → 模型/工具/RAG → 权限 → 失败模式 → eval → trace → 成本延迟 → 上线回滚。缺任一项,答案通常只能到 P5/P6 初段。