主题
AI Agent 年度学习检查表
这不是一张术语背诵表。一个主题只有经过下面三层,才算真正掌握:
- L1 · 能解释:不用照定义,能在两分钟内讲清它解决什么问题、什么时候不该用。
- L2 · 能实现:能在一个小项目里做出最小可运行版本,并看见输入、状态变化和输出。
- L3 · 能排障:知道它常见的失败方式,能从日志、轨迹或数据里定位问题并说出取舍。
每个模块按 L1 -> L2 -> L3 往前走。框架名称会变,验收标准不跟着框架一起过期。
P0:今年必须形成闭环
1. Agent 大地图与边界
覆盖:Chatbot、Workflow、Agent、最小 Agent Loop、停止条件、产品边界。
- [ ] L1:能区分普通问答、固定工作流和自主 Agent,并说明为什么不是任务越复杂越该上 Agent。
- [ ] L2:实现一条
目标 -> 决策 -> 行动 -> 观察 -> 修正/结束的最小闭环。 - [ ] L3:能识别无效循环、目标漂移和过度自治,并给出步数、时间或成本预算。
2. 工具调用与结构化输入输出
覆盖:Tool / Function Calling、JSON Schema、参数校验、结果聚合、串行与并行工具。
- [ ] L1:能讲清模型“选择工具”和程序“真正执行工具”的责任边界。
- [ ] L2:实现至少两个工具,支持参数校验、工具报错、并行调用和统一返回模型。
- [ ] L3:能处理超时、部分成功、重复执行和有依赖关系的工具调用。
3. 上下文、状态与记忆
覆盖:Context Window、线程状态、会话隔离、Checkpoint、短期记忆、长期记忆、记忆压缩。
- [ ] L1:能区分当前上下文、会话状态和跨会话记忆,知道它们不该塞进同一个消息数组。
- [ ] L2:让多轮会话可恢复,并按
user_id / thread_id / run_id隔离和持久化状态。 - [ ] L3:能处理长对话超限、并发写入、旧记忆污染和服务重启后的恢复。
4. RAG 与知识更新
覆盖:语义分片、Embedding、向量检索、关键词 / 混合检索、查询重写、Rerank、引用、版本与增量索引、Lost in the Middle。
- [ ] L1:能画出
入库 -> 切分 -> 索引 -> 检索 -> 重排 -> 生成,并解释每步会丢什么信息。 - [ ] L2:做一个可增量更新、能返回来源的文档问答,并用真实问题检查召回结果。
- [ ] L3:能排查切分错误、召回错文档、新旧版本冲突和长上下文中间信息被忽略。
5. 规划、路由与工作流编排
覆盖:ReAct、Plan-and-Execute / Plan-and-Solve、语义路由、条件分支、模型路由、并行与汇合。
- [ ] L1:能比较“边做边想”和“先规划再执行”,知道路由可以用规则、分类器或 LLM。
- [ ] L2:实现一条包含分类、分支、工具执行、结果汇合和退出条件的可观察流程。
- [ ] L3:能处理误路由、计划过时、分支状态冲突和执行中途需要重新规划。
6. 评估、可观测性与可靠性
覆盖:Trace、离线评测集、轨迹评估、重试、退避、限流、幂等、缓存、熔断、死循环检测、成本与延迟。
- [ ] L1:能区分“最终答案看着不错”和“执行过程稳定、可复现、可追踪”。
- [ ] L2:记录一次运行的模型调用、工具参数、状态变化、耗时、Token / 成本和最终结果。
- [ ] L3:能注入 API 限流、工具超时、重复消息和模型坏输出,验证系统能恢复或安全失败。
7. 权限、安全与人工接管
覆盖:最小权限、Prompt Injection、输入 / 输出 Guardrails、敏感操作确认、Human-in-the-loop、审计记录。
- [ ] L1:能说明“模型说可以”为什么不等于“系统应该执行”。
- [ ] L2:给读、写、删除、发布等工具分级,并为高风险动作加入明确确认和审计。
- [ ] L3:能处理恶意文档指令、越权工具调用、敏感信息泄露和审批后断点续跑。
P1:做过一次,知道何时值得上
8. 多模态文档理解
覆盖:OCR、版面分析、表格 / 图纸、手写批注、图文联合检索。
- [ ] 能把“识别文字”和“理解文字在图上的位置与关系”分开设计。
- [ ] 做过一次带版面坐标或图片区域引用的检索示例。
9. Graph RAG
- [ ] 能解释它相对普通向量检索擅长的关系型、多跳型问题。
- [ ] 能判断什么时候知识图谱的构建和维护成本不值得。
10. 多 Agent 协作
- [ ] 能区分 Subagent、Tool Calling 和 Handoff,明确最终责任归谁。
- [ ] 只在权限、上下文或专业职责确有边界时拆分,并处理交接状态。
11. 协议与可复用集成
覆盖:MCP、资源 / 工具 / Prompt 暴露、客户端能力协商。
- [ ] 接入或实现过一个最小 MCP Server / Client。
- [ ] 能解释 MCP 解决的是集成协议问题,不会自动让 Agent 更聪明。
不作为毕业条件
- 不要求背下所有论文名、框架 API 和模式名。
- 不要求为了展示技术而强行上 Graph RAG 或多 Agent。
- 不按“看过文章”打勾;至少能完成 L1,核心模块尽量做到 L2。
- 新框架、新模型和热词只补进对应模块,不随热点重画整张地图。
2026 年剩余时间怎么验收
- 第一轮:P0 七个模块都达到 L1,能够把整套 Agent 系统讲顺。
- 第二轮:依托一个真实项目,让 P0 至少五个模块达到 L2,不另造一堆演示仓库。
- 第三轮:挑三种真实故障做演练,让可靠性、安全和一个业务主模块达到 L3。
- 年底复盘:重新看一份 Agent 面试题,能把问题放回地图、给出方案、边界和排障入口,而不是只认得名词。