Skip to content

AI Agent 年度学习检查表

这不是一张术语背诵表。一个主题只有经过下面三层,才算真正掌握:

  • L1 · 能解释:不用照定义,能在两分钟内讲清它解决什么问题、什么时候不该用。
  • L2 · 能实现:能在一个小项目里做出最小可运行版本,并看见输入、状态变化和输出。
  • L3 · 能排障:知道它常见的失败方式,能从日志、轨迹或数据里定位问题并说出取舍。

每个模块按 L1 -> L2 -> L3 往前走。框架名称会变,验收标准不跟着框架一起过期。

P0:今年必须形成闭环

1. Agent 大地图与边界

覆盖:Chatbot、Workflow、Agent、最小 Agent Loop、停止条件、产品边界。

  • [ ] L1:能区分普通问答、固定工作流和自主 Agent,并说明为什么不是任务越复杂越该上 Agent。
  • [ ] L2:实现一条 目标 -> 决策 -> 行动 -> 观察 -> 修正/结束 的最小闭环。
  • [ ] L3:能识别无效循环、目标漂移和过度自治,并给出步数、时间或成本预算。

2. 工具调用与结构化输入输出

覆盖:Tool / Function Calling、JSON Schema、参数校验、结果聚合、串行与并行工具。

  • [ ] L1:能讲清模型“选择工具”和程序“真正执行工具”的责任边界。
  • [ ] L2:实现至少两个工具,支持参数校验、工具报错、并行调用和统一返回模型。
  • [ ] L3:能处理超时、部分成功、重复执行和有依赖关系的工具调用。

3. 上下文、状态与记忆

覆盖:Context Window、线程状态、会话隔离、Checkpoint、短期记忆、长期记忆、记忆压缩。

  • [ ] L1:能区分当前上下文、会话状态和跨会话记忆,知道它们不该塞进同一个消息数组。
  • [ ] L2:让多轮会话可恢复,并按 user_id / thread_id / run_id 隔离和持久化状态。
  • [ ] L3:能处理长对话超限、并发写入、旧记忆污染和服务重启后的恢复。

4. RAG 与知识更新

覆盖:语义分片、Embedding、向量检索、关键词 / 混合检索、查询重写、Rerank、引用、版本与增量索引、Lost in the Middle。

  • [ ] L1:能画出 入库 -> 切分 -> 索引 -> 检索 -> 重排 -> 生成,并解释每步会丢什么信息。
  • [ ] L2:做一个可增量更新、能返回来源的文档问答,并用真实问题检查召回结果。
  • [ ] L3:能排查切分错误、召回错文档、新旧版本冲突和长上下文中间信息被忽略。

5. 规划、路由与工作流编排

覆盖:ReAct、Plan-and-Execute / Plan-and-Solve、语义路由、条件分支、模型路由、并行与汇合。

  • [ ] L1:能比较“边做边想”和“先规划再执行”,知道路由可以用规则、分类器或 LLM。
  • [ ] L2:实现一条包含分类、分支、工具执行、结果汇合和退出条件的可观察流程。
  • [ ] L3:能处理误路由、计划过时、分支状态冲突和执行中途需要重新规划。

6. 评估、可观测性与可靠性

覆盖:Trace、离线评测集、轨迹评估、重试、退避、限流、幂等、缓存、熔断、死循环检测、成本与延迟。

  • [ ] L1:能区分“最终答案看着不错”和“执行过程稳定、可复现、可追踪”。
  • [ ] L2:记录一次运行的模型调用、工具参数、状态变化、耗时、Token / 成本和最终结果。
  • [ ] L3:能注入 API 限流、工具超时、重复消息和模型坏输出,验证系统能恢复或安全失败。

7. 权限、安全与人工接管

覆盖:最小权限、Prompt Injection、输入 / 输出 Guardrails、敏感操作确认、Human-in-the-loop、审计记录。

  • [ ] L1:能说明“模型说可以”为什么不等于“系统应该执行”。
  • [ ] L2:给读、写、删除、发布等工具分级,并为高风险动作加入明确确认和审计。
  • [ ] L3:能处理恶意文档指令、越权工具调用、敏感信息泄露和审批后断点续跑。

P1:做过一次,知道何时值得上

8. 多模态文档理解

覆盖:OCR、版面分析、表格 / 图纸、手写批注、图文联合检索。

  • [ ] 能把“识别文字”和“理解文字在图上的位置与关系”分开设计。
  • [ ] 做过一次带版面坐标或图片区域引用的检索示例。

9. Graph RAG

  • [ ] 能解释它相对普通向量检索擅长的关系型、多跳型问题。
  • [ ] 能判断什么时候知识图谱的构建和维护成本不值得。

10. 多 Agent 协作

  • [ ] 能区分 Subagent、Tool Calling 和 Handoff,明确最终责任归谁。
  • [ ] 只在权限、上下文或专业职责确有边界时拆分,并处理交接状态。

11. 协议与可复用集成

覆盖:MCP、资源 / 工具 / Prompt 暴露、客户端能力协商。

  • [ ] 接入或实现过一个最小 MCP Server / Client。
  • [ ] 能解释 MCP 解决的是集成协议问题,不会自动让 Agent 更聪明。

不作为毕业条件

  • 不要求背下所有论文名、框架 API 和模式名。
  • 不要求为了展示技术而强行上 Graph RAG 或多 Agent。
  • 不按“看过文章”打勾;至少能完成 L1,核心模块尽量做到 L2。
  • 新框架、新模型和热词只补进对应模块,不随热点重画整张地图。

2026 年剩余时间怎么验收

  • 第一轮:P0 七个模块都达到 L1,能够把整套 Agent 系统讲顺。
  • 第二轮:依托一个真实项目,让 P0 至少五个模块达到 L2,不另造一堆演示仓库。
  • 第三轮:挑三种真实故障做演练,让可靠性、安全和一个业务主模块达到 L3。
  • 年底复盘:重新看一份 Agent 面试题,能把问题放回地图、给出方案、边界和排障入口,而不是只认得名词。