一总览:路线图与阶段划分
Agent 开发的本质是:用 LLM 作为推理内核,让它能够感知环境、调用工具、维护状态、自主决策,并在工程约束(成本、延迟、可靠性)下完成多步任务。因此学习路线要覆盖四层能力:
| 能力层 | 内容 | 对应阶段 |
| 模型交互层 | LLM API、上下文窗口、采样参数、流式输出、多模态 | 阶段一 |
| 行为塑造层 | Prompt 设计、结构化输出、Few-shot、思维链 | 阶段二 |
| 能力扩展层 | Function Calling、MCP、RAG、记忆系统 | 阶段三、四 |
| 系统编排层 | Agent 架构模式、框架、多智能体、评估、可观测性、部署 | 阶段五、六 |
节奏说明:全计划按「每周投入 10–14 小时」设计。若每周只能投入 5–6 小时,把周期等比拉长到 28–32 周即可,不要砍掉动手环节——Agent 是极度依赖手感的领域,只看文章不看报错的人学不会。
路线图
- 第 1–2 周 模型交互地基(Python + LLM API + 流式/多模态)
- 第 3–4 周 Prompt 与结构化输出(可解析、可验证的 LLM 调用)
- 第 5–6 周 工具调用与 MCP(让模型"长出手脚")
- 第 7–9 周 RAG(向量检索、混合检索、重排、评估)
- 第 10–12 周 Agent 架构与框架(ReAct / Plan-Execute / LangGraph / 多智能体)
- 第 13–16 周 工程化(评估体系、可观测性、护栏、成本、部署)+ 毕业项目
二阶段一(第 1–2 周):地基 —— Python 与 LLM API
目标
能独立、稳定地调用主流大模型 API,理解模型行为背后的关键参数,能写出处理流式输出与异常重试的健壮代码。
知识点清单
- Python 快速上手(Java 视角):类型注解(
typing)、装饰器、异步(asyncio)、虚拟环境与依赖管理(uv / venv)。Java 开发者重点关注:动态类型带来的运行时错误,务必养成写类型注解的习惯。
- LLM 核心概念:Token 与上下文窗口、温度(temperature)与 top_p、系统提示词的角色、最大输出限制、各模型的定价与限流。
- API 实操:OpenAI 兼容格式(国内模型几乎全部兼容)、对话消息结构(system/user/assistant/tool)、流式输出(SSE)、多模态输入(图片/文档)。
- 健壮性基础:指数退避重试、限流处理(429)、超时与取消、结构化日志。
动手任务
- 任务 1.1:写一个命令行多轮对话程序,支持流式输出、历史裁剪(超过 N token 时丢弃最早轮次)、断线重试。
- 任务 1.2:写一个"批量摘要脚本":读入 20 个文本文件,并发(asyncio)调用模型生成摘要,控制并发数 ≤ 5,失败自动重试,最后汇总成 Markdown 报告。
验收标准
✓ 能解释清楚:为什么上下文长度不等于"能塞进这么多字";✓ 你的批量脚本能跑完 20 个文件且中途无人工干预;✓ 能估算一次调用的成本并打印出来。
三阶段二(第 3–4 周):Prompt Engineering 与结构化输出
目标
从"和模型聊天"升级为"给模型下规格":写出可解析、可验证、可回归测试的 Prompt,这是 Agent 可靠性的第一道防线。
知识点清单
- 结构化输出:JSON Schema 约束、JSON mode、Pydantic 模型校验、输出解析失败的重试策略。
- Prompt 设计模式:角色设定、任务分解、Few-shot 示例、思维链(CoT)、输出格式约定、负面约束的写法(告诉模型"不要做什么"往往不如告诉它"要做什么"有效)。
- Prompt 的工程化管理:把 Prompt 当代码管理——版本化、参数化模板(如 Jinja2)、回归测试集。
- 常见陷阱:指令冲突、上下文稀释("迷失在中间")、过度依赖 CoT 导致的慢与贵。
动手任务
- 任务 2.1:实现一个"客服工单分类器":输入原始工单文本,输出 Pydantic 校验过的结构(类别 / 紧急度 / 情绪 / 摘要),解析失败率要求 < 2%(用重试 + Schema 约束达成)。
- 任务 2.2:搭建一个极简 Prompt 回归测试脚本:准备 30 条标注样本,每次改 Prompt 后跑一遍,输出准确率对比。
验收标准
✓ 能说明 JSON mode、Schema 约束、输出后校验三种手段各自解决什么问题;✓ 分类器在 30 条样本上准确率 ≥ 85%,且每一次修改都有数据对比。
四阶段三(第 5–6 周):工具调用、Function Calling 与 MCP
目标
理解"模型决定调用什么"与"系统实际执行什么"的边界,掌握工具设计的最佳实践,了解 MCP 协议为什么出现、解决了什么问题。
知识点清单
- Function Calling 机制:完整请求-响应循环(模型返回 tool_calls → 你执行 → 回填 tool 结果 → 模型继续),并行工具调用,强制调用(tool_choice)。
- 工具设计原则:工具名与描述是给模型看的"API 文档";参数设计要少而清晰;返回值要模型可读(别返回 50 行原始 JSON,做裁剪和摘要);一个工具做一件事,宁可选组合也不用布尔参数爆炸。
- 错误处理:工具报错要把错误信息回填给模型让它自行调整,而不是直接崩溃——这是新手最常见的坑。
- MCP(Model Context Protocol):协议动机(M×N 集成问题)、Server/Client 架构、tools/resources/prompts 三类能力、stdio 与 HTTP 传输、如何写一个最小 MCP Server。
- 安全边界:工具权限分级、危险操作的确认机制、注入风险(工具返回的内容可能含有恶意指令)。
动手任务
- 任务 3.1:不使用任何框架,纯手写一个工具调用循环:给模型提供「查天气」「查日历」「发提醒」三个工具,让它能完成"明天如果下雨,早上 8 点提醒我带伞"这类多步任务。
- 任务 3.2:写一个最小 MCP Server(如暴露"读取本地笔记"能力),并用一个支持 MCP 的客户端连通测试。
- 任务 3.3:故意让一个工具抛异常,验证你的循环能优雅处理并让模型自行换路。
验收标准
✓ 能在白板上画出 function calling 完整时序图;✓ 手写循环任务 3.1 无框架跑通;✓ 能说清 MCP 与直接写 function calling 相比的收益与代价。
五阶段四(第 7–9 周):RAG 检索增强
目标
完整掌握"让模型用上外部知识"的工程全链路:切片 → 向量化 → 检索 → 重排 → 生成 → 评估。RAG 是目前企业级 Agent 落地中占比最高的场景。
知识点清单
- 文档处理:格式解析(PDF/Word/HTML/表格)、清洗、切片策略(固定长度 / 递归 / 语义切片 / 按文档结构切片)、重叠窗口、切片的元数据设计(来源、标题、日期——引用溯源全靠它)。
- Embedding 与向量库:Embedding 模型的选择与维度、相似度度量、向量库(Milvus / Qdrant / FAISS / pgvector)的取舍、索引与增量更新。
- 检索策略:向量检索的局限、混合检索(BM25 关键词 + 向量)、查询改写(HyDE、多查询展开、子问题分解)、重排(Cross-Encoder / Rerank API)、Top-K 与上下文预算的平衡。
- 生成与引用:答案要带引用来源、"检索不到就明说"的拒答设计。
- RAG 评估:检索命中率(Hit Rate / MRR)、生成忠实度(Faithfulness)、答案相关性,用 Ragas 等工具跑通一次完整评估。
- 进阶认知:什么场景 RAG 不如长上下文直塞?什么场景该上 GraphRAG / 结构化查询(Text2SQL)?——面试高频问题。
动手任务
- 任务 4.1:把你手头一份真实文档(如 30MB 需求 Word 文档的某个章节、或一套教材)做成问答机器人:解析 → 切片 → 入库 → 检索问答,答案带页码/章节引用。
- 任务 4.2:给任务 4.1 加混合检索 + 重排,用 20 个自建测试问题对比"纯向量 vs 混合 vs 混合+重排"的命中率,写成一份对比报告。
- 任务 4.3:设计拒答逻辑:检索得分低于阈值时明确回答"文档中没有相关内容",并用测试集验证误拒率。
验收标准
✓ 能说出三种切片策略各自的适用文档类型;✓ 对比报告里有量化数据支撑结论;✓ 能解释"检索没问题但回答错了"和"检索就错了"如何区分排查。
六阶段五(第 10–12 周):Agent 架构与框架实战
目标
这是核心阶段。理解主流 Agent 架构模式的适用边界,熟练掌握至少一个图编排框架,能设计多智能体协作系统。
知识点清单
- 架构模式光谱(从可控到自主):
- 工作流(Workflow):预定义流程 + 模型填充节点,可控性最高;
- ReAct:思考 → 行动 → 观察 循环,最经典的自主模式;
- Plan-and-Execute:先全局规划再分步执行,适合长任务;
- Reflection / 自我修正:执行后自评并重试;
- Multi-Agent:主管-工人模式(Supervisor)、流水线模式、辩论模式。
- 核心判断力:Anthropic 的《Building Effective Agents》核心观点——能用工作流解决的不要上自主 Agent。复杂度是成本,简单模式优先。
- 状态与记忆:短期记忆(对话历史管理、上下文压缩/摘要)、长期记忆(事实库、用户偏好、向量记忆)、检查点(Checkpoint)与断点恢复。
- 框架实战(主攻一个,理解两个):
- LangGraph(推荐主攻):图编排、状态机、Human-in-the-loop 中断恢复——工业界主流;
- OpenAI Agents SDK:轻量,Handoff 模式简洁;
- AutoGen / CrewAI:多智能体对话编排的代表;
- 了解 Claude Agent SDK / 各家 coding agent 的设计思想。
- Human-in-the-loop:关键操作前暂停等人工确认、中断后从检查点恢复——企业落地刚需。
动手任务
- 任务 5.1:用 LangGraph 重写阶段三的手写工具循环,体会图编排带来的状态管理、条件路由和可观测性收益。
- 任务 5.2:实现一个 Plan-and-Execute 研究助手:给定主题 → 规划子问题 → 逐个调用搜索/RAG 工具 → 汇总报告,支持执行中断点恢复。
- 任务 5.3:搭一个 Supervisor 多智能体系统:一个主管调度「检索员」「计算员」「写作员」完成"分析某公司财报并写摘要"任务。
- 任务 5.4:在 5.2 中加入 Reflection 节点:草稿生成后自评"是否回答了所有子问题",不达标则补充检索。
验收标准
✓ 面对任意需求,能先判断"该用工作流还是自主 Agent,为什么";✓ 能画出你的多智能体系统的图结构并解释每个边存在的原因;✓ 中断恢复真的能工作(杀掉进程重启,从检查点继续)。
七阶段六(第 13–16 周):工程化、评估与上线
目标
Demo 与产品之间的距离,全在这个阶段补齐。这是区分"会玩 Agent"和"能交付 Agent"的分水岭,也是面试考察的重心。
知识点清单
- 评估体系(Eval):
- 构建评估集(真实场景抽样 + 边界用例)、单步评估 vs 端到端评估;
- LLM-as-Judge:设计评分量规(rubric)、位置偏差与自评偏差的校正;
- 回归测试:每次改 Prompt/换模型全量跑评估集——Agent 版的 CI。
- 可观测性:全链路 Tracing(每次工具调用、每步 LLM 输入输出的记录)、LangSmith / Langfuse / OpenTelemetry、成本与延迟的分步归因。
- 可靠性工程:
- 死循环防护(最大步数、重复动作检测);
- 幻觉抑制(引用约束、事实验证节点);
- 护栏(Guardrails):输入侧注入检测、输出侧敏感内容与格式校验;
- 降级策略:模型超时切备用模型、工具失败切缓存/默认值。
- 成本与延迟优化:模型分级路由(简单步骤用小模型)、缓存(语义缓存)、并行化独立步骤、上下文裁剪、Prompt 瘦身。
- 安全:Prompt 注入(直接/间接)、工具越权、数据隔离(多租户)、密钥管理。
- 部署:异步任务队列、流式接口(SSE/WebSocket)、会话状态外置(Redis)、灰度与 A/B。
动手任务(毕业项目)
毕业项目 · 第 13–16 周
选择一个你真实有需求的场景,把前面所有能力串起来,做成可演示、可运维的系统。推荐题目(按你的工作背景定制):
- A. 需求文档问答与设计辅助 Agent:针对大体量 Word 需求文档,做"检索问答 + 条目抽取 + 生成设计文档初稿"的多步骤系统,带引用溯源与人工确认环节。
- B. 教材内容整理 Agent:读入多章节 Markdown 教材,自动生成知识点卡片、章节测验题、术语表,输出结构化文档。
- C. 数据报表助手:自然语言提问 → Text2SQL 查询 → 图表生成 → 解读报告,带 SQL 安全校验与错误重试。
毕业标准:① 有 50+ 用例的评估集和评估报告;② 接入 Langfuse 类追踪,能展示任意一次运行的完整链路与成本;③ 有护栏与降级方案说明;④ 一份架构决策记录(为什么这么设计、放弃了什么方案)。
八三个里程碑项目(贯穿全程)
| 里程碑 | 时间 | 内容 | 能力验证点 |
M1 结构化调用工具箱 |
第 6 周末 |
无框架手写:结构化输出 + 工具调用循环 + 错误回填 + 重试 |
理解底层机制,不被框架黑盒绑架 |
M2 领域知识问答系统 |
第 9 周末 |
真实文档 RAG:解析→切片→混合检索→重排→带引用生成→评估报告 |
RAG 全链路 + 数据驱动的优化方法 |
M3 多智能体应用 |
第 12 周末 |
LangGraph 图编排:Plan-Execute + 多角色协作 + 断点恢复 + Human-in-the-loop |
架构设计能力 + 框架熟练度 |
三个里程碑 + 毕业项目,构成你简历上的四个可讲述的实战故事——面试中比任何证书都有说服力。
九学习方法与避坑指南
方法
- 先机制后框架:每个概念先用裸 API 手写一遍,再用框架实现。框架迭代很快,机制不变。
- 读源码级论文与官方工程博客:ReAct、Reflexion、Anthropic 的《Building Effective Agents》《Writing Effective Tools》、OpenAI 的《A Practical Guide to Building Agents》——这类一手材料比二手教程价值高一个数量级。
- 建立自己的错误博物馆:每次 Agent 跑挂,记录「现象 → 根因 → 修复 → 如何预防」。一个月后这本册子就是你的面试弹药库。
- 每周输出:把当周任务写成笔记或博客。写作会暴露理解的漏洞。
避坑
- ❌ 一上来就堆多智能体——90% 的需求一个精心设计的单 Agent + 好工具就够了。
- ❌ 只调 Prompt 不建评估集——没有评估集的优化是玄学,也是面试扣分项。
- ❌ 忽视工具描述的质量——工具描述写得差,再强的模型也会选错工具。
- ❌ 把上下文塞满——上下文越长模型注意力越稀释,"更多信息"经常导致"更差决策"。
- ❌ 无护栏直接放自主 Agent 碰生产系统(尤其有写权限的)——先 Human-in-the-loop,再逐步放开。
十资源汇总
一手材料(必读)
- Anthropic:Building Effective Agents、Writing Effective Tools for Agents、Building Context Engineering —— 架构判断力的最佳来源
- OpenAI:A Practical Guide to Building Agents、Function Calling / Responses API 文档
- 论文:ReAct(推理+行动协同)、Reflexion(自我反思)、Toolformer、RAG 原始论文、Self-RAG
- MCP 官方规范与 Quickstart(modelcontextprotocol.io)
课程与文档
- DeepLearning.AI 短课系列:《AI Agents in LangGraph》《Multi AI Agent Systems with crewAI》《Building and Evaluating Advanced RAG》——短平快,适合补框架上手
- LangGraph 官方文档(含多份端到端教程与模板库 langgraph-templates)
- 12-Factor Agents(github.com/humanlayer/12-factor-agents)——Agent 工程化的十条原则,工程视角极佳
工具清单
| 类别 | 推荐 |
| 框架 | LangGraph(主攻)、OpenAI Agents SDK、CrewAI / AutoGen(了解) |
| RAG | LlamaIndex、Milvus / Qdrant / pgvector、Ragas(评估) |
| 可观测 | Langfuse(开源自部署友好)、LangSmith |
| 协议 | MCP SDK(Python/TypeScript) |
| 沙箱 | Docker(代码执行类工具的隔离运行环境) |