从 “文字接龙” 到 “多智能体协作” —— 用一条能力递进的主线,串起 113 课时的全部知识。
作者姜磺写这本书的初衷,是把 AI 时代 70+ 概念、20+ 框架从「碎片化焦虑」整理成一条「能力递进」的知识链。读这本书最忌讳零敲碎打,抓住下面两条主线,你就抓住了整本书的骨架。
每个章节卡片提炼了该章「要解决什么问题」「核心知识点」「重要类比」与「关键术语」。展开即得一份可自测的精读清单。
按“原理 → 训练 → 应用 → 智能体”分层精选。学习时先盖住右侧含义自测,是最高效的主动回忆练习。
模型处理文本的最小单位;中文约 1 字 ≈ 1 Token,英文 1 词 ≈ 0.75 Token。一切计费与窗口的计量基础。
逐词预测:把已生成的词作为下文输入,直到输出结束。误差会“雪球”累积,这是幻觉与偏题的根源之一。
基于 Self-Attention 的架构:词与词直接互相关注、可并行,解决长程依赖。所有主流大模型的共同底座。
把文字映射成低维稠密向量,语义相近则向量相近。国王−男人+女人≈女王的“语义代数”就发生在向量空间。
衡量两向量方向接近度(−1~1)。RAG 检索“找最相关片段”的本质就是算这个值并排序取 Top-K。
在海量文本上做自监督“预测下一个词”,让模型获得通用语言能力。产出“通才”,成本以千万美元计。
用人工问答对让模型学会“回答问题”而非“接龙”。只教“如何回答”,不教“什么是好回答”。
用人类偏好排序训练奖励模型,再强化学习优化——教模型“符合人类价值观地做事”(对齐)。
规模跨过阈值后突然出现、小模型没有的能力(算术/代码/推理)。呼应“大力出奇迹”与 Scaling Laws。
Loss 与规模呈幂律:L∝N^−α。让“赌涌现”从盲目赌博变成“有保底的风险投资”。
不更新参数,靠提示词里给例子(Zero/One/Few-Shot)让模型即时学会新任务——Prompt 工程的理论根基。
让模型展示“分步推理”而非直接给答案,显著提升复杂任务准确率;“让我们一步步思考”即可触发。
采样前调整概率分布“尖锐/平缓”:低值更确定、高值更有创造力。事实问答用低温,创意任务用高温。
只从“累积概率达 p”的动态候选集里采样;模型越确定候选越少。建议与 Temperature 只调其一。
看似合理实则虚构的输出。根因是“预测最像”而非“判断真假”;工程上用 RAG/工具调用/验证来兜底。
单次能处理的 Token 上限(如 128K/1M)。决定可携带历史长度,是记忆与成本的硬约束。
messages 三种身份:system 设人设规则、user 提问、assistant 记录 AI 历史回复。多轮对话必须携带全量历史。
stream=True 让内容边生成边返回,提升“感知速度”。流式计费需 stream_options.include_usage。
优秀提示词框架:角色+任务+上下文+格式+约束。结构化输出优先用 response_format 而非口头要求。
先检索知识库(向量相似度)再让 AI 基于资料生成。低成本解决知识过时与私有数据;RAG=搜索+AI 给“答案”。
把长文档切成“最小、完整、语义单元”的片段再入库;结构化文档按标题/条目分块效果最佳,重叠 10–20%。
海量向量近似检索引擎,HNSW 是主流算法。Chroma 入门、Milvus 企业级、Pinecone 云托管。
向量 + 关键词(BM25)等多路检索合并去重,再用精排模型重打分。专有名词、精确匹配靠 BM25 补位。
LLM 决策并输出“调哪个函数+参数”,代码真正执行后把结果回填。本质是“决策与执行分离”。
定义工具参数的类型/必填/枚举/默认值。description 写得越清晰,LLM 选对工具的概率越高。
把工具/数据源封装成独立进程服务的开放标准(2024.11 Anthropic 发起)。“AI 的工具 USB 接口”。
MCP Server 三大能力:Resources(只读数据)/ Tools(执行操作)/ Prompts(预制模板)。LLM 决策、应用调度、Server 执行。
MCP 的消息格式(请求/响应/通知),方法用命名空间分层如 tools/call;传输层可选 stdio/SSE/WebSocket。
六大组件 Models/Prompts/Chains/Memory/Tools/Agents + LCEL 管道。原则:能用 Chain 就别用 Agent。
State/Node/Edge/Graph 把 AI 流程做成“白盒有状态工作流”,支持条件分支、循环与人工介入中断点。
SKILL.md(name+description 元数据 + 正文)封装领域知识;description 是触发“路由钥匙”。
“目标优先”的智能决策体:感知—思考—行动循环。特征=目标导向/持续/可行动/可感知/可控。
Thought → Action → Observation 循环,把“思考”显式化以便调试。生产环境 Agent 的主流推理范式。
四层:短期(对话窗口)、工作(任务 State)、长期(向量库/DB)、情景(事件日志)。遗忘=删除/压缩/降级。
在关键节点暂停让“人拍板”再恢复执行,是 AI 应用可靠落地的必备机制(LangGraph checkpointer 实现)。
多个专业 Agent 分工协作(层级/协商/流水线/动态),突破单 Agent 能力与上下文上限,迈向群体智能。
Crew+Agent+Task+Process 构建多 Agent:Sequential 顺序流或 Hierarchical 管理器分发。
Google 主导的跨平台 Agent 互操作标准;Agent Card 描述能力供注册中心动态发现。
用“意图+感觉”编程而非语法;边界=不能自证正确,需要人把控架构与质量。
需求→设计文档→AI 生成代码→人工审核。文档同时是 AI 记忆、团队契约、审核标准,适合中大型项目。
用 LOOP.md 定义“岗位职责”让 Agent 自主循环(发现问题→处理→汇报),配 gate.yaml 机械安全门。
确定性流程用传统代码、需要理解/生成的环节才调 LLM;一个考试系统因此省下约 75% Token。
这本书结构设计本身就利于自学:每节有“阅读指南”、正文大量类比、章末有“学点英语 + 思考帧 + 冷知识”。下面六条方法是把书读“透”的杠杆。
第一遍只读各章「第 1 节」和章末结语,先在大脑里画出“第 1–3 章讲原理 → 第 4 章上手 → 第 5–7 章给知识与能力 → 第 8–10 章框架封装 → 第 11–13 章智能体”的骨架;第二遍再逐节填充。带着“它在能力主线哪个位置”的问题读,比顺序硬啃高效得多。
每读完一节,合上书用一句话向“小白”解释:“这本书把 X 比喻成什么”(如 Transformer=群聊、HNSW=多层地图、MCP=npm)。能讲出书中类比并自创一个新类比,说明真懂了;讲不出就回去重读。
用第贰部分的“知识地图”当自测题:点开章节前先默写它的核心知识点与术语,盖住速查卡释义回忆,卡住的地方打标记。间隔 1 天 / 3 天 / 7 天重测——记忆留存率远高于重读划线。
书中第 4 章起几乎所有课时带可运行代码(samples/ 目录)。原则:先自己读代码猜输出 → 运行验证 → 故意改坏一处看报错。翻译器→游戏问答→Java 规范 RAG→装备查询 FC→旅行 Agent,五个项目跑通,应用层知识才算真正到手。
遇到卡点先问大模型并连续追问(“换个例子”“如果数据是 100 倍呢”);用学到的 Prompt 五要素给它下任务,让它按你的要求生成练习题或代码评审。用 Prompt 工程的方法学 Prompt 工程,事半功倍。
AI 技术迭代极快,优先学透全书反复强调的不变量:概率生成、无状态、上下文窗口、幻觉、涌现。RAG/FC/MCP/Agent 每年都在变,但只要底层原理清晰,新技术出现时你只需问三个问题——它解决哪个阶段的问题?在演进链什么位置?和现有技术什么关系?
第一遍(扫读,约 2–3 天):只读阅读指南、加粗句、小结与类比,建立全书地图。第二遍(精读 + 敲码,约 2–4 周):按下方学习路径逐章过,同步运行全部示例。第三遍(项目反哺,长期):带着自己的真实项目回头查章节——这时的书是一本“手册”,而非“课本”。
全书是一条"能力递进"主轴:理解原理(1–3 章)→ 初次实战(4 章)→ 赋予知识与能力(5–7 章)→ 框架提效(8–9 章)→ 能力封装(10 章)→ 智能体构建(11–12 章)。不必逐课时平推,先认清自己是哪类学习者、时间预算几何,再按下表"跳读 + 深读 + 跑项目"组合推进。三条路线的终点一致:能独立做出一个调用 AI 能力解决真实问题的应用。
全书有一条隐藏的动手主线——五个递进项目恰好对应"会调用 → 有知识 → 有手脚 → 会当家 → 会协作"五个能力阶段。每一个都建议独立跑通后,再按书中思路改造成自己的版本。第六个是第 10 章的能力封装彩蛋。
项目推进心法:先自己读代码猜输出 → 运行验证 → 故意改坏一处看报错 → 修复后加一个新功能。把这四步走完才算"跑通"。所有示例代码位于全书 samples/ 目录,从第 4 章翻译器到第 12 章考试系统,值得逐一手动运行一遍。
以下语句均摘录自原书章节原文——适合抄在便签上,也适合在学不下去时回来看一眼。
"开始动手吧,实践是最好的老师。"第 12 章 · 全书结语
"工程化是 AI 落地的最后一公里。Demo 很容易,生产很难。"第 12 章 · 结语 AI 开发的思考
"技术是工具,选择权在人。AI 最成功的应用不是替代人类,而是增强人类。"第 12 章 · 结语 AI 开发的思考
"技术会过时,工具会更新,但能力递进的逻辑不会变。理解了这个逻辑,你就掌握了一把钥匙。"第 12 章 · 结语致谢
"如果能用 10 行 Python 写出确定性逻辑,就不要用 AI。"第 12 章 · 核心设计原则
"真正的工程师不会把自己系统的命运交给一个黑盒。"第 0 章 · 前言 vibe-spec-coding
"Vibe Coding 改变了编程方式,但没有降低对开发者的要求。"第 0 章 · 前言 Vibe Coding 的边界
"Spec-Coding 最有价值的地方,在于解决了程序员一个根深蒂固的矛盾:都知道文档重要,但就是从来不写。"第 0 章 · 前言 Spec-Coding 的价值