💡阅读指南

AI Agent应该是2026年最为流行的一个概念,我们说2026是Agent的元年一点也不为过。那么Agent到底是什么,它和网页上那种「问一句答一句」的聊天工具(ChatGPT、豆包)有什么本质不同? 这是我们本节要讨论的问题。 如果你已经了解了这个概念,可以直接跳过本节。

1.1 AI Agent 能做什么

我们先从一个场景说起。

老张是一个普通的后端开发,2026 年春天的某个工作日,他打开电脑,端起咖啡,惬意地抿了一口,同时让电脑里的某个程序把昨晚 Slack 上没看完的讨论归纳成三条要点,顺便标出几条需要他回复的消息。

吃完早饭回到座位,他告诉这个程序「把昨天那个支付模块的 bug 修复一下」。程序自己去项目目录里翻相关代码,跑了一遍测试,发现三个用例挂了。它分析报错,发现是边界条件没处理,改好代码重跑测试。最后提交了一个 PR,顺手按团队模板把描述也填好了。

下午他接到一个数据迁移的活。几万行 CSV,格式还不统一。他没自己动手,直接把文件丢给程序,让它把数据迁到新表。程序先检查源数据,写好清洗脚本,然后开始迁移。跑完之后对比源表和目标表的行数和字段分布,出了一份简短的验证报告。整个过程他就盯着进度,没写一行代码。

不只是写代码这些事。换个场景,它一样能帮上忙。比如电商网站上看中了一件商品,觉得价格还能再等等,让它帮忙盯着价格。它会帮着盯,价格一降到心理预期就自动加入购物车,甚至直接下单。再比如刷到一篇不错的长文,没时间细看,直接丢给它,它会读完、提炼要点、整理成笔记存进知识库,以后想回顾随时能搜到。甚至刷抖音看到一个好笑的段子,想截取其中几秒做成 GIF 发到群里,它也能自己打开视频找到那段画面,截下来转成 GIF 发出去。

这个程序,就是现在大家说的 AI Agent。

我们先从场景讲起,是因为 AI Agent 这个词本身有点抽象,但它做的事情其实非常具体。老张一天里做的事情,写代码、跑测试、处理数据,都是平常要人自己手动完成的活,但Agent 却能自己独立完成。

虽然每个人用Agent做的事情不一样,但Agent的特点是共通的:Agent 不是在回答问题,而是在完成工作

1.2 Agent 跟聊天工具到底差在哪

也许你会认为,这些事情我用 ChatGPT 也能做。不完全是。

我们可以用一个最简单的例子来讲清楚Agent与ChatGPT的区别。假设跟朋友约饭,想让 AI 帮忙订一家餐厅。

跟ChatGPT这类聊天工具对话,流程是这样:告诉它人数、口味偏好、地点,它列了五家餐厅推荐,附带人均价格和特色菜。

但需要自己打开大众点评,一家一家搜,再打电话或者在线预订。建议是 ChatGPT 给的,但实际的预定操作还是需要自己来做。

换成 AI Agent,事情就变成另一副样子:告诉它「帮我预订一个吃饭的地方,时间是明天晚上六点,四个人,要有包间,最好能吃粤菜」。它自己去查哪些餐厅合适,看哪家有包间、评价怎么样,挑一家合适的,然后跟你确认:这家行不行?得到肯定答复后,它把预订提交了,最后总结这次任务:「订好了,明天六点,XX 酒楼 203 包间」。

整个过程基本都是由Agent来完成,你只需要给出目标,并复核确认

这两种模式的区别,说到底就是 AI 能不能自己动手。聊天工具输出的是建议,Agent 执行的是流程并最终输出结果。这背后是两种完全不同的产品形态:一个像是站在桌子对面给参考意见的顾问,另一个像是坐在旁边帮你干活的同事。

1.3 Agent 多出来的四样东西

ChatGPT、豆包这些聊天工具也不是不想动手,但它只有“大脑”没有“手”。那么 Agent 比聊天工具多出了哪些能力,让它可以帮人类去完成具体的任务?

第一个是自主规划。给 Agent 一个目标,它不会立刻开始执行,而是先把目标拆成子步骤,想好先做什么、后做什么,出了问题怎么调整。这个拆解过程是它自己完成的,不需要人一步步喂指令。前面订餐厅的例子里,「先查哪些餐厅开着、再看有没有包间、然后比较评价、最后提交预订」这个顺序,就是它自己规划出来的。

第二个是工具调用。聊天工具只能回答问题,别的做不了。Agent 不一样,它可以操作各种工具:读写文件、执行命令、查数据库。Agent 根据任务需要,选择合适的工具,并用这些工具来完成目标。

第三个是多步执行和自我修正。聊天工具的一来一回是一次性的,一个问题对应一个回答。Agent 的任务往往有好几步,从写代码、跑测试,到出错后的原因分析、改好后再测试,这个循环可以反复执行,直到任务真的完成。

人在里面的角色变成了「提出要求然后等出结果」。

第四个是持久的记忆。聊天工具的记忆基本局限在当前对话窗口,如果你新开一个窗口,那么一切归零。但现在主流Agent的 记忆是跨会话的:你上次用的什么编码风格、你反复执行的某个流程、之前踩过的坑,它都有记录。用得越久,它对使用者的理解越深,需要重复解释的事情就越少。

💡提示

目前,不是所有的Agent都有跨会话的记忆,但越来越多的Agent开始注重持久记忆。而持久记忆正是Hermes的一大特色。

1.4 AI Agent 的主流分类

市面上能叫 AI Agent 的产品不少,但侧重点各不相同,大概有这么几类。

最广为人知的一类是代码 Agent,专注于编程任务,能理解项目结构、跨文件修改代码。Cursor、ChatGPT、Qoder、Claude Code 都属于这一类,程序员大多用过。

另一类是通用 Agent,不限定领域,能操作文件、执行命令也能像代码Agent那样编程,它更像是一个泛用的数字助手。OpenClaw 以及这本书要讲的 Hermes 都属于这一类。

最后一类是垂直领域 Agent,专门为某个行业定制。比如做法律文书审查的 Agent、做医疗数据分析的 Agent,都是针对一个专业场景反复调优过的。

这些类型之间没有严格的界限,很多产品横跨多个领域,比如Hermes和Qoder,他们其实都可以互相替代。但不管叫什么名字,Agent们做的事情很类似:拿到一个目标,自己拆解步骤、调用工具,最后完成这个任务。

1.5 ■ 学点英语

中文 English 音标 说明
智能体 AI Agent /ˌeɪ ˈaɪ ˈeɪdʒənt/ 能理解目标、调用工具并持续推进任务的 AI 系统
任务执行 Task Execution /tæsk ˌeksɪˈkjuːʃən/ 把目标拆成步骤并逐步完成的过程
目标分解 Goal Decomposition /ɡoʊl ˌdiːkɑːmpəˈzɪʃən/ 把大目标拆成可执行子任务的过程
工具选择 Tool Selection /tuːl sɪˈlekʃən/ 根据任务需要选择合适工具的判断过程