💡阅读指南

上一节讲了 AI Agent 的核心概念:自主规划、工具调用、多步执行、跨会话记忆,也提到了 Hermes 属于「通用 Agent」这一类。

这一节把镜头拉近,聚焦到 Hermes 本身:它到底能做什么,有什么别的 Agent 没有的机制,技术上有哪些特点,和编程工具之间到底是什么关系。

2.1 Hermes到底是什么

最简单的说法:Hermes 是一个可以操作电脑的 AI 助手。它不只会聊天,还能读写文件、执行命令、浏览网页、管理服务器——像一个真实的搭档。

技术上更准确的定义:Hermes Agent 是一个开源、自托管、具备内置学习循环的 AI 智能体框架。由 Nous Research 在 2026 年 2 月发布,MIT 协议开源。截至 2026 年 4 月,GitHub 标星已超过 53,000。

上一节讲过,Agent 能自己规划步骤、调用工具、完成完整任务。Hermes 把这些能力打包成了一个开箱即用的框架,并且在此基础上做了两件别的产品没做的事:

  1. 持续学习使用者的偏好
  2. 跨平台、长周期地自动运行。

先看几个关键词。

开源

代码完全公开,MIT 协议(最宽松的开源协议)。任何人可以查看、修改、部署。

自托管

Hermes 运行在使用者自己的电脑上。代码、文档、对话历史,全在本机硬盘里。不需要上传到任何云端服务。这就在一定程度上保护了使用者的隐私。

2.2 学习循环

第1节老张的例子已经展示了 Agent 能自主完成任务。Hermes 作为通用 Agent,能做的事不限于某个职业——凡是在电脑上能完成的,基本都能交给它。但 Hermes 真正区别于其他 Agent 的,不是「能做什么」,而是「怎么越做越好」。这就引出了它最核心的机制:学习循环。

第1节中展示的能力,很多 AI Agent 或多或少也具备。但 Hermes 有一个其他工具没有的机制:学习循环(Closed Learning Loop)。

具体来说,当 Hermes 完成了一定量的复杂任务(多次重复的完成同一任务)后,它会自动进入反思阶段,同时开始做四件事。

评估结果。这次完成得怎么样?有没有达到预期?哪些步骤有效,哪些走了弯路?

提取经验。把这次用了什么方法、踩了什么坑、有什么可以复用的模式,将有效的那部分提炼出来。

生成技能文件。把提炼出的经验写成 SKILL.md,存在本地的 ~/.hermes/skills/ 目录下。下次遇到类似任务,直接调用这个技能。而且技能不是写完就不再修改,而是会随着用户进一步的使用,逐步改进。Hermes 内部有一个叫 GEPA 的进化引擎专门做这件事。

更新对使用者的理解。记录使用者的偏好、常用工具、沟通习惯。下次执行任务时自动适配你的特点和偏好,这才能保证使用者满意和舒心。

举个例子:假设你经常让 Hermes 帮你做代码审查。前几次,它每次都要重新摸索——项目用什么编码规范、测试怎么跑、哪些目录是重点。但当你让它审查了五六次之后,它会自动把这些经验提炼成一份技能文件,记下你团队的代码风格、常犯的坑、审查的优先级。下次你再说「帮我 review 这个 PR」,它直接按提炼出的流程走,又快又准。而且这份技能不是一成不变的——随着你继续用它审查,它会不断修正和优化,比如发现你最近开始重视类型安全,就会把这项检查的优先级调高。

整个过程在本地完成,不需要联网,不需要人工干预。这也是 Hermes 和其他 Agent 最本质的区别——OpenClaw 有记忆系统,但需要手动维护;Claude Code 有项目配置文件,但那是静态文本。只有 Hermes 做到了「自动从实践中提炼,在使用中持续进化」。

2.3 Hermes 的技术特点

除了学习循环,Hermes 的技术架构还有几个特点值得了解。

四层记忆。第一层是会话级别的短期记忆(MEMORY.md 和 SOUL.md)。第二层是 SQLite + 全文搜索的会话历史,可以跨会话检索之前的对话。第三层是技能系统构成的程序性记忆。第四层是可接入的外部记忆系统(如 Honcho、Mem0)。跨会话、跨平台,都不会丢失对使用者的了解。

40+内置工具。覆盖终端操作、文件读写、浏览器自动化、代码执行、视觉识别、定时任务等场景。不需要手动注册每个工具。

模型无关。支持 200+ 外置模型(Hermes本身没有大模型,需要外接):OpenAI、Anthropic,以及国内的 Kimi、MiniMax、GLM、Qwen 等。而切换模型只需一行命令。

15+消息平台。国外常见的 Telegram、Discord、Slack、WhatsApp 都能支持;国内的钉钉、飞书、微信也都能接入。我们可以从手机上发消息给Hermes。

这些平台通过一个叫做消息网关的后台进程连通。网关启动后会从你的机器主动向各平台建立长连接(WebSocket 或 Long-Polling),即使本地没有公网 IP,只要能上网,就能和我们的手机进行连接通信。

2.4 Hermes 与 Coding Agent 的关系

第1节提到,Agent 大致分Coding Agent、通用 Agent、垂直 Agent 三类。Hermes 属于通用 Agent,Claude Code、ChatGPT、Qoder 属于Coding Agent。它们之间不是替代关系,而是各有侧重。

代码 Agent 的核心场景是代码仓库——理解项目结构、跨文件改代码、跑测试、修 bug,设计目标是帮程序员把编程任务做得更快更准。Hermes 当然也能做这些事,但它的设计目标更大:长期运行、持续学习、多平台触达的自动化系统

这个差异在编程之外的场景里会变得非常直观。

📌边界正在模糊

需要指出的是,Coding Agent 和通用 Agent 之间的边界并非一成不变。Qoder、TRAE等原本专注于编程的工具,都在逐步借鉴OpenClaw、 Hermes 的成功经验,不再满足于只做编程,他们也朝着通用 Agent 的方向在泛化。一个典型的案例是,前几天 Codex 这个 OpenAI 的 Coding Agent 正式更名为“ChatGPT”,这表明 OpenAI 想去掉其”Codex“的编程属性,转而成为通用 Agent。可以预见,未来两者的差异会越来越小,最终融合为统一的 Agent 形态。

2.5 ■ 学点英语

中文 English 音标 说明
代理运行时 Agent Runtime /ˈeɪdʒənt ˈrʌntaɪm/ 支撑 Agent 执行任务、管理工具和上下文的运行环境
本地代理 Local Agent /ˈloʊkl ˈeɪdʒənt/ 运行在本机、能访问本地文件和工具的 Agent
能力边界 Capability Boundary /ˌkeɪpəˈbɪləti ˈbaʊndəri/ 系统能做什么和不能做什么的范围
执行环境 Execution Environment /ˌeksɪˈkjuːʃən ɪnˈvaɪrənmənt/ 程序运行时依赖的系统、工具和配置条件