上一节我们讲了 Shell Engineering 的五种交付形态。这一节退后一步,回答一个很多人一开始都会问的问题:Shell Engineering 和大家常说的「Agent 开发」是一回事吗?如果不是,区别在哪里?你会看到,「智能体开发」这个词在业内其实有好几层意思,搞清楚层次,才能明白 Shell Engineering 站在哪一层,以及它为什么对普通开发者最重要。
3.1 从一个常见的疑问开始
很多人第一次听到 Shell Engineering,第一反应是:这不就是 Agent 开发吗?
有这个疑问很正常。毕竟都是和 Agent 打交道,都要写代码、调工具、设计工作流,看起来确实很像。
但仔细往下挖一层,会发现一个更根本的问题:业内说的「Agent 开发」,其实不止一种意思。
有的人指的是从零搭建一个 Agent 系统——模型怎么选、记忆系统怎么设计、规划算法怎么实现。 有的人指的是围绕模型做工程化——怎么让 Agent 在生产环境里稳定可靠、怎么评估、怎么监控。 还有的人指的是用 Agent 来写代码——人当监工,AI 写实现。
同一个词,三层含义。如果不把层次理清楚,后面的讨论就没有共同基础。
为什么会出现这么混乱的情况?我想,大概是因为目前还是一个 Agent 发展的草莽阶段。而人工智能的发展,让学术名词的定义平民化了。以前你是专家,你是权威,那你有定义权。但现在一个博学的 AI 站在每一个普通人的身后,给了普通人敢于发表自己看法和观点的勇气。自然就很难形成一个统一的认识。
3.2 三层智能体工程
如果从下往上看,今天的「智能体开发」其实可以分成三层。每一层的起点、目标、核心工作都完全不一样。
第一层:Harness Engineering —— 给模型套工程外壳
最底下这一层,叫 Harness Engineering(驾驭工程)。
它的起点是裸模型(LLM)。目标是给模型装上「手脚」和「安全带」,让它从一个只会聊天的模型,变成一个能调用工具、有记忆、安全可控的系统。
具体要做的事情包括:
| 模块 | 干什么 |
|---|---|
| 工具层 | 接入 API、数据库、代码执行环境、MCP 协议 |
| 记忆层 | 短期记忆、长期记忆、向量库、知识图谱 |
| 安全层 | 沙箱、权限控制、内容审查、注入防护 |
| 执行层 | ReAct 循环、状态管理、错误恢复、持久化执行 |
简单说:Harness Engineering 是给模型装「身体」。 就像给一个大脑装上四肢、眼睛、耳朵,还要加上疼痛反射和安全边界,让它能安全地和外界交互。
这一层的代表产品和项目:
| 类型 | 代表项目 |
|---|---|
| 框架类 | LangChain / LangGraph |
| 协议/标准 | MCP 协议、AGENTS.md 规范 |
| 专用框架 | HarnessX、HarnessAgent、harnesskit |
| 官方托管 | Anthropic Claude Managed Agents、OpenAI Codex Harness |
这一层做的是基础设施。没有它,上面的一切都免谈。但绝大多数应用开发者不需要自己做这一层——开源框架和平台已经帮你做好了。
第二层:Agent Engineering —— 打造超级智能体
中间这一层,是业内最常说的 Agent Engineering(智能体工程)。
它的起点是「已经有了 harness 的模型」。目标是打造一个足够强大的、通用的超级智能体,比如 Hermes、Claude Code、Qoder、ChatGPT 这些产品。
这一层的核心矛盾,是和「模型的不确定性」作斗争。怎么让 Agent 准确理解任务?怎么拆解步骤?怎么调用工具?怎么在出错时自我纠正?怎么在真实场景里稳定可靠地干活?这些问题和具体业务无关,而是关于怎么把一个裸模型变成一个好用的、通用的智能体。
这一层产出的超级 Agent,本身不涉及具体业务。它们提供了理解、规划、工具调用、记忆等基础能力,但没有预设任何业务规则。业务层面的事情,是下一层的工作。
具体要做的事情包括:
| 模块 | 干什么 |
|---|---|
| 模型层 | 选模型、调参数、多模型路由、成本优化 |
| 规划层 | 任务拆解、反思纠错、自我验证、规划算法 |
| 工作流层 | 多 Agent 协作、角色分工、状态机、编排框架 |
| 评估层 | 测试用例、基准测试、A/B 测试、线上监控 |
| 产品层 | 交互设计、用户体验、人工介入机制、权限边界 |
这一层的代表产品:
| 类型 | 代表项目 |
|---|---|
| 编码超级 Agent | Claude Code、Qoder、Cursor |
| 通用超级 Agent | ChatGPT、Hermes、PI Agent、WorkBuddy |
| Agent 构建平台 | 扣子(Coze)、Dify |
简单说:Agent Engineering 是把模型变成超级智能体。 就像你有了一个大脑,你教它怎么思考、怎么规划、怎么用工具、怎么犯错后修正,让它变成一个能独立干活的通用智能体。但它还不了解你的业务,业务的事不归它管。
这一层的玩家,通常是有一定 AI 工程能力的团队。你可以看到,上面的代表项目均是业界的顶级公司。他们很多不造模型,但他们造超级 Agent。
第三层:Shell Engineering —— 给超级 Agent 套业务壳
最上面这一层,就是我们说的 Shell Engineering。
它的起点,不是裸模型,而是已经造好的、足够强大的超级 Agent——比如 Hermes、ChatGPT、PI Agent 这些(上述第二层的 Agent 都可以作为这一层的底座)。
这些超级 Agent 已经具备了通用的理解、规划、工具调用、记忆能力。你不需要再去设计 ReAct 循环,不需要再去搭记忆系统,不需要再去纠结模型怎么选——这些底层能力,超级 Agent 已经帮你做好了,而且做得比绝大多数团队自己写的都要好。
那我们做什么?我们做的是业务层的事情:
| 模块 | 干什么 |
|---|---|
| 业务规则 | 这个系统应该怎么干活?有什么规矩?什么能做什么不能做? |
| 数据结构 | 数据怎么存?页面怎么设计?实体关系怎么组织? |
| 领域知识 | 这个行业的专业知识、术语、最佳实践、常见坑 |
| 交互入口 | 用户怎么用?飞书?网页?命令行?微信? |
| 工作流设计 | 业务流程怎么走?先干什么后干什么?谁审批谁执行? |
| 交付物 | 模板、骨架代码、Skill 包、一键启动的完整应用 |
后续我们会开发三个 Shell Engineering 的项目,这里就不再举例了。
简单说:Shell Engineering 是用超级 Agent 做业务。 就像你有一辆货车,你不需要再去造发动机、装轮子、调刹车——这些厂家都做好了。你要做的是给它装上个货箱、配上配送路线图、设计好接单流程,让它变成一辆生鲜配送车。
这一层的玩家,就是绝大多数普通应用开发者、产品经理、业务专家。你不需要懂模型怎么训练,不需要懂记忆系统怎么实现,你只需要懂业务,然后把业务「套」到超级 Agent 上面。
注意它和 Agent Engineering 的关键区别:起点不一样。 Agent Engineering 的起点是模型+框架,你要去搭 Agent;Shell Engineering 的起点是现成的超级 Agent,你要去用 Agent 做业务。
如果你还是理不清楚,我们简单点:
3.3 一张图看明白层次
+---------------------------------------------------
| Shell Engineering ← 我们在这一层
| 给超级 Agent 套业务壳,做垂直系统
| 代表:胶囊系统、Hermes 业务 Shell
+---------------------------------------------------
| Agent Engineering ← 业内说的「智能体工程」
| 从模型 + harness 出发,打造超级智能体
| 代表:Hermes、Claude Code、Qoder、ChatGPT
+---------------------------------------------------
| Harness Engineering
| 给模型套工程外壳:工具、记忆、安全、执行
| 代表:LangChain、HarnessX
+---------------------------------------------------
| LLM 大模型
+---------------------------------------------------
三个层次,从下到上:
- Harness Engineering — 基础设施层,约束模型的行为
- Agent Engineering — 超级智能体层,把模型变成通用的、不涉及具体业务的智能体(Hermes、Claude Code、Qoder 等)
- Shell Engineering — 业务应用层,用超级 Agent 做业务
越往下,越接近模型,越需要 AI 专业知识;越往上,越接近业务,越需要领域经验。
3.4 为什么要单独定义 Shell Engineering
既然已经有了 Agent Engineering,为什么还要单独提出 Shell Engineering?
因为绝大多数开发者不做 Agent Engineering,他们做的事情更接近 Shell Engineering。
看看你身边的开发者:有多少人真的在从零设计记忆系统?有多少人在研究规划算法?有多少人在调多模型路由?
很少。
绝大多数人面对的场景是这样的: - 我有一个业务问题(比如管客户、做内容、处理报销) - 现在有了 Hermes / Claude Code 这么厉害的 Agent - 我能不能让它帮我把这个业务干了?
这就是 Shell Engineering 的起点。你不需要造 Agent,你需要用好现成的超级 Agent,给它套上业务壳,让它变成你的业务系统。
做 Agent Engineering 的人,每天想的是:模型怎么选?工具怎么接?记忆怎么设计?怎么减少幻觉?怎么提升任务成功率?他在和「模型的不确定性」作斗争。
做 Shell Engineering 的人,每天想的是:用户要解决什么问题?数据结构怎么设计?业务流程怎么跑?用户怎么上手?怎么把领域知识灌进去?他在和「业务的复杂度」作斗争。
两种工作的思维方式、技术栈、评估标准,完全不一样。
但今天业内的状况是:大家都在说「智能体开发」,但没有把这两层明确分开。 结果就是,很多想做业务的开发者,一上来就被拉去学 LangChain、学记忆系统、学规划算法——学了一堆他根本用不上的东西,因为超级 Agent 早就把这些做好了。
Shell Engineering 这个概念的价值,就是把这一层讲清楚:你不需要造 Agent,你可以直接用超级 Agent 做业务。 这是一条对绝大多数开发者来说更短、更快、更有价值的路。
3.5 不是对立,是分层
三层之间不是对立关系,而是层层叠加的关系:
- 没有 Harness Engineering,Agent Engineering 就是空中楼阁
- 没有 Agent Engineering,Shell Engineering 就没有立足之地
- 没有 Shell Engineering,超级 Agent 再厉害,也落不到具体的业务场景里
没有谁更高级,只是在不同的层次上解决不同的问题。
但有一点是确定的:超级 Agent 越强,Shell Engineering 的空间就越大。 当底层的 Agent 足够好用、足够可靠的时候,真正的价值创造,就会往上转移——转移到怎么用它解决实际问题这一层。
就像智能手机普及之后,真正的价值创造不再是造手机,而是做 App。
就像云服务普及之后,真正的价值创造不再是搭服务器,而是在云上做业务。
今天,超级 Agent 正在普及。接下来,真正的价值创造,会发生在怎么用它解决业务问题这一层。
这就是 Shell Engineering 的位置。
3.6 用传统开发做类比
如果上面的三层还是有点抽象,可以拿 Web 开发来做类比,会直观很多。
| 智能体工程 | Web 开发 | 说明 |
|---|---|---|
| Harness Engineering | ASGI 服务器(如 Uvicorn) | 处理最底层的事:协议解析、连接管理、进程调度、安全头。没有它,上面跑不起来 |
| Agent Engineering | FastAPI | 在底层之上提供框架:路由、依赖注入、数据验证、错误处理。开发者用它来构建应用,但 FastAPI 本身不关心你做的是电商还是博客 |
| Shell Engineering | 基于 FastAPI 开发的电商网站 | 真正的业务系统:商品管理、订单流程、支付对接、用户体系。这些和业务强相关的东西,框架不管,你自己做 |
这个类比的关键在于:用 FastAPI 开发电商网站的人,不需要理解 ASGI 协议怎么握手、HTTP 连接怎么复用。FastAPI 把这些都封装好了。你只需要关心你的业务逻辑。
同样,在智能体领域:做 Shell Engineering 的人,不需要关心 ReAct 循环怎么跑、记忆系统怎么实现、模型怎么选。Hermes、Claude Code 这些超级 Agent 已经把这些都做好了。你只需要关心你的业务怎么跑。
3.7 ■ 学点英语
| 中文 | English | 音标 | 说明 |
|---|---|---|---|
| Agent 开发 | Agent Development | /ˈeɪdʒənt dɪˈveləpmənt/ | 直接构建 Agent 能力和内部机制的开发方式 |
| 产品化 | Productization | /ˌprɑːdʌktaɪˈzeɪʃən/ | 把技术能力包装成稳定可交付产品的过程 |
| 抽象层级 | Abstraction Level | /æbˈstrækʃən ˈlevl/ | 描述系统时从细节到整体的不同层次 |
| 工程权衡 | Engineering Trade-off | /ˌendʒɪˈnɪrɪŋ treɪd ɔːf/ | 在成本、稳定性和灵活性之间做取舍 |