💡阅读指南

上一节我们讲了 Shell Engineering 的五种交付形态。这一节退后一步,回答一个很多人一开始都会问的问题:Shell Engineering 和大家常说的「Agent 开发」是一回事吗?如果不是,区别在哪里?你会看到,「智能体开发」这个词在业内其实有好几层意思,搞清楚层次,才能明白 Shell Engineering 站在哪一层,以及它为什么对普通开发者最重要。

3.1 从一个常见的疑问开始

很多人第一次听到 Shell Engineering,第一反应是:这不就是 Agent 开发吗?

有这个疑问很正常。毕竟都是和 Agent 打交道,都要写代码、调工具、设计工作流,看起来确实很像。

但仔细往下挖一层,会发现一个更根本的问题:业内说的「Agent 开发」,其实不止一种意思。

有的人指的是从零搭建一个 Agent 系统——模型怎么选、记忆系统怎么设计、规划算法怎么实现。 有的人指的是围绕模型做工程化——怎么让 Agent 在生产环境里稳定可靠、怎么评估、怎么监控。 还有的人指的是用 Agent 来写代码——人当监工,AI 写实现。

同一个词,三层含义。如果不把层次理清楚,后面的讨论就没有共同基础。

为什么会出现这么混乱的情况?我想,大概是因为目前还是一个 Agent 发展的草莽阶段。而人工智能的发展,让学术名词的定义平民化了。以前你是专家,你是权威,那你有定义权。但现在一个博学的 AI 站在每一个普通人的身后,给了普通人敢于发表自己看法和观点的勇气。自然就很难形成一个统一的认识。

3.2 三层智能体工程

如果从下往上看,今天的「智能体开发」其实可以分成三层。每一层的起点、目标、核心工作都完全不一样。

第一层:Harness Engineering —— 给模型套工程外壳

最底下这一层,叫 Harness Engineering(驾驭工程)

它的起点是裸模型(LLM)。目标是给模型装上「手脚」和「安全带」,让它从一个只会聊天的模型,变成一个能调用工具、有记忆、安全可控的系统。

具体要做的事情包括:

模块 干什么
工具层 接入 API、数据库、代码执行环境、MCP 协议
记忆层 短期记忆、长期记忆、向量库、知识图谱
安全层 沙箱、权限控制、内容审查、注入防护
执行层 ReAct 循环、状态管理、错误恢复、持久化执行

简单说:Harness Engineering 是给模型装「身体」。 就像给一个大脑装上四肢、眼睛、耳朵,还要加上疼痛反射和安全边界,让它能安全地和外界交互。

这一层的代表产品和项目:

类型 代表项目
框架类 LangChain / LangGraph
协议/标准 MCP 协议、AGENTS.md 规范
专用框架 HarnessX、HarnessAgent、harnesskit
官方托管 Anthropic Claude Managed Agents、OpenAI Codex Harness

这一层做的是基础设施。没有它,上面的一切都免谈。但绝大多数应用开发者不需要自己做这一层——开源框架和平台已经帮你做好了。

第二层:Agent Engineering —— 打造超级智能体

中间这一层,是业内最常说的 Agent Engineering(智能体工程)

它的起点是「已经有了 harness 的模型」。目标是打造一个足够强大的、通用的超级智能体,比如 Hermes、Claude Code、Qoder、ChatGPT 这些产品。

这一层的核心矛盾,是和「模型的不确定性」作斗争。怎么让 Agent 准确理解任务?怎么拆解步骤?怎么调用工具?怎么在出错时自我纠正?怎么在真实场景里稳定可靠地干活?这些问题和具体业务无关,而是关于怎么把一个裸模型变成一个好用的、通用的智能体。

这一层产出的超级 Agent,本身不涉及具体业务。它们提供了理解、规划、工具调用、记忆等基础能力,但没有预设任何业务规则。业务层面的事情,是下一层的工作。

具体要做的事情包括:

模块 干什么
模型层 选模型、调参数、多模型路由、成本优化
规划层 任务拆解、反思纠错、自我验证、规划算法
工作流层 多 Agent 协作、角色分工、状态机、编排框架
评估层 测试用例、基准测试、A/B 测试、线上监控
产品层 交互设计、用户体验、人工介入机制、权限边界

这一层的代表产品:

类型 代表项目
编码超级 Agent Claude Code、Qoder、Cursor
通用超级 Agent ChatGPT、Hermes、PI Agent、WorkBuddy
Agent 构建平台 扣子(Coze)、Dify

简单说:Agent Engineering 是把模型变成超级智能体。 就像你有了一个大脑,你教它怎么思考、怎么规划、怎么用工具、怎么犯错后修正,让它变成一个能独立干活的通用智能体。但它还不了解你的业务,业务的事不归它管。

这一层的玩家,通常是有一定 AI 工程能力的团队。你可以看到,上面的代表项目均是业界的顶级公司。他们很多不造模型,但他们造超级 Agent。

第三层:Shell Engineering —— 给超级 Agent 套业务壳

最上面这一层,就是我们说的 Shell Engineering

它的起点,不是裸模型,而是已经造好的、足够强大的超级 Agent——比如 Hermes、ChatGPT、PI Agent 这些(上述第二层的 Agent 都可以作为这一层的底座)。

这些超级 Agent 已经具备了通用的理解、规划、工具调用、记忆能力。你不需要再去设计 ReAct 循环,不需要再去搭记忆系统,不需要再去纠结模型怎么选——这些底层能力,超级 Agent 已经帮你做好了,而且做得比绝大多数团队自己写的都要好。

那我们做什么?我们做的是业务层的事情

模块 干什么
业务规则 这个系统应该怎么干活?有什么规矩?什么能做什么不能做?
数据结构 数据怎么存?页面怎么设计?实体关系怎么组织?
领域知识 这个行业的专业知识、术语、最佳实践、常见坑
交互入口 用户怎么用?飞书?网页?命令行?微信?
工作流设计 业务流程怎么走?先干什么后干什么?谁审批谁执行?
交付物 模板、骨架代码、Skill 包、一键启动的完整应用

后续我们会开发三个 Shell Engineering 的项目,这里就不再举例了。

简单说:Shell Engineering 是用超级 Agent 做业务。 就像你有一辆货车,你不需要再去造发动机、装轮子、调刹车——这些厂家都做好了。你要做的是给它装上个货箱、配上配送路线图、设计好接单流程,让它变成一辆生鲜配送车。

这一层的玩家,就是绝大多数普通应用开发者、产品经理、业务专家。你不需要懂模型怎么训练,不需要懂记忆系统怎么实现,你只需要懂业务,然后把业务「套」到超级 Agent 上面。

注意它和 Agent Engineering 的关键区别:起点不一样。 Agent Engineering 的起点是模型+框架,你要去搭 Agent;Shell Engineering 的起点是现成的超级 Agent,你要去用 Agent 做业务。

如果你还是理不清楚,我们简单点:

3.3 一张图看明白层次

Text
+---------------------------------------------------
|  Shell Engineering                                 ← 我们在这一层
|    给超级 Agent 套业务壳,做垂直系统
|    代表:胶囊系统、Hermes 业务 Shell
+---------------------------------------------------
|  Agent Engineering                                 ← 业内说的「智能体工程」
|    从模型 + harness 出发,打造超级智能体
|    代表:Hermes、Claude Code、Qoder、ChatGPT
+---------------------------------------------------
|  Harness Engineering
|    给模型套工程外壳:工具、记忆、安全、执行
|    代表:LangChain、HarnessX
+---------------------------------------------------
|  LLM 大模型
+---------------------------------------------------

三个层次,从下到上:

  1. Harness Engineering — 基础设施层,约束模型的行为
  2. Agent Engineering — 超级智能体层,把模型变成通用的、不涉及具体业务的智能体(Hermes、Claude Code、Qoder 等)
  3. Shell Engineering — 业务应用层,用超级 Agent 做业务

越往下,越接近模型,越需要 AI 专业知识;越往上,越接近业务,越需要领域经验。

3.4 为什么要单独定义 Shell Engineering

既然已经有了 Agent Engineering,为什么还要单独提出 Shell Engineering?

因为绝大多数开发者不做 Agent Engineering,他们做的事情更接近 Shell Engineering

看看你身边的开发者:有多少人真的在从零设计记忆系统?有多少人在研究规划算法?有多少人在调多模型路由?

很少。

绝大多数人面对的场景是这样的: - 我有一个业务问题(比如管客户、做内容、处理报销) - 现在有了 Hermes / Claude Code 这么厉害的 Agent - 我能不能让它帮我把这个业务干了?

这就是 Shell Engineering 的起点。你不需要造 Agent,你需要用好现成的超级 Agent,给它套上业务壳,让它变成你的业务系统。

做 Agent Engineering 的人,每天想的是:模型怎么选?工具怎么接?记忆怎么设计?怎么减少幻觉?怎么提升任务成功率?他在和「模型的不确定性」作斗争。

做 Shell Engineering 的人,每天想的是:用户要解决什么问题?数据结构怎么设计?业务流程怎么跑?用户怎么上手?怎么把领域知识灌进去?他在和「业务的复杂度」作斗争。

两种工作的思维方式、技术栈、评估标准,完全不一样。

但今天业内的状况是:大家都在说「智能体开发」,但没有把这两层明确分开。 结果就是,很多想做业务的开发者,一上来就被拉去学 LangChain、学记忆系统、学规划算法——学了一堆他根本用不上的东西,因为超级 Agent 早就把这些做好了。

Shell Engineering 这个概念的价值,就是把这一层讲清楚:你不需要造 Agent,你可以直接用超级 Agent 做业务。 这是一条对绝大多数开发者来说更短、更快、更有价值的路。

3.5 不是对立,是分层

三层之间不是对立关系,而是层层叠加的关系:

  • 没有 Harness Engineering,Agent Engineering 就是空中楼阁
  • 没有 Agent Engineering,Shell Engineering 就没有立足之地
  • 没有 Shell Engineering,超级 Agent 再厉害,也落不到具体的业务场景里

没有谁更高级,只是在不同的层次上解决不同的问题。

但有一点是确定的:超级 Agent 越强,Shell Engineering 的空间就越大。 当底层的 Agent 足够好用、足够可靠的时候,真正的价值创造,就会往上转移——转移到怎么用它解决实际问题这一层。

就像智能手机普及之后,真正的价值创造不再是造手机,而是做 App。

就像云服务普及之后,真正的价值创造不再是搭服务器,而是在云上做业务。

今天,超级 Agent 正在普及。接下来,真正的价值创造,会发生在怎么用它解决业务问题这一层。

这就是 Shell Engineering 的位置。

3.6 用传统开发做类比

如果上面的三层还是有点抽象,可以拿 Web 开发来做类比,会直观很多。

智能体工程 Web 开发 说明
Harness Engineering ASGI 服务器(如 Uvicorn) 处理最底层的事:协议解析、连接管理、进程调度、安全头。没有它,上面跑不起来
Agent Engineering FastAPI 在底层之上提供框架:路由、依赖注入、数据验证、错误处理。开发者用它来构建应用,但 FastAPI 本身不关心你做的是电商还是博客
Shell Engineering 基于 FastAPI 开发的电商网站 真正的业务系统:商品管理、订单流程、支付对接、用户体系。这些和业务强相关的东西,框架不管,你自己做

这个类比的关键在于:用 FastAPI 开发电商网站的人,不需要理解 ASGI 协议怎么握手、HTTP 连接怎么复用。FastAPI 把这些都封装好了。你只需要关心你的业务逻辑。

同样,在智能体领域:做 Shell Engineering 的人,不需要关心 ReAct 循环怎么跑、记忆系统怎么实现、模型怎么选。Hermes、Claude Code 这些超级 Agent 已经把这些都做好了。你只需要关心你的业务怎么跑。

3.7 ■ 学点英语

中文 English 音标 说明
Agent 开发 Agent Development /ˈeɪdʒənt dɪˈveləpmənt/ 直接构建 Agent 能力和内部机制的开发方式
产品化 Productization /ˌprɑːdʌktaɪˈzeɪʃən/ 把技术能力包装成稳定可交付产品的过程
抽象层级 Abstraction Level /æbˈstrækʃən ˈlevl/ 描述系统时从细节到整体的不同层次
工程权衡 Engineering Trade-off /ˌendʒɪˈnɪrɪŋ treɪd ɔːf/ 在成本、稳定性和灵活性之间做取舍