前面五章讲的 Hermes,能力主要集中在终端里:跑命令、写代码、操作文件、调用 API。但电脑里很多事情不发生在终端里,比如打开邮件找一封账单,进入后台系统导出一份报表,或者在桌面软件里切页面确认状态。这些操作过去只能自己动鼠标。这一节讲的 Computer Use,就是让 Hermes 从终端走出来,直接操作桌面。
1.1 从「看懂图片」到「操作电脑」
之前讲过怎么给 Hermes 配上「眼睛」,贴一张截图给它,它能认出图上有什么。这是被动的,发图它才看。
Computer Use 把这个能力往前推了一步:Hermes 会自己截屏、自己看懂屏幕上的内容、然后自己动手点击操作。
贴图 → Hermes 看懂了(之前讲的)
Hermes 自己截屏 → 自己看懂 → 自己点击 → 自己验证结果(这一节讲的)
一个是「给它看」,一个是「它自己去看」。区别在这里。
1.2 为什么需要这个能力
Hermes 已经很强了,写代码、跑脚本、调 API、管理文件,终端里能做的事它都干得很好。但现实中有大量工作发生在终端之外。打开 Mail 搜邮件,登录后台导报表,打开日历查会议,在测试环境里点按钮确认流程,这些任务人做起来不难,但很碎,很消耗注意力。
当然,如果操作系统里安装的所有应用程序都向 Hermes 开放 API 或者 CLI,支持 Hermes 调用,那当然最好。但事实绝不可能这样。比如你是一个学生,你想去学校的网站上查询你选修课的作业安排,你想让学校的系统给你的 Hermes 提供 API 这几乎是不可能的。
这种场景有很多,你想统计某个电商平台的历史消费情况,在你公司内部的 OA 系统里提一个报销单,甚至只是打开一个桌面软件找某个设置项在哪,这些系统不会给 Hermes 留一个接口。它们只有界面,只有按钮和输入框,只有给人看的东西。
所以 Agent 很长一段时间的发展很局限,它只能操作那些开放的、允许 Agent 连接的应用或者网站。那怎么办?聪明的人类想到,如果让 Agent 像一个人一样坐在电脑前操作各种网站、软件,岂不是可以绕开所有的限制?甚至可以打游戏?
昨天(2026 年 6 月 9 日)Anthropic 刚发布了 Claude Fable 5,官方直接放出了三个打游戏的 Demo,一个比一个离谱。而恰巧这三个游戏都是我非常喜欢的,除了宝可梦可以理解,另外两个有点超出了我的想象。
《宝可梦·火红》 — 之前的 Claude 模型玩这个 RPG 需要一堆外挂:地图导航、状态读取、专用接口,还是频繁卡关。Fable 5 不需要了,纯视觉,只看屏幕截图,不给任何额外信息,从头到尾通关了整部游戏。抓宠、对战、闯迷宫,全程自己判断。
《异星工厂》 — 这个游戏难度极大,以“复杂到让工程师上瘾”著称。Fable 5 全程自主规划自动化产线,白手起家建了一座工厂,没有人工干预。
《杀戮尖塔》 — 卡牌构筑游戏,Anthropic 还给了 Fable 5 一个持久性文件记忆,让它能记住之前打过的牌局、复盘自己的策略。结果通关终局的频次是上一代 Opus 4.8 的 3 倍。它真的在“从失败中学习”。
这三个案例说明一件事:AI 已经不只是在聊天框里回答问题了,它真的能看屏幕、理解规则、做决策、执行操作。当然,它还只能打这种策略或者建造类的游戏,如果你想让它去打类似 CS 这样需要快速反应和操作的,现在还有点困难,因为理解图像需要时间。
1.3 Computer Use 能做什么
简单来说,它让 Hermes 可以像人一样操作桌面,点击输入、滚动拖拽,都可以交给它去做。
几个实际场景:
邮件处理
帮我查看 QQ Mail 应用里最新的 来自 老张的 邮件,总结里面要求的事项。
Hermes 会打开 Mail(在后台),截图识别界面元素,找到搜索框输入查询,打开结果邮件,阅读并总结内容。全程光标停在原处,Mail 不会跳到前台。
数据导出
打开后台管理系统,导出本月的销售数据为 CSV,并将这份数据,通过邮件发送给 老王。
日历检查
打开日历应用,看看下周有没有重复的会议安排。
跨应用操作
查看最新一封客户邮件,提取里面的订单号,打开 Excel 写入到「订单跟踪」表。
Hermes 不是在调用 API,而是在像人一样点击按钮、填写输入框、翻页读取内容。
1.4 它怎么工作的
Computer Use 依赖一个叫 cua-driver 的组件(Computer Use Agent Driver)。它通过以下技术栈实现操作:
| 组件 | 作用 |
|---|---|
| Accessibility API | 读取应用的 UI 树结构,获取按钮、输入框等元素信息 |
| 屏幕截图 | 截取当前屏幕,用于视觉识别 |
| 视觉模型 | 识别界面内容,定位可操作元素 |
| 点击/输入/滚动 | 模拟真实鼠标键盘操作 |
| 结果验证 | 操作后截图确认是否成功 |
整个流程是这样的:
用户指令 → Hermes 解析意图 → cua-driver 截图识别 → 定位元素 → 执行操作 → 截图验证 → 反馈结果
这里用到了之前讲过的视觉模型能力。Hermes 截屏后,把截图发给视觉模型分析,识别出按钮在哪、输入框在哪、当前状态是什么,然后决定下一步操作。
1.5 用起来是什么感觉
第一,它不抢鼠标
一听「Agent 操作电脑」,第一反应可能是慌:它会不会突然移动鼠标?会不会打断正在做的事?
不会。Computer Use 默认在后台运行。它操作的是后台的应用实例,光标停在原处,正在用的应用不会被抢走焦点。可以继续做自己的事,让 Hermes 在后台慢慢干活。
第二,不锁定模型
这个能力不绑定在某一个模型上。只要模型支持工具调用,就能接入 Computer Use。Claude、GPT、Gemini 可以,国产的 DeepSeek、GLM、Kimi、Mimo 也可以。理论上纯文本模型也能用,cua-driver 可以通过 Accessibility API 读取 UI 树结构,不依赖截图也能操作。但实际体验很差,界面一复杂就容易点错位置、找不到元素。所以强烈建议使用支持视觉能力的模型,能看懂截图,操作才靠谱。
如果你用的是 DeepSeek 这类纯文本模型,可以参考之前章节讲过的方法,给 Hermes 配一个辅助视觉模型(比如 Qwen)。配好之后,Hermes 会自动把截图转发给视觉模型处理,主模型照常干活,不影响。
1.6 一瓢冷水
前面讲了不少 Computer Use 能做的事,听起来很美好。但实际测下来,体验并没有那么理想。有两个核心问题。
第一个问题:慢。
每一步操作都是一个完整的循环:截屏 → 发给视觉模型分析 → 模型判断该点哪里 → 执行操作 → 再截屏验证。这个循环走一圈,快的话几秒,慢的话十几秒。打开一个应用、找到一个按钮、点下去,人做这件事不到一秒,Computer Use 可能要花十秒。如果是多步骤任务,比如「打开邮件 → 搜索 → 点开 → 总结 → 写入 Excel」,每一步都要走一遍这个循环,整个过程可能要几分钟。
第二个问题:找不准。
视觉模型看截图来定位按钮和输入框,但它的定位精度远不如人眼。界面一复杂,元素一密集,它就容易点偏。点偏了之后,它截图一看「咦,怎么不是预期的结果」,再试一次,又点偏了,来回折腾好几轮。我实际测试微信发消息,折腾了半天也没发出去,就是因为定位一直不准。
后台模式也没想象中完美。
Hermes 的 cua-driver 确实可以在后台发送事件,不抢鼠标、不抢焦点。但这只对标准 macOS 应用效果好。微信、钉钉这类自绘 UI 的应用,后台事件发送经常不生效,因为键盘焦点不在它身上,打字输入根本进不去。想要完成输入类操作,还是得短暂把应用拉到前台。
不只是 Hermes 有这些问题。Claude Code 的 Computer Use 更直接,它工作的时候完全接管屏幕,其他应用被隐藏,你根本没法同时干活。OpenAI ChatGPT 号称有「独立光标」,可以后台并行,但实际用户反馈发现,它输入的文本经常跑进你正在用的窗口里,因为键盘焦点被你切换了。
所以现阶段的真实情况是:Computer Use 的方向是对的,但离「放心交给它干活」还有不小的距离。标准应用、简单任务、只读操作,这些场景下它表现还行。复杂界面、自绘应用、多步骤输入,这些场景下它经常翻车。
1.7 目前的状态
Computer Use 是一个相对新的功能,有几点需要了解:
- macOS 支持最好,Windows 和 Linux 支持有限
- 后台模式有延迟(约 5-20ms),日常操作没问题,但不适合需要高速精准鼠标的场景
- 复杂页面识别可能不准确,需要配合视觉模型的能力
- 涉及密码、支付、生产后台的操作,不要直接交给它
还有一个值得注意的点:不是所有应用都好操作。标准 macOS 应用(Mail、日历、Finder、系统设置)用的是系统原生控件,Accessibility API 能读到完整的 UI 结构,操作起来又快又准。但微信、钉钉这类应用大量使用自绘控件,Accessibility API 读不到多少信息,模型只能靠截图去猜,每一步都慢,还经常点错位置。
所以现阶段 Computer Use 更适合操作标准应用,或者在浏览器里完成任务。碰到重度自绘 UI 的应用,体验会差很多。
第一次使用建议从低风险任务开始验证。先做只读观察,确认它能看到界面、能识别元素;再做低风险点击;最后再处理真实任务。
这一节讲了 Computer Use 是什么、能做什么、怎么工作。下一节我们动手装起来,实际跑一遍。
1.8 ■ 学点英语
| 中文 | English | 音标 | 说明 |
|---|---|---|---|
| 计算机使用 | Computer Use | /kəmˈpjuːtər juːs/ | 让 AI 像人一样观察屏幕并操作电脑的能力 |
| 视觉定位 | Visual Grounding | /ˈvɪʒuəl ˈɡraʊndɪŋ/ | 把模型看到的画面内容对应到可操作对象上 |
| 屏幕观察 | Screen Observation | /skriːn ˌɑːbzərˈveɪʃən/ | 让模型读取屏幕画面并理解当前状态 |
| 鼠标操作 | Mouse Control | /maʊs kənˈtroʊl/ | 通过程序移动鼠标并点击目标位置 |