DeepSeek 4.0 是没有视觉能力的。你给它一张图,他无法识别图中的内容。但 Qwen、GPT、MiniMax 等 这些模型支持视觉能力。这一节看看怎么给 Hermes 加上一个"眼睛",让他能够看懂图片。
11.1 我们需要什么?
我们需要的不是强行把非视觉模型改为视觉模型,而是需要以下机制:
常规文本依然使用 DeepSeek 处理,当需要识别图片或者需要依赖视觉时,Hermes 可以自己切换到支持视觉的模型,来完成视觉识别。
Hermes 支持"主模型 + 辅助模型"的分工:
| 角色 | 模型举例 | 负责什么 |
|---|---|---|
| 主模型 | DeepSeek V4 Flash | 日常对话、写代码、查资料、执行任务 |
| 辅助视觉模型 | 任何支持视觉的模型 | 识别图片内容,把"看到了什么"转成文字 |
举例一个场景:
你贴一张截图
→ Hermes 发现主模型不支持图片
→ 自动把图片转发给辅助视觉模型
→ 视觉模型分析图片,返回文字描述
→ 文字描述喂给主模型
→ 主模型"看懂了"图,继续跟你对话
整个过程自动完成。你只需要贴图,Hermes 发现主模型看不了图,就会自动交给视觉模型处理。
11.2 前提条件
- Hermes 已安装(见第3节)
- 准备一个支持视觉的模型的 API Key(任何支持视觉能力的模型都行)
11.3 配置步骤:直接告诉 Hermes
这里有两个方案:
-
自己去改配置来支持主从模型。这个比较麻烦不推荐。
-
不需要手动改配置文件。Hermes 有文件系统访问能力,可以自己修改配置。直接在对话里输入:
> 帮我配置一个辅助视觉模型。用 DashScope 的 qwen3.7-plus,
> API Key 是 sk-xxxxxxxxxxxx
Hermes 收到之后会修改对应的配置文件。
配完之后,Hermes 会提醒你重启。重新启动 Hermes,视觉模型就生效了。
任何支持视觉能力的模型都可以拿来当辅助视觉模型。比如 MiniMax、Kimi 也可以。 但要注意,Qwen 实际上是一个模型族,他的模型非常多,有的模型是支持视觉的,有的模型是不支持的。比如 qwen3.7-plus 支持,但 qwen3.7-max 不支持。
怎么确认一个模型是否支持视觉?直接问 Hermes 就行。Hermes 自带知识库,里面收录了各种模型的配置信息,而且知识库是社区维护的,信息是最新的,比网上搜的或者问别人更靠谱。如果知识库里恰好没有收录,Hermes 还能联网搜索官方文档,帮你确认。
验证是否生效
重启之后,来测试下 Hermes 能否识别图片。先随便截个图(Cmd+Shift+4,或者自行复制一张图片),把截图存到剪贴板上,然后根据你的使用环境发图:
Hermes Desktop:直接把剪贴板里的图片粘贴到对话输入框(Cmd+V),发送就行。Desktop 原生支持图片粘贴。
终端 CLI:终端输入框不支持直接粘贴图片。需要输入 /paste 然后回车,Hermes 会从系统剪贴板读取图片并发送。
等待结果,Hermes 如果返回图像的识别信息,证明配置成功。
如果没生效怎么办
正常情况下 Hermes 都能自己配好。但万一它没处理对,可以手动看一下配置文件:
hermes config edit
对照下面的配置解析,检查几个关键点:
image_input_mode是否设为autoauxiliary.vision下的provider、model、base_url、api_key是否都填了api_key有没有多复制空格或少复制字符
改完保存,重启 Hermes 就行。
配置解析
Hermes 的视觉配置主要涉及两个部分:
image_input_mode 决定了 Hermes 怎么处理你发的图片:
- 设为
auto时,主模型支持看图(比如 qwen)→ 直接把原图发给主模型 - 主模型不支持看图(比如 DeepSeek)→ 自动转发给辅助视觉模型
- 没有配置辅助视觉模型 → 提示你"当前模型不支持图片"
也就是说,设为 auto 之后,不需要关心当前主模型能不能看图。配了辅助视觉模型它就自动走辅助通道,没配它也不会卡住。
auxiliary.vision 定义了辅助视觉模型的具体信息,一个典型的配置长这样:
agent:
image_input_mode: auto
auxiliary:
vision:
provider: dashscope
model: qwen3.7-plus
base_url: https://dashscope.aliyuncs.com/compatible-mode/v1
api_key: sk-你的API Key
timeout: 120
11.4 ■ 学点英语
| 中文 | English | 音标 | 说明 |
|---|---|---|---|
| 视觉模型 | Vision Model | /ˈvɪʒən ˈmɑːdl/ | 能理解图片内容并参与推理的模型 |
| 多模态输入 | Multimodal Input | /ˌmʌltiˈmoʊdl ˈɪnpʊt/ | 同时包含文字、图片、音频等多种信息形式的输入 |
| 模型路由 | Model Routing | /ˈmɑːdl ˈruːtɪŋ/ | 根据任务类型把请求分配给合适模型的机制 |
| 图片理解 | Image Understanding | /ˈɪmɪdʒ ˌʌndərˈstændɪŋ/ | 从图片中识别对象、文字和关系的能力 |