💡阅读指南

DeepSeek 4.0 是没有视觉能力的。你给它一张图,他无法识别图中的内容。但 Qwen、GPT、MiniMax 等 这些模型支持视觉能力。这一节看看怎么给 Hermes 加上一个"眼睛",让他能够看懂图片。

11.1 我们需要什么?

我们需要的不是强行把非视觉模型改为视觉模型,而是需要以下机制:

常规文本依然使用 DeepSeek 处理,当需要识别图片或者需要依赖视觉时,Hermes 可以自己切换到支持视觉的模型,来完成视觉识别。

Hermes 支持"主模型 + 辅助模型"的分工:

角色 模型举例 负责什么
主模型 DeepSeek V4 Flash 日常对话、写代码、查资料、执行任务
辅助视觉模型 任何支持视觉的模型 识别图片内容,把"看到了什么"转成文字

举例一个场景:

code
你贴一张截图
  → Hermes 发现主模型不支持图片
  → 自动把图片转发给辅助视觉模型
  → 视觉模型分析图片,返回文字描述
  → 文字描述喂给主模型
  → 主模型"看懂了"图,继续跟你对话

整个过程自动完成。你只需要贴图,Hermes 发现主模型看不了图,就会自动交给视觉模型处理。

11.2 前提条件

  • Hermes 已安装(见第3节)
  • 准备一个支持视觉的模型的 API Key(任何支持视觉能力的模型都行)

11.3 配置步骤:直接告诉 Hermes

这里有两个方案:

  1. 自己去改配置来支持主从模型。这个比较麻烦不推荐。

  2. 不需要手动改配置文件。Hermes 有文件系统访问能力,可以自己修改配置。直接在对话里输入:

code
> 帮我配置一个辅助视觉模型。用 DashScope 的 qwen3.7-plus,
> API Key 是 sk-xxxxxxxxxxxx

Hermes 收到之后会修改对应的配置文件。

配完之后,Hermes 会提醒你重启。重新启动 Hermes,视觉模型就生效了。

📌不一定非得用 Qwen

任何支持视觉能力的模型都可以拿来当辅助视觉模型。比如 MiniMax、Kimi 也可以。 但要注意,Qwen 实际上是一个模型族,他的模型非常多,有的模型是支持视觉的,有的模型是不支持的。比如 qwen3.7-plus 支持,但 qwen3.7-max 不支持。

怎么确认一个模型是否支持视觉?直接问 Hermes 就行。Hermes 自带知识库,里面收录了各种模型的配置信息,而且知识库是社区维护的,信息是最新的,比网上搜的或者问别人更靠谱。如果知识库里恰好没有收录,Hermes 还能联网搜索官方文档,帮你确认。

验证是否生效

重启之后,来测试下 Hermes 能否识别图片。先随便截个图(Cmd+Shift+4,或者自行复制一张图片),把截图存到剪贴板上,然后根据你的使用环境发图:

Hermes Desktop:直接把剪贴板里的图片粘贴到对话输入框(Cmd+V),发送就行。Desktop 原生支持图片粘贴。

终端 CLI:终端输入框不支持直接粘贴图片。需要输入 /paste 然后回车,Hermes 会从系统剪贴板读取图片并发送。

等待结果,Hermes 如果返回图像的识别信息,证明配置成功。

如果没生效怎么办

正常情况下 Hermes 都能自己配好。但万一它没处理对,可以手动看一下配置文件:

Bash
hermes config edit

对照下面的配置解析,检查几个关键点:

  • image_input_mode 是否设为 auto
  • auxiliary.vision 下的 providermodelbase_urlapi_key 是否都填了
  • api_key 有没有多复制空格或少复制字符

改完保存,重启 Hermes 就行。

配置解析

Hermes 的视觉配置主要涉及两个部分:

image_input_mode 决定了 Hermes 怎么处理你发的图片:

  • 设为 auto 时,主模型支持看图(比如 qwen)→ 直接把原图发给主模型
  • 主模型不支持看图(比如 DeepSeek)→ 自动转发给辅助视觉模型
  • 没有配置辅助视觉模型 → 提示你"当前模型不支持图片"

也就是说,设为 auto 之后,不需要关心当前主模型能不能看图。配了辅助视觉模型它就自动走辅助通道,没配它也不会卡住。

auxiliary.vision 定义了辅助视觉模型的具体信息,一个典型的配置长这样:

YAML
agent:
  image_input_mode: auto

auxiliary:
  vision:
    provider: dashscope
    model: qwen3.7-plus
    base_url: https://dashscope.aliyuncs.com/compatible-mode/v1
    api_key: sk-你的API Key
    timeout: 120

11.4 ■ 学点英语

中文 English 音标 说明
视觉模型 Vision Model /ˈvɪʒən ˈmɑːdl/ 能理解图片内容并参与推理的模型
多模态输入 Multimodal Input /ˌmʌltiˈmoʊdl ˈɪnpʊt/ 同时包含文字、图片、音频等多种信息形式的输入
模型路由 Model Routing /ˈmɑːdl ˈruːtɪŋ/ 根据任务类型把请求分配给合适模型的机制
图片理解 Image Understanding /ˈɪmɪdʒ ˌʌndərˈstændɪŋ/ 从图片中识别对象、文字和关系的能力