🏠 返回首页
Qwen 系列 · 开源大模型深度解析

阿里开源双雄 · 深度解析

稠密 Qwen3.8-27B × 稀疏 MoE Qwen3.6-35B-A3B —— 一次读懂架构、命名、量化与本地部署

调研日期 2026-08-19数据源:Qwen 官方模型卡 / Hugging Face / ModelScope / 阿里云官方博客

27
Qwen3.8-27B
稠密 Dense 模型

2026-08-14 开源。270 亿参数原生多模态稠密模型,Apache 2.0 协议,混合线性注意力架构,长文本与代码能力突出。

总参数
27B
上下文
262K → 1M
模态
文本+图+视频
协议
Apache 2.0
A3B
Qwen3.6-35B-A3B
稀疏 MoE 专家模型

2026-04-16 开源。350 亿总参 / 30 亿激活的混合专家模型,推理时仅激活 3B 参数 —— 「35B 的容量,3B 的算力」。

总参数 / 激活
35B / 3B
上下文
262K → 1.01M
模态
文本+图+视频
协议
Apache 2.0
270亿 / 350亿
参数量级
Apache 2.0
开源协议
262K→1M
上下文长度
500+
社区量化版本
100万+
27B 两天下载量

01

模型名片:Qwen3.8-27B

2026-08-14 由阿里通义实验室开源。新一代原生多模态稠密模型,主打「混合线性注意力 + 超长上下文 + 代码 Agent 能力」,开源仅两天下载量即突破 100 万,社区涌现 500+ 量化版本。

核心参数

  • 总参数 27.78B(含视觉编码器,BF16 精度)
  • 架构 稠密 Dense(全参数参与推理)
  • 层数 64 层,Hidden 5120
  • 原生上下文 262K,YaRN 扩展至 1M

🧠混合线性注意力

  • 重复单元:3 × Gated DeltaNet + 1 × Gated Attention
  • 线性注意力负责长文本高效压缩,降低显存与耗时
  • 门控注意力保障关键信息精确保留
  • MTP 投机解码,推理速度大幅提升

🎯能力亮点

  • 原生多模态:文本 / 图像 / 视频理解
  • 思考模式可调:reasoning_effort 控制深度
  • 代码与工具调用能力突出(SWE-bench Pro 61.7
  • 开源协议 Apache 2.0,商用友好

🔤名称逐段解析:Qwen3.8-27B

Qwen
品牌前缀:通义千问(Qwen,全称 Qwen-通义千问),阿里通义实验室开源大模型家族的统一代号。
3.8
版本号:第 3 代产品线的 3.8 版。数字越大代表迭代越新,3.x 系列沿袭 Qwen3 的开源技术路线。
27B
参数规模:约 270 亿(Billion)参数。稠密模型下,27B 基本等于推理时全量参与计算,显存需求按 27B 整体估算。
(无后缀)
主版本:不带 Instruct / Thinking 后缀的是基础指令版;社区衍生的 -GGUF / -AWQ / -FP8 等后缀表示不同量化格式。

📊官方基准成绩(Qwen 官方自测)

61.7
SWE-bench Pro
真实代码修复
73.0
Terminal-Bench 2.1
终端 Agent 任务
90.3
LiveCodeBench v6
代码竞赛难度
89.2
GPQA Diamond
研究生级科学问答
33.4
JobBench
真实办公任务
📌
说明:以上为 Qwen 官方模型卡自测数据,与社区复测可能存在 ±1~3 分差异。SWE-bench Pro 考察真实 GitHub issue 修复,Terminal-Bench 考察命令行环境下的 Agent 执行能力 —— 两项高分意味着它不只是聊天模型,而是能干活的 Agent 模型

02

模型名片:Qwen3.6-35B-A3B

2026-04-16 开源。Qwen3.6 系列的「轻量高速」代表:总参 350 亿的 MoE 模型,推理时只激活约 30 亿参数,能在消费级显卡上跑出接近小模型的速度,同时保留大模型的容量与多模态能力。

核心参数

  • 总参数 350 亿 / 激活参数 约 30 亿
  • 架构 稀疏 MoE(混合专家)
  • 层数 40 层,Hidden 2048
  • 专家数 256 个(8 路由 + 1 共享)
  • 原生上下文 262K → 扩展 1,010,000

🧠架构亮点

  • 重复单元:3×Gated DeltaNet → MoE,再接 1×Gated Attention → MoE
  • 每层 top-8 路由,Token 只激活 8 个专家 + 1 个共享专家
  • MTP 训练(多 Token 预测),提升推理效率
  • 总参决定显存,激活参决定速度

🚀使用特性

  • 思考 / 非思考双模式,支持 preserve_thinking
  • API 名:qwen3.6-flash(阿里云百炼)
  • 兼容 OpenClaw / Claude Code / Qwen Code 等 Agent 框架
  • 原生多模态:文本 / 图像 / 视频

🔤名称逐段解析:Qwen3.6-35B-A3B

Qwen
品牌前缀:通义千问系列统一代号。
3.6
版本号:第 3 代产品线的 3.6 版,早于 3.8 发布;3.6 系列主打 MoE 与效率
35B
总参数:全部权重共约 350 亿。决定模型容量与显存占用 —— 本地部署时按 35B 算显存。
A3B
A = Active(激活参数),3B = 约 30 亿。MoE 模型推理时每 Token 只激活约 3B 权重,决定计算量与生成速度。这是理解 MoE 的关键后缀!
💡
一句话记住「总参数 vs 激活参数」:总参数(35B)像一本百科全书 —— 内容多,放书架上占地方(显存);激活参数(3B)像你翻书时只读的那几页 —— 决定读得快不快(速度)。MoE 的魔法就在于:书很厚,但每页只用读 1/10。

📊官方基准成绩(Qwen 官方自测)

73.4
SWE-bench Verified
代码修复
51.5
Terminal-Bench 2.0
终端 Agent 任务
86.0
GPQA
科学问答
92.7
AIME 2026
数学竞赛
85.2
MMLU-Pro
综合知识
另有 RefCOCO 92.0(指代视觉理解)与 VideoMMMU 83.7(视频理解)等多模态成绩 —— 它不只是「快」,多模态也是原生能力。

03

读懂量化命名:Q4_K_M 到底是什么?

下载 GGUF 模型时,你会看到 Q2_K、Q4_K_M、Q5_K_S、Q8_0、IQ4_XS 等眼花缭乱的后缀。其实每个字母都有固定含义,拆开看就一目了然。

🔬逐字母拆解:Q4_K_M

Q
Quantization(量化):表示该文件是量化版本。前缀 IQ 则代表 Importance Matrix(重要性矩阵)量化,属于新一代更聪明的量化方式。
4
位宽(bit):权重平均用多少 bit 存储。4 = 平均 4 bit/权重,数字越小文件越小、质量越低;常见档位 2 / 3 / 4 / 5 / 6 / 8。
_K
K-quant 混合量化:llama.cpp 提出的方案 —— 重要权重用更高精度、次要权重用更低精度 混合打包,是当前 GGUF 的默认标准。
_M
质量档位:S / M / L(Small / Medium / Large)。M = 中等,大小与质量最均衡;L 质量最好但更大;S 最省空间。
_0 / F16
后缀 0(如 Q8_0)= 旧式块量化(block-wise);F16 / BF16 = 未量化原版(16 位浮点),文件最大、质量最高。
⚠️
常见误区:Q4_K_M ≠ 纯 INT4。「4」只是平均位宽。K-quant 里实际是混合精度:大部分权重用 4 bit,少部分重要权重(如 attention 的某些矩阵)可能是 5~6 bit。所以它比「一刀切 INT4」质量更好,文件名里的 K 就是关键。

🪜GGUF 量化阶梯(以 27B 稠密模型为例)

量化档位平均位宽近似体积质量推荐场景
BF1616 bit~55.6 GB原版质量服务器 / 多卡集群
Q8_08 bit~30 GB接近原版24GB 显卡最佳档位
Q6_K6 bit~24 GB几乎无损24GB 显卡甜品选择
Q5_K_M5 bit~20 GB轻度损失20GB 显卡(如 3080Ti)
Q4_K_M4 bit~17 GB均衡 · 甜点16~24GB 显卡大众首选
Q3_K_M3 bit~13.5 GB明显损失16GB 显卡极限可跑
Q2_K2 bit~10 GB较大损失仅作体验,不建议正式使用

体积为权重文件估算值,不含 KV 缓存与运行时开销(8K 上下文约再占 0.5~1GB)。


04

稠密模型 vs 专家模型 (MoE)

为什么 27B 是「稠密」而 35B-A3B 是「稀疏」?一张图看懂两者的根本差异 —— 问题在于推理时到底有多少参数在干活

Dense 稠密模型 全员上阵
每个 Token 都要流过全部 27B 参数 · 显存大 · 计算量大
输入 Token 同一输入流 层 1 层 2 层 64 全部参数都被激活 ⚡ 计算量 = 27B
MoE 专家模型 按需召唤
路由器只把 Token 交给 8/256 个专家 · 显存按总参 · 速度按激活
输入 Token 路由器 Router ? 专家 7 ✅ 专家 23 ✅ 专家 41 专家 88 专家 112 专家 165 专家 200 …共 256 个 只激活 top-8 专家 ⚡ 计算量 ≈ 3B

🧮总参数(决定显存)

模型全部权重的数量。无论 Dense 还是 MoE,加载时都要把所有权重放进显存。35B 的 MoE 比 27B 的 Dense 更吃显存,就因为这个数更大。

激活参数(决定速度)

推理时每个 Token 实际参与计算的参数。Dense 中激活参数 = 总参数;MoE 中激活参数 ≈ 总参数 × 路由比例。激活参数越少,生成越快、越省电。

🎛路由 / 共享专家 / 均衡

Router 学习把 Token 分给擅长的专家;共享专家 每个 Token 必用(处理通用知识);负载均衡 防止个别专家过载 —— 三者配合才能让 MoE 又快又稳。

⚖️Dense vs MoE 快速对比

维度稠密 Dense(如 27B)稀疏 MoE(如 35B-A3B)
推理时干活全部 27B 参数仅约 3B 参数(8/256 专家)
模型容量中等(27B 知识)更大(35B 知识 + 多专家分工)
显存需求按 27B 算按 35B 算(更吃显存)
生成速度中规中矩快(激活参数少,RTX 4090 可达 ~70 tok/s)
训练成本较低更高(要学路由、防崩溃)
长程 Agent 任务稳定更快、更省 token
Qwen3.6-35B-A3B = 35B 的容量,只付 3B 的算力
这就是 MoE 的核心理念:把「知识仓库」做大(总参数),但每次只让一小队专家出手(激活参数),用更少的计算换取更大的能力。

05

模型量化原理:把 55GB 塞进 17GB

量化(Quantization)就是把模型权重从高精度浮点数「压缩」成低精度整数。它为什么可行?为什么反而可能更快?往下看。

💾为什么需要量化

  • FP16 每个权重占 2 字节,INT4 只需 0.5 字节 —— 体积直接砍到 1/4
  • 例:7B 模型 FP16 需 14GB 显存,INT4 仅 3.5GB,普通显卡也能跑
  • 推理瓶颈常是内存带宽而非算力:权重更小 → 搬运更快 → 量化后速度反而提升
  • 让 24GB 显卡跑 55GB 的 27B 原版?不可能 —— 量化是本地部署的唯一出路

🧮量化数学原理

q = round( x / scale )

对称量化:用一个缩放因子把浮点范围映射到整数范围

q = round( x / scale ) + zero_point

非对称量化:再加一个零点偏移,适配分布不对称的权重

粒度越高误差越小:per-tensor(整层一个尺度)→ per-channel(每通道一个)→ per-group(每小组一个,GGUF 常用 32 权重一组)。组越细,精度越高,但文件越大、越复杂。

🧰主流量化方法对比

方法核心思路特点典型场景
GPTQ用二阶 Hessian 信息逐层补偿量化误差,保住关键权重精度高,但量化过程较慢(需校准数据)GPU 推理(vLLM、AutoGPTQ)
AWQ激活感知:统计激活值,重点保护「重要」权重通道速度快、精度高,无需反向传播GPU 推理(vLLM、TGI)
GGUF / K-quant混合精度块量化 + 重要权重高精度CPU + GPU 混合运行,兼容性最好llama.cpp / Ollama 本地部署
bitsandbytes加载模型时「动态」量化,不改原文件开箱即用,零配置,适合实验Hugging Face Transformers
FP88 位浮点(e4m3/e5m2),硬件原生支持RTX 40 系 / H100 硬件加速,精度损失极小新显卡 / 数据中心

📉收益与代价

从 FP16 量化到 INT4:

  • 体积 / 显存:减少约 75%
  • 推理速度:提升 50% ~ 150%(带宽受限时更明显)
  • 基准分数:通常仅下降 1% ~ 3%(多数任务几乎无感)

代价与注意点:

  • 极端档位(Q2_K)可能出现逻辑混乱 / 幻觉加重
  • 数学推理、代码等任务对量化更敏感
  • 显存紧张时,宁可 Q4 也不 Q2 —— 质量优先
  • 量化版模型不能继续训练(权重已离散化)

06

本地部署:电脑配置怎么选?

核心原则:显存决定能不能跑,内存决定够不够稳。稠密模型权重整体进显存;MoE 虽然只激活一部分,但全部权重同样要常驻显存 —— 别被「3B 激活」误导。

💻Qwen3.8-27B(稠密)· 量化档位与显存

甜点配置 流畅运行 极限可跑 不推荐
量化档位权重体积推荐显卡评级备注
BF16~55.6 GB80GB × 1 / 多卡服务器级原版质量,家用基本无缘
FP8~27 GBRTX 4090 (24G) 放不下需 32G+ 卡需硬件 FP8 支持,40 系及以上
Q8_0~30 GBRTX 3090 (24G) 放不下需 32G+ 卡接近原版质量
Q6_K~24 GBRTX 4090 / 3090甜点 ✓24GB 卡 + 质量最高档
Q5_K_M~20 GBRTX 3080Ti (12G) 不行建议 24G20GB 卡可流畅(3080Ti 20G 版 / A5000)
Q4_K_M~17 GBRTX 4070 Ti Super (16G)大众甜点 ✓16~24GB 显卡首选,质量/体积最均衡
Q3_K_M~13.5 GBRTX 4070 / 4060Ti (16G)极限可跑16GB 卡可跑,质量明显下降

KV 缓存另计:8K 上下文约 0.5GB,32K 约 2GB。数值为权重近似估算,实际以 Unsloth / llama.cpp 发布表为准。

💻Qwen3.6-35B-A3B(MoE)· 量化档位与显存

甜点配置 流畅运行 极限可跑
量化档位权重体积推荐显卡评级备注
FP16~72 GB多卡 / 服务器服务器级原版质量
Q8_0~37.5 GBRTX 4090 48G 魔改需大显存接近原版质量
Q6_K~28.4 GBRTX 5090 (32G)流畅运行32GB 卡体验佳
Q5_K_M~24.2 GBRTX 4090 (24G)甜点 ✓24GB 卡高质量档
Q4_K_M~21.4 GBRTX 4090 / 3090大众甜点 ✓24GB 卡轻松跑,~70 tok/s
MoE 的速度密码:显存按 35B 总参算(Q4 约 21.4GB),但速度按 3B 激活参算 —— 所以 RTX 4090 上 Q4 档能跑出约 70 tok/s 的流畅速度,远超同显存的稠密模型。

🖥四套推荐配置方案

甜点配置(性价比首选)

  • 显卡:RTX 4090 24GB 或 3090
  • 内存:32GB(推荐 64GB 更稳)
  • 模型:27B Q4_K_M / Q6_K,或 35B-A3B Q4_K_M / Q5_K_M
  • 体验:35B-A3B 流畅 ~70 tok/s,27B 稳跑

🎯入门配置(16GB 显卡)

  • 显卡:RTX 4070 / 4060 Ti 16GB
  • 内存:32GB
  • 模型:27B Q3_K_M(极限)或 Q4_K_M 开长上下文会超显存
  • 体验:27B 可跑但速度一般;想快可换更小的模型

🍎Mac 用户(统一内存)

  • 建议:32GB 统一内存起步,64GB 更佳
  • M 系列芯片跑 GGUF 有 Metal 加速,速度可观
  • 模型:27B Q4_K_M(~17GB)或 35B-A3B Q4(~21GB)
  • 工具:Ollama / llama.cpp(MPS 后端)

🛠部署工具怎么选

  • Ollama:一键安装、命令即用,新手首选
  • llama.cpp:灵活可定制,CPU/GPU 混合,进阶玩家
  • vLLM:生产级高并发,服务部署首选(GPTQ/AWQ)
  • LM Studio:图形界面,拖拽即用,可视化友好

07

双雄对决:一页看懂怎么选

同样是 Qwen 家族、同样 Apache 2.0 开源 —— 27B 与 35B-A3B 的差异不在「谁更强」,而在「适合谁」。

⚔️关键参数对比

维度Qwen3.8-27BQwen3.6-35B-A3B
架构稠密 Dense稀疏 MoE(256 专家 / top-8)
总参数27.78B~35B
激活参数27.78B(全部)~3B
上下文262K → 1M262K → 1.01M
模态文本 / 图像 / 视频文本 / 图像 / 视频
Q4_K_M 显存~17 GB~21.4 GB
生成速度(24G 卡)中速~70 tok/s 高速
开源日期2026-08-142026-04-16
强项多模态理解 / 代码 / 均衡全面速度 / 长程 Agent / 性价比

📈官方基准并排对比

基准Qwen3.8-27BQwen3.6-35B-A3B
代码修复SWE-bench Pro 61.7SWE-bench Verified 73.4
终端 AgentTerminal-Bench 2.1 · 73.0Terminal-Bench 2.0 · 51.5
科学问答GPQA Diamond 89.2GPQA 86.0
数学竞赛—(官方未公布 AIME)AIME 2026 · 92.7
视频理解VideoMMMU 83.7
📌
注意:两模型公布的基准子集不完全一致(Terminal-Bench 版本也不同),分数不能直接横比。更合理的读法是:27B 在终端任务上表现亮眼,35B-A3B 在代码修复与数学上突出 —— 各有侧重,都属同代顶级水平。

🧭选型建议

选 Qwen3.8-27B 如果你…
  • 显卡 16GB 左右,显存预算有限
  • 需要多模态(图 / 视频理解)
  • 看重终端 / 命令行 Agent 能力(Terminal-Bench 73.0)
  • 想要更省显存、更均衡的日用全能模型
选 Qwen3.6-35B-A3B 如果你…
  • 24GB 显卡,追求极致速度(~70 tok/s)
  • 长程 Agent / 多轮工具调用,省时省 token
  • 需要更大知识容量(35B 总参)与更强代码修复(73.4)
  • 能接受 21GB+ 的显存占用换取高速体验
一句话:显存紧、要全能 → 27B有 24G、要飞快的 Agent → 35B-A3B
预算允许的话,两台都装也不冲突 —— 轻量任务交给 35B-A3B 闪电处理,精细多模态任务交给 27B 稳扎稳打。