稠密 Qwen3.8-27B × 稀疏 MoE Qwen3.6-35B-A3B —— 一次读懂架构、命名、量化与本地部署
2026-08-14 开源。270 亿参数原生多模态稠密模型,Apache 2.0 协议,混合线性注意力架构,长文本与代码能力突出。
2026-04-16 开源。350 亿总参 / 30 亿激活的混合专家模型,推理时仅激活 3B 参数 —— 「35B 的容量,3B 的算力」。
2026-08-14 由阿里通义实验室开源。新一代原生多模态稠密模型,主打「混合线性注意力 + 超长上下文 + 代码 Agent 能力」,开源仅两天下载量即突破 100 万,社区涌现 500+ 量化版本。
2026-04-16 开源。Qwen3.6 系列的「轻量高速」代表:总参 350 亿的 MoE 模型,推理时只激活约 30 亿参数,能在消费级显卡上跑出接近小模型的速度,同时保留大模型的容量与多模态能力。
下载 GGUF 模型时,你会看到 Q2_K、Q4_K_M、Q5_K_S、Q8_0、IQ4_XS 等眼花缭乱的后缀。其实每个字母都有固定含义,拆开看就一目了然。
| 量化档位 | 平均位宽 | 近似体积 | 质量 | 推荐场景 |
|---|---|---|---|---|
| BF16 | 16 bit | ~55.6 GB | 原版质量 | 服务器 / 多卡集群 |
| Q8_0 | 8 bit | ~30 GB | 接近原版 | 24GB 显卡最佳档位 |
| Q6_K | 6 bit | ~24 GB | 几乎无损 | 24GB 显卡甜品选择 |
| Q5_K_M | 5 bit | ~20 GB | 轻度损失 | 20GB 显卡(如 3080Ti) |
| Q4_K_M | 4 bit | ~17 GB | 均衡 · 甜点 | 16~24GB 显卡大众首选 |
| Q3_K_M | 3 bit | ~13.5 GB | 明显损失 | 16GB 显卡极限可跑 |
| Q2_K | 2 bit | ~10 GB | 较大损失 | 仅作体验,不建议正式使用 |
体积为权重文件估算值,不含 KV 缓存与运行时开销(8K 上下文约再占 0.5~1GB)。
为什么 27B 是「稠密」而 35B-A3B 是「稀疏」?一张图看懂两者的根本差异 —— 问题在于推理时到底有多少参数在干活。
模型全部权重的数量。无论 Dense 还是 MoE,加载时都要把所有权重放进显存。35B 的 MoE 比 27B 的 Dense 更吃显存,就因为这个数更大。
推理时每个 Token 实际参与计算的参数。Dense 中激活参数 = 总参数;MoE 中激活参数 ≈ 总参数 × 路由比例。激活参数越少,生成越快、越省电。
Router 学习把 Token 分给擅长的专家;共享专家 每个 Token 必用(处理通用知识);负载均衡 防止个别专家过载 —— 三者配合才能让 MoE 又快又稳。
| 维度 | 稠密 Dense(如 27B) | 稀疏 MoE(如 35B-A3B) |
|---|---|---|
| 推理时干活 | 全部 27B 参数 | 仅约 3B 参数(8/256 专家) |
| 模型容量 | 中等(27B 知识) | 更大(35B 知识 + 多专家分工) |
| 显存需求 | 按 27B 算 | 按 35B 算(更吃显存) |
| 生成速度 | 中规中矩 | 快(激活参数少,RTX 4090 可达 ~70 tok/s) |
| 训练成本 | 较低 | 更高(要学路由、防崩溃) |
| 长程 Agent 任务 | 稳定 | 更快、更省 token |
量化(Quantization)就是把模型权重从高精度浮点数「压缩」成低精度整数。它为什么可行?为什么反而可能更快?往下看。
对称量化:用一个缩放因子把浮点范围映射到整数范围
非对称量化:再加一个零点偏移,适配分布不对称的权重
粒度越高误差越小:per-tensor(整层一个尺度)→ per-channel(每通道一个)→ per-group(每小组一个,GGUF 常用 32 权重一组)。组越细,精度越高,但文件越大、越复杂。
| 方法 | 核心思路 | 特点 | 典型场景 |
|---|---|---|---|
| GPTQ | 用二阶 Hessian 信息逐层补偿量化误差,保住关键权重 | 精度高,但量化过程较慢(需校准数据) | GPU 推理(vLLM、AutoGPTQ) |
| AWQ | 激活感知:统计激活值,重点保护「重要」权重通道 | 速度快、精度高,无需反向传播 | GPU 推理(vLLM、TGI) |
| GGUF / K-quant | 混合精度块量化 + 重要权重高精度 | CPU + GPU 混合运行,兼容性最好 | llama.cpp / Ollama 本地部署 |
| bitsandbytes | 加载模型时「动态」量化,不改原文件 | 开箱即用,零配置,适合实验 | Hugging Face Transformers |
| FP8 | 8 位浮点(e4m3/e5m2),硬件原生支持 | RTX 40 系 / H100 硬件加速,精度损失极小 | 新显卡 / 数据中心 |
从 FP16 量化到 INT4:
代价与注意点:
核心原则:显存决定能不能跑,内存决定够不够稳。稠密模型权重整体进显存;MoE 虽然只激活一部分,但全部权重同样要常驻显存 —— 别被「3B 激活」误导。
| 量化档位 | 权重体积 | 推荐显卡 | 评级 | 备注 |
|---|---|---|---|---|
| BF16 | ~55.6 GB | 80GB × 1 / 多卡 | 服务器级 | 原版质量,家用基本无缘 |
| FP8 | ~27 GB | RTX 4090 (24G) 放不下 | 需 32G+ 卡 | 需硬件 FP8 支持,40 系及以上 |
| Q8_0 | ~30 GB | RTX 3090 (24G) 放不下 | 需 32G+ 卡 | 接近原版质量 |
| Q6_K | ~24 GB | RTX 4090 / 3090 | 甜点 ✓ | 24GB 卡 + 质量最高档 |
| Q5_K_M | ~20 GB | RTX 3080Ti (12G) 不行 | 建议 24G | 20GB 卡可流畅(3080Ti 20G 版 / A5000) |
| Q4_K_M | ~17 GB | RTX 4070 Ti Super (16G) | 大众甜点 ✓ | 16~24GB 显卡首选,质量/体积最均衡 |
| Q3_K_M | ~13.5 GB | RTX 4070 / 4060Ti (16G) | 极限可跑 | 16GB 卡可跑,质量明显下降 |
KV 缓存另计:8K 上下文约 0.5GB,32K 约 2GB。数值为权重近似估算,实际以 Unsloth / llama.cpp 发布表为准。
| 量化档位 | 权重体积 | 推荐显卡 | 评级 | 备注 |
|---|---|---|---|---|
| FP16 | ~72 GB | 多卡 / 服务器 | 服务器级 | 原版质量 |
| Q8_0 | ~37.5 GB | RTX 4090 48G 魔改 | 需大显存 | 接近原版质量 |
| Q6_K | ~28.4 GB | RTX 5090 (32G) | 流畅运行 | 32GB 卡体验佳 |
| Q5_K_M | ~24.2 GB | RTX 4090 (24G) | 甜点 ✓ | 24GB 卡高质量档 |
| Q4_K_M | ~21.4 GB | RTX 4090 / 3090 | 大众甜点 ✓ | 24GB 卡轻松跑,~70 tok/s |
同样是 Qwen 家族、同样 Apache 2.0 开源 —— 27B 与 35B-A3B 的差异不在「谁更强」,而在「适合谁」。
| 维度 | Qwen3.8-27B | Qwen3.6-35B-A3B |
|---|---|---|
| 架构 | 稠密 Dense | 稀疏 MoE(256 专家 / top-8) |
| 总参数 | 27.78B | ~35B |
| 激活参数 | 27.78B(全部) | ~3B |
| 上下文 | 262K → 1M | 262K → 1.01M |
| 模态 | 文本 / 图像 / 视频 | 文本 / 图像 / 视频 |
| Q4_K_M 显存 | ~17 GB | ~21.4 GB |
| 生成速度(24G 卡) | 中速 | ~70 tok/s 高速 |
| 开源日期 | 2026-08-14 | 2026-04-16 |
| 强项 | 多模态理解 / 代码 / 均衡全面 | 速度 / 长程 Agent / 性价比 |
| 基准 | Qwen3.8-27B | Qwen3.6-35B-A3B |
|---|---|---|
| 代码修复 | SWE-bench Pro 61.7 | SWE-bench Verified 73.4 |
| 终端 Agent | Terminal-Bench 2.1 · 73.0 | Terminal-Bench 2.0 · 51.5 |
| 科学问答 | GPQA Diamond 89.2 | GPQA 86.0 |
| 数学竞赛 | —(官方未公布 AIME) | AIME 2026 · 92.7 |
| 视频理解 | — | VideoMMMU 83.7 |