面向个人与小团队商业生产的选型指南。把两条路线在 可用模型、工具链、实际效果、真实成本 四个维度摊开对比 —— 并特别纳入 苹果 Mac(Apple Silicon) 这条被很多人忽略的本地路线。
一句话先给结论:代码生成,云端 API 在效果和成本上几乎全面胜出;视频生成,本地能做到云端约八成的效果,但门槛全在显存和耐心。两者本质上是"一次性买断硬件 + 零边际成本"与"零门槛起步 + 按量付费"两种商业模型之争。
关键分水岭是"使用频率"而非"使用与否"。低频探索时,云端按量付费的月成本可能只有本地电费的一半;而一旦进入批量生产(每月几百条视频、上亿 token),本地那笔固定投入会被迅速摊薄。所以真正该问的不是"哪个更好",而是"你每个月到底产出多少" —— 第 04 节会给出精确的盈亏平衡点。
这是最不需要纠结的场景。前沿云端模型在 SWE-bench(真实 GitHub Issue 修复)上已达 88%–96%,而最强开源本地模型约 70%;同时 DeepSeek / Qwen 等国产 API 把价格压到了每百万 token 几毛钱。结论:代码场景默认走云端,本地只用于高频补全、批量重构和涉密环境。
| 模型 | 规模 | 量化后显存 | 定位与优势 | 许可 |
|---|---|---|---|---|
| Qwen3-Coder-Next | 80B MoE 3B 激活 | 8GB+ | 效率之王:只用 3B 激活参数就能跑出 ~70% SWE-bench,16GB 笔记本可跑,Agent 工具调用强 | Apache 2.0 |
| Qwen2.5-Coder 32B | 32B dense | 24GB (Q4) | Python 专精,代码补全能力接近 GPT-4o 中等水平;本地多语言首选 | Apache 2.0 |
| Qwen2.5-Coder 14B | 14B dense | 12–16GB (Q4/Q5) | 12GB 显卡的甜点:24–34 tok/s,补全体验流畅 | Apache 2.0 |
| DeepSeek-R1-Distill 32B | 32B dense | 24GB (Q4) | 带思维链,擅长调试、Bug 定位、复杂逻辑推导 | MIT |
| Llama 3.3 70B | 70B dense | 32GB+ 统一内存 | 通用大模型,Mac 生态友好,全能但需要大内存 | 社区许可 |
| Devstral 24B | 24B dense | 16–24GB (Q4) | 专为 Agentic 编码设计,适配 Cline / Aider 多文件改写 | Apache 2.0 |
| GLM-5.2 / Kimi K3 | 744B MoE 40B 激活 | 高(多卡) | 开源第一梯队,前端/UI 代码强;个人本地不现实,适合团队多卡 | 开放权重 |
* 参数为调研口径,不同来源对同名模型的版本号存在出入,请以官方模型卡为准。
| 环节 | 工具 | 说明 |
|---|---|---|
| 推理运行时 | Ollama / LM Studio | 安装即用,自带 OpenAI 兼容接口(localhost:11434 / 1234),适合入门与个人 |
| 生产推理 | vLLM / llama.cpp | 高并发与吞吐首选;llama.cpp 靠 GGUF 量化把大模型塞进小显存 |
| Mac 原生 | MLX | 苹果官方框架,70B 级模型上比 llama.cpp 快 20%–40% |
| IDE 接入 | Cline / Continue / Roo Code | VS Code 插件,把本地/云端模型接进编辑器,支持补全、Chat、Agent 多文件编辑 |
| 模型 | 输入 / 输出 (美元 / 百万 token) | SWE-bench 量级 | 适用场景 |
|---|---|---|---|
| GPT-5.6 Sol | $5 / $30 | ~96% | 原始能力天花板,终端型 Agent、严格 JSON/Diff 输出 |
| Claude Opus 4.8 | $5 / $25 | ~88% | 深度重构、复杂 Bug、架构级任务,会主动追问 |
| Claude Sonnet 5 | $3 / $15 | ~80% | 日常仓库内编辑的均衡默认值,性价比旗舰 |
| Gemini 3.1 Pro | $2 / $12 | ~80% | 超大上下文(百万级)整体代码库分析、UI 生成 |
| DeepSeek V4 Pro | $0.1–0.3 / $0.3–0.9 | ~80% | 高频批量、CI 修复:成本约为 Claude 的 1/30–1/50 |
| Qwen3-Coder / GLM-5.2 | $0.15–1.4 / $0.6–4.1 | ~70%+ | 中文场景友好,国内直连稳定,无需代理 |
| 工具 | 类型 | 价格 | 强项 |
|---|---|---|---|
| Claude Code | 终端 Agent | $20–100/月 | Agent 能力断层第一,跨文件重构、复杂 Bug |
| Cursor | AI 原生 IDE | $20/月 | 综合体验最均衡,多文件联动、MCP 支持 |
| GitHub Copilot | IDE 插件 | $10/月 起 | 生态最广、补全最快(~150ms),企业合规成熟 |
| Trae | 国产 AI IDE | 免费 / $10 月 | 基础版免费无额度限制,中文理解 98%,性价比极高 |
| 通义灵码 | 国产插件 | 个人免费 | 中文最佳、数据在国内合规、企业可私有化 |
| OpenAI Codex | CLI / 云端 | 随 ChatGPT 订阅 | 深度工程任务、自动化流水线、Worktree 隔离 |
代码场景的钱景测算:一个重度开发者每月可能消耗 2000 万–5000 万 token。若用 DeepSeek 类 API,月成本约 10–40 元;就算全用 Claude Opus,也多在 几百元 量级。而一套能跑 32B 模型的本地设备月摊销轻松超过 400 元。这意味着:纯从省钱角度,代码场景几乎永远不划算自建 —— 本地的价值在于隐私、离线与无限量。
开源视频模型在过去一年追得极快:Wan 2.2 综合画质已是本地第一梯队,LTX-2.3 更是首个开源出"音视频同步"的模型。但视频推理的显存需求是图像模型的 3–10 倍,且开源模型几乎都是 CUDA 优先 —— 这决定了本地路线的真实门槛。
| 模型 | 厂商 | 分辨率 / 时长 | 原生音频 | 最低显存 | 定位 |
|---|---|---|---|---|---|
| LTX-2.3 | Lightricks | 4K / 50fps 最长 20s | ✓ 单次生成 | 官方 32GB GGUF 12–16GB | 首个开源"音视频同步"模型,速度最快,附带免费桌面编辑器 |
| Wan 2.2 | 阿里 | 720p / 5s | ✗ | 24GB (5B) 45–80GB (14B) | 开源综合画质第一,Apache 2.0 可商用,支持 T2V/I2V/首尾帧 |
| HunyuanVideo 1.5 | 腾讯 | 720p / 5s | ✗ | 16GB (量化) 24GB 舒适 | 人物/人脸质量与一致性最佳,社区 LoRA 最丰富 |
| CogVideoX | 智谱 | 720×480 / 6s | ✗ | 16GB | 指令遵循与长序列叙事一致性,比 Wan 更轻量 |
| FramePack | 社区 | 30fps / 最长 60s | ✗ | 6GB | 低显存长视频之王,任何 RTX 30/40/50 系都能跑 |
| Mochi 1 | Genmo | 480p / 5.4s | ✗ | 24GB | 动作物理最自然,但速度慢,适合精修单条 |
* "最低显存"指量化(FP8 / GGUF)后的实际可跑门槛,非官方原生精度要求。
ComfyUI 是本地视频的事实标准:节点式工作流可以精细控制模型、采样器、分辨率与帧数,社区几乎所有新模型都会第一时间提供 ComfyUI 模板。LTX Desktop 是官方免费桌面版(无需配置环境)。Mac 用户还可用原生 App Draw Things。关键技巧:低显存务必用 GGUF 量化 + VAE tiling,并给 Wan 2.2 挂上 Lightning LoRA —— 能把 40 分钟的全量渲染压到 1–3 分钟。
| 模型 | 厂商 | 价格 | 最长 | 音频 | 定位 |
|---|---|---|---|---|---|
| Kling 3.0 | 快手 | $0.09–0.14 / 秒 ≈ ¥0.65–1.0 | 10s | ✓ | 性价比首选,角色与场景一致性口碑最好 |
| Seedance 2.0 | 字节 | ¥0.99 / 秒 Fast 低至 ~$0.022 | — | ✓ | 最便宜的"生产级"入口,多镜头快速迭代 |
| Sora 2 | OpenAI | $0.10–0.30 / 秒 | 15–20s | ✓ | 电影级真实感与物理;注意 API 计划 2026-09 下线 |
| Veo 3.1 | $0.30–0.75 / 秒 | 8s | ✓ | 音画同步旗舰,最贵,适合有对白的精品 | |
| Runway Gen-4.5 | Runway | ~$0.12 / 秒 | 10s | ✓ | 创作控制与编辑工具最完整 |
| Hailuo / Vidu | MiniMax / 生数 | ¥0.38–0.50 / 秒 | — | — | 国内直连,价格友好 |
本地视频的真实定位不是"省钱",而是"试错自由"。云端按条付费意味着每一次不满意都烧钱,于是你会不自觉地"不敢试";本地出一百条废片也只是多耗几度电。因此对需要大量风格探索、镜头试验的创作场景,本地的价值是把创作心态从"省着用"变成"随便试"。真正要交付的成片,再交给云端旗舰模型精修。
"本地免费"是个误导。真实成本 = 硬件 3 年摊销 + 电费 + 维护工时。下表按你要跑的模型倒推设备档位,并给出全包月成本(按整机 3 年摊销、每天使用 4 小时、电价 ¥0.6/度估算)。
| 档位 | 典型设备 | 整机参考价 | 能跑的代码模型 | 能跑的视频模型 | 全包月成本 |
|---|---|---|---|---|---|
| L0 无独显 | 普通办公本 / 集显 | — | 仅 7B 以下,体验差 | 不可用 | ¥0(直接走云端) |
| L1 入门 | RTX 3060 / 4060(8–12GB) | ¥6,000–8,000 | Qwen-Coder 7B–14B | FramePack、LTX-Video(勉强) | ≈ ¥250 / 月 |
| L2 主流 | RTX 4060Ti / 4070Ti Super(16GB) | ¥10,000–14,000 | 14B–30B MoE | LTX-Video、Wan 5B(480–720p) | ≈ ¥380 / 月 |
| L3 高端 | RTX 4090(24GB) | ¥18,000–24,000 | 32B Q4(Qwen2.5-Coder 32B) | Wan 14B / HunyuanVideo / LTX-2.3 | ≈ ¥680 / 月 |
| L4 旗舰 | RTX 5090(32GB) | ¥26,000–32,000 | 32B Q6 / 70B Q3 | 全量模型舒适区 | ≈ ¥900 / 月 |
| A1 苹果入门 | Mac mini M4 / M4 Pro 24GB | ¥6,000–12,000 | 9B–27B(MLX 4-bit) | 1.3B–2B 勉强,很慢 | ≈ ¥300 / 月 |
| A2 苹果主流 | MacBook Pro / Mac Studio M4 Max 48–128GB | ¥22,000–40,000 | 33B 舒适,70B Q4 可用(~17–22 tok/s) | LTX-Video 2B 可用,10s/1080p 约 4–6 分钟 | ≈ ¥750–1,000 / 月 |
| A3 苹果旗舰 | Mac Studio M3 Ultra 96–256GB | ¥30,000–60,000 | 100B 级量化可跑(~40–55 tok/s) | 可勉强跑视频,但仍受 Metal 生态限制 | ≈ ¥1,200+ / 月 |
* 参考价为大区间估算,受市场波动影响大;全包月成本不含"维护调试工时"的机会成本(首次配置约 3–8 小时)。
* 深蓝 = NVIDIA 路线,灰色 = Apple 路线,橙红 = 高投入档位。数值为全包月成本估算中位数。
以视频场景为例。云端按 Kling 3.0 性价比档约 ¥0.65/秒(≈ ¥39/分钟)计;本地取 L3(RTX 4090)全包 ¥680/月 作固定成本线。
读图:每月生成量低于约 17 分钟(约 100 条 10 秒片)时,云端按量付费更便宜;超过则本地固定投入开始摊薄、越用越省。若改用更便宜的档位(如可灵 2.5 Turbo 约 ¥0.30/秒 ≈ ¥18/分钟),平衡点会右移到约 38 分钟/月 —— 云端越便宜,本地越难回本。
代码场景的盈亏平衡点高得多,几乎摸不到。云端 DeepSeek 类 API 下,一个重度开发者月成本也常在 40 元以内,而本地 L3 档月成本约 680 元 —— 意味着你要每月消耗数亿 token 才能靠省钱自建回本。所以代码本地化的理由应是"隐私 / 离线 / 无限量",而不是"省钱"。
苹果的统一内存架构让它成为一条独特的本地路线:用内存容量换模型规模。但它有一个必须讲清楚的短板 —— 内存带宽低于独显,且视频扩散模型生态(CUDA)对 Mac 并不友好。
| 机型 | 统一内存 | 代码模型(MLX) | 视频模型 | 一句话建议 |
|---|---|---|---|---|
| Mac mini M4 | 16–24GB | 9B 4-bit(25–35 tok/s) | 基本不可用 | 入门跑代码补全够用,别指望视频 |
| Mac mini M4 Pro | 24–48GB | 27B–33B 4-bit | 1.3B/2B 勉强,数分钟一条 | 性价比最高的"代码本地机" |
| MacBook Pro / Studio M4 Max | 48–128GB | 70B Q4(~17–22 tok/s) | LTX-Video 2B 可用 10s/1080p ≈ 4–6 分钟 | 能兼顾代码与轻量视频试验 |
| Mac Studio M3 Ultra | 96–256GB | 100B 级量化(40–55 tok/s) | 可跑,但仍受 Metal 限制 | 要"跑得动超大模型"选它,要视频速度选 N 卡 |
* 柱长表示"能跑的模型规模"(参数条数),非性能。可见苹果以更低价格达到同等模型规模,但速度与视频能力落后。
苹果路线的正确用法:如果你已经拥有一台大内存 Mac(M4 Pro 及以上),把 代码生成 放在它上面跑(Ollama / LMX + Cline),性价比极高;而 视频生成 仍交给云端 API,或另配一张 N 卡。如果你还没买设备、且视频是重点 —— 不要为视频去买 Mac,同预算的 N 卡主机在视频场景快数倍。
把本地与云端放在同一坐标系里打分(★ 越多越强,满星 5)。注意"成本"分为低频与高频两种情形 —— 这正是两条路线的分水岭。
| 维度 | 本地部署(N 卡) | 本地部署(Mac) | 云端 API |
|---|---|---|---|
| 代码质量 | ★★★★★最强 ~70% SWE-bench | ★★★★★同模型规模,速度稍慢 | ★★★★★88%–96% |
| 视频画质 | ★★★★★Wan 2.2 第一梯队 | ★★★★★可跑但慢,细节损失 | ★★★★★Veo / Sora 旗舰 |
| 生成速度 | ★★★★★ | ★★★★★ | ★★★★★并发 + 秒级排队 |
| 成本(低频) | ★★★★★ | ★★★★★ | ★★★★★用多少付多少 |
| 成本(高频) | ★★★★★ | ★★★★★ | ★★★★★线性膨胀 |
| 隐私 / 离线 | ★★★★★ | ★★★★★ | ★★★★★数据上云 |
| 可控 / 可定制 | ★★★★★LoRA / 微调 | ★★★★★MLX LoRA 可用 | ★★★★★仅能调提示词 |
| 上手难度(越低越好) | ★★★★★ | ★★★★★驱动最省心 | ★★★★★ |
| 长期维护 | ★★★★★ | ★★★★★ | ★★★★★平台全托管 |
* 评分为综合公开横评与实测口径的相对判断,非绝对基准;本地分数随模型迭代会持续上升。
对个人与小团队商业生产而言,最优解几乎总是混合:用云端做"高频试错之外的精品与复杂任务",用本地做"高频、批量、涉密"的部分。按投入分三档给方案。
代码:Trae / 通义灵码(免费)+ DeepSeek API 兜底复杂任务。
视频:Kling 3.0 出片、Seedance 2.0 试镜。
月成本通常 < ¥300。
代码:本地 Ollama 跑 Qwen-Coder 14B–32B 做补全与批量重构,复杂任务交云端 Claude / GPT。
视频:本地 LTX-Video / Wan 免费试错,云端 Kling / Veo 交成片。
月成本约 ¥400–800。
代码:本地批量重构 + 云端架构级任务;涉密项目全本地。
视频:本地 Wan / LTX 批量生产候选镜头,云端 Sora / Veo 精修最终 5%。
月成本 ¥700–1,200+。
| 任务特征 | 放本地 | 放云端 |
|---|---|---|
| 高频、单次价值低(补全、批量重构、风格试错) | ✓ 首选 | 边际成本会累积,不划算 |
| 涉密 / NDA / 客户数据 | ✓ 唯一解 | 不合规风险 |
| 低频、高价值(架构设计、最终成片、复杂 Bug) | 效果天花板不够 | ✓ 首选 |
| 需要最高画质 / 音画同步 | 开源仍落后旗舰 | ✓ 首选 |
| 断网 / 出差 / 无稳定网络 | ✓ 唯一解 | 不可用 |
| 需要弹性扩容(一天要 100 条) | 受硬件上限 | ✓ 首选 |
从"硬件现状 → 数据敏感性 → 使用频率"三层依次判断,即可落到具体方案。
代码:Trae / 通义灵码(免费)+ DeepSeek API。视频:Kling 3.0 / Seedance 2.0。月成本可控在 ¥300 内,把预算花在"用得上"的服务上,而不是买个跑不动的卡。
你已经具备本地化的硬件基础,接下来看数据敏感性和使用频率。别急着全搬本地,先按场景拆。
代码:N 卡跑 Qwen-Coder 32B 或 Mac跑 70B(MLX)+ Cline。视频:N 卡跑 Wan 2.2 / LTX-Video。接受"效果低一档、速度慢一些"换取绝对的数据主权。
数据不敏感,就可以自由按"效果 + 成本"最优来分配,混合方案的空间最大。
低于盈亏平衡点,本地固定成本不划算。用云端按量付费,本地只做免费的快速试验与预览。这是最省钱、效果最好的组合。
本地固定成本被摊薄。用本地批量生产镜头与草稿(边际成本≈0),把最终成片交给云端 Veo / Sora 精修最后 5%,兼顾数量与质量。
一句话记住三条判断:① 代码场景,云端 API 在效果与成本上几乎全面胜出,本地只在隐私、离线、无限量上才有意义;② 视频场景,本地开源模型已达云端约八成效果,价值在于"随便试"的创作自由,但成片仍建议云端精修;③ 硬件选择,N 卡是视频的正确答案,Mac 是代码的高性价比答案 —— 若视频是重点,不要为它买 Mac。最终建议:先用云端跑通工作流,等用量稳定、看清边际成本后再决定是否购置本地设备,而不是一开始就为"或许用得上"的算力买单。