Flash 模型三方对比 · 2026 年 9 月
Qwen 3.8 Flash 对比 GLM 5.3 Flash 对比 DeepSeek V4 Flash
截至 2026 年 9 月三个最快国产 lab commodity 模型 — 价格、吞吐、编程质量,以及 cheap flash 路由何时胜过 frontier 模型。
TL;DR
GLM 5.3 Flash 最便宜($0.10/$0.20)且 MIT 开放权重。Qwen 3.8 Flash 在 flash 档 SWE-bench 领先(58.2%)。DeepSeek V4 Flash raw 延迟最优(140ms p50)。难 Agent 工作升级到 Fable 5.1。
规格速览
每百万 token 美元标价,截至 2026 年 9 月。
| 指标 | Qwen 3.8 Flash | GLM 5.3 Flash | DeepSeek V4 Flash |
|---|---|---|---|
| 模型 ID | Qwen-3.8-Flash | GLM-5.3-Flash | DeepSeek-V4-Flash |
| 输入价格(每百万 token) | $0.12 | $0.10 | $0.14 |
| 输出价格(每百万 token) | $0.24 | $0.20 | $0.28 |
| Prompt 缓存读取(每百万 token) | $0.02 | $0.02 | $0.02 |
| 上下文窗口 | 1M | 1M | 1M |
| 最大输出 | 64K | 64K | 64K |
| 许可 | 商业 API(阿里云) | 开放权重 — MIT | 开放权重 — MIT |
Qwen 3.8 Flash 跑在阿里云(商业 API)。GLM 5.3 Flash 与 DeepSeek V4 Flash 为 MIT 开放权重,可自托管。
基准对比
Flash 档模型用前沿推理换速度与成本 — 路由生产流量前先 honest 对比。
| 指标 | Qwen 3.8 Flash | GLM 5.3 Flash | DeepSeek V4 Flash |
|---|---|---|---|
| SWE-bench Verified | 58.2% | 52.4% | 49.8% |
| HumanEval | 91.4% | 88.6% | 87.2% |
| 延迟 p50(TTFT) | 180ms | 165ms | 140ms |
| 吞吐量 | 420 tok/s | 480 tok/s | 510 tok/s |
SWE-bench 与 HumanEval 为 vendor 自行报告,截至 2026 年 9 月。延迟在区域边缘节点测量 — 实际结果因环境而异。
flash_models_page.premium_title
flash_models_page.premium_subtitle
何时升级到 Claude Fable 5.1
Flash 模型适合 bulk 路由、草稿与简单编程。当 SWE-bench 差距重要时 — Fable 5.1 每百万 token $10.00/$50.00 达 87.7% SWE-bench(87.7%),flash 档约 50%。将难 10–20% 路由上游。
如何选型
选一个默认 flash lane,失败再升级 — 别全跑 frontier 定价。
高批量 bulk 路由
DeepSeek V4 Flash 510 tok/s、$0.14/$0.28 适合分类、摘要与简单 codegen 规模化。
大陆托管商业 API
Qwen 3.8 Flash 在阿里云,RMB 计费与 mainland 数据驻留。需要 vendor SLA 且不自托管时最佳。
开放权重自托管
GLM 5.3 Flash(MIT)与 DeepSeek V4 Flash(MIT)可在 modest GPU 集群运行。GLM 5.3 Flash 标价最低 $0.10/$0.20。
最低标价优先
GLM 5.3 Flash $0.10/$0.20 输入价低于 Qwen 与 DeepSeek。无差别 batch 工作从这里开始。
难 Agentic 编程需升级
多文件自主 Agent、复杂重构与 frontier 调试属于 Fable 5.1 — 不是 SWE-bench 卡在 50–58% 的 flash 档。
每月 1 亿 token 时,$0.10 与 $10 输入差距真实 — 但 Agent 失败重试的成本也真实。