价格截至 2026 年 9 月核对

三个 flash 模型价格均来自 vendor 标价,截至 2026 年 9 月。基准除非注明均为 vendor 自行报告。

打开成本计算器

Flash 模型三方对比 · 2026 年 9 月

Qwen 3.8 Flash 对比 GLM 5.3 Flash 对比 DeepSeek V4 Flash

截至 2026 年 9 月三个最快国产 lab commodity 模型 — 价格、吞吐、编程质量,以及 cheap flash 路由何时胜过 frontier 模型。

TL;DR

GLM 5.3 Flash 最便宜($0.10/$0.20)且 MIT 开放权重。Qwen 3.8 Flash 在 flash 档 SWE-bench 领先(58.2%)。DeepSeek V4 Flash raw 延迟最优(140ms p50)。难 Agent 工作升级到 Fable 5.1。

规格速览

每百万 token 美元标价,截至 2026 年 9 月。

指标Qwen 3.8 FlashGLM 5.3 FlashDeepSeek V4 Flash
模型 IDQwen-3.8-FlashGLM-5.3-FlashDeepSeek-V4-Flash
输入价格(每百万 token)$0.12$0.10$0.14
输出价格(每百万 token)$0.24$0.20$0.28
Prompt 缓存读取(每百万 token)$0.02$0.02$0.02
上下文窗口1M1M1M
最大输出64K64K64K
许可商业 API(阿里云)开放权重 — MIT开放权重 — MIT

Qwen 3.8 Flash 跑在阿里云(商业 API)。GLM 5.3 Flash 与 DeepSeek V4 Flash 为 MIT 开放权重,可自托管。

基准对比

Flash 档模型用前沿推理换速度与成本 — 路由生产流量前先 honest 对比。

指标Qwen 3.8 FlashGLM 5.3 FlashDeepSeek V4 Flash
SWE-bench Verified58.2%52.4%49.8%
HumanEval91.4%88.6%87.2%
延迟 p50(TTFT)180ms165ms140ms
吞吐量420 tok/s480 tok/s510 tok/s

SWE-bench 与 HumanEval 为 vendor 自行报告,截至 2026 年 9 月。延迟在区域边缘节点测量 — 实际结果因环境而异。

flash_models_page.premium_title

flash_models_page.premium_subtitle

何时升级到 Claude Fable 5.1

Flash 模型适合 bulk 路由、草稿与简单编程。当 SWE-bench 差距重要时 — Fable 5.1 每百万 token $10.00/$50.00 达 87.7% SWE-bench(87.7%),flash 档约 50%。将难 10–20% 路由上游。

如何选型

选一个默认 flash lane,失败再升级 — 别全跑 frontier 定价。

  • 高批量 bulk 路由

    DeepSeek V4 Flash 510 tok/s、$0.14/$0.28 适合分类、摘要与简单 codegen 规模化。

  • 大陆托管商业 API

    Qwen 3.8 Flash 在阿里云,RMB 计费与 mainland 数据驻留。需要 vendor SLA 且不自托管时最佳。

  • 开放权重自托管

    GLM 5.3 Flash(MIT)与 DeepSeek V4 Flash(MIT)可在 modest GPU 集群运行。GLM 5.3 Flash 标价最低 $0.10/$0.20。

  • 最低标价优先

    GLM 5.3 Flash $0.10/$0.20 输入价低于 Qwen 与 DeepSeek。无差别 batch 工作从这里开始。

  • 难 Agentic 编程需升级

    多文件自主 Agent、复杂重构与 frontier 调试属于 Fable 5.1 — 不是 SWE-bench 卡在 50–58% 的 flash 档。

每月 1 亿 token 时,$0.10 与 $10 输入差距真实 — 但 Agent 失败重试的成本也真实。

建模真实成本

用你的 token 结构对比 flash 路由与 Fable 5.1 升级。

常见问题