模型档案 · 2026 年 9 月
DeepSeek V4.1 Flash 参数与价格全解
DeepSeek 用 5520 亿参数的 MoE 把 1M 上下文和原生视觉做到了前沿旗舰模型零头的价位,却在价格页里藏了一个高峰时段倍率——大多数成本估算就是被它翻倍的。
先看结论
标价为每百万 token 输入 $0.15、输出 $0.60,但这是闲时价:工作日高峰时段全部翻倍到 $0.30 / $1.20。缓存命中 $0.003 且不收写入费,没有 Batch 接口,权重以 MIT 协议开源、FP8 约 510 GB。DeepSeek 自测评测称它在智能体任务上反超更贵的 V4 Pro。
完整参数
以下全部是 DeepSeek 官方公布数字,取自本站统一使用的模型数据表。
| 项目 | DeepSeek V4.1 Flash |
|---|---|
| 发布日期 | 2026-09-10 |
| API 模型名 | deepseek-flash |
| 输入(闲时) | $0.15 |
| 输出(闲时) | $0.60 |
| 高峰时段计费 | 闲时价的 2 倍,周一至周五 UTC 01:00–04:00、06:00–10:00 |
| 缓存命中 | $0.003 |
| 缓存写入 | 不收费——前缀缓存自动生效 |
| Batch 接口 | 未提供 |
| 模型结构 | 552B MoE——prefill 激活 8B,decode 激活 16B |
| 权重 | MIT 开源权重(FP8 约 510 GB) |
| 上下文窗口 | 1M |
| 最大输出 | 384K |
| KV 缓存占用 | 890 B/token |
| 数据保留 | 未公布 |
已于 2026-09-19 对照 DeepSeek 官方价格页核对。所有价格单位为美元 / 百万 token。
闲时价与高峰价
工作日 UTC 01:00–04:00 和 06:00–10:00(北京的白天时段)所有价格翻倍,缓存命中也一样。这些窗口之外执行公布价。
| 计费项 | 闲时 | 高峰时段 |
|---|---|---|
| 输入 / 百万 token | $0.15 | $0.30 |
| 输出 / 百万 token | $0.60 | $1.20 |
| 缓存命中 / 百万 token | $0.003 | $0.006 |
作为对照,Claude Fable 5.1 的输入价是它的 67 倍、输出价是 83 倍——查这个词的人真正想要的就是这个坐标。
两列均为官方公布价,2026-09-19 核对;对照数字于 2026-09-14 核对。DeepSeek 没有 Batch 折扣,因此凡是落在那段时间内的用量都会被高峰倍率覆盖。
自己部署
DeepSeek 真正公布了哪些,以及诚实的答案要停在哪。
下载是最简单的一步
权重以 MIT 协议发布,FP8 约 510 GB,协议本身对你拿它提供什么服务不作限制。真正的门槛是体积,不是条款。
大部分参数不激活,仍然是个巨大的模型
prefill 时 5520 亿参数只激活 80 亿、decode 时 160 亿,但整套权重必须常驻高带宽显存。稀疏激活省的是每 token 的算力,省不掉显存——这决定了它是多卡部署,不是工作站部署。
部署方案我们没有验证过
这个模型的卡数、量化选择和吞吐数字,我们都未能亲自复现,所以不会写在页面上。GPU 云厂商宣传的单机方案,同样值得怀疑。等我们真跑通了,分步教程会放在这里。
接入后的三件小事
第一周最容易踩到的三个细节。
两个名字,同一个模型
发布名是 V4.1 Flash,调用时要传的模型名是 deepseek-flash。已下线的 V4 Flash 旧名现在会路由到这里,所以那个「已退役」的标识符至今仍能正常返回结果。
视觉不加价
图像输入是原生能力,并非独立的多模态端点,DeepSeek 也未公布额外的视觉加价——上面那条输入输出价同时覆盖两种模态。
真正要命的是数据保留条款
DeepSeek 未对该模型公布强制保留期;Claude Fable 5.1 则带 30 天保留要求。如果你按合规而不是按价格选型,这条约束会先于上面任何一个数字起作用。
接下来盯什么
这里有两处会变。高峰时段是绝大多数 V4.1 Flash 预算误差的最大来源,流量所在时区一变就要重新核对;而 V4 Pro 这轮下线风波定在 2026-09-14 执行、又在 2026-09-11 被取消——如果你当时按「即将下线」重构了链路,动手改造之前先确认现在的实际路由。