模型档案 · 2026 年 9 月

DeepSeek V4.1 Flash 参数与价格全解

DeepSeek 用 5520 亿参数的 MoE 把 1M 上下文和原生视觉做到了前沿旗舰模型零头的价位,却在价格页里藏了一个高峰时段倍率——大多数成本估算就是被它翻倍的。

先看结论

标价为每百万 token 输入 $0.15、输出 $0.60,但这是闲时价:工作日高峰时段全部翻倍到 $0.30 / $1.20。缓存命中 $0.003 且不收写入费,没有 Batch 接口,权重以 MIT 协议开源、FP8 约 510 GB。DeepSeek 自测评测称它在智能体任务上反超更贵的 V4 Pro。

完整参数

以下全部是 DeepSeek 官方公布数字,取自本站统一使用的模型数据表。

项目DeepSeek V4.1 Flash
发布日期2026-09-10
API 模型名deepseek-flash
输入(闲时)$0.15
输出(闲时)$0.60
高峰时段计费闲时价的 2 倍,周一至周五 UTC 01:00–04:00、06:00–10:00
缓存命中$0.003
缓存写入不收费——前缀缓存自动生效
Batch 接口未提供
模型结构552B MoE——prefill 激活 8B,decode 激活 16B
权重MIT 开源权重(FP8 约 510 GB)
上下文窗口1M
最大输出384K
KV 缓存占用890 B/token
数据保留未公布

已于 2026-09-19 对照 DeepSeek 官方价格页核对。所有价格单位为美元 / 百万 token。

闲时价与高峰价

工作日 UTC 01:00–04:00 和 06:00–10:00(北京的白天时段)所有价格翻倍,缓存命中也一样。这些窗口之外执行公布价。

计费项闲时高峰时段
输入 / 百万 token$0.15$0.30
输出 / 百万 token$0.60$1.20
缓存命中 / 百万 token$0.003$0.006

作为对照,Claude Fable 5.1 的输入价是它的 67 倍、输出价是 83 倍——查这个词的人真正想要的就是这个坐标。

两列均为官方公布价,2026-09-19 核对;对照数字于 2026-09-14 核对。DeepSeek 没有 Batch 折扣,因此凡是落在那段时间内的用量都会被高峰倍率覆盖。

自己部署

DeepSeek 真正公布了哪些,以及诚实的答案要停在哪。

  • 下载是最简单的一步

    权重以 MIT 协议发布,FP8 约 510 GB,协议本身对你拿它提供什么服务不作限制。真正的门槛是体积,不是条款。

  • 大部分参数不激活,仍然是个巨大的模型

    prefill 时 5520 亿参数只激活 80 亿、decode 时 160 亿,但整套权重必须常驻高带宽显存。稀疏激活省的是每 token 的算力,省不掉显存——这决定了它是多卡部署,不是工作站部署。

  • 部署方案我们没有验证过

    这个模型的卡数、量化选择和吞吐数字,我们都未能亲自复现,所以不会写在页面上。GPU 云厂商宣传的单机方案,同样值得怀疑。等我们真跑通了,分步教程会放在这里。

接入后的三件小事

第一周最容易踩到的三个细节。

  • 两个名字,同一个模型

    发布名是 V4.1 Flash,调用时要传的模型名是 deepseek-flash。已下线的 V4 Flash 旧名现在会路由到这里,所以那个「已退役」的标识符至今仍能正常返回结果。

  • 视觉不加价

    图像输入是原生能力,并非独立的多模态端点,DeepSeek 也未公布额外的视觉加价——上面那条输入输出价同时覆盖两种模态。

  • 真正要命的是数据保留条款

    DeepSeek 未对该模型公布强制保留期;Claude Fable 5.1 则带 30 天保留要求。如果你按合规而不是按价格选型,这条约束会先于上面任何一个数字起作用。

接下来盯什么

这里有两处会变。高峰时段是绝大多数 V4.1 Flash 预算误差的最大来源,流量所在时区一变就要重新核对;而 V4 Pro 这轮下线风波定在 2026-09-14 执行、又在 2026-09-11 被取消——如果你当时按「即将下线」重构了链路,动手改造之前先确认现在的实际路由。

把价格换算成真实开销

单价表说明不了你的月度账单。下面两个入口能把上面的价格变成一个可以争论的数字。

常见问题