DeepSeek V4.1 Flash:半万亿 MoE 把推理成本压到两分钱

2026-09-17 开源模型自托管推理

DeepSeek 在 9 月 10 日放出 V4.1 Flash,一个 552B 参数的多模态 MoE,但每次推理只激活 8B(prefill)/16B(decode)参数,上下文窗口 1M token,MIT 协议开源。它在工程上最值得一人公司盯的不是「多大」,而是「多便宜」。

几个关键数字(来自 DeepSeek 自己的评测):

  • KV cache 890 字节/token,而初代 DeepSeek 是 389,000 字节——小了 400 倍以上。这就是为什么它能把长上下文的服务成本压到很低。
  • 在 45 万亿多模态 token 上从零训练;DeepSeek 自测 Terminal-Bench 2.1 得 90.6、DeepSWE 1.1 得 74.2,高于 Opus 5 和 GPT-5.6 Sol。
  • 按 DeepSeek 口径,单任务成本大约 2 分钱

对一个人公司真正有用的点:

  • 本地/小卡也能扛长上下文。 KV cache 暴降意味着同样显存能塞下更长对话和历史,做长文档分析、长代码库问答时,硬件门槛低了一大截。
  • MIT + 开放权重 = 能自己部署。 不想把客户数据送出去的,可以挂到自己机器上,上下文一句不出本地。
  • 2 分钱/任务的量级,让「给每个客户跑一遍分析」「批量处理一堆文档」这种之前嫌贵的动作,可以放心自动化了。

几个要泼的冷水:

  • 数字来自 DeepSeek 自家评测,独立复测还没跟上,先当「上限」看,别当「保底」。
  • 552B 总参数再怎么省激活,跑起来也远不是消费级显卡能轻松扛的;真要自托管得算清显存账。
  • 半年内模型迭代极快,别为了追这个版本专门重构你的推理栈。

我的建议:把它当成「长上下文 + 低成本」的备选底座,用 API 或 OpenRouter 先跑通你的场景再决定是否自托管。重点看 KV cache 优势在你的长文本任务上到底能省多少,而不是盯着 552B 这个总参数。

原文出处 · 事实以此为准
ThursdAI · Open Source Releases
阅读原文 ↗