9 月 10 日,DeepSeek 正式发布 V4.1 Flash。如果说过去一年国产开源模型的主旋律是"追平闭源",这一次的叙事则变成了"用成本把高端 AI 的门槛砸穿"。

一份"反常"的架构

V4.1 Flash 不是简单的参数堆量。它采用了一套被称为 CED(Causal Encoder-Decoder,因果编解码) 的非对称结构:一个 20 层的因果编码器喂给一个 20 层的解码器。模型整体挂着一个 5520 亿(552B)参数的主干,但巧妙之处在于——预填充(prefill)阶段每 token 只激活约 80 亿(8B),解码(decode)阶段激活约 160 亿(16B)

换句话说,它用"大底座 + 小激活"的思路,把推理时的实际算力开销压得很低。配合全新的 CSA2(Compressed Sparse Attention 2,压缩稀疏注意力) 与 FP4 KV 缓存,全局 KV 缓存被压缩到约 每 token 890 字节,大约是上一版 V4-Flash 的四分之一,命中价最低可到 每百万 token 0.003 美元

几组硬指标

  • 训练规模:从零训练于 45T tokens;
  • 推理力度:可在 1–100 之间连续可控,按需调节"想得多深";
  • 许可:MIT 协议开源,这意味着商业友好;
  • 基准(第三方口径):Codeforces 评分约 3471、DeepSWE v1.1 约 74.2%、Terminal-Bench 2.1 约 90.6%。

对普通用户最直观的感受是"生成更快了",对开发者则是"调用更便宜了"。在高端模型动辄按百万 token 计价、闭源厂商忙着筑定价护城河的背景下,DeepSeek 再次把性价比拉满。

硬币的另一面

参数从 284B 跳到 552B,本地推理社区的反应并不全是欢呼。更大的模型意味着消费级硬件更难跑起来——一颗此前还能勉强在高端显卡上运行的模型,体积翻倍后直接把不少人挡在了"本地部署"的门外。

这也是开源与易用之间长期存在的张力:模型越强,对硬件的要求越高。DeepSeek 显然把重心放在了"服务端低成本",而把本地运行的包袱留给了社区和量化方案。

意味着什么

多家媒体在评述中都提到同一个判断:国产开源模型正把高端 AI 的准入门槛拉到尘埃里。当模型层、生态层、资本层同时向中国厂商集中,硅谷闭源巨头赖以生存的"定价护城河"会被快速侵蚀。

对开发者而言,这未必是"谁取代谁"的故事,而更像一个信号:在性能差距逐步收窄的今天,成本与可用性正在成为大模型竞争的新主战场。V4.1 Flash 的价值,不在于它比谁多考了几分,而在于它让"用得起"的边界又往外推了一大步。