2026 年 9 月 10 日,DeepSeek 发布的 V4.1-Flash 技术报告里,标题直接定为「Pushing the Limits of KV Cache Compression」。他们把每 token 全局 KV 的大小压到了 890 字节。这比上代 V4-Flash 降了近四倍,相对第一代更是直接降了 437 倍。
百万 token 上下文的成本瓶颈早已变成了塞满显存的 KV cache。V4.1-Flash 在不掉性能的前提下把内存足迹砍到百字节级别。这种做法重写了长上下文推理的成本结构。
算力从来不是长文本瓶颈
长久以来,跑超长上下文最大的噩梦是显卡的 HBM 容量被 KV 缓存瞬间抽干。V4.1-Flash 靠着 FP4 主 KV 缓存的压缩结构,将全局 KV 降到了每 token 890 字节。
单代产品 4 倍的显存占用缩减,直接打破了以往依靠增加卡数来撑起长上下文的窘境。硬件带宽存在物理局限。模型厂商被迫在预训练阶段从底层解耦序列长度与内存消耗。
图:历代 DeepSeek 模型每 token 全局 KV cache 字节数,V4.1-Flash 相对 V4-Flash 降约 4 倍。来源:DeepSeek 官方模型卡
架构为 890 字节让路
为了把成本打到底,DeepSeek 引入了 Causal Encoder-Decoder 架构。40 层 Transformer 对半分给 encoder 和 decoder。decoder 的全局 KV 直接由 encoder 最终隐状态投影而来,不再需要每层单独计算。这也使得其在 prefill 阶段每 token 只需要激活 8B 参数。
注意力机制是长文本的耗时大户。SWA Bounded Replay 技术只重放最近一段 token。这彻底免去了把 SWA KV 持久化到 SSD 的开销。压缩成本的方法是直接把没必要保存的状态从内存里扔掉。
用 8B 激活跑赢闭源 SOTA
1M 上下文的 agentic 评测证明了它的实战能力。V4.1-Flash 拿到了 Terminal-Bench 2.1 的 90.6 分和 DeepSWE v1.1 的 74.2 分。两项数据均超过了 Opus-5.0。其 Codeforces 评分高达 3471,压过了自家的 V4-Pro。
不需要庞大的全量激活,一个 552B 的多模态 MoE 只要能稳住代码和逻辑底盘,就能在终端自动化测试里把闭源前沿模型拉下马。在 scaffold 表现上,V4.1-Flash 结合 mini-SWE 的 74.2 分也展露了小激活配合合适脚手架的实战能力。
图:DeepSeek-V4.1-Flash 与各前沿模型在 agentic 基准上的对比。来源:DeepSeek 官方模型卡
知识储量无法被压缩
效率的提升并不是全方位的,知识密度的缺陷在 V4.1-Flash 身上依然明显。在 SimpleQA-Verified 评测中,V4.1-Flash 只有 42.3 分。这远低于 V4-Pro 的 55.2 分。在纯知识型难题 HLE 上,其 36.8 分也大幅落后于 Opus-5.0 的 56.3 分。
压缩 KV 和降低激活参数能换来惊人的并发吞吐。但知识储备依然遵循物理规律。事实类知识的记忆随总参数量线性堆叠,很难通过底层的架构取巧来弥补。
开发者只看工程手册
在 Hacker News 上,热评第一条直指核心差异。大家更愿意看满是架构细节的 DeepSeek 报告。他们对某闭源实验室系统卡里 70% 的安全审查声明和仅占 20% 的 benchmark 数字不感兴趣。
相比于模型安全审查的宏大叙事,开发者用脚投票选出的,是那些直接告诉你怎么把显存压低四倍、怎么做内存压缩的工程手册。
当一个 552B 参数的模型靠着 8B 的低激活和 890 字节的 KV 占用,在 DeepSWE 上跟 Opus-5.0 正面刚平,长程实战的竞争逻辑已经变了。V4.1-Flash 展示了底层的架构压缩足够支撑顶级 Agent 的运行。只要单卡显存能塞下更多的高智商并发实体,算力就不再是束缚开发的枷锁。
参考链接:
- DeepSeek 官方技术报告
- HN 社区讨论