据MarkTechPost于9月10日报道,DeepSeek AI发布DeepSeek-V4.1-Flash,这是一款支持100万令牌上下文的多模态混合专家模型。报道称,其全局KV缓存占用为每令牌890字节,约为DeepSeek-V4-Flash的四分之一,比DeepSeek-V1小约437倍。模型以MIT许可开放权重,在Hugging Face提供vLLM、SGLang和Transformers路径,并提供低、高、最大推理层级的公共API。

DeepSeek-V4.1-Flash主干参数为5520亿,另有1960亿Engram参数;预填充阶段每令牌激活80亿参数,解码阶段激活160亿参数。其40层主干拆成20层因果编码器和20层解码器。解码器不自行计算全局KV,而通过逐层投影权重从编码器最终隐藏状态推导,提示令牌在编码器阶段停止,预填充计算接近减半。每层仍运行128令牌窗口的滑动窗口注意力,解码器SWA状态通过重放最后128个提示令牌重建。

缓存采用纯CSA2。每个CSA2层静态分配为Full、Reindex或Reuse模式:Full计算主KV、投影索引器K并选取新的Top-512索引;Reindex复用上一Full层的主KV和索引器K,用自己的索引器Q重新打分;Reuse复用主KV和最新Top-K索引并跳过索引器。编码器与解码器层以不同压缩比组合这些模式,解码器的分层稀疏索引器让Full层建立最多16384个位置的候选池,后续Reindex层只对有限集合打分。

主KV缓存量化为E2M1,每16通道一个E4M3缩放,遵循NVFP4但去掉全局缩放,并通过后训练的量化感知训练引入,相比V4的FP8缓存几乎减半存储。部署时,SWA KV不再持久化到SSD,而放在从主机DRAM划出10%构成的分布式池中,TTL为分钟级,全局KV保证72小时生命周期;未命中时只重算128个令牌。模型还引入Single-Pass mHC、融合Mega-mHC内核、Engram条件记忆、DSpark推测解码及head-wise Muon。上下文从4K扩展到1M时,单令牌解码FLOPs仅上升四分之一。

预训练覆盖45万亿多模态令牌,文本与多模态比例为7:1。稀疏注意力从零开始以64K序列长度训练,没有稠密预热,并在34万亿令牌处把上下文扩展到1M。报道称基础模型在世界知识和编码上匹配DeepSeek-V4-Pro-Base,但总参数为其三分之一、激活参数为其四分之一。后训练未引入新算法,提升来自可验证代理任务的大规模合成、跨多种脚手架的强化学习,以及40多个教师的策略蒸馏。

最大努力设置下,Terminal-Bench 2.1得分90.6,V4-Flash为82.7,Opus-5为89.1,GPT-5.6 Sol为88.8;DeepSWE v1.1为74.2,V4-Flash、Opus-5和GPT-5.6 Sol分别为54.4、74.0和73.0。报道称,该模型在这两项评测上超过Opus-5与GPT-5.6 Sol。