据雷峰网9月10日报道,DeepSeek V4.1-Flash正式上线,采用因果编码器-解码器架构Causal-Encoder-Decoder、第二代压缩稀疏注意力Compressed Sparse Attention 2以及low、high、max三档可调推理力度旋钮。雷峰网称,这套针对长上下文场景的架构重写使KV缓存暴降437倍,运行时显存占用减少四分之三,落盘长期记忆降至上一代的八分之一,百万Token级超长上下文可进入工业级生产力阶段。

长文本Agent场景中,预填充是最烧钱的环节。上一代DeepSeek V4-Flash使用混合注意力架构,只提升了预填充速度,没有减少读取容量。雷峰网报道称,V4.1-Flash的CED架构可将预填充算力减少一半,服务器硬盘上的持久缓存成本缩减到上一代的八分之一。对调用API的企业而言,原本跑一次深度复杂任务需支付10元算力账单,现在降到1至2元。CED把40层网络分成两部分:前20层用因果编码器通读全部上下文,在隐状态中输出高度浓缩摘要;后20层不再从头读取,而通过投影矩阵从摘要生成全局KV缓存。滑动窗口注意力负责紧盯局部细节,有限回放机制则挑出极少数Token,用近似值还原短期记忆。

如果说CED砍的是上下文计算量,CSA2砍的是上下文存储量。上一代V4-Flash采用CSA+HCA混合架构,每一层都保留完整KV缓存和索引,40层网络会保存40份副本,导致显存爆炸。V4.1-Flash采用CSA2,实现跨层KV复用和跨层Top-K索引复用,让40层网络共用同一个副本。CSA2给每层静态分配Full、Reindex、Reuse三种运行模式:Full通读全部上下文,生成完整KV和索引,筛选Top-K重点条目;Reindex拿Full生成的完整KV缓存在自己层面重新筛选重点;Reuse跳过复杂索引计算直接使用。整个网络中只有极少数层处于Full模式。超长上下文下,分层稀疏索引器让Full模式构建浓缩索引池,后面的层只需在这个小池子里二次检索和打分。V4.1-Flash还采用FP4量化,把长期核心记忆主KV缓存压成FP4格式,短期就近细节SWA-KV缓存保持FP8精度,并在训练阶段引入量化感知训练。CSA2叠加FP4后,全局单Token KV体积压到V4-Flash的四分之一;再叠加CED和SWA有限回放,落盘持久KV缓存降到前代的八分之一。

作为主干参数552B、外挂196B Engram记忆模块的模型,DeepSeek V4.1-Flash运行时输入预填充阶段仅激活8B参数,解码生成阶段仅激活16B。雷峰网报道称,这样的激活规模在核心知识、推理、编码能力上追平自家上一代1.6T参数旗舰V4-Pro,部分内部留出评测甚至实现反超。公开Agent基准中,它在DeepSWE v1.1测试拿到74.2%通过率,超过Opus-5.0与GPT-5.6-Sol;在网络安全智能体测试集CyberGym上拿下开源生态SOTA。长上下文Agent部署成本也进一步降低:全局KV缓存压到V4-Flash的四分之一,落盘持久KV仅剩八分之一;上下文长度从4K拉伸到百万Token,解码计算量仅上涨约25%。

近期唐杰团队发表《Trace as State: Reasoning Traces as Conditional States for Long-Context Transformers》,与V4.1-Flash在宏观思路上相通,都希望避免每一层完整重放全部上下文,通过摘要浓缩、按需调取重点来缓解长上下文压力。但两者实现路径不同:V4.1-Flash是底层网络架构重写,Trace as State属于推理阶段的外部算法,不改动模型权重。雷峰网称,如果CED+CSA2架构骨架被行业广泛借鉴,下一代旗舰大模型未必继续走大一统稠密Transformer老路,更多会是稀疏机制、跨层复用、可控近似策略精细拼装出来的产物。