杭州人工智能公司深度求索9月10日发布DeepSeek-V4.1-Flash,称由多方开展的测试显示,这款开放权重模型在性能、成本、速度和总运行时间上均超过体量大得多的旗舰模型DeepSeek-V4-Pro。
据SiliconANGLE报道,从9月14日起,通过DeepSeek应用程序接口发往V4-Pro的请求将由V4.1-Flash应答,并按小模型的费率计费,直至V4.1-Pro版本发布。V4-Flash和该公司8月推出的实验性视觉模型均已退役,对二者的调用现在落在V4.1-Flash上。
V4.1-Flash是混合专家模型,参数规模5520亿,接近V4-Flash的2840亿的两倍。新的因果编码器—解码器设计使模型在处理提示时仅激活80亿参数,生成输出时激活160亿参数。上月仅在实验版本中提供的图像理解能力,现已内置于模型本身。
工程投入的很大一部分用于压缩键值缓存。据DeepSeek的技术报告,模型以四位浮点格式存储这些条目,全局占用为每token 890字节,约为V4-Flash的四分之一;SSD上的持久缓存存储降至上一代的大约八分之一。
DeepSeek的基准测试表在最高推理强度下将该模型与Anthropic的Claude Opus 5和OpenAI的GPT-5.6 Sol比较。V4.1-Flash在Terminal-Bench 2.1上得分90.6,略高于Opus 5的89.1和GPT-5.6 Sol的88.8。在DeepSWE v1.1软件工程测试中,它解决了74.2%的任务,Opus 5为74%,V4-Pro为62.7%。在GPQA Diamond科学推理基准上,两款美国模型仍然领先。
接口定价方面,非高峰时段每百万未缓存输入token为15美分,每百万输出token为60美分,工作日高峰时段费率翻倍。目前仍在调用V4-Pro的开发者高峰时段每百万输出token需付3.96美元,而V4.1-Flash为1.20美元,因此改道相当于将输出费用削减约70%。
模型权重以MIT许可证在Hugging Face上提供,并已在DeepSeek的网页端和移动应用中上线。DeepSeek表示将与开源社区合作推进推理支持,并探索更多部署方案。
发布当天,Anthropic在最新威胁情报报告中将DeepSeek列为七家中国实验室之一,称其针对Claude开展了蒸馏活动。Anthropic称,7月的14天内有超过1210万次交互归属于DeepSeek。
DeepSeek由中国对冲基金幻方量化孵化。据报道,创始人梁文锋在6月一轮超过74亿美元的融资中出资30亿美元,该轮融资对公司的估值超过500亿美元。