据SiliconANGLE报道,中国初创企业DeepSeek于8月21日发布了其V4系列大语言模型的新成员——V4 Flash Vision Exp,这是一个多模态模型,在部分视觉基准测试中超过了Anthropic的Opus 4.8。
上线初期,该模型仅在DeepSeek付费开发者平台提供。由于DeepSeek此前已开源包括V4 Flash在内的多款早期模型,公司未来可能发布免费版本。V4 Flash Vision Exp基于4月发布的V4 Flash模型构建。DeepSeek对比了两代模型在七项文本基准上的表现,除Cybergym(测试模型发现软件漏洞的能力)外,V4 Flash Vision Exp均优于前代。在图像分析方面,模型改进最为显著:在四项视觉测试中,两项得分提升超过10%。尤为突出的是,V4 Flash Vision Exp在ALE和ZeroBench两个视觉基准上击败了Anthropic的Opus 4.8。ALE包含超过1000项多步任务,要求模型与应用程序交互、编写代码并解析媒体文件;ZeroBench包含100项极具挑战性的图像分析任务。
关于模型架构,DeepSeek未公布细节,但其Hugging Face页面提供了基础模型V4 Flash的详细概览。V4 Flash是混合专家模型,总参数2840亿,由多个各含130亿参数的神经网络组成。用户输入提示时,模型仅激活最适宜生成答案的神经网络,相比激活全部网络可显著降低硬件需求。语言模型通过KV缓存存储回答提示所需的信息,V4 Flash采用HCA和CSA两种技术压缩KV缓存。据SiliconANGLE报道,这些技术可将处理100万token的算力需求降低73%。
DeepSeek使用32万亿token的数据训练V4 Flash,并采用Muon算法加速训练流程。Muon减少了校准模型隐藏层所需的时间,而隐藏层承担了回答提示时的大部分计算。4月,DeepSeek还发布了参数数量为V4 Flash五倍以上的V4 Pro。鉴于V4 Flash Vision Exp源自V4 Flash,未来V4 Pro也可能成为针对图像分析等任务优化的专用模型的基础。