8月21日,DeepSeek推出实验性多模态模型deepseek-v4-flash-vision-exp。该模型在保持DeepSeek-V4-Flash文本能力的基础上新增视觉理解能力,可处理图片输入,并已上线DeepSeek API平台,开发者可通过设置model参数访问。DeepSeek Harness 0.1.1版本同步加入对该模型的原生支持。

据爱范儿报道,DeepSeek官方介绍,这一模型旨在提升多模态Agent任务表现,其文本能力、Agent能力、推理能力以及世界知识均与V4-Flash保持一致。在多模态Agent基准测试中,该模型相比V4-Flash有明显提升,表现接近Opus-4.8等高端模型。模型支持混合文本和图片输入,图片可通过Base64、外部URL或Files API方式提供,并可通过Chat Completions、Messages以及Responses API调用。

API价格延续V4-Flash的计费体系。输入和输出均按token计算,图片会根据尺寸转换为token,每张图片最高换算为384 tokens。缓存命中情况下,输入价格空闲时段为每百万tokens 0.05元,高峰时段为0.10元;缓存未命中时,空闲时段为1.5元,高峰时段为3元。输出价格空闲时段为每百万tokens 4.5元,高峰时段为9元。高峰时段为北京时间每天9:00至12:00和14:00至18:00。

同期发布的Files API允许开发者先上传图片文件,通过file_id在不同请求中引用同一文件,避免重复上传。该接口支持JPEG、PNG、GIF和WebP格式,单文件最大64MiB,单用户存储空间为25GiB,最多可保存10000个文件。这一能力适合需要长期复用图片素材的Agent工作流。

爱范儿在测试中使用该模型生成了商业定制西藏自驾游PPT,并对DeepSeek Harness官网进行了二次创作。此前,DeepSeek Harness在0820更新中曾增强多模态支持度,但默认使用的DeepSeek-V4-Pro模型不支持图片输入,导致整理图片时报错。此次发布的视觉模型弥补了这一缺口,使Harness能够调用视觉模型处理图像。

多模态能力是Agent处理真实任务的基础。DeepSeek通过视觉模型、Files API和Harness生态,将图片理解接入现有Agent工作流,使办公中的截图读取、文档分析,开发中的界面识别、错误分析,以及内容生产中的素材辅助成为可能。