DeepSeek开源V4首个多模态模型,Agent开始“看懂”图片
摘要:DeepSeek开源V4系列首款实验性多模态模型DeepSeek-V4-Flash-Vision-Exp,在V4-Flash基础上加入视觉理解能力,可以同时处理文字和图片,并进一步将视觉能力接入Agent。此次开放的不只有模型权重,还包括Tokenizer、Prompt Encoding参考实现和最小化PyTorch推理实现。
产联社编辑 | 黄钰慧

【产联社】DeepSeek正在给V4补上“看”的能力。8月31日,DeepSeek-V4-Flash-Vision-Exp在Hugging Face上线并开源,采用MIT License。这是DeepSeek V4系列首款实验性多模态模型,在V4-Flash基础上加入视觉模块,使模型能够同时处理文字和图片。相比单纯增加图片理解功能,DeepSeek此次更强调视觉能力与Agent的结合,让Agent能够理解视觉信息,并结合工具继续完成任务。
这距离该模型首次上线DeepSeek API只有10天。8月21日,V4-Flash-Vision-Exp率先登陆DeepSeek API平台,开发者可以通过接口输入文字和图片。此次进一步公开模型权重和相关实现后,开发者除了调用DeepSeek API,也可以下载模型,在自己的环境中部署和开发。
这也是DeepSeek近期围绕V4和Agent连续更新的一部分。从V4-Flash、V4-Pro,到DeepSeek Harness,再到加入视觉能力的Vision-Exp,DeepSeek近期的更新已经覆盖模型能力、Agent运行框架和视觉输入等多个环节。V4首次补上视觉能力
DeepSeek V4的能力边界第一次从纯文本扩展到了图片。
DeepSeek官方将V4-Flash-Vision-Exp定义为V4家族首款实验性多模态模型。该模型建立在DeepSeek-V4-Flash架构之上,通过加入视觉模块并继续训练获得视觉理解能力。
此前V4-Flash主要处理文字,现在Vision-Exp进一步增加了图片输入。
根据DeepSeek官方API文档,V4-Flash-Vision-Exp能够同时接收文字和图片,可以描述图片、读取截图中的文字以及分析图表,目前支持JPEG、PNG、GIF和WebP四种图片格式。
对于企业而言,直接的变化是模型能够处理的信息类型更多了。网页截图、数据图表等视觉内容可以直接作为模型输入,不必局限于文字内容。
不过,V4-Flash-Vision-Exp目前仍带有“Exp”后缀,DeepSeek也明确将其称为实验性多模态模型。因此,更准确的说法是,DeepSeek已经开始把视觉能力引入V4系列,但目前发布的仍是实验版本。
增加视觉能力的同时,DeepSeek也强调保留原有文本能力。官方表示,在Agent、推理和世界知识等纯文本任务上,V4-Flash-Vision-Exp与V4-Flash正式版表现相当。换句话说,这次更新并不是单独做一个“看图模型”,而是在V4-Flash原有能力上增加视觉理解。
多模态能力延伸至Agent任务
相比单纯让模型识别图片,DeepSeek此次更强调的是让Agent获得视觉理解能力。
在DeepSeek的官方介绍中,多模态Agent是此次更新的重点之一。DeepSeek表示,V4-Flash-Vision-Exp能够在不同Agent框架中结合视觉理解和多种工具,以拓展更多实际工作场景。
模型“看懂”一张图片只是第一步,更重要的是Agent能够利用图片中的信息继续完成后续任务。DeepSeek此次公开展示的案例包括在Agent框架下生成商业定制旅行PPT、重新设计DeepSeek Harness网站,以及制作前端动态效果等。
这也是DeepSeek此次测试Vision-Exp时重点衡量的方向。官方表示,与V4-Flash相比,Vision-Exp在需要视觉理解的Agent测试中实现了明显提升,同时保持了相近的纯文本Agent能力。DeepSeek给出的总体判断是,其多模态Agent能力已经“接近Opus-4.8”。
这里的“接近”并不意味着Vision-Exp已经全面超过Opus-4.8。DeepSeek公布的测试结果显示,两款模型在不同任务上的表现并不相同,例如Vision-Exp在部分测试中得分更高,但在Terminal Bench 2.1、NL2Repo等测试中仍低于Opus-4.8。
对于企业来说,比测试分数更值得关注的是Agent增加了一种新的信息输入方式。过去主要依赖文字输入的任务,如今可以进一步加入图片、截图和图表,Agent由此能够处理更多包含视觉信息的工作场景。
从API开放走向模型开源
上线API十天后,DeepSeek进一步把模型权重和参考实现开放给开发者。
8月21日,V4-Flash-Vision-Exp率先上线DeepSeek API。开发者可以直接通过接口调用模型,并进行图文混合输入;图片可以通过Base64、外部URL或Files API三种方式传入。
十天后,DeepSeek又把模型本身进一步开放出来。目前,DeepSeek已经在Hugging Face公开V4-Flash-Vision-Exp模型文件,并采用MIT License。仓库同时公开Tokenizer、Prompt Encoding参考实现和最小化PyTorch推理实现等内容。
API和开源模型提供了两种不同的使用方式。如果企业希望快速测试视觉能力,可以直接调用DeepSeek API;如果拥有相应算力和开发能力,也可以下载模型,在自己的环境中运行并进一步开发。对于一些希望自行管理模型和部署环境的团队,开源增加了另一种选择。
在API使用成本上,Vision-Exp的图片会转换为Token后计费,一张图片最多占384个Token,计费价格与V4-Flash一致。DeepSeek官方定价页面也将V4-Flash-Vision-Exp列为当前API可调用模型。
从API先行到模型开源,DeepSeek实际上给开发者提供了两条路径。希望快速使用的团队可以直接调用API,需要自行部署和进一步开发的团队则可以使用开源模型。
不过,DeepSeek仍明确将V4-Flash-Vision-Exp标注为实验性模型。对于计划将其用于正式业务的企业来说,模型在自身场景中的稳定性、部署条件和实际成本,仍需要进一步测试和评估。
一个月内V4持续补齐能力
Vision-Exp并不是一次孤立更新,DeepSeek近一个月一直在围绕V4和Agent补充新的能力。
7月31日,DeepSeek-V4-Flash正式版API上线公测,官方称其Agent能力得到明显增强,并原生支持Responses API格式。
8月13日,DeepSeek发布V4-Pro正式版,重点升级Agent能力;同一天,DeepSeek Harness进入开发者预览并开放源代码。DeepSeek将Harness定义为连接模型与实际运行环境的一层基础设施,使Agent能够理解环境、使用工具并持续工作。
8月21日,Vision-Exp上线API,V4系列首次加入多模态视觉理解模型;十天后,这一模型进一步在Hugging Face开源。
放在一起看,DeepSeek近期的更新已经覆盖模型、Agent运行框架和视觉能力等不同环节。V4-Flash和V4-Pro持续增强Agent相关能力,Harness负责把模型与工具、会话、运行环境等组件连接起来,Vision-Exp则进一步加入图片输入和视觉理解。
视觉输入不仅增加了一类模型能力,也让Agent能够把图片中的信息进一步用于后续工具调用和任务执行。
不过,这一能力目前仍处于实验阶段。V4-Flash-Vision-Exp最终适合进入哪些企业业务,以及在真实场景中的稳定性、成本和实际效果如何,仍需要后续版本和实际应用进一步验证。
商务合作/报料请联系侯经理 18801065284(微信同号)
特别声明:产联社摘录或转载的属于第三方的信息,目的在于传递更多信息而非盈利,同时并不代表赞成其观点或证实其描述,内容仅供参考。转载信息版权归原媒体及作者所有,若有侵权,请联系我们删除。如其他媒体、网站或个人擅自转载使用,请自负版权等法律责任。



