8月21日下午,DeepSeek 发布了一个多模态模型:DeepSeek-V4-Flash-Vision-Exp。没有预热,直接开放 API。过去两年社区对 DeepSeek 最大的吐槽就是"不支持多模态",现在这块短板补上了。

但这次值得看的不是"补上了"本身,而是它补到了什么程度,以及整个行业正在把多模态往哪个方向推。

先看官方给出的能力边界

按 AI 博主维克兹对官方文档的首批拆解(公众号"AI维克兹",2026-08-21),这个模型的定位很明确:视觉理解,不是视觉生成。它读图里的文字、界面、图表,再结合用户输入回答,接口是标准的 OpenAI 兼容格式,content 字段从字符串变成了内容块数组。

官方给的基准成绩是三个数字:Terminal Bench 2.1 得83.9,Chartography(图表理解)64.3,AutomationBench(网页自动化)25.7。翻译一下:纯文本能力和 V4-Flash 正式版持平,需要"看图干活"的 Agent 任务大幅提升,官方称多模态 Agent 能力接近 Opus-4.8;但网页自动化仍在早期。(来源:DeepSeek 官方文档,经 KimKB 笔记整理)

官方文档里还有几个工程细节值得注意:支持 JPEG、PNG、GIF、WebP 四种格式,且按文件实际内容判断格式,把 PNG 改名成 .jpg 骗不过接口;图片有细节等级参数,可以控制模型看得多细。这些细节说明它瞄准的不是聊天配图,而是真实业务场景——读截图、提表格、分析图表。

"实验性质"四个字也要单独说。维克兹在拆解里特意强调:官方开放了接口是一回事,官方确认过的能力是另一回事,两者要分开看。基准分是官方自报的,第三方实测还没跟上;自动化任务25.7这个分,也说明官方自己也承认这条线刚起步。对做工程选型的人来说,这个诚实的分寸感反而是可用的信号——官方没吹满,意味着文档里写的边界大致可信。

DeepSeek 多模态官方基准数字卡片

图:官方披露的三项基准成绩,网页自动化25.7分是明确的短板。

行业视角:多模态正从"渲染器"变成"创作者"

单看一次发布,容易低估它的意义。腾讯研究院《协同进化:2026人工智能十大趋势报告》的第二大趋势"多模态认知",给了一个更长的参照系。

报告指出,过去两年多模态的主线是"更逼真",2026年的变化是生成行为本身从一次性输出变成多步决策:模型在生成前先理解意图、规划步骤,再决定画面怎么组织,而不是把提示词机械翻译成像素。

但报告也捅破了一层窗户纸:当前 Agent 化智能存在结构分层,理解和规划主要由语言模型承担,视觉模型在很大程度上仍是执行器。腾讯混元团队做过一组实验:所有模型在隐喻迁移任务里只会做字面替换,抓不住类比关系。也就是说,DeepSeek 这次补的是"眼睛",而整个行业要补的其实是"视觉思维"。

报告还指出了下一道分水岭:记忆。多模态 AI 需要情境性记忆(记住用户的家居环境)、偏好性记忆(学你对光影色彩的口味)、情感性记忆(攒出"共同历史")。今天你反复调过的色调,明天 AI 就忘了——这道坎,DeepSeek 和所有玩家都还没迈过去。

顺带一提,报告里还有一个和视觉直接相关的判断:当 AI 开始自主规划画面、编排叙事,安全对齐就从文本逻辑延伸到了视觉伦理。渲染器只是工具,责任在使用者;但会自己决定"画什么"的系统,性质不一样了。这一条对做 AIGC 内容生产的团队,未来一两年会越来越实际。

对企业的实际意义

把视角拉回选型。这次发布对三类场景的价值是不同的。

读文档、提表格、看报表这类"结构化识图"任务,是它的舒适区,64.3 的图表理解分加上 Flash 级的价格,性价比会很突出。截图问答、界面操作引导这类场景,83.9 的 Terminal Bench 成绩说明有基础,但要看具体框架的适配。至于网页自动化,25.7 分意味着现在押注太早。

还有一个容易被忽略的点:DeepSeek 走的是 MIT 开源路线,这个视觉模型虽然是实验性质,但接口标准、文档齐全。对企业来说,这意味着可以在不锁定任何一家厂商的情况下,把"看图"能力接进自己的 Agent 系统。

为什么 DeepSeek 拖到现在才做视觉?回看它的节奏就明白了:先把文本推理和代码做到极致,建立口碑,再向外扩。V4 系列主打的是长程推理和 Agent 能力,视觉是补齐"感知输入"这一环。顺序其实很务实——一个读得懂截图的 Agent,前提是它先有能力把任务做完,看得懂图但跑不完任务,价值有限。现在 V4 的文本底座站住了,补视觉的时机才成熟。

这个节奏对企业的启示是:评估一家模型厂商的多模态能力,别只看单项基准分,要看它的感知能力长在什么底座上。眼睛是接在大脑上的,底座强,眼睛才有用。

源势AI观点

我们给客户的建议分两层。

短期,现在就可以把图表识别、截图解析这类任务切到 DeepSeek 多模态上做 A/B:Flash 定价意味着试错成本极低,跑通一个场景再谈规模。

中期,不要把"能看图"当成多模态的全部。趋势报告说得很清楚,视觉理解的真正价值是进入决策链路——理解、规划、执行、记忆缺一不可。我们在给客户设计多模态 Agent 时,会把"视觉记忆"单独列为一项需求:用户上次看的图纸、批过的报告,下次要能接得上。这一点目前没有任何模型原生支持,只能靠应用层补齐。

DeepSeek 补上了眼睛。接下来比的是谁先让这双眼睛记住东西。

机械之眼扫描悬浮的照片与图表

图:多模态的竞争重心,正在从生成逼真画面转向看懂并记住。