你有没有过这种时刻?对着一张设计稿截图,想让AI帮你转成代码,它却说"我看不到图片"。
你有没有过这种时刻?做PPT找素材,想让AI帮你分析竞品海报的配色和布局,它只能给你一堆文字建议。
你有没有过这种时刻?让Agent自动跑任务,每一步都需要人工确认屏幕上的内容,根本谈不上真正的自动化。
这些尴尬,在昨天晚上正式成为历史。
2026年8月21日,DeepSeek正式上线了他们的首个多模态视觉理解模型——DeepSeek-V4-Flash-Vision-Exp。
名字很长,但核心信息很简单:V4-Flash,终于"长眼睛"了。

不是加了个看图功能,是把多模态直接做成了标配
很多人以为,多模态模型就是在原来的文本模型基础上"加了个看图功能"。
不是的,DeepSeek这次做的事情,是把视觉能力完全融入了V4-Flash的体系里。
官方数据显示,在七项Agent评测中,加了视觉的V4-Flash-Vision-Exp有六项都超过了纯文本版的V4-Flash-0731。
这意味着什么?
意味着你接了视觉能力,文本能力不仅没下降,反而更强了。
这不是简单的功能叠加,是能力的协同进化。
更狠的是调用方式。开发者只需要把model参数改成'deepseek-v4-flash-vision-exp',立刻就能用上视觉能力。不用换接口,不用学新文档,不用调整现有代码逻辑。
支持Chat Completions、Messages、Responses三种格式调用,不管你用哪种开发框架,都能无缝接入。
图片输入也准备了三条路:base64内联、外部URL、Files API。其中Files API同步开放,完全免费。传一次之后用file_id引用,同一张图不用重复上传。
对那些需要反复看同一张设计稿、同一份报表、同一个页面截图的Agent应用来说,这省下的是每一轮对话的往返成本。

不是25倍差价,是两种完全不同的产品哲学
真正炸掉开发者圈子的,不是模型能力本身,而是定价。
一张图片最多折算384个token,计费价格与V4-Flash完全一致,一分钱不加。
在别家要单独收费的多模态能力,在DeepSeek这里直接变成了标配。
让我们算一笔账。根据TokenMix的视觉API横评数据:同一张1024×1024的图片,Claude Sonnet 4.6要吃掉1334个token,一千张图收费约4美元;GPT-5.4 Vision是765个token,约1.9美元;Gemini 3.1 Pro是258个token,约0.5美元。
折成人民币,最贵的那档接近29块钱。
DeepSeek呢?384个token封顶。
V4-Flash的输入价格是3元/百万token,低谷时段还打五折。算下来,同样处理一千张图,DeepSeek的输入成本只有1.15元,谷时更是不到6毛钱。
29块和1块1,差了25倍。
放到低谷时段,直接差了50倍。
你以为这只是便宜?
不是的,一千张图三十块和一千张图一块钱,本质上是两种完全不同的产品设计哲学。
前者你得精打细算,想清楚"这一步到底要不要让AI看",看一张图都是成本;后者你可以让Agent每跑一步都截个屏,每做一个决策都先"看一眼"当前状态,视觉不再是奢侈品,而是像呼吸一样自然的基础能力。
这才是真正的想象空间所在。

从看截图到写代码,实测效果到底怎么样?
光说价格不说效果,那是耍流氓。我们看看实测表现。
有人丢给V4-Flash-Vision-Exp一张OpenAI官网的截图,让它1:1复刻成可运行的单文件HTML。要求很苛刻:先逐块描述布局结构、字体、主色色值、间距节奏,再写代码;所有文案照抄;还原hover态、滚动渐入、按钮质感;375px窄屏下不能崩。
这活儿难在哪?难在它不只是"认出图里有什么",而是要把一张二维图像拆解成布局系统、色彩体系、排版节奏,再一行行翻译成可运行的代码。
结果呢?复刻出来的网站几乎一模一样。
还有人给了一句模糊的需求:帮我做个精品咖啡烘焙工坊的B端合作PPT,只做浅烘单品豆,不做拼配不做商用豆,五公斤起订。调性是手作、较真、有点固执,不要行业黑话,要谈每支豆子烘了几遍才定下曲线。视觉风格要粗粝有材质感,像印刷品不是PPT。
V4-Flash-Vision-Exp直接输出了一份11页的B端提案。浅烘单品豆、五公斤起订、三档供货方案,一个都没落下。更难得的是分寸感——全篇没有一句行业黑话,没有一句写给外行看的科普,完全是跟独立咖啡馆主理人对话的专业语气。
一句模糊的自然语言需求进去,一份能直接发给客户的成品出来。
这才是多模态真正该有的样子。
多模态Agent能力在AgentBenchmark上已经接近Opus-4.8的水平,这是什么概念?就是你之前需要花大价钱用顶级闭源模型才能做的视觉推理任务,现在用一块钱一千张图的成本就能跑了。

八天补完最后一环,Agent时代的基础设施铺好了
回头看DeepSeek最近的节奏,你会发现这不是一次孤立的产品更新。
8月13日,DeepSeek Harness开源,原生支持Responses API——Agent的运行时,铺好了。
8月21日,视觉模型上线,同样支持三种调用格式——模型的输入端,铺好了。
同一天,Harness跟着发布0.1.1版本,开箱即支持新模型,适配代码一行不用写。
八天时间,从运行时到感知能力,Agent开发需要的基础设施全部就位。
这时候你再回头看那个定价,就更有意思了。为什么DeepSeek敢把视觉能力卖得这么便宜?
因为他们要的不是靠API赚差价,他们要的是让开发者毫无顾虑地在自己的平台上构建Agent应用。当看图的成本低到可以忽略不计,真正的创新才会爆发。
当每一步操作都能"看"到屏幕反馈,当每一份文档都能直接"读"取内容,当每一个设计稿都能瞬间"理解"并转成代码,AI Agent才真正从"高级聊天机器人"进化成"能干活的数字员工"。
你说,这一天还会远吗?
我们正在见证的不是一个模型的更新迭代,而是一个新时代的开启——在这个时代里,AI不再是只能处理文字的"瞎子",它能看见这个世界,理解这个世界,最终改变这个世界。
而这一切的起点,就是一张图一厘钱的价格。