突发!DeepSeek v4视觉模型上线,不仅能做攻略还能识图

潮新闻 记者 张云山

DeepSeek以前是个“偏科生”——文本推理强得可怕,但面对图片只能“两眼一抹黑”。不过,就在今天,这个短板被正式补上了。

今天,DeepSeek毫无预警地上线了V4系列模型矩阵,正式补齐多模态视觉能力。新推出的DeepSeek-V4-Flash-Vision-Exp(视觉实验版)已经可以在API平台调用,手机端的“识图模式”也同步开启。

简单来说,DeepSeek终于补上了短板。

一眼看出猫咪是“银渐层”,识图能力很扎实

潮新闻记者第一时间进行了体验。随手上传一张猫咪照片,模型几乎秒级响应——不仅准确判定品种为英短银渐层,还条理清晰地列出了毛色分布、爪垫颜色、眼线特征等辨识依据,图文理解表现相当扎实。

这背后是全新的多模态架构在支撑。据介绍,V4-Flash-Vision-Exp在纯文本能力上与标准版V4-Flash持平,而在需要视觉理解的Agent任务上实现了大幅跃升。

DeepSeek官网测评数据(网页截图)

更有意思的是,带“Exp”后缀的实验版模型在理解复杂网络热梗时,偶尔还会产生一些可爱的“幻觉”——但这恰恰证明它的多模态推理链条已经全面打通,不再只是机械的图片描述,而是开始结合视觉信息进行“思考”。

不只是“看图说话”,它真的能帮你干活

多模态能力的补齐,意味着DeepSeek能解锁更多实用的工作场景。DeepSeek官方梳理了几个典型应用,可以说相当实用。

DeepSeek官网突发新模型(网页截图)

高端定制PPT,你可以直接告诉它:“帮我做个西藏攻略的PPT,藏南+藏北,一个月自驾游,高端定制,核心调性是野性、原始、探索感,不要小清新。” 它就能生成一整套包含真实摄影风格配图、三种定价方案的大气PPT,专门发给高净值客户。

还可以给网站二次创作,给它一个网页,让它用“黑蓝深海、玻璃UI、ASCII原子像素”的风格进行重设计,经过多轮交互,就能重构出一个未来主义风格的开发者网站。

还能生成动态特效Demo,可以让它在一群可爱的3D黏土小怪物加入复古舞池派对的灵感下,直接生成一个前端动态特效的Mini Demo。

以前用AI做这些事,得先请“文生图”模型帮忙,再把图喂给大模型,流程繁琐。现在,DeepSeek一站式搞定。

对于开发者来说,这次更新同样有干货。V4-Flash-Vision-Exp的API已经开放,支持Chat Completions、Messages、Responses三种调用格式,图片可以转成token计费,一张图最多只占384 tokens,价格与标准版一致。

DeepSeek同步上线了免费的Files API。开发者可以先把图片上传到平台,在请求中通过file_id引用,同一张图在多个请求里无需重复上传,既能节省带宽,也让调用效率更高。

巨额融资之下,DeepSeek加强视觉识别能力

在AI大模型竞争日益白热化的当下,纯文本模型的差距正在被拉平,多模态理解能力成为决定“第一梯队”排位的关键变量。DeepSeek此前的文本推理能力有目共睹,但在“视觉”这一环确实慢了半拍。

此次V4视觉实验版的推出,标志着DeepSeek正式补齐了这块短板。虽然目前还是实验版本,带有一丝“玩具”属性,但它展示出的能力演进方向已经非常清晰:从“最强大脑”走向“明眸善睐”,从单一的文本交互走向更复杂、更真实的物理世界模拟与操作。

对于普通用户来说,意味着未来可以用更自然的方式跟AI交流——拍张照问问这是什么、让AI看着图片帮你改设计、做方案;对于开发者而言,则意味着Agent应用的场景边界被进一步拓宽。

“转载请注明出处”

责任编辑:杨业