8 月 21 日,DeepSeek 悄悄上线了第一个视觉模型 V4-Flash-Vision-Exp。官方说它的多模态(同时处理文字、图片等多种信息)Agent(能自主完成多步任务的 AI)能力接近 Claude Opus-4.8,但 API 价格一分没涨 — 我们注意到,这是中国大模型第一次在多模态实用环节摸到第一梯队门口。

这是什么

DeepSeek 上线的是 V4-Flash-Vision-Exp,一个实验性质(Exp = Experimental,未来可能调整)的视觉理解模型。简单说:DeepSeek 以前只能读字,现在能看图了。

几个关键点:

  • 文本能力没缩水:和纯文本版 V4-Flash 在推理、世界知识等任务上基本持平
  • 视觉是新加的:在需要看图的 Agent 评测(标准化的能力对比测试)上,从原来基本忽略视觉到接近 Opus-4.8
  • 价格和 V4-Flash 一模一样:图片按尺寸换算成 token(模型处理文字的最小单位),一张图最多 384 tokens
  • 支持 JPEG、PNG、GIF、WebP;并发上限(同时处理的请求数)2500;文件 API(上传后可复用的接口)免费

对开发者来说,最直接的变化是:以前做 Agent 时遇到看图场景,得先调一个第三方模型把图转成文字再喂给 DeepSeek,现在可以一个模型端到端(一次调用完成全流程)处理。

行业怎么看

兴奋点很清楚:截图报错识别、UI 设计稿还原、文档结构化这些过去要靠人肉处理的工作,现在理论上可以接进自动化流程。

不过有冷静声音。值得关心的风险是「实验版」三个字 — Exp 是 Experimental 的缩写,意味着 API 接口和参数未来可能调整,现在就拿去做生产环境(正式上线、对用户开放的系统)项目的团队需要做版本兼容。

另一个长期疑虑:多模态模型对算力(GPU 运算资源)的消耗通常高于纯文本模型。DeepSeek 能维持原价更像是阶段性让利,长期成本是否会上行还不确定。官方这次也没公布视频、音频能力,定位明显是「先补齐图像刚需」而非全面对标 Opus。

对普通人的影响

对企业 IT:截图报错识别、扫描件结构化等技术可以接入自动化,但「能接」不等于「接好」,准确率需要内部测试验证。

对个人职场:日常处理大量图片的工种(设计、运营、财务)会最先感受到变化,但能否真的省时间,取决于企业有没有把它接进现有工具链。

对消费市场:消费级 App 短期不会有体感。多模态能力首先落地在企业开发场景,面向普通用户的新产品要等三四个月才会陆续出现。