DeepSeek 这周上线了多模态实验版 deepseek-v4-flash-vision-exp,每百万 token 输入最低 0.05 元 — 这个价格意味着图像理解和文本理解第一次同时进入国产最低档位。但我们更关心的是它能干什么、差在哪。

这是什么

这是 DeepSeek 首次官方支持图像输入。技术上,图片按尺寸换算成 token,和文本 token 一起计费;格式上 JPEG、PNG、GIF、WebP 都支持。最大变化是接入门槛极低:已有用户只需把模型 ID 换成 vision 版,就能在 Codex、Claude Code、WorkBuddy、WeSight 等 Agent 工具里直接调用,等于补齐了它在 Agent 生态里一直缺的一块拼图。

行业怎么看

社区对这次更新整体是欢迎的。DeepSeek 文本能力口碑一直不错,但不支持图像让很多 Agent 场景被卡住,第三方插件也只能绕路。质疑和风险也存在:第一,「视觉版」目前是实验模型,命名带 -exp,未走完整版本路线,长期是否保留存疑;第二,实测让模型复刻 GitHub 页面,结构识别准确,但像素级还原明显不如字节 K3;第三,价格虽然低,但 v4-flash 是涨价后才进入这个区间,社区普遍希望「降回去」。

对普通人的影响

对企业 IT:多模态 API 价格门槛降到百万 token 几分钱,OCR、截图搜资料、UI 复刻这类内部工具的开发预算会被明显压缩。对个人职场:写代码、看截图、报销录入这些活,Agent 第一次能在一个国产模型里全程跑通,不再需要「OpenAI 看图 + 国产写文本」的拼接。对消费市场:短期内 C 端用户感知不大;真正落地要看后续笔记软件、客服 SaaS 接不接这个模型。