这是什么
DeepSeek 8 月 21 日上线视觉版 deepseek-v4-flash-vision-exp,与纯文本 Flash 完全同价。第一次把「看图」做到了和「读字」一样的成本。开发者在 API 调用时把模型换成 vision 版本(即视觉识别,让 AI 看懂图片),就能上传图片让它识别内容、回答问题。官方 Chat、DeepSeek Harness、cc-switch(一个统一的模型配置工具,可让 Claude Code 调用不同模型)都已支持,实测响应时间约 4–13 秒。
行业怎么看
开源阵营在视觉理解上一直有短板——Claude Code 至今官方不支持看图,GPT-4o、豆包这类闭源多模态门槛不低,而既开源又能跑的视觉方案几乎不存在。DeepSeek 的意义是:一个与 Flash 同价、几秒响应、能直接挂进 Claude Code CLI(命令行界面)的开源视觉模型出现了,「用得起」和「用得上」第一次同时成立。
但需要观望的地方也有。第一,这是实验性模型(命名里 exp 即 experimental),稳定性和长期可用性待验证。第二,视觉能力压在 Flash 这种中端档位,能吸引开发者流量,但能否扛住企业级高并发(大量用户同时调用)是个问号。第三,对企业来说,真正决定是否切换的,还是延迟、数据合规这些工程化指标,一篇教程解决不了。
对普通人的影响
对企业 IT:如果团队已经在用 Claude Code 或类似工具,下个月可以试把识图任务从 GPT-4o 切到 DeepSeek。按当前报价,每百万 token 的识别成本可能从几美元降到几毛人民币。
对个人职场:可以把自己电脑的 Claude Code 接入 DeepSeek 视觉版,处理发票、截图、表格时不用开第二个工具。前提是你愿意折腾命令行配置,这对非技术背景的人门槛不低。
对消费市场:C 端(消费者端)的免费 Chat 应用里识图早就是标配。DeepSeek 这波更多利好 B 端(企业端)和开发者,普通消费者的日常使用感知有限。