DeepSeek 的 Token 消耗刚冲到 8 万亿,但用户撞上同一个坎:它看不见图。开源社区的解法是装一个 Skill(功能插件),把图片先交给千问的识图模型描述成文字,再喂回 DeepSeek——每次两分钱,五分钟装好。这件事折射的趋势是:AI 行业越来越靠"拼"而不是"造"解决问题。

这是什么

DeepSeek 便宜、强,但有一个老问题:它没有"眼睛",处理不了图片。代码报错截图、设计稿、文档插图,过去只能靠嘴描述或手动转文字。

开源社区的解法叫 claude-vision-skill。它的工作逻辑是请一个会识图的模型当翻译——默认用阿里千问的 qwen-vl-max——先把图"读"成文字,再把文字喂回 DeepSeek。整条链路上,DeepSeek 始终在处理文字,只是文字来源变了。

成本:每次约两分钱。阿里云百炼给新用户送 100 万 Token 免费额度,大约够识 7000 张图。装的过程也简单,把 README 路径丢给 Codex,Agent 会自己拉代码、改配置。

行业怎么看

支持方认为这恰恰是 AI 行业最值得看的地方:模型不必全能,组合即能力。DeepSeek 管推理、千问管视觉、Skill 管协调,三个月前还做不到的事,今天拼装就能用。

但我们也得说几件不太舒服的事。

第一,这是一条脆弱的链路。DeepSeek 自己的视觉能力没补上,反而多依赖一个外部模型。如果千问调价、改接口、或者服务不稳定,整条链就断。从"被一家卡脖子"变成"被两家同时卡"。

第二,信息有损。把图压成文字再喂回去,丢掉的是空间、颜色、字体这些视觉细节。改前端、抠细节,这套能"看个大概"但不能"看清"。原生的 GPT-4V、Claude 3.5、Gemini 还是更直接。

第三,为什么大家还在纯文本模型上做文章?成本只是表层,更深层是国内多模态模型在企业里的覆盖度、稳定性、价格组合还有缝隙——这次的拼凑方案能跑通本身,就说明这缝隙还没被填上。

对普通人的影响

对企业 IT:已经在用 DeepSeek 跑业务的中小公司,可以几乎零成本补上"看图"环节,但要接受双供应商依赖带来的稳定性风险。

对个人职场:程序员、前端、运营这类日常和截图打交道的人,能省下大量手动转文字的工夫;复杂视觉任务(设计评审、视频分镜)目前不在这个方案的覆盖范围。

对消费市场:直接影响小,但释放一个信号——AI 工具的"可拼装"会越来越普遍,普通用户早晚要面对"组合使用多个 AI"这件事,而不是用一个大而全的产品。