Reddit 用户 PandaBearFred 这周在 r/LocalLLaMA 晒出一次实验:让本地跑的 DeepSeek-V4-Flash 写一个 HTML 动画页面,但 DeepSeek 自己看不到画面,所以他接了一个叫 Muse-Glimmer 的视觉模型,让 DeepSeek 每写一轮代码就把浏览器截图丢过去「挑刺」,再根据反馈修改。整个循环跑了 30 到 60 分钟才停。
值得关心的是:DeepSeek 官方目前没有公开发布过 V4-Flash,这个版本要么是提前泄露,要么是社区自己蒸馏(用大模型的输出重新训练出小模型)出来的。这件事的信号不在于这个动画有多漂亮,而在于「代码模型 + 视觉模型 + 浏览器自动化」三件套,正在被个人玩家拼出来。
这是什么
作者用的是 PI agent —— 一种让多个 AI 模型接力干活的脚本框架,不是 DeepSeek 自家的产品。流程是:DeepSeek 负责写代码,每写完一段就调用本地浏览器渲染(把代码变成可见页面),截图后发给 Muse-Glimmer 看一眼,Muse 回一段「哪里不对」的文字描述,DeepSeek 再改。
这叫多模型协作(multi-agent orchestration),更准确说是「自我批评循环」(self-critique loop)—— 一个模型写,另一个模型挑毛病,写模型再根据意见修改。本质上模拟了人类设计师「画一稿、看一眼、改一稿」的过程。视觉模型在这套玩法里充当了「免费甲方」的角色。
行业怎么看
支持者会说这是开源生态的胜利:不需要等大公司发产品,几个模型拼一拼就能跑出像样的工作流。Muse-Glimmer 这种小众视觉模型也开始被人用起来,说明模型之间的可组合性在变好。
但我们要说几个不太舒服的地方。第一,30 到 60 分钟做一个网页动画,这个速度对企业用是灾难性的;第二,DeepSeek-V4-Flash 没有任何官方背书,模型来源、权重真伪、是否合规都是黑箱,企业 IT 不可能直接拿来用;第三,这种「AI 自己审 AI」的循环会不会陷入死循环或者越改越差,目前没有可靠标准 —— 作者能跑通不代表能稳定复现。
还有一个容易被忽略的事:这件事能火起来,是因为「会自己看」听起来很酷。但它的实际产出只是一段 GIF 动画,距离真正能交付的代码还很远。
对普通人的影响
对企业 IT:开源工具越来越多,但「能跑」和「能上生产」(真正部署到业务里用)是两回事,引入前必须评估来源合规和稳定性。
对个人职场:不必现在就学会搭这套东西,但「AI 不是一个人在干活,而是多个 AI 互相校验」这个思路会越来越常见,理解概念比会操作更优先。
对消费市场:短期内不会看到直接面向消费者的产品,但做设计、视频、自媒体的团队可以留意类似工作流,因为它直接关系到未来内容生产的成本结构。