这周 Reddit 的 LocalLLaMA 社区做了一场看起来很不正经的测试:让 5 个大模型各自用一份 HTML 文件写出皂液器(Soap Dispenser,往下压出洗手液的那个小机器)的工作动画。看似手痒的点子,背后是把"AI 写前端代码"这件越来越日常的事,放到一道贴近生活的题面上。

这是什么

测试由用户 Foxiya 在 r/LocalLLaMA 发起,规则只有一条:输出一份完整 HTML 文件,能播放皂液器按压出液、机械回弹的全过程。参赛的 5 个模型分别是 Opus 5.5(高推理档)、DeepSeek V4.1 Flash、Qwen 3.8 Max、ChatGPT 5.6 Sol(高推理档)和 Opus 5(高推理档)。

结果以视频并排呈现,没有统一评分,交给评论区投票。我们观察到几个现象:中国两个模型在动画流畅度和物理逻辑上追得很紧,没出现明显掉队;而高推理档相比标准档,并没有拉开厂商宣传里那种量级的差距。

行业怎么看

支持这种"日常题"的开发者不少,原帖高赞评论是"我们不靠 AI 拿金牌,要靠它帮我写一个能跑的页面"。在他们看来,AI 写代码如果连按压出液的动效都讲不清楚,把 Agent(能自主执行多步任务的 AI)吹上天也没意义 — 基础体感过不去,上面盖再多故事都不稳。

但从业者里也有冷静的声音。一位长期跟踪模型评测的人提醒,单题评估不能反映综合工程能力,HTML 动画本质上是"会动就行"的视觉判断,主观成分大。更现实的看法是:这是一面有趣的镜子,但不是选型依据,别把社区投票当成老板的采购参考。

对普通人的影响

对企业 IT:现在 Agent 类基准已经多到看不过来,真正能在采购环节区分模型高下的,是这种"业务上一句话需求"的落地能力,建议把评估清单里的"真实小任务"做厚。

对个人职场:非程序员写一个简单网页、产品动效、PPT 动画的门槛正在快速消失,决定产出差距的正在从"会不会写"变成"问得清不清楚"。

对消费市场:个人 AI 助手正在从"问答工具"过渡到"动手做东西"的阶段,未来一年里主流产品大概率会陆续上线"一句话生成小应用"的功能。