本周 Hugging Face 上出现了一个有点疯狂的实验:开发者 @physicsrob 把经典射击游戏 Doom 的渲染算法,编译成了 210 亿参数的 transformer 权重——没用任何训练数据。听起来像玩笑,但他真的把完整模型上传到了 Hugging Face,每生成一帧画面需要 40 分钟。

这是什么

具体做法是:他写了一个叫 torchwright 的编译器,把 Doom 的渲染逻辑直接翻译成 transformer 的权重——即神经网络里决定模型行为的参数。整个过程没有用到一块显卡的训练数据,权重是数学推导出来的。

实际运行时,用户向模型输入关卡地图、玩家位置和视角方向,模型会逐 token(模型的最小输出单元,这里相当于一条绘图指令)吐出绘图命令,再由一个 43 行的宿主程序把命令还原成画面。320×200 分辨率版本是 210 亿参数、85.87 GB,每一帧需要 3,614 token 的提示加上 53,747 token 的生成。他还放出了一个 80×50 低分辨率版本,只需要 34 GB 显存。

行业怎么看

本地 AI 社区 r/LocalLLaMA 上反应两极。支持者认为这是一个漂亮的概念证明:transformer 可以被当作通用计算平台使用,不只是聊天或者写代码。但反对声音也很直接——同样的画面,传统 GPU 渲染只要几毫秒,这里却要 40 分钟,实用性为零。作者自己也承认,目前需要 fp32(32 位浮点)精度权重,还不能量化(即压缩成更小、更快的低精度版本),并且他自己还没在本地跑过。

更冷静的看法是:这是一个「Doom 跑在 Excel 上」级别的智力游戏。它说明 LLM 架构的灵活性,但并没有改变任何商业现实。

对普通人的影响

- 对企业 IT:几乎没有影响。这是研究型演示,不是产品方向。
- 对个人职场:值得记住一件事——「AI」这个词的边界在变宽。同样是让 Doom 跑起来,过去叫图形编程,现在叫「AI 推理」。下次碰到用 AI 包装的复杂功能,可以多问一句它到底新在哪。
- 对消费市场:短期内不会带来任何变化。除非你愿意为了一帧等 40 分钟。