这是什么

本周,开发者 tomtsai28 在 GitHub 开源了项目 PULSAR-ASM:一个用纯 x86-64 汇编(直接面向 CPU 的底层编程语言)写的 Gemma-2B 推理引擎。Gemma-2B 是 Google 发布的 20 亿参数开源大模型。整个二进制文件只有 5.2 KB —— 不到一张照片的 1/10。没有 C/C++ 运行时,没有 PyTorch,只调用 CPU 自带的 AVX2 和 F16C 指令集(可以理解为 CPU 内置的并行计算加速模块)。

性能数据:在 2010 年代的老款四核 i5 台式机上,达到 4.5–4.7 tokens/秒的生成速度、18.5 GB/s 的内存带宽。作者明确说,这不是一个要替代 llama.cpp(目前主流的开源本地大模型推理工具)的产品,而是个「第一性原理探索」——探索现代 Transformer 架构能被压缩到什么程度,最终目标是为资源极有限的微控制器(MCU)和数字信号处理器(DSP)做参考实现。

行业怎么看

这件事值得编辑部放在更大的趋势里看:过去两年,AI 推理的重心正从云端 GPU 集群,向边缘设备(靠近数据源的本地设备,如手机、摄像头、传感器)扩散。苹果、高通、联发科都在把 NPU(神经网络专用处理单元)塞进消费级芯片,Llama、Phi、Gemma 系列模型也在快速瘦身。5KB 这个数字是个极端但有意义的信号:模型推理的「物理下限」远比想象的低。

但行业看法不是一边倒。反对意见集中在两点:第一,4.6 tokens/秒意味着生成一段 100 字回复需要 20 秒以上,对绝大多数交互场景都不实用;第二,5KB 是高度特化的 x86 汇编代码,移植到 ARM 架构或新 CPU 上几乎要重写,工程成本远高于直接用 llama.cpp 部署。此外,这类极简项目高度依赖单一开发者的维护热情,没有商业支持背书——企业若直接采用,面临「作者弃坑 = 项目死亡」的隐性风险,这在我们看来是被低估的一点。

对普通人的影响

对企业 IT:试点 AI 项目的硬件门槛在降低。一台退役的办公电脑可能就够跑 20 亿参数模型做内部知识库问答,不必一上来就采购 GPU 服务器或调用云 API。

对个人职场:短期内你不会在自己的电脑上感受到变化。但这条路径成熟后,律师、医生、分析师的私有本地 AI 助手可能不再依赖云服务,敏感数据不必上传。

对消费市场:家电、汽车、工业传感器里「塞个小模型」会越来越常见。下次你看到一台冰箱说自己「AI 识别食材」,背后可能就是这种极简推理引擎的某种工业化版本。