这是什么

上周,开源项目 gemma4.c 用 700 行 C 代码在普通 CPU 上跑动 Google 的 Gemma 4 E2B,生文速度 25.9 token/s,超过行业标杆 llama.cpp。这意味着什么?我们认为,AI 推理层的工程门槛正在急速下降,过去必须大团队做的工作,现在一个懂底层的人就能写出来。

项目由开发者 Ryan Ssenn 写成,单个文件包含分词器(tokenizer,把文字切成模型能识别的最小单位)、Transformer 主结构(所有大语言模型的核心计算模块)、KV 缓存(推理时缓存已读过的内容以加速生成)、采样逻辑和 CPU 加速指令。在他的 Ryzen 7 7700 上,预填充(prefill,把整段输入一次性喂给模型)阶段跑出 639 token/s。作者明确强调,这是为了读懂模型而写的学习项目,并非生产工具。

行业怎么看

一件被多数中文媒体忽略的事:Gemma 4 E2B 是 Google 几个月前才发布的新模型。三年前把同类模型跑起来至少要 PyTorch + Transformers + 多个优化库加一支工程团队,现在一个文件一个人。这意味着推理层在急剧商品化,工程溢价正在被摊薄。

但我们也得提醒几种不同的声音。第一,「比 llama.cpp 快」的结论建立在单一 CPU、单一模型、int8 量化(把参数精度从 16 位压到 8 位以提速,会损失少量质量)下,缺乏跨硬件复现;第二,llama.cpp 是全球开发者多年迭代的工程基础设施,单人 demo 离「稳定服务真实用户」还差几个数量级;第三,这个项目的能力上限取决于它跑的那个模型——真正的差距仍在模型层,推理层只是中间环节。把它当成「AI 已经变得很简单」的证据,有过度解读的嫌疑。

对普通人的影响

对企业 IT:自托管(把模型部署在公司自己的服务器上)的硬件与人力门槛继续下降,中型企业以前不敢想的私有化部署正在变得可行,但落地仍取决于数据合规与运维能力,而不只是技术上能否跑通。

对个人职场:还把「我不懂 AI 底层」当借口的窗口越来越窄——这个 700 行文件读一遍,就能给非技术管理者建立真正可用的判断力。

对消费市场:本地化 AI 应用会更密集出现,手机、PC 上的离线助手和隐私优先的工具会变多,但短期内还属于尝鲜阶段,不会替代云端方案。