这周我们注意到一个不太起眼但很有意思的数字:开发者 shifu_legend 用纯 C99 写了一个零依赖(即不依赖任何第三方库)的推理引擎,在 Intel 至强 CPU 上跑 BitNet b1.58-2B-4T 模型(一种把参数压缩到1.58位的极简大模型),达到了每秒 36.25 个 token 的生成速度。BitNet 的核心思路是把每个参数只用 -1、0、+1 三种值表示,模型体积大幅缩小,原本必须靠显卡跑的 20 亿参数模型,现在普通服务器 CPU 也能扛。
这是什么
简单说,这是在「让大模型脱离显卡」这条路线上的一个工程突破。几个关键技术点:第一,作者没装任何深度学习框架,从头用 C 语言写了 4-bit 打包的 SIMD(单条指令处理多个数据,CPU 的并行加速方式)计算内核,直接在 AVX-512 指令集上做整数运算,跳过了把权重还原成浮点数的步骤。第二,整个程序编译出来就一个二进制文件,对外提供与 OpenAI 兼容的 API 接口,意味着任何调用 GPT 的代码几乎零修改就能切到本地跑。第三,也是最关键的瓶颈:单条推理的速度卡在内存带宽上,而不是计算速度本身——他们已经吃到了理论带宽的 95%。
行业怎么看
支持的声音认为,这件事的意义不在于「CPU 比 GPU 快」,而在于部署成本的断崖式下降——一台普通服务器就能跑出一个能用的对话模型,对中小企业和本地化部署是实打实的福音。开源社区已经在 GitHub 上讨论如何在 ARM 和 AMD Zen 架构上复现这个性能,毕竟苹果芯片和主流服务器 CPU 都不在英特尔的指令集生态里。但也有人泼冷水:36 token/秒是 batch size 为 1(一次只处理一个请求)的情况,一旦并发请求上来,CPU 方案的延迟抖动会比 GPU 方案差很多;而且 1.58 位模型的能力上限还没被充分验证,目前看起来更像是「能对话」而不是「能干活」。我们认为,这个项目的真正价值是证明了推理优化还有大量底层红利没被吃透,而不是「显卡要卖不出去了」。
对普通人的影响
对企业 IT:如果你的公司想本地部署一个不传数据的对话 AI,又不想买昂贵的显卡服务器,现在有了「CPU 也能跑」的新选项,硬件预算可能从十万级降到几千块。
对个人职场:目前还不用急——36 token/秒的体验接近慢速打字,离真正替代云端服务还有距离,但值得关注本地 AI 这条赛道的成熟度。
对消费市场:未来两三年内,可能会出现一批「插上 U 盘就能跑 AI」的智能硬件,原理上和今天的努力是同一条线。