本周 Reddit 上一条技术帖被我们编辑部注意到:一位极客把 eBay 上 280 美元(约 2000 元人民币)的二手矿机 FPGA 芯片魔改后,成功跑通阿里通义千问 Qwen3.5 9B 模型,生成速度约每秒 3 个 token(token 是模型处理文字的最小单位,可理解为一个中文字或半个英文单词)。慢,但跑起来了。
这是什么
FPGA(一种可重复编程的硬件芯片,原本主要用于挖矿)单卡 280 美元,配 8GB HBM2 高速内存。技术上,作者把模型压缩到 INT4(把模型参数精度从 32 位砍到 4 位,体积缩到原来的八分之一),用两张卡并行跑 9B 模型。
实测性能:9B 模型生成约 3 token/秒、预读 6 token/秒;27B 模型在双芯片版(375 美元)预估 3-8 token/秒,4 芯片并行时可达 25 token/秒。本地化部署,不用付云端 API 费,也不用把数据传出去——这是这件事值得关心的原因。
行业怎么看
支持方认为这是「本地 AI 平民化」的信号:以前跑 27B 模型至少要几万块 NVIDIA GPU,现在理论上几百块就能搞定。对金融、医疗、法律、政务这些数据敏感行业,「本地大模型」不再遥不可及。
反对意见同样尖锐。其一,每秒 3 个 token 的速度,日常办公根本不可用;其二,FPGA 编程门槛极高,需要懂硬件描述语言和 RTL 设计,普通 IT 团队无法复制;其三,云端推理价格还在快速下降,火山引擎、阿里云都在打价格战,综合性价比未必输给自建。
对普通人的影响
对企业 IT:数据合规要求高的行业(金融、医疗、央国企)值得重新评估本地化方案,硬件门槛从百万级降到十万级不是梦。
对个人职场:普通员工短期内不用操心,云端 API 仍是性价比最优解;但「硬件 + AI」复合背景的工程师会更值钱。
对消费市场:未来 1-2 年可能出现千元级的家用 AI 盒子产品,但体验能否追上云端,还要打问号。