这周 Reddit 上一台“怪兽机”引发讨论:6 张比特币矿卡跑 Qwen 大模型,100k 上下文、28 token/秒,整机功耗约 115 瓦,散热靠三个风扇加一个纸箱。看起来是极客玩具,背后却折射出一个真实趋势——比特币减半后被淘汰的矿卡,正在成为本地 AI 圈最被低估的算力来源。
这是什么
发帖人 Ok-Breadfruit-3523 用的是 6 张 BC-250——2017-2018 年那一波挖矿潮的产物,本质是为挖矿定制的 GPU 主板,单卡算力约等于中端消费级显卡,但显存带宽偏弱。其中 4 张用来跑 Qwen Next Flash 的 IQ2_XS 极量量化版(一种把模型体积压缩到极小、同时损失精度的技术),能处理 10 万 token 上下文,短文本生成约 28 token/秒,5 万 token 时降到 24 token/秒;另 2 张跑 Qwen 3.6 35B 的 Q4 量化版,速度 60 token/秒。
BC-250 这类卡在二手市场已经非常便宜,单张几十美元,矿场清仓时甚至论斤卖。这件事的判断是:算力“下沉”比大多数人预期的要快——不是中产买一张 4090,而是极客用几百美元拼出一台能跑 100k 上下文的机器。
行业怎么看
支持方认为这是积极信号。r/LocalLLaMA 的常客在评论区说,过去一年他在 3090、4080、甚至 P106 矿改卡上都跑通了大模型,“摩尔定律死没死不知道,但算力下沉是真的”。换句话说,AI 算力的长尾市场正在形成,二手硬件 + 量化技术 + 开源模型三件事凑齐,本地 AI 的门槛被持续压低。
但质疑也很直接。115 瓦的整机功耗、24-28 token/秒的速度、再叠加 IQ2_XS 这种极端量化对精度的损耗——跑聊天可以,做严肃的代码生成或长文档分析基本是玩具。一位做 AI 基础设施的工程师在评论里算了笔账:同样电费,云端 API 能换回几十倍 token,“除非你真在意数据不出门,否则这只是昂贵的爱好”。隐性成本还包括:矿卡 BIOS(控制硬件启动的固件)被刷过、显存老化、没保修。
对普通人的影响
对企业 IT:短期内不构成云端替代方案。数据敏感且预算紧的小团队可评估用类似矿卡集群做内部知识库的离线推理,但要把电费、运维、折旧算进 TCO(总拥有成本),多数情况下仍不如租云。
对个人职场:对没有技术背景的普通白领几乎没直接影响。但若你的工作涉及合同、客户数据等敏感内容,“本地跑模型”这个选项在变便宜,知道它存在有备无患。
对消费市场:二手 GPU 还在持续下行。打算今年装机的读者可以盯一波矿卡,但请做好功课:核实显存健康度、刷回原版 BIOS、接受无保修的现实。