本周 LocalLLaMA 社区有个帖子被顶起来了:我们注意到一位开发者把 2017 年的 GTX 1080 Ti 和今年的 RTX 5070 Ti 用千兆网线串起来,通过 llama.cpp 的 RPC 功能拼成一台 AI 工作站,跑通了 Qwen 27B 量化版。这件事值得我们关心的是 — 公司机房吃灰的那些旧显卡,可能终于不是废铁了。

这是什么

llama.cpp 是个开源工具,让普通电脑也能跑大语言模型。这位开发者用它的 RPC(远程过程调用)功能,让两张卡跨机器协同:1080 Ti 负责主计算,5070 Ti 负责 MTP(Multi-Token Prediction,多令牌预测加速),数据通过千兆网传输。在 12k 上下文(模型一次能"看"多少文字)下,输出速度达到每秒 36 个 token,Qwen 27B 量化版(把模型压缩到更小显存)顺利跑通。

行业怎么看

本地 AI 圈振奋 — 旧硬件不再是淘汰品,而是低成本部署的入场券。Qwen、Mistral 等开源模型质量上来了,量化技术让小显存卡也能跑复杂任务。

但冷静的声音也有:36 token/s 远低于云端 API 的响应速度;千兆网本身就是瓶颈;开发者自己也承认"预填充(处理输入)和生成(输出文本)只能二选一,没有中间值"。更关键的是,MTP 加速会多吃 30% 显存,小卡用户反而被劝退。省钱可以,但别指望真能替代云端服务。

对普通人的影响

对企业 IT:机房吃灰的旧显卡值得盘点一下,可能还能再用三年。本地部署大模型不必一次性大额投入。

对个人职场:懂技术的人可以低成本搭一套本地 AI 助手,处理敏感文档不出门;但多数白领直接用 ChatGPT、文心一言更省事。

对消费市场:未来可能出现更多"AI 一体机"产品,把旧硬件利用和本地 AI 打包卖给中小企业。