本周 Reddit 的 LocalLLaMA 板块有个帖子问得很直接:150 美元的二手数据中心显卡,现在还能跑本地大模型吗?评论区多数声音判断——能跑,但这条路越走越窄。
这是什么
主角是两块老卡——NVIDIA Tesla P40(2016 年发布,24GB 显存)和 AMD MI50(Vega 20 架构,32GB HBM2,一种高速显存)。二手价都在 150-250 美元区间,技术上能跑量化后的 7B-13B 模型(量化是一种压缩技术,让大模型占用更小显存)。
发帖人预算紧、愿意折腾,评论区却没给出热情推荐,反而列了一堆劝退理由。
行业怎么看
支持方的理由不复杂:显存够大、价格够低、跑老模型够用,适合纯玩票学习。但反对意见更值得听:
第一,AMD 阵营的 ROCm(AMD 的 GPU 计算平台)驱动始终是硬伤,MI50 在新版里支持残缺,本地部署 Llama 类模型经常卡在兼容性上。第二,P40 虽然 CUDA(NVIDIA 的 GPU 编程框架)生态成熟,但功耗 250W,长期电费能吃掉机器本身的差价。第三,整个生态在向 Blackwell(NVIDIA 最新 GPU 架构)迁移,老卡跑新模型的边际收益递减。
本地 AI 圈正在形成一种共识:除非纯玩票,否则不值得为旧架构折腾时间成本。
对普通人的影响
对企业 IT:边缘推理试点可以小规模试,但生产环境继续靠云 API(按调用次数付费的远程模型接口),自建机房成本账算不过来。
对个人职场:愿意折腾本地大模型的从业者,开始愿意为 RTX 4090/5090 这类新卡付溢价,二手老卡市场正在分层。
对消费市场:暂时无直接影响,本地 AI 还没到消费级拐点,普通用户继续用 ChatGPT 类的云端服务更省心。