这是什么
一位 Reddit 玩家晒出升级日志:家庭服务器从 3 张 RTX 3090(旧消费级旗舰显卡)换到 2 张 RTX 5090,跑同一个 Q8 精度大模型(Q8 = 把模型参数压缩到 8 位,体积更小、速度更快),速度大涨。叠加 speculative decoding(让小模型先猜答案、大模型再确认的加速技巧)和 NVFP4(NVIDIA 新一代 4 位浮点精度)两项软件优化,速度翻了不止一倍。
但他自己也算完账:两张 5090 整机各花 6400 美元,3090 卖回血后净成本约 6000 美元,仍高于 5090 官方建议售价。
行业怎么看
乐观者说:NVFP4 是消费级显卡第一次原生支持 4 位精度,过去要企业级 H100 才能流畅跑的模型,现在家用硬件也能勉强接住。这对数据敏感、不想持续付云端费用的中小企业是个利好。
反对声音同样明确:这是发烧友的发烧友升级,硬件 6000 美元起步,电费、散热、噪音、维护全要自己扛。云端 API(按次付费调用 AI 服务)一年可能只花几百到几千元,绝大多数中小企业和职场人本地部署根本不划算。NVFP4 还是 NVIDIA 专属协议,深度绑定一家厂商是另一层风险。
对普通人的影响
对企业 IT:本地化部署从'不可能'开始变得'可以谈',但 5090 级硬件仍是发烧友玩具,进入企业生产环境还要再等 1-2 代。
对个人职场:短期不必焦虑。能跑得动 ≠ 跑得好,多数人还是用 ChatGPT、DeepSeek、文心一言等云端服务更省事。
对消费市场:旧卡二手价格会承压。准备装机的家庭用户可以留意 3090 二手行情。