这周 Reddit r/LocalLLaMA 社区用户 jwestra 晒出一组数据:通过一个叫 mlock 的工具,把 NVIDIA 5060ti 的 GDDR7 显存超频 5500 MT/s 后,显存带宽跑到了 1248 GB/s,相比常规超频成绩再提升约 40%。

显存带宽对本地推理(让大模型跑在你自己的电脑上)影响很大,尤其决定「逐字生成」— 模型吐回答的速度基本被带宽卡死。5060ti 这类中端显卡一直被本地 AI 玩家视为「性价比甜品」,但受限于带宽一直被吐槽。这次解锁后,社区普遍觉得「中端卡的潜力被低估了」。

这是什么

GDDR7 是 NVIDIA 50 系显卡用的新一代显存,理论上有不少频率余量,但官方锁得很死。mlock 这个工具本质上是一个非官方解锁补丁,把显存频率上限顶上去。5060ti 16GB 在 3000 元价位,原本就是跑 7B-13B 参数模型(参数量越大模型越聪明但越吃硬件)的热门卡,这次带宽再拉一截,等于给每张卡「免费」加了几百块的性能。

行业怎么看

本地 AI 圈的反应相当兴奋。一些老用户已经在重新算账:是不是该把云端 API 订阅(按月付费调用云端模型)砍一砍,换成自建。

但冷静声音也有几个,我们整理如下:

  • 超频失去 NVIDIA 官方保修,GDDR7 在高频下的发热和稳定性要看运气
  • 这是单个用户的成绩,量产卡体质不同,未必都能复现
  • 真正的瓶颈还有显存容量(VRAM),5060ti 16GB 跑 70B 参数模型仍然吃力
  • 云端推理仍是主流厂商主战场,本地跑只适合数据敏感、低频使用场景

对普通人的影响

对企业 IT:中小公司想私有部署敏感数据对话的,5060ti 超频方案多了一个低成本选项,但短期仍是「极客方案」,距离企业标准化采购还有距离。

对个人职场:愿意折腾的技术型白领,现在花 3000-4000 块配一台机器,本地跑 7B-13B 模型做翻译、总结、代码补全,体验已经可用。

对消费市场:这件事传递的信号是 — 消费级硬件跑 AI 远没到天花板。未来 1-2 年本地 AI 设备的实际体验,可能比厂商发布会上的数字乐观。