这是什么
本周 r/LocalLLaMA 一个帖子给出数字:用 Strata 这款新推理引擎,同一台 64GB 内存的机器跑 70GB 大模型,速度从 21 t/s(每秒生成的文字 token 数)跳到 60 t/s——但内存占用顶到 96%,用户连图像生成都跑不动了。
发帖人 Cautious_Chicken_604 配置是 AMD R9700 + RTX 5060 Ti + 64GB DDR5,平时用 R9700 跑 Qwen3-27B(Q6 量化即把模型参数压缩到 6 位精度)做助手,用 5060 Ti 在 ComfyUI 上跑 AI 绘图。他想升级到更大的 Qwen3.8-Flash-Next,原本 llama.cpp(主流开源推理引擎)下只有 21 t/s,换 Strata 后直接拉到 60 t/s。但模型加载后内存 96%,再开 ComfyUI 直接卡死。
他自己的总结:感觉被祝福(终于能跑史诗级模型了),又被诅咒(跑 LLM 还是跑绘图,必须二选一)。
行业怎么看
我们注意到两件事。第一,Strata 代表的「推理引擎优化」在快速进步——同一台机器同一模型,速度从 21 t/s 跳到 60 t/s,是纯软件胜利。第二,硬件上限没变:70GB 模型吃 70GB 内存,再聪明的引擎也绕不开。
反对意见同样清晰:这本质上是发烧友的烦恼。普通用户订阅 ChatGPT 或 Claude 每月 20 美元,根本不会碰到内存瓶颈。云端 API(通过网络调用 AI 模型)才是 99% 人的解法,本地部署更像隐私敏感行业(金融、医疗、法律)的专属战场。而且 Qwen 团队还在持续发更大模型,硬件焦虑只会加剧。
还有个细节:用户承认因为今年买硬件太多,妻子要求用首饰和国际旅行「对冲」——他暂时升不了 128GB 内存。本地 AI 玩家的硬件军备竞赛,已经开始溢出到家庭预算。
对普通人的影响
对企业 IT:本地部署 AI 的总拥有成本被低估。内存扩展板和高端 GPU 一样是 CapEx(资本性支出)大头,企业评估本地 AI 时需要把未来 3 年的内存升级算进去。
对个人职场:想在公司电脑跑本地 AI 保护客户数据,目前硬件门槛比想象中更高。64GB 只是入门,128GB 才是舒适区,批量采购成本不低。
对消费市场:DIY AI 工作站开始分化成「显存党」和「内存党」,硬件选购更复杂。普通玩家面对的不再只是「买什么显卡」,而是显卡、内存、推理引擎的整体搭配。