本周 r/LocalLLaMA 上有个开发者做了 159 次实验,结论很明确:把阿里 Qwen3.8-27B(270 亿参数的代码模型)跑在 AMD Strix Halo + RTX 3090 Ti 这套家用硬件上,32K 上下文下达到 153 tok/s(每秒生成的 token 数),在 HumanEval(标准代码生成测试)164 题里答对 159 题——比一台双 3090 云服务器还快、还准。我们关心的是:本地 AI 已经从极客玩具跨过了可用门槛。
这是什么
作者没动用专业服务器,而是把 27B 模型拆到 AMD 处理器的统一内存和一张消费级显卡上跑。基线速度只有 9.5 tok/s,几项关键优化后达到 153 tok/s。但最有价值的发现不在硬件层面——他只是把对话模板换成更简洁的版本(Qwen-Sharp),墙钟时间立刻砍掉 44%,输出 token 也少了一半。
换句话说:很多时候"AI 跑得慢",不是机器不够强,而是默认提示词让模型在啰嗦。
行业怎么看
支持方认为,本地部署的成本曲线正在加速下移。一台几万元的家用工作站,配合开源 27B 模型,已经能在真实编程任务上超过双 3090 的云端配置。对数据合规要求高的金融、医疗客户,这是个实在的备选方案。
但我们也要看到保留意见。第一,这是单一开发者、单一基准(HumanEval 偏短代码补全,跟真实业务差距大)的测试。第二,eGPU(外接显卡盒)+ 统一内存这种异构配置的稳定性、散热、长期运维,云厂商其实已经替你处理好了。第三,153 tok/s 高度依赖投机解码(让小模型先猜、猜中了跳过)和 n-gram(连续词规律)模式;同一配置跑长文生成,速度会掉到 35.8 tok/s,作者自己也承认这一点。
对普通人的影响
对企业 IT:几万元搭本地 AI 推理节点的方案开始变得可行,尤其对数据不能出内网的客户。
对个人职场:愿意折腾命令行的工程师,可以在家用一台带 NPU(神经网络处理单元,AI 专用芯片)的笔电跑一个真正能用的编程助手,月成本接近零。
对消费市场:以后买"AI 笔记本"会有更明确的衡量标准——能不能本地跑 20B 以上模型、速度够不够日常用。