这是什么
事情发生在 Reddit 的 LocalLLaMA 板块。社区团队 Yamz Labs 基于 ExLlamaV3(主流开源推理引擎)和 AMD ROCm(GPU 计算平台)做了一套叫 Kyojin 的本地引擎,专门跑 AMD Strix Halo 平台(搭载 Ryzen AI Max+ 395,统一内存 128GB)。
他们把两个 300 亿参数的 MoE(混合专家,简单说就是模型很大但每次只激活一部分参数)模型量化压缩后塞进这台小主机:GLM-5.3-Flash 约 99.7GB,预填充 580 tok/s,生成 26-30 tok/s;MiMo-V2.6-Flash 约 105GB,预填充 650 tok/s,生成最高 44 tok/s(代码场景)。
关键不是「能跑」,而是「跑得动」。44 tok/s 大约是真人朗读速度的一半,比不上云端上百的速度,但已经能用。
行业怎么看
支持者说,这是「本地 AI」的标志性时刻——企业不必把所有数据送上云端,一台小主机就能跑 300B 级别模型,处理内部文档或辅助编程,隐私和成本都更可控。量化压缩、ROCm 适配、推理引擎这些过去只有大厂愿意做的脏活,开源社区正在接力。
但我们有三个保留。第一,KLD 散度(衡量压缩版与原版输出差异的指标)显示这些压缩版与官方 FP8(8 位浮点精度)仍有可见偏差,GLM 的 top-1 一致性只有 89.3%。第二,Strix Halo 硬件生态还小,普通用户从买到机器、装驱动、跑通流程,依然需要相当技术能力。第三,44 tok/s 离「丝滑对话」还有距离,国内云端 API 仍是性价比更高的选择;这套方案的可持续性也存疑——Yamz Labs 是社区团队,迭代依赖个人投入。
对普通人的影响
对企业 IT:涉敏感数据、又不想把语料送公有云的场景,本地化部署多了一条路线;但距离「开箱即用」还远,至少需要一位懂 ROCm 和量化的工程师。
对个人职场:日常写邮件、做翻译、问业务问题,还是直接用 Kimi、通义、文心更快更便宜;本地部署对程序员和 AI 爱好者更有意义。
对消费市场:AMD 和 OEM 厂商大概率在 2026 年加码「AI 小主机」品类;如果价格打到 8000 元以内,普通用户才可能为「一台能跑大模型的电脑」买单。