这是什么

Qwen3.8-Flash-Next 在苹果 M4 Max 128GB 工作站上跑出了 94% 的本地基准分 —— 一款五万块设备就能跑起来的百亿参数实验模型,看起来是开源大模型的里程碑,但数字本身却透露另一层信号:基准测试快要分不出模型高下了。这意味着本地大模型(不连云端、直接在自己电脑上跑的大模型)从极客玩具跨入了「企业可选项」的门槛。这位 Reddit 博主自制的编程+通识基准测试显示,Qwen3.8 是今年第一款突破 94% 的模型;困惑度(perplexity,衡量模型对一段文字的「惊讶程度」,数值越低越好)从完整精度的 4.47 只上升到量化压缩(一种把高精度参数压成低精度以省显存的压缩技术)后的 4.53,损失几乎可忽略。

行业怎么看

阿里的迭代节奏值得关注 —— 从 Qwen3.6 到 3.8 间隔仅几个月,社区就摸到了下一代「qwen4_exp」架构的边。但比分数更值得关心的是这位博主自己写的一句话:「models are getting too good to differentiate」,意思是模型已经好到基准测试分不出高下。我们的提醒是另一面 —— 4-bit 量化后仍吃掉约 100GB 显存,「本地能跑」和「本地普及」之间还隔着相当距离;更重要的是,94% 这个数字一旦脱离基准场景放到真实业务里,可能完全是另一回事。换言之,这个分数既可能反映 Qwen3.8 的进步,也可能只是基准测试本身在失效。

对普通人的影响

企业 IT:本地大模型正从极客玩具变成可选项,但 M4 Max 128GB 这套配置对企业并不便宜,IT 部门该开始算「自建 vs 调用云端 API」的账了。

个人职场:除非你是开发者或重度 AI 用户,否则本地跑模型离日常使用还很远。订阅 ChatGPT 或通义网页版仍是更现实的选择。

消费市场:苹果 Mac 工作站用户会最先感受到冲击 —— 下一轮 AI 应用很可能不再依赖云端,而是直接跑在你自己的设备上。