本周 Reddit 上的独立测试显示:阿里通义千问 Qwen3.8-27B 在 AIME 2026 竞赛题(美国高中奥数级别,业内常用的推理硬指标)上答对 29/30 题,准确率 96.7%,追平 Claude Opus 4.6,但和 GPT-5.6 的 99.9% 还差约 3 个百分点。另一个值得关注的信号是:FP8 量化版本(参数精度从 16 位压缩到 8 位)在最高推理档下和原版同分,输出速度却快 2.7 倍。
这是什么
测试使用的是 MathArena 发布的 AIME 2026 题库,每题要求模型写出完整解题过程并给出最终答案。测试者对比了四种配置:BF16 原版 + 中档推理、BF16 原版 + 高档推理、FP8 量化 + 中档、FP8 量化 + 高档。
核心发现:高档推理下,FP8 与 BF16 同为 29/30;中档推理下,FP8 掉到 26/30(86.7%),BF16 仍有 28/30(93.3%)。量化在高难度推理时几乎无代价,在低难度推理时反而会拖后腿。
还有一个细节被作者标红:第 7 题两种配置都把 token 预算烧完了也没给出答案——模型"卡死"了,不是答错。这是长链推理任务里典型的失败模式,也是 Agent 类产品需要重点防范的崩溃点。
行业怎么看
我们注意到,这次跑分把 27B 摆进了一线模型的同一张表:96.7% 与 Claude Opus 4.6、DeepSeek V4 Pro 并列,超过 Kimi K2.6 和 Qwen3.6-27B。开源中国模型在数学这个单项上已基本追平第一梯队。
但要说几个保留。第一,测试者自己注明"只跑了一次",榜单上其他模型是多次取平均,单次跑分波动不小,96.7% 这个数字的置信区间不算窄。第二,FP8 在中档掉分近 10 个百分点,说明"量化无损"是有条件的,不是普适定律。第三,和 GPT-5.6 的 3.2 个百分点差距听起来小,但在金融、医疗等关键场景里,这可能正好是"能用"和"不敢用"的分界。
对普通人的影响
对企业 IT:27B 这个参数量意味着单卡 H100 或双卡 A100 就能本地部署,FP8 推理又把显存和电费成本砍掉近一半。不愿把数据出私有的公司,本地跑一个"接近 Claude 水平"的数学模型,正在变得可以算账。
对个人职场:做财务、合同、数据校验这类需要数字准确性的工作时,本地模型作为"第一道校验"变得可行,不再必须依赖云端 API。对个人电脑配置的要求也在持续下降。
对消费市场:阿里云通义相关 API 价格大概率继续下调,类似能力会以更低价格出现在钉钉、淘宝客服等场景里。消费者短期内能直接感受到的是"AI 客服变聪明了"。