一个俄罗斯开发者这周在 r/LocalLLaMA 上承认:对 Yandex 开源的 80B 模型做微调(用自家数据继续训练),第一次训练直接失败。原因是他自写的 V100 显卡底层模块出现 NaN(数值异常),导致除了两层以外所有层梯度(训练更新信号)都被清零,损失曲线(训练健康度指标)虽然「看起来对」其实是假象。

这是什么

Yandex Alice 80B 是 MoE 架构(混合专家,即每次只激活部分参数,总参数 80B、激活 3B,所以型号写作 A3B),技术上不输主流开源模型。开发者用 QLoRA(一种低显存微调方法)+ 4 张 V100 显卡从零后训练,结果卡在硬件底层兼容问题上。编辑部想提醒:模型开源 ≠ 模型能用,中间还隔着工具链、量化(压缩到小显存)、社区维护三道关。

行业怎么看

支持者觉得损失曲线这次更稳,值得继续。反对声音更值得听:一次失败的训练意味着几天的算力直接打水漂,从零后训练 80B 模型的投入产出比本身就存疑。更深层的风险是 — 现在每月都冒出来几个 80B 级「开源发布」,但能真正完成微调并交付可用品的不到十分之一,多数沦为基准跑分(benchmark)素材。

对普通人的影响

对企业 IT:开源模型拿来用,工程能力和工具链比权重更重要。
对职场人:所谓「AI 强」很多时候是「基座强、调教弱」,最后一公里才是出活的地方。
对消费市场:开源版图正在分化,俄罗斯、欧洲陆续进场,不再只是中美两家。