arXiv 上出现的一篇论文抛出一个让人不太舒服的结论:用英伟达 NVFP4 4 位浮点压缩大语言模型时,如果只盯着输出结果看,会掩盖模型内部结构的退化。换句话说,模型表面上答得跟原来差不多,但中间层的「思考方式」已经被压变形了。
这是什么
NVFP4 是英伟达去年力推的一种超低精度格式(每个参数只用约 4 位二进制存储,远低于常见的 16 位),目的是让大模型推理时跑得更快、用更少显存。当模型从高精度压缩到 NVFP4 后,精度往往会下降,工程界通常用「蒸馏」(distillation:让压缩后的「学生」模型学习未压缩的「老师」模型的输出)来补救。
研究者发现,传统蒸馏只看输出是否一致,相当于只看学生考试分数,不看它是不是真的学会了。他们用 CKA(Centered Kernel Alignment,一种衡量神经网络不同层之间表征相似度的指标)去检测模型的「内部几何」,发现 NVFP4 蒸馏后的模型在中间层已经严重偏离原模型,尤其在经过强化学习(RL)后训练(post-training,即用人类反馈或奖励信号对模型做进一步微调)的模型上更明显。这种内部偏差会直接反映在推理和编程任务的能力下降上。
为此,论文提出了改进方法 CKA-QAD,在蒸馏时增加一个正则化项(一种约束条件),强迫中间层结构也要对齐。在 Nemotron 3 Nano 和 Qwen3-4B-Thinking 两个模型上效果显著,训练开销很小。
行业怎么看
支持者认为,这篇论文切中了当前低精度部署的盲区:大家都在抢 4 位、6 位的推理速度,但很少有人认真检验模型到底丢了什么。如果内部表征漂移普遍存在,那 NVFP4 引以为傲的成本优势可能要打个折扣,方法上的小改进就能换来实质的能力恢复,值得部署侧认真对待。
质疑声音同样存在。NVFP4 目前在生产环境使用时间不长,论文只在两个模型上做了实验,且推理任务指标下降的绝对幅度有限。有从业者指出,真实业务负载中往往有检索增强(RAG,模型先搜索外部资料再回答)和提示工程兜底,内部表征偏差未必会传导到终端用户体验。也有声音认为,论文方法在工业级训练 pipeline 里的可扩展性还没被验证,短期看更像学术增量而非工程范式。
对普通人的影响
对企业 IT:当团队准备把模型切到 4 位精度以省 GPU(图形处理器,AI 算力的核心硬件)成本时,需要把推理准确率指标做细,而不是只看 demo 跑通——能力损失可能藏在边缘场景里。
对个人职场:写代码、做数据分析这类依赖严密推理的工作流,可能比聊天问答更敏感地感受到低精度带来的波动,工具选型要多留一组对照测试。
对消费市场:普通用户大概率感受不到差异,因为各家厂商会用工程手段补偿;但如果服务方过度压缩、省掉内部校验,最终体验会变慢或变笨。