返回首页
NVFP4
找到 6 篇关于此标签的文章
NVIDIANVFP4
英伟达新推 NVFP4 量化格式,5090 用户吵翻:画质到底掉多少
英伟达为 RTX 5090 推出私有 4 位浮点量化格式 NVFP4,号称让本地大模型推理速度翻倍。但用户在 Reddit 上一则帖子为画质损失吵到 200 多条回复没结论。这背后是英伟达用专属格式锁定 GPU 生态的老套路。
9月24日2 分钟
QwenLocalLLaMA
8B 小模型本地跑 Agent 编码追平 27B — 小模型'够用时刻'来了
Reddit 社区开发者用单张 RTX Pro 6000 跑了份 Agent 编程本地基准:8B 量化小模型跑分逼近 27B 模型,每分请求数和 token 数都更省,且模型自称'未充分训练'。我们注意到,本地跑 AI 写代码的硬件与算力账,可能要被重新算一遍。
8月28日2 分钟
NVIDIANemotron
NVIDIA 把大模型从 66GB 压到 22GB 还快 4 倍 — 推理成本的故事正在改写
NVIDIA 的开源大模型 Nemotron 3.5 Lightning 推出 NVFP4 压缩版:体积从 66GB 缩到 22GB,速度最高提升 4 倍,精度声称无损。这件事值得关心——它直接改写 AI 推理的成本结构,企业自建 AI 的门槛被实质性拉低。
8月17日2 分钟
英伟达NVFP4
英伟达 NVFP4 让模型跑得更快,但内部精度悄悄在丢 — 论文指出压缩正在制造隐形损伤
一项 arXiv 新论文发现,用 NVFP4(英伟达 4 位浮点,一种极低精度压缩格式)压缩大模型时,仅让输出匹配老师模型会掩盖内部表征(模型各层对信息的抽象表达)的退化;这意味着低精度推理正在悄悄损害推理和编程能力,值得关心 AI 部署成本与质量平衡的从业者留意。
8月9日2 分钟
Qwen3.6cyankiwi
4 比特量化把 35B 模型压到 23GB 左右,本地部署门槛还在继续下降
Qwen3.6 的一组新量化测试显示,27B 和 35B 级模型可以在约 19GB 到 23GB 权重体积下,尽量接近 BF16(16 位浮点基线)的输出表现。这值得关心,因为大模型竞争正在从“谁更强”转向“谁更容易被企业真正跑起来”。
6月4日2 分钟
NVIDIAGemma
NVIDIA 自研 4 位量化把 26B 模型塞进消费显卡 — 精度损失不到 1%
NVIDIA 发布 NVFP4 量化版 Gemma-4-26B,压缩至 18.8GB 可在消费显卡运行,6 项基准测试精度损失均不超过 0.7%。4 位量化正从妥协变成优选,但这也是 NVIDIA 生态锁定的一步棋。
5月1日2 分钟