返回首页
模型压缩
找到 5 篇关于此标签的文章
Quantization-Aware HealingLocalLLaMA
4-bit 压缩后的模型反而比原版更强 — 量化修复让小模型逆袭
本周 r/LocalLLaMA 流传一项研究:通过「量化感知修复」技术,4-bit 压缩后的模型不仅没掉性能,跑分还超过了原版全精度模型。这事如果站得住,大模型部署成本可能再降一截。
4d ago2 分钟
通义千问Qwen
AI 模型压缩有了新套路 — Qwen 4B 几乎不增体积,推理反涨 17%
开源社区开发者 ByteOtter 用一种叫 QLAB 的新方法,把通义千问 Qwen 3.5 4B 模型在极低精度下的推理得分从 46.875 提升到 54.688,体积仅增 0.4%。这套方法第一次在非 Gemma 模型上跑通,意味着本地部署的小模型将能跑出更接近全精度大模型的效果。
Aug 222 分钟
Qwen千问
国产开源大模型已可手动瘦身 — 社区开发者把千问 27B 砍到 23B 不重新训练
一位 Reddit 开发者把阿里千问 27B 砍到 23B,不靠重新训练只删中间层;这件事意味着国产开源大模型已可「动手改」,本地部署成本继续走低。
Aug 202 分钟
KLQ量化
一个人暑假搞出量化新算法 — 揭穿大模型压缩行业十年没解决的隐疾
一位独立研究者的开源项目 KLQ,用"测量空间不均匀性后再分配比特"的思路,在 4-bit 量化上击败了主流训练无关方法。这值得我们关心:模型压缩十年没有突破,真正卡住的不是算力,而是我们对模型内部几何的认知。
Aug 102 分钟
英伟达NVFP4
英伟达 NVFP4 让模型跑得更快,但内部精度悄悄在丢 — 论文指出压缩正在制造隐形损伤
一项 arXiv 新论文发现,用 NVFP4(英伟达 4 位浮点,一种极低精度压缩格式)压缩大模型时,仅让输出匹配老师模型会掩盖内部表征(模型各层对信息的抽象表达)的退化;这意味着低精度推理正在悄悄损害推理和编程能力,值得关心 AI 部署成本与质量平衡的从业者留意。
Aug 92 分钟