返回首页

量化

找到 18 篇关于此标签的文章

量化本地部署

8G 显卡也能跑 70B 模型了 — 量化技术把 AI 本地部署的成本砍到底

8G 显存的 4070 显卡,过去装不下 130GB 的大模型权重;现在靠量化技术,3.5GB 就能跑 7B 模型。这件事的真正意义不是技术参数,而是 AI 部署第一次有可能脱离云端,让每个企业都能自己跑。

1d ago2 分钟
本地大模型Hugging Face

本地 AI 玩家正在分裂:万元 Mac 派和 Hugging Face 量化包党

一个用 RTX 2060 的 Reddit 用户发帖问:跑本地大模型是不是非花一万块买 Mac 不可?我们关心这件事,是因为本地 AI 的真实门槛不是算力,而是没人带路的模型丛林。

4d ago2 分钟
通义千问Qwen

AI 模型压缩有了新套路 — Qwen 4B 几乎不增体积,推理反涨 17%

开源社区开发者 ByteOtter 用一种叫 QLAB 的新方法,把通义千问 Qwen 3.5 4B 模型在极低精度下的推理得分从 46.875 提升到 54.688,体积仅增 0.4%。这套方法第一次在非 Gemma 模型上跑通,意味着本地部署的小模型将能跑出更接近全精度大模型的效果。

Aug 222 分钟
Qwen阿里

本地部署大模型别只看显存 — Qwen 27B 实测显示 KV 缓存精度影响长文本表现

Reddit LocalLLaMA 社区测试发现,Qwen 27B 在 12 万 token 长文本下,f16 精度 KV 缓存比 q8_0 更稳。量化不是省显存那么简单。

Aug 202 分钟
Ornith-1.5Ornith Lab

Ornith 1.5 把 9B 模型压到 5.6 GB 还能跑 — 小模型本地化部署门槛正在下调

Ornith Lab 这周发布开源模型 Ornith 1.5,9B 参数版本量化后体积仅 5.6 GB,普通笔记本即可运行。社区团队的对比显示,更小体积下仍能保留 90% 以上原始能力。本地 AI 助手的硬件门槛正在快速下降。

Aug 192 分钟
UnslothQwen

Unsloth 把 Qwen 压到 8GB 内存可跑,本地大模型真不挑机器了

开源部署工具 Unsloth 这周更新「Dynamic v3.0」量化方案,让 Qwen 系列模型在 8GB 内存的普通笔记本上就能跑,最极端的 1-bit 版本仍保留 77% 准确率。这直接降低了企业本地跑大模型的硬件门槛和数据外传顾虑,值得决策者看一眼。

Aug 192 分钟
llama.cppQwen

老显卡也能跑大模型 — 1080 Ti 拼 5070 Ti 跑通 Qwen 27B,本地部署成本下降

本周 LocalLLaMA 社区一位开发者把 2017 年的 GTX 1080 Ti 和 RTX 5070 Ti 用千兆网线串起来,通过 llama.cpp 的 RPC 功能跑通 Qwen 27B 量化版。这意味着旧硬件不再是 AI 时代的废铁,企业部署本地大模型的门槛在下降。

Aug 182 分钟
通义千问Qwen3

通义千问 27B 跑分很强,但 300 万次下载的版本其实没人系统测过

通义千问 27B 在公开跑分榜成绩亮眼,但真正被下载 300 万次的 4-bit 压缩版根本没人系统测过。本周 Reddit 高赞帖指出:跑分榜测的是「精装版」,用户跑的是「简装版」,两者不是同一个东西。

Aug 182 分钟
NVIDIANemotron

NVIDIA 把大模型从 66GB 压到 22GB 还快 4 倍 — 推理成本的故事正在改写

NVIDIA 的开源大模型 Nemotron 3.5 Lightning 推出 NVFP4 压缩版:体积从 66GB 缩到 22GB,速度最高提升 4 倍,精度声称无损。这件事值得关心——它直接改写 AI 推理的成本结构,企业自建 AI 的门槛被实质性拉低。

Aug 172 分钟
通义千问阿里

27B 模型被量化压进 16GB 显卡 — 本地 AI 开始蚕食云端 API 生意

Reddit LocalLLaMA 板块本周流传一份技术帖:有人把阿里 Qwen 27B 模型通过 IQ4_XS 量化压缩,跑进了 16GB 消费级显卡。原本需要专业卡才能加载的大模型,第一次能躺在普通工作站里。本地化部署的经济性正在被改写。

Aug 162 分钟
Gemma 4Google

把 AI 模型压到 1/4 大小还能保住 96% 能力 — 本地跑 AI 的成本拐点可能到了

海外技术社区本周出现一项让人意外的结果:通过精细的精度分配,把 3.3GB 的小模型推理分数从 28.9 提到 69.5。这意味着在普通笔记本、手机上跑出「够用」的 AI,成本可能比想象的更低。

Aug 152 分钟
Tim Dettmersbitsandbytes

量化大神 Tim Dettmers 预告新招:单机 7t/s 跑大模型 — 业内谨慎观望

bitsandbytes 库创始人 Tim Dettmers 公开一种新模型量化方法,号称让智谱 GLM 5.3 在单台 DGX Spark 工作站跑到 7 token/s。若属实,大模型部署硬件门槛将被大幅压低;但 Reddit 社区明确提醒:量化领域'画大饼'的传统深厚,需要等实测。

Aug 142 分钟
Qwen阿里

本科生租 4090 击败六家压缩团队,Qwen 9B 量化已逼近无损

阿里 Qwen3.5-9B 被一个本科生用自研压缩管线做到接近无损。这一战意味着开源"单兵"开始系统性反超成熟团队——但量化方法、压缩标准的定义权,也在悄悄离开中国。

Aug 142 分钟
KLQ量化

一个人暑假搞出量化新算法 — 揭穿大模型压缩行业十年没解决的隐疾

一位独立研究者的开源项目 KLQ,用"测量空间不均匀性后再分配比特"的思路,在 4-bit 量化上击败了主流训练无关方法。这值得我们关心:模型压缩十年没有突破,真正卡住的不是算力,而是我们对模型内部几何的认知。

Aug 102 分钟
DeepSeekFlash 0731

DeepSeek Flash 量化版本怎么测?开源社区还没人给出答案

DeepSeek Flash 0731 的多个量化版本(用更少精度换更快速度的压缩模型)已经流出,但开源社区至今没人系统跑过对比基准。问题是:量化到底砍掉了多少能力,没人说得清。

Aug 82 分钟
MLXLocalLLaMA

本地跑大模型的「压缩格式」之争 — MLX 4bit 量化谁更值得用

有人在 Reddit 上比较了在苹果芯片上跑开源大模型(如 Qwen3.6)的几种 4bit 量化方案。这是「本地 AI」玩家关心的小事:量化格式决定模型占用内存、生成速度和回答质量,普通人不必懂,但值得知道这件事正在被认真优化。

Aug 82 分钟
NVIDIAGemma

NVIDIA 自研 4 位量化把 26B 模型塞进消费显卡 — 精度损失不到 1%

NVIDIA 发布 NVFP4 量化版 Gemma-4-26B,压缩至 18.8GB 可在消费显卡运行,6 项基准测试精度损失均不超过 0.7%。4 位量化正从妥协变成优选,但这也是 NVIDIA 生态锁定的一步棋。

May 12 分钟
llama.cppllama-bench

llama.cpp 的 llama-bench 新增 -fitc 和 -fitt 基准测试标志

llama-bench 从 b8679 版本起新增 -fitc 和 -fitt 标志,使开发者能更精细地控制基准测试的时间输出格式。

Apr 62 分钟