返回首页

模型量化

找到 17 篇关于此标签的文章

Qwen阿里通义

社区版 Qwen3.8 量化模型省 30GB 空间 — 本地跑大模型的门槛又降了

社区开发者 agentionai 发布 Qwen3.8-Flash-Next 的定制量化版本,比主流版本小 20-30GB 而质量相当。本地运行大模型的硬件门槛进一步下移,但目前仍是极客圈的事。

7h ago2 分钟
腾讯GGUF

腾讯把 1.5TB 模型压到 200GB — 本地部署大模型的门槛正在消失

这周腾讯把 1.5TB 大模型压到 200GB,性能保留约 98%。这件事意味着企业本地跑大模型的硬件门槛被实质性跨过,对云端 API 的商业模式是个微妙信号。

9h ago2 分钟
Qwen通义千问

阿里通义千问被压到 10GB — 小尺寸跑出原版质量,本地 AI 又进一步

奥地利 ISTA-DASLab 实验室把阿里通义千问系列一个 270 亿参数(27B)模型压到 10GB(普通 U 盘大小),成绩还能和原版几乎打平。本地 AI 又向前跨了一步——企业可以不用云端、不上传数据,部署一个够用的 AI。

1d ago2 分钟
QwenNVIDIA Blackwell

Qwen3 模型瘦身 65% 跑分几乎不跌 — 大模型部署成本战升级

一支团队把 Qwen3-27B 模型压缩到原来的 35%,但 GPQA-Diamond 跑分只掉 0.5 个百分点。这意味着大模型部署所需的显存和成本可能大幅下降,是企业 AI 落地最值得关心的技术拐点。

3d ago2 分钟
Quantization-Aware HealingLocalLLaMA

4-bit 压缩后的模型反而比原版更强 — 量化修复让小模型逆袭

本周 r/LocalLLaMA 流传一项研究:通过「量化感知修复」技术,4-bit 压缩后的模型不仅没掉性能,跑分还超过了原版全精度模型。这事如果站得住,大模型部署成本可能再降一截。

4d ago2 分钟
Qwen通义千问

Qwen 27B 模型压缩实测:精度只掉 0.2%,单张显卡就能跑

本周一个开发者团队把阿里通义千问 27B 大模型压缩成不同精度版本,在单张 RTX 6000 显卡上实测 3D 场景生成。结果很直接:Q6 精度准确率只比最高版本低 0.2%,却省下近 4GB 显存——本地部署大模型的门槛正在快速消失。

6d ago2 分钟
Gemmallama.cpp

普通玩家开始自己定制模型文件 — 本地 AI 部署门槛又降了一档

Reddit 本地 AI 社区出现一个被顶上热门的提问:玩家开始自己动手改模型文件。它指向的是——把 AI 跑在自己电脑里的整套工具链正在成熟,对中国企业来说,私有化部署的成本账需要重新算一遍。

Aug 222 分钟
Qwen阿里

Qwen 27B 被压成 1 bit — 8GB 显存跑得动,质量让人笑出声

本周 Reddit 用户测试了阿里 Qwen 27B 模型被压到 1 bit 的极端版本,在 8GB 显存笔记本上跑了起来——但输出像胡言乱语,用户自嘲「脑损伤」。这件事划出了本地 AI 的极限边界:模型能压到什么程度才真正碎掉?

Aug 202 分钟
SyzygyResearchMach-1

Syzygy团队把35B模型压进7GB,普通笔记本也能本地跑AI了

美国开源团队 SyzygyResearch 用极低比特量化,把 350 亿参数的大模型压成 7GB,普通笔记本能跑到每秒 120 字。这意味着以后本地跑 AI 可能不再需要顶级显卡,企业和个人的「私有 AI」门槛正在快速下降。

Aug 202 分钟
DeepSeekRTX 3060

4 张消费显卡跑通 144GB 大模型 — 本地 AI 部署的成本拐点正在到来

一位开发者用 4 块 RTX 3060(共 48GB 显存)+ 普通工作站,跑通了 144GB 的 DeepSeek-V4-Flash 量化版,提示处理约 100 token/s。值得关心的是:本地大模型不再必须堆 A100/H100,企业级私有 AI 的硬件门槛可能比预想低一截。

Aug 182 分钟
QwenRTX 3090

RTX 3090 跑出 27B 模型 82 token/秒 — "大模型必须上云"的论调该松动了

独立开发者用一张 2020 年上市的 RTX 3090,把 27B 规模的 Qwen 模型压进 14GB 显存跑出每秒 82 token。技术细节值得工程团队收藏;它真正传递的信号是:本地 AI 的硬件成本曲线,正在和云端正面竞争。

Aug 162 分钟
DeepSeek本地大模型

DeepSeek V4 Flash 本地跑分反超云端 — 但「跑得快」和「真能用」是两件事

一位开发者把 DeepSeek V4 Flash 跑在自家 MacBook 上,代码任务通过率 29.4%,比官方 API 的 17.6% 高出一截,也压过了 Claude Opus。这意味着「本地模型能不能替代云端」的天平正在倾斜——但单跑分不能说明一切。

Aug 92 分钟
LoRA大模型微调

定制大模型仅更新1%参数:微调量化让AI专才流水线化,落地门槛实质降低

本文解析大模型微调与量化全流程:微调让通才变专才,量化为模型瘦身。LoRA等高效微调技术仅需更新1%参数,正让中小企业用消费级显卡定制AI成为可能,是模型落地的关键基建。

May 52 分钟
APEXQwen

APEX量化新增25款模型:百亿参数AI塞进家用显卡,算力门槛正被抹平

开源项目APEX推出针对MoE模型的新量化方案,一个月新增25款以上压缩模型,并推出极低体积的I-Nano层级。这让原本需企业级算力的百亿参数AI,现在单张家用显卡即可运行,大幅降低本地部署成本。

May 52 分钟
Qwen本地部署

Qwen3.6 反常识:35B 比 27B 更快更好 — 参数规模不是选模型的靠谱标尺

Qwen3.6 的 35B 版本被开发者实测发现比 27B 质量更高、速度更快,打破"参数少更轻快"的常识。这提醒企业:模型选型不能只看参数量,实测数据比数字更重要。

May 32 分钟
QAT模型量化

AI模型量化告别全盘降级,混合精度拓扑设计成工程新解

AI模型在16位切8位部署时易精度崩塌,新方法提出以8位为底座、对敏感层做16位升级的“等效拓扑”设计,兼顾性能与精度,标志着模型部署走向精打细算。

May 12 分钟
QwenUnsloth

Qwen3.6-27B量化跑进单张消费显卡—本地部署甜蜜点正在出现

Qwen3.6-27B 经 Unsloth Q5 量化后部署在单张 RTX 5090 上实测,19 轮任务表现稳定。中等规模模型的本地部署可行性正在实质性提高,值得关心硬件成本与能力边界的交汇点。

May 12 分钟