返回首页

GGUF

找到 16 篇关于此标签的文章

Hugging FaceTransformers

Hugging Face 把 GGUF 装进 Transformers — 研究、调试、部署终于共用一套工具

本周 Hugging Face 把 GGUF 压缩模型格式原生接入 Transformers 库,让研究、调试、本地部署第一次站在同一套 PyTorch 工具上。M2 Max 笔记本上的实测速度已追到 llama.cpp 的 98%,但 Hugging Face 同步表态「不打算替代 llama.c

9月23日2 分钟
腾讯GGUF

腾讯把 1.5TB 模型压到 200GB — 本地部署大模型的门槛正在消失

这周腾讯把 1.5TB 大模型压到 200GB,性能保留约 98%。这件事意味着企业本地跑大模型的硬件门槛被实质性跨过,对云端 API 的商业模式是个微妙信号。

8月29日2 分钟
Hugging FaceGGUF

Hugging Face 审计结果:14% 的开源 AI 模型文件名实不符

一位独立开发者审计了 Hugging Face 上 25 个仓库的 443 份 GGUF 量化模型文件,发现 64 份——约 14%——的文件名与实际精度不符。本地跑 AI 的玩家需要重新审视自己的模型清单。

8月28日2 分钟
AI9StarsG9v3-39A5B

390 亿开源大模型被装进个人电脑 — 这次功劳不在公司

AI9Stars 的 G9v3-39A5B 模型被 Reddit 用户量化到 GGUF 格式,并 fork 了 llama.cpp 才跑通。这说明开源大模型生态最真实的状态:好模型不少,配套全靠民间接力。

8月15日2 分钟
Qwen阿里

本科生租 4090 击败六家压缩团队,Qwen 9B 量化已逼近无损

阿里 Qwen3.5-9B 被一个本科生用自研压缩管线做到接近无损。这一战意味着开源"单兵"开始系统性反超成熟团队——但量化方法、压缩标准的定义权,也在悄悄离开中国。

8月14日2 分钟
UnslothMuse-Glimmer

Unsloth 推 30B 参数开源模型 — 本地跑大模型开始走出极客圈

Unsloth 上线 Muse-Glimmer-30B 的 GGUF 量化版本,意味着普通用户的笔记本也能跑 300 亿参数的大模型。我们关心的是:本地化部署正在从极客玩具变成企业 IT 的备选项。

8月10日2 分钟
MiniMaxMiniMax M3

MiniMax M3 因兼容性退回密集注意力,开源热度高但本地部署还不成熟

MiniMax M3 的社区版本近期被发现因暂不支持稀疏注意力而“退回密集注意力”,这意味着推理时计算成本明显上升。值得关心的是,大模型参数做得更大不等于普通人就能更方便地用上,部署生态反而成了下一道门槛。

6月13日2 分钟
GoogleGemma 4

谷歌 Gemma 4 修好对话模板 — 本地跑大模型的体验又往前挪了一步

谷歌开源模型 Gemma 4 的对话模板 bug 本周被修复,社区量化版同步更新。这不是大新闻,但说明本地部署 AI 的可用性正在被细节打磨一点点推高。

5月4日2 分钟
MistralUnsloth

Mistral 本地版文件损坏已修复 — 开源模型的品控盲区比你想的大

Mistral Medium 3.5 的本地运行版本此前全部文件损坏,输出乱码,本周被社区修复。小事一桩,但暴露了开源模型"官方只管 API、本地格式靠社区"的品控真空——对企业本地部署决策有实际影响。

5月2日2 分钟
UnslothQwen3.6

Qwen3.6 GGUF Benchmarks

Un sloth claims top KLD-vs-disk-space performance for Qwen3.6-35B-A3B quants in 21 of 22 pareto frontier comparisons.

4月17日2 分钟
Gemma 4Qwen3.5

Gemma 4 与 Qwen 3.5 GGUF 深度评测:oobabooga 的 量化基准分析

oobabooga 发布五份 GGUF 量化基准报告,采用 KL Divergence 方法对 Gemma 4 与 Qwen 3.5 系列模型的 70-90 个量化版本进行全面对比评 测。

4月15日2 分钟
Qwen3.5GGUF

Qwen3.5-9B GGUF Quant Rankings: Q8_0 Dominates KLD Scores

社区对 Qwen3.5- 9B 逾 35 种 GGUF 量化版本的 KLD 基 准测试显示,Q8_0 变体得分接近 0.001,Q5 以 下质量急剧下降。

4月14日2 分钟
llama.cppAndroid

端侧AI 模型部署实战五(Android大模型加载)

Step-by-step JNI bridge implementation for running quantized LLMs on Android using llama.cpp.

4月14日2 分钟
UnslothMiniMax-M2.7

Unsloth 发布 MiniMax M2.7 完整 GGUF 量化套件

Unsloth 为 MiniMax M2.7 上传 22 个 GGUF 量化版本,覆盖从 1-bit(60.7 GB)到 BF16(457 GB)的完整量化梯度,大幅降低本地部署门槛。

4月12日2 分钟
MiniMax-M2.7llama.cpp

MiniMax-M1 229B MoE 首批 GGUF 量化版本现已支持 Apple Silicon

社区贡献者发布 MiniMax-M2.7(229B MoE)的首批 GGUF 量化版本,提供 Q3_K_L(110GB)和 Q8_0(243GB)两种规格,现已上架 HuggingFace。

4月12日2 分钟
Gemma 4llama.cpp

Gemma 4 本地 CUDA 设置:精度陷阱与真实基准测试

在本地 CUDA 上运行 Gemma 4 时,若 KV 缓存边界处的数据类型不严格匹配,输出将静默退化。

4月7日2 分钟