Unsloth
找到 20 篇关于此标签的文章
HF 收购疑云下,Unsloth 让普通显卡跑得动大模型 — 开源生态的真正护城河
Unsloth 是一个让消费级显卡也能跑大模型的开源工具,最近因 HuggingFace 收购传闻被社区集体点赞。真正值得关心的是:当头部平台开始整合,开源生态里那些埋头写代码的团队,决定了普通人未来能不能便宜地用上 AI。
Reddit 用户催更阿里 35B 模型压缩 — 开源 AI 算力门槛又悄悄降了一档
一条 Reddit 请求呼吁把阿里 Qwen 35B 模型用新一代压缩方案重新量化。背后是开源 AI 算力效率持续突破,本地部署成本正在结构性下降。
通义千问发布 Flash 新模型,Unsloth 当天就适配 — 开源大模型的追赶速度变了
阿里通义千问这周推出 Flash 新模型,做本地部署优化的 Unsloth 几乎同一天宣布支持。这意味着开源模型从发布到「普通电脑能跑」的间隔正在被压到一天以内,值得企业 IT 决策者留意。
3000 块显卡跑通完整工程合并 — 本地 AI 编码首次走出 demo
一位独立开发者用一张 4060Ti 显卡(约 3000 元)跑 Qwen 27B 量化模型,让 AI 自主完成真实项目的功能开发并通过人工 review 合并进代码库。值得关心的是:这是开源本地 AI 第一次走通完整的工程化编码流程。
27B 大模型被压到 1-2 比特量化 — 本地跑 AI 又省内存,但质量不稳定
本周 Reddit 用户 jojohai 把 Qwen3.8-27B 模型做成 Q1-Q2 极低精度版本,并把多 token 预测能力直接嫁接进权重。结论:内存占用比外挂方式更低,但关掉「思考模式」时模型「非常笨」,目前只是社区玩具。
千问 27B 单卡跑出 80 步 Agent — 本地模型开始能替人干活了
本周 Reddit 一则实测让人侧目:千问 27B 模型在一张消费级显卡上,仅凭一段提示词就自主调用 80 次工具完成查课表、抓视频、转录等任务。这不只是技术演示,'Agent 必须跑云端'的默认假设正被开源改写,门槛塌得比多数人预想的快。
Unsloth 把 Qwen 压到 8GB 内存可跑,本地大模型真不挑机器了
开源部署工具 Unsloth 这周更新「Dynamic v3.0」量化方案,让 Qwen 系列模型在 8GB 内存的普通笔记本上就能跑,最极端的 1-bit 版本仍保留 77% 准确率。这直接降低了企业本地跑大模型的硬件门槛和数据外传顾虑,值得决策者看一眼。
Qwen 3.8 开源:27B 模型跑进 RTX 4090 — 闭源旗舰的护城河真的在松动
阿里通义千问发布 Qwen 3.8 开源权重,27B 模型在编码、Agent 跑分上超过 Claude Opus 4.6 Max,4-bit 量化后 24GB 内存即可本地运行。对企业 IT、开发生态和硬件市场都是新变量。
Unsloth 推 30B 参数开源模型 — 本地跑大模型开始走出极客圈
Unsloth 上线 Muse-Glimmer-30B 的 GGUF 量化版本,意味着普通用户的笔记本也能跑 300 亿参数的大模型。我们关心的是:本地化部署正在从极客玩具变成企业 IT 的备选项。
Kimi K3 被砍掉 33% 体积只跑英语 — 本地大模型正在悄悄变得「用得起」
Moonshot 的 Kimi K3 经社区量化(用更少位数重新编码)后从 711GB 压缩到 478GB,代价是只保留英语。一个 2-bit(极低精度)变体甚至在编程基准上反超前代。这意味着本地跑千亿参数(千亿级模型权重)大模型的硬件门槛正在被民间力量踏平。
本地跑大模型的「压缩格式」之争 — MLX 4bit 量化谁更值得用
有人在 Reddit 上比较了在苹果芯片上跑开源大模型(如 Qwen3.6)的几种 4bit 量化方案。这是「本地 AI」玩家关心的小事:量化格式决定模型占用内存、生成速度和回答质量,普通人不必懂,但值得知道这件事正在被认真优化。
Kimi K3 传出 2.8 万亿参数,中国模型的难题已从发布转向部署
Reddit 社区流出一条关键信息:Kimi K3 可能达到 2.8 万亿参数。若属实,这不是“更强了”这么简单,而是中国大模型公司正越来越像 OpenAI 一样,把竞争推向训练后能力与部署成本的拉锯战。
Google 新版 Gemma 压缩模型跑分反常,低比特训练未必比普通量化更准
一位本地大模型用户在 Gemma 4 31B 的压缩测试里发现:Google 主打的 QAT Q4(量化感知训练,先按低精度约束训练再压缩)结果竟落后于普通 Q4,甚至不如另一种传统量化方案。这值得关心,因为大模型“更省显存”不等于“更好可用”。
IBM 开源 Granite 4.1 小模型,21 个量化版本实验证明瓶颈不在体积
IBM 发布 Apache 2.0 开源的 Granite 4.1 系列。有人用 21 个不同大小的量化版本画鹈鹕,发现质量无差异 — 小模型的能力短板不在压缩精度,在基础能力本身。
Mistral 本地版文件损坏已修复 — 开源模型的品控盲区比你想的大
Mistral Medium 3.5 的本地运行版本此前全部文件损坏,输出乱码,本周被社区修复。小事一桩,但暴露了开源模型"官方只管 API、本地格式靠社区"的品控真空——对企业本地部署决策有实际影响。
Mistral 3.5 推理 bug 被开源团队修复 — 大模型交付质检亮红灯
开源团队 Unsloth 修复了 Mistral Medium 3.5 的推理缺陷,起因是一个核心参数配置错误。这暴露出大模型公司在交付商业产品时质检流程严重缺位,企业客户需警惕“社区公测”模式带来的业务风险。
Qwen3.6-27B量化跑进单张消费显卡—本地部署甜蜜点正在出现
Qwen3.6-27B 经 Unsloth Q5 量化后部署在单张 RTX 5090 上实测,19 轮任务表现稳定。中等规模模型的本地部署可行性正在实质性提高,值得关心硬件成本与能力边界的交汇点。
Qwen3.6 GGUF Benchmarks
Un sloth claims top KLD-vs-disk-space performance for Qwen3.6-35B-A3B quants in 21 of 22 pareto frontier comparisons.
GPoUr with ~12gb vram and a 3080 getting 40tg/s on qwen3.6 35BA3B w/ 260k ctx
ll ama.cpp 的 turboquant 分支通过 turbo3 KV cache 量化, 在单张 RTX 3080 12GB 显存上实现 Qwen3-35B-A3B 约 40 tok/s 推理速度,并支持 260k 上下文窗口。
Unsloth 发布 MiniMax M2.7 完整 GGUF 量化套件
Unsloth 为 MiniMax M2.7 上传 22 个 GGUF 量化版本,覆盖从 1-bit(60.7 GB)到 BF16(457 GB)的完整量化梯度,大幅降低本地部署门槛。