返回首页

MoE

找到 27 篇关于此标签的文章

llama.cppMoE

llama.cpp 还有 50 个 PR — 本地跑 AI 不必靠显卡

开源项目 llama.cpp 攒 50+ 性能优化待合并,部分让 CPU 推理提速 3 倍。「本地跑大模型」正摆脱对高端显卡的依赖 — 敏感行业的私有部署和普通用户的离线 AI,都会因此更便宜。

2h ago2 分钟
QwenOrnith

Ornith 微调版跑赢 Qwen 原版、逼近 27B 满血 — 32GB 单卡跑 Agent 工具调用的成本拐点

Reddit 开发者用 32GB V100 跑了 300 多小时,对 Qwen3.6-35B-A3B 三个微调版做工具调用测试。Ornith 1.5 和 Tiel-Coder 大幅跑赢原版,也超过了 Qwen3.6-27B 密集模型,逼近尚未发布的 Qwen3.8-27B。本地跑 Agent 的硬件

4d ago2 分钟
MetaMobileMoE

Meta 把 5.3B 参数大模型塞进 3GB 手机内存 — 但只能研究用

Meta 放出 MobileMoE:5.3B 总参数、激活不到 1B,INT4 压缩后 <3GB,手机内存就能装下。但 FAIR NC 协议禁止商用——这是学术礼物,不是产品武器。

5d ago2 分钟
Deepseekllama.cpp

想本地跑 Deepseek 的人卡了三天 — 「本地大模型」不是装个软件那么简单

一位硬件发烧友用 48GB + 24GB 两块显卡想本地跑 Deepseek,折腾三天才发现:加第二张卡反而比单卡更慢。本地大模型不是装个软件那么简单。

Aug 222 分钟
dots3-notellama.cpp

dots3-note 开源:280B 参数、512K 上下文,押注'AI 记笔记'

本周开源模型 dots3-note 进入 llama.cpp:280B 总参数、512K 上下文、多模态输入,主打'长上下文记忆+笔记式学习'。这是又一个把闭源顶级规格开放出来的开源权重模型。

Aug 212 分钟
OrnithMTP

Ornith 1.5 出厂带了个没训练的部件 — 开源 AI 品控问题被低估了

Ornith 1.5 大模型被扒出发版时附带一个未经训练的 MTP 模块。这不是简单 bug,而是开源 AI 生态品控机制的缩影,值得每一个想用它降本的企业重新审视。

Aug 202 分钟
开源模型Qwen

开源社区冒出个神秘大模型 — 跑分超 Qwen 顶级版,但没人知道谁训的

GitHub 上一个叫 g9v3-39a5b 的 MoE 模型,本周突然出现在第三方评测榜上,部分跑分超过 Qwen 27B 系列。社区 llama.cpp 适配分支已同步上线。没有公司背书、没有发布会,它代表了开源生态一种新的「野蛮生长」方式。

Aug 202 分钟
Ornith开源大模型

Ornith 1.5 一次放出三个尺寸 — 开源小厂也敢做 397B MoE 了

本周 r/LocalLLaMA 一个不起眼的帖子:开发者 tarruda 发布了 Ornith 1.5,覆盖 9B 密集模型、35B 和 397B MoE(混合专家)三个版本。397B 这种过去只有头部大厂才碰的规模,现在个人开发者也能做了 — 这件事的意义不在模型本身,而在'大模型门槛下移'又多了

Aug 192 分钟
Ornith-1.5Claude Opus 4.8

397B 开源模型对标 Claude Opus 4.8 — 开源阵营真追上来了

开源模型 Ornith-1.5 三档尺寸(9B/35B/397B)发布,官方称在 Agent 与编程任务上接近 Claude Opus 4.8。这是开源阵营第一次在顶级基准上摸到闭源天花板的边缘。

Aug 192 分钟
Z.aiGLM-5.3

Z.ai 用 GLM-5.3 做了一组对照实验 — 想证明堆参数不如堆训练

Z.ai 发布 GLM-5.3,参数和上一代完全相同,只在后训练上多投入一个月。这背后是一个行业级判断:当参数堆到阈值,决定大模型能力的不是模型变大,而是训练方法变聪明。这件事关乎所有企业未来 18 个月采购 AI 的方式。

Aug 192 分钟
通义千问Qwen

通义千问公开劝开发者别等 35B 模型:开源节奏可能正在变

通义千问开发者在 Reddit 一句「别等 35B-A3B 模型」引爆海外开源社区。这背后是技术路线调整、投入收缩,还是开源策略整体转向?我们梳理三种可能,并指出对依赖 Qwen 做底座的小团队意味着什么。

Aug 182 分钟
通义千问阿里云

通义千问 35B 新版还没官宣,本地 AI 圈已开始倒数 — 中国开源大模型路线对了

Reddit 本地 AI 圈正等待通义千问 Qwen 3.8 35B A3B 版本,可能采用 MoE 架构(35B 总参数、激活 3B),延续中国开源模型「小而强」路线。

Aug 182 分钟
LingLocalLLaMA

Ling 3.0 Tiny 让 4G 老电脑跑到 36 token/秒 — 一条 Reddit 帖子背后的小模型趋势

一位 Reddit 用户报告 Ling 3.0 Tiny 在 4GB 显存的旧电脑上跑到 36 token/秒,并称效果接近 Qwen 3.5 9B。这条单点帖子需要打折,但指向的趋势值得关心:消费级硬件跑得动、效果够用的小模型正在变多。

Aug 172 分钟
Inclusion AILing 3.0

中国团队把 Ling 3.0 合并进 llama.cpp — 1B 激活参数就能本地做复杂推理

Inclusion AI 的 Ling 3.0 系列本周合并进 llama.cpp,让开发者用消费级硬件就能本地部署。最让我们意外的:tiny 版本激活参数仅 10 亿,却被标注为推理模型——能做多步思考。意义:中国开源在推理能力上正以更小参数逼近闭源前沿。

Aug 172 分钟
Qwen3.8Qwen3.6

Qwen3.8 27B 在 12GB 显存上跑不顺:MoE 才是正解

一个 Reddit 实测在 12GB 显存笔记本上跑 Qwen3.8 27B,结果 2-bit 版错题、3-bit 版卡顿,老一代 Qwen3.6 MoE 反而又快又对。

Aug 162 分钟
Qwen阿里通义千问

Qwen 3.8 疑似在 GitHub 现踪 — 阿里通义的开源节奏让对手难追

有人在阿里通义的 ms-swift 框架代码里发现 Qwen 3.8 35B-A3B 的踪迹,意味着开源大模型头号选手之一正在酝酿下一轮更新。这值得关心,因为 35B 档位是企业自建 AI 最实用的尺寸。

Aug 152 分钟
Qwen阿里

1500 元显卡跑通 Qwen 30B — 本地大模型硬件门槛又往下掉

Reddit 用户用入门级 RTX 3050 6GB 显卡跑通了阿里 Qwen 30B 模型的 MoE 版本(一种把大模型拆成多个"专家"、按需激活的架构),9 万字上下文下达到每秒 30 token 的生成速度。这件事值得企业 IT 决策者重新评估本地部署大模型的成本曲线。

Aug 142 分钟
dots-studiodots3-note preview

280B 大模型只激活 16B — 开源模型竞争重心从'总参数'转向'激活参数'

dots-studio 这周在 Hugging Face 上线 dots3-note preview:280B 总参数的 MoE 架构,每次推理只激活 16B,支持 512K 上下文与多模态输入。这件事值得关注,是因为开源大模型的竞争重心正在从'总参数越大越好'转向'每次实际花多少算力'。

Aug 142 分钟
DeepSeekDeepSeek-V4

DeepSeek V4 在 32GB 笔记本跑出 70 tok/s — 本地大模型终于能塞进一台电脑了

有开发者把 DeepSeek V4 这类超大 MoE 模型硬塞进 32GB 内存笔记本,靠重排权重和投机预取专家层,跑出 70 tok/s 的输入速度。虽然输出还慢,但证明消费级硬件跑顶级模型正在变成现实。

Aug 92 分钟
DeepSeekMoE

300B 参数大模型塞进 32GB 笔记本 — 个人本地 AI 开始够用了

一位开发者把 DeepSeek V4 的 300B MoE 模型跑在了 32GB 内存的笔记本上。值得关心的是:硬件瓶颈从算力转向了硬盘读取速度,本地大模型第一次有了「真能干活」的味道。

Aug 92 分钟
Gemma 4Google

Reddit 冒出 Gemma 4 民间改版,开源大模型竞争开始比“可改造性”

一则 Reddit 帖子透露,开发者正在做 Gemma 4 的非官方改版,甚至准备扩展到 26B MoE(混合专家架构,用多个子模型分工推理)。这件事本身不算大新闻,但它提醒我们:开源模型的竞争,正从“谁先发布”转向“谁更容易被社区改造”。

Jun 62 分钟
TinygradBlackwell

Tinygrad 在 Blackwell 集群上测 MoE — 本地 AI 社区开始玩最贵的硬件乐高

有人在 Blackwell + M3 Ultra 的 RDMA 集群上跑 Tinygrad 测 MoE 模型,近 2TB 显存。这不是企业发布,而是社区极客的自发实验——本地派正在用最激进的硬件组合,试探开源框架的极限。

May 32 分钟
QwenCoder-Next

Qwen3.6-27B 与 Coder-Next 实测打平 — 选模型不看跑分看场景

一位开发者用 20 小时实测发现,Qwen3.6-27B 与 MoE 架构的 Coder-Next 整体胜率持平,但在不同任务上表现天差地别。更意外的是:关闭「思考模式」反而更稳定。传统跑分正在失灵,场景选型才是关键。

May 32 分钟
MiniMax-M2.7llama.cpp

MiniMax-M1 229B MoE 首批 GGUF 量化版本现已支持 Apple Silicon

社区贡献者发布 MiniMax-M2.7(229B MoE)的首批 GGUF 量化版本,提供 Q3_K_L(110GB)和 Q8_0(243GB)两种规格,现已上架 HuggingFace。

Apr 122 分钟
llama.cppQwen

37 个大语言模型在 MacBook Air M5 32GB 上完成基准测试:完整速度结果

社区使用 llama-bench 在 M5 Air 32GB 上对 37 个本地 LLM 进行基准测试,结果显示 MoE 模型在速度与质量比方面表现最佳。

Apr 62 分钟
Gemma 4vLLM

在 vLLM 上运行 Gemma 4 26B-A4B:社区故障排查笔记

开发者报告在 vLLM 上部署 Gemma 4 26B-A4B 结果不一,DGX Spark GB10 上的 INT4 量化版本速度过慢。

Apr 62 分钟
llama.cppQwen Coder

APEX 量化与 K-Quants:为何 MoE 编码模型需要不同的压缩策略

APEX 量化针对 MoE 架构的连贯性层采用 Q8 精度,在跨文件编码代理任务中表现优于通用的 K-quants 方法。

Apr 62 分钟