返回首页
MoE架构
找到 4 篇关于此标签的文章
阿里Qwen
阿里 Qwen 让本地玩家又爱又恨 — 他们想要一个'跑得动'的版本
一位 Reddit 用户发帖说阿里的 Qwen 3.8 27B 模型质量很好,但在他 M1 Max 苹果笔电上跑一晚上。他在求一个 35B A3B 版本——总参数 35B、激活仅 3B——稍微笨但快得多。这件事值得关心:本地大模型卡在'够聪明但太慢'的硬件墙上。
6d ago2 分钟
AI9StarsG9v3-39A5B
390 亿开源大模型被装进个人电脑 — 这次功劳不在公司
AI9Stars 的 G9v3-39A5B 模型被 Reddit 用户量化到 GGUF 格式,并 fork 了 llama.cpp 才跑通。这说明开源大模型生态最真实的状态:好模型不少,配套全靠民间接力。
Aug 152 分钟
阿里巴巴Qwen3-Max
阿里开源 2.4 万亿参数大模型 — 国内企业第一次有「不押注 OpenAI」的选项
阿里把 Qwen3-Max 最大版本(2.4 万亿参数)的权重全部公开,号称性能逼近闭源前沿。这是中国企业第一次有「不绑定 OpenAI 或 Anthropic 也能拿到近顶级 AI」的现实选项。
Aug 122 分钟
DeepSeekGPT-5.5
DeepSeek V4 报价仅 GPT-5.5 的 1/22 — 大模型竞争从拼能力转向拼效率
DeepSeek 发布 V4 大模型,Pro 版每百万 tokens 仅 3.48 美元,为 GPT-5.5 的 1/22。靠架构创新而非补贴实现低价,AI 应用的经济模型正在被重写,7×24 小时 Agent 场景的门槛从企业级降到了个人可负担。
May 42 分钟