智谱开源 GLM-5.3-Flash:性能追 Claude Opus,价格只收上代十分之一
本周 Z.ai(智谱)放出了 GLM-5.3-Flash 的完整模型权重,3200 亿参数只激活 180 亿(MoE 架构——把模型拆成多个"专家",每次只调用其中几个),号称在编程和 Agent 类基准上接近 Claude Opus 4.8,自家定价只有 GLM-5.2 的十分之一。这是智谱第一次以 MIT 协议(最宽松的开源许可,允许商用、修改、再分发)公开主力模型的权重。
相关推荐
基于 #开源大模型 推荐
DeepSeekNVIDIA
DeepSeek 在两台几万元小机器上跑出 67 token/s — 本地大模型门槛正在塌方
本周一位 Reddit 用户用两台 NVIDIA DGX Spark 工作站(约 6 万元)跑出 DeepSeek V4 Flash 67-84 token/s 的稳定输出,配 100 万 token 上下文。我们关心的是这份民间复刻印证了一个被低估的趋势:开源大模型本地部署的成本正在快速下沉,企业
8月29日·www.reddit.com
QwenGLM
阿里和智谱同时押注小模型 — 本地 AI 圈开始陷入选择困难
阿里 Qwen Flash 和智谱 GLM Flash 几乎同时推出,让本地部署用户陷入"留一个还是都要"的纠结。这背后是中国开源大模型从"卷参数"转向"卷同档位"的信号。
8月29日·www.reddit.com
智谱AIZCode
智谱3亿Tokens免费送 — 中国大模型价格战打到开发者家门口
智谱AI旗下编程工具ZCode推出周末活动,免费送3亿Tokens(GLM-5.3-Flash模型),有效到8月底。这看似薅羊毛机会,背后是中国大模型公司在开发者圈层的获客争夺战。
8月29日·juejin.cn
llama.cppMoE
llama.cpp 还有 50 个 PR — 本地跑 AI 不必靠显卡
开源项目 llama.cpp 攒 50+ 性能优化待合并,部分让 CPU 推理提速 3 倍。「本地跑大模型」正摆脱对高端显卡的依赖 — 敏感行业的私有部署和普通用户的离线 AI,都会因此更便宜。
8月29日·www.reddit.com
TenstorrentQwen3
Tenstorrent 跑通 Qwen3.7-27B — 非英伟达 AI 芯片商用破冰
Tenstorrent 用户晒出 QuietBox 2 工作站跑 Qwen3.7-27B 的推理数据。这是非英伟达阵营首次拿出接近商用的实测成绩,但距离撼动英伟达生态还很远。
8月29日·www.reddit.com
Ling金融大模型
金融大模型跑分争议:每家都穿自己的装备上场,这榜还公平吗
本周 Reddit 技术圈拆解了一张国内金融大模型 Ling 的官方跑分卡:不同模型在不同测试里用了完全不同的推理设置、Agent 框架甚至工具,所谓的榜单排名更像一场「测试方案」的比拼。这事对所有用 benchmark 选模型的企业和投资人都值得警惕。
8月29日·www.reddit.com