Google 开源 Gemma 4 长文本翻车 — 本地跑大模型的坑比想象中深
Google 开源的旗舰大模型 Gemma 4 31B 这周在 Reddit 开发者社区被报告:原本在 68k 上下文长度下稳定运行的设置,突然开始报「超出共享内存」错误。我们注意到,这件事刺穿了一个泡沫——开源大模型在跑分之外的真实稳定性,被普遍低估了。
相关推荐
基于 #开源模型 推荐
Mica小模型
30 美元训练的小模型把对手甩开 4 倍 — 大模型「越大越强」开始出现裂缝
独立开发者用 30 美元租显卡训练出 4B 参数的 Mica——它不写文字,只输出每个动作的概率用于决策。三个种子的方块测试中,Mica 平均清行数约为对照模型的 4 倍。重点不在游戏成绩,而在「专精小模型」挑战「通用大模型」的可能性。
9月26日·www.reddit.com
Qwen开源模型
27B 模型在家通宵写代码 — 个人本地 AI 编程已成真事,但「怎么管」才是真问题
开发者 Jan 用两块 16GB 显卡在家跑 Qwen3 27B 开源模型,让它通宵自动写出两个监控工具。真正值得关心的不是模型本身,而是「记忆存文件、每步先验收、人随时叫停」这套协作流程。用 AI 写代码这件事,已经从大公司预算变成个人显卡能跑的事。
9月25日·www.reddit.com
Qwen3阿里
有人在 12GB 显卡上把 Qwen3.8 跑到 65 token/s — 中国开源大模型的本地化拐点
一位开发者用自写推理引擎,把阿里开源的 Qwen3.8-Flash-Next 在一张 12GB 消费级显卡上跑到每秒 65 token 输出。这是「中国开源权重 + 全球社区专门优化 + 消费级硬件」组合在本地部署上的又一次突破,对关心 AI 成本和私有化的企业与个人都值得关注。
9月24日·www.reddit.com
QwenHermes
6 张显卡把 AI Agent 装进家里 — 开源三件套首次跑出实用速度
一位玩家用 6 张消费显卡搭出本地 AI Agent 组合,速度够用还能手机远程操控。说明开源家用化部署已具备日常可行性,但 2 万元门槛和电费噪音仍是拦路虎。
9月26日·www.reddit.com
DeepSeekNVIDIA
DeepSeek 把模型切成两半跑:Mac 加 NVIDIA 协同,开源 AI 落地战升级
DeepSeek-V4.1-Flash 在社区被切成两半部署:前层跑 Apple M5 Ultra,后层跑两张 RTX PRO 6000。关键数字是 prompt state 仅 0.9 KB/token。我们认为这意味着 AI 竞争正从堆参数转向比部署成本。
9月26日·www.reddit.com
Qwen阿里巴巴
玩家显卡跑得动阿里千问了 — 但普通人用本地 AI 还早
本周 Reddit 上一个信号:有人用 RTX 5090 显卡在家跑阿里千问的压缩版,每秒 40 字。但对绝大多数人和企业来说,本地 AI 还只是技术圈的自嗨,主流依然是云端 API。
9月26日·www.reddit.com