小模型编程涨 8.55% — 开源量化技术撬动「越大越香」叙事
相关推荐
基于 #LocalLLaMA 推荐
Sesame AIChatGPT
语音 AI 想跑在本地?12GB 显卡暂时还差口气
本周 Reddit 的 LocalLLaMA 社区有热帖追问:有没有能在 12-24GB 消费级显卡上跑的语音对话模型,能对标 Sesame 或 ChatGPT 的体验。答案是——目前还没有真正能打的本地方案。云端语音 AI 的体验优势,正在成为本地化部署的下一道关卡。
8月29日·www.reddit.com
Political CompassLocalLLaMA
大模型也要测政治立场了:Reddit 用户拿 Political Compass 跑了十几个模型
Reddit 用户 Thrumpwart 把十几款主流大模型丢进 Political Compass 测试,结果多数偏向经济左翼 + 社会自由象限。这事表面是社区玩票,背后是训练数据偏见与企业部署选型的真实风险。
8月29日·www.reddit.com
NVIDIADGX
DGX 跑 AI 也过热 — NVIDIA 旗舰得用户自己加风扇这事说明什么
一位 Reddit 用户给 NVIDIA DGX 加装主动散热,因为跑 DeepSeek 等模型时过热。这是真实的本地 AI 部署问题:即使是 NVIDIA 旗舰,持续负载下也得用户自己魔改,「即插即用」的叙事被戳穿。
8月29日·www.reddit.com
GoogleGemini
Google 把语音转文字错误率压到 2.6% — 但不是每个场景都该用
Google 本周上线 Gemini 3.5 Transcribe,把语音转文字的错误率从上一代约 7.3% 压到 2.6%。这件事值得关心,是因为会议记录、客服质检、法律取证这些场景的可靠性门槛被进一步压低。
8月29日·juejin.cn
llama.cppMoE
llama.cpp 还有 50 个 PR — 本地跑 AI 不必靠显卡
开源项目 llama.cpp 攒 50+ 性能优化待合并,部分让 CPU 推理提速 3 倍。「本地跑大模型」正摆脱对高端显卡的依赖 — 敏感行业的私有部署和普通用户的离线 AI,都会因此更便宜。
8月29日·www.reddit.com
DeepSeekNVIDIA
DeepSeek 在两台几万元小机器上跑出 67 token/s — 本地大模型门槛正在塌方
本周一位 Reddit 用户用两台 NVIDIA DGX Spark 工作站(约 6 万元)跑出 DeepSeek V4 Flash 67-84 token/s 的稳定输出,配 100 万 token 上下文。我们关心的是这份民间复刻印证了一个被低估的趋势:开源大模型本地部署的成本正在快速下沉,企业
8月29日·www.reddit.com