Gemma
找到 30 篇关于此标签的文章
AMD 显卡跑本地大模型快了三成 — 不被英伟达卡脖子的理由又多一条
本周 llama.cpp 开源项目给 AMD RDNA3/RDNA4 显卡加了新的 Vulkan 加速代码,在 RX 7900 XTX 上跑 26B 参数模型时批量处理速度提升约 27%。对想自建本地 AI、又不想被英伟达绑定的中小企业,这是一条值得留意的信号。
95个Token做云规划、97%留本地:任务路由比模型本身更重要
Google Antigravity SDK本周支持本地模型,真正值得关注的是它示范的「任务路由」思路:把Agent任务按数据敏感性拆给云端和本地,云端只拿必要摘要、本地承担执行。这套思路比堆模型更能解决企业落地的合规和成本问题。
Google Gemma 开发者 Reddit 催更 — 开源大模型掉队
Google 开源大模型 Gemma 在 Reddit 开发者社区引发催更潮。一位用户公开呼吁推出新版,特别是 220B 规模、采用 MoE(混合专家)架构的版本。这背后是开源与闭源大模型竞争的白热化。
700 行 C 代码跑动 Google 最新大模型 — 单人项目跑赢 llama.cpp
开源项目 gemma4.c 把 Google Gemma 4 E2B 塞进 700 行 C 代码,普通 CPU 上 25.9 token/s 跑赢 llama.cpp。值得关心的是:AI 推理层工程门槛正被一位开发者踢开,过去一团队的事现在一个人就够。
Gemma4 与 Qwen3 同台打榜,两份权威榜单给出相反答案 — AI 评测陷入信任危机
Google Gemma4 31B 和阿里 Qwen3 27B 在 Artificial Analysis 与 LMArena 两份权威榜单上拿到了几乎相反的名次。这件事不只关乎两个模型谁更强——它暴露了 AI 评测正在系统性失灵,值得每一个打算用榜单做选型决策的人重新想想。
4060Ti 上小模型替掉 Gemma-12B — 大模型的副业正在被重新分配
Reddit 用户这周在 4060Ti 上用百聆 Ling Tiny 小模型替换掉 Gemma-12B 做'事后修正',称速度'惊人'。意味着:辅助类 AI 任务正在压向消费级硬件。
一个人用 16G 显卡把开源 AI 动手能力拉高三倍 — 本地 Agent 真便宜了
本周 Reddit 上一位开发者用消费级显卡微调 Google 开源的 Gemma 12B,让 AI 调用工具的能力提升 2.7 倍。值得关心的是:本地部署的 AI 正在从「能聊天」走向「能干活」,成本曲线肉眼可见地在往下走。
普通玩家开始自己定制模型文件 — 本地 AI 部署门槛又降了一档
Reddit 本地 AI 社区出现一个被顶上热门的提问:玩家开始自己动手改模型文件。它指向的是——把 AI 跑在自己电脑里的整套工具链正在成熟,对中国企业来说,私有化部署的成本账需要重新算一遍。
Gemma 下载破 10 亿背后:Google 认真做开源,但开局已晚
Gemma 系列下载量刚破 10 亿,Google 在旧金山办开源庆功晚宴,DeepMind CEO Demis Hassabis 站台。开发者社区押注今晚会顺手发新模型。这一晚确认 Google 认真做开源——但 Meta 和阿里已经把位置占好了。
开源大模型编程能力突飞猛进,写作翻译原地踏步 — 评测标准是不是跑偏了
阿里 Qwen 最新版本在编程评测上刷新纪录,但 Reddit 开源社区一条热门讨论提醒我们:写作、翻译、多语言这些普通白领常用的能力,进步并没有跟上编程。我们关心的是 AI 公司的研发优先级,是否被商业化最快的编程市场带偏了。
Qwen 想太多、Gemma 太懒、Muse 没亮点 — 开源大模型进入挑刺时代
本周 Reddit r/LocalLLaMA 出现有意思现象:3 款新开源模型(Qwen 3.8、Gemma 4、Muse Glimmer)同周被集体吐槽。用户 MerePotato 感叹没有推理模型能逃过抱怨。挑刺背后是开源生态的真实张力。
Google 真推一款 120B 开源大模型,可能直接卡死 OAI 与 Anthropic 的 IPO 之路
Reddit 网友抛出一个大胆假设:Google 若推 1200 亿参数的开源旗舰大模型,可能同时卡住 OpenAI 与 Anthropic 的 IPO。这背后不是技术问题,而是西方企业对中国开源模型的「信任赤字」。
小模型编程涨 8.55% — 开源量化技术撬动「越大越香」叙事
一位开发者用张量级量化(给 AI 模型瘦身并保留关键能力的技术)让开源模型 Gemma 4 12B 编程能力提升 8.55%,模型体积几乎不变。这意味着「越大越强」的大模型叙事正在被开源社区啃食,对预算有限的中小企业是好消息。
一台 5000 元的迷你主机,跑得动 350 亿参数大模型 — 消费级 AI 的省钱新路子
Reddit 上 LocalLLaMA 社区这周传出实用经验:搭载 AMD Radeon 780M 集成显卡的迷你主机,配上 64GB DDR5 内存,就能本地跑 Qwen 35B 和 Gemma 31B 这种规模的开源大模型。整机成本不到 5000 元。这条路意味着,本地化、私密、不依赖云端的 A
Qwen 写代码强、Gemma 聊文本好 — 分词器差异比想象中更致命
一份 Reddit 用户的实测发现:同样 330 行代码,Qwen 切成 1609 个 token,Gemma 切成 4258 个。这个 2.6 倍的差距,可能就是两款开源模型表现风格迥异的隐藏原因。
让 AI 写三遍再自己挑最好的 — 小模型也能稳定产出的实用技巧
一位开发者用 Gemma 4 12B(参数规模约 120 亿的轻量模型)做 YouTube 视频摘要,让模型生成多版再自我打分挑选。实验证明「多次生成+自评」显著稳定,比单次输出更靠谱,给预算有限的中小企业和个人部署提供了低门槛思路。
5个月追平前沿能力的猜想走红,开源大模型正在逼近闭源护城河
一则来自 r/LocalLLaMA 的讨论把问题挑明:如果过去几代模型的追赶速度成立,27B 级开源模型可能在 5 个月内逼近今天更强的闭源能力。值得关心的不是预言准不准,而是闭源领先期正在缩短。
16GB Mac 跑起 Gemma 12B,但本地大模型离产品化还很远
一位开发者把 Gemma 12B 的 MLX 内核代码开源,并称在 16GB 的 M5 MacBook Pro 上可摸到 20-30 tok/s 上限。值得我们关心的是,这说明本地模型优化正在深入到底层,但离稳定、可交付的企业应用还有明显距离。
有人拿三款开源模型测试写邮件排版:模型会干活,审美仍是门槛
一位开发者用 3 款开源模型测试生成 HTML 邮件的效果,比较的不只是“能不能写”,而是“能不能写得像样”。这件事值得关心,因为企业开始把大模型接进邮件、客服和营销流程后,输出质量的差距会直接影响品牌观感。
Unsloth Studio 靠本地大模型前端出圈,但离主流企业工具还差一步
88 tok/s 的实测速度,让 Unsloth Studio 在本地大模型圈子里引发讨论。值得关心的不是一个新界面本身,而是本地 AI 工具正在从“能跑”走向“更好用”,但距离企业真正采用,仍隔着稳定性、集成和运维门槛。
一位开发者被模型 FOMO 逼到焦虑:大模型竞争正从能力转向“够不够用”
一位本地大模型用户在 Reddit 直言“快被 FOMO 搞疯了”,核心不是模型不够强,而是新模型、硬件涨价和限制政策叠加后,用户开始怀疑自己是否必须持续追新。值得关心的是,行业正在从“谁最强”转向“什么场景已经足够好用”。
Google 新版 Gemma 压缩模型跑分反常,低比特训练未必比普通量化更准
一位本地大模型用户在 Gemma 4 31B 的压缩测试里发现:Google 主打的 QAT Q4(量化感知训练,先按低精度约束训练再压缩)结果竟落后于普通 Q4,甚至不如另一种传统量化方案。这值得关心,因为大模型“更省显存”不等于“更好可用”。
Gemma 4 逐层嵌入引讨论 — 把知识和推理拆开存储,小模型的机会还是幻觉
Gemma 4 的逐层嵌入设计引发社区讨论:模型的知识存储和推理能力能否分开扩展?如果可以,2B 小模型或许能装下 20B 的知识量。这直接关系到企业用小模型本地部署的可行性边界。
开发者做出 Hugging Face 模型可视化工具 — 看懂大模型黑盒不再需要读代码
一位开发者推出 hfviewer.com,可将 Hugging Face 上的大模型架构转化为交互式图表。这值得关心,因为它把原本需要读代码才能理解的模型结构变成了直观视觉图,降低了非技术人员了解 AI 黑盒的门槛。
Qwen 3.6 跑分赢实测输 — 刷榜正在扭曲大模型能力认知
开发者实测 Qwen 3.6 与 Gemma 4,发现跑分领先的 Qwen 因死循环烧掉 8000+ Token 在真实任务中落败。大模型刷榜正扭曲能力认知,企业选型需从看榜单转向做实测。
Gemma 4 模型文件现身 HuggingFace — 开源社区跑在了官方工具链前面
有人将 gemma-4-31B-it-DFlash 上传至 HuggingFace,但 llama.cpp 尚不支持运行。开源模型迭代速度正把部署工具链甩在身后,拿到模型却用不起来,成了新尴尬。
NVIDIA 自研 4 位量化把 26B 模型塞进消费显卡 — 精度损失不到 1%
NVIDIA 发布 NVFP4 量化版 Gemma-4-26B,压缩至 18.8GB 可在消费显卡运行,6 项基准测试精度损失均不超过 0.7%。4 位量化正从妥协变成优选,但这也是 NVIDIA 生态锁定的一步棋。
Gemma 4 仅用1/5 token跑赢Qwen 3.6 — 本地部署开始拼效率
Reddit 用户用同一吃豆人游戏 Prompt 测试两个开源模型,Gemma 4 以1/5的token和1/5的时间产出更可玩的结果。这提醒我们:本地部署时代,模型效率比生成量更值得关注。
手机本地跑 AI 不再需要联网—— 一个开源安卓应用正在把这件事变得可操作
Pocket LLM v1.4.0 本周更新:安装包从捆绑模型压缩到约 200MB,用户可在 App 内自行下载所需模型、离线运行 AI 对话。这不是大公司发布会,而是开源社区悄悄推进「手机本地 AI」可用性的一个缩影——值得关注的信号是,离线 AI 的门槛正在从「极客专属」向普通用户移动。
我 们用 TranslateGemma-12B 对比了 5 款前沿大模型的 字幕翻译能力——它全面领先,但有一个严重 缺陷
Alconost 基准测试显示,这 款 12B 专用模型击败了 GPT-5.4 和 Claude Sonnet-4,但会悄无声息地输出错误的 中文字体变体。