返回首页

Gemma 4

找到 17 篇关于此标签的文章

Gemma 4Google

把 AI 模型压到 1/4 大小还能保住 96% 能力 — 本地跑 AI 的成本拐点可能到了

海外技术社区本周出现一项让人意外的结果:通过精细的精度分配,把 3.3GB 的小模型推理分数从 28.9 提到 69.5。这意味着在普通笔记本、手机上跑出「够用」的 AI,成本可能比想象的更低。

8月15日2 分钟
Gemma 4Google

Reddit 冒出 Gemma 4 民间改版,开源大模型竞争开始比“可改造性”

一则 Reddit 帖子透露,开发者正在做 Gemma 4 的非官方改版,甚至准备扩展到 26B MoE(混合专家架构,用多个子模型分工推理)。这件事本身不算大新闻,但它提醒我们:开源模型的竞争,正从“谁先发布”转向“谁更容易被社区改造”。

6月6日2 分钟
GoogleGemma 4

Gemma 4 大模型或将继续扩容,谷歌开始补齐高端开源牌桌

一则来自社交平台的线索指向 Gemma 4 可能新增更大参数版本,外界甚至猜测会到 120B 级别。我们判断,这不只是一次产品补档,更像谷歌在开源模型赛道补齐“大模型旗舰位”,以回应 Meta 和阿里等玩家的尺度竞争。

6月3日2 分钟
GoogleGemma 4

Google 让 Gemma 4 生成速度翻倍 — 小模型带大模型跑的"投机解码"成主流

Google 发布 Gemma 4 系列 MTP 模型,通过"投机解码"技术实现最高 2 倍加速且输出质量不变。这意味着本地部署大模型的实用性显著提升,算力门槛进一步降低。

5月5日2 分钟
GoogleGemma 4

谷歌 Gemma 4 修好对话模板 — 本地跑大模型的体验又往前挪了一步

谷歌开源模型 Gemma 4 的对话模板 bug 本周被修复,社区量化版同步更新。这不是大新闻,但说明本地部署 AI 的可用性正在被细节打磨一点点推高。

5月4日2 分钟
Gemma 4Google DeepMind

教程上新丨一键部署Gemma 4 31B,最高256K上下文,能力媲美Qwen3.5 397B

Google DeepMind 开 源 Gemma 4 31 B 现已登 陆 OpenBayes, 一 键部署, 256 K 上下文,Apache 2.0 授 权, 基 准 测 试表 现 媲美 Qwen 3 .5 397B。

4月16日2 分钟
Gemma 4Qwen3.5

Gemma 4 与 Qwen 3.5 GGUF 深度评测:oobabooga 的 量化基准分析

oobabooga 发布五份 GGUF 量化基准报告,采用 KL Divergence 方法对 Gemma 4 与 Qwen 3.5 系列模型的 70-90 个量化版本进行全面对比评 测。

4月15日2 分钟
Gemma 4MLX

Gemma 4 audio with MLX

Google's Gemma 4 E2B model can transcribe audio locally on macOS using MLX and a single uv run command.

4月13日2 分钟
Gemma 4llama.cpp

修复 llama.cpp 中 Gemma 4 工具调用问题:根本原因解析

llama.cpp 中处理 Gemma 4 聊天模板的四个漏洞导致工具调用结果崩溃或陷入循环。

4月8日2 分钟
Gemma 4Qwen3

通过系统提示词控制 Gemma 4 思考令牌

用户难以像控制 Qwen-30B-A3B 那样,通过系统提示词可靠地切换 Gemma 4 的推理模式,暴露了模型在思考令牌控制上的实践缺口。

4月8日2 分钟
Gemma 4LiteRT

Gemma 4 发布时 Google 禁用了隐藏的 MTP 头部

开发者在 Gemma 4 的 LiteRT 文件中发现了多 token 预测权重;Google 确认 MTP 存在但被故意禁用,旨在确保兼容性与广泛可用性。

4月7日2 分钟
Gemma 4Google DeepMind

Gemma 4 31B 在 EuroEval 五项欧洲语言评测中跻身前三

Gemma 4 31B 在 EuroEval 多语言排行榜中表现强劲,芬兰语位列第 1,丹麦语、法语和意大利语位列第 2。

4月7日2 分钟
Gemma 4llama.cpp

Gemma 4 本地 CUDA 设置:精度陷阱与真实基准测试

在本地 CUDA 上运行 Gemma 4 时,若 KV 缓存边界处的数据类型不严格匹配,输出将静默退化。

4月7日2 分钟
Gemma 4Google DeepMind

深入谷歌 DeepMind Gemma 4 发布:背后所需的一切

Reddit 社区帖子剖析了谷歌 DeepMind 开源模型 Gemma 4 发布背后的工程挑战与物流协调细节。

4月6日2 分钟
Gemma 4vLLM

在 vLLM 上运行 Gemma 4 26B-A4B:社区故障排查笔记

开发者报告在 vLLM 上部署 Gemma 4 26B-A4B 结果不一,DGX Spark GB10 上的 INT4 量化版本速度过慢。

4月6日2 分钟
Gemma 4LiteRT

在设备上运行私有AI手机助手:Gemma 4与PokeClaw

PokeClaw在Android上本地运行Gemma 4来控制任何应用——无云端、无数据泄露、无订阅。

4月6日2 分钟
llama.cppGemma 4

Gemma 4 llama.cpp Issues Resolved With Recent Fixes

Google Gemma 4 models now run correctly in llama.cpp after critical fixes for output quality and crashes

4月4日2 分钟