Google 于 2026 年 9 月 30 日发布 Gemini 4 Argon(Argon 是 Gemini 4 的子型号,类似“高配版”):单次输出拉到 100 万 Token(模型一次能吐出的文字量,约 75 万中文字)、首发 API 价格近乎腰斩、官方 18 项基准评测拿下 12 项第一。这套账面数字非常漂亮,但我们在意的另一组数字是——在贴近日常编程的真实工程评测里,它落后 GPT-6 整整 10 个百分点。
这是什么
简单说,Google 把 Gemini 4 Argon 定位成“新一代编程旗舰基座”。两个最有营销力的卖点:一是 100 万 Token 单次输出,理论上能一次吐出一整个完整模块的几十个文件;二是首发 API 价格大幅下调,比 GPT-6 Astra 便宜约 40%。在 Google 自家跑分榜上,DeepSWE v1.1 拿下 77.9%,账面数据领先。
但叙事背后有三件事被有意省略:真实工程场景的稳定性、促销期结束后的实际成本、以及普通开发者到底能不能调用。
行业怎么看
正面声音主要来自模型厂商口径:参数突破、价格补贴、跑分领先,是 Google 准备好的官方剧本。
编辑部和许多独立开发者更看重的是另一组数据。在更接近真实长程开发的 FrontierSWE v2 上,Argon 落后 GPT-6 Astra 整整 10.5 个百分点;在 Terminal-Bench(专门测“AI 在命令行里会不会自己跑命令”的评测)4.0 上,落后 Claude Opus 5.5 九个百分点——这正是日常编程 Agent 最依赖的“终端回环”能力。彭博社 9 月 30 日援引知情人士称,谷歌内部员工对 Argon 在编码任务上的稳定性同样存疑。
另一个被忽略的变量是价格。促销期每百万输入 2 美元、输出 10 美元,比 Astra 便宜约 40%;促销期结束后将涨到 4 美元和 20 美元(与 Claude Opus 5.5 持平),同样任务下反而比 Astra 贵 20%。迁移越深,促销期结束那天你的 API 账就越难看。
最硬的现实门槛是渠道:Argon 目前仅对受信任的网络安全机构开放内测,企业级通用通道和个人开发者账户都还没放。所以即便你想迁,也迁不动。
对普通人的影响
- 对企业 IT:选型时不要被“跑分榜首”牵着走。终端交互能力、长期价签、调用权限这三件硬指标更值得关注。
- 对个人职场:用 AI 写代码的人短期内不必折腾基座切换,工作流继续跑 GPT-6 或 Claude Opus 5.5 更稳妥。
- 对消费市场:消费者侧的 Gemini(普通用户在手机上用的那个 App)跟这次发布的 Argon 不是一回事,别误以为自己的 Gemini 突然变强了。