我们注意到一件小事:DeepSeek 上周公布 V4 Flash 在 Terminal-Bench 2.1(一种测试 AI 操作命令行完成任务能力的基准)上拿到 82.7%,但用的是自家未公开的评测工具。第三方团队 Ante 用公开工具复现,445 次试验里成功 368 次,准确率 82.7%——数字几乎一模一样。这件事本身不值得兴奋,但它指向一个老问题:中文大模型厂商的跑分,到底有多少可被独立验证?

这是什么

DeepSeek V4 Flash 是一款面向代码与 Agent(能自主调用工具完成多步任务的 AI)任务的轻量模型。Terminal-Bench 2.1 衡量的是模型在真实终端环境里完成复杂任务的能力,比单纯问答类测试更接近实际工作场景。Ante 团队用 OpenRouter(一个聚合多家模型的 API 中转服务)调用同一模型,跑 89 个任务、每个 5 次,最终复现了官方数字。

值得注意的是:DeepSeek 最初用的 "Harness minimal mode"(评测脚本的极简配置)至今未开源。这意味着外界无法判断 DeepSeek 是否选了对自己最有利的参数设置,即便复现成功,也只说明"在公开条件下能复现",不等于"和官方条件完全一致"。

行业怎么看

支持方认为:复现成功本身就说明模型能力扎实,82.7% 是硬指标,不是营销话术。在 Terminal-Bench 这类高难度基准上,即便顶级闭源模型(模型权重不公开、只能通过 API 使用)也很少稳定突破 80%。

质疑方更值得听:评测圈长期吐槽中国厂商"自选跑分环境"——用什么 prompt(喂给模型的指令模板)、允许多少步重试、是否过滤失败用例,都会显著影响分数。一位 Hugging Face 工程师私下对我们说:"数字是真的,但条件是你控制不了的,这种'透明'我不太信。"另有观点指出,DeepSeek 没有公开 89 个任务的具体子集,独立团队用的是同一基准但任务采样细节未必完全相同,82.7% 的一致性可能有一定运气成分。

对我们编辑部来说,这件事的判断是:DeepSeek 的工程能力仍是第一梯队,但"开源透明"这四个字,他们和 Meta、阿里(Qwen)之间仍有距离。

对普通人的影响

对企业 IT: 如果正在评估把 DeepSeek 接入内部系统,V4 Flash 的代码与 Agent 能力值得认真测试,这个跑分至少说明它不是"花瓶模型"。

对个人职场: 开发者可以关注 V4 Flash 的 API 价格与上下文长度(Token 数量上限),性价比可能优于直接调用 GPT-4 或 Claude 处理脚本类任务。

对消费市场: 普通用户短期无感——这些模型主要通过 API(应用程序编程接口,即让外部软件调用模型的标准化通道)卖给企业,消费级产品(豆包、Kimi 等)用的是另一套蒸馏后(把大模型能力压缩到小模型里)的小模型,跑分再高也不直接落到你手机上。