这是什么
这周 Reddit 的 r/LocalLLaMA 板块拆了一张金融垂直大模型 Ling-3.0-flash-Fin 的官方 benchmark 跑分卡。榜单把 Ling 和 GPT-5、Claude、Gemini 等通用模型在 FinFIRST、FinSearchComp Verified、SpreadsheetBench、FinCRAFT 等金融任务上对比,结论是「Ling 在金融场景领先」。
但仔细看跑分卡本身,问题就来了:不同测试用了完全不同的「装备组合」——
- SpreadsheetBench 跑分用的是 Claude Code 2.1.173 加 LibreOffice 25.8.7,禁止搜索,最多 120 或 300 轮交互,3 小时超时
- FinSearchComp Verified 是厂商内部 145 道题,请 GPT-5 当裁判打分
- FinFIRST 直接标注「coming soon」,还没公开就已经上了榜单
- 不同 benchmark 用了不同温度(0.6 到 1)和推理 effort 设置
- Ling 模型本身的权重也没发布,团队说下周才放
行业怎么看
原帖作者的核心判断是:这张榜单的价值在于它「暴露了什么」,而不是「谁赢了」。
支持方认为:榜单至少披露了温度、top_p、推理 effort 等关键参数,比许多只丢一个数字的厂商榜单更透明,算是 AI 评测走向严谨的一步。
但反对意见更尖锐:
- 测试不是独立第三方复现,是厂商自己跑——既是运动员又是裁判
- 不同模型用不同的 Agent 框架(ReAct+Web Search vs Claude Code),比的根本不是「模型」这一个东西,而是「模型+工具+工作流」整套方案
- GPT-5 给金融题当裁判,本身就有利益冲突嫌疑
- FinFIRST 这种「预告式跑分」,等于用没公开的标准给自己背书
值得警醒的是,这不只是某一家的问题。垂直大模型的 benchmark 几乎都面临同样困境:模型和工具已经深度耦合,「裸模型」评测意义有限,而厂商又有动机挑选对自己有利的脚手架(harness,连接模型和外部工具的中间层)。
对普通人的影响
对企业 IT:选垂直模型时,榜单排名只能当参考,必须追问「跑了什么脚手架、用了什么工具、提示词长什么样」。采购前最好用真实业务数据做小范围 PoC(概念验证)试点。
对个人职场:如果你用 AI 做财务分析、研究或表格处理,要知道市面上「金融 AI 专用模型」的差距可能远没榜单显示的那么大,关键看它接了什么数据源和工作流。
对消费市场:以后看到「XX 模型超越 GPT-5」「金融 AI 第一」这类宣传,记住三个字:打折听。测试环境和真实使用场景的差距,往往比分数差距更大。