807 美元、5 天、一张 H100:Unbounded Labs 训练了一个只懂 1931 年前英语的大模型 Bart — 这件事在暗示「小而专」可能比「堆参数」更值得赌。

参数 28 亿,训练数据 201 亿 token(文本处理的基本单位)。项目花了 3 个月,烧了 807 美元(不含人力)。团队还配套开源了第一套「古籍模型」评测基准 Vintage CORE。

这是什么

Bart 的定位很明确:它是一个「时间胶囊」式的大语言模型,只在 1931 年之前的英语文本上训练。团队把哈佛机构藏书数据集从 2420 亿 token 清洗压缩到 230 亿,再配合其他古籍语料凑出 201 亿的训练量。

更有意思的是配套工程:因为没有现成的「古籍大模型评测基准」,他们自己造了 Vintage CORE(20 个评测项),还整理发布了一个 41.6 万条的标注问答数据集。所有代码、数据、训练日志全部开源。

项目的灵感来自 DeepMind 创始人 Demis Hassabis 的一个提问:大模型能不能像历史上的伟大科学家那样推出新结论?「相对论肯定不在预算内,」团队写道,「但这个方向值得推进。」

行业怎么看

支持者认为这是「垂直化路线」的一次漂亮示范:与其花几亿美元卷参数规模,不如用精选数据训练特定领域的小模型。门槛低、迭代快、对中小企业友好。开源基准和数据本身也在推动整个小模型研究社区往前一步。

但我们也要看到另一面。Bart 对标的「GPT-1900」是另一个微缩模型 — 不是真正的前沿大模型。在一个几乎没人竞争的细分赛道里「领先」,含金量要打折扣。古英语这个领域太窄,短期内不会变成商业产品,Hassabis 提的根本问题 — 大模型能不能产生原创思想 — 这篇文章没回答,也答不了。

另外,团队明确在找投资和算力捐赠。项目本身成本低,但想往更大规模走,下一笔钱从哪儿来是另一回事。

对普通人的影响

对企业 IT:垂直领域模型成本降到千元级别,意味着企业不必再迷信通用大模型,法律、医疗、制造等行业的专属模型可能比想象更快落地。

对个人职场:掌握行业数据的人可以低门槛参与构建专属知识助手,不再只能等大公司发布工具。

对消费市场:短期没有直接冲击 — 古英语模型对消费者没有意义。但「小而精」思路若被验证,未来可能出现更多针对特定场景的轻量 AI 产品,而不是越来越臃肿的通用助手。