这周值得我们盯住的是 Pathway 的 BDH(后 Transformer 架构)实验:在 10M 到 1B 参数规模上从头训练,效果和 GPT-2 同区间几乎一致。关键是——它跑在普通 GPU 上,没有依赖 H100 集群。

这是什么

BDH 的全称是"Baby Dragon Hatchling",可以理解为一种模仿人脑神经回路(而非纯数学注意力机制)的网络结构。Pathway 想证明一件事:Transformer(大模型主流架构,所有 GPT、Claude、Llama 都基于此)不是唯一路径,且未必是最优路径。他们在 10M、100M、1B 三档参数下做了对照训练——指标是损失值(loss,数值越低代表模型对数据预测越准),BDH 与 GPT-2 基线几乎重合。

参数规模可以理解为"模型脑容量":参数量越大,模型理论上能学到的知识越多;1B 大约等于 10 亿参数,GPT-2 最大版本就是 1.5B。

行业怎么看

支持的声音集中在两点:开源可复现——代码权重全部公开,社区已开始跑第二轮验证;如果这条曲线延伸到 10B、100B 还成立,意味着训练成本可能下降一个数量级,AI 中小玩家重新有机会。

但反对意见同样尖锐。多数研究者指出,GPT-2 是 2019 年的水平,今天衡量一个架构是否真正突破,要看能不能打 Claude、Llama 这类现代模型。Reddit 上有评论直接说:"追平 6 年前的玩具,没什么意思。"另外,BDH 的推理效率(模型跑起来后回答问题的速度和显存占用)尚未披露——训练便宜不等于部署便宜,这条路还有半张图没画完。

对普通人的影响

对企业 IT:目前还是"知道就行"。架构从实验到生产部署通常隔 18-36 个月,今年企业的算力采购决策不会因此改变。

对个人职场:无直接冲击。但若你负责选型 AI 服务商,未来可以多问一句"你们用的是什么架构"——成本结构正在分化,纯堆 GPU 的方案溢价可能收窄。

对消费市场:短期零感知。长期看,训练成本下降会让中小公司愿意做垂直模型(专门服务于医疗、法律、教育等特定行业的小模型),届时你用到的 AI 产品可能更专业、更便宜。