返回首页
GPT-2
找到 2 篇关于此标签的文章
PathwayBDH
Pathway 用新架构跑出 GPT-2 同等效果 — 大模型不必再堆算力的口子被撕开
欧洲 AI 公司 Pathway 这周放出一个数据:他们自研的 BDH(后 Transformer 架构)在 10M 到 1B 参数区间,训练表现追平 GPT-2。值得关心的是,这条路径如果走通,"必须堆 GPU" 这个行业铁律可能松动。
Aug 92 分钟
Wave Field LLMLocalLLaMA
一位独立研究者称把上下文拉到128K,真正值得看的是大模型降本新思路
Reddit 上一位独立研究者发布 Wave Field LLM,声称用新的注意力机制把训练复杂度降到 O(N log N),并在 128K 上下文下避免传统方案爆内存。我们判断,这更像一次值得跟踪的底层架构试验,而不是马上可用的产品突破。
Jul 152 分钟