返回首页
注意力机制
找到 3 篇关于此标签的文章
ColonyLocalLLaMA
一个小游戏把大模型注意力机制讲明白了,教育价值大于技术突破
Reddit 上出现了一个名为 Colony 的演示项目,用“代理群体”(agents,按规则分工的小程序)在棋盘里模拟大模型的注意力机制。我们判断,它不是新技术发布,但很值得关心,因为它把最难讲清的原理,变成了普通人能看懂的动态过程。
Jun 252 分钟
Transformer注意力机制
读懂 Transformer 注意力机制——大模型能长记性全靠这套 2017 年的老引擎
注意力机制是大模型底层的关键原理,通过给重要信息分配高权重解决了AI健忘问题。搞懂它不是为了写代码,而是看懂大模型长文本的能力边界和背后的算力账单。
May 32 分钟
GoogleSeq2Seq
Seq2Seq 架构十年演进 — 理解它才算真正看懂大模型的技术起点
2014 年 Google 提出的 Seq2Seq 架构,是 GPT、BERT 等大模型共同的技术底座。理解它的编码器-解码器分工与信息瓶颈,才能判断 AI 能力边界。
May 12 分钟