这是什么

510 亿参数当"字典"挂着,每次推理只激活约 60 亿——这是 Qwen 团队新公开的 Engram 架构的核心戏法:让模型把"死记硬背"外包给查表,把神经元腾出来干真正的推理。

具体做法是建一张大表,把"纽约""import std"这种常见词组对应的向量(数值化的语义表示)直接存进去。推理时按最后 2-3 个 token(模型处理文本的最小单位)查表,O(1) 拿到结果喂给网络,不消耗算力。

小模型因此不再花几层网络反复拼写"华尔街"三个字,能腾出深度做更复杂的事。

行业怎么看

支持者认为这是近两年最重要的架构创新之一:参数规模不再等于智能上限,本地部署(在自己电脑或服务器上跑模型)的门槛显著降低。

但 Reddit 和技术社区也泼了几盆冷水:第一,记忆表是"傻"的,只看最后 2-3 个 token,20 万字上下文改变不了它查到什么;第二,N 越大信号越稀,4-gram 以上方案论文自己的消融实验(逐一关停组件看效果的测试)就否了;第三,记忆补不出 C++ 经验,推理能力是另一回事。

那些喊"1T 模型能本地跑"的帖子,对这套机制存在根本误解。

对普通人的影响

企业 IT:部署一个"够用"的 AI,不必再追最大参数,硬件预算有望下台阶。

个人职场:笔记本本地跑接近大模型表现的版本几率上升,敏感数据不必上云。

消费市场:手机端 AI 助手反应更快、回答更准,端侧 AI 应用会有新一波体验升级。