找到 1 篇关于此标签的文章
dots-studio 这周在 Hugging Face 上线 dots3-note preview:280B 总参数的 MoE 架构,每次推理只激活 16B,支持 512K 上下文与多模态输入。这件事值得关注,是因为开源大模型的竞争重心正在从'总参数越大越好'转向'每次实际花多少算力'。