找到 1 篇关于此标签的文章
Reddit 用户用入门级 RTX 3050 6GB 显卡跑通了阿里 Qwen 30B 模型的 MoE 版本(一种把大模型拆成多个"专家"、按需激活的架构),9 万字上下文下达到每秒 30 token 的生成速度。这件事值得企业 IT 决策者重新评估本地部署大模型的成本曲线。