找到 1 篇关于此标签的文章
两个300亿参数的MoE大模型,最近被开源社区工程师装进一台128GB内存的AMD小主机,生成速度达到每秒30-44个token。真正值得关心的不是参数,而是过去要堆几张H100才跑得动的模型,现在一台万元桌面设备就能承担。