找到 1 篇关于此标签的文章
一位独立开发者用自研引擎让 95GB 开源大模型在 M 系列 Mac 上跑到 41-52 token/s,比主流方案快 76%,且 13 万 token 长上下文不掉速。开源可下载,意味着本地化 AI 部署第一次有了真实生产力苗头。