找到 1 篇关于此标签的文章
FlashML 团队开源的 FreeToken 工具让 16GB 消费级显卡跑出 110 token/s 的 35B 模型推理速度。如果数据可复现,意味着本地 AI 在成本和速度上开始具备替代云端 API 的潜力。