找到 1 篇关于此标签的文章
开发者 tomtsai28 把 Gemma-2B 推理压缩到 5KB 纯汇编,在老款 i5 台式机上跑到 4.6 tokens/秒,零 PyTorch、零 C 运行时。这件事值得关心:大模型开始能在普通硬件上跑,边缘 AI 与嵌入式部署的成本可能被重新定义。