找到 1 篇关于此标签的文章
Reddit 开发者最近为本地大模型的「够用速度」吵翻了:一派坚持 30 TPS 就够,一派认为 150 TPS 才有对话感。这场口水战背后,是企业本地部署 AI 时的真实硬件选择困境。