找到 1 篇关于此标签的文章
一位开发者用 2500 条样本和 15 分钟微调出 50MB 小模型替代 Gemini Flash:响应从 0.9 秒降到 0.06 秒,准确率只掉 2 个百分点。「蒸馏」(用大模型造数据训小模型)正从研究走向工程。