一个 3.95 亿参数的本地模型,在 MacBook 上跑一次决策只要 10 毫秒——不联网、不调云端。这是开发者 Abe238 本周发布的 DecisionTune 1.0。它瞄准的是 AI Agent 每天要做的那些「小事」——调哪个工具、客服工单分到哪个队列、是不是退款请求——都可以在本地解决。我们关心的是这条趋势:小模型开始从云端大模型手里抢活。

这是什么

DecisionTune 1.0 是一个只做理解不做生成的模型(encoder-only,即不「写」文本,只「选」选项)。你给它一个状态、一个问题、一组选项,它返回每个选项的概率,本质是个打分器。在 M5 Pro MacBook 上用 MLX 后端跑,单次决策中位数 9.6 毫秒,纯 CPU 约 65 毫秒;模型权重 1.58GB,下载后离线运行,所有文件核对 SHA-256 校验码。许可证 Apache-2.0,可直接商用。它还附带 MCP server(MCP 是本地 AI 助手调用外部工具的标准协议),能接进 Claude Desktop、Cursor 等本地 AI 工作流。

行业怎么看

这是本地小模型(SLM,即 Small Language Model)趋势的一个具体样本。微软 Phi、苹果 AFM、Hugging Face 都在押这条路:高频低复杂度的决策交给本地,云端大模型留给真正需要「思考」的环节。DecisionTune 1.0 在 2,755 个测试题上 PyTorch、ONNX、MLX 三种后端答案一致率 99.85%,稳定性不错。

但也有冷静声音。第一,它给出的概率未经过校准(calibrated)——模型说 70% 概率是退款请求,实际概率未必是 70%,拿来做自动化阈值要谨慎。第二,目前只支持英文,中文表现未知。第三,它「只从你给的选项里选」,选项本身错了它也跟着错——本质是放大镜,不是决策者。

对普通人的影响

对企业 IT:客服工单分流、内容初审、简单路由这类高频低风险环节,可以考虑用本地小模型替代部分云端 API 调用,成本压到零头,隐私也更好。

对个人职场:MCP 接入后,你可以在 Claude Desktop、Cursor 等本地助手里把「小决策」交给本地模型跑,本地 AI 工作流会更完整。

对消费市场:未来手机、笔记本上「不上云」的 AI 能力会越来越多——隐私更好,但功能边界也更窄,别期待它能干所有事。