UI-Mate 达到 270 亿参数,任务覆盖 Ubuntu 与 Windows 上跨应用、持续多步的桌面操作,我们判断它把大模型竞争从“会回答”推进到“能代操作”的一步。
它是一套 GUI Agent(能读懂屏幕、规划步骤并操作鼠标键盘的电脑智能体)。模型以 Qwen3.6-27B 为基础,接收任务、实时截图和操作历史,输出文字说明及结构化的点击、输入、滚动等动作;用户还可提供一次成功示范,让它提取流程,而不是机械回放坐标。界面或应用状态改变时,它会根据实时画面重新规划。
这是什么
项目把通用电脑操作与示范学习放在同一模型中:前者按自然语言直接办事,后者从一次成功操作中提取可复用流程。模型通过监督微调,以及在可执行电脑环境中的在线强化学习(边操作边根据结果调整)训练;输出可由 PyAutoGUI(常用键鼠自动化库)执行。权重按 Apache-2.0 许可开放,兼容 OpenAI 风格的服务和客户端接口。关键价值不是单独点击,而是跨应用完成一段工作。
行业怎么看
支持者会把跨应用长任务和示范学习视为关键进展,因为流程不必逐条写死,界面变化时也可能继续执行。更克制的看法是,目前证据主要来自项目方展示,缺少独立复现;27B 模型的部署成本、误操作后果、权限控制和失败回退也没有被充分回答。值得肯定的是可试点,但暂不宜直接接入生产系统。
对普通人的影响
对企业 IT
低风险、规则明确的跨软件流程,是较自然的早期试点场景,例如资料搬运和报表汇总。权限隔离、操作留痕与人工接管能力会决定它是工具还是责任漏洞。
对个人职场
复制粘贴、跨表整理和批量录入更可能先被接管;异常判断、结果核验与敏感审批仍离不开人。
对消费市场
开放权重会增加本地部署选择,却不等于普通电脑已能安全放手操作。能否普及,取决于硬件成本、误操作率与防护,而不只是演示效果。