这是什么
过去几个月,一位研究者翻完几十篇关于「LLM Agent(让大模型自主操作手机 App 的 AI 助手)」的论文,得出一个不乐观的判断:手机 AI 助手到底能不能像真人那样干活,行业目前根本没有靠谱的衡量标准。他把相关论文整理成了一份阅读清单(来源 alphaxiv.org),并归纳出三个普遍现象:第一,绝大多数评测跑在模拟器上,真实设备数据很难拿到;第二,电池、发热、温度这些「落地硬指标」几乎没人测;第三,日常任务散落在不同基准、不同语言、不同 App 里,没有一套全球通用的「真用户任务集」。
行业怎么看
主流叙事是乐观的——手机 Agent 被普遍视作下一代平台入口,Google、Apple、三星以及国内手机厂商都在加码布局。但这份论文清单实际在泼冷水:整个行业处于「模拟器自信、真实世界盲」的状态。值得警惕的是,模拟器上的高分无法预测一台真实手机的耗电,不会暴露银行 App 改版后 Agent 卡死,更测不出中国用户一边微信聊天一边切屏的多任务场景。我们的建议是:任何企业要在 2025 年认真考虑采购「手机 AI 助手」,先把供应商的演示搬到十台真机上跑一周,跑分可以先放一边。
对普通人的影响
对企业 IT:采购手机端 AI 工具时,别被演示视频和跑分迷惑,要求供应商提供真机、真任务、真实耗电的测试报告。
对个人职场:现阶段别把「让 AI 帮你操作手机」当稳定生产力,它更像一个灵光一现的玩具,关键时刻容易掉链子。
对消费市场:手机厂商会把「AI 助手」当新卖点猛推,但用户口碑会比实验室数据更快暴露问题,节奏类似早期智能音箱。