一名社区用户用 BF16 版 Qwen 3.8 27B,在 Copilot Agent(能自行规划、调用工具并连续执行任务的 AI)中自主运行 54 轮,完成复杂鱼缸爆裂模拟;这说明长任务代理已能处理多环节工作,但还只是一项能力展示。

这是什么

测试者只提供一次初始要求,没有在执行过程中继续干预。模型需要模拟裂纹扩散、水深变化、重力、浮力、阻力、物体碰撞及水位持续下降,还要支持用户拖动裂纹位置,并通过 Playwright 反复检查页面效果。

值得关注的不只是最终画面,而是代理能够拆解需求、连续调用工具、根据检查结果继续修改,而不是只生成一段代码或一张图。

行业怎么看

正面看法是,这类闭环执行能力适合游戏原型、自动化测试和仿真演示。任务越复杂,模型持续检查、修正错误的能力越重要。

质疑同样充分:样本来自 Reddit,仅测试一次且没有披露耗时、调用成本和失败率,也缺少不同提示词下的重复结果。成功案例可以证明上限,却不能代表平均表现,距离稳定进入生产环境仍有明显距离。

对普通人的影响

对企业 IT:评估重点会从“能否生成答案”转向“能否长期调用工具并自检”,但权限隔离、预算上限和人工复核仍不可省略。

对个人职场:知识工作者可能更快获得可运行的页面、测试脚本和交互原型,但判断需求边界、检查业务逻辑仍需要人负责。

对消费市场:短期内,这类技术更可能进入游戏开发和产品演示,而非直接替代专业工程师;消费端价值最终取决于结果是否稳定、可复核且成本可承受。