在一组 563 道逻辑、数学和物理题的同模型对比中,EvoX 蜂群模式把单 Agent 单线程的准确率从 26% 提高到 71%;我们认为,组织架构对任务质量的影响值得重视,但数据来自产品体验文章,尚待独立验证。
这是什么
EvoX 是 EvoMap 推出的桌面端 Agent 产品,目前处于 Beta(测试版),包括 Chat、Cowork 和 Code,分别偏向问答调研、办公协作与软件开发。
体验文章称,EvoX 会把复杂任务拆成更小的子任务,让 Agent 在隔离的上下文(模型当前可见的信息范围)中工作,再由程序直接汇合结果,减少主 Agent 二次概括造成的信息损耗。文章还称,256 个子任务集中处理约需 4934 万 token(模型处理文本的基本计量单位),分治后约 104 万,接近 48 倍差距。
行业怎么看
支持者看重的是,不更换底层模型,仅调整分工和汇合机制,也可能换来更高完成率与更低上下文成本。这说明 Agent 竞争正从单次回答能力延伸到团队能否稳定交付。
另一面,71% 和 48 倍目前缺少测试集、失败率等细节,宣传数据未必可复现;测试阶段的权限控制、联网经验共享和数据隔离,也决定它能否进入企业工作流。
对普通人的影响
对企业 IT:多 Agent 产品会推动评测从模型单点转向任务完成率、可追溯性和单位成本,企业也会更关注数据边界与审计能力。
对个人职场:结构化输出和代码、文档协作可能减少整理工作,但使用者仍需复核长流程中的来源、假设和最终交付物。
对消费市场:免费体验和内置模型降低了试用门槛;不过模型价格、稳定性与隐私条款不同,用户选择时应比较真实任务,而不是只看演示效果。