Agent
找到 30 篇关于此标签的文章
对话越长,AI 越笨:Agent 的真正瓶颈不在记忆,而在读不懂 PPT
一位工程师提出,Agent 卡在落地的根源不是上下文太短,而是它仍在用聊天记录当工作记忆。当 PPT、表格、文档这些"产物"能被 AI 直接读、改、验证时,Agent 才真正进入工作场景。
阿里开源 Pixelle-Video:5 分钟出片不稀奇,调度逻辑才值得抄
阿里 AIDC 团队开源短视频自动化引擎 Pixelle-Video,把一条视频的人工时间压到 5 分钟以内。值得关心的是它背后的「流水线+可插拔工人」架构——工具会过时,调度思路不会。
Agent 也要'锁定文件'了 — AI助手上周能用这周就坏,问题不在模型
你的AI助手上周还能正常工作,这周就出错——原因可能不是模型变笨,而是它背后的技能、工具、权限各自在更新却没人统一记录。AWS和OpenAI正在给Agent加上'版本锁'。
AI 项目总翻车,锅不能甩给大模型 — 工程基本功才是真问题
一家技术团队复盘 AI 项目翻车,结论是模型没问题,问题出在提示词没结构化、用户输入没隔离、输出没校验。这不是孤例,而是企业 AI 落地的通病。
豆包从聊天工具升级成'电脑操作员',字节让最普及的中国 AI 开始替你干活
豆包近期不声不响完成了一次重要升级:从'问答工具'变成'电脑操作员'。能直接操作你电脑里的文件、调用浏览器和飞书做任务,还能手机远程派活。Agent 能力第一次进入全民级中国 AI 应用,值得每个白领留意。
测试员多了一项新本事:给 AI 当质检员 — 一份开源路线图泄露的岗位缺口
一个测试工程师在 GitHub 开源了 13 章 AI 测试开发学习路线,两周拿下数千 Star。这件事值得关心的不是教程本身,而是它透露的行业信号:AI 应用开始批量进入企业,「谁来验收、卡门禁」正在变成一个新岗位需求。
中国开源模型在 Agent 评测追平顶尖闭源 —— GLM 和 Qwen 只用了两个月
Agent Arena Code 这份榜单最近更新了一轮初步结果:智谱的 GLM 和阿里的 Qwen 在 Agent 代码任务上跑出与顶级闭源模型接近的成绩。开源阵营追上闭源头部,这件事在两个月前还不敢想。
Codex 装进 Claude Code — 大厂 AI 工具开始组队,单一选型时代结束
OpenAI 8 月 24 日把 Codex 改造成 Claude Code 的官方插件,工具不再互斥,企业 IT 选型从'选谁'转向'谁当主驾驶'。这件事比少开一个终端更值得关注。
蚂蚁把数据可视化做成了免费工具 — 但「让 Agent 自己看懂数据」这件事还早
蚂蚁集团 AntV 开源社区推出免费 AI 原生可视化平台 Sive,自然语言即可生成图表与报告,还能接入 Agent 工作流。值得关注的是:大厂开始把「Agent 的眼睛」当独立产品在做了。
豆包工作 Agent 让人替你盯仓库和周报 — 这次字节在抢办公入口
豆包工作 Agent 主打连接 GitHub、表单、网页等外部工具+定时巡检+可复用 Skill,把「每天记得看一眼」的杂事交给 AI。本期编辑部关心的是:这是 Agent 真正落地的信号,还是字节又一次「30 天会员」获客动作。
600 多篇 Agent 教程一次性开源 — 中文 AI 学习圈终于有人把路铺平
一个大厂架构师把 628 篇工程文档、23 篇 WorkBuddy 和 37 篇 Coze 内容整理成三段式学习路径开源。我们关心这件事,是因为它折射出当下中文 Agent 学习市场更缺的不是资料,而是连贯路径。
AI Agent 从演示到上线,隔着一道'等'的坎:流式是分水岭
AI Agent 从 demo 到交付,差的就是'等'这一件事。流式交互把首字等待从十几秒压到几百毫秒,是产品能不能用住的工程分水岭 — 这一关过不了,再聪明的模型也留不住用户。
AI Agent 干长任务十有八九半途而废,ICML 论文拆角色拉到 57%
PLAN-AND-ACT 是 ICML 2025 一篇论文,把 AI Agent 的「规划」与「执行」拆成两个模型干,在 WebArena-Lite 上把长任务成功率从 9.85% 提到 57.58%。它回答的不是「AI 聪不聪明」,而是「AI 怎么不半途而废」。
DeepSeek Agent 教程出到第 10 章 — 中国大模型开始抢开发者
DeepSeek 开源的 Agent 框架 Harness 在中文技术社区被逐章拆解,最新已到第 10 章。值得关心的是这背后的转向:中国头部大模型公司的竞争重心,正从「比模型跑分」移向「抢开发者和生态」。
AI 考试满分但活干不好 — 业界开始追问评测到底在测什么
大模型在 benchmark(标准测试)上刷出高分,落地却频频翻车。本期我们看一个正在升温的讨论:行业花几年建起的评测体系,可能从没在测「能不能干活」,只在测「记性好不好」。
用户数不再是权力指标 — 中国 ToB 战场开始按 Token 消耗量重新洗牌
WorkBuddy 单月访问量碾压同行只是表象。真正值得关心的是:2026 年起,AI 公司排名不再按用户数,而是按 Token 消耗量重排,中间层 SaaS 的钱正在转向模型厂商。
DeepSeek 上线识图能力,价格国产最低 — 但复刻页面实测不如 K3
DeepSeek 发布首个官方多模态实验模型 deepseek-v4-flash-vision-exp,百万 token 输入最低 0.05 元,价格仍是国产最低档。补齐 Agent 生态短板,但前端复刻实测弱于 K3。
豆包把手机变成电脑遥控器 — 中国月活最大 AI App 开始做普通人的 Codex
豆包上线'工作任务模式',手机动嘴就能遥控电脑做表格、剪视频、抓热榜。值得关心的是:中国月活最大的 AI App 第一次把 Agent 办公门槛压到普通人可用,但 Mac 暂时只能控浏览器,本地多任务会错乱。
演示完就下班?网易智企要给 AI 员工配'岗位说明书'和 Skill 库
网易智企推出企业级 Agent 平台'帝王蟹 ClawHive',提出 AI 员工、Skill、Skill Hub 三层概念,要解决的不是模型能力,而是企业把 SOP(标准操作流程)封装为可复用组织资产的问题。
DeepSeek 把自家智能体的「操作系统」开源了 — 这件事比技术细节更重要
DeepSeek 内部用了多年的 AI 智能体编排框架 Cordis,最近被开发者做成 9 章源码剖析系列公开。我们认为,这是中国头部 AI 公司首次把生产环境的 Agent 底层架构以这种颗粒度开放。
AWS 让 AI 查故障不用再切窗口 — 大厂正在拼 Agent 落地的最后一公里
AI 查问题几秒就能给结论,但工程师还得切浏览器验证。AWS 用 MCP Apps 把仪表盘塞进 AI 对话框 — 这是企业级 AI 工具正在拼的最后一块拼图。
AI 写 SQL 不稀奇,能在 4 万家企业安全交付才稀奇 — 舟谱数据的 Agent 答卷
一家服务 4 万家经销商的老牌数据公司,把 AI 写 SQL 做成了可工程化交付的 Agent 流水线。它的真正价值在于点出:企业 AI 落地卡住的从来不是模型,是指标治理、权限边界和工程化交付。
Agent 反复换工具为何总留垃圾:dsh 拆解 Cordis 运行时方案
Agent 想稳定跑长任务,先得过'插件装卸'这道关。本期 dsh 团队拆解 Cordis 运行时方案:把状态变更与依赖追踪做成可自动回滚的标准化机制。这决定未来 AI 助手能否在企业里真正落地。
DeepSeek Agent 框架被开发者拆到源码层 — 大模型竞争延伸到应用底座
DeepSeek 旗下的 dsh 框架支持 Web、命令行、桌面等六种入口,整套源码最近被开发者完整拆解。我们关心的是:中国大模型公司正在把战场从模型本身扩展到应用底座,这对开发者和企业 IT 选型有实质影响。
有人让 Qwen 自主写完一个 C 编译器 — 开源 Agent 进入长程耐力赛
一位开发者用阿里 Qwen 3.6 27B 开源模型,花 6 周让 Agent 自主写完一个 C99 编译器。这件事证明开源模型能扛数周级长程任务,但幻觉与上下文管理问题说明「自主」还要打引号。
NVIDIA 用 Vera Rubin 重定义 AI 算力标准 — 但能耗账单才是 Agent 时代的真问题
NVIDIA 推出 Vera Rubin 与 Blackwell GPU,在 Agent 类工作负载上刷新每瓦性能纪录。但真正值得关心的是:Agent 让单次推理的输入量暴涨 4 倍,算力需求被结构性抬升,数据中心开始重新算账。
DeepSeek 开源 Agent 框架一周实测:不是 Claude Code 平替,是可控的开源底座
DeepSeek 开源的 Agent 编程框架 Harness 一周拿下 9.5 万 Star,但实测开发者指出多数人卡在环境配置、任务拆解、插件选型与预期管理四个环节。它不是 Claude Code 的免费替代品,而是一块需要自己组装的开源底座。
字节豆包上线连接器:客服提效 40%,但企业 IT 的麻烦才刚开始
8 月 21 日字节豆包上线连接器,让 AI 直接调用企业既有系统。一个真实案例里客服处理时长降约 40%。MCP 正在成为 Agent 接入工具的事实标准,但企业 IT 的工作量才刚开始。
AI Agent 编程能干、医疗法律难落地:根因在数据结构和反馈机制
为什么同样的 AI Agent 在编程能写能改,在医疗、法律、企业管理却"答非所问"?技术分析的判断很尖锐:根因不在模型,在数据结构和反馈机制 — 这值得每个 AI 项目决策者正视。
本地跑大模型有个隐藏悬崖:Reddit 测试改写企业自建 AI 的算账方式
Reddit 用户 cHunter789 做了一个看似不起眼的测试,专门检测本地大模型在长上下文下的真实表现。结果发现:当显卡显存撑不住时,模型会突然退化到「从头读全文」,这正是大量企业 Agent 项目落地的隐藏障碍。