返回首页

LangSmith

找到 7 篇关于此标签的文章

AgentLangSmith

Agent 上线容易考核难 — 大模型公司正在集体撞上「评分墙」

Agent 落地最大的拦路虎不是模型不够聪明,而是「说不准它做对没」。如何评估一个每次答得都不一样的 AI,正成为新的行业分水岭。

9月23日2 分钟
Agent沙盒

AI Agent 开始自己改代码和数据库,沙盒从技术洁癖变成商业必修课

AI 已从回答问题扩展到改代码、动数据库。OWASP 数据显示,权限失控类漏洞占 LLM(大语言模型)安全的 41%。对正在引入 AI 自动化的企业而言,沙盒(隔离执行环境)不再是工程选项,而是必须补课的治理议题。

8月14日2 分钟
GartnerAnthropic

90 分 Agent 上线一周翻车:评测缺位才是落地的真问题

一个客服 Agent 内部测试 90 分,真实场景被用户骂翻。Gartner 预测 2027 年 40% 的 Agentic AI 项目将被砍,故障率是成熟项目的 4.2 倍。差距全卡在评测这一关。

8月14日2 分钟
LangChainLangGraph

LangChain 不是被 LangGraph 取代,AI Agent 真正门槛已转向落地编排

LangChain 和 LangGraph 处理的不是同一层问题:前者管“把大模型能力接进应用”,后者管“让 Agent 稳定跑完流程”。值得关心的是,AI 项目的难点正在从“能不能做出来”转向“能不能上线、可恢复、可审计”。

6月21日2 分钟
ReActAgent

AI 岗面试开始追问「Agent 跑飞怎么办」— 工程能力正取代术语背诵成筛选标准

ReAct 是当前 AI Agent 最主流的推理范式,面试正从背定义转向追问失败恢复策略。这意味着 Agent 开发进入工程化深水区——光知道术语不够了,得见过真实翻车。

5月3日2 分钟
PydanticLangSmith

Stop Trusting AI Hallucinations: A Builder's Guide to Verifiable Data Pipelines

Jepson's latest analysis exposes critical reliability gaps in modern AI stacks. Learn how to architect systems that verify outputs, enforce constraint

4月12日2 分钟
LangSmithDeepEval

别再追逐排行榜:伯克利揭露有缺陷的 AI Agent 基准测试

伯克利研究人员揭示了顶级 AI 基准测试中的关键数据污染问题。了解如何验证您自己的 Agent 工具、避免过拟合,并构建更可靠的系统。

4月12日2 分钟