给 AI 系统下毒,发现它比 2015 年微服务还脆弱 — 混沌工程开始被认真对待
我们注意到一个反直觉的判断:生产环境里的 LLM 应用(接入大模型的产品),防护手段可能还不如 2015 年的微服务。原因不复杂——大多数团队上线前只做功能验收和延迟压测,但 LLM 应用的外部接口不可控、输出不可预测,传统测试根本测不到真正会爆的路径。
相关推荐
基于 #SRE 推荐
AI服务稳定性事故复盘
AI服务高峰崩了12%用户28分钟 — 出问题的不是模型,是工程基本功
一个线上 AI 推理接口的事故复盘:12% 用户请求超时、持续 28 分钟,根因不是模型能力,而是任务队列没做长度限流这种基础工程没补上。
9月26日·juejin.cn
Jev零样本分类
Jev 把自己包装成 AI 新范式,老玩家却说:这不就是分类器吗
本周 Reddit 高赞技术帖指出:号称'系统一模型'的 Jev 演示的能力,零样本分类器早在 LLM 出圈前就会了。BGE-small 加经典统计方法在同一数据集跑出 93.3% vs 83.2%,把这种新物种包装当场拆穿。
9月23日·www.reddit.com
NVIDIADynamo
NVIDIA 让大模型服务崩了后几秒就恢复 — 但前提是用它的卡
NVIDIA 给自家推理框架 Dynamo 加上「影子引擎恢复」:单个推理节点崩溃后,恢复时间从几分钟压到几秒。对正在把 AI 部署到生产线的传统企业,这是一则好消息,也是一则关于算力绑定的提醒。
8月25日·developer.nvidia.com
AQuA量化交易
两个 AI 互相审交易代码都漏掉一个 bug — 解法是给 AI 上锁
一个量化交易实验记录了 AI 自审系统的翻车:两个 AI 都批准了一个含未来数据的特征。论文给出的解法不是让审稿 AI 更聪明,而是限制 AI 能调用的操作范围。
8月24日·www.reddit.com
LLMRLHF
AI 满嘴'minted''escape hatch':硅谷腔病有解药
Reddit r/LocalLLaMA 这周出现一则高赞吐槽:用户列举 LLM 用'minted'替代'created'等怪现象。编辑部研究为什么 AI 学会装腔作势,给出几条实用解药。
8月22日·www.reddit.com
Jeremy MorrellSimon Willison
LLM 让软件变成乐高 — 开发者 Morrell:让用户自己写插件的时代来了
独立开发者 Jeremy Morrell 提出新假设:LLM 把写扩展的成本压到几乎为零,沙箱技术解决安全问题,软件未来可能只剩「靠谱核心」+ 用户用 AI 自由扩展。这对 SaaS 厂商的护城河和职场工具选型意味着什么?
8月20日·simonwillison.net