这是什么
上周掘金上一篇实战记录值得拿出来说。一位开发者用 Ollama(一个本地运行大模型的工具)在 3090 显卡上部署了通义千问 27B 模型,通过自研的 JClaude 接入 Claude Code(Anthropic 出品的 AI 编程工具)。结果遇到一个诡异 Bug:界面一直显示「正在思考」,但完全没有错误提示。
他把问题描述得相当随意,直接丢给了 Opus 5(Anthropic 最新一代大模型)。没想到 Opus 5 没有追问,而是自主跑了 15 轮测试——检查项目结构、探测本地服务、模拟真实请求、对比协议格式——最终定位到三层问题:模型名写错(qwen3.8 实际不存在)、软件里 max_tokens 被写死、强制思考模式导致假死。
更值得注意的是,Opus 5 还顺手帮开发者发现并修复了 JClaude 本身的兼容性 Bug。
行业怎么看
支持的声音:这是少数能看到完整 debug 过程(而非剪辑过的演示)的真实案例。15 轮对话里 Opus 5 表现出相当严格的工程思路——不轻信用户描述、自己写测试代码、一步步缩小范围。它说明 AI 已经能在一定程度上承担「独立排查 + 验证假设」的工程师工作。
但我们也要指出几个现实风险。第一,整个流程能跑通,前提是 Opus 5 本身具备极强推理能力,且开发者提供了可调试的环境——传统行业、中小企业很难复制这种场景。第二,15 轮对话意味着用户需要相当的技术判断力引导方向,普通人未必胜任。第三,原文里开发者自己都把「qwen3.5」和「qwen3.8」搞混了,说明 AI 还不能完全替代人对基础信息的核对。最后,个案不能证明 AI Agent 已具备普适可用性——过去几年类似的「惊艳 demo」最终没能规模化的案例比比皆是。
对普通人的影响
对企业 IT 部门:本地开源模型 + 云端 AI 工具的混合方案变得更可行,但需要懂技术的人搭桥,中小企业短期内受益有限。
对个人职场:能清晰描述问题、能引导 AI 排查方向,正在变成一种新的基础能力,比单纯会用某个 AI 产品更重要。
对消费市场:短期内对普通消费者无直接影响,但预示未来「AI 帮你修电脑、帮你 debug」的产品形态会越来越多。