这是什么
我们注意到一个有意思的测试:一位开发者用一张 RTX 3090(24GB 显存)跑 27B 参数(参数量越大模型能力越强)的 Qwen 模型做本地编程测试,四个 Python 任务中三个通过、一个完全失败。失败原因不是显卡不够,而是 AI 把所有'思考时间'花光了。
具体配置:模型经过 Q4_K_M 量化(一种压缩格式,把精度砍掉换取体积和速度),权重 16.8GB 全部塞进 24GB 显卡;推理框架是 llama.cpp,编程代理是开源的 OpenCode;上下文窗口 131K token(AI 处理的最小文字单位,约等于 1 个汉字或半个英文单词),每次输出上限 8K。
四个任务里,LRU 缓存实现用约 3 分钟从 0/10 修到 10/10,CSV 账务系统用约 5 分 44 秒从 1/10 修到 10/10,增量构建规划器则 0/10 → 0/10、没写出任何代码,SQLite 原子转账 1/10 → 10/10 但超时。
行业怎么看
值得欣慰的一面是:27B 这种中型模型过去只能跑在云端或多卡服务器,现在单张二手 3090 就能本地驱动 AI 编程代理。'本地 AI 编程'从极客圈拉到了大众硬件门槛。
但更值得我们关注的是那个完全失败的任务。它输入只有 4985 个 token,AI 却把全部 8192 个输出额度都用于内部'推理'(让模型在给出答案前先'想一想',类似写作前列提纲),最终一个字代码都没产出。这是'思考预算超支',跟上下文长度无关。换句话说,模型不是'装不下',而是'想太多'。
还有一个反直觉的发现:测试通过 ≠ 代码正确。CSV 那道题预设测试 10/10 全过,但开发者事后人工 review 发现小数点四舍五入有 bug。换句话说,AI 写的代码即使测试全绿,也不代表在生产场景里能用。
对普通人的影响
对企业 IT:本地 AI 编程在硬件层面已经可行,但'AI 自动写代码、无人审核直接上线'的设想在当前阶段还不成熟,至少需要保留人工 review 环节。
对个人职场:用 AI 写代码提效的同事,建议把'AI 写的代码我审一遍'作为标准动作,尤其涉及财务、精度、边界条件的场景。
对消费市场:未来一年,主流 AI 编程工具的瓶颈会从'算力不够'转向'AI 想太久'或'测试通过但有隐藏 bug',这是值得产品经理和 CTO 提前布局的新动向。