本周 r/LocalLLaMA 用户 Excellent-Issue-5956 公布了一组测试数据:把本地 AI 助手从 Qwen3 27B 换到 Ornith 1.5 35B-A3B,推理速度从约 60 字/秒拉到 180 字/秒,快约 3 倍,自建测试全部通过。我们的判断是——本地部署「数据不出门」的 AI,硬件门槛可能比想象中低。
这是什么
这位用户做的是日常「AI 助手」测试:用本地机器跑一个能调用工具、读写文件、做决策的 Agent(智能体,能自主完成多步任务的 AI 程序)。原配置是两块 RTX 5070 Ti 显卡跑 Qwen3 27B 量化版(压缩参数以降低显存占用的版本),约 55-70 字/秒。换到 Ornith 1.5 35B-A3B 后跑出 176-183 字/秒;两项自建测试——9 步工具调用+记忆 9/9、10 题编程 10/10——都满分。
提速的关键是混合专家架构(MoE,Mixture of Experts):总参数 35B,但每次只激活约 3B(256 个专家子网络里只用 8 个)。41 层中只有 10 层用全注意力(attention),其余 31 层用线性注意力(linear attention,显存占用几乎不随文本增长)。结果是:上下文从 128K 拉到 256K,显存只多约 2GB,速度从 180 降到 139 字/秒——比传统架构温和得多。
行业怎么看
支持的声音:MoE 加线性注意力正在成为开源大模型的「效率标配」。Qwen、DeepSeek、Ornith 都走这条路。如果这条曲线持续,2025-2026 年「两块消费级显卡跑 30B 级模型」会成为常规配置,而不是极客玩具。
克制的判断也要摆出来。第一,这是单一用户的测试,不是基准。Artificial Analysis 还没给 Ornith 评分;厂商自报的 SWE-bench Verified 79 分、Terminal-Bench 2.1 的 68.5 分均未经第三方复核。第二,作者也承认:测试满分只能证明「不差」,不能证明「更聪明」——MoE 模型在简单任务上跑得飞快、在硬推理题上输给更小的稠密模型,并非罕见。第三,256K 上下文时速度从 180 降到 139 字/秒,长文本卡顿只是被推迟,没有消失。
对普通人的影响
对企业 IT:本地 AI 助手过去要几十万元服务器级 GPU;如果这条曲线成立,2-3 万元的工作站配置可能在 12-18 个月内达到「够用」。涉及客户合同、源代码、内部数据的场景值得跟踪。
对个人职场:自由职业者、咨询顾问、独立开发者——任何对「客户数据不能上云」敏感的人——12 个月内有可能在高配工作站上跑一个能用的本地助手。今天是极客玩具,明天可能是标配工具。
对消费市场:现在不要因为这篇测试去买「AI 笔记本」。苹果 Neural Engine、高通 Hexagon、英特尔 NPU 等笔记本内置 AI 芯片,目前仍落后独立显卡 5-10 倍,但价格差正在缩小。