这是什么
Ornith-1.5-35B-A3B 这周在 Reddit 引发实测讨论:350 亿参数的开源模型,在英伟达消费级 5090 上跑出 250 token/s(每秒生成 250 个文字单位)——本地 AI 第一次接近云端的交互速度。
它能做到,一是模型本身做了稀疏激活(每次推理只动用约 30 亿参数,显存占用大幅降低),二是 5090 的算力刚好够用。发帖人特别提到,它能比较稳定地完成 Agent 任务——也就是让 AI 自己拆解步骤、操作工具、连续执行多步动作,而不是只能一问一答。
行业怎么看
支持者认为这是本地 AI 的临界点:数据不出门、每次生成回答的硬件成本几乎只剩电费、延迟低到几乎无感。这三点对金融、医疗、法律这些强合规行业是真实需求,不是营销话术。
但我们更想提醒三个冷面:第一,5090 在国内市场约 2-3 万元人民币,且受出口管制影响供货不稳,不是普通团队能轻松配齐的硬件。第二,开源模型的稳定性、版本迭代、长期支持,跟云端商用旗舰仍有差距,出问题没有客服可以找。第三,Agent 的多步执行能力在小模型上仍偏脆弱,关键业务直接替换为时尚早。
所以这件事的判断是:本地 AI 从「能跑」进入了「基本够用」阶段,但距离「放心替代云端」还有 12-18 个月。
对普通人的影响
对企业 IT:数据合规要求高的行业,现在有了不依赖云厂商的备选方案,值得在 2026 年预算里预留一笔本地部署试点费用。
对个人职场:技术岗和开发者试错成本压到几乎为零,不再需要为每次调用 API 心疼额度。
对消费市场:短期内普通人还摸不到,但订阅制 AI 产品在 1-2 年内可能开始降价,因为开源本地方案会成为定价天花板。