这是什么

本周 Reddit r/LocalLLaMA 出现了一条值得收藏的测试:一位开发者用 RTX 3070 笔记本(8GB 显存)跑通了 35B 参数的 Ornith-1.5 模型,在本地完整执行 agentic 编程任务(即让 AI 自己读代码、分析、修改并交付结果),速度达到 32 token/秒(token 是 AI 处理文字的最小单位,约等于一个汉字或半个英文单词)。

他用的版本是 Q4_K_M 量化版(把模型压缩到原大小约 1/4,牺牲一点精度换体积),架构为 MoE(混合专家架构,每次只激活 3B 参数),上下文窗口维持 128K(相当于一次性读完一本 200 页书)。他之前长期用 Qwen3.6-35B-A3B,表示 Ornith 在速度和"整体 Agent 流程处理"上都更顺手,代码质量自评"近乎完美"。

行业怎么看

需要先说一句:这是一篇个人测试贴,不是基准跑分,单一用户的感受可复现性存疑。作者本人也承认"明天可能就有新模型让我打脸"。

支持的声音:本地大模型这半年明显变强。35B 量级 + MoE + 4-bit 量化,让消费级显卡跑大模型从"玩具"走向"可干活"。对不愿把代码和数据上传云端的开发者、企业研发部门,这是个实在选项——断网可用、数据不出门。

需要警惕的:单一用户的"近乎完美"缺乏横向对照;35B 激活 3B 的 MoE 在复杂推理上仍弱于稠密大模型;32 tok/s 跑 128K 长上下文,显存吃紧后能否稳定,受硬件和驱动差异影响很大。这件事不是"AI 不需要云端了",而是"多了一条路"。

对普通人的影响

对企业 IT:本地部署 AI 编程助手从"试试看"走向"可考虑"。数据不出门、断网可用,对金融、医疗、政企有吸引力;但配套的运维、模型更新、合规审查能力不是现成的,需要专门团队。

对个人职场:非技术岗位暂时不用焦虑,Ornith 这类模型主要服务于代码类工作。但 IT 团队、研发管理者可以把"本地 AI 编程"列入下半年工具评估清单。

对消费市场:8GB 显存已是中端游戏本标配,硬件开始具备承接本地 AI 工作的能力。未来的笔记本、平板,"能不能跑得动某个开源大模型"可能会和"能玩什么游戏"并列成为卖点。