这是什么
本地大模型的硬件门槛正在降到中小企业也能摸到——本周 Reddit 一位开发者用一块 NVIDIA RTX PRO 4000 工作站显卡(24GB 显存、售价约两万人民币级别,面向工程师而非数据中心),把阿里通义千问 27B 模型(270 亿参数的大语言模型)跑出了 128K 上下文窗口和每秒 60 个字的生成速度。
实测细节:输入处理约 413 tok/s(每秒约 400 个 token,一个 token 通常对应一个汉字或半个英文单词);生成速度 60 tok/s;显存吃掉 21.6GB,剩 700MB 余量。关键提速用了 MTP(Multi-Token Prediction,多 token 预测):让模型一次"猜"几个 token,猜中就算赚,把生成速度从 31 tok/s 翻到 60 tok/s。
行业怎么看
支持方会把这当作本地大模型的转折点。两万块的卡就能跑 27B、撑 128K 上下文,足够企业搭内部知识库(让 AI 读公司文档再回答问题)、审合同、写代码——而且数据不出门。对金融、医疗、法律这些数据敏感的行业,是真实需求而非 PR。
但反对意见也得听。第一,这是个极客式技术验证帖,作者本身熟 CUDA 编译,普通 IT 团队照搬会死在驱动兼容性上。第二,60 tok/s 是"读完上下文才开始答"的峰值,真做实时对话还要继续优化。第三,27B 在专业任务上和 70B、GPT-4 级模型仍有明显差距,"能跑"不等于"好用"。
对普通人的影响
对企业 IT:可以认真评估"私有化部署"(把模型装在公司自己服务器上)这条路线,不必再默认所有 AI 都走云端 API(按调用付费的远程接口)。预算 5–10 万、配 2–4 张同款卡就能搭原型。
对个人职场:技术岗未来一两年"会本地部署和调优大模型"可能从加分项变成必备能力。非技术岗短期内不用操心,但留意公司有无相关项目。
对消费市场:消费级显卡(4090、5090)的本地 AI 体验会继续变好。书房那台游戏电脑,三年内很可能成为"私人 AI 助手"——前提是你愿意折腾。