本周 Reddit 一位开发者用两张英伟达 RTX 3060 游戏卡、不到 4000 元硬件成本,跑通了阿里的通义千问 27B 开源大模型——生成速度稳定在 45-50 token/秒(token 可粗略理解为"字"),社区确认日常够用。这是历史性的:四年前这个价位的显卡跑不动 270 亿参数的中文大模型。我们注意到,这一波门槛下移的急先锋是国产模型。

这是什么

用户 jacek2023 在 LocalLLaMA 板块贴出实测:用两张 RTX 3060(2021 年上市的游戏卡,二手 1500-2000 元一张)跑通义千问 27B(开源中文大模型,270 亿参数),生成速度 45-50 token/秒,并发两份 5000 字提示也还行。开发者自评:"日常 agent 会话够用了。"

我们更想划重点的是时间线:四年前这两千块的显卡干不了这种活,现在能了。差距不在显卡,是模型量化(更省空间地压缩模型)和推理优化(让模型在低配硬件上跑得更快)到了临界点。

行业怎么看

支持者的角度:本地 AI 的价值从来不在快,在"数据不出门"。两张 3060 加一台旧机箱,中小公司就能把内部文档、客户资料交给本地模型,不上传任何云,命中预算有限但对数据敏感的客户。

反对声音我们也不能漏掉。第一是速度:45-50 token/秒对企业正式业务偏慢;3060 显存摆在那里,Agent(能自动跑多步任务的 AI 程序)做长对话、长文档会撞墙。第二是供应链:3060 已停产,二手价被 AI 热潮推着涨。第三是人才:本地 AI 卡住中小企业的常不是硬件,是缺懂部署和运维的工程师。

对普通人的影响

对企业 IT:不到 5000 元硬件就能搭一个能跑中文大模型的本地环境,比此前几万块的方案下降了一个数量级;电费和运维人力也算进去才是真总账,硬件只是入场券。

对个人职场:愿意折腾的白领可以买两张二手显卡,自己跑本地 AI 处理不能上传的敏感数据;非技术背景的同事想用上同等能力,仍只能靠云服务或公司统一采购。

对消费市场:本地 AI 部署需求向上,二手显卡和小型工作站市场可能进入涨价周期;普通玩家买游戏卡的成本,大概率被 AI 这股热钱推着往上抬。