找到 1 篇关于此标签的文章
Reddit 本地 AI 社区这周传来一个数据:用户借助开源量化技术,把 26B 参数规模的 Gemma 模型塞进两张 RTX 4060 显卡,跑出每秒 75 字生成速度。这意味着消费级硬件正在够到中等规模大模型的实用门槛。