本地推理
找到 30 篇关于此标签的文章
llama.cpp 还有 50 个 PR — 本地跑 AI 不必靠显卡
开源项目 llama.cpp 攒 50+ 性能优化待合并,部分让 CPU 推理提速 3 倍。「本地跑大模型」正摆脱对高端显卡的依赖 — 敏感行业的私有部署和普通用户的离线 AI,都会因此更便宜。
千问 27B 跑到 50 tok/s:16G 消费显卡也能本地跑大模型
本周一个 Reddit 用户把阿里通义千问 27B 模型塞进 16GB 消费显卡,跑出 50 token/秒生成速度 + 10 万字上下文。本地大模型正走出极客圈、逼近云端体验。
双 DGX Spark 跑 181 tok/s 并发 — 本地多 Agent 这次能用了
海外工程师用 2 台英伟达 DGX Spark 桌面超算,搭载 Qwen 系列开源模型,并发跑出 181 token/秒,同时撑起 9 个 AI Agent。对企业的意思是:本地多 Agent 部署从'展示'走向'干活'。
中国大模型装进了 Mac 本地 — 智谱 GLM 被主流工具接纳,这事比看起来重要
一款名为 ds4 的本地推理工具(由 Redis 创始人 antirez 参与维护)本周新增对智谱 GLM Flash 版本的支持,在 128GB M4 Max 上跑通。这意味着中文大模型有了更多本地化运行选项。对关心数据合规的企业 IT 来说,这是值得追踪的具体进展。
Qwen3 模型在 5090 上跑到 220 tokens/秒,本地 AI 体验拐点临近
新推理引擎 Ninfer 让 Qwen3 模型在 RTX 5090 上跑出平均 170、最高 220 tokens/秒,速度比主流 llama.cpp 快一倍多。本地部署 AI 的体验正在逼近云端 API,企业自建的成本结构开始松动。
3.5万组装机本地跑通Qwen 122B,速度翻倍 — 私有AI部署门槛降到一台PC
一位 Reddit 玩家用 3.5 万元攒出一台本地 AI 工作站(Framework Strix Halo 主板 + AMD R9700 显卡),跑通 Qwen 122B 模型速度翻倍。值得关心的不是硬件本身,而是私有部署大模型第一次有了工作站级别的性价比方案。
他用本地 AI 把篮球剪辑压到 30 分钟 — 个人开发者用小模型做实事
一个篮球爱好者用 YOLO 模型开发了免费开源的篮球高光剪辑工具,把 2-3 小时的人工剪辑压缩到 30 分钟,且不依赖任何云端 AI。这种'小而美'的本地 AI 工具,正在大公司忽视的缝隙里悄悄解决真实需求。
苹果 M5 Ultra 带宽 1.2TB/s — 本地跑大模型跨过实用门槛
苹果本周发布 M5 Ultra,内存带宽达到 1.2TB/s。这是大模型本地推理首次具备实用性能,对处理敏感数据的知识工作者来说,可能改变使用 AI 的方式。
Qwen 27B 长文本速度缩水近三分之二 — 本地玩家不信官方跑分
本周 Reddit 本地 AI 社区用户发帖,准备用 AMD R9700 跑阿里 Qwen3 系列 27B 模型,结果发现官方公布的 51.8 tokens/秒是理想条件下的数字。真正的长文本场景下,速度从 75 跌到 26。值得关心的是:本地部署 AI 大模型正从能不能跑,进入跑得稳不稳的阶段。
用退役服务器跑大模型 — 有人让老 AMD 显卡变成 AI 推理机
Reddit 用户 milpster 联合 GLM 发布了一个针对 AMD GFX906 老架构显卡优化的 llama.cpp 推理分支,Mi50、Mi60、Radeon VII 这些早退役的数据中心 GPU 因此可以本地跑大模型。AI 推理的硬件门槛正在被开源社区悄悄砸到二手市场级别。
AI 当程序员干完 CUDA 移植 — 矿卡跑 Qwen 35B 性能翻倍
一位非程序员的 IT 架构师,借 AI 编码助手把推理引擎移植到矿卡上,让 Qwen 35B 性能翻倍。两件事值得关心:廉价矿卡成本地 AI 的现实选项,AI 当程序员正在把底层技术门槛削平。
本地玩家发现提速诀窍:256k 长文本推理快 3 倍,但离商用还差几道坎
Reddit 上一位用户在小型模型上验证"分块缓存拼接"技巧,长文本 prefill 速度翻 3 倍且检索准确率未掉。这条帖子的真正价值是:本地长上下文推理的工程瓶颈,可能比想象中软。
16G 显卡跑出 110 token/s — 本地 AI 第一次有了云端的速度
FlashML 团队开源的 FreeToken 工具让 16GB 消费级显卡跑出 110 token/s 的 35B 模型推理速度。如果数据可复现,意味着本地 AI 在成本和速度上开始具备替代云端 API 的潜力。
33B 音视频模型跑上苹果芯片,开源社区开始记账'加速'的代价
本周开源项目 h3.c 把一个 330 亿参数的音视频生成模型塞进苹果芯片,没有用单一'加速'开关,而是把每一项加速手段拆开讲清楚代价。这意味着本地 AI 视频生成开始走出 demo 阶段,进入谈画质、速度、商业可用性的工程阶段。
本地跑通义千问 45 tokens/秒 — 苹果芯片成了开源大模型隐形赢家
一位 Reddit 用户在苹果 M 系列芯片上把通义千问 3.8B 跑到 45 tokens/秒,刷新该模型在消费级硬件上的速度纪录。本地跑大模型正从极客玩具变成可选项。
笔记本+显卡盒子拼出 40GB 显存,本地跑 Qwen3 27B 速度涨七成
一位 Reddit 用户用笔电外接显卡盒+雷bolt 4 拼出 40GB 显存跑 Qwen3 27B,生成速度从 16 提升到 27 token/秒,涨幅约七成。这条小众实践提示我们,本地部署成本曲线仍在下行,云端不再是唯一答案。
Liquid AI 发 2.6B 小模型可本地跑 — 小模型路线开始被认真对待
Liquid AI(MIT 出身的 AI 公司)这周公开了 2.6B 参数的 LFM 2.5 模型,提供 GGUF 格式,可在普通笔记本直接跑。单看不是大新闻,但叠在 Phi、Llama、Qwen 的小模型线上,'AI 不一定要走云端'这件事正在悄悄变成企业选项。
中国 Ling-3.0 进入 llama.cpp 官方支持 — 12GB 显存跑满 128K 上下文
本周中国开源模型 Ling-3.0 正式进入 llama.cpp 主分支,开发者用 12GB 消费级显卡就能跑满 128K 上下文。本地推理门槛进一步降低,金融、医疗等数据敏感行业的私有化部署迎来新选项。
4 张消费显卡跑通 144GB 大模型 — 本地 AI 部署的成本拐点正在到来
一位开发者用 4 块 RTX 3060(共 48GB 显存)+ 普通工作站,跑通了 144GB 的 DeepSeek-V4-Flash 量化版,提示处理约 100 token/s。值得关心的是:本地大模型不再必须堆 A100/H100,企业级私有 AI 的硬件门槛可能比预想低一截。
27B 模型在 RTX 3090 跑出 99 tps — 个人本地 AI 起步
一位开源开发者把阿里通义千问 27B 模型在 RTX 3090(24GB 显存、二手价 1500-2000 元)上跑到 99 tokens/秒,意味着消费级硬件已能流畅运行中等尺寸大模型,对企业本地部署和个人数据敏感场景都有现实意义。
llama.cpp 上线'自适应猜词'模式 — 本地跑大模型的人,少一个要调的参数
本周开源项目 llama.cpp 上线'自适应'多 token 预测(MTP)模式,让模型自己决定一次猜几个字。写代码场景最快能翻倍,但普通文本反而慢约 3%。这意味着本地部署大模型的工具链正在从'手动调参'向'系统自调'迁移。
100 美元硬件跑通阿里 270 亿参数模型 — 本地 AI 的廉价拐点到了
本周 Reddit 上一位极客用 100 美元二手硬件跑通了阿里通义千问 270 亿参数大模型。值得关心的是——大模型本地化部署的成本门槛正在塌方,云端 AI 服务的定价权可能因此松动。
Qwen 27B笔记本实测19 tok/s — 开源大模型终于能本地干活
Reddit用户测试阿里开源的Qwen 27B量化版,在128GB统一内存的ROG笔记本上达到19 tok/s生成速度,并用Agent工具自主开发出一个HTML飞行模拟器。这说明本地大模型已从'能跑'进入'够用'阶段。
RTX 3090 跑出 27B 模型 82 token/秒 — "大模型必须上云"的论调该松动了
独立开发者用一张 2020 年上市的 RTX 3090,把 27B 规模的 Qwen 模型压进 14GB 显存跑出每秒 82 token。技术细节值得工程团队收藏;它真正传递的信号是:本地 AI 的硬件成本曲线,正在和云端正面竞争。
本地小模型写代码终于能用了 — 开发者用 RTX 4060 跑 AI 助手,省云端月费
一个开发者开源的工具:让 8GB 显卡也能当 AI 编程助手,处理代码片段;云端大模型只负责规划。本地推理成本接近零,对企业 IT 采购和独立开发者都有参考价值。
一张 5060 Ti 跑出 60 秒 AI 歌曲:本地音乐生成的硬件门槛跌到了桌面级
一张 RTX 5060 Ti 16G 消费级显卡,配合 int8 量化模型,本地就能跑出带人声的 60 秒 AI 歌曲。AI 音乐创作的硬件门槛从数据中心跌到了桌面电脑,内容相关行业的从业者都该重新看一眼。
Mac 跑本地大模型,开发者花两周实测:一团乱麻 — 落后英伟达一整代
一位 Reddit 社区开发者花两周全职测试了 Mac 上跑大模型的所有主流框架,结论直接:苹果 AI 软件生态碎片化严重,关键优化技术分散在十几个 fork 里,没有英伟达 CUDA 那样成熟。对想用 Mac 部署本地 AI 的公司,这是个值得警惕的信号。
LocalLLaMA 社区又喊"轮到我了" — 但这条信号本身更值得看
r/LocalLLaMA(70 万订阅的本地大模型开发者社区)出现一条几乎纯标题的帖子,发帖人没说明发了什么。在 AI 周刊语境里,这种「举旗帜」姿态本身就是社区节奏的信号弹,而不是新闻本身。
Qwen3.8 27B 单卡跑出 200 token/秒:本地推理追上商业方案
阿里开源的 Qwen3.8 27B 模型,搭配社区推理引擎 NInfer,在消费级显卡 RTX 5090 上跑出约 200 token/秒生成速度。本地部署 AI 的硬件门槛正在快速下降,这对企业 IT 采购和数据敏感型业务有实际意义。
RTX 5080 两分钟跑完 30B 大模型,本地 AI 开始追上云端
一张万元级消费显卡,跑出接近云端大模型的输出,速度比云端快 15 倍。本地部署的 AI 不再是极客玩具,正在变成企业的现实选项。金融、医疗等数据敏感行业,值得重新算一次账。