返回首页
本地化部署
找到 3 篇关于此标签的文章
通义千问Qwen3
一张 24G 工作站显卡跑起 27B 模型 — 本地大模型开始够用了
本周 Reddit 一位开发者用一块 24GB 工作站显卡,把阿里通义千问 27B 模型跑出了 128K 上下文和每秒 60 个字的生成速度。值得关心的是:几万块硬件就能本地跑中型大模型,企业不必再把所有数据送去云端。
1d ago2 分钟
DeepSeek推测式解码
DeepSeek 284B 单卡跑到 31 tok/s — 本地大模型的隐性拐点
开发者用单张 RTX PRO 6000 工作站显卡跑通 DeepSeek 284B,配合 DSpark 推测式解码达到 31 tok/s。最反直觉的发现是:把辅助小模型放在普通内存里反而更快。本地部署顶级大模型的隐性成本曲线正在改变。
Aug 132 分钟
OpenCodeOllama
开发者集体寻找完全离线的AI编程工具 — 代码隐私焦虑正从大厂蔓延到个人
r/LocalLLaMA 社区本周热议:OpenCode 被曝存在隐私隐患,开发者急寻可从源码构建、完全离线运行的AI编程助手。代码隐私不再是合规部门的PPT话题,而是每个写代码的人都要面对的现实问题。
May 32 分钟