返回首页

本地部署

找到 30 篇关于此标签的文章

DeepSeekNVIDIA

DeepSeek 在两台几万元小机器上跑出 67 token/s — 本地大模型门槛正在塌方

本周一位 Reddit 用户用两台 NVIDIA DGX Spark 工作站(约 6 万元)跑出 DeepSeek V4 Flash 67-84 token/s 的稳定输出,配 100 万 token 上下文。我们关心的是这份民间复刻印证了一个被低估的趋势:开源大模型本地部署的成本正在快速下沉,企业

Just now2 分钟
QwenApple Silicon

Qwen 3.8 实测:深度思考模式多烧 5.5 倍 token,本地部署账该重算

一位 Reddit 用户在 MacBook Pro M5 Max 上跑了 Qwen3.8-27B:开启「深度思考」模式后,token 消耗是普通模式的 5.5 倍、推理耗时 6 倍;关闭后质量又掉到其他 MoE 模型之后。开源模型「会思考」与「想得起」之间的成本裂缝正在浮出水面。

Just now2 分钟
QwenRTX 5080

RTX 5080 跑 Qwen 大模型只有 6 字/秒 — 本地部署 AI 的家用门槛还有多高

有人在 Reddit 用 RTX 5080 + 64GB 内存跑 Qwen 量化模型,每秒只生成约 6 个汉字。这件事值得关心:想「让 AI 跑在自己电脑上」,对硬件和调参能力的要求仍远超普通用户。

2h ago2 分钟
腾讯GGUF

腾讯把 1.5TB 模型压到 200GB — 本地部署大模型的门槛正在消失

这周腾讯把 1.5TB 大模型压到 200GB,性能保留约 98%。这件事意味着企业本地跑大模型的硬件门槛被实质性跨过,对云端 API 的商业模式是个微妙信号。

6h ago2 分钟
NVIDIADGX

DGX 跑 AI 也过热 — NVIDIA 旗舰得用户自己加风扇这事说明什么

一位 Reddit 用户给 NVIDIA DGX 加装主动散热,因为跑 DeepSeek 等模型时过热。这是真实的本地 AI 部署问题:即使是 NVIDIA 旗舰,持续负载下也得用户自己魔改,「即插即用」的叙事被戳穿。

20h ago2 分钟
Qwen千问

千问 27B 模型只要 18GB 显存就能跑 — 本地大模型门槛又降一档

阿里千问 8 月发布的 27B 多模态模型,Q4 量化后只需 18GB 显存,消费级显卡就能跑起来。开源大模型的本地化门槛又降一档,但 MoE 版本仍需集群,工具链分裂也是老问题。

20h ago2 分钟
Breeze-TTS-2语音合成

7GB 本地模型做出'前沿级'语音 — TTS 不一定要订阅了

国外开源社区本周在测一个叫 Breeze-TTS-2 的语音合成模型,体积只有 7GB,初体验评价是'前沿水平'。如果属实,本地 TTS 比想象来得快,值得做语音内容、有合规压力的公司先看一眼。

1d ago2 分钟
智谱TensorSharp

AI 解码快一倍:TensorSharp 把 llama.cpp 拉下马,部署成本或砍半

智谱 GLM-5.3-Flash 在新框架 TensorSharp 上跑出比 llama.cpp 快一倍的解码速度,本地部署成本可能显著下降,但生态成熟度仍是未知数。

1d ago2 分钟
QwenRTX 3090

两块 3090 显卡跑 27B 大模型,每秒 165 字 — 本地 AI 第一次"够用"

我们注意到一位 Reddit 用户在两块 RTX 3090 游戏显卡(整机二手不到两万)上跑出 27B Qwen 模型每秒 165 字,达到接 Agent 任务的水准。本地大模型第一次从"只能玩"跨进"能干活"。

1d ago2 分钟
量化本地部署

8G 显卡也能跑 70B 模型了 — 量化技术把 AI 本地部署的成本砍到底

8G 显存的 4070 显卡,过去装不下 130GB 的大模型权重;现在靠量化技术,3.5GB 就能跑 7B 模型。这件事的真正意义不是技术参数,而是 AI 部署第一次有可能脱离云端,让每个企业都能自己跑。

1d ago2 分钟
通义千问阿里

通义千问新模型可本地运行 — "AI 必须上云"的假设正在松动

阿里通义千问新模型 Qwen3.8-Flash-Next 合并进 llama.cpp,普通电脑也能本地跑对话 AI 而无需云端 API。这条不起眼的小新闻背后,是开源阵营对闭源云厂商商业模式的持续蚕食。

2d ago2 分钟
UnslothHuggingFace

HF 收购疑云下,Unsloth 让普通显卡跑得动大模型 — 开源生态的真正护城河

Unsloth 是一个让消费级显卡也能跑大模型的开源工具,最近因 HuggingFace 收购传闻被社区集体点赞。真正值得关心的是:当头部平台开始整合,开源生态里那些埋头写代码的团队,决定了普通人未来能不能便宜地用上 AI。

2d ago2 分钟
TokenAIHorus Cyber Nano

TokenAI 发了款 Horus Cyber Nano — 但关键数据全'待公布'

本周美国小公司 TokenAI 公布了一款名为 Horus Cyber Nano 1.0 的模型,但基准测试和模型权重都被推迟到后续发布。在小模型赛道每周冒出新品的环境下,这份'预告型公告'暴露了行业的新问题。

2d ago2 分钟
智谱GLM-5.3

智谱明天放 GLM-5.3 权重 — 中国大模型公司已把开源当默认动作

智谱 AI 明天放出 GLM-5.3 模型权重,延续 GLM-4 以来的开源承诺。中国大模型公司正把开源当成默认动作,对企业部署成本和开发者生态都有真实影响。

2d ago2 分钟
AnthropicClaude Code

Anthropic 算力账本被玩明白了:用户拿本地 Qwen 给 Claude Code 当外包

一位 Claude Code 付费用户因日耗 Token 太快,自建 MCP 架构:把重复编码交给本地 27B 参数的 Qwen,云端 Opus 只负责核心推理。这反映 AI 算力使用正从单一云端走向分层混部。

2d ago2 分钟
QwenClaude Opus

Qwen 27B 本地跑赢 Opus 4.6 — 开源够用,但这是厂商自测

一位量化模型厂商联合创始人发帖称,Qwen 3.8 27B 的本地压缩版本在 RTX 6000 上生成代码速度比 Claude Opus 4.6 快 57%。但样本只有 4 个写 3D 游戏的提示,且发布者本人就是被测厂商的联合创始人。

2d ago2 分钟
Qwen通义千问

阿里千问 27B 压缩到 3-bit,本地能跑 3D 应用 — 开源在追平云端

我们注意到 Reddit 开源社区有人把阿里通义千问 27B 参数的模型用 IQ3XXS 这种激进的 3-bit 量化压缩后,在本地硬件上跑出了一个 3D 演示应用。这意味着「小模型+量化+本地化」的趋势仍在加速 — 对企业 IT 和想自己折腾 AI 的人都值得关注。

2d ago2 分钟
LemonadeAMD

Lemonade SDK 让本地跑大模型像装 App — 15 种 AI 引擎已统一调度

由 AMD 员工牵头的开源项目 Lemonade 把 15 种 AI 模型引擎藏到同一入口背后,覆盖英伟达/AMD/苹果/高通四类硬件。本地部署大模型正从极客玩具走向可用工具,对数据敏感型中国企业尤其值得关注。

3d ago2 分钟
通义千问Qwen

开源 27B 小模型追平前沿大模型 — 一张 Reddit 测试图引发的争论

本地跑得动的 27B 参数开源模型(阿里通义千问)在 agentic 任务上被社区用户晒出追平前沿大模型的成绩。我们关心:这是不是"大模型越大越好"叙事的拐点,企业自建 AI 的成本门槛会不会被进一步压低。

3d ago2 分钟
Qwen英伟达

有人把能跑 27B 大模型的设备塞进饭盒 — 本地 AI 玩家正在追上付费服务

Reddit 用户用松下 Toughbook 加 RTX Pro 6000 攒出一台「饭盒级」本地 AI 主机,跑 27B 模型撑满 26 万 token 上下文,自评优于 Gemini Pro 和 ChatGPT。这不是普通 DIY,而是「数据敏感型工作能否脱离云端」的一次硬核实测。

3d ago2 分钟
Qwen阿里

Qwen 27B 旧显卡跑通 3D 编程,本地 AI 够用了但还不够稳

本周 Reddit r/LocalLLaMA 上一位开发者在 1500 元的旧 3090 显卡上,本地运行阿里 Qwen 3.8 27B 模型,成功输出可用的 3D 网页代码。我们认为:这意味着小模型开始逼近云端,但离生产稳定仍有距离。

3d ago2 分钟
LocalLLaMAr/LocalLLaMA

LocalLLaMA 上有人发了句'我有个问题'就没下文 — 这本身就是条行业信号

r/LocalLLaMA 上一个'我有个问题'的空帖冲上首页 — 这背后是开源大模型社区信号密度的变化。普通人不必在意,但想本地跑模型的人可以留个心眼。

4d ago2 分钟
通义千问Unsloth

通义千问发布 Flash 新模型,Unsloth 当天就适配 — 开源大模型的追赶速度变了

阿里通义千问这周推出 Flash 新模型,做本地部署优化的 Unsloth 几乎同一天宣布支持。这意味着开源模型从发布到「普通电脑能跑」的间隔正在被压到一天以内,值得企业 IT 决策者留意。

4d ago2 分钟
llama.cppOllama

70B 大模型能本地跑了:llama.cpp 两招让企业 AI 预算缩水

本周开发者社区反复在传的技术贴:llama.cpp 用 Q4_K_M 把 70B 模型压到 4 位——消费级显卡跑得动了。对企业的真实意义是,私有部署 AI 的硬件预算可能只要先前的三分之一。

4d ago2 分钟
Moonshot AIDeepSeek

2.8 万亿参数大模型被塞进消费级电脑 — 跑得起来,但慢得没法用

一位工程师用 4070 Ti 显卡 + 32GB 内存,硬把 711GB、2.8 万亿参数的 Kimi K3 跑起来了。正常速度每秒只生成 1-2 个字。真正突破在存储:用两块 SSD 并行读取,把 DeepSeek 速度从 1.14 提到了 8.08 tokens/秒。

4d ago2 分钟
通义千问英伟达

本地 AI 终于能打 — 30B 开源榜单透露的部署拐点

本周 Reddit 上 LocalLLaMA 社区一份 30B 级(300 亿参数)开源模型对比显示,Ornith、TielCoder 等本地可跑模型在编程等任务上已经接近闭源大厂水准。这意味着企业 AI 选型不必再死盯云端 API,本地部署开始成为现实选项。

4d ago2 分钟
Qwen3通义千问

本地跑 Qwen3 没人告诉你怎么配:Reddit 用户自掏 $100 做横评

Reddit 一位用户计划自掏 100 美元租云端 GPU,系统测试阿里 Qwen3 不同量化版本在本地部署时的真实表现。事情虽小,但折射出一个判断:开源大模型看似免费,但跑起来选哪个版本最值,依然没人替普通用户回答。

5d ago2 分钟
QwenDeepSeek

RTX 3090 跑通 489 步本地 Agent — 大模型不再是云端大厂特权

开源社区把阿里 Qwen 3 8B 小模型量化压缩,让它在一张 2020 年的 RTX 3090 消费级显卡上跑通了 489 步完整 Agent 工作流。本地跑 AI 智能体不再是技术幻想——这是中小企业 IT 预算第一次能承受的事。

5d ago2 分钟
LocalLLaMA视觉语言模型

本地视觉语言模型进入实用期 — 128GB 显存门槛把多数企业挡在门外

Reddit LocalLLaMA 社区本周盘点 2026 年 8 月可用的本地视觉语言模型(VLM,能看图说话的 AI)。按显存从 8GB 到 128GB 分五档讨论,结论务实:评测不可靠,没有模型能通吃。这是观察 AI 本地化趋势的一个切口。

5d ago2 分钟
r/LocalLLaMAClaude

6GB 显存想本地跑 AI 写代码 — 一位程序员的求助帖,揭开云订阅不说的成本

一位 Reddit 程序员求助:6GB 显存、64GB 内存想本地跑 AI 写代码、响应一分钟内。这道题藏着云订阅 vs 本地部署的真实成本账。

5d ago2 分钟