返回首页

RTX 3090

找到 19 篇关于此标签的文章

QwenRTX 3090

两块 3090 显卡跑 27B 大模型,每秒 165 字 — 本地 AI 第一次"够用"

我们注意到一位 Reddit 用户在两块 RTX 3090 游戏显卡(整机二手不到两万)上跑出 27B Qwen 模型每秒 165 字,达到接 Agent 任务的水准。本地大模型第一次从"只能玩"跨进"能干活"。

1d ago2 分钟
QwenDeepSeek

RTX 3090 跑通 489 步本地 Agent — 大模型不再是云端大厂特权

开源社区把阿里 Qwen 3 8B 小模型量化压缩,让它在一张 2020 年的 RTX 3090 消费级显卡上跑通了 489 步完整 Agent 工作流。本地跑 AI 智能体不再是技术幻想——这是中小企业 IT 预算第一次能承受的事。

5d ago2 分钟
LocalLLaMARTX 3090

在家跑大模型卡在机箱尺寸上 — 本地 AI 离「开箱即用」还远

本周 Reddit 一则装机求助引发讨论:玩家想把 3090+3070 双卡塞进 B450 主板跑本地大模型,被卡槽间距挡住。背后是消费级本地 AI 部署的真实门槛。

Aug 222 分钟
QwenAMD

消费级显卡跑 27B 到 153 tok/s — 本地 AI 的成本拐点正在到来

r/LocalLLaMA 上一位开发者用 159 次实验证明:消费级硬件跑阿里 Qwen3.8-27B,在 HumanEval 上击败双 3090 云服务器。最值得注意的发现是,仅换对话模板就提速 44%——很多"AI 慢"是用错了提示方式。

Aug 212 分钟
通义千问Qwen

通义 27B 跑出 138 token/秒 — 一张消费显卡正在拉低本地 AI 成本

一位独立开发者把通义 27B 模型在单张消费级显卡 RTX 3090 上跑出 138 token/秒,长对话第二轮延迟从 23 秒压到 1 秒。这不是模型能力的突破,而是本地大模型成本曲线被开源社区悄悄拉平的信号。

Aug 192 分钟
Qwen千问

千问27B在两张3090上跑出218 tokens/秒 — 本地AI成本下沉

一位开发者用两张消费级RTX 3090显卡,把阿里千问团队的27B参数大模型跑出218 tokens/秒。值得关心的是,原本需要H100集群才能流畅运行的负载,如今落到了两张消费卡上。本地AI的硬件成本曲线正在松动。

Aug 192 分钟
Qwen通义千问

27B 模型在 RTX 3090 跑出 99 tps — 个人本地 AI 起步

一位开源开发者把阿里通义千问 27B 模型在 RTX 3090(24GB 显存、二手价 1500-2000 元)上跑到 99 tokens/秒,意味着消费级硬件已能流畅运行中等尺寸大模型,对企业本地部署和个人数据敏感场景都有现实意义。

Aug 182 分钟
Qwen阿里

Qwen3.8-27B 跑分结论反直觉:4 张 3090 反而比 2 张慢 33%

阿里开源大模型 Qwen3.8 27B 在 4 张消费级 RTX 3090 上跑分,结果反直觉:4 张卡比 2 张慢 33-41%。这打破'硬件堆叠=性能提升'的常识,也提示本地部署 AI 的成本结构可能没想得那么简单。

Aug 182 分钟
QwenRTX 3090

RTX 3090 跑出 27B 模型 82 token/秒 — "大模型必须上云"的论调该松动了

独立开发者用一张 2020 年上市的 RTX 3090,把 27B 规模的 Qwen 模型压进 14GB 显存跑出每秒 82 token。技术细节值得工程团队收藏;它真正传递的信号是:本地 AI 的硬件成本曲线,正在和云端正面竞争。

Aug 162 分钟
QwenDeepSeek

Qwen 27B 单卡跑 10 小时不脱轨 — DeepSeek 引擎正在从模型层独立出来

开发者在 RTX 3090 上用 Qwen 27B + DeepSeek 开源调度框架,跑出连续 10 小时不崩的编程 Agent。值得关心的不是模型多强,而是「引擎」正在和「模型」脱钩 — AI 行业进入模块化阶段。

Aug 162 分钟
QwenLocalLLaMA

单卡 3090 还在跑大模型 — 本地部署 Qwen 的玩家没退场

一张 2020 年的消费级显卡,今天还能本地跑通阿里最新的 Qwen3-8B。Reddit 上的讨论告诉我们,「在家跑大模型」这个圈子远没冷清,国产开源模型已成本地玩家的首选之一。

Aug 162 分钟
RTX 3090RTX 6000

玩家用 4 张 3090 拼出接近 RTX 6000 的推理性能 — 价格只要四分之一

Reddit 上有玩家把 4 张二手 RTX 3090 通过张量并行+流水线并行拼接,推理速度逼近专业卡 RTX 6000,成本只要 25%。这件事值得关心:本地大模型部署正在从极客玩具变成一种「算力套利」思路。

Aug 102 分钟
RTX 6000 ProRTX 3090

一个人花四年搭了 8 卡本地 AI 集群 — 他自己说:云便宜得多

Reddit 用户晒出从游戏主机到 4 张 RTX 6000 Pro Max Q 加 4 张 3090 的本地 AI 集群进化史。动机是隐私和玩机,不是省钱。值得关心的是:当云端推理已经便宜到没人算得过来回本,本地部署剩下的到底是什么。

Aug 82 分钟
RTX 3090LocalLLaMA

四张3090不再只为跑分,本地AI开始从发烧转向做生意

一位拥有4张RTX 3090、96GB显存和双NVLink的玩家,没有继续追逐更大模型,而是先给皮肤科医生做了门诊录音转病历工具。值得关心的不是机器多强,而是本地AI社区的重心,正从“能跑什么”转向“能赚什么、能省什么”。

Jul 132 分钟
CodexQwen

开发者把 85%-90% 的 AI 计算放本地,混合式 Agent 正从极客玩具走向降本方案

一位开发者展示了一个三层 Agent:前沿模型负责规划,本地模型完成大部分执行,约 85%-90% 的 token 留在本地。值得关心的不是这个项目本身,而是一个更现实的方向正在浮现:企业未必追求全程最强模型,而是追求“少用贵模型、把结果做稳”。

Jun 152 分钟
RTX 3090NVIDIA

一块灰尘让 RTX 3090 反复掉线,本地算力热潮先卡在维护基本功

一位用户为二手 RTX 3090 主机折腾多轮驱动和功耗设置后,最终发现只是 PCIe 延长转接线积灰导致掉卡。我们注意到,这不是“修电脑趣闻”,而是本地部署热起来后,一个更现实的问题:硬件稳定性开始比模型参数更影响使用体验。

Jun 52 分钟
QwenRTX 3090

消费级显卡跑通 100K 上下文 — 本地大模型部署的硬件门槛正在快速降低

一块 RTX 3090 跑 27B 模型、100K 上下文、50 tokens/s,背后是量化+MTP 推测解码+KV 缓存压缩的组合优化。消费级硬件的推理能力正在逼近一年前的企业级方案,关心本地部署的人值得留意这个趋势。

May 72 分钟
RTX 3090本地推理

二手 RTX 3090 翻新指南走红 — 算力平替让极客开始自修显卡跑 AI

一篇二手 RTX 3090 翻新指南在开发者社区走红。这反映出一个值得关心的趋势:为避开昂贵的云端算力账单,技术团队正转向二手消费级硬件跑本地模型,算力获取方式正变得草根化。

May 12 分钟
LocalLLaMARTX 3090

两张显卡能不能同时跑两个 AI 模 型?一个真实用户案例揭示本地 部署的核心取舍

一位 拥有 RTX 3090(24GB)和 RTX 3060(12GB)双显卡的用户,在 Reddit 上提出了一个典型问题:两张规格不同的显卡,到 底该跑一个大模型还是同时跑两个?这个问题背 后,是越来越多人尝试在自己电脑上运行 AI 模型时都 会遇到的硬件资源分配难题。

Apr 192 分钟