Qwen3
找到 30 篇关于此标签的文章
Agent 决策模型上,开源首次追平闭源 — 但天花板只有 8K
开源 CLM 模型在 Agent 决策任务上比闭源 Jev 快 4-13 倍,微调后编程验证器基准超过 Jev 约 10 个百分点。但代价是上下文缩到 8K,零样本广度仍输约 4 个百分点。对自建 Agent 的企业是一道新选择题。
Tenstorrent 跑通 Qwen3.7-27B — 非英伟达 AI 芯片商用破冰
Tenstorrent 用户晒出 QuietBox 2 工作站跑 Qwen3.7-27B 的推理数据。这是非英伟达阵营首次拿出接近商用的实测成绩,但距离撼动英伟达生态还很远。
一张 24G 工作站显卡跑起 27B 模型 — 本地大模型开始够用了
本周 Reddit 一位开发者用一块 24GB 工作站显卡,把阿里通义千问 27B 模型跑出了 128K 上下文和每秒 60 个字的生成速度。值得关心的是:几万块硬件就能本地跑中型大模型,企业不必再把所有数据送去云端。
Ornith 让 8GB 显卡跑 35B 模型:本地 AI 编程的甜蜜点真的到了
一位 Reddit 用户用 RTX 3070 笔记本(8GB 显存)跑通 Ornith-1.5-35B-A3B,速度约 32 token/秒,能完整执行 agentic 编程任务。这件事值得关心,是因为消费级硬件开始承接过去需要云端才能跑的 AI 工作流。
Qwen3 模型在 5090 上跑到 220 tokens/秒,本地 AI 体验拐点临近
新推理引擎 Ninfer 让 Qwen3 模型在 RTX 5090 上跑出平均 170、最高 220 tokens/秒,速度比主流 llama.cpp 快一倍多。本地部署 AI 的体验正在逼近云端 API,企业自建的成本结构开始松动。
6500 美元旧显卡跑出顶级 AI 速度 — 个体开发者改写企业推理的成本公式
GitHub 用户 curvedinf 用 6500 美元的二手 AMD MI100 显卡,把 Qwen3 27B 模型推理速度从 15 token/s 拉到 972 token/s,约 65 倍提升。值得关心的不是某个开源分支,而是企业部署 AI 的硬件门槛正在被个人项目悄悄压低。
本地跑 Qwen3 没人告诉你怎么配:Reddit 用户自掏 $100 做横评
Reddit 一位用户计划自掏 100 美元租云端 GPU,系统测试阿里 Qwen3 不同量化版本在本地部署时的真实表现。事情虽小,但折射出一个判断:开源大模型看似免费,但跑起来选哪个版本最值,依然没人替普通用户回答。
Qwen 27B 长文本速度缩水近三分之二 — 本地玩家不信官方跑分
本周 Reddit 本地 AI 社区用户发帖,准备用 AMD R9700 跑阿里 Qwen3 系列 27B 模型,结果发现官方公布的 51.8 tokens/秒是理想条件下的数字。真正的长文本场景下,速度从 75 跌到 26。值得关心的是:本地部署 AI 大模型正从能不能跑,进入跑得稳不稳的阶段。
开源大模型追平 GPT-5 之后,本地部署的回本期压到两个月
DeepSeek-V3、Qwen3 系列在多项基准测试追平 GPT-5 级别,英伟达 748GB 显存桌面工作站让本地推理的回本周期缩短至两个月。企业用云不再是唯一选项,混合部署正在成为主流架构。
Reddit 用户让本地 AI 提速 65%,但官方还没接盘
本周 r/LocalLLaMA 有开发者发布 llama.cpp 分支,用「DSpark PC Tree」推测解码技术把 Qwen3 跑速提升约 65%。这是单点实验,未被官方合并,但它折射的趋势值得关心:本地跑 AI 越来越便宜、越来越快。
Qwen3 在 RTX 5090 跑出 6250 token/s — 开源社区把 AI 推理成本又压低 50%
一条 Reddit 帖子显示,unsloth 社区发布的 Qwen3 8B 新压缩版本,在 RTX 5090 上推理速度达到 6250 token/s,比传统方案快 50%。背后是 Nvidia 新一代 NVFP4 4 位浮点格式的社区跟进。
他用一张 5090 显卡替代 Claude Code 写代码 — 本地大模型开始能干活了
一位 Reddit 开发者用 RTX 5090 笔记本显卡(24GB 显存)+ 通义千问 Qwen3 本地模型,替代 Anthropic 的编程助手 Claude Code,连续 7 小时没回头订阅。值得关心的是:本地大模型在编程这种高难度任务上,可能第一次到了让人愿意放弃订阅服务的水平。
25M 参数模型声称追平自家 50M — 一场社区实验,更是一场关于小模型路线的争议
一家叫 SupraLabs 的小团队本周用消费级显卡训练出 25M 参数的语言模型(约为 GPT-2 的六十分之一),并声称成绩追平自家 50M 旧版本。我们看完采样,倾向于把它归为社区实验秀——但它指向的「小模型跑在本机」趋势,值得记一笔。
AirLLM 把 2.8 万亿参数 Kimi K3 塞进 4GB 显卡 — 但先别激动
开源推理工具 AirLLM 更新,号称把 2.8 万亿参数 Kimi K3 跑进 4GB 显存。方向是对的,但社区对数字本身仍有质疑,速度瓶颈也未解决。
笔记本+显卡盒子拼出 40GB 显存,本地跑 Qwen3 27B 速度涨七成
一位 Reddit 用户用笔电外接显卡盒+雷bolt 4 拼出 40GB 显存跑 Qwen3 27B,生成速度从 16 提升到 27 token/秒,涨幅约七成。这条小众实践提示我们,本地部署成本曲线仍在下行,云端不再是唯一答案。
通义千问 27B 跑分很强,但 300 万次下载的版本其实没人系统测过
通义千问 27B 在公开跑分榜成绩亮眼,但真正被下载 300 万次的 4-bit 压缩版根本没人系统测过。本周 Reddit 高赞帖指出:跑分榜测的是「精装版」,用户跑的是「简装版」,两者不是同一个东西。
Qwen3 用户搞混了两个参数:'思考深度'和'字数上限'不是一回事
阿里开源的 Qwen3 在本地部署工具 llama.cpp 中暴露出参数混淆问题:网页界面上的'推理档位'只是 token 上限,真正的'推理努力程度'是另一个隐藏参数——企业自部署的 PoC 效果可能因此严重失真。
阿里 Qwen3 27B 压到 18GB 单卡可跑 — 本地大模型门槛又下一档
阿里通义千问 Qwen3 27B 模型通过 int4 量化压缩到 18GB,配合多 token 预测加速,单张消费级 GPU 即可本地运行。这条来自开源社区的进展说明,本地部署大模型的硬件成本仍在持续下移。
本地 AI 较真:27B 大模型在 RTX 5060 Ti 上跑通 13 万字上下文
本周 LocalLLaMA 社区更新 RTX 5060 Ti 本地大模型项目,把'能加载 13 万字'和'能稳定回答 13 万字问题'分开测试。这件事比单一 benchmark 更有信号意义:开源本地大模型正从'跑得动'进入'真能用'阶段。
Qwen3 被吐槽过度思考 — 推理模型的「思考链」正在变成累赘
阿里 Qwen3 的开源版本在海外本地部署社区遭遇集中差评:模型花大量时间「思考」和做用户没要求的事,真正干活前上下文(模型一次对话能记住的信息量)就被吃光。这反映的是推理类模型的通病,不只是 Qwen3 一家。
英伟达 NVFP4 让模型跑得更快,但内部精度悄悄在丢 — 论文指出压缩正在制造隐形损伤
一项 arXiv 新论文发现,用 NVFP4(英伟达 4 位浮点,一种极低精度压缩格式)压缩大模型时,仅让输出匹配老师模型会掩盖内部表征(模型各层对信息的抽象表达)的退化;这意味着低精度推理正在悄悄损害推理和编程能力,值得关心 AI 部署成本与质量平衡的从业者留意。
玩家把四张消费级显卡打通后跑大模型提速 25% — 本地 AI 的成本曲线正在悄悄松动
一位海外开发者在 4 张 RTX 5060Ti 上启用一项原本仅限专业卡的「GPU 直连」功能,大模型推理速度直接提升约 25%。这件事值得关心,是因为它意味着:用消费级硬件跑本地大模型,可能比你想象中更可行。
消费级显卡跑长文本提速10倍 — 本地部署大模型的等待焦虑被新算法终结
开源项目 PFlash 让 RTX 3090 显卡处理 12 万字长文本的等待时间从 4 分钟缩至 24 秒。这标志着消费级硬件跑长文本大模型不再有首字延迟的致命痛点,本地化部署的商业可行性大幅提升。
手机本地跑 AI 不再需要联网—— 一个开源安卓应用正在把这件事变得可操作
Pocket LLM v1.4.0 本周更新:安装包从捆绑模型压缩到约 200MB,用户可在 App 内自行下载所需模型、离线运行 AI 对话。这不是大公司发布会,而是开源社区悄悄推进「手机本地 AI」可用性的一个缩影——值得关注的信号是,离线 AI 的门槛正在从「极客专属」向普通用户移动。
本地 AI 自己调工 具还在「鬼打墙」——开源社区的真实使 用体验比宣传落后整整一代
Reddit 上一 个获得 103 点赞、148 条回复的帖子,集中 暴露了本地运行 AI 模型时「工具调用」功能的真实状态: 模型声称完成了任务,文件根本不存在; 声称网站已就绪,打开是空文件。 这不是个案,而是当前开源小模型在执 行复杂指令时的普遍短板——值得所有正 在评估「私有化部署 AI」方
两块消费级显卡拼在一起能跑什 么大模型——普通人自建 AI 算力的 边界正在移动
Reddit 上一个关于「双 3090 显卡 能跑什么」的讨论,折射出一个正在悄悄发生的变化:越 来越多的人开始用消费级硬件在家跑大 语言模型。这件事值得关心,不 是因为技术本身有多新,而是它代表 AI 算力的门槛正在向个人倾斜。
Qwen 3 还是 Gemma 4?本地 部署玩家正在用实测替 代官方跑分——小模型选型 进入「场景优先」时代
Reddit 上一 个关于「聊天与问答场景下 Qwen 3 35B 和 Gemma 4 26B 哪个更好」的提问,引发大量本地部署用 户讨论。这件事本身不大,但背后的信号 值得关注:越来越多人开始绕开 官方基准测试,用自己的实际使用场景做 选型依据,小模型市场的竞争逻辑正在 悄悄换轨。
本地运行 AI 编程时, 要不要关掉「思考模式」?一个值得厘 清的实用问题
在自己电脑上 跑大模型写代码时,「思考模式」(模型在给出 答案前先进行内部推理的机制)到底是 帮手还是负担?这个问题在开发者社区里有真 实争议。我们认为,这不只是技 术设置问题,而是折射出当前 AI 编 程工具链一个尚未解决的结构性 矛盾。
Qwen 3.6 is the first local model that actually feels worth the effort for me
阿里巴巴 Qwen 3.6 35B-A3B 在双消费级 GPU 上以 Q8 量化运行,实现 170 tokens/秒与完整 260K 上下文,社 区称其首次真正替代云端编程助手。
GPoUr with ~12gb vram and a 3080 getting 40tg/s on qwen3.6 35BA3B w/ 260k ctx
ll ama.cpp 的 turboquant 分支通过 turbo3 KV cache 量化, 在单张 RTX 3080 12GB 显存上实现 Qwen3-35B-A3B 约 40 tok/s 推理速度,并支持 260k 上下文窗口。