返回首页

Qwen3

找到 30 篇关于此标签的文章

CLMJev

Agent 决策模型上,开源首次追平闭源 — 但天花板只有 8K

开源 CLM 模型在 Agent 决策任务上比闭源 Jev 快 4-13 倍,微调后编程验证器基准超过 Jev 约 10 个百分点。但代价是上下文缩到 8K,零样本广度仍输约 4 个百分点。对自建 Agent 的企业是一道新选择题。

9月24日2 分钟
TenstorrentQwen3

Tenstorrent 跑通 Qwen3.7-27B — 非英伟达 AI 芯片商用破冰

Tenstorrent 用户晒出 QuietBox 2 工作站跑 Qwen3.7-27B 的推理数据。这是非英伟达阵营首次拿出接近商用的实测成绩,但距离撼动英伟达生态还很远。

8月29日2 分钟
通义千问Qwen3

一张 24G 工作站显卡跑起 27B 模型 — 本地大模型开始够用了

本周 Reddit 一位开发者用一块 24GB 工作站显卡,把阿里通义千问 27B 模型跑出了 128K 上下文和每秒 60 个字的生成速度。值得关心的是:几万块硬件就能本地跑中型大模型,企业不必再把所有数据送去云端。

8月29日2 分钟
OrnithQwen3

Ornith 让 8GB 显卡跑 35B 模型:本地 AI 编程的甜蜜点真的到了

一位 Reddit 用户用 RTX 3070 笔记本(8GB 显存)跑通 Ornith-1.5-35B-A3B,速度约 32 token/秒,能完整执行 agentic 编程任务。这件事值得关心,是因为消费级硬件开始承接过去需要云端才能跑的 AI 工作流。

8月28日2 分钟
NinferQwen3

Qwen3 模型在 5090 上跑到 220 tokens/秒,本地 AI 体验拐点临近

新推理引擎 Ninfer 让 Qwen3 模型在 RTX 5090 上跑出平均 170、最高 220 tokens/秒,速度比主流 llama.cpp 快一倍多。本地部署 AI 的体验正在逼近云端 API,企业自建的成本结构开始松动。

8月28日2 分钟
curvedinfAMD

6500 美元旧显卡跑出顶级 AI 速度 — 个体开发者改写企业推理的成本公式

GitHub 用户 curvedinf 用 6500 美元的二手 AMD MI100 显卡,把 Qwen3 27B 模型推理速度从 15 token/s 拉到 972 token/s,约 65 倍提升。值得关心的不是某个开源分支,而是企业部署 AI 的硬件门槛正在被个人项目悄悄压低。

8月27日2 分钟
Qwen3通义千问

本地跑 Qwen3 没人告诉你怎么配:Reddit 用户自掏 $100 做横评

Reddit 一位用户计划自掏 100 美元租云端 GPU,系统测试阿里 Qwen3 不同量化版本在本地部署时的真实表现。事情虽小,但折射出一个判断:开源大模型看似免费,但跑起来选哪个版本最值,依然没人替普通用户回答。

8月24日2 分钟
Qwen3AMD

Qwen 27B 长文本速度缩水近三分之二 — 本地玩家不信官方跑分

本周 Reddit 本地 AI 社区用户发帖,准备用 AMD R9700 跑阿里 Qwen3 系列 27B 模型,结果发现官方公布的 51.8 tokens/秒是理想条件下的数字。真正的长文本场景下,速度从 75 跌到 26。值得关心的是:本地部署 AI 大模型正从能不能跑,进入跑得稳不稳的阶段。

8月24日2 分钟
DeepSeekQwen3

开源大模型追平 GPT-5 之后,本地部署的回本期压到两个月

DeepSeek-V3、Qwen3 系列在多项基准测试追平 GPT-5 级别,英伟达 748GB 显存桌面工作站让本地推理的回本周期缩短至两个月。企业用云不再是唯一选项,混合部署正在成为主流架构。

8月23日2 分钟
llama.cppQwen3

Reddit 用户让本地 AI 提速 65%,但官方还没接盘

本周 r/LocalLLaMA 有开发者发布 llama.cpp 分支,用「DSpark PC Tree」推测解码技术把 Qwen3 跑速提升约 65%。这是单点实验,未被官方合并,但它折射的趋势值得关心:本地跑 AI 越来越便宜、越来越快。

8月21日2 分钟
Qwen3通义千问

Qwen3 在 RTX 5090 跑出 6250 token/s — 开源社区把 AI 推理成本又压低 50%

一条 Reddit 帖子显示,unsloth 社区发布的 Qwen3 8B 新压缩版本,在 RTX 5090 上推理速度达到 6250 token/s,比传统方案快 50%。背后是 Nvidia 新一代 NVFP4 4 位浮点格式的社区跟进。

8月21日2 分钟
Claude Code通义千问

他用一张 5090 显卡替代 Claude Code 写代码 — 本地大模型开始能干活了

一位 Reddit 开发者用 RTX 5090 笔记本显卡(24GB 显存)+ 通义千问 Qwen3 本地模型,替代 Anthropic 的编程助手 Claude Code,连续 7 小时没回头订阅。值得关心的是:本地大模型在编程这种高难度任务上,可能第一次到了让人愿意放弃订阅服务的水平。

8月21日2 分钟
SupraLabsSupra2-Medium

25M 参数模型声称追平自家 50M — 一场社区实验,更是一场关于小模型路线的争议

一家叫 SupraLabs 的小团队本周用消费级显卡训练出 25M 参数的语言模型(约为 GPT-2 的六十分之一),并声称成绩追平自家 50M 旧版本。我们看完采样,倾向于把它归为社区实验秀——但它指向的「小模型跑在本机」趋势,值得记一笔。

8月20日2 分钟
AirLLMKimi K3

AirLLM 把 2.8 万亿参数 Kimi K3 塞进 4GB 显卡 — 但先别激动

开源推理工具 AirLLM 更新,号称把 2.8 万亿参数 Kimi K3 跑进 4GB 显存。方向是对的,但社区对数字本身仍有质疑,速度瓶颈也未解决。

8月20日2 分钟
Qwen3llama.cpp

笔记本+显卡盒子拼出 40GB 显存,本地跑 Qwen3 27B 速度涨七成

一位 Reddit 用户用笔电外接显卡盒+雷bolt 4 拼出 40GB 显存跑 Qwen3 27B,生成速度从 16 提升到 27 token/秒,涨幅约七成。这条小众实践提示我们,本地部署成本曲线仍在下行,云端不再是唯一答案。

8月20日2 分钟
通义千问Qwen3

通义千问 27B 跑分很强,但 300 万次下载的版本其实没人系统测过

通义千问 27B 在公开跑分榜成绩亮眼,但真正被下载 300 万次的 4-bit 压缩版根本没人系统测过。本周 Reddit 高赞帖指出:跑分榜测的是「精装版」,用户跑的是「简装版」,两者不是同一个东西。

8月18日2 分钟
Qwen3llama.cpp

Qwen3 用户搞混了两个参数:'思考深度'和'字数上限'不是一回事

阿里开源的 Qwen3 在本地部署工具 llama.cpp 中暴露出参数混淆问题:网页界面上的'推理档位'只是 token 上限,真正的'推理努力程度'是另一个隐藏参数——企业自部署的 PoC 效果可能因此严重失真。

8月16日2 分钟
阿里Qwen3

阿里 Qwen3 27B 压到 18GB 单卡可跑 — 本地大模型门槛又下一档

阿里通义千问 Qwen3 27B 模型通过 int4 量化压缩到 18GB,配合多 token 预测加速,单张消费级 GPU 即可本地运行。这条来自开源社区的进展说明,本地部署大模型的硬件成本仍在持续下移。

8月16日2 分钟
LocalLLaMARTX 5060 Ti

本地 AI 较真:27B 大模型在 RTX 5060 Ti 上跑通 13 万字上下文

本周 LocalLLaMA 社区更新 RTX 5060 Ti 本地大模型项目,把'能加载 13 万字'和'能稳定回答 13 万字问题'分开测试。这件事比单一 benchmark 更有信号意义:开源本地大模型正从'跑得动'进入'真能用'阶段。

8月16日2 分钟
Qwen3阿里

Qwen3 被吐槽过度思考 — 推理模型的「思考链」正在变成累赘

阿里 Qwen3 的开源版本在海外本地部署社区遭遇集中差评:模型花大量时间「思考」和做用户没要求的事,真正干活前上下文(模型一次对话能记住的信息量)就被吃光。这反映的是推理类模型的通病,不只是 Qwen3 一家。

8月15日2 分钟
英伟达NVFP4

英伟达 NVFP4 让模型跑得更快,但内部精度悄悄在丢 — 论文指出压缩正在制造隐形损伤

一项 arXiv 新论文发现,用 NVFP4(英伟达 4 位浮点,一种极低精度压缩格式)压缩大模型时,仅让输出匹配老师模型会掩盖内部表征(模型各层对信息的抽象表达)的退化;这意味着低精度推理正在悄悄损害推理和编程能力,值得关心 AI 部署成本与质量平衡的从业者留意。

8月9日2 分钟
NVIDIARTX 5060Ti

玩家把四张消费级显卡打通后跑大模型提速 25% — 本地 AI 的成本曲线正在悄悄松动

一位海外开发者在 4 张 RTX 5060Ti 上启用一项原本仅限专业卡的「GPU 直连」功能,大模型推理速度直接提升约 25%。这件事值得关心,是因为它意味着:用消费级硬件跑本地大模型,可能比你想象中更可行。

8月9日2 分钟
PFlashllama.cpp

消费级显卡跑长文本提速10倍 — 本地部署大模型的等待焦虑被新算法终结

开源项目 PFlash 让 RTX 3090 显卡处理 12 万字长文本的等待时间从 4 分钟缩至 24 秒。这标志着消费级硬件跑长文本大模型不再有首字延迟的致命痛点,本地化部署的商业可行性大幅提升。

5月1日2 分钟
Pocket LLM端侧AI

手机本地跑 AI 不再需要联网—— 一个开源安卓应用正在把这件事变得可操作

Pocket LLM v1.4.0 本周更新:安装包从捆绑模型压缩到约 200MB,用户可在 App 内自行下载所需模型、离线运行 AI 对话。这不是大公司发布会,而是开源社区悄悄推进「手机本地 AI」可用性的一个缩影——值得关注的信号是,离线 AI 的门槛正在从「极客专属」向普通用户移动。

4月19日2 分钟
LocalLLaMAQwen3

本地 AI 自己调工 具还在「鬼打墙」——开源社区的真实使 用体验比宣传落后整整一代

Reddit 上一 个获得 103 点赞、148 条回复的帖子,集中 暴露了本地运行 AI 模型时「工具调用」功能的真实状态: 模型声称完成了任务,文件根本不存在; 声称网站已就绪,打开是空文件。 这不是个案,而是当前开源小模型在执 行复杂指令时的普遍短板——值得所有正 在评估「私有化部署 AI」方

4月19日2 分钟
LocalLLaMAQwen3

两块消费级显卡拼在一起能跑什 么大模型——普通人自建 AI 算力的 边界正在移动

Reddit 上一个关于「双 3090 显卡 能跑什么」的讨论,折射出一个正在悄悄发生的变化:越 来越多的人开始用消费级硬件在家跑大 语言模型。这件事值得关心,不 是因为技术本身有多新,而是它代表 AI 算力的门槛正在向个人倾斜。

4月19日2 分钟
Qwen3Gemma4

Qwen 3 还是 Gemma 4?本地 部署玩家正在用实测替 代官方跑分——小模型选型 进入「场景优先」时代

Reddit 上一 个关于「聊天与问答场景下 Qwen 3 35B 和 Gemma 4 26B 哪个更好」的提问,引发大量本地部署用 户讨论。这件事本身不大,但背后的信号 值得关注:越来越多人开始绕开 官方基准测试,用自己的实际使用场景做 选型依据,小模型市场的竞争逻辑正在 悄悄换轨。

4月19日2 分钟
Qwen3本地大模型

本地运行 AI 编程时, 要不要关掉「思考模式」?一个值得厘 清的实用问题

在自己电脑上 跑大模型写代码时,「思考模式」(模型在给出 答案前先进行内部推理的机制)到底是 帮手还是负担?这个问题在开发者社区里有真 实争议。我们认为,这不只是技 术设置问题,而是折射出当前 AI 编 程工具链一个尚未解决的结构性 矛盾。

4月18日2 分钟
Qwen3LocalLLaMA

Qwen 3.6 is the first local model that actually feels worth the effort for me

阿里巴巴 Qwen 3.6 35B-A3B 在双消费级 GPU 上以 Q8 量化运行,实现 170 tokens/秒与完整 260K 上下文,社 区称其首次真正替代云端编程助手。

4月17日2 分钟
llama.cppQwen3

GPoUr with ~12gb vram and a 3080 getting 40tg/s on qwen3.6 35BA3B w/ 260k ctx

ll ama.cpp 的 turboquant 分支通过 turbo3 KV cache 量化, 在单张 RTX 3080 12GB 显存上实现 Qwen3-35B-A3B 约 40 tok/s 推理速度,并支持 260k 上下文窗口。

4月16日2 分钟