Qwen
找到 30 篇关于此标签的文章
大模型上线要调 40 多项参数——调参正在变成独立手艺
一份最新发布的中文调参指南一次性列出 40 多项配置建议。这背后是一个被低估的趋势:AI 落地进入工程化深水区,调参正从工程细节变成独立岗位能力。
阿里云去土耳其、芬兰、荷兰开新机房 — AI 出海的新边界不是模型
阿里云本周公告将在土耳其、芬兰、荷兰新建云数据中心,并把多国节点扩容。AI 产品出海真正卡住的不是模型强弱,而是云地域——它正成为 AI 产品的政策执行面、合规边界与成本变量。
得物用大模型重构商品搜索 — 但'生成式召回'的成本账还没人算清
'召回'是搜索第一关:从几亿商品里挑候选,传统靠关键词匹配和向量检索(文字变数字找相似)。得物让大模型给商品生成标签,从'找'变成'造',是国内一线电商首次系统披露这套工程链路。
5 万元 Mac 跑完 1700 次 Agent 调度 — 本地大模型第一次像在干活
Reddit 开发者用 M5 Ultra Mac Studio 跑 Qwen 3 量化模型,112M tokens 任务里完成 1700 次子 Agent 调度、89% 缓存命中 — 消费级硬件首次跑出工程可用的本地 Agent 表现。
40MB 单文件装下大模型和语音 — Local-First AI 开始落地
一个独立开发者把开源大模型推理、语音识别、代码执行器打包成 40MB 的本地 exe,演示了 AI 实时生成每一个界面像素的可能。这是 Local-First(本地优先、不依赖云)路线少有的能跑通的产品级 demo,值得我们关心:它挑战的是云厂商的护城河。
Qwen 27B 出了一份民间量化包,单块 AMD 显卡就能跑 — 本地大模型开始有'装机'那味了
Reddit 开发者用单块 AMD Strix Halo 跑出 Qwen 27B 的高质量量化版,三项测试超过主流方案。值得关心的是:单人单卡一周就能产出原本需要企业团队数周的工作,本地大模型正从极客玩具变成可选项。
RTX 4090 在家跑通义千问写代码 — 但本地 AI 还不是白领的菜
一位 Reddit 用户用 RTX 4090 + 32GB 内存跑通义千问 27B 量化版写代码并求助调优。这背后是两件事:中国开源模型在国际开发者社区站稳脚跟;但本地大模型对绝大多数白领来说,依然只是硬核爱好者的玩具,不值得为它专门买硬件。
通义千问被海外开发者抢着做适配工具 — 阿里AI开源路线悄悄见效
本周Reddit的r/LocalLLaMA板块,开发者为通义千问3.8选哪个「工具壳」(harness,模型和IDE之间的中间层)吵成一锅粥。表面是工具之争,背后是通义千问已成西方开源社区默认选项之一。
苹果 M5 Max 笔记本跑 35 万字上下文 — 本地大模型跨过硬件门槛,质量还差一口气
一位用户在 128GB MacBook Pro 上实测 Qwen3.8-Flash-Next:上下文撑到 35 万字仍可对话,但超过 10 万字后模型开始"角色错乱"。本地大模型硬件门槛在塌陷,质量稳定性仍是关键短板。
把千问压到 1 比特还是慢 6 倍 — 想在本地跑大模型的企业可以再等等
阿里千问最新模型支持极致压缩(量化到 1 比特),但 Reddit 用户实测发现:极低精度版本在普通电脑上跑起来反而比稍大的版本慢 6 倍,准确率也跌到 70% 出头。这件事告诉我们,本地部署大模型的「省钱+数据自主」故事,现在还远没到能替代云端服务的阶段。
工程师把 Qwen 调到极限后发现:26 万 token 是本地 AI 的硬天花板
一位开发者把 Qwen 最新模型调到极致后发现:上下文一旦超过 10 万 token,生成速度暴跌 75%。这说明长上下文仍是本地 AI 的天花板,也是企业绕不开云端的关键证据。
本地跑 AI 写代码火了 — 但多数公司的显卡还跑不动
本周 Reddit 程序员社区一篇求助帖被反复讨论:作者想用公司闲置的 RTX A4500 工作站(20GB 显存 + 256GB 内存)跑本地大模型写代码,纠结选 Qwen 3 27B 量化版还是更大模型。这不是个例,过去半年本地跑模型写代码正从极客玩具变成部分开发者和中小公司的真实选项。
百万上下文跑在两张 5090 上 — 企业自建 AI 的硬件神话被业余玩家打破
一位 Reddit 开发者改造开源推理引擎 NInfer,让 27B 参数 Qwen 模型在两块消费级 5090 上跑出百万 token 上下文,速度比 vLLM 快近 3 倍。值得关心的是:企业自建大模型的硬件门槛正被业余项目瓦解。
Qwen 3.8 实测:深度思考模式多烧 5.5 倍 token,本地部署账该重算
一位 Reddit 用户在 MacBook Pro M5 Max 上跑了 Qwen3.8-27B:开启「深度思考」模式后,token 消耗是普通模式的 5.5 倍、推理耗时 6 倍;关闭后质量又掉到其他 MoE 模型之后。开源模型「会思考」与「想得起」之间的成本裂缝正在浮出水面。
RTX 5080 跑 Qwen 大模型只有 6 字/秒 — 本地部署 AI 的家用门槛还有多高
有人在 Reddit 用 RTX 5080 + 64GB 内存跑 Qwen 量化模型,每秒只生成约 6 个汉字。这件事值得关心:想「让 AI 跑在自己电脑上」,对硬件和调参能力的要求仍远超普通用户。
社区版 Qwen3.8 量化模型省 30GB 空间 — 本地跑大模型的门槛又降了
社区开发者 agentionai 发布 Qwen3.8-Flash-Next 的定制量化版本,比主流版本小 20-30GB 而质量相当。本地运行大模型的硬件门槛进一步下移,但目前仍是极客圈的事。
一款 35B 开源大模型被悄悄"换芯" — 这背后是整个 AI 行业的供应链信任账
一款 35B 开源大模型的本地压缩版被悄悄重传——权重变了,校准数据换了,官方没发任何说明。这不是产品新闻,是整个开源 AI 圈被忽视的供应链信任问题。
千问 27B 跑到 50 tok/s:16G 消费显卡也能本地跑大模型
本周一个 Reddit 用户把阿里通义千问 27B 模型塞进 16GB 消费显卡,跑出 50 token/秒生成速度 + 10 万字上下文。本地大模型正走出极客圈、逼近云端体验。
把 AI 思考深度拉满反而更差 — DGX Spark 本地实测给企业的提醒
一位 Reddit 开发者用四台 NVIDIA DGX Spark 桌面工作站实测 DeepSeek、Qwen 多款模型,发现「深度思考」模式反而让得分下降、耗时翻倍。这对花钱买 AI 推理服务的企业是直接的成本提醒。
Qwen 把思考深度做成可调档位 — 阿里让大模型开始按需分配算力
阿里通义千问被开发者社区热议的「可调思考深度」功能,意味着用户可以让模型简单问题秒答、复杂问题多推理。这是大模型从「开关」走向「旋钮」的一步。
阿里和智谱同时押注小模型 — 本地 AI 圈开始陷入选择困难
阿里 Qwen Flash 和智谱 GLM Flash 几乎同时推出,让本地部署用户陷入"留一个还是都要"的纠结。这背后是中国开源大模型从"卷参数"转向"卷同档位"的信号。
阿里开源模型救活一部砖掉的折叠屏 — 本地 AI 第一次敢放手干
我们注意到一条 Reddit 帖:作者在树莓派上跑通义千问 3.8 (27B 参数),救活了一部无法启动的折叠屏手机,省下约 600 美元。值得关心的不是技术,而是用户第一次敢让本地 AI 独自处理关键任务。
千问 27B 模型只要 18GB 显存就能跑 — 本地大模型门槛又降一档
阿里千问 8 月发布的 27B 多模态模型,Q4 量化后只需 18GB 显存,消费级显卡就能跑起来。开源大模型的本地化门槛又降一档,但 MoE 版本仍需集群,工具链分裂也是老问题。
阿里通义千问被压到 10GB — 小尺寸跑出原版质量,本地 AI 又进一步
奥地利 ISTA-DASLab 实验室把阿里通义千问系列一个 270 亿参数(27B)模型压到 10GB(普通 U 盘大小),成绩还能和原版几乎打平。本地 AI 又向前跨了一步——企业可以不用云端、不上传数据,部署一个够用的 AI。
双 DGX Spark 跑 181 tok/s 并发 — 本地多 Agent 这次能用了
海外工程师用 2 台英伟达 DGX Spark 桌面超算,搭载 Qwen 系列开源模型,并发跑出 181 token/秒,同时撑起 9 个 AI Agent。对企业的意思是:本地多 Agent 部署从'展示'走向'干活'。
智谱 GLM-5.3 架构未动训练刷分 — 中国大模型公司开始卷'内功'
智谱 GLM-5.3 在架构与 5.2 完全一致的情况下,仅靠训练方法刷出性能新高。当同行还在堆参数换架构,这条'安静路线'值得关心。
两块 3090 显卡跑 27B 大模型,每秒 165 字 — 本地 AI 第一次"够用"
我们注意到一位 Reddit 用户在两块 RTX 3090 游戏显卡(整机二手不到两万)上跑出 27B Qwen 模型每秒 165 字,达到接 Agent 任务的水准。本地大模型第一次从"只能玩"跨进"能干活"。
8B 小模型本地跑 Agent 编码追平 27B — 小模型'够用时刻'来了
Reddit 社区开发者用单张 RTX Pro 6000 跑了份 Agent 编程本地基准:8B 量化小模型跑分逼近 27B 模型,每分请求数和 token 数都更省,且模型自称'未充分训练'。我们注意到,本地跑 AI 写代码的硬件与算力账,可能要被重新算一遍。
本地跑大模型有张没人算的账单 — 你的 GPU 在给房间供暖
Reddit 用户实测:双 5060Ti 跑 Qwen 27B 做编码任务,每张卡满载 170W,相当于一台小型取暖器持续工作。本地 AI 看似'免费',电费和散热成本却没人提前算清。
阿里 Qwen 跑通两张 RTX 3060 — 但默认配置慢 7 倍
Reddit 用户晒出:阿里 Qwen3 125B 量化版在两张 RTX 3060 玩家显卡上跑到 400 t/s。但他最初只跑出 36 t/s——11 倍差距,全卡在一个默认配置陷阱。本地大模型从'跑起来'到'跑得好',中间还差一段工程活。