返回首页

千问

找到 9 篇关于此标签的文章

千问Qwen

把千问压到 1 比特还是慢 6 倍 — 想在本地跑大模型的企业可以再等等

阿里千问最新模型支持极致压缩(量化到 1 比特),但 Reddit 用户实测发现:极低精度版本在普通电脑上跑起来反而比稍大的版本慢 6 倍,准确率也跌到 70% 出头。这件事告诉我们,本地部署大模型的「省钱+数据自主」故事,现在还远没到能替代云端服务的阶段。

Just now2 分钟
Qwen千问

千问 27B 模型只要 18GB 显存就能跑 — 本地大模型门槛又降一档

阿里千问 8 月发布的 27B 多模态模型,Q4 量化后只需 18GB 显存,消费级显卡就能跑起来。开源大模型的本地化门槛又降一档,但 MoE 版本仍需集群,工具链分裂也是老问题。

1d ago2 分钟
Qwen千问

对话 context 烧钱 — 开发者让 0.8B 小模型给 70B 减压,按工种配模型

Reddit LocalLLaMA 板块一个讨论让我们注意到:让千问 0.8B 这种小模型专门压缩对话历史,再喂给 70B 大模型推理——不同任务不该共用一个模型,正在悄悄改变 AI 公司成本结构。

Aug 232 分钟
千问RTX 5090

RTX 5090 单卡跑通千问 27B 的 26 万上下文 — 本地大模型门槛被踩平

海外开发者用 NVIDIA 最新 NVFP4 量化把阿里千问 Qwen3.8-27B 压缩到 19 GB,装进单张 2 万元的 RTX 5090 跑出 26 万 token 完整上下文。短文本生成 77 token/秒,意味着本地部署大模型的硬件门槛正在被悄悄踩平。

Aug 222 分钟
千问Qwen

千问 27B 单卡跑出 80 步 Agent — 本地模型开始能替人干活了

本周 Reddit 一则实测让人侧目:千问 27B 模型在一张消费级显卡上,仅凭一段提示词就自主调用 80 次工具完成查课表、抓视频、转录等任务。这不只是技术演示,'Agent 必须跑云端'的默认假设正被开源改写,门槛塌得比多数人预想的快。

Aug 202 分钟
Qwen千问

国产开源大模型已可手动瘦身 — 社区开发者把千问 27B 砍到 23B 不重新训练

一位 Reddit 开发者把阿里千问 27B 砍到 23B,不靠重新训练只删中间层;这件事意味着国产开源大模型已可「动手改」,本地部署成本继续走低。

Aug 202 分钟
Qwen千问

千问27B在两张3090上跑出218 tokens/秒 — 本地AI成本下沉

一位开发者用两张消费级RTX 3090显卡,把阿里千问团队的27B参数大模型跑出218 tokens/秒。值得关心的是,原本需要H100集群才能流畅运行的负载,如今落到了两张消费卡上。本地AI的硬件成本曲线正在松动。

Aug 192 分钟
qwen千问

阿里千问下周发中型开源新模型 — 全球开源赛道中国公司还在加速

阿里千问社区经理在 Discord 透露,下周将发布一款中型开源大模型,社区猜测参数规模或在 32B-72B 之间。这是千问 2025 年高频迭代节奏的延续,对企业 IT 选型和开源生态值得关注。

Aug 192 分钟
Qwen3.8阿里

Qwen3.8 27B 实测:开最高推理档位,多花 7 倍时间只多 10% 质量

阿里千问新模型支持三档推理强度(让模型'多想一步'的程度)。实测显示:最高档耗时是最低档 6.4 倍,但视觉评分只多 10%。AI 的边际收益递减,已经肉眼可见。

Aug 162 分钟