开源大模型
找到 30 篇关于此标签的文章
DeepSeek 在两台几万元小机器上跑出 67 token/s — 本地大模型门槛正在塌方
本周一位 Reddit 用户用两台 NVIDIA DGX Spark 工作站(约 6 万元)跑出 DeepSeek V4 Flash 67-84 token/s 的稳定输出,配 100 万 token 上下文。我们关心的是这份民间复刻印证了一个被低估的趋势:开源大模型本地部署的成本正在快速下沉,企业
阿里和智谱同时押注小模型 — 本地 AI 圈开始陷入选择困难
阿里 Qwen Flash 和智谱 GLM Flash 几乎同时推出,让本地部署用户陷入"留一个还是都要"的纠结。这背后是中国开源大模型从"卷参数"转向"卷同档位"的信号。
两块 3090 显卡跑 27B 大模型,每秒 165 字 — 本地 AI 第一次"够用"
我们注意到一位 Reddit 用户在两块 RTX 3090 游戏显卡(整机二手不到两万)上跑出 27B Qwen 模型每秒 165 字,达到接 Agent 任务的水准。本地大模型第一次从"只能玩"跨进"能干活"。
Ornith 让 8GB 显卡跑 35B 模型:本地 AI 编程的甜蜜点真的到了
一位 Reddit 用户用 RTX 3070 笔记本(8GB 显存)跑通 Ornith-1.5-35B-A3B,速度约 32 token/秒,能完整执行 agentic 编程任务。这件事值得关心,是因为消费级硬件开始承接过去需要云端才能跑的 AI 工作流。
700 行 C 代码跑动 Google 最新大模型 — 单人项目跑赢 llama.cpp
开源项目 gemma4.c 把 Google Gemma 4 E2B 塞进 700 行 C 代码,普通 CPU 上 25.9 token/s 跑赢 llama.cpp。值得关心的是:AI 推理层工程门槛正被一位开发者踢开,过去一团队的事现在一个人就够。
中国开源模型在 Agent 评测追平顶尖闭源 —— GLM 和 Qwen 只用了两个月
Agent Arena Code 这份榜单最近更新了一轮初步结果:智谱的 GLM 和阿里的 Qwen 在 Agent 代码任务上跑出与顶级闭源模型接近的成绩。开源阵营追上闭源头部,这件事在两个月前还不敢想。
通义千问新模型可本地运行 — "AI 必须上云"的假设正在松动
阿里通义千问新模型 Qwen3.8-Flash-Next 合并进 llama.cpp,普通电脑也能本地跑对话 AI 而无需云端 API。这条不起眼的小新闻背后,是开源阵营对闭源云厂商商业模式的持续蚕食。
Reddit 用户提议 BT 替代 HuggingFace 分发大模型 — 没那么简单
开源大模型动辄几十 GB,HuggingFace 的分发带宽成本是天文数字。Reddit 用户提议用 BT 种子让社区分担——听上去双赢,但安全审核、冷门模型死链、商业可持续性三道坎,哪个都不好过。
DeepSeek 当主脑、Qwen 做副手 — 中国开源大模型开始被分工使用
一名开发者把 DeepSeek V4、Qwen 3.8 Flash、GLM 5.3 Flash 三款中国开源大模型塞进 4 张 DGX Spark 本地推理卡跑实测,GLM 5.3 Flash 因太啰嗦、速度仅 22 tok/s 被淘汰,最终让 DeepSeek 扛主力、Qwen 当副手。这反映中国
智谱把 AI 写代码打到 4 分钱一次:价格不是新闻,门槛转移才是
智谱 GLM-5.3 Flash 本周上线开源——就是上周刷榜的匿名模型「牛来」Ox-Alpha。一位前端用 4 个真实任务实测总账单 4 分钱,同样的输出量喂 Claude Opus 要 11 块多。差距近 300 倍,但真正的变化是门槛本身的转移。
开发者把 AI 模型挂上 BT:防 Nvidia 拿下 Hugging Face
Hugging Face(全球最大 AI 开源模型社区)传出被 Nvidia 收购的消息,社区担心平台走向封闭。一个 Reddit 帖子提醒:AI 模型不是盗版,可合法 BT 分发。值得我们关心的是——AI 模型基础设施越来越集中,整个生态的开放性能否保住。
Qwen 27B 本地跑赢 Opus 4.6 — 开源够用,但这是厂商自测
一位量化模型厂商联合创始人发帖称,Qwen 3.8 27B 的本地压缩版本在 RTX 6000 上生成代码速度比 Claude Opus 4.6 快 57%。但样本只有 4 个写 3D 游戏的提示,且发布者本人就是被测厂商的联合创始人。
DeepSeek V4 视觉版迟迟不发权重 — 中国开源 AI 的「狼来了」焦虑
曾凭 V3 与 R1 开放下载改写行业规则的 DeepSeek,这次在 V4 视觉版(能看图的多模态模型)的权重开放上没了动静。本地 AI 社区开始催问,背后真正的疑问是:中国开源大模型的领先窗口还能撑多久。
智谱旗舰模型定价是 Opus 4.8 的四十分之一 — 中国 AI 改写行业默认
智谱 GLM-5.3-Flash 在 Artificial Analysis 综合智能指数拿到 57 分,与 Claude Opus 4.8 持平,限时价仅为后者的四十分之一。这是中国大模型公司第一次同时拿到前沿性能、低廉价格与最宽松开源协议三张牌。
智谱把 GLM-5.3 轻量版搬上 Hugging Face — 中国大模型公司继续靠开源抢开发者
智谱把 GLM 系列最新轻量版 GLM-5.3-Flash 上传 Hugging Face,主打速度和成本。这是中国大模型公司在开源潮里的又一次出手。值得关心的是:开源模型越轻越多,按调用付费的 API 生意还能撑多久。
Hugging Face 被摆上货架 — 130 亿美元估值背后,开源 AI 主仓库要易主
全球最大的开源 AI 平台 Hugging Face 被传出正在洽谈出售,整体估值约 130 亿美元。这桩交易一旦落地,可能改变开源 AI 生态的现有格局与企业 AI 战略的默认选择。
智谱开源 GLM-5.3-Flash:性能追 Claude Opus,价格只收上代十分之一
智谱本周开源 GLM-5.3-Flash 模型权重,3200 亿参数只激活 180 亿,号称在编程和 Agent 基准上接近 Claude Opus 4.8,价格只有上代的十分之一。我们关心的是:开源大模型第一次有底气跟闭源顶级模型摆在一起比,但这个底气在实际落地时还剩多少。
27B 模型在 4090 上 3 小时做出 Minecraft 克隆 — 本地 AI 能力逼近闭源旗舰
一位海外开发者用本地部署的 27B 参数开源模型(通义千问系列、Q4 量化版),在 RTX 4090 显卡上耗时约 3 小时、电费不到 1 美元,AI 自动完成了代码、音频、贴图和 3D 模型四类资产,最终得到一个可运行的 Minecraft 克隆版游戏。开源大模型的本地能力正快速逼近此前只有顶级闭
智谱开源 Ox Alpha 对标 DeepSeek — 中国大模型把开源做成标准动作
本周 Z.AI(智谱)确认:神秘冲榜的 Ox Alpha 是 GLM 新一代,今晚开源权重。这不只是技术新闻——继 DeepSeek 之后,第二家中国大模型公司主动押注开源换生态。
开源 27B 小模型追平前沿大模型 — 一张 Reddit 测试图引发的争论
本地跑得动的 27B 参数开源模型(阿里通义千问)在 agentic 任务上被社区用户晒出追平前沿大模型的成绩。我们关心:这是不是"大模型越大越好"叙事的拐点,企业自建 AI 的成本门槛会不会被进一步压低。
Qwen3 模型瘦身 65% 跑分几乎不跌 — 大模型部署成本战升级
一支团队把 Qwen3-27B 模型压缩到原来的 35%,但 GPQA-Diamond 跑分只掉 0.5 个百分点。这意味着大模型部署所需的显存和成本可能大幅下降,是企业 AI 落地最值得关心的技术拐点。
本周 AI 圈最热帖只有 8 个字 — 我们看到的预期管理正在靠梗图驱动
英文本地大模型社区 r/LocalLLaMA 本周最热帖只写了 'It's here!' 八个字,配一张辛普森梗图,发帖人 ID 致敬马斯克那条著名推文。零技术细节却刷屏,这件事比任何产品发布都更值得关心。
LocalLLaMA 上有人发了句'我有个问题'就没下文 — 这本身就是条行业信号
r/LocalLLaMA 上一个'我有个问题'的空帖冲上首页 — 这背后是开源大模型社区信号密度的变化。普通人不必在意,但想本地跑模型的人可以留个心眼。
通义千问被追问能不能补全代码 — AI 工具从演示到日常还差工程距离
一位开发者本周在 Reddit 上问:阿里通义千问 Qwen 系列开源模型支不支持在编辑器里实时补全代码?这暴露出一个被低估的事实 — AI 工具从能对话到能嵌入日常工作流,中间还隔着不少工程细节。
IBM 一次放出三个推理大模型,开源免费商用 — 老牌 IT 巨头这回动了真格
IBM 本周在 Hugging Face 一次性发布 Granite 4.2 系列三个推理模型(30B/8B/3B),全部采用 Apache 2.0 协议,免费可商用。支持思维链推理、思考强度切换、512K 长上下文。意味着传统 IT 厂商在 AI 时代开始正面迎战开源阵营。
通义千问发布 Flash 新模型,Unsloth 当天就适配 — 开源大模型的追赶速度变了
阿里通义千问这周推出 Flash 新模型,做本地部署优化的 Unsloth 几乎同一天宣布支持。这意味着开源模型从发布到「普通电脑能跑」的间隔正在被压到一天以内,值得企业 IT 决策者留意。
4-bit 压缩后的模型反而比原版更强 — 量化修复让小模型逆袭
本周 r/LocalLLaMA 流传一项研究:通过「量化感知修复」技术,4-bit 压缩后的模型不仅没掉性能,跑分还超过了原版全精度模型。这事如果站得住,大模型部署成本可能再降一截。
JetBrains 把 27B 本地 AI 装进 IDE — 中国开源模型进入主流开发工具圈
JetBrains 首次把 27B 参数的 Qwen 开源模型集成进 IDE,让代码补全在本地完成、不走云端。这件事不只是产品更新,而是中国开源大模型被西方主流开发工具正式采用的信号。
智谱 GLM 在本地跑得更快 — 大模型装进自家电脑的门槛又低了一档
智谱 AI 开源大模型 GLM-4.5-Air 本周在 llama.cpp 中解锁 MTP 加速,106B 总参数仅激活 12B,社区已在 3090 消费级显卡上验证可用。对关注数据本地化的企业是一个值得追踪的信号。
DeepSeek 系模型在 5 万元苹果机上跑出 25 token/s — 本地 AI 开始追上云端
一位开发者用自改的开源推理框架,在 M2 Ultra Mac 工作站上以 25.8 token/s 的速度本地跑通 DeepSeek 最新大模型,且模型体积比官方量化版还小。这意味着开源中国大模型在专业硬件上已达到「可对话」水平。