英伟达
找到 28 篇关于此标签的文章
Tenstorrent 跑通 Qwen3.7-27B — 非英伟达 AI 芯片商用破冰
Tenstorrent 用户晒出 QuietBox 2 工作站跑 Qwen3.7-27B 的推理数据。这是非英伟达阵营首次拿出接近商用的实测成绩,但距离撼动英伟达生态还很远。
AMD 把 ROCm 版本从 7 跳到 10 — 一个月一更,这是抢市场节奏
ROCm 是 AMD 抗衡英伟达 CUDA 的开源计算平台。版本从 7.14 直接跳到 10.0,发布间隔仅一个月。这件事值得关注:AI 算力垄断格局可能出现松动。
美光给 AI 算力算了一笔账:HBM 费三倍晶圆,短期内别想降价
美光披露:每生产 1GB HBM 约需 3 倍于 DDR5 的晶圆面积,且下一代不会好转。三大存储厂集体转向 HBM,按 GB 计算全球内存产出缩水三分之二,AI 算力降本短期内无解。
英伟达叫停360亿美元AI分成计划:芯片霸主开始管客户的账本
英伟达原想从云服务商AI收入中抽50%分成,两个月后因内部反垄断担忧暂停。芯片公司开始管理客户的利润表,意味着AI基础设施的产权边界正在被改写。
RTX 5090 售价 5090 美元 — 本地跑大模型的好日子结束了
RTX 5090 显卡实际成交价冲到 5090 美元,Reddit 本地 AI 社区一片哀嚎。背后是消费级显卡跑大模型的窗口正在关闭——开源本地化路线,第一次遇到了真金白银的硬件门槛。
130 亿美元收购案背后 — 你天天用的免费 AI 工具,这周要看一眼
英伟达花 130 亿美元收购 Hugging Face,意味着你手上那堆免费 AI 工具的底层可能要变。同周 Z.ai 开源了能读 100 万字的新模型,普通人 15 分钟就能上手用。
有人把能跑 27B 大模型的设备塞进饭盒 — 本地 AI 玩家正在追上付费服务
Reddit 用户用松下 Toughbook 加 RTX Pro 6000 攒出一台「饭盒级」本地 AI 主机,跑 27B 模型撑满 26 万 token 上下文,自评优于 Gemini Pro 和 ChatGPT。这不是普通 DIY,而是「数据敏感型工作能否脱离云端」的一次硬核实测。
苹果 M5 Ultra 带宽 1.2TB/s — 本地跑大模型跨过实用门槛
苹果本周发布 M5 Ultra,内存带宽达到 1.2TB/s。这是大模型本地推理首次具备实用性能,对处理敏感数据的知识工作者来说,可能改变使用 AI 的方式。
本地 AI 终于能打 — 30B 开源榜单透露的部署拐点
本周 Reddit 上 LocalLLaMA 社区一份 30B 级(300 亿参数)开源模型对比显示,Ornith、TielCoder 等本地可跑模型在编程等任务上已经接近闭源大厂水准。这意味着企业 AI 选型不必再死盯云端 API,本地部署开始成为现实选项。
你客户的名字正在训练 AI — 英伟达砸 70 亿想换新玩法
英伟达 70 亿美元做开放权重 AI 模型,对非码农创业者意味着:未来能在本地跑 AI,客户数据不用再上传第三方服务器。现在不用立即行动,但要知道这件事。
Qwen3-27B 单卡跑通视觉版 — 本地大模型进入消费级拐点
LocalLLaMA 社区有开发者把阿里 Qwen3-27B 量化后塞进单张 RTX 5090:45 万 token 上下文、保留视觉能力、每秒 120 token、整机 400 瓦。值得关心的是——以前要堆多卡服务器的中端模型,现在一张消费级显卡就够了。
开源大模型追平 GPT-5 之后,本地部署的回本期压到两个月
DeepSeek-V3、Qwen3 系列在多项基准测试追平 GPT-5 级别,英伟达 748GB 显存桌面工作站让本地推理的回本周期缩短至两个月。企业用云不再是唯一选项,混合部署正在成为主流架构。
Qwen 在 3090 上跑得更快、温度更低,本地大模型开始像正经工具了
Reddit 用户分享:两张 3090 显卡跑通 Qwen 27B,速度达 143 token/秒,温度从 70°C 降到 35°C。值得我们关心的是:本地大模型正从极客爱好跨入可用工具,对中小企业的成本和数据安全是个潜在变量。
二手 AI 硬件一周涨 8% — 算力紧张开始烧到个人买家
澳洲 eBay 上有人目睹 AI 计算硬件一周内涨价 8%。这不是孤例 — 个人买家被算力稀缺卡脖子,意味着高端算力的供需失衡已从企业层传导到消费层。
通义千问2.4T跑出每秒350 tokens — 大模型价格战要来了
阿里通义千问的 2.4 万亿参数模型在英伟达最新 GB300 整机柜上跑出每秒 350 tokens 的实测数据。这意味着大模型推理(让模型实际回答问题)的边际成本正在被开源生态快速压低,国内云厂商的定价逻辑可能在 2026 年被改写。
有人用 Intel 显卡跑本地大模型 — AI 算力开始绕开英伟达
本周 Reddit 上一位玩家用 Intel Arc 显卡和 SYCL 后端跑通了本地大模型推理。社区共识:英伟达 CUDA 生态之外,本地 AI 多了一条可走的路,但离成熟还远。
美国逼各国在 AI 领域选边 — 中国大模型出海通道正在收窄
美国据传将向盟友施压,要求在中美 AI 竞争中明确选边。这是从 2022 年底芯片禁令升级到「阵营划分」的信号——AI 全球化正在被政治打断。
通义千问 27B 跑出旗舰分数 — 本地 AI 让付费订阅第一次显得多余
本周本地 AI 圈最热话题:阿里通义千问 27B 版本据 AI 评测榜单跑出接近 Opus 4.6 的成绩,参数量只有后者约十分之一。如果数据成立,意味着消费级显卡本地运行已经接近闭源旗舰水平,付费订阅的商业逻辑开始动摇。
英伟达真正值钱的不是更快的芯片 — 是二十年没人敢换的那套软件
英伟达从 1993 年加州一家快餐店诞生的显卡公司,成长为市值万亿的 AI 算力霸主。这条路靠的不是芯片更快,而是 2006 年开始铺、二十年没人敢换的软件生态。理解它,是看懂 AI 算力为什么这么贵的前提。
7B 模型训练要 160GB 显存 — 这是 AI 只剩巨头能玩的根本原因
训练一个 7B 大模型需要 160GB 显存,单张顶配 GPU 都装不下。这道算力门槛决定了 AI 行业只能是巨头的牌局 — 独立研究团队和中小公司,要么买 API,要么被淘汰。
5090 之后再等五到十年,GPU 三倍性能才到 — 但功耗可能先撑不住
Reddit 网友算了笔账:2009 到 2025 年英伟达消费级 GPU 每代性能平均涨 50%。按此推算,要做出 RTX 5090 三倍性能的下一代 GPU,最早 2029 年,最晚 2038 年。同时功耗也在涨。
阿里开源 2.4 万亿参数大模型 — 国内企业第一次有「不押注 OpenAI」的选项
阿里把 Qwen3-Max 最大版本(2.4 万亿参数)的权重全部公开,号称性能逼近闭源前沿。这是中国企业第一次有「不绑定 OpenAI 或 Anthropic 也能拿到近顶级 AI」的现实选项。
英伟达 NVFP4 让模型跑得更快,但内部精度悄悄在丢 — 论文指出压缩正在制造隐形损伤
一项 arXiv 新论文发现,用 NVFP4(英伟达 4 位浮点,一种极低精度压缩格式)压缩大模型时,仅让输出匹配老师模型会掩盖内部表征(模型各层对信息的抽象表达)的退化;这意味着低精度推理正在悄悄损害推理和编程能力,值得关心 AI 部署成本与质量平衡的从业者留意。
OpenAI、高通都在绕开英伟达,AI 竞争开始从模型转向算力成本
OpenAI 联手博通测试自研芯片,高通同日发新数据中心方案并收购推理软件公司,信号很明确:AI 公司的胜负手,正从“谁模型更强”转向“谁能把算力做得更便宜、更稳定”。这比单条发布更值得关心。
Anthropic估值九千亿、政治局定调AI+ — 资本与政策同时押注AI落地
Anthropic估值冲九千亿、英伟达造智能体模型、政治局定调AI+。本周资本与政策罕见同频,大模型竞赛正从「比参数」转向「比落地」,AI替人干活的时代正式开启。
PyTorch 占据八成开发者桌面 — 大模型淘金热里,卖铲子的依然是英伟达
PyTorch 已成 AI 开发事实标准,但软件层的统一反而凸显了硬件层 CUDA 的垄断门槛。大模型竞争的瓶颈,正从框架之争退回到显卡算力与配环境上。
单张 3090 在 Windows 跑通 Qwen3 — 本地部署大模型不再必须折腾 Linux
开发者在 Windows 原生环境跑通 Qwen3.6-27B 模型,速度达 72 tok/s。这大幅降低了本地部署门槛,传统企业无需配置 Linux 环境即可用现有显卡跑起大模型。
两块消费级显卡拼在一起能跑什 么大模型——普通人自建 AI 算力的 边界正在移动
Reddit 上一个关于「双 3090 显卡 能跑什么」的讨论,折射出一个正在悄悄发生的变化:越 来越多的人开始用消费级硬件在家跑大 语言模型。这件事值得关心,不 是因为技术本身有多新,而是它代表 AI 算力的门槛正在向个人倾斜。