返回首页

英伟达

找到 28 篇关于此标签的文章

TenstorrentQwen3

Tenstorrent 跑通 Qwen3.7-27B — 非英伟达 AI 芯片商用破冰

Tenstorrent 用户晒出 QuietBox 2 工作站跑 Qwen3.7-27B 的推理数据。这是非英伟达阵营首次拿出接近商用的实测成绩,但距离撼动英伟达生态还很远。

2h ago2 分钟
AMDROCm

AMD 把 ROCm 版本从 7 跳到 10 — 一个月一更,这是抢市场节奏

ROCm 是 AMD 抗衡英伟达 CUDA 的开源计算平台。版本从 7.14 直接跳到 10.0,发布间隔仅一个月。这件事值得关注:AI 算力垄断格局可能出现松动。

1d ago2 分钟
美光HBM

美光给 AI 算力算了一笔账:HBM 费三倍晶圆,短期内别想降价

美光披露:每生产 1GB HBM 约需 3 倍于 DDR5 的晶圆面积,且下一代不会好转。三大存储厂集体转向 HBM,按 GB 计算全球内存产出缩水三分之二,AI 算力降本短期内无解。

1d ago2 分钟
英伟达AI算力

英伟达叫停360亿美元AI分成计划:芯片霸主开始管客户的账本

英伟达原想从云服务商AI收入中抽50%分成,两个月后因内部反垄断担忧暂停。芯片公司开始管理客户的利润表,意味着AI基础设施的产权边界正在被改写。

1d ago2 分钟
RTX 5090英伟达

RTX 5090 售价 5090 美元 — 本地跑大模型的好日子结束了

RTX 5090 显卡实际成交价冲到 5090 美元,Reddit 本地 AI 社区一片哀嚎。背后是消费级显卡跑大模型的窗口正在关闭——开源本地化路线,第一次遇到了真金白银的硬件门槛。

2d ago2 分钟
Hugging Face英伟达

130 亿美元收购案背后 — 你天天用的免费 AI 工具,这周要看一眼

英伟达花 130 亿美元收购 Hugging Face,意味着你手上那堆免费 AI 工具的底层可能要变。同周 Z.ai 开源了能读 100 万字的新模型,普通人 15 分钟就能上手用。

2d ago2 分钟
Qwen英伟达

有人把能跑 27B 大模型的设备塞进饭盒 — 本地 AI 玩家正在追上付费服务

Reddit 用户用松下 Toughbook 加 RTX Pro 6000 攒出一台「饭盒级」本地 AI 主机,跑 27B 模型撑满 26 万 token 上下文,自评优于 Gemini Pro 和 ChatGPT。这不是普通 DIY,而是「数据敏感型工作能否脱离云端」的一次硬核实测。

4d ago2 分钟
AppleM5 Ultra

苹果 M5 Ultra 带宽 1.2TB/s — 本地跑大模型跨过实用门槛

苹果本周发布 M5 Ultra,内存带宽达到 1.2TB/s。这是大模型本地推理首次具备实用性能,对处理敏感数据的知识工作者来说,可能改变使用 AI 的方式。

4d ago2 分钟
通义千问英伟达

本地 AI 终于能打 — 30B 开源榜单透露的部署拐点

本周 Reddit 上 LocalLLaMA 社区一份 30B 级(300 亿参数)开源模型对比显示,Ornith、TielCoder 等本地可跑模型在编程等任务上已经接近闭源大厂水准。这意味着企业 AI 选型不必再死盯云端 API,本地部署开始成为现实选项。

5d ago2 分钟
英伟达开放权重模型

你客户的名字正在训练 AI — 英伟达砸 70 亿想换新玩法

英伟达 70 亿美元做开放权重 AI 模型,对非码农创业者意味着:未来能在本地跑 AI,客户数据不用再上传第三方服务器。现在不用立即行动,但要知道这件事。

5d ago2 分钟
阿里通义千问

Qwen3-27B 单卡跑通视觉版 — 本地大模型进入消费级拐点

LocalLLaMA 社区有开发者把阿里 Qwen3-27B 量化后塞进单张 RTX 5090:45 万 token 上下文、保留视觉能力、每秒 120 token、整机 400 瓦。值得关心的是——以前要堆多卡服务器的中端模型,现在一张消费级显卡就够了。

6d ago2 分钟
DeepSeekQwen3

开源大模型追平 GPT-5 之后,本地部署的回本期压到两个月

DeepSeek-V3、Qwen3 系列在多项基准测试追平 GPT-5 级别,英伟达 748GB 显存桌面工作站让本地推理的回本周期缩短至两个月。企业用云不再是唯一选项,混合部署正在成为主流架构。

6d ago2 分钟
QwenvLLM

Qwen 在 3090 上跑得更快、温度更低,本地大模型开始像正经工具了

Reddit 用户分享:两张 3090 显卡跑通 Qwen 27B,速度达 143 token/秒,温度从 70°C 降到 35°C。值得我们关心的是:本地大模型正从极客爱好跨入可用工具,对中小企业的成本和数据安全是个潜在变量。

Aug 222 分钟
LocalLLaMA英伟达

二手 AI 硬件一周涨 8% — 算力紧张开始烧到个人买家

澳洲 eBay 上有人目睹 AI 计算硬件一周内涨价 8%。这不是孤例 — 个人买家被算力稀缺卡脖子,意味着高端算力的供需失衡已从企业层传导到消费层。

Aug 182 分钟
通义千问阿里

通义千问2.4T跑出每秒350 tokens — 大模型价格战要来了

阿里通义千问的 2.4 万亿参数模型在英伟达最新 GB300 整机柜上跑出每秒 350 tokens 的实测数据。这意味着大模型推理(让模型实际回答问题)的边际成本正在被开源生态快速压低,国内云厂商的定价逻辑可能在 2026 年被改写。

Aug 162 分钟
Intelllama.cpp

有人用 Intel 显卡跑本地大模型 — AI 算力开始绕开英伟达

本周 Reddit 上一位玩家用 Intel Arc 显卡和 SYCL 后端跑通了本地大模型推理。社区共识:英伟达 CUDA 生态之外,本地 AI 多了一条可走的路,但离成熟还远。

Aug 162 分钟
美国对华AI管制芯片出口管制

美国逼各国在 AI 领域选边 — 中国大模型出海通道正在收窄

美国据传将向盟友施压,要求在中美 AI 竞争中明确选边。这是从 2022 年底芯片禁令升级到「阵营划分」的信号——AI 全球化正在被政治打断。

Aug 152 分钟
通义千问Qwen

通义千问 27B 跑出旗舰分数 — 本地 AI 让付费订阅第一次显得多余

本周本地 AI 圈最热话题:阿里通义千问 27B 版本据 AI 评测榜单跑出接近 Opus 4.6 的成绩,参数量只有后者约十分之一。如果数据成立,意味着消费级显卡本地运行已经接近闭源旗舰水平,付费订阅的商业逻辑开始动摇。

Aug 142 分钟
NVIDIA英伟达

英伟达真正值钱的不是更快的芯片 — 是二十年没人敢换的那套软件

英伟达从 1993 年加州一家快餐店诞生的显卡公司,成长为市值万亿的 AI 算力霸主。这条路靠的不是芯片更快,而是 2006 年开始铺、二十年没人敢换的软件生态。理解它,是看懂 AI 算力为什么这么贵的前提。

Aug 142 分钟
DeepSpeed微软

7B 模型训练要 160GB 显存 — 这是 AI 只剩巨头能玩的根本原因

训练一个 7B 大模型需要 160GB 显存,单张顶配 GPU 都装不下。这道算力门槛决定了 AI 行业只能是巨头的牌局 — 独立研究团队和中小公司,要么买 API,要么被淘汰。

Aug 132 分钟
英伟达RTX 5090

5090 之后再等五到十年,GPU 三倍性能才到 — 但功耗可能先撑不住

Reddit 网友算了笔账:2009 到 2025 年英伟达消费级 GPU 每代性能平均涨 50%。按此推算,要做出 RTX 5090 三倍性能的下一代 GPU,最早 2029 年,最晚 2038 年。同时功耗也在涨。

Aug 132 分钟
阿里巴巴Qwen3-Max

阿里开源 2.4 万亿参数大模型 — 国内企业第一次有「不押注 OpenAI」的选项

阿里把 Qwen3-Max 最大版本(2.4 万亿参数)的权重全部公开,号称性能逼近闭源前沿。这是中国企业第一次有「不绑定 OpenAI 或 Anthropic 也能拿到近顶级 AI」的现实选项。

Aug 122 分钟
英伟达NVFP4

英伟达 NVFP4 让模型跑得更快,但内部精度悄悄在丢 — 论文指出压缩正在制造隐形损伤

一项 arXiv 新论文发现,用 NVFP4(英伟达 4 位浮点,一种极低精度压缩格式)压缩大模型时,仅让输出匹配老师模型会掩盖内部表征(模型各层对信息的抽象表达)的退化;这意味着低精度推理正在悄悄损害推理和编程能力,值得关心 AI 部署成本与质量平衡的从业者留意。

Aug 92 分钟
OpenAI英伟达

OpenAI、高通都在绕开英伟达,AI 竞争开始从模型转向算力成本

OpenAI 联手博通测试自研芯片,高通同日发新数据中心方案并收购推理软件公司,信号很明确:AI 公司的胜负手,正从“谁模型更强”转向“谁能把算力做得更便宜、更稳定”。这比单条发布更值得关心。

Jun 252 分钟
Anthropic英伟达

Anthropic估值九千亿、政治局定调AI+ — 资本与政策同时押注AI落地

Anthropic估值冲九千亿、英伟达造智能体模型、政治局定调AI+。本周资本与政策罕见同频,大模型竞赛正从「比参数」转向「比落地」,AI替人干活的时代正式开启。

May 32 分钟
PyTorch英伟达

PyTorch 占据八成开发者桌面 — 大模型淘金热里,卖铲子的依然是英伟达

PyTorch 已成 AI 开发事实标准,但软件层的统一反而凸显了硬件层 CUDA 的垄断门槛。大模型竞争的瓶颈,正从框架之争退回到显卡算力与配环境上。

May 32 分钟
QwenvLLM

单张 3090 在 Windows 跑通 Qwen3 — 本地部署大模型不再必须折腾 Linux

开发者在 Windows 原生环境跑通 Qwen3.6-27B 模型,速度达 72 tok/s。这大幅降低了本地部署门槛,传统企业无需配置 Linux 环境即可用现有显卡跑起大模型。

May 22 分钟
LocalLLaMAQwen3

两块消费级显卡拼在一起能跑什 么大模型——普通人自建 AI 算力的 边界正在移动

Reddit 上一个关于「双 3090 显卡 能跑什么」的讨论,折射出一个正在悄悄发生的变化:越 来越多的人开始用消费级硬件在家跑大 语言模型。这件事值得关心,不 是因为技术本身有多新,而是它代表 AI 算力的门槛正在向个人倾斜。

Apr 192 分钟