返回首页

CUDA

找到 8 篇关于此标签的文章

NVIDIAH100

H100 一卡难求不只是性能强 — 真正的护城河是十几年生态积累

H100 是 AI 训练的事实标准,单卡 FP8 算力 1979 TFLOPS 还只是表面,真正的护城河是 CUDA 生态。值得我们关心:它决定了大模型的成本结构,也影响下一个十年的算力格局。

8月25日2 分钟
NVIDIACUDA

英伟达把自家 GPU 文档做成 AI 可调用的标准模块 — 大模型拼'能干活'的时代来了

英伟达这周上线官方托管的 CUDA MCP,让 AI 助手能直接搜最新 GPU 编程文档、写优化代码、分析性能。值得关心的是:MCP 这种'AI 调外部工具'的统一协议被头部厂商接受,未来大模型拼的不只是聪明,而是能不能真的接入真实世界的资源。

8月20日2 分钟
NVIDIA英伟达

英伟达真正值钱的不是更快的芯片 — 是二十年没人敢换的那套软件

英伟达从 1993 年加州一家快餐店诞生的显卡公司,成长为市值万亿的 AI 算力霸主。这条路靠的不是芯片更快,而是 2006 年开始铺、二十年没人敢换的软件生态。理解它,是看懂 AI 算力为什么这么贵的前提。

8月14日2 分钟
GLM5.2NVIDIA

GLM5.2 跑速曝光:460GB 模型不是更强,而是先把部署门槛抬高了

一则 Reddit 讨论把 GLM5.2 的现实问题摆上台面:460GB 的超大检查点文件,让性能不只取决于模型能力,更取决于显卡、内存和推理栈。值得关心的是,大模型竞争正在从“谁更聪明”转向“谁更跑得动”。

7月4日2 分钟
NVIDIACUDA

CUDA 仍能收溢价,不是因为模型不会写代码,而是生态太难补

Reddit 上一个直白提问点中了 AI 硬件竞争的关键:大模型已经很会写代码,但 AMD 的 ROCm、英特尔的软件栈仍追不上 CUDA。值得我们关心的是,算力市场的壁垒越来越不只是芯片性能,而是“能不能稳定跑起来”的整套软件生态。

6月25日2 分钟
NVIDIADVLT

一个 5MB 小工具跑通英伟达 3D 模型,AI 推理开始从大平台回到轻部署

开发者用 CUDA/C++ 从零写了一个仅 5MB 的推理引擎,能直接跑英伟达 1.17 亿参数的 3D Transformer 模型。值得关心的不是项目体量,而是一个明确信号:不少 AI 应用的竞争,正从“谁模型更大”转向“谁更容易部署、调用和集成”。

6月7日2 分钟
PyTorch英伟达

PyTorch 占据八成开发者桌面 — 大模型淘金热里,卖铲子的依然是英伟达

PyTorch 已成 AI 开发事实标准,但软件层的统一反而凸显了硬件层 CUDA 的垄断门槛。大模型竞争的瓶颈,正从框架之争退回到显卡算力与配环境上。

5月3日2 分钟
Gemma 4llama.cpp

Gemma 4 本地 CUDA 设置:精度陷阱与真实基准测试

在本地 CUDA 上运行 Gemma 4 时,若 KV 缓存边界处的数据类型不严格匹配,输出将静默退化。

4月7日2 分钟