CUDA
找到 8 篇关于此标签的文章
H100 一卡难求不只是性能强 — 真正的护城河是十几年生态积累
H100 是 AI 训练的事实标准,单卡 FP8 算力 1979 TFLOPS 还只是表面,真正的护城河是 CUDA 生态。值得我们关心:它决定了大模型的成本结构,也影响下一个十年的算力格局。
英伟达把自家 GPU 文档做成 AI 可调用的标准模块 — 大模型拼'能干活'的时代来了
英伟达这周上线官方托管的 CUDA MCP,让 AI 助手能直接搜最新 GPU 编程文档、写优化代码、分析性能。值得关心的是:MCP 这种'AI 调外部工具'的统一协议被头部厂商接受,未来大模型拼的不只是聪明,而是能不能真的接入真实世界的资源。
英伟达真正值钱的不是更快的芯片 — 是二十年没人敢换的那套软件
英伟达从 1993 年加州一家快餐店诞生的显卡公司,成长为市值万亿的 AI 算力霸主。这条路靠的不是芯片更快,而是 2006 年开始铺、二十年没人敢换的软件生态。理解它,是看懂 AI 算力为什么这么贵的前提。
GLM5.2 跑速曝光:460GB 模型不是更强,而是先把部署门槛抬高了
一则 Reddit 讨论把 GLM5.2 的现实问题摆上台面:460GB 的超大检查点文件,让性能不只取决于模型能力,更取决于显卡、内存和推理栈。值得关心的是,大模型竞争正在从“谁更聪明”转向“谁更跑得动”。
CUDA 仍能收溢价,不是因为模型不会写代码,而是生态太难补
Reddit 上一个直白提问点中了 AI 硬件竞争的关键:大模型已经很会写代码,但 AMD 的 ROCm、英特尔的软件栈仍追不上 CUDA。值得我们关心的是,算力市场的壁垒越来越不只是芯片性能,而是“能不能稳定跑起来”的整套软件生态。
一个 5MB 小工具跑通英伟达 3D 模型,AI 推理开始从大平台回到轻部署
开发者用 CUDA/C++ 从零写了一个仅 5MB 的推理引擎,能直接跑英伟达 1.17 亿参数的 3D Transformer 模型。值得关心的不是项目体量,而是一个明确信号:不少 AI 应用的竞争,正从“谁模型更大”转向“谁更容易部署、调用和集成”。
PyTorch 占据八成开发者桌面 — 大模型淘金热里,卖铲子的依然是英伟达
PyTorch 已成 AI 开发事实标准,但软件层的统一反而凸显了硬件层 CUDA 的垄断门槛。大模型竞争的瓶颈,正从框架之争退回到显卡算力与配环境上。
Gemma 4 本地 CUDA 设置:精度陷阱与真实基准测试
在本地 CUDA 上运行 Gemma 4 时,若 KV 缓存边界处的数据类型不严格匹配,输出将静默退化。