NVIDIA 这周在开发者博客放出一组名为「Do Inference Now Deploy」的开源 C++ 示例代码,目标只有一个:让 AI 模型能跑在本地 RTX 显卡上、不必每次都走云端。

这是什么

工具箱由三部分组成:ONNX Runtime(一种通用的跨平台模型格式,让同一份文件在不同系统里都能跑)、TensorRT RTX 执行层(NVIDIA 自家的显卡推理加速器,专为 RTX 系列优化)以及若干 C++ 范例。它解决的是开发者长期抱怨的三件事:模型文件不通用、推理框架迁移成本高、显卡加速绑死在特定硬件。对一线业务来说,意义是「本地推理(用训练好的模型做预测或判断)」从此有了厂商背书的样板间。

行业怎么看

看好的一方认为,这是端侧 AI(on-device AI,跑在设备本地而非云端)从概念走向工程化的关键一步——金融、医疗、制造业等数据合规要求高的场景,终于有一条不被云端绑定的路可走。但反对意见也很直接:C++ 的门槛过高,绝大多数 AI 团队是 Python 背景,这套东西更像「给系统级厂商看的样板房」,离一线业务很远;再加上本地推理受限于显卡显存,跑不动真正的大模型,企业真要落地大概率还是要回头买云端算力。

对普通人的影响

对企业 IT:本地推理的可行性提升,意味着未来一两年「自建 AI」对中型企业不再是伪命题,但前提是硬件预算和工程团队同时到位。

对个人职场:不会写代码的同事短期内感受不到变化;但如果你在传统软件公司做产品规划,端侧 AI 能力正在变成新功能栏里的一行,值得让研发同事评估一下。

对消费市场:Windows PC 和游戏本未来可能成为 AI 算力的另一类载体,AI 不再只是「网页里那个聊天框」。