这周开源圈冒出一个叫 Infermeld 的小工具,想让你手头的 AMD 和 NVIDIA 显卡一起跑同一个本地 AI 模型——但作者第一句话就讲明:这是实验性 v0.1,合并的显存「不保证能用满」。
这是什么
Infermeld 本身不是新的推理引擎。它做的事情,是把 llama.cpp(主流开源本地推理工具)打包成一个 Linux 套件,补上 AMD/Vulkan 和 NVIDIA/CUDA 设备选择、预检脚本、可复现的构建说明、以及只针对它启动进程的热保护。
实测硬件组合是 AMD RX 6900 XT(16GB)配 NVIDIA RTX 3080(10GB),跑 Qwen3.6-35B-A3B 的 Q4 量化版本,上下文预留 8K,模型按层切分到两张卡。发布方式是源码——用户自己下载指定版本的 llama.cpp、自己编译、自己准备模型权重,没有一键安装包。
作者自己列了几条边界:没测持续吞吐量、没测填满 8K 的完整表现、单一显卡组合不等于通用兼容、把两张卡的显存加起来也不等于模型真能用到这个数。
行业怎么看
支持动手派会认为这是「把现有资产榨干」的典型思路——中国不少企业早年按价格或供应情况,机房里其实混着 AMD 和 NVIDIA 卡,如果真能合起来跑本地大模型,等于盘活了一堆闲置投入。
但反对意见和风险同样值得听:
- 主流企业级推理框架(vLLM、TGI 等)基本都假设同型号 GPU,这套东西离生产可用差得远。
- 作者本人都强调没跑完整基准——「能加载」不等于「能稳定扛业务」。
- v0.1、单组合验证、个人维护者,放进生产路径意味着相当长的复测、兜底和责任归属问题。
- 本地大模型本身仍处试错阶段,这种小工具更像折腾者的玩具,而不是给 CIO 的答案。
更值得我们关心的是背后的行业信号:为什么一个开发者要造这个轮子?因为大模型推理的硬件生态至今仍碎片化——AMD、NVIDIA 各有各的软件栈,没人替企业解决「混着用」这件麻烦事,这件事本身比这个工具值不值得用更值得关注。
对普通人的影响
- 对企业 IT: 机房里若混着 AMD/NVIDIA 卡,可以留意这个方向,但短期不建议部署到生产;本地 AI 自建仍应以统一卡型为前提。
- 对个人职场: 普通白领基本与此事无关;开发者若手头有两张不同品牌的卡,可以上 GitHub 试一下,但不要把它当稳定方案对外讲。
- 对消费市场: 暂无影响,消费级 AI 体验仍由云端推理决定,与个人用户无关。