本周 Reddit 上一个帖子在硬件圈流传:一位用户升级到 RTX 5070 Ti 后,把闲置的 RTX 4070 Ti 塞进自制的 OCuLink(一种机箱外接显卡的接口标准,类似简化版 Thunderbolt)外接盒,连到主机上跑 Qwen 3.8 27B 模型,效果"完全可用"。这事不大,但值得我们记一笔——本地跑能用的中等尺寸大模型,硬件门槛正在被这种"土法炼钢"一点点拉低。
这是什么
帖主原本升级显卡是为了跑 27B 量级的本地模型。两张卡放进机箱会过热,他又不想让 4070 Ti 吃灰,于是把它装到外接盒里,通过主板上的 PCIe 4.0 OCuLink 扩展卡与主机相连。组合后跑阿里开源的 Qwen 3.8 27B,效果满意,于是发帖求经验、问雷区。
OCuLink 不是新事物——它带宽高于 Thunderbolt、成本更低,但牺牲便携性,线材和供电都得自己折腾,过去更多用在工业和矿机场景。把它用在本地 AI 推理上,是少数派玩法。
行业怎么看
r/LocalLLaMA 社区把这个帖子当成"低成本双卡推理"的新样本讨论。正方观点:消费级 GPU 加外接方案已经能覆盖 70B 以下模型的部分推理需求,未来个人 AI 工作站会更普及。
反对和风险声音同样尖锐。评论里有人提醒 OCuLink 线材超过 1 米后信号衰减明显,长期高负载可能烧接口;也有人指出同样预算不如租云端 GPU,按小时付费更省心。真正的瓶颈不是硬件而是软件——能在 27B 量级流畅跑出生产级结果的本地工作流,目前仍是少数极客的玩具,离"普通人插上就能用"差得远。
对普通人的影响
对企业 IT:短期内不必考虑本地部署 27B 模型,采购、合规、运维成本远高于直接调用云端 API。
对个人职场:日常用 AI 写邮件、改稿完全无需理解 eGPU;如果是产品经理或工程师,需要做本地 AI demo,可以开始关注这种"二手硬件 + 外接盒"的玩法。
对消费市场:显卡二手市场价格继续承压,但 5070 Ti 等新品主战场仍是游戏和创作者,本地 AI 只是附赠场景。