16 到 32 块 SSD、再组 RAID0,这不是极客炫技,我们判断它首先说明一件事:本地跑大模型的成本,已经贵到让用户开始拿硬盘去替代内存。Reddit 社区这篇讨论问得很直接:如果显存和内存都太贵,能不能用大量 SSD 换带宽,把更大的开源模型“塞进”本地机器。

这是什么

帖子来自 r/LocalLLaMA,核心设想是:SSD 单位容量便宜得多,如果把很多块高速 SSD 组 RAID0,理论带宽可能接近系统内存,再通过频繁搬运参数,勉强支撑超大模型推理。这里的难点不在“能不能读出来”,而在延迟——带宽高不等于响应快,而大模型推理往往既吃带宽,也怕延迟。

行业怎么看

这个讨论背后,是开源模型越来越大、消费级硬件越来越难承接的现实。行业里一直有两条路:一条是买更贵的 GPU 和更大的内存;另一条是做量化、分层加载、混合存储,尽量榨干现有硬件。支持者会认为,SSD 方案至少提供了一种“低成本试错”的方向。

但反对意见同样明确:第一,RAID0 叠的是顺序吞吐,不会消掉 SSD 先天的高延迟;第二,推理过程频繁搬运数据,系统开销可能把理论优势吃掉;第三,真要上 16 到 32 块 SSD,还要足够的 PCIe 通道和工作站主板,未必真便宜。我们的判断是,这更像边缘实验,不像可复制方案。

对普通人的影响

对企业 IT:这提醒企业,本地部署大模型的瓶颈仍是硬件成本,采购时不能只看模型参数,还要看整体存储和内存架构。

对个人职场:想在本地“全离线跑大模型”的门槛并没有明显下降,短期更现实的仍是小模型、本地工具链和云端混合使用。

对消费市场:如果这类讨论持续升温,可能带动“AI 工作站”概念继续细分,但真正受益的,未必是 SSD 厂商,更可能是能把存储、内存和推理调度做成整机方案的厂商。