01 触发事件

Nvidia Shield TV (2017 年发布的流媒体盒子, 已经是 7 岁高龄产品) 最近被官方涨价 $100。Wired 报道的官方说法很直接: 内存价格在涨, 任何"带内存的东西"都在被重新定价, Shield TV 也不例外。

这个数字本身不大, 但来源和因果链值得拆开看。

02 这事的真正含义

问题不在 Shield TV, 在 AI 数据中心对内存产能的吞噬。

过去 18 个月, AI 训练和推理对 HBM (high-bandwidth memory) 的需求把 SK Hynix / Samsung / Micron 的先进制程产能几乎全部锁死。HBM 的良率摊销和产能优先级, 直接挤压了标准 DRAM 和 NAND 的供给侧。

Shield TV 用的是老一代的消费级 DRAM 和 eMMC 存储, 理论上和 HBM 不在一个产线池里。但现实是:

晶圆产能是有限的。当三大厂的资本开支和产线排期被 HBM 锁定, 老节点的 DRAM 产能被动收缩, 消费级内存价格跟着涨。

这才是这件事在说的: AI 需求正在从训练侧 (HBM) 传染到消费侧 (DDR4/DDR5/eMMC), 而且传染速度比大多数模型成本预测假设的快。

对推理经济学的直接影响: KV cache 占用的就是 HBM 或高端 DRAM。memory-bound 的推理 (长 context, 大 batch, agent loop) 的成本下行斜率, 可能比我们 2024 年初画的曲线要平。

03 历史类比

2010-2011 年, 智能手机爆发期。Samsung / Hynix 把先进产能切给移动 DRAM, 桌面 PC 的 DDR3 价格一年内涨了 40%。那时候做装机和攒机的玩家被教育了一课: 消费级内存从来不是独立的供需市场, 它是先进制程产能的"溢出层"。

2021 年那次芯片短缺是另一个参照。当时汽车 MCU 用的是 40nm / 90nm 老节点, 理论上和 7nm 手机芯片毫无关系。但台积电把成熟节点产能切给利润率更高的消费电子订单, 汽车业被迫减产。这次 NVIDIA Shield TV 的故事是同一个结构的轻量版复刻。

更近的类比是 2023 年初 LLM 推理爆发后, H100 配套的 HBM3 缺货导致整机价格上涨, 然后 AMD MI300 也跟着涨, 最后连消费级 GPU (RTX 4090) 都被矿潮余波和产能挤压推到天上。

模式一致: AI / 高利润需求 → 先进制程锁定 → 老节点产能被动收缩 → 消费端价格被重定价。 这次只是轮到 Shield TV 这种"老古董"也躲不掉。

04 对 AI builder 意味着什么

这个月值得重新检查几个假设。

第一, 本地推理的 TCO 模型。 如果你正在做 edge AI 产品 (本地 LLM, on-device agent, 本地 RAG), 内存涨价直接影响 BOM。Apple Silicon 的 unified memory 配置, 高通骁龙 X Elite 的 NPU 内存, 这些方案的硬件成本下不来, 你写"在用户设备上跑 7B 模型"的产品方案时, 客户硬件门槛反而在涨。

第二, MoE vs dense 的架构选择。 MoE 模型推理时 expert 参数常驻显存, 内存容量是硬约束。如果 DRAM 价格持续高位, MoE 的部署成本优势会被吃掉一部分。对长 context 应用尤其如此, KV cache 的内存占用和 context length 线性相关。

第三, KV cache 优化的优先级要提高。 PagedAttention, KV cache compression, prompt caching 这些之前是"优化项"的技术, 现在可能变成"必要项"。内存单位价格不降反升, 缓存命中率的边际价值上升。

第四, opcx 这种 model gateway 的 routing 策略要加 memory cost 维度。 之前 routing 主要看 latency / price / quality, 现在同一个模型在不同 context length 下的 memory footprint 可能让价格信号失真, 需要重新标定 unit economics。

我对具体 DRAM spot price 走势没有一手数据, 上述判断主要基于"三大厂产能被 HBM 锁定"这个结构性事实和历史模式的对照, 不是内部测算。

05 反方观点 / 风险

我可能错在以下几点。

第一, Shield TV 这个样本信号太弱。它是 7 年前的老产品, 库存可能本来就在清, 涨价 $100 可能只是 Nvidia 不想再维护老产品线的策略性退出, 和内存价格关系没那么大。用一个边缘产品代表整个消费级内存市场, 是 over-extrapolation。

第二, 消费级 DRAM 和 HBM 的产能关联度没我假设的那么强。 三星和海力士有独立的成熟节点产线, 不一定真的会被 HBM 挤掉。如果他们选择扩产 DDR4/DDR5 而不是 HBM (因为 HBM 利润率边际下降), 那 supply story 就站不住。

第三, AI 推高内存价格这件事已经被市场 price in 至少半年了。Micron 的财报, SK Hynix 的产能指引, 都在反复讲这个故事。这篇文章给我的不是新信息, 只是又一个小数据点。如果信息增量这么少, 单独拎出来写一篇是不是反应过度了?

第四, 也是我最没把握的一点: memory 价格和推理 token 价格的传导链很长。 GPU 整机价格涨, 但云厂商可能用更激进的 batching, 更激进的 quantization, 或者直接转用更新的硬件 (B100, MI355X) 来对冲 DRAM 成本。最终传到 token API 价格的比例可能很小, builder 层面感知不到。

如果第 4 点成立, 那这件事对 AI builder 的实际意义就接近零, 只是一条消费电子趣闻。我倾向认为传导不会完全被吸收, 但具体多大比例落到 token 价格, 我没数据支撑, 这是我最大的不确定性。