主流大模型的 Token(模型处理文字的最小单位)单价两年跌了超过 90% — 这是 AI 行业最被低估的事实之一。
我们在和读者交流中发现:很多人知道 AI 变便宜了,但不知道为什么。要回答这个问题,必须把大模型"推理"这条流水线拆开看。
这是什么
你向 AI 提一个问题,它会走完这条链路:你的文字被切成 Token(模型能认字的最小积木)→ 每个 Token 转成向量 Embedding(让文字变成可计算的数组)→ 送进 Transformer(一种"语言计算网络")→ 通过 Attention 注意力机制(决定当前词该"看"前面哪些词)→ 一个 Token 一个 Token 蹦出回答。
三个最关键的术语:Q/K/V 是 Attention 检索信息的三个维度(Query 查询、Key 键、Value 值);KV Cache 则是把已算过的 K/V 缓存起来,避免每次重复计算。
为什么 KV Cache 重要?因为大模型是逐字生成的。回答越长、对话轮次越多,需要缓存的中间状态就越大。这直接决定了一次推理有多便宜、多快。
行业怎么看
支持方认为,KV Cache 是这两年大模型降价的核心功臣。Anthropic、OpenAI、字节豆包都在工程层面死磕这一块 — 这就是 Token 单价两年跌超 90% 的主要原因之一。
但反对意见同样值得听。前 Google 工程师在 X 上直言:单纯压榨推理成本是"在油箱里挤油",真正瓶颈在训练成本和高质量数据。如果只把现有模型做便宜、不解决能力问题,所谓的"推理红利"三年内会见顶。便宜,不等于好用。
对普通人的影响
对企业 IT:选型时别只看"哪个模型最强",要算"每次调用实际多少钱"。同样问题,使用带缓存的产品可能便宜 5-10 倍。
对个人职场:理解"上下文越长越贵"的规律。给 AI 塞一堆历史对话效果可能更好,但钱包会抗议。学会用结构化提示、清理无用上下文,是新基本功。
对消费市场:免费 AI 越来越能用了,不是因为变聪明了,而是厂商把推理成本压到了能补贴的程度。但羊毛出在羊身上 — 重度功能会持续向付费版倾斜。