这周 Reddit 上一条技术帖,问的不是'能不能跑',而是'怎么跑才不亏钱':一个工程师在生产环境跑 10 个并发请求,所有请求共享同一段提示词前缀——他在琢磨能不能只算一次。我们注意到,'抠这种算力账'这件事本身,正是行业从 demo 走向生产的拐点信号。

这是什么

vLLM(一个开源大模型推理引擎)有一项关键设计叫 KV cache——把大模型推理时算过的中间结果存起来,下次遇到相同输入就不用从头再算。当多个请求共享前缀时,理论上可以只算一次、多次复用,像 Excel 里改一个公式,所有引用它的单元格自动更新。

工程师的难题是:当请求被分散到不同服务器,这种'复用'就失效了。解决方案是用具备 KV cache 感知能力的路由(即智能流量分配器),把同类请求尽量打到同一台机器上,再配合'先发一笔预热'的策略。

技术细节听起来玄乎,本质就一句话:把一段重复劳动从 10 次压缩到 1 次。

行业怎么看

支持方认为这是好事。一条帖子背后是几十个同行在生产环境里算账——只有真金白银在烧,工程师才会抠到这个粒度。开源社区正在快速迭代,整体行业的边际成本(多服务一个客户所增加的成本)正在下降。

但值得警惕的是另一种声音。有人说 10 个并发的小工作负载根本没优化空间;也有人提醒,多数企业连'每天稳定 10 次 LLM 调用'都还没做到,过早优化本身就是资源错配。更深一层:这些优化红利最终会流向客户,今天抠的算力账,三年内大概率就是 AI 产品的标准配置。

对普通人的影响

对企业 IT:采购 AI Agent 服务时,'单次调用成本'和'并发吞吐成本'是两个不同指标——后者才是大规模部署时真正吃预算的那条线。

对个人职场:评估 AI 工具时,先问一句'我的提示词前缀有多长'——前缀越长、可复用越多,单位成本越低;长文档总结、批量分析比短问答更划算。

对消费市场:未来半年到一年,AI 产品的定价会从'按次计费'慢慢走向'按上下文长度计费'。算力经济学正在悄悄改写产品定价方式。