01 触发事件
Lenny's Newsletter 这一期 How I AI, Claire Vo (ChatPRD 创始人) 演示了一款叫 Jev 的产品, 出品方 TypeSafe AI. Jev 的自我描述是 "decision model, 不是 language model" — 输入 $0.04/M tokens, 输出 token 完全免费. Claire 演示的几个数字: 用 9 cents 分析 1,700 个 PR, 用 $4 处理 200,000 次分类, 一整周在 Jev 上的花费不到 $10.
她反复提一个 pair pattern: Jev 做分类/聚类/路由, 前沿模型做 reasoning. 文章原文里出现了 "GPT-6 Astra" 这个名字 — 这点我没在公开 roadmap 上确认到, 可能是 podcast 转述误差或我知识盲区, 先 hedge 一下.
02 这事的真正含义
这事的真正含义不在 "又一家 AI startup 发新产品", 而在 token 经济学的结构性位移: inference 正在被解耦成两层 abstraction.
过去 18 个月, 语言模型是单一 abstraction — 你给 prompt, 它吐 text. 想要 classification, 你让模型输出 JSON 里的某个字段, 然后从 output token 里扣钱. 这个 abstration 假设 output 是 "生成" 的产物, 而 "生成" 是昂贵的.
Jev 这类产品的 abrogation 是: 大部分 production workload 根本不需要生成, 它需要的是 constrained decision. 给我一段 text, 我要 category / score / probability / routing label — 1-of-K categorical output. 这不是生成, 是 retrieval-on-steroids.
价格对比一下 (Claude Haiku 4.5 约 $1/$5, Gemini Flash Lite 约 $0.10/$0.40, GPT-4.1 mini 约 $0.40/$1.60, 都是 per M input/output):
一个典型场景: 100K input + 50 token output 做分类
- Claude Haiku 4.5: $0.10 + $0.25 = $0.35
- Gemini Flash Lite: $0.01 + $0.02 = $0.03
- Jev: $0.004 + $0 = $0.004
差距 80 倍以上. 这不是优化, 这是数量级重构. 而且 Jev 的输出格式是 fixed schema (category/score/probability), 不存在 "模型想多说两句" 的风险, retry rate 应该比传统 LLM 低得多.
这个结构性位移, 我认为比 model routing (router 把请求分发给不同 model) 更进一步 — routing 是请求级别分流, decision model 是 inference shape 本身被拆掉了.
03 历史类比
2014 年 Lambda vs EC2 是同一个 pattern 的早期版本: 同一个 AWS, 两种 abstration, 两种 price elasticity. Lambda 当时被嘲笑 "冷启动慢/限制多", 十年后是 AWS 增长最快的服务之一. 关键不是 Lambda 比 EC2 "更好", 是它解锁了一类 EC2 根本 cover 不到的工作流 (event-driven, 短时, 突发).
2017-2019 年 TPU vs GPU 是另一个对照: 同一类底层计算, 不同 shape. TPU 在 inference 场景效率远超 GPU, 但 NVIDIA 的 CUDA moat 让 TPU 只在 Google 生态里跑得起来.
Jev 这类 decision model 处在哪个位置? 我倾向于认为是 Lambda 那个位置, 不是 TPU 那个位置. 原因是: 底层大概率还是 transformer (或者某种 distilled transformer), 不需要专门硬件, 软件层面就能跑. moat 不在 infra, 在 product 化 — 谁先把这套 workflow (classification → reasoning) 做成 developer 默认 mental model, 谁就赢了. 这跟当年 AWS 把 serverless 包装成 "你不用想 server 了" 是同一个动作.
反例风险也存在: 如果 "decision model" 本质就是把 Llama 3.1 8B 或 Phi-3-mini 包一层 constrained decoding, 那 moat 接近零, OpenAI/Anthropic 随时可以出一个 "structured output mode" 直接吃掉这个品类. 这点我自己没在内部跑过 benchmark, 不能下结论.
04 对 AI builder 意味着什么
这个月/这个季度值得调整的几个决策:
第一, 重算 unit economics. 把 production workload 跑一遍, 标出 "实际只需要分类/打分/路由" 的部分. 这部分如果占比 > 30%, 你已经在烧冤枉钱. 一个 100K-token 的 classification 任务, 每天跑 1 万次, 从 Haiku 迁到 decision-class 模型, 年化能省 $1M 级别 — 这不是夸张, 这是按上述 80 倍差距直接乘出来的.
第二, routing 层正在从 "可选项" 变成 "标配". 现在 production 系统的标准 pattern 应该是: cheap classifier (decision model) 在前面筛, frontier reasoner (Claude/GPT/Gemini) 在后面只处理筛剩下的高难度请求. 这个 two-tier pattern 跟 2023 年的 RAG retrieval-then-generation 是同构的 — 先用便宜的工具缩窄问题空间, 再用贵的工具处理核心.
第三, 监控自己的工作流迁移. Claire 自己发现, 1 月份她 100% 的 AI 使用是 coding 类, 9 月降到了 40%, 剩下被 agents 和媒体类填上. 这不是个人现象 — 这是整个 builder 群体的工作流正在从 "我直接用 frontier model" 转向 "我编排多个 model". 应用层创业者的 product roadmap 应该把这个趋势放进去.
第四, 警惕锁定. 输出免费听起来诱人, 但 input 端价格是平台唯一的 revenue lever. 如果你的 workload 90% 跑在 decision model 上, 你的 pricing power 等于零 — 平台随时可以涨 input 价. 这是反向锁定, 跟当年 AWS egress fee 是一个结构. 在 contract 谈判里, input price 应该跟 volume 挂钩, 别签固定单价.
05 反方观点 / 风险
我可能在以下几个地方误判, 写出来提醒自己.
第一, "decision model" 很可能不是新架构, 是 wrapper. TypeSafe 没公开模型大小, 没开源, 没 benchmark. 我没在内部跑过 Jev, 上述 80 倍差距是基于官方定价算的, 没考虑质量差异. 一个 9-cent 的 PR 分析 demo, 真实 workload 复杂度通常比 demo 高 5-10 倍, 加上 retry 和 fallback, 实际 unit cost 会显著高于展示数字. 别拿 marketing demo 算 ROI.
第二, frontier model 厂商的反应会被低估. Anthropic 和 OpenAI 完全可以 (并且已经在) 推出 "structured output mode" + 大幅降 output price. Claude 的 prompt caching 已经做了类似的层级化定价. 如果 frontier 厂商把 output token 价格砍到 $0.10/M 而不是 $0, decision model 的价格优势直接消失. 我个人赌 frontier 厂商会这么做, 时间点在 6-12 个月内.
第三, GPT-6 Astra 这个名字我没在公开信息里看到过. 如果是 podcast 里口误或转写误差, 那 frontier model 这一层的 reference point 我没核到, 上面有些数字的对比可能需要修正. 如果 GPT-6 真存在且 Astra 是一个 tier, 那是另一个 story, 这次没覆盖到.
第四, decision model 的质量上限可能很低. 它擅长结构化输出, 但不擅长 reasoning. 一旦任务稍微复杂一点 (例如多跳分类、需要 world knowledge 的 judgment), 就会 fall through 到 frontier model. 也就是说, decision model 不是替代 frontier, 是补充 — 这削弱了它的市场规模 claim. 真正的 killer use case 仍然在 frontier model 上, decision model 只是个 filter. Long term 这可能是 router 层 (比如 Martian / Not Diamond / OpenRouter 的玩法), 而不是独立品类.
写完自己看, 我觉得最需要警惕的是第一和第二点 — demo 数字漂亮 + frontier 厂商反击, 这两个组合大概率会压缩 TypeSafe 这种独立 decision model vendor 的窗口期. 真正能跑出来的, 要么是被 frontier 厂商收购整合, 要么是发展出 routing + decision 的复合层 (变成 Not Diamond / Martian 这种 orchestration platform). 纯单点 decision model, 我持中性偏怀疑的态度.