返回首页
LLM推理
找到 3 篇关于此标签的文章
KV CacheLLM推理
Token 单价两年跌 90%:理解推理链路,才看懂大模型的成本逻辑
为什么同样一个 AI 助手,有的收费贵、有的能免费用?答案藏在每一次"你说一句话"背后的计算过程里。我们讲清楚 Token、Transformer、KV Cache 这些名词如何决定 AI 公司的成本结构。
Aug 182 分钟
LLM推理副业创业者
同一个问题多等 20 秒,客户方案为什么会比秒回版稳很多
我以前总以为 AI 回得越快越好,后来才发现:遇到报价、方案、分析这类事,让它“多想一会儿”,常常能少返工一轮。对做副业、接客户、做内容的人,这比追新模型更实用。
Jul 182 分钟
AWS-Trainium2vLLM
AWS Trainium2 上的 Speculative Decoding 将 LLM 推理延迟降低最高 3 倍
AWS 基准测试显示,在 Trainium2 上结 合 vLLM 使用 speculative decoding,可将解码密集型工作负载的 inter-token 延迟降低最高 3 倍。
Apr 152 分钟