返回首页

vLLM

找到 22 篇关于此标签的文章

vLLMPyTorch

vLLM 上线双轨架构 — 大模型推理承认极致性能与跨硬件无法兼得

PyTorch 基金会本月发布 vLLM 硬件无关层说明,官方验证通用路径性能损失仅 3.4%,但承认极致性能与跨硬件可移植已无法写进同一份代码。对自建 AI 的企业,这是评估范式的更新信号。

9月24日2 分钟
Qwen阿里

工程师把 Qwen 调到极限后发现:26 万 token 是本地 AI 的硬天花板

一位开发者把 Qwen 最新模型调到极致后发现:上下文一旦超过 10 万 token,生成速度暴跌 75%。这说明长上下文仍是本地 AI 的天花板,也是企业绕不开云端的关键证据。

8月30日2 分钟
NInfervLLM

百万上下文跑在两张 5090 上 — 企业自建 AI 的硬件神话被业余玩家打破

一位 Reddit 开发者改造开源推理引擎 NInfer,让 27B 参数 Qwen 模型在两块消费级 5090 上跑出百万 token 上下文,速度比 vLLM 快近 3 倍。值得关心的是:企业自建大模型的硬件门槛正被业余项目瓦解。

8月30日2 分钟
DeepSeek投机解码

开源大模型现在会'预判'下一句了 — 投机解码正在变成推理标配

最近有用户在本地显卡上跑开源大模型时,肉眼看到投机解码在工作——AI 提前猜出'美利坚合众国'这类高频短语,瞬间整句输出。背后是 MTP 多 token 预测技术。我们关心的是:本地推理的成本曲线正在被悄悄改写。

8月29日2 分钟
LRU缓存KV Cache

LRU 缓存这个 1960 年代的算法,正在被大模型公司重新重视

掘金一篇 LeetCode 146 题解这周被技术圈反复传阅。我们想说的是:这个讲透「哈希表+双向链表」的老算法,正是大模型 KV Cache、向量数据库、Agent 记忆系统的底层机制。理解它,才能看懂 AI 基础设施的速度与成本博弈。

8月27日2 分钟
curvedinfAMD

6500 美元旧显卡跑出顶级 AI 速度 — 个体开发者改写企业推理的成本公式

GitHub 用户 curvedinf 用 6500 美元的二手 AMD MI100 显卡,把 Qwen3 27B 模型推理速度从 15 token/s 拉到 972 token/s,约 65 倍提升。值得关心的不是某个开源分支,而是企业部署 AI 的硬件门槛正在被个人项目悄悄压低。

8月27日2 分钟
Megatron-LMvLLM

千亿大模型训练的开源链路首次完整跑通 — 但能用上的中国团队不到十家

工程师把 K8s(容器调度)、Megatron-LM(NVIDIA 开源的模型并行训练框架)、vLLM(推理加速引擎)拼成一条训练千亿参数模型的完整流水线,并写成对照文档。国产大模型的「基础设施焦虑」有了解法,但真正能跑起来的玩家仍屈指可数。

8月23日2 分钟
QwenvLLM

Qwen 在 3090 上跑得更快、温度更低,本地大模型开始像正经工具了

Reddit 用户分享:两张 3090 显卡跑通 Qwen 27B,速度达 143 token/秒,温度从 70°C 降到 35°C。值得我们关心的是:本地大模型正从极客爱好跨入可用工具,对中小企业的成本和数据安全是个潜在变量。

8月22日2 分钟
通义千问Qwen

通义 27B 跑出 138 token/秒 — 一张消费显卡正在拉低本地 AI 成本

一位独立开发者把通义 27B 模型在单张消费级显卡 RTX 3090 上跑出 138 token/秒,长对话第二轮延迟从 23 秒压到 1 秒。这不是模型能力的突破,而是本地大模型成本曲线被开源社区悄悄拉平的信号。

8月19日2 分钟
Qwen千问

千问27B在两张3090上跑出218 tokens/秒 — 本地AI成本下沉

一位开发者用两张消费级RTX 3090显卡,把阿里千问团队的27B参数大模型跑出218 tokens/秒。值得关心的是,原本需要H100集群才能流畅运行的负载,如今落到了两张消费卡上。本地AI的硬件成本曲线正在松动。

8月19日2 分钟
QwenRTX 3090

RTX 3090 跑出 27B 模型 82 token/秒 — "大模型必须上云"的论调该松动了

独立开发者用一张 2020 年上市的 RTX 3090,把 27B 规模的 Qwen 模型压进 14GB 显存跑出每秒 82 token。技术细节值得工程团队收藏;它真正传递的信号是:本地 AI 的硬件成本曲线,正在和云端正面竞争。

8月16日2 分钟
inclusionAILing-3.0-flash

两个开关让小模型吞吐近翻倍 — 但隐藏的兼容陷阱比速度更值得警惕

inclusionAI 的 Ling-3.0-flash INT4 模型在 DGX Spark 上仅靠两项配置变更,生成速度从 20.8 提升到 38.7 token/秒。但默认 vLLM 缺少 V3 架构支持,会输出看似正常实则错误的文本。对本地部署和选型的团队而言,这是个隐蔽的工程雷区。

8月9日2 分钟
MiMo-2.5llama.cpp

两台 128GB 小主机跑起 MiMo-2.5,本地大模型正在逼近企业可用线

一位开发者用两台 128GB 机器和消费级显卡跑起 MiMo-2.5,并给出 356 tokens/s 预填充、15 tokens/s 生成速度。我们注意到,这不是“玩家炫技”那么简单,而是本地部署大模型正从实验阶段走向部分企业可用阶段。

6月21日2 分钟
VSCodeOllama

一个离线单文件工具走红,说明本地大模型真正卡点已从训练转向接入

这篇热门实战文章做的不是新模型,而是一个可在 VSCode 里离线使用本地大模型的单 HTML 对话界面。值得关心的是,开发者需求已很明确:比起再追参数,企业更在意内网可用、零依赖、能接入现有流程。

6月20日2 分钟
vLLMServiceNow

vLLM 升级 V1 让强化学习结果跑偏 — 推理框架的正确性比速度更值得关心

vLLM 从 V0 升级到 V1 后,在强化学习场景下出现输出不一致的问题。推理框架的「快」如果以牺牲「准」为代价,会让依赖它训练的模型悄悄走偏。

5月6日2 分钟
llama.cppMTP

llama.cpp MTP 支持进入 Beta — 本地大模型推理的速度短板开始补了

llama.cpp 开始支持 MTP 多 token 预测,目前适配 Qwen3.5。结合张量并行成熟,本地推理框架与云端服务之间的速度差距正在收窄,对本地部署大模型的可行性有实质提升。

5月4日2 分钟
QwenGemma

Qwen 3.6 跑分赢实测输 — 刷榜正在扭曲大模型能力认知

开发者实测 Qwen 3.6 与 Gemma 4,发现跑分领先的 Qwen 因死循环烧掉 8000+ Token 在真实任务中落败。大模型刷榜正扭曲能力认知,企业选型需从看榜单转向做实测。

5月2日2 分钟
QwenvLLM

单张 3090 在 Windows 跑通 Qwen3 — 本地部署大模型不再必须折腾 Linux

开发者在 Windows 原生环境跑通 Qwen3.6-27B 模型,速度达 72 tok/s。这大幅降低了本地部署门槛,传统企业无需配置 Linux 环境即可用现有显卡跑起大模型。

5月2日2 分钟
AWS-Trainium2vLLM

AWS Trainium2 上的 Speculative Decoding 将 LLM 推理延迟降低最高 3 倍

AWS 基准测试显示,在 Trainium2 上结 合 vLLM 使用 speculative decoding,可将解码密集型工作负载的 inter-token 延迟降低最高 3 倍。

4月15日2 分钟
Qwen-32Bllama.cpp

本地 LLM 在 8-9 次链式调用后工具调用准确率下降

Qwen 32B、Gemma 9B 和 Command R 32B 在 8 次以上工具调用后均出现类似故障,原因是注意力稀释而非上下文限制。

4月8日2 分钟
Gemma 4vLLM

在 vLLM 上运行 Gemma 4 26B-A4B:社区故障排查笔记

开发者报告在 vLLM 上部署 Gemma 4 26B-A4B 结果不一,DGX Spark GB10 上的 INT4 量化版本速度过慢。

4月6日2 分钟
QwenvLLM

Agent 集群结合连续批处理将 LLM 任务时间缩短 36 倍

在 Intel B70 GPU 上运行 50 个并行 Agent 配合 Qwen 27B,利用连续批处理技术将原本需 42 分钟的研究任务压缩至 70 秒完成。

4月6日2 分钟