返回首页
NInfer
找到 3 篇关于此标签的文章
NInfervLLM
百万上下文跑在两张 5090 上 — 企业自建 AI 的硬件神话被业余玩家打破
一位 Reddit 开发者改造开源推理引擎 NInfer,让 27B 参数 Qwen 模型在两块消费级 5090 上跑出百万 token 上下文,速度比 vLLM 快近 3 倍。值得关心的是:企业自建大模型的硬件门槛正被业余项目瓦解。
2h ago2 分钟
QwenRTX 4090
单张 RTX 4090 跑通 27B 大模型 — 本地 AI 硬件成本曲线悄悄跌穿
Reddit 本周技术社区的实测帖:开发者把 27B 参数的通义千问塞进单张消费级显卡 RTX 4090,上下文做到 25-35 万 token。本地部署大模型的硬件门槛,正在悄悄跌穿中小企业的心理预期。
Aug 162 分钟
QwenNInfer
Qwen3.8 27B 单卡跑出 200 token/秒:本地推理追上商业方案
阿里开源的 Qwen3.8 27B 模型,搭配社区推理引擎 NInfer,在消费级显卡 RTX 5090 上跑出约 200 token/秒生成速度。本地部署 AI 的硬件门槛正在快速下降,这对企业 IT 采购和数据敏感型业务有实际意义。
Aug 142 分钟