返回首页
Ninfer
找到 2 篇关于此标签的文章
NinferQwen3
Qwen3 模型在 5090 上跑到 220 tokens/秒,本地 AI 体验拐点临近
新推理引擎 Ninfer 让 Qwen3 模型在 RTX 5090 上跑出平均 170、最高 220 tokens/秒,速度比主流 llama.cpp 快一倍多。本地部署 AI 的体验正在逼近云端 API,企业自建的成本结构开始松动。
1d ago2 分钟
NinferCMP170HX
AI 当程序员干完 CUDA 移植 — 矿卡跑 Qwen 35B 性能翻倍
一位非程序员的 IT 架构师,借 AI 编码助手把推理引擎移植到矿卡上,让 Qwen 35B 性能翻倍。两件事值得关心:廉价矿卡成本地 AI 的现实选项,AI 当程序员正在把底层技术门槛削平。
Aug 222 分钟