找到 1 篇关于此标签的文章
Reddit 开源社区有人用 vLLM 分支让英伟达 2017 年的 V100 显卡重新跑起 350 亿参数级别的大模型,性能接近新消费级芯片。这意味着 AI 推理的成本逻辑,可能比多数人想的更宽松。