找到 1 篇关于此标签的文章
开发者用 NVMe 固态当第四层内存,让 85GB 的 DeepSeek-V4-Flash 大模型在 12GB 显存的 RTX 3060 上跑出约 3 token/s。本地大模型的成本墙出现第一道裂缝。