返回首页
推测式解码
找到 3 篇关于此标签的文章
AntLingLing-3.0-flash
国产大模型开始卷推理成本 — 但省钱这事短期跟你无关
AntLing 为其 Ling-3.0-flash 发了一个"草稿模型"配合推理提速。背后是开源社区把注意力从"模型本身"转向"怎么跑得便宜",终端用户短期无感。
Aug 222 分钟
DeepSeekAMD
DeepSeek V4 在家用小主机跑到 22-28 字/秒,本地大模型这事可能真要开始能用了
一位技术爱好者这周在 AMD 迷你主机上跑通了 DeepSeek V4 Flash,速度达到日常办公可用级别。我们关注到,国产开源大模型正从『参数大』过渡到『本地真能跑』,但硬件价格和运维门槛仍把大多数人挡在门外。
Aug 182 分钟
DeepSeek推测式解码
DeepSeek 284B 单卡跑到 31 tok/s — 本地大模型的隐性拐点
开发者用单张 RTX PRO 6000 工作站显卡跑通 DeepSeek 284B,配合 DSpark 推测式解码达到 31 tok/s。最反直觉的发现是:把辅助小模型放在普通内存里反而更快。本地部署顶级大模型的隐性成本曲线正在改变。
Aug 132 分钟