返回首页
AMD Strix Halo
找到 2 篇关于此标签的文章
LocalLLaMAllama.cpp
AI 推理开始「偏科」:一群新引擎放弃通用性,只为榨干每一块硬件
一批只针对特定模型+特定硬件深度优化的「偏科」推理引擎正在冒头,放弃通用性以换取极致性能。这意味着 AI 部署正从「一个引擎跑所有模型」走向「一块硬件一个引擎」的精细化时代,对本地部署成本的影响值得观察。
10月3日2 分钟
GufoHalogen
号称 70 tokens/秒实测打回原形 — AI 跑分注水这事又来了
开源 AI 推理框架 Gufo 主推 70 tokens/秒性能,最近被实测打脸:真实任务下只有 38 左右,比竞品还慢 13%。问题不在造假,而在 benchmark 选了一道投机解码能抄答案的题——'把 red 写 1000 遍'。这是 AI 行业跑分注水的又一个案例。
10月1日2 分钟