智谱TensorSharp
AI 解码快一倍:TensorSharp 把 llama.cpp 拉下马,部署成本或砍半
智谱 GLM-5.3-Flash 在新框架 TensorSharp 上跑出比 llama.cpp 快一倍的解码速度,本地部署成本可能显著下降,但生态成熟度仍是未知数。
1d ago·2 分钟
BitNet推理引擎
有人在普通CPU上跑出36 token/秒 — 大模型推理开始摆脱显卡依赖
一位开发者用纯C99写出零依赖推理引擎,在Intel至强CPU上跑出每秒36个token的成绩。值得关心的是:当模型压缩到1.58位,算力天花板不再是GPU,而是内存带宽。
Aug 8·2 分钟