这是什么
r/LocalLLaMA 上一组基准测试显示:智谱 GLM-5.3-Flash 在新框架 TensorSharp 上跑出 73.5 tokens/秒的解码速度,是 llama.cpp 的整整一倍——这件事值得我们关心,因为它可能改写本地大模型部署的成本曲线。
GLM-5.3-Flash 用 UD-Q2_K_XL 量化(压到 2 比特精度,普通显卡也能跑),TensorSharp 解码快一倍的关键是「图缓存」:把每个 token 的计算图一次性构建、反复回放,而 llama.cpp 每个 token 都得重建。预填充速度两者几乎持平,差距只在 3% 以内。
行业怎么看
Reddit 上两种声音都有。
支持者认为这是真工程突破。GLM-5.3-Flash 的结构(每 token 计算图深且拆碎)恰好是图缓存收益最大的场景。如果国产模型本地部署成本真能砍半,中小企业私有化 AI 是直接受益方。
但反对意见很明确:第一,基准是提交者本人跑的(/u/fuzhongkai),尚无第三方复现;第二,测试用的是 CUDA 12.8 + SM 120 这一代新 GPU,老卡表现未知;第三,TensorSharp 是全新项目,工具链和生态几乎空白,离能投产还有距离。
对普通人的影响
对企业 IT:若结果能被复现,自建大模型推理集群的硬件投入可能下降三到五成——同样卡能服务两倍并发。但 TensorSharp 目前更像技术 demo,离企业级产品还远。
对个人职场:直接影响不大。你用豆包、Kimi、文心一言时,后端用什么引擎你感知不到。但若企业算力成本真的大幅下降,未来 AI 功能的定价有进一步下调空间。
对消费市场:本地 AI 设备(AI 玩具、边缘盒子、车载 AI)响应速度理论上能更快,但 TensorSharp 要走到消费级硬件至少还需一年生态沉淀。