找到 1 篇关于此标签的文章
llama.cpp 新增 TENSOR_READ_LAZY 机制,模型权重按需读取而非一次性塞进显存或内存。这意味着更大参数规模的模型能在消费级硬件上跑起来,对本地 AI 部署生态是一次实质性的松动。