找到 1 篇关于此标签的文章
一个开源团队把 1770 亿参数大模型塞进 16GB 消费级显卡加 SSD,跑出每秒 9-10 个 token。这不只是技术炫技,而是大模型硬件门槛正在悄悄下沉的一个信号。