找到 1 篇关于此标签的文章
本周 Reddit 技术帖显示:苹果 M5 Ultra 跑国产 GLM-flash 模型时,把一个叫 prefill step 的参数从 2048 调到 8192,13 万 token 长文档总耗时直接缩短两成。这不是技术细节,而是本地大模型跨过一道隐形门槛的信号。