AppleM5 Ultra
M5 Ultra Cuts GLM-flash Inference 20% via One Parameter — Local AI Arrives
A Reddit post: M5 Ultra running GLM-flash locally cut 130k-token inference 20% (220s→185s) via prefill tuning. Local LLMs crossed a quiet threshold.
Sep 25·2 min read