Gemma 31BGoogle
同样是 Gemma 31B,本地量化版本差异明显:能不能长文稳定工作,比跑分更重要
一位本地模型用户连续对比发现,Gemma 31B 不同量化版本在长上下文和工具链场景下表现差异很大。值得关心的不是“能不能跑起来”,而是本地大模型正进入稳定性比参数规模更重要的阶段。
Jun 6·2 分钟
QAT模型量化
AI模型量化告别全盘降级,混合精度拓扑设计成工程新解
AI模型在16位切8位部署时易精度崩塌,新方法提出以8位为底座、对敏感层做16位升级的“等效拓扑”设计,兼顾性能与精度,标志着模型部署走向精打细算。
May 1·2 分钟