返回首页
Ling-3.0-flash
找到 2 篇关于此标签的文章
AntLingLing-3.0-flash
国产大模型开始卷推理成本 — 但省钱这事短期跟你无关
AntLing 为其 Ling-3.0-flash 发了一个"草稿模型"配合推理提速。背后是开源社区把注意力从"模型本身"转向"怎么跑得便宜",终端用户短期无感。
Aug 222 分钟
inclusionAILing-3.0-flash
两个开关让小模型吞吐近翻倍 — 但隐藏的兼容陷阱比速度更值得警惕
inclusionAI 的 Ling-3.0-flash INT4 模型在 DGX Spark 上仅靠两项配置变更,生成速度从 20.8 提升到 38.7 token/秒。但默认 vLLM 缺少 V3 架构支持,会输出看似正常实则错误的文本。对本地部署和选型的团队而言,这是个隐蔽的工程雷区。
Aug 92 分钟