返回首页

inclusionAI

找到 5 篇关于此标签的文章

百聆Ling Tiny

4060Ti 上小模型替掉 Gemma-12B — 大模型的副业正在被重新分配

Reddit 用户这周在 4060Ti 上用百聆 Ling Tiny 小模型替换掉 Gemma-12B 做'事后修正',称速度'惊人'。意味着:辅助类 AI 任务正在压向消费级硬件。

6d ago2 分钟
inclusionAILing-3.0-tiny

249 美元小盒子跑满 128K 大模型 — 边缘 AI 开始撬动云端成本

本周技术圈有人在 249 美元的 Jetson Orin Nano 上跑通了 inclusionAI 的 Ling-3.0-tiny:7.9B 参数、128K 上下文、33 token/秒。意味着企业自建 AI 的硬件成本,可能从「机柜级」下沉到「桌面级」。

Aug 192 分钟
Ling-3Qwen3.5

Ling-3 Tiny 跑分超 Qwen3.5 9B — 我们对开源的关注太集中

本周 Reddit 开源社区发现,参数 1-2B 的 Ling-3 Tiny 在推理基准上跑赢 Qwen3.5 9B。这不是孤例 — 中型开源实验室的好模型正被几个明星的光芒盖住。对本地化部署和企业 AI 选型而言,这是个值得重新看一次的信号。

Aug 182 分钟
inclusionAILing

1240 亿参数模型在桌面机上稳定跑了 7 分钟 — 本地 AI 跨过能用的门槛

本周 Reddit 一项测试显示,1240 亿参数的 Ling 模型在单台 NVIDIA DGX Spark 桌面机上连续生成 1.5 万 token,全程解码速度稳定在 35.7 token/s。值得关心的是:本地大模型正从极客玩具变成企业可认真评估的部署选项。

Aug 132 分钟
inclusionAILing-3.0-flash

两个开关让小模型吞吐近翻倍 — 但隐藏的兼容陷阱比速度更值得警惕

inclusionAI 的 Ling-3.0-flash INT4 模型在 DGX Spark 上仅靠两项配置变更,生成速度从 20.8 提升到 38.7 token/秒。但默认 vLLM 缺少 V3 架构支持,会输出看似正常实则错误的文本。对本地部署和选型的团队而言,这是个隐蔽的工程雷区。

Aug 92 分钟