返回首页
LLaMA
找到 2 篇关于此标签的文章
DeepSeekQwen
中美大模型都在抄同一套训练流水线 — 真正决定能力的,不是预训练
我们注意到一个被低估的事实:预训练吃掉 90% 算力,但决定模型聪明程度的反而是那个只占 5% 的中训阶段。一篇掘金技术长文拆解了 DeepSeek、Qwen、Kimi 这条正在被悄悄标准化的流水线。
Aug 142 分钟
Anubis-OSSApple芯片
开源模型排行榜收录 218 款模型、10 款 Apple 芯片 — 本地跑 AI 正在变成正经事
Anubis-OSS 排行榜更新:371 次提交、218 个模型、10 款 Apple 芯片参与。这个数据说明开源模型本地部署不再是极客玩具,正在形成可评估的生态。
May 52 分钟