Llama
找到 14 篇关于此标签的文章
NVIDIA 把开源模型部署压成两条命令 — 算力之外,便利就是新生意
英伟达新发布 TensorRT Model Connect,让开源大模型从训练到上线只需两条命令。值得关心的是:当 GPU 不再稀缺,「让 AI 真正跑起来」本身正在变成一门新生意。
AI 装进自家电脑:本地大模型正从极客玩具走进企业会议室
Reddit r/LocalLLaMA 板块本周一篇标题只有一句话的帖子引出密集讨论。它指向一个真实趋势:DeepSeek、Llama 等开源模型加上消费级硬件的成熟,让本地大模型从极客实验变成企业 IT 的备选项。
在家跑 AI 这事 Reddit 用户笑了 — 企业私有部署的溢价付得值吗
Reddit 本地大模型社群一个两句话的调侃帖引来关注。背后是真问题:消费级硬件跑 AI,离生产可用还有多远?为什么企业还在为私有部署大额买单?我们认为,多数人把「能跑通」和「能上生产」混为一谈。
本地大模型终于能干活了 — 开源阵营正在改写云端 API 的规则
r/LocalLLaMA 上一句「我们到了」引爆社区——本地跑大模型这件事,终于从极客玩具变成了真工具。当 AI 不再必须联网,个人开发者和中小企业第一次拥有了真正的选择权。
通义千问 27B 跑分很强,但 300 万次下载的版本其实没人系统测过
通义千问 27B 在公开跑分榜成绩亮眼,但真正被下载 300 万次的 4-bit 压缩版根本没人系统测过。本周 Reddit 高赞帖指出:跑分榜测的是「精装版」,用户跑的是「简装版」,两者不是同一个东西。
Koboldcpp 出了 v119 — 本地跑大模型,比想象的更远
Koboldcpp 是个让普通电脑本地跑开源大模型的小工具,这周更新到了 v1.119。它本身没有大新闻,但能迭代到 119 版,说明这条被巨头叙事淹没的本地路线,还在被真实用户持续维护。
巨头们都在卷千亿参数,但普通人的笔记本只能跑得动 9B 模型
本周 LocalLLaMA 社区一则吐槽帖引爆讨论:用户抱怨每次推荐 Qwen 9B 这类小模型,评论区都被「122B 更好」刷屏。可普通人笔记本只有 8GB 显存。基准测试的赢家,不一定是真实世界的可用者。
开源 AI 模型下载押注 Hugging Face — 单点风险被忽视
r/LocalLLaMA 上一帖揭示:开源大模型动辄上百 GB,全球下载流量高度集中 Hugging Face。我们关心的是,这不只是下载慢的问题,而是被忽视的供应链集中风险。
本地大模型第一次"够用"了 — Reddit 一场讨论戳中开源模型的拐点
r/LocalLLaMA 上有人提问:本地模型在哪类任务上让你觉得"够用、不用再掏 ChatGPT"了?备选清单是写代码、文档总结、本地 RAG、写作、Agent 工具调用。本质问的是"信任阈值" — 用户从"试试看"切到"日常用"的那一格。
Zuckerberg 亲自盯模型发布节奏 — Meta 用「快」打 OpenAI 的「精」
扎克伯格本周公开 Meta 的模型发布策略:更高频、更小步快跑。这是在向 OpenAI 的「精品慢发」路线叫板,也意味着开源大模型的战火烧到了「更新节奏」上。
Phi 模型已半年没更新 — 微软在开源小模型这条路上还走不走?
微软曾经最受开发者喜爱的开源小模型 Phi 系列,2024 年 12 月之后再无大版本更新。在 r/LocalLLaMA 社区引发「Phi 是否已死」的讨论,我们关心的是:当大公司把资源堆向旗舰模型,曾经的「性价比小钢炮」会怎样。
白宫考虑 AI 模型发布前审查 — 美国监管从自愿转向强制的信号
白宫正讨论在 AI 模型公开发布前进行政府审查,这意味着美国 AI 监管可能从企业自律转向强制准入。对大厂是护城河,对开源社区是生存威胁。
Meta Muse Spark: 仅托管模式运行,内置 16 个 Chat 工具
自 Llama 4 以来的首款模型,Muse Spark 采用仅托管模式运行,在 meta .ai 对话中暴露了 16 个工具。
在 4chan 数据上微调可提升 Llama 8B 和 70B 的基准测试分数
一名研究者在 4chan 数据上微调了 Llama 8B 和 70B 模型,报告称两个模型均超越了其基础版本。