返回首页

LocalLLaMA

找到 30 篇关于此标签的文章

LocalLLaMAReddit

本地跑大模型多快才够用?30 TPS 和 150 TPS 之争,暴露端侧 AI 的真问题

Reddit 开发者最近为本地大模型的「够用速度」吵翻了:一派坚持 30 TPS 就够,一派认为 150 TPS 才有对话感。这场口水战背后,是企业本地部署 AI 时的真实硬件选择困境。

9月24日2 分钟
LocalLLaMA开源模型

40B 以下本地模型能模仿作家文风吗?——Reddit 一问背后的细分战

本周 Reddit LocalLLaMA 一条不到 30 字的求助帖冲到热门:哪个 40B 以下的本地微调模型最适合模仿一本书的文风。问题虽小,却照出本地大模型正在按'用途'分化——通用模型越来越同质,垂直用途的小模型开始有自己的活法。

9月23日2 分钟
ReefLocalLLaMA

开源项目 Reef 据称跑通「自我改进」— 这次是突破还是传闻重演

Reddit 本地大模型圈一条几乎为空的帖子声称开源项目 Reef 跑通了 RSI(递归自我改进)。这是 AI「自己训练自己」的关键能力。值得关心:一旦开源方案被验证,传统大厂的算力护城河会再被削一层。

9月23日2 分钟
LocalLLaMALlama.cpp

40MB 单文件装下大模型和语音 — Local-First AI 开始落地

一个独立开发者把开源大模型推理、语音识别、代码执行器打包成 40MB 的本地 exe,演示了 AI 实时生成每一个界面像素的可能。这是 Local-First(本地优先、不依赖云)路线少有的能跑通的产品级 demo,值得我们关心:它挑战的是云厂商的护城河。

9月23日2 分钟
LocalLLaMAPython

25 行 Python 就能搭 LLM 工具 — 个人开发者的 AI 红利窗口正在打开

LocalLLaMA 社区最近冒出 25 行 Python 写成的 AI 工具 Jev。背后是 LLM 框架成熟、调用门槛暴跌的事实 — 对企业 IT 采购和个人职场都有直接含义。

9月23日2 分钟
NVIDIA5090

5090 显卡都不够用 — 本地跑 AI 正在变成烧钱爱好

一位 Reddit 用户已拥有 NVIDIA 5090 旗舰显卡,还在问'4000 美元还能怎么花'升级本地 AI 算力。背后信号值得关心:本地跑大模型门槛正在向中产收入看齐,普通人想'自己跑模型'并不便宜。

8月30日2 分钟
Sesame AIChatGPT

语音 AI 想跑在本地?12GB 显卡暂时还差口气

本周 Reddit 的 LocalLLaMA 社区有热帖追问:有没有能在 12-24GB 消费级显卡上跑的语音对话模型,能对标 Sesame 或 ChatGPT 的体验。答案是——目前还没有真正能打的本地方案。云端语音 AI 的体验优势,正在成为本地化部署的下一道关卡。

8月29日2 分钟
Political CompassLocalLLaMA

大模型也要测政治立场了:Reddit 用户拿 Political Compass 跑了十几个模型

Reddit 用户 Thrumpwart 把十几款主流大模型丢进 Political Compass 测试,结果多数偏向经济左翼 + 社会自由象限。这事表面是社区玩票,背后是训练数据偏见与企业部署选型的真实风险。

8月29日2 分钟
NVIDIADGX

DGX 跑 AI 也过热 — NVIDIA 旗舰得用户自己加风扇这事说明什么

一位 Reddit 用户给 NVIDIA DGX 加装主动散热,因为跑 DeepSeek 等模型时过热。这是真实的本地 AI 部署问题:即使是 NVIDIA 旗舰,持续负载下也得用户自己魔改,「即插即用」的叙事被戳穿。

8月29日2 分钟
QwenLocalLLaMA

8B 小模型本地跑 Agent 编码追平 27B — 小模型'够用时刻'来了

Reddit 社区开发者用单张 RTX Pro 6000 跑了份 Agent 编程本地基准:8B 量化小模型跑分逼近 27B 模型,每分请求数和 token 数都更省,且模型自称'未充分训练'。我们注意到,本地跑 AI 写代码的硬件与算力账,可能要被重新算一遍。

8月28日2 分钟
RedditLocalLLaMA

本地跑大模型有张没人算的账单 — 你的 GPU 在给房间供暖

Reddit 用户实测:双 5060Ti 跑 Qwen 27B 做编码任务,每张卡满载 170W,相当于一台小型取暖器持续工作。本地 AI 看似'免费',电费和散热成本却没人提前算清。

8月28日2 分钟
OrnithQwen3

Ornith 让 8GB 显卡跑 35B 模型:本地 AI 编程的甜蜜点真的到了

一位 Reddit 用户用 RTX 3070 笔记本(8GB 显存)跑通 Ornith-1.5-35B-A3B,速度约 32 token/秒,能完整执行 agentic 编程任务。这件事值得关心,是因为消费级硬件开始承接过去需要云端才能跑的 AI 工作流。

8月28日2 分钟
QwenHugging Face

Qwen 3.8 27B 压到 14GB 内存,本地模型逼近云端旗舰

社区用户把 Qwen 3.8 27B 压到约 13—14GB 内存运行,并称 12GB 显卡也能承载。它值得关注,因为低成本本地推理正逼近高价云端模型,但能力对比仍需独立测试。

8月28日2 分钟
HuggingFaceNvidia

Reddit 用户提议 BT 替代 HuggingFace 分发大模型 — 没那么简单

开源大模型动辄几十 GB,HuggingFace 的分发带宽成本是天文数字。Reddit 用户提议用 BT 种子让社区分担——听上去双赢,但安全审核、冷门模型死链、商业可持续性三道坎,哪个都不好过。

8月27日2 分钟
AppleMac mini

Mac mini 升级 M6 芯片 — 本地跑 AI 大模型的门槛又降了一档

苹果本周更新 Mac mini,主芯片跳到新一代 Apple Silicon。值得关心的是:这台小主机一直是'本地跑 AI 大模型'的代表机型,新芯片意味着更多普通人也能在家部署开源 AI;但距离真正进入办公室和家庭,还有一段路。

8月26日2 分钟
DeepSeek深度求索

DeepSeek V4 视觉版迟迟不发权重 — 中国开源 AI 的「狼来了」焦虑

曾凭 V3 与 R1 开放下载改写行业规则的 DeepSeek,这次在 V4 视觉版(能看图的多模态模型)的权重开放上没了动静。本地 AI 社区开始催问,背后真正的疑问是:中国开源大模型的领先窗口还能撑多久。

8月26日2 分钟
LocalLLaMARTX 3060

消费级显卡跑大模型个人部署 AI 离企业可用还差多远

一位开发者用 6 张 RTX 3060 和 Intel Arc B60 显卡,在自家跑起了大语言模型,把经验写成 4 篇实战。我们看到,这是个人玩家领域的进展,但商业部署的稳定性与成本结构,仍是另一回事。

8月26日2 分钟
QwenOCuLink

外接显卡复活旧硬件跑通 27B 模型 — 本地大模型正在够用,但前提是你愿意折腾

Reddit 用户用 OCuLink 外接显卡盒把闲置的 RTX 4070 Ti 重新利用,配合 RTX 5070 Ti 跑通了 Qwen 27B 模型。本地跑能用的 AI 不再只是极客专利,但距离普通人日常还有相当距离。

8月26日2 分钟
Qwen3.8Muse-Glimmer

Qwen3.8 跑 30 小时还翻车,小模型三小时搞定 — 架构巧比参数大更重要

一名 r/LocalLLaMA 用户测试发现,Qwen3.8 高投入模式跑完一套基准要 30 小时、还挂了 16 题;Muse Glimmer 三小时搞定,隐式知识得分反而更高。架构巧思开始比参数堆叠更重要,做本地部署和 AI 选型的人值得记一笔。

8月26日2 分钟
LocalLLaMA开源大模型

本周 AI 圈最热帖只有 8 个字 — 我们看到的预期管理正在靠梗图驱动

英文本地大模型社区 r/LocalLLaMA 本周最热帖只写了 'It's here!' 八个字,配一张辛普森梗图,发帖人 ID 致敬马斯克那条著名推文。零技术细节却刷屏,这件事比任何产品发布都更值得关心。

8月26日2 分钟
LocalLLaMAr/LocalLLaMA

LocalLLaMA 上有人发了句'我有个问题'就没下文 — 这本身就是条行业信号

r/LocalLLaMA 上一个'我有个问题'的空帖冲上首页 — 这背后是开源大模型社区信号密度的变化。普通人不必在意,但想本地跑模型的人可以留个心眼。

8月25日2 分钟
Quantization-Aware HealingLocalLLaMA

4-bit 压缩后的模型反而比原版更强 — 量化修复让小模型逆袭

本周 r/LocalLLaMA 流传一项研究:通过「量化感知修复」技术,4-bit 压缩后的模型不仅没掉性能,跑分还超过了原版全精度模型。这事如果站得住,大模型部署成本可能再降一截。

8月25日2 分钟
Kiwix维基百科

做离线维基百科的人发现:自家工具正被偷偷喂 AI — 数据荒信号比我们以为的早

Kiwix 团队这周在 Reddit 发了一个有点意外的帖:他们发现很多 AI 开发者正在用自家打包的离线维基百科数据去训练或检索大模型。一个不起眼的信号,说明公开数据的紧缺比我们以为的来得更早。

8月25日2 分钟
QwenUnsloth

3000 块显卡跑通完整工程合并 — 本地 AI 编码首次走出 demo

一位独立开发者用一张 4060Ti 显卡(约 3000 元)跑 Qwen 27B 量化模型,让 AI 自主完成真实项目的功能开发并通过人工 review 合并进代码库。值得关心的是:这是开源本地 AI 第一次走通完整的工程化编码流程。

8月25日2 分钟
LocalLLaMA本地AI

Reddit 上旧笔记本跑大模型的人组了联盟 — 云端烧钱不止,民间选'穷鬼路线'

知名本地 AI 社区 r/LocalLLaMA 新开子版 r/LowEndLocalAI,专门讨论如何用 16G 内存笔记本、集成显卡、迷你主机跑大模型。背后是云端军备竞赛之外,本地 AI 路线的悄然反扑。

8月25日2 分钟
LocalLLaMA视觉语言模型

本地视觉语言模型进入实用期 — 128GB 显存门槛把多数企业挡在门外

Reddit LocalLLaMA 社区本周盘点 2026 年 8 月可用的本地视觉语言模型(VLM,能看图说话的 AI)。按显存从 8GB 到 128GB 分五档讨论,结论务实:评测不可靠,没有模型能通吃。这是观察 AI 本地化趋势的一个切口。

8月24日2 分钟
NODEMINDSHADOW-250M

Reddit 用户把大模型压进 60 MB 跑 CPU — 数字漂亮,我们先打个问号

60 MB 装下大模型、CPU 跑 400 token/s、无需 GPU——Reddit 用户 NODEMIND 发布的 SHADOW-250M 数字惊人。如果可复现,本地 AI 的成本曲线可能比我们想得更陡;但单一来源、零独立基准,我们暂时把它当值得跟踪的爱好者作品。

8月24日2 分钟
LocalLLaMAOpenAI

新手发帖问'有什么好模型值得等' — 我们替他盘了盘下半年的发布节奏

Reddit LocalLLaMA 版块一位新人问'有什么即将发布的模型值得关注',评论区没什么干货。这件事本身是个信号:开源社区对模型迭代的兴奋度在降温,大家更关心落地能力而非参数规模。我们替这位新手整理了头部厂商下半年的发布预期。

8月24日2 分钟
RedditQwen

Reddit 网友提议众筹训开源大模型 — 用户开始用钱包投票选规格

本周 Reddit 用户发帖建议用 Kickstarter 众筹资金,激励中国 Qwen 团队训练一个 35B MoE 混合专家版本的开源模型。值得我们关心的是:开源 AI 圈正从「免费白嫖」走向「按需付费」,这是社区组织化的早期信号。

8月23日2 分钟
LocalLLaMAVLM

4.5亿参数小模型看懂浏览器屏幕:1%到44%说明垂直微调更划算

Reddit 开发者用 5 万张浏览器截图微调 4.5 亿参数的视觉语言模型,屏幕问答准确率从 1% 跳到 44%。值得关心的是:Agent 落地的瓶颈可能不是参数够不够大,而是有没有针对真实界面做专项训练。

8月23日2 分钟