DeepSeek
找到 30 篇关于此标签的文章
DeepSeek 在两台几万元小机器上跑出 67 token/s — 本地大模型门槛正在塌方
本周一位 Reddit 用户用两台 NVIDIA DGX Spark 工作站(约 6 万元)跑出 DeepSeek V4 Flash 67-84 token/s 的稳定输出,配 100 万 token 上下文。我们关心的是这份民间复刻印证了一个被低估的趋势:开源大模型本地部署的成本正在快速下沉,企业
开源大模型现在会'预判'下一句了 — 投机解码正在变成推理标配
最近有用户在本地显卡上跑开源大模型时,肉眼看到投机解码在工作——AI 提前猜出'美利坚合众国'这类高频短语,瞬间整句输出。背后是 MTP 多 token 预测技术。我们关心的是:本地推理的成本曲线正在被悄悄改写。
把 AI 思考深度拉满反而更差 — DGX Spark 本地实测给企业的提醒
一位 Reddit 开发者用四台 NVIDIA DGX Spark 桌面工作站实测 DeepSeek、Qwen 多款模型,发现「深度思考」模式反而让得分下降、耗时翻倍。这对花钱买 AI 推理服务的企业是直接的成本提醒。
DeepSeek 把 Agent 的五把钥匙交出来 — 中文社区开始啃源码
DeepSeek 开源的 Agent 框架里有一套事件分发机制,最近被开发者「怕浪猫」用「五把钥匙」做类比写成 8000 字源码教程。它说明中文 AI 开源生态正在从「调 API」走向「读源码」。
DGX 跑 AI 也过热 — NVIDIA 旗舰得用户自己加风扇这事说明什么
一位 Reddit 用户给 NVIDIA DGX 加装主动散热,因为跑 DeepSeek 等模型时过热。这是真实的本地 AI 部署问题:即使是 NVIDIA 旗舰,持续负载下也得用户自己魔改,「即插即用」的叙事被戳穿。
AI 找漏洞快到十分钟 — 开源三十年「私下修复」的默契要重建
AI 编码助手能力跃升,把开源漏洞从「私下修复」到「公开利用」的窗口期从几天压缩到十分钟。维护者疲于应对,下游企业和开发者需要重新理解开源安全节奏。
智谱 GLM-5.3 架构未动训练刷分 — 中国大模型公司开始卷'内功'
智谱 GLM-5.3 在架构与 5.2 完全一致的情况下,仅靠训练方法刷出性能新高。当同行还在堆参数换架构,这条'安静路线'值得关心。
NVIDIA 把开源模型部署压成两条命令 — 算力之外,便利就是新生意
英伟达新发布 TensorRT Model Connect,让开源大模型从训练到上线只需两条命令。值得关心的是:当 GPU 不再稀缺,「让 AI 真正跑起来」本身正在变成一门新生意。
8G 显卡也能跑 70B 模型了 — 量化技术把 AI 本地部署的成本砍到底
8G 显存的 4070 显卡,过去装不下 130GB 的大模型权重;现在靠量化技术,3.5GB 就能跑 7B 模型。这件事的真正意义不是技术参数,而是 AI 部署第一次有可能脱离云端,让每个企业都能自己跑。
中国开源模型在 Agent 评测追平顶尖闭源 —— GLM 和 Qwen 只用了两个月
Agent Arena Code 这份榜单最近更新了一轮初步结果:智谱的 GLM 和阿里的 Qwen 在 Agent 代码任务上跑出与顶级闭源模型接近的成绩。开源阵营追上闭源头部,这件事在两个月前还不敢想。
DeepSeek 当主脑、Qwen 做副手 — 中国开源大模型开始被分工使用
一名开发者把 DeepSeek V4、Qwen 3.8 Flash、GLM 5.3 Flash 三款中国开源大模型塞进 4 张 DGX Spark 本地推理卡跑实测,GLM 5.3 Flash 因太啰嗦、速度仅 22 tok/s 被淘汰,最终让 DeepSeek 扛主力、Qwen 当副手。这反映中国
用户称 Qwen 跑赢 DeepSeek — 但帖子连一句正文都没有
一条 Reddit 帖子声称 Qwen3.8-Flash-Next 优于 DeepSeek V4 Pro,但既没有跑分也没有对比表格。我们拆解这条空帖背后反映的中国开源模型对标焦虑。
DeepSeek Agent 教程出到第 10 章 — 中国大模型开始抢开发者
DeepSeek 开源的 Agent 框架 Harness 在中文技术社区被逐章拆解,最新已到第 10 章。值得关心的是这背后的转向:中国头部大模型公司的竞争重心,正从「比模型跑分」移向「抢开发者和生态」。
DeepSeek V4 视觉版迟迟不发权重 — 中国开源 AI 的「狼来了」焦虑
曾凭 V3 与 R1 开放下载改写行业规则的 DeepSeek,这次在 V4 视觉版(能看图的多模态模型)的权重开放上没了动静。本地 AI 社区开始催问,背后真正的疑问是:中国开源大模型的领先窗口还能撑多久。
DeepSeek 让 AI 自己教自己 — 中国开源路线跑出 Agent 新范式
DeepSeek 开源 Harness 训练框架与论文,展示 self-evolving agent(能从执行经验中自我迭代的 AI)。这不是产品发布,而是训练方法论的范式转移——中国大模型公司用更便宜的方式追硅谷 Agent 路线。
智谱开源 Ox Alpha 对标 DeepSeek — 中国大模型把开源做成标准动作
本周 Z.AI(智谱)确认:神秘冲榜的 Ox Alpha 是 GLM 新一代,今晚开源权重。这不只是技术新闻——继 DeepSeek 之后,第二家中国大模型公司主动押注开源换生态。
DeepSeek 上线识图能力,价格国产最低 — 但复刻页面实测不如 K3
DeepSeek 发布首个官方多模态实验模型 deepseek-v4-flash-vision-exp,百万 token 输入最低 0.05 元,价格仍是国产最低档。补齐 Agent 生态短板,但前端复刻实测弱于 K3。
DeepSeek 把自家智能体的「操作系统」开源了 — 这件事比技术细节更重要
DeepSeek 内部用了多年的 AI 智能体编排框架 Cordis,最近被开发者做成 9 章源码剖析系列公开。我们认为,这是中国头部 AI 公司首次把生产环境的 Agent 底层架构以这种颗粒度开放。
大模型窗口开到 128K 还是会'失忆' — 上下文工程师正成为抢手岗位
当你和 AI 聊到第 20 轮它开始'犯傻',多半不是模型不行,是上下文没管理好。这门叫'上下文工程'的技术正在成为大模型公司的下一个战场,也催生了一类新岗位。
花 10 万买 Mac Studio 跑本地大模型?Reddit 一笔账:云端更划算
Reddit 用户算了笔账:10,000 美元的 Mac Studio M5 Max 本地部署的钱,在云端 API 最多能换 1000 亿 token。我们关心的是:本地部署的成本护城河,正在被按需付费模式一点点蚕食。
AI「思考慢、复制快」被工程师写成博客 — 但只对了一半
英国工程师 Michael Gomes Vieira 提出一个工程时间观:AI 推理慢,蒸馏(即把大模型的能力迁移给小模型)快。中国大模型团队早就在用这条规律,但「复制快」不等于「能力等价」——这是工程优势,不是能力保证。
2.8 万亿参数大模型被塞进消费级电脑 — 跑得起来,但慢得没法用
一位工程师用 4070 Ti 显卡 + 32GB 内存,硬把 711GB、2.8 万亿参数的 Kimi K3 跑起来了。正常速度每秒只生成 1-2 个字。真正突破在存储:用两块 SSD 并行读取,把 DeepSeek 速度从 1.14 提到了 8.08 tokens/秒。
DeepSeek Agent 框架被开发者拆到源码层 — 大模型竞争延伸到应用底座
DeepSeek 旗下的 dsh 框架支持 Web、命令行、桌面等六种入口,整套源码最近被开发者完整拆解。我们关心的是:中国大模型公司正在把战场从模型本身扩展到应用底座,这对开发者和企业 IT 选型有实质影响。
RTX 3090 跑通 489 步本地 Agent — 大模型不再是云端大厂特权
开源社区把阿里 Qwen 3 8B 小模型量化压缩,让它在一张 2020 年的 RTX 3090 消费级显卡上跑通了 489 步完整 Agent 工作流。本地跑 AI 智能体不再是技术幻想——这是中小企业 IT 预算第一次能承受的事。
DeepSeek 开源 Agent 框架一周实测:不是 Claude Code 平替,是可控的开源底座
DeepSeek 开源的 Agent 编程框架 Harness 一周拿下 9.5 万 Star,但实测开发者指出多数人卡在环境配置、任务拆解、插件选型与预期管理四个环节。它不是 Claude Code 的免费替代品,而是一块需要自己组装的开源底座。
OpenCode 被 DeepSeek 文件夹卡死 — AI 工具光环下的草台现实
开发者用 OpenCode 命令行版调用模型时工具卡死,最终定位是 DeepSeek CLI 安装时留下的文件夹形成符号链接死循环。这事值得关心:多款 AI 工具共存时,没人能预测会出现什么奇葩冲突。
DeepSeek 公开 Agent 架构秘密:本地和云端共享代码靠'换零件'
DeepSeek 在 GitHub 开源的 dsh 框架把 Agent 拆成定义、提供方、消费方三层。换一个'零件',代码就从本地工具变成云端沙箱。这不是炫技,是中国大模型公司在框架层的正经投入。
EvoX 测试中把准确率从 26% 提到 71%,组织效率正变得重要
EvoX 是 EvoMap 推出的桌面 Agent(能自主拆解并执行任务的 AI)产品,尝试用任务拆分、上下文隔离和程序汇合改善复杂任务交付。它值得关心,因为模型能力之外,协作架构可能同时影响准确率与成本。
6GB 显存想本地跑 AI 写代码 — 一位程序员的求助帖,揭开云订阅不说的成本
一位 Reddit 程序员求助:6GB 显存、64GB 内存想本地跑 AI 写代码、响应一分钟内。这道题藏着云订阅 vs 本地部署的真实成本账。
新手发帖问'有什么好模型值得等' — 我们替他盘了盘下半年的发布节奏
Reddit LocalLLaMA 版块一位新人问'有什么即将发布的模型值得关注',评论区没什么干货。这件事本身是个信号:开源社区对模型迭代的兴奋度在降温,大家更关心落地能力而非参数规模。我们替这位新手整理了头部厂商下半年的发布预期。