返回首页

DGX Spark

找到 8 篇关于此标签的文章

DeepSeekNVIDIA

DeepSeek 在两台几万元小机器上跑出 67 token/s — 本地大模型门槛正在塌方

本周一位 Reddit 用户用两台 NVIDIA DGX Spark 工作站(约 6 万元)跑出 DeepSeek V4 Flash 67-84 token/s 的稳定输出,配 100 万 token 上下文。我们关心的是这份民间复刻印证了一个被低估的趋势:开源大模型本地部署的成本正在快速下沉,企业

2h ago2 分钟
NVIDIADGX Spark

把 AI 思考深度拉满反而更差 — DGX Spark 本地实测给企业的提醒

一位 Reddit 开发者用四台 NVIDIA DGX Spark 桌面工作站实测 DeepSeek、Qwen 多款模型,发现「深度思考」模式反而让得分下降、耗时翻倍。这对花钱买 AI 推理服务的企业是直接的成本提醒。

12h ago2 分钟
QwenNVIDIA

双 DGX Spark 跑 181 tok/s 并发 — 本地多 Agent 这次能用了

海外工程师用 2 台英伟达 DGX Spark 桌面超算,搭载 Qwen 系列开源模型,并发跑出 181 token/秒,同时撑起 9 个 AI Agent。对企业的意思是:本地多 Agent 部署从'展示'走向'干活'。

1d ago2 分钟
DeepSeekQwen

DeepSeek 当主脑、Qwen 做副手 — 中国开源大模型开始被分工使用

一名开发者把 DeepSeek V4、Qwen 3.8 Flash、GLM 5.3 Flash 三款中国开源大模型塞进 4 张 DGX Spark 本地推理卡跑实测,GLM 5.3 Flash 因太啰嗦、速度仅 22 tok/s 被淘汰,最终让 DeepSeek 扛主力、Qwen 当副手。这反映中国

2d ago2 分钟
inclusionAILing

1240 亿参数模型在桌面机上稳定跑了 7 分钟 — 本地 AI 跨过能用的门槛

本周 Reddit 一项测试显示,1240 亿参数的 Ling 模型在单台 NVIDIA DGX Spark 桌面机上连续生成 1.5 万 token,全程解码速度稳定在 35.7 token/s。值得关心的是:本地大模型正从极客玩具变成企业可认真评估的部署选项。

Aug 132 分钟
inclusionAILing-3.0-flash

两个开关让小模型吞吐近翻倍 — 但隐藏的兼容陷阱比速度更值得警惕

inclusionAI 的 Ling-3.0-flash INT4 模型在 DGX Spark 上仅靠两项配置变更,生成速度从 20.8 提升到 38.7 token/秒。但默认 vLLM 缺少 V3 架构支持,会输出看似正常实则错误的文本。对本地部署和选型的团队而言,这是个隐蔽的工程雷区。

Aug 92 分钟
NvidiaDGX Spark

16台Nvidia超算拼成集群跑通大模型 — 企业自建算力的焦点正转向显存

Reddit用户用16台Nvidia DGX Spark搭成集群跑通434GB大模型,验证了统一内存的实用价值。大模型推理瓶颈正从算力转向显存,企业自建本地算力有了新思路。

May 12 分钟
Gemma 4vLLM

在 vLLM 上运行 Gemma 4 26B-A4B:社区故障排查笔记

开发者报告在 vLLM 上部署 Gemma 4 26B-A4B 结果不一,DGX Spark GB10 上的 INT4 量化版本速度过慢。

Apr 62 分钟