多模态
找到 11 篇关于此标签的文章
DeepSeek V4 视觉版迟迟不发权重 — 中国开源 AI 的「狼来了」焦虑
曾凭 V3 与 R1 开放下载改写行业规则的 DeepSeek,这次在 V4 视觉版(能看图的多模态模型)的权重开放上没了动静。本地 AI 社区开始催问,背后真正的疑问是:中国开源大模型的领先窗口还能撑多久。
DeepSeek 上线识图能力,价格国产最低 — 但复刻页面实测不如 K3
DeepSeek 发布首个官方多模态实验模型 deepseek-v4-flash-vision-exp,百万 token 输入最低 0.05 元,价格仍是国产最低档。补齐 Agent 生态短板,但前端复刻实测弱于 K3。
DeepSeek 把识图做成 Flash 同价 — 开源阵营终于有一张能打的视觉牌
DeepSeek 8 月 21 日上线视觉版 deepseek-v4-flash-vision-exp,与纯文本 Flash 同价。这是国产大模型第一次把「看图」做到和「读字」一样的成本,也是 Claude Code 生态首次不用为识图额外付费。
DeepSeek 终于能看图,多模态接近 Opus-4.8 但价格没涨
DeepSeek 上线首个视觉模型 V4-Flash-Vision-Exp,多模态 Agent(能自主完成多步任务的 AI)能力官方称接近 Opus-4.8,但 API 价格与纯文本版相同。这是中国大模型第一次在多模态实用环节摸到第一梯队门口。
医院、工厂的 AI 训练数据不用搬家了 — NVIDIA 把联邦学习做进多模态
联邦学习(数据不出本地、联合训练 AI)过去主要跑在结构化数据上。NVIDIA FLARE 现在支持视觉语言模型,意味着医院影像、工厂巡检图也能在不集中的前提下协同训练。这是合规行业的解药,但落地复杂度不低。
通义千问 Qwen 在图片识别上败给 Muse Glimmer:护城河开始松了?
一位 Reddit 开发者在 LocalLLaMA 论坛发起图片识别对比测试,把 Muse Glimmer 30B 和通义千问 Qwen 3.8 27B 并排跑。结果:Qwen 在 OCR 和图文关系上接连失守,Muse Glimmer 三项全胜。虽是个别用户的非正式测试,但把 Qwen 在多模态上
本地 AI 视觉模型能读电表了:社区土办法测试比厂商刷榜更说明问题
本地部署的开源视觉模型开始能识别电表读数这类真实场景。一位开发者把电表照片发到 AI 社区,让网友用自己电脑上的模型测试。社区这种「随手测试」正在变成检验 AI 落地能力的另一种方式。
阿里千问把多模态重新定义 — 从能看懂到能干活的转向已经开始
阿里千问本周直播把主题定为 Agent First,把多模态从「能看图」重新定义为「能干活」。这是国内大厂第一次在产品叙事上明确跟进全球大模型公司的 Agent 转向,值得关注。
DeepSeek 终于能看图了 — 但靠开源社区拼凑,不是自家
DeepSeek 便宜但'看不见',开源社区用一个 Skill(功能插件)把它和识图模型拼起来,让纯文本模型也能读截图。每次两分钱,新用户有 100 万 Token 免费额度。事件小,但折射出大模型行业越来越像'乐高':靠组合补短板。
AI 改造职场渗透率三年冲到 97%,但代理型项目失败率超过 40%
IDC 预测 2029 年中国 AI 终端渗透率逼近 97%,但 Gartner 同时警告 40% 的代理型 AI 项目将被取消。我们关心的是:渗透率数字背后,真正被改造的不是「有没有 AI」,而是「哪些岗位、哪些环节」——这个分化才决定普通人的饭碗。
DeepSeek 多模态灰度测试 — 秒出识别但色盲卡全败,编程场景最受益
DeepSeek 灰度上线多模态,OCR 和图表识别速度极快,但色盲卡两种模式均失败,暴露视觉感知短板。对编程场景意义最大,图转 HTML 已可用但细节不及 Gemini。