返回首页

视觉模型

找到 5 篇关于此标签的文章

DeepSeekHarness

DeepSeek 给开源工具加视觉理解 — 中国 AI 正在追 MCP 这套国际标准

DeepSeek 这周把开源工具 Harness 升级到 v0.1.1,主线变化是支持图像理解,并接入 MCP 协议(AI 调用外部工具的国际通用标准)。值得关注的是:中国大模型公司开始主动对齐西方主导的开发生态。

Aug 212 分钟
DeepSeek视觉模型

发票合同拍张照就能转成文字 — DeepSeek 这个国产读图 AI 怎么接

DeepSeek 上线了一个能「看图」的模型 v4-flash-vision-exp,发张图片它就能读出文字、识别内容。副业做账、合同归档、产品图描述都能用,按张计费大约 0.1-0.3 元,微信就能付。

Aug 212 分钟
DeepSeekV4-Flash-Vision-Exp

DeepSeek V4 视觉版在 Reddit 露脸 — 但先别急着兴奋

DeepSeek 似乎在测试带视觉能力的 V4 轻量版,但消息源仅是一条 Reddit 帖子。值得关心的是:DeepSeek 每次风吹草动都会牵动市场神经,但这次证据等级偏低。

Aug 212 分钟
Liquid AILFM2.5-VL-3B

Liquid AI 把 2GB 视觉模型塞进手机 — 本地 AI 终于能告诉'这是什么、它在哪'

Liquid AI 发布 LFM2.5-VL-3B,仅 2GB、3.1B 参数的视觉-语言模型,已在 iPhone 17 上本地跑通。更值得关注的是它在 ScreenSpot-v2 桌面测试从 6 分跃到 78.7 分——物体定位能力的大幅提升,意味着本地小模型开始真正'看懂'画面,而不只是描述。

Aug 122 分钟
QwenGemma

Qwen 3.6 跑分赢实测输 — 刷榜正在扭曲大模型能力认知

开发者实测 Qwen 3.6 与 Gemma 4,发现跑分领先的 Qwen 因死循环烧掉 8000+ Token 在真实任务中落败。大模型刷榜正扭曲能力认知,企业选型需从看榜单转向做实测。

May 22 分钟