我们注意到 vivo BlueImage Lab 这周在 CVPR 2026 交了一份答卷:发布 VINS-120K——业内首个面向 4K 图像的指令编辑数据集,含 12 万组精挑细选的高清三元组(编辑指令-原图-成图),并配套让现有 AI 模型无损迁移到超清场景的训练方法。

这是什么

主流 AI 编辑模型多在 1024 像素以下工作,但手机拍的照片已是 4K 起步。直接喂 4K,结构会塌、语义会跑偏;常规做法是"缩小→编辑→放大",问题在于缩小那一步丢掉的高频信息(纹理、毛发、边缘),后面很难真补回来。 vivo 的解法分两块。数据:VINS-120K 含 12 万组 4K 三元组,平均分辨率 4656×4138,由 2.5 万组原生超清视频帧 + 9.5 万组外部数据组成,用视觉语言模型(VLM,能看图也能读文字的多模态 AI)Gemini-2.5-Pro 做结构化标注,最后只留前 20% 质量过线样本。方法:高频感知后适配——不动模型底座,只叠两步修正(注意力分数重缩放 + RoPE 重缩放,即重新调整 AI 内部"注意力分布"与"位置编码"的参数),再加一层频域监督。配套 VINS-4KEval 含 509 个 4K 样本,专门衡量"既改得对,又保得住细节"。

行业怎么看

结果站得住:基于开源 Flux.1-Kontext 适配后,pFID(衡量生成图与真实图分布距离的指标,越低越好)从 12.66 降到 9.15,明显优于其他开源方案;与字节闭源 Seedream 4.0 比,pFID 也更优(9.15 vs 12.82)。在阿里 QwenImage-Edit 上同样可迁移(18.33 降到 11.38),方法不绑 vivo 自家模型。 但冷静的声音有三条。编辑能力分数上 Seedream 4.0 仍领先——vivo 赢在"细节保真",输在"听话程度"。手机厂发论文越来越多,但研究产出能否转化为用户感知的"相册 P 图变好",中间还隔着工程化、产品化几道坎。12 万组样本构建大量依赖 Gemini-2.5-Pro 自动标注,质量上限取决于 VLM 自身判断力——这是当前所有 AI 数据集共有的隐性依赖。 值得关注的是 vivo 把这件事放到 CVPR 而非行业展会——这是手机厂在学术圈争夺"影像 AI 定义权"的信号,从拼像素、拼镜头升级到拼论文和数据集。

对普通人的影响

- 对企业 IT:涉及图片处理流水线的内容平台(电商、影楼、设计 SaaS,即在线订阅工具)可关注——这套方法开源后,对已有工具做一次"适配升级"就能提升超清输出质量。 - 对个人职场:摄影师、视觉设计师、自媒体创作者是直接受益者。修 4K 素材时"缩小-编辑-放大"导致的纹理损失,未来几个月可能在工具里被缓解。 - 对消费市场:vivo 用户最先感知——下一代 X 系列旗舰的相册 AI 编辑大概率会把这套能力落到端侧(设备本地运行)。其他厂商会跟进,2026 年影像发布会"超清 AI 编辑不掉画质"将成为新的卖点关键词。