本周一篇在掘金流传的技术教程,用 Java 17 和大约 50 行代码,让 GPT-5 看图回答"这瓶能带上飞机吗"——我们注意到,这件事值得传统行业管理者留意:视觉 AI 的部署门槛,已经降到普通 IT 团队一周就能跑通 demo 的程度。
这是什么
教程本身并不神秘。技术上调用的是 OpenAI 的 Responses API(对话接口)—— 新版本支持把图片和文字放在同一条消息里送给模型,所以前端只需"用户问什么 + 传什么图",后端把两者打包发给 GPT-5 即可。同类教程的难度,大致相当于一个会写 Spring Boot(Java 后端框架)的初级工程师能在周末完成的项目。
真正值得记下来的,是教程作者刻意在提示词里加的一句话:「只回答图中可见事实;无法确认的规格请说未知。」这句话暴露了视觉问答(Visual Question Answering,即让模型根据图片回答问题)的真实短板:模型能"看见"瓶子,但未必"读得清"瓶子上的小字容量标识;它也不知道你想坐的那家航司的具体规定。
行业怎么看
乐观的一面:电商客服、保险定损、设备巡检、门店巡店这类"看图问事"的场景,过去要标注数据训专属模型(业内叫"垂直模型"),动辄几个月和几十万预算;现在一个普通 Java 团队就能搭起来试水。中小商家的运营成本,可能因此被改写。
但反对意见同样明确。视觉问答和更早的 OCR(把图上的文字读出来)都不是新鲜事物,两者长期存在两类典型错误:反光、遮挡、字体过小或图片被裁切时,模型会"看错"或"读错"。教程作者选择用提示词强行约束模型"承认不知道",说明在 GPT-5 这种顶级模型上,仍需要工程上的"防说谎"设计 —— 不能直接拿来上线对客户。值得警觉的是,新模型层出不穷,但教程刻意固定在 gpt-5 这一可核验的版本,正是为了规避"模型升级等同于可靠性升级"这种销售演示里反复出现的话术。
对普通人的影响
对企业 IT:客服、产品检验、门店巡店等需要"看一眼再回答"的场景,可以开始小规模试点;但要在流程里保留人工核验环节,绝不能让模型直接给客户最终答案。
对个人职场:会写代码的人多了一个明确可学的副业方向 —— 给中小商家做"看图问答"客服插件;不会写代码的运营、客服管理者,也该理解这套能力的边界,别被"AI 看图"四个字忽悠下单。
对消费市场:未来一年里,你发给电商客服的商品照片,可能越来越多是 AI 先看一眼、再转给人工;回复速度会变快,但遇到"能不能带上飞机"这种规则类问题,准确率未必比现在的人工高。