这是什么
这周一篇掘金教程详细拆解了 Google Gemini 多模态模型读发票的全过程:模型读图、Schema 抽字段、本地代码复算金额,三层把关后只进待审批队列、不自动打款。这件事值得关心,因为它示范了一个原则——AI 负责看,代码负责判,财务签字权不能交给大模型。
教程写得很直白:视觉模型在复杂版面下可能看错小数点、把折扣当费用,所以必须用 Pydantic Schema(一种强制规定数据字段和类型的工具)把字段锁死,再用高精度 Decimal 函数重算一遍。三层约束缺一不可。
行业怎么看
这种"AI 做感知、代码做决策"的模式,正在成为企业 AI 落地的共识架构。我们注意到,多家 RPA(机器人流程自动化)厂商和财务 SaaS 公司都在朝这个方向调整产品——AI 负责读单据、对票据,规则引擎负责判合规、控风险。
但反对意见也很清晰:首先,视觉模型在模糊、倾斜、低清票据上仍有"自信编造"的倾向,可能把折扣当费用、把税额看反;其次,国内多数企业的财务系统还不具备 Schema 强制约束能力,模型想"自由发挥"时没人拦得住;再者,伪造票据、重复报销这类业务漏洞,靠视觉模型根本防不住,必须叠加人工或系统层校验。
对普通人的影响
对企业 IT:可以照搬这套"输入校验—Schema 约束—规则重算—人工兜底"的四层架构去做自动化项目,比直接让 AI 端到端决策安全得多。
对个人职场:财务、行政、采购岗位短期不会被 AI 替代,但工作内容会从"自己填"变成"复核 AI 填的对不对"。
对消费市场:未来票据管理、差旅报销类工具会更普及、更便宜,但"完全无人审批"的承诺短期内还不可信。