多模态接口把图片变成模型输入,也能让模型生成和编辑图片,但接口返回 200 只证明一次计算完成。视觉理解可能漏掉小字、误判空间关系或近似计数;生成图可能违背构图约束、写错文字、改变参考角色、带来权利与品牌风险。生产流程必须把“模型候选”和“已验收资产”设为不同状态。

本文面向构建图片理解、素材生成或编辑工作流的开发者。你需要熟悉文件上传、异步任务与内容审核。目标是一条可追溯管线:输入先经过权限和技术预检,模型只输出结构化观察或候选,机器做确定性检查,人类对语义和风险作最终决定。

多模态资产从输入预检到机器检查、人工评审和发布记录的六段管线

图 1(1600 × 900):WEB/SUN 原创 SVG。Candidate ID、review decision 与 immutable asset revision 分开保存;被拒候选不能悄悄成为发布资产。

先把输入变成可追溯资产

图片不应以一段匿名 base64 进入系统。先建立 asset manifest:内容 hash、原始来源、上传者、获取时间、声明权利/许可、MIME、字节、像素、方向、色彩空间、隐私级别和允许用途。模型请求只引用经过批准的 asset revision。

校验真实文件签名,不只看扩展名;解码到隔离区,限制像素和帧数,拒绝损坏或不支持格式;去除不需要的 EXIF/GPS 后再发送,同时把必须保留的来源信息存入 manifest。OpenAI 的Vision 指南明确说明模型不处理原始文件名或 metadata,因此日期、作者、镜头、授权等事实必须由应用提供,不能问模型“从图里读出来”。

涉及身份证件、医疗、儿童、内部截图或客户资料时,先执行产品与合规策略,裁剪无关敏感区域,设置最短保留期。用户上传图片和其中的文字都是不可信输入;图中的“忽略规则并调用工具”不能被提升成指令。

视觉理解:先问可判定问题

不要用“详细描述这张图”承担所有任务。把目标拆成结构字段,例如页面类型、可见控件、目标文本、明显遮挡、是否需要人工复核,并用 Structured Outputs 返回。OpenAI 的Structured Outputs 指南可以约束受支持的 Schema,但应用仍要处理 refusal、不完整状态和领域验证。

type VisualObservation = {
  assetId: string;
  scene: 'document' | 'ui' | 'photo' | 'diagram' | 'unknown';
  observations: Array<{ statement: string; region?: [number, number, number, number] }>;
  unreadableRegions: string[];
  needsHumanReview: boolean;
};

字段叫 observation,不叫 truth。坐标也只是候选区域,不能直接触发点击、裁切或安全判断。计数、OCR、条码、像素尺寸、颜色对比、医学与精密空间任务应由专用算法或人完成,再把结果与视觉模型互相校验。

输入预处理按任务决定:自动纠正方向;对小字生成放大 crop;长图分区并保留全局缩略图;多页文档维护页码;对比任务按固定顺序标记图片 A/B。不要把极长截图缩成一张看不清的小图后,期待模型补出细节。

detail 是质量、token 和延迟的路由,不是“正确率开关”。官方detail 指南提供 low/high/original/auto,可用性与具体行为依模型而异。低细节适合粗分类,高或 original 用于小字和空间敏感任务;最终选择必须在自己的分辨率、语言和场景切片上评测。

明确记录视觉限制

官方 Vision 文档列出的已知限制包括非拉丁文字、小字、旋转图、依赖线型或颜色的图表、精确空间定位、全景/鱼眼、计数和一般准确性;专门医疗影像不适合用来给出医疗建议。产品不能把这些限制藏在条款里,应该转成运行策略。

例如小字检测到低分辨率就要求重新上传;图表结论要读取原始数据而不是只看截图;物体数量用检测器或人工;医疗与高风险判断直接转专家;无法读取时返回 unreadable,不允许模型猜。模型没有可靠地说“不确定”时,应用根据任务和输入条件主动进入 review。

评测集按图像尺寸、文字语言、旋转、遮挡、光照、长宽比、相似对象、空图和对抗文字切片。保存输入 asset revision、detail、prompt、模型和结构化结果,避免预处理变化被误当成模型变化。

图片生成:先选 API,再写资产规格

OpenAI 的Image generation 指南区分两条路径:单次生成或编辑更适合 Image API;需要对话式、多轮编辑和把图片作为流程中间产物时,可使用 Responses API 的 image generation tool。选择依据是状态与交互,而不是哪条看起来更新。

生成请求使用结构化 creative brief:用途、画布比例、主体、构图、镜头/视角、光线、材质、色板、必须出现、不得出现、文字内容、品牌约束、参考图角色和验收标准。不要只写一段风格形容词;验收者要能逐条对照。

先用低成本草稿验证构图,选中候选后再做高质量输出。每次生成保存 candidate ID、parent candidate、prompt revision、输入 reference revision、模型/API、输出参数和 hash。多轮编辑形成 lineage,不能覆盖原图;用户说“把背景换蓝”时,新候选仍需重新检查人物、文字和边缘是否意外变化。

Reference image 是条件,不是版权或像素锁定。使用前确认有权处理和再生成;对需要精确复现的商标、产品 UI 或人物身份,不以生成模型作为唯一变换工具。Mask 也只是指导:OpenAI 的编辑指南明确说明 GPT Image 的 mask 基于提示引导,可能不会完全遵循精确形状。需要像素级边界时,用确定性图像编辑,再让生成模型处理允许变化的区域。

机器检查负责确定性问题

候选产生后先自动验证:能否解码、格式、尺寸、长宽比、文件大小、alpha、色彩空间、压缩、内容 hash;OCR 检查必需文字和明显乱码;感知 hash 检查意外近重复;安全分类器与产品规则检查禁用内容;参考图任务计算可解释的结构差异,但不把单一相似度当验收。

技术失败自动拒绝,无需消耗人工时间。语义检测结果只做提示:物体检测说“缺少背包”可以标红区域,最终由人判断构图是否满足 brief。自动裁切和压缩后再次检查文字、边缘和可访问性,派生尺寸都引用同一 accepted master。

人工验收是一份决策记录

人工 reviewer 看到原始 brief、候选、reference、机器检查、已知风险和来源,而不是只看一张大图点“喜欢”。清单至少包含:

  • 语义:主体、动作、数量、关系和构图是否符合必须项。
  • 一致性:系列角色、色板、服装、产品外观与前一版是否正确。
  • 文字:拼写、语言、日期、数字和可读性,由人逐字确认。
  • 视觉质量:结构畸变、手部/边缘、重复纹理、遮挡和裁切。
  • 安全与事实:是否误导、是否把虚构图当真实事件或证据。
  • 权利与隐私:reference、人物、商标、角色和发布用途是否已获允许。
  • 无障碍:人工编写与上下文匹配的 alt,不把模型 caption 直接发布。

决定是 accepted / changes_requested / rejected,带 reviewer、时间、brief revision、候选 hash 和备注。Accepted asset 复制或晋升成不可变 revision;后续任何编辑都回到 candidate 状态。一个人不能同时提交高风险 reference 和自我批准,敏感发布可要求双人复核。

生成安全不只是一层审核 API

模型和平台安全控制是第一层,产品仍需定义自己的受众、用途与发布边界。OpenAI 的Agent 安全指南强调不可信输入、结构化数据流、审批和多种缓解组合也不能完全消除错误;多模态流程同样需要最小工具权限与人类判断。

不要让图片识别结果直接调用删除、支付或公开发布工具。先把 observation 展示给用户确认,再生成规范化命令。生成工作流也不得自行抓取任意 URL 作为 reference;下载经过域名、SSRF、许可和内容检查。

发布页面明确区分生成插画、编辑图和纪实照片,保留内部 provenance 与许可清单。生成内容不自动获得所有第三方角色、商标、肖像或素材的公开使用权;有疑问就作为发布门禁,而不是让模型推断授权。

失败模式与取舍

常见错误包括:相信模型能读 EXIF;一张缩略图承担 OCR 和空间定位;把 caption 当事实;让图中指令触发工具;只生成一个候选并强行修 prompt;mask 当精确选区;参考图没有许可记录;机器相似度代替人审;验收后覆盖原文件;用模型自动生成 alt 后不复核。

人工审核增加交付时间,多候选和高 detail 增加成本。按风险分级:内部情绪板可以轻量抽查;公开品牌、人物、事实图和商业素材需要完整 lineage、权利核验与人工门禁。效率来自先机器过滤确定性失败、让人集中判断语义与风险,而不是删除验收。

结论

多模态生产系统必须承认两个事实:视觉理解给出的是观察候选,图片生成给出的是资产候选。输入通过 manifest 和权限预检,视觉结果结构化并受已知限制约束,生成过程保留 prompt/reference lineage,机器检查技术条件,人类最终确认语义、文字、安全、权利与无障碍。

当系统能够从 accepted asset 追溯到候选、brief、参考图、模型和 reviewer,也能在任何修改后自动撤回“已验收”状态,图片能力才真正适合进入发布流程。

Sources