图像生成预训练也是视觉预训练
论文假设高质量生成器内部已经学习了边界、空间关系、尺度、材质、几何和语义。 因此,与其重新训练专用视觉理解模型,可以尝试通过 instruction-tuning 释放这些结构能力。
项目中的技术阅读笔记将论文 Image Generators are Generalist Vision Learners 概括为一个核心问题:强图像生成器是否已经学到足够丰富的视觉结构先验,并能通过轻量指令微调转化为通用视觉理解能力。
论文假设高质量生成器内部已经学习了边界、空间关系、尺度、材质、几何和语义。 因此,与其重新训练专用视觉理解模型,可以尝试通过 instruction-tuning 释放这些结构能力。
语义分割、实例分割、深度、surface normal 和指代表达分割,都被统一成“生成一张可解码结果图”。 关键接口是:输入图像 + 文本提示 -> 生成结果图 -> 后处理解码。
Vision Banana 支持自然语言、JSON、RGB tuple 或 hex color 指定目标和颜色。 迁移到医学时,这个自由提示需要变成受控医学术语、固定 palette 和可复现实验协议。
通俗地说,传统分割模型更像是在原图上做“逐像素判题”:这个像素是不是目标、属于哪一类。 Vision Banana 式方法更像是让图像生成器“按要求画出答案图”:把目标区域、实例、深度或法线画成指定颜色,再由程序解码。
本页面整理项目中对 GPT-Images-2 的多轮测试:自然人物图能生成轮廓很细的 RGB mask, 但医学图像中的结构配准和解剖真实性仍不满足严肃医学分割要求。
Vision Banana 的关键思想不是输出传统 logits,而是把视觉任务重新表达为图像生成任务: 输入图像与文本 prompt,输出可视化、可解码的 RGB 结构图。
利用图像生成预训练中已经学到的边界、几何、空间关系和语义结构,再通过指令微调释放密集预测能力。
语义分割、实例分割、深度、表面法线都可以被表达为一张 RGB 结果图,再由后处理解码为结构化结果。
通过文本指定目标和颜色 schema,例如 background = black、target = yellow,再做颜色投影和连通域分析。
医学任务必须额外处理目标不存在、3D 连续性、不确定性、颜色漂移和幻觉结构,不能只看可视效果。
以下图片均来自项目目录。页面刻意保留失败样例,因为它们决定了这个方向是否值得进入严肃医学研究。
这是自然人物任务的正向对照:原图和 GPT 输出均为 1254 x 1254。
mask 轮廓可用,后处理估计平移为 dx=-15px, dy=+50px,
对齐后能得到较干净的人物透明 PNG。
GPT-Images-2 生成的 mask 对人物轮廓和头发丝响应较好。主要问题不是轮廓,而是全局位置偏移。
自动估计偏移为 dx=-24px, dy=+52px。
这张图比前两个自然人物样例更难:手牌和前景牌子真实遮挡人物,完全排除道具反而不符合图像关系。
最终采用“包含前景遮挡物”的倒数第二版 mask,并重新估计偏移为 dx=-5px, dy=+25px。
结果可用于自然图验证,但已经显示出复杂前景下仍需人工判断和后处理。
输出看似医学结构,但并不是原片坐标上的严格分割。它更像生成了一条视觉上合理的脊柱形状, 这类差异在医学分割中不可接受。
相比 X 光,MRI 椎体块状结构更容易被捕捉。但实际 overlay 后,椎体边缘、底部结构和原片边界差异仍然明显, 不能作为医学分割结果。
normal-style 输出能增强椎体、椎间盘和椎管附近结构,但它不是物理 surface normal。 指定椎体 RGB 的版本是 GPT mask + GPT normal map 的后处理组合,不是一次纯 GPT 输出。
自然图像中的轮廓美观不等于医学任务可用。医学影像要求坐标、边界、结构存在性和不确定性都可验证。
GPT-Images-2 可以帮助快速观察 Vision Banana 范式,但零样本医学图像输出不能作为论文主结果。 若要深入研究,应将它转化为可复现的训练框架和定量评估协议。
目前结果适合作为前置可行性验证和失败模式记录,但还不足以支撑一篇完整医学影像论文。 若要进入正式研究,需要补齐以下关键证据。
当前主要是少量案例观察。论文级结论至少需要覆盖几十到几百张医学图像,并包含不同模态、质量和解剖变化。
医学分割必须与专家标注 mask 对比;没有 ground truth,就无法判断偏移、边界误差和结构缺失的真实严重程度。
需要 Dice、IoU、Hausdorff distance、边界误差、中心点偏移、颜色解码误差和失败率,而不只是视觉判断。
prompt、输出尺寸、RGB palette、阈值解码、连通域过滤和是否允许平移校正,都需要提前固定成可复现实验流程。
需要与传统医学分割模型、通用分割模型和生成式结构图方法比较,才能判断问题来自模型、prompt 还是范式本身。
目前已观察到全局偏移、局部形变、遮挡处理、生成式补全和医学结构幻觉,但还需要在数据集上统计频率与成因。
如果继续做论文,不应把当前结果包装成成功 demo,而应围绕失败模式提出严谨方法。
Vision Banana 项目页: vision-banana.github.io · 论文: Image Generators are Generalist Vision Learners