Vision Banana 论文的核心思路

项目中的技术阅读笔记将论文 Image Generators are Generalist Vision Learners 概括为一个核心问题:强图像生成器是否已经学到足够丰富的视觉结构先验,并能通过轻量指令微调转化为通用视觉理解能力。

Idea 01

图像生成预训练也是视觉预训练

论文假设高质量生成器内部已经学习了边界、空间关系、尺度、材质、几何和语义。 因此,与其重新训练专用视觉理解模型,可以尝试通过 instruction-tuning 释放这些结构能力。

Idea 02

把视觉任务输出成 RGB 结构图

语义分割、实例分割、深度、surface normal 和指代表达分割,都被统一成“生成一张可解码结果图”。 关键接口是:输入图像 + 文本提示 -> 生成结果图 -> 后处理解码。

Idea 03

用自然语言和 schema 控制输出

Vision Banana 支持自然语言、JSON、RGB tuple 或 hex color 指定目标和颜色。 迁移到医学时,这个自由提示需要变成受控医学术语、固定 palette 和可复现实验协议。

它和其它图像分割模型的差别

通俗地说,传统分割模型更像是在原图上做“逐像素判题”:这个像素是不是目标、属于哪一类。 Vision Banana 式方法更像是让图像生成器“按要求画出答案图”:把目标区域、实例、深度或法线画成指定颜色,再由程序解码。

其它分割模型的典型实现 图像 -> 编码器提特征 -> 分割头输出概率图 -> 阈值/后处理得到 mask 核心是判别式预测:每个像素被分类,训练目标通常直接监督 logits 或 mask。
Vision Banana 论文启发的方法 图像 + prompt + 颜色 schema -> 生成 RGB 结构图 -> 解码得到 mask / depth / normal 核心是生成式预测:模型输出一张新的“答案图”,视觉任务被统一成图像生成任务。
维度
传统 / 现代分割模型
Vision Banana 式生成模型
模型接口
图像输入后由 segmentation head 或 mask decoder 输出 logits / mask。
图像和提示词作为条件,模型直接生成 RGB mask、深度图、normal map 等结构图。
输出形态
通常是类别概率、二值 mask、多类 mask 或实例 mask,偏工程张量接口。
输出是人可以直接审阅的图像,再通过颜色 codec、阈值和连通域分析解码。
任务边界
多数模型围绕分割本身优化;SAM/MedSAM/SAT/VISTA3D 等扩展了 promptable segmentation。
试图用同一个生成接口覆盖分割、几何、深度、surface normal、测量和不确定性图。
医学风险
强项是坐标注册、效率和可量化监督,但开放词汇、目标不存在和跨任务统一仍需设计。
强项是统一接口和生成式先验;风险是颜色漂移、整体偏移、局部形变和生成式幻觉。
研究价值
适合作为强基线,验证医学 image-mask 监督下的分割性能上限。
更适合研究“生成式预训练能否成为医学密集预测基础范式,以及何时失败”。

Vision Banana 思路在医学影像上的前置可行性验证

本页面整理项目中对 GPT-Images-2 的多轮测试:自然人物图能生成轮廓很细的 RGB mask, 但医学图像中的结构配准和解剖真实性仍不满足严肃医学分割要求。

自然人物图对齐后抠图预览
自然图:细轮廓可用,需整体配准
脊柱 X 光 GPT overlay 失败案例
X 光:生成结构无法严格注册
脊柱 MRI surface normal-style map
MRI:normal-style 可视化有研究价值
自然图像 可用但需配准 简单图 dx -15~-24px;复杂图约 dx -5px, dy +25px
X 光 失败 生成式幻觉和坐标漂移明显
MRI 分割 不达医学要求 椎体边界与原图差异过大
Surface Normal 可视化有价值 适合作为结构表征探索

论文方法如何被迁移到本项目

Vision Banana 的关键思想不是输出传统 logits,而是把视觉任务重新表达为图像生成任务: 输入图像与文本 prompt,输出可视化、可解码的 RGB 结构图。

01

图像生成器作为视觉学习器

利用图像生成预训练中已经学到的边界、几何、空间关系和语义结构,再通过指令微调释放密集预测能力。

02

视觉任务输出参数化为 RGB

语义分割、实例分割、深度、表面法线都可以被表达为一张 RGB 结果图,再由后处理解码为结构化结果。

03

Prompt + Palette Codec

通过文本指定目标和颜色 schema,例如 background = black、target = yellow,再做颜色投影和连通域分析。

04

医学场景增加可靠性约束

医学任务必须额外处理目标不存在、3D 连续性、不确定性、颜色漂移和幻觉结构,不能只看可视效果。

医学图像
Prompt / RGB Schema
GPT-Images-2 结构图
解码与评估

测试图片与结果

以下图片均来自项目目录。页面刻意保留失败样例,因为它们决定了这个方向是否值得进入严肃医学研究。

Case A

自然人物图 baby_1254.png:简单背景下可稳定抠出人物

baby_1254 原图
原图
baby_1254 对齐后的 RGB mask
RGB mask,对齐后
baby_1254 透明背景抠图预览
透明背景校验

这是自然人物任务的正向对照:原图和 GPT 输出均为 1254 x 1254。 mask 轮廓可用,后处理估计平移为 dx=-15px, dy=+50px, 对齐后能得到较干净的人物透明 PNG。

Case B

自然人物图 baby2_1254.png:轮廓能力强,但整体偏移

室内宝宝原图
原图
对齐后的宝宝 RGB mask
RGB mask,对齐后
baby2_1254 透明背景抠图预览
透明背景校验

GPT-Images-2 生成的 mask 对人物轮廓和头发丝响应较好。主要问题不是轮廓,而是全局位置偏移。 自动估计偏移为 dx=-24px, dy=+52px

Case C

复杂生日场景 baby2_1254.jpg:遮挡道具需要保留,偏移需重新估计

baby2_1254 JPG 复杂生日场景原图
原图
baby2_1254 JPG 对齐后的 RGB mask
RGB mask,对齐后
baby2_1254 JPG 对齐后透明背景抠图预览
透明背景校验

这张图比前两个自然人物样例更难:手牌和前景牌子真实遮挡人物,完全排除道具反而不符合图像关系。 最终采用“包含前景遮挡物”的倒数第二版 mask,并重新估计偏移为 dx=-5px, dy=+25px。 结果可用于自然图验证,但已经显示出复杂前景下仍需人工判断和后处理。

Case D

脊柱 X 光:不满足坐标注册要求

脊柱 X 光原图
原图
GPT 生成的脊柱 X 光 overlay
GPT overlay

输出看似医学结构,但并不是原片坐标上的严格分割。它更像生成了一条视觉上合理的脊柱形状, 这类差异在医学分割中不可接受。

Case E

脊柱 MRI RGB mask:能识别椎体,但边界不可用

脊柱 MRI 原图
MRI 原图
脊柱 MRI RGB mask overlay
GPT mask overlay

相比 X 光,MRI 椎体块状结构更容易被捕捉。但实际 overlay 后,椎体边缘、底部结构和原片边界差异仍然明显, 不能作为医学分割结果。

Case F

Surface Normal-style map:结构增强,而非真值

GPT surface normal-style map
Normal-style map
指定 RGB palette 的 normal-style 后处理图
Palette + normal-style

normal-style 输出能增强椎体、椎间盘和椎管附近结构,但它不是物理 surface normal。 指定椎体 RGB 的版本是 GPT mask + GPT normal map 的后处理组合,不是一次纯 GPT 输出。

为什么医学图像结论更保守

自然图像中的轮廓美观不等于医学任务可用。医学影像要求坐标、边界、结构存在性和不确定性都可验证。

医学不可接受的误差

  • 结构整体错位,无法通过简单肉眼判断修复。
  • 生成合理但不存在的解剖结构。
  • 椎体边界被平滑、概括或重绘。
  • 输出颜色不是严格 palette,需要投影和阈值解码。

本项目的阶段性判断

GPT-Images-2 可以帮助快速观察 Vision Banana 范式,但零样本医学图像输出不能作为论文主结果。 若要深入研究,应将它转化为可复现的训练框架和定量评估协议。

定性评分

自然人物轮廓较好
X 光注册失败
MRI 椎体识别部分可见
临床可用性不足

当前不足:为什么还不够写成完整论文

目前结果适合作为前置可行性验证和失败模式记录,但还不足以支撑一篇完整医学影像论文。 若要进入正式研究,需要补齐以下关键证据。

样本规模不足

当前主要是少量案例观察。论文级结论至少需要覆盖几十到几百张医学图像,并包含不同模态、质量和解剖变化。

缺少专家真值标注

医学分割必须与专家标注 mask 对比;没有 ground truth,就无法判断偏移、边界误差和结构缺失的真实严重程度。

缺少定量指标

需要 Dice、IoU、Hausdorff distance、边界误差、中心点偏移、颜色解码误差和失败率,而不只是视觉判断。

实验协议尚未固定

prompt、输出尺寸、RGB palette、阈值解码、连通域过滤和是否允许平移校正,都需要提前固定成可复现实验流程。

缺少基线方法对比

需要与传统医学分割模型、通用分割模型和生成式结构图方法比较,才能判断问题来自模型、prompt 还是范式本身。

失败模式需要系统统计

目前已观察到全局偏移、局部形变、遮挡处理、生成式补全和医学结构幻觉,但还需要在数据集上统计频率与成因。

后续研究方向

如果继续做论文,不应把当前结果包装成成功 demo,而应围绕失败模式提出严谨方法。

医学域指令微调

使用真实医学 image-mask 数据训练生成式结构图输出,而不是直接依赖通用模型零样本能力。

可解码 RGB codec

加入 palette regularization、颜色投影、连通域和不确定区域标记,避免颜色漂移影响 mask。

3D 一致性

从 2D slice 扩展到 2.5D、tri-plane 或 3D volume,约束相邻切片之间的结构连续性。

目标不存在与不确定性

显式训练 empty mask、p_exist 和采样不确定性,减少医学场景最危险的假阳性结构。

参考资料

Vision Banana 项目页: vision-banana.github.io · 论文: Image Generators are Generalist Vision Learners