【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准

发布时间:2026/9/25 8:31:53

【论文学习】MICCAI 2025 || Gut-VLM:面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准
Gut-VLMHallucination-Aware Multimodal Benchmark for Gastrointestinal Image Analysis with Large Vision-Language ModelsMICCAI 2025Gut-VLM面向大型视觉语言模型胃肠道图像分析的幻觉感知多模态基准构建一个同时保留“模型错误报告、错误位置标签和专家修正报告”的胃肠镜图文数据集并让视觉语言模型学习发现和纠正自己的幻觉。幻觉是指模型生成的描述看起来合理但与图像中的真实医学内容不一致。例如一张正常幽门图像模型可能生成图像中央存在红色异常。但医学专家查看图像后认为没有这种异常这句话就是幻觉。医学场景下这种错误尤其危险因为模型可能声称存在实际上不存在的息肉把正常组织描述为炎症错误描述病灶颜色或位置错误判断是否出血、感染错误描述异物或医疗器械。Gut-VLM数据集怎么构建论文使用 Kvasir-v2 胃肠镜数据集中的图像共标注了1816张第一阶段GPT-4o生成报告先让 GPT-4 Omni 根据每张胃肠镜图像生成诊断性描述。提示词要求报告覆盖12个医学问题包括解剖部位解剖标志物的颜色和位置异常区域的颜色和位置息肉数量是否存在炎症是否出血是否存在异物是否感染是否存在医疗器械。得到的是未经审核的模型报告其中可能同时包含正确句子和错误句子第二阶段专家识别和纠正幻觉4名胃肠科专家逐句审查GPT-4o报告。每个句子被标记为Non-hallucinated与图像一致Hallucinated包含与图像不一致的信息对于错误句子专家还需要提供正确版本。最终每张图像可能包含胃肠镜图像 ├── GPT-4o原始报告 ├── 每句话的幻觉标签 ├── 专家修正后的句子 └── 完整的专家修正报告论文发现GPT-4o生成的报告中只有30.39%的报告完全正确1.70%的报告所有句子都包含幻觉67.84%的报告同时包含正确句子和错误句子。也就是说接近70%的报告属于这种情况一部分内容正确 一部分内容错误这比整段报告完全错误更符合真实风险。因为混合型错误看起来更可信也更难检测。幻觉感知微调方法论文比较了两种训练方式普通微调普通方法只给模型看输入医学图像 目标专家修正后的正确报告模型只学习“正确答案是什么”不知道原模型曾经犯了什么错误。幻觉感知微调作者提出的方法输入医学图像 GPT生成的错误报告要求模型分两步输出第一步找出哪些句子存在幻觉 第二步把错误报告修正为正确报告。模型不仅要学习正确答案还要学习错误模式以及如何纠正错误测试了4个开源视觉语言模型LLaVA-1.6-7BQwen2-7BDeepSeek-7B-VLmPLUG-Owl-2B。训练设置Rank-8 LoRA训练5轮batch size 8学习率 (1x10^{-4})A100 GPU。比较三种模型Pretrained未经微调Finetuned普通正确报告微调Finetuned-H幻觉感知微调摘要视觉语言模型Vision-Language ModelsVLMs在医学领域正变得越来越普及它们能够弥合医学图像与临床语言之间的差距。现有VLM在理解医学图像和文本查询并生成详细的描述性医学诊断报告方面展现出了出色的能力。然而幻觉问题仍然是VLM面临的一项重要挑战。这里的“幻觉”是指模型生成与图像视觉内容不一致的描述。这一问题在医学领域可能造成尤为严重的后果。为了促进胃肠道GastrointestinalGI图像分析领域的VLM研究并深入研究模型幻觉问题我们构建了一个胃肠道图像—文本多模态数据集——Gut-VLM。该数据集通过一个两阶段流程构建。首先使用ChatGPT为Kvasir-v2数据集中的图像生成描述性医学报告。在这一过程中ChatGPT会产生一些带有幻觉或错误内容的文本。随后在第二阶段由医学专家对这些报告进行系统审查识别并纠正其中可能存在的不准确信息从而保证数据标注具有较高的质量和临床可靠性。与仅包含描述性文本的传统数据集不同Gut-VLM还提供了用于标识幻觉句子的标签以及这些错误句子所对应的修正内容。减少VLM幻觉的一种常见方法是在小规模、特定任务的数据集上对模型进行微调。然而我们利用所构建的数据集采取了一种不同的策略。我们并非仅仅对VLM进行微调使其生成医学文本报告而是训练模型检测并纠正幻觉。我们将这种方法称为“幻觉感知微调”hallucination-aware finetuning。实验结果表明与仅针对描述性报告生成进行微调相比幻觉感知微调能够取得更好的效果。此外我们还使用多种评价指标对多个当前先进的视觉语言模型进行了全面评估从而建立了一个相应的评测基准。GitHub代码仓库bhattarailab/Hallucination-Aware-VLM图一图1上图数据标注流程概览下图[左]来自Gut- VLM 的数据样本根据提示中提出的问题描述了底层条件展示了幻觉文本红色与修正后的文本绿色[右]该数据集中ChatGPT-4 Omni生成响应的统计结果。上半部分数据标注流程Kvasir-v2胃肠镜图像 医学提示词 ↓ GPT-4o生成报告 ↓ 得到可能含幻觉的描述 ↓ 胃肠科专家逐句检查 ↓ 修正后的报告 ↓ AI提取结构化诊断问答 ↓ 人工再次检查 ↓ 最终诊断问答标注左下部分一个具体错误案例图像是一张正常盲肠胃肠镜图像 提示词是请用一段文字描述该图像并回答下面列出的所有问题 GPT-4o原始输出这是一张正常盲肠的图像。图像中央存在一个小息肉颜色偏黄。解剖标志物为结肠内壁主要呈粉红色。没有观察到炎症、出血、感染、异物或医疗器械。其中红色文字是幻觉图像中央存在一个黄色的小息肉 但图像中实际上没有息肉。GPT-4o把正常的阑尾开口错误识别成了息肉。另一个错误是解剖标志物是结肠内壁主要呈粉红色 专家认为这里的解剖标志物描述不准确专家修正后的报告这是一张正常盲肠的图像。图像中央可见颜色偏黄的阑尾开口。该图像的解剖标志物是盲肠。未观察到炎症、出血、感染或异物也未发现医疗器械。图像中不存在息肉。中下部分12个诊断问题GPT-4o生成报告时需要覆盖12个问题主要包括图像属于哪一种解剖结构图像中是否存在解剖标志物解剖标志物是什么颜色图像中是否存在异常如果存在异常异常是什么颜色异常位于图像中的什么位置是否存在息肉如果有有多少个是否存在医疗器械如果有在哪里、有多少个是否存在炎症是否存在出血是否存在异物是否存在感染因此它不是让GPT-4o自由描述而是用固定问题约束报告内容。右上部分报告级统计数据集中共有1816份GPT-4o报告。报告类型数量比例含义All correct55230.39%所有句子均正确Hallucinated32约1.76%所有句子都包含幻觉Mixed Responses123267.84%同时包含正确和错误句子重要的发现只有约30%的报告完全正确约68%的报告是“正确信息与错误信息混合”。混合型错误最危险因为整篇报告不是明显胡说而是大部分内容正确 少数医学事实错误右下部分不同医学属性的准确率柱状图表示GPT-4o在不同类型问题上的准确率大致为解剖类别约50%最低异常或解剖标志物的颜色约85%位置约90%医学表现如炎症、出血、感染约90%息肉数量约80%。这说明错误不是均匀分布的GPT-4o对颜色、位置和部分医学表现判断较好但对具体解剖类别的识别明显较差。

相关新闻

新疆宣传片

新疆宣传片

2026/8/21 1:40:09

新疆国隆映像文化传媒有限公司,简称 国隆映像传媒,是一家扎根乌鲁木齐、面向全疆及全国客户提供影像内容解决方案的传媒机构。公司成立以来,始终以 “创意 执行 传播” 为核心能力,为政府机构、企事业单位、品牌客户及社会组织提…

无人便利店AI运维崩溃实录(内部故障日志首次公开):从边缘推理延迟到多模态感知漂移的8小时应急修复全流程

无人便利店AI运维崩溃实录(内部故障日志首次公开):从边缘推理延迟到多模态感知漂移的8小时应急修复全流程

2026/9/24 18:59:09

更多请点击: https://codechina.net 第一章:无人便利店AI运维崩溃实录(内部故障日志首次公开):从边缘推理延迟到多模态感知漂移的8小时应急修复全流程 凌晨2:17,华东某城市37号无人便利店监控系统触发红色…

为什么你的AI助手越用越忙?深度拆解时间算法偏差与认知负荷失衡,立即优化

为什么你的AI助手越用越忙?深度拆解时间算法偏差与认知负荷失衡,立即优化

2026/9/24 5:14:11

更多请点击: https://intelliparadigm.com 第一章:AI时间管理的本质困境与认知重构 当人们将日程同步至智能助手、启用自动会议调度、依赖GPT生成待办清单时,一个悖论悄然浮现:工具越先进,注意力越稀缺;算…

CANN/GE ACL数据集缓冲区添加函数

CANN/GE ACL数据集缓冲区添加函数

2026/9/23 22:20:06

aclmdlAddDatasetBuffer 【免费下载链接】ge GE(Graph Engine)是面向昇腾的图编译器和执行器,提供了计算图优化、多流并行、内存复用和模型下沉等技术手段,加速模型执行效率,减少模型内存占用。 GE 提供对 PyTorch、Te…

用ffmpeg高效批量调整图片尺寸的实战指南

用ffmpeg高效批量调整图片尺寸的实战指南

2026/9/23 14:32:22

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱

2026/9/24 3:39:17

Transformers 音频特征提取工具库 audio_utils 全解析:从 Mel 刻度换算到对数 Mel 频谱 【免费下载链接】transformers 🤗 Transformers: the model-definition framework for state-of-the-art machine learning models in text, vision, audio, and mu…

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南

2026/9/23 14:31:31

RustFS 多节点集群重启与滚动升级实战:Readiness、Quorum 与 Degraded 模式完全指南 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system sup…

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

Java Integer缓存揭秘:128陷阱原理、避坑与面试全解

2026/9/24 7:10:52

/* MD / 富文本中的 .toc(含博客园搬家等嵌套结构);.toc-box 在侧栏,不受影响 */#content_views .toc,/* 编辑器常在目录前后插入空 p(:empty 仍占 20px),一并去掉避免顶空隙 */#content_views.markdown_views > p:empty:has(+ .toc),#content_views.markdown_views …

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据

2026/9/23 14:34:03

RustFS Scanner 数据用量发布权威性决策:配额准入如何获得可用的权威依据 【免费下载链接】rustfs 🚀2.3x faster than MinIO for 4KB object payloads. RustFS is an open-source, S3-compatible high-performance object storage system supporting mi…

远程协作的工作台整理

远程协作的工作台整理

2026/9/24 16:02:49

远程协作的工作台整理远程协作的核心不是再加一个工具,而是让交接信息足够完整。异步任务要写明目标、输入位置、完成标准和需要决策的人。 工作台的最小配置 将日程、待办、代码和沟通入口收拢到少数固定位置;通知按紧急程度分层。工作台不需要模仿办公…

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能

2026/9/21 23:38:13

持续集成 流水线自动化与 声明式交付 实践:原型怎样变成可用功能分类:[AI/大模型]细分主题:AI 增强型 CI/CD 流水线自动化与 GitOps 实践:Agent 工作流、工具调用与任务拆解:从原型到生产的验收清单很多团队在尝试用大…

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场

2026/9/25 4:22:14

容器编排 生产环境运维与排障实战:复盘记录怎样真正派上用场分类:[工程技术]细分主题:Kubernetes 生产环境运维与排障实战:可复制的项目复盘模板与决策记录大部分团队的事故复盘报告,最后都变成了躺在 Confluence 或钉…