【ICML 2025】SynSup:理论引导的少样本合成数据训练|从少样本视觉学习视角

发布时间:2026/8/20 9:19:08

【ICML 2025】SynSup:理论引导的少样本合成数据训练|从少样本视觉学习视角
摘要本文解读 ICML 2025 论文《Provably Improving Generalization of Few-Shot Models with Synthetic Data》SynSup。该论文提出理论引导的少样本合成数据训练范式通过可证明的泛化上界、K-means 数据分区与差异/鲁棒双正则损失把用合成数据补足少样本标注从启发式提升为可优化、可保证的方法其特别之处在于证明模型感知的分布接近足以替代客观分布接近。实验表明在 10 个少样本数据集上平均准确率达87.0%超越最强基线 DataDream 达0.7 个百分点且轻量版仅用 1/8 合成数据即可追平基线为少样本学习与合成数据研究提供了理论 实证双支撑的借鉴。视频讲解点击观看 B 站视频摘要论文基本信息为什么用合成数据训练少样本模型会掉点研究主线从问题到结论基准/方法设计合成数据增强方法分类全景方法细节实验设计与结果结果对比总结关键发现局限性常见问题FAQSynSup 和 DataDream 的核心区别是什么为什么直接混入合成数据训练会掉点轻量版为什么只用 1/8 合成数据就能追平基线簇数怎么选方法在 1-shot 场景为什么失效这个方法能用到别的任务上吗参考链接论文基本信息项目内容标题英文Provably Improving Generalization of Few-Shot Models with Synthetic Data标题中文理论引导的少样本合成数据训练作者Lan-Cuong Nguyen, Quan Nguyen-Tri, Bang Tran Khanh, Dung D. Le, Long Tran-Thanh, Khoat Than机构FPT Software AI Center · Hanoi Univ. of Science and Technology · VinUniversity · University of Warwick会议ICML 2025arXivhttps://arxiv.org/abs/2505.24190讨论页https://openreview.net/forum?idL6U7nYc4ah为什么用合成数据训练少样本模型会掉点深度模型通常需要大量标注数据而人工标注既费时又昂贵因此近年来很多工作尝试用合成数据作为替代方案。本文聚焦一个具体场景只有少量真实标注few-shot时如何把合成数据与真实样本联合起来训练一个可靠的分类器朴素的直接混入合成数据反而会掉点Breugel et al., 2023 已观察到这一现象。根本原因是分布差距distribution gap生成器是为预训练任务设计的其输出分布与下游真实数据分布存在偏差。RealFake 与 DataDream 等方法通过微调生成器、在像素空间做分布匹配来缩小差距但主要依赖启发式缺乏理论支撑。作者把问题提炼为四个核心问题① 什么性质决定合成数据集的好坏② 如何生成好的合成数据集③ 如何高效地用真实 合成混合数据训练预测器④ 生成器质量如何影响训练出的模型的泛化能力本文用一个统一的泛化界回答了全部四个问题。从历史脉络看论文附录 H这条路线经历了三个阶段2018–2021 年数据集蒸馏Wang et al., arXiv 1811.10959确立特征空间对齐思想2022–2024 年生成式增强爆发从 IsSynth 的噪声注入演进到 DataDream 的生成器微调2023–2025 年理论补位——Zheng et al.NeurIPS 2023arXiv 2305.17476用总变差距离推导泛化界、Ildiz et al.ICLR 2025arXiv 2410.18837分析线性代理模型但都止步于简单模型。SynSup 是首个给出少样本场景可优化泛化界的工作。研究主线从问题到结论图 4SynSup 研究主线——从少样本标注稀缺、分布差距掉点到泛化界指导设计再到 87.0% 平均准确率Mermaid 流程图。基准/方法设计相关工作沿三条线展开生成式数据增强IsSynth噪声注入 CLIP 过滤DISEF图像描述增强多样性 LoRADataDream微调生成器RealFake模型无关分布匹配、少样本 视觉语言模型CLIP 提示学习、Adapter 类参数高效微调、理论分析Zheng 的 TV 距离界、Ildiz 的线性代理模型——均无法用于少样本。SynSup 的核心思想是把测试误差上界直接转写成可优化目标。给定真实数据 $S$$n$ 个样本与合成数据 $G$$g$ 个样本对数据空间做分区 $\Gamma$分类器 $h$ 的泛化界由四项构成簇内真实-合成预测差异 $\bar{d}_h(G_i,S_i)$、真实与合成数据的局部鲁棒性 $\mathcal{R}_h$、分类损失 $F(S,h)F(G,h)$以及样本复杂度项 $O(1/\sqrt{n}1/\sqrt{g})$。方法分两阶段分区优化对真实 合成数据做 K-means 聚类FAISS 实现簇数约为类别数 2 倍最小化鲁棒项模型优化在联合数据集上最小化组合损失同时用 LoRA 微调 Stable Diffusion 生成器沿用 DataDream 流程从源头降低差异项。图 1SynSup 整体流程——用真实样本标签条件生成合成图像对真实 合成图像联合聚类损失由同簇内真实-合成预测差异与合成样本间鲁棒性项构成。合成数据增强方法分类全景图 5合成数据增强四类路线——像素空间匹配、特征/原型对齐、理论引导训练与生成器微调Mermaid 流程图。方法细节损失函数是方法的核心。SynSup 最小化 $\mathcal{L} \lambda F(S,h) F(G,h) \lambda_1 \sum_i \frac{g_i}{g}\bar{d}h(G_i,S_i) \lambda_2 \frac{1}{g}\sum_i\sum{g_1,g_2\in G_i}\frac{1}{g_i}|h(g_1)-h(g_2)|$前两项是真实与合成数据上的交叉熵第三项是簇内真实-合成预测差异正则对应界中差异项第四项是合成样本间的鲁棒正则对应界中鲁棒项。作者特别强调鲁棒项是被此前工作忽视但至关重要的组件——消融显示去掉它性能明显回落。理论洞察附录 A主定理在至少 $1-\delta$ 概率下给出测试误差上界推论进一步说明——只要模型感知到的两个分布距离足够小即使分布客观上相距很远也能获得好的泛化。这把分布匹配从像素空间推进到了预测空间。轻量版算法附录 B与 full 版相比有三个差异——不微调生成器LoRA 只挂载不更新、每类仅生成 64 张合成图full 版的 1/8、分区不再一次固定而是每个 epoch 用 Mini-Batch K-means 迭代更新簇心。由于数据量小正则项在全部数据上计算以保证强度。轻量版平均 86.4%以 1/8 数据追平了最强基线证明理论正则的价值不依赖昂贵的生成器微调。实验设计与结果评测协议10 个主流少样本数据集ImageNet、Caltech101、FGVC Aircraft、Food101、EuroSAT、Oxford Pets、DTD、SUN397、Stanford Cars、Flowers102每类 16 张真实样本full 版每类 500 张合成图、轻量版 64 张。模型为 CLIP ViT-B/16 图像编码器 LoRA生成器为 Stable Diffusion 2.1guidance 2.0AdamW CutMix/Mixup基线结果与 DataDream 论文口径一致3 个随机种子平均full 版固定 seed 0。方法EuSATDTDAirCFLO平均Real-finetune93.573.959.398.784.2IsSynth93.975.164.899.084.8DISEF94.074.364.399.084.7DataDream$_{dset}$93.474.172.399.486.3Ours (lightweight)94.275.571.599.086.4Ours (full)94.774.574.399.387.0full 版平均87.0%10 个数据集中7 个第一、2 个第二未拿第一的数据集差距也在 0.1–0.3pp 以内轻量版平均 86.4% 追平 DataDream。图 2discrepancy左与 robustness右项随训练的变化——SynSup 损失下两项更小更平滑且小值对应更高精度实证支持泛化界。消融实验附录表差异正则与鲁棒正则必须同时使用——只加一项次优两项全开时 EuroSAT 从 93.5 提升到 94.7、DTD 从 74.1 提升到 74.5、Cars 从 92.6 提升到 93.1。簇数分析附录图簇数约为类别数 2 倍时性能达峰太少边界模糊、太多分散数据弱化正则。图 3簇数消融实验——性能在簇数约为类别数 2 倍时达到峰值过多或过少都回落与理论预期一致。极端少样本附录 D1/4/8-shot 对比 DataDream4-shot 起全面反超——AirC 在 8-shot 时领先 9.3pp54.6 vs 63.9、Cars 领先 3.9pp、FLO 领先 0.3pp1-shot 是明确短板AirC 25.3 vs 31.1单样本时正则项趋零、鲁棒性不足。合成数据规模附录 E每类合成数从 100 张增至 500 张SynSup 在 EuSAT、DTD、AirC 上持续优于DataDream100 张时分别 0.8/0.5/1.1pp。纯合成适配去掉真实损失与差异项仅保留鲁棒正则在 5 个数据集上 3 胜 1 平 1 负Food 89.2 vs 86.7增益远小于完整方法——差异与鲁棒双正则的协同价值由此凸显。结果对比总结图 6平均准确率递进对比——SynSup full 87.0% 登顶轻量版 86.4% 追平 DataDreamMermaid 流程图。关键发现理论-算法闭环泛化界直接落地为可优化损失消融逐项验证每个组件都在负载——差异 鲁棒全开时 EuroSAT 提升 1.2pp、Cars 提升 0.5pp。鲁棒项被低估此前方法只关注分布匹配SynSup 证明局部鲁棒正则对泛化同样关键且在纯合成设定下是唯一仍带来提升的组件。模型感知充分性推论证明模型觉得两个分布接近即可泛化无需客观度量接近——这是与所有像素/特征匹配方法最根本的差异。轻量版性价比64 张/类合成图1/8 数据量 免生成器微调平均 86.4% 追平 DataDream 的 86.3%。架构泛化CLIP-ResNet50 上 4 个数据集 3 个最优AirC 82.67 vs 81.46不依赖特定骨干。诚实叙事附录 F作者主动披露界含 $O(\sqrt{K})$ 项非最优、1-shot 场景退化主文7/10 第一依赖并列计数SUN397 与 IsSynth 并列 77.7口径值得读者留意。局限性1-shot 退化每类仅 1 张真实样本时正则项趋零AirC 上 25.3% 低于 DataDream 的 31.1%。界的紧度上界含 $O(\sqrt{K})$ 项K 大时非最优单个真实样本时局部行为无法被界刻画。计算成本full 版需微调生成器 每类 500 张合成图轻量版缓解但精度略降。验证范围仅在图像分类上实证回归、对抗训练、域自适应等扩展只在文中声称可推广、未验证。常见问题FAQSynSup 和 DataDream 的核心区别是什么DataDream 通过微调生成器让合成图在像素空间贴合真实分布缺少理论依据SynSup 从泛化上界出发在分类器训练中加入差异正则与鲁棒正则并证明模型感知的接近即可保证泛化——同样的生成器微调流程加上理论指导的损失后平均提升 0.7pp。为什么直接混入合成数据训练会掉点生成器与下游任务存在分布差距合成样本可能与真实样本错误关联尤其跨类别。SynSup 的差异正则项专门拉近同簇内真实与合成样本的预测消除这类错误关联。轻量版为什么只用 1/8 合成数据就能追平基线轻量版不微调生成器但保留全部理论正则正则项在全部数据上计算保证强度分区用 Mini-Batch K-means 逐 epoch 迭代更新。这证明收益主要来自损失设计而非数据量或生成器微调。簇数怎么选最优簇数约为类别数的 2 倍。太少导致决策边界模糊、簇内差异项失去意义太多则过度分散数据、弱化正则。ImageNet 上为降计算量取类别数的一半。方法在 1-shot 场景为什么失效每类只有 1 张真实样本时簇内差异与鲁棒正则项趋近于零损失退化为普通分类损失模型鲁棒性不足——这也是论文明确承认的边界。这个方法能用到别的任务上吗作者认为泛化界足够通用可推广到回归、对抗训练与域自适应但论文只在图像分类上做了实证扩展到其他任务前需要重新验证正则项的行为。参考链接arXiv 摘要页https://arxiv.org/abs/2505.24190OpenReview 讨论页https://openreview.net/forum?idL6U7nYc4ahICML 2025 Posterhttps://icml.cc/virtual/2025/poster/45612CLIP少样本视觉语言模型根基https://arxiv.org/abs/2103.00020Dataset Distillation特征空间对齐思想源头https://arxiv.org/abs/1811.10959Zheng et al., Toward Understanding Generative Data AugmentationNeurIPS 2023https://arxiv.org/abs/2305.17476给大家推荐一款自用写文献综述、无虚构文献的 AI复旦大学 FudanNLP 团队自研 切问学术官网qiewenpaper.com覆盖3.6 亿篇可溯源真实中英文文献能自动整合文献观点生成规范综述还能挖掘研究创新点、复现实验配合视频教学新手快速上手文献综述写作后记博客的关键词集中在编程、算法、机器人、人工智能、数学等等持续高质量输出中。讨论QQ群白拾的小屋 (750365700)⭐B站账号白拾的物理AI组会活跃于知识区和动画区✨GitHub主页YhbCode000工程文件

相关新闻

【ICML 2025 (Poster)】在上下文强化学习中缩放通用智能体:Vintix 动作模型|从上下文强化学习规模化视角

【ICML 2025 (Poster)】在上下文强化学习中缩放通用智能体:Vintix 动作模型|从上下文强化学习规模化视角

2026/8/20 9:19:08

摘要 本文解读 ICML 2025(Poster)论文《Vintix: Action Model via In-Context Reinforcement Learning》。该论文提出Vintix 跨域动作模型,通过融合连续噪声蒸馏、跨域数据集与算法蒸馏,让 300M 参数的固定权重模型在推理时通过试…

AI智能体本地化实战:赋予Agent感知与操作电脑能力

AI智能体本地化实战:赋予Agent感知与操作电脑能力

2026/8/20 9:19:08

最近在尝试让 AI 智能体帮我处理一些本地文件、运行脚本或者查询系统信息时,发现一个核心痛点:这些智能体大多“生活”在云端,对运行它们的“电脑”本身几乎一无所知。它们无法直接读取我的文档,不能帮我整理桌面,更别…

2026大厂软件测试面试趋势与高频技术解析

2026大厂软件测试面试趋势与高频技术解析

2026/8/20 9:19:08

1. 2026大厂软件测试面试趋势前瞻 最近帮几位准备跳槽的测试工程师朋友做模拟面试,发现大厂对测试人员的考察维度正在发生明显变化。相比五年前偏重手工测试用例设计的考核方式,如今头部互联网企业的面试官更关注候选人在自动化测试、质量保障体系、持续…

原神成就数据导出怕麻烦?YaeAchievement 免费工具让你 5 分钟拿到全部数据

原神成就数据导出怕麻烦?YaeAchievement 免费工具让你 5 分钟拿到全部数据

2026/8/20 10:19:10

原神成就数据导出怕麻烦?YaeAchievement 免费工具让你 5 分钟拿到全部数据 【免费下载链接】YaeAchievement 更快、更准的原神数据导出工具 项目地址: https://gitcode.com/gh_mirrors/ya/YaeAchievement 换设备那天,我才发现成就"带不走&qu…

照片上的经纬度地址等怎么弄的?2026最新教程:相机无GPS也能写入坐标

照片上的经纬度地址等怎么弄的?2026最新教程:相机无GPS也能写入坐标

2026/8/20 10:19:10

照片上的经纬度地址等怎么弄的?2026最新教程:相机无GPS也能写入坐标 照片上的经纬度地址等怎么弄的?很多人想到的是打开地图App手动标注,或是掏出手机翻设置,折腾半天只能一张张处理,碰上批量需求更是耗时…

TMSpeech免费离线语音转文字工具终极指南:Windows实时字幕一劳永逸

TMSpeech免费离线语音转文字工具终极指南:Windows实时字幕一劳永逸

2026/8/20 10:19:10

TMSpeech免费离线语音转文字工具终极指南:Windows实时字幕一劳永逸 【免费下载链接】TMSpeech 腾讯会议摸鱼工具 项目地址: https://gitcode.com/gh_mirrors/tm/TMSpeech TMSpeech 是一款完全免费、开源的 Windows 离线语音转文字工具:它会实时捕…

输入法状态显示工具实时显示中英文切换

输入法状态显示工具实时显示中英文切换

2026/8/20 10:19:10

ImTip 今天要分享一款实用小工具——ImTip。这款软件的功能特别直接:在你切换输入法的时候,实时显示当前输入法的状态,让你一眼就知道现在是中文还是英文、大写还是小写。 解决什么问题 平时打字的时候,经常忘记当前输入法处于什…

小红书图片格式转换终极指南:HEIC、WEBP下载后打不开?XHS-Downloader一键转JPEG

小红书图片格式转换终极指南:HEIC、WEBP下载后打不开?XHS-Downloader一键转JPEG

2026/8/20 10:19:10

小红书图片格式转换终极指南:HEIC、WEBP下载后打不开?XHS-Downloader一键转JPEG 【免费下载链接】XHS-Downloader 小红书(XiaoHongShu、RedNote)链接提取/作品采集工具:提取账号发布、收藏、点赞、专辑作品链接&#x…

Spring Boot 3.x 虚拟线程实战:高并发改造与线上避坑指南

Spring Boot 3.x 虚拟线程实战:高并发改造与线上避坑指南

2026/8/20 10:09:10

在 JDK 21 之前写高并发 Java 服务,基本就是跟 ThreadPoolExecutor 死磕。线程开多了 OOM,开少了请求排队超时。微服务架构下,网络 IO 和下游 RPC 调用占掉大半时间,传统 1:1 平台线程模型里,大量线程卡在 WAITING 状态…

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

【文章复现】非线性值迭代自适应动态规划(ADP):离散时间非线性系统的策略迭代自适应动态规划算法研究附Matlab代码

2026/8/19 3:36:59

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

【双层规划,节点出清价,绿证交易,CVaR方法】两级电力市场环境下计及风险的省间交易商最优购电模型附Matlab代码

2026/8/19 9:17:18

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

隐式mpc+自适应mpc+时变mpc,线性时变模型预测控制附Simulink仿真

2026/8/19 8:02:16

✅作者简介:热爱科研的Matlab仿真开发者,擅长毕业设计辅导、数学建模、数据处理、建模仿真、程序设计、完整代码获取、论文复现及科研仿真。🍎 往期回顾关注个人主页:Matlab科研工作室👇 关注我领取海量matlab电子书和…

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换

2026/8/20 0:08:45

微信聊天记录如何完整导出?WeChatMsg备份指南:HTML/Word/CSV一键转换 【免费下载链接】WeChatMsg 提取微信聊天记录,将其导出成HTML、Word、CSV文档永久保存,对聊天记录进行分析生成年度聊天报告 项目地址: https://gitcode.com…

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒

2026/8/20 0:08:45

B站缓存m4s打不开?m4s-converter无损合成MP4,实测1.46GB仅5秒 【免费下载链接】m4s-converter 一个跨平台小工具,将bilibili缓存的m4s格式音视频文件合并成mp4 项目地址: https://gitcode.com/gh_mirrors/m4/m4s-converter 判断你是否…

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印

2026/8/20 0:08:45

告别白模时代:Blender3mfFormat 让 3MF 导入导出一次跑通设计到打印 【免费下载链接】Blender3mfFormat Blender add-on to import/export 3MF files 项目地址: https://gitcode.com/gh_mirrors/bl/Blender3mfFormat 按 3MF 官方规范的字面意思,一…

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

2026/8/17 12:00:53

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…

导师推荐!2026最新AI论文工具测评与实用推荐

导师推荐!2026最新AI论文工具测评与实用推荐

2026/8/15 10:10:27

2026年真正好用的AI论文工具,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

告别游戏崩溃:XCOM 2模组管理器的智能革命

告别游戏崩溃:XCOM 2模组管理器的智能革命

2026/8/18 12:20:24

告别游戏崩溃:XCOM 2模组管理器的智能革命 【免费下载链接】xcom2-launcher The Alternative Mod Launcher (AML) is a replacement for the default game launchers from XCOM 2 and XCOM Chimera Squad. 项目地址: https://gitcode.com/gh_mirrors/xc/xcom2-lau…