AI 自给自足,用合成数据做训练,效果比真实数据还好
消息来源:baojiabao.com 作者: 发布时间:2024-11-24
AI 生成的图像太逼真,为什么不能拿来训练 AI 呢?
可别说,现在还真有人这么做了。
来自香港大学、牛津大学和字节跳动的几名研究人员,决定尝试一下能否使用高质量 AI 合成图片,来提升图像分类模型的性能。
为了避免 AI 合成的图像过于单一、或是质量不稳定,他们还提出了几类提升数据多样性和可靠性的方法,帮助 AI 合成更好的数据集(来喂给 AI 的同类 doge)。
结果他们发现,不仅效果不错,有的 AI 在训练后,效果竟然比用真实数据训练还要好!
目前这篇论文已经被 ICLR 2023 收录。
把 AI 生成的数据喂给 AI
作者们分别从零样本(zero-shot)、少样本(few-shot)图像分类、模型预训练(pre-training)与迁移学习三个⽅⾯进⾏了探讨,并给出了提升数据多样性与可靠性的方法。
零样本图像分类
零样本(Zero-shot)图像分类任务,指没有任何⽬标类别的训练图⽚,只有对⽬标类别的描述。
作者们先是提出了一种名为语言增强(Language Enhancement,LE)的⽅法,用于增强合成数据多样性。
具体来说,这种方法会给标签"扩句",如果原标签是简单的"飞机",那么经过"扩句"后的提示词就会变成"一架盘旋在海滩和城市上空的白色飞机"。
随后,还采用了一种叫做 CLIP 过滤器(CLIP Filter)的⽅法确保合成数据的可靠性,即过滤掉合成质量不行的图片,确保 AI 数据质量过硬。
在 17 个数据集上,相⽐此前效果最好的 CLIP 模型,相关⼤⼩模型均获得了显著提升(4.31%/2.90%),展示了合成数据的有效性。
少样本图像分类
少样本图像(Few-shot)分类任务,通常仅有极少数量(1~16 张)的⽬标类别图⽚,与零样本任务的区别是增加了类别与任务特定领域信息。
因此,作者们决定将域内数据(in-domain)的知识⽤于图像⽣成,即将少量的⽬标类别图⽚⽤于噪声叠加的初始状态(Real Guidance),进⼀步发挥⽣成模型的能⼒,从而进⼀步提升性能。
预训练与迁移学习
模型预训练(pre-training)任务,即将模型在⼤量数据上进⾏训练,将训练后的模型作为"起始点",来帮助提升下游任务的性能。
作者们利⽤合成数据,对模型进⾏了预训练,并对数据量、数据多样性程度、预训练模型结构和预训练⽅法进⾏了实验研究。
最终发现:
⽤合成数据进⾏预训练。已经可以达到甚⾄超越⽤真实数据预训练的效果。
⽤更⼤的数据量和数据多样性的合成数据,可以获得更好的预训练效果。
从模型结构和预训练⽅法来看,ViT-based 模型(相比 convolutional-based 模型)、⾃监督⽅法(相比有监督⽅法)会更适合合成数据下的预训练。
论文认为,利⽤⽣成模型产⽣的合成数据来帮助图像分类任务是可行的,不过也存在⼀定的局限性。
例如,如何处理特定任务的 domain gap 和数据多样性之间的 trade-off,以及如何更有效地利⽤潜在⽆穷量的合成图⽚⽤于预训练,都是需要进一步去解决的问题。
作者介绍
一作何睿飞,香港大学在读博士生 @CVMI Lab,指导老师为齐晓娟老师,本科毕业于浙江大学竺可桢学院,研究方向是 data-efficient learning, vision-language model, knowledge distillation, semi / self-supervised learning。CVMI Lab 正在招收计算机视觉与深度学习方向的博士生,感兴趣的伙伴可以直接 email 老师!
对于将 AI 合成图像用于预训练模型这件事,你还能想到更高效的方法吗?
论文地址:
https://arxiv.org/abs/2210.07574
项目地址:
https://github.com/CVMI-Lab/SyntheticData
本文来自微信公众号:量子位 (ID:QbitAI),作者:关注前沿科技
2023-02-24 15:43:24相关文章
- 淘宝天猫仅退款属于诈骗吗?淘宝天猫开始部分取消仅退款
2024-10-01 13:01:28
- 哈啰app借钱|哈啰借钱app下载安装免费小小上当和电话骚扰
2024-10-01 11:22:38
- 白嫖党|山西大同大学学生网购申请“仅退款”被拒骂客服一小时
2024-09-27 09:10:44
- 北大数学教授袁新意《姜萍事件的疑点分析》点评姜萍板书 阿里巴巴竞赛受质疑
2024-06-28 10:07:40
- 天猫新规可以无条件申请“仅退款”了?淘宝天猫又离狗多多零元购近了一步
2024-06-28 09:27:13
- 美国法院裁定阿里须为Squishmallows玩具侵权案答辩
2023-12-28 19:59:34
- 小米汽车传员工3700人 雷军称小米汽车不可能卖9万9
2023-12-28 19:41:57
- 国家新闻出版署:认真研究《网络游戏管理办法(草桉徵求意见稿)》关切 实行前进一步完善
2023-12-28 19:14:56
- 印度以打击金融犯罪为由逮捕了两名 vivo 高管
2023-12-26 16:49:01
- 在国外微信收不到国内信息?微信和WeChat将被拆分
2023-12-15 10:40:15
- 苹果iPhone15 系列手机发布最新消息 预计上市发布时间9月
2023-08-06 23:21:02
- 华为将发布鸿蒙HarmonyOS4操作系统 功能五大升级支持设备清单
2023-08-06 23:17:37
- 整治自媒体网红账号 400万粉丝网红发布擦边视频被无限期封禁
2023-07-12 09:56:09
- 网传微信文件传输助手是真人是真的吗?微信官方回应
2023-06-27 15:53:32
- 电信移动送手机成了“信用购”?你上了运营商的贷款套路了吗?
2023-06-12 17:18:55
- 中国电信广东地区崩了无信号 客服回应已在核实处理
2023-06-08 15:39:04
- 消息称小米新能源汽车价格表正讨论定价区间:双版本不同配置,高配或超 35 万元
2023-03-06 12:56:03
- 华为因制裁被传或分拆剥离手机业务? 内部人士回应:可能性不大.
2023-03-05 23:26:41
- OPPO正式发布安第斯智能云,让终端更智能
2023-02-24 16:02:27
- 华为与OPPO签订全球专利交叉许可协议 包括5G蜂窝通信专利
2023-02-24 16:02:26