设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

何恺明刘壮新作:消除数据集偏差的十年之战

2024-03-17 20:21:54 来源: 量子位

神经网络越来越强大,利用数据集偏差的能力也越来越厉害了Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

MIT新晋副教授何恺明,新作新鲜出炉:Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

瞄准一个横亘在AI发展之路上十年之久的问题:数据集偏差。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

何恺明刘壮新作:消除数据集偏差的十年之战

该研究为何恺明在Meta期间与刘壮合作完成,他们在论文中指出:Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这不禁让人怀疑:我们在消除数据集偏差的战斗中,真的取得了胜利吗?Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

数据集偏差之战,在2011年由知名学者Antonio Torralba和Alyosha Efros提出——Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Alyosha Efros正是Sora两位一作博士小哥(Tim Brooks和William Peebles)的博士导师,而Antonio Torralba也在本科期间指导过Peebles。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

当时他们发现,机器学习模型很容易“过拟合”到特定的数据集上,导致在其他数据集上表现不佳。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

十多年过去了,尽管我们有了更大、更多样化的数据集,如ImageNet、YFCC100M、CC12M等,但这个问题似乎并没有得到根本解决。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

反而,随着神经网络变得越来越强大,它们“挖掘”和利用数据集偏差的能力也越来越强了!Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

为了分析这个问题,何恺明团队设计了一个虚构的”数据集分类”任务。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

听名字你可能就猜到了:给定一张图像,模型需要判断它来自哪个数据集。通过看模型在这个任务上的表现,就可以了解它们捕捉数据集偏差的能力。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

何恺明刘壮新作:消除数据集偏差的十年之战

现代AI轻松识破不同数据集

在实验中团队发现,各种现代神经网络架构,如AlexNet、VGG、ResNet、ViT等,在数据集分类任务上表现出惊人的一致性:它们几乎都能以超过80%的准确率区分不同数据集的图像!Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

何恺明刘壮新作:消除数据集偏差的十年之战

更令人吃惊的是,这个发现在各种不同的条件下都非常稳健:Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不管是不同的数据集组合、不同的模型架构、不同的模型尺寸、不同的训练数据量,还是不同的数据增强方法,神经网络始终能轻松”一眼识破”图像的数据集来源。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

那么,神经网络是如何做到这一点的呢?是靠单纯的记忆,还是学到了一些更普适的规律?Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

为了揭开谜底,团队做了一系列对比实验。他们发现,如果把不同的数据集随机混在一起,神经网络就很难再区分它们了(准确率下降到了33%)。这说明,神经网络并不是在单纯地记忆每一张图像,而是真的学到了一些数据集特有的模式。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

何恺明刘壮新作:消除数据集偏差的十年之战

更有趣的是,即使在自监督学习的设置下,神经网络也展现出了惊人的”数据集辨识力”。在这种设置下,模型在训练时并没有用到任何数据集的标签信息,但当在这些自监督学习到的特征上训练一个简单的线性分类器时,它依然能以超过70%的准确率区分不同的数据集!Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

通过这一系列的实验,何恺明、刘壮等人的研究给我们敲响了警钟:尽管这十年我们一直在努力构建更大、更多样化的数据集,但数据集偏差这个问题似乎并没有得到根本解决。相反,现代神经网络越来越善于利用这些偏差来获得高准确率,但这可能并不代表它们真正学到了鲁棒、普适的视觉概念。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

何恺明刘壮新作:消除数据集偏差的十年之战

论文的最后,作者呼吁整个AI社区重新审视数据集偏差这个问题,并重新思考如何在算法和数据两个层面上来应对这一挑战。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

CVPR最佳论文作者的通力合作

本文是何恺明在Meta期间,与Meta研究科学家刘壮合作完成。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

现在,何恺明已经正式在MIT上岗,担任电气工程与计算机科学系的助理教授。他的“开学第一课”开课即火爆,在youtube上已经有2.9万的播放量。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

何恺明刘壮新作:消除数据集偏差的十年之战

和何恺明一样,刘壮本科毕业自清华,并且也是CVPR最佳论文奖得主——他是CVPR2017最佳论文DenseNet的第一作者。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

2017年,刘壮从清华姚班毕业,进入加州大学伯克利分校攻读博士学位,师从Trevor Darrell,是贾扬清的同门师弟。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

博士毕业后,刘壮进入Meta AI Research工作。在此之前,他已经在Meta实习了一年多时间,期间和谢赛宁合作,发表了ConvNeXt。Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

何恺明刘壮新作:消除数据集偏差的十年之战

论文地址:
https://arxiv.org/abs/2403.08632Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

参考链接:
https://twitter.com/liuzhuang1234/status/1768096508082008289Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

— 完 —Yne速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

本文链接:何恺明刘壮新作:消除数据集偏差的十年之战http://www.sushuapos.com/show-2-3865-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 来感受一下“人工智能+”,三甲医院是这样用大模型的

下一篇: 星舰失联了!SpaceX第三次发射功败垂成,但马斯克又把人类推进了一大步

热门资讯

  • 明天氢能荣获国家电网科技进步奖一等奖

    记者3月18日从安徽明天氢能科技股份有限公司(以下简称明天氢能)获悉,国家电网近日向明天氢能及董事长王朝云分别授予科学技术进步奖一等奖,获奖项目为

  • Sora将如何影响科学与社会

    英国《自然》周刊网站3月12日刊登题为《OpenAI的文生视频工具Sora会如何改变科学——以及社会》的文章,作者为乔纳森·奥卡拉汉,内

  • 人类祖先200万年前开始捕鱼

    美国《发现》杂志网站2月7日刊登题为《200万年前,我们的人类祖先开始从水里捞鱼》的文章,作者是科迪·科蒂尔,内容编译如下:捕鱼可能是一种占许

  • CRISPR能消除培养细胞中艾滋病病毒

    荷兰阿姆斯特丹大学医学院科学家开展的一项新研究证明,利用最新CRISPR-Cas基因编辑技术,能消除实验室中受感染细胞内所有艾滋病病毒(HIV)的痕迹,为治愈

  • 我国建立“天-空-地-深”一体化铀矿勘查技术体系

    记者3月21日从核工业北京地质研究院(以下简称核地研院)获悉,该院自1959年成立以来,在天然铀保障、高放废物地质处置、核遥感技术与应用、分析测试等领

  • 一种新的结核病候选疫苗在南非启动Ⅲ期临床试验

    在3月24日世界防治结核病日前夕,比尔及梅琳达∙盖茨医学研究所(以下简称盖茨医学研究所)宣布,启动评估结核病候选疫苗M72有效性的Ⅲ期临床试验。在Ⅱb

  • 雌蛙会向雄蛙“暗送秋波”?这项研究给出了答案

    记者3月21日从安徽师范大学获悉,该校生命科学学院张方教授课题组通过野外自然抱对、控制实验下抱对以及视频回放等实验手段,证实他们前期提出的,眨眼

  • 植物避盐性的关键基因被发现

    记者3月21日从安徽农业大学获悉,该校生命科学学院韩毅教授课题组与国内外专家合作,发现了植物避盐性的关键基因。该研究对于提高植物耐盐性,帮助盐碱

  • 银鲳高质量染色体水平 参考基因组发布

    3月19日,记者从中国科学院海洋研究所了解到,该所研究团队在国际上首次发布了银鲳的高质量染色体水平参考基因组。相关研究论文近日在线发表于《自然

  • 量子互联网:小荷已露尖尖角

    近日,美国纽约州立大学石溪分校科学家菲格罗阿等人在一篇发表于《自然·量子信息》上的论文中称,他们通过把两个独立的光子存储在铷气里,首次在

  • “婴儿香”原来是真的香

    所谓香喷喷的婴儿,到底是源于人们的爱意,还是说确有其香?《通讯·化学》21日一项小型研究首次分析了婴儿和青少年体味化学组成的差异。研究显示

  • 人工智能大模型赋能企业科技创新研讨会召开

    3月21日,人工智能大模型赋能企业科技创新研讨会在广州召开。中国知网在会议期间发布了专利大数据智能应用产品“AI Pat+”。据中国知网相关负责人介

推荐资讯

  • 日榜
  • 周榜
  • 月榜