设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

字节发布视觉基础模型ViTamin,多项任务实现SOTA,入选CVPR2024

发布时间: 2024-04-28 16:06:41 来源: 量子位

视觉语言时代新基准zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

视觉语言模型屡屡出现新突破,但ViT仍是图像编码器的首选网络结构。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

字节提出新基础模型——ViTamin,专为视觉语言时代设计。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

字节发布视觉基础模型ViTamin,多项任务实现SOTA,入选CVPR2024

在使用相同的数据集和训练方案时,ViTamin在ImageNet零样本准确率上比ViT提高了2.0%。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外在分类、检索、开放词汇检测和分割、多模态大语言模型等60个不同基准上都表现出了良好的结果。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

当进一步扩展参数规模时,ViTamin-XL仅有436M参数,却达到了82.9%的ImageNet零样本准确率,超过了拥有十倍参数(4.4B)的EVA-E。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

最终这一成果,入选计算机视觉顶会CVPR2024zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

视觉语言时代新基准

在视觉语言时代下,如何设计一个更好可扩展的视觉模型?zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在ImageNet时代,新的视觉模型在ImageNet数据集得以验证,也造就了不断有新的视觉模型涌现。但在视觉语言时代,新的视觉模型鲜为人见。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,基于现有常见视觉模型,在面对比ImageNet数据规模还大的情况下表现又是如何?研究团队们测试了几种常见模型,包括纯Transformer的ViT,纯卷积网络的ConvNeXt,以及混合卷积和Transformer的CoAtNet。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

最终在一个公开的数据集上进行了系统性的训练和比较,得出了一些关键发现:zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  • 第一,模型的扩展性:由于可扩展的自注意力机制,ViT能最好地适应不同规模的任务。
  • 第二,数据的扩展性:随着训练数据的增加,所有模型的性能都有所提升。
  • 第三,特征的分辨率:在训练过程中,模型需要理解更广泛的信息,而不仅仅是简单的类别标签。因此,提取的特征的分辨率对模型的预测能力有很大影响。
  • 第四,混合架构:在一般情况下,CoAtNet表现优于其他模型,但将其扩展到处理数十亿数据可能会有一些挑战。

基于这些发现,研究人员设计了ViTamin模型zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

它采用了三个阶段的混合架构。前两个阶段使用了轻量级的MBConv Blocks,第三个阶段包含了可扩展的Transformer Blocks。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

字节发布视觉基础模型ViTamin,多项任务实现SOTA,入选CVPR2024

具体来说,一张图片首先经过卷积stem处理,得到2倍降采样的特征图。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

然后,这个特征图经过第一阶段,由两个MBConv-LN Blocks组成,接着经过第二阶段,由四个MBConv-LN Blocks组成,然后降采样得到16倍降采样的二维特征。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

接下来,这些特征被展平成一维,并输入到第三阶段,该阶段由N_B个TFB-GeGLU Block组成。最后,通过对比图像特征和语言特征,来学习对比损失函数。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

作者们致力于简单有效的scaling law,只考虑模型的宽度C和模型第三阶段的深度N_B,因此在scaling到更大的模型中,通过模型的参数规模可以直接反推需要多大的宽度和深度,进而实现模型的scaling。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

多项SOTA

零样本性能上面,研究结果显示,ViTamin-L的零样本ImageNet准确率比ViT-L/14高出了2.0%。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

字节发布视觉基础模型ViTamin,多项任务实现SOTA,入选CVPR2024

当将特征分辨率增加到576个patch时,ViTamin-L的准确率进一步提高到了81.8%,比之前的ViT-L/14 CLIPA-v2高出了1.5%。在38个数据集的平均性能上,ViTamin-L比ViT-H/14模型高出了0.4%,而且参数数量只有ViT-H/14的一半。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,当进一步扩大模型规模时,参数量为436M的ViTamin-XL达到了82.9%的ImageNet零样本准确率,超过了4.4B参数量的EVA-E取得的82.0%。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

作者们进一步验证了ViTamin模型对下游任务而言是个强大的视觉编码器zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

作者们引入了一系列下游任务,包括开放词汇检测和分割,以及多模态大模型(LMMs)。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

ViTamin在开放词汇检测任务OV-LVIS上,相比比ViT-L模型能提高了3.1%。ViTamin在8个开放词汇分割任务中,相比ViT-L平均提升了2.6%。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

ViTamin能直接迁移到多模态大模型诸如LLaVA上,并在12个多模态问答等基准上表现出色。值得注意的是,ViTamin在7个开放词汇分割基准上创造了新SOTA。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在这项工作中,作者们建立了主流视觉模型在视觉语言情境下的评估基准,并对它们进行了重新基准测试。作者们从数据可扩展性、模型可扩展性、特征分辨率和混合架构四个方面考察了主流的视觉模型。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

字节发布视觉基础模型ViTamin,多项任务实现SOTA,入选CVPR2024

这四个方面的关键发现为ViTamin的设计提供指导,ViTamin模型不仅在零样本ImageNet准确率和平均38个数据集准确率方面全面超越ViT,而且在包括开放词汇检测和分割以及大型多模态模型在内的22个下游任务上达到了最新的技术水平。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

来自智能创作团队

智能创作团队是字节跳动 AI & 多媒体技术团队,覆盖了计算机视觉、音视频编辑、特效处理等技术领域。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

他们借助公司丰富的业务场景、基础设施资源和技术协作氛围,实现了前沿算法 – 工程系统 – 产品全链路的闭环,旨在以多种形式为公司内部各业务提供业界前沿的内容理解、内容创作、互动体验与消费的能力和行业解决方案。
目前,智能创作团队已通过字节跳动旗下的云服务平台火山引擎向企业开放技术能力和服务。更多大模型算法相关岗位开放中。zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

论文链接:zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://arxiv.org/pdf/2404.02132.pdfzat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
项目主页:zat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://beckschen.github.io/vitaminzat速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

记者19日从兰州大学获悉,天华肉羊通过国家畜禽遗传资源委员会审定鉴定,成为我国首个适应高寒气候的肉羊品种。该品种由兰州大学草地农业科技学院李发弟教授和乐祥鹏教授团队,联合甘肃省武威市天 记者19日从西北大学获悉,该校地质学系、大陆动力学国家重点实验室刘鹏副教授与中国地质大学(北京)李国武教授团队申请的两种新矿物,近日经国际矿物学学会新矿物命名与分类专业委员会审查、投票,均   239万的无人驾驶航空器淘宝上架,人人可以“打飞的”还有多远  239万元/架的无人驾驶载人航空器也看上了电商渠道。  3月18日,亿航智能设备(广州)有限公司(下称“亿航智能”)在淘宝上架了其生产的EH216-S无人驾 记者3月21日从中国科学技术大学获悉,该校物理学院张斗国教授课题组,提出并实现了一种基于矢量光场调控原理的动量空间偏振滤波器件。该滤波器件安装于传统无标记光学显微镜后,可采集到单个纳米 美国和法国的科学家联合团队借助新的3D打印技术,开发出一种多层人造皮肤,只需18天即可长成。这种仿真皮肤可用于提升护肤品测试效率,并催生更好的皮肤治疗方法。相关研究发表于新一期《先进功能 聊到安卓电话的拍照,大部分用户还是比较认可的,而在与iPhone电话的对比中,用户也普遍以为安卓电话的拍照水平要比iPhone更好,当然这一说法也并非空穴来风,其背后的原因直接而明确。首先,硬件配置的竞争 。

本文链接:字节发布视觉基础模型ViTamin,多项任务实现SOTA,入选CVPR2024http://www.sushuapos.com/show-2-5471-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 68万奖金角逐,2024华为软件精英挑战赛全球总决赛获奖名单公布!

下一篇: 谁在领导AI专利竞赛?上榜的有这些公司

热门资讯

推荐资讯

  • 讨论:拼多多先用后付大额怎么提出

    拼多多上面消费的商品,顾客可以先使用,觉得满意再进行付款。本质上,这是一种信用支付方式,先让用户享受0元下单的权益,然后再是用户守信付款。先用后付的这个时间间隔大概是15天

  • 解说:拼多多先用后付大额怎么套出

    拼多多凭借前几年一番病毒式的营销之后,如今已经成为了和淘宝、京东齐名的电商巨头之一,为了更好的留住用户,还专门开通了先用后付的服务,拼多多的先用后付功能许多用户都

  • 分享方法-拼多多先用后付怎么最快提出来

    随着网络购物的日益普及,人们对于购物体验的要求也越来越高。其中,拼多多先用后付作为一种新兴的消费方式,逐渐受到了广大消费者的青睐。拼多多作为一家国内知名的电商平台,也

  • 三分钟必看篇:拼多多先用后付额度如何取现出来

    拼多多是一款可以拼团下单的在线购物平台,到了很多顾客朋友的喜爱,其优势主要就是价格更低,可以发起与朋友之间的社交联系。很多喜欢用拼多多购物平台买东西的朋友,一旦到了购

  • 介绍详细秒到攻略-拼多多先用后付怎么提出现金

    拼多多是一款可以拼团下单的在线购物平台,到了很多顾客朋友的喜爱,其优势主要就是价格更低,可以发起与朋友之间的社交联系。很多喜欢用拼多多购物平台买东西的朋友,一旦到了购

  • 小二推荐真实秒到技巧-拼多多先用后付大额怎么提出

    随着电商的发展,购物方式也在发生改变。拼多多作为国内领先的电商平台,其“先用后付”的额度政策吸引了众多消费者。 那么,如何巧妙地套出拼多多先用后付的额度呢?今天,我将为大

  • 介绍安全秒到方法-拼多多先用后付取现全过程

    随着网络购物的日益普及,人们对于购物体验的要求也越来越高。其中,拼多多先用后付作为一种新兴的消费方式,逐渐受到了广大消费者的青睐。拼多多作为一家国内知名的电商平台,也

  • 4种简单方法拼多多先用后付的钱怎么取出来

    拼多多先用后付额度怎么套出来的,最简单的方法拼多多先用后付是拼多多平台推出的一款消费服务,现在网络消费额度比较流行,其中的利润也是非常可观的,多多现在也是一个比较热

  • 今日必看方法-怎么找拼多多先用后付变现商家

    我们要了解拼多多先用后付额度的政策。简单来说,先用后付额度就是拼多多根据用户的购物行为和信用评级,给予的一部分信用额度。用户可以在购物时先使用这部分额度,然后在规定

  • 详细秒到攻略-拼多多先用后付怎么找提现商家

    随着电商的发展,购物方式也在发生改变。拼多多作为国内领先的电商平台,其“先用后付”的额度政策吸引了众多消费者。 那么,如何巧妙地套出拼多多先用后付的额度呢?今天,我将为大

  • 精研:拼多多先用后付1500怎么套出来

    随着网络购物的日益普及,人们对于购物体验的要求也越来越高。其中,拼多多先用后付作为一种新兴的消费方式,逐渐受到了广大消费者的青睐。拼多多作为一家国内知名的电商平台,也

  • 三分钟必看篇:拼多多先用后付提现全过程

    拼多多凭借前几年一番病毒式的营销之后,如今已经成为了和淘宝、京东齐名的电商巨头之一,为了更好的留住用户,还专门开通了先用后付的服务,拼多多的先用后付功能许多用户都

  • 日榜
  • 周榜
  • 月榜