设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

发布时间: 来源: 量子位

即插即用KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

CLIP长文本能力被解锁,图像检索任务表现显著提升!KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一些关键细节也能被捕捉到。上海交大联合上海AI实验室提出新框架Long-CLIPKHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△棕色文本为区分两张图的关键细节KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Long-CLIP在保持CLIP原始特征空间的基础上,在图像生成等下游任务中即插即用,实现长文本细粒度图像生成——KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

长文本-图像检索提升20%,短文本-图像检索提升6%。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

解锁CLIP长文本能力

CLIP对齐了视觉与文本模态,拥有强大的zero-shot泛化能力。因此,CLIP被广泛应用在各种多模态任务中,如图像分类、文本图像检索、图像生成等。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

但CLIP的一大弊病是在于长文本能力的缺失KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

首先,由于采用了绝对位置编码,CLIP的文本输入长度被限制在了77个token。不仅如此,实验发现CLIP真正的有效长度甚至不足20个token,远远不足以表征细粒度信息。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

文本端的长文本缺失也限制了视觉端的能力。由于仅包含短文本,CLIP的视觉编码器也只会提取一张图片中最主要的成分,而忽略了各种细节。这对跨模态检索等细粒度任务是十分不利的。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时,长文本的缺乏也使CLIP采取了类似bag-of-feature(BOF)的简单建模方式,不具备因果推理等复杂能力。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

针对这一问题,研究人员提出了Long-CLIP模型。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

具体提出了两大策略:保留知识的位置编码扩充(Knowledge-Preserving Stretching of Positional Embedding)与加入核心成分对齐(Primary Component Matching)的微调策略。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

保留知识的位置编码扩充

一个简单的扩充输入长度、增强长文本能力的方法是先以固定的比率 λ1 对位置编码进行插值,再通过长文本进行微调。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

研究者们发现,CLIP的不同位置编码的训练程度是不同的。由于训练文本很可能以短文本为主,较低位的位置编码训练较为充分,能够精确地表征绝对位置,而较高位的位置编码则仅能表征其大致的相对位置。因此,对不同位置的编码进行插值的代价是不同的。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

基于以上观察,研究者保留了前20个位置编码,而对于剩下的57个位置编码,则以一个更大的比率λ2 进行插值,计算公式可表示为:KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

实验表明,相较于直接插值,该策略可以在支持更长的总长度的同时大幅提升在各个任务上的性能。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

加入核心属性对齐的微调

仅仅引入长文本微调会使模型走入另一个误区,即一视同仁地囊括所有细节。针对这一问题,研究者们在微调中引入核心属性对齐这一策略。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

具体而言,研究者们利用主成分分析(PCA)算法,从细粒度的图像特征中提取核心属性,将其余属性过滤后重建粗粒度图像特征,并将其与概括性的短文本进行对齐。这一策略既要求模型不仅能够包含更多的细节(细粒度对齐),同时还能识别并建模其中最为核心的属性(核心成分提取与粗粒度对齐)。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△加入核心属性对齐的微调流程KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

即插即用在各种多模态任务中

在图文检索、图像生成等领域,Long-CLIP可即插即用地替换CLIP。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

比如图文检索,Long-CLIP能够在图像与文本模态捕捉更多细粒度信息,从而可以增强相似图像和文本的区分能力,大幅提升图文检索的表现。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

无论是在传统的短文本检索(COCO、Flickr30k),还是在长文本检索任务上,Long-CLIP在召回率上均有显著提升。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△短文本-图像检索实验结果KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索实验结果KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索可视化,棕色文本为区分两张图片的关键细节

除此之外,CLIP的文本编码器常被用于文本到图像生成模型中,如stable diffusion系列等。但由于长文本能力的缺失,用于生成图像的文本描述通常都十分简短,无法个性化地订制各种细节。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Long-CLIP可以突破77个token的限制,实现篇章级别的图像生成(右下)。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

也可以在77个token内建模更多地细节,实现细粒度图像生成(右上)。KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

论文链接:KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://arxiv.org/abs/2403.15378KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
代码链接:KHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://github.com/beichenzbc/Long-CLIPKHf速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

再打一局游戏就睡,再刷几个视频就睡,终于放下手机,关灯睡觉了……结果翻来覆去睡不着,半夜醒来再也睡不着,为什么明明睡着了,睡眠质量却不高?3月21日是世界睡眠日,最新发布的《2024中国 3月19日,记者从中国科学院海洋研究所了解到,该所研究团队在国际上首次发布了银鲳的高质量染色体水平参考基因组。相关研究论文近日在线发表于《自然》子刊《科学数据》。银鲳广泛分布于西北太 自2023年以来,人工智能的“触角”已延伸到生活的方方面面。其中,“人工智能+情感”的赛道正悄然崛起。目前,国内外已经出现了多款较为成熟的AI伴侣应用。不少网友在社交媒体上晒出了与自己“AI 3月23日消息,据媒体报道,iPhone与百度公司已达成合作协议,百度将为苹果内置的生成式人工智能大模型提供技术支持。报道指出,iPhone生成式人工智能大模型的合作伙伴包含谷歌、百度、OpenAI等公司。国 回望一加去年的整体节奏,如果要用一个词来总结其数字系列和Ace系列的概况,那就是“卷”!从外观质感、内存性能到整机体验,与友商的相互竞争中,一加表现的都比较强势,搭配清晰的产品定位策略和稳扎稳打 3月23日20时30分许,内蒙古自治区鄂尔多斯市,约200米的高楼、磐石造型博物馆、书籍外形图书馆等主要地标建筑纷纷关闭灯光,人们在静下来的城市里感受地球的呼吸与脉动。今年“地球一小时”中国 。

本文链接:上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升http://www.sushuapos.com/show-2-4431-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 百亿tokens免费额度,清华系明星AI公司的羊毛薅起来

下一篇: 一款手游有400+个AI角色!腾讯游戏新系统炸场GDC:训练成本大减90%

热门资讯

  • 我国科研团队揭示非洲猪瘟病毒感染致病机制

    记者3月18日从兰州大学获悉,该校动物医学与生物安全学院郑海学教授团队解析了非洲猪瘟病毒(ASFV)在猪体内感染的靶细胞,以及在靶细胞内延长感染的机制

  • 洞悉竹类植物有了称手“利器”

    竹类植物是竹亚科植物的总称,与水稻、小麦、大麦和燕麦同属于禾本科BOP分支,具有重要的经济、生态和文化价值。为更好地服务竹类植物的系统进化和功

  • 活性氧响应性材料 向肠炎部位精准投药

    3月17日,记者从陆军军医大学西南医院获悉,该院消化内科教授陈磊团队联合陆军军医大学教授张定林首次提出,活性氧响应性纳米材料能够把程序性死亡配体-

  • 让肺部磁共振成像从“不可看”到“看得清”

    患者只需吸入特制的“氙气”,3.5秒后一幅人体肺部磁共振3D影像就呈现出来。影像中,气体可抵达肺部的位置清晰可见,患者的肺部微结构、气体交换功能情

  • 全国首个模拟验证机场开工

    记者日前获悉,位于四川成都未来科技城应用性科创区的民航科技创新示范区(B区)航站楼项目,近日取得施工许可证。这也意味着全国首个模拟验证机场开工。

  • 马斯克用行动反击 开源自家顶级大模型 压力给到OpenAI

      马斯克用行动反击 开源自家顶级大模型 压力给到OpenAI  《科创板日报》3月18日讯(编辑 宋子乔) 似乎是为了表明自己始终坚持对AI模型开源,马斯克做出了与阿尔特曼全然

  • “类脑”无线网络可处理数千微芯片数据

    美国布朗大学研究团队在最新一期《自然·电子学》上描述了一种无线通信网络。它可有效地传输、接收和解码来自数千个微电子芯片的数据。研究

  • 与狗互动有助放松和提高注意力

    据韩国建国大学研究人员发表在最新一期开放获取期刊《公共科学图书馆·综合》上的一项研究,与狗共度美好时光可减轻压力,同时可增强与放松和注

  • 多层人造皮肤18天内长成

    美国和法国的科学家联合团队借助新的3D打印技术,开发出一种多层人造皮肤,只需18天即可长成。这种仿真皮肤可用于提升护肤品测试效率,并催生更好的皮肤

  • 被美国诉讼垄断:iPhone回应想让苹果变成安卓!iOS开放还怎么玩

    3月22日消息,美国司法部对iPhone提起诉讼,声称其苹果生态系统构成垄断。司法部表示,iPhone将苹果生态系统视为一种垄断,以牺牲消费者、开发者和竞争对手的

  • 聚焦AI框架技术创新 加速大模型规模化落地

    “人工智能作为数字新基建重点建设方向,前景广阔,大有作为。今年的政府工作报告更首次提出开展‘人工智能+’行动,无疑将为人工智能技术在

  • 北京市青少年科学教育基地揭牌

    为构建有效联动、密切配合的青少年科学教育协同机制,提升科学教育实施效能,3月23日,北京市关心下一代工作委员会(以下简称“北京市关工委”)、北京市科

推荐资讯

  • 博鳌对话|高通公司钱:智能眼镜等将逐步成为“个人AI”入口

      中新经纬3月27日电 (王玉玲 薛宇飞)“人工智能正在从‘生成式AI’,迈向以智能体AI的新阶段。2026年是智能体之年,智能体将迎来规模化发展,这背后是终端能力的整体跃迁。”

  • 众泰汽车信披不及时收监管函

      中新经纬3月27日电 27日下午,众泰汽车公告,收到深交所监管函。  监管函显示,根据众泰汽车重整计划安排,公司应分别于2023年12月21日、2024年12月21日、2025年12月21日、20

  • 创业板指半日涨0.83% 创新药概念多股涨停

      中新经纬3月27日电 周五早盘,A股三大指数低开高走。截至午间收盘,上证指数涨0.26%,报3899.12点;深证成指涨0.93%,报13732.34点;创业板指涨0.83%,报3299.57点。  沪深两市半日

  • 三连涨长飞光纤:部分产品单价波动对业绩影响需综合判断

      中新经纬3月26日电 26日盘后,长飞光纤发布《关于股票交易异常波动的公告》称,当前国内外光纤光缆市场供需结构有一定改善,但部分产品的阶段性单价波动对公司未来业绩的影响

  • 美股三大指数收涨!ARM涨超16%,国际油价跌超2%

      中新经纬3月26日电 国际油价回落,美国股市出现回暖。当地时间25日,美股三大指数集体收涨,道指涨0.66%,纳指涨0.77%,标普500指数涨0.54%。  美国大型科技股多数上涨,亚马逊涨

  • 三亚通报“两颗榴莲坑150”:情况属实,拟罚6万元

      中新经纬3月25日电 据微信号“三亚发布”25日消息,海南省三亚市综合行政执法局发布情况通报称,2026年3月22日,关注到有网民反映“两颗榴莲坑150 无照经营 遥控鬼称”的情况

  • 工信部:前2月电信业务收入同比降1.7%

      中新经纬3月25日电 工信部网站25日披露2026年前2个月通信业经济运行情况。其中提到,前2个月,电信业务收入累计完成2904亿元,同比下降1.7%。  工信部称,前2个月,通信业运行

  • 金价过山车,黄金基金要继续拿吗?

      中新经纬3月25日电 (周奕航)“黄金基金亏麻了,我要躺平了。”“由盈转亏,黄金基金还要不要继续拿着?”……近日,在社交平台上,关于黄金基金该持有还是赎回的讨论持续升温。 

  • 洲际油气高息借钱,还压上核心资产

      中新经纬3月25日电 (张澍楠)贷款利率10.5%、核心资产担保、被抵押主体资产高于合并报表总资产,这些字眼出现在洲际油气下属子公司贷款公告中。  上交所网站截图  该

  • 外媒:英国商业活动增长几近停滞

      中新经纬3月25日电 据英国《金融时报》中文网24日消息,美伊局势推高成本,英国商业活动增长几近停滞。  报道指出,一项备受关注的调查显示,英国商业活动正以自9月以来最慢

  • 石油紧缩,已经影响到韩国泡面了

      中新经纬3月24日电 据彭博社报道,中东原油短缺日益严重,影响已经传递到了韩国的食品行业。  日前,由于中东局势紧张导致石脑油供应不稳,韩国将于下月起对石脑油出口实施管

  • 纳睿雷达终止收购,股价高开低走

      中新经纬3月24日电 24日,纳睿雷达股价高开超4%,此后迅速翻绿,截至发稿跌超2%。  3月23日,纳睿雷达发布公告称,鉴于市场环境变化等因素,董事会审议通过了终止发行股份及支付

  • 日榜
  • 周榜
  • 月榜