设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

发布时间: 2024-03-26 17:05:38 来源: 量子位

详细上手教程已发布在GitHubwgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个开源的类Sora架构视频生成模型,来了!wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

整个训练流程,包括数据处理所有训练细节和模型权重,全部开放。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这就是刚刚发布的Open-Sora 1.0。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

它带来的实际效果如下,能生成繁华都市夜景中的车水马龙。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

还能用航拍视角,展现悬崖海岸边,海水拍打着岩石的画面。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

亦或是延时摄影下的浩瀚星空。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

自Sora发布以来,由于效果惊艳但技术细节寥寥,揭秘、复现Sora成为了开发社区最热议话题之一。比如Colossal-AI团队推出成本直降46%的Sora训练推理复现流程。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

短短两周时间后,该团队再次发布最新进展,复现类Sora方案,并将技术方案及详细上手教程在GitHub上免费开源。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

那么问题来了,复现Sora如何实现?wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Open-Sora 开源地址:https://github.com/hpcaitech/Open-SorawgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全面解读Sora复现方案

Sora复现方案包括四个方面:wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  • 模型架构设计
  • 训练复现方案
  • 数据预处理
  • 高效训练优化策略

模型架构设计

模型采用了Sora同源架构Diffusion Transformer (DiT) 。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

它以采用DiT架构的高质量开源文生图模型PixArt-α为基座,在此基础上引入时间注意力层,将其扩展到视频数据上。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

具体来看,整个架构包括一个预训练好的VAE,一个文本编码器和一个利用空间-时间注意力机制的STDiT (Spatial Temporal Diffusion Transformer)模型。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

其中,STDiT 每层的结构如下图所示。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

它采用串行的方式在二维的空间注意力模块上叠加一维的时间注意力模块,用于建模时序关系。在时间注意力模块之后,交叉注意力模块用于对齐文本的语意。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

与全注意力机制相比,这样的结构大大降低了训练和推理开销wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

与同样使用空间-时间注意力机制的 Latte模型相比,STDiT 可以更好的利用已经预训练好的图像 DiT 的权重,从而在视频数据上继续训练。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

△STDiT结构示意图wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

整个模型的训练和推理流程如下。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据了解,在训练阶段首先采用预训练好的Variational Autoencoder (VAE)的编码器将视频数据进行压缩,然后在压缩之后的潜在空间中与文本嵌入(text embedding)一起训练STDiT扩散模型。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在推理阶段,从VAE的潜在空间中随机采样出一个高斯噪声,与提示词嵌入(prompt embedding)一起输入到STDiT中,得到去噪之后的特征,最后输入到VAE的解码器,解码得到视频。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

△模型训练流程wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

训练复现方案

在训练复现部分,Open-Sora参考了Stable Video Diffusion (SVD)。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一共分为3个阶段:wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

  1. 大规模图像预训练;
  2. 大规模视频预训练;
  3. 高质量视频数据微调。

每个阶段都会基于前一个阶段的权重继续训练。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

相比于从零开始单阶段训练,多阶段训练通过逐步扩展数据,更高效地达成高质量视频生成的目标。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

训练方案三阶段wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

第一阶段是大规模图像预训练wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

团队利用互联网上丰富的图像数据和文生图技术,先训练出一个高质量的文生图模型,将该模型作为下一阶段视频预训练的初始化权重。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时,由于目前没有高质量的时空VAE,他们采用Stable Diffusion预训练好的图像VAE。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这样不仅能保障初始模型的优越性能,还能显著降低视频预训练的整体成本。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

第二阶段是大规模视频预训练wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这一阶段主要增加模型的泛化能力,有效掌握视频的时间序列关联。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

它需要使用大量视频数据训练,并且保障视频素材的多样性。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时,第二阶段的模型在第一阶段文生图模型的基础上加入了时序注意力模块,用于学习视频中的时序关系。其余模块与第一阶段保持一致,并加载第一阶段权重作为初始化,同时初始化时序注意力模块输出为零,以达到更高效更快速的收敛。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Colossal-AI团队使用了PixArt-alpha的开源权重作为第二阶段STDiT模型的初始化,以及采用了T5模型作为文本编码器。他们采用了256×256的小分辨率进行预训练,进一步增加了收敛速度,降低训练成本。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

△Open-Sora生成效果(提示词:水中世界的镜头,镜头中一只海龟在珊瑚礁间悠然游弋)wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

第三阶段是高质量视频数据微调wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

据介绍,这一阶段能显著提升模型的生成质量。使用的数据规模比上一阶段降低一个量级,但是视频的时长、分辨率和质量都更高。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

通过这种方式进行微调,能实现视频生成从短到长、从低分辨率到高分辨率、从低保真度到高保真度的高效扩展。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

值得一提的是,Colossal-AI还详细透露了每阶段的资源使用情况。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在Open-Sora的复现流程中,他们使用了64块H800进行训练。第二阶段的训练量一共是 2808 GPU hours,约合7000美元,第三阶段的训练量是1920 GPU hours,大约4500美元。经过初步估算,整个训练方案成功把Open-Sora复现流程控制在了1万美元左右。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

数据预处理

为了进一步降低Sora复现的门槛和复杂度,Colossal-AI团队在代码仓库中还提供了便捷的视频数据预处理脚本,让大家可以轻松启动Sora复现预训练。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

包括公开视频数据集下载、长视频根据镜头连续性分割为短视频片段、使用开源大语言模型LLaVA生成精细的提示词。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

他们提供的批量视频标题生成代码可以用两卡 3 秒标注一个视频,并且质量接近于 GPT-4VwgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

最终得到的视频/文本对可直接用于训练。借助他们在GitHub上提供的开源代码,可以轻松地在自己的数据集上快速生成训练所需的视频/文本对,显著降低了启动Sora复现项目的技术门槛和前期准备。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

高效训练加持

除此之外,Colossal-AI团队还提供了训练加速方案。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

通过算子优化和混合并行等高效训练策略,在处理64帧、512×512分辨率视频的训练中,实现了1.55倍的加速效果wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时,得益于Colossal-AI的异构内存管理系统,在单台服务器上(8H800)可以无阻碍地进行1分钟的1080p高清视频训练任务。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

而且团队还发现STDiT模型架构在训练时也展现出卓越的高效性。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

和采用全注意力机制的DiT相比,随着帧数的增加,STDiT实现了高达5倍的加速效果,这在处理长视频序列等现实任务中尤为关键。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重

团队和量子位透露,他们将长期更新优化Open-Sora的相关解决方案和动态。未来将使用更多视频训练数据,以生成更高质量、更长时长的视频内容,并支持多分辨率特性。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

实际应用方面,团队透露将推进在电影、游戏、广告等领域落地。wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

感兴趣的开发者们,可访问GitHub项目了解更多~wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Open-Sora 开源地址:https://github.com/hpcaitech/Open-SorawgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

参考链接:
[1]https://arxiv.org/abs/2212.09748 Scalable Diffusion Models with Transformers
[2]https://arxiv.org/abs/2310.00426 PixArt-α: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis
[3]https://arxiv.org/abs/2311.15127 Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets
[4]https://arxiv.org/abs/2401.03048 Latte: Latent Diffusion Transformer for Video Generation
[5]https://huggingface.co/stabilityai/sd-vae-ft-mse-originalwgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
[6]https://github.com/google-research/text-to-text-transfer-transformerwgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
[7]https://github.com/haotian-liu/LLaVAwgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
[8]https://hpc-ai.com/blog/open-sora-v1.0wgC速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

英国“我超爱科学”网站1月1日刊登题为《什么是“时空连续体”?》的文章,作者是斯蒂芬·伦茨,内容编译如下:“时空连续体”(space-time continuum)是源自于大多数人听说过却未必完全了解的 3月21日,由安徽省工业和信息化厅指导、中国光伏行业协会主办、阳光电源股份有限公司承办的“PAT2024爱光伏一生一世”先进技术研讨会在合肥举办。光储高压先进技术发布会现场。阳光电源股份有 记者3月21日从中国科学技术大学获悉,该校物理学院张斗国教授课题组,提出并实现了一种基于矢量光场调控原理的动量空间偏振滤波器件。该滤波器件安装于传统无标记光学显微镜后,可采集到单个纳米 3月23日消息,据媒体报道,iPhone与百度公司已达成合作协议,百度将为苹果内置的生成式人工智能大模型提供技术支持。报道指出,iPhone生成式人工智能大模型的合作伙伴包含谷歌、百度、OpenAI等公司。国 作为月之暗面的创始人,杨植麟常把他的AGI梦想形容为“登月计划”,长文本就是这个伟大计划的第一步。但现在,随着Kimi的爆火出圈,赛道瞬间变得拥挤,24小时内,阿里、360、百度紧急“出手”,纷 3月23日20时30分许,内蒙古自治区鄂尔多斯市,约200米的高楼、磐石造型博物馆、书籍外形图书馆等主要地标建筑纷纷关闭灯光,人们在静下来的城市里感受地球的呼吸与脉动。今年“地球一小时”中国 。

本文链接:全球首个类Sora开源复现方案来了!全面公开训练细节和模型权重http://www.sushuapos.com/show-2-4206-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 大模型落地“诸神之战”,场景玩家先杀出重围了

下一篇: 英伟达新核弹B200发布,一台服务器顶一个超算,AI推理30倍加速

热门资讯

推荐资讯

  • 2026总结三个办法:抖音月付4000怎么套出来!

    抖音月付作为购物支付工具,可以为用户提供一定的消费额度,方便用户在抖音平台内进行购物。 然而,很多用户在使用过程中,会遇到月付额度剩余,却无法直接提取出来的问题。 下面,小创

  • 彼得·蒂尔:现代人内心最大的恐惧丨Findme

    这篇是彼得·蒂尔2004年写的文章。是我之前的直播记录,用AI整理成文本。这是讲《施特劳斯时刻》的第二期,顺序上,应该在前几篇文章更前头,只是发稿顺

  • Kimi紧急叫停新订阅:模型效率提升,算力缺口却在扩大

    (文/连政 编辑/吕栋) 近期,月之暗面Kimi、阿里千问接连发布新模型,中国模型在参数规模、长上下文和推理成本上持续推进,引发外媒关注。但Kimi K3上线后,其需求迅速增长,也让月之

  • 长鑫被弃购658.62万股

    7月21日,长鑫科技打新结果出炉。 根据长鑫科技发布的结果公告,公司本次发行价格为8.66元/股,初始发行股份数量为66.88亿股,占发行后总股本约10%。最终战略配售数量为16.67亿股,

  • 88%的企业在砸钱,8%在赚钱:AI落地的瓶颈不在模型,在流程

    (文/张志峰 编辑/吕栋) Gartner调研显示,88%的企业计划在2026年继续加码AI投入;行业整合数据显示,在中国仅有8%的企业确认从AI中获得可量化的实际财务回报。 埃森哲7月发布《2

  • 知识:抖音月付大额怎么套取出来?

    抖音是目前非常热门的软件了,几乎是人人都必备的软件,上至70几岁的老人,下至几岁的小孩,人人刷抖音消耗了我们大量的时间。如今抖音也和头条一样推出了借kuan软件,叫做dou分

  • 指教:抖音月付如何取到银行卡!

    大家在急yong钱的时候肯定会想到抖音月付,不需要很复杂的程序就能把抖音月付额度换成现金,解决燃眉之急!抖音月付只能通过抖音商城平台,无论是抖音自营店铺还是抖音个人C店都可

  • 小二分享解说秒到攻略-抖音月付3000怎么套出来!

    抖音月付额度怎么提现?这是很多抖音用户关心的问题。月付额度是指用户在抖音上获得的收入,月底可以提现到自己的银行账户。 但是,具体怎么提现呢?下面,我们就来分享一下最新2026

  • 2026讲述三个办法:抖音月付怎么最快提出来!

    抖音上线了一款叫做抖音月付的信用产品功能,在使用月付在抖音上面买产品衣服商品提现额度,其实很早之前抖音就开始测试这款产品功能了,怎么才能吧抖音月付额度提取出来做法很简

  • 独学:抖音月付大额怎么套取出来?

    抖音月付是抖音推出的一项付费服务,用户可以在抖音上享受更多的特权和优惠。但是,有些用户可能不知道怎样将抖音月付提取到威信账户。 首先,需要进入抖音月付的提现页面,然后选

  • K3蒸馏美国人模型?还是未公布的?Kimi否认

    中国开源大模型Kimi K3近日以亮眼成绩在全球爆红,但美国人工智能公司Anthropic CEO阿莫代伊在出席美国国会AI安全听证会时,却声称K3蒸馏了其模型,甚至是一款“尚未公开的未

  • 空缺四个月,永泰运终于迎来新董秘|董秘沙龙

    来源|时代商业研究院作者|实习生陈嘉雯、韩迅编辑|韩迅

  • 日榜
  • 周榜
  • 月榜