消费级GPU即可微调3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
“只需”10万美元,训练Llama-2级别的大模型。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
尺寸更小但性能不减的MoE模型来了:3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
它叫JetMoE,来自MIT、普林斯顿等研究机构。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
性能妥妥超过同等规模的Llama-2。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM△贾扬清转发3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
要知道,后者可是数十亿美元级别的投入成本。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

JetMoE发布即完全开源,且学术界友好:仅使用公开数据集和开源代码,用消费级GPU就能进行微调。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
不得说,大模型的打造成本,真的比人们想的要便宜更多了。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
Ps. Stable Diffusion前老板Emad也点了赞:3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

10万美刀实现Llama-2性能
JetMoE启发于ModuleFormer的稀疏激活架构。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
(ModuleFormer,一种基于稀疏专家混合(SMoE)的模块化架构,可提高大模型效率和灵活性,去年6月提出)3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
它的注意力层中仍然使用了MoE:3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
80亿参数的JetMoE一共有24个区块,每块包含2个MoE层,分别是注意力头混合 (MoA) 和MLP专家混合 (MoE)。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
每个MoA和MoE层又有8个专家,每次输入token激活2个。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

JetMoE-8B使用公开数据集中的1.25T token进行训练,学习率5.0 x 10-4,全局batch size为4M token。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
具体训练方案遵循MiniCPM(来自面壁智能,2B模型就能赶超Mistral-7B)的思路,共包含两阶段:3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
第一阶段使用线性预热的恒定学习率,用来自大规模开源预训练数据集的1万亿个token进行训练,这些数据集包括RefinedWeb、Pile、Github data等等。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

第二阶段则使用指数学习率衰减,用2500亿个token训练来自第一阶段数据集和超高质量开源数据集的token。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

最终,团队使用96×H100的GPU集群,花费2周时间、约8万美元搞定JetMoE-8B。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
更多技术细节将在不久后发布的技术报告上揭露。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
而在推理过程中,由于JetMoE-8B仅具有22亿个激活参数,因此计算成本大大降低——3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
同时,它还收获了不错的性能表现。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
如下图所示:3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
JetMoE-8B在8个评测基准上获得了5个sota(包括大模型竞技场Open LLM Leaderboard),超过LLaMA-13B、LLaMA2-7B和DeepseekMoE-16B。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在MT-Bench基准上得分6.681,也超过了130亿参数的LLaMA2、Vicuna等模型。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

作者介绍
JetMoE一共4位作者,分别是:3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
MIT-IBM Watson Lab研究员,研究方向NLP。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
本硕毕业于北航,博士经历于Yoshua Bengio创办的Mila研究机构。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
MIT博士在读, 研究方向为3D成像的数据高效机器学习。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
UC伯克利本科毕业,去年夏天作为学生研究员加入MIT-IBM Watson Lab,导师为Yikang Shen等人。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
普林斯顿博士在读生,本科毕业于北大应用数学和计算机科学,目前也是Together.ai 的兼职研究员,与Tri Dao合作。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
MIT博士在读,同时在创业,MyShell的AI研发主管。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
这家公司刚刚融资了1100万美元,投资者包括Transformer的作者。3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

传送门:
https://github.com/myshell-ai/JetMoE3Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
参考链接:
https://twitter.com/jiayq/status/17759358452054632923Jb速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
马斯克开源3140亿参数的Grok,大模型争相开源所为何求? 作者:刘晓洁 特斯拉CEO埃隆・马斯克(Elon Musk)给大模型领域投下一枚重磅炸弹。 北京时间3月18日凌晨,马斯克旗下大模型公司 xAI 在官网宣布开源 3140
记者3月20日从中国科学技术大学获悉,该校郭光灿院士团队在量子态分辨研究中取得重要进展:他们在最小资源消耗的量子态分辨问题中首次提出了全局最优自适应策略,并发展了自适应集体测量实验技术,
近日,我国“主要作物丰产增效科技创新工程”重点专项“优质双季超级稻丰产增效技术研发与集成示范”项目,在湖南岳阳宣布启动。据了解,该项目主要聚焦优质双季超级稻丰产增效技术研发,着力探明双
21世纪经济报道记者雷晨 北京报道随着人工智能技术的飞速发展,Kimi概念股成为资本市场的新宠。3月21日,受Kimi智能助手技术突破的催化,相关概念股集体走高,市场对AI板块的热情再次被点燃
21世纪经济报道记者王峰北京报道 近日,全球教育集团培生(NYSE:PSO)公布2023财年财报。2023财年,培生的销售额为36.74亿英镑(下同),同比下降4%,但基础销售额同比增长1%;调整后营业利润5.73亿,同
21世纪经济报道记者孔海丽、实习生邓熙涵 北京报道“民以食为天,食与民同欢”,吃得健康、吃得安全是消费者长期以来的普遍共识。当代消费者已不止于填饱肚子,而是讲求“精耕细作”。消
。
本文链接:10万美元训出Llama-2级大模型!全华人打造新型MoE,贾扬清SD前CEO围观http://www.sushuapos.com/show-2-4591-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 超巧 全智贤 宋慧乔在机场撞型,她眼睛都会笑(超巧全智贤宋慧乔在机场撞型)
下一篇: 最懂AI的诺奖经济学得主去世,大模型关键技术受他研究启发