大模型进入组装时代s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
堂堂开源之王Llama 3,原版上下文窗口居然只有……8k,让到嘴边的一句“真香”又咽回去了。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
在32k起步,100k寻常的今天,这是故意要给开源社区留做贡献的空间吗?s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

开源社区当然不会放过这个机会:s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
现在只需58行代码,任何Llama 3 70b的微调版本都能自动扩展到1048k(一百万)上下文。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

背后是一个LoRA,从扩展好上下文的Llama 3 70B Instruct微调版本中提取出来,文件只有800mb。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
接下来使用Mergekit,就可以与其他同架构模型一起运行或直接合并到模型中。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

所使用的1048k上下文微调版本,刚刚在流行的大海捞针测试中达到全绿(100%准确率)的成绩。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

不得不说,开源的进步速度是指数级的。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

1048k上下文LoRA怎么炼成的
首先1048k上下文版Llama 3微调模型来自Gradient AI,一个企业AI解决方案初创公司。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而对应的LoRA来自开发者Eric Hartford,通过比较微调模型与原版的差异,提取出参数的变化。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
他先制作了524k上下文版,随后又更新了1048k版本。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

首先,Gradient团队先在原版Llama 3 70B Instruct的基础上继续训练,得到Llama-3-70B-Instruct-Gradient-1048k。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
具体方法如下:s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
- 调整位置编码:用NTK-aware插值初始化RoPE theta的最佳调度,进行优化,防止扩展长度后丢失高频信息
- 渐进式训练:使用UC伯克利Pieter Abbeel团队提出的Blockwise RingAttention方法扩展模型的上下文长度
值得注意的是,团队通过自定义网络拓扑在Ring Attention之上分层并行化,更好地利用大型GPU集群来应对设备之间传递许多KV blocks带来的网络瓶颈。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
最终使模型的训练速度提高了33倍。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

长文本检索性能评估中,只在最难的版本中,当“针”藏在文本中间部分时容易出错。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM


有了扩展好上下文的微调模型之后,使用开源工具Mergekit比较微调模型和基础模型,提取参数的差异成为LoRA。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
同样使用Mergekit,就可以把提取好的LoRA合并到其他同架构模型中了。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
合并代码也由Eric Hartford开源在GitHub上,只有58行。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

目前尚不清楚这种LoRA合并是否适用于在中文上微调的Llama 3。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
不过可以看到,中文开发者社区已经关注到了这一进展。s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

524k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-524k-adapters5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
1048k版本LoRA:
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-1048k-adapters5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
合并代码:
https://gist.github.com/ehartford/731e3f7079db234fa1b79a01e09859acs5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
参考链接:
[1]https://twitter.com/erhartford/status/1786887884211138784s5w速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
监管AI,欧盟出手,美国掉队? 上个世纪,科幻小说家艾萨克・阿西莫夫提出了“机器人三定律”,带来了对“机器人”与“规则”的美好幻想。 如今,伴随着ChatGPT、Sora的爆火,人工智能(AI)领域的激烈竞争,对该领域的监管
旅行推销员问题是一个经典的数学问题,也是一个组合优化问题。德国柏林弗雷大学和亥姆霍兹柏林能源与材料研究中心(HZB)科学家开展的一项新研究证明,量子计算机在解决旅行推销员问题上,相较于传统
科技日报从哈尔滨工业大学获悉,北京时间2024年3月20日8时31分28秒,“天都一号”“天都二号”通导技术试验星伴随探月工程四期鹊桥二号中继星任务搭乘长征八号遥三运载火箭从文昌航天发射场发射
我国制氢加氢一体站建设有了团体标准。记者从中国石化获悉,为推动我国氢能交通产业发展,中国石化联合国内数十家氢能头部企业发布了国内首个《制氢加氢一体站技术指南》团体标准。该标准的制定
据韩国建国大学研究人员发表在最新一期开放获取期刊《公共科学图书馆·综合》上的一项研究,与狗共度美好时光可减轻压力,同时可增强与放松和注意力相关的脑电波。动物辅助干预措施,如犬类
记者3月21日从安徽农业大学获悉,该校生命科学学院韩毅教授课题组与国内外专家合作,发现了植物避盐性的关键基因。该研究对于提高植物耐盐性,帮助盐碱地下的农作物稳产具有重要理论指导意义。相
。
本文链接:58行代码把Llama 3扩展到100万上下文,任何微调版都适用http://www.sushuapos.com/show-2-5684-0.html
声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。
上一篇: 上海期智研究院全球招人才!人工智能/信息安全/量子智能方向的来
下一篇: 《嬛嬛朕emo啦》但马斯克!阿里这项技术开放试玩