58行代码把Llama 3扩展到100万上下文，任何微调版都适用

发布时间: 2024-05-08 09:13:13 来源：量子位

观看：233

大模型进入组装时代

堂堂开源之王Llama 3，原版上下文窗口居然只有……8k，让到嘴边的一句“真香”又咽回去了。

在32k起步，100k寻常的今天，这是故意要给开源社区留做贡献的空间吗？

开源社区当然不会放过这个机会：

现在只需58行代码，任何Llama 3 70b的微调版本都能自动扩展到1048k（一百万）上下文。

背后是一个LoRA，从扩展好上下文的Llama 3 70B Instruct微调版本中提取出来，文件只有800mb。

接下来使用Mergekit，就可以与其他同架构模型一起运行或直接合并到模型中。

所使用的1048k上下文微调版本，刚刚在流行的大海捞针测试中达到全绿（100%准确率）的成绩。

不得不说，开源的进步速度是指数级的。

1048k上下文LoRA怎么炼成的

首先1048k上下文版Llama 3微调模型来自Gradient AI，一个企业AI解决方案初创公司。

而对应的LoRA来自开发者Eric Hartford，通过比较微调模型与原版的差异，提取出参数的变化。

他先制作了524k上下文版，随后又更新了1048k版本。

首先，Gradient团队先在原版Llama 3 70B Instruct的基础上继续训练，得到Llama-3-70B-Instruct-Gradient-1048k。

具体方法如下：

调整位置编码：用NTK-aware插值初始化RoPE theta的最佳调度，进行优化，防止扩展长度后丢失高频信息
渐进式训练：使用UC伯克利Pieter Abbeel团队提出的Blockwise RingAttention方法扩展模型的上下文长度

值得注意的是，团队通过自定义网络拓扑在Ring Attention之上分层并行化，更好地利用大型GPU集群来应对设备之间传递许多KV blocks带来的网络瓶颈。

最终使模型的训练速度提高了33倍。

长文本检索性能评估中，只在最难的版本中，当“针”藏在文本中间部分时容易出错。

有了扩展好上下文的微调模型之后，使用开源工具Mergekit比较微调模型和基础模型，提取参数的差异成为LoRA。

同样使用Mergekit，就可以把提取好的LoRA合并到其他同架构模型中了。

合并代码也由Eric Hartford开源在GitHub上，只有58行。

目前尚不清楚这种LoRA合并是否适用于在中文上微调的Llama 3。

不过可以看到，中文开发者社区已经关注到了这一进展。

524k版本LoRA：
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-524k-adapter

1048k版本LoRA：
https://huggingface.co/cognitivecomputations/Llama-3-70B-Gradient-1048k-adapter

合并代码：
https://gist.github.com/ehartford/731e3f7079db234fa1b79a01e09859ac

参考链接：
[1]https://twitter.com/erhartford/status/1786887884211138784

随着历史的车轮驶入2024年，大模型、AIGC等话题引发广泛热议，云计算与AI技术展现出了前所未有的深度融合趋势，就如同寒武纪的生物大爆发，激发着各行各业的创新浪潮。新质生产力时代到来，政企用云进据英国《金融时报》网站3月13日报道，科学家们已经在利用人工智能(AI)阐释人体所谓的“黑暗基因组”，并开发一种可能很强大的癌症检测、监测和治疗新方法。美国约翰斯·霍普金斯大学的研记者3月20日从中国科学院地质与地球物理研究所获悉，该所科研人员在东北黑土区开展了大范围的野外调查和样品采集工作，通过分析采集的黑土样品发现，黑土物质最初都是由风力搬运而来。相关研究成 21世纪经济报道记者雷晨北京报道随着人工智能技术的飞速发展，Kimi概念股成为资本市场的新宠。3月21日，受Kimi智能助手技术突破的催化，相关概念股集体走高，市场对AI板块的热情再次被点燃　　英伟达AI风暴席卷医疗行业 “AI制药”是风口还是泡沫？　　季媛媛　　全球医疗健康行业正刮起最强AI风暴。　　当地时间3月18日，全球瞩目的顶级AI盛会――英伟达2024年GPU技术大会(NVIDIA GTC 2024)正式开幕。据相关近日有消息称，huaweiMate60已经停产。作为huawei于2023年8月末发布的最新旗舰机型，huaweiMate60的停产意味着huawei新款旗舰或即将上市，接替Mate60。2023年8月29日，huaweiMate60 Pro、huaweiMate60等。

本文链接：58行代码把Llama 3扩展到100万上下文，任何微调版都适用http://www.sushuapos.com/show-2-5684-0.html

声明：本网站为非营利性网站，本网页内容由互联网博主自发贡献，不代表本站观点，本站不承担任何法律责任。天上不会到馅饼，请大家谨防诈骗！若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。

上一篇：上海期智研究院全球招人才！人工智能/信息安全/量子智能方向的来

下一篇：《嬛嬛朕emo啦》但马斯克！阿里这项技术开放试玩

58行代码把Llama 3扩展到100万上下文，任何微调版都适用

1048k上下文LoRA怎么炼成的

热门资讯

推荐资讯

科技最热文章