设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

单卡跑Llama 70B快过双卡,微软硬生生把FP6搞到了A100里 | 开源

发布时间: 来源: 量子位

吞吐量比FP16提升2.65倍bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

克雷西 发自 凹非寺bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
量子位 | 公众号 QbitAI

FP8和更低的浮点数量化精度,不再是H100的“专利”了!bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

老黄想让大家用INT8/INT4,微软DeepSpeed团队在没有英伟达官方支持的条件下,硬生生在A100上跑起FP6bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

测试结果表明,新方法TC-FPx在A100上的FP6量化,速度接近甚至偶尔超过INT4,而且拥有比后者更高的精度bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在此基础之上,还有端到端的大模型支持,目前已经开源并集成到了DeepSpeed等深度学习推理框架中。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

这一成果对大模型的加速效果也是立竿见影——在这种框架下用单卡跑Llama,吞吐量比双卡还要高2.65倍。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一名机器学习研究人员看了后表示,微软的这项研究简直可以用crazy来形容。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

表情包也第一时间上线,be like:bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

英伟达:只有H100支持FP8。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

微软:Fine,我自己搞定。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

那么,这个框架到底能实现什么样的效果,背后又采用了什么样的技术呢?bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

用FP6跑Llama,单卡比双卡还快

在A100上使用FP6精度,带来的是内核级的性能提升bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

研究人员选取了不同大小的Llama模型和OPT模型之中的线性层,在NVIDIA A100-40GB GPU平台上,使用CUDA 11.8进行了测试。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

结果相比于英伟达官方的cuBLAS(W16A16)和TensorRT-LLM(W8A16),TC-FPx(W6A16)速度提升的最大值分别是2.6倍和1.9倍。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

相比于4bit的BitsandBytes(W4A16)方法,TC-FPx的最大速度提升则是达到了8.9倍。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

(W和A分别代表权重量化位宽和激活量化位宽)bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

归一化数据,以cuBLAS结果为1

同时,TC-FPx内核还减少了对DRAM内存的访问,并提高了DRAM带宽利用率和Tensor Cores利用率,以及ALU和FMA单元的利用率。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在TC-FPx基础之上设计的端到端推理框架FP6-LLM,也给大模型带来了显著的性能提高。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

以Llama-70B为例,用FP6-LLM在单卡上的运行吞吐量,比FP16在双卡上还要高出2.65倍,在16以下的批大小中的延迟也低于FP16。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而对于参数量小一些的模型OPT-30B(FP16也使用单卡),FP6-LLM同样带来了明显的吞吐量提升和延迟降低。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而且单卡FP16在这种条件下最多支持的批大小只有4,FP6-LLM却可以在批大小为16的情况下正常运行。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

那么,微软团队是怎样实现在A100上运行FP16量化的呢?bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

重新设计内核方案

为了实现对包括6bit在内精度的支持,TC-FPx团队设计了一个统一的内核方案,可以支持不同位宽的量化权重。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

相比于传统的双内核方法,TC-FPx通过将去量化和矩阵乘法融合在单个内核中,减少了内存访问次数,提高了性能。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

实现低精度量化的核心奥义则是通过去量化方式,将FP6精度的数据“伪装”成FP16,然后按照FP16的格式交给GPU进行运算。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时团队还利用了位级预打包技术,解决GPU内存系统对非2的幂次位宽(如6-bit)不友好的问题。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

具体来说,位级预打包是在模型推理之前对权重数据进行重新组织,包括将6-bit量化的权重重新排列,以便它们能够以GPU内存系统友好的方式进行访问。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,由于GPU内存系统通常以32位或64位的块进行数据访问,位级预打包技术将还会6-bit权重打包,使得它们能够以这些对齐的块的形式存储和访问。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

预打包完成后,研究团队使用SIMT核心的并行处理能力,对寄存器中的FP6权重执行并行去量化,生成FP16格式的权重。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

去量化后的FP16权重在寄存器中被重构,然后送入Tensor Core,使用重构后的FP16权重执行矩阵乘法运算,完成线性层的计算。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在此过程中,团队利用了SMIT核心的位级并行性,提高了整个去量化过程的效率。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

而为了权重重构任务能够并行运行,团队还使用了一种并行权重拼接技术。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

具体来说,每个权重被分割成几个部分,每个部分的位宽是2的幂次(如把6分割成2+4或4+2)。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

在去量化之前,权重首先从共享内存加载到寄存器中。由于每个权重被分割成多个部分,需要在运行时在寄存器级别重构完整的权重。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

为了减少运行时的开销,TC-FPx提出了一种并行提取和拼接权重的方法。这种方法使用两组寄存器来存储32个FP6权重的片段,并行地重构这些权重。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时,为了并行提取和拼接权重,需要确保初始数据布局满足特定的顺序要求,因此TC-FPx通过在运行前对权重片段进行重排。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

此外,TC-FPx还设计了一个软件流水线,将去量化步骤与Tensor Core的矩阵乘法操作融合在一起,通过指令级并行性提高了整体的执行效率。bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

图片bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

论文地址:bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://arxiv.org/abs/2401.14112bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
参考链接:bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://twitter.com/rohanpaul_ai/status/1784599257384727044bpK速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

中国科学院深圳先进技术研究院15日发布消息称,该院科研团队研发了一种具有靶向送药功能的磁驱软体机器人,该机器人能够根据器官内部环境的特点选择合适的运动模式,实现靶向送药的同时还可以控制 美国太平洋西北国家实验室的科学家设计了一种复合装饰材料,可以储存更多二氧化碳,提供了一种既符合建筑规范,又比标准复合饰面板便宜的“负碳”选择。研究人员于18日在美国化学会春季会议上公布 据《自然》20日消息称,天文学家对91对恒星所作的光谱分析显示,大约每12个恒星中就有一个可能吞噬了一个行星。在吞噬一个行星后,恒星的化学构成可能发生改变,这个过程被称为“行星吸收”。通过比 英国科学家首次创造了一个新颖的实验平台,即“量子龙卷风”。它能模拟超流体氦中的黑洞,使研究人员能更详细地观察类似黑洞的行为以及与周围环境的相互作用。通过对超流体氦表面微波动力学的观 记者3月21日获悉,由中国科学院自动化研究所和中国科学院香港创新研究院联合研发的医疗领域AI多模态大模型——CARES Copilot 1.0日前在香港正式发布,现已面向香港神经外科医生开放使 瑞士洛桑联邦理工学院工程学院研究团队制造了一种用于内存的新型纳米流体设备,这使他们第一次能连接两个“人工突触”。该设备为受大脑启发的液体硬件设计铺平了道路。这项研究发表在最新一期 。

本文链接:单卡跑Llama 70B快过双卡,微软硬生生把FP6搞到了A100里 | 开源http://www.sushuapos.com/show-2-5562-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 字节跳动反腐持续加压 大厂高举反舞弊大旗

下一篇: “人工智能+”浪潮下,财务领域如何突围?

热门资讯

  • 明天氢能荣获国家电网科技进步奖一等奖

    记者3月18日从安徽明天氢能科技股份有限公司(以下简称明天氢能)获悉,国家电网近日向明天氢能及董事长王朝云分别授予科学技术进步奖一等奖,获奖项目为

  • 多功能金纳米花颗粒 可促进感染性组织修复

    3月17日,记者从海南大学获悉,该校化学化工学院副教授李萌婷与相关研究团队合作,合成了多功能复合金纳米花颗粒。该颗粒配合温和光热、光动力、药物控

  • 新疗法可有效治疗多发性骨髓瘤

    据埃菲社报道,多发性骨髓瘤是成年人中继淋巴瘤之后第二常见的血液肿瘤。最近,西班牙的一个科研团队开发出了一种新的免疫疗法来对抗它。实验室实验表

  • 睡不够很焦虑?专家:警惕常见睡眠认知误区

    3月21日是世界睡眠日,今年中国主题为“健康睡眠 人人共享”。人的一生约有三分之一的时间是在睡眠中度过,睡眠、运动、营养被视为保障机体正常发育和

  • 每12个恒星或有一个吞过行星

    据《自然》20日消息称,天文学家对91对恒星所作的光谱分析显示,大约每12个恒星中就有一个可能吞噬了一个行星。在吞噬一个行星后,恒星的化学构成可能发

  • 专家:警惕常见睡眠认知误区

    3月21日是世界睡眠日,中国主题为“健康睡眠 人人共享”。近日发布的《2023年中国居民睡眠白皮书》显示,我国居民平均睡眠时长6.75小时,平均在零点后入

  • “爆”脾气电池频“发火”,新成果防患于未“燃”

    近年来,电动自行车以便利性受到大众青睐,但相关起火事故威胁着居民的生命财产安全。据国家消防救援局发布的统计数据,2023年全国共接报电动自行车火灾

  • 我国建立“天-空-地-深”一体化铀矿勘查技术体系

    记者3月21日从核工业北京地质研究院(以下简称核地研院)获悉,该院自1959年成立以来,在天然铀保障、高放废物地质处置、核遥感技术与应用、分析测试等领

  • 光储行业迎来2000V新时代

    3月21日,由安徽省工业和信息化厅指导、中国光伏行业协会主办、阳光电源股份有限公司承办的“PAT2024爱光伏一生一世”先进技术研讨会在合肥举办。光

  • 尚德机构2023年净收入21.6亿元 详细披露老年教育进展

    21世纪经济报道记者王峰北京报道 近日,成人职业在线教育企业尚德机构(NYSE:STG)公布了其2023年第四季度及全年未经审计的财务报告。2023年

  • 首批未来产业创新成果惊艳亮相

    全球首台无细胞蛋白质合成生物反应器、全球首台全高温超导托卡马克装置(洪荒70)、64比特超导量子计算机研发与产业化项目、深海可燃冰探采重载作业机

  • 俄罗斯成功发射“联盟MS-25”载人飞船

    俄罗斯国家航天集团23日发布消息说,俄当天成功发射了“联盟MS-25”载人飞船。消息说,莫斯科时间23日15时36分(北京时间20时36分),“联盟MS-25”载人飞船

推荐资讯

  • 日榜
  • 周榜
  • 月榜