快讯科技财经汽车社会旅游娱乐时尚健康生活科学教育

热搜：极空间携手活力中国调羊小咩便荔于古德伍德前5个月全远东酒店实第31届上海 2026央行一

首页 > 科技

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

发布时间: 2024-04-30 08:38:11 来源：量子位

观看：256

吞吐量比FP16提升2.65倍

克雷西发自凹非寺
量子位 | 公众号 QbitAI

FP8和更低的浮点数量化精度，不再是H100的“专利”了！

老黄想让大家用INT8/INT4，微软DeepSpeed团队在没有英伟达官方支持的条件下，硬生生在A100上跑起FP6。

测试结果表明，新方法TC-FPx在A100上的FP6量化，速度接近甚至偶尔超过INT4，而且拥有比后者更高的精度。

在此基础之上，还有端到端的大模型支持，目前已经开源并集成到了DeepSpeed等深度学习推理框架中。

这一成果对大模型的加速效果也是立竿见影——在这种框架下用单卡跑Llama，吞吐量比双卡还要高2.65倍。

一名机器学习研究人员看了后表示，微软的这项研究简直可以用crazy来形容。

表情包也第一时间上线，be like：

英伟达：只有H100支持FP8。
微软：Fine，我自己搞定。

那么，这个框架到底能实现什么样的效果，背后又采用了什么样的技术呢？

用FP6跑Llama，单卡比双卡还快

在A100上使用FP6精度，带来的是内核级的性能提升。

研究人员选取了不同大小的Llama模型和OPT模型之中的线性层，在NVIDIA A100-40GB GPU平台上，使用CUDA 11.8进行了测试。

结果相比于英伟达官方的cuBLAS（W16A16）和TensorRT-LLM（W8A16），TC-FPx（W6A16）速度提升的最大值分别是2.6倍和1.9倍。

相比于4bit的BitsandBytes（W4A16）方法，TC-FPx的最大速度提升则是达到了8.9倍。

（W和A分别代表权重量化位宽和激活量化位宽）

△归一化数据，以cuBLAS结果为1

同时，TC-FPx内核还减少了对DRAM内存的访问，并提高了DRAM带宽利用率和Tensor Cores利用率，以及ALU和FMA单元的利用率。

在TC-FPx基础之上设计的端到端推理框架FP6-LLM，也给大模型带来了显著的性能提高。

以Llama-70B为例，用FP6-LLM在单卡上的运行吞吐量，比FP16在双卡上还要高出2.65倍，在16以下的批大小中的延迟也低于FP16。

而对于参数量小一些的模型OPT-30B（FP16也使用单卡），FP6-LLM同样带来了明显的吞吐量提升和延迟降低。

而且单卡FP16在这种条件下最多支持的批大小只有4，FP6-LLM却可以在批大小为16的情况下正常运行。

那么，微软团队是怎样实现在A100上运行FP16量化的呢？

重新设计内核方案

为了实现对包括6bit在内精度的支持，TC-FPx团队设计了一个统一的内核方案，可以支持不同位宽的量化权重。

相比于传统的双内核方法，TC-FPx通过将去量化和矩阵乘法融合在单个内核中，减少了内存访问次数，提高了性能。

实现低精度量化的核心奥义则是通过去量化方式，将FP6精度的数据“伪装”成FP16，然后按照FP16的格式交给GPU进行运算。

同时团队还利用了位级预打包技术，解决GPU内存系统对非2的幂次位宽（如6-bit）不友好的问题。

具体来说，位级预打包是在模型推理之前对权重数据进行重新组织，包括将6-bit量化的权重重新排列，以便它们能够以GPU内存系统友好的方式进行访问。

此外，由于GPU内存系统通常以32位或64位的块进行数据访问，位级预打包技术将还会6-bit权重打包，使得它们能够以这些对齐的块的形式存储和访问。

预打包完成后，研究团队使用SIMT核心的并行处理能力，对寄存器中的FP6权重执行并行去量化，生成FP16格式的权重。

去量化后的FP16权重在寄存器中被重构，然后送入Tensor Core，使用重构后的FP16权重执行矩阵乘法运算，完成线性层的计算。

在此过程中，团队利用了SMIT核心的位级并行性，提高了整个去量化过程的效率。

而为了权重重构任务能够并行运行，团队还使用了一种并行权重拼接技术。

具体来说，每个权重被分割成几个部分，每个部分的位宽是2的幂次（如把6分割成2+4或4+2）。

在去量化之前，权重首先从共享内存加载到寄存器中。由于每个权重被分割成多个部分，需要在运行时在寄存器级别重构完整的权重。

为了减少运行时的开销，TC-FPx提出了一种并行提取和拼接权重的方法。这种方法使用两组寄存器来存储32个FP6权重的片段，并行地重构这些权重。

同时，为了并行提取和拼接权重，需要确保初始数据布局满足特定的顺序要求，因此TC-FPx通过在运行前对权重片段进行重排。

此外，TC-FPx还设计了一个软件流水线，将去量化步骤与Tensor Core的矩阵乘法操作融合在一起，通过指令级并行性提高了整体的执行效率。

论文地址：
https://arxiv.org/abs/2401.14112
参考链接：
https://twitter.com/rohanpaul_ai/status/1784599257384727044

　　诺贝尔化学奖获得者阿龙・切哈诺沃：做研究保持好奇心很重要　　中新网宁波3月17日电(林波)对于学生而言，如何找到研究的信心和价值，让他们有继续下去的动力？　　“做研究保持好奇心很重要。”3月17日，2004年诺贝尔化学记者19日从兰州大学获悉，天华肉羊通过国家畜禽遗传资源委员会审定鉴定，成为我国首个适应高寒气候的肉羊品种。该品种由兰州大学草地农业科技学院李发弟教授和乐祥鹏教授团队，联合甘肃省武威市天记者3月20日从中国科学技术大学获悉，该校郭光灿院士团队在量子态分辨研究中取得重要进展：他们在最小资源消耗的量子态分辨问题中首次提出了全局最优自适应策略，并发展了自适应集体测量实验技术，南方财经全媒体记者马嘉璐广州报道如何划分一般数据、重要数据、核心数据终于有了国标版“参考答案”。3月21日，国家标准GB/T 43697-2024《数据安全技术数据分类分级规则》（以下简自2023年以来，人工智能的“触角”已延伸到生活的方方面面。其中，“人工智能+情感”的赛道正悄然崛起。目前，国内外已经出现了多款较为成熟的AI伴侣应用。不少网友在社交媒体上晒出了与自己“AI 瑞士洛桑联邦理工学院工程学院研究团队制造了一种用于内存的新型纳米流体设备，这使他们第一次能连接两个“人工突触”。该设备为受大脑启发的液体硬件设计铺平了道路。这项研究发表在最新一期。

本文链接：单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源http://www.sushuapos.com/show-2-5562-0.html

声明：本网站为非营利性网站，本网页内容由互联网博主自发贡献，不代表本站观点，本站不承担任何法律责任。天上不会到馅饼，请大家谨防诈骗！若有侵权等问题请及时与本网联系，我们将在第一时间删除处理。

上一篇：字节跳动反腐持续加压大厂高举反舞弊大旗

下一篇： “人工智能＋”浪潮下，财务领域如何突围？

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

克雷西发自凹非寺
量子位 | 公众号 QbitAI

用FP6跑Llama，单卡比双卡还快

△归一化数据，以cuBLAS结果为1

重新设计内核方案

热门资讯

推荐资讯

科技最热文章

单卡跑Llama 70B快过双卡，微软硬生生把FP6搞到了A100里 | 开源

克雷西 发自 凹非寺tPl速刷资讯——每天刷点最新资讯，了解这个世界多一点SUSHUAPOS.COM量子位 | 公众号 QbitAI

用FP6跑Llama，单卡比双卡还快

△归一化数据，以cuBLAS结果为1

重新设计内核方案

热门资讯

推荐资讯

科技最热文章

克雷西发自凹非寺
量子位 | 公众号 QbitAI