稀疏大模型训练架构

稀疏大模型训练架构

HET是由北京大学“河图”团队提出的一种分布式训练系统,旨在解决万亿参数稀疏嵌入模型训练中的通信瓶颈问题 。该架构于2022年在VLDB会议上提出,采用参数服务器与全局规约混合通信架构,并设计了支持嵌入参数缓存的Cache Embedding Table结构及细粒度嵌入向量时钟的有限异步协议。实验表明,该架构可降低88%的通信代价,训练速度提升最高达20.68倍,支持万亿参数模型的高效训练 。

HET框架已被集成到北京大学自研的分布式深度学习系统“河图”(Hetu)中并开源 。河图系统是一个兼顾创新性和可用性的分布式深度学习系统,于2021年开源,曾入选“AI中国”2021年度十大开源事件,并在腾讯等公司的业务场景中得到应用 。

想要了解更多“稀疏大模型训练架构”的信息,请点击:稀疏大模型训练架构百科