稀疏大模型训练架构
HET是由北京大学“河图”团队提出的一种分布式训练系统,旨在解决万亿参数稀疏嵌入模型训练中的通信瓶颈问题。该架构于2022年在VLDB会议上提出,采用参数服务器与全局规约混合通信架构,并设计了支持嵌入参数缓存的Cache Embedding Table结构及细粒度嵌入向量时钟的有限异步协议。实验表明,该架构可降低88%的通信代价,训练速度提升最高达20.68倍,支持万亿参数模型的高效训练。HET框架已被集成到北京大学自研的分布式深度学习系统“河图”(Hetu)中并开源。河图系
