训练遭遇频繁故障

  • 训练遭遇频繁故障

    训练遭遇频繁故障

    IT之家7月28日消息,Meta发布的一份研究报告显示,其用于训练4050亿参数模型Llama3的16384个英伟达H100显卡集群在54天内出现了419次意外故障,训练遭遇频繁故障平均每三小时就有一次。其中,一半以上的故障是由显卡或其搭载的高带宽内存(HBM3)引起的。由于系统规模巨大且任务高度同步,单个显卡故障可能导致整个训练任务中断,需要重新开始。尽管如此,Meta团队还是保持了90%以上的有效训练时间。IT之家注意到,在为期54天的预预训练中,共出现了466次工作中断,其中47次是计划中断,419次是意外中...

    手机 2024-08-12 1019 0 训练遭遇频繁故障
1

最近发表