从零学大语言模型 L7:并行计算1 | 斯坦福 CS336 2025 春季

130次播放
2025-06-27

视频 AI 总结:本讲座是系统课程的第二部分,专注于多机优化,旨在解决大规模模型训练中单GPU内存和计算不足的问题。核心内容包括数据并行(如ZeRO阶段1-3和FSDP)、模型并行(流水线并行和张量并行)以及激活并行(序列并行),并讨论了如何结合这些策略实现高效训练。讲座还涵盖了网络拓扑对并行策略的影响,以及实际案例(如Megatron LLM、Llama3、Gemma2)中的并行配置。最后给出了简单的规则:先使用张量并行(限于节点内),再用流水线并行或ZeRO 3实现内存扩展,最后用数据并行扩展算力。

关键信息: 1. 多机并行化的动机:模型太大无法单GPU训练,且需要线性扩展计算和内存。 2. 数据并行:复制参数,分割批次,通过Allreduce同步梯度;ZeRO优化通过分片优化器状态、梯度和参数降低内存。 3. 模型并行:流水线并行按层分割,存在气泡问题,需大批次掩盖;张量并行按矩阵切分,通信量大,适合节点内高速互连。 4. 激活并行:序列并行处理非矩阵运算(如LayerNorm),进一步减少激活内存。 5. 组合策略:3D/4D并行,常见顺序为张量并行→流水线并行/ZeRO 3→数据并行。

课件与代码: https://cs336.stanford.edu/spring2025/