从零学大语言模型 L11:规模定律2 | 斯坦福CS336 2025 春季

136次播放
2025-06-27

视频是规模定律讲座的第二部分,重点通过实际案例研究(Cerebras-GPT、MiniCPM、DeepSeek等)讲解现代语言模型构建者如何利用缩放定律进行模型设计。内容包括:muP参数化方法的数学推导与实证验证,WSD学习率调度用于高效Chinchilla分析,以及不同模型(如Llama 3、Hunyuan、MiniMax)的规模策略。核心结论是muP能使超参数(如学习率)跨规模稳定,WSD调度可减少计算开销,而Chinchilla规模定律在实践中具有可预测性但具体参数因模型而异。

关键信息:1. muP通过调整初始化和每层学习率实现超参数稳定;2. WSD学习率允许单次训练完成数据缩放分析;3. DeepSeek直接拟合学习率和批大小的缩放定律;4. MiniCPM使用muP和WSD实现高效缩放;5. 现代模型(如Llama 3)倾向于更高的token/参数比(约40:1)。

课件与代码: https://cs336.stanford.edu/spring2025/