从零学大语言模型 L5:GPU | 斯坦福 CS336 2025年春季

143次播放
2025-06-27

视频的核心内容是讲解GPU的工作原理、性能优化技巧以及如何利用这些知识加速深度学习模型。首先介绍了GPU的架构,包括流多处理器(SM)、线程块(block)、线程束(warp)等概念,并强调了内存层次的重要性。接着分析了GPU性能优化的关键策略,如降低精度(混合精度)、算子融合、重计算、内存合并(coalescing)和分块(tiling)。最后以FlashAttention为例,展示了如何结合这些技术实现高效的注意力计算,避免全局内存的频繁访问。

关键信息:GPU的SIMT执行模型、内存层次(寄存器、共享内存、全局内存)、性能优化六技巧(条件分支、低精度、算子融合、重计算、内存合并、分块)、FlashAttention通过在线softmax和分块实现亚二次内存访问。

课件与代码:https://cs336.stanford.edu/spring2025/