从零学大语言模型 L13:数据 1 | 斯坦福CS336 2025 春季

108次播放
2025-06-27

视频 AI 总结:本视频深入探讨了数据在语言模型训练中的核心地位,指出数据比架构、优化器等因素更能决定模型质量。讲师回顾了从BERT到现代模型的预训练数据来源(如Common Crawl、Wikipedia、GitHub等),分析了各种数据集的特性、过滤方法(基于规则与基于模型)以及数据处理的细节。同时,视频也讨论了中训练和后训练阶段的数据构造(如指令遵循数据、合成数据),并涉及版权与公平使用等法律伦理问题。最终强调,数据是区分语言模型能力的关键,但整个领域仍依赖大量启发式方法,充满挑战与机遇。

主要内容

  • 数据是语言模型成功的首要因素,比架构更关键。
  • 预训练数据主要来自Common Crawl,但需经过严格过滤(如CCNet、C4、FineWeb等)。
  • 质量过滤方法从早期规则(Gopher规则)转向模型化分类器(fastText、教育价值评分)。
  • 中训练聚焦能力增强(如数学、代码、长上下文),后训练依赖指令遵循与合成数据(Alpaca、Vicuna等)。
  • 版权问题复杂:大多数网页受版权保护,训练依赖“公平使用”原则或商业许可。

课件与代码: https://cs336.stanford.edu/spring2025/