从零学大语言模型 L12:评估 | 斯坦福CS336 2025 春季

109次播放
2025-06-27

视频 AI 总结:该视频深入探讨了语言模型(如 GPT、Claude 等)的评估问题,指出评估看似简单实则复杂,涉及多种基准(如 MMLU、GPQA、Chatbot Arena 等)和评估维度(如能力、安全性、成本等)。核心观点是评估结果高度依赖目标(如用户决策、研究进步或政策制定),且当前面临基准饱和、训练-测试重叠、游戏化等危机,同时强调安全评估和实际部署的重要性。

主要内容

  • 评估是机械过程,但深刻影响模型开发方向,存在“评估危机”。
  • 介绍多种基准:MMLU(知识测试)、MMLU-Pro(更难的版本)、GPQA(博士级问题)、Humanity's Last Exam(极难问题)、Chatbot Arena(人类偏好)、IFEval(指令遵循)、AlpacaEval(自动评估)等。
  • 评估涉及输入选择、提示策略、输出评估和结果解释,需注意训练-测试重叠和数据质量问题。
  • 智能体基准如 SWEBench、CyBench、MLEBench 评估代码生成、网络安全和机器学习实验能力。
  • 安全基准如 HarmBench、AIR-Bench 测试模型拒绝有害指令的能力,但存在拒绝-能力平衡和越狱问题。
  • 实际部署中,真实用户查询与标准化考试不同,需关注隐私和实用性(如 MedHELM)。

课件与代码: https://cs336.stanford.edu/spring2025/