斯坦福机器人讲座 | 2025年秋季 | 了如何使机器人操作更有效

29次播放
2026-07-31

本次视频涵盖: • 一种数据金字塔策略的介绍,该策略旨在通过充分利用多样化的数据源来应对这一挑战 • 一个简单但强大的想法:将互联网规模的数据集、人类远程操作数据和机器人采集的经验结合起来,使它们相互增强并填补彼此的空白

视频 AI 总结:该演讲探讨了如何使机器人操作(manipulation)更有效,提出了一种类似人类和大型语言模型的三层数据金字塔框架:大规模预训练(从海量人类视频中学习运动级信息)、实体特定微调(研究数据缩放定律,发现多样性比数据量更重要)以及强化学习(利用基础先验实现样本高效的真实世界学习)。演讲者展示了其团队在三个方面的具体工作:从人类视频向机器人迁移运动信息、通过数据多样性实现80%以上的零样本泛化成功率、以及利用策略先验、价值先验和成功奖励在1小时内将成功率从20%提升至85%。最后讨论了未来的开放性问题,如如何利用互联网级别的视频进行预训练、多任务数据缩放以及进一步降低强化学习的样本复杂度。
主要内容

  • 三层数据金字塔:大规模预训练(从人类视频学习运动信息)→ 实体特定微调(数据缩放定律,多样性优于数量)→ 强化学习(高效策略优化)
  • 第一项工作:通过混合人类视频(提取手部关键点并重定向到机器人形态)与机器人遥操作数据,在未见过的任务上实现20%的零样本成功率,证明运动级信息可从人类迁移到机器人。
  • 第二项工作:通过收集约1600个多样化演示(32个环境×50个演示),在全新环境和对象上达到80-90%成功率,发现数据多样性比绝对数量更重要,并拟合出模仿学习的缩放定律(R²>0.95)。
  • 第三项工作:利用基础先验(策略先验、价值先验、成功奖励)进行真实世界强化学习,无需手动设计奖励,在1小时内将成功率从20%提升至85%,适用于多种任务(如倒水、开门、拧瓶盖等)。 如需了解更多斯坦福研究生项目信息,请访问:https://online.stanford.edu/graduate-education

2025年10月3日 杨戈 清华大学交叉信息研究院(IIIS)助理教授