论文研究 ·
从像素到姿态:机器人工具操作学习新方法提出
From Pixel to Poses: Object-centric Tool Manipulation Learning from Human Demonstrations
70进行中1 条HF Daily Papers
AI 解读
AI 生成推荐理由可降低机器人精密操作技能训练对真实配对数据的依赖。
P2P-T框架绕开人机配对数据,复杂工具操作性能较原SOTA提升73%
发生了什么
P2P-T是研究团队推出的数据高效、以对象为中心的工具操作学习框架,直接从人类演示中学习工具使用。框架采用两阶段方法:先预训练以对象为中心的世界模型提取稳定姿态先验,再将其集成到高效的姿态感知低级策略中;依托现代基础模型驱动的自动化数据处理流水线,完全无需人机对齐数据,大幅降低训练开销。仅需单任务微调和少量数据,该框架就在此前标准大规模预训练模型无法完成的复杂真实世界工具操作任务上,执行性能较此前最优水平提升73%。
关键信息
- 框架名称
- P2P-T
- 核心方法
- 两阶段学习:预训练对象中心世界模型提取姿态先验,集成至姿态感知低级策略
- 基准成绩
- 复杂真实工具操作任务执行性能较此前SOTA提升73%
- 训练数据要求
- 完全无需人机对齐配对数据,仅需人类演示数据
背景
当前机器人操作落地的核心瓶颈是真实世界机器人数据稀缺,现有依赖人类视频演示的方案要么计算成本高,要么仍需人机配对数据做域对齐;即使是当前最优的长程任务操作模型,也难以胜任复杂工具操作所需的精细精准控制。
为什么重要
对行业而言,P2P-T打破了机器人精细操作对海量真机配对数据的依赖,大幅降低机器人技能开发的数据成本和算力开销;对开发者而言,无需从零采集真机配对数据,仅通过单任务微调就能快速为机器人新增复杂工具操作能力;对普通用户而言,未来能胜任家务工具操作的家用机器人落地速度将明显加快。
后续看点
后续可关注该框架在更多品类的真实家用、工业操作场景下的落地测试效果,以及与主流通用大模型机器人基座的适配进展。
由 AI 根据原文生成,可能有疏漏,以原文为准。