佰感交融 机智过人
从日常视频复刻人手灵巧动作,UR机器人双臂协同搭建低成本具身实验底座
你有没有想过——随手拍的转笔视频,就能成为训练机器人的数据?
UC Berkeley 最新发布的 “Do as I Do”框架,正试图把这个想法变成现实。
在此之前,机器人想“看懂视频”并“动手执行”,必须跨过两道坎:
- 2D信息缺失:单目RGB视频无深度和触觉,难还原三维运动。
- 形态鸿沟:人手21个自由度,与灵巧手关节构型不同,无法直接照搬人类的抓取动作。
伯克利团队用模块化方案打通了整条链路——不仅刷新4D手物重建SOTA(State of the Art),更在UR双臂机器人上成功落地。


01 两步走解决方案


第一步:重建模块 — 单目视频 → 4D手物轨迹
如何从一张平面的图片中还原出3D世界?
- 手部追踪:复用成熟的HaWoR模型,稳定提取人手三维骨架。
- 物体跟踪(核心创新):基于SAM 3D改造时序逻辑——固定首帧物体形状,仅逐帧更新位姿,靠引导扩散预测6D姿态。即便遇到遮挡、运动模糊的“野生视频”,也能输出连贯运动序列。
- 尺度恢复与对齐:借助MoGe恢复真实尺度,加权SE(3)聚类筛选最优姿态。
效果:在 DexYCB、HOI4D 标准数据集上刷新物体跟踪指标。在150段野外视频的人工评测中,67%的研究者更认可该方法的跟踪效果。
遮挡场景跟踪对比(左侧基线FoundationPose明显漂移,右侧Do as I Do在遮挡情况下跟踪更稳定):


第二步:动力学感知重定向 — 人类动作适配机器人
单纯做几何坐标映射,容易出现机械手穿透物体、抓取打滑的问题。框架采用基于MPPI思想的采样优化,在 MuJoCo Warp 物理仿真中迭代求解可行的控制指令。
为了应对重建轨迹中的噪声,团队新增了三项创新:
- 预热阶段:抓取前预留调整区间,避免初始偏差导致抓空。
- 随机力扰动:叠加外力噪声,优化抗干扰的稳定抓取姿态。
- 过渡奖励:区分悬空/落地两种状态,对抓取/放置动作切换施加约束惩罚。
消融实验数据:655段野外视频重定向成功率从25%→71%;干净数据集从72%→81%。
引入三项创新机制后,仿真环境下的重定向成功率显著提升:


02 仿真到真机:双臂UR3e机器人落地验证
实验平台选用双臂UR3e协作机器人+ 22自由度Sharpa Wave灵巧手。在这里,展现了UR协作机器人在科研落地中的独特优势:
- 生态兼容性:UR拥有成熟的 MuJoCo、ROS 等科研生态支持,团队可快速搭建数字孪生环境,提前规避碰撞和轨迹偏移。
- 控制精度与稳定性:论文采用50Hz控制频率完成UR双臂同步控制。在将仿真轨迹迁移到真机时,UR3e凭借其高重复定位精度,精准复现了算法规划出的复杂空间轨迹。
- 开放底层扭矩接口:自定义柔顺控制,适配高精度对位、双手协同操作拓展研究。
团队先在数字孪生校验,再低速下发指令,最终稳定复现搅拌、倾倒、锤击等20类日常操作。


03 给具身从业者的落地启发
这篇论文不仅提供了算法,还附带一份视频筛选实操手册:从2000段100DOH视频中,最终仅4%-5%适合灵巧训练。大量视频因遮挡、镜头切换、物体移出画面而失效。
建议:优先选取镜头稳定、手物完整交互的视频素材。
当然,也要客观看待框架的局限:当前仅适配刚性物体;单目RGB存在深度歧义,难以区分遮挡与真实接触;仿真与真实仍有偏差。这些是后续值得深挖的方向。
04 结语
Do as I Do本质是数据采集范式的转变——摆脱昂贵遥操作,挖掘互联网海量免费观察数据。它证明仅靠日常视频就能规模化产出可真机部署的灵巧操作轨迹。
而UR协作机器人作为连接算法与物理世界的桥梁,以其双臂协同、AI加速器等技术领先性,为通用具身智能的落地提供了坚实的硬件底座。
引用论文
论文arXiv:https://arxiv.org/abs/2606.19333
