【论文推荐】FACTR:面向接触密集型策略学习的力感知课程训练
原文题目:FACTR: Force-Attending Curriculum Training for Contact-Rich Policy Learning
作者:Jason Jingzhou Liu、Yulong Li、Kenneth Shaw、Tony Tao、Ruslan Salakhutdinov、Deepak Pathak
单位:卡内基梅隆大学(Carnegie Mellon University)
说明:Jason Jingzhou Liu 与 Yulong Li 贡献相同。本文公式、图号、表号和参考文献编号均与原论文保持一致。
图 1 FACTR。左:低成本主从遥操作装置通过驱动主端机械臂与夹爪的舵机实现力反馈,提高遥操作成功率、完成速度和易用性。右:FACTR 行为克隆策略利用机器人力信息,在接触密集型任务中提升对不同几何形状和纹理物体的性能与泛化能力。
摘要
人类执行的许多接触密集型任务——例如搬起箱子或擀面团——都依赖力反馈来保证可靠完成。然而,虽然大多数机械臂都能直接提供这类力信息,它在遥操作和策略学习中却并未得到普遍利用。因此,机器人的行为往往局限在不需要复杂力反馈的准静态运动学任务上。
本文首先提出一套低成本、直观的双向遥操作装置:它把从端机械臂受到的外力反馈到主端机械臂,从而便于采集复杂接触密集型任务的数据。随后,作者提出策略学习方法 FACTR。该方法在训练过程中以逐渐减弱的强度破坏视觉输入,形成一种课程。它可以避免基于 Transformer 的策略过拟合视觉输入,并引导策略正确关注力模态。
实验表明,充分利用力信息后,与没有课程的基线方法相比,FACTR 对未见物体的泛化能力提升了 43%。
一、引言
从搬箱子、擀面团,到磕鸡蛋、开门,接触密集型任务无处不在。它们看似简单,实际却涉及复杂的力交互,并要求操作者根据力反馈进行精确调整。人类高度依赖这种反馈,因此能跨任务、跨物体泛化,并自然适应外观和几何形状的变化。
但在机器人学习中,力信息仍未被充分利用,即使 Franka Panda、KUKA LBR iiwa 等现代机械臂本身就能提供它。包括行为克隆在内的大多数数据驱动方法,在数据采集和策略学习阶段主要依赖视觉反馈,忽略了力的关键作用。这限制了纯视觉策略对新物体的泛化。例如,双臂抬箱子时,决定动作的主要因素是箱体几何形状,颜色和纹理并不重要。此时,力反馈能够清楚地提示模式切换——比如是否已经建立接触——因此比单纯依赖视觉更有利于物体泛化。
力反馈利用不足,一个重要原因是缺少既直观、低成本,又能在采集数据时记录力反馈的遥操作系统。近年来,低成本主从系统开始流行:操作者控制主端机械臂,从端机械臂镜像其关节运动。然而,这类系统通常是被动、单向的:主端关节没有驱动,主端也接收不到从端的信息。对于需要精确调力的动态接触任务,这会显著增加操作难度。
为此,作者提出一种低成本双向遥操作系统:从端测得外部关节力矩后,将其传给主端并驱动主端电机,从而产生力反馈。电机驱动同时支持主动重力补偿,并能处理机械臂冗余自由度带来的运动学多解问题。四项接触密集型任务的用户研究显示,这些改进带来了:
· 任务完成率提高 64.7%;
· 完成时间缩短 37.4%;
· 主观易用性提高 83.3%。
图 2 带力反馈的低成本双臂遥操作系统。系统包括两条有源主端机械臂、两条带外部关节力矩传感能力的从端机械臂、一台前视相机和两台腕部相机。
第二个挑战,是怎样把机器人力信息真正有效地纳入策略学习。扩散策略和动作分块 Transformer 等方法在精细操作上表现出色,却常常难以泛化到外观和几何形状不同的未见物体。人类在建立接触后可以忽略无关视觉细节,只依赖力反馈完成抬箱子、擀面团等任务。可是,把力直接加入策略输入并不够:策略常会过拟合视觉模态,实际上忽略力数据。原因在于,接触力信号的区分度通常较低;在机械臂尚未接触环境时,它可能长时间接近零。若训练时不加干预,策略很容易选择视觉这条“捷径”。
FACTR 通过课程训练缓解这种模态失衡。它在训练早期对视觉输入施加强高斯模糊或强下采样,随后逐渐降低破坏尺度、恢复视觉细节。这样,策略在初期被鼓励更多关注力信息,随着训练推进再逐步平衡视觉和力。作者还基于神经切线核(NTK)给出简化情形下的理论分析,并在像素空间和潜空间中测试不同算子与调度器。
本文贡献可概括为两点:
1. 带力反馈的低成本遥操作。 设计双向主从遥操作系统,提供力反馈、重力补偿和冗余解析;用户研究中,任务完成率提升 64.7%,易用性提升 83.3%。
2. 力关注课程训练。 提出 FACTR,使策略更好地学习使用力反馈,并增强对物体外观和几何形状的泛化。在四项任务上,相比同样输入力信息但不采用课程的策略,性能平均提升 40.0%。
二、相关工作
2.1 使用力信息的模仿学习
模仿学习借助示范训练机器人策略,近年来取得了显著进展。传统方法主要使用视觉和关节位置,但许多现实任务必须显式利用力反馈,才能提高稳定性、适应性与安全性。已有研究把夹爪力或触觉信号加入示范学习,使策略能够处理细小、易碎物体,或完成削蔬菜皮等强接触任务。
相比之下,机械臂自身的关节力矩数据仍研究不足。有的方法借助末端力传感器,在动觉示教中估计柔顺参数或虚拟位置目标;也有方法把力矩感知并入扩散策略,推断用于底层控制的六维力/力矩。
不过,简单地把力反馈加入策略仍可能导致策略过拟合视觉并忽略力。FoAR 通过显式预测接触/非接触阶段来调节视觉与力的融合,但需要额外标注。FACTR 则利用课程把视觉与力有效融合,无须接触阶段标签,并让策略通过力提升物体泛化。
2.2 带力反馈的低成本遥操作系统
围绕低成本、高质量数据采集,研究者提出了手持夹爪和主从系统。手持夹爪天然能让操作者感到力,但通常不直接记录力数据;近期工作通过增设力传感器缓解了这一问题。可手持设备受制于人手与机器人的运动学差异,产生的命令未必能由机器人执行。
主从系统没有这一问题,却往往缺少力反馈。Kobayashi 等人的双向系统会在主、从端关节位置存在差异时给主端附加力矩;然而,从端在无接触运动时,操作者也会感到它的惯性、摩擦等动力学作用,降低易用性和精度。本文的方法只把从端的外部关节力矩反馈给主端,使操作者感知环境约束,同时不受从端内部摩擦和惯性干扰。
三、FACTR 低成本双向遥操作系统
GELLO、ALOHA 等主从系统通过关节空间映射,让从端把主端关节位置作为目标,因而简单、直观、成本低。操作者能够自然感知从端的运动学约束;但多数系统没有力反馈,无法感知环境几何约束。其主端虽然使用可驱动舵机,却通常保持被动,还需借助外部框架、橡皮筋或绳索抵消重力,降低了便携性。
本文充分利用主端机械臂与夹爪中的舵机。主端由现成舵机和 3D 打印件组成,是从端在运动学上等价的缩小版本;主动驱动后,系统拥有力反馈、可定制的冗余解析、重力与摩擦补偿以及关节限位规避能力。低成本硬件因此获得了过去通常只见于昂贵遥操作设备的功能。
3.1 力反馈
力反馈让操作者直接感到机器人与环境的交互,尤其适合接触密集型或视觉受限任务。系统把从端感知的外部关节力矩反馈到主端:

其中,
是缩放常数,
是从端测得的外部关节力矩,
和
是力反馈的 PD 增益。
按主、从端最大力矩之比计算;阻尼项
可减少从端接触环境时主端的振荡。系统只传递外力,因此操作者不会感到从端运动中的内部摩擦和惯性;作者还通过缩小反馈力改善操作精度、降低认知负担。
平行夹爪没有外部力传感器,因此系统利用从端夹爪舵机的当前电流估计力反馈:

是发送给主端夹爪的反馈力矩,
是从端夹爪舵机电流,
是指数移动平均滤波系数。系统取
=0.1。
3.2 可定制的冗余解析
对运动学冗余机械臂,如果不调节关节空间,机械臂会在重力作用下漂移到不理想姿态。GELLO 用弹簧等机械部件正则化关节空间,却会在末端产生随构型变化、分布不均的力,也无法让用户指定冗余解析目标。在狭窄空间,这会限制可达性并导致碰撞。
图 3 可定制关节正则化。左:固定关节正则化目标限制可达性,在狭窄空间引发碰撞。右:用户可为主端指定静止关节构型,使从端在狭窄空间仍能到达目标。
本文用零空间投影控制律调节关节位置:

是机械臂雅可比矩阵,
是用户指定的静止姿态,
、
是零空间投影的 PD 增益,
为零空间投影矩阵。该控制能把关节稳定在任意指定姿态,又不向末端附加额外作用力。
3.3 重力补偿
为了让主端在操作者停手时保持静止,系统用递归牛顿—欧拉算法实时计算逆动力学,实现重力补偿:
![]()
其中,
是质量/惯性矩阵,
是科里奥利与离心项矩阵,
是重力向量。

3.4 其他补偿与控制
系统还提供:用于降低主端感知摩擦的
;基于人工势场、用于避免主端超出从端关节范围的关节限位控制;以及基于黎曼运动策略(Riemannian Motion Policies)的双臂动态避障。细节见附录九。
3.5 主端总控制律
各项力矩分别负责外力反馈、零空间冗余解析、重力补偿、摩擦补偿和关节限位,最终施加到主端舵机的合力矩为:

四、FACTR:力关注课程训练
简单地把机器人力数据并入策略,并不一定提升策略。非接触阶段的力信号长时间接近零,区分信息有限,所以策略容易忽略力、主要依赖视觉。FACTR 用高斯模糊或下采样逐步破坏视觉信息,并在训练中逐渐减小破坏程度。训练早期,力模态因而被迫发挥更大作用。
图 4 FACTR 在不过拟合视觉的前提下融合力信息。RGB 图像与外部关节力矩分别经视觉编码器和力编码器转为 token,再送入动作 Transformer 预测未来关节位置目标。课程可作用于像素空间或潜空间,其尺度从大到小逐渐衰减。
4.1 问题定义与基础模型
给定时刻 t 的视觉观测 I_t 与外部关节力矩 \tau_t,策略 \pi_\theta 输出长度为 k 的未来关节位置动作块 \hat q_{t:t+k}。作者从专家轨迹数据集 \mathcal D 中用行为克隆训练,损失为:

模型是融合视觉与力的编码器—解码器 Transformer。预训练 ViT 把图像编码为 M_v 个 d 维视觉 token,MLP 把关节力矩编码为一个力 token;二者拼接后由 Transformer 编码器处理。解码器接收 k 个动作 token,并通过自注意力和对编码结果的交叉注意力生成未来动作。
解码器每层中,动作 token 对视觉 token 与力 token 的交叉注意力分别记为 \alpha_V^{(l)} 与 \alpha_F^{(l)}。它们反映动作在第 l 层对两种模态的关注程度,也是后文分析“策略究竟有没有使用力”的主要依据。最后,MLP 把解码器输出投影到动作空间。
4.2 力关注课程
实验发现,训练时直接把力与视觉拼接,策略常会忽略力输入。FACTR 因而逐渐“揭开”视觉细节,让模型先学会使用力。作者定义像素空间算子 \beta_P(I,\sigma_n) 和潜空间算子 \beta_L(z,\sigma_n);\sigma_n 是随总计 N 个梯度步骤变化的尺度,例如高斯核标准差或最大池化核尺寸。
训练时,像素空间课程把 \beta_P 施加到图像 I_t;潜空间课程把 \beta_L 施加到视觉潜 token。较大的尺度会使不同视觉输入在度量空间中更相近,从而让力模态作出更多贡献。随着 \sigma_n 下降,视觉的判别细节逐渐恢复。
4.3 课程算子
作者考察两类算子:
3. 高斯模糊。 像素空间中用标准差为 \sigma_n 的高斯核卷积图像;潜空间中对视觉 token 加入方差与尺度相关的高斯扰动。尺度越大,视觉输入越难区分。
4. 下采样。 像素空间中先把图像缩小,再恢复到原尺寸;潜空间中对 token 序列进行最大池化。尺度越大,保留的视觉细节越少。
高斯模糊的 NTK 分析表明:训练早期的大尺度模糊压制高频视觉变化,使不同视觉输入更相似,视觉分支的判别力降低,梯度因而更倾向于更新力编码器。随着尺度减小,视觉分支重新获得细粒度判别能力。
4.4 课程调度器
在第 n=1,\ldots,N 个训练步骤,调度器控制尺度 \sigma_n。论文比较常数、线性、余弦、指数和阶跃五种方案。线性调度可写为 \sigma_n=\sigma_0(1-n/N);余弦调度平滑衰减;指数调度按指数速度下降;阶跃调度则在预设训练阶段离散减小尺度。
*算法 1:力关注课程训练(FACTR)*
给定专家数据集、动作块长度、总训练步数、像素/潜空间算子和尺度调度器。
初始化预训练 ViT、力 MLP 编码器与动作分块 Transformer。
每轮从数据集采样图像、外部关节力矩和专家动作。
按调度器得到当前尺度;若使用像素空间课程,则先处理图像。
编码视觉 token;若使用潜空间课程,则再处理视觉 token。
编码力 token,联合两种 token 预测动作块。
计算均方误差,并用 Adam 更新全部参数。
五、评估
5.1 实验设置
作者设置了四项接触密集型任务。所有任务均使用 Franka Panda 机械臂和 OpenManipulator-X 夹爪,RGB 观测来自前方 ZED2 相机或安装在夹爪附近的腕部相机。
图 5 四项任务及训练/测试物体。任务要求机器人在操纵外观和几何形状未见过的物体时,感知并响应力反馈。
· 双臂抬箱(Box Lift):两臂抬起箱子并在空中保持平衡至少 2 秒。输入为前视图像和两臂外部关节力矩。
· 非抓取式翻转(Non-Prehensile Pivot):机器人把物体抵住治具角点旋转,直至翻转 90° 并能稳定站立。输入为前视图像和单臂外部关节力矩。
· 水果抓取放置(Fruit Pick and Place):抓起柔软、易损的水果并放入碗中。输入为腕部图像和夹爪外部力矩。
· 擀面团(Rolling Dough):连续滚动面团至少 8 秒,使其成为圆柱形。输入为前视图像和机械臂外部关节力矩。
5.2 遥操作评估
作者将完整系统——有源主端、力反馈、重力补偿和冗余解析——与采用机械关节正则化的无源主从基线比较。结果显示,本文系统的完成率提高 64.7%,完成时间缩短 37.4%,主观易用性提高 83.3%。
需要机械臂与物体持续接触的任务,例如非抓取式翻转和双臂抬箱,在无源系统上经常发生接触丢失。没有力反馈时,操作者无法通过主端感知环境的几何约束,很难稳定维持接触。
此外,无源系统在持续接触中常让从端超过关节速度限制。操作者可能把主端移到与从端差异很大的姿态;一旦失去接触,关节空间误差使 PID 控制器产生大力矩,引起突然运动。本文系统则通过主端呈现环境约束,阻止操作者在接触阶段把主端移得离从端过远。
图 7 用户研究。与无源主从系统相比,FACTR 遥操作系统显著提高完成率、缩短完成时间,并让参与者主观上感觉更易使用。
5.3 策略评估
实验关注两个问题:FACTR 相比纯视觉基线、以及“使用力但不采用课程”的基线表现如何?不同课程参数又怎样影响性能?
作者用遥操作系统为每项任务收集 50 条示范,并在完全相同的超参数下比较:
· ACT(仅视觉):只接收视觉观测的动作分块 Transformer;
· ACT(视觉+力):同时接收视觉和力,但不使用课程;
· FACTR:使用潜空间高斯模糊与线性调度的力关注课程。
每个任务、每个物体评估 5~10 次,并分别报告训练物体与测试物体的平均成功率。
图 6 FACTR 带来更好的物体泛化。上:训练物体;下:测试物体。绿色为仅视觉 ACT,橙色为视觉+力 ACT,蓝色为 FACTR。
在大多数任务的训练物体上,三种策略表现接近。擀面团是例外:纯视觉策略只会压扁面团而不会滚动,因而完全失败。滚动过程中,相邻时刻的视觉观测非常相似,力信号却呈明显周期性;这一振荡模式能够帮助力感知策略判断运动阶段。
图 8 擀面团轨迹中的 Franka 外部关节力矩范数。蓝色是接触前阶段,紫色和绿色分别标出机械臂到达面团左右端时的力矩峰谷。周期性力矩让策略在视觉相似时仍能区分状态。
对测试物体,纯视觉策略平均成功率仅 21.3%;直接加入力但没有课程时为 61.2%;FACTR 达到 87.5%。力在“机械臂接触箱体”“夹爪抓住水果”等时刻提供了模式切换信号,而课程使策略真正学会利用这些信号。
FACTR 学会识别模式切换
作者把第一层解码器中,动作 token 对视觉与力 token 的平均交叉注意力可视化。FACTR 在执行任务时明显更关注力。抬箱子时,一旦两臂接触箱体,对力的注意力就超过对视觉的注意力,表示策略识别到了模式切换。没有课程时,策略对力关注不足,常常无法抬起或平衡新箱体。
图 9 FACTR 学会识别模式切换。左:没有课程时,策略对力关注不足。右:FACTR 在机械臂接触箱体时让力注意力超过视觉注意力,从而完成任务。
FACTR 带来更好的恢复行为
恢复实验从策略第一次成功抬箱开始,随后人为把箱子打落,再检查第二次尝试。训练物体上各策略几乎都能恢复;测试物体上,纯视觉策略的首次成功率为 31.7%,第二次跌至 13.3%,而力感知策略两次成功率接近。
纯视觉策略在箱子被打落后经常停住,不再重试,可能是因为它过拟合训练场景,对分布外物体反应不足。FACTR 则能通过外部关节力矩恢复到抬起前数值来检测接触丢失,于是返回预抬起状态并再次尝试。
方法 | 训练物体恢复 | 测试物体恢复 |
ACT(仅视觉) | 4/5 | 4/30 |
ACT(视觉+力) | 5/5 | 16/30 |
FACTR | 3/3 | 27/30 |
表 1 抬箱任务的恢复行为评估。
5.4 课程消融
作者选用最难任务之一“非抓取式翻转”,只在 5 个测试物体上评估,每个物体 5 次。
调度方式 | 像素空间·模糊 | 像素空间·下采样 | 潜空间·模糊 | 潜空间·下采样 |
固定尺度 | 16/25 | 15/25 | 17/25 | 16/25 |
线性 | 19/25 | 18/25 | 19/25 | 18/25 |
余弦 | 20/25 | 19/25 | 17/25 | 19/25 |
指数 | 19/25 | 21/25 | 20/25 | 19/25 |
阶跃 | 19/25 | 18/25 | 20/25 | 19/25 |
表 2 课程训练消融。
尺度逐渐衰减的课程在所有任务上都优于固定平滑尺度。最终策略仍需要完整、未模糊的视觉细节;课程允许策略逐渐适应清晰图像,而固定平滑虽然能减少视觉过拟合,却让策略无法提取完成任务所需的细节。
像素/潜空间、高斯模糊/下采样,以及线性、余弦、指数、阶跃调度之间,没有某一组合始终占优或始终落后。这说明 FACTR 对课程参数具有相对较好的稳健性。
六、结论与局限
FACTR 是一种训练力感知策略的课程方法,目标是提升接触密集型任务的性能和物体泛化。它在训练中对视觉信息施加尺度逐渐减小的模糊,使策略在早期更多使用力,避免过拟合视觉而忽略力。在抬箱、非抓取式翻转、水果抓放和擀面团四项任务上,FACTR 都显著提高了任务完成率,并增强了对未见外观和几何形状的泛化。带力反馈和重力补偿的有源主端也带来了更直观的遥操作体验。
作者同时指出三项局限:
从端外部关节力矩传感器精度有限,细粒度操作所需的微小调力可能淹没在噪声中。未来可加入高分辨率触觉传感器或触觉手套。
方法假设从端机械臂能提供外部关节力矩。未来可适配只在末端安装六维力/力矩传感器的机械臂。
模糊算子、尺度调度等课程超参数具有任务依赖性,可能需要大量调参。自适应或自调节课程可以按任务动态改变超参数。
附录
附录七:从神经切线核视角分析 FACTR
本节给出一个理论论证框架,解释高斯模糊、下采样等 FACTR 算子为什么能帮助策略关注力输入。
7.1 神经切线核预备知识
神经切线核(NTK)用于分析神经网络,尤其是无限宽极限下的训练行为。对参数为 \theta 的网络 f_\theta(x):
k(x_i,x_j)=\left\langle \nabla_\theta f_\theta(x_i),\nabla_\theta f_\theta(x_j)\right\rangle
在无限宽极限下,NTK 变为确定量,并在训练期间保持不变。若参数按高斯分布初始化,核收敛为对初始化取期望的确定性核。它可视作输入间的相似度:核值越大,网络对两个输入的预测越接近。对 n 个训练点,它形成半正定核矩阵 K。
使用平方误差和梯度流训练无限宽网络时,时刻 t 的残差满足:
f_{\theta_t}(x)-y=e^{-\eta Kt}\bigl(f_{\theta_0}(x)-y\bigr)
其中 \eta 是学习率。残差沿核矩阵不同特征方向,以对应特征值决定的速率指数衰减。
7.2 用 NTK 分析高斯模糊
考虑先用标准差为 \sigma 的高斯核 K_\sigma 卷积输入,再送入两层网络:
f(x)=W^T(K_\sigma*x)
其 NTK 等价于模糊后输入之间的内积。\sigma 越大,高斯卷积越强烈地抑制高频分量,不同图像因此更相似;当 \sigma\to\infty,所有模糊输入近似同一个向量,核矩阵接近缩放后的全 1 矩阵。它是秩 1 的:网络只能为所有视觉输入学习一个全局输出,只能拟合平均标签,失去视觉判别能力。
从残差分解看,只有沿全 1 特征向量的分量会快速衰减,正交分量保持不变。因此在课程早期,视觉分支无法区分样本,梯度更新会转而使用力信息,并充分更新力编码器。随后逐渐减小 \sigma,视觉输入从平滑版本过渡到原图,核重新获得判别能力,模型再学习细粒度视觉特征。这种由简单到复杂的过程,也避免了训练早期过拟合高频视觉变化。
附录八:带力反馈遥操作系统的成本分析
下表是一套主端机械臂与主端夹爪在论文提交时的物料成本。
部件 | 数量 |
Dynamixel XM430-W210-T | 2 |
Dynamixel XC330-T288-T | 6 |
U2D2 控制板 | 1 |
12V 20A 电源 | 1 |
PLA 3D 打印材料 | 不适用 |
合计 |
表 3 一套带力反馈主端遥操作设备的物料清单
附录九:遥操作系统的其他控制律
9.1 摩擦补偿
关节摩擦会引入阻力,降低响应性与直观性,并增加反驱电机所需体力。系统显式补偿静摩擦、库仑摩擦和黏性摩擦。
静摩擦通过向控制输入加入幅值较小的高频振荡信号来缓解。微振动可防止电机停留在静摩擦状态,使静止到运动的过渡更平滑:
\tau_{ss}^{(i)}=\begin{cases} \mu_s^{(i)}\cos(\omega t), & |\dot q^{(i)}|<\dot q_s^{(i)}\\ 0, & \text{其他} \end{cases} \tag{7}
其中 \mu_s 是标定的静摩擦系数,控制循环频率为 500 Hz。运动摩擦补偿为:
\tau_{ks}^{(i)}=\mu_c^{(i)}\operatorname{sgn}(\dot q^{(i)})+\mu_v^{(i)}\dot q^{(i)} \tag{8}
\mu_c 与 \mu_v 分别是库仑摩擦和黏性摩擦系数,总摩擦补偿为静摩擦项与运动摩擦项之和。
9.2 关节限位规避
系统用人工势场在接近从端关节上下限时产生排斥力矩。势能在安全区为零,在进入上下限安全边界后按距离的倒数平方增大,控制力矩为:
\tau_{limit}^{(i)}=-\nabla_{q^{(i)}}U(q^{(i)}) \tag{10}
其中 U 是排斥势函数,安全裕量决定势场开始生效的位置,缩放因子决定排斥强度。
9.3 带动态避碰的双从端控制
常见双臂主从系统直接把主端当前关节位置作为从端目标。本文改用 Isaac Lab 中实现的黎曼运动策略(RMP):它在尽量匹配主端关节位置的同时,动态生成满足实时避碰的从端关节目标。无论操作者怎样动作,系统都能防止两条从端机械臂相互碰撞,或撞到桌面等外部障碍。
附录十:行为克隆策略架构与训练超参数
策略输入包括 RGB 图像、当前手部关节角(本体感觉)和力信息。ViT 把图像编码为 token;线性层编码本体感觉;随后由编码器—解码器式动作分块 Transformer 输出动作序列。ViT 使用 Soup 1M 权重初始化。
抬箱任务的动作空间是两条机械臂的绝对关节角;翻转和擀面团使用单臂绝对关节角;水果抓放使用单臂与夹爪绝对关节角。作者特意不把机械臂当前关节角加入本体感觉,以免模型只预测接近当前姿态的动作;这样会迫使模型从图像中提取物体信息,有利于泛化。
类别 | 超参数 | 值 |
策略训练 | 优化器 | AdamW |
基础学习率 | 3e-4 | |
权重衰减 | 0.05 | |
动量 $\beta_1,\beta_2$ | 0.9, 0.95 | |
批大小 | 128 | |
学习率计划 | 余弦衰减 | |
总步数 | 20,000~50,000 | |
预热步数 | 500 | |
数据增强 | RandomResizeCrop | |
GPU | RTX 4090(24GB) | |
训练时长 | 2~6 小时 | |
ViT | Patch 大小 | 16 |
层数 / 注意力头数 | 12 / 12 | |
隐藏维度 | 768 | |
Class token | 是 | |
位置编码 | 正弦—余弦 | |
动作 Transformer | 编码器层 / 解码器层 | 6 / 6 |
注意力头数 | 8 | |
隐藏维度 / 前馈维度 | 512 / 2048 | |
Dropout | 0.1 | |
位置编码 | 正弦—余弦 | |
动作块长度 | 100 |
表 4 策略架构与训练超参数。
附录十一:详细定量结果
双臂抬箱
方法 | 训练平均 | 测试 Box3 | Box4 | Box5 | Box6 | Box7 | 测试平均 |
ACT(仅视觉) | 100.0% | 1/10 | 1/10 | 6/10 | 3/10 | 1/10 | 31.7% |
ACT(视觉+力) | 100.0% | 4/10 | 4/10 | 10/10 | 10/10 | 5/10 | 58.3% |
FACTR | 100.0% | 7/10 | 10/10 | 10/10 | 10/10 | 10/10 | 91.7% |
非抓取式翻转
方法 | 训练平均 | 测试 Box3 | Box4 | Box5 | Box6 | Box7 | 测试平均 |
ACT(仅视觉) | 95.0% | 3/10 | 0/10 | 7/10 | 2/10 | 1/10 | 26.0% |
ACT(视觉+力) | 90.0% | 1/10 | 2/10 | 9/10 | 4/10 | 5/10 | 42.0% |
FACTR | 90.0% | 6/10 | 5/10 | 10/10 | 7/10 | 10/10 | 76.0% |
水果抓取放置
方法 | 训练平均 | 测试 Obj2 | Obj3 | Obj4 | 测试平均 |
ACT(仅视觉) | 100.0% | 0/5 | 4/5 | 0/5 | 26.7% |
ACT(视觉+力) | 100.0% | 3/5 | 4/5 | 4/5 | 73.3% |
FACTR | 100.0% | 4/5 | 5/5 | 5/5 | 93.3% |
擀面团
方法 | 训练平均 | 测试 Obj2 | Obj3 | Obj4 | 测试平均 |
ACT(仅视觉) | 0.0% | 0/5 | 0/5 | 0/5 | 0.0% |
ACT(视觉+力) | 80.0% | 4/5 | 3/5 | 4/5 | 70.0% |
FACTR | 90.0% | 4/5 | 4/5 | 4/5 | 80.0% |
一句话总结:FACTR 的关键并不是“给策略多加一种传感器”,而是通过课程训练改变学习顺序——先让机器人学会听懂力,再逐步把清晰视觉还给它。
