
普通 DAgger 要求人类在机器人仍在行驶时标记状态。在真实硬件上这是不安全的,并且会产生质量差的标签。门控变体用必须由某人按住的门替换盲目标记: HG-DAgger 中的人类、SafeDAgger 中的安全分类器、EnsembleDAgger 中的集合分歧、ThriftyDAgger 中的预算化新颖性和风险估计。本文根据谁拥有门、什么信号打开门以及每个门的代价来比较它们——以及为什么人工门控的形式是与真实机械臂接触后仍然有效的那种。
当克隆策略的训练数据用尽时,它会失败。解决方案是在策略自身的状态分布下继续收集数据,而不是在演示者的分布下,这正是 DAgger 所做的,也是 数据聚合的介绍 从第一原理涵盖的内容。它留下了原始算法中尴尬的部分: 当学习者驾驶时,专家应该说他们会做什么,对于每个状态,而不被控制。
在带有脚本专家的模拟器中是免费的。在带有真实机械臂的桌子上既不免费也不安全。HG-DAgger 作者精确地表述了异议: 这样的采样方案"要求专家在未完全控制系统的情况下提供动作标签",这"可能会降低安全性,在使用人类作为专家时,由于感知执行器延迟可能会降低收集标签的质量"(Kelly 等,2019)。该句子中隐藏了两个失败: 策略继续驾驶进入没人希望的状态,而为这种风险购买的标签比人类在按住控制装置时产生的标签更差。下面的每个变体都回答相同的问题——在控制上放一个门,让某人决定何时打开它。它们在谁拥有开关方面有所不同。
简短版本
- •门控变体用策略控制和专家控制之间的开关替换盲目标记。分离它们的是谁拥有开关。
- •HG-DAgger 将开关交给人类,仅聚合在人类具有不中断控制期间记录的数据。
- •SafeDAgger 将其交给预测参考策略偏差的二进制分类器; EnsembleDAgger 同时要求低集合方差和与专家动作的小距离。
- •LazyDAgger 添加迟滞以防止控制振荡; ThriftyDAgger 在显式干预预算下基于新颖性或估计风险进行门控。
- •机器人门控信号需要精调 VLA 在业余级机械臂上通常缺少的东西: 参考策略、廉价集合或已校准的认识论不确定性。
- •门是方法的一半。之后对干预段进行的处理——混合、加权、聚合——决定该轮是否改进了任何东西。
人工门控和机器人门控: 重要的分裂
交互式模仿学习有自己的综述; Celemin 及其同事根据反馈类型、界面、学习模型、用户体验、应用和基准对其进行编目。决定你的工程的区别比这些轴中的任何一个都简单,最近的工作直接命名: 当主管决定何时干预时,方法是 human-gated ,当代理决定何时寻求帮助时是 robot-gated (Cai 等,2025)。所有其他东西都是为这两个选择之一服务的机制。权衡从一开始就很明显: 人工门需要持续注意,机器人门承诺归还注意力——但仅当它把关的信号可信,构建该信号本身是一个研究问题。
SafeDAgger: 预测自身偏差的分类器
Zhang 和 Cho 的 SafeDAgger (2016) 是这些门中最早的。查询参考策略是昂贵的部分,所以第二个小网络——安全策略——首先预测查询是否值得。它"返回一个二进制标签,指示主策略在不查询的情况下可能偏离参考策略"。标签根据两个策略的动作之间的平方 L2 偏差以阈值 tau 定义,分类器用二进制交叉熵拟合。在运行时,它决定每个状态学习者是继续驾驶还是参考接管。摘要报告赛车模拟器中的参考查询更少,以及作者归因于自动课程效应的收敛速度提升,没有给出任何数字。
问题在于定义,而不是结果。训练分类器需要参考策略在每个用于拟合的状态上的动作,这假设参考是另一个程序。如果你的参考是带有领导臂的人,该标签集不便宜,该方法失去了为其设计的属性。
EnsembleDAgger: 怀疑和差异,两者都有
Menda、Driggs-Campbell 和 Kochenderfer (2019) 将门视为概率问题。EnsembleDAgger "使用神经网络的集合近似高斯过程"并将集合方差作为置信度代理读取: 高方差意味着与训练数据不同的区域,这——假设专家避免失败状态——与接近失败相关。规则是合取。学习者仅当其平均动作与专家动作之间的 L2 距离保持在一个阈值(差异)以下时才可以行动 和 其预测动作的方差保持在第二个(怀疑)以下。如果任一失败,专家接管。目标是在约束失败概率的同时最大化学习者的动作份额; 论文报告了在倒立摆和 MuJoCo HalfCheetah 上相比其他 DAgger 变体改进的安全性和学习。
这悄悄地使完整规则不适合不动手的监督。学习者的动作与专家的动作之间的距离需要专家在该状态、该时刻的动作。使用脚本专家没问题。使用人类,人类必须持续产生动作——这正是门控变体旨在消除的负担。怀疑项单独是不动手的; 合取不是。
LazyDAgger: 停止开关颤抖
Hoque 及其同事(2021)攻击了早期论文没有衡量的代价: 开关本身。每个干预"打断人类正在进行的其他工作,在主管和自主控制之间产生上下文切换的延迟,并需要时间来执行"。一个一分钟打开和关闭十次的门比打开一次持续十秒的门更糟糕,在自主份额相同的情况下。LazyDAgger 用不对称阈值扩展 SafeDAgger——更难进入主管控制而更容易留在其中——所以系统不会在边界处振荡。在模拟中它"可以在 3 个连续控制任务上将上下文切换相比 SafeDAgger 平均减少 60%,同时维持最先进的策略性能"; 在带有 ABB YuMi 的织物操纵中它"减少上下文切换 60%,同时在执行时间达到比 SafeDAgger 高 60% 的成功率"。
ThriftyDAgger: 新颖性或风险,在预算下
ThriftyDAgger (Hoque 等,CoRL 2021) 从主管的预算而不是策略开始。它"使用学习的切换策略仅在足够满足以下条件的状态下请求干预: (1) 新颖,其中机器人策略没有模仿的参考行为,或 (2) 有风险,其中机器人对任务完成的信心低",带有用于估计该风险的新指标。预算是输入,而不是结果: 你声明你将花费多少人类时间。在执行时应用该方法"在模拟和物理任务上都达到 100% 成功率",以及十个参与者控制三机器人群体同时进行浓度任务的用户研究报告它"相比下一个最佳算法增加人类和机器人性能分别 58% 和 80%,同时减少主管负担"。群体设置是这项工作的自然家园; Fleet-DAgger 后来正式化了具有多个机器人和主管的交互式群体学习,提议人类努力回报作为优化的数量。
HG-DAgger: 人类持有门
Kelly 等(2019)走另一条路。没有切换策略。学习者被推出"直到专家观察到新手进入状态空间的不安全区域",此时专家接管并将系统指引回来。聚合规则是严格的部分: "仅在这些恢复轨迹期间收集和添加专家动作标签到数据集,在这期间人类专家拥有系统的不中断控制。" 当人类是旁观者时,什么都不被标记。
它不在开关处停止。HG-DAgger 也"学习模型-不确定性-基风险指标的安全阈值,可用于预测完全训练的新手在状态空间不同区域的性能": 它记录学习者在人类干预时刻的不确定性,平均这些记录的最后四分之一,其中学习者最像其最终形式。那不是机器人操作的门而是诊断,告诉你完成的策略应该在哪里持有。评估涵盖模拟和真实世界驾驶任务,报告相比 DAgger 和行为克隆改进的性能。
一条相关的线改变什么计为标签。Spencer 及其同事的专家干预学习持有"任何专家反馈数量,无论是干预还是非干预,都提供关于当前状态质量、动作最优性或两者的信息",正式化为对学习者值函数的约束,用无遗憾在线学习解决。在该阅读下,人类看着和什么都不做的拉伸是弱正证据而不是空白。EIL 从约一分钟的专家控制学习碰撞回避。

变体并排
| 方法 | 谁打开门 | 信号 | 需要可用 | 已报告 |
|---|---|---|---|---|
| DAgger (Ross 等,2011) | 没有人——学习者总是驾驶 | 无; 专家标记每个访问状态 | 能够在不控制的情况下标记策略外状态的专家 | 在学习者状态分布下无遗憾缩减保证 |
| HG-DAgger (Kelly 等,2019) | 人类主管 | 主管判断状态不安全 | 有人在看,以及控制的干净交接 | 击败 DAgger 和模拟和真实驾驶任务上的行为克隆; 也学习风险阈值 |
| SafeDAgger (Zhang & Cho, 2016) | 机器人 | 对参考上方 tau 的 L2 偏差的二进制分类器 | 用于分类器标签的可查询参考策略 | 赛车模拟器中更少的参考查询,更快的收敛(未给出数字) |
| EnsembleDAgger (Menda 等,2019) | 机器人 | 集合方差和与专家动作的距离,两者都在阈值以下 | 网络集合加上每个步骤的专家动作 | 在摆和 HalfCheetah 上改进的安全性和学习 |
| LazyDAgger (Hoque 等,2021) | 机器人,有迟滞 | SafeDAgger 的信号具有单独的进入和退出阈值 | SafeDAgger 需要的加上第二个要调节的阈值 | 3 个任务上大约减少 60% 上下文切换; YuMi 织物上 60% 更高成功率 |
| ThriftyDAgger (Hoque 等,2021) | 机器人,在预算下 | 新颖性或任务完成的估计风险 | 学习的风险估计器和陈述的干预预算 | 执行时 100% 成功; 用户研究(N=10): 相比下一个最佳 58% 和 80% 收益 |
| EIL (Spencer 等,2020) | 人类——非干预也计数 | 作为值函数约束的干预及其缺失 | 在价值约束上的在线无遗憾学习 | 从约一分钟的专家控制的碰撞回避 |
每个门购买的和它收费的
向下阅读"需要"列,一个模式脱落出来: 那里的每个机器人门控信号都是必须被制造的代理,每个代理都有自己的账单。
- 差异信号(SafeDAgger、LazyDAgger、EnsembleDAgger 规则的一半)需要参考策略。要么你有脚本专家,在这种情况下有趣的问题已经解决,要么人类持续在后台产生动作以便可以计算距离。
- 怀疑信号需要已校准的认识论不确定性。小控制网络的集合近似它; 30 亿参数视觉-语言-动作模型的集合是内存和延迟问题。
- 新颖性和风险信号需要学习的任务完成估计器,拟合足够成功和失败的推出。在你仍在使其工作的任务上,该数据第一轮不存在。
- 人工门只需要注意,没有别的——第一天在任何策略架构上唯一可用的信号,无需额外模型来训练。
- 没有机器人门从房间中移除人类。它们减少人类必须行动的频率,而不是他们是否必须在场。
有一个更安静的差异在门产生什么。机器人门在轨迹中途启动会将移动的臂交给处于任意姿态的人。人工门让操作员选择时刻——在达到之后,在把握之前,不是在摇摆的中途。来自两个的恢复段不是同样干净的,那些段是轮的整个产品。
为什么人工门控形式在真实硬件上赢得
这是工程论证,不是基准结果——我们找到的没有论文在同一操纵器上用同一策略类运行全部五个门。它基于四点。
首先,主管无论如何都在那里。没有人让 SO-100 臂 无人值守地运行在它能撞倒的物体旁边。一旦有人在看,给他们接管按钮的边际代价接近零; 构建已校准风险估计器是项目。
其次,你能在现代策略上实际测量的不确定性通常是错误的数量。扩散或流匹配头产生采样动作块的方差,那个方差反映了头被训练来代表的多模态,不是关于状态的认识论无知。EnsembleDAgger 的怀疑项使用集合正是为了捕获后者。两个看起来像相同的数字而不是; 动作分块 和 流匹配 项涵盖那些头首先如何发出动作的。
第三,在操纵中重要的失败通常是语义而不是统计上不寻常的。关闭夹具两厘米太早的策略或自信地伸向两个相同立方体中的错误的策略不在高方差状态中——它有信心而错误。没有方差阈值能捕捉那个; 看的人立即捕捉它。
第四,标签质量——原始 HG-DAgger 点,以及最常被跳过的。在人类具有不中断控制时收集的标签击败在移动系统上旁白的标签。如果目标是值得聚合的纠正数据,证明责任在于自动门。
一个主管负责许多机器人时图片翻转——ThriftyDAgger 用户研究和 Fleet-DAgger 正式化针对的政权。有了群体,人类注意力是稀缺资源,不完美分配击败无。一只臂在一张桌子上你不在那个政权。
人工门控循环,已经接线
在运行推理会话期间接管,每帧干预标记在纠正段上,策管每次运行进入纠正或评估,从你选择的源组成混合数据集,以及从现有检查点继续训练内置而不是手工脚本。接管用领导臂工作,或如果你没有用键盘和滑块。
查看 DAgger 循环如何运行门是方法的一半; 数据处理是另一半
门决定哪些帧人类驾驶,不是用它们做什么,那第二个决定是轮最常被浪费的地方。第一个规则是 DAgger 中的 D 代表的那个: 聚合,不替换。微调 检查点 纯粹在几百个纠正帧上给你一个已经看到几乎没有什么但恢复和忘记标称轨迹的模型。
第二个规则是干预帧不是普通帧。Mandlekar 等构建了一个远程遥操纵系统用于 6 自由度操纵让操作员监控策略并在失败时接管,然后用算法迭代地训练"鼓励策略学习如何通过干预遍历瓶颈"; 在那数据上训练的代理超越在相等普通演示样本数量上训练的代理。Sirius 将想法推进部署,"用近似人类干预规则的重新加权训练样本和用加权行为克隆优化策略"。两者都需要每帧标记什么被人类驾驶,这是为什么 干预 标记比它看起来重要得多。
第三个规则是自动混合是陷阱。你无法枚举其源的组成数据集是当下一轮变糟时你无法调试的那个。在这平台组成步骤显式用于那原因——原始数据集加纠正、每个源的情节选择和结果是普通 LeRobot 数据集 同步和训练像任何其他; 数据集文档 涵盖格式侧。
| 在轮中的步骤 | 它产生什么 | 它最常出错的方式 |
|---|---|---|
| 以记录打开运行推理 | 在策略自身状态分布下运行 | 记录为纯遥操纵,失去策略在驾驶 |
| 在失败时接管 | 带有每帧干预标记的纠正段 | 纠正化妆品摇晃,教学风格而不是恢复 |
| 策管每个情节 | 纠正、评估或丢弃 | 保留一切; 搞砸的接管代价超过情节值 |
| 同步纠正 | 原始旁边的版本化数据集 | 永不离开本地机器的纠正 |
| 组成混合数据集 | 原始加纠正,显式选择 | 静默自动混合,所以后来回归无法追溯到源 |
| 从检查点继续 | 从前一个初始化的检查点 | 期望优化器恢复; 权重初始化模型,它们不恢复优化器状态 |
设置人类能实际按住的门
"人类决定"不是规范。两个操作员有不同阈值产生不可比轮,漂移阈值产生你无法读的趋势。在第一次运行之前写下触发器。
- 命名打开门的条件——方法偏离超过固定边际、夹具抓住无、关节朝向极限漂移、停滞超过秒或两个——并保持列表在轮中不变。
- 命名什么不打开它。超调策略自己恢复的是训练信号; 在那接管删除恢复它已知。
- 足够早接管以进行干净交接,尽快手回到可恢复状态。
- 记录为什么接管,每情节。三轮后它是否同样失败返回的唯一记录。
- 跨轮保持摄像头、任务文本和操作员常数。改变一个数字停止可比。
在机制上交接有两个变体。用领导臂,领导必须达到追随者的当前姿态在扭矩转移之前,或臂跳跃; 这个对齐移动是链上真实硬件上最少测试的部分。不用领导臂接管从第一次按键手动: 追随者被按住和操作员从键盘逐关节推动它或拖滑块,服务器端钳制保持每个输入小——按键每对度,每个滑块更新少数,因为大步进入按住姿态是你如何剥离伺服的方式。步骤版本与键绑定在 在 SO-100 上的 DAgger 轮演练; 背景两个遥操纵模式都在 遥操纵文档 和 领导追随者项 。

读取门是否做了任何东西
人工门控轮的指标是干预率: 干预帧除以运行的帧。它有一个工作——如果它不跨轮下降,轮买不了任何东西,下一个应该改变数据量以外的东西。
它是有偏指标你应该知道如何。它测量操作员的阈值和策略的能力一样多,这是触发列表保持固定原因; 在会话中放松的操作员产生无数落后的曲线。它也忽视严重程度——十帧停止碰撞和十帧推动把握看相同。将其与固定评估集对配,其中没有纠正数据曾被吸取。 关于测量 DAgger 循环的文章 从评估设计中出发,包括如何将评估情节远离训练混合。
- 在第一天工作,在任何策略架构上,无需额外模型校准
- 捕捉没有方差阈值检测的有信心而错误的失败
- 产生在操作员有完全控制时记录的纠正,在他们选择的时刻
- 产生每帧标记干预加权方法如 IWR 和 Sirius 消费
- 代价持续监督; 它不缩放一人对多机器人
- 取决于操作员一致性——漂移阈值腐蚀干预率
- 本身产生没有风险模型; HG-DAgger 学习的阈值和 ThriftyDAgger 的估计器是额外机制
- 计数帧,不后果
- 不能拯救其失败在控制上游的策略,如交换摄像头或标签错误的任务字符串
值得关注的开放问题
基准很弱。Spencer 及其同事检查了用于测试模仿学习方法的那些,发现它们"可实现和简单,因此不足以捕获真实世界决策问题中看到的更难错误复合政权"——以及,对着周围文献,发现普通行为克隆在它们上做得很好。那是理由对任何 DAgger 变体排名怀疑基于那些任务,包括上表中的一些数字。
大策略上的机器人门也未解决。AIM 工作用近似人类干预规则的代理 Q-函数替换不确定性,报告相比 ThriftyDAgger 接管代价和学习效率 40% 改进——在连续和离散控制中,不在驾驶操纵器的视觉-语言-动作模型上。这些门中任何一个是否转移到微调 VLA 是开放的。综述做相关点: 领域的术语和结构跨文献未统一,这使方法难以比较。在你自己的臂上,你的日志是你拥有的证据。
HG-DAgger 真的是 DAgger 如果人类仅在干预期间标记?▾
它保留重要的部分——数据在学习者诱导的状态分布下收集,与之前来的聚合——并放弃与硬件接触不存活的部分。Kelly 等提出它作为变体; 2011 无遗憾保证不完整携带。
我能在 SO-100 上对微调 VLA 策略使用机器人门吗?▾
不直接。SafeDAgger 的分类器需要可查询参考策略你没有。EnsembleDAgger 需要集合,其中对于多十亿参数模型意味着内存中多个副本加它们的推理代价。ThriftyDAgger 需要风险估计器拟合不存在于你第一轮之前的成功和失败。
单一接管应该有多长?▾
足够长到达策略能继续的状态,不再: 扩展接管将运行变成演示会议并用标称行为淹没纠正集。LazyDAgger 的发现切割另一种方式太——许多非常短开关是他们自己的代价。
我应该仅在纠正段上训练吗?▾
否——那是浪费轮的最常见方式。仅在恢复上微调的模型已经看到几乎没有什么但恢复。将纠正混入显式选择的源的原始数据集; 要走得更远,看干预加权方法如 IWR 或 Sirius,加权人类驾驶帧而不是隔离它们。
干预率在轮后不下降呢?▾
按面值取: 轮不帮助。在添加纠正前,检查更便宜解释——操作员的阈值漂移,纠正是化妆品,组成数据集实际包含它们,训练从预期检查点初始化吗。静默从基础模型启动的轮看起来完全像从学习失败的轮。
非干预携带信息吗?▾
在专家干预学习下,是: 拉伸主管看和不动是读作弱证据那状态和动作是可接受的,正式化为值函数的约束。大多数实用管道,包括这个,仅标记人类驾驶的东西。
对于桌子上的单个臂选择做出: 自己按门,写下打开它的,并花努力在轮后面数据处理而不是在自动开关上。平台侧描述在 DAgger 循环页,每个策略族的训练选项在 训练和价格。对于背景,开始 模仿学习 和 SO-100 上的模仿学习; 对于第一次运行, 运行你的第一个策略 是更短的路径。
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started