Operator giám sát một robot arm thông qua một giao diện teleoperation, tay trên các điều khiển và sẵn sàng để takeover
DAggerInteractive Imitation LearningHG-DAggerRobot PoliciesSO-100

HG-DAgger và các biến thể được gating: Ai quyết định khi nào để takeover một robot policy

AY-Robots ResearchAugust 27, 202615 min read

Plain DAgger yêu cầu một người để gán nhãn các state trong khi robot vẫn đang lái. Trên hardware thực, điều này không an toàn và tạo ra các nhãn kém chất lượng. Các biến thể được gating thay thế gán nhãn mù với một cổng mà ai đó phải giữ: con người trong HG-DAgger, một bộ phân loại an toàn trong SafeDAgger, sự không đồng ý của ensemble trong EnsembleDAgger, một ước tính novelty-and-risk có ngân sách trong ThriftyDAgger. Bài viết này so sánh chúng bằng ai sở hữu cổng, tín hiệu nào mở nó, và chi phí của mỗi cái — và tại sao dạng được gating bởi con người là dạng có thể sống sót khi tiếp xúc với một cánh tay thực.

Một policy được clone sẽ thất bại nơi dữ liệu huấn luyện của nó hết. Giải pháp là tiếp tục thu thập dữ liệu theo phân bố state của policy thay vì của demonstrator, đó là những gì DAgger làm và những gì the introduction to dataset aggregation covers from first principles. It leaves open the awkward part of the original algorithm: while the learner drives, the expert is supposed to say what they would have done, for every state, without being in control.

Trong một simulator có một scripted expert miễn phí. Trên một bàn với một robot arm thực tế, nó không miễn phí cũng không an toàn. Các tác giả HG-DAgger nêu rõ lý do từ chối: các sơ đồ lấy mẫu như vậy "yêu cầu expert cung cấp action labels mà không hoàn toàn kiểm soát hệ thống", mà "có thể giảm độ an toàn và, khi sử dụng con người làm experts, có khả năng làm giảm chất lượng các nhãn được thu thập do latency được cảm nhận của actuator" (Kelly et al., 2019). Hai lỗi ẩn trong câu đó: policy tiếp tục lái vào các state mà không ai muốn nó vào, và các nhãn mua với rủi ro đó tệ hơn những cái mà con người tạo ra trong khi giữ các điều khiển. Mỗi biến thể dưới đây trả lời cùng một câu hỏi — đặt một cổng trên điều khiển và để cho ai đó quyết định khi nào nó mở. Chúng khác nhau ở chỗ ai đó đó là.

The short version

  • Các biến thể được gating thay thế gán nhãn mù với một công tắc giữa điều khiển policy và điều khiển expert. Những gì tách biệt chúng là ai sở hữu công tắc.
  • HG-DAgger cho công tắc cho con người và chỉ tổng hợp dữ liệu được ghi lại trong khi con người có quyền kiểm soát không bị gián đoạn.
  • SafeDAgger cho nó một bộ phân loại nhị phân dự đoán sự lệch khỏi một policy tham chiếu; EnsembleDAgger yêu cầu variance ensemble thấp và khoảng cách nhỏ đến action expert cùng một lúc.
  • LazyDAgger thêm hysteresis để điều khiển không ping-pong; ThriftyDAgger gates trên novelty hoặc estimated risk dưới một ngân sách intervention rõ ràng.
  • Các tín hiệu robot-gated cần cái gì mà một fine-tuned VLA trên một hobby-class arm thường thiếu: một policy tham chiếu, một ensemble rẻ, hoặc calibrated epistemic uncertainty.
  • Cổng là một nửa của phương pháp. Những gì xảy ra với các đoạn intervention sau đó — mix, weight, aggregate — quyết định liệu vòng đó có cải thiện bất cứ điều gì.

Human-gated and robot-gated: the split that matters

Interactive imitation learning có survey riêng của nó; Celemin và các đồng nghiệp liệt kê nó cùng với loại feedback, interface, learning model, user experience, application và benchmark. Sự phân biệt quyết định work engineering của bạn đơn giản hơn bất kỳ trục nào trong số những trục đó, và công việc gần đây đặt tên nó trực tiếp: một phương pháp là human-gated khi supervisor quyết định khi nào để intervene, và robot-gated khi agent quyết định khi nào để ask for help (Cai et al., 2025). Mọi thứ khác là máy móc phục vụ một trong hai lựa chọn đó. Trade-off có thể nhìn thấy từ đầu: một human gate có chi phí continuous attention, và một robot gate hứa sẽ trả lại attention đó — nhưng chỉ khi tín hiệu nó gates trên là trustworthy, và xây dựng tín hiệu đó là research problem của nó.

SafeDAgger: a classifier that predicts its own deviation

SafeDAgger của Zhang và Cho (2016) là cổng sớm nhất trong số này. Querying reference policy là phần tốn kém, vì vậy một mạng nhỏ thứ hai — safety policy — dự đoán liệu querying có giá trị hay không. Nó "trả về một binary label cho biết liệu primary policy có khả năng lệch khỏi reference policy mà không query nó". Nhãn được định nghĩa so với một squared L2 deviation giữa các actions của hai policies với một ngưỡng tau, và classifier được fit với binary cross-entropy. Tại runtime nó quyết định per state liệu learner vẫn lái hay reference takes over. Abstract báo cáo ít hơn reference queries trong một car racing simulator plus một convergence speed-up các tác giả quy cho một automated curriculum effect, mà không đưa ra một hình vẽ cho bất kỳ.

Bẫy nằm trong định nghĩa, không phải kết quả. Training classifier yêu cầu reference policy's action trên mỗi state được sử dụng để fit nó, giả định rằng reference là một chương trình khác. Nếu reference của bạn là một người có một leader arm, tập nhãn đó không rẻ và phương pháp mất thuộc tính nó được thiết kế cho.

EnsembleDAgger: doubt and discrepancy, both

Menda, Driggs-Campbell và Kochenderfer (2019) coi cổng như một câu hỏi xác suất. EnsembleDAgger "xấp xỉ một Gaussian Process sử dụng một ensemble của neural networks" và đọc ensemble variance như một confidence proxy: high variance có nghĩa là một vùng không giống dữ liệu training, cái mà — giả định expert tránh failure states — tương quan với proximity to failure. Quy tắc là một conjunction. Learner có thể act chỉ khi L2 distance giữa mean action của nó và expert's action ở dưới một ngưỡng (discrepancy) and variance của predicted action của nó ở dưới một second (doubt). Nếu bất kỳ cái nào thất bại, expert takes control. Mục tiêu là maximize learner's share của actions trong khi constraining probability của failure; paper báo cáo improved safety và learning so với DAgger variants khác trên một inverted pendulum và MuJoCo HalfCheetah.

Discrepancy term cần expert's action

Điều này quietly disqualifies quy tắc đầy đủ cho hands-off supervision. Distance giữa learner's action và expert's yêu cầu expert's action ở state đó, tại moment đó. Với một scripted expert, fine. Với một con người, con người phải tạo actions liên tục — chính xác là gánh nặng các biến thể được gating được dự định để remove. Chỉ doubt term là hands-off; conjunction không.

LazyDAgger: stop the switch from chattering

Hoque và các đồng nghiệp (2021) tấn công một chi phí các papers trước đó không đo lường: switch itself. Mỗi intervention "gián đoạn công việc khác mà con người đang làm, tạo ra latency với mỗi context switch giữa supervisor và autonomous control, và yêu cầu thời gian để thực hiện". Một cổng mở và đóng mười lần một phút tệ hơn một cái mở một lần trong mười giây, ở autonomous share giống hệt. LazyDAgger mở rộng SafeDAgger với asymmetric thresholds — khó hơn để enter supervisor control hơn để stay in it — vì vậy hệ thống không dao động tại biên giới. Trong simulation nó "có thể giảm context switches by an average of 60% over SafeDAgger trên 3 continuous control tasks trong khi maintaining state-of-the-art policy performance"; trong fabric manipulation với một ABB YuMi nó "giảm context switches by 60% trong khi achieving a 60% higher success rate so với SafeDAgger tại execution time".

ThriftyDAgger: novelty or risk, under a budget

ThriftyDAgger (Hoque et al., CoRL 2021) khởi đầu từ supervisor's budget hơn là policy. Nó "sử dụng một learned switching policy để solicit interventions chỉ tại states mà sufficiently (1) novel, nơi robot policy không có reference behavior để imitate, hoặc (2) risky, nơi robot có low confidence trong task completion", với một metric mới để estimate rủi ro đó. Budget là một input, không phải một outcome: bạn state bao nhiêu human time bạn sẽ spend. Applied tại execution time phương pháp "đạt được một 100% success rate trên cả simulation và physical tasks", và một user study với ten participants kiểm soát một three-robot fleet alongside a concentration task báo cáo rằng nó "tăng human và robot performance by 58% và 80% tương ứng so với next best algorithm trong khi reducing supervisor burden". Fleet setting là natural home cho công việc này; Fleet-DAgger sau này formalized interactive fleet learning với multiple robots và supervisors, đề xuất Return on Human Effort như lượng để optimize.

HG-DAgger: the human holds the gate

Kelly et al. (2019) đi cách khác. Không có switching policy. Learner được rolled out "cho đến khi expert observe rằng novice đã enter một unsafe region của state space", tại điểm đó expert takes control và guides hệ thống back. Aggregation rule là strict part: "Expert action labels chỉ được collected và added tới dataset trong các recovery trajectories, trong đó human expert có uninterrupted control của hệ thống." Nothing được labeled trong khi con người là spectator.

Nó không dừng lại ở switch. HG-DAgger cũng "học một safety threshold cho một model-uncertainty-based risk metric mà có thể được sử dụng để predict performance của fully trained novice trong các vùng khác nhau của state space": nó logs bao không chắc learner ở các moments con người intervened và averages quarter cuối cùng của những records đó, nơi learner most resembles final form của nó. Đó không phải một cổng mà robot operates mà một diagnostic telling bạn nơi finished policy được expect để hold. Evaluation covers một simulated và một real-world driving task và báo cáo improved performance so với cả DAgger và behavior cloning.

Một related line thay đổi cái gì counts như một label. Spencer và các đồng nghiệp's Expert Intervention Learning giữ rằng "bất kỳ amount của expert feedback, có thể là intervention hoặc non-intervention, cung cấp thông tin về chất lượng của current state, optimality của action, hoặc cả hai", formalized như một constraint trên learner's value function và solved với no-regret online learning. Dưới reading đó, stretches nơi con người watched và không làm gì là weak positive evidence hơn là empty. EIL học collision avoidance từ khoảng một phút của expert control.

Robot arm workspace có cameras positioned để data collection trong một supervised policy rollout
Một human-gated round là một ordinary inference run với một recorder attached. Frames mà operator drove được flagged; rest ở vị trí như cũ.

The variants side by side

MethodWho opens the gateSignalNeeds availableReported
DAgger (Ross et al., 2011)Nobody — learner luôn láiNone; expert gán nhãn mỗi visited stateMột expert có khả năng gán nhãn off-policy states trong khi không trong quyền kiểm soátNo-regret reduction với guarantees dưới learner's state distribution
HG-DAgger (Kelly et al., 2019)Human supervisorSupervisor's judgement mà state đó không an toànSomeone watching, và một clean handover của controlBeats DAgger và behavior cloning trên một simulated và real driving task; cũng học một risk threshold
SafeDAgger (Zhang & Cho, 2016)RobotBinary classifier cho L2 deviation từ reference above tauMột queryable reference policy cho classifier's labelsÍt hơn reference queries trong một racing simulator, faster convergence (không hình vẽ được đưa ra)
EnsembleDAgger (Menda et al., 2019)RobotEnsemble variance và distance tới expert action, cả hai dưới thresholdMột ensemble của networks cộng expert's action ở mỗi stepImproved safety và learning trên pendulum và HalfCheetah
LazyDAgger (Hoque et al., 2021)Robot, với hysteresisSafeDAgger's signal với separate entry và exit thresholdsCái mà SafeDAgger cần, cộng một second threshold để tune~60% ít hơn context switches trên 3 tasks; 60% higher success trên YuMi fabric
ThriftyDAgger (Hoque et al., 2021)Robot, dưới một budgetNovelty, hoặc estimated risk không completing taskMột learned risk estimator và một stated intervention budget100% success tại execution time; user study (N=10): 58% và 80% gains so với next-best
EIL (Spencer et al., 2020)Human — non-intervention counts quáIntervention và absence của nó như constraints trên value functionOnline no-regret learning trên một value constraintCollision avoidance từ khoảng một phút của expert control

What each gate buys, and what it charges

Đọc down "needs" column và một pattern rơi ra: mỗi robot-gated signal ở đó là một proxy mà phải được manufacture, và mỗi proxy có bill riêng của nó.

  • Discrepancy signals (SafeDAgger, LazyDAgger, một nửa của EnsembleDAgger's rule) cần một reference policy. Hoặc bạn có một scripted expert, trong trường hợp đó interesting problem đã được solved, hoặc một con người keeps producing actions trong background để một distance có thể computed.
  • Doubt signals cần calibrated epistemic uncertainty. Một ensemble của small control networks xấp xỉ nó; một ensemble của một three-billion-parameter vision-language-action model là một memory và latency problem đầu tiên.
  • Novelty và risk signals cần một learned estimator của task completion, fitted trên đủ successful và failed rollouts. Trên một task bạn vẫn getting để work, data đó không exist trong round một.
  • Human gate cần attention và nothing else — tín hiệu duy nhất available trên day một, trên bất kỳ policy architecture, với no extra model để train.
  • No robot gate removes con người khỏi phòng. Chúng giảm bao lần con người phải act, không phải liệu chúng phải present.

Có một quieter difference trong cái gì gate produces. Một robot gate firing mid-trajectory trao một người một moving arm tại một arbitrary pose. Một human gate cho phép operator pick moment — sau reach, trước grasp, không halfway through một swing. Recovery segments từ hai không equally clean, và những segments đó là entire product của round.

Why the human-gated form wins on real hardware

Đây là một engineering argument, không phải một benchmark result — không paper nào chúng tôi found chạy tất cả năm gates trên cùng một manipulator với cùng một policy class. Nó rests trên bốn điểm.

First, supervisor ở đây anyway. Nobody leaves một SO-100 arm running unattended next tới objects nó có thể knock over. Một khi someone ở watching, marginal cost của giving họ một takeover button là near zero; building một calibrated risk estimator là một project.

Second, uncertainty bạn có thể actually measure trên một modern policy thường là wrong quantity. Một diffusion hoặc flow-matching head produces variance qua sampled action chunks, và variance đó reflects multimodality head được trained để represent, không epistemic ignorance về state. EnsembleDAgger's doubt term sử dụng một ensemble precisely để capture latter. Hai cái trông như same number và không phải; action chunkingflow matching entries cover bao những heads emit actions trong first place.

Third, failures mà matter trong manipulation thường là semantic hơn statistically unusual. Một policy closing gripper two centimetres sớm, hoặc reaching confidently cho wrong một của hai identical cubes, không phải trong một high-variance state — nó confident và wrong. No variance threshold catches đó; một person watching catches nó immediately.

Fourth, label quality — original HG-DAgger point, và one most often skipped. Labels collected trong khi human có uninterrupted control beat labels narrated qua một moving system. Nếu goal là corrective data worth aggregating, burden của proof nằm với automated gate.

Where robot gates do pay off

Picture flips khi one supervisor responsible cho many robots — regime ThriftyDAgger's user study và Fleet-DAgger's formalization target. Với một fleet, human attention là scarce resource và một imperfect allocation beats none. Với one arm trên one desk bạn không trong regime đó.

The human-gated loop, already wired up

Takeover trong một running inference session, per-frame intervention flags trên corrected segments, curating mỗi run thành corrections hoặc evaluation, composing một mixed dataset từ sources bạn pick, và continuing training từ một existing checkpoint được built in hơn scripted bằng tay. Takeover works với một leader arm, hoặc với keyboard và sliders nếu bạn không có một.

See how the DAgger loop runs

The gate is half the method; data handling is the other half

Một gate quyết định frames nào một con người drove, không cái gì để làm với chúng, và second decision đó là nơi rounds most often wasted. First rule là one D trong DAgger stands cho: aggregate, không replace. Fine-tuning một checkpoint purely trên một few hundred correction frames cho bạn một model mà đã seen almost nothing nhưng recoveries và đã forgotten nominal trajectory.

Second rule là intervention frames không ordinary frames. Mandlekar et al. built một remote-teleoperation system cho 6-DoF manipulation letting operators monitor policies và take over trên failure, sau đó trained iteratively với một algorithm mà "encourages policy để learn bao traverse bottlenecks qua interventions"; agents trained trên data đó outperformed agents trained trên một equal number của ordinary demonstration samples. Sirius pushes idea vào deployment, "re-weighing training samples với approximated human trust và optimizing policies với weighted behavioral cloning". Cả hai cần một per-frame marker của cái gì được human-driven, đó là lý do intervention flag matters hơn nó looks.

Third rule là automatic mixing là một trap. Một composed dataset mà sources bạn không thể enumerate là một bạn không thể debug khi next round gets worse. Trên platform này compose step là explicit cho reason đó — original dataset cộng corrections, episode selection per source, và result là một ordinary LeRobot dataset mà syncs và trains như bất kỳ khác; dataset documentation covers format side.

Step in a roundWhat it producesMost common way it goes wrong
Run inference với recording onA run dưới policy's riêng state distributionRecorded như plain teleoperation, mất rằng một policy được driving
Take over trên failureCorrection segments với một per-frame intervention flagCorrecting cosmetic wobble, teaching style hơn một recovery
Curate mỗi episodeCorrections, evaluation, hoặc discardsKeeping everything; một botched takeover costs hơn episode đó worth
Sync correctionsA versioned dataset beside originalCorrections mà never leave local machine
Compose mixed datasetOriginal cộng corrections, explicit selectionSilent auto-mixing, vì vậy một later regression không thể traced tới một source
Continue từ một checkpointA checkpoint initialized từ previous mộtExpecting một optimizer resume; weights initialize model, họ không restore optimizer state

Setting a gate a person can actually hold

"The human decides" không phải một specification. Hai operators với different thresholds produce incomparable rounds, và một drifting threshold produces một trend bạn không thể read. Write triggers down trước first run.

  1. Name conditions mà open gate — approach off bằng more than một fixed margin, gripper closing trên nothing, một joint drifting hướng tới một limit, một stall của more than một second hoặc two — và keep list unchanged cho round.
  2. Name cái gì không open nó. Overshoot policy recovers từ on its own là training signal; taking over ở đó deletes một recovery nó already knows.
  3. Take over sớm enough cho một clean handover, hand back as soon as state là recoverable.
  4. Log tại sao bạn took over, per episode. Três rounds sau đó nó là only record của liệu same failure returns.
  5. Keep cameras, task text và operator constant qua rounds. Change một và numbers stop being comparable.

Mechanically handover có two variants. Với một leader arm, leader phải reach follower's current pose trước torque transfers, hoặc arm jumps; alignment move này là least-tested part của chain trên real hardware. Mà không một leader arm takeover là manual từ first keypress: follower được held và operator nudges nó joint bằng joint từ keyboard hoặc drags sliders, với server-side clamps keeping mỗi input nhỏ — một couple của degrees per keypress, một handful per slider update, bởi vì một large step thành một held pose là bao bạn strip một servo. Step-by-step version với key bindings ở the walkthrough của một DAgger round trên một SO-100; background trên cả teleoperation modes là ở the teleoperation docsleader-follower entry.

Comparison của supported policy architectures với training và inference characteristics của chúng
Gate là architecture-agnostic. Cái policy nào bạn correct changes training cost của một round, không bao takeover works.

Reading whether gate did anything

Metric của một human-gated round là intervention rate: intervention frames chia cho frames của run. Nó có one job — nếu nó không fall qua rounds, round bought nothing, và next một phải change something khác hơn amount của data.

Nó là một biased metric và bạn nên know bao. Nó measures operator's threshold bằng much như policy's competence, đó là lý do trigger list stays fixed; một operator người relaxes qua một session produces một falling curve với nothing behind it. Nó cũng ignores severity — ten frames để stop một collision và ten để nudge một grasp trông identical. Pair nó với một fixed evaluation set no correction data đã ever drawn từ. The article trên measuring một DAgger loop works qua evaluation design, including bao để keep evaluation episodes out của training mix.

The human gate, honestly
What it gives you
  • Works trên day một, trên bất kỳ policy architecture, với no extra model để calibrate
  • Catches confident-and-wrong failures no variance threshold detects
  • Produces corrections recorded trong khi operator đã full control, tại một moment họ chose
  • Yields một per-frame marker mà intervention-weighted methods như IWR và Sirius consume
What it does not
  • Costs continuous supervision; nó không scale tới one person và many robots
  • Depends trên operator consistency — một drifting threshold corrupts intervention rate
  • Produces no risk model on its own; HG-DAgger's learned threshold và ThriftyDAgger's estimator là extra machinery
  • Counts frames, không consequences
  • Cannot rescue một policy mà failure là upstream của control, như một swapped camera hoặc một mislabelled task string

Open questions worth keeping ở view

Benchmarks là weak. Spencer và colleagues examined những used để test imitation learning approaches và found họ "realizable và simple và do đó insufficient cho capturing harder regimes của error compounding seen trong real-world decision making problems" — và, against surrounding literature, found plain behavior cloning did well trên chúng. Đó là reason để skeptical của bất kỳ ranking của DAgger variants resting trên những tasks, including some numbers trong table above.

Robot gates trên large policies không solved hoặc. AIM work replaces uncertainty với một proxy Q-function mimicking human intervention rule và reports một 40% improvement trong take-over cost và learning efficiency over ThriftyDAgger — trong continuous và discrete control, không trên một vision-language-action model driving một manipulator. Whether bất kỳ của những gates transfers tới một fine-tuned VLA là open. Survey makes một related point: field's terminology và structure không unified qua literature, cái mà makes methods hard để compare. Trên your own arm, your logs là evidence bạn có.

Is HG-DAgger really DAgger nếu human chỉ labels trong interventions?

Nó keeps part mà matters — data collected dưới state distribution learner induces, aggregated với cái came trước — và drops part mà không survive contact với hardware. Kelly et al. present nó như một variant; 2011 no-regret guarantee không carry qua unchanged.

Can I use một robot gate trên một fine-tuned VLA policy trên một SO-100?

Không straightforwardly. SafeDAgger's classifier cần một queryable reference policy bạn không have. EnsembleDAgger cần một ensemble, mà cho một multi-billion-parameter model có nghĩa là several copies trong memory cộng inference cost của chúng. ThriftyDAgger cần một risk estimator fitted trên successes và failures mà không exist trước your first rounds.

How long nên một single takeover được?

Long enough để reach một state policy có thể continue từ, và no longer: extended takeovers turn run thành một demonstration session và flood correction set với nominal behavior. LazyDAgger's finding cuts other way quá — many very short switches là their own cost.

Should I train chỉ trên corrected segments?

No — đó là most common way để waste một round. Một model fine-tuned chỉ trên recoveries đã seen almost nothing nhưng recoveries. Mix corrections thành original dataset với sources chosen explicitly; để go further, look tại intervention-weighted approaches như IWR hoặc Sirius, họ up-weight human-driven frames hơn isolating chúng.

What nếu intervention rate không fall sau một round?

Take nó tại face value: round không help. Before adding corrections, check cheaper explanations — did operator's threshold drift, were corrections cosmetic, did composed dataset actually chứa họ, was training initialised từ intended checkpoint. Một round mà silently started từ base model trông exactly như một round mà failed để learn.

Does non-intervention carry information?

Under Expert Intervention Learning, yes: stretches nơi supervisor watched và không act được read như weak evidence mà state và action acceptable, formalized như một constraint trên value function. Most practical pipelines, including cái này, mark chỉ cái gì human drove.

Cho một single arm trên một desk choice được made: hold gate yourself, write down cái mà opens nó, và spend effort trên data handling behind nó hơn là trên automating switch. Platform side được described trên the DAgger loop page, training options per policy family dưới training và pricing. Cho background, start với imitation learningimitation learning trên SO-100; cho một first run, run your first policy là shorter path.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started