
Plain DAgger beder en menneske om at mærke tilstande, mens robotten stadig kører. På rigtig hardware er det usikkert og producerer dårlige mærkninger. De gatede varianter erstatter blind mærkning med en gate, som nogen skal holde: mennesket i HG-DAgger, en sikkerhedsklassificerer i SafeDAgger, uenighed blandt ensemblets medlemmer i EnsembleDAgger, et budgetteret estimat over nyhed og risiko i ThriftyDAgger. Denne artikel sammenligner dem efter hvem der ejer gaten, hvad signal åbner den, og hvad hver enkelt koster — og hvorfor den menneske-gatede form er den, som overlever kontakt med en rigtig arm.
En kloneret politik mislykkes, hvor dens træningsdata løb ud. Rettelsen er at blive ved med at indsamle data under politikkens egen tilstandsfordeling i stedet for demonstrantens, hvilket er hvad DAgger gør og hvad introduktionen til datasæt-aggregering dækker fra første principper. Det efterlader den ubelejlige del af den oprindelige algoritme åben: mens læreren kører, skal eksperten sige, hvad de ville have gjort, for hver tilstand, uden at være under kontrol.
I en simulator med en scripted ekspert er det gratis. På et bord med en rigtig arm på det er det hverken gratis eller sikkert. HG-DAgger-forfatterne angiver indvendingen præcist: sådanne sampling skemaer "kræver, at eksperten giver handlings mærkninger uden at være fuldt under kontrol af systemet", som "kan mindske sikkerhed og, når man bruger mennesker som eksperter, sandsynligvis vil forringes kvaliteten af de indsamlede mærkninger på grund af opfattet aktuator lag" (Kelly et al., 2019). To fiaskoer gemmer sig i den sætning: politikken bliver ved med at køre ind i tilstande, som ingen ønsker den i, og de mærkninger, som blev købt med denne risiko, er værre end dem, som en menneske producerer, mens de holder kontrollen. Hver variant nedenfor besvarer det samme spørgsmål — sæt en gate på kontrollen og lad nogen bestemme, hvornår den åbner. De adskiller sig i hvem denne nogen er.
Den korte version
- •De gatede varianter erstatter blind mærkning med en switch mellem politik kontrol og ekspert kontrol. Hvad der adskiller dem, er hvem der ejer switchen.
- •HG-DAgger giver switchen til mennesket og aggregerer kun data registreret, mens mennesket havde uafbrudt kontrol.
- •SafeDAgger giver det til en binær klassificerer, der forudsiger afvigelse fra en referenceprolitik; EnsembleDAgger kræver lav ensemble varians og små afstand til eksperthandlingen samtidigt.
- •LazyDAgger tilføjer hysterese, så kontrol ikke ping-ponger; ThriftyDAgger udelukker på grundlag af nyhed eller estimeret risiko under et eksplicit interventionsbudget.
- •Robot-gatede signaler har brug for noget, som en fine-tuned VLA på en hobby-klasse arm sædvanligvis mangler: en referenceprolitik, et billigt ensemble eller kalibreret epistemisk usikkerhed.
- •Gaten er halvdelen af metoden. Hvad der sker med interventionssegmenterne bagefter — blande, vægte, aggregere — bestemmer, om runden forbedrede noget.
Menneske-gatede og robot-gatede: det split, der betyder noget
Interaktiv imitationslæring har sin egen undersøgelse; Celemin og kolleger katalogiserer det efter feedback type, grænseflade, læringsmodel, brugeroplevelse, applikation og benchmark. Den skelnen, der afgør din engineering, er enklere end nogle af disse akser, og nyere arbejde navngiver det direkte: en metode er menneske-gattet når supervisoren beslutter hvornår man skal gribe ind, og robot-gattet når agenten beslutter hvornår man skal bede om hjælp (Cai et al., 2025). Alting andet er maskinavling, der tjener et af disse to valg. Handelen er synlig fra starten: en menneske gate koster kontinuerlig opmærksomhed, og en robot gate lover at give den opmærksomhed tilbage — men kun hvis det signal, det udelukker, er troværdigt, og at bygge det signal er sit eget forskningsproblem.
SafeDAgger: en klassificerer, der forudsiger sin egen afvigelse
Zhang og Cho's SafeDAgger (2016) er den tidligste af disse gates. At forespørge referenceprolitikken er den dyre del, så et andet, lille netværk — sikkerhedsprolitikken — forudsiger, om det overhovedet er værd at forespørge. Den "returnerer en binær label, der angiver, om den primære politik sandsynligvis vil afvige fra en referenceprolitik uden at forespørge den". Labelen er defineret mod en squared L2 afvigelse mellem de to politikkers handlinger med en tærskel tau, og klassificereren er monteret med binær cross-entropy. Kørselstidspunktet afgør den per state, om læreren bliver ved med at køre, eller om referensen overtager. Abstractet rapporterer færre referenceforespørgsler i en bilkørings simulator plus en convergence hastighed-op, som forfatterne tillægger en automatiseret curriculum effekt, uden at give en tal for nogen af dem.
Fangsten er i definitionen, ikke i resultaterne. At træne klassificereren kræver referenceprolitikkens handling på hver state brugt til at montere den, som antager, at referenceprolitikken er et andet program. Hvis din reference er en person med en leader arm, er det label sæt ikke billigt, og metoden mister den egenskab, den blev designet til.
EnsembleDAgger: tvivl og uoverensstemmelse, begge
Menda, Driggs-Campbell og Kochenderfer (2019) behandler gaten som et probabilistisk spørgsmål. EnsembleDAgger "tilnærmer en Gaussian Process ved hjælp af et ensemble af neurale netværk" og læser ensemblets varians som en tillids proxy: høj varians betyder en region ulig træningsdataene, som — hvis eksperten undgår fejltilstande — korrelerer med nærhed til fejl. Regelen er en konjunktion. Læreren må kun handle, når L2 afstanden mellem dens gennemsnitlige handling og ekspertens handling forbliver under en tærskel (uoverensstemmelse) og variansen af dens forudsagte handling forbliver under en anden (tvivl). Hvis en af dem mislykkes, overtager eksperten kontrollen. Målet er at maksimere lærerens andel af handlinger mens der begrænses sandsynligheden for fejl; papiret rapporterer forbedret sikkerhed og læring mod andre DAgger varianter på et inverteret pendul og MuJoCo HalfCheetah.
Dette udelukker stille den fulde regel for hands-off supervision. Afstanden mellem lærerens handling og ekspertens handling kræver ekspertens handling på denne state, på dette øjeblik. Med en scripted ekspert, fint. Med en menneske, skal mennesket producere handlinger kontinuerligt — præcis den byrde, som de gatede varianter var beregnet til at fjerne. Tvivls udtrykket alene er hands-off; konjunktionen er det ikke.
LazyDAgger: stop switchen fra at svigte
Hoque og kolleger (2021) angreb en omkostning, som de tidligere papirer ikke målte: switchen selv. Hver intervention "afbryder andet arbejde, som mennesket gør, påløber latens ved hver kontekst switch mellem supervisor og autonom kontrol, og kræver tid til at udføre". En gate, der åbner og lukker ti gange i minuttet, er værre end en, der åbner engang i ti sekunder, på identisk autonom andel. LazyDAgger udvider SafeDAgger med asymmetriske tærskler — sværere at komme ind supervisor kontrol end at blive i den — så systemet ikke oscillerer ved grænsen. I simulering "kan reducere kontekst switches med gennemsnitligt 60% over SafeDAgger på 3 kontinuerlige kontrolopgaver while maintaining state-of-the-art policy performance"; i stof manipulation med en ABB YuMi "reducerer kontekst switches med 60% mens opnår en 60% højere succes rate end SafeDAgger på eksekveringstidspunktet".
ThriftyDAgger: nyhed eller risiko, under et budget
ThriftyDAgger (Hoque et al., CoRL 2021) starter fra supervisors budget snarere end politikken. Den "bruger en lært switching policy til at forespørge interventioner kun på tilstande, der er tilstrækkeligt (1) nye, hvor robotprolitikken ingen reference adfærd har at imitere, eller (2) risikable, hvor robotten har lav tillid til opgave completion", med en ny metrik for estimering af den risiko. Budgettet er et input, ikke et resultat: du angiver hvor meget mennesketid, du vil bruge. Anvendt på eksekveringstidspunktet opnår metoden "100% succes rate på både simulation og fysiske opgaver", og en bruger undersøgelse med ti deltagere, der kontrollerer en tre-robot fleet ved siden af en koncentrationsopgave, rapporterer, at den "øger menneske og robot ydeevne med 58% og 80% henholdsvis sammenlignet med næste bedste algoritme while reducing supervisor burden". Fleet-indstillingen er det naturlige hjem for dette arbejde; Fleet-DAgger formaliserede senere interaktiv fleet læring med flere robotter og supervisorer, foreslår Return on Human Effort som den mængde man skal optimere.
HG-DAgger: mennesket holder gaten
Kelly et al. (2019) gøre det på den anden måde. Der er ingen switching policy. Læreren rulles ud "indtil eksperten observerer, at novicen er gået ind i en usikker region af tilstandsrummet", på hvilket tidspunkt eksperten overtager kontrollen og guider systemet tilbage. Aggregation regelen er den strenge del: "Ekspert handlings labels indsamles kun og tilføjes datasættet under disse recovery trajektorier, under hvilke menneske eksperten har uafbrudt kontrol af systemet." Intet mærkes, mens mennesket er en tilskuer.
Det stopper ikke ved switchen. HG-DAgger lærer også "en sikkerhed tærskel for en model-uncertainty-baseret risiko metrik, der kan bruges til at forudsige ydeevnen af den fuldt trænet novice i forskellige regioner af tilstandsrummet": den logger hvor usikker læreren var på momenterne, hvor mennesket greb ind, og gennemsnittet sidste kvarter af disse poster, hvor læreren mest ligner sin slutform. Det er ikke en gate, som robotten betjener, men en diagnostik, der fortæller dig, hvor den færdige politik forventes at holde. Evalueringen dækker en simuleret og en real-world køreopgave og rapporterer forbedret ydeevne over både DAgger og behavior cloning.
En relateret linje ændrer hvad der tæller som label. Spencer og kolleger's Expert Intervention Learning holder, at "enhver mængde ekspert feedback, hvad enten ved intervention eller ikke-intervention, giver information om kvaliteten af den aktuelle tilstand, optimaliteten af handlingen, eller begge", formaliseret som en constraint på lærerens value function og løst med no-regret online læring. Under det læsning er strækningen hvor mennesket kiggede og gjorde intet svage positive beviser snarere end tomme. EIL lærer collision avoidance fra omkring et minut af ekspert kontrol.

De varianter side ved side
| Metode | Hvem åbner gaten | Signal | Behov til rådighed | Rapporteret |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Ingen — læreren kører altid | Ingen; eksperten mærker hver besøgt tilstand | En ekspert der kan mærke off-policy tilstande uden at være under kontrol | No-regret reduktion med garantier under lærerens tilstandsfordeling |
| HG-DAgger (Kelly et al., 2019) | Menneske supervisoren | Supervisorens vurdering af, at tilstanden er usikker | Nogen der ser, og en ren overgang af kontrol | Slår DAgger og behavior cloning på en simuleret og en rigtig køreopgave; lærer også en risiko tærskel |
| SafeDAgger (Zhang & Cho, 2016) | Robotten | Binær klassificerer for L2 afvigelse fra referenceprolitikken ovenfor tau | En queryable referenceprolitik for klassificererens labels | Færre referenceforespørgsler i en racersimulator, hurtigere convergence (ingen tal givet) |
| EnsembleDAgger (Menda et al., 2019) | Robotten | Ensemble varians og afstand til eksperthandlingen, begge under tærskel | Et ensemble af netværk plus ekspertens handling på hvert trin | Forbedret sikkerhed og læring på pendul og HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Robotten, med hysterese | SafeDAggers signal med separate entry og exit tærskler | Hvad SafeDAgger har brug for, plus en anden tærskel at tune | ~60% færre kontekst switches på 3 opgaver; 60% højere succes på YuMi stof |
| ThriftyDAgger (Hoque et al., 2021) | Robotten, under et budget | Nyhed, eller estimeret risiko for ikke at fuldende opgaven | En lært risiko estimator og et angivet interventionsbudget | 100% succes på eksekveringstidspunktet; bruger undersøgelse (N=10): 58% og 80% gevinster over næste bedste |
| EIL (Spencer et al., 2020) | Mennesket — ikke-intervention tæller også | Intervention og dets fravær som constraints på value functionen | Online no-regret læring over en value constraint | Collision avoidance fra omkring et minut af ekspert kontrol |
Hvad hver gate køber, og hvad den koster
Læs ned i "behov" kolonnen og et mønster falder ud: hver robot-gattet signal der er en proxy, der skal fremstilles, og hver proxy har sin egen regning.
- Uoverensstemmelse signaler (SafeDAgger, LazyDAgger, halvdelen af EnsembleDAgger's regel) har brug for en referenceprolitik. Enten har du en scripted ekspert, i hvilket tilfælde det interessante problem allerede er løst, eller et menneske bliver ved med at producere handlinger i baggrunden, så en afstand kan beregnes.
- Tvivls signaler har brug for kalibreret epistemisk usikkerhed. Et ensemble af små kontrolnetværk tilnærmer det; et ensemble af en tre-milliarder-parameter vision-language-action model er et hukommelse og latens problem først.
- Nyhed og risiko signaler har brug for en lært estimator af opgave completion, monteret på nok succesfulde og mislykkede rollouts. På en opgave, du stadig får til at virke, eksisterer disse data ikke i runde en.
- Menneske gaten har brug for opmærksomhed og intet andet — det eneste signal til rådighed på dag en, på ethvert politik arkitektur, med ingen ekstra model at træne.
- Ingen robot gate fjerner mennesket fra rummet. De reducerer hvor ofte mennesket skal handle, ikke om de skal være til stede.
Der er en stille forskel i hvad gaten producerer. En robot gate fyring midt-bane giver en person en bevægende arm på en vilkårlig pose. En menneske gate lader operatøren vælge øjeblikket — efter reach, før grasp, ikke halvvejs gennem en swing. Recovery segmenterne fra de to er ikke lige rene, og disse segmenter er hele produktet af runden.
Hvorfor den menneske-gatede form vinder på rigtig hardware
Dette er et engineering argument, ikke et benchmark resultat — ingen papir vi fandt kører alle fem gates på samme manipulator med samme policy klasse. Det hviler på fire punkter.
Først, supervisoren er der alligevel. Ingen lader en SO-100 arm køre uovervåget ved siden af objekter, den kan vælte. Når nogen ser, er marginal omkostningen ved at give dem en takeover knap nær nul; at bygge en kalibreret risiko estimator er et projekt.
Andet, usikkerheden, du kan faktisk måle på en moderne politik, er ofte den forkerte mængde. En diffusion eller flow-matching hoved producerer varians på tværs af samplede action chunks, og denne varians afspejler multimodaliteten, som hovedet blev trænet til at repræsentere, ikke epistemisk uvidenhed om tilstanden. EnsembleDAgger's tvivls udtryk bruger et ensemble præcist til at fange sidstnævnte. De to ser ud som det samme tal og er det ikke; action chunking og flow matching entries dækker hvordan disse hoveder udsender handlinger i første omgang.
Tredje, fejlene, der betyder noget i manipulation, er ofte semantiske snarere end statistisk usædvanligt. En politik der lukker gripper to centimeter for tidligt, eller når selvsikkert efter den forkerte af to identiske terninger, er ikke i en høj-varians tilstand — den er selvsikker og forkert. Ingen varians tærskel fanger det; en person ser det øjeblikkeligt.
Fjerde, label kvalitet — det oprindelige HG-DAgger punkt, og det, der oftest springes over. Labels indsamlet, mens mennesket har uafbrudt kontrol, slår labels fortalt over et bevægeligt system. Hvis målet er korrigerende data værd aggregering, ligger bevissbyrden hos den automatiserede gate.
Billedet flips, når en supervisor er ansvarlig for mange robotter — regime ThriftyDAggers bruger undersøgelse og Fleet-DAgger's formalisering target. Med en fleet, menneske opmærksomhed er den knappe ressource, og en ufuldkommen allokering slår ingen. Med en arm på et skrivebord er du ikke i det regime.
Den menneske-gatede loop, allerede ledningsført
Takeover under en kørende inference session, per-frame intervention flags på de korrigerede segmenter, kuratorer hver runde til korrektioner eller evaluering, sammensat et blandet datasæt fra kilder du vælger, og fortsætter træning fra en eksisterende checkpoint bygget i snarere end scripted af hånd. Takeover virker med en leader arm, eller med tastatur og sliders hvis du ikke har en.
Se hvordan DAgger loopen kørerGaten er halvdelen af metoden; data håndtering er den anden halvdel
En gate bestemmer hvilke rammer et menneske kørte, ikke hvad man gør med dem, og denne anden beslutning er hvor runder oftest spildes. Den første regel er den D i DAgger står for: aggreger, erstat ikke. Fine-tuning a checkpoint rent på et par hundrede korrektions frames giver dig en model, der har set næsten intet end recoveries og har glemt den nominelle bane.
Den anden regel er, at intervention frames ikke er almindelige frames. Mandlekar et al. byggede et fjernteleoperation system til 6-DoF manipulation lader operatører overvåge politikker og overtage på fejl, derefter træne iterativt med en algoritme, der "opfordrer politikken til at lære, hvordan man traverserer flaskehalse gennem interventioner"; agenter trænet på disse data outperformed agenter trænet på et lige antal almindeligt demonstration samples. Sirius skubber ideen ind i deployment, "re-vejning trænings samples med tilnærmet menneske tillid og optimering politikker med vejted behavioral cloning". Begge har brug for et per-frame marker af hvad der blev menneske-kørt, hvilket er hvorfor "intervention" flaget betyder mere end det ser ud til.
Den tredje regel er, at automatisk blanding er en fælde. Et sammensat datasæt, hvis kilder du ikke kan opregne, er et du ikke kan debugge, når næste runde bliver værre. På denne platform kompose trinnet er eksplicit for den grund — oprindelig datasæt plus korrektioner, episode valg per kilde, og resultatet er et almindeligt LeRobot datasæt der synkroniseres og træner som en anden; datasæt dokumentation dækker format siden.
| Trin i en runde | Hvad den producerer | Mest almindelig måde det går galt |
|---|---|---|
| Kør inference med recording på | En kørsel under politikkens egen tilstandsfordeling | Registreret som plain teleoperation, miste at en politik kørte |
| Overtag på fejl | Korrektion segmenter med et per-frame intervention flag | Korrigering kosmetisk vibrato, undervisning stil snarere end en recovery |
| Kuratorer hver episode | Korrektioner, evaluering, eller kasserer | Beholder alt; en klodset takeover koster mere end episoden var værd |
| Synkronisering korrekturerne | En versioneret datasæt ved siden af den oprindelige | Korrektioner, der aldrig forlader den lokale maskine |
| Sammensæt det blandede datasæt | Original plus korrektioner, eksplicit valg | Stille auto-blanding, så en senere regression ikke kan spores til en kilde |
| Fortsæt fra et checkpoint | Et checkpoint initialiseret fra det forrige | Forventer en optimizer resume; vægtene initialiserer modellen, de gendanner ikke optimizer tilstand |
Sætter en gate et menneske kan faktisk holde
"Mennesket beslutter" er ikke en specifikation. To operatører med forskellige tærskler producerer sammenlignbare runder, og en drivende tærskel producerer en trend du ikke kan læse. Skriv triggerne ned før den første kørsel.
- Navngiv betingelserne, der åbner gaten — tilgang uden af mere end en fast margin, gripper lukker på intet, et joint drivende mod en grænse, en stald af mere end et sekund eller to — og hold listen uændret for runden.
- Navngiv hvad der ikke åbner det. Overshoot politikken gendanner fra på egen hånd er trænings signal; at overtage der sletter en recovery, det allerede ved.
- Overtag tidligt nok til en ren overdragelse, danner tilbage så snart tilstanden er genoprettelig.
- Log hvorfor du overtog, per episode. Tre runder senere er det det eneste rekord af hvad samme fejl returnerer.
- Hold kameraer, opgave tekst og operatør konstant på tværs af runder. Skift en og tallene slutter med at være sammenlignelige.
Mekanisk skal overdragelse har to varianter. Med en leader arm, lederen skal nå følgerens nuværende pose før moment overfører, eller armen hopper; denne alignment bevægelse er den mindst-testede del af kæden på rigtig hardware. Uden en leader arm takeover er manuel fra det første tastetryk: følgeren holdes og operatøren nudges det joint af joint fra tastaturet eller drager sliders, med server-side klemmer holder hver input småt — et par grader per tastetryk, en håndful per slider opdatering, fordi et stort step ind i en holdt pose er hvordan du fjerner en servo. Step-by-step versionen med keyBindings er i gennemgangen af en DAgger runde på en SO-100; baggrund på begge teleoperation modes er i teleoperation docs og leader-follower entry.

Læsning om gaten gjorde noget
Metrikken for en menneske-gattet runde er interventionsraten: intervention frames divideret med frames af kørsel. Det har et job — hvis det ikke falder på tværs af runder, har runden købt intet, og den næste skal ændre noget andet end mængden af data.
Det er en skæv metrik og du burde vide hvordan. Det måler operatørens tærskel ligesom politikkens kompetence, hvilket er hvorfor triggerlisten forbliver fast; en operatør der afslapper på tværs af en session producerer en faldende kurve med intet bag. Det ignorerer også alvor — ti frames for at stoppe en kollision og ti for at nudge en grasp ser identisk ud. Parring det med et fast evalueringsset ingen korrektionsdata blev aldrig tegnet fra. Artiklen om at måle en DAgger loop arbejder gennem evaluering design, herunder hvordan man holder evaluerings episoder ud af trænings mix.
- Virker dag en, på ethvert politik arkitektur, med no ekstra model at kalibrere
- Fanger selvfikker-og-forkert fejl ingen varians tærskel detekterer
- Producerer korrektioner registreret, mens operatøren havde fuldt kontrol, på et øjeblik de valgte
- Giver et per-frame marker, som interventions-vejtet metoder som IWR og Sirius forbruger
- Koster kontinuerlig tilsyn; den skaleres ikke til en person og mange robotter
- Afhænger af operatør konsistens — en drivende tærskel korruper interventionsraten
- Producerer ingen risiko model på egen hånd; HG-DAgger's lært tærskel og ThriftyDAgger's estimator er ekstra maskinavling
- Tæller frames, ikke konsekvenser
- Kan ikke redde en politik hvis fejl er opstream af kontrol, som en byttet kamera eller en mislabelled opgave streng
Åbne spørgsmål værd at holde i syn
Benchmarkene er svage. Spencer og kolleger undersøgte dem brugt til test imitation learning tilgange og fandt dem "realizable og simple og således utilstrækkelig til at indfange de hårdere regimer af fejl compounding set i rigtig-verden decision making problemer" — og, mod den omgivende litteratur, fandt plain behavior cloning gjorde godt på dem. Det er grund til at være skeptisk over for enhver ranking af DAgger varianter hvilelset på disse opgaver, herunder nogle tal i tabellen ovenfor.
Robot gates på store politikker er heller ikke løst. AIM arbejde erstatter usikkerhed med en proxy Q-funktion efterligning menneske interventions regel og rapporterer en 40% forbedring i take-over omkostning og læring effektivitet over ThriftyDAgger — i kontinuerlig og diskret kontrol, ikke på en vision-language-action model der kører en manipulator. Om nogen af disse gates overfører til en fine-tuned VLA er åbent. Undersøgelsen gør et relateret punkt: feltets terminologi og struktur er ikke enige på tværs af litteratur, som gør metoder hård at sammenligne. På din egen arm, dine logs er det bevis du har.
Er HG-DAgger virkelig DAgger hvis mennesket kun mærker under interventioner?▾
Den holder den del der betyder — data indsamlet under tilstandsfordelingen læreren inducerer, aggregeret med hvad der kom før — og dropper den del, der ikke overlever kontakt med hardware. Kelly et al. præsenterer det som en variant; 2011 no-regret garantien danner ikke uændret.
Kan jeg bruge en robot gate på en fine-tuned VLA politik på en SO-100?▾
Ikke lige på. SafeDAgger's klassificerer har brug for en queryable referenceprolitik du ikke har. EnsembleDAgger har brug for et ensemble, som for en multi-milliarder-parameter model betyder flere kopier i hukommelse plus deres inference omkostning. ThriftyDAgger har brug for en risiko estimator monteret på succesfulde og fejl, som ikke eksisterer før dine første runder.
Hvor lang burde en enkelt takeover være?▾
Lang nok til at nå en tilstand politikken kan fortsætte fra, og ikke længere: udvidede takeovers vender kørslen til en demonstration session og oversvømmer korrektur sættet med nominal adfærd. LazyDAgger's søgefund skærer den anden vej også — mange meget korte switches er deres egen omkostning.
Skal jeg træne kun på de korrigerede segmenter?▾
Nej — det er den mest almindelig måde at spilde en runde. En model fine-tuned kun på recoveries har set næsten intet end recoveries. Bland korrektioner i det oprindelige datasæt med kilder valgt eksplicit; at gå videre, kig på interventions-vejtet tilgange som IWR eller Sirius, som op-vejt menneske-kørt frames snarere end isolere dem.
Hvad hvis interventionsraten ikke falder efter en runde?▾
Tag det til ansigt værdi: runden hjalp ikke. Før tilføjelse korrektioner, check billigere forklaringer — drev operatørens tærskel, var korrekturerne kosmetik, gjorde sammensat datasæt faktisk indeholder dem, blev træning initialiseret fra det tilsigtede checkpoint. En runde der tavst startede fra basis model ser præcist som en runde der mislykkedes at lære.
Gør ikke-intervention bærer information?▾
Under Expert Intervention Learning, ja: strækning hvor supervisor så på og ikke handlede er læs som svage bevis, at tilstand og handling var acceptabel, formaliseret som en constraint på value functionen. Mest praktiske pipelines, herunder denne, mærk kun hvad mennesket kørte.
For en enkelt arm på et skrivebord er valget lavet: hold gaten selv, skriv ned hvad der åbner det, og bruge indsatsen på data håndtering bag den snarere end på at automatisere switchen. Platformsiden er beskrevet på DAgger loop page, trænings optioner per politik familie under træning og prissætning. For baggrund, start med imitationslæring og imitationslæring på SO-100; for et første løb, kør dine første politik er den kortere vej.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started