Bediener kontrolliert einen Roboterarm über eine Fernsteuerungsschnittstelle, die Hände an den Reglern und bereit zur Übernahme
DAggerInteraktives ImitationslernenHG-DAggerRobot PoliciesSO-100

HG-DAgger und die Gated Varianten: Wer entscheidet über die Übernahme einer Policy

AY-Robots Research27. August 202615 min Lesedauer

Das ursprüngliche DAgger verlangt von einem Menschen, während der Roboter noch fährt, Zustände zu labeln. Auf echter Hardware ist das unsicher und erzeugt schlechte Labels. Die Gated Varianten ersetzen blindes Labeling durch eine Schleuse, die jemand halten muss: der Mensch bei HG-DAgger, ein Sicherheitsklassifizierer bei SafeDAgger, die Uneinigkeit eines Ensembles bei EnsembleDAgger, eine budgetierte Neuartigkeits- und Risikoschaetzer bei ThriftyDAgger. Dieser Artikel vergleicht sie danach, wer die Schleuse bedient, welches Signal sie oeffnet, und welche Kosten sie jeweils hat — und warum die durch den Menschen gesteuerte Form die ist, die den Kontakt mit einem echten Arm übersteht.

Eine geklonte Policy schlägt fehl, wo die Trainingsdaten aufhörten. Die Lösung ist, weiterhin Daten unter der eigenen Zustandsverteilung der Policy zu sammeln, nicht unter der des Demonstrators, was DAgger tut und was die Einführung zur Datensatzaggregation aus den Grundprinzipien abdeckt. Dabei bleibt der unbequeme Teil des ursprünglichen Algorithmus offen: Während der Lerner fährt, soll der Experte für jeden Zustand sagen, was sie getan hätten, ohne selbst die Kontrolle zu haben.

Im Simulator mit einem geskripteten Experten ist das kostenlos. An einem Tisch mit echtem Arm ist es weder kostenlos noch sicher. Die HG-DAgger-Autoren formulieren den Einwand präzise: solche Sampling-Schemata "require the expert to provide action labels without being fully in control of the system", was "can decrease safety and, when using humans as experts, is likely to degrade the quality of the collected labels due to perceived actuator lag" (Kelly et al., 2019). Zwei Fehler verbergen sich in diesem Satz: die Policy fährt weiter in Zustände, in die niemand sie haben möchte, und die mit diesem Risiko erkauften Labels sind schlechter als die, die ein Mensch produziert, der die Regler bedient. Jede Variante unten beantwortet die gleiche Frage — lege eine Schleuse auf die Kontrolle und lass jemanden entscheiden, wann sie sich öffnet. Sie unterscheiden sich darin, wer dieser Jemand ist.

Die Kurzfassung

  • Die Gated Varianten ersetzen blindes Labeling durch einen Schalter zwischen Policy-Kontrolle und Experten-Kontrolle. Was sie unterscheidet, ist, wer diesen Schalter bedient.
  • HG-DAgger gibt den Schalter dem Menschen und aggregiert nur Daten, die aufgezeichnet wurden, während der Mensch ununterbrochene Kontrolle hatte.
  • SafeDAgger gibt ihn an einen binären Klassifizierer, der Abweichungen von einer Referenzpolicy vorhersagt; EnsembleDAgger verlangt gleichzeitig niedrige Ensemble-Varianz und kleine Distanz zur Expertenaktion.
  • LazyDAgger fügt Hysterese hinzu, damit die Kontrolle nicht hin und her schaltet; ThriftyDAgger öffnet die Schleuse abhängig von Neuartigkeit oder geschätztem Risiko unter einem expliziten Interventionsbudget.
  • Policy-gesteuerte Signale brauchen etwas, das ein feingekörnertes VLA auf einem Hobbyroboterarm normalerweise nicht hat: eine Referenzpolicy, ein billiges Ensemble oder kalibrierte epistemische Unsicherheit.
  • Die Schleuse ist die Hälfte der Methode. Was danach mit den Interventionssegmenten passiert — vermischte, gewichtet, aggregiert — entscheidet, ob die Runde etwas verbesserte.

Durch den Menschen gesteuert und Policy-gesteuert: die Unterscheidung, die zählt

Interaktives Imitationslernen hat eine eigene Übersicht; Celemin und Kollegen katalogisieren es entlang Rückkopplungstyp, Schnittstelle, Lernmodell, Nutzererlebnis, Anwendung und Benchmark. Die Unterscheidung, die Ihre Entwicklung entscheidet, ist einfacher als jede dieser Achsen, und neuere Arbeiten nennen sie direkt: eine Methode ist durch den Menschen gesteuert, wenn der Überwacher über Interventionen entscheidet, und Policy-gesteuert, wenn der Agent entscheidet, wann um Hilfe gefragt wird (Cai et al., 2025). Alles andere ist Maschinerie, die einer dieser beiden Wahlmöglichkeiten dient. Der Kompromiss ist von Anfang an sichtbar: eine menschliche Schleuse kostet ständige Aufmerksamkeit, und eine Policy-gesteuerte Schleuse verspricht, diese Aufmerksamkeit zurückzugeben — aber nur, wenn das Signal, das sie öffnet, vertrauenswürdig ist, und dieses Signal zu bauen ist sein eigenes Forschungsproblem.

SafeDAgger: ein Klassifizierer, der seine eigene Abweichung vorhersagt

Zhangs und Chos SafeDAgger (2016) ist das älteste dieser Gates. Abfragen der Referenzpolicy ist der teure Teil, also sagt ein zweites, kleines Netzwerk — die Safety Policy — voraus, ob es sich überhaupt lohnt, abzufragen. Es "returns a binary label indicating whether the primary policy is likely to deviate from a reference policy without querying it". Das Label ist gegen eine quadrierte L2-Abweichung zwischen den Aktionen der beiden Policies mit Schwelle tau definiert, und der Klassifizierer ist mit binärer Kreuzentropie angepasst. Zur Laufzeit entscheidet er pro Zustand, ob der Lerner weiter fährt oder die Referenz übernimmt. Der Abstract berichtet weniger Referenzabfragen in einem Auto-Rennspiel-Simulator plus eine Konvergenzgeschwindigkeit, die die Autoren einem automatisierten Curriculum-Effekt zuschreiben, ohne eine Zahl für beides zu geben.

Der Haken sitzt in der Definition, nicht in den Ergebnissen. Den Klassifizierer zu trainieren verlangt die Aktion der Referenzpolicy auf jedem Zustand, der verwendet wird, ihn zu fitten, was voraussetzt, dass die Referenz ein anderes Programm ist. Wenn Ihre Referenz eine Person mit Führungsarm ist, ist diese Label-Menge nicht billig und die Methode verliert die Eigenschaft, für die sie entworfen wurde.

EnsembleDAgger: Zweifel und Abweichung, beides

Menda, Driggs-Campbell und Kochenderfer (2019) behandeln die Schleuse als probabilistische Frage. EnsembleDAgger "approximates a Gaussian Process using an ensemble of neural networks" und liest die Ensemble-Varianz als Sicherheits-Proxy: hohe Varianz bedeutet eine Region, anders als die Trainingsdaten, was — vorausgesetzt, der Experte meidet Versagenszustände — mit Nähe zum Versagen korreliert. Die Regel ist eine Konjunktion. Der Lerner darf handeln nur, wenn die L2-Distanz zwischen seiner mittleren Aktion und der Expertenaction unter einer Schwelle bleibt (Abweichung) und die Varianz seiner vorhergesagten Aktion unter einer zweiten (Zweifel). Wenn eines versagt, übernimmt der Experte die Kontrolle. Das Ziel ist, den Anteil des Lerners an Aktionen zu maximieren, während die Versagenswahrscheinlichkeit begrenzt wird; die Arbeit berichtet verbesserte Sicherheit und Lernen gegen andere DAgger-Varianten auf einem umgekehrten Pendel und MuJoCo HalfCheetah.

Der Abweichungsterm braucht die Expertenaktion

Das disqualifiziert diskret die volle Regel für Freihändig-Beaufsichtigung. Die Distanz zwischen Lerner-Aktion und Experten-Aktion verlangt die Aktion des Experten in jenem Zustand, in jenem Moment. Mit geskripteter Experte, kein Problem. Mit einem Menschen, muss der Mensch ständig Aktionen produzieren — genau die Last, die die Gated Varianten entfernen sollten. Der Zweifel-Term alleine ist freihändig; die Konjunktion nicht.

LazyDAgger: halte den Schalter am Flattern

Hoque und Kollegen (2021) griffen einen Kostenfaktor an, den die früheren Arbeiten nicht gemessen hatten: den Schalter selbst. Jede Intervention "interrupts other work the human is doing, incurs latency with each context switch between supervisor and autonomous control, and requires time to perform". Ein Gate, das zehnmal in der Minute auf- und zugeht, ist schlechter als eines, das einmal für zehn Sekunden aufgeht, bei gleichem autonomen Anteil. LazyDAgger erweitert SafeDAgger mit asymmetrischen Schwellen — schwerer, Beaufsichtigungskontrolle zu betreten, als darin zu bleiben — damit das System nicht an der Grenze oszilliert. In Simulation "can reduce context switches by an average of 60% over SafeDAgger on 3 continuous control tasks while maintaining state-of-the-art policy performance"; bei Stoff-Manipulation mit einem ABB YuMi "reduces context switches by 60% while achieving a 60% higher success rate than SafeDAgger at execution time".

ThriftyDAgger: Neuartigkeit oder Risiko, unter Budget

ThriftyDAgger (Hoque et al., CoRL 2021) startet vom Budget des Beobachters, nicht von der Policy. Es "uses a learned switching policy to solicit interventions only at states that are sufficiently (1) novel, where the robot policy has no reference behavior to imitate, or (2) risky, where the robot has low confidence in task completion", mit einer neuen Metrik zur Schätzung dieses Risikos. Das Budget ist eine Eingabe, kein Ergebnis: du sagst, wie viel menschliche Zeit du ausgeben wirst. Bei Anwendung zur Laufzeit erreicht die Methode "a 100% success rate on both the simulation and physical tasks", und eine Nutzerstudie mit zehn Teilnehmern, die eine Dreiroboter-Flotte parallel zu einer Konzentrationaufgabe steuern, berichtet, dass sie "increases human and robot performance by 58% and 80% respectively compared to the next best algorithm while reducing supervisor burden" senkt. Die Flotten-Einstellung ist die natürliche Heimat dieser Arbeit; Fleet-DAgger formalisierte später interaktives Flotten-Lernen mit mehreren Robotern und Beaufsichtigern und schlägt Return on Human Effort als Größe vor, die optimiert werden soll.

HG-DAgger: der Mensch hält die Schleuse

Kelly et al. (2019) gehen den anderen Weg. Es gibt kein Schaltknoten-Netzwerk. Der Lerner wird ausgeführt "until the expert observes that the novice has entered an unsafe region of the state space", an welchem Punkt der Experte die Kontrolle nimmt und das System zurückführt. Die Aggregationsregel ist der strikte Teil: "Expert action labels are only collected and added to the dataset during these recovery trajectories, during which the human expert has uninterrupted control of the system." Nichts wird gekennzeichnet, während der Mensch Zuschauer ist.

Es stoppt nicht am Schalter. HG-DAgger lernt auch "a safety threshold for a model-uncertainty-based risk metric that can be used to predict the performance of the fully trained novice in different regions of the state space": es protokolliert, wie unsicher der Lerner in den Momenten war, in denen der Mensch eingriff, und mittelt die letzte Viertel dieser Datensätze, wo der Lerner seinem endgültigen Zustand am ähnlichsten ist. Das ist nicht eine Schleuse, die der Roboter bedient, sondern ein Diagnose-Tool, das dir sagt, wo die fertige Policy zu halten erwartet wird. Die Auswertung deckt eine simulierte und eine echte Fahrenaufgabe ab und berichtet verbesserte Performance über beide DAgger und Behavior Cloning.

Eine verwandte Linie ändert, was als Label zählt. Spencers und Kollegen "Expert Intervention Learning" halten, dass "any amount of expert feedback, whether by intervention or non-intervention, provides information about the quality of the current state, the optimality of the action, or both", formalisiert als eine Beschränkung auf die Wertfunktion des Lerners und gelöst mit Reueminimierungs-Online-Lernen. Unter dieser Lesart sind die Strecken, in denen der Mensch zusah und nichts tat, schwache positive Evidenz statt leer. EIL lernt Kollisionsvermeidung aus etwa einer Minute Experten-Kontrolle.

Roboterarm-Arbeitsraum mit Kameras, die für Datensammlung während eines beaufsichtigten Policy-Rollouts angeordnet sind
Eine menschlich gesteuerte Runde ist ein normaler Inferenzlauf mit einem Rekorder daneben. Die Frames, die der Bediener fuhr, werden gekennzeichnet; der Rest bleibt wie er war.

Die Varianten Seite an Seite

VerfahrenWer öffnet die SchleuseSignalNotwendiger verfügbarBerichtet
DAgger (Ross et al., 2011)Niemand — der Lerner fährt immerKeines; der Experte labelt jeden besuchten ZustandEin Experte, der Off-Policy-Zustände labeln kann, während er nicht die Kontrolle hatKeine-Reue-Reduktion mit Garantien unter der Zustandsverteilung des Lerners
HG-DAgger (Kelly et al., 2019)Der menschliche ÜberwacherDas Urteil des Beobachters, dass der Zustand unsicher istJemand schaut zu, und eine saubere KontrollübergabeSchlägt DAgger und Behavior Cloning auf einer simulierten und echten Fahrenaufgabe; lernt auch eine Risikoschwelle
SafeDAgger (Zhang & Cho, 2016)Der RoboterBinärer Klassifizierer für L2-Abweichung von der Referenz über tauEine abfragbar Referenzpolicy für die Labels des KlassifizierersWeniger Referenzabfragen in einem Rennspiel-Simulator, schnellere Konvergenz (keine Zahl gegeben)
EnsembleDAgger (Menda et al., 2019)Der RoboterEnsemble-Varianz und Distanz zur Expertenaction, beides unter SchwelleEin Ensemble von Netzwerken plus der Expertenaction bei jedem SchrittVerbesserte Sicherheit und Lernen auf Pendel und HalfCheetah
LazyDAgger (Hoque et al., 2021)Der Roboter, mit HystereseSafeDAggers Signal mit separaten Ein- und Aus-SchwellenWas SafeDAgger braucht, plus eine zweite Schwelle zum Abstimmen~60% weniger Kontextwechsel auf 3 Aufgaben; 60% höhere Erfolgsrate auf YuMi-Stoff
ThriftyDAgger (Hoque et al., 2021)Der Roboter, unter BudgetNeuartigkeit, oder geschätztes Risiko, die Aufgabe nicht zu erfüllenEin gelernter Risikoschaetzer und ein genanntes Interventionsbudget100% Erfolg zur Laufzeit; Nutzerstudie (N=10): 58% und 80% Gewinne über nächstbeste
EIL (Spencer et al., 2020)Der Mensch — Nicht-Intervention zählt auchIntervention und ihre Abwesenheit als Beschränkungen auf die WertfunktionOnline-Reueminimierung über eine WertbeschränkungKollisionsvermeidung aus etwa einer Minute Experten-Kontrolle

Was jedes Gate kostet, und was es kauft

Lies hinab in der Spalte "Notwendiger" und ein Muster fällt heraus: jedes Policy-gesteuerte Signal dort ist ein Proxy, der hergestellt werden muss, und jeder Proxy hat seine eigene Rechnung.

  • Abweichungs-Signale (SafeDAgger, LazyDAgger, die Hälfte von EnsembleDAggers Regel) brauchen eine Referenzpolicy. Entweder hast du einen geskripteten Experten, in welchem Fall das interessante Problem bereits gelöst ist, oder ein Mensch produziert ständig Aktionen im Hintergrund, damit eine Distanz berechnet werden kann.
  • Zweifels-Signale brauchen kalibrierte epistemische Unsicherheit. Ein Ensemble von kleinen Kontroll-Netzwerken approximiert sie; ein Ensemble eines 3-Milliarden-Parameter-Vision-Language-Action-Modells ist ein Speicher- und Latenz-Problem zuerst.
  • Neuartigkeits- und Risiko-Signale brauchen einen gelernten Schaetzer der Aufgaben-Fertigstellung, angepasst an genug erfolgreiche und fehlgeschlagene Rollouts. Bei einer Aufgabe, die du noch zum Laufen bringst, existieren diese Daten nicht in Runde eins.
  • Das menschliche Gate braucht Aufmerksamkeit und nichts sonst — das einzige Signal, das am ersten Tag verfügbar ist, auf jeder Policy-Architektur, ohne zusätzliches Modell zum Trainieren.
  • Kein Policy-Gate entfernt den Menschen aus dem Raum. Sie reduzieren, wie oft der Mensch handeln muss, nicht ob er anwesend sein muss.

Es gibt eine stillere Unterscheidung in dem, was das Gate produziert. Ein Policy-Gate, das mittendrin feuert, übergibt einem Menschen einen sich bewegenden Arm in einer beliebigen Pose. Ein menschliches Gate lässt den Bediener den Moment wählen — nach dem Greifen, vor dem Griff, nicht mittendrin im Schwung. Die Wiederherstellungssegmente aus den beiden sind nicht gleichmäßig sauber, und diese Segmente sind das gesamte Produkt der Runde.

Warum die menschlich gesteuerte Form auf echter Hardware gewinnt

Das ist ein Entwicklungsargument, kein Benchmark-Ergebnis — kein Paper, das wir fanden, führt alle fünf Gates auf denselben Manipulator mit der gleichen Policy-Klasse aus. Es ruht auf vier Punkten.

Erstens ist der Überwacher doch dort. Niemand lässt einen SO-100 Arm unbeaufsichtigt neben Objekten laufen, die er umkippen kann. Sobald jemand zusieht, ist die Grenzkosten, ihm einen Übernahmeknopf zu geben, nahe Null; einen kalibrierten Risikoschaetzer zu bauen ist ein Projekt.

Zweites, die Unsicherheit, die du tatsächlich auf einer modernen Policy gemessen kannst, ist oft die falsche Größe. Ein Diffusions- oder Flow-Matching-Kopf erzeugt Varianz über gestaffelte Action-Blöcke, und diese Varianz reflektiert die Multimodalität, auf die der Kopf trainiert wurde, nicht epistemische Unwissenheit über den Zustand. EnsembleDAggers Zweifels-Term verwendet ein Ensemble präzise, um letzteres zu erfassen. Die beiden sehen wie die gleiche Zahl aus und sind es nicht; die Action Chunking und Flow Matching Einträge decken ab, wie diese Köpfe Actions zuerst emittieren.

Drittens sind die Fehler, die in Manipulation zählen, oft semantisch statt statistisch ungewöhnlich. Eine Policy, die den Greifer zwei Zentimeter zu früh schließt, oder zuversichtlich für die falsche von zwei identischen Würfeln greift, ist nicht in einem hochvarianzigen Zustand — sie ist zuversichtlich und falsch. Keine Varianz-Schwelle fängt das; eine Person, die zusieht, fängt es sofort.

Viertens, Label-Qualität — der ursprüngliche HG-DAgger-Punkt, und der, der am meisten übersprungen wird. Labels, die gesammelt werden, während der Mensch ununterbrochene Kontrolle hat, schlagen Labels, die über ein sich bewegendes System erzählt werden. Wenn das Ziel korrigierende Daten ist, die zu aggregieren lohnt, liegt die Beweislast auf dem automatisierten Gate.

Wo Policy-Gates sich auszahlen

Das Bild wendet sich, wenn ein Überwacher für viele Roboter verantwortlich ist — das Regime, das ThriftyDAggers Nutzerstudie und Fleet-DAggers Formalisierung anzielen. Mit einer Flotte ist menschliche Aufmerksamkeit die knappe Ressource, und eine unvollkommene Allokation schlägt keine. Mit einem Arm auf einem Tisch bist du nicht in diesem Regime.

Die menschlich gesteuerte Schleife, bereits verdrahtet

Übernahme während einer laufenden Inferenz-Sitzung, Pro-Frame-Interventions-Flags auf den korrigierten Segmenten, Kuratieren jeder Laufzeit in Korrektionen oder Auswertung, Komposition eines gemischten Datensatzes aus Quellen, die du wählst, und Weiteristraining von einem existierenden Checkpoint sind eingebaut statt von Hand geskriptet. Übernahme funktioniert mit einem Führungsarm, oder mit Tastatur und Schiebereglern, wenn du keinen hast.

Sieh, wie die DAgger-Schleife läuft

Das Gate ist die Hälfte der Methode; Datenhandling ist die andere Hälfte

Ein Gate entscheidet, welche Frames ein Mensch fuhr, nicht was damit zu tun ist, und diese zweite Entscheidung ist wo Runden am meisten verschwendet werden. Die erste Regel ist die, deren D in DAgger steht: aggregiere, ersetze nicht. Ein Checkpoint rein mit ein paar hundert Korrektur-Frames feingekörnnert gibt dir ein Modell, das fast nichts als Wiederherstellungen gesehen hat und die nominale Trajektorie vergessen hat.Checkpoint reines Feintuning auf ein paar hundert Korrektur-Frames gibt dir ein Modell, das fast nichts als Wiederherstellungen gesehen hat und die nominale Trajektorie vergessen hat.

Die zweite Regel ist, dass Interventions-Frames nicht gewöhnliche Frames sind. Mandlekar et al. bauten ein Fernsteuerungs-System für 6-DoF-Manipulation, mit dem Bediener Policies überwachen und bei Versagen übernehmen können, dann iterativ mit einem Algorithmus trainierten, der "encourages the policy to learn how to traverse bottlenecks through the interventions" trainierten; Agenten, auf diesen Daten trainiert, übertroffen Agenten, auf einer gleichalen Zahl gewöhnlicher Demonstrations-Proben trainiert. Sirius drückt die Idee in den Einsatz, "re-weighing training samples with approximated human trust and optimizing the policies with weighted behavioral cloning". Beide brauchen einen Pro-Frame-Marker dessen, was menschlich gefahren wurde, darum ist das Interventions Flag wichtiger als es aussieht.

Die dritte Regel ist, dass automatisches Mischen eine Falle ist. Ein komponierter Datensatz, dessen Quellen du nicht aufzählen kannst, ist einer, den du nicht debuggen kannst, wenn die nächste Runde schlechter wird. Auf dieser Plattform ist der Kompositionsschritt explizit dafür — Original-Datensatz plus Korrektionen, Episode-Auswahl pro Quelle, und das Ergebnis ist ein gewöhnlicher LeRobot Datensatz, der synct und trainiert wie jeder andere; die Datensatz-Dokumentation deckt die Format-Seite ab.

Schritt in einer RundeWas er erzeugtHäufigste Art, wie es schiefgeht
Laufe Inferenz mit Aufzeichnung anEine Durchführung unter der eigenen Zustandsverteilung der PolicyAufgezeichnet als reine Fernsteuerung, verlierend, dass eine Policy fuhr
Übernahme bei VersagenKorrektur-Segmente mit Pro-Frame-Interventions-FlagKorrigiere kosmetisches Wackeln, lehre Stil statt einer Wiederherstellung
Kuratiere jede EpisodeKorrektionen, Auswertung, oder VerwerfeHalte alles; eine gescheiterte Übernahme kostet mehr als die Episode es wert war
Synce die KorrektionenEin versionsierter Datensatz neben dem OriginalKorrektionen, die niemals die lokale Maschine verlassen
Komponiere den gemischten DatensatzOriginal plus Korrektionen, explizite AuswahlStilles Auto-Mischen, so eine spätere Regression kann nicht zu einer Quelle nachverfolt werden
Fortsetze von einem CheckpointEin Checkpoint, der von dem vorherigen initialisiert wurdeErwartend einen Optimizer-Neustart; die Gewichte initialisieren das Modell, sie stellen keinen Optimizer-Zustand wieder her

Stellen eine Schleuse auf, die eine Person tatsächlich halten kann

"Der Mensch entscheidet" ist keine Spezifikation. Zwei Bediener mit verschiedenen Schwellen produzieren unvergleichbare Runden, und eine abdriftende Schwelle erzeugt einen Trend, den du nicht lesen kannst. Schreib die Trigger auf, bevor die erste Runde.

  1. Nenne die Bedingungen, die die Schleuse öffnen — Annäherung um mehr als eine feste Marge aus, Greifer schließt auf nichts, ein Gelenk driftet zu einer Grenze, ein Stall von mehr als einer oder zwei Sekunden — und halte die Liste während der Runde unverändert.
  2. Nenne, was die Schleuse nicht öffnet. Übersch die Policy erholt sich selbst davon ist Trainingssignal; Übernahme dort löscht eine Wiederherstellung, die sie bereits kennt.
  3. Übernahme früh genug für eine saubere Handover, gib zurück, sobald der Zustand wiederherstellbar ist.
  4. Protokolliere, warum du übernommen hast, pro Episode. Drei Runden später ist es der einzige Datensatz, ob der gleiche Fehler zurückkommt.
  5. Halte Kameras, Aufgabentext und Bediener über Runden konstant. Ändere eine und die Zahlen hören auf, vergleichbar zu sein.

Mechanisch hat die Handover zwei Varianten. Mit einem Führungsarm muss der Führungsarm die aktuelle Pose des Folge-Arms erreichen, bevor Drehmoment transferiert, oder der Arm springt; diese Ausrichtungs-Bewegung ist der am wenigsten getestete Teil der Kette auf echter Hardware. Ohne Führungsarm ist die Übernahme manuell vom ersten Tastendruck: der Folge-Arm wird gehalten und der Bediener nudzt ihn Gelenk für Gelenk von der Tastatur oder zieht Schieberegler, mit Server-seitige Klammern, die jede Eingabe klein halten — ein paar Grad pro Tastendruck, eine Handvoll pro Schieberegler-Aktualisierung, weil ein großer Schritt in eine gehaltene Pose ist wie du einen Servo abziehst. Die Schritt-für-Schritt-Version mit den Tastenbindungen ist in der Durchgang einer DAgger-Runde auf einem SO-100; Hintergrund über beide Fernsteuerungs-Modi ist in die Fernsteuerungs-Dokumentation und den Führungs-Folge-Eintrag.

Vergleich unterstützter Policy-Architekturen mit ihren Trainings- und Inferenz-Charakteristiken
Das Gate ist architektur-agnostisch. Welche Policy du korrigierst ändert die Trainingskosten einer Runde, nicht wie die Übernahme funktioniert.

Lese, ob das Gate etwas tat

Die Metrik einer menschlich gesteuerten Runde ist die Interventionsrate: Interventions-Frames geteilt durch Frames der Laufzeit. Es hat einen Job — wenn es nicht über Runden fällt, kaufte die Runde nichts, und die nächste sollte etwas anderes ändern als die Daten-Menge.

Es ist eine verzerrte Metrik und du solltest es wissen. Es misst die Schwelle des Bedieners genauso wie die Kompetenz der Policy, darum bleibt die Trigger-Liste fest; ein Bediener, der sich über einer Sitzung entspannt, produziert eine fallende Kurve mit nichts dahinter. Es ignoriert auch Schwere — zehn Frames zum Stoppen einer Kollision und zehn zum Nudgen eines Griffs sehen identisch aus. Paare es mit einem festen Auswertungs-Set, aus dem Korrektur-Daten niemals gezogen wurden. Der Artikel über das Messen einer DAgger-Schleife arbeitet durch die Auswertungs-Planung, einschließend wie man Auswertungs-Episoden aus dem Trainings-Mix hält.

Das menschliche Gate, ehrlich
Was es gibt
  • Funktioniert am ersten Tag, auf jeder Policy-Architektur, ohne zusätzliches Modell zum Kalibrieren
  • Fängt zuversichtlich-und-falsch Versagen, die keine Varianz-Schwelle erkennt
  • Produziert Korrektionen, die aufgezeichnet werden, während der Bediener volle Kontrolle hatte, in einem Moment, den sie wählten
  • Gibt einen Pro-Frame-Marker, den Interventions-gewichtete Methoden wie IWR und Sirius konsumieren
Was es nicht tut
  • Kostet ständige Beaufsichtigung; es skaliert nicht zu einer Person und vielen Robotern
  • Hängt vom Bediener-Konsistenz ab — eine abdriftende Schwelle beschädigt die Interventionsrate
  • Produziert kein Risiko-Modell auf eigenem; HG-DAggers gelernte Schwelle und ThriftyDAggers Schaetzer sind extra Maschinerie
  • Zählt Frames, nicht Konsequenzen
  • Kann keine Policy retten, deren Versagen stromaufwärts der Kontrolle liegt, wie eine getauschte Kamera oder ein mislabeled Aufgabenstring

Offene Fragen, die es wert sind, in Ansicht zu halten

Die Benchmarks sind schwach. Spencer und Kollegen untersuchten diejenigen, um Imitationslernen-Ansätze zu testen, und fanden sie "realizable and simple and thus insufficient for capturing the harder regimes of error compounding seen in real-world decision making problems" — und, gegen die umgebende Literatur, fanden Plan Behavior Cloning machte es gut auf ihnen. Das ist Grund, skeptisch zu sein über jede Reihung von DAgger-Varianten ruhend auf diesen Aufgaben, einschließlich einige Zahlen in der Tabelle oben.

Policy-Gates auf großen Policies sind auch nicht gelöst. Die AIM-Arbeit ersetzt Unsicherheit mit einem Proxy Q-Function, der die menschliche Interventions-Regel ahmt, und berichtet eine 40%-Verbesserung in Übernahme-Kosten und Lern-Effizienz über ThriftyDAgger — in kontinuierlicher und diskreter Kontrolle, nicht auf einem Vision-Language-Action-Modell, das einen Manipulator fährt. Ob irgendeine dieser Gates zu einem feingekörnnerten VLA transferiert, ist offen. Die Übersicht macht einen verwandten Punkt: die Terminologie und Struktur des Feldes sind nicht über die Literatur vereinheitlicht, was Methoden schwer vergleichbar macht. Auf deinem eigenen Arm sind deine Logs die Evidenz, die du hast.

Ist HG-DAgger wirklich DAgger, wenn der Mensch nur während Interventionen labelt?

Es hält den Teil, der zählt — Daten gesammelt unter der Zustandsverteilung, die der Lerner induziert, aggregiert mit was davor kam — und fällt der Teil, der keinen Kontakt mit Hardware übersteht. Kelly et al. präsentieren ihn als eine Variante; die 2011 Keine-Reue-Garantie trägt nicht unverändert über.

Kann ich ein Policy-Gate auf einem feingekörnnerten VLA auf einem SO-100 verwenden?

Nicht geradeheraus. SafeDAggers Klassifizierer braucht eine abfragbar Referenzpolicy, die du nicht hast. EnsembleDAgger braucht ein Ensemble, das für ein Multi-Milliarden-Parameter-Modell bedeutet mehrere Kopien im Speicher plus ihre Inferenz-Kosten. ThriftyDAgger braucht einen Risikoschaetzer, der an Erfolgen und Versagen angepasst ist, die vor deinen ersten Runden nicht existieren.

Wie lange sollte eine einzelne Übernahme sein?

Lang genug um einen Zustand zu erreichen, den die Policy weitermachen kann, und nicht länger: verlängert Übernahmen drehen die Laufzeit in eine Demonstrations-Sitzung und überschwemmen die Korrektur-Set mit nominalen Verhalten. LazyDAggers Fund schneidet auch das andere Weg — viele sehr kurze Schalter sind ihre eigenen Kosten.

Sollte ich nur auf den korrigierten Segmenten trainieren?

Nein — das ist die häufigste Art, eine Runde zu verschwenden. Ein Modell, feingekörnnert nur auf Wiederherstellungen, hat fast nichts als Wiederherstellungen gesehen. Mische Korrektionen in den Original-Datensatz mit Quellen, die explizit gewählt sind; um weiter zu gehen, schau auf Interventions-gewichtete Ansätze wie IWR oder Sirius, die Mensch-gefahren-Frames hochgewichten statt sie zu isolieren.

Was wenn die Interventionsrate nicht über eine Runde fällt?

Nimm es bei Nennwert: die Runde hat nicht geholfen. Bevor Korrektionen hinzufügst, prüfe die billigeren Erklärungen — ist die Bediener-Schwelle abgedriftet, waren die Korrektionen kosmetisch, enthielt der komponierte Datensatz sie tatsächlich, wurde Training vom beabsichtigten Checkpoint initialisiert. Eine Runde, die still vom Basis-Modell startete sieht genau aus wie eine Runde, die versäumte zu lernen.

Trägt Nicht-Intervention Information?

Unter Expert Intervention Learning, ja: Strecken, wo der Überwacher zusah und nicht tat, sind Lesewort als schwache Evidenz, dass Zustand und Aktion akzeptabel waren, formalisiert als Beschränkung auf die Wertfunktion. Die meisten praktischen Pipelines, einschließend dieser, markiert nur, was der Mensch fuhr.

Für einen einzelnen Arm auf einem Tisch ist die Wahl gemacht: halte die Schleuse selbst, schreib auf, was sie öffnet, und verbringe die Anstrengung auf der Datenhandel dahinter statt auf der Automatie des Schalters. Die Plattform-Seite wird beschrieben auf die DAgger-Schleifen-Seite, Trainings-Optionen pro Policy-Familie unter Training und Preise. Für Hintergrund, startet mit Imitationslernen und Imitationslernen auf dem SO-100; für einen ersten Lauf, laufe deine erste Policy ist der kürzere Pfad.

Quellen

Bereit für hochwertige Robotik-Daten?

AY-Robots verbindet Ihre Roboter mit qualifizierten Operatoren weltweit.

Jetzt starten