
Το intervention rate - intervention frames διαιρούμενα με τα frames της εκτέλεσης - είναι το φθηνότερο ειλικρινές σήμα προόδου που έχει ένας human-gated DAgger loop. Αυτό το άρθρο το ορίζει έτσι ώστε δύο άτομα να υπολογίσουν την ίδια τιμή, δείχνει πώς να το καταγράψετε και ανιχνεύει τους τέσσερις τρόπους που σας παραπλανά: operator habituation, ένα drifting evaluation setup, training μόνο σε corrections και ένας άνθρωπος που διορθώνει διαφορετικά την Τρίτη από τη Δευτέρα.
Ένας DAgger κύκλος αισθάνεται παραγωγικός ενώ είστε μέσα του. Οδηγείτε την πολιτική, παίρνετε τον έλεγχο όταν χαμηλώνει στη σύλληψη, αποθηκεύετε τις διορθώσεις, ξαναεκπαιδεύετε και η επόμενη εκτέλεση φαίνεται - θα το ορκίζατε - λίγο ομαλότερη. Δύο κύκλοι αργότερα δεν μπορείτε να πείτε αν κάτι άλλαξε, επειδή το "λίγο ομαλότερο" δεν είναι ποσότητα.
Το loop χρειάζεται έναν αριθμό ανά κύκλο, και σε ένα human-gated loop αυτός ο αριθμός είναι σχεδόν δωρεάν: το κλάσμα της εκτέλεσης κατά το οποίο είχατε τον έλεγχο αντί της πολιτικής. Αυτό το άρθρο το ορίζει έτσι δύο άτομα να υπολογίσουν την ίδια τιμή, το καταγράφει, διαβάζει την προκύπτουσα καμπύλη και ονοματίζει τους τέσσερις τρόπους που σας παραπλανά όταν στέκεται μόνο του. Για τη θεωρία που υποθέτει αυτό το κομμάτι, δείτε την εξήγηση DAgger και τη human-gated παραλλαγή; το hands-on αντίστοιχο είναι εκτέλεση ενός DAgger loop σε ένα SO-100.
Η σύντομη έκδοση
- •Intervention rate = intervention frames / frames της εκτέλεσης. Frames, όχι episodes, και ο παρονομαστής περιλαμβάνει τα frames που δαπανήσατε στη διόρθωση.
- •Μια επίπεδη καμπύλη σε τρεις κύκλους σημαίνει ότι οι κύκλοι δεν αγοράζουν τίποτα - αλλάξτε το μίγμα, το checkpoint ή την εργασία αντί να συλλέγετε ένα τέταρτο.
- •Ένα πτώνον intervention rate δεν είναι ένα αυξανόμενο success rate. Το κατώφλι σας για να ανέβετε μετατοπίζεται προς τα κάτω καθώς αυξάνεται η εμπιστοσύνη.
- •Χωρίς ένα frozen evaluation protocol - οι ίδιες starting poses, αντικείμενα, κάμερες, αριθμός δοκιμών - μετράτε το δωμάτιο.
- •Το training μόνο σε corrections παραποιεί την κατανομή κατάστασης. Η απάντηση του IWR: σχεδιάστε intervention και non-intervention δείγματα σε ίση αναλογία.
Γιατί ένας κύκλος χρειάζεται ένα αριθμό καθόλου
Το DAgger υπάρχει επειδή υπάρχει ένα πρόβλημα κατανομής, και τα προβλήματα κατανομής είναι αόρατα στο μάτι. Οι Ross και Bagnell έδειξαν ότι imitation learning σε ένα σταθερό σύνολο επίδειξης οδηγεί σε σφάλματα σύνθεσης και ένα regret bound που αυξάνεται τετραγωνικά στον ορίζοντα του χρόνου: μόλις ο μαθητής φύγει από τις καταστάσεις που επισκέφθηκε ο αναδείκτης, τίποτα στα δεδομένα του λέει πώς να επιστρέψει. Το DAgger το διορθώνει με επανάληψη - εκτέλεση της πολιτικής, ετικέτα των καταστάσεων που επισκέπτεται, συγκέντρωση, ξαναεκπαίδευση - που οι Ross, Gordon και Bagnell πλαισιώνουν ως μια μείωση σε no-regret online learning.
Αυτός ο σχεδιασμός έχει μια συνέπεια που οι άνθρωποι παραλείπουν. Η εγγύηση αφορά την ακολουθία των πολιτικών σε όλες τις επαναλήψεις, όχι κάποιον μόνο κύκλο. Δεν λέει τίποτα για το αν ο κύκλος τρία βοήθησε. Ο μόνος τρόπος να το ξέρετε είναι να μετρήσετε κάθε επανάληψη. Ο Kelly και συνάδελφοι εισήγαγαν το HG-DAgger επειδή το κλασικό DAgger ζητά από τον εμπειρογνώμονα ετικέτες δράσης ενώ ο νέος εξακολουθεί να έχει τον έλεγχο, το οποίο το άρθρο υποστηρίζει ότι μπορεί να μειώσει την ασφάλεια και, με ανθρώπινους ειδικούς, είναι πιθανό να υποβαθμίσει την ποιότητα της ετικέτας μέσω της αντιληπτής actuator lag. Το HG-DAgger μαθαίνει επίσης ένα κατώφλι ασφάλειας για μια μετρική κινδύνου που βασίζεται στη model uncertainty και αναφέρει βελτιωμένη απόδοση σε σχέση με τόσο το DAgger όσο και behavioral cloning σε μια εργασία οδήγησης. Δεν δημοσιεύει αριθμούς παρεμβάσεων· εκείνες τις παράγετε ο ίδιος.
Ορίζοντας το rate έτσι δύο άτομα να πάρουν τον ίδιο αριθμό
Ο ορισμός είναι μια γραμμή: intervention frames διαιρούμενα με frames της εκτέλεσης. Όλα τα δύσκολα κρύβονται σε αυτό που μετράει ως frame και τι μετράει ως εκτέλεση.
Frames, όχι episodes
Ο μέτρησης episodes με τουλάχιστον μια παρέμβαση είναι άχρηστη: δέκα episodes με ένα nudge το καθένα και δέκα κατά τα οποία οδηγήσατε ενενήντα τοις εκατό και οι δύο δίνουν "10/10". Ο μέτρημα frames τα χωρίζει και είναι η κοκκοβάρυνση που η εγγραφή ήδη έχει - στη μορφή LeRobot dataset κάθε χρονικό βήμα είναι μια σειρά, έτσι η σημαία παρέμβασης είναι μια boolean στήλη δίπλα στην κατάσταση και τη δράση. Εδώ γράφεται ανά frame τη στιγμή που ξεκινά η ανάληψη ελέγχου και διαγράφεται όταν ο έλεγχος επιστρέφει.
Ο παρονομαστής περιλαμβάνει τις διορθώσεις
Δύο παρονομαστές είναι υπεράσπιστοι - συνολικά frames της εκτέλεσης ή frames που η πολιτική οδήγησε αυτόνομα - και αποκλίνουν σκληρά σε υψηλά επίπεδα παρέμβασης. Πάρτε τον έλεγχο για 400 από 1000 frames και ο πρώτος δίνει 40 τοις εκατό, ο δεύτερος 67 τοις εκατό. Η σύγκριση ενός κύκλου που μετράται με τον πρώτο τρόπο έναντι του επόμενου που μετράται με τον δεύτερο είναι πώς μια πραγματική βελτίωση εξαφανίζεται. Πάρτε συνολικά frames και μην ξαναδείτε την επιλογή σε εν λόγω σειρές.
Αποφασίστε μια φορά τι συμβαίνει με τα handover frames
Υπάρχει πάντα ένας δερματοπλαστής. Όταν ο έλεγχος μεταφέρεται, ορισμένα frames ανήκουν σε κανέναν: το βραχίονα κρατείται, ο ηγέτης ευθυγραμμίζεται, η εγγραφή είναι παγωμένη. Σε αυτή τη pipeline εκείνα τα handover frames παραμένουν στη surw stream και δεν μπαίνουν ποτέ στο curated episode - δεν είναι ούτε πολιτική συμπεριφορά ούτε μια διόρθωση που αξίζει να εκπαιδευτεί. Μετρήστε το δερματοπλαστής ο ίδιος τρόπος κάθε κύκλο: στα 30 Hz, έξι ανάληψη με δύο δευτερολέπτων δερματοπλαστής το καθένα είναι 360 frames, αρκετά για να μετακινήσετε ένα ποσοστιαίο σημείο.
Frames ή episodes; συνολική εκτέλεση ή αυτόνομη-μόνο; handover frames μέσα ή έξω. Οποιοδήποτε από τα τρία άλλαξε σιωπηλά μεταξύ των κύκλων κάνει την καμπύλη άνευ νοήματος. Γράψτε και τα τρία.
Καταγραφή του έτσι ώστε ο αριθμός να επιζήσει της συνόδου
Μια μετρική στο πίνακα κατάστασης μιας εκτελούμενης διαδικασίας είναι ένα readout: εξαφανίζεται σε επανεκκίνηση και δεν μπορεί να σχεδιαστεί. Μια append-only σειρά ανά εκτέλεση καλύπτει ολόκληρη τη σειρά - συμπεριλαμβανομένου του checkpoint που οδηγήσατε, αφού αυτό αλλάζει κάθε κύκλο και ο μπερδέματα τα μειώνει ότι ακολουθεί.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Δύο πεδία κουβαλούν το βάρος. train_mix είναι αυτό που δώσατε στην επόμενη εργασία εκπαίδευσης; χωρίς αυτό, τίποτα δεν μπορεί να αποδοθεί. eval_protocol ονοματίζει το σταθερό δοκιμή που τρέξατε αργότερα, και είναι το πεδίο που συχνότερα αφήνεται κενό. Στο ay-robots cockpit το takeover status αναφέρει το intervention frame count για την εκτελούμενη συνόδο, έτσι η καταγραφή είναι αντιγραφή και όχι όργανα· το dataset documentation καλύπτει όπου τα ανά-frame columns προσγειώνονται.

Ανάγνωση της καμπύλης: τρεις κύκλοι, μια απόφαση
Τρεις κύκλοι είναι το ελάχιστο για μια ανάγνωση, επειδή δύο σημεία είναι πάντα μια γραμμή. Ο πίνακας παρακάτω είναι ένα πρότυπο σημειωματάριου με αριθμούς placeholder, όχι μετρήσεις από κάποιον κύκλο. Αναζητάτε μια monotone decrease matched από αύξηση στην επιτυχία σε σταθερό δοκιμή.
| Κύκλος | Checkpoint driven | Frames | Intervention frames | Rate | Successes (of 20) |
|---|---|---|---|---|---|
| 0 (baseline) | base policy | 5 900 | 1 380 | 23.4 % | 7 |
| 1 | from round 0 mix | 5 610 | 980 | 17.5 % | 10 |
| 2 | from round 1 mix | 5 412 | 611 | 11.3 % | 11 |
| 3 | from round 2 mix | 5 380 | 598 | 11.1 % | 12 |
Οι κύκλοι ένα και δύο κάνουν δουλειά. Ο κύκλος τρία δεν είναι: 11.3 έναντι 11.1 τοις εκατό είναι μέσα στη run-to-run παραλλαγή από οτιδήποτε μετράται σε ένα φυσικό βραχίονα, και ένας τέταρτος κύκλος του ίδιου corrections ξοδεύει ένα απόγευμα για τίποτα. Το flat segment λέει αλλάξτε κάτι δομικό.
- Οι υπόλοιπες αποτυχίες δεν είναι διορθώσιμες με teleoperation - αντικείμενο εκτός εμβέλειας, γεωμετρία αρπάγης, ένα joint στο όριό του. Κανένα δεδομένο διόρθωσης δεν διορθώνει ένα κινηματικό τοίχο.
- Οι διορθώσεις είναι πολύ λίγες έναντι του base dataset για να μετακινήσουν την κλίση, και τίποτα τα ζυγίζει.
- Οι διορθώσεις έρχονται σε αντίθεση η μία με την άλλη, οπότε η πολιτική προσεγγίζει δύο στρατηγικές και προσγειώνεται μεταξύ τους.
- Η αποτυχία είναι upstream: ένα κάμερα μετακινήθηκε, το φωτισμό άλλαξε, η άποψη του καρπού δεν ταιριάζει πλέον με εκπαίδευση.
- Η εργασία είναι στο ταβάνι αυτής της κατηγορίας πολιτικής σε αυτό το υλικό, και το επόμενο βήμα είναι περισσότερα base δεδομένα.
Τα δύο τελευταία δεν είναι αποτυχίες του loop. Στο Sirius-Fleet μια πτωτή ανάγκη για τον άνθρωπο είναι το σχεδιασμένο αποτέλεσμα: καθώς η ρομποτική αυτονομία βελτιώνεται, οι προγνωστικοί ανιχνευτές ανωμαλιών του προσαρμόζουν τα κριτήρια πρόβλεψης τους, οδηγώντας σε λιγότερες αιτήματα για ανθρώπινη παρέμβαση και σταδιακή μείωση του ανθρώπινου φόρτου εργασίας με την πάροδο του χρόνου. Εκεί το κριτήριο προσαρμόζεται σκόπιμα. Σε ένα manual loop το δικό σας προσαρμόζεται και πάλι, σιωπηλά - έτσι ένα rate που ισοπεδώνεται επειδή η εργασία είναι στο ταβάνι της φαίνεται ακριβώς σαν κάποιο που ισοπεδώνεται επειδή ο χειριστής σταμάτησε να παρατηρεί. Ποιο είναι το επόμενο πρόβλημα.
Παγίδα 1: ένα πτώνον rate δεν είναι ένα αυξανόμενο success rate
Το intervention rate μετράει ακριβώς ένα πράγμα: πόσο από την εκτέλεση αποφασίσατε να κατέχετε. Εκείνη η απόφαση είναι δική σας, λαμβάνεται σε πραγματικό χρόνο, και μετακινείται. Στον κύκλο μηδέν παίρνετε τον έλεγχο στην πρώτη κακή γωνία προσέγγισης· μέχρι τον κύκλο τρία έχετε παρακολουθήσει την πολιτική να ανακάμπτει από ένα dozen από αυτά και την αφήνετε να δοκιμάσει. Το κατώφλι σας μετακινήθηκε· η policy ίσως να μην. Το rate πέφτει και τα δύο.
Η ανθρώπινη εμπιστοσύνη είναι τουλάχιστον μια modeled ποσότητα στη βιβλιογραφία και όχι μια υποτιθέμενη σταθερά. Το Sirius επαναζυγίζει δείγματα εκπαίδευσης με προσέγγιση ανθρώπινη εμπιστοσύνη και βελτιστοποιεί την πολιτική με weighted behavioral cloning, αναφέροντας ένα 8 τοις εκατό boost σε προσομοίωση και 27 τοις εκατό σε πραγματικό υλικό έναντι του state of the art σε policy success rate, σε διπλάσια convergence speed. Αυτό αντιμετωπίζει την εμπιστοσύνη ως βάρος στα δεδομένα. Δεν διορθώνει το κατώφλι στο κεφάλι σας μεταξύ κύκλου μηδέν και κύκλου τρία.
Δεν μπορείτε να αφαιρέσετε το drift, έτσι ζευγαρώστε το rate με κάτι που το κατώφλι σας δεν μπορεί να αγγίξει: ένα σταθερό σύνολο δοκιμών κατά τα οποία δεν παρεμβαίνετε καθόλου, σκοραρισμένα έναντι ενός κριτηρίου γραμμένου πριν τον κύκλο. Ένα rate που πέφτει ενώ το paired success rate παραμένει put είναι η υπογραφή του habituation - αξίζει κάτσιμο, επειδή από μέσα στο loop αισθάνεται σαν πρόοδος.
| Intervention rate | Success rate on fixed protocol | Most likely reading |
|---|---|---|
| πέφτει | αυξάνεται | Ο κύκλος δούλεψε. Συνεχίστε. |
| πέφτει | flat | Το κατώφλι σας διολίσθησε ή οι διορθώσεις αφαίρεσαν προσπάθεια χωρίς να αφαιρέσουν αποτυχίες. |
| πέφτει | πέφτει | Οι διορθώσεις υποβαθμίζουν την πολιτική. Ελέγξτε το μίγμα και την εσωτερική συνέπειά τους. |
| flat | flat | Ο κύκλος δεν αγόρασε τίποτα. Αλλάξτε μίγμα, checkpoint ή εργασία πριν συλλέξετε περισσότερα. |
| αυξάνεται | πέφτει | Regression. Υποψιάσθε training mix, ένα μετακινημένο κάμερα ή ένα checkpoint mix-up πριν υποψιάσθε τη μέθοδο. |
Παγίδα 2: χωρίς ένα fixed protocol, μετράτε το δωμάτιο
Η real-robot evaluation είναι ακριβή και δύσκολη να επαναληφθεί. Οι συγγραφείς SIMPLER αιτιολογούν τη simulated evaluation με την παρατήρηση ότι η real-world evaluation τέτοιων πολιτικών δεν είναι κλιμακώσιμη και αντιμετωπίζει προκλήσεις reproducibility που είναι πιθανό να χειροτερευθούν καθώς οι πολιτικές διευρύνουν το φάσμα εργασιών τους. Το RoboArena το επιτίθεται από την άλλη πλευρά, με περισσότερες από 600 paired real-robot evaluation episodes σε εφτά generalist πολιτικές, τρέχοντας από evaluators σε εφτά ακαδημαϊκά ιδρύματα στη πλατφόρμα DROID. Οι evaluators του επιλέγουν τις δικές τους εργασίες και περιβάλλοντα αλλά πρέπει να κρίνουν ζευγάρια πολιτικών double-blind; το άρθρο αναφέρει ότι αυτή η crowd-sourced κατάταξη ακολουθεί την απόδοση generalist-policy με περισσότερη ακρίβεια από τη συμβατική, κεντρικοποιημένη αξιολόγηση.
Δεν θα τρέξετε 600 paired episodes σε ένα SO-100 σε ένα workshop. Αυτό που μπορείτε να κάνετε είναι να αφαιρέσετε τη διακύμανση που ελέγχετε - ένα κατάλογο αρκετά βαρετό ώστε συνήθως αγνοείται.
| Διάσταση | Παγώστε αυτό | Τι διολισθαίνει αν δεν το κάνετε |
|---|---|---|
| Start pose | Μια γραμμένη home position, οδηγούμενη πριν από κάθε δοκιμή | Η τροχιά ξεκινά out of distribution |
| Αντικείμενα | Taped marks και τα ίδια φυσικά αντικείμενα κρατημένα για αξιολόγηση | Μια 'καλύτερη' πολιτική είναι πραγματικά ένα κοντινότερο αντικείμενο |
| Κάμερες και φως | Οι ίδιες τοποθετήσεις, indices, exposure· κλειστές κατακόρυφες; φωτογραφήστε τη ρύθμιση | Τα ανταλλαγμένα κάμερα indices μόνο μπορούν να κυριαρχήσουν το αποτέλεσμα |
| Δοκιμές και stop rule | Σταθερό n, σταθερό timeout, κριτήριο γραμμένο πριν τον κύκλο | Κριτήρια post-hoc μετατρέπουν κοντινές απώλειες σε ό,τι χρειάζεστε |
| Operator behaviour | Κανένα intervention κατά τις εργασίες αξιολόγησης | Η αξιολόγηση γίνεται μια άλλη συνόδου διόρθωσης |
Τότε η αριθμητική, ανελέητη στους αριθμούς δοκιμής ενός workshop. Κάτω από τη normal approximation, 60 τοις εκατό επιτυχία σε 20 δοκιμές φέρει ένα standard error κοντά στα 11 ποσοστιαία σημεία - η τετραγωνική ρίζα 0.6 φορές 0.4 πάνω από 20 - και η διαφορά μεταξύ δύο τέτοιων κύκλων φέρει περίπου 15. Ένα jump από 60 σε 70 τοις εκατό είναι επομένως συνεπές με τίποτα που δεν συνέβη. Πενήντα δοκιμές φέρουν το per-round σχήμα στο περίπου 7 σημεία και κοστολόγηση ένα απόγευμα.
Αυτή η ασυμμετρία είναι το επιχείρημα για το intervention rate: υπολογισμένο σε χιλιάδες frames αντί binary outcomes, κινείται νωρίτερα και πιο ομαλά. Ο προειδοποίηση είναι ότι frames μέσα σε ένα episode είναι σκληρά συσχετισμένα - μια κακή σύλληψη αποδόσεις εκατό συνεχόμενα intervention frames - έτσι το effective δείγμα μέγεθος είναι κοντινότερο στον αριθμό των takeovers. Μεταχειριστείτε το rate ως ο πρώιμος δείκτης και το success rate ως αργή ground truth.
Τα αξιολόγησης episodes πρέπει ποτέ να μην μπουν στο composed training dataset - διαφορετικά ο κύκλος n+1 σκοράρεται σε δεδομένα που τρενάρησε και η καμπύλη μετράει memorisation.
Παγίδα 3: training μόνο σε corrections κάμπτει την πολιτική
Οι διορθώσεις είναι τα ενδιαφέρον δεδομένα, έτσι η본能είναι να εκπαιδεύσει με αυτά. Μην. Έρχονται από την κατασκευή από το ضيق slice του state space όπου η πολιτική ήδη αποτυγχάνει και λένε σχεδόν τίποτα για τη πλειονότητα της εκτέλεσης που δούλεψε. Fine-tune στη σφαίρα μόνο και παίρνετε μια πολιτική καλή ανάκαμψης από ένα botched approach που έχει ξεχάσει πώς να κάνει ένα καθαρό.
Οι Mandlekar και συνάδελφοι χτίσανε το remote intervention system τους γύρω από αυτό. Η framing τους: τα manipulation tasks περιέχουν bottleneck περιοχές που απαιτούν ένα ακολουθία precise δράσεων - η εισαγωγή ενός pod σε μια μηχανή καφέ είναι το παράδειγμα τους - όπου μικρές αποκλίσεις οδηγούν σε καταστάσεις τις επιδείξεις δεν δούλεψαν. Τα αλγόριθμα τους εκπαιδεύει iteratively στα νέα δεδομένα έτσι η πολιτική μαθαίνει να διατρέχει εκείνα τα bottlenecks και αναφέρουν ότι αγέντες που εκπαιδεύθηκαν σε intervention δεδομένα κερδίζουν αγέντες που εκπαιδεύθηκαν σε ένα ισοδύναμο δείγμα μη-interventional αναδείκτες.
- Γρήγορα: μια σύντομη εκτέλεση σε λίγα dozen episodes είναι φθηνή αρκετή να επανάληψη
- Στοχευμένα: η κλίση κυριαρχείται από τις καταστάσεις που νοιάζεστε
- Φθηνά για δοκιμή αν ένα correction στυλ είναι learnable καθόλου
- Η fine-tune κατανομή δεν ομοιάζει πλέον με την κατανομή εργασίας
- Η nominal συμπεριφορά μπορεί να υποβαθμιστεί ορατά μέσα σε έναν κύκλο
- Το rate μπορεί να πέσει ενώ η επιτυχία πέφτει με αυτό - καθαρά segments traded για recoveries
Το μίγμα αναλογία είναι ένα hyperparameter και αξίζει να γραφτεί κάτω. Κατάρτιση του επόμενου dataset είναι όπου αποφασίζεται: original επιδείξεις συν το correction set, επιλογή episode explicit ανά πηγή αντί ένας κανόνας που σιωπηλά τραβά σε ό,τι είναι διαθέσιμο. Εκεί ότι είναι ένα compose βήμα στο cockpit και το αποτέλεσμα είναι ένα συνηθισμένο dataset - δείτε το training documentation. Τι όχι εργαλείο κάνει για εσάς είναι εγγραφή ποια αναλογία παράγει ποια καμπύλη.
Παγίδα 4: ο άνθρωπος δεν είναι ένας συνεπής εμπειρογνώμονας
Η θεωρία DAgger υποθέτει έναν εμπειρογνώμονα. Δεν είστε ένας στη τεχνική έννοια: οι διορθώσεις σας δεν είναι δείγματα από ένα σταθερό conditional κατανομή σε σχέση δράσεων. Οι συγγραφείς ACT ονοματίζουν αυτό όταν καταγράφουν τα εμπόδια fine manipulation - τα σφάλματα συντάσσουν με την πάροδο του χρόνου και ανθρώπινα επιδείξεων μπορούν να είναι non-stationary. Το σύστημα τους ακόμη φτάνει 80 έως 90 τοις εκατό επιτυχία σε έξι πραγματικές εργασίες από δέκα λεπτά επιδείξεων, έτσι το πρόβλημα είναι feasible, όχι απών.
Η robomimic μελέτη κάνει το σημείο από την πλευρά δεδομένων. Σε έξι offline αλγόριθμα σε πέντε simulated και τρία real-world multi-stage εργασίες, οι μαθήματα περιλαμβάνουν ευαισθησία σε σχεδιασμό επιλογές, εξάρτηση σε επίδειξη ποιότητα, και - εκείνη που τραυματίζει εδώ - variability προερχόμενη από κριτήρια σταματήσεως, επειδή εκπαίδευση και αξιολόγηση αντικείμενο διαφέρουν. Το checkpoint με τη χαμηλότερη απώλεια δεν είναι αξιόπιστα ο ένας με το υψηλότερο success rate.
Υπάρχει μια hardware έκδοση αυτού: το input mode διαμορφώνει τη διόρθωση. Ένα leader-follower ρύθμιση παράγει συνεχή, human-paced τροχιές. Πληκτρολόγημα nudges είναι στριμωγμένο σκληρά από το server - δύο μοίρες ανά κλήση σε τα arm joints, τέσσερις στη αρπάγη - έτσι η ίδια πρόθεση αφίχνευται ως σκάλα μικρά βήματα. Sliders στείλετε απόλυτα targets και το server κινείται στις περισσότερες έξι μοίρες προς τα αυτά ανά κλήση. Τρία modes, τρία δράσης κατανομές; μίξη όλα τρία σε ένα correction σύνολο και τότε αναρωτιέται γιατί η προσέγγιση έγινε twitchy είναι αυτο-επιβαλλόμενο. Το teleoperation documentation καλύπτει τι κάθε mode στέλνει.
Ζύγιση των παρεμβάσεων: IWR και τι ήρθε αργότερα
Αν διορθώσεις είναι η πολύτιμη μειονότητα, το principled fix είναι βάρος αντί αποκλειστικότητα. Intervention Weighted Regression είναι η αναφορά εφαρμογή: τα δεδομένα εμερικεύονται σε intervention και non-intervention δείγματα και το δύο χωρίστε δείγματα σε ίση αναλογία κατά την εκπαίδευση. Ένα correction σύνολο που είναι πέντε τοις εκατό στα frames τότε συνεισφέρει μισό την κλίση, χωρίς η nominal συμπεριφορά εξαφανίζεται από τη κατανομή.
Ίση αναλογία είναι ένα σημείο αρχής, όχι νόμος. Sirius generalises το ένα αντικατάσταση δυαδικό χωρίστε με ένα συνεχής βάρος από προσέγγιση ανθρώπινη εμπιστοσύνη; Sirius-Fleet κινείται την απόφαση upstream, χρησιμοποιώντας ένα οπτικό κόσμο μοντέλο και ανωμαλίας predictors να αποφασίσει όταν ένας άνθρωπος είναι ζητηθεί καθόλου. Το κοινό thread: η intervention σημαία είναι ένα training σήμα, όχι μόνο ένα σημειωματάριο στήλη.
| Μέθοδος | Ποιος αποφασίζει όταν ο άνθρωπος δρα | Πώς το intervention δεδομένα χρησιμοποιείται | Αναφερόμενη αποτέλεσμα |
|---|---|---|---|
| DAgger (2011) | Σταθερό schedule; expert ετικέτες επισκέπτεται καταστάσεις | Ένα growing dataset, unweighted | Framed ως μια μείωση να no-regret online learning |
| HG-DAgger (2019) | Ο άνθρωπος, gating έλεγχος σε ένα πραγματικό σύστημα | Aggregated; συν ένα μαθημένο κατώφλι ασφάλειας σε model uncertainty | Καλύτερα από DAgger και BC σε οδήγηση; αριθμούς παρέμβασης δεν δίνονται |
| IWR (2020) | Ο άνθρωπος, via remote teleoperation | Intervention και non-intervention δείγματα τραβήχτηκαν σε ίση αναλογία | Κερδίζει μη-interventional demos στο ισοδύναμο δείγμα count |
| Sirius (2022) | Ο άνθρωπος, κατά την ανάπτυξη | Σταθμισμένα BC, βάρη από προσέγγιση ανθρώπινη εμπιστοσύνη | 8 % κέρδος σε προσομοίωση, 27 % σε πραγματικό υλικό; 2x γρηγορότερη convergence |
| ThriftyDAgger (2021) | Το σύστημα, gating σε novelty και κίνδυνος | Διαδραστική συλλογή κάτω από ένα εποπτεία προϋπολογισμό | User μελέτη (N=10): 58 % υψηλότερα ανθρώπινα και 80 % υψηλότερα robot απόδοση από το επόμενο καλύτερο μέθοδο |
| Fleet-DAgger (2022) | Το σύστημα, αποδίδοντας προσοχή σε ένα fleet | Fleet μάθηση σκοράρεται από Return on Human Effort | Μέχρι 8.8x υψηλότερα ROHE από baselines |
| Sirius-Fleet (2024) | Ανωμαλίες predictors με self-adapting κριτήρια | Multi-task μάθηση με ένα οπτικό κόσμο μοντέλο | Λιγότερες intervention αιτήματα ως αυτονομία βελτιώνεται |

Τέσσερις μετρικές αξίζει καταγραφή δίπλα στο rate
- Takeovers ανά εκτέλεση. Είκοσι σύντομη διορθώσεων και ένα μακρύ δίνουν παρόμοια rates και περιγράφουν διαφορετικές πολιτικές - ένα jittery, ένα με ένα μόνο blind spot.
- Μέσα intervention μήκος. Αυξανόμενα μήκος με ένα πέφτον μέτρημα σημαίνει τα υπόλοιπα αποτυχίες είναι οι δύσκολο, ποιο είναι τι τελική πρόοδος μοιάζει.
- Χρόνος πρώτα παρέμβαση. Ένας πολιτική που παίρνει περισσότερα πριν νέα βοήθεια είναι βελτίωση ακόμη όταν το ολικό rate είναι flat.
- Όπου παρεμβάσεις cluster. Bin ο σημαία από κανονικοποίηση episode πρόοδο; ένα σταθερό κορυφή σε κύκλοι σημεία σε ένα bottleneck.
Ένα κύκλο πρωτόκολλο που μπορείτε καθορίζουν εκτέλεση
Ένα μετρηθέν κύκλο έχει έξι βήματα και παράγει μια σειρά στο log. Ο πρώτος τέσσερις είναι το loop; το τελευταίο δύο κάνουν αυτό ένα μέτρηση.
- 1Παγώστε το αξιολόγηση πρωτόκολλο πριν κύκλο μηδέν
Γράψτε down σημείο έναρξης, placement αντικειμένων, κάμερες, μέτρημα δοκιμής, timeout και επιτυχία κριτήριο. Φωτογραφήστε το τραπέζι. Αν το έγγραφο έχει να αλλάξει, η σειρά ξαναρχίνει.
- 2Μέτρηση baseline
Εκτέλεση το πρωτόκολλο με αριθμό παρεμβάσεις και εγγραφή το successes; τότε τρέχει ένα όργανο συνόδου με takeover ενεργοποιηθεί και εγγραφή το rate. Εκείνα δύο αριθμοί είναι κύκλο μηδέν.
- 3Συλλέγουν διορθώσεων σε ένα συνεπή στυλ
Ένα input mode ανά κύκλο, ένα χειριστής αν μπορείτε διαχειριστείτε. Πάρτε over σε ένα κριτήριο μπορείτε κατάσταση out loud - 'αρπάγη περισσότερο από δύο εκατοστά off σε προσέγγιση' - και κρατήστε για το κύκλο.
- 4Triage κάθε επεισόδιο ο ίδιο ημέρα
Διόρθωση, αξιολόγηση ή απόρριψη. Διφορούμενα επεισόδια παίρνουν απορρίφθηκε, όχι αποθηκευμένα σε ο θεωρία ότι περισσότερα δεδομένα βοηθά - ένα διόρθωση σε ποιες εσείς χαμηλά είναι χειρότερα από αριθμό επεισόδιο.
- 5Σύνθεση το μίγμα ρητά
Original επιδείξεις συν διορθώσεις, επιλογή επεισόδιο ανά πηγή. Εγγραφή base μέτρημα, διόρθωση μέτρημα και κάθε ζύγιση - αυτό είναι το πεδίο θα θέλει σε τρεις εβδομάδες.
- 6Συνεχίστε από το checkpoint, τότε ανα-μέτρηση
Τρένο το composed dataset από το προηγούμενη checkpoint όχι ο base μοντέλο, τρέξιμο του κρύσταλλο πρωτόκολλο συν ένα όργανο συνόδου, προσθήκη ο σειρά, και σύγκριση έναντι του προηγούμενα δύο κύκλοι.
Δύο όρια αλλαγή πώς διαβάσατε ένα αδύναμο κύκλο. Συνεχίζεται από ένα checkpoint initialises το βάρη από αυτό - όχι ένα optimizer resume, έτσι το schedule ξεκινά φρέσκο και ένα σύντομο τρέχει από ένα συγκλίνων checkpoint μπορεί να κινηθεί πολύ λίγα. Και ο ηγέτης-ευθυγράμμιση κίνηση σε το ξεκίνημα ενός takeover έχει το λιγότερο mileage σε πραγματικό υλικό κάθε σε το chain; αν διορθώσεις όλα ξεκινά με ένα περίεργο transient, βρούμε εκεί πριν ένας κατηγορία το μίγμα.
Το μετρηθέν loop, ήδη σύρματα
ay-robots εφαρμόζει αυτά τα έξι βήματα ως χαρακτηριστικά προϊόντος: πάρτε over mid-run από ένας ηγέτης βραχίονα, πληκτρολόγημα ή sliders, με intervention frames σημαία αυτόματα; triage κάθε επεισόδιο ως διόρθωση, αξιολόγηση ή απόρριψη; σύνθεση ο επόμενο dataset από ο original επιδείξεις συν το διορθώσεις, επιλογή επεισόδιο ρητά ανά πηγή; και ξεκινά το επόμενο εκπαίδευση εκτέλεση από το προηγούμενο checkpoint αντί ο base μοντέλο.
Δείτε πώς το DAgger loop δουλεύειΤι τα αριθμοί δεν μπορεί να πείτε
Κανένα αυτό επιλύθηκε, και ένα τακτοποιημένο καμπύλη δεν πρέπει να πείσει εσείς διαφορετικά. Το intervention rate μετράει ένα joint σύστημα - πολιτική, υλικό, χειριστής, δωμάτιο - και χαρακτηρίζει τίποτα από μόνο του. Δεν μπορεί κρίνουν αν διορθώσεις ήταν καλά, και αυτό θα πέσει ευτυχώς σε ένα εργασία που έγινε ευκολότερη επειδή το αντικείμενο παρασύρθη δύο εκατοστά κοντάρει σε τρεις εβδομάδες.
Τι αυτό κάνει είναι γύρω ένα αόριστο εντύπωση σε μια στήλη μπορείτε επιχείρημα με. Η εναλλακτική δεν είναι ένα καλύτερα μετρικά; είναι τρεις εβδομάδες συλλογή διορθώσεων ο καμπύλη θα έχει είπε εσείς, μετά κύκλο τρία, στο στάση συλλογή. Η έρευνα βιβλιογραφία καθορίζει διαδραστική imitation μάθηση ως ανθρώπινα σχόλια δωμάτια περιστασιακός κατά ρομπότ εκτέλεση, έχοντας ένα online βελτίωση της συμπεριφορών· ο οικογένεια είναι ευρύ, και κανένα ρύθμιση αυτό δουλεύει χωρίς ένα αριθμό ανά κύκλο. Δείτε επίσης την SO-100 imitation μάθηση οδηγό για το base δεδομένα μίγμα έναντι, τρέχοντας μια πολιτική για ο ανάρτηση πλευρά, και τη DAgger loop σελίδα για ο εφαρμογή pipeline.
Είναι το intervention rate μόνο ένα μείον το success rate;▾
Αρ. Το rate μετράει πόσο από ένα τρέχοντας παίρνετε over; το success rate μετράει αν ο εργασία άσκηση χωρίς εσείς. Ένα εκτέλεση μπορεί να επιτύχουν με ένα 30 τοις εκατό intervention rate, και ένα τρέχοντας με αριθμό παρεμβάσεις μπορεί αποτύχει εξ ολοκλήρου. Αυτές διαφέρουν επίσης σε θόρυβο: το rate κινείται ομαλά πάνω χιλιάδες συσχετισμένα frames, το success rate άλματα μεταξύ λίγων δυαδικό αποτελέσματα. Σύνδεση και τα δύο.
Πόσα αξιολόγηση δοκιμές κάνω χρειάζονται για το success rate να σημαίνει κάτι;▾
Περισσότερο από αισθάνεται λογικό. Κάτω από το κανονικό προσέγγιση, 20 δοκιμές σε ένα αληθινό 60 τοις εκατό success rate φέρουν ένα τυπικό σφάλμα κοντά στα 11 ποσοστιαία σημεία, έτσι ένα 10-point κίνηση μεταξύ κύκλοι είναι αδιάκριτα από θόρυβο; 50 δοκιμές φέρουν ότι σχήμα σε περίπου 7. Αν δεν μπορείτε να αξιοποιήσει 50, κρατήστε το δοκιμή μέτρημα ίδιο σε κύκλοι και μεταχείριση μικρό κινήσεις ως inconclusive.
Τι μίγμα αναλογία από επιδείξεις να διορθώσεις πρέπει ξεκινώ με;▾
Ο τεκμηριωμένο σημείο έναρξης είναι IWR'του: χωρίστε ο δεδομένα σε intervention και non-intervention δείγματα και τραβήξιμο αυτά σε ίση αναλογία, έτσι ο διορθώσεις συμβάλλουν μισό ο κλίση όπως μικρό ένα κλάσμα του frames αυτά είναι. Αν σας ρύθμιση δεν μπορεί ζύγιση δείγμα, κατά προσέγγιση το μέσω επεισόδιο αριθμούς όταν σύνθεση το dataset και εγγραφή το αναλογία. Εκπαίδευση σε διορθώσεις μόνο είναι το επιλογή να κανόνα έξω.
Ο παρέμβαση rate πήγε up μετά ένας κύκλο. Είναι το κύκλο σπατάλη;▾
Όχι ανάγκη, αλλά ελέγχος το βαρετό εξηγήσεις πρώτα: κάνω ο checkpoint που ήδη χαμηλά ταίριασμα το ένας μάθανε, κάνω ένα κάμερα δείκτη ή τοποθέτηση αλλαγή, κάνω αντικείμενο τοποθέσία drift, ήταν ο διόρθωση στυλ συνεπής. Αν όλα τέσσερις είναι καθαρά και το paired success rate επίσης έπεσε, ύποπτη το μίγμα - πολύ λίγα base επιδείξεις έναντι ο διορθώσεις ή διορθώσεις που έρχονται σε αντίθεση ο άλλα. Ένα γνήσιο regression ανήκει σε ο log, όχι ο bin.
Μπορώ παραλείπω ο κρύσταλλο αξιολόγηση πρωτόκολλο και μόνο παρακολούθηση ο intervention rate;▾
Μόνο αν δεχθείτε που δεν μπορείτε πείτε βελτίωση από habituation. Το rate εξαρτάται σε σας δικός πραγματικό χρόνο κατώφλι για stepping σε, και ότι κατώφλι πέφτει ως παίρνετε χρησιμοποιηθεί να ο πολιτική'ς quirks. Το κρύσταλλο πρωτόκολλο είναι ο μέρος ο μέτρηση σας κατώφλι δεν μπορεί προσέγγιση - taped σημάδια, ένα γραμμένη home pose, ένα σταθερό δοκιμή μέτρημα, ένα κριτήριο αποφασίστηκε πριν ο κύκλο. Αυτό έχει στάση αμετάβλητη σε ο σειρά.
Κρατήστε ο log σε ο αποθετήριο, όχι σε ένα σημειωματάριο: κύκλοι είναι ημέρες χώρια, υλικό παίρνει ξαναχτισμένο, και ο πρόσωπο ανάγνωση ο καμπύλη σε Οκτώβριος είναι εσείς με αριθμό μνήμη του Αύγουστο. Ο documentation FAQ καλύπτει ο λειτουργικό λεπτομέρεις αριστερά έξω εδώ.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started