Χειριστής που παρακολουθεί έναν ρομποτικό βραχίονα μέσω ενός τηλε-ελέγχου, χέρια στα χειριστήρια και έτοιμος να αναλάβει τον έλεγχο
DAggerInteractive Imitation LearningHG-DAggerΡομποτικές ΠολιτικέςSO-100

HG-DAgger και οι Gated Variants: Ποιος Αποφασίζει Πότε Να Ελάβει τη Ρομποτική Πολιτική

AY-Robots ResearchAugust 27, 202615 λεπτά ανάγνωση

Το απλό DAgger ζητά από έναν άνθρωπο να επισημάνει καταστάσεις ενώ το ρομπότ εξακολουθεί να οδηγεί. Στο πραγματικό υλικό αυτό είναι ανασφαλές και παράγει κακές ετικέτες. Οι gated variants αντικαθιστούν την τυφλή επισήμανση με μια πύλη που κάποιος πρέπει να ανοίξει: ο άνθρωπος σε HG-DAgger, ένας ταξινομητής ασφάλειας σε SafeDAgger, η διαφωνία ενός ensemble σε EnsembleDAgger, μια αποτίμηση καινοτομίας και κινδύνου με προϋπολογισμό σε ThriftyDAgger. Αυτό το άρθρο τα συγκρίνει αναλύοντας ποιος είναι ο ιδιοκτήτης της πύλης, ποιο σήμα την ανοίγει και τι κοστίζει καθένα — και γιατί η μορφή με ανθρώπινη πύλη είναι εκείνη που επιζεί σε επαφή με πραγματικό ρομπότ.

Μια κλωνοποιημένη πολιτική αποτυγχάνει εκεί που τα δεδομένα εκπαίδευσής της εξαντλήθηκαν. Η λύση είναι να συνεχίσουν να συλλέγονται δεδομένα υπό τη δική της κατανομή κατάστασης αντί για εκείνη του δείκτη, κάτι που κάνει το DAgger και κάτι που η εισαγωγή στη συγκέντρωση δεδομένων καλύπτει από τα πρώτα αρχή. Αφήνει ανοικτό το δύσκολο μέρος του αρχικού αλγορίθμου: ενώ ο μαθητής οδηγεί, ο ειδικός υποτίθεται ότι λέει τι θα έκανε, για κάθε κατάσταση, χωρίς να ελέγχει.

Σε έναν προσομοιωτή με έναν scripted ειδικό είναι δωρεάν. Σε ένα τραπέζι με έναν πραγματικό βραχίονα δεν είναι ούτε δωρεάν ούτε ασφαλές. Οι συγγραφείς HG-DAgger αναφέρουν ακριβώς την αντίρρηση: τέτοια σχήματα δειγματοληψίας "απαιτούν από τον ειδικό να παρέχει ετικέτες δράσης χωρίς να είναι πλήρως σε έλεγχο του συστήματος", το οποίο "μπορεί να μειώσει την ασφάλεια και, όταν χρησιμοποιούνται άνθρωποι ως ειδικοί, είναι πιθανό να υποβαθμίσει την ποιότητα των συλλεγμένων ετικετών λόγω αντιληπτής καθυστέρησης του ενεργοποιητή" (Kelly et al., 2019). Δύο αποτυχίες κρύβονται σε αυτή την πρόταση: η πολιτική συνεχίζει να οδηγεί σε καταστάσεις που κανείς δεν θέλει, και οι ετικέτες που αγοράστηκαν με αυτόν τον κίνδυνο είναι χειρότερες από αυτές που παράγει ένας άνθρωπος ενώ κρατά τα χειριστήρια. Κάθε παραλλαγή παρακάτω απαντά στην ίδια ερώτηση — βάλτε μια πύλη στον έλεγχο και αφήστε κάποιον να αποφασίσει πότε ανοίγει. Διαφέρουν σε ποιος είναι εκείνος κάποιος.

Η σύντομη εκδοχή

  • Οι gated variants αντικαθιστούν την τυφλή επισήμανση με έναν διακόπτη μεταξύ ελέγχου πολιτικής και ελέγχου ειδικού. Αυτό που τα διαχωρίζει είναι ποιος ιδιοκτητείται ο διακόπτης.
  • Το HG-DAgger δίνει τον διακόπτη στον άνθρωπο και συγκεντρώνει μόνο δεδομένα που καταγράφηκαν ενώ ο άνθρωπος είχε αδιάκοπο έλεγχο.
  • Το SafeDAgger του δίνει σε έναν δυαδικό ταξινομητή που προβλέπει απόκλιση από μια πολιτική αναφοράς· το EnsembleDAgger απαιτεί χαμηλή διακύμανση ensemble και μικρή απόσταση από τη δράση του ειδικού ταυτόχρονα.
  • Το LazyDAgger προσθέτει υστέρηση ώστε ο έλεγχος να μην χτυπά εδώ και εκεί· το ThriftyDAgger έχει πύλη στη νεότητα ή την εκτιμώμενη ρίσκο υπό έναν σαφή προϋπολογισμό παρέμβασης.
  • Τα σήματα με πύλη ρομπότ χρειάζονται κάτι που ένα fine-tuned VLA σε έναν βραχίονα κατηγορίας χόμπι συνήθως στερείται: μια πολιτική αναφοράς, ένα φτηνό ensemble, ή βαθμονομημένη epistemic uncertainty.
  • Η πύλη είναι το ήμισυ της μεθόδου. Αυτό που συμβαίνει στα τμήματα παρέμβασης αφού - ανάμιξη, βάρος, συγκέντρωση - αποφασίζει αν το γύρο βελτίωσε κάτι.

Human-gated και robot-gated: το διαχωρισμό που σημαίνει

Η διαδραστική μαθητική απομίμησης έχει δικό της survey· ο Celemin και συνάδελφοι το καταλογογραφούν κατά τύπο ανατροφοδότησης, διεπαφή, μοντέλο μάθησης, εμπειρία χρήστη, εφαρμογή και benchmark. Το διαχωρισμό που αποφασίζει την ingeering σου είναι πιο απλό από όλους αυτούς τους άξονες, και η πρόσφατη εργασία το ονοματίζει άμεσα: μια μέθοδος είναι human-gated όταν ο επιβλέπων αποφασίζει πότε να παρέμβει, και robot-gated όταν ο agent αποφασίζει πότε να ζητήσει βοήθεια (Cai et al., 2025). Όλα τα υπόλοιπα είναι μηχανοποιός που εξυπηρετεί μία από αυτές τις δύο επιλογές. Το ανταλλάγμα είναι ορατό από το αρχικό στάδιο: μια πύλη ανθρώπων κοστίζει συνεχή προσοχή, και μια πύλη ρομπότ υπόσχεται να δώσει αυτή την προσοχή πίσω — αλλά μόνο αν το σήμα που έχει πύλη είναι αξιόπιστο, και η κατασκευή αυτού του σήματος είναι το δικό της πρόβλημα έρευνας.

SafeDAgger: ένας ταξινομητής που προβλέπει τη δική του απόκλιση

Το SafeDAgger του Zhang και Cho (2016) είναι το νωρίτερο από αυτές τις πύλες. Η αναφορά της πολιτικής αναφοράς είναι το ακριβό μέρος, οπότε ένα δεύτερο, μικρό δίκτυο — η πολιτική ασφάλειας — προβλέπει αν η αναφορά είναι καθόλου άξια του κόστους. Επιστρέφει "μια δυαδική ετικέτα που δείχνει αν η κύρια πολιτική είναι πιθανό να αποκλίνει από μια πολιτική αναφοράς χωρίς να την αναφέρει". Η ετικέτα ορίζεται σε σχέση με μια τετραγωνική απόκλιση L2 μεταξύ των ενεργειών των δύο πολιτικών με έναν κατώφλι tau, και ο ταξινομητής προσαρμόζεται με binary cross-entropy. Κατά τη διάρκεια εκτέλεσης αποφασίζει ανά κατάσταση αν ο μαθητής συνεχίζει να οδηγεί ή η αναφορά αναλαμβάνει. Το αφθέρεν αναφέρει λιγότερες αναφορές αναφοράς σε ένα racing simulator συν έναν ταχύτερο ρυθμό σύγκλισης που οι συγγραφείς αποδίδουν σε ένα αυτοματοποιημένο curriculum effect, χωρίς να δίνουν αριθμό για καθένα.

Η ερύθρα είναι στον ορισμό, όχι στα αποτελέσματα. Η εκπαίδευση του ταξινομητή απαιτεί τη δράση της πολιτικής αναφοράς σε κάθε κατάσταση που χρησιμοποιείται για να το προσαρμόσει, το οποίο υποθέτει ότι η αναφορά είναι ένα άλλο πρόγραμμα. Αν η αναφορά σας είναι ένας άνθρωπος με έναν βραχίονα ηγέτη, αυτό το σύνολο ετικετών δεν είναι φτηνό και η μέθοδος χάνει τη ιδιότητα που σχεδιάστηκε για.

EnsembleDAgger: αμφιβολία και διαφορά, και τα δύο

Οι Menda, Driggs-Campbell και Kochenderfer (2019) αντιμετωπίζουν την πύλη ως μια πιθανοκρατική ερώτηση. Το EnsembleDAgger "προσεγγίζει ένα Gaussian Process χρησιμοποιώντας ένα ensemble τεχνητών νευρώνων" και διαβάζει τη διακύμανση ensemble ως ένα proxy αυτοπεποίθησης: υψηλή διακύμανση σημαίνει μια περιοχή αντίθετη με τα δεδομένα εκπαίδευσης, που — υποθέτοντας ότι ο ειδικός αποφεύγει τις καταστάσεις αποτυχίας — συσχετίζεται με την εγγύτητα στην αποτυχία. Ο κανόνας είναι μια σύζευξη. Ο μαθητής μπορεί να ενεργήσει μόνο όταν η απόσταση L2 μεταξύ της μέσης δράσης του και της δράσης του ειδικού παραμένει κάτω από ένα κατώφλι (discrepancy) και η διακύμανση της προβλεπόμενης δράσης του παραμένει κάτω από ένα δεύτερο (doubt). Αν κάποιος αποτύχει, ο ειδικός αναλαμβάνει τον έλεγχο. Ο στόχος είναι να μεγιστοποιηθεί το μερίδιο του μαθητή των ενεργειών ενώ περιορίζεται η πιθανότητα αποτυχίας· το άρθρο αναφέρει βελτιωμένη ασφάλεια και μάθηση ενάντια σε άλλες παραλλαγές DAgger σε ένα inverted pendulum και MuJoCo HalfCheetah.

Ο όρος discrepancy χρειάζεται την δράση του ειδικού

Αυτό αθόρυβα αποκλείει τον πλήρη κανόνα για την επίβλεψη χωρίς χέρια. Η απόσταση μεταξύ της δράσης του μαθητή και του ειδικού απαιτεί τη δράση του ειδικού σε εκείνη την κατάσταση, εκείνη τη στιγμή. Με έναν scripted ειδικό, μια χαρά. Με έναν άνθρωπο, ο άνθρωπος πρέπει να παράγει ενέργειες συνεχώς — ακριβώς το φορτίο που οι gated variants προοριζόταν να αφαιρέσουν. Ο όρος doubt του μόνου είναι χωρίς χέρια· η σύζευξη δεν είναι.

LazyDAgger: σταματήστε τον διακόπτη από το κτύπημα

Ο Hoque και συνάδελφοι (2021) επιτέθηκαν σε ένα κόστος που τα προηγούμενα έγγραφα δεν μέτρησαν: ο ίδιος ο διακόπτης. Κάθε παρέμβαση "διακόπτει άλλη δουλειά που κάνει ο άνθρωπος, έχει καθυστέρηση με κάθε context switch μεταξύ επιβλέποντος και αυτονόμου ελέγχου, και απαιτεί χρόνο για εκτέλεση". Μια πύλη που ανοίγει και κλείνει δέκα φορές ανά λεπτό είναι χειρότερη από μία που ανοίγει μία φορά για δέκα δευτερόλεπτα, σε ίδιο αυτόνομο μερίδιο. Το LazyDAgger επεκτείνει το SafeDAgger με ασύμμετρα κατώφλι — πιο δύσκολο να εισέλθει έλεγχος επιβλέποντος από ό, τι να παραμείνει σε αυτό — ώστε το σύστημα να μην ταλαντεύεται στο όριο. Σε προσομοίωση "μπορεί να μειώσει τους context switches κατά μέσο όρο κατά 60% σε σχέση με SafeDAgger σε 3 συνεχείς εργασίες ελέγχου ενώ διατηρεί την κατάσταση της τέχνης απόδοση πολιτικής"· στη χειρισμό ύφασμα με ένα ABB YuMi "μειώνει τους context switches κατά 60% ενώ επιτυγχάνει 60% υψηλότερο ποσοστό επιτυχίας από SafeDAgger κατά τη διάρκεια εκτέλεσης".

ThriftyDAgger: νεότητα ή κίνδυνος, υπό έναν προϋπολογισμό

ThriftyDAgger (Hoque et al., CoRL 2021) ξεκινά από τον προϋπολογισμό του επιβλέποντος παρά την πολιτική. Χρησιμοποιεί "μια μαθημένη πολιτική εναλλαγής για να ζητήσει παρεμβάσεις μόνο σε καταστάσεις που είναι επαρκώς (1) novel, όπου η πολιτική ρομπότ δεν έχει συμπεριφορά αναφοράς για απομίμηση, ή (2) risky, όπου το ρομπότ έχει χαμηλή αυτοπεποίθηση στην ολοκλήρωση της εργασίας", με ένα νέο μέτρο για την εκτίμηση αυτού του κινδύνου. Ο προϋπολογισμός είναι μια είσοδος, όχι ένα αποτέλεσμα: δηλώνετε πόσο χρόνο ανθρώπου θα δαπανήσετε. Εφαρμόζεται κατά τη διάρκεια εκτέλεσης η μέθοδος "επιτυγχάνει 100% ποσοστό επιτυχίας τόσο στην προσομοίωση όσο και στις φυσικές εργασίες", και μια μελέτη χρήστη με δέκα συμμετέχοντες που ελέγχουν ένα τρία-ρομποτική στόλο εκτός από μια εργασία συγκέντρωσης αναφέρει ότι "αυξάνει ανθρώπινη και ρομποτική απόδοση κατά 58% και 80% αντίστοιχα σε σχέση με τον επόμενο καλύτερο αλγόριθμο ενώ μειώνει το φορτίο επιβλέποντος". Η ρύθμιση στόλου είναι ο φυσικός χώρος για αυτή τη δουλειά· το Fleet-DAgger αργότερα τυποποίησε διαδραστικό fleet learning με πολλά ρομπότ και επιβλέποντες, προτείνοντας Return on Human Effort ως την ποσότητα για βελτιστοποίηση.

HG-DAgger: ο άνθρωπος κρατά την πύλη

Ο Kelly et al. (2019) πάνε στην άλλη κατεύθυνση. Δεν υπάρχει πολιτική εναλλαγής. Ο μαθητής κυλάει "έως ότου ο ειδικός παρατηρήσει ότι ο αρχάριος έχει εισέλθει σε μια ανασφαλή περιοχή του χώρου κατάστασης", σε αυτό το σημείο ο ειδικός αναλαμβάνει τον έλεγχο και καθοδηγεί το σύστημα πίσω. Ο κανόνας συγκέντρωσης είναι το αυστηρό μέρος: "Οι ετικέτες ενέργειας ειδικού συλλέγονται και προστίθενται στο σύνολο δεδομένων μόνο κατά τη διάρκεια αυτών των τροχιών ανάκαμψης, κατά τη διάρκεια των οποίων ο ειδικός άνθρωπος έχει αδιάκοπο έλεγχο του συστήματος." Τίποτα δεν επισημαίνεται ενώ ο άνθρωπος είναι θεατής.

Δεν σταματά στον διακόπτη. Το HG-DAgger επίσης "μαθαίνει ένα όριο ασφάλειας για μια μετρική κινδύνου βασισμένη στη model-uncertainty που μπορεί να χρησιμοποιηθεί για να προβλέψει την απόδοση του πλήρως εκπαιδευμένου αρχαρίου σε διαφορετικές περιοχές του χώρου κατάστασης": καταγράφει πόσο αβέβαιος ήταν ο μαθητής στα χρονικά σημεία όπου ο άνθρωπος παρέμβηκε και υπολογίζει το μέσο όρο του τελευταίου τετάρτου αυτών των ηχογραφήσεων, όπου ο μαθητής μοιάζει περισσότερο με την τελική του μορφή. Αυτό δεν είναι μια πύλη που το ρομπότ λειτουργεί αλλά ένα διαγνωστικό που σας λέει πού αναμένεται ότι θα κρατήσει η ολοκληρωμένη πολιτική. Η αξιολόγηση καλύπτει μια προσομοιωμένη και μια πραγματική εργασία οδήγησης και αναφέρει βελτιωμένη απόδοση έναντι τόσο του DAgger όσο και της behavior cloning.

Μια σχετική γραμμή αλλάζει αυτό που θεωρείται ως ετικέτα. Η Expert Intervention Learning του Spencer και συνάδελφοι υποστηρίζει ότι "κάθε ποσό ανθρώπινης ανατροφοδότησης, είτε μέσω παρέμβασης είτε μη παρέμβασης, παρέχει πληροφορίες σχετικά με την ποιότητα της τρέχουσας κατάστασης, την βελτιστότητα της δράσης, ή και τα δύο", τυποποιημένο ως ένας περιορισμός της συνάρτησης τιμής του μαθητή και επιλύεται με no-regret online learning. Υπό αυτή την ανάγνωση, τα τμήματα όπου ο άνθρωπος παρακολουθούσε και δεν έκανε τίποτα είναι ασθενής θετική απόδειξη παρά κενή. Το EIL μαθαίνει αποφυγή σύγκρουσης από περίπου ένα λεπτό ανθρώπινου ελέγχου.

Χώρος εργασίας βραχίονα ρομπότ με κάμερες τοποθετημένες για συλλογή δεδομένων κατά τη διάρκεια ενός επιβλεπόμενου policy rollout
Ένα ανθρώπινο-gated γύρο είναι ένα συνηθισμένο inference run με ένα recorder συνδεδεμένο. Τα πλαίσια που οδήγησε ο χειριστής επισημαίνονται· τα υπόλοιπα παραμένουν όπως ήταν.

Οι παραλλαγές δίπλα-δίπλα

ΜέθοδοςΠοιος ανοίγει την πύληΣήμαΧρειάζεται διαθέσιμοΑναφερόμενο
DAgger (Ross et al., 2011)Κανείς — ο μαθητής πάντα οδηγείΚανένα· ο ειδικός επισημαίνει κάθε επισκέψιμη κατάστασηΈνας ειδικός ικανός να επισημάνει off-policy καταστάσεις χωρίς να ελέγχειNo-regret reduction με εγγυήσεις υπό την κατανομή κατάστασης του μαθητή
HG-DAgger (Kelly et al., 2019)Ο ανθρώπινος επιβλέπωνΗ κρίση του επιβλέποντος ότι η κατάσταση είναι ανασφαλήςΚάποιος που παρακολουθεί και μια καθαρή παράδοση ελέγχουΞεπερνά το DAgger και behavior cloning σε μια προσομοιωμένη και πραγματική εργασία οδήγησης· επίσης μαθαίνει ένα όριο κινδύνου
SafeDAgger (Zhang & Cho, 2016)Το ρομπότΔυαδικός ταξινομητής για απόκλιση L2 από την αναφορά πάνω από tauΜια queryable πολιτική αναφοράς για τις ετικέτες του ταξινομητήΛιγότερες ερωτήσεις αναφοράς σε ένα racing simulator, ταχύτερη σύγκλιση (χωρίς αριθμό)
EnsembleDAgger (Menda et al., 2019)Το ρομπότEnsemble διακύμανση και απόσταση από την ενέργεια του ειδικού, και τα δύο κάτω από κατώφλιΈνα ensemble δικτύων συν τη δράση του ειδικού σε κάθε βήμαΒελτιωμένη ασφάλεια και μάθηση σε pendulum και HalfCheetah
LazyDAgger (Hoque et al., 2021)Το ρομπότ, με υστέρησηΣήμα SafeDAgger με ξεχωριστά κατώφλια εισόδου και εξόδουΌ,τι χρειάζεται το SafeDAgger, συν ένα δεύτερο κατώφλι για σύνδεση~60% λιγότερα context switches σε 3 εργασίες· 60% υψηλότερη επιτυχία σε YuMi fabric
ThriftyDAgger (Hoque et al., 2021)Το ρομπότ, υπό έναν προϋπολογισμόΝεότητα, ή εκτιμώμενος κίνδυνος μη ολοκλήρωσης της εργασίαςΈνας εκπαιδευμένος εκτιμητής κινδύνου και ένας δηλωμένος προϋπολογισμός παρέμβασης100% επιτυχία κατά τη διάρκεια εκτέλεσης· μελέτη χρήστη (N=10): 58% και 80% κέρδη έναντι της επόμενης καλύτερης
EIL (Spencer et al., 2020)Ο άνθρωπος — η μη παρέμβαση μετράει επίσηςΠαρέμβαση και η απουσία της ως περιορισμοί στη συνάρτηση τιμήςOnline no-regret learning πάνω από ένα value constraintΑποφυγή σύγκρουσης από περίπου ένα λεπτό ανθρώπινου ελέγχου

Τι αγοράζει κάθε πύλη και τι χρεώνει

Διαβάστε προς τα κάτω τη στήλη "needs" και ένα σχέδιο πέφτει έξω: κάθε σήμα robot-gated εκεί είναι ένα proxy που πρέπει να κατασκευαστεί, και κάθε proxy έχει το δικό του λογαριασμό.

  • Τα σήματα Discrepancy (SafeDAgger, LazyDAgger, μισό του κανόνα EnsembleDAgger) χρειάζονται μια πολιτική αναφοράς. Είτε έχετε έναν scripted ειδικό, στην περίπτωση αυτή το ενδιαφέρον πρόβλημα έχει ήδη επιλυθεί, ή ένας άνθρωπος συνεχίζει να παράγει ενέργειες στο παρασκήνιο ώστε να μπορεί να υπολογιστεί μια απόσταση.
  • Τα σήματα Doubt χρειάζονται βαθμονομημένη epistemic uncertainty. Ένα ensemble μικρών control networks προσεγγίζει το· ένα ensemble ενός τρία-δισεκατομμυρίου-parameter vision-language-action model είναι ένα πρόβλημα μνήμης και καθυστέρησης πρώτα.
  • Τα σήματα Novelty και risk χρειάζονται ένα εκπαιδευμένο estimator της ολοκλήρωσης εργασίας, προσαρμοσμένο σε αρκετά επιτυχημένα και αποτυχημένα rollouts. Σε μια εργασία που ακόμα κάνετε να δουλεύει, αυτά τα δεδομένα δεν υπάρχουν στο γύρο ένα.
  • Η ανθρώπινη πύλη χρειάζεται προσοχή και τίποτα άλλο — το μόνο σήμα διαθέσιμο στη μέρα ένα, σε οποιαδήποτε αρχιτεκτονική πολιτικής, χωρίς κανένα επιπλέον μοντέλο για εκπαίδευση.
  • Κανένα robot gate δεν αφαιρεί τον άνθρωπο από το δωμάτιο. Μειώνουν πόσο συχνά ο άνθρωπος πρέπει να ενεργήσει, όχι αν πρέπει να είναι παρών.

Υπάρχει μια ήσυχη διαφορά σε αυτό που παράγει η πύλη. Μια robot gate που εκπέμπει mid-trajectory δίνει σε έναν άνθρωπο ένα κινούμενο βραχίονα σε ένα αυθαίρετο θέση. Μια ανθρώπινη πύλη αφήνει τον χειριστή να επιλέξει τη στιγμή — μετά τη σταγών, πριν από τη σύγκρουση, όχι στη μέση ενός swing. Τα τμήματα ανάκαμψης από τα δύο δεν είναι εξίσου καθαρά, και αυτά τα τμήματα είναι το σύνολο του προϊόντος του γύρου.

Γιατί η μορφή human-gated κερδίζει στο πραγματικό υλικό

Αυτό είναι ένα όρισμα μηχανικής, όχι ένα benchmark αποτέλεσμα — κανένα χαρτί που βρήκαμε δεν τρέχει όλες τις πέντε πύλες στον ίδιο χειριστή με την ίδια κατηγορία πολιτικής. Στηρίζεται σε τέσσερα σημεία.

Πρώτον, ο επιβλέπων είναι εκεί ούτως ή άλλως. Κανείς δεν αφήνει ένα SO-100 arm τρέχον χωρίς επίβλεψη δίπλα σε αντικείμενα που μπορεί να ρίξει. Μόλις κάποιος κοιτάζει, το οριακό κόστος της δύο τους ενός κουμπιού takeover είναι κοντά στο μηδέν· η κατασκευή ενός βαθμολογημένου κινδύνου εκτιμητή είναι ένα έργο.

Δεύτερον, η αβεβαιότητα που μπορείτε να μετρήσετε πραγματικά σε μια σύγχρονη πολιτική είναι συχνά η λάθος ποσότητα. Ένα diffusion ή flow-matching κεφαλή παράγει διακύμανση κατά τις δειγματοληφθείσες δράσεις τμήματα, και αυτή η διακύμανση αντανακλά την πολυτροπικότητα που η κεφαλή εκπαιδεύθηκε να αντιπροσωπεύει, όχι epistemic άγνοια σχετικά με την κατάσταση. Το δεύτερο όρο αμφιβολίας του EnsembleDAgger χρησιμοποιεί ένα ensemble ακριβώς για να καταγράψει το τελευταίο. Τα δύο μοιάζουν με τον ίδιο αριθμό και δεν είναι· η action chunking και flow matching εγγραφές καλύπτουν πώς αυτές οι κεφαλές εκπέμπουν ενέργειες αρχικά.

Τρίτον, οι αποτυχίες που σημαίνουν στη χειρισμό είναι συχνά σημαντικές παρά στατιστικά ασυνήθιστες. Μια πολιτική που κλείνει το gripper δύο εκατοστά νωρίτερα, ή που φτάνει με αυτοπεποίθηση για το λάθος ένα από δύο πανομοιότυπα κύβοι, δεν είναι σε μια κατάσταση υψηλής διακύμανσης — είναι αυτοπεποίθης και λάθος. Κανένα κατώφλι διακύμανσης δεν αποπλάνηση εκείνα· ένα άτομο που παρακολουθεί αποπλανά το αμέσως.

Τέταρτον, ποιότητα ετικέτας — το αρχικό σημείο HG-DAgger, και αυτό που παραλείπεται συχνότερα. Οι ετικέτες που συλλέγονται ενώ ο άνθρωπος έχει αδιάκοπο έλεγχο ξεπερνούν τις ετικέτες διηγήθηκαν σε ένα κινούμενο σύστημα. Αν ο στόχος είναι corrective δεδομένα που αξίζει συγκέντρωσης, ο όγκος του δικαιστηρίου είναι με τον αυτοματοποιημένο πύλη.

Όπου οι robot gates πληρώνουν

Η εικόνα αναπτύσσεται όταν ένας επιβλέπων είναι υπεύθυνος για πολλά ρομπότ — το καθεστώς που ThriftyDAgger's μελέτη χρήστη και Fleet-DAgger's τυποποίηση στόχο. Με ένα στόλο, ανθρώπινη προσοχή είναι η σπάνια πόρος και μια ελλειπής κατανομή χτυπά κανένα. Με έναν βραχίονα σε ένα τραπέζι δεν είστε σε εκείνο το καθεστώς.

Το human-gated loop, ήδη συνδεδεμένο

Takeover κατά τη διάρκεια μιας τρέχουσας inference session, ανά πλαίσιο intervention σημαίες στα διορθωμένα τμήματα, δικαστηρίου κάθε run σε διορθώσεις ή αξιολόγηση, σύνθεση μεικτού σύνολο δεδομένων από πηγές που επιλέγετε, και συνεχιζόμενης εκπαίδευσης από ένα υπάρχον checkpoint είναι ενσωματωμένα παρά scripted με το χέρι. Takeover εργάζεται με έναν βραχίονα ηγέτη, ή με πληκτρολόγιο και δρομείς αν δεν έχετε ένα.

Δείτε πώς τρέχει το DAgger loop

Η πύλη είναι το ήμισυ της μεθόδου· η αποχέ δεδομένων είναι το άλλο ήμισυ

Μια πύλη αποφασίζει ποια πλαίσια οδήγησε ένας άνθρωπος, όχι τι να κάνει με αυτά, και αυτή η δεύτερη απόφαση είναι όπου γύροι είναι πιο συχνά σπαταλημένο. Ο πρώτος κανόνας είναι ο που το D σε DAgger σημαίνει: συγκέντρωση, μην αντικαταστήσετε. Fine-tuning α checkpoint καθαρά σε μερικών εκατοντάδων πλαίσια διόρθωσης σας δίνει ένα μοντέλο που έχει δει σχεδόν τίποτα αλλά ανάρρωσης και έχει ξεχάσει το ονοματιστικό τροχιά.

Ο δεύτερος κανόνας είναι ότι τα πλαίσια παρέμβασης δεν είναι τα συνηθισμένα πλαίσια. Mandlekar et al. κατασκευή ένα σύστημα τηλεελέγχου για 6-DoF χειρισμό που αφήνει χειριστές να παρακολουθούν πολιτικές και αναλάβουν την αποτυχία, στη συνέχεια εκπαιδευμένη αναλόγως με ένα αλγόριθμο που "ενθαρρύνει την πολιτική να μάθει πώς να διασχίσει bottlenecks μέσω των παρεμβάσεων"· agents εκπαιδευθηκε στις δεδομένα ξεπέρασε agents εκπαιδευθηκε στο ίδιο ποσό των συνηθισμένων δείγματα αποδείξεως. Sirius ωθήσει την ιδέα σε ανάπτυξη, "re-weighting εκπαίδευσης δείγματα με approximated ανθρώπινη αμοιβή και βελτιστοποίηση των πολιτικές με σταθμισμένη behavioral cloning". Και τα δύο χρειάζονται ένα ανά-πλαίσιο marker του τι ήταν ανθρώπινη-κίνητη, η οποία είναι γιατί η intervention σημαία σημαίνει περισσότερο από ό,τι εκείνη.

Ο τρίτος κανόνας είναι ότι αυτόματη ανάμιξη είναι μια παγίδα. Ένα σύνθεση σύνολο δεδομένων των οποίων πηγές δεν μπορείτε να απαριθμήσετε είναι ένα δεν μπορείτε να αποσφαλματώσετε όταν ο επόμενος γύρος χειροτερεύει. Σε αυτή την πλατφόρμα στο σύνθεση βήμα είναι ρητό για αυτό το λόγο — αρχικό σύνολο δεδομένων συν διορθώσεις, επεισόδιο επιλογή ανά πηγή, και το αποτέλεσμα είναι ένα συνηθισμένο LeRobot dataset που συγχρονίζεται και τρένα όπως κάθε άλλα· η dataset documentation καλύπτει την μορφή πλευρά.

Βήμα σε ένα γύροΤι παράγειΠιο συνηθισμένος τρόπος που πάει λάθος
Τρέξτε την reasoning με ηχογράφηση σεΈνα τρέξτε κάτω από την δικιά του κατανομή κατάστασης πολιτικήςΚαταγράφεται ως απλή τηλεχείρισης, χάνοντας ότι μια πολιτική ήταν οδήγηση
Αναλάβετε κατά την αποτυχίαΤμήματα διόρθωσης με ένα ανά-πλαίσιο intervention σημαίαΚοσμητική wobble διόρθωση, διδασκαλία στυλ παρά ένα ανάρρωση
Δικαστηρίου κάθε επεισόδιοΔιορθώσεις, αξιολόγηση, ή απορρίπτειΚρατώντας τα πάντα· μια botched takeover κοστίζει περισσότερο από το επεισόδιο ήταν αξίζει
Συγχρονισμό τις διορθώσειςΜια versioned σύνολο δεδομένων δίπλα το αρχικόΔιορθώσεις που ποτέ δεν αφήσει ο τοπικός μηχανή
Σύνθεση το μεικτό σύνολο δεδομένωνΑρχικό συν διορθώσεις, ρητό επιλογήΉσυχη αυτο-ανάμιξη, έτσι ώστε ένα αργότερα παλινδρόμηση δεν μπορεί να ανιχνευθεί σε μια πηγή
Συνεχίστε από ένα checkpointΈνα checkpoint ξεκίνησα από το προηγούμενοΠεριμένοντας ένα optimizer resume· τα βάρη αρχικοποίηση μοντέλο, δεν τα αποκαταστήσουν optimizer κατάσταση

Ορισμός ενός πύλης ένα άτομο μπορεί πραγματικά να κρατήσει

"Ο άνθρωπος αποφασίζει" δεν είναι μια προδιαγραφή. Δύο χειριστές με διαφορετικά κατώφλι παράγουν ασύγκριτα γύρο, και ένα παρέκκλιση κατώφλι παράγει μια τάση δεν μπορείτε να διαβάσετε. Γράψτε τα ενεργοποιήματα κάτω πριν από το πρώτο τρέχει.

  1. Όνομα οι συνθήκες που ανοίγουν την πύλη — προσέγγιση από περισσότερα από ένα σταθερό περιθώριο, gripper κλείσιμο σε τίποτα, ένα αρθρωτό παρέκκλιση προς ένα όριο, μια αποσταλμό περισσότερα από ένα δεύτερο ή δύο — και κρατήστε τη λίστα αμετάβλητη για το γύρο.
  2. Όνομα ό,τι δεν ανοίγει το. Overshoot η πολιτική ανακάμπτει από το δικό του είναι εκπαίδευση σήμα· σε αναλαμβάνοντας εκεί διαγράφει ένα ανάρρωση πολιτική ήδη ξέρει.
  3. Αναλάβετε νωρίς αρκετά για μια καθαρή παράδοση, χέρι πίσω όπως και σύντομα ως η κατάσταση είναι ανακάμπτοντας.
  4. Σύνδεση γιατί αναλαμβάνοντας, ανά επεισόδιο. Τρεις γύρο αργότερα ότι είναι το μόνο ηχογράφηση του αν η ίδια αποτυχία επιστροφές.
  5. Κρατήστε κάμερες, εργασία κείμενο και χειριστής σταθερή κατά τη διάρκεια γύρο. Αλλάζω ένα και οι αριθμοί σταματήσουν να είναι συγκρίσιμο.

Μηχανικά η παράδοση έχει δύο παραλλαγές. Με έναν βραχίονα ηγέτη, ο ηγέτης έχει να φτάσει το follower κατάσταση πριν torque μεταφορές, ή ο βραχίονας άλματα· αυτό συστοίχωση κίνηση είναι ο λιγότερο-δοκιμή μέρος της αλυσίδας σε πραγματικό υλικό. Χωρίς έναν βραχίονα ηγέτη η takeover είναι χειροκίνητα από το πρώτο keypress: ο follower κρατούνται και ο χειριστής nudges το αρθρωτό-αρθρωτό από το πληκτρολόγιο ή σύρει δρομείς, με server-πλευρά αποτυχίες κρατώντας κάθε εισαγωγής μικρό — ένα σύζυγο βαθμού ανά keypress, μια χούφτα ανά δρομέα ενημέρωση, επειδή ένα μεγάλο βήμα σε ένα κρατούνται pose είναι πώς κορδέλα ένα servo. Ο βήμα-ανά-βήμα έκδοση με την κλειδί δεσμεύσεις είναι σε η περιήγηση ενός DAgger γύρο σε ένα SO-100· ιστορικό και οι δύο τηλεελέγχου τρόπος είναι σε η τηλεελέγχου κείμενο και το leader-follower είσοδος.

Σύγκριση της υποστήριξης πολιτικής αρχιτεκτονικές με το εκπαίδευσης και reasoning χαρακτηριστικά
Η πύλη είναι αρχιτεκτονική-αγνωστικός. Ποια πολιτική αναφορών αλλάζει το εκπαίδευσης κόστος α γύρο, όχι πώς τα takeover εργασίες.

Διάβασμα αν η πύλη έκανε τίποτα

Ο μετρική ενός human-gated γύρο είναι ο intervention rate: intervention πλαίσια διαιρούνται κατά πλαίσια της τρέχει. Έχει μία δουλειά — αν αυτό δεν πέσει κατά γύρο, ο γύρος αγόρασα τίποτα, και το επόμενο θα πρέπει να αλλάξει κάτι άλλο αυτό του ποσού δεδομένων.

Είναι μια μεροληπτική μετρική και θα πρέπει να ξέρετε πώς. Μέτρων χειριστή κατώφλι ως πολύ ως πολιτικής ικανότητα, η οποία είναι γιατί ο ενεργοποιήσει λίστα παραμένει σταθερή· ένας χειριστής που χαλαρών κατά μια συνεδρία παράγει α πέφτοντας καμπύλη με τίποτα πίσω κατά κατά. Επίσης αγνοεί δυσκολία — δέκα πλαίσια να σταματήσει μια σύγκρουση και δέκα να σπρώξτε α σύγκρουση εμφανίζεται τα ίδια. Ζεύγη με κανονικός αξιολόγηση σύνολο αριθμός διόρθωση δεδομένα ήταν ποτέ ανασχεδιάστηκε από. Η άρθρο σχετικά με μέτρηση α DAgger loop εργασίες μέσω τη σχεδιασμό αξιολόγηση, συμπεριλαμβανομένου πώς να κρατήσει αξιολόγηση επεισόδιο έξω από το εκπαίδευσης ανακατεύθυνση.

Ο ανθρώπινη πύλη, ειλικρινά
Τι δίνει
  • Εργάζεται σε μέρα ένα, σχετικά με κάθε πολιτικής αρχιτεκτονική, χωρίς κανένα επιπλέον μοντέλο για να διορθώσει
  • Συλλαμβάνει αυτοπεποίθης-και-λάθος αποτυχίες αριθμός διακύμανση κατώφλι ανιχνεύει
  • Παράγει διορθώσεις ηχογράφηση ενώ ο χειριστής είχαν πλήρη έλεγχο, σε μια στιγμή που επέλεξαν
  • Αποδόσεις α ανά-πλαίσιο marker που intervention-βαρυτικός μέθοδος όπως IWR και Sirius χρησιμοποιούν
Τι δεν κάνει
  • Κοστίζει συνεχή επίβλεψη· αυτό δεν κλίμακας για ένα άτομο και πολλά ρομπότ
  • Εξαρτάται χειριστής συνέπεια — α παρέκκλιση κατώφλι καταστρέφει τη intervention rate
  • Παράγει αριθμός κινδύνου μοντέλο σε δικό του· HG-DAgger's μαθημένη κατώφλι και ThriftyDAgger's εκτιμητή είναι επιπλέον μηχανοποιός
  • Μετρά πλαίσια, όχι συνέπειες
  • Δεν μπορώ διάσωση ένα πολιτικής του ανάντη αποτυχία δεν ελέγχου, όπως ένα κοσμάρι κάμερα ή ένα mislabelled εργασία κείμενο

Ανοικτές ερωτήσεις άξιο κρατώντας σε άποψη

Τα benchmarks είναι αδύναμη. Spencer και συνάδελφοι εξετάσει εκείνα χρησιμοποιείται για δοκιμή μαθητική μαθητική προσέγγιση και βρήκα τα "realizable και απλή και με τούτο ανεπαρκής για αποτύπωση τη σκληρότερη δικαιοδοσίας του λάθος σύνθεση δει στο πραγματικό κόσμο απόφαση κάνοντας προβλήματα" — και, ενάντια το περιβάλλον λογοτεχνίας, βρήκα απλά behavior cloning έκανε καλά σε αυτά. Ότι είναι λόγος να είναι σκεπτικός του οποιαδήποτε κατάταξη των DAgger παραλλαγές ριχτεί στις εργασίες, συμπεριλαμβανομένου μερικά αριθμό σε ο πίνακας παραπάνω.

Ρομπότ πύλες σε μεγάλα πολιτικές δεν έχουν λύσει. Το AIM εργασία αντικαθιστά αβεβαιότητα με ένα proxy Q-συνάρτηση μιμούνται ο ανθρώπινη παρέμβαση κανόνα και αναφορές ένα 40% βελτίωση σε take-over κόστος και μάθηση αποδοτικότητα έναντι ThriftyDAgger — σε συνεχή και διακριτό έλεγχο, όχι σε μια vision-language-action μοντέλο οδήγηση χειριστή. Κατά πόσο κάθε αυτές πύλες μεταφορές για μια fine-tuned VLA είναι ανοικτή. Το survey κάνει ένα σχετικό σημείο: το πεδίο terminology και δομή δεν ενοποιημένο κατά τη διάρκεια του λογοτεχνίας, ένα κάνει μέθοδο δύσκολη σε σύγκριση. Σε δικό σας βραχίονα, δικά σας αρχεία μαγνητοσκοπήσεων είναι ο απόδειξη έχετε.

Είναι HG-DAgger πραγματικά DAgger αν ο άνθρωπος μόνο ετικέτες κατά παρεμβάσεις;

Αυτό κρατά ο μέρος ότι σημαίνει — δεδομένα συλλεγμένο κάτω από κατανομή κατάστασης ο μαθητής προκαλεί, συγκεντρώθηκε με τι ήρθε πριν — και κάνει μη ο μέρος ότι δεν σωθεί επαφή με υλικό. Kelly et al. παρουσιάζουν αυτό ως ένα παραλλαγής· ο 2011 no-regret εγγύηση δεν φέρουν κατά αλλαγμένο.

Μπορώ να χρησιμοποιήσω έναν ρομπότ πύλη σε μια fine-tuned VLA πολιτικής σε ένα SO-100;

Όχι ίσια. SafeDAgger's ταξινομητή πρέπει μια queryable αναφορά πολιτικής έχετε δεν. EnsembleDAgger πρέπει ένα ensemble, ότι για ένα πολλαπλάσιο δισεκατομμύριο-παράμετρο μοντέλο σημαίνει μερικές αντιγραφές σε μνήμη συν τα reasoning κόστος. ThriftyDAgger πρέπει ένα κινδύνο εκτιμητή μοντάρω σε επιτυχίες και αποτυχίες ότι δεν υπάρχει πριν δικά σας πρώτο γύρο.

Πόσο χρόνο θα πρέπει ένα μονό takeover είναι;

Αρκετά για το φτάσιμο κατάσταση ο πολιτικής μπορώ συνεχίσω από, και όχι περισσότερα: προεκτεινόμενη takeovers κάνω τη τρέχει σε ένα επιδεικνύει συνεδρία και πλημμυρά το διόρθωση σύνολο με ονοματιστικό συμπεριφορά. LazyDAgger's εύρημα κόβει τα άλλα τρόπο τόσο — πολλά πολύ μικρό διακόπτες είναι τα δικά τους κόστος.

Θα πρέπει να εκπαιδεύσω μόνο σχετικά με τα διορθωμένα τμήματα;

Αριθμός — ότι είναι ο πιο συνηθισμένος τρόπο να σπαταλήσει ένα γύρο. Ένα μοντέλο fine-tuned μόνο σχετικά με ανάρρωση έχει δει σχεδόν τίποτα αλλά ανάρρωσης. Ανάμιξη διορθώσεις σε ο αρχικό σύνολο δεδομένων με πηγές επιλεγμένο ρητό· για ενημέρωση παραπέρα, κοιτάξτε σε intervention-σταθμισμένο προσεγγίσεις όπως IWR ή Sirius, που up-βάρος ανθρώπινα-κίνητη πλαίσια παρά απομόνωση αυτά.

Τι αν ο intervention rate δεν πέσει μετά ένα γύρο;

Αναλάβετε κατά προσώπου τιμή: ο γύρος έκανε δεν βοηθώ. Πριν από την προσθήκη διορθώσεις, ελέγξτε πιο φτηνό εξηγήσεις — έκανε ο χειριστή κατώφλι παρέκκλιση, ήταν τα διορθώσεις κοσμητική, έκανε το σύνθεση σύνολο δεδομένων απο περιέχουν αυτά, ήταν εκπαίδευση αρχικοποιημένη από ο κατά νου checkpoint. Ένα γύρο ότι ήσυχα ξεκίνησα από ο βάση μοντέλο φαίνεται ακριβώς όπως ένα γύρο ότι αποτύχησε να μάθει.

Μη παρέμβαση φέρουν πληροφορίες;

Υπό Expert Intervention Learning, ναι: τμήματα όπου ο επιβλέπων παρακολούθησε και δεν δράση είναι διαβάζω ως αδύναμη απόδειξη ότι κατάσταση και δράση ήταν αποδεκτή, formalised ως περιορισμός σχετικά με ο τιμή συνάρτηση. Περισσότερα πρακτικά pipelines, συμπεριλαμβανομένου αυτό ένα, σημαία μόνο τι ο άνθρωπος κίνητη.

Για ένα μονό βραχίονα σε ένα τραπέζι η επιλογή είναι κατέστη: κρατήστε η πύλη εαυτό, γράψτε προς τα κάτω τι ανοίγει κατά κατά, και ξοδεύουν ο προσπάθεια στο δεδομένα αποχέ πίσω αυτό παρά σχετικά αυτοματοποίηση ο διακόπτης. Ο πλατφόρμα πλευρά είναι περιγραφεί σχετικά ο DAgger loop σελίδα, εκπαίδευσης επιλογές ανά πολιτικής οικογένεια κάτω από εκπαίδευσης και κοστολόγηση. Για ιστορικό, ξεκίνημα με μαθητική μαθητική και μαθητική μαθητική σχετικά με ο SO-100· για ένα πρώτο τρέχει, τρέχει δικά σας πρώτο πολιτικής είναι ο συντομότερο δρόμο.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started