Human-gated DAgger, από άκρη σε άκρη

Αναλάβετε τον έλεγχο όταν η policy κάνει κάτι λάθος, και εκπαιδεύστε ακριβώς πάνω σε αυτή τη διόρθωση.

Μια policy εκπαιδευμένη με behavior cloning γνωρίζει μόνο τις καταστάσεις που επισκέφθηκαν οι δικές σας επιδείξεις. Το DAgger κλείνει αυτό το κενό με δεδομένα από τις καταστάσεις που φτάνει η ίδια η policy. Το AY-Robots τρέχει ολόκληρο τον βρόχο πάνω σε έναν SO-100: οδηγήστε ένα checkpoint, αναλάβετε τον έλεγχο εν μέσω εκτέλεσης, κρατήστε τα διορθωμένα επεισόδια, συνθέστε το μείγμα και συνεχίστε την εκπαίδευση από το checkpoint που μόλις οδηγήσατε.

  • HG-DAgger, με ανθρώπινο έλεγχο
  • SO-100 / SO-101
  • ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
  • Ποσοστό παρέμβασης ανά γύρο

Γιατί μια εκπαιδευμένη policy κάνει κάτι που ποτέ δεν επιδείχθηκε

Το behavior cloning αντιμετωπίζει τον έλεγχο σαν συνηθισμένη επιβλεπόμενη μάθηση: παρατήρηση μέσα, στόχος άρθρωσης έξω, προσαρμοσμένο στα frames που κατέγραψε ένας άνθρωπος. Αυτό ισχύει μόνο όσο το ρομπότ παραμένει στις καταστάσεις που επισκέφθηκε αυτός ο άνθρωπος, και δεν παραμένει. Μια αρπάγη που κλείνει σαράντα χιλιοστά του δευτερολέπτου νωρίτερα μετατοπίζει τον κύβο δύο χιλιοστά από την επιδειχθείσα θέση του. Η επόμενη παρατήρηση είναι μία που δεν περιέχεται στο σύνολο εκπαίδευσης, οπότε η ενέργεια εκεί είναι μια παρέκταση, και η επόμενη κατάσταση βρίσκεται ακόμη πιο μακριά. Η κατανομή εκπαίδευσης και η κατανομή που πράγματι παράγει η εκπαιδευμένη policy είναι δύο διαφορετικά πράγματα, και η δεύτερη αποκλίνει όλο και περισσότερο από την πρώτη καθώς προχωρά το επεισόδιο.

Οι Ross, Gordon και Bagnell περιέγραψαν ακριβώς αυτή την αστοχία της αναγωγής το 2011 και ποσοτικοποίησαν τη ζημιά: ένας ταξινομητής που σφάλλει με πιθανότητα e υπό την κατανομή του ειδικού μπορεί να κάνει, σε έναν ορίζοντα T βημάτων και υπό τη δική του κατανομή, λάθη της τάξης του T στο τετράγωνο επί e, επειδή ένα λάθος παράγει παρατηρήσεις που ο ειδικός δεν παρήγαγε ποτέ και τα σφάλματα συσσωρεύονται. Η λύση τους είναι ο αλγόριθμος για τον οποίο μιλά αυτή η σελίδα: τρέξτε την τρέχουσα policy, συλλέξτε ετικέτες ειδικού για τις καταστάσεις που επισκέπτεται, συγκεντρώστε τις με όσα έχουν συλλεχθεί μέχρι στιγμής, επανεκπαιδεύστε, επαναλάβετε. Περισσότερες επιδείξεις του ίδιου τύπου δεν βοηθούν, γιατί δειγματοληπτούν ξανά την ίδια κατανομή. Ετικέτες πάνω στις καταστάσεις που φτάνει η policy βοηθούν. Η παραλλαγή που υλοποιείται εδώ είναι με ανθρώπινο έλεγχο (HG-DAgger, Kelly et al.): η policy κρατά τον έλεγχο μέχρι ένα άτομο να αποφασίσει ότι κάτι πάει στραβά και να αναλάβει, έτσι ώστε διορθώσεις να παράγονται μόνο εκεί όπου χρειάζονται, και ο βραχίονας να μην οδηγείται ποτέ σε μια κατάσταση που ο χειριστής δεν θα επέτρεπε.

  • Το behavior cloning ισχύει μόνο στην κατανομή καταστάσεων πάνω στην οποία εκπαιδεύτηκε.
  • Η αστοχία είναι αυτοενισχυόμενη: μια μικρή απόκλιση παράγει μια άγνωστη κατάσταση, η οποία παράγει μεγαλύτερη απόκλιση.
  • Το αντίδοτο δεν είναι περισσότερες επιδείξεις, είναι ετικέτες πάνω στις καταστάσεις που φτάνει η ίδια η policy.
  • Με ανθρώπινο έλεγχο σημαίνει ότι ο χειριστής αποφασίζει πότε θα παρέμβει, όχι ένα σκορ αυτονομίας.

Γιατί το σφάλμα συσσωρεύεται

Σύρετε τον ορίζοντα. Με behavior cloning, το αναμενόμενο επιπλέον κόστος αυξάνεται περίπου με το τετράγωνο του αριθμού των βημάτων, επειδή κάθε λάθος παράγει καταστάσεις που οι επιδείξεις δεν κάλυψαν ποτέ· ένας βρόχος συγκέντρωσης κρατά την αύξηση κοντά στη γραμμική (Ross et al., 2011).

200
1.0 %
Behavior cloning
400
DAgger
2.00
200×
Behavior cloning ÷ DAgger
0.000100200300400050100150200Αναμενόμενο επιπλέον κόστος (φράγμα)
Ορίζοντας εργασίας (βήματα)

Ενδεικτικές καμπύλες από τα φράγματα στο Ross et al. (2011), όχι μετρήσεις από το ρομπότ σας. Αυτό που μετράει είναι το σχήμα, όχι οι αριθμοί.

Ένας γύρος DAgger, έξι βήματα

Έτσι τρέχει ο βρόχος στην πλατφόρμα στην πράξη, όχι σχηματικά. Κάθε βήμα παρακάτω αντιστοιχεί σε ένα χειριστήριο του πίνακα ελέγχου.

Ο βρόχος βήμα προς βήμα

Τα ίδια έξι βήματα, ένα τη φορά, με ό,τι συμβαίνει στον βραχίονα και στο σύνολο δεδομένων σε καθένα από αυτά.

01

Εκτέλεση της policy και καταγραφή

Ξεκινήστε μια εκτέλεση συμπερασμού πάνω σε ένα checkpoint που εκπαιδεύσατε. Η εκτέλεση καταγράφεται καθώς συμβαίνει, μαζί με το κείμενο της εργασίας της ίδιας της εκτέλεσης, ώστε τα frames να είναι αξιοποιήσιμα ως δεδομένα εκπαίδευσης αργότερα και όχι απλώς ένα βίντεο που μπορείτε μόνο να παρακολουθήσετε.

1 από 6

Τι αναλαμβάνει η πλατφόρμα για εσάς

Κάθε στοιχείο εδώ είναι ένα βήμα του βρόχου που διαφορετικά θα έπρεπε να χτίσετε και να συντηρείτε μόνοι σας.

Ανάληψη ελέγχου χωρίς βραχίονα leader

Επιλέξτε είσοδο πληκτρολογίου ή ρυθμιστικών στην αρχή της εκτέλεσης και μπορείτε να διορθώσετε με ένα laptop και μόνο. Οι μικρομετακινήσεις από το πληκτρολόγιο περιορίζονται από τον server σε δύο μοίρες ανά άρθρωση και τέσσερις στην αρπάγη· οι στόχοι των ρυθμιστικών είναι απόλυτοι και ο server κινείται προς αυτούς κατά το πολύ έξι μοίρες ανά κλήση. Τα όρια επιβάλλονται από τον server, όχι από το UI, οπότε ένα κολλημένο πλήκτρο δεν μπορεί να ρίξει τον βραχίονα.

Τεκμηρίωση τηλεχειρισμού

Παρεμβάσεις σημειωμένες ανά frame

Κάθε frame που καταγράφεται όσο κρατάτε τον έλεγχο του βραχίονα φέρει μια σημαία παρέμβασης, και η στήλη action περιέχει την πλήρη εντεταλμένη θέση. Δεν συντηρείτε μια στήλη σημαιών με το χέρι ούτε την ευθυγραμμίζετε αργότερα με τους δείκτες των frames.

Μορφή συνόλου δεδομένων LeRobot

Διαλογή: διόρθωση, αξιολόγηση ή απόρριψη

Κάθε εκτέλεση παίρνει μία απόφαση στην κάρτα αποθήκευσης. Οι εκτελέσεις διόρθωσης τροφοδοτούν τον επόμενο γύρο εκπαίδευσης, οι εκτελέσεις αξιολόγησης μένουν έξω από την εκπαίδευση ώστε να παραμένουν μια καθαρή μέτρηση, και οι κακές εκτελέσεις εξαφανίζονται αντί να δηλητηριάζουν σιωπηλά το μείγμα.

Sessions και επεισόδια

Συνθέστε το μείγμα ρητά

Το σύνολο εκπαίδευσης για τον γύρο n συναρμολογείται από εσάς: αρχικό σύνολο δεδομένων συν διορθώσεις, με επεισόδια επιλεγμένα ανά πηγή. Καμία αυτόματη ανάμειξη, κανένα κρυφό δεδομένο προσομοίωσης, και το συντεθειμένο αποτέλεσμα συμπεριφέρεται όπως κάθε άλλο σύνολο δεδομένων.

Σύνολα δεδομένων

Συνέχιση εκπαίδευσης από checkpoint

Στρέψτε μια εκτέλεση εκπαίδευσης στο checkpoint που μόλις οδηγήσατε αντί στο βασικό μοντέλο, ώστε κάθε γύρος να ξεκινά εκεί όπου τελείωσε ο προηγούμενος. Αρχικοποιεί μόνο τα βάρη· η κατάσταση του optimizer δεν αποκαθίσταται, οπότε αξίζει να αντιμετωπίζετε τον πρώτο γύρο ως δοκιμή εφικτότητας.

Εκπαίδευση

GPU με ενοικίαση ανά γύρο

ACT και SmolVLA σε μια 4090, Pi0 και GR00T N1.5 ή N1.7 σε μια A100 με 80 GB. Ξεκινάτε έναν γύρο, το pod ανεβαίνει, τα checkpoints καταλήγουν στο bucket σας, και πληρώνετε για τις ώρες που χρειάστηκε ο γύρος.

Τιμές GPU

Σχεδιάστε τους γύρους σας

Το ποσοστό παρέμβασης είναι η μετρική προόδου του βρόχου: διορθωμένα frames διά τα frames της εκτέλεσης. Ορίστε από πού ξεκινάτε και πόσο κερδίζει κάθε γύρος, και δείτε πόσοι γύροι χρειάζονται για να φτάσετε εκεί που θέλετε.

30 %
25 %
3 000
ΓύροςΠοσοστό παρέμβασηςΔιορθωμένα frames
1
30.0%
900
2
22.5%
675
3
16.9%
506
4
12.7%
380
5
9.5%
285
6
7.1%
214
Σ2 960

Ένα μοντέλο, όχι μια πρόβλεψη. Οι πραγματικοί γύροι είναι ακανόνιστοι, και ένας γύρος που δεν μετακινεί το ποσοστό δεν σας έχει προσφέρει τίποτα· αυτό ακριβώς είναι το σήμα που αξίζει να παρακολουθείτε.

Να χτίσετε τον βρόχο μόνοι σας ή να τον τρέξετε εδώ

Τίποτα από αυτά δεν είναι αδύνατο να γίνει με το χέρι. Είναι θέμα πόσα βράδια πάνε σε υποδομή αντί σε γύρους, και υπάρχει μία γραμμή όπου το να το κάνετε μόνοι σας είναι ξεκάθαρα η καλύτερη απάντηση.

Βήμα του βρόχουΡύθμιση με το χέριΣτο AY-Robots
Ανάληψη ελέγχου εν μέσω εκτέλεσηςΈνας βραχίονας leader, ή δικός σας κώδικας πάνω στον δίαυλο servo. Την ανάληψη μέσω πληκτρολογίου και ρυθμιστικών, μαζί με τα όρια ασφαλείας, τη γράφετε και τη διορθώνετε σε πραγματικό υλικό.Βραχίονας leader, πληκτρολόγιο ή ρυθμιστικά, επιλεγμένα στην αρχή της εκτέλεσης. Τα όρια γωνίας βρίσκονται στον server.
Σήμανση παρεμβάσεωνΠροσθέτετε τη στήλη σημαίας, την κρατάτε ευθυγραμμισμένη με τον δείκτη frame, και την ελέγχετε ξανά κάθε φορά που αλλάζει η μορφή καταγραφής.Κάθε frame που καταγράφεται κατά την ανάληψη σημαίνεται αυτόματα, με την εντεταλμένη θέση στη στήλη action.
Ταξινόμηση των εκτελέσεωνΣυμβάσεις καταλόγων και σενάρια shell. Τα ακίνητα καρέ γύρω από μια παράδοση ελέγχου πρέπει να τα βρείτε και να τα αποκλείσετε μόνοι σας.Μία απόφαση ανά εκτέλεση στην κάρτα αποθήκευσης. Τα frames παράδοσης ελέγχου μένουν στον κατάλογο raw.
Δημιουργία του μεικτού συνόλου δεδομένωνΣενάρια συγχώνευσης ανά έκδοση μορφής. Το κουραστικό κομμάτι είναι να κρατήσετε συνεπείς τους δείκτες επεισοδίων, τα μεταδεδομένα και τις αναφορές βίντεο.Σύνθεση από το αρχικό συν τις διορθώσεις με επιλογή επεισοδίων ανά πηγή· το αποτέλεσμα είναι ένα κανονικό σύνολο δεδομένων.
Έναρξη του επόμενου γύρου από την τελευταία policyΣυνδέετε το checkpoint στον trainer μόνοι σας, και μπορείτε επίσης να αποκαταστήσετε την κατάσταση του optimizer αν θέλετε πραγματική επανεκκίνηση.Ένα πεδίο για το βασικό checkpoint. Μόνο βάρη: αρχικοποιεί από το checkpoint, δεν είναι επανεκκίνηση του optimizer.
Έλεγχος πάνω στον βρόχο εκπαίδευσηςΠλήρης. Δικό σας loss, δικό σας πρόγραμμα, δικές σας αφαιρέσεις (ablations), δική σας οργανολογία, καμία πλατφόρμα στη μέση. Αν το ερευνητικό ερώτημα είναι ο ίδιος ο βρόχος εκπαίδευσης, κάντε το με το χέρι.Ένα σταθερό μονοπάτι με μια καθορισμένη λίστα policies και τις υπερπαραμέτρους που εκθέτει η φόρμα, όχι αυθαίρετος κώδικας.

Οι εργασίες πάνω στις οποίες βασίζεται αυτό

Διαβάστε αυτές πριν αντιμιλήσετε στον βρόχο. Κάθε σύνδεσμος οδηγεί στη σελίδα της περίληψης, όχι πίσω από paywall.

  1. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning

    Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)

    Η αρχική εργασία του DAgger: διατυπώνει το πρόβλημα της συσσώρευσης σφαλμάτων, δίνει το φράγμα T στο τετράγωνο για την καθαρά επιβλεπόμενη προσέγγιση, και προτείνει τη συγκέντρωση δεδομένων από τις καταστάσεις που επισκέπτεται ο ίδιος ο εκπαιδευόμενος.

  2. HG-DAgger: Interactive Imitation Learning with Human Experts

    Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019

    Η παραλλαγή με ανθρώπινο έλεγχο: ο ειδικός αποφασίζει πότε θα αναλάβει τον έλεγχο αντί να ερωτάται για καταστάσεις που επέλεξε η policy· αυτός είναι ο τρόπος λειτουργίας που υλοποιεί αυτή η πλατφόρμα.

  3. EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning

    Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019

    Ο άλλος τρόπος ελέγχου των παρεμβάσεων: η διαφωνία σε ένα ensemble ως σήμα εμπιστοσύνης για το πότε ο εκπαιδευόμενος μπορεί να ενεργήσει μόνος του. Χρήσιμη αντιπαραβολή με το να αποφασίζει ένα άτομο.

  4. ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning

    Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021

    Αντιμετωπίζει την ανθρώπινη προσοχή ως τον σπάνιο πόρο και ζητά βοήθεια μόνο σε νέες ή επικίνδυνες καταστάσεις, κάτι που είναι το σωστό πλαίσιο όταν ένα άτομο επιβλέπει τον βραχίονα ένα ολόκληρο απόγευμα.

  5. DART: Noise Injection for Robust Imitation Learning

    Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017

    Η ειλικρινής εναλλακτική: αντί να διορθώνει την policy κατά την εκτέλεσή της, διαταράσσει τις επιδείξεις ώστε ο ειδικός να επιδείξει ανάκαμψη. Άξιο γνώσης προτού δεσμευτείτε σε παρεμβάσεις.

  6. Interactive Imitation Learning in Robotics: A Survey

    Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600

    Ο χάρτης του πεδίου: ποιες μορφές ανθρώπινης ανάδρασης υπάρχουν, ποιες διεπαφές τις μεταφέρουν, και πού βρίσκεται ανάμεσά τους η παρέμβαση τύπου DAgger.

  7. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

    Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705

    Η εργασία του ACT. Το action chunking είναι ο λόγος για τον οποίο ένας φθηνός βραχίονας μπορεί καν να οδηγηθεί από μια policy μίμησης, και το ACT είναι η ταχύτερη policy για να επαναλάβετε έναν γύρο DAgger.

  8. π0: A Vision-Language-Action Flow Model for General Robot Control

    Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164

    Ένα VLA βασισμένο σε flow matching πάνω σε ένα προεκπαιδευμένο μοντέλο όρασης-γλώσσας, και ένα από τα checkpoints που μπορείτε να κάνετε fine-tune εδώ· η εργασία δηλώνει ρητά ότι οι νέες δεξιότητες προέρχονται από το fine-tuning, όχι μόνο από το βασικό μοντέλο.

Ερωτήσεις που κάνει πραγματικά ο κόσμος

Χρειάζομαι βραχίονα leader για το DAgger;

Όχι. Επιλέξτε είσοδο πληκτρολογίου ή ρυθμιστικών όταν ξεκινάτε την εκτέλεση, και η ανάληψη είναι χειροκίνητη από το πρώτο frame, οδηγούμενη από τον browser. Ένας βραχίονας leader είναι πιο ευχάριστος για λεπτές κινήσεις, και είναι ο μόνος τρόπος στον οποίο ο βραχίονας ευθυγραμμίζεται μόνος του πριν την παράδοση ελέγχου, αλλά ο βρόχος τρέχει και χωρίς αυτόν.

Πόσους γύρους DAgger χρειάζομαι;

Δεν υπάρχει ένας ειλικρινής σταθερός αριθμός. Παρακολουθήστε το ποσοστό παρέμβασης: αν δεν πέφτει από τον έναν γύρο στον επόμενο, αυτός ο γύρος δεν σας πρόσφερε τίποτα, και το πρόβλημα βρίσκεται συνήθως στη ρύθμιση της εργασίας, στις κάμερες ή στο αρχικό σύνολο δεδομένων και όχι στον αριθμό των γύρων.

Είναι αυτό πραγματικό DAgger ή κάτι πιο χαλαρό;

Είναι HG-DAgger, η παραλλαγή με ανθρώπινο έλεγχο. Το κλασικό DAgger ρωτά τον ειδικό για καταστάσεις που επέλεξε η policy, μεταξύ αυτών καταστάσεις όπου κανένας λογικός χειριστής δεν θα άφηνε έναν πραγματικό βραχίονα να φτάσει. Εδώ ένα άτομο αποφασίζει πότε θα παρέμβει, και μόνο αυτά τα τμήματα γίνονται ετικέτες.

Εκπαιδεύω μόνο πάνω στις διορθώσεις;

Όχι, και δεν θα έπρεπε. Η εκπαίδευση μόνο πάνω σε διορθώσεις σας δίνει μια policy που ξέρει μόνο πώς να ανακάμπτει. Το συντεθειμένο σύνολο δεδομένων είναι τα αρχικά δεδομένα συν τις διορθώσεις, με τα επεισόδια από κάθε πηγή επιλεγμένα ρητά.

Η συνέχιση από ένα checkpoint επανεκκινεί την εκτέλεση εκπαίδευσης;

Αρχικοποιεί τα βάρη από αυτό το checkpoint. Η κατάσταση του optimizer δεν αποκαθίσταται, οπότε δεν πρόκειται για επανεκκίνηση με τη στενή έννοια. Στην πράξη τα βάρη είναι αυτά που μεταφέρουν τη μαθημένη συμπεριφορά κατά τον γύρο, αλλά αξίζει να ξέρετε ποιο από τα δύο παίρνετε.

Πώς υπολογίζεται το ποσοστό παρέμβασης;

Frames σημειωμένα ως παρέμβαση διά τον συνολικό αριθμό frames της εκτέλεσης. Εμφανίζεται στην κατάσταση ανάληψης, και είναι ο ένας αριθμός που αξίζει να σημειώνετε ανά γύρο, μαζί με το checkpoint που οδηγήσατε και το μείγμα που εκπαιδεύσατε.

Με ποιες policies μπορώ να τρέξω αυτόν τον βρόχο;

ACT, SmolVLA, Pi0, και GR00T N1.5 ή N1.7. Ο ίδιος ο βρόχος είναι ανεξάρτητος από την policy, αφού παράγει μόνο σύνολα δεδομένων και checkpoints· η πρακτική διαφορά είναι πόσο διαρκεί ένας γύρος και ποια GPU χρειάζεται.

Μπορώ να το κάνω αυτό χωρίς να έχω δικό μου ρομπότ;

Μπορείτε να καταγράψετε και να εκπαιδεύσετε χωρίς ένα, αγοράζοντας σύνολα δεδομένων στο marketplace ή αναθέτοντας σε χειριστές, και μπορείτε να οδηγήσετε έναν πραγματικό SO-100 στον browser στη σελίδα live. Ένας γύρος DAgger είναι διαφορετικός: χρειάζεται έναν βραχίονα που μπορείτε να αναλάβετε εν μέσω εκτέλεσης, οπότε για τον ίδιο τον βρόχο θέλετε υλικό στο δικό σας γραφείο.

Drive a real arm

A real SO-100, live in the browser. No signup, no hardware needed.

Τρέξτε τον πρώτο σας γύρο αυτή την εβδομάδα

Εγκαταστήστε τον client, οδηγήστε ένα checkpoint που ήδη έχετε, και αναλάβετε τον έλεγχο την πρώτη φορά που ο βραχίονας ξεπερνά τον κύβο. Αυτή η μία εκτέλεση είναι ένας γύρος DAgger σε μικρογραφία: όλα όσα ακολουθούν είναι η σύνθεση του μείγματος και η πληρωμή για τις ώρες GPU.