
Περιγραφή βήμα προς βήμα ενός ανθρώπινης έγκρισης DAgger κύκλου σε SO-100 βραχίονα: εκτέλεση της πολιτικής και καταγραφή της, ανάληψη όταν κάτι πάει στραφί, αρχειοθέτηση της εκτέλεσης ως διόρθωση, σύνθεση ενός μεικτού συνόλου δεδομένων και συνέχιση της εκπαίδευσης από σημείο ελέγχου. Περιλαμβάνει τη διαδρομή ανάληψης πληκτρολογίου και δρομέα για άτομα χωρίς βραχίονα ηγέτη, και τα τέσσερα λάθη που κάνουν ένα κύκλο άχρηστο.
Η πολιτική σας τρέχει. Φθάνει για τον κύβο, κλείνει το gripper ένα εκατοστό πολύ νωρίς, και συνεχίζει σαν να τον είχε πάρει. Τίποτα δεν σφάλλει και κανένα ποσό κοίτας στη απώλεια εκπαίδευσης δεν το εξηγεί. Η λύση δεν είναι άλλα 20 000 βήματα gradient στα ίδια παραδείγματα. Είναι να βάλετε ξανά το χέρι σας στο βραχίονα ακριβώς όπου πάει λάθος, να καταγράψετε τι κάνατε αντ' αυτού, και να εκπαιδεύσετε το επόμενο checkpoint στα παλιά δεδομένα συν αυτή τη διόρθωση. Αυτό είναι ένας DAgger κύκλος, και έτσι τρέχει σε ένα SO-100 με μια vision-language-action πολιτική.
Η θεωρία είναι αλλού: γιατί η συναθροιστική δεδομένων λειτουργεί καθόλου και τι αλλάζει η ανθρώπινη έγκριση γι' αυτό. Αυτό είναι το manual λειτουργίας, και υποθέτει ένα εκπαιδευμένο checkpoint, ένα λειτουργικό σύνολο κάμερας, και ένα βραχίονα που κινείται. Τα έξι βήματα παρακάτω είναι ο κύκλος όπως εφαρμόζεται σε τη σελίδα DAgger αυτής της πλατφόρμας, αλλά η ακολουθία είναι η ίδια από τα δικά σας scripts.
Ένας κύκλος εν συντομία
- •Εκτέλεση της εκπαιδευμένης πολιτικής και καταγραφή της, με το κείμενο εργασίας της εκτέλεσης αντί μιας γενικής ετικέτας τηλεχειρισμού.
- •Ανάληψη τη στιγμή που η συμπεριφορά πάει στραφί: μια mirror handover με ένα βραχίονα ηγέτη, άμεση και χειροκίνητη πάνω πληκτρολόγιο ή δρομείς χωρίς.
- •Triage κάθε εκτέλεση: αρχειοθέτηση ως διόρθωση, διατήρηση ως episode αξιολόγησης, ή απόρριψη.
- •Σύνθεση του μίγματος με το χέρι - αρχικές demonstrações συν διορθώσεις, episodes επιλεγμένα ανά πηγή. Ποτέ δεν εκπαιδεύετε μόνο σε διορθώσεις.
- •Συνέχιση της εκπαίδευσης από το τελευταίο checkpoint, και σημείωση ποιο checkpoint παρήγαγε ποιο μίγμα.
- •Ο αριθμός που λέει αν ο κύκλος αξίζει τίποτα είναι η intervention rate, όχι η απώλεια εκπαίδευσης.
Γιατί ο δεύτερος κύκλος δεν είναι απλά περισσότερα δεδομένα
Behavior cloning εκπαιδεύει στις καταστάσεις που επισκέφθηκε ένας άνθρωπος. Κατά τη δοκιμή η πολιτική επισκέπτεται τις καταστάσεις που προκαλεί, και τα μικρά σφάλματα δράσης συντίθενται σε καταστάσεις που καμία demonstration δεν κάλυψε. Ross, Gordon και Bagnell τυποποίησαν αυτή την αποτυχία για AISTATS 2011 και την απάντησαν με ένα επαναληπτικό αλγόριθμο που εκπαιδεύει μια στάσιμη ντερμινιστική πολιτική και, σύμφωνα με τη μείωσή τους, πρέπει να λειτουργεί καλά κάτω από την κατανομή κατάστασης που επάγει: εκτελέστε την τρέχουσα πολιτική, έχετε το ειδικό λάβει τις καταστάσεις που πραγματικά έφτασε, προσθέστε αυτές στο σύνολο δεδομένων, επανεκπαιδεύστε, επαναλάβετε. Kelly et al. κατέστησαν ρεαλιστικό την ερώτηση με HG-DAgger, όπου ο άνθρωπος αποφασίζει πότε να αναλάβει τον έλεγχο αντί να ετικετάσει καταστάσεις χωρίς να κρατά τα χέρια· αναφέρουν βελτιωμένη απόδοση σε σχέση με τόσο DAgger όσο και behavior cloning σε μια προσομοιωμένη και πραγματική αυτόνομη εργασία οδήγησης. Η ανθρώπινη έγκριση είναι αυτό που κάνει τον κύκλο ανεκτό σε ένα γραφείο βραχίονα - κινείτε τα χέρια σας μόνο όταν κάτι πάει στραφί.
Δύο συνέπειες έχουν μεγαλύτερη σημασία στην πράξη από τη θεωρία. Οι διορθώσεις δεν είναι συνηθισμένες demonstrações: συγκεντρώνονται στις περιοχές bottleneck που περιγράφει ο Mandlekar et al., όπου μια μικρή απόκλιση ρίχνει την πολιτική σε καταστάσεις που ποτέ δεν κάλυψαν οι demonstrações. Και ένα σύνολο δεδομένων που αποτελείται μόνο από αυτά τα δύσκολα μέρη είναι ένα κακώς διαμορφωμένο σύνολο δεδομένων - Belkhale, Cui και Sadigh υποστηρίζουν από την πλευρά δεδομένων ότι η ποικιλομορφία κατάστασης δεν είναι πάντα ωφέλιμη, και ότι η απόκλιση δράσης και η ποικιλομορφία μετάβασης μαζί αποφασίζουν την ποιότητα συνόλου δεδομένων. Το μεικτό σύνολο δεδομένων δεν είναι συμβιβασμός, είναι το σημείο.
Παγώστε αυτά πριν από τον πρώτο κύκλο
Ένας DAgger κύκλος συγκρίνει μια πολιτική με τον εαυτό της στο χρόνο. Οτιδήποτε αλλάζετε μεταξύ κύκλων που δεν είναι το σύνολο δεδομένων κάνει αυτή τη σύγκριση άνευ σημασίας.
- Θέσεις κάμερας και στηρίγματα, περιλαμβανομένης της κάμερας καρπού. Χαλαρώστε ένα clamp και αλλάξατε την κατανομή παρατήρησης, όχι την πολιτική.
- Έκθεση και ισορροπία λευκού, αν η στοίβα σας δεδομένων σας επιτρέπει να τις ακινητοποιήσετε. Αυτόματη έκθεση που υπομνέει μεταξύ κύκλων είναι αργή, άορατη domain shift.
- Βαθμονόμηση βραχίονα και θέσεις servo zero. Αν πρέπει να βαθμονομήσετε ξανά, αντιμετωπίστε όλα τα καταγεγραμμένα πριν από αυτό ως ξεχωριστό σύνολο δεδομένων.
- Το κείμενο εργασίας. Κάθε VLA εδώ υπό όρους αυτό· αναφόρηση του εν μέσω loop είναι μια διαφορετική εργασία.
- Φωτισμό, επιφάνεια τραπεζιού, σύνολο αντικειμένων. Ένα νέο αντικείμενο είναι ένα νέο πείραμα, όχι ο επόμενος κύκλος.
- Η ταχύτητα καρέ εγγραφής. Σύγκριση intervention rates διαπασών δύο δειγματοληψίας παράγει διαφορές που προέρχονται από το raster.
Hsu et al. σύγκριναν μια χέρι-κεντρική προοπτική έναντι της συνηθισμένης τρίτης προσώπου προοπτικής και ανακάλυψαν ότι η προοπτική ματιού-ενσωματωμένη συνεπώς βελτίωσε την αποτελεσματικότητα εκπαίδευσης και εξ ορισμού γενίκευση, παρά το να δούμε λιγότερο από τη σκηνή. Σε έναν πέντε-κόμβο βραχίονα, ο χρόνος grip είναι συνήθως αυτό που επιδιορθώνουν οι διορθώσεις σας, και ο χρόνος grip είναι αυτό που μεταφέρει το wrist view.
Ο κύκλος, από άκρο σε άκρο
- 1Εκτέλεση συμπερασμού και καταγραφή του
Ξεκινήστε την εκτέλεση εναντίον του checkpoint που θέλετε να βελτιώσετε, στη συνέχεια ξεκινήστε την εγγραφή στη ρίζα συμπερασμού. Που καταγράφηκε με αυτόν τον τρόπο κληρονομεί το δικό του κείμενο εργασίας της εκτέλεσης, το οποίο είναι αυτό που εκπαιδεύθηκε η πολιτική σας, αντί της προεπιλεγμένης ετικέτας τηλεχειρισμού. Χωρίς την εγγραφή μπορείτε να παρακολουθήσετε την αποτυχία αλλά όχι να εκπαιδεύσετε γι' αυτή.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Ανάληψη όταν πάει στραφί
Πατήστε Ανάληψη και επιλέξτε τη λειτουργία εισόδου: βραχίονας ηγέτη, πληκτρολόγιο ή δρομείς. Ο δρομέας παύεται, διορθώνετε, δίνετε πίσω. Frames που καταγράφηκαν ενώ οδηγούσατε σημαίνονται ως interventions αυτόματα.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Triage τα episodes
Αποφασίστε ανά episode: αρχειοθέτηση ως διόρθωση, διατήρηση ως αξιολόγηση, ή απόρριψη. Μια εκτέλεση που ολοκλήρωσε την πολιτική χωρίς βοήθεια είναι αξιολόγηση δεδομένων.
- 4Συγχρονισμός του συνόλου διόρθωσης δεδομένων
Οι διορθώσεις συλλέγονται σε ένα τοπικό σύνολο δεδομένων ανά πολιτική και πηγαίνουν στο cloud storage μέσω του αυτόματου συγχρονισμού. Τίποτα δεν αναμιγνύεται που δεν βάλατε εκεί.
- 5Σύνθεση του μεικτού συνόλου δεδομένων
Συνδυάστε το αρχικό σύνολο δεδομένων με το σύνολο διόρθωσης, επιλέγοντας episodes ρητά ανά πηγή. Το αποτέλεσμα είναι ένα συνηθισμένο σύνολο δεδομένων από εκείνο το σημείο και μετά.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Συνέχιση της εκπαίδευσης από το checkpoint
Εκπαιδεύστε το μίγμα από το προηγούμενο checkpoint αντί του base model. Σημείωση ποιο checkpoint και ποιο μίγμα· χωρίς αυτό το ζεύγος ο κύκλος δεν είναι αναπαραγώγιμος.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Βήμα 2 λεπτομερώς: οι δύο τρόποι ανάληψης
Με ένα βραχίονα ηγέτη
Σε leader-follower λειτουργία η ανάληψη είναι μια handover μεταξύ δύο βραχιόνων που δεν βρίσκονται στην ίδια posture. Πατώντας Ανάληψη σταματά τον δρομέα και οδηγεί το leader στο current pose του follower, έτσι τίποτα δεν πηδάει όταν μεταφέρεται η ροπή. Αν η μονάδα ευθυγράμμισης χρονοδιακόπτης, ευθυγραμμίστε το leader με το χέρι και απελευθερώστε μόνο όταν τα δύο βρίσκονται εντός πέντε μοιρών. Από τότε τηλεχειρίζεστε κανονικά και η στήλη δράσης καταγράφει αυτό που διέταξαν.
Να είστε ειλικρινείς για αυτή τη διαδρομή: η μονάδα ευθυγράμμισης και η handover ροπής είναι το λιγότερο δοκιμασμένο μέρος του κύκλου στο πραγματικό hardware. Δοκιμάστε τη handover σε αργή, αβλαβή posture πριν να στηρίξετε σε μια εκτέλεση που σας ενδιαφέρει. Ένας βραχίονας ηγέτη παράγει τις ομαλότερες διορθώσεις των τριών λειτουργιών, και επίσης έχει περισσότερα που μπορούν να πάνε λάθος μηχανικά.
Χωρίς ένα βραχίονα ηγέτη: πληκτρολόγιο και δρομείς
Οι περισσότεροι άνθρωποι που διαβάζουν αυτό έχουν ένα βραχίονα. Αυτό είναι αρκετό. Επιλέξτε πληκτρολόγιο ή slider εισόδου τη στιγμή που πατάτε Ανάληψη, και η ανάληψη είναι άμεση και χειροκίνητη - δεν υπάρχει δεύτερος βραχίονας να ευθυγραμμίσετε, έτσι δεν υπάρχει step ευθυγράμμισης. Ο follower κρατά τη posture του και περιμένει εισόδου.
| Λειτουργία εισόδου | Πώς κινείται ο βραχίονας | Περιορισμό ανά κλήση που επιβάλλει ο server | Κλειδωμένο όταν |
|---|---|---|---|
| Βραχίονας ηγέτη | Το mirror οδηγεί το follower από τις γωνίες κόμβου του leader | Δεν υπάρχουν nudge ή set κλήσεις σε αυτή τη λειτουργία· το mirror γράφει στόχους follower συνεχώς | Ποτέ κλειδωμένο, και το προεπιλεγμένο αν δεν δίνεται λειτουργία εισόδου - αλλά χρειάζεται ένα δεύτερο βραχίονα· χωρίς αναγνωριστικό ηγέτη η ανάληψη αρνείται |
| Πληκτρολόγιο | Σχετική nudge ανά πάτημα κλειδιού, που αποστέλλεται στο takeover nudge endpoint | Σκληρό clamp στις 2 μοίρες ανά κόμβο, 4 μοίρες για το gripper | Απορρίφθη με 409 εάν η ανάληψη ξεκίνησε σε λειτουργία ηγέτη |
| Δρομείς | Απόλυτη target pose, που αποστέλλεται στο takeover set endpoint | Το πολύ 6 μοίρες ταξιδιού προς τον στόχο ανά κλήση· η διεπαφή διατηρεί την αποστολή περίπου δέκα φορές ανά δευτερόλεπτο | Απορρίφθη με 409 εάν η ανάληψη ξεκίνησε σε λειτουργία ηγέτη |
Οι clamps επιβάλλονται στη διακομιστή πλευρά, όχι στη διεπαφή, επειδή ένα δακτυλογραφημένο delta σε ένα bus-servo arm είναι σύγκρουση. Οι διορθώσεις πληκτρολογίου βγαίνουν stepwise και λίγο χοντρή· οι διορθώσεις δρομέα είναι ομαλότερες, επειδή ο server περπατά προς τον στόχο ενώ η διεπαφή συνεχίζει το streaming. Είτε και οι δύο η στήλη δράσης λαμβάνει το full commanded pose vector και η intervention marking είναι αναπόδογος με τη διαδρομή ηγέτη, έτσι οι διορθώσεις πληκτρολογίου προσγειώνονται στο ίδιο σύνολο δεδομένων χωρίς διαφορά μορφής.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Πότε να πατήσετε το κουμπί
Νωρίς παρά αργά. Μια διόρθωση που αρχίζει αφού το gripper κλείσει σε τίποτα διδάσκει ανάρρωση από αποτυχία που η πολιτική δεν έπρεπε να εισελθεί, και τα δεδομένα ανάρρωσης αξίζει πολύ λιγότερο από δεδομένα αποφυγής. Interruption στο πρώτο μόμεντο είστε σίγουροι η τροχιά είναι λάθος, διορθώστε μέσα από το δύσκολο μέρος, δώστε πίσω μόλις η κατάσταση είναι μία που η πολιτική χειρίστηκε πριν. ThriftyDAgger αυτοματοποιεί αυτή την απόφαση από gating interventions σε novelty και εκτιμώμενο κίνδυνο κάτω από σταθερό ανθρώπινο budget, αλλά σε ένα μόνο βραχίονα με ένα ανθρώπινο ήδη παρακολούθηση, η ανθρώπινη gate είναι φθηνότερη και καλύτερα βαθμονόμησης από οτιδήποτε θα fine-tune.
Εφικτό με τη στοίβα ανοικτού κώδικα και μερικά scripts. Τι κοστίζει είναι βιβλιογραφία, και η βιβλιογραφία είναι όπου DAgger κύκλοι πεθαίνουν.
- Γράψτε frames από το δικό σας script συμπερασμού σε LeRobot dataset, με το κείμενο εργασίας που εκπαιδεύθηκε η πολιτική σας.
- Σταματήστε τον κύκλο πολιτικής, αλλάξτε τη πηγή εντολής, και σημαίνετε κάθε frame που οδηγείτε ως intervention. Χωρίς τη σημαία, οι διορθώσεις φαίνονται όπως συνηθισμένες demonstrações.
- Αποφασίστε σκόπιμα τι συμβαίνει στα πλαίσια μετάβασης μεταξύ της απελευθέρωσης πολιτικής και την πρώτη εισόδου σας.
- Διατηρήστε διορθώσεις στο δικό τους σύνολο δεδομένων ανά πολιτική, και κάντε track δείκτες episode με το χέρι έτσι το μίγμα μπορεί να ανακατασκευαστεί.
- Σημείωση τo fine-tuning entry point στο προηγούμενο checkpoint, και ελέγξτε στη καταγραφή ότι φόρτωσε αυτά τα βάρη.
Τα ίδια έξι βήματα υπάρχουν ως κουμπιά. Τι είναι αυτοματοποιημένο είναι αυτό που είναι εύκολο να γίνει λάθος με το χέρι: η σημαία ανά πλαίσιο intervention, η διαίρεση μεταξύ διορθώσεων και αξιολογήσεων, και το record ποιο checkpoint παρήγαγε ποιο μίγμα. Τίποτα δεν εισέρχεται ένα σύνθετο σύνολο δεδομένων που δεν επιλέξατε.
Δεν αποφασίζει για σας. Ποια εκτέλεση μετράει ως διόρθωση, ποια episodes πηγαίνουν στο μίγμα, και πότε σταματά να πέφτει η intervention rate παραμένουν κρίσης κλήσεις. Τα πεδία είναι τεκμηριωμένα κάτω από εκπαίδευση, η είσοδος λειτουργιών κάτω από τηλεχειρισμός.
Βήμα 3 λεπτομερώς: η triage αποφασίζει την ποιότητα
Μετά την εκτέλεση έχετε μια εγγραφή με κάποια πλαίσια σημάνθηκε ως interventions. Τρεις προορισμοί υπάρχουν, και το λάθος ένα σιωπηλά δηλητηριάζει τον επόμενο κύκλο.
- Αρχειοθέτηση ως διόρθωση όταν η intervention ήταν πραγματική επιδιόρθωση: η πολιτική κατευθυνόταν κάπου λάθος και η εισόδου σας έδειξε το σωστό πράγμα από μια κατάσταση που η ίδια πολιτική παρήγαγε.
- Διατηρήστε ως αξιολόγηση για καθαρές αυτόνομες εκτελέσεις και για εκτελέσεις που αναλάβατε από προσοχή. Τα episodes αξιολόγησης είναι πώς μετράτε το επόμενο checkpoint, και πρέπει ποτέ να εκπαιδεύσετε.
- Απόρριψη εκτέλεσεων ruined από κάτι άσχετο - ένα πλαίσιο κάμερας που έπεσε, ένα stalled servo, ένα αντικείμενο που χτυπήσατε. Μια άσχημη διόρθωση είναι χειρότερη από καμία διόρθωση.
Μεταξύ της απελευθέρωσης πολιτικής και την πρώτη εισόδου σας, ο βραχίονας κρατά αχίνητο ενώ ο εγγραφέας συνεχίζει το γράψιμο - ένας κύκλος πανομοιότυπης posture ζευγοποιημένη με λίγο διαφορετικές εικόνες. Εδώ αυτά τα πλαίσια handover παραμένουν στη raw εγγραφή και έξω από το σύνολο διόρθωσης. Αν δομήσετε τον κύκλο μόνοι σας, κόψτε τα σκόπιμα: μια πολιτική εκπαιδευμένη γι' αυτά μαθαίνει να σταματά όπου θα έπρεπε να δράσει.
Βήμα 5 λεπτομερώς: σύνθεση του μίγματος
Σύνθεση παίρνει το αρχικό σύνολο δεδομένων συν το σύνολο διόρθωσης και παράγει μια νέα, συνηθισμένη LeRobot σύνολο δεδομένων που εκπαιδεύει σαν κάθε άλλο. Η σημαντική ιδιότητα είναι ότι η επιλογή episode είναι ρητή ανά πηγή - τίποτα δεν αναμιγνύεται αυτόματα. Ακούγεται μικρό μέχρι την πρώτη φορά μια πολιτική συμπεριφέρεται περίεργα και πρέπει να ανακατασκευάσετε τι εκπαιδεύθηκε.
Το ανοικτό ερώτημα είναι ο λόγος, και κανείς δεν έχει έναν αριθμό που μεταφέρεται. Τι η βιβλιογραφία τηςμές συμφωνείς είναι ότι οι διορθώσεις πρέπει να μετράνε περισσότερο από το κοινό τους. Mandlekar et al. retraining επαναληπτικά στα δεδομένα τα intervention system τους συλλέγει, έτσι η πολιτική μαθαίνει να διασχίσει το bottlenecks, και αναφέρουν ότι οι αγέντες εκπαιδευμένη αυτό τρόπο ξεπερνούν αγέντες εκπαιδευμένη σε ένα ισοδύναμο αριθμό δειγμάτων από μη-παρεμβάσεων demonstradores. Sirius πηγαίνει παραπέρα και μετάβαρος δεδομένων εκπαίδευσης δείγμα από κατά προσέγγιση ανθρώπινη εμπιστοσύνη, αναφέρει 8 τοις εκατό κέρδος σε προσομοίωση και 27 τοις εκατό σε πραγματικό hardware σε πολιτική ταχύτητα κατάφ εναντίον των μεθόδων συγκρίνει με, σε διπλάσια ταχύτητα σύγκλισης. Κανένα από τα εισόδους εκπαίδευσης εδώ εκθέτουν δείγμα-weighting κουμπί, έτσι το ακατέργαστο υποκατάστατο είναι να κρατήσετε κάθε episode διόρθωσης ενώ subsample αρχικά demonstração - και να γράψετε κάτω τι κάνατε.

Βήμα 6 λεπτομερώς: τι συνέχιση από checkpoint πραγματικά σημαίνει
Εκπαίδευση το μίγμα από το base model λειτουργεί αλλά ρίχνει μακριά τον προηγούμενο κύκλο και κοστοσ πλήρης εκτέλεση. Συνέχιση από το προηγούμενο checkpoint είναι ταχύτερη και συνήθως καλύτερη. Είναι επίσης πιο περιορισμένη από ό,τι προτείνει η φράση.
Ένα weights-only checkpoint περιέχει τις παραμέτρους και τίποτα άλλο. Φόρτωση του δίνει τη επόμενη εκτέλεση καλύτερη σημείο εκκίνησης από το base model, αλλά optimizer moments, learning-rate schedule θέση και data order όλα αρχίζουν από μηδέν. Περιμένουν ένα απώλεια spike στην αρχή του συνεχή εκτέλεση, δεν διαβάσετε ως αποτυχία, και δεν κλήσει τον κύκλο resume. Είναι ένα warm start.
| Πολιτική | Μέγεθος | GPU tier | Συμπέρασμα ανά δράση βήμα | Σύνολο δεδομένων μορφή | Episodes πριν είναι αξίων δοκιμή |
|---|---|---|---|---|---|
| GR00T N1.7 | σχετικά 3 B, περίπου 40 M εκπαιδευμένη κατά fine-tuning | A100 80 GB ή H100 80 GB | περίπου 152 ms | LeRobot v2.0 ή v2.1 | 50 |
| GR00T N1.5 | σχετικά 3 B | A100 80 GB ή H100 80 GB | περίπου 165 ms | LeRobot v2.0 ή v2.1 | 50 |
| Pi0.5 | σχετικά 3 B σε PaliGemma backbone | A100 80 GB ή H100 80 GB | περίπου 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | σχετικά 450 M | RTX 4090 ή όποιο 24 GB κάρτα | περίπου 245 ms | LeRobot v3.0 | 30 |
| ACT | σχετικά 80 M, εκπαιδευμένη από το scratch | RTX 4090 ή όποιο 24 GB κάρτα | περίπου 20 ms | LeRobot v3.0 | 50 |
Latency σύνθετα μέσα σε ένα DAgger κύκλο με ένα τρόπο δεν κατά τη διάρκεια ένα demo: στο περίπου 485 ms ανά action βήμα αναλαμβάνετε επειδή ο βραχίονας hesitated, όχι επειδή ήταν λάθος, και hesitation διορθώσεις δεν είναι χρήσιμη εκπαίδευση δεδομένων. Αν είστε iterating σε δεδομένα αντί chasing τελικής ταχύτητα επιτυχίας, iterate ένα γρήγορο μοντέλο. Shukor et al. περιγράφουν SmolVLA ως σχεδιασμένο να εκπαιδεύσει σε ένα ενιαίο GPU και ανάπτυξη σε καταναλωτή GPUs ή CPUs, με μια ασύγχρονη συμπέρασμα στοίβα που αποσυνδέεται πρόβλεψη δράσης από εκτέλεση να επιτρέψει υψηλότερη έλεγχο ταχύτητες - την ιδιότητα που κρατά ένα takeover κύκλο ανταποκριτικό.
Τα σύνολο δεδομένων μορφές δεν είναι interchangeable. GR00T παίρνει LeRobot v2.0 ή v2.1, και το Isaac-GR00T repository περιγράφει τη εισόδου ως γεύση της LeRobot v2 μορφή με ένα προστεθέν δυνατότητα περιγραφή αρχείο· το νεότερο trainers εδώ περιμένουν v3.0. Ένα μίγμα σύνθετη στη λάθος έκδοση αποτυγχάνει στη φόρτωση χρόνου αντί δημιουργία κακής πολιτικής - η καλύτερη λειτουργία αποτυχία, εξακολουθεί σπατάληση σειράς slot. Ο σύνολο δεδομένων τεκμηρίωση κατάλογοι ποια μορφή κάθε trainer παίρνει.
Ο κύκλος, με τη βιβλιογραφία ήδη κάνει
Takeover με ένα βραχίονα ηγέτη, πληκτρολόγιο ή δρομείς· ανά πλαίσιο intervention σημαία· αρχειοθέτηση εκτελέσεις ως διορθώσεις ή αξιολογήσεις· σύνθεση ένα μεικτό σύνολο δεδομένων με ρητό επιλογή ανά πηγή· και συνέχιση εκπαίδευσης από checkpoint αντί του base model. Τι παραμένει δική σας απόφαση είναι ποια εκτέλεση μετράει ως διόρθωση, τι πηγαίνει στο μίγμα, και πότε η intervention rate σταμάτησε πέσει.
Δείτε πώς ο DAgger κύκλος είναι προσκολλημένηΤέσσερις τρόποι να σπαταλήσετε ένα κύκλο
1. Εκπαίδευση στο διορθώσεις μόνο
Ο πιο συνήθης αποτυχία και το πιο δελεαστικό shortcut. Ένα διόρθωση-μόνο σύνολο δεδομένων είναι σχεδόν εντελώς το δύσκολο μέσαία της εργασίας, με προσέγγιση και retreat αγνοήθηκαν· η πολιτική παίρνει καλύτερη σε το δύσκολο μέρος και ξεχνά πώς να φθάσει εκεί. Aggregation δεν είναι υλοποίηση λεπτομέρεια της μεθόδου, είναι ο μηχανισμός: τα παλιά δεδομένα είναι τι κρατά το υπόλοιπο του συμπεριφοράς σε θέση ενώ διορθώσεις κίνηση ένα μέρος του.
2. Κίνηση κάμερα μεταξύ κύκλων
Ένα κάμερα που μετακινείται δύο εκατοστά μεταξύ κύκλων παράγει μια πολιτική χειρότερη από ό,τι αρχίζω με, και μια διάγνωση που κοστοσ μια ημέρα. Κάθε VLA εδώ υπό όρους εικόνες· κατάσταση κοινή μόνο δεν disambiguate όπου αντικείμενο είναι. Φωτογραφήστε τη ρύθμιση πριν τον πρώτο κύκλο και ελέγξτε αυτή φωτογραφία πριν κάθε αργότερα ένα.
3. Επιτρέποντας handover αρχidacts σε εκπαίδευση
Καλύπτονται παραπάνω, και σε λίστα επειδή είναι αόρατη. Το σύμπτωμα είναι πολιτική που stalls για κλάσμα δευτερολέπτου ακριβώς όπου προηγούμενος κύκλος χειριστής άναχος. Φαίνεται σαν hesitation· είναι μίμηση.
4. Κάλεσμα ένα warm start resume
Αν πιστεύετε optimizer κατάσταση μεταφέρθηκε, το αρχικό απώλεια spike διαβάζει ως ένα bug και πηγαίνετε κυνήγι για διαφθορά δεδομένων. Αν γνωρίζετε optimizer αρχίζει φρέσκο, spike είναι αναμενόμενη και κοιτάζετε τι έρχεται μετά από αυτό. Ίδια αριθμοί, αντίθετη συμπεράσματα.
Μέτρηση του κύκλου
Το μετρικό για ένα ανθρώπινης έγκρισης κύκλο είναι η intervention rate: πλαίσια καταγράφηκε ενώ είστε σε έλεγχο, διαιρούμενο από συνολική πλαίσια της εκτέλεσης. Είναι σε takeover κατάσταση, και είναι ο μόνο αριθμός που απαντά το ερώτημα ο κύκλος ρώτησε. Εκπαίδευση απώλεια πέφτει αν ή όχι η πολιτική βελτιωθεί· ταχύτητα επιτυχίας είναι δυαδική και θορυβώδης δείγμα μεγέθη γραφείο βραχίονα παράγει. Intervention rate είναι συνεχής, μετρούμενη σε το κατάσταση η πολιτική ίδια προκάλεσε, και αυτό σταγόνες ως η πολιτική σας χρειάζεται λιγότερο.
Σύγκριση αυτό μόνο κατά εκτελέσεις εγγραφή κάτω ταυτόσημα συνθήκες. Το πλήρες επιχείρημα, και πώς να δομήσετε αξιολόγηση σύνολο που επιζεί περισσότερα από δύο κύκλοι, είναι σε άρθρο σε μέτρηση ένα DAgger κύκλο. Κύκλος ένα είναι ρεαλιστικά ένα ικανότητα δοκιμή: είστε έλεγχο ότι takeover δουλειές σε δικό σας hardware, αυτό διορθώσεις προσγείωση με δικό τους σημαίες, και ότι συνεχή εκτέλεση φορτώθηκε checkpoint ονόματα. Κύκλοι δύο και τρεις είναι όπου ο ποσοστό θα πρέπει να αρχίσει κινείται. Αν δεν έχει μετακινηθεί κατά κύκλο τέσσερα, το πρόβλημα είναι upstream DAgger.
| Γράψτε κάτω ανά κύκλο | Γιατί έχει σημασία αργότερα |
|---|---|
| Checkpoint που ήταν οδήγησε | Χωρίς αυτό δεν μπορείτε ιδιοκτησίας βελτίωση να ένα μίγμα |
| Εισόδου λειτουργία που χρησιμοποιούνται για takeover | Διορθώσεις πληκτρολογίου είναι χοντρή από leader διορθώσεις, και εμφανίζεται στα δεδομένα |
| Αριθμό εκτελέσεις και πώς κάθε ήταν triaged | Αν ο κύκλος είχε αρκετά διορθώσεις να έχουν σημασία |
| Intervention rate ανά εκτέλεση, και η μέση | Η πρόοδος μετρικό του κύκλου |
| Ακριβής επιλογή ανά πηγή | Ο μόνο τρόπο να αναπαραγάγ ή αναιρέσετε ένα κύκλο |
| Warm start ή φρέσκα εκπαίδευση | Εξηγεί απώλεια καμπύλη θα κοιτάζω σε μια εβδομάδα |
Αν δεν έχετε checkpoint ακόμα
Ο κύκλος έχει ούτε εισόδου σημείο χωρίς ένα. Record πρώτα σύνολο δεδομένων, εκπαίδευση πρώτη πολιτική, εκτέλεση αυτό - εγγραφή, εκπαίδευση και εκτέλεση η πολιτική κάλυψη αυτό μονοπάτι. Ο εγγραφή πελάτης είναι σε σελίδα λήψη, GPU tier και ωριαία συντελεστή σε σελίδα τιμολόγησης, και τι α χρησιμοποιήσιμη episode φαίνεται σαν στο SO-100 δεδομένων συλλογής guide. Πάρε αυτό demonstrações σωστά πριν διορθώσεις: DAgger είναι επιδιόρθωση μηχανισμός, και έχει λειτουργούν πολύ καλύτερα σε κάτι ήταν σχεδόν σωστό ήδη.
Μπορώ τρέχω ένα DAgger κύκλο χωρίς ένα βραχίονα ηγέτη;▾
Ναι. Επιλέξτε πληκτρολόγιο ή slider εισόδου όταν πατάτε Ανάληψη: takeover είναι άμεση και χειροκίνητη, με ούτε δεύτερο βραχίονα να ευθυγραμμίσετε. Πληκτρολόγιο αποστέλλει σχετικά nudges ότι ο server clamps σκληρά στο 2 μοίρες ανά κόμβο και 4 για gripper· δρομείς αποστολή ένα απόλυτη στόχο και ο server κινείται στις περισσότερες 6 μοίρες προς αυτό ανά κλήση, ενώ διεπαφή κρατά ρεύματα. Δράσης στήλη και intervention σημαία είναι ίδια ως leader λειτουργία, έτσι διορθώσεις είναι αδιάκριτες σε δεδομένα.
Πόσα διορθώσεις κάνει ένα κύκλο χρειάζεται;▾
Δεν υπάρχει αμυντική καθολικός αριθμός, και καρέ αριθμό έχει σημασία περισσότερο από episode αριθμό. Ο εργασίας κανόνας είναι ότι διορθώσεις δεν πρέπει να χαθεί σε μίγμα: με 200 αρχικό episodes και τρεις διόρθωση episodes, τίποτα θα κινηθεί. Στοχεύετε διορθώσεις ότι κάλυψη το αποτυχία συμπεριφορά από πολλά ξεκίνησης σημειώσεων αντί τρεις επαναλήψεις ίδια διάσωση.
Γιατί είναι εκπαίδευση σε διορθώσεις μόνο τέτοια κακή ιδέα;▾
Επειδή διορθώσεις είναι σχεδόν εντελώς το δύσκολο μέσαία του εργασίας. Προσέγγιση, ευθυγράμμιση και retreat αγνοήθηκαν, έτσι η πολιτική χάνει ό,τι κάνατε ήδη καλά ενώ βελτίωση σε το μέρος διορθώθη. Διατήρηση παλιό δεδομένα και προσθέσεις είναι ο μηχανισμός ίδια, δεν προαιρετικό πρόσθετο.
Συνέχιση από checkpoint resume προηγούμενο εκπαίδευση εκτέλεση;▾
Όχι. Α weights-only checkpoint αποκαθιστά παραμέτρους και τίποτα άλλο: optimizer moments, learning-rate schedule θέση και data order αρχίζω φρέσκα. Είναι ένα warm start, και αρχικό απώλεια spike είναι αναμενόμενη αντί ένα σύμπτωμα. Γράψτε κάτω ποιο τα δύο είστε πραγματικά κάνει, έτσι διαβάσετε καμπύλη σωστά μια εβδομάδα αργότερα.
Τι αν η intervention rate δεν πέφτει;▾
Σταμάτησε προσθέσεις κύκλοι. Ένα επίπεδη ποσοστό σημαίνει διορθώσεις δεν διδάσκαλος ό,τι νομίζετε. Τα συνηθισμένα αιτίες είναι upstream: κάμερα κινήθηκε, διορθώσεις αρχίζω πολύ αργά να είναι αποφυγής δεδομένων, handover πλαίσια είναι σε εκπαίδευση σύνολο, ή εργασία είναι underdetermined από παρατηρήσεις ότι πολιτική πραγματικά παίρνει.
Κανένα από αυτό είναι λύθηκε πρόβλημα και κανένα από αυτό είναι ένα κλικ. Διαδραστική μίμηση μάθηση είναι ένα ενεργό έρευνα περιοχή ακριβώς επειδή έρωτημα - πότε να παρέμβουν, πώς να βάρος τι ανθρώπινο έκανε, πόσο παλιό δεδομένα να κρατήσετε - έχουν ούτε σταθμευμένο απαντήσεις· η εξέταση από Celemin et al. χάρτες ό,τι είναι ακόμα ανοικτό. Τι ο κύκλος σας έχει είναι μετρούμενο σύγκλιση όταν αυτό είναι τρέχει προσεκτικά, σε hardware που κοστοσ μερικές εκατοντάδες ευρώ. Παγώστε τη ρύθμιση, παρέμβουν νωρίς, triage ειλικρινής, μίγμα σκόπιμα, και record intervention rate κάθε φορά.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started