Αναλάβετε τον έλεγχο όταν η policy κάνει κάτι λάθος, και εκπαιδεύστε ακριβώς πάνω σε αυτή τη διόρθωση.
Μια policy εκπαιδευμένη με behavior cloning γνωρίζει μόνο τις καταστάσεις που επισκέφθηκαν οι δικές σας επιδείξεις. Το DAgger κλείνει αυτό το κενό με δεδομένα από τις καταστάσεις που φτάνει η ίδια η policy. Το AY-Robots τρέχει ολόκληρο τον βρόχο πάνω σε έναν SO-100: οδηγήστε ένα checkpoint, αναλάβετε τον έλεγχο εν μέσω εκτέλεσης, κρατήστε τα διορθωμένα επεισόδια, συνθέστε το μείγμα και συνεχίστε την εκπαίδευση από το checkpoint που μόλις οδηγήσατε.
- HG-DAgger, με ανθρώπινο έλεγχο
- SO-100 / SO-101
- ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
- Ποσοστό παρέμβασης ανά γύρο
Γιατί μια εκπαιδευμένη policy κάνει κάτι που ποτέ δεν επιδείχθηκε
Το behavior cloning αντιμετωπίζει τον έλεγχο σαν συνηθισμένη επιβλεπόμενη μάθηση: παρατήρηση μέσα, στόχος άρθρωσης έξω, προσαρμοσμένο στα frames που κατέγραψε ένας άνθρωπος. Αυτό ισχύει μόνο όσο το ρομπότ παραμένει στις καταστάσεις που επισκέφθηκε αυτός ο άνθρωπος, και δεν παραμένει. Μια αρπάγη που κλείνει σαράντα χιλιοστά του δευτερολέπτου νωρίτερα μετατοπίζει τον κύβο δύο χιλιοστά από την επιδειχθείσα θέση του. Η επόμενη παρατήρηση είναι μία που δεν περιέχεται στο σύνολο εκπαίδευσης, οπότε η ενέργεια εκεί είναι μια παρέκταση, και η επόμενη κατάσταση βρίσκεται ακόμη πιο μακριά. Η κατανομή εκπαίδευσης και η κατανομή που πράγματι παράγει η εκπαιδευμένη policy είναι δύο διαφορετικά πράγματα, και η δεύτερη αποκλίνει όλο και περισσότερο από την πρώτη καθώς προχωρά το επεισόδιο.
Οι Ross, Gordon και Bagnell περιέγραψαν ακριβώς αυτή την αστοχία της αναγωγής το 2011 και ποσοτικοποίησαν τη ζημιά: ένας ταξινομητής που σφάλλει με πιθανότητα e υπό την κατανομή του ειδικού μπορεί να κάνει, σε έναν ορίζοντα T βημάτων και υπό τη δική του κατανομή, λάθη της τάξης του T στο τετράγωνο επί e, επειδή ένα λάθος παράγει παρατηρήσεις που ο ειδικός δεν παρήγαγε ποτέ και τα σφάλματα συσσωρεύονται. Η λύση τους είναι ο αλγόριθμος για τον οποίο μιλά αυτή η σελίδα: τρέξτε την τρέχουσα policy, συλλέξτε ετικέτες ειδικού για τις καταστάσεις που επισκέπτεται, συγκεντρώστε τις με όσα έχουν συλλεχθεί μέχρι στιγμής, επανεκπαιδεύστε, επαναλάβετε. Περισσότερες επιδείξεις του ίδιου τύπου δεν βοηθούν, γιατί δειγματοληπτούν ξανά την ίδια κατανομή. Ετικέτες πάνω στις καταστάσεις που φτάνει η policy βοηθούν. Η παραλλαγή που υλοποιείται εδώ είναι με ανθρώπινο έλεγχο (HG-DAgger, Kelly et al.): η policy κρατά τον έλεγχο μέχρι ένα άτομο να αποφασίσει ότι κάτι πάει στραβά και να αναλάβει, έτσι ώστε διορθώσεις να παράγονται μόνο εκεί όπου χρειάζονται, και ο βραχίονας να μην οδηγείται ποτέ σε μια κατάσταση που ο χειριστής δεν θα επέτρεπε.
- Το behavior cloning ισχύει μόνο στην κατανομή καταστάσεων πάνω στην οποία εκπαιδεύτηκε.
- Η αστοχία είναι αυτοενισχυόμενη: μια μικρή απόκλιση παράγει μια άγνωστη κατάσταση, η οποία παράγει μεγαλύτερη απόκλιση.
- Το αντίδοτο δεν είναι περισσότερες επιδείξεις, είναι ετικέτες πάνω στις καταστάσεις που φτάνει η ίδια η policy.
- Με ανθρώπινο έλεγχο σημαίνει ότι ο χειριστής αποφασίζει πότε θα παρέμβει, όχι ένα σκορ αυτονομίας.
Γιατί το σφάλμα συσσωρεύεται
Σύρετε τον ορίζοντα. Με behavior cloning, το αναμενόμενο επιπλέον κόστος αυξάνεται περίπου με το τετράγωνο του αριθμού των βημάτων, επειδή κάθε λάθος παράγει καταστάσεις που οι επιδείξεις δεν κάλυψαν ποτέ· ένας βρόχος συγκέντρωσης κρατά την αύξηση κοντά στη γραμμική (Ross et al., 2011).
Ενδεικτικές καμπύλες από τα φράγματα στο Ross et al. (2011), όχι μετρήσεις από το ρομπότ σας. Αυτό που μετράει είναι το σχήμα, όχι οι αριθμοί.
Ένας γύρος DAgger, έξι βήματα
Έτσι τρέχει ο βρόχος στην πλατφόρμα στην πράξη, όχι σχηματικά. Κάθε βήμα παρακάτω αντιστοιχεί σε ένα χειριστήριο του πίνακα ελέγχου.
Ο βρόχος βήμα προς βήμα
Τα ίδια έξι βήματα, ένα τη φορά, με ό,τι συμβαίνει στον βραχίονα και στο σύνολο δεδομένων σε καθένα από αυτά.
Εκτέλεση της policy και καταγραφή
Ξεκινήστε μια εκτέλεση συμπερασμού πάνω σε ένα checkpoint που εκπαιδεύσατε. Η εκτέλεση καταγράφεται καθώς συμβαίνει, μαζί με το κείμενο της εργασίας της ίδιας της εκτέλεσης, ώστε τα frames να είναι αξιοποιήσιμα ως δεδομένα εκπαίδευσης αργότερα και όχι απλώς ένα βίντεο που μπορείτε μόνο να παρακολουθήσετε.
Ανάληψη ελέγχου και διόρθωση
Τη στιγμή που ο βραχίονας κάνει κάτι λάθος, πατήστε Ανάληψη ελέγχου. Ο runner παύει και ο βραχίονας περνά σε εσάς. Με βραχίονα leader, αυτός οδηγείται πρώτα στη θέση του follower και μετά παραδίδει τον έλεγχο· με είσοδο από πληκτρολόγιο ή ρυθμιστικά, επιλεγμένη στην αρχή της εκτέλεσης, η ανάληψη είναι αμέσως χειροκίνητη. Διορθώστε την κίνηση και μετά επιστρέψτε τον έλεγχο στην policy. Τα frames που καταγράφονται κατά την ανάληψη σημαίνονται αυτόματα ως παρεμβάσεις.
Διαλογή της εκτέλεσης
Αποφασίστε για κάθε εκτέλεση τι ήταν: καταχωρίστε την ως διόρθωση, κρατήστε την ως εκτέλεση αξιολόγησης ή απορρίψτε την. Τα ακίνητα καρέ γύρω από μια παράδοση ελέγχου παραμένουν στον κατάλογο raw και δεν μπαίνουν ποτέ στο σύνολο δεδομένων.
Συγχρονισμός του συνόλου δεδομένων διορθώσεων
Οι διορθώσεις συγκεντρώνονται σε ένα σύνολο δεδομένων διορθώσεων ανά policy και καταλήγουν στο bucket σας μέσω του αυτόματου cloud sync. Σε αυτό το σημείο δεν συγχωνεύεται τίποτα με τίποτα· οι διορθώσεις είναι απλώς ένα δικό τους σύνολο δεδομένων.
Συνθέστε οι ίδιοι το μείγμα
Χρησιμοποιήστε τη σύνθεση συνόλου δεδομένων για να χτίσετε το σύνολο εκπαίδευσης του επόμενου γύρου: το αρχικό σύνολο δεδομένων συν τις διορθώσεις, με επεισόδια επιλεγμένα ρητά ανά πηγή. Το αποτέλεσμα είναι ένα κοινό σύνολο δεδομένων που συγχρονίζεται και εκπαιδεύεται όπως κάθε άλλο. Τίποτα δεν αναμειγνύεται πίσω από την πλάτη σας, και δεδομένα προσομοίωσης δεν προστίθενται αυτόματα.
Συνέχιση εκπαίδευσης από checkpoint
Εκπαιδεύστε το συντεθειμένο σύνολο δεδομένων με τη συνέχιση εκπαίδευσης από checkpoint αντί να ξεκινήσετε από το βασικό μοντέλο, ώστε ο γύρος να ξεκινά από την policy που μόλις οδηγήσατε. Να είστε ακριβείς ως προς το τι ακριβώς είναι αυτό: αρχικοποιεί τα βάρη από αυτό το checkpoint, δεν είναι επανεκκίνηση (resume) του optimizer.
Τι αναλαμβάνει η πλατφόρμα για εσάς
Κάθε στοιχείο εδώ είναι ένα βήμα του βρόχου που διαφορετικά θα έπρεπε να χτίσετε και να συντηρείτε μόνοι σας.
Ανάληψη ελέγχου χωρίς βραχίονα leader
Επιλέξτε είσοδο πληκτρολογίου ή ρυθμιστικών στην αρχή της εκτέλεσης και μπορείτε να διορθώσετε με ένα laptop και μόνο. Οι μικρομετακινήσεις από το πληκτρολόγιο περιορίζονται από τον server σε δύο μοίρες ανά άρθρωση και τέσσερις στην αρπάγη· οι στόχοι των ρυθμιστικών είναι απόλυτοι και ο server κινείται προς αυτούς κατά το πολύ έξι μοίρες ανά κλήση. Τα όρια επιβάλλονται από τον server, όχι από το UI, οπότε ένα κολλημένο πλήκτρο δεν μπορεί να ρίξει τον βραχίονα.
Τεκμηρίωση τηλεχειρισμούΠαρεμβάσεις σημειωμένες ανά frame
Κάθε frame που καταγράφεται όσο κρατάτε τον έλεγχο του βραχίονα φέρει μια σημαία παρέμβασης, και η στήλη action περιέχει την πλήρη εντεταλμένη θέση. Δεν συντηρείτε μια στήλη σημαιών με το χέρι ούτε την ευθυγραμμίζετε αργότερα με τους δείκτες των frames.
Μορφή συνόλου δεδομένων LeRobotΔιαλογή: διόρθωση, αξιολόγηση ή απόρριψη
Κάθε εκτέλεση παίρνει μία απόφαση στην κάρτα αποθήκευσης. Οι εκτελέσεις διόρθωσης τροφοδοτούν τον επόμενο γύρο εκπαίδευσης, οι εκτελέσεις αξιολόγησης μένουν έξω από την εκπαίδευση ώστε να παραμένουν μια καθαρή μέτρηση, και οι κακές εκτελέσεις εξαφανίζονται αντί να δηλητηριάζουν σιωπηλά το μείγμα.
Sessions και επεισόδιαΣυνθέστε το μείγμα ρητά
Το σύνολο εκπαίδευσης για τον γύρο n συναρμολογείται από εσάς: αρχικό σύνολο δεδομένων συν διορθώσεις, με επεισόδια επιλεγμένα ανά πηγή. Καμία αυτόματη ανάμειξη, κανένα κρυφό δεδομένο προσομοίωσης, και το συντεθειμένο αποτέλεσμα συμπεριφέρεται όπως κάθε άλλο σύνολο δεδομένων.
Σύνολα δεδομένωνΣυνέχιση εκπαίδευσης από checkpoint
Στρέψτε μια εκτέλεση εκπαίδευσης στο checkpoint που μόλις οδηγήσατε αντί στο βασικό μοντέλο, ώστε κάθε γύρος να ξεκινά εκεί όπου τελείωσε ο προηγούμενος. Αρχικοποιεί μόνο τα βάρη· η κατάσταση του optimizer δεν αποκαθίσταται, οπότε αξίζει να αντιμετωπίζετε τον πρώτο γύρο ως δοκιμή εφικτότητας.
ΕκπαίδευσηGPU με ενοικίαση ανά γύρο
ACT και SmolVLA σε μια 4090, Pi0 και GR00T N1.5 ή N1.7 σε μια A100 με 80 GB. Ξεκινάτε έναν γύρο, το pod ανεβαίνει, τα checkpoints καταλήγουν στο bucket σας, και πληρώνετε για τις ώρες που χρειάστηκε ο γύρος.
Τιμές GPUΣχεδιάστε τους γύρους σας
Το ποσοστό παρέμβασης είναι η μετρική προόδου του βρόχου: διορθωμένα frames διά τα frames της εκτέλεσης. Ορίστε από πού ξεκινάτε και πόσο κερδίζει κάθε γύρος, και δείτε πόσοι γύροι χρειάζονται για να φτάσετε εκεί που θέλετε.
| Γύρος | Ποσοστό παρέμβασης | Διορθωμένα frames |
|---|---|---|
| 1 | 30.0 % | 900 |
| 2 | 22.5 % | 675 |
| 3 | 16.9 % | 506 |
| 4 | 12.7 % | 380 |
| 5 | 9.5 % | 285 |
| 6 | 7.1 % | 214 |
| Σ | 2 960 | |
Ένα μοντέλο, όχι μια πρόβλεψη. Οι πραγματικοί γύροι είναι ακανόνιστοι, και ένας γύρος που δεν μετακινεί το ποσοστό δεν σας έχει προσφέρει τίποτα· αυτό ακριβώς είναι το σήμα που αξίζει να παρακολουθείτε.
Να χτίσετε τον βρόχο μόνοι σας ή να τον τρέξετε εδώ
Τίποτα από αυτά δεν είναι αδύνατο να γίνει με το χέρι. Είναι θέμα πόσα βράδια πάνε σε υποδομή αντί σε γύρους, και υπάρχει μία γραμμή όπου το να το κάνετε μόνοι σας είναι ξεκάθαρα η καλύτερη απάντηση.
| Βήμα του βρόχου | Ρύθμιση με το χέρι | Στο AY-Robots |
|---|---|---|
| Ανάληψη ελέγχου εν μέσω εκτέλεσης | Ένας βραχίονας leader, ή δικός σας κώδικας πάνω στον δίαυλο servo. Την ανάληψη μέσω πληκτρολογίου και ρυθμιστικών, μαζί με τα όρια ασφαλείας, τη γράφετε και τη διορθώνετε σε πραγματικό υλικό. | Βραχίονας leader, πληκτρολόγιο ή ρυθμιστικά, επιλεγμένα στην αρχή της εκτέλεσης. Τα όρια γωνίας βρίσκονται στον server. |
| Σήμανση παρεμβάσεων | Προσθέτετε τη στήλη σημαίας, την κρατάτε ευθυγραμμισμένη με τον δείκτη frame, και την ελέγχετε ξανά κάθε φορά που αλλάζει η μορφή καταγραφής. | Κάθε frame που καταγράφεται κατά την ανάληψη σημαίνεται αυτόματα, με την εντεταλμένη θέση στη στήλη action. |
| Ταξινόμηση των εκτελέσεων | Συμβάσεις καταλόγων και σενάρια shell. Τα ακίνητα καρέ γύρω από μια παράδοση ελέγχου πρέπει να τα βρείτε και να τα αποκλείσετε μόνοι σας. | Μία απόφαση ανά εκτέλεση στην κάρτα αποθήκευσης. Τα frames παράδοσης ελέγχου μένουν στον κατάλογο raw. |
| Δημιουργία του μεικτού συνόλου δεδομένων | Σενάρια συγχώνευσης ανά έκδοση μορφής. Το κουραστικό κομμάτι είναι να κρατήσετε συνεπείς τους δείκτες επεισοδίων, τα μεταδεδομένα και τις αναφορές βίντεο. | Σύνθεση από το αρχικό συν τις διορθώσεις με επιλογή επεισοδίων ανά πηγή· το αποτέλεσμα είναι ένα κανονικό σύνολο δεδομένων. |
| Έναρξη του επόμενου γύρου από την τελευταία policy | Συνδέετε το checkpoint στον trainer μόνοι σας, και μπορείτε επίσης να αποκαταστήσετε την κατάσταση του optimizer αν θέλετε πραγματική επανεκκίνηση. | Ένα πεδίο για το βασικό checkpoint. Μόνο βάρη: αρχικοποιεί από το checkpoint, δεν είναι επανεκκίνηση του optimizer. |
| Έλεγχος πάνω στον βρόχο εκπαίδευσης | Πλήρης. Δικό σας loss, δικό σας πρόγραμμα, δικές σας αφαιρέσεις (ablations), δική σας οργανολογία, καμία πλατφόρμα στη μέση. Αν το ερευνητικό ερώτημα είναι ο ίδιος ο βρόχος εκπαίδευσης, κάντε το με το χέρι. | Ένα σταθερό μονοπάτι με μια καθορισμένη λίστα policies και τις υπερπαραμέτρους που εκθέτει η φόρμα, όχι αυθαίρετος κώδικας. |
Οι εργασίες πάνω στις οποίες βασίζεται αυτό
Διαβάστε αυτές πριν αντιμιλήσετε στον βρόχο. Κάθε σύνδεσμος οδηγεί στη σελίδα της περίληψης, όχι πίσω από paywall.
- A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)
Η αρχική εργασία του DAgger: διατυπώνει το πρόβλημα της συσσώρευσης σφαλμάτων, δίνει το φράγμα T στο τετράγωνο για την καθαρά επιβλεπόμενη προσέγγιση, και προτείνει τη συγκέντρωση δεδομένων από τις καταστάσεις που επισκέπτεται ο ίδιος ο εκπαιδευόμενος.
- HG-DAgger: Interactive Imitation Learning with Human Experts
Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019
Η παραλλαγή με ανθρώπινο έλεγχο: ο ειδικός αποφασίζει πότε θα αναλάβει τον έλεγχο αντί να ερωτάται για καταστάσεις που επέλεξε η policy· αυτός είναι ο τρόπος λειτουργίας που υλοποιεί αυτή η πλατφόρμα.
- EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning
Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019
Ο άλλος τρόπος ελέγχου των παρεμβάσεων: η διαφωνία σε ένα ensemble ως σήμα εμπιστοσύνης για το πότε ο εκπαιδευόμενος μπορεί να ενεργήσει μόνος του. Χρήσιμη αντιπαραβολή με το να αποφασίζει ένα άτομο.
- ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021
Αντιμετωπίζει την ανθρώπινη προσοχή ως τον σπάνιο πόρο και ζητά βοήθεια μόνο σε νέες ή επικίνδυνες καταστάσεις, κάτι που είναι το σωστό πλαίσιο όταν ένα άτομο επιβλέπει τον βραχίονα ένα ολόκληρο απόγευμα.
- DART: Noise Injection for Robust Imitation Learning
Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017
Η ειλικρινής εναλλακτική: αντί να διορθώνει την policy κατά την εκτέλεσή της, διαταράσσει τις επιδείξεις ώστε ο ειδικός να επιδείξει ανάκαμψη. Άξιο γνώσης προτού δεσμευτείτε σε παρεμβάσεις.
- Interactive Imitation Learning in Robotics: A Survey
Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600
Ο χάρτης του πεδίου: ποιες μορφές ανθρώπινης ανάδρασης υπάρχουν, ποιες διεπαφές τις μεταφέρουν, και πού βρίσκεται ανάμεσά τους η παρέμβαση τύπου DAgger.
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705
Η εργασία του ACT. Το action chunking είναι ο λόγος για τον οποίο ένας φθηνός βραχίονας μπορεί καν να οδηγηθεί από μια policy μίμησης, και το ACT είναι η ταχύτερη policy για να επαναλάβετε έναν γύρο DAgger.
- π0: A Vision-Language-Action Flow Model for General Robot Control
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164
Ένα VLA βασισμένο σε flow matching πάνω σε ένα προεκπαιδευμένο μοντέλο όρασης-γλώσσας, και ένα από τα checkpoints που μπορείτε να κάνετε fine-tune εδώ· η εργασία δηλώνει ρητά ότι οι νέες δεξιότητες προέρχονται από το fine-tuning, όχι μόνο από το βασικό μοντέλο.
Ερωτήσεις που κάνει πραγματικά ο κόσμος
Χρειάζομαι βραχίονα leader για το DAgger;
Όχι. Επιλέξτε είσοδο πληκτρολογίου ή ρυθμιστικών όταν ξεκινάτε την εκτέλεση, και η ανάληψη είναι χειροκίνητη από το πρώτο frame, οδηγούμενη από τον browser. Ένας βραχίονας leader είναι πιο ευχάριστος για λεπτές κινήσεις, και είναι ο μόνος τρόπος στον οποίο ο βραχίονας ευθυγραμμίζεται μόνος του πριν την παράδοση ελέγχου, αλλά ο βρόχος τρέχει και χωρίς αυτόν.
Πόσους γύρους DAgger χρειάζομαι;
Δεν υπάρχει ένας ειλικρινής σταθερός αριθμός. Παρακολουθήστε το ποσοστό παρέμβασης: αν δεν πέφτει από τον έναν γύρο στον επόμενο, αυτός ο γύρος δεν σας πρόσφερε τίποτα, και το πρόβλημα βρίσκεται συνήθως στη ρύθμιση της εργασίας, στις κάμερες ή στο αρχικό σύνολο δεδομένων και όχι στον αριθμό των γύρων.
Είναι αυτό πραγματικό DAgger ή κάτι πιο χαλαρό;
Είναι HG-DAgger, η παραλλαγή με ανθρώπινο έλεγχο. Το κλασικό DAgger ρωτά τον ειδικό για καταστάσεις που επέλεξε η policy, μεταξύ αυτών καταστάσεις όπου κανένας λογικός χειριστής δεν θα άφηνε έναν πραγματικό βραχίονα να φτάσει. Εδώ ένα άτομο αποφασίζει πότε θα παρέμβει, και μόνο αυτά τα τμήματα γίνονται ετικέτες.
Εκπαιδεύω μόνο πάνω στις διορθώσεις;
Όχι, και δεν θα έπρεπε. Η εκπαίδευση μόνο πάνω σε διορθώσεις σας δίνει μια policy που ξέρει μόνο πώς να ανακάμπτει. Το συντεθειμένο σύνολο δεδομένων είναι τα αρχικά δεδομένα συν τις διορθώσεις, με τα επεισόδια από κάθε πηγή επιλεγμένα ρητά.
Η συνέχιση από ένα checkpoint επανεκκινεί την εκτέλεση εκπαίδευσης;
Αρχικοποιεί τα βάρη από αυτό το checkpoint. Η κατάσταση του optimizer δεν αποκαθίσταται, οπότε δεν πρόκειται για επανεκκίνηση με τη στενή έννοια. Στην πράξη τα βάρη είναι αυτά που μεταφέρουν τη μαθημένη συμπεριφορά κατά τον γύρο, αλλά αξίζει να ξέρετε ποιο από τα δύο παίρνετε.
Πώς υπολογίζεται το ποσοστό παρέμβασης;
Frames σημειωμένα ως παρέμβαση διά τον συνολικό αριθμό frames της εκτέλεσης. Εμφανίζεται στην κατάσταση ανάληψης, και είναι ο ένας αριθμός που αξίζει να σημειώνετε ανά γύρο, μαζί με το checkpoint που οδηγήσατε και το μείγμα που εκπαιδεύσατε.
Με ποιες policies μπορώ να τρέξω αυτόν τον βρόχο;
ACT, SmolVLA, Pi0, και GR00T N1.5 ή N1.7. Ο ίδιος ο βρόχος είναι ανεξάρτητος από την policy, αφού παράγει μόνο σύνολα δεδομένων και checkpoints· η πρακτική διαφορά είναι πόσο διαρκεί ένας γύρος και ποια GPU χρειάζεται.
Μπορώ να το κάνω αυτό χωρίς να έχω δικό μου ρομπότ;
Μπορείτε να καταγράψετε και να εκπαιδεύσετε χωρίς ένα, αγοράζοντας σύνολα δεδομένων στο marketplace ή αναθέτοντας σε χειριστές, και μπορείτε να οδηγήσετε έναν πραγματικό SO-100 στον browser στη σελίδα live. Ένας γύρος DAgger είναι διαφορετικός: χρειάζεται έναν βραχίονα που μπορείτε να αναλάβετε εν μέσω εκτέλεσης, οπότε για τον ίδιο τον βρόχο θέλετε υλικό στο δικό σας γραφείο.
A real SO-100, live in the browser. No signup, no hardware needed.
Τρέξτε τον πρώτο σας γύρο αυτή την εβδομάδα
Εγκαταστήστε τον client, οδηγήστε ένα checkpoint που ήδη έχετε, και αναλάβετε τον έλεγχο την πρώτη φορά που ο βραχίονας ξεπερνά τον κύβο. Αυτή η μία εκτέλεση είναι ένας γύρος DAgger σε μικρογραφία: όλα όσα ακολουθούν είναι η σύνθεση του μείγματος και η πληρωμή για τις ώρες GPU.