Εκπαίδευση policy
Το AY-Robots εκπαιδεύει policies χειρισμού σε διαχειριζόμενες GPU, οπότε μπορείτε να πάτε από καταγεγραμμένα επεισόδια σε μια policy που τρέχει στον βραχίονά σας χωρίς να κατέχετε υλικό εκπαίδευσης. Αυτή η σελίδα καλύπτει τους υποστηριζόμενους τύπους policy, τη σελίδα εκτέλεσης εκπαίδευσης, τα checkpoints, και τι αποτελέσματα να περιμένετε ρεαλιστικά από το πλήθος επεισοδίων σας.
Τελευταία ενημέρωση 2026-08-09
Εκπαίδευση χωρίς δική σας GPU
Η εκπαίδευση μιας policy χειρισμού είναι φόρτος εργασίας GPU, και τα σύγχρονα μοντέλα vision-language-action χρειάζονται περισσότερη VRAM από όση έχει ένας τυπικός σταθμός εργασίας. Στο AY-Robots η εκπαίδευση τρέχει σε cloud GPU που διαχειρίζεται η πλατφόρμα: επιλέγετε ένα dataset και έναν τύπο policy, ξεκινάτε την εκτέλεση, και παρακολουθείτε την πρόοδό της από τον browser. Δεν υπάρχει ρύθμιση CUDA, ταίριασμα driver, ή περιβάλλον προς συντήρηση.
Η είσοδος είναι πάντα ένα cloud dataset από το Dashboard > Datasets. Οτιδήποτε καταγράψατε μέσω συνεδριών τηλεχειρισμού ή ανεβάσατε στη μορφή LeRobot είναι επιλέξιμο, συμπεριλαμβανομένων συγχωνευμένων datasets. Επιμεληθείτε πριν εκπαιδεύσετε: επεισόδια με ετικέτα Failure συνήθως δεν ανήκουν στο σύνολο εκπαίδευσης, και δέκα λεπτά ελέγχου στον browser επεισοδίων εξοικονομούν ώρες χρόνου GPU που ξοδεύονται μαθαίνοντας από κακές επιδείξεις.
Υποστηριζόμενες policies
Υποστηρίζονται τέσσερις οικογένειες policy. Διαφέρουν σε μέγεθος, κόστος εκπαίδευσης, και πόσο μπορούν να απορροφήσουν από τα δεδομένα σας, οπότε η σωστή επιλογή εξαρτάται από την εργασία και το dataset σας περισσότερο από οποιαδήποτε γενική κατάταξη.
| Policy | Είδος | Χαρακτηριστικά |
|---|---|---|
| ACT | Transformer, action chunking | Προβλέπει σύντομα τμήματα μελλοντικών ενεργειών αντί μεμονωμένων βημάτων. Συμπαγής, εκπαιδεύεται συγκριτικά γρήγορα, και είναι μια στέρεη πρώτη επιλογή για μία καλά καθορισμένη εργασία. |
| Diffusion Policy | Diffusion πάνω σε ακολουθίες ενεργειών | Μοντελοποιεί την πλήρη κατανομή των επιδεικνυόμενων ενεργειών, κάτι που βοηθά όταν οι επιδείξεις σας λύνουν την εργασία με περισσότερους από έναν έγκυρους τρόπους. Πιο βαριά στην εκπαίδευση και πιο αργή στην εξαγωγή συμπερασμάτων από το ACT. |
| SmolVLA | Μικρό μοντέλο vision-language-action | Υπό γλωσσική συνθήκη: η συμβολοσειρά εργασίας από τα επεισόδιά σας γίνεται μέρος της εισόδου. Μια καλή μέση λύση όταν θέλετε γλωσσική συνθήκη χωρίς ένα μεγάλο foundation model. |
| Fine-tune GR00T | Fine-tune foundation model | Κάνει fine-tune ένα μεγάλο προεκπαιδευμένο foundation model ρομποτικής στα επεισόδιά σας. Το υψηλότερο ταβάνι από τα τέσσερα, στο υψηλότερο κόστος εκπαίδευσης, και με αυστηρή απαίτηση μορφής dataset. |
Το fine-tuning του GR00T δέχεται μόνο datasets στη μορφή LeRobot έκδοση 2.1. Ένα dataset v3.0 θα αποτύχει κατά τη φόρτωση δεδομένων, όχι κατά την υποβολή, οπότε ελέγξτε την έκδοση μορφής πριν ξεκινήσετε την εκτέλεση. Datasets καταγεγραμμένα στην πλατφόρμα μπορούν να χρησιμοποιηθούν όπως είναι· για εξωτερικά ανεβάσματα, επαληθεύστε πρώτα την έκδοση στο meta/info.json.
Εκκίνηση μιας εκτέλεσης
- 1Επιλέξτε το dataset
Ανοίξτε το Dashboard > Training και επιλέξτε το dataset στο οποίο θα εκπαιδεύσετε. Το πλήθος επεισοδίων και ο τύπος ρομπότ εμφανίζονται ώστε να επιβεβαιώσετε ότι επιλέξατε το σωστό.
- 2Επιλέξτε την policy
Επιλέξτε έναν από τους υποστηριζόμενους τύπους policy. Αν δεν είστε σίγουροι, ξεκινήστε με το ACT: είναι ο φθηνότερος τρόπος να διαπιστώσετε αν το dataset σας είναι αρκετά καλό για να εκπαιδεύσει οτιδήποτε.
- 3Εκκινήστε
Ξεκινήστε την εκτέλεση. Παίρνει ένα job id και τη δική της σελίδα εκτέλεσης, και μπορείτε να κλείσετε τον browser: η εκπαίδευση συνεχίζεται στην πλευρά του server και η σελίδα δείχνει την τρέχουσα κατάσταση όποτε επιστρέφετε.
Η σελίδα εκτέλεσης εκπαίδευσης
Κάθε εκτέλεση έχει μια αφιερωμένη σελίδα που απαντά στα δύο ερωτήματα που πράγματι έχετε κατά την εκπαίδευση: μαθαίνει, και είναι το μηχάνημα υγιές. Η πρόοδος μάθησης εμφανίζεται ως διαγράμματα του loss, του χρονοδιαγράμματος ρυθμού μάθησης, και της κλίσης gradient. Ένα loss που ισοπεδώνεται αμέσως ή μια κλίση gradient που εκρήγνυται σάς λέει νωρίς ότι η εκτέλεση δεν αξίζει την αναμονή.
Η υγεία του μηχανήματος εμφανίζεται δίπλα: χρήση GPU και μνήμη, συν τις μετρήσεις host του μηχανήματος εκπαίδευσης. Ένα χρονοδιάγραμμα φάσεων δείχνει πού βρίσκεται τώρα η εκτέλεση, από την προετοιμασία περιβάλλοντος μέχρι τη φόρτωση δεδομένων, τον ίδιο τον βρόχο εκπαίδευσης, και το ανέβασμα checkpoint. Όταν κάτι φαίνεται περίεργο, ο ενσωματωμένος προβολέας logs σάς δίνει τα ακατέργαστα logs εκπαίδευσης χωρίς καμία πρόσβαση SSH, κάτι που συνήθως αρκεί για να δείτε αν μια αποτυχία είναι το dataset σας ή η ίδια η εκτέλεση.
Checkpoints και συνέχιση
Τα checkpoints αποθηκεύονται ανά εκτέλεση, όχι σε μια κοινή δεξαμενή, οπότε τα checkpoints που εμφανίζονται σε μια σελίδα εκτέλεσης ανήκουν πάντα ακριβώς σε αυτή την εκτέλεση και τη ρύθμισή της. Αυτό έχει μεγαλύτερη σημασία απ᾽ όσο ακούγεται: η ανάμειξη checkpoints ανάμεσα σε εκτελέσεις με διαφορετικές ρυθμίσεις είναι μια κλασική πηγή σιωπηλά χαλασμένων policies.
Αν μια εκτέλεση διακοπεί, μπορείτε να συνεχίσετε από το πιο πρόσφατο checkpoint της αντί να ξεκινήσετε από την αρχή. Τα ενδιάμεσα checkpoints είναι επίσης χρήσιμα από μόνα τους: όταν μια μακρά εκτέλεση αρχίζει να κάνει overfitting προς το τέλος, ένα προγενέστερο checkpoint συχνά τρέχει καλύτερα στον πραγματικό βραχίονα από το τελικό.
Εκτέλεση της εκπαιδευμένης policy στον βραχίονά σας
Μια ολοκληρωμένη policy μπορεί να αναπτυχθεί κατευθείαν πίσω στο ρομπότ σας. Στο cockpit, επιλέξτε την εκπαιδευμένη policy για τον συνδεδεμένο βραχίονά σας και ξεκινήστε inference: η policy τώρα παράγει τις εντολές αρθρώσεων που προηγουμένως παράγατε εσείς μέσω τηλεχειρισμού. Ο βραχίονας πρέπει να είναι ο ίδιος τύπος ρομπότ στον οποίο καταγράφηκε το dataset, και η σκηνή πρέπει να μοιάζει με τις σκηνές εκπαίδευσης, συμπεριλαμβανομένης της τοποθέτησης καμερών.
Αντιμετωπίστε τις πρώτες εκτελέσεις inference σαν πειράματα, όχι επιδείξεις. Κρατήστε το emergency stop σε εμβέλεια, ξεκινήστε από μια αρχική κατάσταση κοντά σε αυτό που επιδείξατε, και περιμένετε η policy να είναι ευαίσθητη σε πράγματα που δεν θα προσέχατε: μια μετακινημένη κάμερα, διαφορετικό φωτισμό, ή ένα αντικείμενο που το dataset δεν περιείχε ποτέ.
Πόσα επεισόδια χρειάζεστε
Το πιο συνηθισμένο λάθος εκπαίδευσης στην πλατφόρμα δεν είναι λάθος υπερπαράμετρος, είναι η εκπαίδευση σε πολύ λίγα δεδομένα και το συμπέρασμα ότι ο τύπος policy δεν λειτουργεί. Ως πρακτικός κανόνας για μία εργασία σε επιφάνεια τραπεζιού: περίπου 50 επεισόδια σάς δίνουν μια policy με στενή γενίκευση που πετυχαίνει από αρχικές καταστάσεις κοντά σε αυτές που επιδείξατε. Περίπου 100 έως 200 επεισόδια δίνουν χρησιμοποιήσιμη ευρωστία σε όλον τον χώρο εργασίας για εκείνη τη μία εργασία, εφόσον μεταβάλατε την τοποθέτηση αντικειμένων ανάμεσα στα επεισόδια.
Πιο ικανοί τύποι policy δεν το ανατρέπουν αυτό. Ένα fine-tune GR00T σε 20 επεισόδια θα γενικεύσει ακόμα άσχημα· αυτό που αγοράζουν τα μεγαλύτερα μοντέλα είναι ένα καλύτερο ταβάνι μόλις υπάρχουν τα δεδομένα. Αν ο προϋπολογισμός σας είναι περιορισμένος, ξοδέψτε τον σε πιο ποικίλα επεισόδια πριν τον ξοδέψετε σε μεγαλύτερο μοντέλο.
Συχνές ερωτήσεις
Πόσο διαρκεί μια εκτέλεση εκπαίδευσης;▾
Εξαρτάται από τον τύπο policy και το μέγεθος dataset, οπότε δεν υπάρχει ένας τίμιος μοναδικός αριθμός. Το ACT είναι συνήθως το ταχύτερο από τα τέσσερα, τα fine-tunes GR00T το πιο αργό. Το χρονοδιάγραμμα φάσεων και τα διαγράμματα loss στη σελίδα εκτέλεσης δείχνουν νωρίς αν μια εκτέλεση προχωράει.
Μπορώ να εκπαιδεύσω σε ένα συγχωνευμένο dataset;▾
Ναι. Τα συγχωνευμένα datasets είναι συνηθισμένα datasets· η επικύρωση συγχώνευσης έχει ήδη εγγυηθεί συνεπές fps, χαρακτηριστικά, και τύπο ρομπότ. Η συγχώνευση καταγραφών της ίδιας εργασίας είναι ένας από τους πιο αποτελεσματικούς τρόπους να φτάσετε στο εύρος 100 έως 200 επεισοδίων.
Η εκτέλεση GR00T μου αποτυγχάνει κατά τη φόρτωση δεδομένων. Τι πρέπει να ελέγξω πρώτα;▾
Την έκδοση μορφής dataset. Το fine-tuning του GR00T απαιτεί LeRobot v2.1, και ένα dataset v3.0 αποτυγχάνει ακριβώς εκεί. Ελέγξτε την έκδοση στο meta/info.json του dataset σας.
Πρέπει να αφαιρέσω αποτυχημένα επεισόδια πριν την εκπαίδευση;▾
Συνήθως ναι. Επεισόδια με ετικέτα Failure διδάσκουν στην policy την αποτυχημένη συμπεριφορά. Τα επεισόδια Recovery είναι διαφορετικά: δείχνουν πώς να διορθώσετε ένα λάθος και συχνά αξίζει να τα κρατήσετε.
Χρειάζεται να κρατάω τον browser ανοιχτό κατά την εκπαίδευση;▾
Όχι. Οι εκτελέσεις τρέχουν στην πλευρά του server. Η σελίδα εκτέλεσης δείχνει την τρέχουσα κατάσταση, διαγράμματα, και logs όποτε επιστρέφετε, και τα checkpoints αποθηκεύονται ανεξάρτητα από το αν κάποιος παρακολουθεί.
Πώς το AY-Robots αποθηκεύει καταγραφές τηλεχειρισμού στη μορφή LeRobot: δομή επεισοδίου, ο browser επεισοδίων στον πίνακα ελέγχου, συγχώνευση ανεβασμάτων, και η αγορά.
Κάθε βραχίονας ρομπότ που υποστηρίζεται στο AY-Robots με τις προδιαγραφές του: SO-100, Koch v1.1, Franka FR3, FP3 και Panda, WidowX-250, και το ALOHA ViperX-300.