Blog
Insights on robotics, AI, and data collection

Εκτέλεση ενός DAgger Loop σε SO-100 με VLA Policy
Περιγραφή βήμα προς βήμα ενός ανθρώπινης έγκρισης DAgger κύκλου σε SO-100 βραχίονα: εκτέλεση της πολιτικής και καταγραφή της, ανάληψη όταν κάτι πάει στραφί, αρχειοθέτηση της εκτέλεσης ως διόρθωση, σύνθεση ενός μεικτού συνόλου δεδομένων και συνέχιση της εκπαίδευσης από σημείο ελέγχου. Περιλαμβάνει τη διαδρομή ανάληψης πληκτρολογίου και δρομέα για άτομα χωρίς βραχίονα ηγέτη, και τα τέσσερα λάθη που κάνουν ένα κύκλο άχρηστο.

Μέτρηση ενός DAgger Loop: Intervention Rate, Evaluation Protocol και οι Παγίδες ανάμεσά τους
Το intervention rate - intervention frames διαιρούμενα με τα frames της εκτέλεσης - είναι το φθηνότερο ειλικρινές σήμα προόδου που έχει ένας human-gated DAgger loop. Αυτό το άρθρο το ορίζει έτσι ώστε δύο άτομα να υπολογίσουν την ίδια τιμή, δείχνει πώς να το καταγράψετε και ανιχνεύει τους τέσσερις τρόπους που σας παραπλανά: operator habituation, ένα drifting evaluation setup, training μόνο σε corrections και ένας άνθρωπος που διορθώνει διαφορετικά την Τρίτη από τη Δευτέρα.

HG-DAgger και οι Gated Variants: Ποιος Αποφασίζει Πότε Να Ελάβει τη Ρομποτική Πολιτική
Το απλό DAgger ζητά από έναν άνθρωπο να επισημάνει καταστάσεις ενώ το ρομπότ εξακολουθεί να οδηγεί. Στο πραγματικό υλικό αυτό είναι ανασφαλές και παράγει κακές ετικέτες. Οι gated variants αντικαθιστούν την τυφλή επισήμανση με μια πύλη που κάποιος πρέπει να ανοίξει: ο άνθρωπος σε HG-DAgger, ένας ταξινομητής ασφάλειας σε SafeDAgger, η διαφωνία ενός ensemble σε EnsembleDAgger, μια αποτίμηση καινοτομίας και κινδύνου με προϋπολογισμό σε ThriftyDAgger. Αυτό το άρθρο τα συγκρίνει αναλύοντας ποιος είναι ο ιδιοκτήτης της πύλης, ποιο σήμα την ανοίγει και τι κοστίζει καθένα — και γιατί η μορφή με ανθρώπινη πύλη είναι εκείνη που επιζεί σε επαφή με πραγματικό ρομπότ.

DAgger Εξηγημένο: Γιατί το Behavior Cloning αποτυγχάνει και τι αποδεικνύει η Dataset Aggregation
Το Behavior cloning προσαρμόζει μια πολιτική στη κατανομή καταστάσεων του ειδικού και στη συνέχεια αναπτύσσεται από μόνο της. Το κενό μεταξύ αυτών των δύο κατανομών είναι γιατί μια πολιτική που δείχνει καλή στην επαλήθευση αποτυγχάνει στον πίνακα στο βήμα 300. Αυτό είναι το κεφάλαιο θεωρίας της σειράς DAgger: από πού προέρχεται το τετραγωνικό σφάλμα, τι αλλάζει η συνάθροιση δεδομένων, τι υποθέτει η απόδειξη χωρίς ζημία, και ποιο μέρος του λογαριασμού ο ανθρώπινος ειδικός πρέπει ακόμη να πληρώσει.

Χρήση DROID, BridgeData V2 και Open X σε ένα SO-100
Τα DROID, BridgeData V2 και Open X-Embodiment μετατρέπονται σε ενέργειες τελικού ενεργοποιητή 7 διαστάσεων σε βραχίονες 6 και 7 βαθμών ελευθερίας. Ένας SO-100 δέχεται 6 θέσεις αρθρώσεων. Τι μεταφέρεται, τι όχι, τι να κάνετε αντ' αυτού.

Συνθετικά Δεδομένα για Πολιτικές Ρομπότ: Πού Βοηθά η Προσομοίωση
Η προσομοίωση μπορεί να πολλαπλασιάσει μια χούφτα επιδείξεων σε χιλιάδες. Εδώ είναι τι πραγματικά λένε οι δημοσιευμένοι αριθμοί, πού δαγκώνει το χάσμα sim-to-real, και τι πρέπει ακόμα να καταγραφεί.

Μικρά Μοντέλα VLA: TinyVLA, SmolVLA και η Περίπτωση κάτω του 1 δισεκατομμυρίου παραμέτρων
Τα TinyVLA και SmolVLA θέτουν ένα λειτουργικό VLA κάτω από 1 δισεκατομμύριο παραμέτρους. Πραγματικοί αριθμοί από τις δύο εργασίες, τις προεπιλογές του LeRobot, τη μετρούμενη καθυστέρηση, και το κόστος μιας εκτέλεσης σε κάρτα 24 GB.

Εκτέλεση συμπερασμάτων GR00T χωρίς τοπική GPU
Το ρομποτικό σας μηχάνημα δεν διαθέτει GPU. Τοποθετήστε τον διακομιστή πολιτικής GR00T σε μια ενοικιαζόμενη GPU στο cloud, μεταδώστε τμήματα ενεργειών στον βραχίονα και μάθετε ακριβώς τι σας κοστίζει το δίκτυο.

Πώς να εκπαιδεύσετε το ACT στο SO-100 από το μηδέν
Εκπαιδεύστε έναν Action Chunking Transformer από το μηδέν σε ένα SO-100 με το lerobot: τη διαμόρφωση act, τα chunk_size και n_action_steps, το χρονοδιάγραμμα 100000 βημάτων, την εξαγωγή συμπερασμάτων σε 20 ms.

Ποια Πολιτική VLA Πρέπει να Εκπαιδεύσετε το 2026;
GR00T N1.7, Pi0.5, SmolVLA, ACT ή GR00T N1.5; Ένας πίνακας αποφάσεων προσαρμοσμένος σε πραγματικές καταστάσεις, με τους δημοσιευμένους αριθμούς benchmark, την καθυστέρηση, το κόστος ανά εκτέλεση και τις άδειες πίσω από κάθε επιλογή.

Κόστος Εκπαίδευσης VLA: Τι Κοστίζει Πραγματικά μια Εκτέλεση Fine-Tuning
Πραγματικές τιμές GPU στην αγορά spot, πόσο διαρκεί η εκτέλεση καθεμιάς από τις πέντε πολιτικές, τι κοστίζει ο ρομποτικός βραχίονας και οι επιδείξεις, και τα τέσσερα σημεία όπου τα χρήματα εξαφανίζονται αθόρυβα.

Καταγράψτε το Πρώτο σας LeRobot Σύνολο Δεδομένων με ένα SO-100
Καταγράψτε ένα χρησιμοποιήσιμο σύνολο δεδομένων LeRobot με ένα SO-100: βαθμονόμηση, τηλελειτουργία leader-follower, οι πραγματικές σημαίες και προεπιλογές του lerobot-record, ρύθμιση κάμερας, αριθμός επεισοδίων, και τα ελαττώματα που καταστρέφουν μια εκτέλεση.

Πώς να εκπαιδεύσετε το SmolVLA σε μια GPU 24 GB (lerobot 0.6.1)
Το SmolVLA είναι ένα VLA 450 εκατομμυρίων παραμέτρων που βελτιστοποιείται σε μία μόνο κάρτα 24 GB. Πραγματικές εντολές lerobot 0.6.1, οι πραγματικές προεπιλογές, οι παγίδες που κοστίζουν μια μέρα και τι κοστίζει μια εκτέλεση.

Πώς να εκπαιδεύσετε το Pi0.5 με τα δικά σας δεδομένα ρομπότ
Βελτιστοποιήστε το Pi0.5, το VLA αντιστοίχισης ροής από την Physical Intelligence, με τα δικά σας δεδομένα ρομπότ. Πραγματικές εντολές για openpi και lerobot pi05, παγίδες μορφής συνόλου δεδομένων, όρια VRAM και καθυστέρησης.

Πώς να εκπαιδεύσετε το GR00T N1.7 στο δικό σας σύνολο δεδομένων SO-100
Μια δοκιμασμένη αναλυτική περιγραφή για τη λεπτομερή ρύθμιση του NVIDIA GR00T N1.7 σε ένα σύνολο δεδομένων LeRobot SO-100: πραγματικές σημαίες, modality.json, την απαίτηση v2.1, τι κοστίζει μια εκτέλεση, και τις παγίδες.
RoboTurk: Εκμάθηση Ρομπότ μέσω Crowdsourcing με Απομακρυσμένη Τηλεχειρισμό
Ανακαλύψτε πώς το RoboTurk φέρνει επανάσταση στην εκμάθηση ρομπότ μέσω crowdsourcing δεδομένων υψηλής ποιότητας μέσω απομακρυσμένου τηλεχειρισμού, επιτρέποντας κλιμακούμενα σύνολα δεδομένων για μοντέλα AI στη ρομποτική. Εξερευνήστε τον αντίκτυπό του στη μάθηση μίμησης, τα μοντέλα VLA και την απόδοση επένδυσης (ROI) για τις εταιρείες ρομποτικής.
Πολιτικές Ρομπότ Αντιστοίχισης Ροής Pi-Zero: Επαναστατικοποίηση του Επιδέξιου Ελέγχου με Αρχικοποίηση VLM
Ανακαλύψτε πώς η τεχνική αντιστοίχισης ροής του Pi-Zero, σε συνδυασμό με την αρχικοποίηση VLM, μεταμορφώνει τις πολιτικές ρομπότ γενικού χαρακτήρα για επιδέξιο έλεγχο. Μάθετε για τα πλεονεκτήματά της έναντι των παραδοσιακών μεθόδων, την αποτελεσματικότητα στα δεδομένα εκπαίδευσης AI για τη ρομποτική και τις επιπτώσεις για την κλιμακούμενη ανάπτυξη ρομπότ στις βιομηχανίες.
RT-2: Γιατί τα Δεδομένα Εκπαίδευσης Ρομπότ Υψηλής Ποιότητας Ξεπερνούν τους Αλγορίθμους – Οι Επαναστατικές Εμπνεύσεις της Google DeepMind
Ανακαλύψτε πώς το μοντέλο RT-2 της Google DeepMind επαναστατεί στη ρομποτική τεχνητή νοημοσύνη, δίνοντας έμφαση στον κρίσιμο ρόλο των δεδομένων εκπαίδευσης υψηλής ποιότητας έναντι των προηγμένων αλγορίθμων. Αυτό το άρθρο αναλύει τα πειράματα που αποδεικνύουν γιατί η αποτελεσματική συλλογή δεδομένων είναι απαραίτητη για την απόδοση των ρομπότ στον πραγματικό κόσμο. Μάθετε πώς πλατφόρμες όπως η AY-Robots μπορούν να βοηθήσουν στη γεφύρωση του χάσματος στα δεδομένα εκπαίδευσης για μελλοντικές καινοτομίες.
RT-2 από την Google DeepMind: Πώς Αυτό το Μοντέλο Όρασης-Γλώσσας-Δράσης Μεταμορφώνει τη Μάθηση Ρομπότ
Ανακαλύψτε πώς το μοντέλο Όρασης-Γλώσσας-Δράσης (VLA) RT-2 της Google αναδιαμορφώνει τη μάθηση ρομπότ ενσωματώνοντας οπτικά δεδομένα, φυσική γλώσσα και ενέργειες σε πραγματικό χρόνο. Αυτή η καινοτόμος τεχνολογία AI ενισχύει τη συλλογή δεδομένων για τους τηλεχειριστές και αυξάνει την αποδοτικότητα στις εφαρμογές ρομποτικής. Εξερευνήστε τις πιθανές επιπτώσεις της στο μέλλον των ρομπότ που βασίζονται στην τεχνητή νοημοσύνη στην AY-Robots.