
GR00T N1.7, Pi0.5, SmolVLA, ACT ή GR00T N1.5; Ένας πίνακας αποφάσεων προσαρμοσμένος σε πραγματικές καταστάσεις, με τους δημοσιευμένους αριθμούς benchmark, την καθυστέρηση, το κόστος ανά εκτέλεση και τις άδειες πίσω από κάθε επιλογή.
Πέντε πολιτικές μπορούν να εκπαιδευτούν σε έναν βραχίονα κλάσης SO-100 σήμερα. Διαφέρουν κατά έναν παράγοντα 24 στην εξαγωγή συμπερασμάτων καθυστέρηση, 37 στον αριθμό παραμέτρων και 12 στο κόστος μιας εκτέλεσης, καθώς και στο αν επιτρέπεται να διανείμετε το αποτέλεσμα. Πέντε κάρτες μοντέλων δεν θα το διευθετήσουν: καμία δεν απαντά στην ερώτηση που έχετε, ποια να εκτελέσω πρώτα;
Κάθε αριθμός παρακάτω ανακτήθηκε από τις εργασίες, τα αποθετήρια και τις κάρτες τον Αύγουστο του 2026. Οι αριθμοί πλατφόρμας προέρχονται από τον κατάλογο πολιτικών της AY-Robots· όπου οι δύο διαφωνούν, εμφανίζονται και οι δύο.
Η σύντομη εκδοχή
- •Εκπαιδεύστε το ACT πρώτα αν αμφιβάλλετε για το σύνολο δεδομένων σας: 1 έως 3 USD ανά εκτέλεση, τίποτα προεκπαιδευμένο για να καλύψει κακά δεδομένα.
- •Τα GR00T N1.7 και Pi0.5 βρίσκονται εντός μισής μονάδας στο LIBERO, 97.0 έναντι 96.85 έως 97.5. Αυτός δεν είναι λόγος να επιλέξετε κανένα από τα δύο.
- •Το Pi0.5 είναι η επιλογή γενίκευσης, όχι η επιλογή ακρίβειας, και το πιο αργό στα 485 ms.
- •Το SmolVLA, με 450 M παραμέτρους, είναι το μόνο VLA εδώ που κάνει fine-tuning σε μία κάρτα 24 GB.
- •Το ACT στα 20 ms είναι η μόνη επιλογή για γρήγορη αντιδραστική κίνηση. Οι άδειες αποφασίζουν τα υπόλοιπα.
Ο πίνακας αποφάσεων
| Η κατάστασή σας | Εκπαιδεύστε αυτό | Γιατί |
|---|---|---|
| Μη αποδεδειγμένη ποιότητα συνόλου δεδομένων | ACT | Τίποτα προεκπαιδευμένο δεν κρύβει ένα προβληματικό σύνολο δεδομένων, και η αποτυχία κοστίζει 1 έως 3 USD. |
| Πλούσιο σε επαφές, πολλαπλών βημάτων, υπό συνθήκες γλώσσας | GR00T N1.7 | 97,0% σε τέσσερις σουίτες LIBERO, συν έναν σχετικό χώρο δράσης τελικού ενεργοποιητή. |
| Γρήγορη αντιδραστική κίνηση, συμπερασματολογία στους σερβοκινητήρες | ACT | 20 ms. Ο επόμενος ταχύτερος είναι 7,6 φορές πιο αργός. |
| Νέα αντικείμενα, νέα σκηνή, ανοιχτός κόσμος | Pi0.5 | Κατασκευασμένο για συμπεριφορά εκτός κατανομής, σε έως και 104 τοποθεσίες. |
| Μία κάρτα 24 GB, εξακολουθεί να θέλει γλώσσα | SmolVLA | 450 M παραμέτρους, ένα όριο 30 επεισοδίων, τρέχει τοπικά. |
| Αναπαραγωγή μιας εκτέλεσης που καταγράφηκε το 2025 | GR00T N1.5 | Μόνο αν πρέπει: Το LeRobot το απορρίπτει πλέον, τα βάρη είναι μη εμπορικά. |
| Αυτό θα κυκλοφορήσει ως προϊόν | N1.7, SmolVLA or ACT | Το N1.5 είναι μη εμπορικό, το Pi0.5 φέρει όρους Gemma, η κάρτα του SmolVLA δεν αναφέρει τίποτα. |
Οι πέντε υποψήφιοι
Και τα πέντε είναι πολιτικές: καρέ κάμερας, θέσεις αρθρώσεων και, για τέσσερα από αυτά, μια γλωσσική οδηγία, χαρτογραφημένη σε ένα τμήμα μελλοντικών στόχων αρθρώσεων. Αυτό που τα χωρίζει είναι το πόσο έχει μάθει πριν φτάσετε.
| Πολιτική | Παράμετροι | Καθυστέρηση | Επίπεδο GPU | Τοπικό; | Ελάχιστα επεισόδια | Μορφή | Κόστος |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | ναι | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | ναι | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | όχι | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | όχι | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | όχι | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Το τρέχον μοντέλο της NVIDIA μοντέλο όρασης-γλώσσας-δράσης, περίπου 3 δισεκατομμύρια παράμετροι, περίπου 40 εκατομμύρια εκπαιδευμένες κατά τη διάρκεια λεπτομερούς ρύθμισης. Το αποθετήριο αναφέρει τις διαφορές από το N1.6: ο κορμός από ένα μοντέλο Eagle τρίτου κατασκευαστή σε Cosmos-Reason2-2B σε Qwen3-VL, επίπεδα διάχυσης 32 σε 16, διαστάσεις κατάστασης και δράσης 29 σε 132, ορίζοντας δράσης 16 σε 40.
Αυτό που έχει σημασία σε έναν μικρό βραχίονα είναι ο σχετικός χώρος δράσης του τελικού ενεργοποιητή: το N1.7 προβλέπει διαφορές από την τρέχουσα στάση, κάτι που επιτρέπει τη μεταφορά 20K ωρών ανθρώπινου βίντεο EgoScale σε μια πολιτική ρομπότ. Προδιαγραφές στη σελίδα του N1.7, διαδικασία στον οδηγό N1.7 στο SO-100.
Το README του Isaac-GR00T δηλώνει το N1.7 ως έκδοση Γενικής Διαθεσιμότητας, με πλήρη benchmarks και υποστήριξη. Η κάρτα του Hugging Face δεν έχει ενημερωθεί: το πεδίο Model Version εξακολουθεί να αναγράφει GR00T N1.7 EA. Το αποθετήριο είναι το νεότερο έγγραφο.
GR00T N1.5
Ίδια κλίμακα 3 B, αρχιτεκτονική Eagle 2, SigLip2 και T5, κεφαλή DiT flow-matching. Υπάρχει για να επεκτείνει ένα που ήδη διαθέτετε. Δύο πράγματα το καθιστούν μια κακή προεπιλογή: τα βάρη φέρουν τη μη εμπορική άδεια μονής κατεύθυνσης της NVIDIA, και οι τρέχουσες εκδόσεις του LeRobot αφαίρεσαν την υποστήριξη του N1.5. Δείτε .
Pi0.5
Το Physical Intelligence's VLA, τύπου πολιτικής pi05. Η δημοσίευση περιγράφει ένα VLM 2 B αρχικοποιημένο από το PaliGemma συν έναν ειδικό δράσης 300 M, που οδηγεί το ρομπότ στα 50 Hz· η διαμόρφωση pi05 του LeRobot προεπιλέγει ένα τμήμα 50 βημάτων, ένα δευτερόλεπτο με αυτόν τον ρυθμό. Το βασικό πλεονέκτημα είναι τα άγνωστα μέρη: περίπου 400 ώρες κινητής χειραγώγησης σε πραγματικά σπίτια, και μια μελέτη κλιμάκωσης σε 3, 12, 22, 53, 82 και 104 τοποθεσίες, όπου το μοντέλο των 104 τοποθεσιών ταίριαξε με ένα σύστημα ελέγχου που εκπαιδεύτηκε στα ίδια τα σπίτια δοκιμής.
Ένα όριο, που αναφέρεται στην lerobot/pi05_base κάρτα: η θύρα μεταφέρει μόνο την κεφαλή δράσης που ταιριάζει με τη ροή. Η πρόβλεψη υποεργασιών, η κωδικοποίηση δράσεων και το RL δεν κυκλοφόρησαν upstream, και το openpi λέει το ίδιο για το δικό του αποθετήριο. Η σελίδα του Pi0.5 και ο οδηγός Pi0.5 στο SO-100 έχουν τα υπόλοιπα.
Το Pi0.5 χρειάζεται τον tokenizer με πύλη google/paligemma-3b-pt-224 (gated: manual, αν και η Google λέει ότι τα αιτήματα επεξεργάζονται άμεσα). Χωρίς να το αποδεχτείτε και να εκτελέσετε το hf auth login στο περιβάλλον εκπαίδευσης, η εργασία ξεκινά, κατεβάζει για λίγο, και μετά σταματά λόγω σφάλματος εξουσιοδότησης που μοιάζει με σφάλμα δικτύου. Το nvidia/GR00T-N1.7-3B δεν έχει πύλη, αλλά ο πυρήνας του nvidia/Cosmos-Reason2-2B έχει (gated: auto). Εκκαθαρίστε και τα δύο πριν την ουρά. Εάν μια εκτέλεση παραμένει αδρανής, η σελίδα με τις κολλημένες εργασίες στην ουρά αναφέρει τι πρέπει να ελέγξετε.
SmolVLA
450 M παραμέτρους, περίπου 100 M στον ειδικό δράσης, στο SmolVLM-2 με το VLM παγωμένο και μόνο τα πρώτα 16 επίπεδα γλωσσικού μοντέλου χρησιμοποιήθηκαν. Η προεκπαίδευση ήταν δεδομένα κοινότητας: 481 σύνολα δεδομένων, 10.6 M καρέ, από τους ίδιους φθηνούς βραχίονες που χρησιμοποιείτε. Το μόνο VLA εδώ που χωράει σε μία κάρτα 24 GB, και το μόνο με 30 επεισόδιο όριο. Δείτε τη σελίδα του SmolVLA.
ACT
Δεν είναι ένα θεμελιώδες μοντέλο. Το Action Chunking Transformer από την ALOHA έχει περίπου 80 εκατομμύρια παραμέτρους εκπαιδευμένες από το μηδέν ανά εργασία, σε 50 επιδείξεις στα 50 Hz. Η εργασία αναφέρει έξι πραγματικές αμφιδέξιες εργασίες από περίπου δέκα λεπτά επιδείξεων η καθεμία, με 80 έως 90 τοις εκατό στα παραδείγματα που τονίζει. Η ιδέα του, τμηματοποίηση δράσης, βρίσκεται σε κάθε μοντέλο αυτής της σελίδας, και η αφαίρεσή του εξακολουθεί να μετρά το αποτέλεσμα καλύτερα: σε δύο προσομοιωμένες εργασίες με απενεργοποιημένο το χρονικό ensembling, η επιτυχία αυξάνεται από 1 τοις εκατό στο k=1 σε 44 τοις εκατό στο k=100. Η σελίδα του ACT έχει τα υπόλοιπα.
Τι λένε στην πραγματικότητα τα benchmarks
Το LIBERO είναι το ένα benchmark για το οποίο αναφέρουν τρία από αυτά τα πέντε: εργασίες υπό συνθήκες γλώσσας σε ένα προσομοιωμένο Franka Panda, χωρισμένο σε τέσσερις σουίτες παρακάτω με δέκα εργασίες η καθεμία. Η NVIDIA πραγματοποίησε 200 δοκιμές ανά σουίτα.
| Μοντέλο | Χωρικό | Αντικείμενο | Στόχος | 10 (Μακρύ) | Μέσος όρος |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Κάθε αριθμός προέρχεται από διαφορετικό σύστημα δοκιμών και προϋπολογισμό. Το GR00T εκτέλεσε 20K βήματα με συνολική παρτίδα 640· το νούμερο του openpi είναι ένα σημείο ελέγχου 30K· η μεταφορά LeRobot πρόσθεσε 6K βήματα σε ένα βασικό μοντέλο LIBERO. Το SmolVLA αποτελεί περαιτέρω ασυμφωνία: η δημοσίευσή του εκπαιδεύει αυτή τη σειρά στο LIBERO από το μηδέν, χωρίς προεκπαίδευση VLA, ενώ τα τρία παραπάνω κάνουν λεπτομερή ρύθμιση σε προεκπαιδευμένα σημεία ελέγχου. Αντιμετωπίστε το 96.85 έως 97.5 ως μία ομάδα, και το κενό έως 87.3% ως πραγματικό αλλά επιτευχθέν με 6.7 φορές τις παραμέτρους.
Το SimplerEnv δείχνει την εξάπλωση, κάτι που το LIBERO δεν κάνει. Η NVIDIA συγκρίνει το N1.7 με το N1.6, το πιο κοντινό δημόσιο στοιχείο σε μια γενεαλογική διαφορά.
| Σουίτα SimplerEnv | Μέσος όρος N1.6 | Μέσος όρος N1.7 | Καλύτερη μεταβολή | Χειρότερη μεταβολή |
|---|---|---|---|---|
| Bridge (WidowX), 7 εργασίες | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 εργασίες | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | κανένα, κάθε εργασία βελτιώθηκε |
Η σειρά Bridge είναι η χρήσιμη: 5.7 πόντοι κερδήθηκαν κατά μέσο όρο ενώ put_eggplant_in_basket έχασε 36 και put_eggplant_in_sink έπεσε από 33 σε 2. Μια νέα γενιά μετακινεί την κατανομή αντί να την ανυψώνει, οπότε αν η εργασία σας βρίσκεται εκεί που το N1.7 υποχώρησε, ο μέσος όρος δεν λέει τίποτα.

Από τα πέντε, μόνο η εργασία SmolVLA αναφέρει έναν βραχίονα κατηγορίας SO-100: 78.3 τοις εκατό για το SmolVLA και 61.7 για το Pi0 σε τρεις εργασίες, και τα δύο πολλαπλών εργασιών, έναντι 48.3 για το ACT εκπαιδευμένο σε μία εργασία, το οποίο δεν είναι όμοιο με όμοιο. Η καθαρή σύζευξη είναι και τα δύο μονής εργασίας στο SO-101 pick-and-place: 90 έναντι 70 στην κατανομή, 50 έναντι 40 εκτός αυτής. Συγκρίνετε σε ACT έναντι SmolVLA και Pi0.5 έναντι SmolVLA, ή περιηγηθείτε στο την αρένα.
Η καθυστέρηση και το κόστος καθορίζουν την ανάπτυξη
Καθυστέρηση συμπερασματολογίας είναι ο περιορισμός που οι άνθρωποι ανακαλύπτουν τελευταίο και μετανοούν πρώτο. Μια πολιτική πέντε μονάδες καλύτερη σε ένα benchmark αλλά μισό δευτερόλεπτο ανά βήμα ενέργειας φαίνεται χειρότερη στο γραφείο σας: η δυναμική επαφής δεν περιμένει.
Μια προειδοποίηση: η τιμή του GR00T διαφωνεί με την κάρτα της NVIDIA, η οποία μετρά 4 βήματα αποθορυβοποίησης και μία κάμερα στα 85.8 ms σε H100 σε eager mode, 48.6 ms με torch.compile, 27.9 ms μέσω πλήρους TensorRT. Τα 152 ms εδώ είναι μια τιμή ολόκληρης της στοίβας με overhead εξυπηρέτησης και περισσότερες από μία κάμερες, όχι μια forward pass.
Ο βρόχος 20 έως 485 ms είναι του μοντέλου, και τα round trips του δημόσιου διαδικτύου προστίθενται σε αυτόν. Η απομακρυσμένη συμπερασματολογία είναι βιώσιμη για αργές εργασίες pick-and-place, όχι για γρήγορη αντιδραστική κίνηση. Εάν η εργασία σας απαιτεί ταχύτητα, η συμπερασματολογία βρίσκεται δίπλα στους σερβοκινητήρες: ACT ή SmolVLA, τοπικά. Σχετικά: η πολιτική παγώνει εν μέσω κίνησης.
Ένας τρόπος να κερδίσετε χρόνο χωρίς να αλλάξετε μοντέλο: η εργασία SmolVLA μετρά τη σύγχρονη εκτέλεση, όπου η πολιτική ολοκληρώνει ένα κομμάτι πριν προβλέψει το επόμενο, έναντι της ασύγχρονης, όπου η πρόβλεψη επικαλύπτει την εκτέλεση. Η επιτυχία είναι παρόμοια, 78.3 έναντι 73.3, αλλά η ίδια εργασία pick-and-place διαρκεί 9.7 δευτερόλεπτα αντί για 13.75, και σε ένα σταθερό παράθυρο το ρομπότ διαχειρίζεται 19 κύκλους αντί για 9.
Άδειες, ελεγμένες επειδή κανείς δεν τις ελέγχει
| Model | Άδεια βαρών | Άδεια κώδικα | Εμπορική χρήση |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; η κάρτα επιτρέπει εμπορική χρήση | Apache 2.0 | ναι |
| GR00T N1.5 | Μη εμπορική άδεια μονής κατεύθυνσης NVIDIA | Apache 2.0 | όχι |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | διαβάστε και τα δύο, διαφωνούν |
| SmolVLA | δεν υπάρχει πεδίο άδειας στην κάρτα smolvla_base | Apache 2.0 (LeRobot) | κώδικας ναι, βάρη αδήλωτα |
| ACT | δεν υπάρχουν βασικά βάρη | Apache 2.0 (LeRobot) | ναι |
Η σειρά Pi0.5 χρειάζεται προσοχή. Η τεκμηρίωση LeRobot pi05 αναφέρει Apache 2.0 συνεπές με το openpi, ενώ η κάρτα Hub για lerobot/pi05_base φέρει license: gemma. Και τα δύο είναι ενεργά. Το GR00T N1.7 έχει μια ηπιότερη έκδοση: το README του Isaac-GR00T αναφέρει παρεμπιπτόντως ότι το N1.7 είναι πλήρως εμπορικά αδειοδοτήσιμο υπό Apache 2.0, ενώ η δική του ενότητα άδειας και η κάρτα μοντέλου θέτουν μόνο τον κώδικα υπό Apache 2.0 και τα βάρη υπό την NVIDIA Open Model License.
Οι προεπιλογές που θα εκτελέσετε στην πράξη
Κάθε μορφή εκπαιδευτή συνοδεύεται από μια προεπιλογή, και αυτές δεν είναι αυθαίρετες. Οι προεπιλογές του ACT είναι του LeRobot: batch 8, lr 1e-5, 100000 βήματα εκπαίδευσης, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. Μία στήλη παρακάτω είναι παγίδα.
| Πολιτική | Batch | LR | Μέγιστα βήματα | Συσσώρευση κλίσης | Εφαρμόζεται; | Επιπλέον ρυθμίσεις |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ναι | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ναι | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | όχι (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | όχι | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | όχι | chunkSize, nActionSteps, seed, logFreq |
Το σημείο εισόδου fine-tuning του GR00T (launch_finetune.py, ένα tyro CLI) δεν έχει πεδίο seed στην κλάση δεδομένων διαμόρφωσής του, οπότε οι εκτελέσεις δεν είναι αναπαραγώγιμες bit-for-bit. Το αποθετήριο προειδοποιεί επίσης για διακύμανση 5 έως 6 τοις εκατό μεταξύ των εκτελέσεων από μη-ντετερμινιστικές αυξήσεις εικόνας, μεγαλύτερη από τα περισσότερα κενά συγκριτικής αξιολόγησης που συζητούνται διαδικτυακά. Το προεπιλεγμένο seed του LeRobot είναι 1000. Η στήλη grad-accum περιγράφει lerobot 0.5.1; η upstream έκδοση 0.6.2 το εκθέτει ως --accelerator.gradient_accumulation.steps.
Η ρύθμιση που μετράει περισσότερο από την επιλογή μοντέλου
Είναι το κομμάτι δράσης. Μεγαλύτερα κομμάτια δίνουν ομαλότερη κίνηση και λιγότερα σωρευτικά σφάλματα, αλλά η πολιτική δεσμεύεται όσο εκτελείται το μπλοκ, οπότε αντιδρά αργά σε οτιδήποτε κινείται: με αυτοπεποίθηση σε έναν στατικό κύβο, απελπιστική σε έναν κυλιόμενο. Αν υπερβεί το στόχο, η συντόμευση του εκτελούμενου μέρους είναι καλύτερη από την επανεκπαίδευση και είναι δωρεάν. Μια άρθρωση που σταματά νωρίς είναι ένα διαφορετικό πρόβλημα· δείτε .
- ACT: Η ACTConfig προεπιλέγει σε
chunk_size 100καιn_action_steps 100. Η χρονική ομαδοποίηση είναι απενεργοποιημένη και απαιτείn_action_steps 1. - GR00T N1.7: ο εσωτερικός ορίζοντας πήγε από 16 σε 40, ωστόσο το παράδειγμα SO-101 του LeRobot εξακολουθεί να τρέχει
--policy.chunk_size=16 --policy.n_action_steps=16. Η σημαία rollout μετονομάστηκε σε--execution-horizon. - Pi0.5: ένα κομμάτι 50 βημάτων, εκ των οποίων η συνταγή LIBERO του LeRobot εκτελεί 10 μέσω
--policy.n_action_steps=10· με--policy.pretrained_pathεπανέρχεται στα 50 αν παραλείψετε τη σημαία. - SmolVLA: κομμάτια 50 δράσεων, και οι δύο ρυθμίσεις εκτεθειμένες.
Πώς να ελέγξετε και τα πέντε σε ένα απόγευμα
Η φθηνότερη απάντηση δεν είναι περισσότερο διάβασμα. Ξοδέψτε περίπου 15 USD και αφήστε το ρομποτικό βραχίονα να σας πει: καταγράψτε μία φορά, εκπαιδεύστε πρώτα το φθηνό μοντέλο, κλιμακώστε μόλις αποδειχθεί ότι τα δεδομένα είναι αξιόπιστα. Η δομή υπερτερεί του όγκου, το νόημα της και της .
- 1Καταγράψτε 50 επεισόδια μία φορά
Πενήντα επεισόδια ανοίγουν τον δρόμο για τα GR00T, Pi0.5 και ACT, και τα 30 του SmolVLA. Επαναλάβετε κάθε παραλλαγή αντί να διασκορπιστείτε: 50 επεισόδια σε 5 θέσεις κύβων εκπαιδεύτηκαν, όπου 25 δεν εκπαιδεύτηκαν. Δείτε καταγράψτε το πρώτο σας σύνολο δεδομένων.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Εκπαιδεύστε πρώτα το ACT, γιατί δεν μπορεί να σας πει ψέματα
Χωρίς προεκπαιδευμένα βάρη, οπότε αν εκτελεί καθόλου την εργασία, το σύνολο δεδομένων σας περιέχει την εργασία. Αν το ACT μηδενιστεί, διορθώστε τα δεδομένα. 1 έως 3 USD, 2 έως 5 ώρες σε κάρτα 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Εκτελέστε το SmolVLA στο ίδιο σύνολο δεδομένων, αμετάβλητο
Ίδια δεδομένα, ίδιος βραχίονας, 450 M παράμετροι αντί για 80 M, συν γλωσσική προσαρμογή. Το LeRobot εκτιμά μια εκτέλεση 20K βημάτων σε περίπου 4 ώρες σε μία A100. Αυτό σας λέει αν η προεκπαίδευση προσφέρει κάτι.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Μετατρέψτε σε v2.1 πριν χρησιμοποιήσετε το GR00T
Το GR00T διαβάζει μια παραλλαγή της μορφής LeRobot v2 συν ένα επιπλέον
meta/modality.jsonπου αντιστοιχίζει πώς οι συνενωμένοι πίνακες κατάστασης και δράσης χωρίζονται σε ονομαστικά πεδία. Ένα σύνολο δεδομένων v3.0 καταρρέει αυτόν τον φορτωτή, επειδή το v3.0 συσκευάζει πολλά επεισόδια σε κοινόχρηστα αρχεία όπου το v2 έγραφε ένα ανά επεισόδιο. Το Isaac-GR00T παρέχει το βοηθητικό εργαλείο υποβάθμισης ωςscripts/lerobot_conversion/convert_v3_to_v2.py. Η σελίδα απόρριψης v3 είναι η γρήγορη διαδρομή.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Αναβαθμίστε σε GR00T N1.7 μόνο αν τα δύο πρώτα άφησαν κάτι ανεκμετάλλευτο
Μέσω του CLI της NVIDIA, όπως φαίνεται εδώ, ή του τύπου πολιτικής
grootτου LeRobot. Η NVIDIA συνιστά 40 GB ή περισσότερο VRAM για fine-tuning, 16 GB για inference. Σε περίπτωση OOM, δείτε τη σελίδα OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Δύο τρόποι για να εκτελέσετε αυτό το πέρασμα διαλογής
Τρία περιβάλλοντα, επειδή οι αλυσίδες εργαλείων δεν συνυπάρχουν. Το LeRobot στο main είναι 0.6.2 και χρειάζεται Python 3.12 ή νεότερη έκδοση. Το Isaac-GR00T και το openpi είναι ξεχωριστά αποθετήρια διαχειριζόμενα από uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- Το GR00T χρησιμοποιεί το
torchcodec0.8.0 ως το μοναδικό του backend βίντεο, απαιτώντας FFmpeg 4 έως 7. Το FFmpeg 8 δεν υποστηρίζεται, το AV1 δεν είναι εγγυημένο. - Ελάχιστες απαιτήσεις μνήμης openpi: inference πάνω από 8 GB, LoRA πάνω από 22.5 GB, πλήρες fine-tuning πάνω από 70 GB. Αυτός ο τελευταίος λόγος είναι γιατί το Pi0.5 είναι μια εργασία A100.
- Νοικιάστε τη GPU μόνοι σας, καταστρέψτε την μετά, συμφιλιώστε τρία σύνολα διαδρομών σημείων ελέγχου χειροκίνητα.
Τα ίδια πέντε μοντέλα, μία φόρμα. Επιλέξτε μοντέλο, σύνολο δεδομένων και υπερπαραμέτρους. Το backend νοικιάζει μια GPU με μέγεθος ανάλογο του απαιτούμενου VRAM, εκτελεί τον εκπαιδευτή και γράφει σε αποθήκευση αντικειμένων.
- Ο πίνακας εκπαίδευσης είναι πέντε μοντέλα επί τέσσερις βραχίονες, κάθε κελί ένας οδηγός: SmolVLA στο SO-100, ACT στο SO-101.
- Τα pods inference παρέχονται αυτόματα από το
/api/inference/podμε έναν idle watchdog, οπότε ένα ξεχασμένο pod δεν χρεώνεται σιωπηλά. - Τα βασικά σημεία ελέγχου είναι των ίδιων των προμηθευτών:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. Το ACT δεν έχει κανένα. - Ίδιες λειτουργίες από το CLI και από πράκτορες AI μέσω του διακομιστή MCP.
- Δεν έχετε υλικό; Ο ζωντανός βραχίονας μεταδίδει ένα φυσικό SO-100 χωρίς εγγραφή. Η σελίδα δοκιμής δείχνει τους τρόπους πρόσβασης.
Βασικό μοντέλο ή από το μηδέν
Το πραγματικό δίλημμα δεν είναι ποιο μοντέλο 3 δισεκατομμυρίων παραμέτρων να επιλέξετε. Είναι το αν θα χρησιμοποιήσετε καθόλου ένα προεκπαιδευμένο VLA, δεδομένου ότι το ACT έμαθε έξι πραγματικές αμφιδέξιες εργασίες από περίπου δέκα λεπτά επιδείξεων η καθεμία, με 80 εκατομμύρια παραμέτρους και τίποτα προεκπαιδευμένο.
- Γλωσσική προσαρμογή. Το ACT δεν έχει καμία· ένα σημείο ελέγχου ACT εκτελεί μία εργασία.
- Καλύτερο σε αντικείμενα που απουσιάζουν από τις επιδείξεις σας: στο SO-101, 50% έναντι 40% του ACT εκτός κατανομής.
- Πολυ-εργασία γενικά: Το SmolVLA φτάνει το 78.3% σε τρεις εργασίες SO-100 με ένα σημείο ελέγχου· το ACT εκτελέστηκε μόνο ως μονο-εργασία.
- 7.6x έως 24x μεγαλύτερη καθυστέρηση: 152 έως 485 ms ανά βήμα ενέργειας έναντι 20 ms του ACT.
- 4 έως 12 USD ανά εκτέλεση αντί για 1 έως 3, και επίπεδο A100 αντί για οποιαδήποτε κάρτα 24 GB.
- Έκθεση σε άδειες χρήσης, συν ένας τρόπος αποτυχίας λόγω περιορισμένου αποθετηρίου που δεν υπάρχει από το μηδέν.
- Τα προεκπαιδευμένα βάρη μπορούν να καλύψουν ένα κακό σύνολο δεδομένων. Μια λεπτομερής ρύθμιση που λειτουργεί κατά το ήμισυ σε προβληματικά δεδομένα κοστίζει μια εβδομάδα πριν εξετάσετε τα δεδομένα.
Η περίπτωση αναπαραγωγής μιας παλιάς εκτέλεσης
Η επιδίωξη ενός σημείου ελέγχου του 2025 καθορίζει την επιλογή μοντέλου για εσάς και μετατρέπει το πρόβλημα σε κλείδωμα έκδοσης: το τρέχον LeRobot απορρίπτει το N1.5, οπότε κλειδώνετε την έκδοση lerobot==0.5.1. Χωρίς πεδίο seed και με 5 έως 6 τοις εκατό διακύμανση μεταξύ των εκτελέσεων, η αναπαραγωγή είναι κατά προσέγγιση εκ κατασκευής. και έχουν την πλευρά της πλατφόρμας.

Μείνατε σε δύο; ACT έναντι GR00T N1.7 και GR00T N1.7 έναντι SmolVLA. Οι ακατέργαστες σειρές βρίσκονται στις καταχωρήσεις της αρένας: GR00T N1.7, Pi0.5, SmolVLA και ACT.
Πού αυτή η πλατφόρμα δεν σας βοηθά
- Δεν μπορεί να κάνει την απομακρυσμένη εξαγωγή συμπερασμάτων γρήγορη. Ο βρόχος 20 έως 485 ms ανήκει στο μοντέλο· οι διαδρομές μετ' επιστροφής στο διαδίκτυο προστίθενται σε αυτόν.
- Δεν μπορεί να κάνει fine-tuning τα GR00T ή Pi0.5 στο δικό σας υλικό. Και τα δύο είναι μόνο cloud εδώ· μόνο τα SmolVLA και ACT τρέχουν τοπικά.
- Δεν μπορεί να διορθώσει ένα σύνολο δεδομένων. Η απώλεια μειώνεται αλλά η πολιτική δεν κάνει τίποτα είναι πρόβλημα δεδομένων, μια πολιτική που λειτουργεί μόνο σε μία ρύθμιση είναι πρόβλημα κάλυψης.
- Δεν μπορεί να κάνει τις εκτελέσεις του GR00T αναπαραγώγιμες: η upstream διαμόρφωση δεν έχει πεδίο seed.
85 μοντέλα, 332 αποτελέσματα συγκριτικής αξιολόγησης, κάθε αριθμός συνδεδεμένος με την πηγή του
Η ταξινομήσιμη έκδοση των πινάκων σε αυτή τη σελίδα: 85 μοντέλα όρασης-γλώσσας-δράσης, 332 αποτελέσματα συγκριτικής αξιολόγησης, το καθένα συνδεδεμένο με την εργασία ή την κάρτα μοντέλου του.
Ανοίξτε την αρέναΕπιλέγοντας ένα και προχωρώντας
Μία προεπιλογή: καταγράψτε 50 επεισόδια, εκπαιδεύστε το ACT για 1 έως 3 USD για να αποδείξετε το σύνολο δεδομένων, μετά το SmolVLA στα ίδια δεδομένα. Κάτω από 6 USD συνολικά, και απαντούν στην ερώτηση που έχει σημασία: αν η προεκπαίδευση βοηθάει εδώ, ή αν το πρόβλημα είναι τα δεδομένα. Αναβαθμίστε σε GR00T N1.7 για εργασίες πολλαπλών βημάτων με πλούσια επαφή, σε Pi0.5 όταν η σκηνή αλλάζει.
Περιήγηση στην πλατφόρμα: εκπαιδεύστε την πρώτη σας πολιτική, μετά εκτελέστε την πρώτη σας πολιτική. Τα έγγραφα εκπαίδευσης και έγγραφα συνόλων δεδομένων καλύπτουν τη μορφή και τη μορφοποίηση· η σελίδα SO-100 και ο πλήρης οδηγός SO-100 καλύπτουν την κατασκευή και τη βαθμονόμηση. Ιστορικό: η επισκόπηση VLA και το άρθρο Pi0 flow-matching. Αυτό που θα βελτιώσει το ποσοστό επιτυχίας σας είναι ο οδηγός ποιότητας δεδομένων.
Ποια πολιτική VLA πρέπει να εκπαιδεύσω πρώτα σε ένα SO-100;▾
ACT, μετά SmolVLA. Το ACT εκπαιδεύεται από το μηδέν, οπότε δεν μπορεί να καλύψει ένα κακό σύνολο δεδομένων, και μια εκτέλεση κοστίζει 1 έως 3 USD σε μια κάρτα 24 GB. Αν το ACT εκτελέσει καθόλου την εργασία, τα 4 έως 12 USD για μια εκτέλεση GR00T N1.7 ή Pi0.5 δεν πάνε χαμένα.
Είναι το GR00T N1.7 πραγματικά καλύτερο από το Pi0.5;▾
Στο LIBERO βρίσκονται εντός του θορύβου: 97.0% σε τέσσερις σουίτες για το GR00T N1.7, 96.85% για το Pi0.5 σε 30k βήματα στο openpi, 97.5% για την έκδοση LeRobot, όλα από διαφορετικά συστήματα δοκιμών. Οι πραγματικές διαφορές είναι 152 ms ανά βήμα δράσης έναντι 485 ms, σύνολα δεδομένων v2.1 έναντι v3.0, και ακρίβεια benchmark έναντι γενίκευσης σε ανοιχτό κόσμο.
Μπορώ να κάνω fine-tune κάποιο από αυτά σε μία μόνο RTX 4090;▾
SmolVLA και ACT, ναι· και τα δύο αναφέρονται για RTX 4090 ή οποιαδήποτε κάρτα 24 GB και τρέχουν τοπικά. Τα GR00T N1.7, N1.5 και Pi0.5 χρειάζονται A100 ή H100 80 GB και είναι μόνο cloud εδώ. Η NVIDIA συνιστά 40 GB ή περισσότερο για fine-tuning του GR00T· το ελάχιστο του openpi είναι πάνω από 70 GB για πλήρες fine-tune του Pi0.5, 22.5 GB για LoRA.
Ποιο από αυτά τα πέντε μπορώ να χρησιμοποιήσω εμπορικά;▾
Τα βάρη του GR00T N1.7 υπόκεινται στην Άδεια Ανοιχτού Μοντέλου της NVIDIA, η οποία, σύμφωνα με την κάρτα, καλύπτει εμπορική χρήση. Τα βάρη του N1.5 είναι μη εμπορικά. Ο κώδικας του SmolVLA είναι Apache 2.0 στο LeRobot, αλλά η κάρτα lerobot/smolvla_base δεν περιέχει πεδίο άδειας, οπότε τα βάρη δεν δηλώνονται. Το ACT δεν έχει βασικά βάρη για αδειοδότηση. Το Pi0.5 είναι αμφίσημο: τα έγγραφα του LeRobot αναφέρουν Apache 2.0, ενώ τα μεταδεδομένα της κάρτας του αναγράφουν license: gemma.
Sources
- Αποθετήριο NVIDIA Isaac-GR00T: Κατάσταση GA, αλλαγές από N1.6 σε N1.7, απαιτήσεις υλικού, περιορισμοί torchcodec και FFmpeg, launch_finetune.py, διακύμανση από εκτέλεση σε εκτέλεση
- Κάρτα μοντέλου nvidia/GR00T-N1.7-3B: Cosmos-Reason2-2B backbone, 3 B παράμετροι, πίνακας χρόνου συμπερασμάτων, Άδεια Ανοιχτού Μοντέλου NVIDIA, πεδίο Έκδοσης Μοντέλου
- Κάρτα μοντέλου nvidia/GR00T-N1.5-3B: Αναφορά Eagle 2, SigLip2 και T5, flow matching DiT, μονόδρομη μη εμπορική άδεια
- Παράδειγμα Isaac-GR00T LIBERO: ποσοστά επιτυχίας ανά σουίτα σε 20K βήματα και μέγεθος batch 640, 200 δοκιμές ανά σουίτα
- Παράδειγμα Isaac-GR00T SimplerEnv: ποσοστά επιτυχίας Bridge και Fractal ανά εργασία, GR00T N1.6 έναντι N1.7
- pi0.5: Ένα Μοντέλο Όρασης-Γλώσσας-Δράσης με Γενίκευση σε Ανοιχτό Κόσμο (2 B VLM συν 300 M ειδικός δράσης, έλεγχος 50 Hz, περίπου 400 ώρες κινητής χειραγώγησης, μελέτη κλιμάκωσης σε 3 έως 104 τοποθεσίες)
- Αποθετήριο openpi: Ελάχιστα όρια μνήμης GPU, πεδίο εφαρμογής flow-matching-head-only, και τα αποτελέσματα Pi0.5 LIBERO στο examples/libero
- Κάρτα μοντέλου lerobot/pi05_base: πεδίο εφαρμογής της έκδοσης LeRobot, license: gemma metadata, χρήση lerobot-train
- Τεκμηρίωση LeRobot pi0.5: gated PaliGemma tokenizer, πίνακας αναπαραγωγής LIBERO, n_action_steps fallback trap, δήλωση Apache 2.0
- SmolVLA: Ένα Μοντέλο Όρασης-Γλώσσας-Δράσης για Προσιτή και Αποδοτική Ρομποτική (450 M παράμετροι, πίνακες LIBERO και Meta-World, αποτελέσματα SO-100 και SO-101, ασύγχρονη συμπερασματολογία)
- Τεκμηρίωση LeRobot SmolVLA: 50 επεισόδια σε 5 θέσεις έναντι 25, 20k βήματα σε περίπου 4 ώρες σε A100
- Εκμάθηση Λεπτομερούς Αμφιδέξιας Χειραγώγησης με Υλικό Χαμηλού Κόστους (ACT και ALOHA): 6 εργασίες σε 80-90 τοις εκατό, αφαίρεση μεγέθους chunk από k=1 έως k=100
- LeRobot 0.6.2: Προεπιλογές ACTConfig και SmolVLAConfig, προεπιλεγμένο seed 1000, --accelerator.gradient_accumulation.steps, απαίτηση Python 3.12, Apache 2.0
- Τεκμηρίωση LeRobot GR00T: policy type groot, υποστήριξη N1.5 αφαιρέθηκε, pin lerobot==0.5.1, παράδειγμα μεγέθους chunk SO-101
- Κάρτα μοντέλου lerobot/smolvla_base: το βασικό checkpoint SmolVLA που χρησιμοποιείται από το --policy.path, και τα μεταδεδομένα της κάρτας του, το οποίο δεν περιέχει πεδίο άδειας
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started