
GR00T N1.7, Pi0.5, SmolVLA, ACT किंवा GR00T N1.5? वास्तविक परिस्थितीशी जुळणारी एक निर्णय सारणी, प्रकाशित बेंचमार्क संख्या, विलंबता, प्रत्येक रनचा खर्च आणि प्रत्येक निवडीमागील परवाने यासह.
आज SO-100 श्रेणीच्या आर्मवर पाच पॉलिसी प्रशिक्षित करता येतात. त्यांची इन्फरन्स लेटन्सीमध्ये 24 च्या पटीत, पॅरामीटर संख्येत 37 च्या पटीत आणि एका रनच्या खर्चात 12 च्या पटीत फरक आहे, तसेच तुम्ही परिणाम पाठवू शकता की नाही यातही फरक आहे. पाच मॉडेल कार्ड्स हे स्पष्ट करणार नाहीत: तुमच्या प्रश्नाचे उत्तर कोणीही देत नाही, मी आधी कोणते चालवू?
खालील प्रत्येक संख्या ऑगस्ट 2026 मध्ये पेपर्स, रेपो आणि कार्ड्समधून वाचली गेली आहे. प्लॅटफॉर्म संख्या येथून येतात AY-Robots policy catalog; जिथे दोन्ही असहमत आहेत, तिथे दोन्ही दाखवले आहेत.
संक्षिप्त आवृत्ती
- •तुमच्या डेटासेटबद्दल शंका असल्यास आधी ACT प्रशिक्षित करा: प्रति रन 1 ते 3 USD, खराब डेटा लपवण्यासाठी काहीही पूर्व-प्रशिक्षित नाही.
- •GR00T N1.7 आणि Pi0.5 LIBERO वर अर्ध्या पॉइंटच्या आत आहेत, 97.0 विरुद्ध 96.85 ते 97.5. हे दोन्हीपैकी एक निवडण्याचे कारण नाही.
- •Pi0.5 हे सामान्यीकरणासाठी आहे, अचूकतेसाठी नाही, आणि 485 ms सह सर्वात धीमे आहे.
- •SmolVLA, 450 M पॅरामीटर्ससह, येथे एकमेव VLA आहे जे एका 24 GB कार्डवर फाइन-ट्यून होते.
- •20 ms वरील ACT हे जलद प्रतिक्रियाशील गतीसाठी एकमेव पर्याय आहे. परवाने बाकीचे ठरवतात.
निर्णय सारणी
| तुमची परिस्थिती | याला प्रशिक्षित करा | का |
|---|---|---|
| डेटासेटची गुणवत्ता सिद्ध नाही | ACT | कोणतेही पूर्व-प्रशिक्षित मॉडेल खराब डेटासेट लपवू शकत नाही आणि अयशस्वी होण्याचा खर्च 1 ते 3 USD आहे. |
| संपर्क-समृद्ध, बहु-टप्प्यांची, भाषेवर आधारित | GR00T N1.7 | चार LIBERO सूट्सवर 97.0%, तसेच सापेक्ष एंड-इफेक्टर ॲक्शन स्पेस. |
| जलद प्रतिक्रियाशील हालचाल, सर्व्होवर अनुमान | ACT | 20 ms. पुढील सर्वात वेगवान 7.6 पट हळू आहे. |
| नवीन वस्तू, नवीन दृश्य, मुक्त-जग | Pi0.5 | 104 स्थानांपर्यंत, वितरणाबाहेरील वर्तनासाठी तयार केले आहे. |
| एक 24 GB कार्ड, तरीही भाषा हवी आहे | SmolVLA | 450 M पॅरामीटर्स, 30 एपिसोडची किमान मर्यादा, स्थानिक पातळीवर चालते. |
| 2025 मध्ये रेकॉर्ड केलेला रन पुन्हा तयार करणे | GR00T N1.5 | फक्त आवश्यक असल्यास: LeRobot आता ते नाकारते, वजन गैर-व्यावसायिक आहे. |
| हे उत्पादन म्हणून पाठवले जाईल | N1.7, SmolVLA or ACT | N1.5 गैर-व्यावसायिक आहे, Pi0.5 मध्ये Gemma अटी आहेत, SmolVLA च्या कार्डवर काहीही नमूद केलेले नाही. |
पाच उमेदवार
सर्व पाच आहेत धोरणे: कॅमेरा फ्रेम्स, जॉइंट पोझिशन्स आणि, त्यापैकी चारसाठी, एक भाषा सूचना, भविष्यातील जॉइंट लक्ष्यांच्या एका भागाशी जोडलेली. त्यांना काय वेगळे करते ते म्हणजे तुम्ही येण्यापूर्वी किती शिकले गेले होते.
| धोरण | पॅरामीटर्स | विलंबता | GPU स्तर | स्थानिक? | किमान एपिसोड | स्वरूप | खर्च |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | होय | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | होय | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | नाही | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | नाही | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | नाही | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA चे सध्याचे व्हिजन-लँग्वेज-ॲक्शन मॉडेल, सुमारे 3 अब्ज पॅरामीटर्स, अंदाजे 40 दशलक्ष फाइन-ट्यूनिंग दरम्यान प्रशिक्षण दिले गेले. रेपॉजिटरीमध्ये N1.6 पासूनचे बदल सूचीबद्ध आहेत: बॅकबोन एका वेंडर्ड ईगल मॉडेलवरून Cosmos-Reason2-2B वरील Qwen3-VL मध्ये बदलले, डिफ्यूजन लेयर्स 32 वरून 16, स्टेट आणि ॲक्शन डायमेन्शन्स 29 वरून 132, ॲक्शन होरायझन 16 वरून 40.
लहान आर्मवर महत्त्वाचे म्हणजे सापेक्ष एंड-इफेक्टर ॲक्शन स्पेस: N1.7 हे सध्याच्या पोझमधून डेल्टासचा अंदाज लावते, ज्यामुळे 20K तासांचे EgoScale मानवी व्हिडिओ रोबोट पॉलिसीमध्ये हस्तांतरित होतात. तपशील N1.7 पृष्ठावर, प्रक्रिया N1.7 ऑन SO-100 मार्गदर्शिकेत.
Isaac-GR00T README N1.7 ला जनरल अवेलेबिलिटी रिलीज म्हणून घोषित करते, ज्यात संपूर्ण बेंचमार्क आणि सपोर्ट आहे. त्याचे Hugging Face कार्ड अजून अपडेट झालेले नाही: Model Version फील्ड अजूनही GR00T N1.7 EA असे वाचते. रेपॉजिटरी हे नवीन डॉक्युमेंट आहे.
GR00T N1.5
तेच 3 B स्केल, ईगल 2 बॅकबोन, सिगलिप2 आणि T5, फ्लो-मॅचिंग डीआयटी हेड. हे तुमच्याकडे आधीपासून असलेल्या चा विस्तार करण्यासाठी अस्तित्वात आहे. दोन गोष्टींमुळे ते एक खराब डीफॉल्ट ठरते: त्याचे वजन NVIDIA चे एकतर्फी गैर-व्यावसायिक परवाना घेऊन येते, आणि सध्याच्या LeRobot रिलीझमधून N1.5 समर्थन काढून टाकण्यात आले आहे. पहा .
Pi0.5
फिजिकल इंटेलिजन्सचे VLA, पॉलिसी प्रकार pi05. हे पेपर पालीगेमापासून सुरू केलेले 2 B VLM आणि 300 M ॲक्शन एक्सपर्ट देते, जे रोबोटला 50 Hz वेगाने चालवते; LeRobot चे pi05 कॉन्फिग 50-स्टेप चंकला डीफॉल्ट करते, त्या दराने एक सेकंद. याचे मुख्य वैशिष्ट्य म्हणजे न पाहिलेली ठिकाणे: वास्तविक घरांमध्ये सुमारे 400 तास मोबाइल मॅनिप्युलेशन, आणि 3, 12, 22, 53, 82 आणि 104 ठिकाणांवर एक स्केलिंग अभ्यास, जिथे 104-ठिकाणांच्या मॉडेलने स्वतः चाचणी घरांवर प्रशिक्षित केलेल्या नियंत्रणाशी जुळले.
एक मर्यादा, जी lerobot/pi05_base कार्डवर नमूद केली आहे: पोर्ट केवळ फ्लो-मॅचिंग ॲक्शन हेड वाहून नेते. सबटास्क प्रेडिक्शन, ॲक्शन टोकेनायझेशन आणि आरएल (RL) अपस्ट्रीममध्ये रिलीज केले गेले नाहीत, आणि ओपनपी (openpi) त्यांच्या स्वतःच्या रिपॉझिटरीबद्दल तेच म्हणते. Pi0.5 पृष्ठ आणि SO-100 वरील Pi0.5 मार्गदर्शक मध्ये उर्वरित माहिती आहे.
Pi0.5 ला गेटेड google/paligemma-3b-pt-224 टोकेनायझरची आवश्यकता आहे (gated: manual, जरी Google म्हणते की विनंत्या त्वरित प्रक्रिया केल्या जातात). ते स्वीकारल्याशिवाय आणि प्रशिक्षण वातावरणात hf auth login न चालवल्यास, कार्य सुरू होते, काही काळ डाउनलोड होते, नंतर नेटवर्क फॉल्टसारख्या दिसणाऱ्या प्रमाणीकरण त्रुटीमुळे थांबते. nvidia/GR00T-N1.7-3B गेटेड नाही, परंतु त्याचे nvidia/Cosmos-Reason2-2B बॅकबोन गेटेड आहे (gated: auto). रांगेत लावण्यापूर्वी दोन्ही साफ करा; जर एखादे रन निष्क्रिय राहिले, तर अडकलेल्या रांगेचे पृष्ठ काय तपासावे याची यादी देते.
SmolVLA
450 M पॅरामीटर्स, सुमारे 100 M ॲक्शन एक्सपर्टमध्ये, SmolVLM-2 वर VLM गोठवलेले असताना आणि त्याचे फक्त पहिले 16 लँग्वेज-मॉडेल लेयर्स वापरले गेले. प्रीट्रेनिंग हे कम्युनिटी डेटा होते: 481 डेटासेट्स, 10.6 M फ्रेम्स, तुम्ही वापरता त्याच स्वस्त आर्म्समधून. येथे एकमेव VLA जे एका 24 GB कार्डमध्ये बसते, आणि एकमेव 30 एपिसोड फ्लोअर. पहा SmolVLA पृष्ठ.
ACT
हा फाउंडेशन मॉडेल नाही. ALOHA मधील ॲक्शन चंकिंग ट्रान्सफॉर्मर सुमारे 80 M पॅरामीटर्सचा आहे, जो प्रत्येक कार्यासाठी नव्याने प्रशिक्षित केला जातो, 50 Hz वर 50 प्रात्यक्षिकांवर. पेपरमध्ये सुमारे दहा मिनिटांच्या प्रत्येक प्रात्यक्षिकातून सहा वास्तविक द्वि-हस्त कार्ये नोंदवली आहेत, ज्यामध्ये ठळक केलेल्या उदाहरणांवर 80 ते 90 टक्के यश मिळाले आहे. त्याची कल्पना, ॲक्शन चंकिंग, या पृष्ठावरील प्रत्येक मॉडेलमध्ये आहे, आणि त्याचे ॲब्लेशन अजूनही सर्वात चांगला परिणाम मोजते: तात्पुरते एन्सेम्बलिंग बंद असलेल्या दोन सिम्युलेटेड कार्यांमध्ये, k=1 वर 1 टक्क्यांवरून k=100 वर 44 टक्के यश वाढते. ACT पृष्ठ मध्ये उर्वरित माहिती आहे.
बेंचमार्क प्रत्यक्षात काय सांगतात
या पाचपैकी तीन बेंचमार्क LIBERO वर आधारित आहेत: सिम्युलेटेड Franka Panda वर भाषा-आधारित कार्ये, खालील चार सूट्समध्ये प्रत्येकी दहा कार्यांमध्ये विभागलेली आहेत. NVIDIA ने प्रत्येक सूटसाठी 200 चाचण्या केल्या.
| मॉडेल | स्थानिक | वस्तू | लक्ष्य | 10 (दीर्घ) | सरासरी |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
प्रत्येक संख्या वेगवेगळ्या हार्नेस आणि बजेटमधून येते. GR00T ने ग्लोबल बॅच 640 वर 20K स्टेप्स चालवले; openpi आकृती 30K चेकपॉईंट आहे; LeRobot पोर्टने LIBERO बेस मॉडेलमध्ये 6K स्टेप्स जोडले. SmolVLA हा आणखी एक विसंगत प्रकार आहे: त्याचा पेपर LIBERO वर सुरुवातीपासून त्या पंक्तीला प्रशिक्षित करतो, VLA प्रीट्रेनिंगशिवाय, तर त्यावरील तीन प्रीट्रेन्ड चेकपॉईंट्सना फाइन-ट्यून करतात. 96.85 ते 97.5 ला एक क्लस्टर माना, आणि 87.3% पर्यंतची तफावत खरी आहे पण ती 6.7 पट पॅरामीटर्सने मिळवली आहे.
SimplerEnv प्रसार दर्शवतो, जो LIBERO दर्शवत नाही. NVIDIA N1.7 ची तुलना N1.6 शी करते, जे सार्वजनिकरित्या सर्वात जवळचे आहे जनरेशनल डेल्टा.
| SimplerEnv सूट | N1.6 सरासरी | N1.7 सरासरी | सर्वोत्तम स्विंग | सर्वात वाईट स्विंग |
|---|---|---|---|---|
| ब्रिज (WidowX), 7 कार्ये | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| फ्रॅक्टल (Google रोबोट), 6 कार्ये | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | काहीही नाही, प्रत्येक कार्य सुधारले |
ब्रिज रो उपयुक्त आहे: सरासरी 5.7 गुण मिळाले, तर put_eggplant_in_basket 36 गमावले आणि put_eggplant_in_sink 33 वरून 2 पर्यंत खाली आले. एक नवीन पिढी वितरण उचलण्याऐवजी ते हलवते, त्यामुळे जर तुमचे कार्य N1.7 ने कमी झालेल्या ठिकाणी असेल, तर सरासरी काहीही सांगत नाही.

पाचपैकी, केवळ SmolVLA पेपर SO-100 क्लास आर्मवर अहवाल देतो: SmolVLA साठी 78.3 टक्के आणि तीन कार्यांमध्ये Pi0 साठी 61.7, दोन्ही मल्टी-टास्क, ACT प्रशिक्षित सिंगल-टास्कसाठी 48.3 च्या तुलनेत, जे सारखे नाही. SO-101 पिक-अँड-प्लेसवर स्वच्छ जोडी दोन्ही सिंगल-टास्क आहे: वितरणात 90 विरुद्ध 70, 50 विरुद्ध 40 त्याच्या बाहेर. तुलना करा ACT विरुद्ध SmolVLA आणि Pi0.5 विरुद्ध SmolVLA, किंवा ब्राउझ करा अरेना.
विलंबता आणि खर्च तैनाती ठरवतात
इन्फरन्स लेटन्सी ही अशी मर्यादा आहे जी लोकांना सर्वात शेवटी कळते आणि सर्वात आधी पश्चात्ताप होतो. बेंचमार्कवर पाच गुण अधिक चांगली असलेली पॉलिसी, परंतु प्रति क्रिया अर्धा सेकंद अधिक वेळ घेणारी, तुमच्या डेस्कवर वाईट दिसते: संपर्क डायनॅमिक्स थांबत नाहीत.
एक चेतावणी: GR00T आकडेवारी NVIDIA च्या कार्डशी जुळत नाही, जे 4 डीनोइजिंग स्टेप्स आणि एका कॅमेऱ्यासाठी H100 वर ईगर मोडमध्ये 85.8 ms, torch.compile सह 48.6 ms, पूर्ण TensorRT द्वारे 27.9 ms वेळ घेते. येथे दिलेले 152 ms हे सर्व्हिंग ओव्हरहेड आणि एकापेक्षा जास्त कॅमेऱ्यांसह संपूर्ण स्टॅकचे आकडे आहेत, केवळ फॉरवर्ड पासचे नाहीत.
20 ते 485 ms चा लूप मॉडेलचा आहे आणि सार्वजनिक-इंटरनेट राऊंड ट्रिप्स त्यात भर घालतात. रिमोट इन्फरन्स हळू पिक-अँड-प्लेससाठी व्यवहार्य आहे, जलद प्रतिक्रियाशील गतीसाठी नाही. जर तुमच्या कार्याला गतीची आवश्यकता असेल, तर इन्फरन्स सर्व्होच्या शेजारीच असावे: ACT किंवा SmolVLA, स्थानिक पातळीवर. संबंधित: पॉलिसी मध्य-गतीमध्ये थांबते.
मॉडेल न बदलता वेळ वाचवण्याचा एक मार्ग: SmolVLA पेपर सिंक्रोनस एक्झिक्यूशन मोजतो, जिथे पॉलिसी पुढील भविष्यवाणी करण्यापूर्वी एक भाग पूर्ण करते, याउलट असिंक्रोनसमध्ये, जिथे भविष्यवाणी एक्झिक्यूशनवर ओव्हरलॅप होते. यश सारखेच आहे, 78.3 विरुद्ध 73.3, परंतु तेच पिक-अँड-प्लेस 13.75 सेकंदांऐवजी 9.7 सेकंद घेते, आणि एका निश्चित विंडोमध्ये रोबोट 9 ऐवजी 19 सायकल व्यवस्थापित करतो.
परवाने, तपासले कारण कोणीही ते तपासत नाही
| मॉडेल | वजन परवाना | कोड परवाना | व्यावसायिक वापर |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; कार्ड व्यावसायिक वापरास परवानगी देते | Apache 2.0 | होय |
| GR00T N1.5 | NVIDIA एकतर्फी गैर-व्यावसायिक परवाना | Apache 2.0 | नाही |
| Pi0.5 | pi05_base कार्ड मेटाडेटा परवाना वाचतो: gemma | Apache 2.0 (openpi, LeRobot docs) | दोन्ही वाचा, ते सहमत नाहीत |
| SmolVLA | smolvla_base कार्डवर परवाना क्षेत्र नाही | Apache 2.0 (LeRobot) | कोड होय, वजन नमूद केलेले नाही |
| ACT | कोणतेही मूळ वजन अस्तित्वात नाही | Apache 2.0 (LeRobot) | होय |
Pi0.5 पंक्तीकडे लक्ष देणे आवश्यक आहे. LeRobot pi05 दस्तऐवजीकरण openpi शी सुसंगत Apache 2.0 नमूद करते, तर हब कार्डसाठी lerobot/pi05_base मध्ये आहे license: gemma. दोन्ही सक्रिय आहेत. GR00T N1.7 ची सौम्य आवृत्ती आहे: Isaac-GR00T README मध्ये असे नमूद केले आहे की N1.7 Apache 2.0 अंतर्गत पूर्णपणे व्यावसायिकरित्या परवानायोग्य आहे, तर त्याचा स्वतःचा परवाना विभाग आणि मॉडेल कार्ड केवळ कोड Apache 2.0 अंतर्गत आणि वजन NVIDIA Open Model License अंतर्गत ठेवतात.
तुम्ही प्रत्यक्षात चालवणार असलेले डीफॉल्ट
प्रत्येक ट्रेनर फॉर्म डीफॉल्टसह येतो आणि ते मनमानी नसतात. ACT चे LeRobot चे स्वतःचे आहेत: बॅच 8, lr 1e-5, 100000 प्रशिक्षण पायऱ्या, चंक आकार 100, ACTConfig अपस्ट्रीमशी जुळणारे आणि k=100 from the ACT paper. खालील एक स्तंभ एक सापळा आहे.
| धोरण | बॅच | LR | जास्तीत जास्त पायऱ्या | ग्रेड संचय | लागू होते का? | अतिरिक्त नियंत्रणे |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | होय | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | होय | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | नाही (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | नाही | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | नाही | chunkSize, nActionSteps, seed, logFreq |
GR00T चे फाइन-ट्यूनिंग एंट्री पॉइंट (launch_finetune.py, एक tyro CLI) मध्ये त्याच्या कॉन्फिग डेटाक्लासमध्ये सीड फील्ड नाही, त्यामुळे रन बिट-फॉर-बिट पुनरुत्पादक नाहीत. रेपो देखील नॉन-डिटरमिनिस्टिक इमेज ऑगमेंटेशन्समुळे रनमध्ये 5 ते 6 टक्के फरक असल्याची चेतावणी देतो, जे ऑनलाइन वादविवाद केलेल्या बहुतेक बेंचमार्क गॅप्सपेक्षा मोठे आहे. LeRobot ची डीफॉल्ट सीड 1000 आहे. ग्रेड-संचय स्तंभ lerobot 0.5.1 चे वर्णन करतो; अपस्ट्रीम 0.6.2 ते --accelerator.gradient_accumulation.steps म्हणून उघड करते.
मॉडेल निवडीपेक्षा अधिक महत्त्वाचे नियंत्रण
हा ॲक्शन चंक आहे. मोठे चंक्स अधिक गुळगुळीत हालचाल आणि कमी संमिश्र चुका देतात, परंतु ब्लॉक कार्यान्वित होत असताना पॉलिसी वचनबद्ध असते, त्यामुळे ती हलणाऱ्या कोणत्याही गोष्टीला उशिरा प्रतिसाद देते: स्थिर क्यूबवर आत्मविश्वासपूर्ण, फिरणाऱ्या क्यूबवर निराशाजनक. जर ते ओव्हरशूट झाले, तर कार्यान्वित केलेला भाग लहान करणे पुन्हा प्रशिक्षण देण्यापेक्षा चांगले आहे आणि ते विनामूल्य आहे. लवकर थांबणारा जॉइंट ही एक वेगळी समस्या आहे; पहा .
- ACT: ACTConfig defaults to
chunk_size 100andn_action_steps 100. टेम्पोरल एन्सेम्बलिंग बंद आहे आणि त्यालाn_action_steps 1आवश्यक आहे. - GR00T N1.7: आंतरिक होरायझन 16 वरून 40 पर्यंत गेला, तरीही LeRobot चे SO-101 उदाहरण अजूनही
--policy.chunk_size=16 --policy.n_action_steps=16चालवते. रोलआउट फ्लॅगचे नाव बदलून--execution-horizonअसे करण्यात आले. - Pi0.5: 50-स्टेपचा चंक, ज्यापैकी LeRobot ची LIBERO रेसिपी
--policy.n_action_steps=10द्वारे 10 कार्यान्वित करते;--policy.pretrained_pathसह, जर तुम्ही फ्लॅग वगळला तर ते 50 वर परत येते. - SmolVLA: 50-ॲक्शन चंक्स, दोन्ही नॉब्स उपलब्ध आहेत.
एका दुपारमध्ये पाचही कसे तपासावे
सर्वात स्वस्त उत्तर म्हणजे अधिक वाचन नाही. सुमारे 15 USD खर्च करा आणि रोबोटला तुम्हाला सांगू द्या: एकदा रेकॉर्ड करा, प्रथम स्वस्त मॉडेलला प्रशिक्षित करा, एकदा डेटा योग्य असल्याचे सिद्ध झाल्यावर पुढे वाढवा. संरचनेला प्रमाणापेक्षा महत्त्व आहे, हे आणि चा उद्देश आहे.
- 150 एपिसोड्स एकदा रेकॉर्ड करा
GR00T, Pi0.5 आणि ACT साठी पन्नास, आणि SmolVLA च्या तीस साठी जागा मोकळी करते. प्रत्येक भिन्नता पातळ न पसरवता पुन्हा करा: 50 क्यूब पोझिशन्समध्ये 50 एपिसोड्स प्रशिक्षित केले, जिथे 25 केले नाहीत. तुमचा पहिला डेटासेट रेकॉर्ड करा.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2आधी ACT ला प्रशिक्षित करा, कारण ते तुम्हाला खोटे बोलू शकत नाही
कोणतेही पूर्व-प्रशिक्षित वजन नाही, त्यामुळे जर ते कार्य करत असेल, तर तुमच्या डेटासेटमध्ये ते कार्य आहे. जर ACT सपाट झाले, तर डेटा दुरुस्त करा. 24 GB कार्डवर 1 ते 3 USD, 2 ते 5 तास.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLA ला त्याच डेटासेटवर, न बदलता चालवा
तोच डेटा, तोच आर्म, 80 M ऐवजी 450 M पॅरामीटर्स, अधिक भाषा कंडिशनिंग. LeRobot एका A100 वर अंदाजे 4 तासांत 20K स्टेप्स चालवते. पूर्व-प्रशिक्षण काही फायदा देते की नाही हे यावरून कळते.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T वापरण्यापूर्वी v2.1 मध्ये रूपांतरित करा
GR00T LeRobot v2 फॉरमॅटचा एक प्रकार वाचतो, तसेच
meta/modality.jsonहे अतिरिक्त मॅपिंग वाचतो, जे एकत्रित स्थिती आणि क्रिया ॲरेचे नामांकित फील्डमध्ये कसे विभाजन होते हे दर्शवते. v3.0 डेटासेट तो लोडर क्रॅश करतो, कारण v3.0 अनेक एपिसोड्स सामायिक फाइल्समध्ये पॅक करतो जिथे v2 प्रत्येक एपिसोडसाठी एक फाइल लिहितो. Isaac-GR00Tscripts/lerobot_conversion/convert_v3_to_v2.pyम्हणून डाउनग्रेड हेल्पर पाठवते; v3 नाकारण्याचे पृष्ठ हा जलद मार्ग आहे.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5पहिले दोन पर्याय अपुरे पडल्यासच GR00T N1.7 कडे जा
येथे दर्शविलेल्या NVIDIA च्या CLI द्वारे, किंवा LeRobot च्या
grootपॉलिसी प्रकाराद्वारे. NVIDIA फाइन-ट्यूनिंगसाठी 40 GB किंवा अधिक VRAM, आणि इन्फरन्ससाठी 16 GB VRAM ची शिफारस करते. OOM झाल्यास, OOM पृष्ठ पहा.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
ती स्क्रीनिंग पास चालवण्याचे दोन मार्ग
तीन वातावरण, कारण टूलचेन एकत्र अस्तित्वात नाहीत. मुख्यवरील LeRobot 0.6.2 आहे आणि त्याला Python 3.12 किंवा नवीन आवृत्तीची आवश्यकता आहे; Isaac-GR00T आणि openpi हे स्वतंत्र uv-व्यवस्थापित रेपो आहेत.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0 ला त्याचे एकमेव व्हिडिओ बॅकएंड म्हणून वापरते, ज्यासाठी FFmpeg 4 ते 7 आवश्यक आहे. FFmpeg 8 ला समर्थन नाही, AV1 ची हमी नाही. - openpi मेमरी मर्यादा: इन्फरन्स 8 GB च्या वर, LoRA 22.5 GB च्या वर, पूर्ण फाइन-ट्यूनिंग 70 GB च्या वर. शेवटचे कारण म्हणजे Pi0.5 हे A100 चे काम आहे.
- GPU स्वतः भाड्याने घ्या, नंतर ते नष्ट करा, चेकपॉईंट पाथचे तीन संच हाताने जुळवा.
तेच पाच मॉडेल्स, एकच फॉर्म. मॉडेल, डेटासेट आणि हायपरपॅरामीटर्स निवडा; बॅकएंड आवश्यक VRAM नुसार GPU भाड्याने घेते, ट्रेनर चालवते आणि ऑब्जेक्ट स्टोरेजमध्ये लिहिते.
- प्रशिक्षण मॅट्रिक्स हे चार आर्म्सद्वारे पाच मॉडेल्स आहेत, प्रत्येक सेल एक मार्गदर्शक आहे: SO-100 वर SmolVLA, SO-101 वर ACT.
- इन्फरन्स पॉड्स
/api/inference/podद्वारे निष्क्रिय वॉचडॉगसह स्वयंचलितपणे प्रदान केले जातात, त्यामुळे विसरलेला पॉड शांतपणे बिल करत नाही. - मूळ चेकपॉईंट्स विक्रेत्यांचे स्वतःचे आहेत:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT कडे कोणतेही नाहीत. - CLI मधून आणि MCP सर्व्हर द्वारे AI एजंट्सकडून समान ऑपरेशन्स.
- हार्डवेअर नाही? लाइव्ह आर्म कोणत्याही साइनअपशिवाय भौतिक SO-100 प्रवाहित करते; प्रयत्न पृष्ठ प्रवेशाचे मार्ग दर्शवते.
फाउंडेशन मॉडेल किंवा सुरुवातीपासून
खरा प्रश्न कोणता 3 B मॉडेल निवडायचा हा नाही. तर, प्रीट्रेन्ड VLA वापरायचा की नाही, हे आहे, हे लक्षात घेता की ACT ने प्रत्येक दहा मिनिटांच्या प्रात्यक्षिकांमधून सहा वास्तविक द्वि-हस्त कार्ये शिकली, 80 M पॅरामीटर्ससह आणि काहीही प्रीट्रेन्ड नसताना.
- भाषा कंडिशनिंग. ACT मध्ये हे नाही; एक ACT चेकपॉईंट एकच कार्य करतो.
- तुमच्या प्रात्यक्षिकांमध्ये नसलेल्या वस्तूंवर चांगले: SO-101 वर, ACT च्या 40% आउट ऑफ डिस्ट्रिब्युशनच्या तुलनेत 50%.
- मल्टी-टास्क: SmolVLA एका चेकपॉईंटसह तीन SO-100 कार्यांमध्ये 78.3% पर्यंत पोहोचते; ACT फक्त सिंगल-टास्क चालवले गेले.
- 7.6x ते 24x विलंब: ACT च्या 20 ms च्या तुलनेत प्रति क्रिया पायरी 152 ते 485 ms.
- 1 ते 3 ऐवजी प्रति रन 4 ते 12 USD, आणि कोणत्याही 24 GB कार्डऐवजी A100 टियर.
- परवाना एक्सपोजर, तसेच गेटेड-रेपो फेल्युअर मोड जो सुरुवातीपासून अस्तित्वात नाही.
- प्रीट्रेन्ड वेट्स खराब डेटासेट लपवू शकतात. तुटलेल्या डेटावर अर्धवट काम करणार्या फाइन-ट्यूनसाठी डेटा पाहण्यापूर्वी एक आठवडा लागतो.
जुन्या रनची पुनरावृत्ती करण्याची केस
2025 च्या चेकपॉईंटचा पाठपुरावा केल्याने तुमच्यासाठी मॉडेलची निवड होते आणि समस्या व्हर्जन पिनिंगमध्ये बदलते: सध्याचे LeRobot N1.5 नाकारते, म्हणून तुम्ही पिन करा lerobot==0.5.1. सीड फील्ड नसताना आणि रनमध्ये 5 ते 6 टक्के फरक असल्याने , पुनरुत्पादन अंदाजे असते. आणि प्लॅटफॉर्म बाजू आहे.

दोन पर्यंत खाली आले आहे का? आणि . कच्च्या पंक्ती एरिना नोंदींमध्ये आहेत: , , आणि .
हे प्लॅटफॉर्म तुम्हाला कुठे मदत करत नाही
- ते रिमोट इन्फरन्स जलद करू शकत नाही. 20 ते 485 ms चा लूप मॉडेलचा आहे; इंटरनेट राऊंड ट्रिप्स त्यात भर घालतात.
- ते तुमच्या स्वतःच्या हार्डवेअरवर GR00T किंवा Pi0.5 ला फाइन-ट्यून करू शकत नाही. येथे दोन्ही केवळ क्लाउड-आधारित आहेत; फक्त SmolVLA आणि ACT स्थानिक पातळीवर चालतात.
- ते डेटासेट दुरुस्त करू शकत नाही. लॉस कमी होतो पण पॉलिसी काही करत नाही ही डेटाची समस्या आहे, फक्त एका सेटअपमध्ये काम करणारी पॉलिसी ही कव्हरेजची समस्या आहे.
- ते GR00T रन पुनरुत्पादक बनवू शकत नाही: कारण अपस्ट्रीम कॉन्फिगमध्ये सीड फील्ड नाही.
85 मॉडेल्स, 332 बेंचमार्क परिणाम, प्रत्येक संख्या तिच्या स्रोताशी जोडलेली
या पृष्ठावरील सारण्यांची क्रमवारी लावता येण्याजोगी आवृत्ती: 85 व्हिजन-लँग्वेज-ॲक्शन मॉडेल्स, 332 बेंचमार्क परिणाम, प्रत्येक त्याच्या पेपर किंवा मॉडेल कार्डशी जोडलेला आहे.
अरेना उघडाएक निवडणे आणि पुढे जाणे
एक डीफॉल्ट: 50 एपिसोड रेकॉर्ड करा, डेटासेट सिद्ध करण्यासाठी 1 ते 3 USD मध्ये ACT ला प्रशिक्षित करा, नंतर SmolVLA ला त्याच डेटावर प्रशिक्षित करा. एकत्रितपणे 6 USD पेक्षा कमी खर्चात, आणि ते महत्त्वाच्या प्रश्नाचे उत्तर देतात: येथे प्रीट्रेनिंग मदत करते की नाही, किंवा अडचण डेटा आहे की नाही. संपर्क-समृद्ध मल्टी-स्टेप कार्यांसाठी GR00T N1.7 कडे जा, जेव्हा दृश्य बदलते तेव्हा Pi0.5 कडे जा.
प्लॅटफॉर्म वॉकथ्रू: तुमची पहिली पॉलिसी प्रशिक्षित करा, नंतर तुमची पहिली पॉलिसी चालवा. प्रशिक्षण डॉक्स आणि डेटासेट डॉक्स फॉर्म आणि फॉरमॅट कव्हर करतात; SO-100 पृष्ठ आणि संपूर्ण SO-100 मार्गदर्शक बिल्ड आणि कॅलिब्रेशन कव्हर करतात. पार्श्वभूमी: VLA विहंगावलोकन आणि Pi0 फ्लो-मॅचिंग लेख. तुमचा यश दर वाढवणारे आहे डेटा गुणवत्ता मार्गदर्शक.
SO-100 वर मी प्रथम कोणती VLA पॉलिसी प्रशिक्षित करावी?▾
ACT, त्यानंतर SmolVLA. ACT सुरुवातीपासून प्रशिक्षण घेते, त्यामुळे ते खराब डेटासेट लपवू शकत नाही, आणि 24 GB कार्डवर एका रनसाठी 1 ते 3 USD खर्च येतो. जर ACT ने हे कार्य केलेच, तर GR00T N1.7 किंवा Pi0.5 रनसाठी लागणारे 4 ते 12 USD वाया जात नाहीत.
GR00T N1.7 खरोखरच Pi0.5 पेक्षा चांगले आहे का?▾
LIBERO वर ते आवाजाच्या मर्यादेत आहेत: GR00T N1.7 साठी चार सूट्समध्ये 97.0%, openpi मध्ये 30k स्टेप्सवर Pi0.5 साठी 96.85%, LeRobot पोर्टसाठी 97.5%, हे सर्व वेगवेगळ्या हार्नेसवरून आहेत. वास्तविक फरक 485 ms च्या तुलनेत प्रति ॲक्शन स्टेप 152 ms आहे, v3.0 च्या तुलनेत v2.1 डेटासेट, आणि ओपन-वर्ल्ड जनरलायझेशनच्या तुलनेत बेंचमार्क अचूकता.
मी यापैकी कोणतेही एका RTX 4090 वर फाइन-ट्यून करू शकतो का?▾
SmolVLA आणि ACT, होय; दोन्ही RTX 4090 किंवा कोणत्याही 24 GB कार्डसाठी सूचीबद्ध आहेत आणि स्थानिक पातळीवर चालतात. GR00T N1.7, N1.5 आणि Pi0.5 ला A100 किंवा H100 80 GB ची आवश्यकता आहे आणि येथे ते केवळ क्लाउड-आधारित आहेत. NVIDIA GR00T फाइन-ट्यूनिंगसाठी 40 GB किंवा त्याहून अधिक शिफारस करते; पूर्ण Pi0.5 फाइन-ट्यूनसाठी openpi ची किमान मर्यादा 70 GB पेक्षा जास्त आहे, LoRA साठी 22.5 GB.
या पाचपैकी मी व्यावसायिकरित्या कोणते वापरू शकतो?▾
GR00T N1.7 चे वेट्स NVIDIA Open Model License Agreement अंतर्गत आहेत, जे कार्डनुसार व्यावसायिक वापरासाठी आहेत. N1.5 चे वेट्स गैर-व्यावसायिक आहेत. SmolVLA चा कोड LeRobot मध्ये Apache 2.0 आहे, परंतु lerobot/smolvla_base कार्डवर कोणतेही परवाना क्षेत्र नाही, त्यामुळे वेट्स नमूद केलेले नाहीत. ACT ला परवाना देण्यासाठी कोणतेही बेस वेट्स नाहीत. Pi0.5 संदिग्ध आहे: LeRobot च्या डॉक्समध्ये Apache 2.0 असे म्हटले आहे, त्याच्या कार्ड मेटाडेटामध्ये परवाना: gemma असे वाचले आहे.
Sources
- NVIDIA Isaac-GR00T रिपॉझिटरी: GA स्थिती, N1.6 ते N1.7 मधील बदल, हार्डवेअर आवश्यकता, torchcodec आणि FFmpeg मर्यादा, launch_finetune.py, रन-टू-रन भिन्नता
- nvidia/GR00T-N1.7-3B मॉडेल कार्ड: Cosmos-Reason2-2B बॅकबोन, 3 B पॅरामीटर्स, इन्फरन्स टाइमिंग टेबल, NVIDIA ओपन मॉडेल परवाना, मॉडेल आवृत्ती फील्ड
- nvidia/GR00T-N1.5-3B मॉडेल कार्ड: Eagle 2 संदर्भ, SigLip2 आणि T5, फ्लो मॅचिंग DiT, एकतर्फी गैर-व्यावसायिक परवाना
- Isaac-GR00T LIBERO उदाहरण: 20K स्टेप्स आणि बॅच आकार 640 वर प्रति-सूट यश दर, प्रति सूट 200 चाचण्या
- Isaac-GR00T SimplerEnv उदाहरण: प्रति-कार्य ब्रिज आणि फ्रॅक्टल यश दर, GR00T N1.6 विरुद्ध N1.7
- pi0.5: ओपन-वर्ल्ड जनरलायझेशनसह एक व्हिजन-लँग्वेज-ॲक्शन मॉडेल (2 B VLM अधिक 300 M ॲक्शन एक्सपर्ट, 50 Hz नियंत्रण, सुमारे 400 तास मोबाइल मॅनिप्युलेशन, 3 ते 104 स्थानांवर स्केलिंग अभ्यास)
- openpi रिपॉझिटरी: GPU मेमरी फ्लोर्स, फ्लो-मॅचिंग-हेड-ओन्ली स्कोप, आणि examples/libero मधील Pi0.5 LIBERO परिणाम
- lerobot/pi05_base मॉडेल कार्ड: LeRobot पोर्टचा स्कोप, परवाना: gemma मेटाडेटा, lerobot-train वापर
- LeRobot pi0.5 डॉक्युमेंटेशन: गेटेड PaliGemma टोकेनायझर, LIBERO पुनरुत्पादन टेबल, n_action_steps फॉलबॅक ट्रॅप, Apache 2.0 विधान
- SmolVLA: परवडणाऱ्या आणि कार्यक्षम रोबोटिक्ससाठी एक व्हिजन-लँग्वेज-ॲक्शन मॉडेल (450 M पॅरामीटर्स, LIBERO आणि Meta-World टेबल्स, SO-100 आणि SO-101 परिणाम, असिंक्रोनस इन्फरन्स)
- LeRobot SmolVLA डॉक्युमेंटेशन: 25 च्या तुलनेत 5 स्थानांवर 50 एपिसोड्स, A100 वर सुमारे 4 तासांत 20k स्टेप्स
- कमी किमतीच्या हार्डवेअरसह फाइन-ग्रेन्ड बायमॅन्युअल मॅनिप्युलेशन शिकणे (ACT आणि ALOHA): 80-90 टक्के दराने 6 कार्ये, k=1 ते k=100 पर्यंत चंक आकार ॲब्लेशन
- LeRobot 0.6.2: ACTConfig आणि SmolVLAConfig डीफॉल्ट्स, डीफॉल्ट सीड 1000, --accelerator.gradient_accumulation.steps, Python 3.12 आवश्यकता, Apache 2.0
- LeRobot GR00T डॉक्युमेंटेशन: पॉलिसी प्रकार groot, N1.5 समर्थन काढले, lerobot==0.5.1 पिन करा, SO-101 चंक आकार उदाहरण
- lerobot/smolvla_base मॉडेल कार्ड: --policy.path द्वारे वापरलेला SmolVLA बेस चेकपॉइंट, आणि त्याचे कार्ड मेटाडेटा, ज्यामध्ये कोणतेही परवाना क्षेत्र नाही
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started