
GR00T N1.7, Pi0.5, SmolVLA, ACT या GR00T N1.5? वास्तविक स्थितियों से मेल खाने वाली एक निर्णय तालिका, जिसमें प्रकाशित बेंचमार्क संख्याएँ, विलंबता, प्रति रन लागत और प्रत्येक विकल्प के पीछे के लाइसेंस शामिल हैं।
आज SO-100 श्रेणी के आर्म पर पाँच नीतियाँ प्रशिक्षित की जा सकती हैं। वे अनुमान में 24 के कारक से भिन्न हैं विलंबता, पैरामीटर गणना में 37 और एक रन की लागत में 12 के कारक से भिन्न हैं, और क्या आप परिणाम भेज सकते हैं। पाँच मॉडल कार्ड इसे तय नहीं करेंगे: कोई भी आपके प्रश्न का उत्तर नहीं देता है, कि मैं पहले कौन सा चलाऊँ?
नीचे दिया गया हर नंबर अगस्त 2026 में कागजात, रेपो और कार्ड से पढ़ा गया था। प्लेटफ़ॉर्म नंबर आते हैं से AY-Robots नीति कैटलॉग; जहाँ दोनों असहमत हैं, दोनों दिखाए गए हैं।
संक्षिप्त संस्करण
- •यदि आपको अपने डेटासेट पर संदेह है तो पहले ACT को प्रशिक्षित करें: 1 से 3 USD प्रति रन, खराब डेटा को छिपाने के लिए कुछ भी पूर्व-प्रशिक्षित नहीं।
- •GR00T N1.7 और Pi0.5 LIBERO पर आधे बिंदु के भीतर हैं, 97.0 बनाम 96.85 से 97.5। यह किसी एक को चुनने का कारण नहीं है।
- •Pi0.5 सामान्यीकरण के लिए है, सटीकता के लिए नहीं, और 485 ms पर सबसे धीमा है।
- •SmolVLA, 450 M पैरामीटर पर, यहाँ एकमात्र VLA है जो एक 24 GB कार्ड पर फाइन-ट्यून होता है।
- •ACT 20 ms पर तेज़ प्रतिक्रियाशील गति के लिए एकमात्र विकल्प है। लाइसेंस बाकी तय करते हैं।
निर्णय तालिका
| आपकी स्थिति | इसे प्रशिक्षित करें | क्यों |
|---|---|---|
| डेटासेट की गुणवत्ता अप्रमाणित | ACT | कोई भी पूर्व-प्रशिक्षित मॉडल टूटे हुए डेटासेट को नहीं छिपा सकता, और विफलता की लागत 1 से 3 USD है। |
| संपर्क-समृद्ध, बहु-चरणीय, भाषा-आधारित | GR00T N1.7 | चार LIBERO सुइट्स पर 97.0%, साथ ही एक सापेक्ष एंड-इफेक्टर एक्शन स्पेस। |
| तेज प्रतिक्रियाशील गति, सर्वो पर अनुमान | ACT | 20 ms। अगला सबसे तेज 7.6 गुना धीमा है। |
| नई वस्तुएं, नया दृश्य, खुली दुनिया | Pi0.5 | 104 स्थानों तक, आउट-ऑफ-डिस्ट्रीब्यूशन व्यवहार के लिए निर्मित। |
| एक 24 GB कार्ड, फिर भी भाषा चाहते हैं | SmolVLA | 450 M पैरामीटर, 30 एपिसोड का न्यूनतम स्तर, स्थानीय रूप से चलता है। |
| 2025 में रिकॉर्ड किए गए रन को पुनरुत्पादित करना | GR00T N1.5 | केवल तभी जब आपको करना हो: LeRobot अब इसे अस्वीकार करता है, वज़न गैर-व्यावसायिक हैं। |
| यह एक उत्पाद के रूप में शिप होगा | N1.7, SmolVLA or ACT | N1.5 गैर-व्यावसायिक है, Pi0.5 में Gemma की शर्तें हैं, SmolVLA के कार्ड में कोई नहीं है। |
पांच उम्मीदवार
सभी पांच नीतियां हैं: कैमरा फ्रेम, संयुक्त स्थितियां और, उनमें से चार के लिए, एक भाषा निर्देश, जिसे भविष्य के संयुक्त लक्ष्यों के एक हिस्से में मैप किया गया है। उन्हें जो अलग करता है वह यह है कि आपके आने से पहले कितना सीखा गया था।
| पॉलिसी | पैरामीटर्स | विलंबता | GPU टियर | स्थानीय? | न्यूनतम एपिसोड | फॉर्मेट | लागत |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | हाँ | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | हाँ | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | नहीं | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | नहीं | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | नहीं | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA का वर्तमान विजन-लैंग्वेज-एक्शन मॉडल, लगभग 3 बिलियन पैरामीटर, जिसमें से लगभग 40 मिलियन फाइन-ट्यूनिंग के दौरान प्रशिक्षित किए गए। रेपो में N1.6 से डेल्टा सूचीबद्ध हैं: बैकबोन एक वेंडर्ड ईगल मॉडल से Qwen3-VL पर Cosmos-Reason2-2B में, डिफ्यूजन लेयर्स 32 से 16, स्टेट और एक्शन डाइमेंशन 29 से 132, एक्शन होराइजन 16 से 40।
एक छोटी भुजा पर जो मायने रखता है वह सापेक्ष एंड-इफेक्टर एक्शन स्पेस है: N1.7 वर्तमान पोज़ से डेल्टा की भविष्यवाणी करता है, जो 20K घंटे के ईगोस्केल मानव वीडियो को रोबोट पॉलिसी में स्थानांतरित करने देता है। स्पेसिफिकेशन N1.7 पेज पर, प्रक्रिया SO-100 गाइड पर N1.7 में।
Isaac-GR00T README N1.7 को जनरल अवेलेबिलिटी रिलीज़ घोषित करता है, जिसमें पूर्ण बेंचमार्क और समर्थन शामिल है। इसका Hugging Face कार्ड अभी तक अपडेट नहीं हुआ है: the Model Version फ़ील्ड अभी भी GR00T N1.7 EA दिखाता है। रेपो नया दस्तावेज़ है।
GR00T N1.5
वही 3 B स्केल, ईगल 2 बैकबोन, सिगलिप2 और T5, फ्लो-मैचिंग DiT हेड। यह आपके पास पहले से मौजूद एक को विस्तारित करने के लिए मौजूद है। दो बातें इसे एक खराब डिफ़ॉल्ट बनाती हैं: इसके वज़न में NVIDIA का एकतरफा गैर-व्यावसायिक लाइसेंस है, और वर्तमान LeRobot रिलीज़ ने N1.5 समर्थन हटा दिया है। देखें .
Pi0.5
फिजिकल इंटेलिजेंस का VLA, पॉलिसी प्रकार pi05। यह पेपर पालिगेमा से इनिशियलाइज़्ड 2 B VLM और 300 M एक्शन एक्सपर्ट देता है, जो रोबोट को 50 Hz पर चलाता है; LeRobot का pi05 कॉन्फ़िग डिफ़ॉल्ट रूप से 50-स्टेप चंक पर सेट होता है, उस दर पर एक सेकंड। इसका मुख्य विक्रय बिंदु अनदेखी जगहें हैं: वास्तविक घरों में लगभग 400 घंटे का मोबाइल मैनिपुलेशन, और 3, 12, 22, 53, 82 और 104 स्थानों पर एक स्केलिंग अध्ययन, जहाँ 104-स्थान मॉडल ने स्वयं परीक्षण घरों पर प्रशिक्षित नियंत्रण से मेल खाया।
एक सीमा, जो इस पर बताई गई है lerobot/pi05_base कार्ड पर: पोर्ट केवल फ्लो-मैचिंग एक्शन हेड को वहन करता है। सबटास्क प्रेडिक्शन, एक्शन टोकनाइजेशन और आरएल को अपस्ट्रीम जारी नहीं किया गया था, और ओपनपी अपने रिपॉजिटरी के बारे में भी यही कहता है। Pi0.5 पेज और SO-100 पर Pi0.5 गाइड में बाकी जानकारी है।
Pi0.5 को गेटेड google/paligemma-3b-pt-224 टोकनाइज़र की आवश्यकता है (gated: manual, हालांकि Google का कहना है कि अनुरोध तुरंत संसाधित किए जाते हैं)। इसे स्वीकार किए बिना और ट्रेनिंग एनवायरनमेंट में hf auth login चलाए बिना, जॉब शुरू होती है, थोड़ी देर डाउनलोड होती है, फिर एक ऑथराइजेशन एरर पर रुक जाती है जो नेटवर्क फॉल्ट जैसा लगता है। nvidia/GR00T-N1.7-3B गेटेड नहीं है, लेकिन इसका nvidia/Cosmos-Reason2-2B बैकबोन है (gated: auto)। क्यू में डालने से पहले दोनों को क्लियर करें; यदि कोई रन निष्क्रिय रहता है, तो स्टक-क्यू पेज बताता है कि क्या जांचना है।
SmolVLA
450 M पैरामीटर, एक्शन एक्सपर्ट में लगभग 100 M, SmolVLM-2 पर VLM को फ्रीज करके और केवल इसकी पहली 16 लैंग्वेज-मॉडल लेयर्स का उपयोग किया गया। प्रीट्रेनिंग कम्युनिटी डेटा था: 481 डेटासेट, 10.6 M फ्रेम्स, उन्हीं सस्ते आर्म्स से जो आप उपयोग करते हैं। यहां एकमात्र VLA जो एक 24 GB कार्ड में फिट होता है, और एकमात्र 30 एपिसोड फ्लोर। देखें SmolVLA पेज.
ACT
यह कोई फाउंडेशन मॉडल नहीं है। ALOHA का एक्शन चंकिंग ट्रांसफार्मर लगभग 80 M पैरामीटर का है जिसे प्रत्येक कार्य के लिए, 50 Hz पर 50 प्रदर्शनों पर खरोंच से प्रशिक्षित किया गया है। पेपर में लगभग दस मिनट के प्रदर्शनों से छह वास्तविक द्वि-मैनुअल कार्यों की रिपोर्ट की गई है, जिसमें हाइलाइट किए गए उदाहरणों पर 80 से 90 प्रतिशत सफलता मिली है। इसका विचार, एक्शन चंकिंग, इस पृष्ठ पर हर मॉडल में है, और इसका एब्लेशन अभी भी प्रभाव को सबसे अच्छी तरह मापता है: अस्थायी एन्सेम्बलिंग बंद होने पर दो सिम्युलेटेड कार्यों में, सफलता k=1 पर 1 प्रतिशत से बढ़कर k=100 पर 44 प्रतिशत हो जाती है। ACT पृष्ठ पर बाकी जानकारी है।
बेंचमार्क वास्तव में क्या कहते हैं
LIBERO वह बेंचमार्क है जिस पर इन पाँच में से तीन रिपोर्ट करते हैं: एक सिम्युलेटेड Franka Panda पर भाषा-आधारित कार्य, जिन्हें नीचे दिए गए चार सुइट्स में विभाजित किया गया है, प्रत्येक में दस कार्य हैं। NVIDIA ने प्रति सुइट 200 परीक्षण चलाए।
| मॉडल | स्थानिक | वस्तु | लक्ष्य | 10 (दीर्घ) | औसत |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
प्रत्येक संख्या एक अलग हार्नेस और बजट से आती है। GR00T ने वैश्विक बैच 640 पर 20K स्टेप्स चलाए; openpi आंकड़ा एक 30K चेकपॉइंट है; LeRobot पोर्ट ने LIBERO बेस मॉडल में 6K स्टेप्स जोड़े। SmolVLA एक और बेमेल है: इसका पेपर उस पंक्ति को LIBERO पर शुरू से प्रशिक्षित करता है, बिना किसी VLA प्रीट्रेनिंग के, जबकि इसके ऊपर के तीन प्रीट्रेन्ड चेकपॉइंट्स को फाइन-ट्यून करते हैं। 96.85 से 97.5 को एक क्लस्टर मानें, और 87.3% के अंतर को वास्तविक मानें लेकिन 6.7 गुना अधिक पैरामीटर के साथ प्राप्त किया गया।
SimplerEnv प्रसार दिखाता है, जो LIBERO नहीं दिखाता। NVIDIA N1.7 की तुलना N1.6 से करता है, जो एक पीढ़ीगत डेल्टा
| SimplerEnv सूट | N1.6 औसत | N1.7 औसत | सर्वश्रेष्ठ स्विंग | सबसे खराब स्विंग |
|---|---|---|---|---|
| Bridge (WidowX), 7 कार्य | 56.6% | 62.3% | stack_cube 5.0 से 48.0 | put_eggplant_in_basket 89.0 से 53.0 |
| Fractal (Google Robot), 6 कार्य | 52.0% | 72.5% | open_drawer 0.0 से 65.0 | कोई नहीं, हर कार्य में सुधार हुआ |
ब्रिज रो उपयोगी है: put_eggplant_in_basket में औसतन 5.7 अंक प्राप्त हुए, 36 अंक खो दिए और put_eggplant_in_sink 33 से 2 पर आ गया। एक नई पीढ़ी वितरण को स्थानांतरित करती है बजाय इसे ऊपर उठाने के, इसलिए यदि आपका कार्य वहां है जहां N1.7 में गिरावट आई है, तो औसत कुछ नहीं कहता।

पांच में से, केवल SmolVLA पेपर SO-100 श्रेणी के आर्म पर रिपोर्ट करता है: SmolVLA के लिए 78.3 प्रतिशत और तीन कार्यों में Pi0 के लिए 61.7, दोनों मल्टी-टास्क, ACT द्वारा प्रशिक्षित सिंगल-टास्क के लिए 48.3 के मुकाबले, जो कि समान नहीं है। समान। स्वच्छ युग्मन SO-101 पिक-एंड-प्लेस पर दोनों सिंगल-टास्क हैं: वितरण में 70 के मुकाबले 90, 40 के मुकाबले 50 इससे बाहर। तुलना करें ACT बनाम SmolVLA और Pi0.5 बनाम SmolVLA, या ब्राउज़ करें अखाड़ा.
विलंबता और लागत परिनियोजन तय करती हैं
इन्फ्रेंस लेटेंसी वह बाधा है जिसे लोग सबसे अंत में खोजते हैं और सबसे पहले पछताते हैं। एक बेंचमार्क पर पांच अंक बेहतर नीति, लेकिन प्रति एक्शन स्टेप आधा सेकंड, आपकी डेस्क पर बदतर दिखती है: संपर्क गतिशीलता प्रतीक्षा नहीं करती।
एक चेतावनी: GR00T का आंकड़ा NVIDIA के कार्ड से असहमत है, जो 4 डीनोइजिंग स्टेप्स और एक कैमरे को H100 पर ईगर मोड में 85.8 ms, torch.compile के साथ 48.6 ms, पूर्ण TensorRT के माध्यम से 27.9 ms पर समय देता है। यहां 152 ms एक संपूर्ण-स्टैक आंकड़ा है जिसमें सर्विंग ओवरहेड और एक से अधिक कैमरे शामिल हैं, न कि केवल एक फॉरवर्ड पास।
20 से 485 ms का लूप मॉडल का है, और सार्वजनिक-इंटरनेट राउंड ट्रिप इसमें जुड़ जाती हैं। रिमोट इन्फ्रेंस धीमी पिक-एंड-प्लेस के लिए व्यवहार्य है, लेकिन तेज़ प्रतिक्रियाशील गति के लिए नहीं। यदि आपके कार्य को गति की आवश्यकता है, तो इन्फ्रेंस सर्वो के बगल में बैठता है: ACT या SmolVLA, स्थानीय रूप से। संबंधित: नीति गति के बीच में रुक जाती है।
मॉडल बदले बिना समय खरीदने का एक तरीका: SmolVLA पेपर सिंक्रोनस निष्पादन को मापता है, जहाँ नीति अगले की भविष्यवाणी करने से पहले एक खंड समाप्त करती है, बनाम एसिंक्रोनस, जहाँ भविष्यवाणी निष्पादन के साथ ओवरलैप होती है। सफलता समान है, 78.3 बनाम 73.3, लेकिन वही पिक-एंड-प्लेस 13.75 के बजाय 9.7 सेकंड लेता है, और एक निश्चित विंडो में रोबोट 9 के बजाय 19 चक्रों का प्रबंधन करता है।
लाइसेंस, जाँचे गए क्योंकि कोई उन्हें जाँचता नहीं है
| मॉडल | वजन लाइसेंस | कोड लाइसेंस | वाणिज्यिक उपयोग |
|---|---|---|---|
| GR00T N1.7 | NVIDIA ओपन मॉडल लाइसेंस; कार्ड वाणिज्यिक उपयोग की अनुमति देता है | Apache 2.0 | हाँ |
| GR00T N1.5 | NVIDIA एकतरफा गैर-वाणिज्यिक लाइसेंस | Apache 2.0 | नहीं |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | दोनों पढ़ें, वे असहमत हैं |
| SmolVLA | smolvla_base कार्ड पर कोई लाइसेंस फ़ील्ड नहीं | Apache 2.0 (LeRobot) | कोड हाँ, वजन अज्ञात |
| ACT | कोई आधार वजन मौजूद नहीं है | Apache 2.0 (LeRobot) | हाँ |
Pi0.5 पंक्ति को सावधानी की आवश्यकता है। LeRobot pi05 दस्तावेज़ openpi के अनुरूप Apache 2.0 बताता है, जबकि हब कार्ड के लिए lerobot/pi05_base में है license: gemma। दोनों सक्रिय हैं। GR00T N1.7 का एक हल्का संस्करण है: Isaac-GR00T README में यह उल्लेख किया गया है कि N1.7 Apache 2.0 के तहत पूरी तरह से व्यावसायिक रूप से लाइसेंस योग्य है, जबकि इसका अपना लाइसेंस अनुभाग और मॉडल कार्ड केवल कोड को Apache 2.0 के तहत और वजन को NVIDIA ओपन मॉडल लाइसेंस के तहत रखते हैं।
वे डिफ़ॉल्ट जिन्हें आप वास्तव में चलाएंगे
प्रत्येक ट्रेनर फॉर्म एक डिफ़ॉल्ट के साथ आता है, और वे मनमाने नहीं होते हैं। ACT के अपने हैं: बैच 8, lr 1e-5, 100000 प्रशिक्षण चरण, चंक आकार 100, ACTConfig अपस्ट्रीम और k=100 from the ACT paper. नीचे एक कॉलम एक जाल है।
| पॉलिसी | बैच | LR | अधिकतम चरण | ग्रेडिएंट संचय | लागू होता है? | अतिरिक्त नॉब |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | हाँ | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | हाँ | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | नहीं (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | नहीं | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | नहीं | chunkSize, nActionSteps, seed, logFreq |
GR00T का फाइन-ट्यूनिंग एंट्री पॉइंट (launch_finetune.py, एक टायरो CLI) अपनी कॉन्फ़िग डेटाक्लास में कोई सीड फ़ील्ड नहीं रखता है, इसलिए रन बिट-फॉर-बिट पुनरुत्पादित नहीं होते हैं। रेपो गैर-नियतात्मक छवि संवर्द्धन से रनों के बीच 5 से 6 प्रतिशत भिन्नता की भी चेतावनी देता है, जो ऑनलाइन बहस किए गए अधिकांश बेंचमार्क अंतरों से अधिक है। LeRobot का डिफ़ॉल्ट सीड 1000 है। ग्रेडिएंट-संचय कॉलम lerobot 0.5.1 का वर्णन करता है; अपस्ट्रीम 0.6.2 इसे --accelerator.gradient_accumulation.steps के रूप में उजागर करता है।
मॉडल के चुनाव से अधिक महत्वपूर्ण नॉब
यह एक्शन चंक है। लंबे चंक से गति अधिक सहज होती है और त्रुटियाँ कम जमा होती हैं, लेकिन ब्लॉक के निष्पादित होने के दौरान नीति प्रतिबद्ध होती है, इसलिए यह हिलने वाली किसी भी चीज़ पर देर से प्रतिक्रिया करती है: एक स्थिर क्यूब पर आत्मविश्वासपूर्ण, एक लुढ़कते हुए पर निराशाजनक। यदि यह ओवरशूट करता है, तो निष्पादित हिस्से को छोटा करना रिट्रेनिंग से बेहतर है और यह मुफ्त है। एक जोड़ जो बीच में रुक जाता है वह एक अलग समस्या है; देखें ।
- ACT: ACTConfig defaults to
chunk_size 100andn_action_steps 100. टेम्पोरल एन्सेम्बलिंग बंद है और इसके लिए आवश्यक हैn_action_steps 1. - GR00T N1.7: आंतरिक क्षितिज 16 से 40 हो गया, फिर भी LeRobot's SO-101 उदाहरण अभी भी चलता है
--policy.chunk_size=16 --policy.n_action_steps=16. रोलआउट फ़्लैग का नाम बदलकर--execution-horizonकर दिया गया था। - Pi0.5: एक 50-स्टेप चंक, जिसमें से LeRobot's LIBERO रेसिपी 10 को निष्पादित करती है
--policy.n_action_steps=10;--policy.pretrained_pathके साथ यदि आप फ़्लैग छोड़ देते हैं तो यह 50 पर वापस आ जाता है। - SmolVLA: 50-एक्शन चंक, दोनों नॉब उजागर।
एक दोपहर में सभी पाँचों को कैसे स्क्रीन करें
सबसे सस्ता जवाब अधिक पढ़ना नहीं है। लगभग 15 USD खर्च करें और रोबोटिक आर्म को आपको बताने दें: एक बार रिकॉर्ड करें, पहले सस्ते मॉडल को प्रशिक्षित करें, एक बार जब यह डेटा को सही साबित कर दे तो आगे बढ़ें। संरचना मात्रा से बेहतर है, जिसका उद्देश्य है और ।
- 1एक बार में 50 एपिसोड रिकॉर्ड करें
GR00T, Pi0.5 और ACT के लिए पचास, और SmolVLA के तीस के लिए रास्ता साफ करता है। प्रत्येक भिन्नता को पतला फैलाने के बजाय दोहराएं: 50 एपिसोड 5 क्यूब स्थितियों में प्रशिक्षित किए गए जहाँ 25 नहीं किए गए थे। देखें अपना पहला डेटासेट रिकॉर्ड करें।
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2पहले ACT को प्रशिक्षित करें, क्योंकि यह आपसे झूठ नहीं बोल सकता
कोई पूर्व-प्रशिक्षित वज़न नहीं है, इसलिए यदि यह कार्य करता है, तो आपके डेटासेट में वह कार्य शामिल है। यदि ACT फ्लैटलाइन हो जाता है, तो डेटा को ठीक करें। 24 GB कार्ड पर 1 से 3 USD, 2 से 5 घंटे।
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLA को उसी डेटासेट पर चलाएं, अपरिवर्तित
वही डेटा, वही आर्म, 80 M के बजाय 450 M पैरामीटर, साथ ही भाषा कंडीशनिंग। LeRobot एक A100 पर लगभग 4 घंटे में 20K स्टेप रन पूरा करता है। यह आपको बताता है कि क्या प्रीट्रेनिंग से कोई फायदा होता है।
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T को छूने से पहले v2.1 में डाउनग्रेड करें
GR00T LeRobot v2 प्रारूप का एक प्रकार पढ़ता है, साथ ही एक अतिरिक्त
meta/modality.jsonजो यह मैप करता है कि संयोजित स्थिति और क्रिया सरणियाँ नामित क्षेत्रों में कैसे विभाजित होती हैं। एक v3.0 डेटासेट उस लोडर को क्रैश कर देता है, क्योंकि v3.0 कई एपिसोड को साझा फ़ाइलों में पैक करता है जहाँ v2 प्रति एपिसोड एक लिखता था। Isaac-GR00T डाउनग्रेड हेल्पर कोscripts/lerobot_conversion/convert_v3_to_v2.pyके रूप में भेजता है; v3 अस्वीकृति पृष्ठ तेज़ रास्ता है।text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5GR00T N1.7 पर तभी जाएं जब पहले दो ने कुछ अधूरा छोड़ दिया हो
यहाँ दिखाए गए NVIDIA के CLI के माध्यम से, या LeRobot के
grootपॉलिसी प्रकार के माध्यम से। NVIDIA फाइन-ट्यूनिंग के लिए 40 GB या अधिक VRAM, और अनुमान के लिए 16 GB की सिफारिश करता है। OOM पर, OOM पृष्ठ देखें।bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
उस स्क्रीनिंग पास को चलाने के दो तरीके
तीन वातावरण, क्योंकि टूलचेन एक साथ मौजूद नहीं हैं। मुख्य पर LeRobot 0.6.2 है और इसे Python 3.12 या नए की आवश्यकता है; Isaac-GR00T और openpi अलग-अलग uv-प्रबंधित रेपो हैं।
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0 को अपने एकमात्र वीडियो बैकएंड के रूप में पिन करता है, जिसके लिए FFmpeg 4 से 7 की आवश्यकता होती है। FFmpeg 8 असमर्थित है, AV1 की गारंटी नहीं है। - openpi मेमोरी सीमाएँ: 8 GB से ऊपर अनुमान, 22.5 GB से ऊपर LoRA, 70 GB से ऊपर पूर्ण फाइन-ट्यूनिंग। आखिरी वाला यही कारण है कि Pi0.5 एक A100 कार्य है।
- GPU को स्वयं किराए पर लें, बाद में उसे नष्ट कर दें, चेकपॉइंट पथों के तीन सेटों को मैन्युअल रूप से मिलाएं।
वही पाँच मॉडल, एक ही रूप। मॉडल, डेटासेट और हाइपरपैरामीटर चुनें; बैकएंड आवश्यक VRAM के अनुसार एक GPU किराए पर लेता है, ट्रेनर चलाता है और को ऑब्जेक्ट स्टोरेज में लिखता है।
- प्रशिक्षण मैट्रिक्स पाँच मॉडल और चार आर्म्स का है, प्रत्येक सेल एक मार्गदर्शक है: SO-100 पर SmolVLA, SO-101 पर ACT।
- अनुमान पॉड्स
/api/inference/podद्वारा एक निष्क्रिय वॉचडॉग के साथ स्वतः-प्रावधानित होते हैं, ताकि एक भूला हुआ पॉड चुपचाप बिल न करे। - बेस चेकपॉइंट विक्रेताओं के अपने हैं:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base। ACT के पास कोई नहीं है। - CLI से और AI एजेंटों से MCP सर्वर के माध्यम से समान संचालन।
- कोई हार्डवेयर नहीं? लाइव आर्म बिना साइनअप के एक भौतिक SO-100 स्ट्रीम करता है; प्रयास पृष्ठ अंदर आने के तरीके दिखाता है।
फाउंडेशन मॉडल या स्क्रैच से
असली दुविधा यह नहीं है कि कौन सा 3 B मॉडल चुनना है। यह है कि क्या एक पूर्व-प्रशिक्षित VLA का उपयोग बिल्कुल करना है, यह देखते हुए कि ACT ने प्रत्येक लगभग दस मिनट के प्रदर्शन से छह वास्तविक द्वि-मैनुअल कार्य सीखे, जिसमें 80 M पैरामीटर थे और कुछ भी पूर्व-प्रशिक्षित नहीं था।
- भाषा कंडीशनिंग। ACT में कोई नहीं है; एक ACT चेकपॉइंट एक कार्य करता है।
- आपके प्रदर्शनों से अनुपस्थित वस्तुओं पर बेहतर: SO-101 पर, ACT के 40% आउट ऑफ डिस्ट्रीब्यूशन के मुकाबले 50%।
- बहु-कार्य बिल्कुल: SmolVLA एक चेकपॉइंट के साथ तीन SO-100 कार्यों में 78.3% तक पहुँचता है; ACT को केवल एकल-कार्य के रूप में चलाया गया था।
- 7.6x से 24x विलंबता: ACT के 20 ms के मुकाबले प्रति एक्शन स्टेप 152 से 485 ms।
- 1 से 3 के बजाय प्रति रन 4 से 12 USD, और किसी भी 24 GB कार्ड के बजाय एक A100 टियर।
- लाइसेंस एक्सपोजर, साथ ही एक गेटेड-रेपो विफलता मोड जो स्क्रैच से मौजूद नहीं है।
- पूर्व-प्रशिक्षित वज़न एक खराब डेटासेट को छिपा सकते हैं। एक फाइन-ट्यून जो टूटे हुए डेटा पर आधा काम करता है, डेटा देखने से पहले एक सप्ताह का समय लेता है।
एक पुराने रन को पुनरुत्पादित करने का मामला
2025 चेकपॉइंट का पीछा करना आपके लिए मॉडल का चुनाव करता है और समस्या को संस्करण पिनिंग में बदल देता है: वर्तमान LeRobot N1.5 को अस्वीकार करता है, इसलिए आप पिन करते हैं lerobot==0.5.1। कोई सीड फ़ील्ड और रन के बीच 5 से 6 प्रतिशत भिन्नता के बिना, पुनरुत्पादन निर्माण द्वारा अनुमानित है। और में प्लेटफ़ॉर्म पक्ष है।

क्या दो पर आ गए? ACT के मुकाबले GR00T N1.7 और GR00T N1.7 के मुकाबले SmolVLA. रॉ पंक्तियाँ अखाड़े की प्रविष्टियों में मौजूद हैं: GR00T N1.7, Pi0.5, SmolVLA और ACT.
यह प्लेटफ़ॉर्म आपकी कहाँ मदद नहीं करता
- यह रिमोट इन्फेरेंस को तेज़ नहीं कर सकता। 20 से 485 मिलीसेकंड का लूप मॉडल का है; इंटरनेट राउंड ट्रिप इसमें और समय जोड़ते हैं।
- यह आपके अपने हार्डवेयर पर GR00T या Pi0.5 को फाइन-ट्यून नहीं कर सकता। यहां दोनों केवल क्लाउड-आधारित हैं; केवल SmolVLA और ACT स्थानीय रूप से चलते हैं।
- यह डेटासेट को ठीक नहीं कर सकता। लॉस कम होता है लेकिन पॉलिसी कुछ नहीं करती एक डेटा समस्या है, एक पॉलिसी जो केवल एक सेटअप में काम करती है एक कवरेज समस्या है।
- यह GR00T रन को रिप्रोड्यूसिबल नहीं बना सकता: क्योंकि अपस्ट्रीम कॉन्फ़िग में कोई सीड फ़ील्ड नहीं है।
85 मॉडल, 332 बेंचमार्क परिणाम, हर संख्या अपने स्रोत से जुड़ी हुई
इस पृष्ठ पर तालिकाओं का क्रमबद्ध संस्करण: 85 विजन-लैंग्वेज-एक्शन मॉडल, 332 बेंचमार्क परिणाम, प्रत्येक अपने पेपर या मॉडल कार्ड से जुड़ा हुआ।
अखाड़ा खोलेंएक चुनना और आगे बढ़ना
एक डिफ़ॉल्ट: 50 एपिसोड रिकॉर्ड करें, डेटासेट को प्रमाणित करने के लिए ACT को 1 से 3 USD में प्रशिक्षित करें, फिर SmolVLA को उसी डेटा पर। कुल मिलाकर 6 USD से कम में, और वे उस महत्वपूर्ण प्रश्न का उत्तर देते हैं: क्या यहाँ प्रीट्रेनिंग मदद करती है, या क्या बाधा डेटा है। संपर्क-समृद्ध बहु-चरणीय कार्यों के लिए GR00T N1.7 पर जाएँ, जब दृश्य बदलता है तो Pi0.5 पर।
प्लेटफ़ॉर्म वॉकथ्रू: अपनी पहली नीति को प्रशिक्षित करें, फिर अपनी पहली नीति चलाएँ। प्रशिक्षण दस्तावेज़ और डेटासेट दस्तावेज़ फॉर्म और प्रारूप को कवर करते हैं; SO-100 पृष्ठ और संपूर्ण SO-100 गाइड निर्माण और अंशांकन को कवर करते हैं। पृष्ठभूमि: VLA अवलोकन और Pi0 फ्लो-मैचिंग लेख। जो आपकी सफलता दर को बढ़ाएगा वह है डेटा गुणवत्ता गाइड।
SO-100 पर मुझे पहले कौन सी VLA पॉलिसी प्रशिक्षित करनी चाहिए?▾
ACT, फिर SmolVLA। ACT खरोंच से प्रशिक्षित होता है, इसलिए यह खराब डेटासेट को छिपा नहीं सकता, और 24 GB कार्ड पर एक रन की लागत 1 से 3 USD आती है। यदि ACT कार्य को बिल्कुल भी करता है, तो GR00T N1.7 या Pi0.5 रन के लिए 4 से 12 USD बर्बाद नहीं होते हैं।
क्या GR00T N1.7 वास्तव में Pi0.5 से बेहतर है?▾
LIBERO पर वे शोर के भीतर हैं: GR00T N1.7 के लिए चार सुइट्स में 97.0%, openpi में 30k स्टेप्स पर Pi0.5 के लिए 96.85%, LeRobot पोर्ट के लिए 97.5%, सभी विभिन्न हार्नेस से। वास्तविक अंतर 152 ms प्रति एक्शन स्टेप बनाम 485 ms, v2.1 डेटासेट बनाम v3.0, और बेंचमार्क सटीकता बनाम ओपन-वर्ल्ड जनरलाइजेशन हैं।
क्या मैं इनमें से किसी को भी एक RTX 4090 पर फाइन-ट्यून कर सकता हूँ?▾
SmolVLA और ACT, हाँ; दोनों RTX 4090 या किसी भी 24 GB कार्ड के लिए सूचीबद्ध हैं और स्थानीय रूप से चलते हैं। GR00T N1.7, N1.5 और Pi0.5 को A100 या H100 80 GB की आवश्यकता होती है और यहाँ केवल क्लाउड पर उपलब्ध हैं। NVIDIA GR00T फाइन-ट्यूनिंग के लिए 40 GB या अधिक की सिफारिश करता है; openpi का फ्लोर पूर्ण Pi0.5 फाइन-ट्यून के लिए 70 GB से ऊपर है, LoRA के लिए 22.5 GB।
इन पाँचों में से मैं व्यावसायिक रूप से किसका उपयोग कर सकता हूँ?▾
GR00T N1.7 वज़न NVIDIA Open Model License Agreement के तहत हैं, जिसके बारे में कार्ड कहता है कि यह व्यावसायिक उपयोग को कवर करता है। N1.5 वज़न गैर-व्यावसायिक हैं। LeRobot में SmolVLA का कोड Apache 2.0 है, लेकिन lerobot/smolvla_base कार्ड में कोई लाइसेंस फ़ील्ड नहीं है, इसलिए वज़न अज्ञात हैं। ACT के पास लाइसेंस के लिए कोई आधार वज़न नहीं है। Pi0.5 अस्पष्ट है: LeRobot के दस्तावेज़ Apache 2.0 कहते हैं, इसके कार्ड मेटाडेटा में लाइसेंस: gemma लिखा है।
Sources
- NVIDIA Isaac-GR00T रिपॉजिटरी: GA स्थिति, N1.6 से N1.7 में परिवर्तन, हार्डवेयर आवश्यकताएँ, torchcodec और FFmpeg बाधाएँ, launch_finetune.py, रन-टू-रन भिन्नता
- nvidia/GR00T-N1.7-3B मॉडल कार्ड: Cosmos-Reason2-2B बैकबोन, 3 B पैरामीटर, अनुमान समय सारणी, NVIDIA Open Model License, मॉडल संस्करण फ़ील्ड
- nvidia/GR00T-N1.5-3B मॉडल कार्ड: Eagle 2 संदर्भ, SigLip2 और T5, फ्लो मैचिंग DiT, एकतरफा गैर-व्यावसायिक लाइसेंस
- Isaac-GR00T LIBERO उदाहरण: 20K स्टेप्स और बैच आकार 640 पर प्रति-सुइट सफलता दर, प्रति सुइट 200 परीक्षण
- Isaac-GR00T SimplerEnv उदाहरण: प्रति-कार्य ब्रिज और फ्रैक्चरल सफलता दर, GR00T N1.6 बनाम N1.7
- pi0.5: ओपन-वर्ल्ड जनरलाइजेशन के साथ एक विजन-लैंग्वेज-एक्शन मॉडल (2 B VLM प्लस 300 M एक्शन एक्सपर्ट, 50 Hz नियंत्रण, लगभग 400 घंटे का मोबाइल मैनिपुलेशन, 3 से 104 स्थानों पर स्केलिंग अध्ययन)
- openpi रिपॉजिटरी: GPU मेमोरी फ़्लोर, फ्लो-मैचिंग-हेड-ओनली स्कोप, और Pi0.5 LIBERO परिणाम examples/libero में
- lerobot/pi05_base मॉडल कार्ड: LeRobot पोर्ट का दायरा, लाइसेंस: gemma मेटाडेटा, lerobot-train उपयोग
- LeRobot pi0.5 दस्तावेज़: गेटेड PaliGemma टोकनाइज़र, LIBERO पुनरुत्पादन तालिका, n_action_steps फॉलबैक ट्रैप, Apache 2.0 कथन
- SmolVLA: किफायती और कुशल रोबोटिक्स के लिए एक विजन-लैंग्वेज-एक्शन मॉडल (450 M पैरामीटर, LIBERO और Meta-World तालिकाएँ, SO-100 और SO-101 परिणाम, एसिंक अनुमान)
- LeRobot SmolVLA दस्तावेज़: 25 के मुकाबले 5 स्थितियों में 50 एपिसोड, A100 पर लगभग 4 घंटे में 20k स्टेप्स
- कम लागत वाले हार्डवेयर (ACT और ALOHA) के साथ फाइन-ग्रेन्ड बिमैनुअल मैनिपुलेशन सीखना: 80-90 प्रतिशत पर 6 कार्य, k=1 से k=100 तक चंक आकार एब्लेशन
- LeRobot 0.6.2: ACTConfig और SmolVLAConfig डिफ़ॉल्ट, डिफ़ॉल्ट सीड 1000, --accelerator.gradient_accumulation.steps, Python 3.12 आवश्यकता, Apache 2.0
- LeRobot GR00T दस्तावेज़: पॉलिसी प्रकार groot, N1.5 समर्थन हटाया गया, पिन lerobot==0.5.1, SO-101 चंक आकार उदाहरण
- lerobot/smolvla_base मॉडल कार्ड: --policy.path द्वारा उपयोग किया जाने वाला SmolVLA आधार चेकपॉइंट, और इसका कार्ड मेटाडेटा, जिसमें कोई लाइसेंस फ़ील्ड नहीं है
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started