
GR00T N1.7, Pi0.5, SmolVLA, ACT वा GR00T N1.5? वास्तविक परिस्थितिहरूसँग मेल खाने निर्णय तालिका, प्रकाशित बेन्चमार्क संख्याहरू, विलम्बता, प्रति रन लागत र प्रत्येक छनोट पछाडिका लाइसेन्सहरू सहित।
आज SO-100 वर्गको पाखुरामा पाँच नीतिहरू तालिम दिन सकिन्छ। तिनीहरू अनुमानमा 24 गुणा विलम्बता, 37 प्यारामिटर गणनामा र 12 एक रनको लागतमा, र तपाईंले परिणाम पठाउन सक्नुहुन्छ कि सक्नुहुन्न भन्नेमा फरक छन्। पाँच मोडेल कार्डहरू यसलाई समाधान गर्दैन: तपाईंसँग भएको प्रश्नको कुनैले पनि जवाफ दिँदैन, मैले पहिले कुन चलाउने?
तलका प्रत्येक संख्या अगस्ट 2026 मा कागजातहरू, रेपोहरू र कार्डहरूबाट पढिएको थियो। प्लेटफर्म संख्याहरू बाट आउँछन् AY-Robots policy catalog; जहाँ दुई असहमत छन्, दुवै देखाइएको छ।
संक्षिप्त संस्करण
- •यदि तपाईंलाई आफ्नो डेटासेटमा शंका छ भने पहिले ACT तालिम दिनुहोस्: 1 देखि 3 USD प्रति रन, खराब डेटालाई ढाक्नको लागि कुनै पूर्व-तालिम प्राप्त छैन।
- •GR00T N1.7 र Pi0.5 LIBERO मा आधा बिन्दु भित्र छन्, 97.0 विरुद्ध 96.85 देखि 97.5। त्यो कुनै पनि छनौट गर्ने कारण होइन।
- •Pi0.5 सामान्यीकरणको लागि हो, शुद्धताको लागि होइन, र 485 ms मा सबैभन्दा ढिलो छ।
- •SmolVLA, 450 M प्यारामिटरहरूमा, यहाँ एक मात्र VLA हो जसले एउटा 24 GB कार्डमा फाइन-ट्युन गर्छ।
- •20 ms मा ACT द्रुत प्रतिक्रियात्मक गतिको लागि एक मात्र विकल्प हो। लाइसेन्सले बाँकी निर्णय गर्छ।
निर्णय तालिका
| तपाईंको अवस्था | यसलाई तालिम दिनुहोस् | किन |
|---|---|---|
| डेटासेटको गुणस्तर अप्रमाणित | ACT | कुनै पनि पूर्व-प्रशिक्षित मोडेलले बिग्रिएको डेटासेट लुकाउन सक्दैन, र असफल हुँदा 1 देखि 3 USD खर्च लाग्छ। |
| सम्पर्क-समृद्ध, बहु-चरण, भाषा-आधारित | GR00T N1.7 | चार LIBERO सुइटहरूमा 97.0%, साथै एक सापेक्ष अन्तिम-प्रभावकारी कार्य स्थान। |
| द्रुत प्रतिक्रियात्मक गति, सर्भोमा अनुमान | ACT | 20 ms। अर्को सबैभन्दा छिटो 7.6 गुणा ढिलो छ। |
| नयाँ वस्तुहरू, नयाँ दृश्य, खुला-विश्व | Pi0.5 | 104 स्थानहरूमा, वितरण बाहिरको व्यवहारका लागि निर्मित। |
| एउटा 24 GB कार्ड, अझै भाषा चाहिन्छ | SmolVLA | 450 M प्यारामिटरहरू, 30 एपिसोडको न्यूनतम, स्थानीय रूपमा चल्छ। |
| 2025 मा रेकर्ड गरिएको रन पुन: उत्पादन गर्दै | GR00T N1.5 | यदि तपाईंले गर्नैपर्छ भने मात्र: LeRobot ले अब यसलाई अस्वीकार गर्छ, वजनहरू गैर-व्यावसायिक छन्। |
| यो उत्पादनको रूपमा पठाइनेछ | N1.7, SmolVLA or ACT | N1.5 गैर-व्यावसायिक छ, Pi0.5 मा Gemma सर्तहरू छन्, SmolVLA को कार्डमा कुनै उल्लेख छैन। |
पाँच उम्मेदवारहरू
सबै पाँच नीतिहरू हुन्: क्यामेरा फ्रेमहरू, जोइन्ट पोजिसनहरू र, तिनीहरूमध्ये चारका लागि, भविष्यका जोइन्ट लक्ष्यहरूको एक भागमा म्याप गरिएको भाषा निर्देशन। तिनीहरूलाई के कुराले अलग गर्छ भने तपाईं आउनु अघि कति सिकिएको थियो।
| नीति | प्यारामिटरहरू | विलम्बता | GPU टियर | स्थानीय? | न्यूनतम एपिसोडहरू | ढाँचा | लागत |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | हो | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | हो | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | होइन | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | होइन | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | होइन | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA को हालको भिजन-ल्याङ्ग्वेज-एक्शन मोडेल, लगभग ३ अर्ब प्यारामिटरहरू, जसमध्ये लगभग ४० मिलियन फाइन-ट्युनिङको समयमा प्रशिक्षित गरियो। रेपोले N1.6 बाट भएका परिवर्तनहरू सूचीबद्ध गर्दछ: ब्याकबोन भेन्डर गरिएको Eagle मोडेलबाट Qwen3-VL मा Cosmos-Reason2-2B मा, diffusion layers 32 to 16, state and action dimensions 29 to 132, action horizon 16 to 40.
सानो आर्ममा महत्त्वपूर्ण कुरा सापेक्षिक एन्ड-इफेक्टर एक्शन स्पेस हो: N1.7 ले हालको पोजबाट डेल्टा अनुमान गर्दछ, जसले गर्दा २० हजार घण्टाको EgoScale मानव भिडियो रोबोट नीतिमा स्थानान्तरण गर्न सकिन्छ। स्पेसिफिकेशन N1.7 पृष्ठमा, प्रक्रिया SO-100 गाइडमा N1.7.
Isaac-GR00T README ले N1.7 लाई जनरल एभेलिबिलिटी रिलिजको रूपमा घोषणा गर्दछ, जसमा पूर्ण बेन्चमार्क र समर्थन समावेश छ। यसको Hugging Face कार्ड अपडेट भएको छैन: the Model Version फिल्डमा अझै पनि GR00T N1.7 EA लेखिएको छ। रेपो नयाँ कागजात हो।
GR00T N1.5
उही 3 B स्केल, Eagle 2 ब्याकबोन, SigLip2 र T5, फ्लो-म्याचिङ DiT हेड। यो तपाईंसँग पहिले नै भएको लाई विस्तार गर्न अवस्थित छ। दुई कुराले यसलाई खराब पूर्वनिर्धारित बनाउँछ: यसको तौलमा NVIDIA को एकतर्फी गैर-व्यावसायिक लाइसेन्स छ, र हालको LeRobot रिलीजहरूले N1.5 समर्थन हटाएका छन्। हेर्नुहोस् .
Pi0.5
Physical Intelligence को VLA, पोलिसी प्रकार pi05। यस पेपरले PaliGemma बाट प्रारम्भ गरिएको 2 B VLM र 300 M कार्य विशेषज्ञ दिन्छ, जसले रोबोटलाई 50 Hz मा चलाउँछ; LeRobot को pi05 कन्फिगले पूर्वनिर्धारित रूपमा 50-चरणको चङ्क, त्यो दरमा एक सेकेन्डमा सेट गर्छ। यसको मुख्य विशेषता नदेखिएको ठाउँहरू हुन्: वास्तविक घरहरूमा लगभग 400 घण्टाको मोबाइल म्यानिपुलेसन, र 3, 12, 22, 53, 82 र 104 स्थानहरूमा गरिएको स्केलिङ अध्ययन, जहाँ 104-स्थानको मोडेलले परीक्षण घरहरूमा नै प्रशिक्षित नियन्त्रणसँग मेल खायो।
एउटा सीमा, जुन lerobot/pi05_base कार्डमा भनिएको छ: पोर्टले केवल फ्लो-म्याचिङ एक्शन हेड मात्र बोक्छ। सबटास्क प्रेडिक्शन, एक्शन टोकेनाइजेसन र आरएल अपस्ट्रिममा जारी गरिएको थिएन, र ओपनपीले आफ्नो रिपोजिटरीको बारेमा पनि त्यही भन्छ। Pi0.5 पृष्ठ र SO-100 मा Pi0.5 गाइड मा बाँकी जानकारी छ।
Pi0.5 लाई गेटेड google/paligemma-3b-pt-224 टोकेनाइजर चाहिन्छ (gated: manual, यद्यपि गुगलले अनुरोधहरू तुरुन्तै प्रशोधन गरिने बताउँछ)। यसलाई स्वीकार नगरी र प्रशिक्षण वातावरणमा hf auth login चलाउँदा, काम सुरु हुन्छ, केही समय डाउनलोड हुन्छ, त्यसपछि नेटवर्क त्रुटि जस्तो देखिने प्राधिकरण त्रुटिमा समाप्त हुन्छ। nvidia/GR00T-N1.7-3B गेटेड छैन, तर यसको nvidia/Cosmos-Reason2-2B ब्याकबोन गेटेड छ (gated: auto)। क्युमा राख्नु अघि दुवैलाई खाली गर्नुहोस्; यदि कुनै रन निष्क्रिय बसिरहन्छ भने, स्टक-क्यु पृष्ठ ले के जाँच गर्ने भनेर सूचीबद्ध गर्दछ।
SmolVLA
450 M प्यारामिटरहरू, लगभग 100 M एक्शन एक्सपर्टमा, SmolVLM-2 मा VLM फ्रोजन गरी र यसको पहिलो 16 भाषा-मोडेल तहहरू मात्र प्रयोग गरियो। पूर्व-प्रशिक्षण सामुदायिक डेटा थियो: 481 डेटासेटहरू, 10.6 M फ्रेमहरू, तपाईंले प्रयोग गर्ने उही सस्ता आर्महरूबाट। यहाँ एक 24 GB कार्डमा फिट हुने एक मात्र VLA, र एक मात्र 30 एपिसोड फ्लोर। हेर्नुहोस् SmolVLA पृष्ठ।
ACT
फाउन्डेसन मोडेल होइन। ALOHA बाट एक्शन चंकिङ ट्रान्सफर्मर लगभग 80 M प्यारामिटरहरूमा प्रशिक्षित छ प्रत्येक कार्यका लागि सुरुदेखि नै, 50 Hz मा 50 प्रदर्शनहरूमा। यस पेपरले लगभग दश मिनेटका प्रदर्शनहरूबाट प्रत्येक, यसले हाइलाइट गर्ने उदाहरणहरूमा 80 देखि 90 प्रतिशतसम्म। यसको विचार, action chunking, यस पृष्ठमा रहेका हरेक मोडेलमा छ, र यसको एब्लेसनले अझै पनि मापन गर्छ प्रभाव सबैभन्दा राम्रो: टेम्पोरल एन्सेम्बलिंग बन्द गरी दुई सिमुलेटेड कार्यहरूमा, सफलता k=1 मा 1 प्रतिशतबाट k=100 मा 44 प्रतिशतमा बढ्छ। ACT पृष्ठ मा बाँकी छ।
बेन्चमार्कहरूले वास्तवमा के भन्छन्
LIBERO यी पाँचमध्ये तीनले रिपोर्ट गर्ने एउटा बेन्चमार्क हो: सिमुलेटेडमा भाषा-कन्डिसन गरिएका कार्यहरू Franka Panda, तलका चार सुइटहरूमा प्रत्येकमा दस कार्यहरूमा विभाजित। NVIDIA ले प्रति सुइट 200 परीक्षणहरू चलायो।
| मोडेल | स्थानिक | वस्तु | लक्ष्य | 10 (लामो) | औसत |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
प्रत्येक संख्या फरक हार्नेस र बजेटबाट आउँछ। GR00T ले ग्लोबल ब्याच 640 मा 20K चरणहरू चलायो; ओपनपीआईको तथ्याङ्क 30K चेकपोइन्ट हो; LeRobot पोर्टले LIBERO आधार मोडेलमा 6K चरणहरू थप्यो। SmolVLA अर्को बेमेल हो: यसको पेपरले LIBERO मा सुरुदेखि नै, कुनै VLA पूर्व-प्रशिक्षण बिना, त्यो पङ्क्तिलाई तालिम दिन्छ, जबकि यसभन्दा माथिका तीनले पूर्व-प्रशिक्षित चेकपोइन्टहरूलाई फाइन-ट्यून गर्छन्। 96.85 देखि 97.5 लाई एउटै क्लस्टरको रूपमा व्यवहार गर्नुहोस्, र 87.3% को अन्तरलाई वास्तविक मान्नुहोस् तर 6.7 गुणा प्यारामिटरहरूसँग प्राप्त गरिएको।
SimplerEnv ले फैलावट देखाउँछ, जुन LIBERO ले देखाउँदैन। NVIDIA ले N1.7 लाई N1.6 सँग तुलना गर्छ, जुन पुस्तागत डेल्टा को सबैभन्दा नजिकको सार्वजनिक कुरा हो।
| SimplerEnv सुइट | N1.6 औसत | N1.7 औसत | उत्कृष्ट स्विंग | सबैभन्दा खराब स्विंग |
|---|---|---|---|---|
| Bridge (WidowX), 7 कार्यहरू | 56.6% | 62.3% | stack_cube 5.0 देखि 48.0 | put_eggplant_in_basket 89.0 देखि 53.0 |
| Fractal (Google Robot), 6 कार्यहरू | 52.0% | 72.5% | open_drawer 0.0 देखि 65.0 | कुनै पनि छैन, प्रत्येक कार्यमा सुधार भयो |
ब्रिज पङ्क्ति उपयोगी छ: औसतमा 5.7 अंक प्राप्त भयो जबकि put_eggplant_in_basket ले 36 गुमायो र put_eggplant_in_sink 33 बाट 2 मा झर्यो। नयाँ पुस्ताले वितरणलाई उठाउनुको सट्टा सार्छ, त्यसैले यदि तपाईंको कार्य N1.7 घटेको ठाउँमा छ भने, औसतले केही भन्दैन।

पाँच मध्ये, केवल SmolVLA पेपरले SO-100 वर्गको हातमा रिपोर्ट गर्छ: तीन कार्यहरूमा SmolVLA को लागि 78.3 प्रतिशत र Pi0 को लागि 61.7, दुवै बहु-कार्य, ACT प्रशिक्षित एकल-कार्यको लागि 48.3 को विरुद्ध, जुन समान छैन। स्वच्छ जोडी SO-101 पिक-एन्ड-प्लेस मा दुवै एकल-कार्य हो: वितरणमा 70 को विरुद्ध 90, यसबाट बाहिर 40 को विरुद्ध 50। यसमा तुलना गर्नुहोस् ACT विरुद्ध SmolVLA र Pi0.5 विरुद्ध SmolVLA, वा ब्राउज गर्नुहोस् एरिना।
विलम्बता र लागतले परिनियोजन निर्धारण गर्छ
इन्फरेन्स लेटेन्सी मानिसहरूले अन्तिममा पत्ता लगाउने र पहिले पछुताउने बाधा हो। बेन्चमार्कमा पाँच अंकले राम्रो तर प्रति कार्य चरण आधा सेकेन्ड लाग्ने नीति तपाईंको डेस्कमा खराब देखिन्छ: सम्पर्क गतिशीलता पर्खदैन।
एउटा चेतावनी: GR00T को तथ्याङ्क NVIDIA को कार्डसँग मेल खाँदैन, जसले 4 डिनोइजिङ चरणहरू र एउटा क्यामेरालाई H100 मा इगर मोडमा 85.8 ms, torch.compile सँग 48.6 ms, पूर्ण TensorRT मार्फत 27.9 ms मा समय दिन्छ। यहाँको 152 ms सर्भिङ ओभरहेड र एकभन्दा बढी क्यामेरासहितको पूर्ण-स्ट्याक तथ्याङ्क हो, फर्वार्ड पास होइन।
20 देखि 485 ms को लूप मोडेलको हो, र सार्वजनिक-इन्टरनेट राउन्ड ट्रिपहरूले यसमा थप्छन्। रिमोट इन्फरेन्स ढिलो पिक-एन्ड-प्लेसका लागि सम्भव छ, तर छिटो प्रतिक्रियात्मक गतिका लागि होइन। यदि तपाईंको कार्यलाई गति चाहिन्छ भने, इन्फरेन्स सर्भोको छेउमा बस्छ: ACT वा SmolVLA, स्थानीय रूपमा। सम्बन्धित: नीति गतिमा बीचमा रोकिन्छ।
मोडेल परिवर्तन नगरी समय किन्नको लागि एउटा तरिका: SmolVLA पेपरले सिंक्रोनस कार्यान्वयन मापन गर्दछ, जहाँ नीतिले अर्को भविष्यवाणी गर्नु अघि एउटा खण्ड समाप्त गर्दछ, एसिन्क्रोनसको विरुद्धमा, जहाँ भविष्यवाणी कार्यान्वयनसँग ओभरल्याप हुन्छ। सफलता समान छ, 73.3 को विरुद्धमा 78.3, तर उही पिक-एन्ड-प्लेले 13.75 को सट्टा 9.7 सेकेन्ड लिन्छ, र निश्चित विन्डोमा रोबोटले 9 को सट्टा 19 चक्र व्यवस्थापन गर्दछ।
लाइसेन्सहरू, जाँच गरियो किनभने कसैले जाँच गर्दैन
| Model | वजन लाइसेन्स | कोड लाइसेन्स | व्यावसायिक प्रयोग |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; कार्डले व्यावसायिक प्रयोगको अनुमति दिन्छ | Apache 2.0 | हो |
| GR00T N1.5 | NVIDIA एकतर्फी गैर-व्यावसायिक लाइसेन्स | Apache 2.0 | होइन |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | दुवै पढ्नुहोस्, तिनीहरू असहमत छन् |
| SmolVLA | no licence field on the smolvla_base card | Apache 2.0 (LeRobot) | कोड हो, वजन उल्लेख नगरिएको |
| ACT | कुनै आधारभूत वजनहरू अवस्थित छैनन् | Apache 2.0 (LeRobot) | हो |
Pi0.5 पङ्क्तिमा ध्यान दिनुपर्छ। LeRobot pi05 कागजातले openpi सँग मिल्दोजुल्दो Apache 2.0 उल्लेख गर्दछ, जबकि Hub कार्ड lerobot/pi05_base मा license: gemma छ। दुवै सक्रिय छन्। GR00T N1.7 सँग एक हल्का संस्करण छ: Isaac-GR00T README ले N1.7 Apache 2.0 अन्तर्गत पूर्ण रूपमा व्यावसायिक रूपमा लाइसेन्स योग्य छ भनी उल्लेख गर्दछ, जबकि यसको आफ्नै लाइसेन्स खण्ड र मोडेल कार्डले कोडलाई मात्र Apache 2.0 अन्तर्गत र वजनहरूलाई NVIDIA Open Model License अन्तर्गत राख्छ।
तपाईंले वास्तवमा चलाउने पूर्वनिर्धारितहरू
प्रत्येक ट्रेनर फारमले पूर्वनिर्धारित सेटिङहरू सहित आउँछ, र तिनीहरू मनमानी छैनन्। ACT को LeRobot को आफ्नै हुन्: ब्याच 8, lr 1e-5, 100000 प्रशिक्षण चरणहरू, चंक साइज 100, ACTConfig अपस्ट्रीम र k=100 ACT पेपरबाट। तलको एउटा स्तम्भ एउटा जाल हो।
| नीति | ब्याच | LR | अधिकतम चरणहरू | ग्रेड एक्युम | लागू हुन्छ? | अतिरिक्त नियन्त्रणहरू |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
GR00T को फाइन-ट्युनिङ प्रवेश बिन्दु (launch_finetune.py, एक tyro CLI) मा कुनै सीड फिल्ड छैन यसको कन्फिग डेटाक्लासमा, त्यसैले रनहरू बिट-फर-बिट पुनरुत्पादन योग्य छैनन्। भण्डारले रनहरू बीच 5 देखि 6 प्रतिशत भिन्नता गैर-निर्धारित छवि वृद्धिबाट, जुन अनलाइनमा बहस गरिएका धेरै बेन्चमार्क अन्तरहरू भन्दा ठूलो छ। LeRobot को पूर्वनिर्धारित सीड 1000 हो। ग्रेड-एक्युम स्तम्भले lerobot 0.5.1; अपस्ट्रीम 0.6.2 ले यसलाई --accelerator.gradient_accumulation.steps को रूपमा देखाउँछ।
मोडेल छनोट भन्दा बढी महत्त्वपूर्ण नियन्त्रण
यो कार्य खण्ड हो। लामो खण्डहरूले सहज गति र कम त्रुटिहरू दिन्छन्, तर ब्लक कार्यान्वयन हुँदा नीति प्रतिबद्ध हुन्छ, त्यसैले यो चल्ने कुनै पनि कुरामा ढिलो प्रतिक्रिया दिन्छ: स्थिर घनमा विश्वस्त, घुमिरहेकोमा निराश। यदि यो धेरै अगाडि बढ्छ भने, कार्यान्वयन गरिएको भाग छोटो पार्नुले पुन: प्रशिक्षणलाई जित्छ र निःशुल्क हुन्छ। छोटो रोकिने जोइन्ट फरक समस्या हो; हेर्नुहोस् ।
- ACT: ACTConfig पूर्वनिर्धारित रूपमा
chunk_size 100रn_action_steps 100मा हुन्छ। टेम्पोरल एन्सेम्ब्लिङ बन्द छ रn_action_steps 1आवश्यक पर्दछ। - GR00T N1.7: आन्तरिक क्षितिज १६ बाट ४० मा गयो, तैपनि LeRobot को SO-101 उदाहरण अझै
--policy.chunk_size=16 --policy.n_action_steps=16मा चल्छ। रोलआउट फ्ल्यागको नाम परिवर्तन गरी--execution-horizonराखिएको थियो। - Pi0.5: ५०-चरणको खण्ड, जसमध्ये LeRobot को LIBERO रेसिपीले
--policy.n_action_steps=10मार्फत १० वटा कार्यान्वयन गर्छ; यदि तपाईंले फ्ल्याग छोड्नुभयो भने--policy.pretrained_pathसँग यो ५० मा फर्कन्छ। - SmolVLA: ५०-कार्य खण्डहरू, दुवै नबहरू खुला।
एकै दिउँसोमा पाँचवटैलाई कसरी स्क्रिन गर्ने
सबैभन्दा सस्तो उत्तर थप पढाइ होइन। लगभग 15 USD खर्च गर्नुहोस् र पाखुरालाई तपाईंलाई भन्न दिनुहोस्: एक पटक रेकर्ड गर्नुहोस्, पहिले सस्तो मोडेललाई तालिम दिनुहोस्, एक पटक यसले डेटा सही साबित गरेपछि अगाडि बढ्नुहोस्। संरचनाले मात्रालाई जित्छ, जसको मुख्य उद्देश्य हो र ।
- 1एक पटकमा ५० एपिसोड रेकर्ड गर्नुहोस्
GR00T, Pi0.5 र ACT का लागि पचासले बाटो खुल्ला गर्छ, र SmolVLA को तीसले। प्रत्येक भिन्नतालाई पातलो बनाउनुको सट्टा दोहोर्याउनुहोस्: ५० एपिसोडहरू ५ क्यूब स्थानहरूमा प्रशिक्षित गरियो जहाँ २५ वटा गरिएन। तपाईंको पहिलो डेटासेट रेकर्ड गर्नुहोस् हेर्नुहोस्।
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2पहिले ACT लाई तालिम दिनुहोस्, किनकि यसले तपाईंलाई झूट बोल्न सक्दैन
कुनै पूर्व-प्रशिक्षित तौल छैन, त्यसैले यदि यसले कार्य गर्छ भने, तपाईंको डेटासेटमा त्यो कार्य समावेश छ। यदि ACT ले काम गर्न छोड्यो भने, डेटा ठीक गर्नुहोस्। २४ GB कार्डमा १ देखि ३ USD, २ देखि ५ घण्टा लाग्छ।
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3उही डेटासेटमा SmolVLA चलाउनुहोस्, अपरिवर्तित
उही डेटा, उही आर्म, ८० M प्यारामिटरको सट्टा ४५० M प्यारामिटर, साथै भाषा कन्डिसनिङ। LeRobot ले एउटा A100 मा लगभग ४ घण्टामा २०K स्टेप रन गर्छ। यसले तपाईंलाई पूर्व-प्रशिक्षणले केही फाइदा दिन्छ कि दिँदैन भनेर बताउँछ।
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T चलाउनु अघि v2.1 मा डाउनग्रेड गर्नुहोस्
GR00T ले LeRobot v2 ढाँचाको एक प्रकार पढ्छ, साथै एउटा अतिरिक्त
meta/modality.jsonजसले संयुक्त अवस्था र कार्य एरेहरूलाई नाम दिइएका फिल्डहरूमा कसरी विभाजन गर्छ भनेर म्याप गर्छ। v3.0 डेटासेटले त्यो लोडरलाई क्र्यास गर्छ, किनकि v3.0 ले धेरै एपिसोडहरूलाई साझा फाइलहरूमा प्याक गर्छ जहाँ v2 ले प्रति एपिसोड एउटा लेख्थ्यो। Isaac-GR00T लेscripts/lerobot_conversion/convert_v3_to_v2.pyलाई डाउनग्रेड हेल्परको रूपमा पठाउँछ; v3 अस्वीकृति पृष्ठ छिटो बाटो हो।text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5यदि पहिलो दुईले केही बाँकी राखे भने मात्र GR00T N1.7 मा जानुहोस्
यहाँ देखाइएको NVIDIA को CLI मार्फत, वा LeRobot को
grootनीति प्रकार मार्फत। NVIDIA ले फाइन-ट्युनिङका लागि ४० GB वा सोभन्दा बढी VRAM, र इन्फरेन्सका लागि १६ GB सिफारिस गर्छ। OOM भएमा, OOM पृष्ठ हेर्नुहोस्।bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
त्यो स्क्रिनिङ पास चलाउने दुई तरिकाहरू
तीन वातावरण, किनभने टूलचेनहरू एकसाथ रहँदैनन्। मुख्यमा LeRobot ०.६.२ हो र यसलाई Python ३.१२ वा नयाँ चाहिन्छ; Isaac-GR00T र openpi छुट्टाछुट्टै uv-व्यवस्थित रिपोहरू हुन्।
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T ले
torchcodec०.८.० लाई यसको एकमात्र भिडियो ब्याकएन्डको रूपमा पिन गर्छ, जसलाई FFmpeg ४ देखि ७ चाहिन्छ। FFmpeg ८ असमर्थित छ, AV1 ग्यारेन्टी छैन। - openpi मेमोरी फ्लोरहरू: इन्फरेन्स ८ GB भन्दा माथि, LoRA २२.५ GB भन्दा माथि, पूर्ण फाइन-ट्युनिङ ७० GB भन्दा माथि। त्यो अन्तिम कारणले Pi0.5 एउटा A100 को काम हो।
- GPU आफैं भाडामा लिनुहोस्, पछि यसलाई नष्ट गर्नुहोस्, र तीन सेट चेकपोइन्ट पथहरू हातले मिलाउनुहोस्।
उही पाँच मोडेल, एउटै फारम। मोडेल, डेटासेट र हाइपरप्यारामिटरहरू छान्नुहोस्; ब्याकएन्डले आवश्यक VRAM अनुसारको GPU भाडामा लिन्छ, ट्रेनर चलाउँछ र चेकपोइन्टहरू अब्जेक्ट भण्डारणमा लेख्छ।
- The तालिम म्याट्रिक्स पाँच मोडेल चार आर्महरूद्वारा हो, प्रत्येक सेल एउटा गाइड हो: SO-100 मा SmolVLA, SO-101 मा ACT।
- इन्फरेन्स पोडहरू
/api/inference/podद्वारा निष्क्रिय वाचडगको साथ स्वतः प्रावधान गरिन्छ, त्यसैले बिर्सिएको पोडले चुपचाप बिल गर्दैन। - आधार चेकपोइन्टहरू विक्रेताहरूको आफ्नै हुन्:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base। ACT सँग कुनै छैन। - CLI बाट र AI एजेन्टहरूबाट MCP सर्भर मार्फत उही कार्यहरू।
- हार्डवेयर छैन? लाइभ आर्म ले कुनै साइनअप बिना भौतिक SO-100 स्ट्रिम गर्छ; प्रयास पृष्ठ ले भित्र जाने तरिकाहरू देखाउँछ।
फाउन्डेसन मोडेल वा स्क्र्याचबाट
वास्तविक दुविधा कुन 3 B मोडेल छनौट गर्ने होइन। यो पूर्व-प्रशिक्षित VLA प्रयोग गर्ने हो कि होइन, यो कुरालाई ध्यानमा राख्दै कि ACT ले प्रत्येक लगभग दस मिनेटको प्रदर्शनबाट छवटा वास्तविक दुई-हातका कार्यहरू सिकेको थियो, 80 M प्यारामिटरहरू सहित र केही पनि पूर्व-प्रशिक्षित थिएन।
- भाषा कन्डिसनिङ। ACT सँग कुनै छैन; एउटा ACT चेकपोइन्टले एउटा कार्य गर्छ।
- तपाईंको प्रदर्शनबाट अनुपस्थित वस्तुहरूमा राम्रो: SO-101 मा, ACT को 40% आउट अफ डिस्ट्रिब्युसनको तुलनामा 50%।
- सबैमा बहु-कार्य: SmolVLA ले एउटा चेकपोइन्टको साथ तीन SO-100 कार्यहरूमा 78.3% पुग्छ; ACT केवल एकल-कार्यमा चलाइएको थियो।
- 7.6x देखि 24x विलम्बता: ACT को 20 ms को तुलनामा प्रति कार्य चरण 152 देखि 485 ms।
- 1 देखि 3 को सट्टा प्रति रन 4 देखि 12 USD, र कुनै पनि 24 GB कार्डको सट्टा A100 टियर।
- लाइसेन्स जोखिम, साथै एउटा गेटेड-रेपो विफलता मोड जुन सुरुदेखि अवस्थित छैन।
- पूर्व-प्रशिक्षित तौलहरूले खराब डेटासेटलाई मास्क गर्न सक्छ। बिग्रिएको डेटामा आधा काम गर्ने फाइन-ट्यूनले डेटा हेर्नु अघि एक हप्ता खर्च गर्छ।
पुरानो रन पुन: उत्पादन गर्ने केस
2025 चेकपोइन्ट पछ्याउँदा तपाईंको लागि मोडेल छनोट हुन्छ र समस्यालाई संस्करण पिनिङमा परिणत गर्छ: हालको LeRobot ले N1.5 अस्वीकार गर्छ, त्यसैले तपाईंले पिन गर्नुहुन्छ lerobot==0.5.1। कुनै सीड फिल्ड र रनहरू बीच 5 देखि 6 प्रतिशत भिन्नता नहुँदा, पुनरुत्पादन निर्माणद्वारा अनुमानित हुन्छ। र प्लेटफर्म पक्षमा छन्।

दुईमा झर्यो? ACT र GR00T N1.7 र GR00T N1.7 र SmolVLA। कच्चा पङ्क्तिहरू एरेना प्रविष्टिहरूमा छन्: GR00T N1.7, Pi0.5, SmolVLA र ACT।
यो प्लेटफर्मले तपाईंलाई कहाँ मद्दत गर्दैन
- यसले रिमोट अनुमानलाई छिटो बनाउन सक्दैन। २० देखि ४८५ ms को लूप मोडेलको हो; इन्टरनेट राउन्ड ट्रिपहरूले यसमा थप्छन्।
- यसले तपाईंको आफ्नै हार्डवेयरमा GR00T वा Pi0.5 लाई फाइन-ट्यून गर्न सक्दैन। यहाँ दुवै क्लाउड-मात्र हुन्; SmolVLA र ACT मात्र स्थानीय रूपमा चल्छन्।
- यसले डेटासेट ठीक गर्न सक्दैन। हानि घट्छ तर नीतिले केही गर्दैन एउटा डेटा समस्या हो, एउटा नीति जुन एउटै सेटअपमा मात्र काम गर्छ एउटा कभरेज समस्या हो।
- यसले GR00T रनहरूलाई पुनरुत्पादन योग्य बनाउन सक्दैन: अपस्ट्रीम कन्फिगमा कुनै सीड फिल्ड छैन।
८५ मोडेलहरू, ३३२ बेन्चमार्क परिणामहरू, प्रत्येक संख्या त्यसको स्रोतमा लिङ्क गरिएको
यस पृष्ठमा रहेका तालिकाहरूको क्रमबद्ध संस्करण: ८५ भिजन-ल्याङ्ग्वेज-एक्शन मोडेलहरू, ३३२ बेन्चमार्क परिणामहरू, प्रत्येकलाई त्यसको पेपर वा मोडेल कार्डमा लिङ्क गरिएको छ।
एरिना खोल्नुहोस्एउटा छनौट गरेर अगाडि बढ्दै
एउटा पूर्वनिर्धारित: ५० एपिसोडहरू रेकर्ड गर्नुहोस्, डेटासेट प्रमाणित गर्न १ देखि ३ USD मा ACT तालिम दिनुहोस्, त्यसपछि SmolVLA लाई उही डेटामा। कुल ६ USD भन्दा कममा, र तिनीहरूले महत्त्वपूर्ण प्रश्नको जवाफ दिन्छन्: यहाँ प्रिट्रेनिङले मद्दत गर्छ कि, वा बोटलनेक डेटा हो। सम्पर्क-समृद्ध बहु-चरण कार्यहरूको लागि GR00T N1.7 मा जानुहोस्, दृश्य परिवर्तन हुँदा Pi0.5 मा जानुहोस्।
प्लेटफर्मको विस्तृत जानकारी: आफ्नो पहिलो नीति तालिम दिनुहोस्, त्यसपछि आफ्नो पहिलो नीति चलाउनुहोस्। तालिम कागजातहरू र डेटासेट कागजातहरूले फारम र ढाँचा समेट्छन्; SO-100 पृष्ठ र पूर्ण SO-100 गाइडले निर्माण र क्यालिब्रेसन समेट्छन्। पृष्ठभूमि: VLA सिंहावलोकन र Pi0 फ्लो-म्याचिङ लेख। तपाईंको सफलता दर बढाउने एउटा हो डेटा गुणस्तर गाइड।
SO-100 मा मैले कुन VLA नीति पहिले तालिम दिनुपर्छ?▾
ACT, त्यसपछि SmolVLA। ACT ले सुरुदेखि नै तालिम दिन्छ, त्यसैले यसले खराब डेटासेटलाई लुकाउन सक्दैन, र 24 GB कार्डमा एक रनको लागत 1 देखि 3 USD हुन्छ। यदि ACT ले कार्य गर्छ भने, GR00T N1.7 वा Pi0.5 रनको लागि 4 देखि 12 USD खेर जाँदैन।
के GR00T N1.7 वास्तवमा Pi0.5 भन्दा राम्रो छ?▾
LIBERO मा तिनीहरू आवाजको दायरा भित्र छन्: GR00T N1.7 को लागि चार सुइटहरूमा 97.0%, openpi मा 30k स्टेप्समा Pi0.5 को लागि 96.85%, LeRobot पोर्टको लागि 97.5%, सबै फरक हार्नेसहरूबाट। वास्तविक भिन्नताहरू 152 ms प्रति कार्य चरण बनाम 485 ms, v2.1 डेटासेट बनाम v3.0, र बेन्चमार्क शुद्धता बनाम खुला-विश्व सामान्यीकरण हुन्।
के म यी मध्ये कुनैलाई एकल RTX 4090 मा फाइन-ट्यून गर्न सक्छु?▾
SmolVLA र ACT, हो; दुवै RTX 4090 वा कुनै पनि 24 GB कार्डको लागि सूचीबद्ध छन् र स्थानीय रूपमा चल्छन्। GR00T N1.7, N1.5 र Pi0.5 लाई A100 वा H100 80 GB चाहिन्छ र यहाँ क्लाउड-मात्र छन्। NVIDIA ले GR00T फाइन-ट्यूनिङको लागि 40 GB वा सोभन्दा बढी सिफारिस गर्दछ; openpi को न्यूनतम आवश्यकता पूर्ण Pi0.5 फाइन-ट्यूनको लागि 70 GB भन्दा माथि छ, LoRA को लागि 22.5 GB।
यी पाँच मध्ये कुनलाई म व्यावसायिक रूपमा प्रयोग गर्न सक्छु?▾
GR00T N1.7 को वेट्स NVIDIA Open Model License Agreement अन्तर्गत छन्, जुन कार्डले व्यावसायिक प्रयोगलाई समेट्छ भन्छ। N1.5 को वेट्स गैर-व्यावसायिक छन्। SmolVLA को कोड LeRobot मा Apache 2.0 हो, तर lerobot/smolvla_base कार्डमा कुनै लाइसेन्स फिल्ड छैन, त्यसैले वेट्स उल्लेख गरिएको छैन। ACT सँग लाइसेन्स दिनको लागि कुनै आधारभूत वेट्स छैन। Pi0.5 अस्पष्ट छ: LeRobot को कागजातहरूले Apache 2.0 भन्छन्, यसको कार्ड मेटाडेटाले लाइसेन्स: gemma पढ्छ।
Sources
- NVIDIA Isaac-GR00T रिपोजिटरी: GA स्थिति, N1.6 देखि N1.7 परिवर्तनहरू, हार्डवेयर आवश्यकताहरू, torchcodec र FFmpeg अवरोधहरू, launch_finetune.py, रन-देखि-रन भिन्नता
- nvidia/GR00T-N1.7-3B मोडेल कार्ड: Cosmos-Reason2-2B ब्याकबोन, 3 B प्यारामिटरहरू, अनुमान समय तालिका, NVIDIA Open Model License, Model Version फिल्ड
- nvidia/GR00T-N1.5-3B मोडेल कार्ड: Eagle 2 सन्दर्भ, SigLip2 र T5, फ्लो म्याचिङ DiT, एकतर्फी गैर-व्यावसायिक लाइसेन्स
- Isaac-GR00T LIBERO उदाहरण: 20K स्टेप्स र ब्याच साइज 640 मा प्रति-सुइट सफलता दर, प्रति सुइट 200 परीक्षणहरू
- Isaac-GR00T SimplerEnv उदाहरण: प्रति-कार्य Bridge र Fractal सफलता दर, GR00T N1.6 बनाम N1.7
- pi0.5: खुला-विश्व सामान्यीकरण सहितको एक भिजन-भाषा-कार्य मोडेल (2 B VLM प्लस 300 M कार्य विशेषज्ञ, 50 Hz नियन्त्रण, लगभग 400 घण्टाको मोबाइल हेरफेर, 3 देखि 104 स्थानहरूमा स्केलिंग अध्ययन)
- openpi रिपोजिटरी: GPU मेमोरी फ्लोरहरू, फ्लो-म्याचिङ-हेड-मात्र स्कोप, र examples/libero मा Pi0.5 LIBERO परिणामहरू
- lerobot/pi05_base मोडेल कार्ड: LeRobot पोर्टको स्कोप, लाइसेन्स: gemma मेटाडेटा, lerobot-train प्रयोग
- LeRobot pi0.5 कागजात: गेटेड PaliGemma टोकेनाइजर, LIBERO पुनरुत्पादन तालिका, n_action_steps फलब्याक ट्र्याप, Apache 2.0 कथन
- SmolVLA: किफायती र कुशल रोबोटिक्सका लागि एक भिजन-भाषा-कार्य मोडेल (450 M प्यारामिटरहरू, LIBERO र Meta-World तालिकाहरू, SO-100 र SO-101 परिणामहरू, एसिन्क्रोनस अनुमान)
- LeRobot SmolVLA कागजात: 25 विरुद्ध 5 स्थानहरूमा 50 एपिसोडहरू, A100 मा लगभग 4 घण्टामा 20k स्टेप्स
- कम लागतको हार्डवेयरको साथ फाइन-ग्रेन्ड बिम्यानुअल हेरफेर सिक्ने (ACT र ALOHA): 80-90 प्रतिशतमा 6 कार्यहरू, k=1 देखि k=100 सम्म चंक साइज एब्लेसन
- LeRobot 0.6.2: ACTConfig र SmolVLAConfig पूर्वनिर्धारितहरू, पूर्वनिर्धारित सीड 1000, --accelerator.gradient_accumulation.steps, Python 3.12 आवश्यकता, Apache 2.0
- LeRobot GR00T कागजात: नीति प्रकार groot, N1.5 समर्थन हटाइयो, pin lerobot==0.5.1, SO-101 चंक साइज उदाहरण
- lerobot/smolvla_base मोडेल कार्ड: --policy.path द्वारा प्रयोग गरिएको SmolVLA आधार चेकपोइन्ट, र यसको कार्ड मेटाडेटा, जसमा कुनै लाइसेन्स फिल्ड छैन
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started