AY-Robots नीति तुलना तालिकाले GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA र ACT लाई प्यारामिटर गणना, GPU टियर, इन्फरेन्स विलम्बता र न्यूनतम एपिसोड गणनाका साथ सँगै देखाउँदै।
VLA मोडेलहरूनीति प्रशिक्षणमोडेल चयनLeRobotso-100

तपाईंले २०२६ मा कुन VLA नीति तालिम दिनुपर्छ?

AY-Robots ResearchAugust 23, 202618 मिनेट पढाइ

GR00T N1.7, Pi0.5, SmolVLA, ACT वा GR00T N1.5? वास्तविक परिस्थितिहरूसँग मेल खाने निर्णय तालिका, प्रकाशित बेन्चमार्क संख्याहरू, विलम्बता, प्रति रन लागत र प्रत्येक छनोट पछाडिका लाइसेन्सहरू सहित।

आज SO-100 वर्गको पाखुरामा पाँच नीतिहरू तालिम दिन सकिन्छ। तिनीहरू अनुमानमा 24 गुणा विलम्बता, 37 प्यारामिटर गणनामा र 12 एक रनको लागतमा, र तपाईंले परिणाम पठाउन सक्नुहुन्छ कि सक्नुहुन्न भन्नेमा फरक छन्। पाँच मोडेल कार्डहरू यसलाई समाधान गर्दैन: तपाईंसँग भएको प्रश्नको कुनैले पनि जवाफ दिँदैन, मैले पहिले कुन चलाउने?

तलका प्रत्येक संख्या अगस्ट 2026 मा कागजातहरू, रेपोहरू र कार्डहरूबाट पढिएको थियो। प्लेटफर्म संख्याहरू बाट आउँछन् AY-Robots policy catalog; जहाँ दुई असहमत छन्, दुवै देखाइएको छ।

संक्षिप्त संस्करण

  • यदि तपाईंलाई आफ्नो डेटासेटमा शंका छ भने पहिले ACT तालिम दिनुहोस्: 1 देखि 3 USD प्रति रन, खराब डेटालाई ढाक्नको लागि कुनै पूर्व-तालिम प्राप्त छैन।
  • GR00T N1.7 र Pi0.5 LIBERO मा आधा बिन्दु भित्र छन्, 97.0 विरुद्ध 96.85 देखि 97.5। त्यो कुनै पनि छनौट गर्ने कारण होइन।
  • Pi0.5 सामान्यीकरणको लागि हो, शुद्धताको लागि होइन, र 485 ms मा सबैभन्दा ढिलो छ।
  • SmolVLA, 450 M प्यारामिटरहरूमा, यहाँ एक मात्र VLA हो जसले एउटा 24 GB कार्डमा फाइन-ट्युन गर्छ।
  • 20 ms मा ACT द्रुत प्रतिक्रियात्मक गतिको लागि एक मात्र विकल्प हो। लाइसेन्सले बाँकी निर्णय गर्छ।

निर्णय तालिका

तपाईंको अवस्थायसलाई तालिम दिनुहोस्किन
डेटासेटको गुणस्तर अप्रमाणितACTकुनै पनि पूर्व-प्रशिक्षित मोडेलले बिग्रिएको डेटासेट लुकाउन सक्दैन, र असफल हुँदा 1 देखि 3 USD खर्च लाग्छ।
सम्पर्क-समृद्ध, बहु-चरण, भाषा-आधारितGR00T N1.7चार LIBERO सुइटहरूमा 97.0%, साथै एक सापेक्ष अन्तिम-प्रभावकारी कार्य स्थान।
द्रुत प्रतिक्रियात्मक गति, सर्भोमा अनुमानACT20 ms। अर्को सबैभन्दा छिटो 7.6 गुणा ढिलो छ।
नयाँ वस्तुहरू, नयाँ दृश्य, खुला-विश्वPi0.5104 स्थानहरूमा, वितरण बाहिरको व्यवहारका लागि निर्मित।
एउटा 24 GB कार्ड, अझै भाषा चाहिन्छSmolVLA450 M प्यारामिटरहरू, 30 एपिसोडको न्यूनतम, स्थानीय रूपमा चल्छ।
2025 मा रेकर्ड गरिएको रन पुन: उत्पादन गर्दैGR00T N1.5यदि तपाईंले गर्नैपर्छ भने मात्र: LeRobot ले अब यसलाई अस्वीकार गर्छ, वजनहरू गैर-व्यावसायिक छन्।
यो उत्पादनको रूपमा पठाइनेछN1.7, SmolVLA or ACTN1.5 गैर-व्यावसायिक छ, Pi0.5 मा Gemma सर्तहरू छन्, SmolVLA को कार्डमा कुनै उल्लेख छैन।

पाँच उम्मेदवारहरू

सबै पाँच नीतिहरू हुन्: क्यामेरा फ्रेमहरू, जोइन्ट पोजिसनहरू र, तिनीहरूमध्ये चारका लागि, भविष्यका जोइन्ट लक्ष्यहरूको एक भागमा म्याप गरिएको भाषा निर्देशन। तिनीहरूलाई के कुराले अलग गर्छ भने तपाईं आउनु अघि कति सिकिएको थियो।

नीतिप्यारामिटरहरूविलम्बताGPU टियरस्थानीय?न्यूनतम एपिसोडहरूढाँचालागत
ACT~80 M20 ms24 GB cardहो50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardहो30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBहोइन50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBहोइन50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBहोइन50v3.04 to 12 USD

GR00T N1.7

NVIDIA को हालको भिजन-ल्याङ्ग्वेज-एक्शन मोडेल, लगभग ३ अर्ब प्यारामिटरहरू, जसमध्ये लगभग ४० मिलियन फाइन-ट्युनिङको समयमा प्रशिक्षित गरियो। रेपोले N1.6 बाट भएका परिवर्तनहरू सूचीबद्ध गर्दछ: ब्याकबोन भेन्डर गरिएको Eagle मोडेलबाट Qwen3-VL मा Cosmos-Reason2-2B मा, diffusion layers 32 to 16, state and action dimensions 29 to 132, action horizon 16 to 40.

सानो आर्ममा महत्त्वपूर्ण कुरा सापेक्षिक एन्ड-इफेक्टर एक्शन स्पेस हो: N1.7 ले हालको पोजबाट डेल्टा अनुमान गर्दछ, जसले गर्दा २० हजार घण्टाको EgoScale मानव भिडियो रोबोट नीतिमा स्थानान्तरण गर्न सकिन्छ। स्पेसिफिकेशन N1.7 पृष्ठमा, प्रक्रिया SO-100 गाइडमा N1.7.

रेपोमा GA, मोडेल कार्डमा EA

Isaac-GR00T README ले N1.7 लाई जनरल एभेलिबिलिटी रिलिजको रूपमा घोषणा गर्दछ, जसमा पूर्ण बेन्चमार्क र समर्थन समावेश छ। यसको Hugging Face कार्ड अपडेट भएको छैन: the Model Version फिल्डमा अझै पनि GR00T N1.7 EA लेखिएको छ। रेपो नयाँ कागजात हो।

GR00T N1.5

उही 3 B स्केल, Eagle 2 ब्याकबोन, SigLip2 र T5, फ्लो-म्याचिङ DiT हेड। यो तपाईंसँग पहिले नै भएको लाई विस्तार गर्न अवस्थित छ। दुई कुराले यसलाई खराब पूर्वनिर्धारित बनाउँछ: यसको तौलमा NVIDIA को एकतर्फी गैर-व्यावसायिक लाइसेन्स छ, र हालको LeRobot रिलीजहरूले N1.5 समर्थन हटाएका छन्। हेर्नुहोस् .

Pi0.5

Physical Intelligence को VLA, पोलिसी प्रकार pi05। यस पेपरले PaliGemma बाट प्रारम्भ गरिएको 2 B VLM र 300 M कार्य विशेषज्ञ दिन्छ, जसले रोबोटलाई 50 Hz मा चलाउँछ; LeRobot को pi05 कन्फिगले पूर्वनिर्धारित रूपमा 50-चरणको चङ्क, त्यो दरमा एक सेकेन्डमा सेट गर्छ। यसको मुख्य विशेषता नदेखिएको ठाउँहरू हुन्: वास्तविक घरहरूमा लगभग 400 घण्टाको मोबाइल म्यानिपुलेसन, र 3, 12, 22, 53, 82 र 104 स्थानहरूमा गरिएको स्केलिङ अध्ययन, जहाँ 104-स्थानको मोडेलले परीक्षण घरहरूमा नै प्रशिक्षित नियन्त्रणसँग मेल खायो।

एउटा सीमा, जुन lerobot/pi05_base कार्डमा भनिएको छ: पोर्टले केवल फ्लो-म्याचिङ एक्शन हेड मात्र बोक्छ। सबटास्क प्रेडिक्शन, एक्शन टोकेनाइजेसन र आरएल अपस्ट्रिममा जारी गरिएको थिएन, र ओपनपीले आफ्नो रिपोजिटरीको बारेमा पनि त्यही भन्छ। Pi0.5 पृष्ठSO-100 मा Pi0.5 गाइड मा बाँकी जानकारी छ।

दिउँसो बर्बाद गर्ने जाल: गेटेड रिपोज

Pi0.5 लाई गेटेड google/paligemma-3b-pt-224 टोकेनाइजर चाहिन्छ (gated: manual, यद्यपि गुगलले अनुरोधहरू तुरुन्तै प्रशोधन गरिने बताउँछ)। यसलाई स्वीकार नगरी र प्रशिक्षण वातावरणमा hf auth login चलाउँदा, काम सुरु हुन्छ, केही समय डाउनलोड हुन्छ, त्यसपछि नेटवर्क त्रुटि जस्तो देखिने प्राधिकरण त्रुटिमा समाप्त हुन्छ। nvidia/GR00T-N1.7-3B गेटेड छैन, तर यसको nvidia/Cosmos-Reason2-2B ब्याकबोन गेटेड छ (gated: auto)। क्युमा राख्नु अघि दुवैलाई खाली गर्नुहोस्; यदि कुनै रन निष्क्रिय बसिरहन्छ भने, स्टक-क्यु पृष्ठ ले के जाँच गर्ने भनेर सूचीबद्ध गर्दछ।

SmolVLA

450 M प्यारामिटरहरू, लगभग 100 M एक्शन एक्सपर्टमा, SmolVLM-2 मा VLM फ्रोजन गरी र यसको पहिलो 16 भाषा-मोडेल तहहरू मात्र प्रयोग गरियो। पूर्व-प्रशिक्षण सामुदायिक डेटा थियो: 481 डेटासेटहरू, 10.6 M फ्रेमहरू, तपाईंले प्रयोग गर्ने उही सस्ता आर्महरूबाट। यहाँ एक 24 GB कार्डमा फिट हुने एक मात्र VLA, र एक मात्र 30 एपिसोड फ्लोर। हेर्नुहोस् SmolVLA पृष्ठ

ACT

फाउन्डेसन मोडेल होइन। ALOHA बाट एक्शन चंकिङ ट्रान्सफर्मर लगभग 80 M प्यारामिटरहरूमा प्रशिक्षित छ प्रत्येक कार्यका लागि सुरुदेखि नै, 50 Hz मा 50 प्रदर्शनहरूमा। यस पेपरले लगभग दश मिनेटका प्रदर्शनहरूबाट प्रत्येक, यसले हाइलाइट गर्ने उदाहरणहरूमा 80 देखि 90 प्रतिशतसम्म। यसको विचार, action chunking, यस पृष्ठमा रहेका हरेक मोडेलमा छ, र यसको एब्लेसनले अझै पनि मापन गर्छ प्रभाव सबैभन्दा राम्रो: टेम्पोरल एन्सेम्बलिंग बन्द गरी दुई सिमुलेटेड कार्यहरूमा, सफलता k=1 मा 1 प्रतिशतबाट k=100 मा 44 प्रतिशतमा बढ्छ। ACT पृष्ठ मा बाँकी छ।

बेन्चमार्कहरूले वास्तवमा के भन्छन्

LIBERO यी पाँचमध्ये तीनले रिपोर्ट गर्ने एउटा बेन्चमार्क हो: सिमुलेटेडमा भाषा-कन्डिसन गरिएका कार्यहरू Franka Panda, तलका चार सुइटहरूमा प्रत्येकमा दस कार्यहरूमा विभाजित। NVIDIA ले प्रति सुइट 200 परीक्षणहरू चलायो।

मोडेलस्थानिकवस्तुलक्ष्य10 (लामो)औसत
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
यी पङ्क्तिहरू कडाईका साथ तुलनायोग्य छैनन्

प्रत्येक संख्या फरक हार्नेस र बजेटबाट आउँछ। GR00T ले ग्लोबल ब्याच 640 मा 20K चरणहरू चलायो; ओपनपीआईको तथ्याङ्क 30K चेकपोइन्ट हो; LeRobot पोर्टले LIBERO आधार मोडेलमा 6K चरणहरू थप्यो। SmolVLA अर्को बेमेल हो: यसको पेपरले LIBERO मा सुरुदेखि नै, कुनै VLA पूर्व-प्रशिक्षण बिना, त्यो पङ्क्तिलाई तालिम दिन्छ, जबकि यसभन्दा माथिका तीनले पूर्व-प्रशिक्षित चेकपोइन्टहरूलाई फाइन-ट्यून गर्छन्। 96.85 देखि 97.5 लाई एउटै क्लस्टरको रूपमा व्यवहार गर्नुहोस्, र 87.3% को अन्तरलाई वास्तविक मान्नुहोस् तर 6.7 गुणा प्यारामिटरहरूसँग प्राप्त गरिएको।

SimplerEnv ले फैलावट देखाउँछ, जुन LIBERO ले देखाउँदैन। NVIDIA ले N1.7 लाई N1.6 सँग तुलना गर्छ, जुन पुस्तागत डेल्टा को सबैभन्दा नजिकको सार्वजनिक कुरा हो।

SimplerEnv सुइटN1.6 औसतN1.7 औसतउत्कृष्ट स्विंगसबैभन्दा खराब स्विंग
Bridge (WidowX), 7 कार्यहरू56.6%62.3%stack_cube 5.0 देखि 48.0put_eggplant_in_basket 89.0 देखि 53.0
Fractal (Google Robot), 6 कार्यहरू52.0%72.5%open_drawer 0.0 देखि 65.0कुनै पनि छैन, प्रत्येक कार्यमा सुधार भयो

ब्रिज पङ्क्ति उपयोगी छ: औसतमा 5.7 अंक प्राप्त भयो जबकि put_eggplant_in_basket ले 36 गुमायो र put_eggplant_in_sink 33 बाट 2 मा झर्यो। नयाँ पुस्ताले वितरणलाई उठाउनुको सट्टा सार्छ, त्यसैले यदि तपाईंको कार्य N1.7 घटेको ठाउँमा छ भने, औसतले केही भन्दैन।

AY-Robots एरिना लिडरबोर्ड, 85 भिजन-भाषा-कार्य मोडेलहरूको क्रमबद्ध तालिका जसमा 332 बेन्चमार्क परिणामहरू छन्, प्रत्येक मान यसको पेपर वा मोडेल कार्डबाट लिङ्क गरिएको छ जहाँबाट यो आएको हो
एरिनामा 85 VLA मोडेल र 332 बेन्चमार्क परिणामहरू छन्, प्रत्येकलाई यसको पेपर वा मोडेल कार्डमा लिङ्क गरिएको छ। ब्लग पोस्टमा उद्धृत गरिएको संख्या वास्तविक हो कि होइन भनेर जाँच गर्न उपयोगी।

पाँच मध्ये, केवल SmolVLA पेपरले SO-100 वर्गको हातमा रिपोर्ट गर्छ: तीन कार्यहरूमा SmolVLA को लागि 78.3 प्रतिशत र Pi0 को लागि 61.7, दुवै बहु-कार्य, ACT प्रशिक्षित एकल-कार्यको लागि 48.3 को विरुद्ध, जुन समान छैन। स्वच्छ जोडी SO-101 पिक-एन्ड-प्लेस मा दुवै एकल-कार्य हो: वितरणमा 70 को विरुद्ध 90, यसबाट बाहिर 40 को विरुद्ध 50। यसमा तुलना गर्नुहोस् ACT विरुद्ध SmolVLAPi0.5 विरुद्ध SmolVLA, वा ब्राउज गर्नुहोस् एरिना

विलम्बता र लागतले परिनियोजन निर्धारण गर्छ

इन्फरेन्स लेटेन्सी मानिसहरूले अन्तिममा पत्ता लगाउने र पहिले पछुताउने बाधा हो। बेन्चमार्कमा पाँच अंकले राम्रो तर प्रति कार्य चरण आधा सेकेन्ड लाग्ने नीति तपाईंको डेस्कमा खराब देखिन्छ: सम्पर्क गतिशीलता पर्खदैन।

एउटा चेतावनी: GR00T को तथ्याङ्क NVIDIA को कार्डसँग मेल खाँदैन, जसले 4 डिनोइजिङ चरणहरू र एउटा क्यामेरालाई H100 मा इगर मोडमा 85.8 ms, torch.compile सँग 48.6 ms, पूर्ण TensorRT मार्फत 27.9 ms मा समय दिन्छ। यहाँको 152 ms सर्भिङ ओभरहेड र एकभन्दा बढी क्यामेरासहितको पूर्ण-स्ट्याक तथ्याङ्क हो, फर्वार्ड पास होइन।

रिमोट इन्फरेन्सको कडा सीमा छ

20 देखि 485 ms को लूप मोडेलको हो, र सार्वजनिक-इन्टरनेट राउन्ड ट्रिपहरूले यसमा थप्छन्। रिमोट इन्फरेन्स ढिलो पिक-एन्ड-प्लेसका लागि सम्भव छ, तर छिटो प्रतिक्रियात्मक गतिका लागि होइन। यदि तपाईंको कार्यलाई गति चाहिन्छ भने, इन्फरेन्स सर्भोको छेउमा बस्छ: ACT वा SmolVLA, स्थानीय रूपमा। सम्बन्धित: नीति गतिमा बीचमा रोकिन्छ

मोडेल परिवर्तन नगरी समय किन्नको लागि एउटा तरिका: SmolVLA पेपरले सिंक्रोनस कार्यान्वयन मापन गर्दछ, जहाँ नीतिले अर्को भविष्यवाणी गर्नु अघि एउटा खण्ड समाप्त गर्दछ, एसिन्क्रोनसको विरुद्धमा, जहाँ भविष्यवाणी कार्यान्वयनसँग ओभरल्याप हुन्छ। सफलता समान छ, 73.3 को विरुद्धमा 78.3, तर उही पिक-एन्ड-प्लेले 13.75 को सट्टा 9.7 सेकेन्ड लिन्छ, र निश्चित विन्डोमा रोबोटले 9 को सट्टा 19 चक्र व्यवस्थापन गर्दछ।

लाइसेन्सहरू, जाँच गरियो किनभने कसैले जाँच गर्दैन

Modelवजन लाइसेन्सकोड लाइसेन्सव्यावसायिक प्रयोग
GR00T N1.7NVIDIA Open Model License; कार्डले व्यावसायिक प्रयोगको अनुमति दिन्छApache 2.0हो
GR00T N1.5NVIDIA एकतर्फी गैर-व्यावसायिक लाइसेन्सApache 2.0होइन
Pi0.5pi05_base card metadata reads license: gemmaApache 2.0 (openpi, LeRobot docs)दुवै पढ्नुहोस्, तिनीहरू असहमत छन्
SmolVLAno licence field on the smolvla_base cardApache 2.0 (LeRobot)कोड हो, वजन उल्लेख नगरिएको
ACTकुनै आधारभूत वजनहरू अवस्थित छैनन्Apache 2.0 (LeRobot)हो

Pi0.5 पङ्क्तिमा ध्यान दिनुपर्छ। LeRobot pi05 कागजातले openpi सँग मिल्दोजुल्दो Apache 2.0 उल्लेख गर्दछ, जबकि Hub कार्ड lerobot/pi05_base मा license: gemma छ। दुवै सक्रिय छन्। GR00T N1.7 सँग एक हल्का संस्करण छ: Isaac-GR00T README ले N1.7 Apache 2.0 अन्तर्गत पूर्ण रूपमा व्यावसायिक रूपमा लाइसेन्स योग्य छ भनी उल्लेख गर्दछ, जबकि यसको आफ्नै लाइसेन्स खण्ड र मोडेल कार्डले कोडलाई मात्र Apache 2.0 अन्तर्गत र वजनहरूलाई NVIDIA Open Model License अन्तर्गत राख्छ।

तपाईंले वास्तवमा चलाउने पूर्वनिर्धारितहरू

प्रत्येक ट्रेनर फारमले पूर्वनिर्धारित सेटिङहरू सहित आउँछ, र तिनीहरू मनमानी छैनन्। ACT को LeRobot को आफ्नै हुन्: ब्याच 8, lr 1e-5, 100000 प्रशिक्षण चरणहरू, चंक साइज 100, ACTConfig अपस्ट्रीम र k=100 ACT पेपरबाट। तलको एउटा स्तम्भ एउटा जाल हो।

नीतिब्याचLRअधिकतम चरणहरूग्रेड एक्युमलागू हुन्छ?अतिरिक्त नियन्त्रणहरू
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
पुनरुत्पादनक्षमता, मिति अगस्ट 2026

GR00T को फाइन-ट्युनिङ प्रवेश बिन्दु (launch_finetune.py, एक tyro CLI) मा कुनै सीड फिल्ड छैन यसको कन्फिग डेटाक्लासमा, त्यसैले रनहरू बिट-फर-बिट पुनरुत्पादन योग्य छैनन्। भण्डारले रनहरू बीच 5 देखि 6 प्रतिशत भिन्नता गैर-निर्धारित छवि वृद्धिबाट, जुन अनलाइनमा बहस गरिएका धेरै बेन्चमार्क अन्तरहरू भन्दा ठूलो छ। LeRobot को पूर्वनिर्धारित सीड 1000 हो। ग्रेड-एक्युम स्तम्भले lerobot 0.5.1; अपस्ट्रीम 0.6.2 ले यसलाई --accelerator.gradient_accumulation.steps को रूपमा देखाउँछ।

मोडेल छनोट भन्दा बढी महत्त्वपूर्ण नियन्त्रण

यो कार्य खण्ड हो। लामो खण्डहरूले सहज गति र कम त्रुटिहरू दिन्छन्, तर ब्लक कार्यान्वयन हुँदा नीति प्रतिबद्ध हुन्छ, त्यसैले यो चल्ने कुनै पनि कुरामा ढिलो प्रतिक्रिया दिन्छ: स्थिर घनमा विश्वस्त, घुमिरहेकोमा निराश। यदि यो धेरै अगाडि बढ्छ भने, कार्यान्वयन गरिएको भाग छोटो पार्नुले पुन: प्रशिक्षणलाई जित्छ र निःशुल्क हुन्छ। छोटो रोकिने जोइन्ट फरक समस्या हो; हेर्नुहोस् ।

  • ACT: ACTConfig पूर्वनिर्धारित रूपमा chunk_size 100n_action_steps 100 मा हुन्छ। टेम्पोरल एन्सेम्ब्लिङ बन्द छ र n_action_steps 1 आवश्यक पर्दछ।
  • GR00T N1.7: आन्तरिक क्षितिज १६ बाट ४० मा गयो, तैपनि LeRobot को SO-101 उदाहरण अझै --policy.chunk_size=16 --policy.n_action_steps=16 मा चल्छ। रोलआउट फ्ल्यागको नाम परिवर्तन गरी --execution-horizon राखिएको थियो।
  • Pi0.5: ५०-चरणको खण्ड, जसमध्ये LeRobot को LIBERO रेसिपीले --policy.n_action_steps=10 मार्फत १० वटा कार्यान्वयन गर्छ; यदि तपाईंले फ्ल्याग छोड्नुभयो भने --policy.pretrained_path सँग यो ५० मा फर्कन्छ।
  • SmolVLA: ५०-कार्य खण्डहरू, दुवै नबहरू खुला।

एकै दिउँसोमा पाँचवटैलाई कसरी स्क्रिन गर्ने

सबैभन्दा सस्तो उत्तर थप पढाइ होइन। लगभग 15 USD खर्च गर्नुहोस् र पाखुरालाई तपाईंलाई भन्न दिनुहोस्: एक पटक रेकर्ड गर्नुहोस्, पहिले सस्तो मोडेललाई तालिम दिनुहोस्, एक पटक यसले डेटा सही साबित गरेपछि अगाडि बढ्नुहोस्। संरचनाले मात्रालाई जित्छ, जसको मुख्य उद्देश्य हो र ।

  1. 1
    एक पटकमा ५० एपिसोड रेकर्ड गर्नुहोस्

    GR00T, Pi0.5 र ACT का लागि पचासले बाटो खुल्ला गर्छ, र SmolVLA को तीसले। प्रत्येक भिन्नतालाई पातलो बनाउनुको सट्टा दोहोर्याउनुहोस्: ५० एपिसोडहरू ५ क्यूब स्थानहरूमा प्रशिक्षित गरियो जहाँ २५ वटा गरिएन। तपाईंको पहिलो डेटासेट रेकर्ड गर्नुहोस् हेर्नुहोस्।

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    पहिले ACT लाई तालिम दिनुहोस्, किनकि यसले तपाईंलाई झूट बोल्न सक्दैन

    कुनै पूर्व-प्रशिक्षित तौल छैन, त्यसैले यदि यसले कार्य गर्छ भने, तपाईंको डेटासेटमा त्यो कार्य समावेश छ। यदि ACT ले काम गर्न छोड्यो भने, डेटा ठीक गर्नुहोस्। २४ GB कार्डमा १ देखि ३ USD, २ देखि ५ घण्टा लाग्छ।

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    उही डेटासेटमा SmolVLA चलाउनुहोस्, अपरिवर्तित

    उही डेटा, उही आर्म, ८० M प्यारामिटरको सट्टा ४५० M प्यारामिटर, साथै भाषा कन्डिसनिङ। LeRobot ले एउटा A100 मा लगभग ४ घण्टामा २०K स्टेप रन गर्छ। यसले तपाईंलाई पूर्व-प्रशिक्षणले केही फाइदा दिन्छ कि दिँदैन भनेर बताउँछ।

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T चलाउनु अघि v2.1 मा डाउनग्रेड गर्नुहोस्

    GR00T ले LeRobot v2 ढाँचाको एक प्रकार पढ्छ, साथै एउटा अतिरिक्त meta/modality.json जसले संयुक्त अवस्था र कार्य एरेहरूलाई नाम दिइएका फिल्डहरूमा कसरी विभाजन गर्छ भनेर म्याप गर्छ। v3.0 डेटासेटले त्यो लोडरलाई क्र्यास गर्छ, किनकि v3.0 ले धेरै एपिसोडहरूलाई साझा फाइलहरूमा प्याक गर्छ जहाँ v2 ले प्रति एपिसोड एउटा लेख्थ्यो। Isaac-GR00T ले scripts/lerobot_conversion/convert_v3_to_v2.py लाई डाउनग्रेड हेल्परको रूपमा पठाउँछ; v3 अस्वीकृति पृष्ठ छिटो बाटो हो।

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    यदि पहिलो दुईले केही बाँकी राखे भने मात्र GR00T N1.7 मा जानुहोस्

    यहाँ देखाइएको NVIDIA को CLI मार्फत, वा LeRobot को groot नीति प्रकार मार्फत। NVIDIA ले फाइन-ट्युनिङका लागि ४० GB वा सोभन्दा बढी VRAM, र इन्फरेन्सका लागि १६ GB सिफारिस गर्छ। OOM भएमा, OOM पृष्ठ हेर्नुहोस्।

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

त्यो स्क्रिनिङ पास चलाउने दुई तरिकाहरू

तीन वातावरण, किनभने टूलचेनहरू एकसाथ रहँदैनन्। मुख्यमा LeRobot ०.६.२ हो र यसलाई Python ३.१२ वा नयाँ चाहिन्छ; Isaac-GR00T र openpi छुट्टाछुट्टै uv-व्यवस्थित रिपोहरू हुन्।

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T ले torchcodec ०.८.० लाई यसको एकमात्र भिडियो ब्याकएन्डको रूपमा पिन गर्छ, जसलाई FFmpeg ४ देखि ७ चाहिन्छ। FFmpeg ८ असमर्थित छ, AV1 ग्यारेन्टी छैन।
  • openpi मेमोरी फ्लोरहरू: इन्फरेन्स ८ GB भन्दा माथि, LoRA २२.५ GB भन्दा माथि, पूर्ण फाइन-ट्युनिङ ७० GB भन्दा माथि। त्यो अन्तिम कारणले Pi0.5 एउटा A100 को काम हो।
  • GPU आफैं भाडामा लिनुहोस्, पछि यसलाई नष्ट गर्नुहोस्, र तीन सेट चेकपोइन्ट पथहरू हातले मिलाउनुहोस्।

फाउन्डेसन मोडेल वा स्क्र्याचबाट

वास्तविक दुविधा कुन 3 B मोडेल छनौट गर्ने होइन। यो पूर्व-प्रशिक्षित VLA प्रयोग गर्ने हो कि होइन, यो कुरालाई ध्यानमा राख्दै कि ACT ले प्रत्येक लगभग दस मिनेटको प्रदर्शनबाट छवटा वास्तविक दुई-हातका कार्यहरू सिकेको थियो, 80 M प्यारामिटरहरू सहित र केही पनि पूर्व-प्रशिक्षित थिएन।

सुरुदेखि ACT तालिम दिनुको सट्टा पूर्व-प्रशिक्षित VLA लाई फाइन-ट्यूनिङ गर्ने
तपाईंले के प्राप्त गर्नुहुन्छ
  • भाषा कन्डिसनिङ। ACT सँग कुनै छैन; एउटा ACT चेकपोइन्टले एउटा कार्य गर्छ।
  • तपाईंको प्रदर्शनबाट अनुपस्थित वस्तुहरूमा राम्रो: SO-101 मा, ACT को 40% आउट अफ डिस्ट्रिब्युसनको तुलनामा 50%।
  • सबैमा बहु-कार्य: SmolVLA ले एउटा चेकपोइन्टको साथ तीन SO-100 कार्यहरूमा 78.3% पुग्छ; ACT केवल एकल-कार्यमा चलाइएको थियो।
यसले तपाईंलाई के खर्च गर्छ
  • 7.6x देखि 24x विलम्बता: ACT को 20 ms को तुलनामा प्रति कार्य चरण 152 देखि 485 ms।
  • 1 देखि 3 को सट्टा प्रति रन 4 देखि 12 USD, र कुनै पनि 24 GB कार्डको सट्टा A100 टियर।
  • लाइसेन्स जोखिम, साथै एउटा गेटेड-रेपो विफलता मोड जुन सुरुदेखि अवस्थित छैन।
  • पूर्व-प्रशिक्षित तौलहरूले खराब डेटासेटलाई मास्क गर्न सक्छ। बिग्रिएको डेटामा आधा काम गर्ने फाइन-ट्यूनले डेटा हेर्नु अघि एक हप्ता खर्च गर्छ।

पुरानो रन पुन: उत्पादन गर्ने केस

2025 चेकपोइन्ट पछ्याउँदा तपाईंको लागि मोडेल छनोट हुन्छ र समस्यालाई संस्करण पिनिङमा परिणत गर्छ: हालको LeRobot ले N1.5 अस्वीकार गर्छ, त्यसैले तपाईंले पिन गर्नुहुन्छ lerobot==0.5.1। कुनै सीड फिल्ड र रनहरू बीच 5 देखि 6 प्रतिशत भिन्नता नहुँदा, पुनरुत्पादन निर्माणद्वारा अनुमानित हुन्छ। र प्लेटफर्म पक्षमा छन्।

AY-Robots को GR00T N1.7 र Pi0.5 को आमने-सामने तुलना पृष्ठ, जसले प्यारामिटर गणना, GPU आवश्यकताहरू, अनुमान विलम्बता, डेटासेट ढाँचा र न्यूनतम एपिसोड गणनाहरू सँगसँगै देखाउँछ।
आमने-सामने /compare/groot-n1-7-vs-pi0-5 मा। दुई 3 B मोडेलहरू स्पेसिफिकेशन पानामा एकअर्कासँग साट्न मिल्ने देखिन्छन् तर त्यस्तो होइनन्: एउटालाई LeRobot v2.1 चाहिन्छ, अर्कोलाई v3.0।

दुईमा झर्यो? ACT र GR00T N1.7GR00T N1.7 र SmolVLA। कच्चा पङ्क्तिहरू एरेना प्रविष्टिहरूमा छन्: GR00T N1.7, Pi0.5, SmolVLAACT

यो प्लेटफर्मले तपाईंलाई कहाँ मद्दत गर्दैन

  • यसले रिमोट अनुमानलाई छिटो बनाउन सक्दैन। २० देखि ४८५ ms को लूप मोडेलको हो; इन्टरनेट राउन्ड ट्रिपहरूले यसमा थप्छन्।
  • यसले तपाईंको आफ्नै हार्डवेयरमा GR00T वा Pi0.5 लाई फाइन-ट्यून गर्न सक्दैन। यहाँ दुवै क्लाउड-मात्र हुन्; SmolVLA र ACT मात्र स्थानीय रूपमा चल्छन्।
  • यसले डेटासेट ठीक गर्न सक्दैन। हानि घट्छ तर नीतिले केही गर्दैन एउटा डेटा समस्या हो, एउटा नीति जुन एउटै सेटअपमा मात्र काम गर्छ एउटा कभरेज समस्या हो।
  • यसले GR00T रनहरूलाई पुनरुत्पादन योग्य बनाउन सक्दैन: अपस्ट्रीम कन्फिगमा कुनै सीड फिल्ड छैन।

८५ मोडेलहरू, ३३२ बेन्चमार्क परिणामहरू, प्रत्येक संख्या त्यसको स्रोतमा लिङ्क गरिएको

यस पृष्ठमा रहेका तालिकाहरूको क्रमबद्ध संस्करण: ८५ भिजन-ल्याङ्ग्वेज-एक्शन मोडेलहरू, ३३२ बेन्चमार्क परिणामहरू, प्रत्येकलाई त्यसको पेपर वा मोडेल कार्डमा लिङ्क गरिएको छ।

एरिना खोल्नुहोस्

एउटा छनौट गरेर अगाडि बढ्दै

एउटा पूर्वनिर्धारित: ५० एपिसोडहरू रेकर्ड गर्नुहोस्, डेटासेट प्रमाणित गर्न १ देखि ३ USD मा ACT तालिम दिनुहोस्, त्यसपछि SmolVLA लाई उही डेटामा। कुल ६ USD भन्दा कममा, र तिनीहरूले महत्त्वपूर्ण प्रश्नको जवाफ दिन्छन्: यहाँ प्रिट्रेनिङले मद्दत गर्छ कि, वा बोटलनेक डेटा हो। सम्पर्क-समृद्ध बहु-चरण कार्यहरूको लागि GR00T N1.7 मा जानुहोस्, दृश्य परिवर्तन हुँदा Pi0.5 मा जानुहोस्।

प्लेटफर्मको विस्तृत जानकारी: आफ्नो पहिलो नीति तालिम दिनुहोस्, त्यसपछि आफ्नो पहिलो नीति चलाउनुहोस्तालिम कागजातहरूडेटासेट कागजातहरूले फारम र ढाँचा समेट्छन्; SO-100 पृष्ठपूर्ण SO-100 गाइडले निर्माण र क्यालिब्रेसन समेट्छन्। पृष्ठभूमि: VLA सिंहावलोकनPi0 फ्लो-म्याचिङ लेख। तपाईंको सफलता दर बढाउने एउटा हो डेटा गुणस्तर गाइड

SO-100 मा मैले कुन VLA नीति पहिले तालिम दिनुपर्छ?

ACT, त्यसपछि SmolVLA। ACT ले सुरुदेखि नै तालिम दिन्छ, त्यसैले यसले खराब डेटासेटलाई लुकाउन सक्दैन, र 24 GB कार्डमा एक रनको लागत 1 देखि 3 USD हुन्छ। यदि ACT ले कार्य गर्छ भने, GR00T N1.7 वा Pi0.5 रनको लागि 4 देखि 12 USD खेर जाँदैन।

के GR00T N1.7 वास्तवमा Pi0.5 भन्दा राम्रो छ?

LIBERO मा तिनीहरू आवाजको दायरा भित्र छन्: GR00T N1.7 को लागि चार सुइटहरूमा 97.0%, openpi मा 30k स्टेप्समा Pi0.5 को लागि 96.85%, LeRobot पोर्टको लागि 97.5%, सबै फरक हार्नेसहरूबाट। वास्तविक भिन्नताहरू 152 ms प्रति कार्य चरण बनाम 485 ms, v2.1 डेटासेट बनाम v3.0, र बेन्चमार्क शुद्धता बनाम खुला-विश्व सामान्यीकरण हुन्।

के म यी मध्ये कुनैलाई एकल RTX 4090 मा फाइन-ट्यून गर्न सक्छु?

SmolVLA र ACT, हो; दुवै RTX 4090 वा कुनै पनि 24 GB कार्डको लागि सूचीबद्ध छन् र स्थानीय रूपमा चल्छन्। GR00T N1.7, N1.5 र Pi0.5 लाई A100 वा H100 80 GB चाहिन्छ र यहाँ क्लाउड-मात्र छन्। NVIDIA ले GR00T फाइन-ट्यूनिङको लागि 40 GB वा सोभन्दा बढी सिफारिस गर्दछ; openpi को न्यूनतम आवश्यकता पूर्ण Pi0.5 फाइन-ट्यूनको लागि 70 GB भन्दा माथि छ, LoRA को लागि 22.5 GB।

यी पाँच मध्ये कुनलाई म व्यावसायिक रूपमा प्रयोग गर्न सक्छु?

GR00T N1.7 को वेट्स NVIDIA Open Model License Agreement अन्तर्गत छन्, जुन कार्डले व्यावसायिक प्रयोगलाई समेट्छ भन्छ। N1.5 को वेट्स गैर-व्यावसायिक छन्। SmolVLA को कोड LeRobot मा Apache 2.0 हो, तर lerobot/smolvla_base कार्डमा कुनै लाइसेन्स फिल्ड छैन, त्यसैले वेट्स उल्लेख गरिएको छैन। ACT सँग लाइसेन्स दिनको लागि कुनै आधारभूत वेट्स छैन। Pi0.5 अस्पष्ट छ: LeRobot को कागजातहरूले Apache 2.0 भन्छन्, यसको कार्ड मेटाडेटाले लाइसेन्स: gemma पढ्छ।

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started