LeRobot डेटासेट ढाँचाका लागि AY-Robots शब्दावली प्रविष्टि, प्लेटफर्ममा प्रत्येक प्रशिक्षकले उपभोग गर्ने ढाँचा चाहे एपिसोडहरू रेकर्ड गरिएका थिए वा उत्पन्न गरिएका थिए।
सिंथेटिक डेटासिम-टु-रियलIsaac Labनक्कल सिकाइMimicGenSO-101

रोबोट नीतिहरूको लागि सिंथेटिक डेटा: जहाँ सिमुलेशनले मद्दत गर्छ

AY-Robots ResearchAugust 23, 202631 मिनेट पढाइ

सिमुलेशनले केही प्रदर्शनहरूलाई हजारौंमा गुणन गर्न सक्छ। प्रकाशित संख्याहरूले वास्तवमा के भन्छन्, जहाँ सिम-टु-रियल अन्तरले असर गर्छ, र के अझै रेकर्ड गर्नुपर्छ यहाँ छ।

हरेक केही महिनामा कसैले पत्ता लगाउँछ कि पचास एपिसोडहरू हातले रेकर्ड गर्नु ढिलो हुन्छ, र सोध्छ कि के एक सिमुलेटरले तिनीहरूलाई उत्पादन गर्न सक्छ। यो एक उचित प्रश्न हो। इमानदार जवाफका तीन भाग छन्: उत्पन्न गरिएको डेटाले मद्दत गर्छ, यसले वास्तविक रेकर्डिङहरूलाई प्रतिस्थापन गर्दैन, र ती दुई तथ्यहरू बीचको अनुपात तपाईंले कुन प्रकारको सिंथेटिक डेटा भन्न खोज्नुभएको हो भन्नेमा पूर्ण रूपमा निर्भर गर्दछ।

यो पृष्ठले प्रकाशित कार्यले वास्तवमा के मापन गर्यो, तपाईंले आज कम लागतको आर्ममा जस्तै SO-100, र जहाँ सिम-टु-रियल ग्यापले लाभहरू खान्छ, त्यसको बारेमा बताउँछ। विस्तृत विवरण अघिको छोटो संस्करण: सबैभन्दा ठूलो गुणकहरू रिपोर्ट गर्ने प्रणालीहरूले वास्तविक मानव प्रदर्शनहरूको सानो सेटलाई गुणा गर्छन्। तिनीहरूले तिनीहरूको आवश्यकतालाई हटाउँदैनन्।

तपाईंले जान्नुपर्ने कुराहरू

  • हेरफेरमा चार असम्बन्धित प्रविधिहरूलाई सिंथेटिक डेटा भनिन्छ: ट्र्याजेक्टोरी गुणन, भौतिकी रोलआउट, भिडियो विश्व मोडेल, र छवि-स्थान वृद्धि। तिनीहरू विभिन्न तरिकामा असफल हुन्छन् र विभिन्न मात्रामा मूल्यवान हुन्छन्।
  • MimicGen ले 200 भन्दा कम मानव प्रदर्शनहरूलाई 18 कार्यहरूमा 50,000 भन्दा बढी उत्पन्न गरिएका प्रदर्शनहरूमा परिणत गर्यो। यसको Square D0 कार्यमा, 10 मानव प्रदर्शनहरूबाट उत्पन्न गरिएका 200 डेमोहरूले 79 प्रतिशत सफलता दिए जबकि 200 वास्तविक मानव डेमोहरूको लागि 84 प्रतिशत थियो।
  • RoboCasa यसको विपरीत उदाहरण हो: 72,000 उत्पन्न गरिएका डेमोहरूले 1,250 मानव डेमोहरूको लागि 28.8 प्रतिशतको तुलनामा 47.6 प्रतिशत अंक प्राप्त गरे। त्यो 58 गुणा भोल्युमको फाइदा हो, समान-को-समान जीत होइन।
  • सिम-एन्ड-रियल सह-प्रशिक्षण अध्ययनले वास्तविक-विश्व कार्य प्रदर्शनमा औसत 38 प्रतिशत सुधार रिपोर्ट गर्दछ। विधि मिश्रणमा सह-प्रशिक्षण हो, सिम-मात्र स्थानान्तरण होइन।
  • GR00T N1 780,000 सिमुलेशन ट्र्याजेक्टोरीहरू (6,500 घण्टा बराबर, 11 घण्टामा उत्पन्न) र 88 वास्तविक घण्टाबाट बढेका 827 घण्टाको न्यूरल ट्र्याजेक्टोरीहरूमा आधारित छ। ती 88 वास्तविक घण्टाहरू अझै पनि पिरामिडको शिखर हुन्।
  • SO-101 को लागि आज एउटा काम गर्ने खुला पाइपलाइन छ: Isaac Lab भित्र LeIsaac, भौतिक नेता आर्मसँग टेलिअपरेट गर्नुहोस्, Isaac Lab Mimic सँग गुणा गर्नुहोस्, LeRobot ढाँचामा निर्यात गर्नुहोस्, GR00T लाई फाइन-ट्यून गर्नुहोस्।
  • AY-Robots ले सिंथेटिक डेटा उत्पन्न गर्दैन। यसले तपाईंले दिनुभएको LeRobot डेटासेटमा प्रशिक्षण दिन्छ, जुन तरिकाले त्यो डेटासेट उत्पादन गरिएको थियो, र प्रशिक्षकहरूलाई मोडेलको आधारमा न्यूनतम 30 देखि 50 एपिसोडहरू चाहिन्छ।

चार फरक चीजहरूलाई सिंथेटिक डेटा भनिन्छ

संख्याहरू तुलना गर्नु अघि परिवारहरूलाई अलग गर्नु उपयुक्त हुन्छ, किनभने 100x गुणक रिपोर्ट गर्ने एउटा पेपर र 5 अंकको सफलता वृद्धि रिपोर्ट गर्ने एउटा पेपरले प्रायः एउटै पाइपलाइनलाई फरक-फरक कोणबाट वर्णन गरिरहेका हुन्छन्। साझा कुरा के हो भने LeRobot dataset मेसिनद्वारा उत्पादन गरिएको थियो न कि भौतिक हातबाट रेकर्ड गरिएको। फरक के हो भने कुन भाग।

परिवारके वास्तविक रहन्छके उत्पन्न हुन्छरिपोर्ट गरिएको गुणकमुख्य असफलता मोड
ट्र्याजेक्टोरी गुणन (MimicGen, DexMimicGen, Isaac Lab Mimic)केही मानव डेमोहरू, वस्तुका जालहरू, भौतिकी इन्जिननयाँ वस्तुको पोज र दृश्य लेआउटहरूमा अनुकूलित नयाँ ट्र्याजेक्टोरीहरू10 human demos to 1,000 per reset distribution; 60 to 21,000; under 200 to over 50,000उत्पत्ति प्रयासहरू असफल हुन्छन्। Isaac Lab ले साधारण केसहरूमा उम्मेदवार सफलता दर 70 percentसम्म र कठिन केसहरूमा 1 percentभन्दा कम राख्छ
कार्य सिमुलेटरमा भौतिकी रोलआउटहरू (Isaac Lab, robosuite, RoboCasa)भौतिकी इन्जिन र सम्पत्ति पुस्तकालयस्क्रिप्टेड नियन्त्रकहरू, योजनाकारहरू वा RL द्वारा संचालित सम्पूर्ण एपिसोडहरूGPU hoursले मात्र सीमितसिमुलेटेड हात तपाईंको हात होइन। सम्पर्क र सर्भो गतिशीलता अनुमानहरू हुन्
भिडियो विश्व मोडेलहरू (DreamGen, Cosmos Transfer)कन्डिसनिङको रूपमा प्रयोग गरिएका केही वास्तविक टेलिअपरेसन एपिसोडहरूनयाँ व्यवहारहरूको फोटोरियलिस्टिक भिडियो, साथै पछि पुनःप्राप्त छद्म-कार्यहरूGR00T N1 मा 88 hours to 827 hours, लगभग 10xकार्यहरू अनुमान गरिन्छ, मापन गरिँदैन। एक विश्वसनीय भिडियोले अविश्वसनीय कार्य बोक्न सक्छ
छवि-स्थान वृद्धि (अनियमित क्रप, रङ जिटर)पिक्सेल बाहेक सबै कुरातपाईंसँग पहिले नै भएका एपिसोडहरूको विचलित दृश्यहरू1x, यसले कुनै नयाँ ट्र्याजेक्टोरी सिर्जना गर्दैनज्यामितीय वृद्धिले छवि र कार्य लेबल बीचको सम्बन्ध तोड्छ

यस लेखले भन्न खोजेको अर्थमा पहिलो तीन मात्र सिंथेटिक डेटा हुन्। चौथो उल्लेख गर्न लायक छ किनभने यो एउटै कुराकानीमा बन्डल हुन्छ र सूचीमा सबैभन्दा सस्तो चीज हो। यदि तपाईंले आफ्नो प्रशिक्षकसँग आउने वृद्धिहरू पहिले नै सक्रिय गर्नुभएको छैन भने, सिमुलेटर स्थापना गर्नु अघि त्यो गर्नुहोस्।

तपाईंले कुनै पनि उत्पन्न गर्नु अघि वास्तविक सिंथेटिक डेटा हेर्न सक्नुहुन्छ

NVIDIA ले GR00T N1 पोस्ट-प्रशिक्षणका लागि प्रयोग गरिएका सिमुलेटेड ट्र्याजेक्टोरीहरू प्रकाशित गर्‍यो nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim Hugging Face मा, लगभग 1.87 TB cc-by-4.0 अन्तर्गत। यो 9,000 क्रस-एम्बोडाइड बाइम्यानुअल Panda र GR1 ट्र्याजेक्टोरीहरू, 240,000 ह्युमनोइड टेबलटप ट्र्याजेक्टोरीहरू, 72,000 एकल-Panda किचन ट्र्याजेक्टोरीहरू र 102 Unitree G1 लोको-म्यानिपुलेसन ट्र्याजेक्टोरीहरूमा विभाजित छ। huggingface-cli download --include "gr1_arms_only.CanSort/**" प्रयोग गरेर एउटा उपसमूह डाउनलोड गर्नु र केही एपिसोडहरू हेर्नु उत्पन्न ट्र्याजेक्टोरीहरू कस्ता देखिन्छन् भनेर क्यालिब्रेट गर्ने सबैभन्दा छिटो तरिका हो, र यसमा ब्यान्डविथ बाहेक केही खर्च लाग्दैन।

प्रकाशित संख्याहरूले वास्तवमा के भन्छन्

यहाँ प्रमाण आधार छ, जसमा संख्याहरू स्रोतहरूले भनेअनुसार छन्, प्रेस विज्ञप्तिहरूले सारांशित गरेअनुसार होइन। तलको प्रत्येक पङ्क्ति 23 अगस्त 2026 मा पढिएको एउटा पेपर वा परियोजना पृष्ठबाट लिइएको हो।

प्रणालीइनपुटउत्पन्न गरिएकोरिपोर्ट गरिएको नतिजा
MimicGen, CoRL 2023200 भन्दा कम मानव डेमो; हेड-टु-हेडमा 10 मानव डेमो50,000 भन्दा बढी डेमो, 18 कार्यहरू, चार हातहरू (Panda, Sawyer, IIWA, UR5e)Square D0: 10 मानव डेमोबाट उत्पन्न गरिएका 200 डेमोबाट 79 प्रतिशत, 200 मानव डेमोबाट 84 प्रतिशतको तुलनामा
DexMimicGen, 202460 स्रोत मानव डेमोद्वि-म्यानुअल दक्ष रोबोटहरूको लागि 21,000 डेमोसिमुलेशनमा द्वि-म्यानुअल दक्ष कार्यहरू, साथै वास्तविक-देखि-सिम-देखि-वास्तविक ह्युमनोइड क्यान क्रमबद्ध गर्ने परिनियोजन
RoboCasa, 20241,250 मानव डेमो (25 एटोमिक कार्यहरूमा प्रति कार्य 50), 100 मूल्याङ्कन कार्यहरू, 150 भन्दा बढी वस्तु कोटीहरू100,000 MimicGen ट्र्याजेक्टरीहरू; 72,000-डेमो उपसमूहले मुख्य तुलनालाई अगाडि बढाउँछमानव सेटमा समग्रमा 28.8 प्रतिशत, पूर्ण रूपमा उत्पन्न गरिएको सेटमा 47.6 प्रतिशतको तुलनामा, नदेखिएको वस्तुका उदाहरणहरूमा मात्र मूल्याङ्कन गरिएको
सिम-र-वास्तविक सह-प्रशिक्षण, 2025वास्तविक डेमोहरू साथै सिमुलेशन डेटासेटहरू, दुई डोमेनहरू (रोबोट आर्म र ह्युमनोइड)एक मिश्रण, प्रतिस्थापन होइनसिमुलेशन डेटाले वास्तविक-विश्व कार्य प्रदर्शनलाई औसत 38 प्रतिशतले बढायो
DreamGen, 2025एउटै वातावरणमा एकल पिक-एन्ड-प्लेस कार्यबाट टेलिअपरेसन डेटाएक अव्यक्त कार्य मोडेल वा एक व्युत्क्रम गतिशीलता मोडेलबाट सिंथेटिक भिडियो प्लस स्यूडो-कार्यहरूह्युमनोइडमा 22 नयाँ व्यवहारहरू, देखिएका र नदेखिएका वातावरणहरूमा
GR00T N1 data pyramid, 202588 घण्टाको इन-हाउस GR-1 टेलिअपरेसन827 घण्टाको न्यूरल ट्र्याजेक्टरीहरू (लगभग 10x); 780,000 सिम ट्र्याजेक्टरीहरू, 6,500 घण्टा बराबर, 11 घण्टामा उत्पादन गरिएकोन्यूरल ट्र्याजेक्टरीहरूले RoboCasa मा 30, 100 र 300 डेमो-प्रति-कार्य प्रणालीहरूमा 4.2, 8.8 र 6.8 अंक थपे, र 8 वास्तविक GR-1 कार्यहरूमा औसत 5.8 अंक थपे
गुणकहरूलाई क्षमताको रूपमा होइन, ट्र्याजेक्टरी गणनाको रूपमा पढ्नुहोस्

एक गुणक पङ्क्ति गणना हो। MimicGen को आफ्नै हेड-टु-हेडले उत्पन्न गरिएको डेटालाई मानव डेटाको समान गणना (84 प्रतिशतको तुलनामा 79) भन्दा अलिकति तल राख्छ, र GR00T N1 एब्लेसनले वास्तविक घण्टा भएको मोडेलको शीर्षमा एकल-अंकको प्रतिशत अंकहरू थप्छ। RoboCasa ले मानव डेटालाई हराउँछ, 28.8 प्रतिशतको तुलनामा 47.6 प्रतिशत, तर 1,250 मानव डेमोको तुलनामा 72,000 उत्पन्न डेमोको साथ। मात्राले कभरेज किन्छ। यसले तपाईंको प्रदर्शनहरूमा कहिल्यै नभएको जानकारी किन्दैन।

प्रत्येक इमानदार एब्लेसनमा ढाँचा उस्तै हुन्छ। सिंथेटिक डेटाले सस्तोमा कभरेज बढाउँछ। यसले तपाईंको ग्रिपर, तपाईंको सर्भो स्याग, तपाईंको प्रकाश वा तपाईंको टेबलको उचाइको बारेमा जानकारी सिर्जना गर्दैन जुन वास्तविक प्रदर्शनहरूमा कतै थिएन। यदि तपाईंको नीति असफल हुन्छ किनभने अन्त-प्रभावकारी आधा सेकेन्ड ढिलो बन्द हुन्छ, कुनै पनि सिमुलेटेड भिन्नताले यसलाई ठीक गर्दैन। त्यो एउटा ग्रिपर समय समस्या वास्तविक रेकर्डिङहरूमा हो।

एक MimicGen खोज तपाईंको आफ्नै रेकर्डिङ सत्रहरूमा लैजान लायक छ, किनभने यसले सामान्य सल्लाहको विरुद्धमा जान्छ। परियोजनाले स्क्वायर D2 मा दुईवटा डेटासेटहरू उत्पन्न गर्‍यो, एउटा राम्रो-गुणस्तरको मानव अपरेटरबाट 10 डेमोहरू सहित र अर्को खराब-गुणस्तरको अपरेटरबाट 10 डेमोहरू सहित, दुवै robomimic बहु-मानव स्क्वायर डेटासेटबाट लिइएका थिए। प्रत्येकमा प्रशिक्षित नीतिहरूले तुलनात्मक परिणामहरू प्राप्त गरे, जसलाई लेखकहरूले ठूलो-स्तरीय डेटा प्रणालीमा डेटाको गुणस्तर त्यति महत्त्वपूर्ण नहुन सक्छ भन्ने संकेतको रूपमा लिए। ध्यानपूर्वक पढ्नुहोस्, त्यो दस बीज प्रदर्शनहरूको बारेमा कथन हो, तपाईंको पचास वास्तविक एपिसोडहरूको बारेमा होइन। यसको अर्थ अलिकति अव्यवस्थित बीज सेट तपाईं र प्रयोगयोग्य उत्पन्न डेटासेटको बीचमा खडा हुने कुरा होइन। यसको अर्थ तपाईंले सह-प्रशिक्षण गर्ने वास्तविक एपिसोडहरू अव्यवस्थित हुन सक्छन् भन्ने होइन, किनभने ती नै हुन् जसले सिम्युलेटरसँग नभएको जानकारी बोक्छन्।

The AY-Robots public dataset directory listing recorded LeRobot datasets with their episode counts.
The public dataset directory at /directory. Every entry here is real recorded episodes. Synthetic data is a multiplier on top of something like this, not a substitute for it.

सिम-टु-रियल ग्याप, ठोस रूपमा

यो खाडललाई सामान्यतया एउटै मात्राको रूपमा छलफल गरिन्छ, जुन अनुपयोगी छ। यो कम्तिमा पाँच अलग-अलग बेमेलहरू हुन्, र तिनीहरूको आकार ११० देखि १५० EUR को हबी आर्ममा फ्रान्काको तुलनामा फरक हुन्छ।

  • सम्पर्क र घर्षण। आइज्याक ल्याबले स्पष्ट रूपमा भन्छ कि एउटै हार्डवेयर र एउटै आइज्याक सिम र फिजिक्स संस्करण दिएमा सिमुलेशन पुन: उत्पादन गर्न सकिन्छ, तर फ्लोटिंग पोइन्ट परिशुद्धता र राउन्डिङ त्रुटिहरूको कारणले विभिन्न हार्डवेयर कन्फिगरेसनहरूमा परिणामहरू फरक हुन्छन्, र फिजिक्सले कपडा वा नरम शरीरहरू जस्ता गैर-कठोर शरीरहरू भएको कुनै पनि दृश्यको लागि निर्धारणवादको ग्यारेन्टी गर्दैन।
  • सञ्चालन। ७.४ V मा चल्ने Feetech STS3215 बस सर्भो लोड अन्तर्गत झुक्छ, ब्याकल्याश हुन्छ, र तातो हुँदा यसको व्यवहार परिवर्तन हुन्छ। SO-101 को लागि MJCF मोडेलले यसको मोटर प्यारामिटरहरू तपाईंको आर्ममा पहिचान गर्नुको सट्टा असम्बन्धित परियोजनाबाट लिन्छ।
  • रेन्डरिङ। क्यामेराको आवाज, रोलिङ शटर, अटो-एक्सपोजर, र तपाईंको टेबलको सही रंग रेन्डरमा हुँदैन। यो खाडलको आधा भाग हो जुन Cosmos-Transfer1 बन्द गर्न निर्माण गरिएको थियो: यसको रोबोटिक्स वृद्धि कार्यप्रवाहले एक रोबोटिक्स सिंथेटिक उदाहरणलाई सेगमेन्टेसन, गहिराई वा किनारा कन्डिसनिङबाट धेरै यथार्थवादी उदाहरणहरूमा नक्सा गर्छ।
  • समय। एक सिमुलेटर निश्चित दरमा चल्छ। वास्तविक नियन्त्रण लूप चल्दैन, र मोडेल आफैंले तपाईंले कुन रोज्नुभयो भन्ने आधारमा प्रति कार्य चरण २० देखि ४८५ ms खर्च गर्छ। इन्फरेन्स लेटेन्सी हेर्नुहोस्।
  • वस्तु तथ्याङ्क। सिमुलेटेड दृश्यहरू कसैले लेखेको वितरणबाट नमूना गरिन्छ। तपाईंको भान्साको टेबल त्यस्तो होइन।

एक सिमुलेटेड SO-100 ले तपाईंको आर्मको बारेमा वास्तवमा के जान्दछ

यो त्यो भाग हो जसले माथिका मध्ये कुनै पनि तपाईंको सप्ताहन्तको लायक छ कि छैन भनेर निर्णय गर्छ, र पहिलो आश्चर्य यो हो कि SO-100 र SO-101 लाई समान रूपमा सेवा दिइँदैन। TheRobotStudio को SO-ARM100 भण्डारले यसको सिमुलेशन सम्पत्तिहरू Simulation/ अन्तर्गत राख्छ। SO100 फोल्डरमा एउटा मात्र URDF फाइल हुन्छ र अरू केही हुँदैन। SO101 फोल्डरमा URDF र MuJoCo दुवै फाइलहरू हुन्छन्: scene.xml, so101_new_calib.xml, so101_old_calib.xml, मिल्दो URDFs र joints_properties.xml। यदि तपाईंलाई किनेमेटिक चेनको सट्टा भौतिकी मोडेल चाहिन्छ भने, तपाईंलाई SO-101 फाइलहरू चाहिन्छ।

तिनीहरू Onshape मा डिजाइन गरिएको CAD मोडेलबाट onshape-to-robot प्लगइनको साथ उत्पन्न गरिएका थिए, जसको अर्थ किनेमेटिक्स र भिजुअल मेशहरू CAD जत्तिकै राम्रा छन्। डाइनामिक्स फरक कथा हो, र भण्डारको आफ्नै README तीन कुराहरूमा स्पष्ट छ। सिमुलेशन र योजनाको क्रममा समस्याग्रस्त टक्कर व्यवहारका कारण आधार टक्कर मेशहरू हटाइयो। STS3215 मोटर गुणहरू Open Duck Mini परियोजनाबाट अनुकूलित गरिएका छन्, SO-101 मा मापन गर्नुको सट्टा। र LeRobot ग्रिपर कन्भेन्सन, जहाँ 0 पूर्ण रूपमा बन्द छ र 100 पूर्ण रूपमा खुला छ, URDF र MuJoCo फाइलहरूमा स्पष्ट रूपमा अझै प्रतिबिम्बित भएको छैन। ती मध्ये प्रत्येक एउटा यस्तो ठाउँ हो जहाँ त्यो मोडेलमा मात्र प्रशिक्षित नीतिले तपाईंको डेस्कमा फरक व्यवहार गर्नेछ।

एक दिन बर्बाद गर्ने क्यालिब्रेसन कन्भेन्सन

पठाइएका MuJoCo फाइलहरूमा दुई शून्य कन्भेन्सनहरू छन्, र scene.xml ले कुन रोबोट फाइल समावेश गर्छ भन्ने आधारमा तिनीहरूमध्ये एउटा छान्छ। so101_new_calib.xml मा, जुन पूर्वनिर्धारित हो, प्रत्येक जोइन्टको भर्चुअल शून्य यसको जोइन्ट दायराको बीचमा हुन्छ। so101_old_calib.xml मा शून्य भनेको रोबोट तेर्सो रूपमा पूर्ण रूपमा फैलिएको कन्फिगरेसन हो। यदि तपाईंको सिमुलेटेड एपिसोडहरूले एउटा कन्भेन्सन प्रयोग गर्छन् र तपाईंको रेकर्ड गरिएका वास्तविक एपिसोडहरूले अर्को प्रयोग गर्छन् भने, मिश्रित डेटासेटमा प्रत्येक जोइन्ट कोण दशौं डिग्रीले अफसेट हुन्छ, हानि अझै घट्छ, र नीतिले आत्मविश्वासका साथ केही गलत गर्छ। सह-प्रशिक्षण गर्नु अघि दुवै पक्षमा कन्भेन्सन जाँच गर्नुहोस्, र पहिले क्यालिब्रेसनहानि घट्छ, नीतिले केही गर्दैन पढ्नुहोस्।

डोमेन र्यान्डमाइजेसन, र यसले के ठीक गर्दैन

यो अन्तरको मानक उत्तर भनेको वास्तविकतासँग मेल खाने प्रयास गर्न छोड्नु र यसको सट्टा यति फराकिलो वितरणमा प्रशिक्षण दिनु हो कि वास्तविकता यस भित्र पर्छ। टोबिन र सहकर्मीहरूले 2017 मा यसको बलियो संस्करण देखाए: गैर-वास्तविक अनियमित बनावटका साथ सिमुलेटेड छविहरूमा मात्र प्रशिक्षित गरिएको वस्तु डिटेक्टर, वास्तविक छविहरूमा कुनै पूर्व-प्रशिक्षण बिना, वास्तविक वस्तुहरूलाई 1.5 सेन्टिमिटरको शुद्धतामा स्थानीयकृत गर्यो र विचलित गर्ने कारकहरू र आंशिक अवरोधहरूमा बलियो रह्यो।

Isaac Lab ले तपाईंले वातावरण कन्फिगमा संलग्न गर्ने घटना सर्तहरू जस्तै विचार प्रस्तुत गर्दछ। यी isaaclab.envs.mdp मा तिनीहरूको वास्तविक प्रकार्य नामहरूद्वारा नियन्त्रणहरू हुन्, ताकि तपाईं अनुमान गर्नुको सट्टा तिनीहरूलाई पढ्न सक्नुहुन्छ।

घटना प्रकार्ययसले के गडबड गर्छ
randomize_rigid_body_materialसम्पर्क घर्षण र प्रत्यावर्तन
randomize_rigid_body_mass, randomize_rigid_body_comवस्तु र लिङ्कको द्रव्यमान, द्रव्यमान केन्द्रको अफसेटहरू
randomize_actuator_gainsजोइन्ट नियन्त्रकको कठोरता र ड्याम्पिङ
randomize_joint_parameters, randomize_fixed_tendon_parametersजोइन्ट घर्षण, आर्मेचर र सीमाहरू
randomize_visual_texture_material, randomize_visual_colorरूप, खाली ठाउँको फोटोमेट्रिक आधा
randomize_physics_scene_gravityगुरुत्वाकर्षण भेक्टर
apply_external_force_torque, push_by_setting_velocityरनटाइम गडबडीहरू
reset_root_state_uniform, reset_joints_by_offsetप्रत्येक एपिसोड रिसेटमा प्रारम्भिक अवस्थाको फैलावट

यहाँ सीमा छ, र यो त्यही हो जसमा मानिसहरू अल्झिन्छन्। अनियमितताले तपाईंले बनाएको मोडेल भित्र नीतिले देखेको वितरणलाई फराकिलो बनाउँछ। यसले सिमुलेटरले प्रतिनिधित्व नगर्ने भौतिक प्रभाव प्रस्तुत गर्न सक्दैन। यदि PhysX ले तपाईंको STS3215 सर्भोको ब्याकल्याश र थर्मल ड्रुपलाई मोडेल गरिरहेको छैन भने, तिनीहरूको कठोरतालाई अनियमित बनाउनाले नीतिलाई ब्याकल्याशको बारेमा केही सिकाउँदैन। त्यसैले सिमुलेशन-प्रशिक्षित नीति अन्तर्गत काम्छ र त्यसपछि झुक्छ भन्ने पाखुरा अनियमितता-बजेट समस्या होइन। यो एक मोडेलिङ समस्या हो।

म्यानुअल मार्ग: Isaac Lab मा डेटा उत्पन्न गर्दै

Isaac Gym लिगेसी सफ्टवेयर हो। NVIDIA को आफ्नै पृष्ठको शीर्षक "Isaac Gym - अब अप्रचलित" छ र यसले विकासकर्ताहरूले यसलाई डाउनलोड गरी प्रयोग गर्न जारी राख्न सक्ने तर यसलाई अब समर्थन नगरिने, Isaac Lab लाई सट्टामा देखाउँछ। यदि तपाईं इतिहास जान्न चाहनुहुन्छ भने, हामीले दुवैलाई समेटेका छौं: र । सन् २०२६ मा नयाँ कामको लागि, Isaac Lab बाट सुरु गर्नुहोस्।

  1. 1
    Isaac Sim र Isaac Lab स्थापना गर्नुहोस्

    पिप स्थापना पृष्ठले निर्देशनहरू Isaac Sim 5.X को लागि हुन् भनी बताउँछ, जसलाई Python 3.11 चाहिन्छ। स्रोत क्लोनले तपाईंलाई अर्को चरणहरूका लागि आवश्यक स्क्रिप्टहरू दिन्छ।

    bash
    pip install "isaacsim[all,extscache]==5.1.0" \
        --extra-index-url https://pypi.nvidia.com
    
    git clone https://github.com/isaac-sim/IsaacLab.git --branch main
    cd IsaacLab
    sudo apt install cmake build-essential
    ./isaaclab.sh --install
    
    # smoke test
    ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py
  2. 2
    लगभग दस मानव प्रदर्शनहरू रेकर्ड गर्नुहोस्

    Isaac Lab को कागजात विशिष्ट छ: निम्न चरणहरू सफल हुनका लागि लगभग १० सफल प्रदर्शनहरू आवश्यक पर्दछ। यसका सुझावहरू पनि उत्तिकै विशिष्ट छन्। प्रदर्शनहरू छोटो राख्नुहोस्, मनमानी अक्षहरूमा नचली सीधा मार्ग लिनुहोस्, र नरोक्नुहोस्, किनकि नीतिलाई किन र कहिले रोक्ने भन्ने स्पष्ट हुँदैन।

    bash
    ./isaaclab.sh -p scripts/tools/record_demos.py \
        --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \
        --device cpu \
        --teleop_device spacemouse \
        --dataset_file ./datasets/dataset.hdf5 \
        --num_demos 10
  3. 3
    उपकार्य सीमाहरू एनोटेट गर्नुहोस्

    Mimic ले इनपुट प्रदर्शनहरूलाई उपकार्यहरूमा विभाजन गर्दछ ताकि यसले खण्डहरूलाई पुनः-समय र पुनः-लक्ष्य गर्न सकोस्। --auto फ्ल्यागले स्वचालित एनोटेशन परिभाषित गर्ने कार्यहरूको लागि मानव हस्तक्षेप बिना यो गर्दछ; यस बिना तपाईं B सँग रोक्नुहुन्छ, N सँग जारी राख्नुहुन्छ र S सँग सीमा चिन्ह लगाउनुहुन्छ। ध्यान दिनुहोस् कि कार्य आईडीले -Mimic प्रत्यय प्राप्त गर्दछ।

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \
        --device cpu \
        --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \
        --auto \
        --input_file ./datasets/dataset.hdf5 \
        --output_file ./datasets/annotated_dataset.hdf5
  4. 4
    गुणा गरिएको डेटासेट उत्पन्न गर्नुहोस्

    यो त्यो चरण हो जसले १० लाई १००० मा बदल्छ। Mimic ले प्रत्येक उम्मेदवारमा बुलियन सफलता मापदण्ड लागू गर्दछ र कार्य पूरा गर्नेहरूलाई मात्र राख्छ, त्यसैले आउटपुट गणना परीक्षण गणना भन्दा कम हुन्छ। कागजातहरूले सरल अवस्थामा उम्मेदवार सफलता दर ७० प्रतिशतसम्म र कठिन कार्यहरू र जटिल रोबोटहरूको लागि १ प्रतिशतभन्दा कम राख्छन्: Franka क्यूब स्ट्याकको लागि लगभग ५० प्रतिशत, र GR1T2 पिक एन्ड प्लेसको लागि ६५ देखि ८० प्रतिशत, जहाँ १००० डेमोलाई १८ देखि ४० मिनेट लाग्छ (८० प्रतिशतमा RTX ADA 6000 मा १९ मिनेट)।

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \
        --device cpu \
        --num_envs 10 \
        --generation_num_trials 1000 \
        --headless \
        --input_file ./datasets/annotated_dataset.hdf5 \
        --output_file ./datasets/generated_dataset.hdf5
  5. 5
    HDF5 लाई LeRobot डेटासेटमा रूपान्तरण गर्नुहोस्

    माथिका सबैले robomimic-फ्लेवर्ड HDF5 उत्पादन गर्दछ, र Isaac Lab कोरले आफ्नै LeRobot कनवर्टर पठाउँदैन: यसका कागजातहरूले मात्र भन्छन् कि तपाईंले उत्पन्न गरिएको डेटासेटलाई LeRobot ढाँचामा रूपान्तरण गर्न सक्नुहुन्छ। दुई परियोजनाहरूले वास्तविक कनवर्टर प्रदान गर्छन्। IsaacLab-Arena ले YAML कन्फिगद्वारा पूर्ण रूपमा सञ्चालित GR00T-लक्षित कनवर्टर पठाउँछ, र LeIsaac ले SO-101 मार्गको लागि आफ्नै जोडी पठाउँछ (तल हेर्नुहोस्)।

    bash
    # IsaacLab-Arena, GR00T LeRobot format
    python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
        --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
आफ्नो संस्करणहरू पिन गर्नुहोस्, र main मा विश्वास नगर्नुहोस्

२३ अगस्ट २०२६ मा main को लागि Isaac Lab कागजातमा Isaac Sim 6.0.1 ब्याज छ र यसले v2.3.2 सँगै release/3.0.0 र v3.0.0-beta2 लाई यसको संस्करण स्विचरमा प्रदान गर्दछ, जबकि सोही ट्रीमा रहेको pip स्थापना पृष्ठले अझै पनि isaacsim[all,extscache]==5.1.0 लाई पिन गर्दछ र निर्देशनहरू Isaac Sim 5.X को लागि भएको वर्णन गर्दछ। NVIDIA synthetic-manipulation-motion-generation ब्लुप्रिन्ट कन्टेनर फेरि पुरानो छ: Isaac Sim 4.5.0 मा Isaac Lab 2.0.2। LeIsaac को आफ्नै अनुकूलता तालिकाले Isaac Sim 5.1 लाई Isaac Lab v2.3.0 सँग जोड्छ। यी ट्रीहरू कागजातहरूले मिलाउन सक्ने भन्दा छिटो सर्छन्। एउटा रिलीज छान्नुहोस्, यसलाई लेख्नुहोस्, र यदि तपाईंले तीन महिना अघि लेखिएको ट्यूटोरियल पछ्याउनुभयो भने स्क्रिप्ट मार्गहरू र फ्ल्याग नामहरू सरेको अपेक्षा गर्नुहोस्।

उत्पादन प्रयासहरू किन असफल हुन्छन्, र के परिवर्तन गर्ने

उम्मेदवारको सफलता दर जुन ७० प्रतिशत र १ प्रतिशतभन्दा कमको बीचमा उतारचढाव हुन्छ, त्यो रहस्य होइन, र आइज्याक ल्याबले तपाईंलाई अनुमान गर्न छोड्नुको सट्टा सामान्य त्रुटिहरू दस्तावेज गर्दछ। ती सबै रेकर्डिङको समयमा तपाईंले नियन्त्रण गर्ने कुराहरू हुन्, त्यसैले पहिलो निराशाजनक जेनेरेसन रन पछि भन्दा दस सीड प्रदर्शनहरू रेकर्ड गर्नु अघि यो सूची पढ्नु लाभदायक हुन्छ।

  • प्रदर्शनहरू धेरै लामो छन्। लामो समय क्षितिज नीतिलाई सिक्न गाह्रो हुन्छ। पहिलो वस्तुको नजिकबाट सुरु गर्नुहोस् र गतिलाई कम गर्नुहोस्।
  • प्रदर्शनहरू चिल्लो छैनन्। अनियमित गति नीतिलाई बुझ्न गाह्रो हुन्छ, र राम्रो टेलिअपरेसन हार्डवेयरले राम्रो डेटा दिन्छ: कागजातहरूले स्पष्ट रूपमा भन्छन् कि स्पेसमाउसले किबोर्डलाई जित्छ।
  • विरामहरू। विरामहरू सिक्न गाह्रो हुन्छ, किनभने नीतिलाई किन र कहिले रोक्ने भन्ने स्पष्ट हुँदैन। गतिलाई तरल राख्नुहोस्।
  • धेरै उपकार्यहरू। धेरै उपकार्यहरूको अर्थ ट्र्याजेक्टोरी खण्डहरू बीच धेरै सिलाई हुन्छ, जसले कम चिल्लो गति र कम जेनेरेसन सफलता दर दिन्छ। सीमाहरू जहाँ पाखुरा कुनै पनि चीजसँग ठोक्किने सम्भावना कम हुन्छ, त्यहाँ टिप्पणी गर्नुहोस्।
  • कुनै कार्य आवाज छैन। कार्य आवाजले परिणामी नीतिहरूलाई अझ बलियो बनाउँछ।
  • रेकर्डिङ धेरै कडा काटिएको। यदि रेकर्डिङ सफलताको सर्त ट्रिगर हुने ठ्याक्कै फ्रेममा रोकिन्छ भने, यो रिप्लेको समयमा पुन: ट्रिगर नहुन सक्छ। अन्त्यमा बफर छोड्नुहोस्।
  • गैर-निर्धारित रिप्ले। आइज्याक ल्याबमा भौतिक विज्ञान env.reset भरि निश्चित रूपमा पुन: उत्पादन योग्य छैन, त्यसैले केही मानव डेमोहरू रिप्लेमा असफल हुन्छन्। तपाईंलाई आवश्यक भन्दा बढी सङ्कलन गर्नुहोस् र एनोटेशनबाट बच्नेहरूलाई राख्नुहोस्। Mimic-उत्पन्न HDF5 फाइलमा पर्ने सबै कुरा एक सफल डेमो हो र रिप्ले पछि असफल भए पनि प्रशिक्षणको लागि प्रयोग गर्न सकिन्छ।

सिलाई गरिएका उपकार्य खण्डहरू बीचको इन्टरपोलेसन चरणको आफ्नै ट्युनिङ नब हुन्छ, र तपाईंलाई आवश्यक पर्ने इन्टरपोलेसन चरणहरूको संख्या रोबोट कति छिटो चल्छ र वस्तु रिसेट वितरण कति फराकिलो छ भन्नेमा निर्भर गर्दछ। ठूलो रिसेट वितरण भएको जटिल कार्यले खण्डहरू बीच ठूला खाली ठाउँहरू छोड्छ, जसलाई निरन्तर गतिमा आउन थप इन्टरपोलेसन चरणहरू चाहिन्छ। यदि तपाईंको उत्पन्न भिडियोहरूले पाखुरा चरणहरू बीच लर्किरहेको देखाउँछ भने, सीड डेमोहरूलाई दोष दिनु अघि हेर्नुपर्ने प्यारामिटर त्यो हो।

SO-101 मा उही पाइपलाइन, वास्तविक नेता पाखुराको साथ

यो यस पृष्ठ पढ्ने जो कोहीका लागि पनि रोचक छ, किनकि यो एक मात्र खुला पाइपलाइन हो जसले Isaac Lab भित्र राख्छ र तपाईंले पहिले नै स्वामित्वमा रहेको भौतिक लिडर आर्मले यसलाई चलाउन दिन्छ। लेख्ने समयमा LeIsaac, संस्करण 0.4.0, LeRobot को EnvHub मा एकीकृत आधिकारिक नक्कल-सिकाइ सिमुलेशन प्लेग्राउन्ड हो। यसको अनुकूलता तालिकाले तीनवटा कार्यशील संयोजनहरू सूचीबद्ध गर्दछ; सबैभन्दा नयाँले Isaac Sim 5.1 लाई Isaac Lab v2.3.0, CUDA 12.8, PyTorch 2.7.0 र Python 3.11 सँग जोड्छ, र कागजातहरूले 50-श्रृंखला कार्डहरूको लागि Isaac Sim 5.0 वा नयाँ सिफारिस गर्दछ।

bash
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
  --index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0
स्रोतबाट LeIsaac। numpy पिन आधिकारिक निर्देशनहरूमा छ, यो कुनै समाधान होइन।

त्यो स्थापित भएपछि, /dev/ttyACM0 मा रहेको लिडर आर्मले सिमुलेटेड फलोअरलाई चलाउँछ र सिधै HDF5 मा रेकर्ड गर्छ। लूप वास्तविक रेकर्डिङबाट तपाईंले पहिले नै थाहा पाएको जस्तै हो, केवल फलोअर PhysX मा एक कठोर शरीर हो।

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 \
    --device=cuda \
    --enable_cameras \
    --record \
    --dataset_file=./datasets/dataset.hdf5
वातावरण IDकार्य विवरणरोबोट
LeIsaac-SO101-PickOrange-v0तीनवटा सुन्तला टिपेर प्लेटमा राख्नुहोस्, त्यसपछि पाखुरालाई आरामको अवस्थामा फर्काउनुहोस्Single-arm SO101 follower
LeIsaac-SO101-LiftCube-v0रातो घन माथि उठाउनुहोस्Single-arm SO101 follower
LeIsaac-SO101-CleanToyTable-v0दुईवटा 'e' अक्षरका वस्तुहरू बक्समा राख्नुहोस्, त्यसपछि पाखुरालाई आरामको अवस्थामा फर्काउनुहोस्Single-arm SO101 follower
LeIsaac-SO101-CleanToyTable-BiArm-v0दुई पाखुराले उही कार्यBi-arm SO101 follower
LeIsaac-SO101-FoldCloth-BiArm-v0कपडा पट्याउनुहोस्, त्यसपछि पाखुरालाई आरामको अवस्थामा फर्काउनुहोस्। DirectEnv भेरियन्टले मात्र check_success लाई समर्थन गर्दछBi-arm SO101 follower
LeIsaac-LeKiwi-CleanupTrash-v0भुइँबाट टिस्यु फोहोर टिपेर फोहोरदानमा फाल्नुहोस्LeKiwi

ती मध्ये धेरै ID हरू -Direct-v0 भेरियन्टको रूपमा पनि अवस्थित छन्, र python scripts/environments/list_envs.py ले हालको सूची प्रिन्ट गर्दछ। तपाईं HDF5 को बाटो पूर्ण रूपमा छोडेर तीनवटा झण्डा थपेर टेलिअपरेसनको समयमा LeRobot ढाँचामा लेख्न सक्नुहुन्छ। दुईवटा चेतावनीहरू कागजातबाटै आउँछन्: रेकर्डरले प्रारम्भिक अवस्थाहरूबाट अस्थिरताबाट बच्न प्रत्येक एपिसोडको पहिलो ५ फ्रेमहरू स्वचालित रूपमा छोड्छ, र यसले टेलिअपरेसनमा हल्का ढिलाइ गराउन सक्छ, जुन तपाईंको प्रदर्शनको चरित्रलाई चुपचाप परिवर्तन गर्ने कुरा हो। यसले कार्य सफल भएको चिन्ह लगाइएका एपिसोडहरू मात्र फ्लश गर्दछ।

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 --device=cuda --enable_cameras --record \
    --use_lerobot_recorder \
    --lerobot_dataset_repo_id=<your-user>/<dataset-name> \
    --lerobot_dataset_fps=30

गुणन चरण त्यसपछि ती रेकर्डिङहरूमा चल्छ। LeIsaac ले Isaac Lab Mimic लाई चार आदेशहरूमा समेट्छ, किनभने Mimic ले अन्तिम-प्रभावकारी र वस्तुको पोजबाट ट्र्याजेक्टरीहरू सामान्यीकरण गर्दछ: जोइन्ट-स्पेस कार्यहरूलाई IK-आधारित कार्यहरूमा रूपान्तरण गर्नुहोस्, एनोटेट गर्नुहोस्, उत्पन्न गर्नुहोस्, त्यसपछि जोइन्ट स्पेसमा फिर्ता रूपान्तरण गर्नुहोस्।

bash
python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --to_ik --headless

python scripts/mimic/annotate_demos.py --device cuda \
  --task LeIsaac-SO101-LiftCube-Mimic-v0 \
  --input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/generate_dataset.py --device cuda \
  --num_envs 1 --generation_num_trials 10 \
  --input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
  --to_joint --headless

त्यसपछि LeRobot मा रूपान्तरण गर्नुहोस्। यो त्यो चरण हो जहाँ प्लेटफर्मको ढाँचा नियमले असर गर्छ, र LeIsaac ले तपाईंलाई चाहिने दुईवटा कन्भर्टरहरू उपलब्ध गराउँछ: isaaclab2lerobot.py ले LeRobot v2 लेख्छ, जुन GR00T लोडरहरूले लिन्छन्, र isaaclab2lerobotv3.py ले v3 लेख्छ Pi0.5, SmolVLAACT। दुई स्क्रिप्टहरूले समान तर्कहरू लिन्छन् तर फरक lerobot संस्करणहरू प्रयोग गर्छन्, र सफल एपिसोडहरू मात्र रूपान्तरण गरिन्छन्।

bash
pip install lerobot==0.3.3
pip install numpy==1.26.0

python scripts/convert/isaaclab2lerobot.py \
    --task_name=LeIsaac-SO101-PickOrange-v0 \
    --repo_id=<your-user>/so101_pick_orange_sim \
    --hdf5_root=./datasets \
    --hdf5_files=dataset.hdf5
GR00T को लागि LeRobot v2 आउटपुट। v3 ट्रेनरहरूको लागि lerobot 0.4.2 सहित isaaclab2lerobotv3.py प्रयोग गर्नुहोस्।
GPU बिनाको विकल्प उपलब्ध छ

LeIsaac ले NVIDIA Brev मा सम्पूर्ण स्ट्याक चलाउने दस्तावेज गर्दछ: डिप्लोय गर्नुहोस्, ब्राउजर-आधारित VS Code Server खोल्न पोर्ट 80 लिङ्कमा क्लिक गर्नुहोस्, र --kit_args="--no-window --enable omni.kit.livestream.webrtc" सहित चार पूर्व-स्थापित परिदृश्यहरू चलाउनुहोस्, रेन्डरलाई /viewer थपेर सोही ठेगानामा हेर्नुहोस्। यदि तपाईंसँग आफ्नो डेस्कमुनि वर्कस्टेशन कार्ड छैन भने, यो तपाईंको कार्यको सिमुलेटेड संस्करण हार्डवेयरमा प्रतिबद्ध गर्नु अघि कति नजिक छ भनेर पत्ता लगाउने सस्तो तरिका हो।

प्रशिक्षित नीतिमा पुग्ने दुई मार्गहरू

तपाईं आफैं दृश्य निर्माण गर्नुहुन्छ, डेटा उत्पन्न गर्नुहुन्छ, GPU भाडामा लिनुहुन्छ र सर्भर सेटअप गर्नुहुन्छ। यदि कार्यलाई भौतिक रूपमा तयार गर्न नसकिने वातावरणीय भिन्नता चाहिन्छ, वा यदि तपाईं दोहोर्याउन मिल्ने मूल्याङ्कन चाहनुहुन्छ भने यो सही विकल्प हो।

  1. Isaac Sim 5.1 र Isaac Lab, वा यदि तपाईंको रोबोट SO-101 हो भने LeIsaac स्ट्याक स्थापना गर्नुहोस्।
  2. दृश्यलाई मोडेल गर्नुहोस् वा आयात गर्नुहोस्। यो त्यो चरण हो जसको लागि कसैले बजेट छुट्याउँदैन र यो सामान्यतया सबैभन्दा लामो हुन्छ।
  3. सिमुलेटेड फलोअर मार्फत लगभग 10 सफा प्रदर्शनहरू रेकर्ड गर्नुहोस्।
  4. उपकार्यहरूलाई एनोटेट गर्नुहोस्, generate_dataset.py चलाउनुहोस्, र असफलताहरू खारेज गरिनेछन् भन्ने स्वीकार गर्नुहोस्।
  5. HDF5 लाई LeRobot ढाँचामा रूपान्तरण गर्नुहोस्, GR00T को लागि v2 र अरूको लागि v3 छान्नुहोस्।
  6. जे भए पनि भौतिक हातमा वास्तविक एपिसोडहरू रेकर्ड गर्नुहोस्, त्यसपछि मिश्रणमा सह-प्रशिक्षण गर्नुहोस्।
  7. GPU भाडामा लिनुहोस्, फाइन-ट्यून चलाउनुहोस्, चेकपोइन्टलाई हातको छेउमा सेवा दिनुहोस्।
स्रोतस्रोतहरूले के भन्छन्
Local simulation GPUThe NVIDIA synthetic-manipulation blueprint asks for Ubuntu 22.04 and an NVIDIA RTX A6000 with 48 GB VRAM
World-model nodeThe same blueprint asks for an H100 or higher with 80 GB, on a node separate from the Isaac Lab simulation
Container versionsIsaac Lab 2.0.2 on Isaac Sim 4.5.0 inside that blueprint image
Generation throughputIsaac Lab reports 1000 GR1T2 pick-and-place demos in 18 to 40 minutes, 19 minutes on an RTX ADA 6000 at 80 percent success
Neural trajectory costGR00T N1 reports about 105,000 L40 GPU hours, roughly 1.5 days on 3,600 L40s, for its 827 hours of dreams
इमानदार लागत क्यालेन्डर समय हो, GPU समय होइन

1000 ट्र्याजेक्टोरीहरू उत्पन्न गर्न एक दिउँसो लाग्छ। तपाईंको दृश्य, तपाईंको क्यामेरा एक्सट्रिन्सिक्स, तपाईंको वस्तु मेसहरू र तपाईंको सर्भो मोडेललाई पर्याप्त नजिक ल्याउनु जहाँ ती ट्र्याजेक्टोरीहरू स्थानान्तरण हुन्छन्, त्यहाँ हप्ताहरू बित्छन्। नमूनाको लागि होइन, मोडेलिङको लागि बजेट छुट्याउनुहोस्।

भिडियो विश्व मोडेलहरू: सबैभन्दा नयाँ तह, र सबैभन्दा कम मापन गरिएको

DreamGen पछाडिको विचार यो हो कि एक भिडियो जेनेरेटिभ मोडेल, लक्षित रोबोटको अवतारमा अनुकूलित, तपाईंले कहिल्यै भ्रमण नगरेका दृश्यहरूमा सम्भावित एपिसोडहरू कल्पना गर्न सक्छ। पाइपलाइनमा चार चरणहरू छन्: भिडियो विश्व मोडेललाई फाइन-ट्यून गर्ने, फोटोरियलिस्टिक सिंथेटिक रोबोट भिडियोहरू उत्पन्न गर्ने, लुकेको कार्य मोडेल वा उल्टो गतिशीलता मोडेलको साथ छद्म-कार्य अनुक्रमहरू पुन: प्राप्त गर्ने, त्यसपछि परिणाममा रोबोट नीतिलाई तालिम दिने। NVIDIA को GR00T-dreams भण्डारले ठ्याक्कै त्यही लागू गर्दछ।

मुख्य नतिजा वास्तविक छ र यसलाई गम्भीरतापूर्वक लिन लायक छ: एउटै वातावरणमा एउटा मात्र पिक-एन्ड-प्लेस कार्यबाट प्राप्त टेलिओपरेशन डेटाले मानवोइडमा, देखिएका र नदेखिएका दुवै वातावरणमा २२ नयाँ व्यवहारहरू उत्पादन गर्‍यो। चेतावनी पनि उत्तिकै वास्तविक छ र तेस्रो चरणमा पर्छ।

भिडियो विश्व मोडेलहरू डेटा स्रोतको रूपमा
फाइदाहरू
  • तिनीहरू वास्तविक संसारमा साँच्चै महँगो हुने अक्षमा मापन गर्छन्: नयाँ दृश्यहरू, नयाँ वस्तु व्यवस्थापनहरू, निर्देशनका नयाँ वाक्यांशहरू।
  • GR00T-dreams ले यसको कार्य-निकाल्ने र फाइन-ट्युनिङ स्क्रिप्टहरूको लागि चार समर्थित अवतारहरू सूचीबद्ध गर्दछ: franka, gr1, robocasa र so100। यो मानवोइड-मात्र प्रविधि होइन।
  • Cosmos-Transfer1 ले ग्यापको फोटोमेट्रिक आधा भागमा सीधा आक्रमण गर्छ, एउटा रोबोटिक्स सिंथेटिक उदाहरणलाई सेगमेन्टेसन, डेप्थ वा एज कन्डिसनिङबाट धेरै यथार्थवादी उदाहरणहरूमा म्याप गर्छ। Isaac Lab आफैंले scripts/tools/cosmos अन्तर्गत यसको लागि प्रम्प्ट उपकरणहरू प्रदान गर्दछ।
  • DreamGen कार्यले DreamGen बेन्च, एक भिडियो-उत्पादन बेन्चमार्क प्रदान गर्दछ जसले बेन्चमार्क प्रदर्शन र डाउनस्ट्रीम नीति सफलता बीच बलियो सम्बन्ध देखाउँछ, ताकि तपाईंले तिनीहरूमा प्रशिक्षण दिनु अघि उत्पादनहरू स्क्रिन गर्न सक्नुहुन्छ।
फाइदा-बेफाइदा
  • कार्यहरू मोडेलद्वारा पुनःप्राप्त गरिन्छ, इन्कोडरद्वारा मापन गरिँदैन। सही देखिने भिडियोले तपाईंको पाखुराले कार्यान्वयन गर्न नसक्ने संयुक्त प्रक्षेपवक्र बोक्न सक्छ।
  • उत्पादन महँगो छ। GR00T N1 ले L40 मा एक सेकेन्डको भिडियो उत्पादन गर्न दुई मिनेट लाग्ने रिपोर्ट गर्छ, जुन लगभग १०५,००० L40 GPU घण्टा हो, यसको ८२७ घण्टाको न्यूरल ट्र्याजेक्टरीका लागि ३,६०० L40 GPU हरूमा लगभग १.५ दिन लाग्छ।
  • मापन गरिएको लाभ एकल अंकमा छ: तीन डेटा प्रणालीहरूमा रोबोकासामा ४.२, ८.८ र ६.८ अंक, र ८ वास्तविक GR-1 कार्यहरूमा औसत ५.८ अंक, जुन पहिले नै वास्तविक डेटा भएको मोडेलको शीर्षमा छ।
  • कुनै पनि प्रकाशित विधिले ७.४ V हबी-सर्भो पाखुराको लागि यसलाई अन्त-देखि-अन्तसम्म प्रमाणित गर्दैन। तपाईंले पोर्टिङ गरिरहनुहुनेछ, पछ्याइरहनुहुनेछैन।
STS3215 लाई कहिल्यै १२ V नदिनुहोस्

सिमुलेसनसँग सम्बन्धित छैन, तर यो तब आउँछ जब कोही सिमुलेटेड पाखुराबाट वास्तविक पाखुरामा सर्छ र पावर सप्लाईको व्यवस्था गर्छ। SO-100, SO-101 र LeKiwi पाखुरा सबै Feetech STS3215 सर्भोहरू ७.४ V मा चलाउँछन्। तिनीहरूलाई १२ V दिँदा तिनीहरू नष्ट हुन्छन्, र LeKiwi एउटा विशेष जाल हो किनभने यसको बेस रेल नै १२ V हो। कुनै पनि तार जोड्नु अघि SO-100 हार्डवेयर पृष्ठ हेर्नुहोस्।

सह-प्रशिक्षण नै वास्तविक लाभ देखाउने विधि हो

साहित्यबाट एउटा मात्र परिचालन पाठ सिक्नुहुन्छ भने, यो सिक्नुहोस्। सिम-र-वास्तविक सह-प्रशिक्षण अध्ययन (मद्दुकुरी र सहकर्मीहरू, २०२५) ले दृष्टि-आधारित रोबोटिक हेरफेर कार्यहरू समाधान गर्न सिमुलेशन डेटा प्रयोग गर्ने एउटा सरल विधि पत्ता लगाउन सुरु गर्यो, दुई डोमेनहरूमा, एउटा रोबोट पाखुरा र एउटा ह्युमनोइड, र यसको निष्कर्ष यो हो कि तपाईंले मिश्रणमा प्रशिक्षण दिनुहोस्। सिमुलेशन डेटाले वास्तविक-विश्व कार्य प्रदर्शनलाई औसत ३८ प्रतिशतले बढायो, र पेपरले स्पष्ट रूपमा भन्छ कि यो सिमुलेशन र वास्तविक-विश्व डेटा बीच उल्लेखनीय भिन्नताहरू हुँदा पनि कायम रह्यो।

त्यो अन्तिम खण्ड ३८ प्रतिशत भन्दा बढी महत्त्वपूर्ण छ। यसको अर्थ सिमुलेशन उपयोगी हुनको लागि पूर्ण डिजिटल ट्विन हुनुपर्दैन, यदि वास्तविक डेटा यसलाई स्थिर गर्न मिश्रणमा छ भने। सिम-मात्र स्थानान्तरण महँगो मार्ग हो: सोही पेपरले भन्छ कि नीतिलाई सिमुलेशनमा मात्र प्रशिक्षण दिनु र यसलाई वास्तविक संसारमा स्थानान्तरण गर्दा वास्तविकताको अन्तरलाई कम गर्न प्रायः पर्याप्त मानवीय प्रयास चाहिन्छ। सह-प्रशिक्षणले नीतिलाई आफैंले अन्तर बन्द गर्न नसोधी धेरैजसो प्रयासलाई छोड्छ।

The AY-Robots policy comparison table showing parameters, GPU tier, inference latency and minimum episodes for GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA and ACT.
The five trainable policies at /policies. The minimum-episode column is the number that decides whether synthetic data is a nice-to-have or the only way you reach a trainable dataset.

व्यावहारिक रूपमा, यस प्लेटफर्ममा, सह-प्रशिक्षणको अर्थ एउटै कुरा हो: दुवै एपिसोड सेटहरू एउटैमा राख्नुहोस् LeRobot dataset सुसंगत क्यामेरा कुञ्जीहरू, सुसंगत जोइन्ट अर्डर र सुसंगत एकाइहरूसँग, त्यसपछि सामान्य चलाउनुहोस् फाइन-ट्यून। प्रशिक्षण फारममा कुनै मिश्रण-वजन नब छैन। यदि तपाईं 3:1 सिम-टु-रियल अनुपात चाहनुहुन्छ भने, तपाईंले प्रत्येकका कति एपिसोडहरू डेटासेटमा राख्नुहुन्छ भन्ने कुराले त्यसलाई व्यक्त गर्नुहुन्छ।

सिमुलेशनबाट सबैभन्दा सस्तो जित प्रशिक्षण डेटा होइन

यो मूल्याङ्कन हो। दुईवटा तुलना गर्न प्रत्येक कार्यका लागि दर्जनौं वास्तविक परीक्षणहरू चलाउनु एक दिनको आर्म समय हो, र आर्म परीक्षणहरू बीचमा सर्छ। SIMPLER (ली र सहकर्मीहरू, २०२४) ले सिमुलेटेड वातावरणहरू निर्माण गर्‍यो जसको उद्देश्य वास्तविक नीतिहरूलाई प्रशिक्षण दिनुको सट्टा स्कोर गर्नु हो, र त्यसपछि सिम र्याङ्किङले वास्तविकलाई कति राम्रोसँग भविष्यवाणी गर्छ भनेर नाप्यो। एउटा SIMPLER वातावरणले उपभोक्ता RTX 4090 मा 640 बाइ 512 रिजोल्युसनमा प्रति सेकेन्ड 3,500 सिमुलेशन स्टेप्स रेन्डर गर्छ, जुन 500 Hz सिमुलेशन फ्रिक्वेन्सी अन्तर्गत वास्तविक मूल्याङ्कन भन्दा 7 गुणा छिटो छ।

मूल्याङ्कन प्रोटोकलMMRV (कम भए राम्रो)पियर्सन r (उच्च भए राम्रो)
मान्यता MSE0.3750.308
SIMPLER, भेरियन्ट एकत्रीकरण0.1430.778
SIMPLER, भिजुअल मिलान0.0560.924

ती छवटा सामान्य खुला स्रोत चेकपोइन्टहरूका लागि तीनवटा Google Robot कार्य समूहहरूमा औसत हुन्: विभिन्न प्रशिक्षण चरणहरूमा तीनवटा RT-1 चेकपोइन्टहरू, RT-1-X, RT-2-X र Octo-Base। वास्तविक पक्ष एक समान परीक्षण गणना होइन, जुन उद्धृत गर्नु अघि जान्न लायक छ: कोक क्यान उठाउनका लागि 75 परीक्षण, नजिक सार्नका लागि 60, दराज खोल्ने र बन्द गर्ने कार्यहरूका लागि 54 र लामो दराज-र-स्याउ कार्यका लागि 27। मान्यता MSE विरुद्धको तुलना उपयोगी भाग हो। मान्यता हानिद्वारा मोडेल चयनले यी चेकपोइन्टहरूलाई नराम्रोसँग क्रमबद्ध गर्छ, र भिजुअल मिलान अन्तर्गत 0.924 को पियर्सन r को अर्थ हो कि यदि कुनै चेकपोइन्टले SIMPLER मा राम्रो स्कोर गर्छ भने यसले बेन्चमा धेरै सम्भावना राम्रो स्कोर गर्छ। त्यो एक दोहोर्याउन मिल्ने रातभरको स्कोरबोर्ड हो, र यसले तपाईंलाई सिम-टु-रियल प्रशिक्षण स्थानान्तरणको बारेमा केही पनि विश्वास गर्न आवश्यक पर्दैन।

The AY-Robots Arena leaderboard, a sortable table of 85 vision-language-action models with 332 benchmark results, each value linked to its source paper or model card.
The Arena at /arena collects 332 benchmark results across 85 models. Almost all of them are simulated benchmarks, which is exactly the point of the SIMPLER argument: simulation is a good scoreboard long before it is a good data source.

यी बेन्चमार्क संख्याहरूले भिजन-भाषा-कार्य मोडेलको बारेमा के बताउँछन् र के बताउँदैनन् भन्ने बारे विस्तृत जानकारी चाहनुहुन्छ भने, हामीले त्यसलाई छुट्टै VLA सिंहावलोकनमा लेखेका छौं।

यो प्लेटफर्मले तपाईंलाई कहाँ मद्दत गर्दैन

सीमाबारे स्पष्ट हुनुले सबैको समय बचाउँछ। AY-Robots एउटा रेकर्डिङ, तालिम र सेवा प्रदान गर्ने प्लेटफर्म हो। यसमा कुनै सिमुलेटर छैन।

  • कुनै Isaac Lab छैन, कुनै MimicGen छैन, कुनै विश्व मोडेल छैन, कुनै दृश्य लेखन छैन। यदि तपाईं उत्पन्न डाटा चाहनुहुन्छ भने, तपाईं यसलाई अन्यत्र उत्पन्न गर्नुहुन्छ र परिणाम ल्याउनुहुन्छ।
  • प्रशिक्षकहरूले LeRobot डेटासेटहरू मात्र उपभोग गर्छन्। एक सिम्युलेटर निर्यातलाई इनपुट हुनु अघि रूपान्तरण गर्नुपर्छ, र यो सही संस्करण हुनुपर्छ: GR00T N1.5 र N1.7 को लागि v2.0 वा v2.1, Pi0.5, SmolVLA र ACT को लागि v3.0।
  • GR00T को फाइन-ट्यूनिङ प्रवेश बिन्दु एक tyro CLI हो जसले कुनै सीड देखाउँदैन, त्यसैले GR00T रनहरू बिट-फर-बिट पुनरुत्पादन योग्य छैनन्। यदि तपाईं सावधानीपूर्वक सिम-बनाम-वास्तविक एब्लेसन चलाउँदै हुनुहुन्छ भने, त्यो एक वास्तविक सीमा हो। lerobot को आफ्नै पूर्वनिर्धारित सीड 1000 हो, र ACT, SmolVLA र Pi0.5 फारमहरूले सीड फिल्ड देखाउँछन्।
  • ग्रेडियन्ट संचय केवल दुई GR00T प्रशिक्षकहरूको लागि मात्र लागू हुन्छ। Pi0.5 र SmolVLA को लागि फिल्ड फारममा अवस्थित छ तर lerobot 0.5.1 मा त्यस्तो कुनै फ्ल्याग छैन, त्यसैले यसले केही गर्दैन।
  • छिटो कार्यहरूको लागि अनुमान सर्भोको छेउमा बस्नुपर्छ। नियन्त्रण लूप मोडेलमा निर्भर गर्दै प्रति कार्य चरण 20 देखि 485 ms हुन्छ, र सार्वजनिक-इन्टरनेट राउन्ड ट्रिपहरू थप्दा काम गर्ने नीतिलाई हिचकिचाउने नीतिमा परिणत गर्दछ। रिमोट अनुमान ढिलो पिक-एन्ड-प्लेसको लागि सम्भव छ, छिटो प्रतिक्रियात्मक गतिको लागि होइन।
यहाँ तपाईंले गर्न सक्ने कुरा जुन अन्यत्र साँच्चै गाह्रो छ

हातको स्वामित्व बिना सह-प्रशिक्षण मिश्रणको वास्तविक आधा रेकर्ड गर्नुहोस्। /live भौतिक SO-100 लाई कुनै साइनअप बिना, कतार-आधारित स्ट्रिम गर्दछ, र अपरेटर कार्यक्रम अवस्थित छ किनभने कसैले तिनीहरूलाई चलाउनुपर्छ। यदि तपाईंको बाधा यो हो कि तपाईंसँग सिम्युलेटर छ र कुनै वास्तविक एपिसोडहरू छैनन्, त्यो यो प्लेटफर्मले बन्द गर्ने अन्तर हो।

तपाईंले रक्षा गर्न सक्ने बजेट

दुई मार्गहरूलाई प्रत्येकले वास्तवमा प्रकाशित गर्ने संख्याहरूसँग सँगै राख्नुहोस्, र कम लागतको हातमा एकल-कार्य परियोजनाको लागि निर्णय सामान्यतया आफैं हुन्छ।

विषयवस्तुसिमुलेशन-पहिलोरेकर्ड-पहिलो
अग्रिम मोडलिङदृश्य, मेष, क्यामेराको स्थान, सर्भो मोडेल। दिनदेखि हप्तासम्मकुनै पनि छैन
डाटा सङ्कलनसिममा लगभग १० डेमो, त्यसपछि उत्पादन३० देखि ५० वास्तविक एपिसोड, केही घण्टाको टेलिअपरेसन
आफ्नो स्वामित्वमा हुने हार्डवेयरIsaac Lab ब्लुप्रिन्टको लागि ४८ GB कार्ड, Cosmos स्टेजको लागि ८० GBएउटा पाखुरा र एउटा ल्यापटप
तालिम लागतदायाँ स्तम्भ जस्तै, प्रशिक्षकलाई डाटा कहाँबाट आयो भन्ने कुराको वास्ता छैन४०९० टियरमा १ देखि ३ USD, A100 वा H100 टियरमा ४ देखि १२ USD
प्रतिफलको उत्कृष्ट प्रमाणसह-तालिम दिँदा ३८ प्रतिशत औसत वास्तविक-विश्व लाभ, न्यूरल ट्र्याजेक्टरीबाट ४ देखि ९ अंकमाथिका सबै कुरा नापिएको आधाररेखा
असफल हुन्छ जबतपाईंको कार्य सम्पर्क, विकृत वस्तु वा सर्भो अनुपालनमा निर्भर गर्दछतपाईंलाई भौतिक रूपमा मञ्चन गर्न नसकिने वातावरणीय भिन्नता चाहिन्छ

SO-100 मा पहिलो नीतिको लागि, रेकर्ड गर्नुहोस्। र ले तपाईंलाई कफीको मूल्यमा एक सेवा गरिएको चेकपोइन्टमा पुर्‍याउँछ, र तपाईंसँग भविष्यको कुनै पनि सह-तालिम मिश्रणको वास्तविक आधा भाग हुनेछ। तपाईंसँग काम गर्ने आधाररेखा र तपाईंले नाम दिन सक्ने एक विशिष्ट सामान्यीकरण विफलता हुँदा सिमुलेटर प्रयोग गर्नुहोस्, जस्तै एउटा नीति जुन ।

तपाईंको डेस्कमा अझै पाखुरा छैन?

ब्राउजरमा वास्तविक SO-100 चलाउनुहोस्, कतार-आधारित, साइनअप बिना, र सिमुलेटरमा मोडलिङ गर्न एक सप्ताहन्त खर्च गर्नु अघि वास्तविक एपिसोड कस्तो देखिन्छ हेर्नुहोस्।

वास्तविक पाखुरा चलाउनुहोस्

प्रमाणलाई सम्मान गर्ने एउटा विधि

  1. 1
    पहिले वास्तविक आधारभूत रेकर्ड गर्नुहोस्

    SmolVLA का लागि 30 एपिसोड, ACT का लागि 50, GR00T N1.7Pi0.5 का लागि पनि 50। एक पटक तालिम दिनुहोस्। त्यो नीतिले जेमा असफल हुन्छ, त्यही नै तपाईंको सिंथेटिक डेटाको लागि विशिष्टता हो।

  2. 2
    सामान्यीकरण असफलताको नाम दिनुहोस्

    वस्तुको स्थिति? प्रकाश? टेबलको उचाइ? विचलित गर्ने वस्तुहरू? निर्देशनको फरक वाक्यांश? सिंथेटिक डेटा एक पटकमा यी मध्ये एउटामा मात्र राम्रो हुन्छ, र यदि तपाईंले कुन हो भन्न सक्नुहुन्न भने यो बेकार हुन्छ।

  3. 3
    यसलाई समेट्ने सबैभन्दा सस्तो परिवार छान्नुहोस्

    स्थिति र लेआउट भिन्नता: ट्र्याजेक्टोरी गुणन। प्रकाश र बनावट: पहिले छवि वृद्धि, दोस्रोमा विश्व मोडेल। पूर्ण नयाँ दृश्यहरू: भौतिकी रोलआउटहरू, र मोडेलिङ लागत स्वीकार गर्नुहोस्।

  4. 4
    उत्पन्न गर्नुहोस्, त्यसपछि आक्रामक रूपमा फ्याँक्नुहोस्

    उत्पन्न गर्ने प्रयासहरू असफल हुन्छन्, र Isaac Lab को आफ्नै उम्मेदवार सफलता दर कार्य अनुसार 70 प्रतिशतबाट 1 प्रतिशत भन्दा कममा झर्छ। केवल सफल, कार्य-पूरा गर्ने ट्र्याजेक्टोरीहरू राख्नुहोस्, र ब्याचमा विश्वास गर्नु अघि भिडियोको रूपमा नमूनालाई आँखाले हेर्नुहोस्।

    bash
    python scripts/mimic/generate_dataset.py --device cuda \
        --num_envs 8 --generation_num_trials 500 \
        --input_file ./datasets/annotated.hdf5 \
        --output_file ./datasets/generated.hdf5 --enable_cameras
  5. 5
    सह-तालिम दिनुहोस्, प्रतिस्थापन नगर्नुहोस्

    उत्पन्न गरिएका एपिसोडहरूलाई वास्तविक एपिसोडहरूसँग एउटै LeRobot डेटासेटमा समान क्यामेरा कुञ्जीहरू र जोइन्ट अर्डरिंगका साथ मर्ज गर्नुहोस्। 38 प्रतिशतको आंकडा सह-तालिमको आंकडा हो।

  6. 6
    वास्तविक हातमा मूल्याङ्कन गर्नुहोस्, र त्यहाँ मात्र

    सिमुलेटेड मूल्याङ्कन एक राम्रो र्याङ्किङ संकेत हो (SIMPLER को भिजुअल-म्याचिङ सेटअपमा Pearson r 0.924) तर यो स्वीकृति परीक्षण होइन। यसमा विश्वास गर्नु अघि बेन्चमा चेकपोइन्ट चलाउनुहोस्।

यदि तपाईं वास्तविक रेकर्डिङहरूका लागि चेकलिस्टबाट सुरु गर्न चाहनुहुन्छ भने, क्यामेरा प्लेसमेन्ट, का प्रभावहरू र असफलता मोडहरू जसले एक डेटासेटलाई अनुपयोगी बनाउँछ। ढाँचाको विवरणहरू मा छन्, र हाइपरप्यारामिटर पक्ष मा छन्।

के म रोबोट नीतिलाई पूर्ण रूपमा सिंथेटिक डेटामा तालिम दिन सक्छु?

वास्तविक हातमा हेरफेर कार्यको लागि, भरपर्दो रूपमा होइन। बलियो संख्या भएको हरेक प्रकाशित नतिजा सह-तालिमको नतिजा वा वास्तविक-डेटामाथि वृद्धि (augmentation) को नतिजा हो। MimicGen को आफ्नै तुलनाले एउटै कार्यमा 200 मानव डेमोको लागि 84 प्रतिशतको तुलनामा 200 उत्पन्न डेमोलाई 79 प्रतिशतमा राख्छ, र 2025 को सिम-एन्ड-रियल सह-तालिम पेपरले बताउँछ कि सिमुलेशनमा मात्र तालिम दिनु र स्थानान्तरण गर्दा वास्तविकताको खाडल पुर्न प्रायः पर्याप्त मानवीय प्रयासको माग गर्दछ। RoboCasa ले उत्पन्न डेटाले मानव डेटालाई 47.6 विरुद्ध 28.8 प्रतिशतले हराएको देखाउँछ, तर 72,000 उत्पन्न डेमोको तुलनामा 1,250 मानव डेमोको साथ मात्र, दुवै उत्पादन गर्ने सिमुलेटर भित्र।

यदि मैले सिंथेटिक एपिसोडहरू उत्पन्न गर्छु भने मलाई अझै कति वास्तविक एपिसोडहरू चाहिन्छ?

AY-Robots मा प्रशिक्षकहरूलाई SmolVLA का लागि न्यूनतम 30 एपिसोड र ACT, GR00T N1.5, GR00T N1.7 र Pi0.5 का लागि 50 एपिसोड चाहिन्छ, एपिसोडहरू जहाँबाट आएका भए पनि। Isaac Lab को Mimic कागजातले भन्छ कि उत्पन्न गर्नका लागि लगभग 10 सफल मानव प्रदर्शनहरू बीजको रूपमा आवश्यक पर्दछ। ती फरक प्रश्नहरूको जवाफ दिने फरक संख्याहरू हुन्: 10 जेनेरेटरलाई चाहिन्छ, 30 देखि 50 प्रशिक्षकलाई चाहिन्छ।

के सिमुलेटेड डेटा LeRobot ढाँचामा हुनुपर्छ?

यो प्लेटफर्ममा तालिम दिनको लागि, हो। Isaac Lab र LeIsaac दुवैले robomimic-flavoured HDF5 उत्पादन गर्छन्। Isaac Lab कोरले कुनै LeRobot कन्भर्टर पठाउँदैन, तर LeIsaac ले LeRobot v2 को लागि isaaclab2lerobot.py र v3 को लागि isaaclab2lerobotv3.py पठाउँछ, र IsaacLab-Arena ले YAML कन्फिग द्वारा संचालित GR00T-लक्षित convert_hdf5_to_lerobot.py पठाउँछ। संस्करणमा ध्यान दिनुहोस्: GR00T N1.5 र N1.7 ले LeRobot v2.0 वा v2.1 लिन्छन्, जबकि Pi0.5, SmolVLA र ACT ले v3.0 लिन्छन्। एक v3.0 डेटासेटले GR00T लोडरलाई क्र्यास गर्छ र यसलाई v2.1 मा रूपान्तरण गर्नुपर्छ।

के Isaac Gym अझै 2026 मा सिक्नको लागि सही कुरा हो?

होइन। NVIDIA को आफ्नै उत्पादन पृष्ठको शीर्षक "Isaac Gym - अब अप्रचलित" छ र यसले यो लिगेसी सफ्टवेयर हो, कि विकासकर्ताहरूले यसलाई डाउनलोड गरी प्रयोग गर्न जारी राख्न सक्छन् तर यो अब समर्थित छैन, र Isaac Lab लाई प्रतिस्थापनको रूपमा देखाउँछ। Isaac Lab ले IsaacGymEnvs, OmniIsaacGymEnvs र Orbit बाट माइग्रेसन गाइडहरू पठाउँछ, त्यसैले अवस्थित वातावरण हराउनुको सट्टा पोर्टेबल हुन्छ।

के म SO-100 वा SO-101 लाई Isaac Lab मा राख्न सक्छु?

SO-101, हो, राम्ररी। TheRobotStudio भण्डारले SO-101 को लागि URDF र MJCF दुवै फाइलहरू पठाउँछ, जुन Onshape CAD मोडेलबाट onshape-to-robot मार्फत उत्पन्न गरिएको हो, र LeIsaac ले भौतिक SO101 लिडर आर्मबाट टेलिअपरेसन सहित LeIsaac-SO101-PickOrange-v0 जस्ता तयार Isaac Lab कार्यहरू प्रदान गर्दछ। SO-100 को लागि त्यही भण्डारले केवल एउटा URDF र कुनै MuJoCo मोडेल पठाउँदैन। SO-101 README ले दुवै तरिकाले उल्लेख गरेका सीमाहरू बारे सचेत रहनुहोस्: समस्याग्रस्त टक्कर व्यवहारका कारण आधार टक्कर जालहरू हटाइएका थिए, STS3215 मोटर गुणहरू SO-101 मा पहिचान गर्नुको सट्टा Open Duck Mini परियोजनाबाट अनुकूलित गरिएको थियो, र 0-बन्द देखि 100-खुल्ला ग्रिपर कन्भेन्सन मोडेल फाइलहरूमा अझै प्रतिबिम्बित भएको छैन।

के प्लेटफर्मले मेरो लागि सिमुलेशन चलाउँछ?

होइन। AY-Robots ले वास्तविक टेलिअपरेसनबाट LeRobot डेटासेटहरू रेकर्ड गर्छ, भाडामा लिएका GPU हरूमा पाँच समर्थित नीतिहरूलाई फाइन-ट्युन गर्छ, र परिणामी चेकपोइन्टलाई आर्ममा फिर्ता पठाउँछ। यसमा कुनै सिमुलेटर, कुनै सिंथेटिक डेटा उत्पादन र कुनै दृश्य लेखन छैन। यदि तपाईंले अन्यत्र डेटा उत्पन्न गर्नुहुन्छ र यसलाई वैध LeRobot डेटासेटमा रूपान्तरण गर्नुहुन्छ भने, प्रशिक्षकहरूले यसलाई वास्तविक रेकर्डिङहरू जस्तै स्वीकार गर्नेछन्।

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started