مدخل مسرد AY-Robots لتنسيق مجموعة بيانات LeRobot، وهو التنسيق الذي يستهلكه كل مدرب على المنصة سواء تم تسجيل الحلقات أو إنشاؤها.
البيانات الاصطناعيةمن المحاكاة إلى الواقعIsaac Labالتعلم بالمحاكاةMimicGenSO-101

البيانات الاصطناعية لسياسات الروبوت: أين تساعد المحاكاة

AY-Robots ResearchAugust 23, 202631 دقيقة قراءة

يمكن للمحاكاة أن تضاعف عددًا قليلاً من العروض التوضيحية إلى الآلاف. إليك ما تقوله الأرقام المنشورة حقًا، وأين تكمن مشكلة الفجوة بين المحاكاة والواقع، وما الذي لا يزال يتعين تسجيله.

كل بضعة أشهر، يكتشف أحدهم أن تسجيل خمسين حلقة يدويًا بطيء، ويتساءل عما إذا كان المحاكي يمكن أن ينتجها بدلاً من ذلك. إنه سؤال عادل. الإجابة الصادقة تتكون من ثلاثة أجزاء: البيانات المولدة تساعد، لكنها لا تحل محل التسجيلات الحقيقية، وتعتمد النسبة بين هاتين الحقيقتين كليًا على نوع البيانات الاصطناعية التي تقصدها.

تستعرض هذه الصفحة ما تم قياسه فعليًا في الأعمال المنشورة، وما يمكنك تشغيله اليوم على ذراع منخفضة التكلفة مثل SO-100، وأين تلتهم فجوة المحاكاة إلى الواقع المكاسب. النسخة المختصرة، قبل التفاصيل: الأنظمة التي تُبلغ عن أكبر مضاعفات تضاعف مجموعة صغيرة من العروض البشرية الحقيقية. إنها لا تلغي الحاجة إليها.

ما تحتاج لمعرفته

  • تُطلق تسمية البيانات الاصطناعية في مجال التلاعب على أربع تقنيات غير مرتبطة: مضاعفة المسارات، وعمليات محاكاة الفيزياء، ونماذج العالم المرئية، وتكبير مساحة الصورة. تفشل هذه التقنيات بطرق مختلفة وتختلف قيمتها.
  • حول MimicGen أقل من 200 عرض بشري إلى أكثر من 50,000 عرض مولد عبر 18 مهمة. في مهمة Square D0 الخاصة به، حققت 200 عرض مولد من 10 عروض بشرية نسبة نجاح 79 بالمائة مقابل 84 بالمائة لـ 200 عرض بشري حقيقي.
  • RoboCasa هو المثال المضاد: حققت 72,000 عرض مولد نسبة 47.6 بالمائة مقابل 28.8 بالمائة لـ 1,250 عرض بشري. هذه ميزة حجم 58 ضعفًا، وليست فوزًا متكافئًا.
  • تُبلغ دراسة التدريب المشترك بين المحاكاة والواقع عن تحسن متوسط قدره 38 بالمائة في أداء المهام في العالم الحقيقي. الوصفة هي التدريب المشترك على مزيج، وليس النقل من المحاكاة فقط.
  • يعتمد GR00T N1 على 780,000 مسار محاكاة (ما يعادل 6,500 ساعة، تم إنشاؤها في 11 ساعة) و 827 ساعة من المسارات العصبية المستمدة من 88 ساعة حقيقية. لا تزال تلك الـ 88 ساعة الحقيقية هي قمة الهرم.
  • بالنسبة لـ SO-101، توجد اليوم خطة عمل مفتوحة: LeIsaac داخل Isaac Lab، التحكم عن بعد بذراع القائد الفيزيائية، المضاعفة باستخدام Isaac Lab Mimic، التصدير إلى تنسيق LeRobot، الضبط الدقيق لـ GR00T.
  • لا يقوم AY-Robots بتوليد بيانات اصطناعية. إنه يتدرب على مجموعة بيانات LeRobot التي تقدمها له، بغض النظر عن طريقة إنتاج تلك المجموعة، ويحتاج المدربون إلى 30 إلى 50 حلقة كحد أدنى حسب النموذج.

أربعة أشياء مختلفة تُسمى بيانات اصطناعية

قبل مقارنة الأرقام، يجدر بنا فصل الفئات، لأن ورقة بحثية تشير إلى مضاعف 100x وورقة بحثية تشير إلى زيادة 5 نقاط في النجاح غالبًا ما تصفان نفس المسار من نهايات مختلفة. القاسم المشترك هو أن شيئًا ما في مجموعة بيانات LeRobot تم إنتاجه بواسطة آلة بدلاً من تسجيله من ذراع مادية. ما يختلف هو الجزء.

الفئةما يبقى حقيقيًاما يتم إنشاؤهالمضاعف المبلغ عنهوضع الفشل الرئيسي
مضاعفة المسار (MimicGen, DexMimicGen, Isaac Lab Mimic)عدد قليل من العروض التوضيحية البشرية، شبكات الكائنات، محرك الفيزياءمسارات جديدة تتكيف مع أوضاع الكائنات وتخطيطات المشهد الجديدة10 عروض توضيحية بشرية إلى 1,000 لكل توزيع إعادة تعيين؛ 60 إلى 21,000؛ أقل من 200 إلى أكثر من 50,000محاولات التوليد تفشل. يضع Isaac Lab معدل نجاح المرشحين بنسبة تصل إلى 70 بالمائة في الحالات البسيطة وأقل من 1 بالمائة في الحالات الصعبة
عمليات محاكاة الفيزياء في محاكي المهام (Isaac Lab, robosuite, RoboCasa)محرك الفيزياء ومكتبة الأصولحلقات كاملة، مدفوعة بوحدات تحكم مبرمجة، أو مخططين، أو تعلم معزز (RL)محدودة فقط بساعات استخدام وحدة معالجة الرسوميات (GPU)الذراع المحاكية ليست ذراعك. ديناميكيات التلامس والسيرفو هي تقريبات
نماذج عالم الفيديو (DreamGen, Cosmos Transfer)عدد قليل من حلقات التشغيل عن بعد الحقيقية المستخدمة كشروطفيديو واقعي للصور لسلوكيات جديدة، بالإضافة إلى إجراءات زائفة تم استردادها لاحقًا88 hours to 827 hours in GR00T N1, about 10xيتم استنتاج الإجراءات، لا قياسها. يمكن أن يحمل الفيديو المعقول إجراءً غير معقول
زيادة مساحة الصورة (اقتصاص عشوائي، اهتزاز الألوان)كل شيء ما عدا البكسلاتمشاهد مضطربة لحلقات لديك بالفعل1x, it creates no new trajectoryالزيادة الهندسية تكسر الارتباط بين الصورة وتسمية الإجراء

فقط الثلاثة الأولى هي بيانات اصطناعية بالمعنى الذي تقصده هذه المقالة. الرابع يستحق الذكر لأنه يندرج ضمن نفس المحادثة وهو الأرخص بكثير في القائمة. إذا لم تكن قد قمت بتشغيل التحسينات التي يأتي بها مدربك، فافعل ذلك قبل تثبيت المحاكي.

يمكنك الاطلاع على بيانات اصطناعية حقيقية قبل أن تقوم بتوليد أي منها

نشرت NVIDIA المسارات المحاكية المستخدمة لـ GR00T N1 بعد التدريب باسم nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim على Hugging Face، بحجم حوالي 1.87 تيرابايت تحت ترخيص cc-by-4.0. تتوزع على 9,000 مسار ثنائي اليدين متقاطع الأجسام لـ Panda و GR1، و 240,000 مسار بشري على الطاولة، و 72,000 مسار مطبخ لـ Panda واحدة، و 102 مسار تحكم حركي لـ Unitree G1. تنزيل مجموعة فرعية واحدة باستخدام huggingface-cli download --include "gr1_arms_only.CanSort/**" ومشاهدة بعض الحلقات هو أسرع طريقة لمعايرة شكل المسارات المولدة، ولا يكلف شيئًا سوى النطاق الترددي.

ما تقوله الأرقام المنشورة بالفعل

إليكم قاعدة الأدلة، مع الأرقام كما ذكرتها المصادر بدلاً من تلخيصها في البيانات الصحفية. كل صف أدناه مأخوذ من ورقة بحثية أو صفحة مشروع تمت قراءتها في 23 أغسطس 2026.

النظامالمدخلاتالمولدةالنتيجة المبلغ عنها
MimicGen, CoRL 2023أقل من 200 عرض توضيحي بشري؛ 10 عروض توضيحية بشرية في المواجهة المباشرةأكثر من 50,000 عرض توضيحي، 18 مهمة، أربعة أذرع (Panda, Sawyer, IIWA, UR5e)Square D0: 79 بالمائة من 200 عرض توضيحي تم إنشاؤها من 10 عروض توضيحية بشرية، مقابل 84 بالمائة من 200 عرض توضيحي بشري
DexMimicGen, 202460 عرض توضيحي بشري مصدري21,000 عرض توضيحي للروبوتات الماهرة ثنائية اليدمهام ماهرة ثنائية اليد في المحاكاة، بالإضافة إلى نشر فرز علب بشري من الواقع إلى المحاكاة إلى الواقع
RoboCasa, 20241,250 عرض توضيحي بشري (50 لكل مهمة عبر 25 مهمة ذرية)، 100 مهمة تقييم، أكثر من 150 فئة كائن100,000 مسار MimicGen؛ المجموعة الفرعية المكونة من 72,000 عرض توضيحي تقود المقارنة الرئيسية28.8 بالمائة إجمالاً على المجموعة البشرية مقابل 47.6 بالمائة على المجموعة المولدة بالكامل، تم تقييمها فقط على حالات الكائنات غير المرئية
Sim-and-real co-training, 2025عروض توضيحية حقيقية بالإضافة إلى مجموعات بيانات المحاكاة، مجالان (ذراع روبوت وبشري)مزيج، وليس بديلاًعززت بيانات المحاكاة أداء المهام في العالم الحقيقي بمتوسط 38 بالمائة
DreamGen, 2025بيانات التشغيل عن بعد من مهمة التقاط ووضع واحدة في بيئة واحدةفيديو اصطناعي بالإضافة إلى إجراءات زائفة من نموذج عمل كامن أو نموذج ديناميكي عكسي22 سلوكًا جديدًا على روبوت بشري، في بيئات مرئية وغير مرئية
GR00T N1 data pyramid, 202588 ساعة من التشغيل عن بعد الداخلي لـ GR-1827 ساعة من المسارات العصبية (حوالي 10 أضعاف)؛ 780,000 مسار محاكاة، ما يعادل 6,500 ساعة، تم إنتاجها في 11 ساعةأضافت المسارات العصبية 4.2، 8.8 و 6.8 نقاط على RoboCasa عند أنظمة 30، 100 و 300 عرض توضيحي لكل مهمة، و 5.8 نقاط في المتوسط عبر 8 مهام GR-1 حقيقية
اقرأ المضاعفات كعدد مسارات، وليس كقدرة

المضاعف هو عدد الصفوف. المواجهة المباشرة لـ MimicGen تضع البيانات المولدة أقل قليلاً من نفس عدد البيانات البشرية (79 مقابل 84 بالمائة)، وتضيف عملية استئصال GR00T N1 نقاطًا مئوية أحادية الرقم فوق نموذج كان لديه بالفعل الساعات الحقيقية. تتفوق RoboCasa على البيانات البشرية، 47.6 مقابل 28.8 بالمائة، ولكن مع 72,000 عرض توضيحي مولد مقابل 1,250 عرض توضيحي بشري. الحجم يشتري التغطية. إنه لا يشتري معلومات لم تتضمنها عروضك التوضيحية أبدًا.

النمط عبر كل عملية استئصال صادقة هو نفسه. البيانات الاصطناعية توسع التغطية بتكلفة زهيدة. إنها لا تخلق معلومات حول قابضك، أو ترهل السيرفو الخاص بك، أو إضاءتك، أو ارتفاع طاولتك لم تكن موجودة في العروض التوضيحية الحقيقية في مكان ما. إذا فشلت السياسة لأن المؤثر النهائي يغلق متأخراً بنصف ثانية، فلن يحل أي قدر من التباين المحاكى ذلك. هذه مشكلة توقيت القابض في التسجيلات الحقيقية.

أحد النتائج التي توصلت إليها MimicGen يستحق الأخذ به في جلسات التسجيل الخاصة بك، لأنه يتعارض مع النصيحة المعتادة. أنشأ المشروع مجموعتي بيانات على Square D2، إحداهما تم بذرها بـ 10 عروض توضيحية من مشغل بشري ذي جودة أفضل والأخرى بـ 10 عروض توضيحية من مشغل ذي جودة أسوأ، وكلاهما مأخوذ من مجموعة بيانات robomimic متعددة البشر Square. حققت السياسات المدربة على كل منهما نتائج قابلة للمقارنة، والتي قرأها المؤلفون كعلامة على أن جودة البيانات قد لا تهم كثيرًا في نظام البيانات واسع النطاق. اقرأ بعناية، هذا بيان حول العروض التوضيحية العشرة الأولية، وليس حول حلقاتك الخمسين الحقيقية. هذا يعني أن مجموعة أولية غير منظمة قليلاً ليست هي الشيء الذي يقف بينك وبين مجموعة بيانات مولدة قابلة للاستخدام. ولا يعني ذلك أن الحلقات الحقيقية التي تتدرب عليها بشكل مشترك يمكن أن تكون غير منظمة، لأن هذه هي التي تحمل المعلومات التي لا يمتلكها المحاكي.

The AY-Robots public dataset directory listing recorded LeRobot datasets with their episode counts.
دليل مجموعات البيانات العامة في /directory. كل إدخال هنا هو حلقات مسجلة حقيقية. البيانات الاصطناعية هي مضاعف فوق شيء كهذا، وليست بديلاً عنه.

فجوة المحاكاة إلى الواقع، بشكل ملموس

عادةً ما تُناقش الفجوة ككمية واحدة، وهو أمر غير مفيد. إنها على الأقل خمسة اختلافات منفصلة، ولها أحجام مختلفة على ذراع هواة يتراوح سعره بين 110 و 150 يورو مقارنةً بذراع Franka.

  • التلامس والاحتكاك. يذكر Isaac Lab بوضوح أنه بالنظر إلى نفس الأجهزة ونفس إصدار Isaac Sim و PhysX، فإن المحاكاة قابلة للتكرار، ولكن النتائج تختلف عبر تكوينات الأجهزة المختلفة بسبب دقة الفاصلة العائمة وأخطاء التقريب، وأن PhysX لا يضمن الحتمية لأي مشهد يحتوي على أجسام غير صلبة مثل القماش أو الأجسام اللينة.
  • التشغيل. ينخفض محرك سيرفو Feetech STS3215 الذي يعمل بجهد 7.4 فولت تحت الحمل، ولديه رد فعل عنيف، ويتغير سلوكه مع ارتفاع درجة حرارته. يستعير نموذج MJCF الخاص بـ SO-101 معلمات محركه من مشروع غير ذي صلة بدلاً من تحديدها على ذراعك.
  • التقديم. ضوضاء الكاميرا، الغالق المتدحرج، التعريض التلقائي، والدرجة اللونية الدقيقة لطاولتك ليست موجودة في التقديم. هذا هو النصف من الفجوة الذي تم بناء Cosmos-Transfer1 لإغلاقه: سير عمل تعزيز الروبوتات الخاص به يربط مثالًا تركيبيًا واحدًا للروبوتات بأمثلة واقعية متعددة من التجزئة أو العمق أو تحديد الحواف.
  • التوقيت. يتقدم المحاكي بمعدل ثابت. حلقة التحكم الحقيقية لا تفعل ذلك، ويكلف النموذج نفسه من 20 إلى 485 مللي ثانية لكل خطوة عمل اعتمادًا على النموذج الذي اخترته. انظر زمن انتقال الاستدلال.
  • إحصائيات الكائنات. يتم أخذ عينات من المشاهد المحاكاة من توزيع كتبه شخص ما. طاولة مطبخك ليست كذلك.

ما يعرفه SO-100 المحاكي بالفعل عن ذراعك

هذا هو الجزء الذي يقرر ما إذا كان أي مما سبق يستحق عطلة نهاية الأسبوع الخاصة بك، والمفاجأة الأولى هي أن SO-100 و SO-101 لا يتم خدمتهما بالتساوي. يحتفظ مستودع SO-ARM100 الخاص بـ TheRobotStudio بأصول المحاكاة الخاصة به تحت Simulation/. يحتوي مجلد SO100 على ملف URDF واحد ولا شيء آخر. يحتوي مجلد SO101 على ملفات URDF و MuJoCo: scene.xml، so101_new_calib.xml، so101_old_calib.xml، ملفات URDF المطابقة وملف joints_properties.xml. إذا كنت تريد نموذجًا فيزيائيًا بدلاً من سلسلة حركية، فأنت تريد ملفات SO-101.

تم إنشاؤها باستخدام الملحق onshape-to-robot من نموذج CAD مصمم في Onshape، مما يعني أن الحركيات والشبكات المرئية جيدة مثل CAD. الديناميكيات قصة مختلفة، وملف README الخاص بالمستودع صريح بشأن ثلاثة أمور. تمت إزالة شبكات الاصطدام الأساسية بسبب سلوك الاصطدام الإشكالي أثناء المحاكاة والتخطيط. تم تكييف خصائص محرك STS3215 من مشروع Open Duck Mini بدلاً من قياسها على SO-101. ولم يتم بعد عكس اتفاقية قابض LeRobot، حيث 0 مغلق بالكامل و 100 مفتوح بالكامل، بشكل صريح في ملفات URDF و MuJoCo. كل واحد من هذه الأمور هو مكان ستتصرف فيه السياسة المدربة بحتة في هذا النموذج بشكل مختلف على مكتبك.

اتفاقية المعايرة التي تستهلك يومًا

توجد اتفاقيتان للصفر في ملفات MuJoCo المرفقة، ويختار scene.xml بينهما حسب ملف الروبوت الذي يتضمنه. في so101_new_calib.xml، الافتراضي، يقع الصفر الافتراضي لكل مفصل في منتصف نطاق حركته. في so101_old_calib.xml، الصفر هو التكوين الذي يكون فيه الروبوت ممتدًا بالكامل أفقيًا. إذا كانت حلقات المحاكاة الخاصة بك تستخدم اتفاقية واحدة وكانت حلقاتك الحقيقية المسجلة تستخدم الأخرى، فإن كل زاوية مفصل في مجموعة البيانات المختلطة ستكون مزاحة بعشرات الدرجات، وسيظل الخسارة تنخفض، وستقوم السياسة بشيء خاطئ بثقة. تحقق من الاتفاقية على كلا الجانبين قبل التدريب المشترك، واقرأ المعايرة و الخسارة تنخفض، السياسة لا تفعل شيئًا أولاً.

عشوائية المجال، وما لا تصلحه

الإجابة القياسية على الفجوة هي التوقف عن محاولة مطابقة الواقع وبدلاً من ذلك التدريب عبر توزيع واسع بما يكفي ليقع الواقع ضمنه. أظهر توبين وزملاؤه النسخة القوية من هذا في عام 2017: كاشف كائنات مدرب فقط على صور محاكاة ذات أنسجة عشوائية غير واقعية، بدون أي تدريب مسبق على صور حقيقية على الإطلاق، حدد مواقع الكائنات الحقيقية بدقة 1.5 سم وظل قويًا ضد المشتتات والانسدادات الجزئية.

يقدم Isaac Lab نفس فكرة مصطلحات الأحداث التي تربطها بتكوين البيئة. هذه هي المقابض، بأسماء وظائفها الفعلية في isaaclab.envs.mdp، حتى تتمكن من قراءتها بدلاً من التخمين.

وظيفة الحدثما الذي يزعجه
randomize_rigid_body_materialاحت frictional contact والارتداد
randomize_rigid_body_mass, randomize_rigid_body_comكتلة الكائن والوصلة، إزاحات مركز الكتلة
randomize_actuator_gainsصلابة وتخميد وحدة التحكم بالمفصل
randomize_joint_parameters, randomize_fixed_tendon_parametersاحتكاك المفصل، المحرك والحدود
randomize_visual_texture_material, randomize_visual_colorالمظهر، النصف الضوئي للفجوة
randomize_physics_scene_gravityمتجه الجاذبية
apply_external_force_torque, push_by_setting_velocityاضطرابات وقت التشغيل
reset_root_state_uniform, reset_joints_by_offsetانتشار الحالة الأولية عند كل إعادة تعيين للحلقة

هذا هو الحد، وهو ما يتعثر فيه الناس. يعمل التوزيع العشوائي على توسيع التوزيع الذي رأته السياسة داخل النموذج الذي بنيته. لا يمكنه إدخال تأثير مادي لا يمثله المحاكي. إذا لم يكن PhysX يقوم بنمذجة الارتداد والانخفاض الحراري لمشغلات STS3215 الخاصة بك، فإن عشوائية صلابتها لا تعلم السياسة شيئًا عن الارتداد. ولهذا السبب، فإن الذراع التي يرتعش ثم يترهل تحت سياسة مدربة بالمحاكاة ليست مشكلة ميزانية عشوائية. إنها مشكلة نمذجة.

المسار اليدوي: توليد البيانات في Isaac Lab

Isaac Gym هو برنامج قديم. صفحة NVIDIA الخاصة به تحمل عنوان "Isaac Gym - مهمل الآن" وتذكر أن المطورين يمكنهم تنزيله ومواصلة استخدامه ولكنه لم يعد مدعومًا، مشيرة إلى Isaac Lab بدلاً من ذلك. إذا كنت تريد معرفة التاريخ، فقد قمنا بتغطية كليهما: و . للعمل الجديد في عام 2026، ابدأ بـ Isaac Lab.

  1. 1
    تثبيت Isaac Sim و Isaac Lab

    تذكر صفحة تثبيت pip أن التعليمات مخصصة لـ Isaac Sim 5.X، والذي يتطلب Python 3.11. يمنحك استنساخ المصدر (source clone) السكربتات التي تحتاجها الخطوات التالية.

    bash
    pip install "isaacsim[all,extscache]==5.1.0" \
        --extra-index-url https://pypi.nvidia.com
    
    git clone https://github.com/isaac-sim/IsaacLab.git --branch main
    cd IsaacLab
    sudo apt install cmake build-essential
    ./isaaclab.sh --install
    
    # smoke test
    ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py
  2. 2
    تسجيل حوالي عشرة عروض توضيحية بشرية

    وثائق Isaac Lab محددة: يلزم حوالي 10 عروض توضيحية ناجحة لكي تنجح الخطوات التالية. نصائحها محددة بنفس القدر. اجعل العروض التوضيحية قصيرة، واسلك مسارًا مباشرًا بدلاً من التحرك على محاور عشوائية، ولا تتوقف مؤقتًا، لأنه ليس من الواضح للسياسة (policy) سبب ووقت التوقف.

    bash
    ./isaaclab.sh -p scripts/tools/record_demos.py \
        --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \
        --device cpu \
        --teleop_device spacemouse \
        --dataset_file ./datasets/dataset.hdf5 \
        --num_demos 10
  3. 3
    شرح حدود المهام الفرعية

    يقوم Mimic بتقسيم العروض التوضيحية المدخلة إلى مهام فرعية حتى يتمكن من إعادة توقيت وإعادة استهداف الأجزاء. تقوم علامة --auto بذلك دون تدخل بشري للمهام التي تحدد التعليق التوضيحي التلقائي؛ وبدونها تتوقف مؤقتًا باستخدام B، وتستمر باستخدام N، وتضع علامة على الحدود باستخدام S. لاحظ أن معرف المهمة يكتسب لاحقة -Mimic.

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \
        --device cpu \
        --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \
        --auto \
        --input_file ./datasets/dataset.hdf5 \
        --output_file ./datasets/annotated_dataset.hdf5
  4. 4
    إنشاء مجموعة البيانات المضاعفة

    هذه هي الخطوة التي تحول 10 إلى 1000. يطبق Mimic معيار نجاح منطقيًا على كل مرشح ويحتفظ فقط بالمرشحين الذين أكملوا المهمة، لذا فإن عدد المخرجات أقل من عدد المحاولات. تشير الوثائق إلى أن معدل نجاح المرشح هذا يصل إلى 70 بالمائة في الحالات البسيطة وأقل من 1 بالمائة للمهام الصعبة والروبوتات المعقدة: حوالي 50 بالمائة لتكديس مكعبات Franka، و 65 إلى 80 بالمائة لعملية الالتقاط والوضع بواسطة GR1T2، حيث تستغرق 1000 عرض توضيحي من 18 إلى 40 دقيقة (19 دقيقة على RTX ADA 6000 بنسبة 80 بالمائة).

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \
        --device cpu \
        --num_envs 10 \
        --generation_num_trials 1000 \
        --headless \
        --input_file ./datasets/annotated_dataset.hdf5 \
        --output_file ./datasets/generated_dataset.hdf5
  5. 5
    تحويل HDF5 إلى مجموعة بيانات LeRobot

    كل ما سبق ينتج HDF5 بنكهة robomimic، ولا يشحن Isaac Lab الأساسي محول LeRobot خاصًا به: وثائقه تقول فقط أنه يمكنك تحويل مجموعة البيانات التي تم إنشاؤها إلى تنسيق LeRobot. يوفر مشروعان المحول الفعلي. يشحن IsaacLab-Arena محولًا يستهدف GR00T ويتم تشغيله بالكامل بواسطة تكوين YAML، ويشحن LeIsaac زوجًا خاصًا به لمسار SO-101 (انظر أدناه).

    bash
    # IsaacLab-Arena, GR00T LeRobot format
    python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
        --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
ثبّت إصداراتك، ولا تثق في main

في 23 أغسطس 2026، تحمل وثائق Isaac Lab لـ main شارة Isaac Sim 6.0.1 وتقدم إصدار release/3.0.0 و v3.0.0-beta2 في مبدل الإصدارات الخاص بها جنبًا إلى جنب مع v2.3.2، بينما لا تزال صفحة تثبيت pip على نفس الشجرة تثبت isaacsim[all,extscache]==5.1.0 وتصف التعليمات بأنها لـ Isaac Sim 5.X. حاوية مخطط NVIDIA synthetic-manipulation-motion-generation أقدم مرة أخرى: Isaac Lab 2.0.2 على Isaac Sim 4.5.0. يقرن جدول توافق LeIsaac الخاص به Isaac Sim 5.1 مع Isaac Lab v2.3.0. تتحرك هذه الأشجار أسرع مما تتوافق الوثائق. اختر إصدارًا واحدًا، ودوّنه، وتوقع أن تكون مسارات السكربتات وأسماء العلامات قد تغيرت إذا اتبعت برنامجًا تعليميًا كُتب قبل ثلاثة أشهر.

لماذا تفشل محاولات الإنشاء، وماذا يجب تغييره

معدل نجاح مرشح يتأرجح بين 70 بالمائة وأقل من 1 بالمائة ليس لغزًا، ويوثق Isaac Lab المزالق الشائعة بدلاً من تركك للتخمين. كل واحد منها هو شيء تتحكم فيه وقت التسجيل، ولهذا السبب من المفيد قراءة هذه القائمة قبل تسجيل العروض التوضيحية العشرة الأولية بدلاً من بعد تشغيل الجيل الأول المخيب للآمال.

  • العروض التوضيحية طويلة جدًا. كلما كان الأفق الزمني أطول، كان تعلم السياسة أصعب. ابدأ بالقرب من الكائن الأول وقلل الحركة.
  • العروض التوضيحية ليست سلسة. الحركة غير المنتظمة يصعب على السياسة فك شفرتها، وأجهزة التحكم عن بعد الأفضل توفر بيانات أفضل: تشير الوثائق بوضوح إلى أن SpaceMouse يتفوق على لوحة المفاتيح.
  • التوقفات المؤقتة. يصعب تعلم التوقفات المؤقتة، لأنه ليس واضحًا للسياسة سبب ووقت التوقف. حافظ على حركة سلسة.
  • الكثير من المهام الفرعية. المزيد من المهام الفرعية يعني المزيد من الربط بين أجزاء المسار، مما يؤدي إلى حركة أقل سلاسة ومعدل نجاح توليد أقل. قم بوضع علامات على الحدود حيث من غير المرجح أن يصطدم الذراع بأي شيء.
  • لا يوجد ضوضاء في الإجراء. ضوضاء الإجراء تجعل السياسات الناتجة أكثر قوة.
  • التسجيل مقطوع بإحكام شديد. إذا توقف التسجيل عند الإطار الدقيق الذي يؤدي إلى تشغيل مصطلح النجاح، فقد لا يتم إعادة تشغيله أثناء الإعادة. اترك مخزنًا مؤقتًا في النهاية.
  • إعادة تشغيل غير حتمية. لا يمكن إعادة إنتاج الفيزياء في Isaac Lab بشكل حتمي عبر env.reset، لذلك تفشل بعض العروض التوضيحية البشرية عند الإعادة. اجمع أكثر مما تحتاج واحتفظ بتلك التي تنجو من التعليق التوضيحي. كل ما يهبط في ملف HDF5 الذي تم إنشاؤه بواسطة Mimic هو عرض توضيحي ناجح ويمكن استخدامه للتدريب حتى لو فشلت الإعادة لاحقًا.

خطوة الاستيفاء بين أجزاء المهام الفرعية المترابطة لها مقبض ضبط خاص بها، ويتناسب عدد خطوات الاستيفاء التي تحتاجها مع سرعة حركة الروبوت ومدى اتساع توزيع إعادة تعيين الكائن. المهمة المعقدة ذات التوزيع الكبير لإعادة التعيين تترك فجوات أكبر بين الأجزاء، مما يتطلب المزيد من خطوات الاستيفاء لتظهر كحركة مستمرة. إذا أظهرت مقاطع الفيديو التي تم إنشاؤها أن الذراع يتأرجح بين المراحل، فهذه هي المعلمة التي يجب النظر إليها قبل إلقاء اللوم على العروض التوضيحية الأولية.

نفس المسار على SO-101، مع ذراع القائد الحقيقي

هذا هو الجزء المثير للاهتمام لأي شخص يقرأ هذه الصفحة، لأنه المسار المفتوح الوحيد الذي يضع داخل Isaac Lab ويتيح لك قيادته باستخدام ذراع القائد الفيزيائي الذي تملكه بالفعل. LeIsaac، الإصدار 0.4.0 وقت الكتابة، هو ساحة اللعب الرسمية للمحاكاة بالتعلم بالتقليد المدمجة في EnvHub الخاص بـ LeRobot. يسرد جدول التوافق الخاص به ثلاث مجموعات عمل؛ أحدثها يجمع بين Isaac Sim 5.1 مع Isaac Lab v2.3.0، وCUDA 12.8، وPyTorch 2.7.0، وPython 3.11، وتوصي الوثائق بـ Isaac Sim 5.0 أو أحدث لبطاقات السلسلة 50.

bash
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
  --index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0
LeIsaac من المصدر. تثبيت numpy موجود في التعليمات الرسمية، وليس حلاً بديلاً.

مع تثبيت ذلك، يقوم ذراع القائد على /dev/ttyACM0 بقيادة التابع المحاكى ويسجل مباشرة إلى HDF5. هي نفسها التي تعرفها بالفعل من التسجيل الحقيقي، فقط التابع هو جسم صلب في PhysX.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 \
    --device=cuda \
    --enable_cameras \
    --record \
    --dataset_file=./datasets/dataset.hdf5
معرف البيئةوصف المهمةالروبوت
LeIsaac-SO101-PickOrange-v0التقط ثلاث برتقالات وضعها في الطبق، ثم أعد الذراع إلى حالة الراحةSingle-arm SO101 follower
LeIsaac-SO101-LiftCube-v0ارفع المكعب الأحمرSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-v0التقط جسمين على شكل حرف e وضعهما في الصندوق، ثم أعد الذراع إلى حالة الراحةSingle-arm SO101 follower
LeIsaac-SO101-CleanToyTable-BiArm-v0نفس المهمة بذراعينBi-arm SO101 follower
LeIsaac-SO101-FoldCloth-BiArm-v0اطوِ القماش، ثم أعد الذراع إلى حالة الراحة. فقط متغير DirectEnv يدعم check_successBi-arm SO101 follower
LeIsaac-LeKiwi-CleanupTrash-v0التقط مناديل القمامة من الأرض وارمها في سلة المهملاتLeKiwi

معظم هذه المعرفات موجودة أيضًا كمتغير -Direct-v0، و python scripts/environments/list_envs.py يطبع القائمة الحالية. يمكنك أيضًا تخطي مسار HDF5 بالكامل وكتابة تنسيق LeRobot أثناء التشغيل عن بعد عن طريق إضافة ثلاثة أعلام. هناك تحذيران يأتيان من الوثائق نفسها: يتخطى المسجل تلقائيًا أول 5 إطارات من كل حلقة لتجنب عدم الاستقرار من الحالات الأولية، وقد يتسبب في تأخيرات طفيفة في التشغيل عن بعد، وهو بالضبط نوع الشيء الذي يغير بهدوء طبيعة عروضك التوضيحية. كما أنه لا يقوم بتفريغ الحلقات إلا إذا تم وضع علامة نجاح على المهمة.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 --device=cuda --enable_cameras --record \
    --use_lerobot_recorder \
    --lerobot_dataset_repo_id=<your-user>/<dataset-name> \
    --lerobot_dataset_fps=30

ثم يتم تشغيل خطوة المضاعفة على تلك التسجيلات. يغلف LeIsaac Isaac Lab Mimic في أربعة أوامر، لأن Mimic يعمم المسارات من أوضاع المؤثر النهائي والكائن: تحويل الإجراءات في مساحة المفصل إلى إجراءات قائمة على IK، التعليق التوضيحي، التوليد، ثم التحويل مرة أخرى إلى مساحة المفصل.

bash
python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --to_ik --headless

python scripts/mimic/annotate_demos.py --device cuda \
  --task LeIsaac-SO101-LiftCube-Mimic-v0 \
  --input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/generate_dataset.py --device cuda \
  --num_envs 1 --generation_num_trials 10 \
  --input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
  --to_joint --headless

ثم قم بالتحويل إلى LeRobot. هذه هي الخطوة التي تفرض فيها قاعدة تنسيق المنصة نفسها، ويصادف أن LeIsaac يأتي مع المحولين اللذين تحتاجهما بالضبط: isaaclab2lerobot.py يكتب LeRobot v2، وهو ما تستخدمه محملات GR00T، و isaaclab2lerobotv3.py يكتب v3 لـ Pi0.5, SmolVLA و ACT. يأخذ السكريبتان نفس الوسائط ولكنهما يحددان إصدارات مختلفة من lerobot، ويتم تحويل الحلقات الناجحة فقط.

bash
pip install lerobot==0.3.3
pip install numpy==1.26.0

python scripts/convert/isaaclab2lerobot.py \
    --task_name=LeIsaac-SO101-PickOrange-v0 \
    --repo_id=<your-user>/so101_pick_orange_sim \
    --hdf5_root=./datasets \
    --hdf5_files=dataset.hdf5
مخرج LeRobot v2 لـ GR00T. استبدل بـ isaaclab2lerobotv3.py، مع lerobot 0.4.2، لمدربي v3.
يوجد مخرج طوارئ بدون وحدة معالجة رسومات

يوثق LeIsaac تشغيل المكدس بأكمله على NVIDIA Brev: قم بالنشر، انقر على رابط المنفذ 80 لفتح خادم VS Code المستند إلى المتصفح، وقم بتشغيل السيناريوهات الأربعة المثبتة مسبقًا باستخدام --kit_args="--no-window --enable omni.kit.livestream.webrtc"، مع عرض العرض على نفس العنوان بإضافة /viewer. إذا لم يكن لديك بطاقة محطة عمل تحت مكتبك، فهذه طريقة أرخص لمعرفة ما إذا كانت النسخة المحاكاة لمهمتك قريبة حتى قبل أن تلتزم بتخصيص الأجهزة لها.

مساران لسياسة مدربة

تقوم ببناء المشهد، وتوليد البيانات، واستئجار وحدة معالجة الرسوميات (GPU)، وتوصيل خدمة النشر بنفسك. هذا هو الخيار الصحيح إذا كانت المهمة تتطلب تنوعًا بيئيًا لا يمكنك إعداده ماديًا، أو إذا كنت ترغب في تقييم قابل للتكرار.

  1. قم بتثبيت Isaac Sim 5.1 و Isaac Lab، أو حزمة LeIsaac إذا كان الروبوت الخاص بك من طراز SO-101.
  2. نمذجة المشهد أو استيراده. هذه هي الخطوة التي لا يخصص لها أحد ميزانية وعادة ما تكون الأطول.
  3. سجل حوالي 10 عروض توضيحية نظيفة عبر المتابع المحاكي.
  4. قم بتعليق المهام الفرعية، وقم بتشغيل generate_dataset.py، واقبل أن يتم تجاهل الإخفاقات.
  5. حول HDF5 إلى تنسيق LeRobot، مع اختيار v2 لـ GR00T و v3 للآخرين.
  6. سجل حلقات حقيقية على الذراع الفيزيائية على أي حال، ثم قم بالتدريب المشترك على الخليط.
  7. استأجر وحدة معالجة رسوميات (GPU)، قم بتشغيل الضبط الدقيق، واخدم نقطة التحقق بجوار الذراع.
الموردما تذكره المصادر
وحدة معالجة الرسوميات للمحاكاة المحليةتتطلب خطة NVIDIA للتلاعب الاصطناعي Ubuntu 22.04 وبطاقة NVIDIA RTX A6000 بذاكرة VRAM سعة 48 جيجابايت
عقدة نموذج العالمتتطلب نفس الخطة H100 أو أعلى بسعة 80 جيجابايت، على عقدة منفصلة عن محاكاة Isaac Lab
إصدارات الحاوياتIsaac Lab 2.0.2 على Isaac Sim 4.5.0 داخل صورة تلك الخطة
إنتاجية التوليديبلغ Isaac Lab عن 1000 عرض توضيحي لالتقاط ووضع GR1T2 في 18 إلى 40 دقيقة، 19 دقيقة على RTX ADA 6000 بنسبة نجاح 80 بالمائة
تكلفة المسار العصبييبلغ GR00T N1 حوالي 105,000 ساعة GPU من نوع L40، أي ما يقرب من 1.5 يوم على 3,600 L40، لـ 827 ساعة من أحلامه
التكلفة الحقيقية هي الوقت الزمني، وليس وقت وحدة معالجة الرسوميات (GPU)

توليد 1000 مسار يستغرق فترة بعد الظهر. أما جعل المشهد الخاص بك، وإعدادات الكاميرا الخارجية، وشبكات الكائنات، ونموذج السيرفو قريبًا بما يكفي لنقل تلك المسارات، فهذا هو ما يستغرق أسابيع. خصص الميزانية للنمذجة، وليس لأخذ العينات.

نماذج عالم الفيديو: الطبقة الأحدث، والأقل قياسًا

الفكرة وراء DreamGen هي أن نموذجًا توليديًا للفيديو، مُكيفًا مع تجسيد الروبوت المستهدف، يمكنه تخيل حلقات معقولة في مشاهد لم تزورها أبدًا. تتكون العملية من أربع مراحل: الضبط الدقيق لنموذج عالم الفيديو، وتوليد مقاطع فيديو روبوتية اصطناعية واقعية، واستعادة تسلسلات الإجراءات الزائفة باستخدام نموذج عمل كامن أو نموذج ديناميكيات عكسية، ثم تدريب سياسة الروبوت على النتيجة. مستودع GR00T-dreams من NVIDIA ينفذ ذلك بالضبط.

النتيجة الرئيسية حقيقية وتستحق الأخذ بها على محمل الجد: بيانات التشغيل عن بعد من مهمة التقاط ووضع واحدة فقط في بيئة واحدة أنتجت 22 سلوكًا جديدًا على روبوت بشري، في بيئات مرئية وغير مرئية على حد سواء. التحذير حقيقي بنفس القدر ويكمن في المرحلة الثالثة.

نماذج عالم الفيديو كمصدر للبيانات
المزايا
  • تتوسع على طول المحور المكلف حقًا في العالم الحقيقي: مشاهد جديدة، ترتيبات كائنات جديدة، صياغات جديدة للتعليمات.
  • GR00T-dreams يسرد أربعة تجسيدات مدعومة لبرامج استخراج الإجراءات والضبط الدقيق: franka, gr1, robocasa and so100. هذه ليست تقنية مخصصة للروبوتات البشرية فقط.
  • يهاجم Cosmos-Transfer1 النصف الضوئي من الفجوة مباشرة، حيث يقوم بربط مثال روبوتات اصطناعي واحد بأمثلة واقعية متعددة من التجزئة أو العمق أو تحديد الحواف. يشحن Isaac Lab نفسه أدوات المطالبة لذلك تحت scripts/tools/cosmos.
  • يشحن عمل DreamGen معيار DreamGen Bench، وهو معيار لتوليد الفيديو يظهر ارتباطًا قويًا بين أداء المعيار ونجاح السياسة اللاحقة، بحيث يمكنك فحص التوليدات قبل التدريب عليها.
المقايضات
  • يتم استعادة الإجراءات بواسطة نموذج، وليس قياسها بواسطة مشفر. قد يحمل الفيديو الذي يبدو صحيحًا مسارًا مفصليًا لا يستطيع ذراعك تنفيذه.
  • التوليد مكلف. يشير GR00T N1 إلى دقيقتين لتوليد ثانية واحدة من الفيديو على L40، أي ما يقرب من 105,000 ساعة GPU من L40، حوالي 1.5 يوم على 3,600 وحدة GPU من L40، لـ 827 ساعة من المسارات العصبية.
  • المكاسب المقاسة تقع في خانة الآحاد: 4.2، 8.8 و 6.8 نقطة على RoboCasa عبر أنظمة البيانات الثلاثة، و 5.8 نقطة في المتوسط على 8 مهام GR-1 حقيقية، بالإضافة إلى نموذج كان لديه بالفعل البيانات الحقيقية.
  • لا توجد وصفة منشورة تتحقق من صحة هذا لذراع مؤازرة هواة 7.4 V من البداية إلى النهاية. ستكون تقوم بالترحيل، وليس المتابعة.
لا تقم أبدًا بتغذية 12 V إلى STS3215

لا علاقة له بالمحاكاة، ولكنه يظهر كلما انتقل شخص ما من ذراع محاكاة إلى ذراع حقيقي وارتجل مصدر طاقة. تعمل أذرع SO-100 و SO-101 و LeKiwi جميعها بمحركات Feetech STS3215 المؤازرة عند 7.4 V. تغذيتها بـ 12 V تدمرها، و LeKiwi هو فخ خاص لأن سكة قاعدته هي 12 V. راجع صفحة أجهزة SO-100 قبل توصيل أي شيء.

التدريب المشترك هو الوصفة التي تظهر مكاسب فعلية

إذا استخلصت درسًا عمليًا واحدًا من الأدبيات، فليكن هذا الدرس. هدفت دراسة التدريب المشترك بين المحاكاة والواقع (مادوكوري وزملاؤه، 2025) إلى إيجاد وصفة بسيطة لاستخدام بيانات المحاكاة لحل مهام التلاعب الروبوتي القائمة على الرؤية، عبر مجالين، ذراع روبوت وإنسان آلي، وكان استنتاجها هو أنك تتدرب على مزيج. عززت بيانات المحاكاة أداء المهام في العالم الحقيقي بمتوسط 38 بالمائة، وتوضح الورقة البحثية أن هذا ظل صحيحًا حتى مع وجود اختلافات ملحوظة بين بيانات المحاكاة وبيانات العالم الحقيقي.

تلك الجملة الأخيرة تهم أكثر من نسبة 38 بالمائة. هذا يعني أن المحاكاة لا يجب أن تكون توأمًا رقميًا مثاليًا لتكون مفيدة، بشرط أن تكون البيانات الحقيقية موجودة في المزيج لتثبيتها. النقل المعتمد على المحاكاة فقط هو المسار المكلف: تشير نفس الورقة إلى أن تدريب سياسة بالكامل في المحاكاة ونقلها إلى العالم الحقيقي غالبًا ما يتطلب جهدًا بشريًا كبيرًا لسد فجوة الواقع. يتخطى التدريب المشترك معظم هذا الجهد بعدم مطالبة السياسة بسد الفجوة بمفردها أبدًا.

جدول مقارنة سياسات AY-Robots الذي يوضح المعلمات، فئة وحدة معالجة الرسوميات، زمن استجابة الاستدلال، والحد الأدنى للحلقات لـ GR00T N1.7، GR00T N1.5، Pi0.5، SmolVLA و ACT.
السياسات الخمس القابلة للتدريب في /policies. عمود الحد الأدنى للحلقات هو الرقم الذي يحدد ما إذا كانت البيانات الاصطناعية أمرًا مرغوبًا فيه أم الطريقة الوحيدة للوصول إلى مجموعة بيانات قابلة للتدريب.

عمليًا، على هذه المنصة، يعني التدريب المشترك شيئًا واحدًا: ضع مجموعتي الحلقات في نفس مجموعة بيانات LeRobot مع مفاتيح كاميرا متسقة، ترتيب مفاصل متسق، ووحدات متسقة، ثم قم بتشغيل ضبط دقيق. لا يوجد مقبض لوزن المزيج في نموذج التدريب. إذا كنت تريد نسبة 3:1 من المحاكاة إلى الواقع، فإنك تعبر عن ذلك بعدد الحلقات من كل نوع التي تضعها في مجموعة البيانات.

أرخص مكسب من المحاكاة ليس بيانات التدريب

إنه التقييم. إجراء عشرات التجارب الحقيقية لكل مهمة لمقارنة يستغرق يومًا كاملاً من وقت الذراع، وتنجرف الذراع بين التجارب. قامت SIMPLER (لي وزملاؤه، 2024) ببناء بيئات محاكاة هدفها هو تسجيل السياسات الحقيقية بدلاً من تدريبها، ثم قياس مدى جودة تنبؤ ترتيب المحاكاة بالترتيب الحقيقي. بيئة SIMPLER واحدة تعرض 3,500 خطوة محاكاة في الثانية على بطاقة RTX 4090 للمستهلك بدقة 640 × 512، وهو ما يمثل تسريعًا بمقدار 7 أضعاف مقارنة بالتقييم الحقيقي عند تردد محاكاة 500 هرتز.

بروتوكول التقييمMMRV (الأقل أفضل)معامل ارتباط بيرسون r (الأعلى أفضل)
خطأ متوسط التربيع للتحقق0.3750.308
SIMPLER، تجميع المتغيرات0.1430.778
SIMPLER، المطابقة البصرية0.0560.924

هذه متوسطات لثلاث مجموعات مهام من Google Robot لست نقاط تحقق شائعة مفتوحة المصدر: ثلاث نقاط تحقق RT-1 في مراحل تدريب مختلفة، RT-1-X، RT-2-X و Octo-Base. الجانب الحقيقي ليس عددًا موحدًا من التجارب، وهو أمر يستحق المعرفة قبل الاقتباس منه: 75 تجربة لالتقاط علبة كوكا، 60 لتحريكها بالقرب، 54 لمهام فتح وإغلاق الدرج، و 27 لمهمة الدرج والتفاح الأطول. المقارنة مقابل خطأ متوسط التربيع للتحقق هي الجزء المفيد. اختيار النموذج عن طريق خسارة التحقق يصنف نقاط التحقق هذه بشكل سيء، ومعامل ارتباط بيرسون r بقيمة 0.924 تحت المطابقة البصرية يعني أنه إذا سجلت نقطة تحقق أداءً أفضل في SIMPLER، فمن المحتمل جدًا أن تسجل أداءً أفضل على المنصة. هذه لوحة نتائج قابلة للتكرار بين عشية وضحاها، ولا تتطلب منك تصديق أي شيء حول نقل التدريب من المحاكاة إلى الواقع.

لوحة صدارة AY-Robots Arena، وهي جدول قابل للفرز يضم 85 نموذجًا للرؤية واللغة والحركة مع 332 نتيجة معيارية، كل قيمة مرتبطة بورقتها البحثية المصدر أو بطاقة النموذج.
تجمع ساحة Arena في /arena عدد 332 نتيجة معيارية عبر 85 نموذجًا. جميعها تقريبًا هي معايير محاكاة، وهذا هو بالضبط جوهر حجة SIMPLER: المحاكاة لوحة نتائج جيدة قبل وقت طويل من كونها مصدر بيانات جيد.

إذا كنت تريد السياق الأوسع حول ما تخبرك به هذه الأرقام المعيارية وما لا تخبرك به عن ، فقد كتبنا ذلك بشكل منفصل في .

أين لا تساعدك هذه المنصة

الوضوح بشأن الحدود يوفر وقت الجميع. AY-Robots هي منصة تسجيل وتدريب وتقديم خدمات. لا تحتوي على أي محاكي.

  • لا يوجد Isaac Lab، ولا MimicGen، ولا نموذج عالمي، ولا تأليف للمشاهد. إذا كنت تريد بيانات مُولّدة، فعليك توليدها في مكان آخر وإحضار النتيجة.
  • تستهلك المدربات مجموعات بيانات LeRobot ولا شيء غيرها. يجب تحويل تصدير المحاكي قبل أن يصبح مدخلاً، ويجب أن يكون الإصدار الصحيح: v2.0 أو v2.1 لـ GR00T N1.5 و N1.7، و v3.0 لـ Pi0.5 و SmolVLA و ACT.
  • نقطة الدخول للضبط الدقيق في GR00T هي واجهة سطر أوامر (CLI) من نوع tyro لا تكشف عن أي بذرة (seed)، لذا فإن تشغيل GR00T ليس قابلاً للاستنساخ بت-باي-بت. إذا كنت تجري دراسة إزالة دقيقة للمحاكاة مقابل الواقع، فهذا قيد حقيقي. البذرة الافتراضية الخاصة بـ lerobot هي 1000، وتكشف نماذج ACT و SmolVLA و Pi0.5 عن حقل للبذرة.
  • تراكم التدرج (Gradient accumulation) يُطبق فعليًا فقط لمدربي GR00T الاثنين. بالنسبة لـ Pi0.5 و SmolVLA، يوجد الحقل في النموذج ولكن lerobot 0.5.1 لا يحتوي على مثل هذه العلامة، لذا فهو لا يفعل شيئًا.
  • يجب أن يكون الاستدلال (Inference) بجانب المحركات المؤازرة للمهام السريعة. حلقة التحكم تتراوح من 20 إلى 485 مللي ثانية لكل خطوة عمل اعتمادًا على النموذج، وإضافة رحلات ذهاب وعودة عبر الإنترنت العام تحول السياسة العاملة إلى سياسة مترددة. الاستدلال عن بعد ممكن لمهام الالتقاط والوضع البطيئة، وليس للحركة التفاعلية السريعة.
ما يمكنك فعله هنا وهو صعب حقًا في أماكن أخرى

سجل النصف الحقيقي من مزيج التدريب المشترك دون امتلاك ذراع. /live يبث SO-100 ماديًا بدون تسجيل، ويعتمد على قائمة الانتظار، وبرنامج المشغل موجود لأن شخصًا ما يجب أن يقودها. إذا كانت مشكلتك هي أن لديك محاكيًا ولا توجد حلقات حقيقية، فهذه هي الفجوة التي تسدها هذه المنصة.

ميزانية يمكنك الدفاع عنها

ضع المسارين جنبًا إلى جنب مع الأرقام التي ينشرها كل منهما فعليًا، وعادة ما يتخذ القرار بنفسه لمشروع مهمة واحدة على ذراع منخفضة التكلفة.

البندالمحاكاة أولاًالتسجيل أولاً
النمذجة الأوليةالمشهد، الشبكات، وضع الكاميرا، نموذج السيرفو. أيام إلى أسابيعNone
جمع البياناتحوالي 10 عروض توضيحية في المحاكاة، ثم التوليد30 إلى 50 حلقة حقيقية، بضع ساعات من التشغيل عن بعد
المعدات المطلوبةبطاقة 48 جيجابايت لمخطط Isaac Lab، و80 جيجابايت لمرحلة Cosmosذراع وجهاز كمبيوتر محمول
تكلفة التدريبنفس تكلفة العمود الأيمن، المدرب لا يهتم بمصدر البيانات1 إلى 3 دولار أمريكي على فئة 4090، 4 إلى 12 دولار أمريكي على فئة A100 أو H100
أفضل دليل على العائدمتوسط مكاسب بنسبة 38 بالمائة في العالم الحقيقي عند التدريب المشترك، 4 إلى 9 نقاط من المسارات العصبيةالخط الأساسي الذي تُقاس عليه جميع ما سبق
يفشل عندماتعتمد مهمتك على التلامس، أو الأجسام القابلة للتشوه، أو مرونة السيرفوتحتاج إلى تباين بيئي لا يمكنك تهيئته فعليًا

لسياسة أولى على SO-100، قم بالتسجيل. إن و يوصلانك إلى نقطة تحقق جاهزة للخدمة بسعر فنجان قهوة، وستمتلك النصف الحقيقي لأي مزيج تدريب مشترك مستقبلي. الجأ إلى المحاكي عندما يكون لديك خط أساسي عامل وفشل تعميم محدد يمكنك تسميته، مثل سياسة .

لا يوجد ذراع على مكتبك بعد؟

قم بقيادة SO-100 حقيقي في المتصفح، بنظام قائمة الانتظار، بدون تسجيل، وشاهد كيف تبدو الحلقة الحقيقية بالفعل قبل أن تقضي عطلة نهاية الأسبوع في نمذجة واحدة في المحاكي.

قد ذراعًا حقيقيًا

وصفة تحترم الأدلة

  1. 1
    سجل خط الأساس الحقيقي أولاً

    30 حلقة لـ SmolVLA، و50 لـ ACT، وGR00T N1.7 وPi0.5. تدرب مرة واحدة. أي شيء تفشل فيه هذه السياسة هو مواصفاتك للبيانات الاصطناعية.

  2. 2
    حدد فشل التعميم

    وضعية الكائن؟ الإضاءة؟ ارتفاع الطاولة؟ المشتتات؟ صياغة مختلفة للتعليمات؟ البيانات الاصطناعية جيدة في واحدة فقط من هذه الأمور في كل مرة، وعديمة الفائدة إذا لم تتمكن من تحديد أي منها.

  3. 3
    اختر العائلة الأقل تكلفة التي تغطيها

    تنوع الوضعية والتخطيط: مضاعفة المسار. الإضاءة والملمس: تعزيز الصورة أولاً، نموذج العالم ثانياً. مشاهد جديدة بالكامل: عمليات محاكاة فيزيائية، وتقبل تكلفة النمذجة.

  4. 4
    قم بالتوليد، ثم تخلص بقوة

    تفشل محاولات التوليد، ويتراوح معدل نجاح المرشحين في Isaac Lab من 70 بالمائة إلى أقل من 1 بالمائة حسب المهمة. احتفظ فقط بالمسارات الناجحة التي تكمل المهمة، وراجع عينة كفيديو قبل أن تثق بالدفعة.

    bash
    python scripts/mimic/generate_dataset.py --device cuda \
        --num_envs 8 --generation_num_trials 500 \
        --input_file ./datasets/annotated.hdf5 \
        --output_file ./datasets/generated.hdf5 --enable_cameras
  5. 5
    تدرب بشكل مشترك، لا تستبدل

    ادمج الحلقات المولدة مع الحلقات الحقيقية في مجموعة بيانات LeRobot واحدة بمفاتيح كاميرا وترتيب مفاصل متطابقين. الرقم 38 بالمائة هو رقم تدريب مشترك.

  6. 6
    قيم على الذراع الحقيقية، وهناك فقط

    التقييم المحاكى هو إشارة ترتيب جيدة (معامل ارتباط بيرسون r 0.924 في إعداد المطابقة البصرية لـ SIMPLER) ولكنه ليس اختبار القبول. قم بتشغيل نقطة التحقق على المنصة قبل أن تصدقها.

إذا كنت تفضل البدء من قائمة تحقق للتسجيلات الحقيقية نفسها، ، يغطي وضع الكاميرا، وتداعياتها وأنماط الفشل التي تجعل مجموعة البيانات غير قابلة للاستخدام. تفاصيل التنسيق نفسه موجودة في ، وجانب المعلمات الفائقة في .

هل يمكنني تدريب سياسة روبوت بالكامل على بيانات اصطناعية؟

لمهمة مناولة على ذراع حقيقية، ليس بشكل موثوق. كل نتيجة منشورة برقم قوي هي نتيجة تدريب مشترك أو نتيجة تعزيز فوق البيانات الحقيقية. مقارنة MimicGen الخاصة تضع 200 عرض توضيحي مولد بنسبة 79 بالمائة مقابل 84 بالمائة لـ 200 عرض توضيحي بشري على نفس المهمة، وتشير ورقة التدريب المشترك بين المحاكاة والواقع لعام 2025 إلى أن التدريب في المحاكاة فقط والنقل يتطلب غالبًا جهدًا بشريًا كبيرًا لسد فجوة الواقع. تُظهر RoboCasa أن البيانات المولدة تتفوق على البيانات البشرية بنسبة 47.6 مقابل 28.8 بالمائة، ولكن فقط مع 72,000 عرض توضيحي مولد مقابل 1,250 عرض توضيحي بشري، داخل المحاكي الذي أنتج كليهما.

كم عدد الحلقات الحقيقية التي ما زلت أحتاجها إذا قمت بتوليد حلقات اصطناعية؟

في AY-Robots، يحتاج المدربون إلى 30 حلقة كحد أدنى لـ SmolVLA و50 لـ ACT وGR00T N1.5 وGR00T N1.7 وPi0.5، بغض النظر عن مصدر الحلقات. تشير وثائق Mimic الخاصة بـ Isaac Lab إلى أن حوالي 10 عروض توضيحية بشرية ناجحة مطلوبة كبذرة للتوليد. هذه أرقام مختلفة تجيب على أسئلة مختلفة: 10 هو ما يحتاجه المولد، و30 إلى 50 هو ما يحتاجه المدرب.

هل يجب أن تكون البيانات المحاكية بتنسيق LeRobot؟

للتدريب على هذه المنصة، نعم. ينتج كل من Isaac Lab وLeIsaac ملفات HDF5 بنكهة robomimic. لا يشحن Isaac Lab الأساسي أي محول LeRobot، ولكن LeIsaac يشحن isaaclab2lerobot.py لـ LeRobot v2 وisaaclab2lerobotv3.py لـ v3، ويشحن IsaacLab-Arena ملف convert_hdf5_to_lerobot.py المستهدف لـ GR00T والذي يتم تشغيله بواسطة تكوين YAML. انتبه للإصدار: GR00T N1.5 وN1.7 يستخدمان LeRobot v2.0 أو v2.1، بينما Pi0.5 وSmolVLA وACT يستخدمان v3.0. مجموعة بيانات v3.0 تتسبب في تعطل محمل GR00T ويجب تحويلها إلى v2.1.

هل Isaac Gym لا يزال هو الشيء الصحيح لتعلمه في عام 2026؟

لا. صفحة منتج NVIDIA الخاصة تحمل عنوان "Isaac Gym - الآن مهمل" وتذكر أنه برنامج قديم، وأن المطورين يمكنهم تنزيله ومواصلة استخدامه ولكنه لم يعد مدعومًا، وتشير إلى Isaac Lab كبديل. يشحن Isaac Lab أدلة ترحيل من IsaacGymEnvs، ومن OmniIsaacGymEnvs ومن Orbit، لذا فإن البيئة الحالية قابلة للنقل بدلاً من فقدانها.

هل يمكنني وضع SO-100 أو SO-101 في Isaac Lab؟

SO-101، نعم، بشكل صحيح. يشحن مستودع TheRobotStudio ملفات URDF وMJCF لكل من SO-101، تم إنشاؤها باستخدام onshape-to-robot من نموذج Onshape CAD، ويوفر LeIsaac مهام Isaac Lab جاهزة مثل LeIsaac-SO101-PickOrange-v0 مع التحكم عن بعد من ذراع SO101 القائد الفيزيائي. بالنسبة لـ SO-100، يشحن نفس المستودع ملف URDF واحد فقط ولا يوجد نموذج MuJoCo. كن على دراية بالقيود التي يذكرها ملف README الخاص بـ SO-101 في كلتا الحالتين: تمت إزالة شبكات تصادم القاعدة بسبب سلوك التصادم الإشكالي، وتم تكييف خصائص محرك STS3215 من مشروع Open Duck Mini بدلاً من تحديدها على SO-101، ولم يتم بعد عكس اتفاقية القابض من 0-مغلق إلى 100-مفتوح في ملفات النموذج.

هل تقوم المنصة بتشغيل المحاكاة لي؟

لا. تسجل AY-Robots مجموعات بيانات LeRobot من التحكم عن بعد الحقيقي، وتضبط السياسات الخمس المدعومة على وحدات معالجة الرسوميات المستأجرة، وتقدم نقطة التحقق الناتجة مرة أخرى إلى الذراع. لا يوجد محاكي، ولا توليد بيانات اصطناعية، ولا تأليف للمشاهد فيها. إذا قمت بتوليد البيانات في مكان آخر وتحويلها إلى مجموعة بيانات LeRobot صالحة، فسيقبلها المدربون تمامًا مثل التسجيلات الحقيقية.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started