مدخل واژه‌نامه AY-Robots برای فرمت مجموعه داده LeRobot، فرمتی که هر آموزش‌دهنده در پلتفرم از آن استفاده می‌کند چه اپیزودها ضبط شده باشند و چه تولید شده باشند.
داده‌های مصنوعیشبیه‌سازی به واقعیتIsaac Labیادگیری تقلیدیMimicGenSO-101

داده‌های مصنوعی برای سیاست‌های ربات: جایی که شبیه‌سازی کمک می‌کند

AY-Robots ResearchAugust 23, 202631 min مطالعه

شبیه‌سازی می‌تواند تعداد کمی از نمایش‌ها را به هزاران مورد تکثیر کند. در اینجا چیزی است که اعداد منتشر شده واقعاً می‌گویند، جایی که شکاف شبیه‌سازی به واقعیت مشکل‌ساز می‌شود، و چه چیزی هنوز باید ضبط شود.

هر چند ماه یک بار کسی متوجه می‌شود که ضبط پنجاه اپیزود به صورت دستی کند است و می‌پرسد که آیا یک شبیه‌ساز می‌تواند به جای آن، آن‌ها را تولید کند. این یک سوال منصفانه است. پاسخ صادقانه سه بخش دارد: داده‌های تولید شده کمک می‌کنند، جایگزین ضبط‌های واقعی نمی‌شوند، و نسبت بین این دو واقعیت کاملاً به نوع داده‌های مصنوعی که منظور شماست بستگی دارد.

این صفحه به بررسی آنچه که کارهای منتشر شده واقعاً اندازه‌گیری کرده‌اند، آنچه که امروز می‌توانید روی یک بازوی کم‌هزینه مانند SO-100، اجرا کنید، و جایی که شکاف شبیه‌سازی به واقعیت (sim-to-real gap) دستاوردها را از بین می‌برد، می‌پردازد. نسخه کوتاه، قبل از جزئیات: سیستم‌هایی که بزرگترین ضرایب را گزارش می‌کنند، مجموعه کوچکی از نمایش‌های واقعی انسانی را تکثیر می‌کنند. آن‌ها نیاز به این نمایش‌ها را از بین نمی‌برند.

آنچه باید بدانید

  • چهار تکنیک نامرتبط در دستکاری رباتیک، داده‌های مصنوعی نامیده می‌شوند: تکثیر مسیر (trajectory multiplication)، رول‌اوت‌های فیزیکی (physics rollouts)، مدل‌های جهانی ویدیویی (video world models)، و افزایش فضای تصویر (image-space augmentation). آن‌ها به روش‌های مختلفی شکست می‌خورند و ارزش‌های متفاوتی دارند.
  • MimicGen کمتر از 200 نمایش انسانی را به بیش از 50,000 نمایش تولید شده در 18 وظیفه تبدیل کرد. در وظیفه Square D0 خود، 200 نمایش تولید شده از 10 نمایش انسانی، 79 درصد موفقیت در مقابل 84 درصد برای 200 نمایش واقعی انسانی به دست آورد.
  • RoboCasa نمونه متقابل است: 72,000 نمایش تولید شده 47.6 درصد امتیاز کسب کردند در مقابل 28.8 درصد برای 1,250 نمایش انسانی. این یک مزیت حجمی 58 برابری است، نه یک برد برابر.
  • مطالعه هم‌آموزی شبیه‌سازی و واقعیت (sim-and-real co-training) بهبود متوسط 38 درصدی در عملکرد وظایف دنیای واقعی را گزارش می‌کند. دستورالعمل، هم‌آموزی بر روی یک ترکیب است، نه انتقال فقط از شبیه‌سازی.
  • GR00T N1 بر روی 780,000 مسیر شبیه‌سازی (معادل 6,500 ساعت، تولید شده در 11 ساعت) و 827 ساعت مسیر عصبی که از 88 ساعت واقعی رشد کرده‌اند، استوار است. آن 88 ساعت واقعی هنوز قله هرم هستند.
  • برای یک SO-101، امروز یک خط لوله باز و کارآمد وجود دارد: LeIsaac در داخل Isaac Lab، تله‌اپراتوری با بازوی فیزیکی رهبر، تکثیر با Isaac Lab Mimic، خروجی به فرمت LeRobot، تنظیم دقیق GR00T.
  • AY-Robots داده‌های مصنوعی تولید نمی‌کند. این ربات بر روی مجموعه داده LeRobot که به آن می‌دهید، آموزش می‌بیند، به هر روشی که آن مجموعه داده تولید شده باشد، و مربیان بسته به مدل به حداقل 30 تا 50 اپیزود نیاز دارند.

چهار چیز متفاوت که داده‌های مصنوعی نامیده می‌شوند

قبل از مقایسه اعداد، ارزش آن را دارد که خانواده‌ها را از هم جدا کنیم، زیرا مقاله‌ای که ضریب 100x را گزارش می‌کند و مقاله‌ای که 5 امتیاز افزایش موفقیت را گزارش می‌کند، اغلب یک خط لوله را از زوایای مختلف توصیف می‌کنند. وجه مشترک این است که چیزی در LeRobot dataset، توسط یک ماشین تولید شده است تا اینکه از یک بازوی فیزیکی ضبط شده باشد. آنچه متفاوت است، کدام بخش است.

خانوادهچه چیزی واقعی می‌ماندچه چیزی تولید می‌شودضریب گزارش‌شدهحالت اصلی شکست
تکثیر مسیر (MimicGen, DexMimicGen, Isaac Lab Mimic)تعداد کمی دمو انسانی، مش‌های شیء، موتور فیزیکمسیرهای جدید سازگار شده با ژست‌های جدید شیء و چیدمان صحنه10 دمو انسانی به 1,000 در هر توزیع بازنشانی؛ 60 به 21,000؛ کمتر از 200 به بیش از 50,000تلاش‌های تولید شکست می‌خورند. Isaac Lab نرخ موفقیت کاندید را در موارد ساده تا 70 درصد و در موارد دشوار کمتر از 1 درصد اعلام می‌کند
اجراهای فیزیکی در شبیه‌ساز وظیفه (Isaac Lab, robosuite, RoboCasa)موتور فیزیک و کتابخانه داراییاپیزودهای کامل، هدایت شده توسط کنترل‌کننده‌های اسکریپت‌نویسی شده، برنامه‌ریزان یا RLفقط توسط ساعات GPU محدود می‌شودبازوی شبیه‌سازی شده بازوی شما نیست. دینامیک تماس و سروو تقریبی هستند
مدل‌های جهانی ویدئویی (DreamGen, Cosmos Transfer)چند اپیزود تله‌اپریشن واقعی که به عنوان شرط‌گذاری استفاده می‌شوندویدئوی فوتورئالیستی از رفتارهای جدید، به علاوه شبه‌اقدامات بازیابی شده پس از آن88 ساعت تا 827 ساعت در GR00T N1، حدود 10xاقدامات استنباط می‌شوند، نه اندازه‌گیری. یک ویدئوی باورپذیر می‌تواند یک اقدام غیرباورپذیر را حمل کند
افزایش فضای تصویر (برش تصادفی، لرزش رنگ)همه چیز به جز پیکسل‌هانماهای مختل شده از اپیزودهایی که از قبل دارید1x، هیچ مسیر جدیدی ایجاد نمی‌کندافزایش هندسی ارتباط بین تصویر و برچسب عمل را قطع می‌کند

فقط سه مورد اول داده‌های مصنوعی به معنایی هستند که این مقاله در نظر دارد. مورد چهارم ارزش ذکر کردن را دارد زیرا در همان گفتگو گنجانده می‌شود و تا حد زیادی ارزان‌ترین مورد در لیست است. اگر هنوز افزونه‌هایی را که مربی شما با آن عرضه می‌شود، فعال نکرده‌اید، قبل از نصب شبیه‌ساز این کار را انجام دهید.

می‌توانید داده‌های مصنوعی واقعی را قبل از تولید هر چیزی مشاهده کنید

NVIDIA مسیرهای شبیه‌سازی شده مورد استفاده برای GR00T N1 پس از آموزش را به عنوان nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim در Hugging Face، حدود 1.87 ترابایت تحت مجوز cc-by-4.0 منتشر کرد. این مجموعه به 9,000 مسیر دو دستی Panda و GR1 با تجسم متقاطع، 240,000 مسیر رومیزی انسان‌نما، 72,000 مسیر آشپزخانه تک-Panda و 102 مسیر دستکاری-حرکتی Unitree G1 تقسیم می‌شود. دانلود یک زیرمجموعه با huggingface-cli download --include "gr1_arms_only.CanSort/**" و تماشای چند اپیزود سریع‌ترین راه برای کالیبره کردن ظاهر مسیرهای تولید شده است و هیچ هزینه‌ای جز پهنای باند ندارد.

آنچه اعداد منتشر شده واقعاً می‌گویند

اینجا پایگاه شواهد است، با اعدادی که منابع بیان کرده‌اند، نه آنطور که بیانیه‌های مطبوعاتی خلاصه کرده‌اند. هر ردیف زیر از یک مقاله یا صفحه پروژه که در 23 آگوست 2026 خوانده شده، آمده است.

سیستمورودیتولید شدهنتیجه گزارش شده
MimicGen, CoRL 2023کمتر از 200 دمو انسانی؛ 10 دمو انسانی در رقابت مستقیمبیش از 50,000 دمو، 18 وظیفه، چهار بازو (Panda, Sawyer, IIWA, UR5e)Square D0: 79 درصد از 200 دموی تولید شده از 10 دموی انسانی، در مقابل 84 درصد از 200 دموی انسانی
DexMimicGen, 202460 دموی انسانی منبع21,000 دمو برای ربات‌های ماهر دو دستیوظایف ماهرانه دو دستی در شبیه‌سازی، به علاوه استقرار مرتب‌سازی قوطی انسان‌نما از واقعیت به شبیه‌سازی به واقعیت
RoboCasa, 20241,250 دموی انسانی (50 دمو برای هر وظیفه در 25 وظیفه اتمی)، 100 وظیفه ارزیابی، بیش از 150 دسته شیء100,000 مسیر MimicGen؛ زیرمجموعه 72,000 دمویی مقایسه اصلی را هدایت می‌کند28.8 درصد کلی در مجموعه انسانی در مقابل 47.6 درصد در مجموعه کاملاً تولید شده، ارزیابی شده فقط بر روی نمونه‌های شیء دیده نشده
Sim-and-real co-training, 2025دموهای واقعی به علاوه مجموعه داده‌های شبیه‌سازی، دو حوزه (بازوی ربات و انسان‌نما)یک ترکیب، نه یک جایگزینداده‌های شبیه‌سازی عملکرد وظایف دنیای واقعی را به طور متوسط 38 درصد بهبود بخشید
DreamGen, 2025داده‌های تله‌اپریشن از یک وظیفه برداشت و قرار دادن در یک محیطویدیوی مصنوعی به علاوه شبه‌اقدامات از یک مدل عمل نهفته یا یک مدل دینامیک معکوس22 رفتار جدید بر روی یک انسان‌نما، در محیط‌های دیده شده و دیده نشده
GR00T N1 data pyramid, 202588 ساعت تله‌اپریشن داخلی GR-1827 ساعت مسیرهای عصبی (حدود 10 برابر)؛ 780,000 مسیر شبیه‌سازی، معادل 6,500 ساعت، تولید شده در 11 ساعتمسیرهای عصبی 4.2، 8.8 و 6.8 امتیاز به RoboCasa در رژیم‌های 30، 100 و 300 دمو در هر وظیفه، و به طور متوسط 5.8 امتیاز در 8 وظیفه واقعی GR-1 اضافه کردند
ضریب‌ها را به عنوان تعداد مسیرها بخوانید، نه قابلیت

یک ضریب، تعداد ردیف است. رقابت مستقیم MimicGen داده‌های تولید شده را کمی پایین‌تر از همان تعداد داده‌های انسانی (79 در مقابل 84 درصد) قرار می‌دهد، و حذف GR00T N1 امتیازات درصدی تک رقمی را به مدلی اضافه می‌کند که قبلاً ساعات واقعی را داشت. RoboCasa داده‌های انسانی را شکست می‌دهد، 47.6 در مقابل 28.8 درصد، اما با 72,000 دموی تولید شده در مقابل 1,250 دموی انسانی. حجم، پوشش می‌خرد. اطلاعاتی را که دموهای شما هرگز شامل نمی‌شدند، نمی‌خرد.

الگوی هر حذف صادقانه یکسان است. داده‌های مصنوعی پوشش را با هزینه کم گسترش می‌دهند. این اطلاعاتی در مورد گریپر، افت سروو، نورپردازی یا ارتفاع میز شما که قبلاً در جایی در نمایش‌های واقعی وجود نداشته، ایجاد نمی‌کند. اگر سیاست شما شکست می‌خورد زیرا اند افکتور نیم ثانیه دیرتر بسته می‌شود، هیچ مقدار از تغییرات شبیه‌سازی شده آن را رفع نمی‌کند. این یک مشکل زمان‌بندی گریپر در ضبط‌های واقعی است.

یک یافته MimicGen ارزش دارد که در جلسات ضبط خود به کار ببرید، زیرا برخلاف توصیه‌های معمول است. این پروژه دو مجموعه داده را روی Square D2 تولید کرد، یکی با 10 دمو از یک اپراتور انسانی با کیفیت بهتر و دیگری با 10 دمو از یک اپراتور با کیفیت بدتر، که هر دو از مجموعه داده robomimic multi-human Square گرفته شده بودند. سیاست‌های آموزش‌دیده بر روی هر یک نتایج قابل مقایسه‌ای به دست آوردند، که نویسندگان آن را نشانه‌ای از این می‌دانند که در رژیم داده‌های در مقیاس بزرگ، کیفیت داده ممکن است چندان اهمیت نداشته باشد. با دقت بخوانید، این یک بیانیه در مورد ده دمو اولیه است، نه در مورد پنجاه اپیزود واقعی شما. این بدان معناست که یک مجموعه اولیه کمی نامرتب، چیزی نیست که بین شما و یک مجموعه داده تولید شده قابل استفاده قرار گیرد. این بدان معنا نیست که اپیزودهای واقعی که با آنها هم‌آموزش می‌دهید می‌توانند نامرتب باشند، زیرا آنها حامل اطلاعاتی هستند که شبیه‌ساز ندارد.

فهرست دایرکتوری عمومی مجموعه داده AY-Robots که مجموعه داده‌های ضبط شده LeRobot را با تعداد اپیزودهایشان نشان می‌دهد.
دایرکتوری عمومی مجموعه داده در /directory. هر ورودی در اینجا اپیزودهای واقعی ضبط شده است. داده‌های مصنوعی یک ضریب افزایشی بر روی چیزی شبیه به این هستند، نه جایگزینی برای آن.

شکاف شبیه‌سازی به واقعیت، به طور مشخص

شکاف معمولاً به عنوان یک کمیت واحد مورد بحث قرار می‌گیرد که مفید نیست. این شکاف حداقل شامل پنج عدم تطابق جداگانه است و اندازه آنها در یک بازوی سرگرمی 110 تا 150 EUR با آنچه در یک فرانکای صنعتی وجود دارد، متفاوت است.

  • تماس و اصطکاک. Isaac Lab به صراحت بیان می‌کند که با داشتن سخت‌افزار یکسان و نسخه یکسان Isaac Sim و PhysX، شبیه‌سازی قابل تکرار است، اما نتایج به دلیل دقت ممیز شناور و خطاهای گرد کردن در پیکربندی‌های سخت‌افزاری مختلف متفاوت است و PhysX برای هیچ صحنه‌ای با اجسام غیرصلب مانند پارچه یا اجسام نرم، قطعیت را تضمین نمی‌کند.
  • عملگر. یک سروو باس Feetech STS3215 که با ولتاژ 7.4 V کار می‌کند، تحت بار افت می‌کند، دارای لقی است و با گرم شدن تغییر رفتار می‌دهد. مدل MJCF برای SO-101 پارامترهای موتور خود را از یک پروژه نامرتبط قرض می‌گیرد به جای اینکه آنها را روی بازوی شما شناسایی کند.
  • رندرینگ. نویز دوربین، شاتر غلتان، نوردهی خودکار و رنگ دقیق میز شما در رندر وجود ندارد. این نیمی از شکافی است که Cosmos-Transfer1 برای بستن آن ساخته شده است: گردش کار تقویت رباتیک آن، یک مثال مصنوعی رباتیک را به چندین مثال واقعی از طریق شرطی‌سازی بخش‌بندی، عمق یا لبه نگاشت می‌کند.
  • زمان‌بندی. یک شبیه‌ساز با نرخ ثابت گام برمی‌دارد. یک حلقه کنترل واقعی این کار را نمی‌کند و خود مدل بسته به اینکه کدام را انتخاب کرده‌اید، 20 تا 485 ms در هر گام عملیاتی هزینه دارد. به تأخیر استنتاج مراجعه کنید.
  • آمار اشیاء. صحنه‌های شبیه‌سازی شده از توزیعی نمونه‌برداری می‌شوند که کسی آن را نوشته است. میز آشپزخانه شما اینگونه نیست.

آنچه یک SO-100 شبیه‌سازی شده واقعاً درباره بازوی شما می‌داند

این بخشی است که تعیین می‌کند آیا هیچ یک از موارد فوق ارزش آخر هفته شما را دارد یا خیر، و اولین شگفتی این است که SO-100 و SO-101 به طور یکسان پشتیبانی نمی‌شوند. مخزن SO-ARM100 از TheRobotStudio دارایی‌های شبیه‌سازی خود را تحت Simulation/. پوشه SO100 حاوی یک فایل URDF و هیچ چیز دیگری نیست. پوشه SO101 حاوی هر دو فایل URDF و MuJoCo است: scene.xml, so101_new_calib.xml, so101_old_calib.xml, URDFهای منطبق و یک joints_properties.xml. اگر به جای یک زنجیره کینماتیک، یک مدل فیزیکی می‌خواهید، فایل‌های SO-101 را می‌خواهید.

آنها با استفاده از پلاگین onshape-to-robot از یک مدل CAD طراحی شده در Onshape تولید شده‌اند، به این معنی که کینماتیک و مش‌های بصری به خوبی CAD هستند. دینامیک داستان متفاوتی است، و فایل README خود مخزن در مورد سه چیز صریح است. مش‌های برخورد پایه به دلیل رفتار برخورد مشکل‌ساز در طول شبیه‌سازی و برنامه‌ریزی حذف شدند. ویژگی‌های موتور STS3215 از پروژه Open Duck Mini اقتباس شده‌اند تا اینکه روی یک SO-101 اندازه‌گیری شده باشند. و قرارداد گریپر LeRobot، که در آن 0 کاملاً بسته و 100 کاملاً باز است، هنوز به صراحت در فایل‌های URDF و MuJoCo منعکس نشده است. هر یک از این موارد جایی است که یک سیاست که صرفاً در آن مدل آموزش دیده است، روی میز شما متفاوت عمل خواهد کرد.

قرارداد کالیبراسیون که یک روز را هدر می‌دهد

در فایل‌های MuJoCo ارائه شده، دو قرارداد صفر وجود دارد، و scene.xml با انتخاب فایل ربات مورد نظر، بین آنها یکی را برمی‌گزیند. در so101_new_calib.xml، که پیش‌فرض است، صفر مجازی هر مفصل در وسط محدوده مفصل آن قرار دارد. در so101_old_calib.xml صفر، پیکربندی است که ربات به طور کامل افقی کشیده شده است. اگر اپیزودهای شبیه‌سازی شده شما از یک قرارداد و اپیزودهای واقعی ضبط شده شما از دیگری استفاده کنند، هر زاویه مفصل در مجموعه داده ترکیبی ده‌ها درجه جابجا می‌شود، خطا همچنان کاهش می‌یابد، و سیاست با اطمینان کاری اشتباه انجام می‌دهد. قبل از آموزش مشترک، قرارداد را در هر دو طرف بررسی کنید، و ابتدا کالیبراسیون و کاهش خطا، سیاست هیچ کاری نمی‌کند را بخوانید.

تصادفی‌سازی دامنه، و آنچه که آن را برطرف نمی‌کند

پاسخ استاندارد به این شکاف این است که از تلاش برای تطبیق با واقعیت دست برداریم و در عوض روی توزیعی به اندازه کافی گسترده آموزش دهیم که واقعیت در آن قرار گیرد. توبین و همکارانش نسخه قوی این را در 2017 نشان دادند: یک آشکارساز شیء که فقط روی تصاویر شبیه‌سازی شده با بافت‌های تصادفی غیرواقعی آموزش دیده بود، بدون هیچ پیش‌آموزشی روی تصاویر واقعی، اشیاء واقعی را با دقت 1.5 سانتی‌متر محلی‌سازی کرد و در برابر عوامل حواس‌پرتی و انسدادهای جزئی مقاوم ماند.

آیزاک لب همان ایده‌ای را ارائه می‌دهد که شما به عنوان اصطلاحات رویداد به پیکربندی محیط متصل می‌کنید. این‌ها همان اهرم‌ها هستند، با نام‌های واقعی توابعشان در isaaclab.envs.mdp، تا بتوانید آن‌ها را بخوانید به جای اینکه حدس بزنید.

تابع رویدادچه چیزی را مختل می‌کند
randomize_rigid_body_materialاصطکاک تماسی و بازگشت‌پذیری
randomize_rigid_body_mass, randomize_rigid_body_comجرم شیء و پیوند، آفست‌های مرکز جرم
randomize_actuator_gainsسفتی و میرایی کنترل‌کننده مفصل
randomize_joint_parameters, randomize_fixed_tendon_parametersاصطکاک مفصل، آرمیچر و محدودیت‌ها
randomize_visual_texture_material, randomize_visual_colorظاهر، نیمه فوتومتریک شکاف
randomize_physics_scene_gravityبردار گرانش
apply_external_force_torque, push_by_setting_velocityاختلالات زمان اجرا
reset_root_state_uniform, reset_joints_by_offsetگسترش حالت اولیه در هر بار بازنشانی اپیزود

اینجا محدودیت است، و این همان چیزی است که مردم در آن دچار مشکل می‌شوند. تصادفی‌سازی توزیعی را که سیاست در مدل ساخته شده توسط شما دیده است، گسترش می‌دهد. این نمی‌تواند یک اثر فیزیکی را معرفی کند که شبیه‌ساز آن را نمایش نمی‌دهد. اگر PhysX پس‌زدگی و افت حرارتی سرووهای STS3215 شما را مدل‌سازی نمی‌کند، تصادفی‌سازی سفتی آن‌ها هیچ چیز در مورد پس‌زدگی به سیاست نمی‌آموزد. به همین دلیل است که بازویی که لرزش دارد و سپس افت می‌کند تحت یک سیاست آموزش‌دیده در شبیه‌ساز، مشکل بودجه تصادفی‌سازی نیست. این یک مشکل مدل‌سازی است.

مسیر دستی: تولید داده در آیزاک لب

Isaac Gym یک نرم‌افزار قدیمی است. صفحه خود NVIDIA با عنوان "Isaac Gym - اکنون منسوخ شده است" اعلام می‌کند که توسعه‌دهندگان می‌توانند آن را دانلود کرده و به استفاده از آن ادامه دهند، اما دیگر پشتیبانی نمی‌شود و به جای آن به Isaac Lab اشاره می‌کند. اگر به تاریخچه آن علاقه دارید، ما هر دو را پوشش داده‌ایم: و . برای کارهای جدید در سال 2026، از Isaac Lab شروع کنید.

  1. 1
    نصب Isaac Sim و Isaac Lab

    صفحه نصب pip بیان می‌کند که دستورالعمل‌ها برای Isaac Sim 5.X هستند که به Python 3.11 نیاز دارد. کلون کردن سورس، اسکریپت‌های مورد نیاز برای مراحل بعدی را در اختیار شما قرار می‌دهد.

    bash
    pip install "isaacsim[all,extscache]==5.1.0" \
        --extra-index-url https://pypi.nvidia.com
    
    git clone https://github.com/isaac-sim/IsaacLab.git --branch main
    cd IsaacLab
    sudo apt install cmake build-essential
    ./isaaclab.sh --install
    
    # smoke test
    ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py
  2. 2
    ضبط حدود ده نمایش انسانی

    مستندات Isaac Lab دقیق است: حدود 10 نمایش موفق برای موفقیت مراحل بعدی لازم است. نکات آن نیز به همان اندازه دقیق هستند. نمایش‌ها را کوتاه نگه دارید، مسیری مستقیم را طی کنید به جای حرکت در امتداد محورهای دلخواه، و مکث نکنید، زیرا برای یک سیاست مشخص نیست که چرا و چه زمانی باید مکث کند.

    bash
    ./isaaclab.sh -p scripts/tools/record_demos.py \
        --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \
        --device cpu \
        --teleop_device spacemouse \
        --dataset_file ./datasets/dataset.hdf5 \
        --num_demos 10
  3. 3
    حاشیه‌نویسی مرزهای زیروظایف

    Mimic نمایش‌های ورودی را به زیروظایف تقسیم می‌کند تا بتواند زمان‌بندی و هدف‌گذاری مجدد بخش‌ها را انجام دهد. پرچم --auto این کار را بدون دخالت انسان برای وظایفی که حاشیه‌نویسی خودکار را تعریف می‌کنند، انجام می‌دهد؛ بدون آن، با B مکث می‌کنید، با N ادامه می‌دهید و با S یک مرز را علامت‌گذاری می‌کنید. توجه داشته باشید که شناسه وظیفه یک پسوند -Mimic می‌گیرد.

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \
        --device cpu \
        --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \
        --auto \
        --input_file ./datasets/dataset.hdf5 \
        --output_file ./datasets/annotated_dataset.hdf5
  4. 4
    تولید مجموعه داده ضرب شده

    این مرحله‌ای است که 10 را به 1000 تبدیل می‌کند. Mimic یک معیار موفقیت بولی را برای هر کاندید اعمال می‌کند و فقط آنهایی را نگه می‌دارد که وظیفه را تکمیل کرده‌اند، بنابراین تعداد خروجی کمتر از تعداد تلاش‌ها است. مستندات نرخ موفقیت کاندید را در موارد ساده تا 70 درصد و برای وظایف دشوار و ربات‌های پیچیده کمتر از 1 درصد ذکر می‌کند: حدود 50 درصد برای چیدن مکعب Franka، و 65 تا 80 درصد برای GR1T2 pick and place، جایی که 1000 دمو 18 تا 40 دقیقه طول می‌کشد (19 دقیقه روی یک RTX ADA 6000 با 80 درصد).

    bash
    ./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \
        --device cpu \
        --num_envs 10 \
        --generation_num_trials 1000 \
        --headless \
        --input_file ./datasets/annotated_dataset.hdf5 \
        --output_file ./datasets/generated_dataset.hdf5
  5. 5
    تبدیل HDF5 به مجموعه داده LeRobot

    تمام موارد بالا HDF5 با طعم robomimic تولید می‌کنند، و هسته Isaac Lab هیچ مبدل LeRobot خاص خود را ارائه نمی‌دهد: مستندات آن فقط می‌گوید که می‌توانید مجموعه داده تولید شده را به فرمت LeRobot تبدیل کنید. دو پروژه مبدل واقعی را ارائه می‌دهند. IsaacLab-Arena یک مبدل هدفمند GR00T را ارائه می‌دهد که کاملاً توسط یک پیکربندی YAML هدایت می‌شود، و LeIsaac جفت خود را برای مسیر SO-101 (به پایین مراجعه کنید) ارائه می‌دهد.

    bash
    # IsaacLab-Arena, GR00T LeRobot format
    python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \
        --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
نسخه‌های خود را پین کنید و به main اعتماد نکنید

در 23 آگوست 2026، مستندات Isaac Lab برای main دارای نشان Isaac Sim 6.0.1 است و نسخه‌های release/3.0.0 و v3.0.0-beta2 را در سوئیچر نسخه خود در کنار v2.3.2 ارائه می‌دهد، در حالی که صفحه نصب pip در همان درخت همچنان isaacsim[all,extscache]==5.1.0 را پین می‌کند و دستورالعمل‌ها را برای Isaac Sim 5.X توصیف می‌کند. کانتینر طرح اولیه synthetic-manipulation-motion-generation NVIDIA دوباره قدیمی‌تر است: Isaac Lab 2.0.2 روی Isaac Sim 4.5.0. جدول سازگاری LeIsaac، Isaac Sim 5.1 را با Isaac Lab v2.3.0 جفت می‌کند. این درختان سریع‌تر از آنکه مستندات هماهنگ شوند، حرکت می‌کنند. یک نسخه را انتخاب کنید، آن را یادداشت کنید، و انتظار داشته باشید که مسیرهای اسکریپت و نام پرچم‌ها جابجا شده باشند اگر یک آموزش سه ماه پیش را دنبال می‌کنید.

چرا تلاش‌های تولید شکست می‌خورند و چه چیزی را باید تغییر داد

نرخ موفقیت کاندیدا که بین ۷۰ درصد و کمتر از ۱ درصد در نوسان است، یک راز نیست، و Isaac Lab به جای اینکه شما را به حدس زدن وا دارد، مشکلات رایج را مستند می‌کند. هر یک از این موارد چیزی است که شما در زمان ضبط کنترل می‌کنید، به همین دلیل ارزش دارد که این لیست را قبل از ضبط ده نمایش اولیه (seed demonstrations) بخوانید، نه پس از اولین اجرای تولید ناامیدکننده.

  • نمایش‌ها بیش از حد طولانی هستند. افق زمانی طولانی‌تر برای یک سیاست (policy) دشوارتر است تا یاد بگیرد. نزدیک به اولین شیء شروع کنید و حرکت را به حداقل برسانید.
  • نمایش‌ها روان نیستند. حرکت نامنظم برای یک سیاست دشوار است تا رمزگشایی کند، و سخت‌افزار تله‌اپریشن بهتر، داده‌های بهتری ارائه می‌دهد: مستندات به صراحت می‌گویند که یک SpaceMouse از یک صفحه‌کلید بهتر است.
  • مکث‌ها. مکث‌ها برای یادگیری دشوار هستند، زیرا برای یک سیاست مشخص نیست که چرا و چه زمانی باید مکث کند. حرکت را روان نگه دارید.
  • زیروظایف بیش از حد. زیروظایف بیشتر به معنای اتصال بیشتر بین بخش‌های مسیر است که منجر به حرکت کمتر روان و نرخ موفقیت تولید پایین‌تر می‌شود. مرزهایی را که بازو بعید است با چیزی برخورد کند، حاشیه‌نویسی کنید.
  • عدم وجود نویز عمل. نویز عمل، سیاست‌های حاصل را مقاوم‌تر می‌کند.
  • ضبط بیش از حد فشرده. اگر ضبط دقیقاً در فریمی که شرط موفقیت فعال می‌شود متوقف شود، ممکن است در طول بازپخش دوباره فعال نشود. یک بافر در انتها بگذارید.
  • بازپخش غیرقطعی. فیزیک در Isaac Lab در طول env.reset به طور قطعی قابل بازتولید نیست، بنابراین برخی از دموهای انسانی در بازپخش شکست می‌خورند. بیش از آنچه نیاز دارید جمع‌آوری کنید و آنهایی را که از حاشیه‌نویسی جان سالم به در می‌برند، نگه دارید. هر چیزی که در یک فایل HDF5 تولید شده توسط Mimic قرار می‌گیرد، یک دموی موفق است و می‌تواند برای آموزش استفاده شود، حتی اگر بازپخش بعداً شکست بخورد.

گام درون‌یابی بین بخش‌های زیروظیفه متصل شده، اهرم تنظیم خاص خود را دارد، و تعداد گام‌های درون‌یابی که نیاز دارید با سرعت حرکت ربات و وسعت توزیع بازنشانی شیء متناسب است. یک وظیفه پیچیده با توزیع بازنشانی بزرگ، شکاف‌های بزرگ‌تری بین بخش‌ها ایجاد می‌کند که برای تبدیل شدن به حرکت پیوسته، به گام‌های درون‌یابی بیشتری نیاز دارد. اگر ویدئوهای تولید شده شما بازو را در حال حرکت ناگهانی بین فازها نشان می‌دهند، این پارامتری است که باید قبل از سرزنش دموهای اولیه به آن نگاه کنید.

همان پایپ‌لاین روی یک SO-101، با بازوی رهبر واقعی

این مورد برای هر کسی که این صفحه را می‌خواند جالب است، زیرا تنها پایپ‌لاین باز است که یک را در داخل Isaac Lab قرار می‌دهد و به شما امکان می‌دهد آن را با بازوی فیزیکی رهبر که از قبل دارید، کنترل کنید. LeIsaac، نسخه 0.4.0 در زمان نگارش این مطلب، زمین بازی رسمی شبیه‌سازی یادگیری تقلیدی است که در EnvHub شرکت LeRobot ادغام شده است. جدول سازگاری آن سه ترکیب کاری را فهرست می‌کند؛ جدیدترین ترکیب، Isaac Sim 5.1 را با Isaac Lab v2.3.0، CUDA 12.8، PyTorch 2.7.0 و Python 3.11 جفت می‌کند، و مستندات Isaac Sim 5.0 یا جدیدتر را برای کارت‌های سری 50 توصیه می‌کنند.

bash
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
  --index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0
LeIsaac از سورس. محدودیت نسخه numpy در دستورالعمل‌های رسمی است، نه یک راه‌حل موقت.

با این تنظیمات، بازوی رهبر روی /dev/ttyACM0، دنبال‌کننده شبیه‌سازی شده را هدایت می‌کند و مستقیماً در HDF5 ضبط می‌کند. حلقه همان چیزی است که از ضبط واقعی می‌شناسید، با این تفاوت که دنبال‌کننده یک جسم صلب در PhysX است.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 \
    --device=cuda \
    --enable_cameras \
    --record \
    --dataset_file=./datasets/dataset.hdf5
شناسه محیطتوضیحات وظیفهربات
LeIsaac-SO101-PickOrange-v0سه پرتقال را برداشته و در بشقاب قرار دهید، سپس بازو را به حالت استراحت بازگردانید.Single-arm SO101 follower
LeIsaac-SO101-LiftCube-v0مکعب قرمز را بلند کنید.Single-arm SO101 follower
LeIsaac-SO101-CleanToyTable-v0دو شیء حرف e را در جعبه قرار دهید، سپس بازو را به حالت استراحت بازگردانید.Single-arm SO101 follower
LeIsaac-SO101-CleanToyTable-BiArm-v0همین وظیفه با دو بازو.Bi-arm SO101 follower
LeIsaac-SO101-FoldCloth-BiArm-v0پارچه را تا کنید، سپس بازو را به حالت استراحت بازگردانید. فقط نوع DirectEnv از check_success پشتیبانی می‌کند.Bi-arm SO101 follower
LeIsaac-LeKiwi-CleanupTrash-v0زباله‌های دستمال کاغذی را از روی زمین برداشته و در سطل زباله بیندازید.LeKiwi

اکثر این شناسه‌ها به صورت -Direct-v0 نیز وجود دارند، و python scripts/environments/list_envs.py لیست فعلی را چاپ می‌کند. همچنین می‌توانید به طور کامل از مسیر HDF5 صرف نظر کرده و فرمت LeRobot را در طول تله‌اپریشن با افزودن سه پرچم بنویسید. دو نکته از خود مستندات ناشی می‌شود: ضبط‌کننده به طور خودکار ۵ فریم اول هر اپیزود را برای جلوگیری از بی‌ثباتی ناشی از حالت‌های اولیه رد می‌کند، و ممکن است باعث تأخیرهای جزئی در تله‌اپریشن شود، که دقیقاً از آن دسته مواردی است که به آرامی ماهیت نمایش‌های شما را تغییر می‌دهد. همچنین فقط اپیزودهایی را که وظیفه موفقیت‌آمیز علامت‌گذاری کرده است، ذخیره می‌کند.

bash
python scripts/environments/teleoperation/teleop_se3_agent.py \
    --task=LeIsaac-SO101-PickOrange-v0 \
    --teleop_device=so101leader \
    --port=/dev/ttyACM0 \
    --num_envs=1 --device=cuda --enable_cameras --record \
    --use_lerobot_recorder \
    --lerobot_dataset_repo_id=<your-user>/<dataset-name> \
    --lerobot_dataset_fps=30

مرحله ضرب سپس بر روی آن ضبط‌ها اجرا می‌شود. LeIsaac، Isaac Lab Mimic را در چهار دستور می‌پیچد، زیرا Mimic مسیرها را از وضعیت‌های اثرگذار نهایی و اشیاء تعمیم می‌دهد: تبدیل اقدامات فضای مفصلی به اقدامات مبتنی بر IK، حاشیه‌نویسی، تولید، سپس تبدیل مجدد به فضای مفصلی.

bash
python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --to_ik --headless

python scripts/mimic/annotate_demos.py --device cuda \
  --task LeIsaac-SO101-LiftCube-Mimic-v0 \
  --input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/generate_dataset.py --device cuda \
  --num_envs 1 --generation_num_trials 10 \
  --input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --enable_cameras

python scripts/mimic/eef_action_process.py \
  --input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
  --output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
  --to_joint --headless

سپس به LeRobot تبدیل کنید. این مرحله‌ای است که قانون فرمت پلتفرم مشکل‌ساز می‌شود، و LeIsaac دقیقاً دو مبدل مورد نیاز شما را ارائه می‌دهد: isaaclab2lerobot.py LeRobot v2 را می‌نویسد، که همان چیزی است که لودرهای GR00T استفاده می‌کنند، و isaaclab2lerobotv3.py v3 را برای Pi0.5، SmolVLA و ACT. این دو اسکریپت آرگومان‌های یکسانی می‌گیرند اما نسخه‌های مختلفی از lerobot را مشخص می‌کنند، و فقط اپیزودهای موفق تبدیل می‌شوند.

bash
pip install lerobot==0.3.3
pip install numpy==1.26.0

python scripts/convert/isaaclab2lerobot.py \
    --task_name=LeIsaac-SO101-PickOrange-v0 \
    --repo_id=<your-user>/so101_pick_orange_sim \
    --hdf5_root=./datasets \
    --hdf5_files=dataset.hdf5
خروجی LeRobot v2 برای GR00T. برای آموزش‌دهنده‌های v3، از isaaclab2lerobotv3.py با lerobot 0.4.2 استفاده کنید.
راه فرار بدون GPU وجود دارد

LeIsaac اجرای کل پشته را بر روی NVIDIA Brev مستند می‌کند: استقرار، کلیک بر روی لینک پورت 80 برای باز کردن یک VS Code Server مبتنی بر مرورگر، و اجرای چهار سناریوی از پیش نصب شده با --kit_args="--no-window --enable omni.kit.livestream.webrtc"، با مشاهده رندر در همان آدرس با /viewer اضافه شده. اگر کارت ورک‌استیشن زیر میز خود ندارید، این یک راه ارزان‌تر برای فهمیدن این است که آیا نسخه شبیه‌سازی شده وظیفه شما حتی نزدیک به واقعیت است یا خیر، قبل از اینکه سخت‌افزار را به آن اختصاص دهید.

دو مسیر برای یک سیاست آموزش‌دیده

شما صحنه را می‌سازید، داده‌ها را تولید می‌کنید، GPU را اجاره می‌کنید و سرویس‌دهی را خودتان راه‌اندازی می‌کنید. این انتخاب درستی است اگر وظیفه به تغییرات محیطی نیاز دارد که نمی‌توانید به صورت فیزیکی آن را صحنه‌سازی کنید، یا اگر ارزیابی تکرارپذیر می‌خواهید.

  1. Isaac Sim 5.1 و Isaac Lab را نصب کنید، یا اگر ربات شما SO-101 است، پشته LeIsaac را نصب کنید.
  2. صحنه را مدل‌سازی یا وارد کنید. این مرحله‌ای است که هیچ‌کس برای آن بودجه‌ای در نظر نمی‌گیرد و معمولاً طولانی‌ترین مرحله است.
  3. تقریباً 10 نمایش تمیز را از طریق دنبال‌کننده شبیه‌سازی‌شده ضبط کنید.
  4. زیروظایف را حاشیه‌نویسی کنید، generate_dataset.py را اجرا کنید و بپذیرید که خطاها کنار گذاشته می‌شوند.
  5. HDF5 را به فرمت LeRobot تبدیل کنید، v2 را برای GR00T و v3 را برای بقیه انتخاب کنید.
  6. به هر حال اپیزودهای واقعی را روی بازوی فیزیکی ضبط کنید، سپس روی ترکیب آن‌ها هم‌آموزش دهید.
  7. یک GPU اجاره کنید، تنظیم دقیق را اجرا کنید، و نقطه بازرسی را در کنار بازو سرویس‌دهی کنید.
منبعآنچه منابع بیان می‌کنند
Local simulation GPUThe NVIDIA synthetic-manipulation blueprint asks for Ubuntu 22.04 and an NVIDIA RTX A6000 with 48 GB VRAM
World-model nodeThe same blueprint asks for an H100 or higher with 80 GB, on a node separate from the Isaac Lab simulation
Container versionsIsaac Lab 2.0.2 on Isaac Sim 4.5.0 inside that blueprint image
Generation throughputIsaac Lab reports 1000 GR1T2 pick-and-place demos in 18 to 40 minutes, 19 minutes on an RTX ADA 6000 at 80 percent success
Neural trajectory costGR00T N1 reports about 105,000 L40 GPU hours, roughly 1.5 days on 3,600 L40s, for its 827 hours of dreams
هزینه واقعی زمان تقویمی است، نه زمان GPU

تولید 1000 مسیر یک بعدازظهر طول می‌کشد. اما هفته‌ها صرف این می‌شود که صحنه، پارامترهای خارجی دوربین، مش‌های اشیاء و مدل سروو خود را به اندازه‌ای دقیق کنید که این مسیرها قابل انتقال باشند. برای مدل‌سازی بودجه‌بندی کنید، نه برای نمونه‌برداری.

مدل‌های جهانی ویدیویی: جدیدترین لایه، و کمترین اندازه‌گیری‌شده

ایده پشت DreamGen این است که یک مدل مولد ویدیویی، که با تجسم ربات هدف سازگار شده است، می‌تواند اپیزودهای قابل قبولی را در صحنه‌هایی که هرگز بازدید نکرده‌اید، تصور کند. این پایپ‌لاین چهار مرحله دارد: تنظیم دقیق مدل جهانی ویدیویی، تولید ویدیوهای ربات مصنوعی فوتورئالیستیک، بازیابی توالی‌های شبه‌اکشن با یک مدل اکشن پنهان یا یک مدل دینامیک معکوس، و سپس آموزش سیاست ربات بر اساس نتیجه. مخزن GR00T-dreams انویدیا دقیقاً همین را پیاده‌سازی می‌کند.

نتیجه اصلی واقعی و قابل توجه است: داده‌های تله‌اپریشن تنها از یک وظیفه برداشت و قرار دادن در یک محیط، ۲۲ رفتار جدید را در یک ربات انسان‌نما، هم در محیط‌های دیده شده و هم در محیط‌های دیده نشده، تولید کرد. هشدار نیز به همان اندازه واقعی است و در مرحله سوم قرار دارد.

مدل‌های جهانی ویدیویی به عنوان منبع داده
مزایا
  • آنها در امتداد محوری مقیاس‌پذیر هستند که در دنیای واقعی واقعاً گران است: صحنه‌های جدید، چیدمان‌های جدید اشیاء، عبارات جدید دستورالعمل.
  • GR00T-dreams چهار تجسم پشتیبانی شده را برای اسکریپت‌های استخراج عمل و تنظیم دقیق خود فهرست می‌کند: franka, gr1, robocasa و so100. این یک تکنیک فقط برای انسان‌نماها نیست.
  • Cosmos-Transfer1 مستقیماً به نیمه فوتومتریک شکاف حمله می‌کند و یک مثال مصنوعی رباتیک را به چندین مثال واقعی از تقسیم‌بندی، عمق یا شرط‌گذاری لبه نگاشت می‌کند. Isaac Lab خود ابزارهای پرامپت را برای آن تحت scripts/tools/cosmos ارائه می‌دهد.
  • کار DreamGen، DreamGen Bench را ارائه می‌دهد، یک بنچمارک تولید ویدیو که همبستگی قوی بین عملکرد بنچمارک و موفقیت سیاست‌های بعدی را نشان می‌دهد، بنابراین می‌توانید نسل‌ها را قبل از آموزش روی آنها غربال کنید.
موازنه
  • اقدامات توسط یک مدل بازیابی می‌شوند، نه توسط یک انکودر اندازه‌گیری شوند. ویدیویی که درست به نظر می‌رسد می‌تواند یک مسیر مفصلی را حمل کند که بازوی شما قادر به اجرای آن نیست.
  • تولید گران است. GR00T N1 گزارش می‌دهد که برای تولید یک ثانیه ویدیو روی یک L40، دو دقیقه زمان لازم است، تقریباً 105,000 ساعت GPU L40، حدود 1.5 روز روی 3,600 GPU L40، برای 827 ساعت مسیرهای عصبی خود.
  • افزایش اندازه‌گیری شده در ارقام تک‌رقمی است: 4.2، 8.8 و 6.8 امتیاز در RoboCasa در سه رژیم داده، و 5.8 امتیاز به طور متوسط در 8 وظیفه واقعی GR-1، علاوه بر مدلی که از قبل داده‌های واقعی را داشت.
  • هیچ دستورالعمل منتشر شده‌ای این را برای یک بازوی سروو سرگرمی 7.4 V به طور کامل تأیید نمی‌کند. شما در حال پورت کردن خواهید بود، نه دنبال کردن.
هرگز 12 V به یک STS3215 ندهید

بی‌ارتباط با شبیه‌سازی، اما هر زمان که کسی از یک بازوی شبیه‌سازی شده به یک بازوی واقعی منتقل می‌شود و یک منبع تغذیه بداهه می‌سازد، مطرح می‌شود. بازوهای SO-100، SO-101 و LeKiwi همگی سرووهای Feetech STS3215 را با 7.4 V اجرا می‌کنند. تغذیه آنها با 12 V آنها را از بین می‌برد، و LeKiwi یک تله خاص است زیرا ریل پایه آن 12 V است. قبل از سیم‌کشی هر چیزی، صفحه سخت‌افزار SO-100 را ببینید.

آموزش مشترک دستورالعملی است که واقعاً افزایش را نشان می‌دهد

اگر یک درس عملی از ادبیات می‌گیرید، این یکی را بگیرید. مطالعه هم‌آموزی شبیه‌سازی و واقعی (Maddukuri و همکاران، 2025) به دنبال یافتن یک دستورالعمل ساده برای استفاده از داده‌های شبیه‌سازی برای حل وظایف دستکاری رباتیک مبتنی بر بینایی، در دو حوزه، یک بازوی رباتیک و یک انسان‌نما، بود و نتیجه‌گیری آن این است که شما باید روی یک ترکیب آموزش دهید. داده‌های شبیه‌سازی عملکرد وظایف دنیای واقعی را به طور متوسط 38 درصد افزایش داد و مقاله به صراحت بیان می‌کند که این امر حتی با تفاوت‌های قابل توجه بین داده‌های شبیه‌سازی و دنیای واقعی نیز صادق بود.

آن بند آخر بیش از 38 درصد اهمیت دارد. این بدان معناست که شبیه‌سازی برای مفید بودن نیازی به یک دوقلوی دیجیتال کامل ندارد، مشروط بر اینکه داده‌های واقعی در ترکیب برای تثبیت آن وجود داشته باشند. انتقال فقط با شبیه‌سازی یک مسیر پرهزینه است: همان مقاله بیان می‌کند که آموزش یک سیاست صرفاً در شبیه‌سازی و انتقال آن به دنیای واقعی اغلب نیازمند تلاش انسانی قابل توجهی برای پر کردن شکاف واقعیت است. هم‌آموزی با هرگز نخواستن از سیاست برای پر کردن شکاف به تنهایی، بیشتر آن تلاش را نادیده می‌گیرد.

جدول مقایسه سیاست AY-Robots که پارامترها، رده GPU، تأخیر استنتاج و حداقل اپیزودها را برای GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA و ACT نشان می‌دهد.
پنج سیاست قابل آموزش در /policies. ستون حداقل اپیزود، عددی است که تعیین می‌کند آیا داده‌های مصنوعی یک مزیت هستند یا تنها راهی که می‌توانید به یک مجموعه داده قابل آموزش دست یابید.

عملاً، در این پلتفرم، هم‌آموزی یک معنی دارد: هر دو مجموعه اپیزود را در همان مجموعه داده LeRobot با کلیدهای دوربین یکسان، ترتیب مفصل یکسان و واحدهای یکسان قرار دهید، سپس یک تنظیم دقیق عادی را اجرا کنید. هیچ دکمه تنظیم وزن ترکیب در فرم آموزش وجود ندارد. اگر نسبت شبیه‌سازی به واقعیت 3:1 می‌خواهید، آن را با تعداد اپیزودهایی که از هر کدام در مجموعه داده قرار می‌دهید، بیان می‌کنید.

ارزان‌ترین دستاورد از شبیه‌سازی، داده‌های آموزشی نیست

این ارزیابی است. اجرای ده‌ها آزمایش واقعی برای هر وظیفه به منظور مقایسه دو یک روز زمان بازو است و بازو بین آزمایش‌ها دچار انحراف می‌شود. SIMPLER (لی و همکاران، 2024) محیط‌های شبیه‌سازی‌شده‌ای را ساخت که هدفشان امتیازدهی به سیاست‌های واقعی به جای آموزش آن‌ها بود و سپس اندازه‌گیری کرد که رتبه‌بندی شبیه‌سازی چقدر خوب رتبه‌بندی واقعی را پیش‌بینی می‌کند. یک محیط SIMPLER واحد با سرعت 3,500 گام شبیه‌سازی در ثانیه بر روی یک RTX 4090 مصرف‌کننده با وضوح 640 در 512 رندر می‌شود که تحت فرکانس شبیه‌سازی 500 هرتز، 7 برابر سرعت بیشتر نسبت به ارزیابی واقعی است.

پروتکل ارزیابیMMRV (کمتر بهتر است)ضریب همبستگی پیرسون r (بالاتر بهتر است)
MSE اعتبارسنجی0.3750.308
SIMPLER، تجمیع واریانت0.1430.778
SIMPLER، تطابق بصری0.0560.924

این‌ها میانگین‌هایی بر روی سه گروه وظیفه ربات گوگل برای شش نقطه بازرسی متن‌باز رایج هستند: سه نقطه بازرسی RT-1 در مراحل مختلف آموزش، RT-1-X، RT-2-X و Octo-Base. سمت واقعی دارای تعداد آزمایش یکنواخت نیست، که قبل از استناد به آن ارزش دانستن دارد: 75 آزمایش برای برداشتن قوطی کوکا، 60 آزمایش برای حرکت نزدیک، 54 آزمایش برای وظایف باز و بسته کردن کشو و 27 آزمایش برای وظیفه طولانی‌تر کشو و سیب. مقایسه با MSE اعتبارسنجی بخش مفید است. انتخاب مدل بر اساس افت اعتبارسنجی این نقاط بازرسی را به شدت بد رتبه‌بندی می‌کند، و ضریب همبستگی پیرسون r 0.924 تحت تطابق بصری به این معنی است که اگر یک نقطه بازرسی امتیاز بهتری کسب کند، به احتمال زیاد در آزمایش واقعی نیز امتیاز بهتری کسب خواهد کرد. این یک تابلوی امتیازات قابل تکرار در طول شب است و نیازی نیست که شما به چیزی در مورد انتقال آموزش از شبیه‌سازی به واقعیت اعتقاد داشته باشید.

جدول امتیازات AY-Robots Arena، یک جدول قابل مرتب‌سازی از 85 مدل بینایی-زبان-عمل با 332 نتیجه بنچمارک، که هر مقدار به مقاله منبع یا کارت مدل آن پیوند داده شده است.
آرنا در /arena تعداد 332 نتیجه بنچمارک را از 85 مدل جمع‌آوری می‌کند. تقریباً همه آنها بنچمارک‌های شبیه‌سازی شده هستند، که دقیقاً نکته اصلی استدلال SIMPLER است: شبیه‌سازی یک تابلوی امتیاز خوب است، مدت‌ها قبل از اینکه یک منبع داده خوب باشد.

اگر می‌خواهید زمینه گسترده‌تری در مورد اینکه این اعداد بنچمارک چه چیزی را به شما می‌گویند و چه چیزی را نمی‌گویند، درباره یک مدل بینایی-زبان-عمل، ما آن را به طور جداگانه در مرور کلی VLA.

جایی که این پلتفرم به شما کمک نمی‌کند

شفاف بودن در مورد مرزها، در وقت همه صرفه‌جویی می‌کند. AY-Robots یک پلتفرم ضبط، آموزش و ارائه خدمات است. هیچ شبیه‌ساز در آن وجود ندارد.

  • بدون Isaac Lab، بدون MimicGen، بدون مدل جهانی، بدون طراحی صحنه. اگر داده تولید شده می‌خواهید، آن را در جای دیگری تولید کرده و نتیجه را بیاورید.
  • آموزش‌دهنده‌ها مجموعه داده‌های LeRobot را مصرف می‌کنند و نه چیز دیگری. یک خروجی شبیه‌ساز باید قبل از اینکه ورودی باشد، تبدیل شود و باید نسخه صحیح باشد: v2.0 یا v2.1 برای GR00T N1.5 و N1.7، v3.0 برای Pi0.5، SmolVLA و ACT.
  • نقطه ورودی تنظیم دقیق GR00T یک CLI tyro است که هیچ seedی را نمایش نمی‌دهد، بنابراین اجراهای GR00T به صورت بیت به بیت قابل بازتولید نیستند. اگر در حال اجرای یک آزمایش حذف دقیق شبیه‌سازی در برابر واقعیت هستید، این یک محدودیت واقعی است. seed پیش‌فرض lerobot 1000 است و فرم‌های ACT، SmolVLA و Pi0.5 یک فیلد seed را نمایش می‌دهند.
  • تجمع گرادیان فقط برای دو آموزش‌دهنده GR00T اعمال می‌شود. برای Pi0.5 و SmolVLA فیلد در فرم وجود دارد اما lerobot 0.5.1 چنین پرچمی ندارد، بنابراین کاری انجام نمی‌دهد.
  • استنتاج برای کارهای سریع باید در کنار سرووها قرار گیرد. حلقه کنترل بسته به مدل، 20 تا 485 میلی‌ثانیه در هر گام عملیاتی است و اضافه کردن رفت و برگشت‌های اینترنت عمومی، یک سیاست کاری را به یک سیاست مردد تبدیل می‌کند. استنتاج از راه دور برای کارهای کند انتخاب و جابجایی (pick-and-place) قابل اجرا است، نه برای حرکت واکنشی سریع.
آنچه می‌توانید در اینجا انجام دهید که در جای دیگر واقعاً دشوار است

نیمه واقعی یک ترکیب هم‌آموزشی را بدون داشتن یک بازو ضبط کنید. /live یک SO-100 فیزیکی را بدون نیاز به ثبت‌نام، مبتنی بر صف، پخش می‌کند و برنامه اپراتور وجود دارد زیرا کسی باید آنها را هدایت کند. اگر گلوگاه شما این است که یک شبیه‌ساز دارید و هیچ اپیزود واقعی ندارید، این همان شکافی است که این پلتفرم پر می‌کند.

بودجه‌ای که می‌توانید از آن دفاع کنید

دو مسیر را در کنار هم با اعدادی که هر یک واقعاً منتشر می‌کنند، قرار دهید و تصمیم معمولاً برای یک پروژه تک‌وظیفه‌ای روی یک بازوی کم‌هزینه خود به خود گرفته می‌شود.

موردشبیه‌سازی-اولضبط-اول
مدل‌سازی اولیهصحنه، مش‌ها، جایگذاری دوربین، مدل سروو. روزها تا هفته‌هاهیچ
جمع‌آوری دادهحدود 10 دمو در شبیه‌ساز، سپس تولید30 تا 50 اپیزود واقعی، چند ساعت تله‌اپریشن
سخت‌افزار مورد نیازکارت 48 گیگابایتی برای طرح اولیه Isaac Lab، 80 گیگابایتی برای مرحله Cosmosیک بازو و یک لپ‌تاپ
هزینه آموزشهمانند ستون سمت راست، مربی اهمیتی نمی‌دهد داده از کجا آمده است1 تا 3 USD در رده 4090، 4 تا 12 USD در رده A100 یا H100
بهترین شواهد بازده38 درصد میانگین افزایش در دنیای واقعی هنگام آموزش مشترک، 4 تا 9 امتیاز از مسیرهای عصبیخط مبنایی که همه موارد بالا بر اساس آن اندازه‌گیری می‌شوند
زمانی که شکست می‌خوردوظیفه شما به تماس، اجسام تغییرشکل‌پذیر یا انطباق سروو بستگی داردبه تنوع محیطی نیاز دارید که نمی‌توانید به صورت فیزیکی آن را صحنه‌سازی کنید

برای اولین سیاست‌گذاری روی یک SO-100، ضبط کنید. و شما را با هزینه یک قهوه به یک نقطه بازرسی (checkpoint) آماده می‌رساند و شما نیمی از هر ترکیب هم‌آموزشی آینده را در اختیار خواهید داشت. زمانی به شبیه‌ساز روی بیاورید که یک خط مبنای عملیاتی و یک شکست تعمیم‌پذیری خاص و قابل شناسایی دارید، مانند سیاستی که .

هنوز بازویی روی میزتان ندارید؟

یک SO-100 واقعی را در مرورگر، مبتنی بر صف، بدون نیاز به ثبت‌نام، هدایت کنید و ببینید یک اپیزود واقعی چگونه به نظر می‌رسد، قبل از اینکه یک آخر هفته را صرف مدل‌سازی آن در شبیه‌ساز کنید.

یک بازوی واقعی را هدایت کنید

دستورالعملی که به شواهد احترام می‌گذارد

  1. 1
    ابتدا خط مبنای واقعی را ثبت کنید

    30 اپیزود برای SmolVLA، 50 اپیزود برای ACT، GR00T N1.7 و Pi0.5. یک بار آموزش دهید. هر آنچه که آن سیاست در آن شکست می‌خورد، مشخصات شما برای داده‌های مصنوعی است.

  2. 2
    شکست تعمیم را نام ببرید

    حالت شیء؟ نورپردازی؟ ارتفاع میز؟ عوامل حواس‌پرتی؟ عبارت‌بندی متفاوتی از دستورالعمل؟ داده‌های مصنوعی در هر بار دقیقاً در یکی از این موارد خوب عمل می‌کنند و اگر نتوانید بگویید کدام یک، بی‌فایده هستند.

  3. 3
    ارزان‌ترین خانواده‌ای که آن را پوشش می‌دهد انتخاب کنید

    تغییرات حالت و چیدمان: تکثیر مسیر. نورپردازی و بافت: ابتدا افزایش تصویر، سپس مدل جهان. صحنه‌های کاملاً جدید: شبیه‌سازی‌های فیزیکی، و پذیرش هزینه مدل‌سازی.

  4. 4
    تولید کنید، سپس به شدت دور بریزید

    تلاش‌های تولید شکست می‌خورند، و نرخ موفقیت کاندیدای خود Isaac Lab بسته به وظیفه از 70 درصد تا کمتر از 1 درصد متغیر است. فقط مسیرهای موفق و کامل‌کننده وظیفه را نگه دارید، و قبل از اعتماد به دسته، یک نمونه را به صورت ویدئو بررسی کنید.

    bash
    python scripts/mimic/generate_dataset.py --device cuda \
        --num_envs 8 --generation_num_trials 500 \
        --input_file ./datasets/annotated.hdf5 \
        --output_file ./datasets/generated.hdf5 --enable_cameras
  5. 5
    هم‌آموزش دهید، جایگزین نکنید

    اپیزودهای تولید شده را با اپیزودهای واقعی در یک مجموعه داده LeRobot واحد با کلیدهای دوربین و ترتیب مفصل یکسان ادغام کنید. عدد 38 درصد یک رقم هم‌آموزشی است.

  6. 6
    روی بازوی واقعی ارزیابی کنید، و فقط آنجا

    ارزیابی شبیه‌سازی شده یک سیگنال رتبه‌بندی خوب است (ضریب همبستگی پیرسون r 0.924 در تنظیمات تطبیق بصری SIMPLER) اما آزمون پذیرش نیست. قبل از اینکه به آن اعتماد کنید، نقطه بازرسی را روی میز کار اجرا کنید.

اگر ترجیح می‌دهید از یک چک‌لیست برای خود ضبط‌های واقعی شروع کنید، ، پوشش می‌دهد قرارگیری دوربین، پیامدها و حالت‌های شکست که یک مجموعه داده را غیرقابل استفاده می‌کنند. جزئیات فرمت خود در ، و بخش هایپرپارامترها در .

آیا می‌توانم یک سیاست ربات را کاملاً بر اساس داده‌های مصنوعی آموزش دهم؟

برای یک وظیفه دستکاری روی یک بازوی واقعی، به طور قابل اعتماد خیر. هر نتیجه منتشر شده با یک عدد قوی، نتیجه هم‌آموزشی یا نتیجه افزایش داده بر روی داده‌های واقعی است. مقایسه خود MimicGen، 200 دمو تولید شده را با 79 درصد در مقابل 84 درصد برای 200 دموی انسانی در همان وظیفه قرار می‌دهد، و مقاله هم‌آموزشی شبیه‌سازی و واقعی 2025 بیان می‌کند که آموزش صرفاً در شبیه‌سازی و انتقال اغلب نیازمند تلاش انسانی قابل توجهی برای پر کردن شکاف واقعیت است. RoboCasa نشان می‌دهد که داده‌های تولید شده با 47.6 در مقابل 28.8 درصد، داده‌های انسانی را شکست می‌دهند، اما فقط با 72,000 دموی تولید شده در مقابل 1,250 دموی انسانی، در داخل شبیه‌سازی که هر دو را تولید کرده است.

اگر اپیزودهای مصنوعی تولید کنم، هنوز به چند اپیزود واقعی نیاز دارم؟

در AY-Robots، مربیان حداقل 30 اپیزود برای SmolVLA و 50 اپیزود برای ACT، GR00T N1.5، GR00T N1.7 و Pi0.5 نیاز دارند، صرف نظر از اینکه اپیزودها از کجا آمده‌اند. مستندات Mimic در Isaac Lab می‌گوید که حدود 10 نمایش موفق انسانی به عنوان بذر برای تولید مورد نیاز است. اینها اعداد متفاوتی هستند که به سوالات متفاوتی پاسخ می‌دهند: 10 چیزی است که ژنراتور نیاز دارد، 30 تا 50 چیزی است که مربی نیاز دارد.

آیا داده‌های شبیه‌سازی شده باید در فرمت LeRobot باشند؟

برای آموزش روی این پلتفرم، بله. Isaac Lab و LeIsaac هر دو HDF5 با طعم robomimic تولید می‌کنند. هسته Isaac Lab هیچ مبدل LeRobot را ارائه نمی‌دهد، اما LeIsaac فایل isaaclab2lerobot.py را برای LeRobot v2 و isaaclab2lerobotv3.py را برای v3 ارائه می‌دهد، و IsaacLab-Arena یک convert_hdf5_to_lerobot.py هدفمند برای GR00T را که توسط یک پیکربندی YAML هدایت می‌شود، ارائه می‌دهد. به نسخه توجه کنید: GR00T N1.5 و N1.7 از LeRobot v2.0 یا v2.1 استفاده می‌کنند، در حالی که Pi0.5، SmolVLA و ACT از v3.0 استفاده می‌کنند. یک مجموعه داده v3.0 بارگذار GR00T را از کار می‌اندازد و باید به v2.1 تبدیل شود.

آیا Isaac Gym هنوز هم در سال 2026 چیز درستی برای یادگیری است؟

خیر. صفحه محصول خود NVIDIA با عنوان "Isaac Gym - اکنون منسوخ شده" است و بیان می‌کند که این نرم‌افزار قدیمی است، توسعه‌دهندگان ممکن است آن را دانلود کرده و به استفاده از آن ادامه دهند اما دیگر پشتیبانی نمی‌شود، و Isaac Lab را به عنوان جایگزین معرفی می‌کند. Isaac Lab راهنماهای مهاجرت از IsaacGymEnvs، از OmniIsaacGymEnvs و از Orbit را ارائه می‌دهد، بنابراین یک محیط موجود قابل انتقال است و از بین نمی‌رود.

آیا می‌توانم یک SO-100 یا SO-101 را در Isaac Lab قرار دهم؟

SO-101، بله، به درستی. مخزن TheRobotStudio هر دو فایل URDF و MJCF را برای SO-101 ارائه می‌دهد که با onshape-to-robot از مدل CAD Onshape تولید شده‌اند، و LeIsaac وظایف آماده Isaac Lab مانند LeIsaac-SO101-PickOrange-v0 را با تله‌اپریشن از بازوی رهبر فیزیکی SO101 فراهم می‌کند. برای SO-100، همان مخزن فقط یک URDF و هیچ مدل MuJoCo را ارائه نمی‌دهد. در هر صورت از محدودیت‌هایی که README SO-101 بیان می‌کند آگاه باشید: مش‌های برخورد پایه به دلیل رفتار برخورد مشکل‌ساز حذف شدند، ویژگی‌های موتور STS3215 از پروژه Open Duck Mini اقتباس شده‌اند نه اینکه روی SO-101 شناسایی شده باشند، و قرارداد گیره 0-بسته تا 100-باز هنوز در فایل‌های مدل منعکس نشده است.

آیا این پلتفرم شبیه‌سازی را برای من اجرا می‌کند؟

خیر. AY-Robots مجموعه‌های داده LeRobot را از تله‌اپریشن واقعی ضبط می‌کند، پنج سیاست پشتیبانی شده را روی GPUهای اجاره‌ای تنظیم دقیق می‌کند، و نقطه بازرسی حاصل را به بازو بازمی‌گرداند. هیچ شبیه‌ساز، تولید داده مصنوعی و نویسندگی صحنه در آن وجود ندارد. اگر داده‌ها را در جای دیگری تولید کرده و آن را به یک مجموعه داده معتبر LeRobot تبدیل کنید، مربیان آن را دقیقاً مانند ضبط‌های واقعی می‌پذیرند.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started