
GR00T N1.7، Pi0.5، SmolVLA، ACT یا GR00T N1.5؟ یک جدول تصمیمگیری منطبق با موقعیتهای واقعی، همراه با اعداد بنچمارک منتشر شده، تأخیر، هزینه هر اجرا و مجوزهای پشت هر انتخاب.
امروزه پنج سیاست بر روی یک بازوی کلاس SO-100 قابل آموزش هستند. آنها از نظر استنتاج تأخیر، 37 در تعداد پارامترها و 12 در هزینه یک اجرا، و اینکه آیا میتوانید نتیجه را ارسال کنید، متفاوت هستند. پنج کارت مدل آن را حل نخواهند کرد: هیچ کدام به سوال شما پاسخ نمیدهند، کدام را اول اجرا کنم؟
هر عددی در زیر از مقالات، مخازن و کارتها در آگوست 2026 خوانده شده است. اعداد پلتفرم از از کاتالوگ سیاستهای AY-Robots؛ در جایی که این دو با هم اختلاف دارند، هر دو نمایش داده شدهاند.
نسخه کوتاه
- •اگر به مجموعه داده خود شک دارید، ابتدا ACT را آموزش دهید: 1 تا 3 دلار برای هر اجرا، هیچ چیز از پیش آموزش دیده برای پوشاندن دادههای بد وجود ندارد.
- •GR00T N1.7 و Pi0.5 در LIBERO در فاصله نیم امتیاز قرار دارند، 97.0 در مقابل 96.85 تا 97.5. این دلیلی برای انتخاب هیچ کدام نیست.
- •Pi0.5 برای تعمیمپذیری است، نه دقت، و کندترین با 485 میلیثانیه است.
- •SmolVLA، با 450 میلیون پارامتر، تنها VLA در اینجا است که بر روی یک کارت 24 گیگابایتی تنظیم دقیق میشود.
- •ACT با 20 میلیثانیه تنها گزینه برای حرکت واکنشی سریع است. مجوزها بقیه را تعیین میکنند.
جدول تصمیمگیری
| وضعیت شما | این را آموزش دهید | چرا |
|---|---|---|
| کیفیت مجموعه داده اثبات نشده | ACT | هیچ مدل از پیش آموزشدیدهای نمیتواند یک مجموعه داده معیوب را پنهان کند، و شکست ۱ تا ۳ USD هزینه دارد. |
| غنی از تماس، چند مرحلهای، با شرطگذاری زبانی | GR00T N1.7 | ۹۷.۰٪ در چهار مجموعه LIBERO، به علاوه فضای عملگر نسبی انتهای بازو. |
| حرکت واکنشی سریع، استنتاج در سرووها | ACT | ۲۰ میلیثانیه. بعدی سریعترین ۷.۶ برابر کندتر است. |
| اشیاء جدید، صحنه جدید، دنیای باز | Pi0.5 | ساخته شده برای رفتارهای خارج از توزیع، در حداکثر ۱۰۴ مکان. |
| یک کارت ۲۴ گیگابایتی، همچنان خواهان زبان | SmolVLA | ۴۵۰ میلیون پارامتر، حداقل ۳۰ اپیزود، به صورت محلی اجرا میشود. |
| باز تولید یک اجرای ضبط شده در سال ۲۰۲۵ | GR00T N1.5 | فقط در صورت لزوم: LeRobot اکنون آن را رد میکند، وزنها غیرتجاری هستند. |
| این به عنوان یک محصول عرضه خواهد شد | N1.7, SmolVLA or ACT | N1.5 غیرتجاری است، Pi0.5 شامل شرایط Gemma است، کارت SmolVLA هیچکدام را ذکر نمیکند. |
پنج نامزد
هر پنج مورد سیاستها هستند: فریمهای دوربین، موقعیتهای مفصل و، برای چهار مورد از آنها، یک دستورالعمل زبانی، که به مجموعهای از اهداف مفصلی آینده نگاشت شده است. آنچه آنها را از هم متمایز میکند این است که چقدر قبل از ورود شما آموخته شده بود.
| سیاست | پارامترها | تأخیر | رده GPU | محلی؟ | حداقل اپیزودها | فرمت | هزینه |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | بله | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | بله | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | خیر | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | خیر | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | خیر | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
مدل فعلی NVIDIA مدل بینایی-زبان-عمل، حدود 3 میلیارد پارامتر، تقریباً 40 میلیون در طول تنظیم دقیق. مخزن، تفاوتها را از N1.6 فهرست میکند: ستون فقرات از یک مدل Eagle اختصاصی به Cosmos-Reason2-2B روی Qwen3-VL، لایههای انتشار 32 به 16، ابعاد حالت و عمل 29 به 132، افق عمل 16 به 40.
آنچه در یک بازوی کوچک اهمیت دارد، فضای عمل نسبی اندافکتور است: N1.7 دلتاها را از وضعیت فعلی پیشبینی میکند، که همین امر امکان انتقال 20 هزار ساعت ویدیوی انسانی EgoScale را به یک سیاست ربات میدهد. مشخصات در صفحه N1.7، رویه در راهنمای N1.7 روی SO-100.
فایل README مربوط به Isaac-GR00T، N1.7 را به عنوان یک نسخه در دسترس بودن عمومی منتشر شده، با معیارهای کامل و پشتیبانی اعلام میکند. کارت Hugging Face آن هنوز بهروز نشده است: فیلد Model Version همچنان GR00T N1.7 EA را نشان میدهد. مخزن سند جدیدتر است.
GR00T N1.5
همان مقیاس 3 B، ستون فقرات Eagle 2، SigLip2 و T5، و سر DiT تطبیق جریان. این مدل برای توسعه یک چکپوینت که از قبل دارید، وجود دارد. دو چیز آن را به یک گزینه پیشفرض نامناسب تبدیل میکند: وزنها دارای مجوز یکطرفه غیرتجاری NVIDIA هستند، و نسخههای فعلی LeRobot پشتیبانی از N1.5 را حذف کردهاند. برای مقایسه، به N1.7 در برابر N1.5.
Pi0.5
VLA "Physical Intelligence" با تطبیق جریان، از نوع سیاست pi05. مقاله یک VLM 2 B را ارائه میدهد که از PaliGemma و یک متخصص عمل 300 M مقداردهی اولیه شده و ربات را با فرکانس 50 هرتز هدایت میکند؛ پیکربندی pi05 در LeRobot به طور پیشفرض یک قطعه 50 مرحلهای، معادل یک ثانیه با آن نرخ، است. نقطه قوت آن مکانهای دیده نشده است: حدود 400 ساعت دستکاری موبایل در خانههای واقعی، و یک مطالعه مقیاسپذیری بر روی 3، 12، 22، 53، 82 و 104 مکان، که در آن مدل 104 مکانی با یک کنترل آموزشدیده بر روی خود خانههای آزمایشی مطابقت داشت.
یک محدودیت، که در lerobot/pi05_base کارت ذکر شده است: پورت فقط سر عمل را حمل میکند. پیشبینی زیروظیفه، توکنسازی عمل و یادگیری تقویتی در بالادست منتشر نشدهاند، و openpi نیز همین را در مورد مخزن خود میگوید. صفحه Pi0.5 و راهنمای Pi0.5 در SO-100 بقیه را دارند.
Pi0.5 به توکنساز گیتدار google/paligemma-3b-pt-224 نیاز دارد (gated: manual، اگرچه گوگل میگوید درخواستها بلافاصله پردازش میشوند). بدون پذیرش آن و اجرای hf auth login در محیط آموزش، کار شروع میشود، مدتی دانلود میکند، سپس با خطای مجوز که شبیه به خطای شبکه است، متوقف میشود. nvidia/GR00T-N1.7-3B گیتدار نیست، اما ستون فقرات آن nvidia/Cosmos-Reason2-2B گیتدار است (gated: auto). هر دو را قبل از صفبندی پاک کنید؛ اگر یک اجرا بیکار بماند، صفحه صفهای گیرکرده مواردی را که باید بررسی شوند، فهرست میکند.
SmolVLA
450 میلیون پارامتر، حدود 100 میلیون در متخصص عمل، بر روی SmolVLM-2 با VLM فریز شده و تنها 16 لایه اول مدل زبان آن استفاده شده است. پیشآموزش دادههای جامعه بود: 481 مجموعه داده، 10.6 میلیون فریم، از همان بازوهای ارزانقیمتی که شما استفاده میکنید. تنها VLA در اینجا که در یک کارت 24 گیگابایتی جای میگیرد، و تنها 30 اپیزود کف. به صفحه SmolVLA.
ACT
یک مدل بنیادی نیست. Action Chunking Transformer از ALOHA حدود ۸۰ میلیون پارامتر دارد که آموزش دیده استاز ابتدا برای هر وظیفه، بر اساس ۵۰ نمایش با فرکانس ۵۰ هرتز. این مقاله شش وظیفه واقعی دو دستی را از حدود ده دقیقه نمایش برای هر کدام، با ۸۰ تا ۹۰ درصد موفقیت بر روی مثالهایی که برجسته میکند. ایده آن، قطعهبندی عمل، در هر مدل در این صفحه وجود دارد، و مطالعه حذف اجزا (ablation) آن همچنان بهترین تأثیر را اندازهگیری میکند: در بیش از دو وظیفه شبیهسازی شده با خاموش بودن ترکیب زمانی (temporal ensembling)، موفقیت از ۱ درصد در k=1 به ۴۴ درصد در k=100 میرسد. صفحه ACT بقیه جزئیات را دارد.
آنچه معیارهای ارزیابی واقعاً میگویند
LIBERO تنها معیار ارزیابی است که سه مورد از این پنج مورد درباره آن گزارش میدهند: وظایف شرطیشده با زبان بر روی یک ربات شبیهسازی شده Franka Panda، که به چهار مجموعه زیر، هر کدام با ده وظیفه، تقسیم شده است. NVIDIA ۲۰۰ آزمایش برای هر مجموعه اجرا کرد.
| مدل | فضایی | شیء | هدف | 10 (طولانی) | میانگین |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
هر عدد از یک مجموعه تست و بودجه متفاوت به دست آمده است. GR00T به مدت 20 هزار گام با بچ جهانی 640 اجرا شد؛ عدد openpi یک نقطه بازرسی 30 هزار است؛ پورت LeRobot 6 هزار گام به یک مدل پایه LIBERO اضافه کرد. SmolVLA یک عدم تطابق دیگر است: مقاله آن، آن ردیف را بر روی LIBERO از ابتدا و بدون پیشآموزش VLA آموزش میدهد، در حالی که سه مورد بالاتر از آن، نقاط بازرسی از پیش آموزشدیده را تنظیم دقیق میکنند. 96.85 تا 97.5 را به عنوان یک خوشه در نظر بگیرید، و شکاف تا 87.3% را واقعی اما با 6.7 برابر پارامترها به دست آمده تلقی کنید.
SimplerEnv پراکندگی را نشان میدهد، که LIBERO نشان نمیدهد. NVIDIA مدل N1.7 را با N1.6 مقایسه میکند، که نزدیکترین چیز عمومی به یک «تغییر نسلی» است.
| مجموعه SimplerEnv | میانگین N1.6 | میانگین N1.7 | بهترین نوسان | بدترین نوسان |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
ردیف Bridge ردیف مفید است: 5.7 امتیاز به طور متوسط به دست آمد در حالی که put_eggplant_in_basket 36 امتیاز از دست داد و put_eggplant_in_sink از 33 به 2 کاهش یافت. یک نسل جدید توزیع را به جای بالا بردن آن، حرکت میدهد، بنابراین اگر وظیفه شما در جایی قرار دارد که N1.7 پسرفت کرده است، میانگین چیزی نمیگوید.

از میان پنج مورد، تنها مقاله SmolVLA در مورد یک بازوی کلاس SO-100 گزارش میدهد: 78.3 درصد برای SmolVLA و 61.7 برای Pi0 در سه وظیفه، هر دو چندوظیفهای، در مقابل 48.3 برای ACT آموزشدیده تکوظیفهای، که قابل مقایسه نیست. جفتسازی تمیز هر دو تکوظیفهای بر روی SO-101 pick-and-place است: 90 در مقابل 70 در توزیع، 50 در مقابل 40 خارج از آن. مقایسه کنید در ACT در مقابل SmolVLA و Pi0.5 در مقابل SmolVLA, یا مرور کنید عرصه.
تأخیر و هزینه، استقرار را تعیین میکنند
تأخیر استنتاج محدودیتی است که افراد آن را دیرتر کشف میکنند و اول از همه پشیمان میشوند. یک سیاست که پنج امتیاز در یک بنچمارک بهتر است اما نیم ثانیه در هر گام عملیاتی طول میکشد، روی میز کار شما بدتر به نظر میرسد: دینامیک تماس منتظر نمیماند.
یک نکته: عدد GR00T با کارت NVIDIA که 4 مرحله حذف نویز و یک دوربین را در 85.8 ms روی H100 در حالت eager، 48.6 ms با torch.compile، 27.9 ms از طریق TensorRT کامل زمانبندی میکند، مغایرت دارد. 152 ms در اینجا یک عدد کل پشته با سربار سرویسدهی و بیش از یک دوربین است، نه یک گذر رو به جلو.
حلقه 20 تا 485 ms متعلق به مدل است و رفت و برگشتهای اینترنت عمومی به آن اضافه میشود. استنتاج از راه دور برای عملیات کند برداشتن و قرار دادن (pick-and-place) قابل اجرا است، نه برای حرکتهای واکنشی سریع. اگر وظیفه شما به سرعت نیاز دارد، استنتاج باید در کنار سرووها قرار گیرد: ACT یا SmolVLA، به صورت محلی. مرتبط: سیاست در میانه حرکت متوقف میشود.
یک راه برای صرفهجویی در زمان بدون تغییر مدل: مقاله SmolVLA اجرای همزمان را اندازهگیری میکند، جایی که سیاست یک بخش را قبل از پیشبینی بخش بعدی به پایان میرساند، در مقابل اجرای ناهمزمان، جایی که پیشبینی با اجرا همپوشانی دارد. موفقیت مشابه است، 78.3 در مقابل 73.3، اما همان عملیات برداشتن و قرار دادن (pick-and-place) به جای 13.75 ثانیه، 9.7 ثانیه طول میکشد، و در یک پنجره ثابت ربات 19 چرخه را به جای 9 چرخه مدیریت میکند.
مجوزها، بررسی شدهاند چون هیچکس آنها را بررسی نمیکند
| مدل | مجوز وزنها | مجوز کد | استفاده تجاری |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License؛ کارت اجازه استفاده تجاری را میدهد | Apache 2.0 | بله |
| GR00T N1.5 | مجوز یکطرفه غیرتجاری NVIDIA | Apache 2.0 | خیر |
| Pi0.5 | فراداده کارت pi05_base مجوز را gemma میخواند | Apache 2.0 (openpi, LeRobot docs) | هر دو را بخوانید، آنها با هم اختلاف دارند |
| SmolVLA | هیچ فیلد مجوزی در کارت smolvla_base وجود ندارد | Apache 2.0 (LeRobot) | کد بله، وزنها نامشخص |
| ACT | هیچ وزن پایه ای وجود ندارد | Apache 2.0 (LeRobot) | بله |
ردیف Pi0.5 نیاز به دقت دارد. مستندات LeRobot pi05 بیان میکند که Apache 2.0 با openpi سازگار است، در حالی که کارت هاب برای lerobot/pi05_base شامل license: gemma. هر دو فعال هستند. GR00T N1.7 دارای یک نسخه ملایمتری است: README Isaac-GR00T به طور گذرا میگوید که N1.7 تحت Apache 2.0 کاملاً قابل مجوزدهی تجاری است، در حالی که بخش مجوز خودش و کارت مدل، فقط کد را تحت Apache 2.0 و وزنها را تحت NVIDIA Open Model License قرار میدهند.
پیشفرضهایی که واقعاً اجرا خواهید کرد
هر فرم آموزشدهنده یک پیشفرض را ارائه میدهد و آنها خودسرانه نیستند. ACT متعلق به LeRobot است: بچ 8، lr 1e-5, 100000 گامهای آموزشی، اندازه قطعه 100، مطابق با ACTConfig بالادستی و k=100 from the ACT paper. یک ستون در پایین یک تله است.
| سیاست | بچ | LR | حداکثر گامها | تجمع گرادیان | اعمال میشود؟ | تنظیمات اضافی |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | بله | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | بله | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | خیر (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | خیر | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | خیر | chunkSize, nActionSteps, seed, logFreq |
نقطه ورودی تنظیم دقیق GR00T (launch_finetune.py، یک CLI از نوع tyro) دارای فیلد seed ندارد در کلاس داده پیکربندی خود است، بنابراین اجراها به صورت بیت به بیت قابل بازتولید نیستند. مخزن همچنین هشدار میدهد که 5 تا 6 درصد واریانس بین اجراها ناشی از افزایشهای غیرقطعی تصویر، که بزرگتر از اکثر شکافهای بنچمارک مورد بحث آنلاین است. seed پیشفرض LeRobot 1000 است. ستون تجمع گرادیان، lerobot 0.5.1 را توصیف میکند؛ نسخه بالادستی 0.6.2 آن را به عنوان --accelerator.gradient_accumulation.steps نمایش میدهد.
تنظیمی که بیش از انتخاب مدل اهمیت دارد
این تکه عمل است. تکههای طولانیتر حرکت نرمتر و خطاهای ترکیبی کمتری ایجاد میکنند، اما سیاست در حین اجرای بلوک متعهد میشود، بنابراین به هر چیزی که حرکت میکند دیر واکنش نشان میدهد: در مورد یک مکعب ثابت مطمئن است، اما در مورد یک مکعب غلتان ناامیدکننده. اگر از حد خود فراتر رود، کوتاه کردن بخش اجرا شده بهتر از آموزش مجدد است و رایگان است. مفصلی که زود متوقف میشود یک مشکل متفاوت است؛ به .
- ACT: ACTConfig به طور پیشفرض روی
chunk_size 100وn_action_steps 100تنظیم شده است. تجمیع زمانی خاموش است و بهn_action_steps 1نیاز دارد. - GR00T N1.7: افق داخلی از 16 به 40 افزایش یافت، با این حال مثال SO-101 LeRobot همچنان با
--policy.chunk_size=16 --policy.n_action_steps=16اجرا میشود. پرچم rollout به--execution-horizonتغییر نام یافت. - Pi0.5: یک تکه 50 مرحلهای، که دستورالعمل LIBERO LeRobot 10 مرحله آن را از طریق
--policy.n_action_steps=10اجرا میکند؛ با--policy.pretrained_pathاگر پرچم را حذف کنید، به 50 بازمیگردد. - SmolVLA: تکههای 50 عملی، هر دو کنترلکننده در دسترس هستند.
چگونه هر پنج مورد را در یک بعدازظهر بررسی کنیم
ارزانترین پاسخ، مطالعه بیشتر نیست. حدود 15 USD هزینه کنید و بگذارید بازو به شما بگوید: یک بار ضبط کنید، ابتدا مدل ارزان را آموزش دهید، پس از اثبات صحت دادهها، مقیاس را افزایش دهید. ساختار بر حجم غلبه میکند، این نکته اصلی و .
- 1۵۰ اپیزود را یک بار ضبط کنید
پنجاه اپیزود، مسیر را برای GR00T، Pi0.5 و ACT، و ۳۰ اپیزود برای SmolVLA هموار میکند. هر تغییر را به جای پراکنده کردن، تکرار کنید: ۵۰ اپیزود در ۵ موقعیت مکعبی آموزش داده شد، در حالی که ۲۵ اپیزود آموزش داده نشد. برای اطلاعات بیشتر به اولین مجموعه داده خود را ضبط کنید مراجعه کنید.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ابتدا ACT را آموزش دهید، زیرا نمیتواند به شما دروغ بگوید
بدون وزنهای از پیش آموزشدیده، بنابراین اگر اصلاً وظیفه را انجام میدهد، مجموعه داده شما شامل آن وظیفه است. اگر ACT خط صاف نشان داد، دادهها را اصلاح کنید. ۱ تا ۳ دلار آمریکا، ۲ تا ۵ ساعت روی یک کارت ۲۴ گیگابایتی.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLA را روی همان مجموعه داده، بدون تغییر اجرا کنید
همان دادهها، همان بازو، ۴۵۰ میلیون پارامتر به جای ۸۰ میلیون، به علاوه شرطیسازی زبانی. LeRobot یک اجرای ۲۰ هزار مرحلهای را تقریباً ۴ ساعت روی یک A100 تخمین میزند. این چیزی است که به شما میگوید آیا پیشآموزش فایدهای دارد یا خیر.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4قبل از کار با GR00T، به v2.1 تبدیل کنید
GR00T نسخهای از فرمت LeRobot v2 را به همراه یک فایل اضافی
meta/modality.jsonمیخواند که نحوه تقسیم آرایههای حالت و عمل ادغام شده به فیلدهای نامگذاری شده را نگاشت میکند. یک مجموعه داده v3.0 این لودر را از کار میاندازد، زیرا v3.0 بسیاری از اپیزودها را در فایلهای مشترک بستهبندی میکند، در حالی که v2 برای هر اپیزود یک فایل مینوشت. Isaac-GR00T ابزار کمکی برای کاهش نسخه را به عنوانscripts/lerobot_conversion/convert_v3_to_v2.pyارائه میدهد؛ صفحه رد شدن v3 مسیر سریع است.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5فقط در صورتی به GR00T N1.7 ارتقا دهید که دو مورد اول نتیجه کافی ندادند
از طریق CLI انویدیا، که در اینجا نشان داده شده است، یا نوع سیاست
grootLeRobot. انویدیا ۴۰ گیگابایت یا بیشتر VRAM را برای تنظیم دقیق و ۱۶ گیگابایت را برای استنتاج توصیه میکند. در صورت بروز OOM، به صفحه OOM مراجعه کنید.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
دو روش برای اجرای این مرحله غربالگری
سه محیط، زیرا زنجیرههای ابزار با هم سازگار نیستند. LeRobot در شاخه اصلی نسخه 0.6.2 است و به پایتون 3.12 یا جدیدتر نیاز دارد؛ Isaac-GR00T و openpi مخازن جداگانه مدیریت شده توسط uv هستند.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T نسخه 0.8.0
torchcodecرا به عنوان تنها بکاند ویدیویی خود استفاده میکند که به FFmpeg 4 تا 7 نیاز دارد. FFmpeg 8 پشتیبانی نمیشود و AV1 تضمین شده نیست. - حداقل حافظه مورد نیاز openpi: استنتاج بالای ۸ گیگابایت، LoRA بالای ۲۲.۵ گیگابایت، تنظیم دقیق کامل بالای ۷۰ گیگابایت. مورد آخر دلیل اینکه Pi0.5 یک کار A100 است.
- GPU را خودتان اجاره کنید، پس از اتمام کار آن را از بین ببرید، و سه مجموعه مسیر چکپوینت را به صورت دستی تطبیق دهید.
همان پنج مدل، یک فرم. مدل، مجموعه داده و هایپرپارامترها را انتخاب کنید؛ بکاند یک GPU با اندازه VRAM مورد نیاز اجاره میکند، آموزشدهنده را اجرا میکند و را در فضای ذخیرهسازی ابری مینویسد.
- The ماتریس آموزش شامل پنج مدل برای چهار بازو است، هر سلول یک راهنما: SmolVLA روی SO-100، ACT روی SO-101.
- پادهای استنتاج به صورت خودکار توسط
/api/inference/podبا یک ناظر بیکاری تامین میشوند، بنابراین یک پاد فراموش شده به صورت پنهانی هزینه ایجاد نمیکند. - چکپوینتهای پایه متعلق به خود فروشندگان هستند:
nvidia/GR00T-N1.7-3B،nvidia/GR00T-N1.5-3B،lerobot/pi05_base. ACT هیچ کدام را ندارد. - همان عملیات از CLI و از عوامل هوش مصنوعی از طریق سرور MCP.
- سختافزار ندارید؟ بازوی زنده یک SO-100 فیزیکی را بدون نیاز به ثبتنام پخش میکند؛ صفحه امتحان راههای ورود را نشان میدهد.
مدل پایه یا از ابتدا
چالش اصلی این نیست که کدام مدل 3B را انتخاب کنیم. بلکه این است که آیا اصلاً از یک VLA از پیش آموزشدیده استفاده کنیم یا خیر، با توجه به اینکه ACT شش وظیفه واقعی دو دستی را از حدود ده دقیقه نمایش برای هر کدام، با 80 میلیون پارامتر و بدون هیچ آموزش قبلی یاد گرفت.
- شرطیسازی زبانی. ACT هیچکدام را ندارد؛ یک نقطه بازرسی ACT یک وظیفه را انجام میدهد.
- عملکرد بهتر روی اشیایی که در نمایشهای شما غایب هستند: روی SO-101، 50% در مقابل 40% ACT خارج از توزیع.
- چند وظیفهای بودن: SmolVLA با یک نقطه بازرسی به 78.3% در سه وظیفه SO-100 میرسد؛ ACT فقط به صورت تک وظیفهای اجرا شد.
- 7.6 تا 24 برابر تأخیر بیشتر: 152 تا 485 میلیثانیه در هر گام عملیاتی در مقابل 20 میلیثانیه ACT.
- 4 تا 12 دلار آمریکا به ازای هر اجرا به جای 1 تا 3 دلار، و نیاز به رده A100 به جای هر کارت 24 گیگابایتی.
- ریسک مجوز، به علاوه حالت خرابی مخزن محدود (gated-repo) که از ابتدا وجود ندارد.
- وزنهای از پیش آموزشدیده میتوانند یک مجموعه داده بد را پنهان کنند. یک تنظیم دقیق که روی دادههای خراب نیمهکاره عمل میکند، قبل از اینکه به دادهها نگاه کنید، یک هفته هزینه دارد.
مورد بازتولید یک اجرای قدیمی
دنبال کردن یک نقطه بازرسی 2025، انتخاب مدل را برای شما انجام میدهد و مشکل را به تثبیت نسخه تبدیل میکند: LeRobot فعلی N1.5 را رد میکند، بنابراین شما lerobot==0.5.1. با عدم وجود فیلد seed و 5 تا 6 درصد واریانس بین اجراها، بازتولید به طور ذاتی تقریبی است. و جنبه پلتفرم را پوشش میدهند.

به دو مورد رسیدید؟ ACT در برابر GR00T N1.7 و GR00T N1.7 در برابر SmolVLA. ردیفهای خام در ورودیهای آرنا قرار دارند: GR00T N1.7، Pi0.5، SmolVLA و ACT.
مواردی که این پلتفرم به شما کمک نمیکند
- این پلتفرم نمیتواند استنتاج از راه دور را سریع کند. حلقه 20 تا 485 میلیثانیه متعلق به مدل است؛ رفت و برگشتهای اینترنتی به آن اضافه میشوند.
- این پلتفرم نمیتواند GR00T یا Pi0.5 را روی سختافزار شما تنظیم دقیق کند. هر دو در اینجا فقط ابری هستند؛ فقط SmolVLA و ACT به صورت محلی اجرا میشوند.
- این پلتفرم نمیتواند یک مجموعه داده را اصلاح کند. افت ضرر اما سیاست هیچ کاری نمیکند یک مشکل دادهای است، سیاستی که فقط در یک تنظیم کار میکند یک مشکل پوشش است.
- این پلتفرم نمیتواند اجرای GR00T را قابل بازتولید کند: پیکربندی بالادستی فیلد seed ندارد.
85 مدل، 332 نتیجه بنچمارک، هر عدد لینک شده به منبع خود
نسخه قابل مرتبسازی جداول در این صفحه: 85 مدل بینایی-زبان-عمل، 332 نتیجه بنچمارک، که هر کدام به مقاله یا کارت مدل خود لینک شدهاند.
باز کردن میدانانتخاب یکی و ادامه دادن
یک پیشفرض: 50 اپیزود را ضبط کنید، ACT را با هزینه 1 تا 3 USD آموزش دهید تا مجموعه داده را اثبات کنید، سپس SmolVLA را روی همان دادهها. مجموعاً کمتر از 6 USD، و آنها به سوال مهم پاسخ میدهند: آیا پیشآموزش در اینجا کمک میکند، یا آیا گلوگاه دادهها هستند. برای وظایف چندمرحلهای با تماس زیاد به GR00T N1.7، و برای زمانی که صحنه تغییر میکند به Pi0.5 ارتقا دهید.
راهنمای پلتفرم: اولین خطمشی خود را آموزش دهید، سپس اولین خطمشی خود را اجرا کنید. مستندات آموزش و مستندات مجموعه داده شکل و فرمت را پوشش میدهند؛ صفحه SO-100 و راهنمای کامل SO-100 ساخت و کالیبراسیون را پوشش میدهند. پیشزمینه: مرور کلی VLA و مقاله تطبیق جریان Pi0. موردی که نرخ موفقیت شما را افزایش میدهد، راهنمای کیفیت داده.
کدام سیاست VLA را باید ابتدا روی SO-100 آموزش دهم؟▾
ACT، سپس SmolVLA. ACT از ابتدا آموزش میبیند، بنابراین نمیتواند یک مجموعه داده بد را پنهان کند، و هر اجرا 1 تا 3 USD روی یک کارت 24 GB هزینه دارد. اگر ACT اصلاً وظیفه را انجام دهد، 4 تا 12 USD برای اجرای GR00T N1.7 یا Pi0.5 هدر نمیرود.
آیا GR00T N1.7 واقعاً بهتر از Pi0.5 است؟▾
در LIBERO، تفاوتها در حد نویز هستند: 97.0% در چهار مجموعه برای GR00T N1.7، 96.85% برای Pi0.5 در 30k گام در openpi، 97.5% برای پورت LeRobot، همه از هارنسهای مختلف. تفاوتهای واقعی 152 ms در هر گام عملیاتی در مقابل 485 ms، مجموعه دادههای v2.1 در مقابل v3.0، و دقت بنچمارک در مقابل تعمیمپذیری در دنیای باز هستند.
آیا میتوانم هر یک از اینها را روی یک RTX 4090 تنظیم دقیق کنم؟▾
SmolVLA و ACT، بله؛ هر دو برای یک RTX 4090 یا هر کارت 24 GB فهرست شدهاند و به صورت محلی اجرا میشوند. GR00T N1.7، N1.5 و Pi0.5 به یک A100 یا H100 80 GB نیاز دارند و در اینجا فقط ابری هستند. NVIDIA برای تنظیم دقیق GR00T، 40 GB یا بیشتر را توصیه میکند؛ حداقل حافظه مورد نیاز openpi برای تنظیم دقیق کامل Pi0.5 بالای 70 GB و برای LoRA 22.5 GB است.
کدام یک از این پنج مورد را میتوانم به صورت تجاری استفاده کنم؟▾
وزنهای GR00T N1.7 تحت توافقنامه مجوز مدل باز NVIDIA هستند که کارت بیان میکند استفاده تجاری را پوشش میدهد. وزنهای N1.5 غیرتجاری هستند. کد SmolVLA در LeRobot تحت Apache 2.0 است، اما کارت lerobot/smolvla_base فیلد مجوز ندارد، بنابراین وزنها نامشخص هستند. ACT هیچ وزن پایه برای مجوز ندارد. Pi0.5 مبهم است: مستندات LeRobot میگویند Apache 2.0، اما متادیتای کارت آن license: gemma را نشان میدهد.
Sources
- مخزن NVIDIA Isaac-GR00T: وضعیت GA، تغییرات N1.6 به N1.7، الزامات سختافزاری، محدودیتهای torchcodec و FFmpeg، launch_finetune.py، واریانس اجرا به اجرا
- کارت مدل nvidia/GR00T-N1.7-3B: ستون فقرات Cosmos-Reason2-2B، 3 B پارامتر، جدول زمانبندی استنتاج، مجوز مدل باز NVIDIA، فیلد Model Version
- کارت مدل nvidia/GR00T-N1.5-3B: مرجع Eagle 2، SigLip2 و T5، flow matching DiT، مجوز یکطرفه غیرتجاری
- مثال Isaac-GR00T LIBERO: نرخ موفقیت در هر مجموعه در 20K گام و اندازه دسته 640، 200 آزمایش در هر مجموعه
- مثال Isaac-GR00T SimplerEnv: نرخ موفقیت Bridge و Fractal برای هر وظیفه، GR00T N1.6 در مقابل N1.7
- pi0.5: یک مدل بینایی-زبان-عمل با تعمیمپذیری در دنیای باز (2 B VLM به علاوه 300 M متخصص عمل، کنترل 50 Hz، حدود 400 ساعت دستکاری موبایل، مطالعه مقیاسپذیری در 3 تا 104 مکان)
- مخزن openpi: حداقل حافظه GPU، دامنه flow-matching-head-only، و نتایج Pi0.5 LIBERO در examples/libero
- کارت مدل lerobot/pi05_base: دامنه پورت LeRobot، متادیتای license: gemma، استفاده از lerobot-train
- مستندات LeRobot pi0.5: توکنایزر gated PaliGemma، جدول بازتولید LIBERO، تله بازگشتی n_action_steps، بیانیه Apache 2.0
- SmolVLA: یک مدل بینایی-زبان-عمل برای رباتیک مقرونبهصرفه و کارآمد (450 M پارامتر، جداول LIBERO و Meta-World، نتایج SO-100 و SO-101، استنتاج ناهمزمان)
- مستندات LeRobot SmolVLA: 50 اپیزود در 5 موقعیت در مقابل 25، 20k گام در حدود 4 ساعت روی یک A100
- یادگیری دستکاری دو دستی دقیق با سختافزار کمهزینه (ACT و ALOHA): 6 وظیفه با 80-90 درصد، حذف اندازه قطعه از k=1 تا k=100
- LeRobot 0.6.2: پیشفرضهای ACTConfig و SmolVLAConfig، seed پیشفرض 1000، --accelerator.gradient_accumulation.steps، نیاز به Python 3.12، Apache 2.0
- مستندات LeRobot GR00T: نوع سیاست groot، پشتیبانی N1.5 حذف شد، pin lerobot==0.5.1، مثال اندازه قطعه SO-101
- کارت مدل lerobot/smolvla_base: نقطه بازرسی پایه SmolVLA که توسط --policy.path استفاده میشود، و متادیتای کارت آن که فیلد مجوز ندارد
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started