جدول مقایسه سیاست‌های AY-Robots که GR00T N1.7، GR00T N1.5، Pi0.5، SmolVLA و ACT را در کنار هم با تعداد پارامترها، رده GPU، تأخیر استنتاج و حداقل تعداد اپیزودها نشان می‌دهد.
مدل‌های VLAآموزش سیاستانتخاب مدلlerobotso-100

کدام سیاست VLA را باید در سال 2026 آموزش دهید؟

AY-Robots ResearchAugust 23, 202618 دقیقه مطالعه

GR00T N1.7، Pi0.5، SmolVLA، ACT یا GR00T N1.5؟ یک جدول تصمیم‌گیری منطبق با موقعیت‌های واقعی، همراه با اعداد بنچمارک منتشر شده، تأخیر، هزینه هر اجرا و مجوزهای پشت هر انتخاب.

امروزه پنج سیاست بر روی یک بازوی کلاس SO-100 قابل آموزش هستند. آنها از نظر استنتاج تأخیر، 37 در تعداد پارامترها و 12 در هزینه یک اجرا، و اینکه آیا می‌توانید نتیجه را ارسال کنید، متفاوت هستند. پنج کارت مدل آن را حل نخواهند کرد: هیچ کدام به سوال شما پاسخ نمی‌دهند، کدام را اول اجرا کنم؟

هر عددی در زیر از مقالات، مخازن و کارت‌ها در آگوست 2026 خوانده شده است. اعداد پلتفرم از از کاتالوگ سیاست‌های AY-Robots؛ در جایی که این دو با هم اختلاف دارند، هر دو نمایش داده شده‌اند.

نسخه کوتاه

  • اگر به مجموعه داده خود شک دارید، ابتدا ACT را آموزش دهید: 1 تا 3 دلار برای هر اجرا، هیچ چیز از پیش آموزش دیده برای پوشاندن داده‌های بد وجود ندارد.
  • GR00T N1.7 و Pi0.5 در LIBERO در فاصله نیم امتیاز قرار دارند، 97.0 در مقابل 96.85 تا 97.5. این دلیلی برای انتخاب هیچ کدام نیست.
  • Pi0.5 برای تعمیم‌پذیری است، نه دقت، و کندترین با 485 میلی‌ثانیه است.
  • SmolVLA، با 450 میلیون پارامتر، تنها VLA در اینجا است که بر روی یک کارت 24 گیگابایتی تنظیم دقیق می‌شود.
  • ACT با 20 میلی‌ثانیه تنها گزینه برای حرکت واکنشی سریع است. مجوزها بقیه را تعیین می‌کنند.

جدول تصمیم‌گیری

وضعیت شمااین را آموزش دهیدچرا
کیفیت مجموعه داده اثبات نشدهACTهیچ مدل از پیش آموزش‌دیده‌ای نمی‌تواند یک مجموعه داده معیوب را پنهان کند، و شکست ۱ تا ۳ USD هزینه دارد.
غنی از تماس، چند مرحله‌ای، با شرط‌گذاری زبانیGR00T N1.7۹۷.۰٪ در چهار مجموعه LIBERO، به علاوه فضای عملگر نسبی انتهای بازو.
حرکت واکنشی سریع، استنتاج در سرووهاACT۲۰ میلی‌ثانیه. بعدی سریع‌ترین ۷.۶ برابر کندتر است.
اشیاء جدید، صحنه جدید، دنیای بازPi0.5ساخته شده برای رفتارهای خارج از توزیع، در حداکثر ۱۰۴ مکان.
یک کارت ۲۴ گیگابایتی، همچنان خواهان زبانSmolVLA۴۵۰ میلیون پارامتر، حداقل ۳۰ اپیزود، به صورت محلی اجرا می‌شود.
باز تولید یک اجرای ضبط شده در سال ۲۰۲۵GR00T N1.5فقط در صورت لزوم: LeRobot اکنون آن را رد می‌کند، وزن‌ها غیرتجاری هستند.
این به عنوان یک محصول عرضه خواهد شدN1.7, SmolVLA or ACTN1.5 غیرتجاری است، Pi0.5 شامل شرایط Gemma است، کارت SmolVLA هیچ‌کدام را ذکر نمی‌کند.

پنج نامزد

هر پنج مورد سیاست‌ها هستند: فریم‌های دوربین، موقعیت‌های مفصل و، برای چهار مورد از آنها، یک دستورالعمل زبانی، که به مجموعه‌ای از اهداف مفصلی آینده نگاشت شده است. آنچه آنها را از هم متمایز می‌کند این است که چقدر قبل از ورود شما آموخته شده بود.

سیاستپارامترهاتأخیررده GPUمحلی؟حداقل اپیزودهافرمتهزینه
ACT~80 M20 ms24 GB cardبله50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardبله30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBخیر50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBخیر50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBخیر50v3.04 to 12 USD

GR00T N1.7

مدل فعلی NVIDIA مدل بینایی-زبان-عمل، حدود 3 میلیارد پارامتر، تقریباً 40 میلیون در طول تنظیم دقیق. مخزن، تفاوت‌ها را از N1.6 فهرست می‌کند: ستون فقرات از یک مدل Eagle اختصاصی به Cosmos-Reason2-2B روی Qwen3-VL، لایه‌های انتشار 32 به 16، ابعاد حالت و عمل 29 به 132، افق عمل 16 به 40.

آنچه در یک بازوی کوچک اهمیت دارد، فضای عمل نسبی اندافکتور است: N1.7 دلتاها را از وضعیت فعلی پیش‌بینی می‌کند، که همین امر امکان انتقال 20 هزار ساعت ویدیوی انسانی EgoScale را به یک سیاست ربات می‌دهد. مشخصات در صفحه N1.7، رویه در راهنمای N1.7 روی SO-100.

GA در مخزن، EA روی کارت مدل

فایل README مربوط به Isaac-GR00T، N1.7 را به عنوان یک نسخه در دسترس بودن عمومی منتشر شده، با معیارهای کامل و پشتیبانی اعلام می‌کند. کارت Hugging Face آن هنوز به‌روز نشده است: فیلد Model Version همچنان GR00T N1.7 EA را نشان می‌دهد. مخزن سند جدیدتر است.

GR00T N1.5

همان مقیاس 3 B، ستون فقرات Eagle 2، SigLip2 و T5، و سر DiT تطبیق جریان. این مدل برای توسعه یک چک‌پوینت که از قبل دارید، وجود دارد. دو چیز آن را به یک گزینه پیش‌فرض نامناسب تبدیل می‌کند: وزن‌ها دارای مجوز یک‌طرفه غیرتجاری NVIDIA هستند، و نسخه‌های فعلی LeRobot پشتیبانی از N1.5 را حذف کرده‌اند. برای مقایسه، به N1.7 در برابر N1.5.

Pi0.5

VLA "Physical Intelligence" با تطبیق جریان، از نوع سیاست pi05. مقاله یک VLM 2 B را ارائه می‌دهد که از PaliGemma و یک متخصص عمل 300 M مقداردهی اولیه شده و ربات را با فرکانس 50 هرتز هدایت می‌کند؛ پیکربندی pi05 در LeRobot به طور پیش‌فرض یک قطعه 50 مرحله‌ای، معادل یک ثانیه با آن نرخ، است. نقطه قوت آن مکان‌های دیده نشده است: حدود 400 ساعت دستکاری موبایل در خانه‌های واقعی، و یک مطالعه مقیاس‌پذیری بر روی 3، 12، 22، 53، 82 و 104 مکان، که در آن مدل 104 مکانی با یک کنترل آموزش‌دیده بر روی خود خانه‌های آزمایشی مطابقت داشت.

یک محدودیت، که در lerobot/pi05_base کارت ذکر شده است: پورت فقط سر عمل را حمل می‌کند. پیش‌بینی زیروظیفه، توکن‌سازی عمل و یادگیری تقویتی در بالادست منتشر نشده‌اند، و openpi نیز همین را در مورد مخزن خود می‌گوید. صفحه Pi0.5 و راهنمای Pi0.5 در SO-100 بقیه را دارند.

تله‌ای که یک بعدازظهر را می‌بلعد: مخازن گیت‌دار

Pi0.5 به توکن‌ساز گیت‌دار google/paligemma-3b-pt-224 نیاز دارد (gated: manual، اگرچه گوگل می‌گوید درخواست‌ها بلافاصله پردازش می‌شوند). بدون پذیرش آن و اجرای hf auth login در محیط آموزش، کار شروع می‌شود، مدتی دانلود می‌کند، سپس با خطای مجوز که شبیه به خطای شبکه است، متوقف می‌شود. nvidia/GR00T-N1.7-3B گیت‌دار نیست، اما ستون فقرات آن nvidia/Cosmos-Reason2-2B گیت‌دار است (gated: auto). هر دو را قبل از صف‌بندی پاک کنید؛ اگر یک اجرا بیکار بماند، صفحه صف‌های گیرکرده مواردی را که باید بررسی شوند، فهرست می‌کند.

SmolVLA

450 میلیون پارامتر، حدود 100 میلیون در متخصص عمل، بر روی SmolVLM-2 با VLM فریز شده و تنها 16 لایه اول مدل زبان آن استفاده شده است. پیش‌آموزش داده‌های جامعه بود: 481 مجموعه داده، 10.6 میلیون فریم، از همان بازوهای ارزان‌قیمتی که شما استفاده می‌کنید. تنها VLA در اینجا که در یک کارت 24 گیگابایتی جای می‌گیرد، و تنها 30 اپیزود کف. به صفحه SmolVLA.

ACT

یک مدل بنیادی نیست. Action Chunking Transformer از ALOHA حدود ۸۰ میلیون پارامتر دارد که آموزش دیده استاز ابتدا برای هر وظیفه، بر اساس ۵۰ نمایش با فرکانس ۵۰ هرتز. این مقاله شش وظیفه واقعی دو دستی را از حدود ده دقیقه نمایش برای هر کدام، با ۸۰ تا ۹۰ درصد موفقیت بر روی مثال‌هایی که برجسته می‌کند. ایده آن، قطعه‌بندی عمل، در هر مدل در این صفحه وجود دارد، و مطالعه حذف اجزا (ablation) آن همچنان بهترین تأثیر را اندازه‌گیری می‌کند: در بیش از دو وظیفه شبیه‌سازی شده با خاموش بودن ترکیب زمانی (temporal ensembling)، موفقیت از ۱ درصد در k=1 به ۴۴ درصد در k=100 می‌رسد. صفحه ACT بقیه جزئیات را دارد.

آنچه معیارهای ارزیابی واقعاً می‌گویند

LIBERO تنها معیار ارزیابی است که سه مورد از این پنج مورد درباره آن گزارش می‌دهند: وظایف شرطی‌شده با زبان بر روی یک ربات شبیه‌سازی شده Franka Panda، که به چهار مجموعه زیر، هر کدام با ده وظیفه، تقسیم شده است. NVIDIA ۲۰۰ آزمایش برای هر مجموعه اجرا کرد.

مدلفضاییشیءهدف10 (طولانی)میانگین
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
این ردیف‌ها دقیقاً قابل مقایسه نیستند

هر عدد از یک مجموعه تست و بودجه متفاوت به دست آمده است. GR00T به مدت 20 هزار گام با بچ جهانی 640 اجرا شد؛ عدد openpi یک نقطه بازرسی 30 هزار است؛ پورت LeRobot 6 هزار گام به یک مدل پایه LIBERO اضافه کرد. SmolVLA یک عدم تطابق دیگر است: مقاله آن، آن ردیف را بر روی LIBERO از ابتدا و بدون پیش‌آموزش VLA آموزش می‌دهد، در حالی که سه مورد بالاتر از آن، نقاط بازرسی از پیش آموزش‌دیده را تنظیم دقیق می‌کنند. 96.85 تا 97.5 را به عنوان یک خوشه در نظر بگیرید، و شکاف تا 87.3% را واقعی اما با 6.7 برابر پارامترها به دست آمده تلقی کنید.

SimplerEnv پراکندگی را نشان می‌دهد، که LIBERO نشان نمی‌دهد. NVIDIA مدل N1.7 را با N1.6 مقایسه می‌کند، که نزدیک‌ترین چیز عمومی به یک «تغییر نسلی» است.

مجموعه SimplerEnvمیانگین N1.6میانگین N1.7بهترین نوسانبدترین نوسان
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

ردیف Bridge ردیف مفید است: 5.7 امتیاز به طور متوسط به دست آمد در حالی که put_eggplant_in_basket 36 امتیاز از دست داد و put_eggplant_in_sink از 33 به 2 کاهش یافت. یک نسل جدید توزیع را به جای بالا بردن آن، حرکت می‌دهد، بنابراین اگر وظیفه شما در جایی قرار دارد که N1.7 پسرفت کرده است، میانگین چیزی نمی‌گوید.

جدول امتیازات AY-Robots arena، یک جدول قابل مرتب‌سازی از 85 مدل بینایی-زبان-عمل با 332 نتیجه بنچمارک، که هر مقدار به مقاله یا کارت مدلی که از آن آمده است پیوند داده شده است
این عرصه شامل 85 مدل VLA و 332 نتیجه بنچمارک است که هر کدام به مقاله یا کارت مدل خود پیوند داده شده‌اند. برای بررسی اینکه آیا یک عدد نقل شده در یک پست وبلاگ واقعی است، مفید است.

از میان پنج مورد، تنها مقاله SmolVLA در مورد یک بازوی کلاس SO-100 گزارش می‌دهد: 78.3 درصد برای SmolVLA و 61.7 برای Pi0 در سه وظیفه، هر دو چندوظیفه‌ای، در مقابل 48.3 برای ACT آموزش‌دیده تک‌وظیفه‌ای، که قابل مقایسه نیست. جفت‌سازی تمیز هر دو تک‌وظیفه‌ای بر روی SO-101 pick-and-place است: 90 در مقابل 70 در توزیع، 50 در مقابل 40 خارج از آن. مقایسه کنید در ACT در مقابل SmolVLA و Pi0.5 در مقابل SmolVLA, یا مرور کنید عرصه.

تأخیر و هزینه، استقرار را تعیین می‌کنند

تأخیر استنتاج محدودیتی است که افراد آن را دیرتر کشف می‌کنند و اول از همه پشیمان می‌شوند. یک سیاست که پنج امتیاز در یک بنچمارک بهتر است اما نیم ثانیه در هر گام عملیاتی طول می‌کشد، روی میز کار شما بدتر به نظر می‌رسد: دینامیک تماس منتظر نمی‌ماند.

یک نکته: عدد GR00T با کارت NVIDIA که 4 مرحله حذف نویز و یک دوربین را در 85.8 ms روی H100 در حالت eager، 48.6 ms با torch.compile، 27.9 ms از طریق TensorRT کامل زمان‌بندی می‌کند، مغایرت دارد. 152 ms در اینجا یک عدد کل پشته با سربار سرویس‌دهی و بیش از یک دوربین است، نه یک گذر رو به جلو.

استنتاج از راه دور دارای سقف سختی است

حلقه 20 تا 485 ms متعلق به مدل است و رفت و برگشت‌های اینترنت عمومی به آن اضافه می‌شود. استنتاج از راه دور برای عملیات کند برداشتن و قرار دادن (pick-and-place) قابل اجرا است، نه برای حرکت‌های واکنشی سریع. اگر وظیفه شما به سرعت نیاز دارد، استنتاج باید در کنار سرووها قرار گیرد: ACT یا SmolVLA، به صورت محلی. مرتبط: سیاست در میانه حرکت متوقف می‌شود.

یک راه برای صرفه‌جویی در زمان بدون تغییر مدل: مقاله SmolVLA اجرای همزمان را اندازه‌گیری می‌کند، جایی که سیاست یک بخش را قبل از پیش‌بینی بخش بعدی به پایان می‌رساند، در مقابل اجرای ناهمزمان، جایی که پیش‌بینی با اجرا همپوشانی دارد. موفقیت مشابه است، 78.3 در مقابل 73.3، اما همان عملیات برداشتن و قرار دادن (pick-and-place) به جای 13.75 ثانیه، 9.7 ثانیه طول می‌کشد، و در یک پنجره ثابت ربات 19 چرخه را به جای 9 چرخه مدیریت می‌کند.

مجوزها، بررسی شده‌اند چون هیچ‌کس آن‌ها را بررسی نمی‌کند

مدلمجوز وزن‌هامجوز کداستفاده تجاری
GR00T N1.7NVIDIA Open Model License؛ کارت اجازه استفاده تجاری را می‌دهدApache 2.0بله
GR00T N1.5مجوز یک‌طرفه غیرتجاری NVIDIAApache 2.0خیر
Pi0.5فراداده کارت pi05_base مجوز را gemma می‌خواندApache 2.0 (openpi, LeRobot docs)هر دو را بخوانید، آن‌ها با هم اختلاف دارند
SmolVLAهیچ فیلد مجوزی در کارت smolvla_base وجود نداردApache 2.0 (LeRobot)کد بله، وزن‌ها نامشخص
ACTهیچ وزن پایه ای وجود نداردApache 2.0 (LeRobot)بله

ردیف Pi0.5 نیاز به دقت دارد. مستندات LeRobot pi05 بیان می‌کند که Apache 2.0 با openpi سازگار است، در حالی که کارت هاب برای lerobot/pi05_base شامل license: gemma. هر دو فعال هستند. GR00T N1.7 دارای یک نسخه ملایم‌تری است: README Isaac-GR00T به طور گذرا می‌گوید که N1.7 تحت Apache 2.0 کاملاً قابل مجوزدهی تجاری است، در حالی که بخش مجوز خودش و کارت مدل، فقط کد را تحت Apache 2.0 و وزن‌ها را تحت NVIDIA Open Model License قرار می‌دهند.

پیش‌فرض‌هایی که واقعاً اجرا خواهید کرد

هر فرم آموزش‌دهنده یک پیش‌فرض را ارائه می‌دهد و آنها خودسرانه نیستند. ACT متعلق به LeRobot است: بچ 8، lr 1e-5, 100000 گام‌های آموزشی، اندازه قطعه 100، مطابق با ACTConfig بالادستی و k=100 from the ACT paper. یک ستون در پایین یک تله است.

سیاستبچLRحداکثر گام‌هاتجمع گرادیاناعمال می‌شود؟تنظیمات اضافی
GR00T N1.7321e-4200001بلهsaveSteps
GR00T N1.511e-5200016بلهsaveSteps
Pi0.515e-53000016خیر (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008خیرseed, logFreq
ACT81e-51000001خیرchunkSize, nActionSteps, seed, logFreq
قابلیت بازتولید، تاریخ آگوست 2026

نقطه ورودی تنظیم دقیق GR00T (launch_finetune.py، یک CLI از نوع tyro) دارای فیلد seed ندارد در کلاس داده پیکربندی خود است، بنابراین اجراها به صورت بیت به بیت قابل بازتولید نیستند. مخزن همچنین هشدار می‌دهد که 5 تا 6 درصد واریانس بین اجراها ناشی از افزایش‌های غیرقطعی تصویر، که بزرگتر از اکثر شکاف‌های بنچمارک مورد بحث آنلاین است. seed پیش‌فرض LeRobot 1000 است. ستون تجمع گرادیان، lerobot 0.5.1 را توصیف می‌کند؛ نسخه بالادستی 0.6.2 آن را به عنوان --accelerator.gradient_accumulation.steps نمایش می‌دهد.

تنظیمی که بیش از انتخاب مدل اهمیت دارد

این تکه عمل است. تکه‌های طولانی‌تر حرکت نرم‌تر و خطاهای ترکیبی کمتری ایجاد می‌کنند، اما سیاست در حین اجرای بلوک متعهد می‌شود، بنابراین به هر چیزی که حرکت می‌کند دیر واکنش نشان می‌دهد: در مورد یک مکعب ثابت مطمئن است، اما در مورد یک مکعب غلتان ناامیدکننده. اگر از حد خود فراتر رود، کوتاه کردن بخش اجرا شده بهتر از آموزش مجدد است و رایگان است. مفصلی که زود متوقف می‌شود یک مشکل متفاوت است؛ به .

  • ACT: ACTConfig به طور پیش‌فرض روی chunk_size 100 و n_action_steps 100 تنظیم شده است. تجمیع زمانی خاموش است و به n_action_steps 1 نیاز دارد.
  • GR00T N1.7: افق داخلی از 16 به 40 افزایش یافت، با این حال مثال SO-101 LeRobot همچنان با --policy.chunk_size=16 --policy.n_action_steps=16 اجرا می‌شود. پرچم rollout به --execution-horizon تغییر نام یافت.
  • Pi0.5: یک تکه 50 مرحله‌ای، که دستورالعمل LIBERO LeRobot 10 مرحله آن را از طریق --policy.n_action_steps=10 اجرا می‌کند؛ با --policy.pretrained_path اگر پرچم را حذف کنید، به 50 بازمی‌گردد.
  • SmolVLA: تکه‌های 50 عملی، هر دو کنترل‌کننده در دسترس هستند.

چگونه هر پنج مورد را در یک بعدازظهر بررسی کنیم

ارزان‌ترین پاسخ، مطالعه بیشتر نیست. حدود 15 USD هزینه کنید و بگذارید بازو به شما بگوید: یک بار ضبط کنید، ابتدا مدل ارزان را آموزش دهید، پس از اثبات صحت داده‌ها، مقیاس را افزایش دهید. ساختار بر حجم غلبه می‌کند، این نکته اصلی و .

  1. 1
    ۵۰ اپیزود را یک بار ضبط کنید

    پنجاه اپیزود، مسیر را برای GR00T، Pi0.5 و ACT، و ۳۰ اپیزود برای SmolVLA هموار می‌کند. هر تغییر را به جای پراکنده کردن، تکرار کنید: ۵۰ اپیزود در ۵ موقعیت مکعبی آموزش داده شد، در حالی که ۲۵ اپیزود آموزش داده نشد. برای اطلاعات بیشتر به اولین مجموعه داده خود را ضبط کنید مراجعه کنید.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    ابتدا ACT را آموزش دهید، زیرا نمی‌تواند به شما دروغ بگوید

    بدون وزن‌های از پیش آموزش‌دیده، بنابراین اگر اصلاً وظیفه را انجام می‌دهد، مجموعه داده شما شامل آن وظیفه است. اگر ACT خط صاف نشان داد، داده‌ها را اصلاح کنید. ۱ تا ۳ دلار آمریکا، ۲ تا ۵ ساعت روی یک کارت ۲۴ گیگابایتی.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLA را روی همان مجموعه داده، بدون تغییر اجرا کنید

    همان داده‌ها، همان بازو، ۴۵۰ میلیون پارامتر به جای ۸۰ میلیون، به علاوه شرطی‌سازی زبانی. LeRobot یک اجرای ۲۰ هزار مرحله‌ای را تقریباً ۴ ساعت روی یک A100 تخمین می‌زند. این چیزی است که به شما می‌گوید آیا پیش‌آموزش فایده‌ای دارد یا خیر.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    قبل از کار با GR00T، به v2.1 تبدیل کنید

    GR00T نسخه‌ای از فرمت LeRobot v2 را به همراه یک فایل اضافی meta/modality.json می‌خواند که نحوه تقسیم آرایه‌های حالت و عمل ادغام شده به فیلدهای نام‌گذاری شده را نگاشت می‌کند. یک مجموعه داده v3.0 این لودر را از کار می‌اندازد، زیرا v3.0 بسیاری از اپیزودها را در فایل‌های مشترک بسته‌بندی می‌کند، در حالی که v2 برای هر اپیزود یک فایل می‌نوشت. Isaac-GR00T ابزار کمکی برای کاهش نسخه را به عنوان scripts/lerobot_conversion/convert_v3_to_v2.py ارائه می‌دهد؛ صفحه رد شدن v3 مسیر سریع است.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    فقط در صورتی به GR00T N1.7 ارتقا دهید که دو مورد اول نتیجه کافی ندادند

    از طریق CLI انویدیا، که در اینجا نشان داده شده است، یا نوع سیاست groot LeRobot. انویدیا ۴۰ گیگابایت یا بیشتر VRAM را برای تنظیم دقیق و ۱۶ گیگابایت را برای استنتاج توصیه می‌کند. در صورت بروز OOM، به صفحه OOM مراجعه کنید.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

دو روش برای اجرای این مرحله غربالگری

سه محیط، زیرا زنجیره‌های ابزار با هم سازگار نیستند. LeRobot در شاخه اصلی نسخه 0.6.2 است و به پایتون 3.12 یا جدیدتر نیاز دارد؛ Isaac-GR00T و openpi مخازن جداگانه مدیریت شده توسط uv هستند.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T نسخه 0.8.0 torchcodec را به عنوان تنها بک‌اند ویدیویی خود استفاده می‌کند که به FFmpeg 4 تا 7 نیاز دارد. FFmpeg 8 پشتیبانی نمی‌شود و AV1 تضمین شده نیست.
  • حداقل حافظه مورد نیاز openpi: استنتاج بالای ۸ گیگابایت، LoRA بالای ۲۲.۵ گیگابایت، تنظیم دقیق کامل بالای ۷۰ گیگابایت. مورد آخر دلیل اینکه Pi0.5 یک کار A100 است.
  • GPU را خودتان اجاره کنید، پس از اتمام کار آن را از بین ببرید، و سه مجموعه مسیر چک‌پوینت را به صورت دستی تطبیق دهید.

مدل پایه یا از ابتدا

چالش اصلی این نیست که کدام مدل 3B را انتخاب کنیم. بلکه این است که آیا اصلاً از یک VLA از پیش آموزش‌دیده استفاده کنیم یا خیر، با توجه به اینکه ACT شش وظیفه واقعی دو دستی را از حدود ده دقیقه نمایش برای هر کدام، با 80 میلیون پارامتر و بدون هیچ آموزش قبلی یاد گرفت.

تنظیم دقیق یک VLA از پیش آموزش‌دیده به جای آموزش ACT از ابتدا
چه چیزی به دست می‌آورید
  • شرطی‌سازی زبانی. ACT هیچ‌کدام را ندارد؛ یک نقطه بازرسی ACT یک وظیفه را انجام می‌دهد.
  • عملکرد بهتر روی اشیایی که در نمایش‌های شما غایب هستند: روی SO-101، 50% در مقابل 40% ACT خارج از توزیع.
  • چند وظیفه‌ای بودن: SmolVLA با یک نقطه بازرسی به 78.3% در سه وظیفه SO-100 می‌رسد؛ ACT فقط به صورت تک وظیفه‌ای اجرا شد.
چه چیزی برای شما هزینه دارد
  • 7.6 تا 24 برابر تأخیر بیشتر: 152 تا 485 میلی‌ثانیه در هر گام عملیاتی در مقابل 20 میلی‌ثانیه ACT.
  • 4 تا 12 دلار آمریکا به ازای هر اجرا به جای 1 تا 3 دلار، و نیاز به رده A100 به جای هر کارت 24 گیگابایتی.
  • ریسک مجوز، به علاوه حالت خرابی مخزن محدود (gated-repo) که از ابتدا وجود ندارد.
  • وزن‌های از پیش آموزش‌دیده می‌توانند یک مجموعه داده بد را پنهان کنند. یک تنظیم دقیق که روی داده‌های خراب نیمه‌کاره عمل می‌کند، قبل از اینکه به داده‌ها نگاه کنید، یک هفته هزینه دارد.

مورد بازتولید یک اجرای قدیمی

دنبال کردن یک نقطه بازرسی 2025، انتخاب مدل را برای شما انجام می‌دهد و مشکل را به تثبیت نسخه تبدیل می‌کند: LeRobot فعلی N1.5 را رد می‌کند، بنابراین شما lerobot==0.5.1. با عدم وجود فیلد seed و 5 تا 6 درصد واریانس بین اجراها، بازتولید به طور ذاتی تقریبی است. و جنبه پلتفرم را پوشش می‌دهند.

صفحه مقایسه رو در رو AY-Robots برای GR00T N1.7 در برابر Pi0.5، که تعداد پارامترها، الزامات GPU، تأخیر استنتاج، فرمت مجموعه داده و حداقل تعداد اپیزودها را در کنار هم نشان می‌دهد.
مقایسه رو در رو در /compare/groot-n1-7-vs-pi0-5. دو مدل 3 B در برگه مشخصات قابل تعویض به نظر می‌رسند اما اینطور نیستند: یکی LeRobot v2.1 می‌خواهد، دیگری v3.0.

به دو مورد رسیدید؟ ACT در برابر GR00T N1.7 و GR00T N1.7 در برابر SmolVLA. ردیف‌های خام در ورودی‌های آرنا قرار دارند: GR00T N1.7، Pi0.5، SmolVLA و ACT.

مواردی که این پلتفرم به شما کمک نمی‌کند

  • این پلتفرم نمی‌تواند استنتاج از راه دور را سریع کند. حلقه 20 تا 485 میلی‌ثانیه متعلق به مدل است؛ رفت و برگشت‌های اینترنتی به آن اضافه می‌شوند.
  • این پلتفرم نمی‌تواند GR00T یا Pi0.5 را روی سخت‌افزار شما تنظیم دقیق کند. هر دو در اینجا فقط ابری هستند؛ فقط SmolVLA و ACT به صورت محلی اجرا می‌شوند.
  • این پلتفرم نمی‌تواند یک مجموعه داده را اصلاح کند. افت ضرر اما سیاست هیچ کاری نمی‌کند یک مشکل داده‌ای است، سیاستی که فقط در یک تنظیم کار می‌کند یک مشکل پوشش است.
  • این پلتفرم نمی‌تواند اجرای GR00T را قابل بازتولید کند: پیکربندی بالادستی فیلد seed ندارد.

85 مدل، 332 نتیجه بنچمارک، هر عدد لینک شده به منبع خود

نسخه قابل مرتب‌سازی جداول در این صفحه: 85 مدل بینایی-زبان-عمل، 332 نتیجه بنچمارک، که هر کدام به مقاله یا کارت مدل خود لینک شده‌اند.

باز کردن میدان

انتخاب یکی و ادامه دادن

یک پیش‌فرض: 50 اپیزود را ضبط کنید، ACT را با هزینه 1 تا 3 USD آموزش دهید تا مجموعه داده را اثبات کنید، سپس SmolVLA را روی همان داده‌ها. مجموعاً کمتر از 6 USD، و آنها به سوال مهم پاسخ می‌دهند: آیا پیش‌آموزش در اینجا کمک می‌کند، یا آیا گلوگاه داده‌ها هستند. برای وظایف چندمرحله‌ای با تماس زیاد به GR00T N1.7، و برای زمانی که صحنه تغییر می‌کند به Pi0.5 ارتقا دهید.

راهنمای پلتفرم: اولین خط‌مشی خود را آموزش دهید، سپس اولین خط‌مشی خود را اجرا کنید. مستندات آموزش و مستندات مجموعه داده شکل و فرمت را پوشش می‌دهند؛ صفحه SO-100 و راهنمای کامل SO-100 ساخت و کالیبراسیون را پوشش می‌دهند. پیش‌زمینه: مرور کلی VLA و مقاله تطبیق جریان Pi0. موردی که نرخ موفقیت شما را افزایش می‌دهد، راهنمای کیفیت داده.

کدام سیاست VLA را باید ابتدا روی SO-100 آموزش دهم؟

ACT، سپس SmolVLA. ACT از ابتدا آموزش می‌بیند، بنابراین نمی‌تواند یک مجموعه داده بد را پنهان کند، و هر اجرا 1 تا 3 USD روی یک کارت 24 GB هزینه دارد. اگر ACT اصلاً وظیفه را انجام دهد، 4 تا 12 USD برای اجرای GR00T N1.7 یا Pi0.5 هدر نمی‌رود.

آیا GR00T N1.7 واقعاً بهتر از Pi0.5 است؟

در LIBERO، تفاوت‌ها در حد نویز هستند: 97.0% در چهار مجموعه برای GR00T N1.7، 96.85% برای Pi0.5 در 30k گام در openpi، 97.5% برای پورت LeRobot، همه از هارنس‌های مختلف. تفاوت‌های واقعی 152 ms در هر گام عملیاتی در مقابل 485 ms، مجموعه داده‌های v2.1 در مقابل v3.0، و دقت بنچمارک در مقابل تعمیم‌پذیری در دنیای باز هستند.

آیا می‌توانم هر یک از این‌ها را روی یک RTX 4090 تنظیم دقیق کنم؟

SmolVLA و ACT، بله؛ هر دو برای یک RTX 4090 یا هر کارت 24 GB فهرست شده‌اند و به صورت محلی اجرا می‌شوند. GR00T N1.7، N1.5 و Pi0.5 به یک A100 یا H100 80 GB نیاز دارند و در اینجا فقط ابری هستند. NVIDIA برای تنظیم دقیق GR00T، 40 GB یا بیشتر را توصیه می‌کند؛ حداقل حافظه مورد نیاز openpi برای تنظیم دقیق کامل Pi0.5 بالای 70 GB و برای LoRA 22.5 GB است.

کدام یک از این پنج مورد را می‌توانم به صورت تجاری استفاده کنم؟

وزن‌های GR00T N1.7 تحت توافقنامه مجوز مدل باز NVIDIA هستند که کارت بیان می‌کند استفاده تجاری را پوشش می‌دهد. وزن‌های N1.5 غیرتجاری هستند. کد SmolVLA در LeRobot تحت Apache 2.0 است، اما کارت lerobot/smolvla_base فیلد مجوز ندارد، بنابراین وزن‌ها نامشخص هستند. ACT هیچ وزن پایه برای مجوز ندارد. Pi0.5 مبهم است: مستندات LeRobot می‌گویند Apache 2.0، اما متادیتای کارت آن license: gemma را نشان می‌دهد.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started