
GR00T N1.7، Pi0.5، SmolVLA، ACT یا GR00T N1.5؟ ایک فیصلہ کن جدول جو حقیقی حالات سے مماثل ہے، شائع شدہ بینچ مارک نمبرز، لیٹنسی، فی رن لاگت اور ہر انتخاب کے پیچھے لائسنسز کے ساتھ۔
آج SO-100 کلاس کے بازو پر پانچ پالیسیاں تربیت کے قابل ہیں۔ ان میں انفرنس لیٹنسی میں 24، پیرامیٹر کاؤنٹ میں 37 اور ایک رن کی لاگت میں 12 کا فرق ہے، اور اس میں بھی کہ آیا آپ نتیجہ بھیج سکتے ہیں۔ پانچ ماڈل کارڈز اس کا فیصلہ نہیں کریں گے: کوئی بھی اس سوال کا جواب نہیں دیتا جو آپ کے پاس ہے، میں پہلے کون سا چلاؤں؟
نیچے ہر نمبر اگست 2026 میں کاغذات، ریپوز اور کارڈز سے پڑھا گیا تھا۔ پلیٹ فارم کے نمبرز سے آتے ہیں AY-Robots پالیسی کیٹلاگ؛ جہاں دونوں متفق نہیں ہوتے، دونوں دکھائے جاتے ہیں۔
مختصر ورژن
- •اگر آپ کو اپنے ڈیٹا سیٹ پر شک ہے تو پہلے ACT کو تربیت دیں: 1 سے 3 USD فی رن، خراب ڈیٹا کو چھپانے کے لیے کچھ بھی پری ٹرینڈ نہیں۔
- •GR00T N1.7 اور Pi0.5 LIBERO پر آدھے پوائنٹ کے اندر ہیں، 97.0 بمقابلہ 96.85 سے 97.5۔ یہ کسی ایک کو منتخب کرنے کی وجہ نہیں ہے۔
- •Pi0.5 عمومیت کا کھیل ہے، درستگی کا نہیں، اور 485 ms پر سب سے سست ہے۔
- •SmolVLA، 450 M پیرامیٹرز پر، یہاں واحد VLA ہے جو ایک 24 GB کارڈ پر فائن ٹیون ہوتا ہے۔
- •ACT 20 ms پر تیز رد عمل کی حرکت کے لیے واحد آپشن ہے۔ لائسنس باقی کا فیصلہ کرتے ہیں۔
فیصلے کی میز
| آپ کی صورتحال | اسے تربیت دیں | کیوں |
|---|---|---|
| ڈیٹا سیٹ کا معیار غیر ثابت شدہ | ACT | کوئی بھی پری ٹرینڈ ماڈل خراب ڈیٹا سیٹ کو نہیں چھپا سکتا، اور ناکامی پر 1 سے 3 USD لاگت آتی ہے۔ |
| رابطہ سے بھرپور، کثیر مراحل، زبان سے مشروط | GR00T N1.7 | چار LIBERO سوئیٹس پر 97.0%، علاوہ ازیں ایک نسبتی اینڈ-ایفیکٹر ایکشن اسپیس۔ |
| تیز رد عمل کی حرکت، سرووز پر انفرنس | ACT | 20 ms۔ اگلا تیز ترین 7.6 گنا سست ہے۔ |
| نئی اشیاء، نیا منظر، کھلی دنیا | Pi0.5 | آؤٹ آف ڈسٹری بیوشن رویے کے لیے بنایا گیا، 104 مقامات تک۔ |
| ایک 24 GB کارڈ، پھر بھی زبان چاہتے ہیں | SmolVLA | 450 M پیرامیٹرز، 30 ایپیسوڈ کی حد، مقامی طور پر چلتا ہے۔ |
| 2025 میں ریکارڈ کی گئی رن کو دوبارہ تیار کرنا | GR00T N1.5 | صرف اگر آپ کو لازمی ہو: LeRobot اب اسے مسترد کرتا ہے، وزن غیر تجارتی ہیں۔ |
| یہ ایک پروڈکٹ کے طور پر بھیجا جائے گا | N1.7, SmolVLA or ACT | N1.5 غیر تجارتی ہے، Pi0.5 میں Gemma کی شرائط ہیں، SmolVLA کے کارڈ میں کوئی نہیں ہے۔ |
پانچ امیدوار
تمام پانچ پالیسیاں ہیں: کیمرہ فریمز، جوائنٹ پوزیشنز اور، ان میں سے چار کے لیے، ایک زبان کی ہدایت، جو مستقبل کے جوائنٹ ٹارگٹس کے ایک حصے سے منسلک ہے۔ جو چیز انہیں الگ کرتی ہے وہ یہ ہے کہ آپ کے آنے سے پہلے کتنا سیکھا گیا تھا۔
| پالیسی | پیرامیٹرز | لیٹنسی | GPU ٹیر | مقامی؟ | کم از کم ایپیسوڈز | فارمیٹ | لاگت |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA کا موجودہ ویژن-لینگویج-ایکشن ماڈل، تقریباً 3 بلین پیرامیٹرز، جس میں سے تقریباً 40 ملین کی تربیت فائن ٹیوننگ کے دوران کی گئی۔ ریپو میں N1.6 سے ہونے والی تبدیلیاں درج ہیں: بیک بون کو ایک وینڈرڈ Eagle ماڈل سے Qwen3-VL پر Cosmos-Reason2-2B میں تبدیل کیا گیا، ڈفیوژن لیئرز 32 سے 16، اسٹیٹ اور ایکشن ڈائمینشنز 29 سے 132، ایکشن ہورائزن 16 سے 40۔
ایک چھوٹے بازو پر جو چیز اہمیت رکھتی ہے وہ نسبتی اینڈ-ایفیکٹر ایکشن اسپیس ہے: N1.7 موجودہ پوز سے ڈیلٹا کی پیش گوئی کرتا ہے، جو 20K گھنٹے کی EgoScale انسانی ویڈیو کو روبوٹ پالیسی میں منتقل کرنے کی اجازت دیتا ہے۔ تفصیلات N1.7 صفحہ پر، طریقہ کار N1.7 برائے SO-100 گائیڈ میں۔
Isaac-GR00T README N1.7 کو ایک جنرل اویلیبلٹی ریلیز قرار دیتا ہے، جس میں مکمل بینچ مارکس اور سپورٹ شامل ہے۔ اس کا Hugging Face کارڈ ابھی تک اپ ڈیٹ نہیں ہوا ہے: Model Version فیلڈ اب بھی GR00T N1.7 EA دکھاتا ہے۔ ریپو جدید ترین دستاویز ہے۔
GR00T N1.5
وہی 3 B اسکیل، ایگل 2 بیک بون، سگ لپ 2 اور T5، فلو-میچنگ ڈی آئی ٹی ہیڈ۔ یہ ایک موجودہ کو بڑھانے کے لیے موجود ہے۔ دو چیزیں اسے ایک ناقص ڈیفالٹ بناتی ہیں: اس کے وزن کے ساتھ NVIDIA's one-way non-commercial licence, اور LeRobot کی موجودہ ریلیز نے N1.5 سپورٹ ہٹا دی ہے۔ دیکھیں۔
Pi0.5
فزیکل انٹیلی جنس کا VLA، پالیسی کی قسم pi05۔ یہ مقالہ PaliGemma سے شروع کیا گیا ایک 2 B VLM اور ایک 300 M ایکشن ایکسپرٹ پیش کرتا ہے، جو روبوٹ کو 50 Hz پر چلاتا ہے؛ LeRobot کی pi05 کنفگ ڈیفالٹ کے طور پر 50 قدموں کا چنک استعمال کرتی ہے، اس رفتار پر ایک سیکنڈ۔ اس کا اہم فائدہ غیر دیکھی ہوئی جگہیں ہیں: حقیقی گھروں میں تقریباً 400 گھنٹے کی موبائل مینیپولیشن، اور 3، 12، 22، 53، 82 اور 104 مقامات پر ایک اسکیلنگ اسٹڈی، جہاں 104 مقامات والے ماڈل نے خود ٹیسٹ گھروں پر تربیت یافتہ کنٹرول سے مطابقت اختیار کی۔
ایک حد، جو کہ lerobot/pi05_base کارڈ پر بیان کی گئی ہے: پورٹ صرف فلو-میچنگ ایکشن ہیڈ کو لے جاتا ہے۔ سب ٹاسک کی پیش گوئی، ایکشن ٹوکنائزیشن اور RL کو اپ اسٹریم جاری نہیں کیا گیا تھا، اور اوپن پائی اپنی ریپوزٹری کے بارے میں بھی یہی کہتا ہے۔ Pi0.5 صفحہ اور SO-100 پر Pi0.5 گائیڈ میں باقی معلومات موجود ہیں۔
Pi0.5 کو گیٹڈ google/paligemma-3b-pt-224 ٹوکنائزر کی ضرورت ہے (gated: manual، اگرچہ گوگل کا کہنا ہے کہ درخواستیں فوری طور پر پروسیس کی جاتی ہیں)۔ اسے قبول کیے بغیر اور ٹریننگ ماحول میں hf auth login چلائے بغیر، جاب شروع ہوتی ہے، کچھ دیر ڈاؤن لوڈ ہوتی ہے، پھر ایک اجازت کی خرابی پر ختم ہو جاتی ہے جو نیٹ ورک کی خرابی جیسی لگتی ہے۔ nvidia/GR00T-N1.7-3B گیٹڈ نہیں ہے، لیکن اس کا nvidia/Cosmos-Reason2-2B بیک بون گیٹڈ ہے (gated: auto)۔ کیو میں ڈالنے سے پہلے دونوں کو صاف کریں؛ اگر کوئی رن بیکار پڑا رہتا ہے، تو پھنسے ہوئے کیو کا صفحہ یہ بتاتا ہے کہ کیا چیک کرنا ہے۔
SmolVLA
450 M پیرامیٹرز، جن میں سے تقریباً 100 M ایکشن ایکسپرٹ میں ہیں، SmolVLM-2 پر VLM کو منجمد کر کے اور صرف اس کی پہلی 16 لینگویج ماڈل لیئرز استعمال کی گئیں۔ پری ٹریننگ کمیونٹی ڈیٹا پر کی گئی تھی: 481 ڈیٹا سیٹس، 10.6 M فریمز، انہی سستے آرمز سے جو آپ استعمال کرتے ہیں۔ یہاں واحد VLA جو ایک 24 GB کارڈ میں فٹ ہوتا ہے، اور واحد 30 ایپیسوڈ فلور۔ مزید دیکھیں SmolVLA صفحہ.
ACT
یہ کوئی فاؤنڈیشن ماڈل نہیں ہے۔ ALOHA کا ایکشن چنکنگ ٹرانسفارمر تقریباً 80 M پیرامیٹرز پر مشتمل ہے جو ہر کام کے لیے شروع سے تربیت یافتہ ہے، 50 Hz پر 50 مظاہروں پر۔ مقالے میں تقریباً دس منٹ کے مظاہروں سے چھ حقیقی دوہاتھوں والے کاموں کی اطلاع دی گئی ہے، جن مثالوں کو یہ نمایاں کرتا ہے ان پر 80 سے 90 فیصد کامیابی کے ساتھ۔ اس کا خیال، ایکشن چنکنگ، اس صفحے پر موجود ہر ماڈل میں شامل ہے، اور اس کا ایبلیشن اب بھی پیمائش کرتا ہے اثر کو بہترین طریقے سے: ٹیمپورل اینسیمبلنگ بند ہونے کے ساتھ دو نقلی کاموں پر، کامیابی 1 فیصد (k=1 پر) سے بڑھ کر 44 فیصد (k=100 پر) ہو جاتی ہے۔ ACT صفحہ میں باقی تفصیلات ہیں۔
بینچ مارکس دراصل کیا کہتے ہیں
LIBERO وہ واحد بینچ مارک ہے جس پر ان پانچ میں سے تین رپورٹ کرتے ہیں: ایک نقلی فرینکا پانڈا پر زبان سے مشروط کام، جو نیچے دیے گئے چار سوئیٹس میں تقسیم ہیں، ہر ایک میں دس کام۔ NVIDIA نے ہر سوئیٹ کے لیے 200 ٹرائلز چلائے۔
| Model | Spatial | Object | Goal | 10 (Long) | Average |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
ہر نمبر ایک مختلف ہارنس اور بجٹ سے آتا ہے۔ GR00T نے گلوبل بیچ 640 پر 20K سٹیپس چلائے؛ اوپن پائی کا اعداد و شمار ایک 30K چیک پوائنٹ ہے؛ LeRobot پورٹ نے LIBERO بیس ماڈل میں 6K سٹیپس کا اضافہ کیا۔ SmolVLA مزید ایک عدم مطابقت ہے: اس کا پیپر اس قطار کو LIBERO پر شروع سے تربیت دیتا ہے، بغیر کسی VLA پری ٹریننگ کے، جبکہ اس کے اوپر والے تین پری ٹرینڈ چیک پوائنٹس کو فائن ٹیون کرتے ہیں۔ 96.85 سے 97.5 کو ایک کلسٹر سمجھیں، اور 87.3% تک کے فرق کو حقیقی سمجھیں لیکن یہ 6.7 گنا زیادہ پیرامیٹرز کے ساتھ حاصل کیا گیا ہے۔
SimplerEnv پھیلاؤ کو ظاہر کرتا ہے، جو LIBERO نہیں کرتا۔ NVIDIA N1.7 کا موازنہ N1.6 سے کرتا ہے، جو 'نسلی ڈیلٹا' کے قریب ترین عوامی چیز ہے۔نسلی ڈیلٹا۔
| SimplerEnv suite | N1.6 average | N1.7 average | Best swing | Worst swing |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
برج رو مفید ہے: اوسطاً 5.7 پوائنٹس حاصل کیے گئے جبکہ put_eggplant_in_basket نے 36 کھوئے اور put_eggplant_in_sink 33 سے 2 پر آ گیا۔ ایک نئی نسل تقسیم کو اٹھانے کے بجائے حرکت دیتی ہے، لہذا اگر آپ کا کام وہاں ہے جہاں N1.7 نے تنزلی کی، تو اوسط کچھ نہیں کہتی۔

پانچ میں سے، صرف SmolVLA پیپر SO-100 کلاس آرم پر رپورٹ کرتا ہے: تین کاموں میں SmolVLA کے لیے 78.3 فیصد اور Pi0 کے لیے 61.7 فیصد، دونوں ملٹی ٹاسک، ACT کے لیے 48.3 کے مقابلے میں جو سنگل ٹاسک پر تربیت یافتہ ہے، جو کہ ایک جیسی موازنہ نہیں ہے۔ صاف جوڑا SO-101 پک اینڈ پلیس پر دونوں سنگل ٹاسک ہیں: تقسیم میں 70 کے مقابلے میں 90، اس سے باہر 40 کے مقابلے میں 50۔ موازنہ کریں ACT کا SmolVLA سے موازنہ اور Pi0.5 کا SmolVLA سے موازنہ، یا براؤز کریں ارینا۔
لیٹنسی اور لاگت تعیناتی کا فیصلہ کرتی ہیں
انفرنس لیٹنسی وہ رکاوٹ ہے جسے لوگ سب سے آخر میں دریافت کرتے ہیں اور سب سے پہلے پچھتاتے ہیں۔ ایک پالیسی جو بینچ مارک پر پانچ پوائنٹس بہتر ہے لیکن فی ایکشن سٹیپ آدھا سیکنڈ لیتی ہے، آپ کی میز پر بدتر لگتی ہے: رابطے کی حرکیات انتظار نہیں کرتیں۔
ایک انتباہ: GR00T کا اعداد و شمار NVIDIA کے کارڈ سے متفق نہیں ہے، جو 4 ڈینوائزنگ سٹیپس اور ایک کیمرے کو H100 پر ایگر موڈ میں 85.8 ms، torch.compile کے ساتھ 48.6 ms، مکمل TensorRT کے ذریعے 27.9 ms پر وقت دیتا ہے۔ یہاں 152 ms سرونگ اوور ہیڈ اور ایک سے زیادہ کیمروں کے ساتھ ایک مکمل اسٹیک کا اعداد و شمار ہے، نہ کہ صرف ایک فارورڈ پاس۔
20 سے 485 ms کا لوپ ماڈل کا ہے، اور پبلک انٹرنیٹ راؤنڈ ٹرپس اس میں اضافہ کرتے ہیں۔ ریموٹ انفرنس سست پک اینڈ پلیس کے لیے قابل عمل ہے، تیز رد عمل والی حرکت کے لیے نہیں۔ اگر آپ کے کام کو رفتار کی ضرورت ہے، تو انفرنس سرووز کے ساتھ ہی موجود ہے: ACT یا SmolVLA، مقامی طور پر۔ متعلقہ: پالیسی حرکت کے دوران منجمد ہو جاتی ہے۔
ماڈل کو تبدیل کیے بغیر وقت حاصل کرنے کا ایک طریقہ: SmolVLA پیپر ہم وقت ساز (synchronous) عمل درآمد کی پیمائش کرتا ہے، جہاں پالیسی اگلے کی پیش گوئی کرنے سے پہلے ایک ٹکڑا مکمل کرتی ہے، بمقابلہ غیر ہم وقت ساز (asynchronous)، جہاں پیش گوئی عمل درآمد کے ساتھ اوورلیپ کرتی ہے۔ کامیابی یکساں ہے، 78.3 بمقابلہ 73.3، لیکن وہی پک اینڈ پلیس 13.75 کے بجائے 9.7 سیکنڈ لیتا ہے، اور ایک مقررہ ونڈو میں روبوٹ 9 کے بجائے 19 سائیکل سنبھالتا ہے۔
لائسنس، جانچے گئے کیونکہ کوئی انہیں نہیں جانچتا
| ماڈل | وزن کا لائسنس | کوڈ کا لائسنس | تجارتی استعمال |
|---|---|---|---|
| GR00T N1.7 | NVIDIA اوپن ماڈل لائسنس؛ کارڈ تجارتی استعمال کی اجازت دیتا ہے | Apache 2.0 | ہاں |
| GR00T N1.5 | NVIDIA یک طرفہ غیر تجارتی لائسنس | Apache 2.0 | نہیں |
| Pi0.5 | pi05_base کارڈ میٹا ڈیٹا میں license: gemma لکھا ہے | Apache 2.0 (openpi, LeRobot دستاویزات) | دونوں کو پڑھیں، وہ متفق نہیں ہیں |
| SmolVLA | smolvla_base کارڈ پر کوئی لائسنس فیلڈ نہیں ہے | Apache 2.0 (LeRobot) | کوڈ ہاں، وزن غیر بیان شدہ |
| ACT | کوئی بنیادی وزن موجود نہیں ہے | Apache 2.0 (LeRobot) | ہاں |
Pi0.5 کی قطار کو احتیاط کی ضرورت ہے۔ LeRobot pi05 دستاویزات میں Apache 2.0 کا ذکر ہے جو openpi کے مطابق ہے، جبکہ ہب کارڈ برائے lerobot/pi05_base میں license: gemma۔ دونوں فعال ہیں۔ GR00T N1.7 کا ایک نرم ورژن ہے: Isaac-GR00T README میں اتفاقاً کہا گیا ہے کہ N1.7 Apache 2.0 کے تحت مکمل طور پر تجارتی طور پر لائسنس یافتہ ہے، جبکہ اس کا اپنا لائسنس سیکشن اور ماڈل کارڈ صرف کوڈ کو Apache 2.0 کے تحت اور وزن کو NVIDIA اوپن ماڈل لائسنس کے تحت رکھتے ہیں۔
وہ ڈیفالٹس جو آپ درحقیقت چلائیں گے
ہر ٹرینر فارم ایک ڈیفالٹ کے ساتھ آتا ہے، اور وہ من مانی نہیں ہوتے۔ ACT کے LeRobot کے اپنے ہیں: بیچ 8، lr 1e-5, 100000 ٹریننگ سٹیپس، چنک سائز 100، ACTConfig اپ اسٹریم سے مماثل اور k=100 from the ACT paper. نیچے ایک کالم ایک جال ہے۔
| پالیسی | بیچ | LR | زیادہ سے زیادہ سٹیپس | گریڈ ایکم | لاگو ہوتا ہے؟ | اضافی کنٹرولز |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
GR00T کا فائن ٹیوننگ انٹری پوائنٹ (launch_finetune.py، ایک ٹائرو CLI) اپنی کنفگ ڈیٹا کلاس میں کوئی سیڈ فیلڈ نہیں رکھتا، لہذا رنز بٹ بہ بٹ دوبارہ پیدا نہیں کیے جا سکتے۔ ریپو غیر متعین امیج آگمینٹیشنز کی وجہ سے رنز کے درمیان 5 سے 6 فیصد فرق کی بھی خبردار کرتا ہے، جو آن لائن بحث کیے جانے والے زیادہ تر بینچ مارک گیپس سے زیادہ ہے۔ LeRobot کا ڈیفالٹ سیڈ 1000 ہے۔ گریڈ ایکم کالم lerobot 0.5.1 کو بیان کرتا ہے؛ اپ اسٹریم 0.6.2 اسے --accelerator.gradient_accumulation.steps کے طور پر ظاہر کرتا ہے۔
وہ کنٹرول جو ماڈل کے انتخاب سے زیادہ اہمیت رکھتا ہے
یہ ایکشن چنک ہے۔ لمبے چنکس ہموار حرکت اور کم پیچیدہ غلطیاں دیتے ہیں، لیکن پالیسی بلاک کے عمل کے دوران پابند ہوتی ہے، لہذا یہ حرکت کرنے والی کسی بھی چیز پر دیر سے رد عمل ظاہر کرتی ہے: ایک ساکن کیوب پر پراعتماد، گھومنے والے پر مایوس کن۔ اگر یہ حد سے تجاوز کر جائے، تو عمل شدہ حصے کو مختصر کرنا دوبارہ تربیت سے بہتر ہے اور مفت ہے۔ ایک جوائنٹ جو جلدی رک جاتا ہے وہ ایک مختلف مسئلہ ہے؛ دیکھیں ۔
- ACT: ACTConfig بطور ڈیفالٹ
chunk_size 100اورn_action_steps 100پر سیٹ ہوتا ہے۔ ٹیمپورل اینسیمبلنگ بند ہے اور اسےn_action_steps 1درکار ہے۔ - GR00T N1.7: اندرونی افق 16 سے 40 تک گیا، پھر بھی LeRobot کا SO-101 مثال اب بھی
--policy.chunk_size=16 --policy.n_action_steps=16پر چلتا ہے۔ رول آؤٹ فلیگ کا نام بدل کر--execution-horizonکر دیا گیا ہے۔ - Pi0.5: ایک 50-اسٹیپ چنک، جس میں سے LeRobot کی LIBERO ریسیپی
--policy.n_action_steps=10کے ذریعے 10 کو عمل میں لاتی ہے؛--policy.pretrained_pathکے ساتھ اگر آپ فلیگ کو چھوڑ دیتے ہیں تو یہ 50 پر واپس آ جاتا ہے۔ - SmolVLA: 50-ایکشن چنکس، دونوں نوبس ظاہر ہیں۔
ایک دوپہر میں پانچوں کو کیسے اسکرین کیا جائے
سب سے سستا جواب مزید پڑھنا نہیں ہے۔ تقریباً 15 USD خرچ کریں اور بازو کو آپ کو بتانے دیں: ایک بار ریکارڈ کریں، پہلے سستے ماڈل کو تربیت دیں، ایک بار جب یہ ڈیٹا کو درست ثابت کر دے تو اسے بڑھائیں۔ ساخت حجم سے بہتر ہے، جس کا مقصد ہے اور ۔
- 150 ایپی سوڈز ایک بار ریکارڈ کریں
یہ GR00T، Pi0.5 اور ACT کے لیے 50 اور SmolVLA کے لیے 30 کا راستہ صاف کرتا ہے۔ ہر تغیر کو پھیلانے کے بجائے دہرائیں: 5 کیوب پوزیشنز پر 50 ایپی سوڈز کو تربیت دی گئی جہاں 25 کو نہیں دی گئی۔ اپنا پہلا ڈیٹا سیٹ ریکارڈ کریں دیکھیں۔
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2پہلے ACT کو تربیت دیں، کیونکہ یہ آپ سے جھوٹ نہیں بول سکتا
کوئی پہلے سے تربیت یافتہ وزن نہیں، لہذا اگر یہ کام بالکل کرتا ہے، تو آپ کے ڈیٹا سیٹ میں یہ کام شامل ہے۔ اگر ACT فلیٹ لائن ہو جائے، تو ڈیٹا کو درست کریں۔ 1 سے 3 USD، 24 GB کارڈ پر 2 سے 5 گھنٹے۔
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3SmolVLA کو اسی ڈیٹا سیٹ پر چلائیں، بغیر کسی تبدیلی کے
وہی ڈیٹا، وہی بازو، 80M کے بجائے 450M پیرامیٹرز، نیز زبان کی کنڈیشنگ۔ LeRobot ایک A100 پر تقریباً 4 گھنٹے میں 20K قدموں کی رن مکمل کرتا ہے۔ یہ آپ کو بتاتا ہے کہ آیا پری ٹریننگ سے کوئی فائدہ ہوتا ہے۔
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00T کو چھونے سے پہلے v2.1 میں تبدیل کریں
GR00T LeRobot v2 فارمیٹ کا ایک ذائقہ پڑھتا ہے جس میں ایک اضافی
meta/modality.jsonشامل ہے جو یہ بتاتا ہے کہ مربوط حالت اور ایکشن اریوں کو نامزد فیلڈز میں کیسے تقسیم کیا جاتا ہے۔ ایک v3.0 ڈیٹا سیٹ اس لوڈر کو کریش کر دیتا ہے، کیونکہ v3.0 بہت سے ایپی سوڈز کو مشترکہ فائلوں میں پیک کرتا ہے جہاں v2 نے فی ایپی سوڈ ایک لکھا تھا۔ Isaac-GR00T ڈاؤن گریڈ ہیلپر کوscripts/lerobot_conversion/convert_v3_to_v2.pyکے طور پر بھیجتا ہے؛ v3 مسترد کرنے والا صفحہ تیز راستہ ہے۔text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5GR00T N1.7 پر صرف اس صورت میں جائیں جب پہلے دو نے کچھ باقی چھوڑ دیا ہو
NVIDIA کے CLI کے ذریعے، جو یہاں دکھایا گیا ہے، یا LeRobot کی
grootپالیسی قسم کے ذریعے۔ NVIDIA فائن ٹیوننگ کے لیے 40 GB یا اس سے زیادہ VRAM، اور انفرنس کے لیے 16 GB کی سفارش کرتا ہے۔ OOM پر، OOM صفحہ دیکھیں۔bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
اس اسکریننگ پاس کو چلانے کے دو طریقے
تین ماحول، کیونکہ ٹول چینز ایک ساتھ موجود نہیں ہیں۔ مین پر LeRobot 0.6.2 ہے اور اسے Python 3.12 یا اس سے نیا ورژن درکار ہے؛ Isaac-GR00T اور openpi الگ الگ uv-منظم ریپوز ہیں۔
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0 کو اپنے واحد ویڈیو بیک اینڈ کے طور پر استعمال کرتا ہے، جس کے لیے FFmpeg 4 سے 7 کی ضرورت ہوتی ہے۔ FFmpeg 8 غیر تعاون یافتہ ہے، AV1 کی ضمانت نہیں ہے۔ - openpi میموری کی حدیں: انفرنس 8 GB سے اوپر، LoRA 22.5 GB سے اوپر، مکمل فائن ٹیوننگ 70 GB سے اوپر۔ آخری وجہ یہ ہے کہ Pi0.5 ایک A100 کا کام ہے۔
- GPU خود کرایہ پر لیں، بعد میں اسے ختم کر دیں، چیک پوائنٹ کے تین سیٹوں کے راستوں کو دستی طور پر ہم آہنگ کریں۔
وہی پانچ ماڈلز، ایک ہی فارم۔ ماڈل، ڈیٹا سیٹ اور ہائپر پیرامیٹرز کا انتخاب کریں؛ بیک اینڈ مطلوبہ VRAM کے مطابق ایک GPU کرایہ پر لیتا ہے، ٹرینر چلاتا ہے اور آبجیکٹ اسٹوریج میں لکھتا ہے۔
- ٹریننگ میٹرکس پانچ ماڈلز اور چار بازوؤں پر مشتمل ہے، ہر سیل ایک گائیڈ ہے: SmolVLA on SO-100، ACT on SO-101۔
- انفرنس پوڈز
/api/inference/podکے ذریعے ایک آئیڈل واچ ڈاگ کے ساتھ خود بخود فراہم کیے جاتے ہیں، تاکہ ایک بھولا ہوا پوڈ خاموشی سے بل نہ کرے۔ - بنیادی چیک پوائنٹس وینڈرز کے اپنے ہیں:
nvidia/GR00T-N1.7-3B،nvidia/GR00T-N1.5-3B،lerobot/pi05_base۔ ACT کے پاس کوئی نہیں ہے۔ - CLI سے اور AI ایجنٹس سے MCP سرور کے ذریعے وہی آپریشنز۔
- کوئی ہارڈ ویئر نہیں؟ لائیو بازو بغیر سائن اپ کے ایک فزیکل SO-100 کو اسٹریم کرتا ہے؛ ٹرائی پیج اندر آنے کے طریقے دکھاتا ہے۔
فاؤنڈیشن ماڈل یا شروع سے
اصل مسئلہ یہ نہیں کہ کون سا 3 B ماڈل چننا ہے۔ بلکہ یہ ہے کہ کیا پری ٹرینڈ VLA استعمال کیا جائے، یہ دیکھتے ہوئے کہ ACT نے ہر ایک کے تقریباً دس منٹ کے مظاہروں سے چھ حقیقی دو ہاتھوں والے کام سیکھے، 80 M پیرامیٹرز کے ساتھ اور کچھ بھی پری ٹرینڈ نہیں تھا۔
- زبان کی کنڈیشنگ۔ ACT میں کوئی نہیں؛ ایک ACT چیک پوائنٹ ایک کام کرتا ہے۔
- آپ کے مظاہروں سے غیر حاضر اشیاء پر بہتر کارکردگی: SO-101 پر، ACT کے 40% آؤٹ آف ڈسٹری بیوشن کے مقابلے میں 50%۔
- ہر طرح سے ملٹی ٹاسک: SmolVLA ایک چیک پوائنٹ کے ساتھ تین SO-100 کاموں میں 78.3% تک پہنچتا ہے؛ ACT صرف سنگل ٹاسک چلایا گیا تھا۔
- 7.6x سے 24x تک لیٹنسی: ACT کے 20 ms کے مقابلے میں فی ایکشن سٹیپ 152 سے 485 ms۔
- فی رن 1 سے 3 کے بجائے 4 سے 12 USD، اور کسی بھی 24 GB کارڈ کے بجائے A100 ٹیر۔
- لائسنس کا خطرہ، نیز ایک گیٹڈ ریپو ناکامی کا موڈ جو شروع سے موجود نہیں ہوتا۔
- پری ٹرینڈ وزن ایک خراب ڈیٹا سیٹ کو چھپا سکتے ہیں۔ ایک فائن ٹیون جو خراب ڈیٹا پر آدھا کام کرتا ہے، ڈیٹا دیکھنے سے پہلے ایک ہفتہ لیتا ہے۔
ایک پرانے رن کو دوبارہ تیار کرنے کا معاملہ
2025 کے چیک پوائنٹ کا پیچھا کرنا آپ کے لیے ماڈل کا انتخاب کرتا ہے اور مسئلے کو ورژن پِننگ میں بدل دیتا ہے: موجودہ LeRobot N1.5 کو مسترد کرتا ہے، لہذا آپ lerobot==0.5.1۔ کوئی سیڈ فیلڈ نہ ہونے اور رن کے درمیان 5 سے 6 فیصد فرق کے ساتھ، دوبارہ تیار کرنا ساخت کے لحاظ سے تخمینی ہے۔ اور پلیٹ فارم کی طرف ہیں۔

صرف دو رہ گئے؟ ACT بمقابلہ GR00T N1.7 اور GR00T N1.7 بمقابلہ SmolVLA. خام قطاریں میدان کے اندراجات میں موجود ہیں: GR00T N1.7, Pi0.5, SmolVLA اور ACT.
یہ پلیٹ فارم آپ کی کہاں مدد نہیں کرتا
- یہ ریموٹ انفرنس کو تیز نہیں بنا سکتا۔ 20 سے 485 ms کا لوپ ماڈل سے تعلق رکھتا ہے؛ انٹرنیٹ راؤنڈ ٹرپس اس میں اضافہ کرتے ہیں۔
- یہ آپ کے اپنے ہارڈ ویئر پر GR00T یا Pi0.5 کو فائن ٹیون نہیں کر سکتا۔ یہاں دونوں صرف کلاؤڈ پر ہیں؛ صرف SmolVLA اور ACT مقامی طور پر چلتے ہیں۔
- یہ ایک ڈیٹا سیٹ کو ٹھیک نہیں کر سکتا۔ نقصان کم ہوتا ہے لیکن پالیسی کچھ نہیں کرتی ایک ڈیٹا کا مسئلہ ہے، ایک پالیسی جو صرف ایک سیٹ اپ میں کام کرتی ہے ایک کوریج کا مسئلہ ہے۔
- یہ GR00T رنز کو دوبارہ قابلِ تولید نہیں بنا سکتا: اپ اسٹریم کنفگ میں کوئی سیڈ فیلڈ نہیں ہے۔
85 ماڈلز، 332 بینچ مارک نتائج، ہر نمبر اپنے ماخذ سے منسلک
اس صفحہ پر موجود جدولوں کا قابل ترتیب ورژن: 85 وژن-لینگویج-ایکشن ماڈلز، 332 بینچ مارک نتائج، ہر ایک اپنے پیپر یا ماڈل کارڈ سے منسلک ہے۔
ارینا کھولیںایک کا انتخاب اور آگے بڑھنا
ایک ڈیفالٹ: 50 ایپی سوڈز ریکارڈ کریں، ڈیٹا سیٹ کو ثابت کرنے کے لیے ACT کو 1 سے 3 USD میں تربیت دیں، پھر SmolVLA کو اسی ڈیٹا پر۔ مجموعی طور پر 6 USD سے کم میں، اور وہ اس اہم سوال کا جواب دیتے ہیں: آیا یہاں پری ٹریننگ مدد کرتی ہے، یا کیا رکاوٹ ڈیٹا ہے۔ رابطے سے بھرپور کثیر مرحلہ کاموں کے لیے GR00T N1.7 پر جائیں، جب منظر بدل جائے تو Pi0.5 پر۔
پلیٹ فارم کا جائزہ: اپنی پہلی پالیسی کو تربیت دیں، پھر اپنی پہلی پالیسی چلائیں۔ تربیتی دستاویزات اور ڈیٹا سیٹ دستاویزات فارم اور فارمیٹ کا احاطہ کرتی ہیں؛ SO-100 صفحہ اور مکمل SO-100 گائیڈ تعمیر اور کیلیبریشن کا احاطہ کرتی ہیں۔ پس منظر: VLA کا جائزہ اور Pi0 فلو-میچنگ آرٹیکل۔ جو آپ کی کامیابی کی شرح کو بڑھائے گا وہ ہے ڈیٹا کوالٹی گائیڈ۔
SO-100 پر مجھے پہلے کون سی VLA پالیسی کی تربیت دینی چاہیے؟▾
ACT، پھر SmolVLA۔ ACT شروع سے تربیت حاصل کرتا ہے، لہذا یہ خراب ڈیٹا سیٹ کو چھپا نہیں سکتا، اور 24 GB کارڈ پر ایک رن کی لاگت 1 سے 3 USD آتی ہے۔ اگر ACT یہ کام سرانجام دیتا ہے، تو GR00T N1.7 یا Pi0.5 رن کے لیے 4 سے 12 USD ضائع نہیں ہوتے۔
کیا GR00T N1.7 واقعی Pi0.5 سے بہتر ہے؟▾
LIBERO پر وہ شور کے اندر ہیں: GR00T N1.7 کے لیے چار سوئیٹس میں 97.0%، openpi میں 30k مراحل پر Pi0.5 کے لیے 96.85%، LeRobot پورٹ کے لیے 97.5%، یہ سب مختلف ہارنیسز سے ہیں۔ حقیقی فرق 152 ms فی ایکشن سٹیپ بمقابلہ 485 ms، v2.1 ڈیٹا سیٹس بمقابلہ v3.0، اور بینچ مارک کی درستگی بمقابلہ اوپن ورلڈ جنرلائزیشن ہیں۔
کیا میں ان میں سے کسی کو ایک RTX 4090 پر فائن ٹیون کر سکتا ہوں؟▾
SmolVLA اور ACT، ہاں؛ دونوں RTX 4090 یا کسی بھی 24 GB کارڈ کے لیے درج ہیں اور مقامی طور پر چلتے ہیں۔ GR00T N1.7، N1.5 اور Pi0.5 کو A100 یا H100 80 GB کی ضرورت ہے اور یہاں صرف کلاؤڈ پر دستیاب ہیں۔ NVIDIA GR00T فائن ٹیوننگ کے لیے 40 GB یا اس سے زیادہ کی سفارش کرتا ہے؛ openpi کا فلور مکمل Pi0.5 فائن ٹیون کے لیے 70 GB سے زیادہ ہے، LoRA کے لیے 22.5 GB۔
ان پانچ میں سے میں کون سا تجارتی طور پر استعمال کر سکتا ہوں؟▾
GR00T N1.7 کے وزن NVIDIA Open Model License Agreement کے تحت ہیں، جس کے بارے میں کارڈ کہتا ہے کہ یہ تجارتی استعمال کا احاطہ کرتا ہے۔ N1.5 کے وزن غیر تجارتی ہیں۔ SmolVLA کا کوڈ LeRobot میں Apache 2.0 ہے، لیکن lerobot/smolvla_base کارڈ میں کوئی لائسنس فیلڈ نہیں ہے، لہذا وزن غیر واضح ہیں۔ ACT کے پاس لائسنس کے لیے کوئی بنیادی وزن نہیں ہے۔ Pi0.5 مبہم ہے: LeRobot کی دستاویزات Apache 2.0 کہتی ہیں، اس کا کارڈ میٹا ڈیٹا license: gemma پڑھتا ہے۔
Sources
- NVIDIA Isaac-GR00T ریپوزٹری: GA اسٹیٹس، N1.6 سے N1.7 میں تبدیلیاں، ہارڈویئر کی ضروریات، torchcodec اور FFmpeg کی پابندیاں، launch_finetune.py، رن ٹو رن تغیر
- nvidia/GR00T-N1.7-3B ماڈل کارڈ: Cosmos-Reason2-2B بیک بون، 3 B پیرامیٹرز، انفرنس ٹائمنگ ٹیبل، NVIDIA Open Model License، ماڈل ورژن فیلڈ
- nvidia/GR00T-N1.5-3B ماڈل کارڈ: Eagle 2 حوالہ، SigLip2 اور T5، فلو میچنگ DiT، یک طرفہ غیر تجارتی لائسنس
- Isaac-GR00T LIBERO مثال: 20K مراحل اور بیچ سائز 640 پر فی سوئیٹ کامیابی کی شرح، فی سوئیٹ 200 ٹرائلز
- Isaac-GR00T SimplerEnv مثال: فی ٹاسک برج اور فریکٹل کامیابی کی شرح، GR00T N1.6 بمقابلہ N1.7
- pi0.5: اوپن ورلڈ جنرلائزیشن کے ساتھ ایک ویژن-لینگویج-ایکشن ماڈل (2 B VLM پلس 300 M ایکشن ایکسپرٹ، 50 Hz کنٹرول، تقریباً 400 گھنٹے کی موبائل مینیپولیشن، 3 سے 104 مقامات پر اسکیلنگ اسٹڈی)
- openpi ریپوزٹری: GPU میموری فلورز، فلو-میچنگ-ہیڈ-اونلی اسکوپ، اور Pi0.5 LIBERO کے نتائج examples/libero میں
- lerobot/pi05_base ماڈل کارڈ: LeRobot پورٹ کا دائرہ کار، license: gemma میٹا ڈیٹا، lerobot-train کا استعمال
- LeRobot pi0.5 دستاویزات: گیٹڈ PaliGemma ٹوکنائزر، LIBERO ری پروڈکشن ٹیبل، n_action_steps فال بیک ٹریپ، Apache 2.0 بیان
- SmolVLA: سستی اور موثر روبوٹکس کے لیے ایک ویژن-لینگویج-ایکشن ماڈل (450 M پیرامیٹرز، LIBERO اور Meta-World ٹیبلز، SO-100 اور SO-101 نتائج، async انفرنس)
- LeRobot SmolVLA دستاویزات: 50 ایپیسوڈز 5 پوزیشنز پر بمقابلہ 25، A100 پر تقریباً 4 گھنٹے میں 20k مراحل
- کم لاگت والے ہارڈویئر کے ساتھ فائن گرین بائی مینول مینیپولیشن سیکھنا (ACT اور ALOHA): 80-90 فیصد پر 6 ٹاسک، k=1 سے k=100 تک چنک سائز ایبلیشن
- LeRobot 0.6.2: ACTConfig اور SmolVLAConfig ڈیفالٹس، ڈیفالٹ سیڈ 1000، --accelerator.gradient_accumulation.steps، Python 3.12 کی ضرورت، Apache 2.0
- LeRobot GR00T دستاویزات: پالیسی ٹائپ groot، N1.5 سپورٹ ہٹا دیا گیا، pin lerobot==0.5.1، SO-101 چنک سائز کی مثال
- lerobot/smolvla_base ماڈل کارڈ: SmolVLA بیس چیک پوائنٹ جو --policy.path کے ذریعے استعمال ہوتا ہے، اور اس کا کارڈ میٹا ڈیٹا، جس میں کوئی لائسنس فیلڈ نہیں ہے
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started