AY-Robots پالیسیوں کا موازنہ جدول جو GR00T N1.7، GR00T N1.5، Pi0.5، SmolVLA اور ACT کو پیرامیٹر کی گنتی، GPU ٹیر، انفرنس لیٹنسی اور کم از کم ایپیسوڈ کی گنتی کے ساتھ ساتھ دکھا رہا ہے۔
VLA ماڈلزپالیسی کی تربیتماڈل کا انتخابLeRobotso-100

2026 میں آپ کو کون سی VLA پالیسی کی تربیت دینی چاہیے؟

AY-Robots ResearchAugust 23, 202618 منٹ کا مطالعہ

GR00T N1.7، Pi0.5، SmolVLA، ACT یا GR00T N1.5؟ ایک فیصلہ کن جدول جو حقیقی حالات سے مماثل ہے، شائع شدہ بینچ مارک نمبرز، لیٹنسی، فی رن لاگت اور ہر انتخاب کے پیچھے لائسنسز کے ساتھ۔

آج SO-100 کلاس کے بازو پر پانچ پالیسیاں تربیت کے قابل ہیں۔ ان میں انفرنس لیٹنسی میں 24، پیرامیٹر کاؤنٹ میں 37 اور ایک رن کی لاگت میں 12 کا فرق ہے، اور اس میں بھی کہ آیا آپ نتیجہ بھیج سکتے ہیں۔ پانچ ماڈل کارڈز اس کا فیصلہ نہیں کریں گے: کوئی بھی اس سوال کا جواب نہیں دیتا جو آپ کے پاس ہے، میں پہلے کون سا چلاؤں؟

نیچے ہر نمبر اگست 2026 میں کاغذات، ریپوز اور کارڈز سے پڑھا گیا تھا۔ پلیٹ فارم کے نمبرز سے آتے ہیں AY-Robots پالیسی کیٹلاگ؛ جہاں دونوں متفق نہیں ہوتے، دونوں دکھائے جاتے ہیں۔

مختصر ورژن

  • اگر آپ کو اپنے ڈیٹا سیٹ پر شک ہے تو پہلے ACT کو تربیت دیں: 1 سے 3 USD فی رن، خراب ڈیٹا کو چھپانے کے لیے کچھ بھی پری ٹرینڈ نہیں۔
  • GR00T N1.7 اور Pi0.5 LIBERO پر آدھے پوائنٹ کے اندر ہیں، 97.0 بمقابلہ 96.85 سے 97.5۔ یہ کسی ایک کو منتخب کرنے کی وجہ نہیں ہے۔
  • Pi0.5 عمومیت کا کھیل ہے، درستگی کا نہیں، اور 485 ms پر سب سے سست ہے۔
  • SmolVLA، 450 M پیرامیٹرز پر، یہاں واحد VLA ہے جو ایک 24 GB کارڈ پر فائن ٹیون ہوتا ہے۔
  • ACT 20 ms پر تیز رد عمل کی حرکت کے لیے واحد آپشن ہے۔ لائسنس باقی کا فیصلہ کرتے ہیں۔

فیصلے کی میز

آپ کی صورتحالاسے تربیت دیںکیوں
ڈیٹا سیٹ کا معیار غیر ثابت شدہACTکوئی بھی پری ٹرینڈ ماڈل خراب ڈیٹا سیٹ کو نہیں چھپا سکتا، اور ناکامی پر 1 سے 3 USD لاگت آتی ہے۔
رابطہ سے بھرپور، کثیر مراحل، زبان سے مشروطGR00T N1.7چار LIBERO سوئیٹس پر 97.0%، علاوہ ازیں ایک نسبتی اینڈ-ایفیکٹر ایکشن اسپیس۔
تیز رد عمل کی حرکت، سرووز پر انفرنسACT20 ms۔ اگلا تیز ترین 7.6 گنا سست ہے۔
نئی اشیاء، نیا منظر، کھلی دنیاPi0.5آؤٹ آف ڈسٹری بیوشن رویے کے لیے بنایا گیا، 104 مقامات تک۔
ایک 24 GB کارڈ، پھر بھی زبان چاہتے ہیںSmolVLA450 M پیرامیٹرز، 30 ایپیسوڈ کی حد، مقامی طور پر چلتا ہے۔
2025 میں ریکارڈ کی گئی رن کو دوبارہ تیار کرناGR00T N1.5صرف اگر آپ کو لازمی ہو: LeRobot اب اسے مسترد کرتا ہے، وزن غیر تجارتی ہیں۔
یہ ایک پروڈکٹ کے طور پر بھیجا جائے گاN1.7, SmolVLA or ACTN1.5 غیر تجارتی ہے، Pi0.5 میں Gemma کی شرائط ہیں، SmolVLA کے کارڈ میں کوئی نہیں ہے۔

پانچ امیدوار

تمام پانچ پالیسیاں ہیں: کیمرہ فریمز، جوائنٹ پوزیشنز اور، ان میں سے چار کے لیے، ایک زبان کی ہدایت، جو مستقبل کے جوائنٹ ٹارگٹس کے ایک حصے سے منسلک ہے۔ جو چیز انہیں الگ کرتی ہے وہ یہ ہے کہ آپ کے آنے سے پہلے کتنا سیکھا گیا تھا۔

پالیسیپیرامیٹرزلیٹنسیGPU ٹیرمقامی؟کم از کم ایپیسوڈزفارمیٹلاگت
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

NVIDIA کا موجودہ ویژن-لینگویج-ایکشن ماڈل، تقریباً 3 بلین پیرامیٹرز، جس میں سے تقریباً 40 ملین کی تربیت فائن ٹیوننگ کے دوران کی گئی۔ ریپو میں N1.6 سے ہونے والی تبدیلیاں درج ہیں: بیک بون کو ایک وینڈرڈ Eagle ماڈل سے Qwen3-VL پر Cosmos-Reason2-2B میں تبدیل کیا گیا، ڈفیوژن لیئرز 32 سے 16، اسٹیٹ اور ایکشن ڈائمینشنز 29 سے 132، ایکشن ہورائزن 16 سے 40۔

ایک چھوٹے بازو پر جو چیز اہمیت رکھتی ہے وہ نسبتی اینڈ-ایفیکٹر ایکشن اسپیس ہے: N1.7 موجودہ پوز سے ڈیلٹا کی پیش گوئی کرتا ہے، جو 20K گھنٹے کی EgoScale انسانی ویڈیو کو روبوٹ پالیسی میں منتقل کرنے کی اجازت دیتا ہے۔ تفصیلات N1.7 صفحہ پر، طریقہ کار N1.7 برائے SO-100 گائیڈ میں۔

ریپو میں GA، ماڈل کارڈ پر EA

Isaac-GR00T README N1.7 کو ایک جنرل اویلیبلٹی ریلیز قرار دیتا ہے، جس میں مکمل بینچ مارکس اور سپورٹ شامل ہے۔ اس کا Hugging Face کارڈ ابھی تک اپ ڈیٹ نہیں ہوا ہے: Model Version فیلڈ اب بھی GR00T N1.7 EA دکھاتا ہے۔ ریپو جدید ترین دستاویز ہے۔

GR00T N1.5

وہی 3 B اسکیل، ایگل 2 بیک بون، سگ لپ 2 اور T5، فلو-میچنگ ڈی آئی ٹی ہیڈ۔ یہ ایک موجودہ کو بڑھانے کے لیے موجود ہے۔ دو چیزیں اسے ایک ناقص ڈیفالٹ بناتی ہیں: اس کے وزن کے ساتھ NVIDIA's one-way non-commercial licence, اور LeRobot کی موجودہ ریلیز نے N1.5 سپورٹ ہٹا دی ہے۔ دیکھیں۔

Pi0.5

فزیکل انٹیلی جنس کا VLA، پالیسی کی قسم pi05۔ یہ مقالہ PaliGemma سے شروع کیا گیا ایک 2 B VLM اور ایک 300 M ایکشن ایکسپرٹ پیش کرتا ہے، جو روبوٹ کو 50 Hz پر چلاتا ہے؛ LeRobot کی pi05 کنفگ ڈیفالٹ کے طور پر 50 قدموں کا چنک استعمال کرتی ہے، اس رفتار پر ایک سیکنڈ۔ اس کا اہم فائدہ غیر دیکھی ہوئی جگہیں ہیں: حقیقی گھروں میں تقریباً 400 گھنٹے کی موبائل مینیپولیشن، اور 3، 12، 22، 53، 82 اور 104 مقامات پر ایک اسکیلنگ اسٹڈی، جہاں 104 مقامات والے ماڈل نے خود ٹیسٹ گھروں پر تربیت یافتہ کنٹرول سے مطابقت اختیار کی۔

ایک حد، جو کہ lerobot/pi05_base کارڈ پر بیان کی گئی ہے: پورٹ صرف فلو-میچنگ ایکشن ہیڈ کو لے جاتا ہے۔ سب ٹاسک کی پیش گوئی، ایکشن ٹوکنائزیشن اور RL کو اپ اسٹریم جاری نہیں کیا گیا تھا، اور اوپن پائی اپنی ریپوزٹری کے بارے میں بھی یہی کہتا ہے۔ Pi0.5 صفحہ اور SO-100 پر Pi0.5 گائیڈ میں باقی معلومات موجود ہیں۔

وہ جال جو ایک دوپہر کھا جاتا ہے: گیٹڈ ریپوز

Pi0.5 کو گیٹڈ google/paligemma-3b-pt-224 ٹوکنائزر کی ضرورت ہے (gated: manual، اگرچہ گوگل کا کہنا ہے کہ درخواستیں فوری طور پر پروسیس کی جاتی ہیں)۔ اسے قبول کیے بغیر اور ٹریننگ ماحول میں hf auth login چلائے بغیر، جاب شروع ہوتی ہے، کچھ دیر ڈاؤن لوڈ ہوتی ہے، پھر ایک اجازت کی خرابی پر ختم ہو جاتی ہے جو نیٹ ورک کی خرابی جیسی لگتی ہے۔ nvidia/GR00T-N1.7-3B گیٹڈ نہیں ہے، لیکن اس کا nvidia/Cosmos-Reason2-2B بیک بون گیٹڈ ہے (gated: auto)۔ کیو میں ڈالنے سے پہلے دونوں کو صاف کریں؛ اگر کوئی رن بیکار پڑا رہتا ہے، تو پھنسے ہوئے کیو کا صفحہ یہ بتاتا ہے کہ کیا چیک کرنا ہے۔

SmolVLA

450 M پیرامیٹرز، جن میں سے تقریباً 100 M ایکشن ایکسپرٹ میں ہیں، SmolVLM-2 پر VLM کو منجمد کر کے اور صرف اس کی پہلی 16 لینگویج ماڈل لیئرز استعمال کی گئیں۔ پری ٹریننگ کمیونٹی ڈیٹا پر کی گئی تھی: 481 ڈیٹا سیٹس، 10.6 M فریمز، انہی سستے آرمز سے جو آپ استعمال کرتے ہیں۔ یہاں واحد VLA جو ایک 24 GB کارڈ میں فٹ ہوتا ہے، اور واحد 30 ایپیسوڈ فلور۔ مزید دیکھیں SmolVLA صفحہ.

ACT

یہ کوئی فاؤنڈیشن ماڈل نہیں ہے۔ ALOHA کا ایکشن چنکنگ ٹرانسفارمر تقریباً 80 M پیرامیٹرز پر مشتمل ہے جو ہر کام کے لیے شروع سے تربیت یافتہ ہے، 50 Hz پر 50 مظاہروں پر۔ مقالے میں تقریباً دس منٹ کے مظاہروں سے چھ حقیقی دوہاتھوں والے کاموں کی اطلاع دی گئی ہے، جن مثالوں کو یہ نمایاں کرتا ہے ان پر 80 سے 90 فیصد کامیابی کے ساتھ۔ اس کا خیال، ایکشن چنکنگ، اس صفحے پر موجود ہر ماڈل میں شامل ہے، اور اس کا ایبلیشن اب بھی پیمائش کرتا ہے اثر کو بہترین طریقے سے: ٹیمپورل اینسیمبلنگ بند ہونے کے ساتھ دو نقلی کاموں پر، کامیابی 1 فیصد (k=1 پر) سے بڑھ کر 44 فیصد (k=100 پر) ہو جاتی ہے۔ ACT صفحہ میں باقی تفصیلات ہیں۔

بینچ مارکس دراصل کیا کہتے ہیں

LIBERO وہ واحد بینچ مارک ہے جس پر ان پانچ میں سے تین رپورٹ کرتے ہیں: ایک نقلی فرینکا پانڈا پر زبان سے مشروط کام، جو نیچے دیے گئے چار سوئیٹس میں تقسیم ہیں، ہر ایک میں دس کام۔ NVIDIA نے ہر سوئیٹ کے لیے 200 ٹرائلز چلائے۔

ModelSpatialObjectGoal10 (Long)Average
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
یہ قطاریں سختی سے موازنہ کے قابل نہیں ہیں

ہر نمبر ایک مختلف ہارنس اور بجٹ سے آتا ہے۔ GR00T نے گلوبل بیچ 640 پر 20K سٹیپس چلائے؛ اوپن پائی کا اعداد و شمار ایک 30K چیک پوائنٹ ہے؛ LeRobot پورٹ نے LIBERO بیس ماڈل میں 6K سٹیپس کا اضافہ کیا۔ SmolVLA مزید ایک عدم مطابقت ہے: اس کا پیپر اس قطار کو LIBERO پر شروع سے تربیت دیتا ہے، بغیر کسی VLA پری ٹریننگ کے، جبکہ اس کے اوپر والے تین پری ٹرینڈ چیک پوائنٹس کو فائن ٹیون کرتے ہیں۔ 96.85 سے 97.5 کو ایک کلسٹر سمجھیں، اور 87.3% تک کے فرق کو حقیقی سمجھیں لیکن یہ 6.7 گنا زیادہ پیرامیٹرز کے ساتھ حاصل کیا گیا ہے۔

SimplerEnv پھیلاؤ کو ظاہر کرتا ہے، جو LIBERO نہیں کرتا۔ NVIDIA N1.7 کا موازنہ N1.6 سے کرتا ہے، جو 'نسلی ڈیلٹا' کے قریب ترین عوامی چیز ہے۔نسلی ڈیلٹا۔

SimplerEnv suiteN1.6 averageN1.7 averageBest swingWorst swing
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

برج رو مفید ہے: اوسطاً 5.7 پوائنٹس حاصل کیے گئے جبکہ put_eggplant_in_basket نے 36 کھوئے اور put_eggplant_in_sink 33 سے 2 پر آ گیا۔ ایک نئی نسل تقسیم کو اٹھانے کے بجائے حرکت دیتی ہے، لہذا اگر آپ کا کام وہاں ہے جہاں N1.7 نے تنزلی کی، تو اوسط کچھ نہیں کہتی۔

AY-Robots ارینا لیڈر بورڈ، 85 وژن-لینگویج-ایکشن ماڈلز کی ایک ترتیب پذیر جدول جس میں 332 بینچ مارک نتائج ہیں، ہر قدر اس پیپر یا ماڈل کارڈ سے منسلک ہے جہاں سے یہ آئی ہے۔
ارینا میں 85 VLA ماڈلز اور 332 بینچ مارک نتائج شامل ہیں، ہر ایک اپنے پیپر یا ماڈل کارڈ سے منسلک ہے۔ یہ جانچنے کے لیے مفید ہے کہ آیا کسی بلاگ پوسٹ میں دیا گیا نمبر حقیقی ہے۔

پانچ میں سے، صرف SmolVLA پیپر SO-100 کلاس آرم پر رپورٹ کرتا ہے: تین کاموں میں SmolVLA کے لیے 78.3 فیصد اور Pi0 کے لیے 61.7 فیصد، دونوں ملٹی ٹاسک، ACT کے لیے 48.3 کے مقابلے میں جو سنگل ٹاسک پر تربیت یافتہ ہے، جو کہ ایک جیسی موازنہ نہیں ہے۔ صاف جوڑا SO-101 پک اینڈ پلیس پر دونوں سنگل ٹاسک ہیں: تقسیم میں 70 کے مقابلے میں 90، اس سے باہر 40 کے مقابلے میں 50۔ موازنہ کریں ACT کا SmolVLA سے موازنہ اور Pi0.5 کا SmolVLA سے موازنہ، یا براؤز کریں ارینا۔

لیٹنسی اور لاگت تعیناتی کا فیصلہ کرتی ہیں

انفرنس لیٹنسی وہ رکاوٹ ہے جسے لوگ سب سے آخر میں دریافت کرتے ہیں اور سب سے پہلے پچھتاتے ہیں۔ ایک پالیسی جو بینچ مارک پر پانچ پوائنٹس بہتر ہے لیکن فی ایکشن سٹیپ آدھا سیکنڈ لیتی ہے، آپ کی میز پر بدتر لگتی ہے: رابطے کی حرکیات انتظار نہیں کرتیں۔

ایک انتباہ: GR00T کا اعداد و شمار NVIDIA کے کارڈ سے متفق نہیں ہے، جو 4 ڈینوائزنگ سٹیپس اور ایک کیمرے کو H100 پر ایگر موڈ میں 85.8 ms، torch.compile کے ساتھ 48.6 ms، مکمل TensorRT کے ذریعے 27.9 ms پر وقت دیتا ہے۔ یہاں 152 ms سرونگ اوور ہیڈ اور ایک سے زیادہ کیمروں کے ساتھ ایک مکمل اسٹیک کا اعداد و شمار ہے، نہ کہ صرف ایک فارورڈ پاس۔

ریموٹ انفرنس کی ایک سخت حد ہے

20 سے 485 ms کا لوپ ماڈل کا ہے، اور پبلک انٹرنیٹ راؤنڈ ٹرپس اس میں اضافہ کرتے ہیں۔ ریموٹ انفرنس سست پک اینڈ پلیس کے لیے قابل عمل ہے، تیز رد عمل والی حرکت کے لیے نہیں۔ اگر آپ کے کام کو رفتار کی ضرورت ہے، تو انفرنس سرووز کے ساتھ ہی موجود ہے: ACT یا SmolVLA، مقامی طور پر۔ متعلقہ: پالیسی حرکت کے دوران منجمد ہو جاتی ہے۔

ماڈل کو تبدیل کیے بغیر وقت حاصل کرنے کا ایک طریقہ: SmolVLA پیپر ہم وقت ساز (synchronous) عمل درآمد کی پیمائش کرتا ہے، جہاں پالیسی اگلے کی پیش گوئی کرنے سے پہلے ایک ٹکڑا مکمل کرتی ہے، بمقابلہ غیر ہم وقت ساز (asynchronous)، جہاں پیش گوئی عمل درآمد کے ساتھ اوورلیپ کرتی ہے۔ کامیابی یکساں ہے، 78.3 بمقابلہ 73.3، لیکن وہی پک اینڈ پلیس 13.75 کے بجائے 9.7 سیکنڈ لیتا ہے، اور ایک مقررہ ونڈو میں روبوٹ 9 کے بجائے 19 سائیکل سنبھالتا ہے۔

لائسنس، جانچے گئے کیونکہ کوئی انہیں نہیں جانچتا

ماڈلوزن کا لائسنسکوڈ کا لائسنستجارتی استعمال
GR00T N1.7NVIDIA اوپن ماڈل لائسنس؛ کارڈ تجارتی استعمال کی اجازت دیتا ہےApache 2.0ہاں
GR00T N1.5NVIDIA یک طرفہ غیر تجارتی لائسنسApache 2.0نہیں
Pi0.5pi05_base کارڈ میٹا ڈیٹا میں license: gemma لکھا ہےApache 2.0 (openpi, LeRobot دستاویزات)دونوں کو پڑھیں، وہ متفق نہیں ہیں
SmolVLAsmolvla_base کارڈ پر کوئی لائسنس فیلڈ نہیں ہےApache 2.0 (LeRobot)کوڈ ہاں، وزن غیر بیان شدہ
ACTکوئی بنیادی وزن موجود نہیں ہےApache 2.0 (LeRobot)ہاں

Pi0.5 کی قطار کو احتیاط کی ضرورت ہے۔ LeRobot pi05 دستاویزات میں Apache 2.0 کا ذکر ہے جو openpi کے مطابق ہے، جبکہ ہب کارڈ برائے lerobot/pi05_base میں license: gemma۔ دونوں فعال ہیں۔ GR00T N1.7 کا ایک نرم ورژن ہے: Isaac-GR00T README میں اتفاقاً کہا گیا ہے کہ N1.7 Apache 2.0 کے تحت مکمل طور پر تجارتی طور پر لائسنس یافتہ ہے، جبکہ اس کا اپنا لائسنس سیکشن اور ماڈل کارڈ صرف کوڈ کو Apache 2.0 کے تحت اور وزن کو NVIDIA اوپن ماڈل لائسنس کے تحت رکھتے ہیں۔

وہ ڈیفالٹس جو آپ درحقیقت چلائیں گے

ہر ٹرینر فارم ایک ڈیفالٹ کے ساتھ آتا ہے، اور وہ من مانی نہیں ہوتے۔ ACT کے LeRobot کے اپنے ہیں: بیچ 8، lr 1e-5, 100000 ٹریننگ سٹیپس، چنک سائز 100، ACTConfig اپ اسٹریم سے مماثل اور k=100 from the ACT paper. نیچے ایک کالم ایک جال ہے۔

پالیسیبیچLRزیادہ سے زیادہ سٹیپسگریڈ ایکملاگو ہوتا ہے؟اضافی کنٹرولز
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
دوبارہ پیدا کرنے کی صلاحیت، اگست 2026 کی تاریخ

GR00T کا فائن ٹیوننگ انٹری پوائنٹ (launch_finetune.py، ایک ٹائرو CLI) اپنی کنفگ ڈیٹا کلاس میں کوئی سیڈ فیلڈ نہیں رکھتا، لہذا رنز بٹ بہ بٹ دوبارہ پیدا نہیں کیے جا سکتے۔ ریپو غیر متعین امیج آگمینٹیشنز کی وجہ سے رنز کے درمیان 5 سے 6 فیصد فرق کی بھی خبردار کرتا ہے، جو آن لائن بحث کیے جانے والے زیادہ تر بینچ مارک گیپس سے زیادہ ہے۔ LeRobot کا ڈیفالٹ سیڈ 1000 ہے۔ گریڈ ایکم کالم lerobot 0.5.1 کو بیان کرتا ہے؛ اپ اسٹریم 0.6.2 اسے --accelerator.gradient_accumulation.steps کے طور پر ظاہر کرتا ہے۔

وہ کنٹرول جو ماڈل کے انتخاب سے زیادہ اہمیت رکھتا ہے

یہ ایکشن چنک ہے۔ لمبے چنکس ہموار حرکت اور کم پیچیدہ غلطیاں دیتے ہیں، لیکن پالیسی بلاک کے عمل کے دوران پابند ہوتی ہے، لہذا یہ حرکت کرنے والی کسی بھی چیز پر دیر سے رد عمل ظاہر کرتی ہے: ایک ساکن کیوب پر پراعتماد، گھومنے والے پر مایوس کن۔ اگر یہ حد سے تجاوز کر جائے، تو عمل شدہ حصے کو مختصر کرنا دوبارہ تربیت سے بہتر ہے اور مفت ہے۔ ایک جوائنٹ جو جلدی رک جاتا ہے وہ ایک مختلف مسئلہ ہے؛ دیکھیں ۔

  • ACT: ACTConfig بطور ڈیفالٹ chunk_size 100 اور n_action_steps 100 پر سیٹ ہوتا ہے۔ ٹیمپورل اینسیمبلنگ بند ہے اور اسے n_action_steps 1 درکار ہے۔
  • GR00T N1.7: اندرونی افق 16 سے 40 تک گیا، پھر بھی LeRobot کا SO-101 مثال اب بھی --policy.chunk_size=16 --policy.n_action_steps=16 پر چلتا ہے۔ رول آؤٹ فلیگ کا نام بدل کر --execution-horizon کر دیا گیا ہے۔
  • Pi0.5: ایک 50-اسٹیپ چنک، جس میں سے LeRobot کی LIBERO ریسیپی --policy.n_action_steps=10 کے ذریعے 10 کو عمل میں لاتی ہے؛ --policy.pretrained_path کے ساتھ اگر آپ فلیگ کو چھوڑ دیتے ہیں تو یہ 50 پر واپس آ جاتا ہے۔
  • SmolVLA: 50-ایکشن چنکس، دونوں نوبس ظاہر ہیں۔

ایک دوپہر میں پانچوں کو کیسے اسکرین کیا جائے

سب سے سستا جواب مزید پڑھنا نہیں ہے۔ تقریباً 15 USD خرچ کریں اور بازو کو آپ کو بتانے دیں: ایک بار ریکارڈ کریں، پہلے سستے ماڈل کو تربیت دیں، ایک بار جب یہ ڈیٹا کو درست ثابت کر دے تو اسے بڑھائیں۔ ساخت حجم سے بہتر ہے، جس کا مقصد ہے اور ۔

  1. 1
    50 ایپی سوڈز ایک بار ریکارڈ کریں

    یہ GR00T، Pi0.5 اور ACT کے لیے 50 اور SmolVLA کے لیے 30 کا راستہ صاف کرتا ہے۔ ہر تغیر کو پھیلانے کے بجائے دہرائیں: 5 کیوب پوزیشنز پر 50 ایپی سوڈز کو تربیت دی گئی جہاں 25 کو نہیں دی گئی۔ اپنا پہلا ڈیٹا سیٹ ریکارڈ کریں دیکھیں۔

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    پہلے ACT کو تربیت دیں، کیونکہ یہ آپ سے جھوٹ نہیں بول سکتا

    کوئی پہلے سے تربیت یافتہ وزن نہیں، لہذا اگر یہ کام بالکل کرتا ہے، تو آپ کے ڈیٹا سیٹ میں یہ کام شامل ہے۔ اگر ACT فلیٹ لائن ہو جائے، تو ڈیٹا کو درست کریں۔ 1 سے 3 USD، 24 GB کارڈ پر 2 سے 5 گھنٹے۔

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    SmolVLA کو اسی ڈیٹا سیٹ پر چلائیں، بغیر کسی تبدیلی کے

    وہی ڈیٹا، وہی بازو، 80M کے بجائے 450M پیرامیٹرز، نیز زبان کی کنڈیشنگ۔ LeRobot ایک A100 پر تقریباً 4 گھنٹے میں 20K قدموں کی رن مکمل کرتا ہے۔ یہ آپ کو بتاتا ہے کہ آیا پری ٹریننگ سے کوئی فائدہ ہوتا ہے۔

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    GR00T کو چھونے سے پہلے v2.1 میں تبدیل کریں

    GR00T LeRobot v2 فارمیٹ کا ایک ذائقہ پڑھتا ہے جس میں ایک اضافی meta/modality.json شامل ہے جو یہ بتاتا ہے کہ مربوط حالت اور ایکشن اریوں کو نامزد فیلڈز میں کیسے تقسیم کیا جاتا ہے۔ ایک v3.0 ڈیٹا سیٹ اس لوڈر کو کریش کر دیتا ہے، کیونکہ v3.0 بہت سے ایپی سوڈز کو مشترکہ فائلوں میں پیک کرتا ہے جہاں v2 نے فی ایپی سوڈ ایک لکھا تھا۔ Isaac-GR00T ڈاؤن گریڈ ہیلپر کو scripts/lerobot_conversion/convert_v3_to_v2.py کے طور پر بھیجتا ہے؛ v3 مسترد کرنے والا صفحہ تیز راستہ ہے۔

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    GR00T N1.7 پر صرف اس صورت میں جائیں جب پہلے دو نے کچھ باقی چھوڑ دیا ہو

    NVIDIA کے CLI کے ذریعے، جو یہاں دکھایا گیا ہے، یا LeRobot کی groot پالیسی قسم کے ذریعے۔ NVIDIA فائن ٹیوننگ کے لیے 40 GB یا اس سے زیادہ VRAM، اور انفرنس کے لیے 16 GB کی سفارش کرتا ہے۔ OOM پر، OOM صفحہ دیکھیں۔

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

اس اسکریننگ پاس کو چلانے کے دو طریقے

تین ماحول، کیونکہ ٹول چینز ایک ساتھ موجود نہیں ہیں۔ مین پر LeRobot 0.6.2 ہے اور اسے Python 3.12 یا اس سے نیا ورژن درکار ہے؛ Isaac-GR00T اور openpi الگ الگ uv-منظم ریپوز ہیں۔

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T torchcodec 0.8.0 کو اپنے واحد ویڈیو بیک اینڈ کے طور پر استعمال کرتا ہے، جس کے لیے FFmpeg 4 سے 7 کی ضرورت ہوتی ہے۔ FFmpeg 8 غیر تعاون یافتہ ہے، AV1 کی ضمانت نہیں ہے۔
  • openpi میموری کی حدیں: انفرنس 8 GB سے اوپر، LoRA 22.5 GB سے اوپر، مکمل فائن ٹیوننگ 70 GB سے اوپر۔ آخری وجہ یہ ہے کہ Pi0.5 ایک A100 کا کام ہے۔
  • GPU خود کرایہ پر لیں، بعد میں اسے ختم کر دیں، چیک پوائنٹ کے تین سیٹوں کے راستوں کو دستی طور پر ہم آہنگ کریں۔

فاؤنڈیشن ماڈل یا شروع سے

اصل مسئلہ یہ نہیں کہ کون سا 3 B ماڈل چننا ہے۔ بلکہ یہ ہے کہ کیا پری ٹرینڈ VLA استعمال کیا جائے، یہ دیکھتے ہوئے کہ ACT نے ہر ایک کے تقریباً دس منٹ کے مظاہروں سے چھ حقیقی دو ہاتھوں والے کام سیکھے، 80 M پیرامیٹرز کے ساتھ اور کچھ بھی پری ٹرینڈ نہیں تھا۔

ACT کو شروع سے تربیت دینے کے بجائے پری ٹرینڈ VLA کو فائن ٹیون کرنا
آپ کو کیا حاصل ہوتا ہے
  • زبان کی کنڈیشنگ۔ ACT میں کوئی نہیں؛ ایک ACT چیک پوائنٹ ایک کام کرتا ہے۔
  • آپ کے مظاہروں سے غیر حاضر اشیاء پر بہتر کارکردگی: SO-101 پر، ACT کے 40% آؤٹ آف ڈسٹری بیوشن کے مقابلے میں 50%۔
  • ہر طرح سے ملٹی ٹاسک: SmolVLA ایک چیک پوائنٹ کے ساتھ تین SO-100 کاموں میں 78.3% تک پہنچتا ہے؛ ACT صرف سنگل ٹاسک چلایا گیا تھا۔
آپ کو کیا قیمت ادا کرنی پڑتی ہے
  • 7.6x سے 24x تک لیٹنسی: ACT کے 20 ms کے مقابلے میں فی ایکشن سٹیپ 152 سے 485 ms۔
  • فی رن 1 سے 3 کے بجائے 4 سے 12 USD، اور کسی بھی 24 GB کارڈ کے بجائے A100 ٹیر۔
  • لائسنس کا خطرہ، نیز ایک گیٹڈ ریپو ناکامی کا موڈ جو شروع سے موجود نہیں ہوتا۔
  • پری ٹرینڈ وزن ایک خراب ڈیٹا سیٹ کو چھپا سکتے ہیں۔ ایک فائن ٹیون جو خراب ڈیٹا پر آدھا کام کرتا ہے، ڈیٹا دیکھنے سے پہلے ایک ہفتہ لیتا ہے۔

ایک پرانے رن کو دوبارہ تیار کرنے کا معاملہ

2025 کے چیک پوائنٹ کا پیچھا کرنا آپ کے لیے ماڈل کا انتخاب کرتا ہے اور مسئلے کو ورژن پِننگ میں بدل دیتا ہے: موجودہ LeRobot N1.5 کو مسترد کرتا ہے، لہذا آپ lerobot==0.5.1۔ کوئی سیڈ فیلڈ نہ ہونے اور رن کے درمیان 5 سے 6 فیصد فرق کے ساتھ، دوبارہ تیار کرنا ساخت کے لحاظ سے تخمینی ہے۔ اور پلیٹ فارم کی طرف ہیں۔

The AY-Robots head to head comparison page for GR00T N1.7 against Pi0.5, showing parameter counts, GPU requirements, inference latency, dataset format and minimum episode counts side by side
Head to head on /compare/groot-n1-7-vs-pi0-5. The two 3 B models look interchangeable on a spec sheet and are not: one wants LeRobot v2.1, one wants v3.0.

صرف دو رہ گئے؟ ACT بمقابلہ GR00T N1.7 اور GR00T N1.7 بمقابلہ SmolVLA. خام قطاریں میدان کے اندراجات میں موجود ہیں: GR00T N1.7, Pi0.5, SmolVLA اور ACT.

یہ پلیٹ فارم آپ کی کہاں مدد نہیں کرتا

  • یہ ریموٹ انفرنس کو تیز نہیں بنا سکتا۔ 20 سے 485 ms کا لوپ ماڈل سے تعلق رکھتا ہے؛ انٹرنیٹ راؤنڈ ٹرپس اس میں اضافہ کرتے ہیں۔
  • یہ آپ کے اپنے ہارڈ ویئر پر GR00T یا Pi0.5 کو فائن ٹیون نہیں کر سکتا۔ یہاں دونوں صرف کلاؤڈ پر ہیں؛ صرف SmolVLA اور ACT مقامی طور پر چلتے ہیں۔
  • یہ ایک ڈیٹا سیٹ کو ٹھیک نہیں کر سکتا۔ نقصان کم ہوتا ہے لیکن پالیسی کچھ نہیں کرتی ایک ڈیٹا کا مسئلہ ہے، ایک پالیسی جو صرف ایک سیٹ اپ میں کام کرتی ہے ایک کوریج کا مسئلہ ہے۔
  • یہ GR00T رنز کو دوبارہ قابلِ تولید نہیں بنا سکتا: اپ اسٹریم کنفگ میں کوئی سیڈ فیلڈ نہیں ہے۔

85 ماڈلز، 332 بینچ مارک نتائج، ہر نمبر اپنے ماخذ سے منسلک

اس صفحہ پر موجود جدولوں کا قابل ترتیب ورژن: 85 وژن-لینگویج-ایکشن ماڈلز، 332 بینچ مارک نتائج، ہر ایک اپنے پیپر یا ماڈل کارڈ سے منسلک ہے۔

ارینا کھولیں

ایک کا انتخاب اور آگے بڑھنا

ایک ڈیفالٹ: 50 ایپی سوڈز ریکارڈ کریں، ڈیٹا سیٹ کو ثابت کرنے کے لیے ACT کو 1 سے 3 USD میں تربیت دیں، پھر SmolVLA کو اسی ڈیٹا پر۔ مجموعی طور پر 6 USD سے کم میں، اور وہ اس اہم سوال کا جواب دیتے ہیں: آیا یہاں پری ٹریننگ مدد کرتی ہے، یا کیا رکاوٹ ڈیٹا ہے۔ رابطے سے بھرپور کثیر مرحلہ کاموں کے لیے GR00T N1.7 پر جائیں، جب منظر بدل جائے تو Pi0.5 پر۔

پلیٹ فارم کا جائزہ: اپنی پہلی پالیسی کو تربیت دیں، پھر اپنی پہلی پالیسی چلائیں۔ تربیتی دستاویزات اور ڈیٹا سیٹ دستاویزات فارم اور فارمیٹ کا احاطہ کرتی ہیں؛ SO-100 صفحہ اور مکمل SO-100 گائیڈ تعمیر اور کیلیبریشن کا احاطہ کرتی ہیں۔ پس منظر: VLA کا جائزہ اور Pi0 فلو-میچنگ آرٹیکل۔ جو آپ کی کامیابی کی شرح کو بڑھائے گا وہ ہے ڈیٹا کوالٹی گائیڈ۔

SO-100 پر مجھے پہلے کون سی VLA پالیسی کی تربیت دینی چاہیے؟

ACT، پھر SmolVLA۔ ACT شروع سے تربیت حاصل کرتا ہے، لہذا یہ خراب ڈیٹا سیٹ کو چھپا نہیں سکتا، اور 24 GB کارڈ پر ایک رن کی لاگت 1 سے 3 USD آتی ہے۔ اگر ACT یہ کام سرانجام دیتا ہے، تو GR00T N1.7 یا Pi0.5 رن کے لیے 4 سے 12 USD ضائع نہیں ہوتے۔

کیا GR00T N1.7 واقعی Pi0.5 سے بہتر ہے؟

LIBERO پر وہ شور کے اندر ہیں: GR00T N1.7 کے لیے چار سوئیٹس میں 97.0%، openpi میں 30k مراحل پر Pi0.5 کے لیے 96.85%، LeRobot پورٹ کے لیے 97.5%، یہ سب مختلف ہارنیسز سے ہیں۔ حقیقی فرق 152 ms فی ایکشن سٹیپ بمقابلہ 485 ms، v2.1 ڈیٹا سیٹس بمقابلہ v3.0، اور بینچ مارک کی درستگی بمقابلہ اوپن ورلڈ جنرلائزیشن ہیں۔

کیا میں ان میں سے کسی کو ایک RTX 4090 پر فائن ٹیون کر سکتا ہوں؟

SmolVLA اور ACT، ہاں؛ دونوں RTX 4090 یا کسی بھی 24 GB کارڈ کے لیے درج ہیں اور مقامی طور پر چلتے ہیں۔ GR00T N1.7، N1.5 اور Pi0.5 کو A100 یا H100 80 GB کی ضرورت ہے اور یہاں صرف کلاؤڈ پر دستیاب ہیں۔ NVIDIA GR00T فائن ٹیوننگ کے لیے 40 GB یا اس سے زیادہ کی سفارش کرتا ہے؛ openpi کا فلور مکمل Pi0.5 فائن ٹیون کے لیے 70 GB سے زیادہ ہے، LoRA کے لیے 22.5 GB۔

ان پانچ میں سے میں کون سا تجارتی طور پر استعمال کر سکتا ہوں؟

GR00T N1.7 کے وزن NVIDIA Open Model License Agreement کے تحت ہیں، جس کے بارے میں کارڈ کہتا ہے کہ یہ تجارتی استعمال کا احاطہ کرتا ہے۔ N1.5 کے وزن غیر تجارتی ہیں۔ SmolVLA کا کوڈ LeRobot میں Apache 2.0 ہے، لیکن lerobot/smolvla_base کارڈ میں کوئی لائسنس فیلڈ نہیں ہے، لہذا وزن غیر واضح ہیں۔ ACT کے پاس لائسنس کے لیے کوئی بنیادی وزن نہیں ہے۔ Pi0.5 مبہم ہے: LeRobot کی دستاویزات Apache 2.0 کہتی ہیں، اس کا کارڈ میٹا ڈیٹا license: gemma پڑھتا ہے۔

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started