پالیسی ٹریننگ
AY-Robots منظم GPUs پر مینیپولیشن پالیسیز ٹرین کرتا ہے، اس لیے آپ ٹریننگ ہارڈویئر کے مالک ہوئے بغیر ریکارڈ شدہ ایپیسوڈز سے اپنے آرم پر چلنے والی پالیسی تک پہنچ سکتے ہیں۔ یہ صفحہ سپورٹڈ پالیسی اقسام، ٹریننگ رن صفحہ، چیک پوائنٹس، اور آپ کی ایپیسوڈ تعداد سے حقیقت پسندانہ طور پر کیا نتائج توقع کیے جائیں یہ احاطہ کرتا ہے۔
آخری اپڈیٹ 2026-08-09
اپنے GPU کے بغیر ٹریننگ
مینیپولیشن پالیسی ٹرین کرنا ایک GPU ورک لوڈ ہے، اور جدید ویژن لینگویج ایکشن ماڈلز کو ایک عام ورک اسٹیشن سے زیادہ VRAM چاہیے۔ AY-Robots پر، ٹریننگ پلیٹ فارم کے زیرِ انتظام کلاؤڈ GPUs پر چلتی ہے: آپ ایک ڈیٹاسیٹ اور پالیسی ٹائپ منتخب کرتے ہیں، رن شروع کرتے ہیں، اور براؤزر سے اس کی پیشرفت دیکھتے ہیں۔ کوئی CUDA سیٹ اپ نہیں، کوئی ڈرائیور میچنگ نہیں، اور برقرار رکھنے کے لیے کوئی انوائرنمنٹ نہیں۔
ان پٹ ہمیشہ Dashboard > Datasets سے ایک کلاؤڈ ڈیٹاسیٹ ہوتا ہے۔ ٹیلی آپریشن سیشنز کے ذریعے آپ نے جو کچھ بھی ریکارڈ کیا یا LeRobot فارمیٹ میں اپ لوڈ کیا، مرج شدہ ڈیٹاسیٹس سمیت، سب اہل ہے۔ ٹرین کرنے سے پہلے کیوریٹ کریں: Failure لیبل والے ایپیسوڈز عام طور پر ٹریننگ سیٹ سے باہر رہنے چاہئیں، اور ایپیسوڈ براؤزر میں دس منٹ کا جائزہ خراب ڈیمانسٹریشنز سے سیکھنے میں خرچ ہونے والے GPU کے گھنٹوں کی بچت کرتا ہے۔
سپورٹڈ پالیسیز
چار پالیسی خاندان سپورٹڈ ہیں۔ یہ سائز، ٹریننگ لاگت، اور آپ کے ڈیٹا سے کتنا جذب کر سکتے ہیں اس میں مختلف ہیں، اس لیے صحیح انتخاب کسی عمومی رینکنگ سے زیادہ آپ کے ٹاسک اور ڈیٹاسیٹ پر منحصر ہے۔
| پالیسی | قسم | خصوصیات |
|---|---|---|
| ACT | ٹرانسفارمر، ایکشن چنکنگ | واحد قدموں کے بجائے مستقبل کی ایکشنز کے مختصر چنکس کی پیشگوئی کرتی ہے۔ کمپیکٹ، نسبتاً تیزی سے ٹرین ہوتی ہے، اور ایک واضح طور پر متعین ٹاسک کے لیے ایک مضبوط پہلا انتخاب۔ |
| Diffusion Policy | ایکشن سیکوینسز پر ڈفیوژن | ڈیمانسٹریٹ کی گئی ایکشنز کی مکمل تقسیم کو ماڈل کرتی ہے، جو مدد دیتی ہے جب آپ کی ڈیمانسٹریشنز ٹاسک کو ایک سے زیادہ درست طریقوں سے حل کرتی ہیں۔ ACT سے ٹرین کرنا زیادہ بھاری اور انفرنس میں سست۔ |
| SmolVLA | چھوٹا ویژن لینگویج ایکشن ماڈل | لینگویج کنڈیشنڈ: آپ کے ایپیسوڈز کی ٹاسک اسٹرنگ ان پٹ کا حصہ بن جاتی ہے۔ بڑے فاؤنڈیشن ماڈل کے بغیر لینگویج کنڈیشننگ چاہیں تو ایک اچھا درمیانی راستہ۔ |
| GR00T فائن ٹیون | فاؤنڈیشن ماڈل فائن ٹیون | آپ کے ایپیسوڈز پر ایک بڑا پری ٹرینڈ روبوٹکس فاؤنڈیشن ماڈل فائن ٹیون کرتا ہے۔ چاروں میں سب سے اونچی سیلنگ، سب سے زیادہ ٹریننگ لاگت پر، اور سخت ڈیٹاسیٹ فارمیٹ کی ضرورت کے ساتھ۔ |
GR00T فائن ٹیوننگ صرف LeRobot فارمیٹ ورژن 2.1 کے ڈیٹاسیٹس قبول کرتی ہے۔ ایک v3.0 ڈیٹاسیٹ سبمیشن پر نہیں بلکہ ڈیٹا لوڈنگ کے دوران ناکام ہوگا، اس لیے رن شروع کرنے سے پہلے فارمیٹ ورژن چیک کریں۔ پلیٹ فارم پر ریکارڈ کیے گئے ڈیٹاسیٹس جیسے ہیں ویسے ہی استعمال کیے جا سکتے ہیں؛ بیرونی اپ لوڈز کے لیے، پہلے meta/info.json میں ورژن کی تصدیق کریں۔
ایک رن شروع کرنا
- 1ڈیٹاسیٹ منتخب کریں
Dashboard > Training کھولیں اور جس ڈیٹاسیٹ پر ٹرین کرنا ہے اسے منتخب کریں۔ ایپیسوڈ کاؤنٹ اور روبوٹ ٹائپ دکھائے جاتے ہیں تاکہ آپ تصدیق کر سکیں کہ آپ نے صحیح والا منتخب کیا۔
- 2پالیسی منتخب کریں
سپورٹڈ پالیسی اقسام میں سے ایک منتخب کریں۔ اگر یقین نہیں، تو ACT سے شروع کریں: یہ جاننے کا سب سے سستا طریقہ کہ آیا آپ کا ڈیٹاسیٹ کچھ بھی ٹرین کرنے کے لیے کافی اچھا ہے۔
- 3لانچ کریں
رن شروع کریں۔ اسے ایک جاب آئی ڈی اور اپنا رن صفحہ ملتا ہے، اور آپ براؤزر بند کر سکتے ہیں: ٹریننگ سرور سائیڈ پر جاری رہتی ہے اور آپ کے واپس آنے پر صفحہ لائیو حالت دکھاتا ہے۔
ٹریننگ رن صفحہ
ہر رن کا اپنا مخصوص صفحہ ہے جو ٹریننگ کے دوران آپ کے پاس واقعی موجود دو سوالات کا جواب دیتا ہے: کیا یہ سیکھ رہا ہے، اور کیا مشین صحت مند ہے۔ سیکھنے کی پیشرفت loss کے چارٹس، لرننگ ریٹ شیڈول، اور گریڈینٹ نارم کے طور پر دکھائی جاتی ہے۔ ایک loss جو فوری طور پر پلیٹو ہو جائے یا ایک گریڈینٹ نارم جو پھٹ جائے آپ کو جلدی بتا دیتا ہے کہ رن کا انتظار کرنا فائدہ مند نہیں۔
مشین کی صحت ساتھ ساتھ دکھائی جاتی ہے: GPU استعمال اور میموری، ساتھ میں ٹریننگ مشین کے ہوسٹ میٹرکس۔ ایک فیز ٹائم لائن دکھاتی ہے کہ رن اس وقت کہاں ہے، انوائرنمنٹ کی تیاری سے لے کر ڈیٹا لوڈنگ، خود ٹریننگ لوپ، اور چیک پوائنٹ اپ لوڈ تک۔ جب کچھ غلط لگے، بلٹ ان لاگ ویور آپ کو بغیر کسی SSH رسائی کے خام ٹریننگ لاگز دیتا ہے، جو عام طور پر یہ دیکھنے کے لیے کافی ہے کہ ناکامی آپ کے ڈیٹاسیٹ کی ہے یا رن کی خود۔
چیک پوائنٹس اور دوبارہ شروع کرنا
چیک پوائنٹس فی رن محفوظ کیے جاتے ہیں، کسی مشترکہ پول میں نہیں، اس لیے ایک رن صفحے پر درج چیک پوائنٹس ہمیشہ بالکل اسی رن اور اس کی کنفیگریشن سے تعلق رکھتے ہیں۔ یہ جتنا لگتا ہے اس سے زیادہ اہم ہے: مختلف سیٹنگز والے رنز کے درمیان چیک پوائنٹس ملانا خاموشی سے خراب ہونے والی پالیسیز کا ایک کلاسک ذریعہ ہے۔
اگر کوئی رن رک جائے، تو آپ دوبارہ شروع کرنے کے بجائے اس کے آخری چیک پوائنٹ سے دوبارہ شروع کر سکتے ہیں۔ درمیانی چیک پوائنٹس بھی خود کارآمد ہوتے ہیں: جب ایک طویل رن آخر کے قریب اوورفٹ ہونا شروع کرتا ہے، تو ایک پہلے کا چیک پوائنٹ اکثر آخری چیک پوائنٹ سے بہتر طور پر اصل آرم پر چلتا ہے۔
اپنے آرم پر ٹرینڈ پالیسی چلانا
ایک مکمل شدہ پالیسی براہ راست آپ کے روبوٹ پر ڈیپلائے کی جا سکتی ہے۔ کاک پٹ میں، اپنے کنیکٹڈ آرم کے لیے ٹرینڈ پالیسی منتخب کریں اور انفرنس شروع کریں: اب پالیسی وہ جوائنٹ کمانڈز پیدا کرتی ہے جو پہلے آپ ٹیلی آپریشن کے ذریعے پیدا کرتے تھے۔ آرم اسی روبوٹ ٹائپ کا ہونا چاہیے جس پر ڈیٹاسیٹ ریکارڈ کیا گیا تھا، اور منظر ٹریننگ کے مناظر سے ملتا جلتا ہونا چاہیے، بشمول کیمرے کی جگہ۔
پہلے انفرنس رنز کو تجربات کی طرح سمجھیں، ڈیموز کی طرح نہیں۔ ایمرجنسی اسٹاپ کو ہاتھ کی پہنچ میں رکھیں، اپنے ڈیمانسٹریٹ کردہ حالات کے قریب ایک ابتدائی حالت سے شروع کریں، اور توقع کریں کہ پالیسی ایسی چیزوں کے لیے حساس ہوگی جو آپ محسوس بھی نہیں کریں گے: ایک ہلا ہوا کیمرا، مختلف روشنی، یا ایسی کوئی چیز جو ڈیٹاسیٹ میں کبھی موجود نہیں تھی۔
آپ کو کتنے ایپیسوڈز چاہئیں
پلیٹ فارم پر سب سے عام ٹریننگ غلطی کوئی غلط ہائپر پیرامیٹر نہیں، بلکہ بہت کم ڈیٹا پر ٹریننگ کرکے یہ نتیجہ اخذ کرنا ہے کہ پالیسی ٹائپ کام نہیں کرتی۔ ایک واحد ٹیبل ٹاپ ٹاسک کے لیے ایک عمومی اصول کے طور پر: تقریباً 50 ایپیسوڈز آپ کو ایک ایسی پالیسی دیتے ہیں جس کی محدود جنرلائزیشن ہو جو آپ کے ڈیمانسٹریٹ کیے ہوئے حالات کے قریب ابتدائی حالات سے کامیاب ہوتی ہے۔ 100 سے 200 ایپیسوڈز اس ایک ٹاسک کے لیے پورے ورک اسپیس میں قابل استعمال مضبوطی دیتے ہیں، بشرطیکہ آپ نے ایپیسوڈز کے درمیان چیز کی جگہ بدلی ہو۔
زیادہ قابل پالیسی اقسام اسے منسوخ نہیں کرتیں۔ 20 ایپیسوڈز پر ایک GR00T فائن ٹیون پھر بھی خراب جنرلائز کرے گا؛ بڑے ماڈلز جو خریدتے ہیں وہ ہے ڈیٹا ہونے پر ایک بہتر سیلنگ۔ اگر آپ کا بجٹ محدود ہے، تو بڑے ماڈل پر خرچ کرنے سے پہلے مزید متنوع ایپیسوڈز پر خرچ کریں۔
اکثر پوچھے جانے والے سوالات
ایک ٹریننگ رن میں کتنا وقت لگتا ہے؟▾
یہ پالیسی ٹائپ اور ڈیٹاسیٹ سائز پر منحصر ہے، اس لیے کوئی ایک درست نمبر نہیں۔ ACT عام طور پر چاروں میں سب سے تیز ہے، GR00T فائن ٹیونز سب سے سست۔ رن صفحے پر فیز ٹائم لائن اور loss چارٹس جلدی دکھاتے ہیں کہ کیا رن آگے بڑھ رہا ہے۔
کیا میں مرج شدہ ڈیٹاسیٹ پر ٹرین کر سکتا ہوں؟▾
جی ہاں۔ مرج شدہ ڈیٹاسیٹس عام ڈیٹاسیٹس ہیں؛ مرج ویلیڈیشن پہلے ہی مستقل fps، فیچرز، اور روبوٹ ٹائپ کی ضمانت دے چکی ہے۔ ایک ہی ٹاسک کی ریکارڈنگز مرج کرنا 100 سے 200 ایپیسوڈ رینج تک پہنچنے کے سب سے مؤثر طریقوں میں سے ایک ہے۔
میرا GR00T رن ڈیٹا لوڈنگ کے دوران ناکام ہو جاتا ہے۔ مجھے پہلے کیا چیک کرنا چاہیے؟▾
ڈیٹاسیٹ فارمیٹ ورژن۔ GR00T فائن ٹیوننگ کو LeRobot v2.1 چاہیے، اور ایک v3.0 ڈیٹاسیٹ بالکل وہیں ناکام ہوتا ہے۔ اپنے ڈیٹاسیٹ کے meta/info.json میں ورژن چیک کریں۔
کیا مجھے ٹریننگ سے پہلے ناکام ایپیسوڈز ہٹا دینے چاہئیں؟▾
عام طور پر ہاں۔ Failure لیبل والے ایپیسوڈز پالیسی کو ناکام رویہ سکھاتے ہیں۔ Recovery ایپیسوڈز مختلف ہیں: یہ دکھاتے ہیں کہ کوئی غلطی کیسے درست کی جائے اور اکثر رکھنے کے قابل ہوتے ہیں۔
کیا مجھے ٹریننگ کے دوران براؤزر کھلا رکھنا ضروری ہے؟▾
نہیں۔ رنز سرور سائیڈ پر چلتے ہیں۔ آپ کے واپس آنے پر رن صفحہ موجودہ حالت، چارٹس، اور لاگز دکھاتا ہے، اور چیک پوائنٹس محفوظ ہوتے ہیں چاہے کوئی دیکھ رہا ہو یا نہ ہو۔
AY-Robots ٹیلی آپریشن ریکارڈنگز کو LeRobot فارمیٹ میں کیسے محفوظ کرتا ہے: ایپیسوڈ ساخت، ڈیش بورڈ ایپیسوڈ براؤزر، اپ لوڈز کو مرج کرنا، اور مارکیٹ پلیس۔
AY-Robots پر سپورٹڈ ہر روبوٹ آرم اس کی وضاحتوں کے ساتھ: SO-100، Koch v1.1، Franka FR3، FP3 اور Panda، WidowX-250، اور ALOHA ViperX-300۔