ایک آپریٹر جو ٹیلی آپریشن انٹرفیس کے ذریعے روبوٹ بازو کی نگرانی کر رہا ہے، کنٹرول پر ہاتھ اور کنٹرول سنبھالنے کے لیے تیار
DAggerInteractive Imitation LearningHG-DAggerRobot PoliciesSO-100

HG-DAgger اور Gated Variants: روبوٹ پالیسی پر کنٹرول کب لیں یہ کون فیصلہ کرتا ہے

AY-Robots ResearchAugust 27, 202615 منٹ کا مطالعہ

سادہ DAgger ایک انسان سے کہتا ہے کہ حالات پر لیبل لگائے جبکہ روبوٹ ابھی چل رہا ہے۔ حقیقی ہارڈویئر پر یہ غیر محفوظ ہے اور اچھے لیبل نہیں بناتا۔ Gated variants بغیر سوچے سمجھے لیبل لگانے کو ایک گیٹ سے بدل دیتے ہیں جسے کوئی سنبھالتا ہے: HG-DAgger میں انسان، SafeDAgger میں حفاظتی classifier، EnsembleDAgger میں ensemble کے اختلاف سے، ThriftyDAgger میں بجٹ بندی شدہ نیا پن اور خطرے کے تخمینے سے۔ یہ مضمون ان کا موازنہ کرتا ہے کہ گیٹ کا مالک کون ہے، اس کو کیا signal کھولتا ہے، اور ہر ایک کی کیا قیمت ہے — اور کیوں انسان-gated صورت ہی وہ ہے جو حقیقی بازو سے رابطے میں قائم رہتی ہے۔

ایک cloned policy وہاں ناکام ہوتی ہے جہاں اس کی تربیتی ڈیٹا ختم ہو جاتی ہے۔ حل یہ ہے کہ ڈیٹا اکٹھا کرنا جاری رکھیں پالیسی کی اپنی state distribution کے تحت بجائے demonstrator کے، جو DAgger کرتا ہے اور جو dataset aggregation کا تعارف پہلی اصولوں سے سمجھاتا ہے۔ یہ الگورتھم کے پریشان کن حصے کو کھلا چھوڑ دیتا ہے: جبکہ learner چل رہا ہو، expert کو کہنا چاہیے کہ وہ کیا کیا ہوتا، ہر state میں، بغیر کنٹرول میں ہوئے۔

Simulator میں scripted expert کے ساتھ یہ مفت ہے۔ ٹیبل پر حقیقی بازو کے ساتھ یہ نہ تو مفت ہے اور نہ محفوظ۔ HG-DAgger مصنفین اعتراض کو بالکل واضح کہتے ہیں: اس طرح کی sampling schemes "expert سے action labels دینے کی ضرورت ہوتی ہے بغیر سسٹم پر مکمل کنٹرول کے"، جو "حفاظت کو کم کر سکتا ہے اور، انسانوں کو experts کے طور پر استعمال کرتے وقت، جمع کیے گئے لیبل کی کوالٹی کو محسوس شدہ actuator lag کی وجہ سے خراب کرنے کی امکانہ ہے" (Kelly et al., 2019)۔ دو ناکامیاں اس جملے میں چھپی ہوئی ہیں: پالیسی ایسے states میں چلتی رہتی ہے جہاں کوئی نہیں چاہتا، اور اس خطرے کے ساتھ خریدے گئے لیبل وہ سے بھی بدتر ہیں جو ایک انسان کنٹرول میں ہوتے ہوئے بناتا ہے۔ ہر variant نیچے ایک ہی سوال کا جواب دیتا ہے — کنٹرول پر ایک گیٹ لگائیں اور کوئی فیصلہ کرے کہ یہ کب کھلے۔ وہ اس میں مختلف ہیں کہ وہ کوئی کون ہے۔

مختصر ورژن

  • Gated variants بغیر سوچے سمجھے لیبل لگانے کو policy control اور expert control کے درمیان ایک سوئچ سے بدل دیتے ہیں۔ جو انہیں الگ کرتا ہے وہ سوئچ کا مالک ہے۔
  • HG-DAgger سوئچ انسان کو دیتا ہے اور صرف ڈیٹا aggregate کرتا ہے جو ریکارڈ ہوا جبکہ انسان کے پاس بغیر رکاوٹ کنٹرول تھا۔
  • SafeDAgger اسے ایک binary classifier کو دیتا ہے جو reference policy سے انحراف کی پیش گوئی کرتا ہے؛ EnsembleDAgger کم ensemble variance اور expert action سے چھوٹی فاصلہ دونوں کو چاہتا ہے۔
  • LazyDAgger hysteresis شامل کرتا ہے تاکہ کنٹرول ping-pong نہ ہو؛ ThriftyDAgger نیا پن یا novelty-اور-risk کی بنیاد پر گیٹ لگاتا ہے ایک واضح intervention budget کے تحت۔
  • Robot-gated signals کو کچھ ایسی چیز کی ضرورت ہے جو fine-tuned VLA hobby-class بازو پر عام طور پر فقدان ہے: ایک reference policy، سستا ensemble، یا calibrated epistemic uncertainty۔
  • گیٹ نصف طریقہ ہے۔ intervention segments کے بعد کیا ہوتا ہے — mix، weight، aggregate — یہ فیصلہ کرتا ہے کہ آیا یہ دور کچھ بہتر لایا۔

Human-gated اور robot-gated: وہ تقسیم جو اہم ہے

Interactive imitation learning کا اپنا سروے ہے؛ Celemin اور ساتھی اسے feedback type، interface، learning model، user experience، application اور benchmark کے ساتھ catalogue کرتے ہیں۔ وہ تفریق جو آپ کی engineering کو فیصلہ کرتی ہے وہ ان میں سے کسی بھی axis سے سادہ تر ہے، اور حالیہ کام اسے براہ راست نام دیتے ہیں: ایک طریقہ human-gated ہے جب supervisor فیصلہ کرے کہ کب intervene کریں، اور robot-gated جب agent فیصلہ کرے کہ کب مدد مانگیں (Cai et al., 2025)۔ باقی سب کچھ ان دونوں میں سے ایک انتخاب کی خدمت کرنے والی مشینری ہے۔ تبادلہ شروع سے نظر آتا ہے: ایک human gate مسلسل توجہ کی قیمت دیتا ہے، اور ایک robot gate وہ توجہ واپس دینے کا وعدہ کرتا ہے — لیکن صرف اگر signal جو وہ گیٹ کرتا ہے قابل اعتماد ہے، اور یہ signal بنانا اپنی تحقیق کا مسئلہ ہے۔

SafeDAgger: ایک classifier جو اپنے انحراف کی پیش گوئی کرتا ہے

Zhang اور Cho کا SafeDAgger (2016) ان gates میں سب سے پرانا ہے۔ Reference policy کو query کرنا مہنگا حصہ ہے، تو دوسرا، چھوٹا network — safety policy — پیش گوئی کرتا ہے کہ آیا query کرنا قابل قیمت ہے۔ یہ "ایک binary label واپس کرتا ہے یہ ظاہر کرتے ہوئے کہ آیا primary policy اسے query کیے بغیر reference policy سے منحرف ہونے کا امکان ہے"۔ Label دونوں policies کے actions کے درمیان squared L2 انحراف کے خلاف threshold tau کے ساتھ defined ہے، اور classifier binary cross-entropy کے ساتھ fit ہوتا ہے۔ Runtime پر یہ ہر state میں فیصلہ کرتا ہے کہ learner چلتا رہے یا reference سنبھالے۔ Abstract مختلف reference queries کی رپورٹ کرتا ہے ایک car racing simulator میں بھی convergence speed-up جو مصنفین ایک automated curriculum effect کو منسوب کرتے ہیں، بغیر کوئی figure دیے۔

پکڑ definition میں ہے، نتائج میں نہیں۔ Classifier کو تربیت دینے کے لیے reference policy کا action ہر state پر ضروری ہے جو اسے fit کرنے کے لیے استعمال ہوتا ہے، جو فرض کرتا ہے کہ reference ایک اور پروگرام ہے۔ اگر آپ کا reference ایک شخص ہے leader arm کے ساتھ، تو یہ label set سستا نہیں ہے اور طریقہ وہ خصوصیت کھو دیتا ہے جس کے لیے یہ design کیا گیا تھا۔

EnsembleDAgger: شک اور اختلاف، دونوں

Menda، Driggs-Campbell اور Kochenderfer (2019) gate کو ایک probabilistic سوال کے طور پر سمجھتے ہیں۔ EnsembleDAgger "ایک ensemble of neural networks استعمال کرتے ہوئے Gaussian Process کو approximate کرتا ہے" اور ensemble variance کو ایک confidence proxy کے طور پر پڑھتا ہے: high variance کا مطلب ایک region training data سے مختلف، جو — فرض کرتے ہوئے کہ expert failure states سے بچتا ہے — failure کے قریبی سے correlate کرتا ہے۔ اصول ایک conjunction ہے۔ Learner صرف تب کام کر سکتا ہے جب اس کے mean action اور expert کے action کے درمیان L2 فاصلہ ایک threshold (discrepancy) سے نیچے رہے اور اس کے predicted action کی variance ایک دوسری (doubt) سے نیچے رہے۔ اگر دونوں میں سے کوئی بھی ناکام ہو، تو expert کنٹرول سنبھالتا ہے۔ مقصد learner کے actions کا حصہ زیادہ سے زیادہ کرنا ہے جبکہ failure کے امکان کو محدود کرتے ہیں؛ paper ایک inverted pendulum اور MuJoCo HalfCheetah پر دوسری DAgger variants کے مقابلہ بہتر حفاظت اور learning کی رپورٹ کرتا ہے۔

Discrepancy term کو expert کا action چاہیے

یہ خاموشی سے hands-off supervision کے لیے مکمل rule کو غیر قابل استعمال بناتا ہے۔ Learner کے action اور expert کے action کے درمیان فاصلہ expert کے action کو اس state میں، اس لمحے میں ضروری کرتا ہے۔ Scripted expert کے ساتھ، ٹھیک ہے۔ انسان کے ساتھ، انسان کو مسلسل actions بنانے ہوں — بالکل وہی بوجھ جو gated variants ختم کرنے کے لیے تھے۔ Doubt term اکیلے hands-off ہے؛ conjunction نہیں ہے۔

LazyDAgger: سوئچ کو chatter سے روکیں

Hoque اور ساتھی (2021) ایک لاگت پر حملہ کریں جو پہلے کے کاغذات نے measure نہیں کی: سوئچ خود۔ ہر intervention "دوسری کام میں رکاوٹ ڈالتا ہے جو انسان کر رہا ہے، supervisor اور autonomous control کے درمیان ہر context switch کے ساتھ latency لاتا ہے، اور کو انجام دینے کے لیے وقت ضروری ہے"۔ ایک gate جو ایک منٹ میں دس بار کھولتا اور بند ہوتا ہے وہ اس سے بدتر ہے جو دس سیکنڈ کے لیے ایک بار کھلتا ہے، identical autonomous share کے ساتھ۔ LazyDAgger SafeDAgger کو asymmetric thresholds کے ساتھ بڑھاتا ہے — supervisor کنٹرول میں داخل ہونا مشکل ہے اس میں رہنے سے — تاکہ سسٹم boundary پر oscillate نہ ہو۔ Simulation میں یہ "3 continuous control tasks پر SafeDAgger سے اوستاً 60% context switches کو کم کر سکتا ہے جبکہ state-of-the-art policy performance برقرار رہتی ہے"؛ fabric manipulation میں ایک ABB YuMi کے ساتھ یہ "60% context switches کو کم کرتا ہے جبکہ execution time پر SafeDAgger سے 60% زیادہ success rate حاصل کرتے ہوئے"۔

ThriftyDAgger: نیا پن یا خطرہ، ایک budget کے تحت

ThriftyDAgger (Hoque et al.، CoRL 2021) supervisor کے budget سے شروع کرتا ہے بجائے policy کے۔ یہ "ایک learned switching policy استعمال کرتا ہے تاکہ صرف states میں interventions کے لیے کہا جائے جو کافی طور پر (1) نیا ہو، جہاں robot policy کے پاس imitate کرنے کے لیے کوئی reference behavior نہیں ہے، یا (2) risky ہو، جہاں robot کے پاس task completion میں کم confidence ہے"، ایک نیا metric کے ساتھ اس خطرے کا تخمینہ لگانے کے لیے۔ Budget ایک input ہے، outcome نہیں: آپ کہہ دیتے ہیں کہ آپ کتنا انسانی وقت خرچ کریں گے۔ Execution time پر لاگو ہوتے ہوئے طریقہ "simulation اور physical tasks دونوں پر 100% success rate حاصل کرتا ہے"، اور دس participants کے ساتھ ایک user study جو تین-robot fleet کو کنٹرول کر رہے ہیں ایک concentration task کے ساتھ رپورٹ کرتے ہیں کہ یہ "next best algorithm سے موازنے میں human اور robot performance کو 58% اور 80% بڑھاتا ہے جبکہ supervisor بوجھ کو کم کرتے ہیں"۔ Fleet setting یہ کام کے لیے قدرتی گھر ہے؛ Fleet-DAgger نے بعد میں multiple robots اور supervisors کے ساتھ interactive fleet learning کو فارمالائز کیا، Return on Human Effort کی تجویز کی جو مقدار optimize کرنی ہے۔

HG-DAgger: انسان گیٹ کو سنبھالتا ہے

Kelly et al. (2019) دوسری طرف جاتے ہیں۔ کوئی switching policy نہیں ہے۔ Learner کو "جب تک expert نہ دیکھے کہ novice state space کے unsafe region میں داخل ہو گیا ہے" تک roll out کیا جاتا ہے، جس وقت expert کنٹرول سنبھالتا ہے اور سسٹم کو واپس guide کرتا ہے۔ Aggregation rule سخت حصہ ہے: "Expert action labels صرف اسی وقت جمع کیے جاتے ہیں اور dataset میں شامل ہوتے ہیں جب یہ recovery trajectories ہوں، جس دوران انسان expert کے پاس سسٹم کے uninterrupted کنٹرول تھا۔" جبکہ انسان ایک تماشائی ہے تو کچھ بھی label نہیں ہے۔

یہ سوئچ پر رکتا نہیں ہے۔ HG-DAgger بھی "ایک model-uncertainty-based risk metric کے لیے ایک safety threshold سیکھتا ہے جو fully trained novice کی performance کی مختلف regions of state space میں predict کرنے کے لیے استعمال ہو سکتا ہے": یہ log کرتا ہے کہ learner اتنا uncertain تھا جتنا انسان نے intervene کیا اور ان records کے آخری quarter کا اوسط کرتا ہے، جہاں learner اپنی final form سے سب سے زیادہ ملتا ہے۔ یہ ایک gate نہیں ہے جو روبوٹ چلاتا ہے بلکہ ایک diagnostic ہے جو آپ کو بتاتا ہے کہ finished policy کہاں held ہونے کی امید ہے۔ Evaluation ایک simulated اور real-world driving task کو cover کرتا ہے اور DAgger اور behavior cloning دونوں سے بہتر performance کی رپورٹ کرتا ہے۔

ایک related line جو count کے طور پر ہے بدل دیتا ہے۔ Spencer اور ساتھی کا Expert Intervention Learning کہتا ہے کہ "کوئی بھی amount of expert feedback، چاہے intervention یا non-intervention ہو، موجودہ state کی کوالٹی کے بارے میں معلومات فراہم کرتا ہے، action کی optimality، یا دونوں"، ایک constraint کے طور پر learner کے value function پر formalised اور no-regret online learning کے ساتھ حل کیا۔ اس reading کے تحت، وہ stretches جہاں انسان نے دیکھا اور کچھ نہیں کیا weak positive evidence ہیں empty سے بجائے۔ EIL collision avoidance سیکھتا ہے تقریباً ایک منٹ کے expert کنٹرول سے۔

روبوٹ بازو کی workspace cameras کے ساتھ جو ڈیٹا collection کے لیے supervised policy rollout کے دوران رکھے ہوں
ایک human-gated دور ایک عام inference run ہے جس کے ساتھ ایک recorder منسلک ہو۔ وہ frames جو آپریٹر نے چلائے ہیں flagged ہیں؛ باقی جیسے تھا ویسے رہے۔

Variants ایک طرف

طریقہگیٹ کو کون کھولتا ہےSignalدستیاب ہونے کی ضرورت ہےرپورٹ کیا گیا
DAgger (Ross et al., 2011)کوئی نہیں — learner ہمیشہ چلتا ہےکوئی نہیں؛ expert ہر دیکھے ہوئے state پر label لگاتا ہےکوئی expert جو off-policy states پر label لگانے کے قابل ہو جبکہ کنٹرول میں نہ ہوNo-regret reduction with guarantees learner کی state distribution کے تحت
HG-DAgger (Kelly et al., 2019)انسانی supervisorSupervisor کا فیصلہ کہ state unsafe ہےکوئی شخص دیکھتا ہے، اور کنٹرول کا صاف handoverSimulated اور real driving task پر DAgger اور behavior cloning کو شکست دیتا ہے؛ بھی ایک risk threshold سیکھتا ہے
SafeDAgger (Zhang & Cho, 2016)روبوٹBinary classifier L2 انحراف کے لیے reference سے threshold tau سے اوپرایک queryable reference policy classifier کے labels کے لیےRacing simulator میں کم reference queries، تیز convergence (figure نہیں دیا گیا)
EnsembleDAgger (Menda et al., 2019)روبوٹEnsemble variance اور expert action سے فاصلہ، دونوں threshold سے نیچےNetworks کا ایک ensemble بھی expert کا action ہر step پرPendulum اور HalfCheetah پر بہتر حفاظت اور learning
LazyDAgger (Hoque et al., 2021)روبوٹ، hysteresis کے ساتھSafeDAgger کا signal الگ entry اور exit thresholds کے ساتھجو SafeDAgger کو چاہیے بھی tune کے لیے ایک دوسری threshold~60% کم context switches 3 tasks پر؛ 60% زیادہ success YuMi fabric پر
ThriftyDAgger (Hoque et al., 2021)روبوٹ، ایک budget کے تحتنیا پن، یا completion کے task میں estimated risk نہ کرنے کاایک learned risk estimator اور ایک stated intervention budget100% success execution time پر؛ user study (N=10): next-best سے 58% اور 80% gains
EIL (Spencer et al., 2020)انسان — non-intervention بھی countsIntervention اور اس کی absence constraints کے طور پر value function پرOnline no-regret learning ایک value constraint پرCollision avoidance تقریباً ایک منٹ کے expert کنٹرول سے

ہر گیٹ کیا خریدتا ہے، اور یہ کیا چارج کرتا ہے

"Needs" column کو نیچے پڑھیں اور ایک pattern باہر آتا ہے: ہر robot-gated signal وہاں ایک proxy ہے جو manufactured ہونا پڑے، اور ہر proxy کے اپنے بل ہیں۔

  • Discrepancy signals (SafeDAgger، LazyDAgger، EnsembleDAgger کے rule کا نصف) کو ایک reference policy چاہیے۔ یا تو آپ کے پاس ایک scripted expert ہے، جس میں دلچسپ مسئلہ پہلے سے حل ہو چکا ہے، یا ایک انسان مسلسل actions بناتا رہتا ہے تاکہ ایک فاصلہ compute کیا جائے۔
  • Doubt signals کو calibrated epistemic uncertainty چاہیے۔ چھوٹے control networks کا ایک ensemble اسے approximate کرتا ہے؛ ایک تین-billion-parameter vision-language-action model کا ensemble ایک memory اور latency مسئلہ پہلے ہے۔
  • Novelty اور risk signals کو task completion کے ایک learned estimator کی ضرورت ہے، کافی successful اور failed rollouts پر fitted۔ ایک task پر آپ ابھی کام کر رہے ہیں، وہ ڈیٹا round one میں موجود نہیں ہے۔
  • انسانی gate کو توجہ اور کچھ نہیں چاہیے — صرف signal دستیاب پہلے دن پر، کسی بھی policy architecture پر، کوئی اضافی model تربیت دیے بغیر۔
  • کوئی robot gate انسان کو room سے نہیں نکالتا۔ وہ reduce کرتے ہیں کہ انسان کو کتنی بار کام کرنا پڑے، نہ کہ آیا انسان موجود ہوں۔

ایک خاموش فرق ہے جو gate بناتا ہے۔ ایک robot gate mid-trajectory firing ایک شخص کو ایک حرکت پذیر بازو دیتا ہے ایک arbitrary pose میں۔ ایک human gate آپریٹر کو لمحہ منتخب کرنے دیتا ہے — reach کے بعد، grasp سے پہلے، swing کے بیچ میں نہیں۔ دونوں سے recovery segments برابر صاف نہیں ہوں، اور وہ segments دور کی مکمل پیداوار ہیں۔

انسان-gated form حقیقی ہارڈویئر پر کیوں جیتا ہے

یہ ایک engineering argument ہے، benchmark result نہیں — کوئی paper جو ہمیں ملا تمام پانچ gates ایک ہی manipulator پر ایک ہی policy class کے ساتھ چلاتا ہے۔ یہ چار نکات پر منحصر ہے۔

پہلا، supervisor وہاں ویسے ہی ہے۔ کوئی بھی SO-100 arm کو بغیر دیکھ بھال کے objects کے ساتھ چلتے ہوئے چھوڑ نہیں دیتا جو یہ knock over کر سکتے ہیں۔ ایک بار جب کوئی دیکھتا ہے، انہیں ایک takeover button دینے کی marginal cost تقریباً صفر ہے؛ ایک calibrated risk estimator بنانا ایک project ہے۔

دوسرا، uncertainty جو آپ حقیقی طور پر ایک modern policy پر measure کر سکتے ہیں اکثر غلط مقدار ہے۔ ایک diffusion یا flow-matching head sampled action chunks میں variance بناتا ہے، اور وہ variance multimodality کو ظاہر کرتا ہے جو head کو represent کرنے کے لیے تربیت دیا گیا تھا، state کے بارے میں epistemic ignorance نہیں۔ EnsembleDAgger کا doubt term ایک ensemble استعمال کرتا ہے بالکل اس کو capture کرنے کے لیے۔ دونوں ایک ہی number کی طرح دیکھتے ہیں اور نہیں ہیں؛ action chunking اور flow matching entries سمجھاتے ہیں کہ وہ heads پہلے جگہ پر actions کو emit کیسے کرتے ہیں۔

تیسرا، manipulation میں failures جو اہم ہیں اکثر semantically ہیں بجائے statistically unusual کے۔ ایک policy gripper کو دو سینٹی میٹر سے پہلے بند کرتی ہے، یا confidently غلط cube کے لیے دو identical میں سے پہنچتی ہے، high-variance state میں نہیں ہے — یہ confident اور غلط ہے۔ کوئی variance threshold یہ catch نہیں کرتا؛ ایک شخص دیکھتا ہے یہ فوری طور پر catch کرتا ہے۔

چوتھا، label quality — اصل HG-DAgger نکتہ، اور سب سے زیادہ skipped ہوا۔ Labels جو جمع ہوتے ہیں جب انسان کے پاس uninterrupted کنٹرول ہو اور beat labels جو ایک حرکت پذیر سسٹم پر narrated ہوں۔ اگر مقصد corrective ڈیٹا ہے aggregating قابل، proof کا بوجھ automated gate کے ساتھ ہے۔

جہاں robot gates واقعی کامیاب ہوتے ہیں

تصویر flip ہوتی ہے جب ایک supervisor بہت سارے robots کے لیے ذمہ دار ہو — وہ regime جو ThriftyDAgger کا user study اور Fleet-DAgger کی formalization target کرتی ہے۔ ایک fleet کے ساتھ، human attention scarce resource ہے اور ایک imperfect allocation کوئی بھی نہیں beats۔ ایک بازو ایک desk پر آپ اس regime میں نہیں ہیں۔

Human-gated loop، پہلے سے wired

Takeover ایک running inference session کے دوران، per-frame intervention flags corrected segments پر، ہر run کو curate کرنا corrections یا evaluation کے لیے، ایک mixed dataset بنانا sources سے آپ منتخب کرتے ہیں، اور existing checkpoint سے training جاری رکھنا built in ہیں بجائے hand scripted ہونے کے۔ Takeover ایک leader arm کے ساتھ کام کرتا ہے، یا keyboard اور sliders کے ساتھ اگر آپ کے پاس ایک نہیں ہے۔

DAgger loop کیسے چلتا ہے یہ دیکھیں

گیٹ نصف طریقہ ہے؛ ڈیٹا handling دوسرا نصف ہے

ایک gate فیصلہ کرتا ہے جو frames ایک انسان نے چلائے، نہ کہ ان کے ساتھ کیا کریں، اور وہ دوسرا فیصلہ وہاں ہے جہاں rounds سب سے زیادہ وفر ہوتے ہیں۔ پہلا اصول وہ ہے جو D in DAgger کے لیے stands کرتا ہے: aggregate، replace نہ کریں۔ Fine-tuning ایک checkpoint خالصتاً چند سو correction frames پر آپ کو ایک model دیتا ہے جس نے تقریباً کچھ نہیں دیکھا سوائے recoveries اور nominal trajectory کو بھول گیا۔

دوسرا اصول یہ ہے کہ intervention frames عام frames نہیں ہیں۔ Mandlekar et al. نے ایک remote-teleoperation system بنایا 6-DoF manipulation کے لیے operators کو policies monitor کرنے دیتے ہوئے اور failure پر take over کرتے ہوئے، پھر iteratively trained ایک algorithm کے ساتھ جو "policy کو سیکھنے کو حوصلہ دیتا ہے کہ interventions کے ذریعے bottlenecks کو traverse کریں"؛ اس ڈیٹا پر trained agents ordinary demonstration samples کے برابر تعداد سے بہتری فراہم کرتے ہیں۔ Sirius اس خیال کو deployment میں دھکیلتا ہے، "re-weighing training samples approximated human trust کے ساتھ اور policies کو optimize کرتے ہوئے weighted behavioral cloning کے ساتھ"۔ دونوں کو per-frame marker چاہیے کہ کیا انسان-driven تھا، جو intervention flag زیادہ اہم ہے کیوں۔intervention flag اہم سے زیادہ دکھتا ہے۔

تیسرا اصول یہ ہے کہ automatic mixing ایک trap ہے۔ ایک composed dataset جس کے sources آپ enumerate نہیں کر سکتے وہ ہے جو آپ debug نہیں کر سکتے جب اگلا round بدتر ہو جائے۔ اس platform پر compose step اس وجہ سے explicit ہے — original dataset plus corrections، episode selection per source، اور نتیجہ ایک عام LeRobot dataset ہے جو syncs اور trains کسی اور کی طرح؛ dataset documentation format side کو cover کرتا ہے۔

Round میں Stepیہ کیا بناتا ہےسب سے عام طریقہ یہ غلط جاتا ہے
Inference کو recording کے ساتھ چلائیںایک run learner کی اپنی state distribution کے تحتPlain teleoperation کے طور پر ریکارڈ کیا گیا، یہ کھوتے ہوئے کہ policy چل رہی تھی
Failure پر take over کریںCorrection segments per-frame intervention flag کے ساتھCosmetic wobble کو correcting، طریقہ سیکھ رہے ہیں بجائے recovery کے
ہر episode کو curate کریںCorrections، evaluation، یا discardsسب کچھ رکھنا؛ ایک botched takeover کے قابل ہے اس episode سے زیادہ
Corrections کو sync کریںایک versioned dataset اصل کے ساتھCorrections جو کبھی local machine کو نہیں چھوڑتے
Mixed dataset کو compose کریںOriginal plus corrections، واضح selectionSilent auto-mixing، تاکہ ایک بعد میں regression کو ایک source سے trace نہیں ہو سکے
ایک checkpoint سے جاری رکھیںایک checkpoint پچھلے سے initializedایک optimizer resume کی توقع؛ weights model کو initialize کرتے ہیں، optimizer state کو restore نہیں کرتے

ایک gate set کریں جو ایک شخص اصل میں سنبھال سکے

"انسان فیصلہ کرتا ہے" ایک specification نہیں ہے۔ دو operators مختلف thresholds کے ساتھ incomparable rounds بناتے ہیں، اور ایک drifting threshold ایک trend بناتا ہے آپ پڑھ نہیں سکتے۔ وہ triggers نیچے لکھیں پہلا run سے پہلے۔

  1. نام الگ کریں وہ conditions جو گیٹ کھولتے ہیں — approach fixed margin سے زیادہ off ہے، gripper کچھ بند نہیں ہو رہا، ایک joint ایک limit کی طرف drift ہو رہا ہے، ایک stall سے زیادہ ایک یا دو سیکنڈ — اور list کو unchanged رکھیں round کے لیے۔
  2. نام کریں جو یہ نہیں کھولتا۔ Overshoot policy اپنے آپ سے recover کرتا ہے training signal ہے؛ وہاں take over کرنا ایک recovery delete کرتا ہے یہ پہلے سے جانتی ہے۔
  3. جلدی take over کریں ایک صاف handover کے لیے، جتنا جلدی state recoverable ہے hand back کریں۔
  4. Log کریں کہ آپ نے کیوں take over کیا، ہر episode۔ تین rounds بعد یہ صرف record ہے کہ آیا وہی failure واپس آتی ہے۔
  5. رکھیں cameras، task text اور operator constant round کے عام۔ ایک بدل دیں اور نمبر comparable رہنا بند ہوں۔

Mechanically handover کے دو variants ہیں۔ ایک leader arm کے ساتھ، leader کو follower کے current pose تک پہنچنا پڑے torque سے پہلے transfer کرے، یا arm jump کرے؛ یہ alignment move chain کے کم سے کم-tested حصہ ہے real hardware پر۔ بغیر leader arm کے takeover manual ہے پہلی keypress سے: follower held ہے اور operator اسے nudge کرتا ہے joint by joint keyboard سے یا sliders drag کرتے ہوئے، server-side clamps کے ساتھ ہر input کو چھوٹا رکھتے ہوئے — ایک pair of degrees per keypress، کچھ per slider update، کیونکہ ایک بڑا step ایک held pose میں یہ ہے کہ آپ ایک servo strip کیسے کرتے ہیں۔ Step-by-step version key bindings کے ساتھ ہے ایک SO-100 پر DAgger round کا walkthrough؛ دونوں teleoperation modes کے لیے background ہے teleoperation docs میں اور leader-follower entryمیں۔

Supported policy architectures کا comparison ان کی training اور inference خصوصیات کے ساتھ
گیٹ architecture-agnostic ہے۔ کون سی policy آپ correct کرتے ہیں ایک round کے training cost کو بدلتے ہیں، کنٹرول نہیں۔

پڑھیں کہ آیا gate نے کچھ کیا

ایک human-gated round کا metric intervention rate ہے: intervention frames run کے frames سے divide کیے ہوئے۔ یہ ایک کام ہے — اگر یہ rounds سے fall نہیں کرتا، round نے کچھ نہیں خریدا، اور اگلا ایک کچھ اور بدلنا چاہیے ڈیٹا کی مقدار سے۔

یہ ایک biased metric ہے اور آپ کو پتا ہونا چاہیے۔ یہ operator کی threshold کو measure کرتا ہے جتنا policy کی competence، جو وجہ trigger list fixed رہتا ہے؛ ایک operator جو ایک session میں relax کرتا ہے ایک falling curve بناتا ہے کچھ کے بغیر۔ یہ بھی severity کو ignore کرتا ہے — دس frames ایک collision روکنے کے اور دس ایک grasp کو nudge کرنے ایک جیسے دیکھتے ہیں۔ اسے ایک fixed evaluation set کے ساتھ جوڑی کریں کوئی correction ڈیٹا کبھی نہیں خینچا۔ ایک DAgger loop کو measure کرنے کے بارے میں article evaluation design سے کام کرتا ہے، evaluation episodes کو training mix سے باہر کیسے رکھیں اس سمیت۔

انسانی gate، ایمانداری سے
یہ کیا دیتا ہے
  • پہلے دن کام کرتا ہے، کسی بھی policy architecture پر، کوئی اضافی model calibrate کیے بغیر
  • Confident-and-wrong failures کو catch کرتا ہے کوئی variance threshold detect نہیں کرتا
  • Corrections بناتا ہے ریکارڈ کیے ہوئے جب operator کے پاس مکمل کنٹرول تھا، ایک لمحے پر وہ منتخب کرتے ہیں
  • Yields ایک per-frame marker جو intervention-weighted methods جیسے IWR اور Sirius consume کرتے ہیں
یہ نہیں دیتا
  • مسلسل supervision کی لاگت؛ یہ ایک شخص اور بہت سارے robots کے لیے scale نہیں کرتا
  • Operator consistency پر منحصر — ایک drifting threshold intervention rate کو corrupt کرتا ہے
  • کوئی risk model اپنے آپ پر بناتا نہیں؛ HG-DAgger کا learned threshold اور ThriftyDAgger کا estimator اضافی مشینری ہیں
  • Frames کو شمار کرتا ہے، consequences نہیں
  • ایک policy کو نہیں بچا سکتا جس کی failure کنٹرول سے upstream ہو، جیسے swapped camera یا mislabelled task string

Open سوالات نظر میں رکھنے کے قابل

Benchmarks کمزور ہیں۔ Spencer اور ساتھی نے جو imitation learning approaches کو test کرنے کے لیے استعمال ہوتے ہیں وہ examine کیے اور ان کو پایا "realizable اور simple اور اس طرح real-world decision making problems میں دیکھے جانے والے harder regimes of error compounding کو capture کرنے کے لیے ناکافی" — اور، surrounding literature کے خلاف، plain behavior cloning ان tasks پر اچھی کارکردگی کی۔ یہ کوئی DAgger variants کی ranking پر sceptical ہونے کا سبب ہے وہ tasks پر استوار ہے، جس میں اوپر کے table میں کچھ numbers شامل ہیں۔

Robot gates بڑی policies پر بھی نہیں حل ہیں۔ AIM work uncertainty کو ایک proxy Q-function کے ساتھ بدلتا ہے انسانی intervention rule کی نقل کرتے ہوئے اور 40% بہتری کی رپورٹ کرتا ہے take-over cost اور learning efficiency میں ThriftyDAgger سے — continuous اور discrete کنٹرول میں، manipulation کو drive کرتے ہوئے vision-language-action model پر نہیں۔ آیا ان میں سے کوئی بھی gate fine-tuned VLA میں transfer کرتا ہے یہ open ہے۔ Survey ایک related point بناتا ہے: field کی terminology اور structure unified نہیں ہیں literature کے عام۔ آپ کے بازو پر، آپ کے logs وہ evidence ہیں جو آپ کے پاس ہیں۔

کیا HG-DAgger واقعی DAgger ہے اگر انسان صرف interventions کے دوران label لگاتا ہے؟

یہ وہ حصہ رکھتا ہے جو اہم ہے — ڈیٹا جمع کیا جاتا ہے learner کے state distribution کے تحت، aggregate کیا جاتا ہے جو سے پہلے آیا — اور وہ حصہ drop کرتا ہے جو hardware سے رابطے میں زندہ رہتا نہیں۔ Kelly et al. اسے ایک variant کے طور پر پیش کرتے ہیں؛ 2011 کی no-regret guarantee غیر تبدیل نہیں لے جاتی۔

کیا میں robot gate استعمال کر سکتا ہوں fine-tuned VLA policy پر SO-100 پر؟

سیدھے طریقے سے نہیں۔ SafeDAgger کے classifier کو ایک queryable reference policy چاہیے جو آپ کے پاس نہیں ہے۔ EnsembleDAgger کو ایک ensemble چاہیے، جو ایک multi-billion-parameter model کے لیے memory میں کچھے نقل کا مطلب ہے بھی ان کی inference cost۔ ThriftyDAgger کو ایک risk estimator fitted کی ضرورت ہے successes اور failures پر جو آپ کے پہلے rounds سے پہلے موجود نہیں ہیں۔

ایک single takeover کتنا طویل ہونا چاہیے؟

جتنا لمبا ایک state تک پہنچنا چاہیے policy continue کر سکے، اور کچھ زیادہ نہیں: extended takeovers run کو ایک demonstration session میں بدلتے ہیں اور correction set کو nominal behavior سے بھر دیتے ہیں۔ LazyDAgger کی تلاش دوسری طرف بھی کاٹتی ہے — بہت سارے بہت مختصر switches ان کی اپنی لاگت ہیں۔

کیا میں صرف corrected segments پر تربیت دوں؟

نہیں — یہ ایک round کو ضائع کرنے کا سب سے عام طریقہ ہے۔ ایک model fine-tuned صرف recoveries پر تقریباً کچھ نہیں دیکھا سوائے recoveries۔ Corrections کو original dataset میں mix کریں sources کے ساتھ واضح طور پر منتخب؛ اگے جانے کے لیے intervention-weighted approaches دیکھیں جیسے IWR یا Sirius، جو human-driven frames کو up-weight کرتے ہیں بجائے انہیں isolate کرنے کے۔

اگر intervention rate ایک round کے بعد fall نہیں کرتا کیا؟

اسے face value پر لیں: round مددگار نہیں تھا۔ Corrections شامل کرنے سے پہلے، سستے وضاحتیں check کریں — کیا operator کی threshold drift ہوئی، corrections کیا cosmetic تھے، کیا composed dataset اصل میں ان میں تھا، تربیت initialize کیا گئی تھی intended checkpoint سے۔ ایک round جو خاموشی سے base model سے شروع ہوا بالکل ایک round کی طرح دیکھتا ہے جو سیکھنے میں ناکام رہا۔

کیا non-intervention معلومات رکھتا ہے؟

Expert Intervention Learning کے تحت، ہاں: stretches جہاں supervisor نے دیکھا اور کام نہیں کیا weak evidence کے طور پر پڑھے جاتے ہیں کہ state اور action قابل قبول تھے، value function پر constraint کے طور پر formalised۔ اکثر practical pipelines، اس میں یہ بھی، صرف mark کریں وہ انسان نے چلایا۔

ایک desk پر ایک بازو کے لیے انتخاب کیا گیا ہے: گیٹ اپنے آپ کو سنبھالیں، لکھیں جو اسے کھولتا ہے، اور کوشش کو ڈیٹا handling کے پیچھے خرچ کریں سوائے سوئچ کو automate کرنے کے۔ Platform side اس پر بیان کیا گیا ہے DAgger loop page، training options policy family per کے تحت training and pricing۔ Background کے لیے، شروع کریں imitation learning اور imitation learning on the SO-100 سے؛ پہلے run کے لیے، run your first policy مختصر path ہے۔

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started