Tabletop robot کی کام کی جگہ جو بار بار policy runs کے لیے مقررہ evaluation setup کے طور پر استعمال ہوتی ہے
DAggerتشخیصنقالی کی تعلیمروبوٹ ڈیٹاSO-100

ایک DAgger Loop کی پیمائش: Intervention Rate، Evaluation Protocol اور درمیان کے خطرات

AY-Robots ResearchAugust 27, 202615 منٹ کی پڑھائی

Intervention rate - intervention frames کو run کے frames سے تقسیم کیا جائے - ایک انسان کے قابو میں DAgger loop کا سب سے سستا ایمانداری سے پیش رفت کا اشارہ ہے۔ یہ مضمون اسے اس طریقے سے متعریف کرتا ہے کہ دو لوگ ایک جیسی قیمت حاصل کریں، اسے لاگ کرنے کا طریقہ دکھاتا ہے، اور چار طریقے واضح کرتا ہے جو اسے آپ کو گمراہ کرتے ہیں: آپریٹر کی عادت، Evaluation setup میں تبدیلی، صرف اصلاحات پر تربیت، اور ایک انسان جو منگل کو پیر سے مختلف طریقے سے اصلاح کرتا ہے۔

ایک DAgger round محسوس ہوتا ہے کہ یہ پروڈکٹو ہے جب آپ اس میں ہوتے ہیں۔ آپ policy کو چلاتے ہیں، جب یہ grasp میں ٹھوکر کھاتا ہے تو قابو میں آجاتے ہیں، اصلاحات محفوظ کرتے ہیں، دوبارہ تربیت دیتے ہیں، اور اگلا run - آپ قسم کھا سکتے ہیں - تھوڑا نرم دکھائی دیتا ہے۔ دو rounds بعد آپ یہ نہیں کہہ سکتے کہ کوئی بھی چیز بدل گئی یا نہیں، کیونکہ "تھوڑا نرم" ایک مقدار نہیں ہے۔

لوپ کو ہر round میں ایک نمبر کی ضرورت ہے، اور انسان کے قابو میں لوپ میں یہ نمبر تقریباً مفت ہے: جس وقت کا حصہ آپ کے پاس control میں تھا policy کے بجائے۔ یہ مضمون اسے اس طریقے سے متعریف کرتا ہے کہ دو لوگ ایک جیسی قیمت حاصل کریں، اسے لاگ کرتا ہے، نتیجے میں منحنی پڑھتا ہے، اور چار طریقے نام دیتا ہے جو اسے گمراہ کرتے ہیں جب یہ اکیلا ہو۔ تھیوری کے لیے یہ مضمون فرض کرتا ہے، دیکھیں DAgger کی وضاحت اور انسان کے ساتھ لوپ میں variant; عملی طریقہ ہے ایک SO-100 پر DAgger loop چلانا۔

مختصر ورژن

  • Intervention rate = intervention frames / run کے frames۔ Episodes نہیں، frames، اور denominator میں جو وقت آپ نے اصلاح میں صرف کی وہ بھی شامل ہے۔
  • تین rounds میں ایک سمتل منحنی مطلب ہے کہ rounds کوئی فائدہ نہیں دے رہے - خلط کو، checkpoint کو یا کام کو بدلیں بجائے چوتھے round کو جمع کرنے کے۔
  • ایک گرتی intervention rate کا مطلب ایک بڑھتی ہوئی success rate نہیں ہے۔ آپ کی stepping in کی حد بڑھتے ہوئے trust کے ساتھ نیچے کی طرف بہتی ہے۔
  • ایک مقررہ evaluation protocol کے بغیر - ایک جیسے start poses، objects، cameras، trial count - آپ کمرے کو ماپ رہے ہیں۔
  • صرف اصلاحات پر تربیت state distribution کو بڑھاتا ہے۔ IWR کا جواب: intervention اور غیر intervention samples کو برابر تناسب میں کھینچیں۔

ایک round کو سب کچھ کے لیے ایک نمبر کی ضرورت کیوں ہے

DAgger موجود ہے ایک distribution problem کی وجہ سے، اور distribution problems آنکھ سے نظر نہیں آتے۔ Ross اور Bagnell نے دکھایا کہ نقالی کی تعلیم ایک مقررہ demonstration set پر quadratically بڑھتی ہوئی regret bound اور compounding errors کی طرف لے جاتی ہے: ایک بار جب learner وہ states چھوڑ دیتا ہے جو demonstrator نے دیکھے ہوں، ڈیٹا میں کچھ نہیں بتاتا کہ واپس کیسے آئیں۔ DAgger اسے iterating سے ٹھیک کرتا ہے - policy چلائیں، states label کریں جو یہ دیکھتا ہے، aggregate کریں، دوبارہ تربیت دیں - جو Ross، Gordon اور Bagnell نے no-regret online learning میں reduction کے طور پر فریم کیا۔

اس فریمنگ کے ایک نتیجے ہیں جو لوگ چھوڑ دیتے ہیں۔ guarantee sequence کے بارے میں ہے policies کے iterations کے، کسی سنگل run کے بارے میں نہیں۔ یہ کچھ نہیں کہتا کہ آیا آپ کا round تین مدد دیا۔ جاننے کا واحد طریقہ ہے ہر iteration کو ماپنا۔ Kelly اور colleagues نے HG-DAgger متعارف کروایا کیونکہ classic DAgger expert سے action labels مانگتا ہے جب novice ابھی بھی control میں ہو، جو paper کا دعویٰ ہے safety کو کم کر سکتا ہے اور، انسان experts کے ساتھ، recognized actuator lag کے ذریعے label quality کو degrade کرنے کا امکان ہے۔ HG-DAgger ایک safety threshold بھی سیکھتا ہے ایک model-uncertainty-based risk metric کے لیے اور DAgger اور behavioral cloning دونوں کے اوپر بہتر performance رپورٹ کرتا ہے ایک driving task پر۔ یہ intervention counts شائع نہیں کرتا؛ وہ آپ خود produce کرتے ہیں۔

Rate کو متعریف کریں تاکہ دو لوگ ایک جیسی نمبر حاصل کریں

تعریف ایک لائن ہے: intervention frames کو run کے frames سے تقسیم کریں۔ ہر مشکل چیز hidden ہے اس میں کہ کیا ایک frame کے طور پر شمار ہوتا ہے اور کیا ایک run کے طور پر۔

Frames، episodes نہیں

کم سے کم ایک intervention کے ساتھ episodes کو شمار کرنا بیکار ہے: دس episodes ایک nudge کے ساتھ اور دس جن میں آپ نے 80 فیصد چلایا دونوں "10/10" دیتے ہیں۔ Frame count انہیں الگ کرتا ہے، اور یہ granularity ہے جو recording میں پہلے سے ہے - LeRobot dataset format میں ہر timestep ایک row ہے، تو intervention flag ایک boolean column ہے state اور action کے ساتھ۔ یہاں یہ per frame میں لکھا جاتا ہے جب takeover شروع ہوتا ہے اور صاف ہوتا ہے جب control واپس آتا ہے۔

Denominator میں اصلاحات شامل ہیں

دو denominators defensible ہیں - run کے total frames، یا frames جو policy نے خود سے چلائے - اور وہ high intervention levels پر بہت نقصان پہنچاتے ہیں۔ 1000 frames میں سے 400 پر قابو لیں اور پہلا 40 فیصد دیتا ہے، دوسرا 67 فیصد۔ ایک round کو پہلے طریقے سے ماپنے کا موازنہ کریں اگلے کے ساتھ دوسری طریقے سے اور ایک حقیقی بہتری غائب ہو جاتی ہے۔ Total frames لیں اور سلسلے کے درمیان اس کو دوبارہ دیکھنے کی کوشش کریں۔

ہاتھ بدلنے والے frames کے لیے ایک بار فیصلہ کریں

ہمیشہ ایک seam ہے۔ جب control pass ہوتا ہے، کچھ frames دونوں طرفوں کے لیے: arm ہو رہی ہے، leader align ہو رہا ہے، recording منجمد ہے۔ اس pipeline میں وہ handover frames raw stream میں رہتے ہیں اور کبھی curated episode میں داخل نہیں ہوتے - وہ نہ ہی policy behaviour ہیں اور نہ ہی training کے قابل correction۔ Seam کو ایک جیسے طریقے سے ہر round میں شمار کریں: 30 Hz پر، چھ takeovers ایک دو سیکنڈ seam کے ساتھ ہر ایک 360 frames ہے، ایک فیصد point کو حرکت دینے کے لیے کافی۔

تین فیصلے جو comparability کو توڑتے ہیں

Frames یا episodes؛ total run یا autonomous-only؛ handover frames اندر یا باہر۔ ان میں سے کوئی بھی تبدیل ہوا خاموشی سے rounds کے درمیان curve کو meaningless بناتا ہے۔ تینوں کو لکھ دیں۔

اسے لاگ کریں تاکہ نمبر session سے بچے

ایک metric running process کے status panel میں ایک readout ہے: یہ restart پر غائب ہو جاتا ہے اور plot نہیں ہو سکتا۔ ایک append-only line ہر run کے لیے پورے سلسلے کو cover کرتا ہے - اس میں بھی شامل ہے کہ کون سا checkpoint آپ نے چلایا، کیونکہ یہ ہر round کو بدلتا ہے اور انہیں mix کرنا غلط چیزوں کو غلط کرتا ہے۔

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
ہر run میں ایک line۔ Denominator اور handover convention کو نمبر کے ساتھ record کرنا field names سے زیادہ وزنی ہے۔

دو fields وزن رکھتے ہیں۔ train_mix ہے جو آپ نے اگلی training job کو دیا؛ اس کے بغیر کچھ بھی attribute نہیں کیا جا سکتا۔ eval_protocol fixed test کا نام دیتا ہے جو آپ نے بعد میں چلایا، اور وہ field سب سے زیادہ خالی چھوڑا جاتا ہے۔ ay-robots cockpit میں takeover status running session کے لیے intervention frame count رپورٹ کرتا ہے، تو logging instrumentation کے بجائے transcription ہے؛ dataset documentation covers کرتا ہے کہ per-frame columns کہاں land کرتے ہیں۔

Policies، datasets اور checkpoints کو ایک ساتھ دکھانے والا تربیتی configuration matrix
ہر round checkpoint اور dataset mix کو بدلتا ہے۔ ایک نمبر جس کا combination record نہیں کیا گیا attribute نہیں ہو سکتا۔

منحنی کو پڑھیں: تین rounds، ایک verdict

تین rounds سب سے کم ہے پڑھنے کے لیے، کیونکہ دو points ہمیشہ ایک line ہیں۔ نیچے ٹیبل ایک bookkeeping template ہے placeholder numbers کے ساتھ، کسی run سے measurements نہیں۔ آپ monotone decrease کو ڈھونڈ رہے ہیں fixed test پر success میں بڑھتے ہوئے match کے ساتھ۔

RoundCheckpoint چلایاFramesIntervention framesRateSuccesses (of 20)
0 (baseline)base policy5 9001 38023.4 %7
1round 0 mix سے5 61098017.5 %10
2round 1 mix سے5 41261111.3 %11
3round 2 mix سے5 38059811.1 %12

Rounds ایک اور دو کام کر رہے ہیں۔ Round تین نہیں ہے: 11.3 11.1 فیصد کے خلاف کسی بھی چیز پر جو run-to-run variation کے اندر ہے جو ایک physical arm پر ماپی جاتی ہے، اور چوتھے round کی اسی اصلاحات سے ایک دوپہر صرف ضائع ہوتی ہے۔ Flat segment کہتا ہے کوئی چیز structural بدلیں۔

  • باقی ناکامیاں teleoperation سے قابل اصلاح نہیں ہیں - object reach سے باہر، gripper geometry، ایک joint اپنی limit پر۔ کوئی correction data kinematic wall کو ٹھیک نہیں کرتا۔
  • اصلاحات بہت کم ہیں base dataset کے خلاف gradient کو حرکت دینے کے لیے، اور کچھ بھی انہیں وزن نہیں دیتا۔
  • اصلاحات ایک دوسرے کو contraddict کرتی ہیں، تو policy دو strategies کو average کرتی ہے اور ان کے درمیان landing کرتی ہے۔
  • ناکامی upstream ہے: ایک camera move ہو گیا، lighting بدل گیا، wrist view اب training کے ساتھ match نہیں کرتا۔
  • کام اس policy class کے ceiling پر ہے اس hardware پر، اور اگلا قدم زیادہ base data ہے۔

آخری دو loop کی ناکامیاں نہیں ہیں۔ Sirius-Fleet میں انسان کے لیے declining need ہے طے شدہ نتیجہ: جیسے جیسے robot autonomy بہتر ہو، اس کے anomaly predictors adapt کرتے ہیں اپنے prediction criteria، leading سے کم requests تک انسانی intervention کے لیے اور آہستہ آہستہ reducing انسانی workload over time۔ وہاں criterion adapt کرتا ہے مقصد پر۔ ایک manual loop میں آپ کا adapt بھی کرتا ہے، خاموشی سے - تو ایک rate جو flattens کیونکہ کام اپنے ceiling پر ہے exactly ترح لگتا ہے ایک جو flattened کیونکہ operator نے noticing بند کیا۔ کون ہے اگلا مسئلہ۔

Trap 1: گرتی ہوئی rate بڑھتی ہوئی success rate نہیں ہے

Intervention rate بالکل ایک چیز کو ماپتا ہے: run کے کتنے حصے کو آپ نے own کریں کرنے کا فیصلہ کیا۔ یہ فیصلہ آپ کا ہے، real time میں بنایا گیا، اور یہ حرکت کرتا ہے۔ Round zero میں آپ first bad approach angle پر take over کرتے ہیں؛ round تین تک آپ نے policy کو ایک درجن سے recover کرتے ہوئے دیکھا ہے اور آپ اسے کوشش کرنے دیتے ہیں۔ آپ کی threshold move ہوا؛ policy شاید نہیں۔ Rate دونوں طریقوں سے گرتا ہے۔

انسانی trust ہے کم سے کم ایک modelled quantity literature میں بجائے فرض ایک constant کے۔ Sirius re-weights training samples سے approximated انسانی trust اور optimises policy کے ساتھ weighted behavioral cloning، reporting ایک 8 فیصد boost simulation میں اور 27 فیصد real hardware پر state of the art کے اوپر policy success rate میں، دگنا convergence speed۔ یہ trust کو treat کرتا ہے ایک weight کے طور پر data پر۔ یہ correct نہیں کرتا threshold آپ کے سر میں round zero اور round تین کے درمیان۔

آپ drift کو remove نہیں کر سکتے، تو rate کو pair کریں کوئی چیز سے جو آپ کی threshold نہیں پہنچ سکتی: ایک fixed set trials کے جس میں آپ بالکل intervene نہیں کرتے، scored ایک criterion کے خلاف جو round سے پہلے لکھا گیا۔ ایک rate جو گرتا ہے جب paired success rate flat رہتی ہے ہے signature habituation کی - قابل قدر catching، کیونکہ loop کے اندر سے یہ محسوس ہوتا ہے pیش رفت۔

Intervention rateSuccess rate مقررہ protocol پرسب سے ممکنہ پڑھائی
گرتا ہےبڑھتا ہےRound نے کام کیا۔ جاری رکھیں۔
گرتا ہےسمتلآپ کا threshold drift، یا اصلاحات effort کو ہٹایا بغیر ناکامیاں ہٹائے۔
گرتا ہےگرتا ہےCorrections policy کو degrade ہو رہے ہیں۔ Mixture اور ان کی internal consistency کو check کریں۔
سمتلسمتلRound کچھ نہیں خریدا۔ Mixture، checkpoint یا task کو بدلیں مزید جمع کرنے سے پہلے۔
بڑھتا ہےگرتا ہےRegression۔ Training mix، ایک changed camera یا checkpoint mix-up کو suspect کریں method سے پہلے۔

Trap 2: ایک fixed protocol کے بغیر، آپ کمرے کو ماپ رہے ہیں

Real-robot evaluation مہنگا ہے اور دوبارہ کرنے میں مشکل۔ SIMPLER authors motivate کرتے ہیں simulated evaluation سے observation سے کہ real-world evaluation ایسے policies کا scalable نہیں ہے اور reproducibility challenges کا سامنا کرتا ہے likely سے بدتر ہو جانے والے جیسے policies اپنے task spectrum کو broaden کریں۔ RoboArena attack کرتا ہے اسے دوسری طرف سے، پہلے سے زیادہ 600 pairwise real-robot evaluation episodes سات generalist policies کے اوپر، چلائے جاتے ہیں evaluators سے سات academic institutions پر DROID platform۔ اس کے evaluators اپنے tasks اور environments pick کرتے ہیں لیکن must judge policies کی pairs double-blind؛ paper رپورٹ کرتا ہے کہ یہ crowd-sourced ranking tracks generalist-policy performance زیادہ accurately than conventional، centralised evaluation۔

آپ 600 paired episodes run نہیں کریں گے ایک SO-100 پر ایک workshop میں۔ جو آپ کر سکتے ہیں وہ ہے variance کو ہٹانا جو آپ control کرتے ہیں - ایک list بورنگ enough کہ یہ usually skip ہو جاتی ہے۔

Dimensionیہ freeze کریںکیا drift ہوتا ہے اگر آپ نہیں کرتے
Start poseایک written home position، driven ہر trial سے پہلےTrajectory start ہوتا ہے out of distribution
ObjectsTaped marks، اور same physical objects reserved evaluation کے لیےایک 'بہتر' policy واقعی ایک closer object ہے
Cameras اور lightSame mounts، indices، exposure؛ blinds بند؛ photograph کریں setupSwapped camera indices alone سے dominates ہو سکتے ہیں result
Trials اور stop ruleFixed n، fixed timeout، criterion written round سے پہلےPost-hoc criteria turn near-misses تمہاری ضرورت میں کچھ بھی
Operator رویہNo interventions evaluation trials کے دورانEvaluation another correction session بن جاتا ہے

پھر arithmetic، unforgiving trial counts پر جو workshop afford کر سکتی ہے۔ Normal approximation کے تحت، 60 فیصد success 20 trials پر carry کرتا ہے ایک standard error near 11 percentage points - 0.6 times 0.4 over 20 کا square root - اور difference دونوں ایسے rounds کے درمیان carry کرتا ہے تقریباً 15۔ ایک jump 60 سے 70 فیصد تک ہے اس لیے کچھ نہ ہونے کے ساتھ consistent۔ Fifty trials لاتے ہیں per-round figure تقریباً 7 points، اور cost ایک دوپہر۔

یہ asymmetry ہے argument intervention rate کے لیے: computed ہزاروں frames کے اوپر بجائے بیس binary outcomes کے، یہ earlier اور smoothly move کرتا ہے۔ Caveat یہ ہے کہ frames ایک episode کے اندر بہت correlated ہیں - ایک bad grasp yields سو consecutive intervention frames - تو effective sample size closer ہے takeovers کی تعداد کے۔ Rate کو treat کریں early indicator کے طور پر اور success rate کو slow ground truth کے طور پر۔

Evaluation episodes کو training pool سے باہر رکھیں

Evaluation episodes کو کبھی composed training dataset میں داخل نہیں ہونا چاہیے - ورنہ round n+1 scored ہے data پر جو یہ trained تھا، اور curve measure کرتا ہے memorization۔

Trap 3: صرف اصلاحات پر تربیت policy کو bend کرتی ہے

اصلاحات ہیں interesting data، تو instinct ہے انہیں پر train کرنا۔ نہ کریں۔ وہ آتے ہیں construction سے narrow slice کے state space جہاں policy پہلے سے ہی failing تھی اور say تقریباً کچھ بھی نہیں majority run کے جو کام کیا۔ Fine-tune اس slice پر تنہا اور آپ کو get کریں ایک policy good ایک botched approach سے recover کرنے میں جو forget کیا ہے کیسے ایک clean بنانا۔

Mandlekar اور colleagues نے built کیا ان کا remote intervention system اس کے دور۔ Framing ان کا: manipulation tasks contain bottleneck regions requiring ایک sequence precise actions - inserting ایک pod ایک coffee machine میں ہے ان کی مثال - جہاں small deviations lead کرتے ہیں states میں demonstrations نے کبھی cover نہیں کیا۔ الگورتھم انہوں نے trains iteratively نئے data پر تو policy learns bottlenecks کو traverse کریں، اور وہ report کرتے ہیں agents trained intervention data پر beat کرتے ہیں agents trained ایک equivalent number samples پر non-interventional demonstrators سے۔

Corrections-only fine-tuning versus ایک composed mixture
کیا corrections-only آپ کو دیتا ہے
  • تیز: ایک short run over کچھ درجن episodes ہے cheap enough دوبارہ کرنے کے لیے
  • Targeted: gradient dominated ہے states سے جو آپ کو care کرتے ہیں
  • سستا testing کے لیے کہ آیا correction style learnable ہے بالکل
کیا یہ cost کرتا ہے
  • Fine-tune distribution اب resemble نہیں کرتا task distribution
  • Nominal رویہ degrade ہو سکتا ہے visibly ایک single round میں
  • Rate گر سکتا ہے جب success گرتی ہے اس کے ساتھ - clean segments traded recoveries کے لیے

Mixing ratio ہے ایک hyperparameter اور deserves ہے لکھا جانا۔ Composing اگلا dataset ہے جہاں یہ فیصلہ ہے: original demonstrations plus correction set، episode selection explicit per source بجائے rule جو quietly pull کرتا ہے ہے جو available ہے۔ یہاں وہ ایک compose step ہے cockpit میں، اور result ہے ایک ordinary dataset - دیکھیں تربیت documentation۔ کیا کوئی tool آپ کے لیے نہیں کرتا وہ ہے recording جو ratio produced جو curve۔

Trap 4: انسان ایک consistent expert نہیں ہے

DAgger کی theory فرض کرتا ہے ایک expert۔ آپ نہیں ہو technical sense میں: آپ کی corrections نہیں ہیں samples ایک fixed conditional distribution سے over actions۔ ACT authors name اسے جب listing obstacles سے fine manipulation - errors compound کرتے ہیں over time، اور انسانی demonstrations ہو سکتے ہیں non-stationary۔ سسٹم انہوں نے پھر بھی reach کرتا ہے 80 سے 90 فیصد success چھ real tasks پر دس منٹ سے demonstrations، تو مسئلہ ہے tractable، موجود نہیں۔

Robomimic study makes point سے data side۔ پار چھ offline algorithms پر پانچ simulated اور تین real-world multi-stage tasks، اس کے lessons میں شامل ہیں sensitivity design choices کو، dependence demonstration quality پر، اور - سب سے زیادہ hurt یہاں - variability stopping criteria سے، کیونکہ تربیت اور evaluation objectives differ۔ Checkpoint lowest loss کے ساتھ ہے نہیں reliably وہ highest success rate کے ساتھ۔

ایک hardware version ہے اس: input mode shapes correction۔ ایک leader-follower setup produces continuous، انسان کی pace trajectories۔ Keyboard nudges ہیں clamped hard سے server - دو degrees arm joints پر ہر call، چار gripper پر - تو ایک جیسی intent پہنچتی ہے ایک staircase طور پر small steps۔ Sliders send کرتے ہیں absolute targets اور server move کرتا ہے پر زیادہ سے زیادہ چھ degrees ان کی طرف ہر call۔ تین modes، تین action distributions؛ mixing تینوں ایک correction set میں اور پھر wondering کیوں approach twitchy ہو گیا ہے self-inflicted۔ teleoperation documentation covers کیا ہر mode بھیجتا ہے۔

Interventions کو وزن کرنا: IWR اور کیا بعد میں آیا

اگر corrections valuable minority ہیں، principled fix ہے weight بجائے exclusivity۔ Intervention Weighted Regression ہے reference implementation: data partitioned ہے intervention اور non-intervention samples میں، اور دونوں partitions sampled ہیں equal proportion میں تربیت کے دوران۔ ایک correction set جو frames کا پانچ فیصد ہے پھر contribute کرتا ہے نصف gradient، بغیر nominal رویہ vanishing۔

Equal proportion ایک starting point ہے، نہ ایک law۔ Sirius generalises اسے replacing binary partition کے ایک continuous weight سے approximated انسانی trust؛ Sirius-Fleet moves decision upstream، ایک visual world model استعمال کر اور anomaly predictors فیصلہ کریں جب ایک انسان پوچھا جاتا ہے۔ Common thread: intervention flag ہے ایک training signal، نہ صرف ایک bookkeeping column۔

Methodکون فیصلہ کرتا ہے جب انسان act کرتا ہےکیسے intervention data استعمال ہوتا ہےReported result
DAgger (2011)Fixed schedule؛ expert labels visited statesایک growing dataset، unweightedFramed ایک reduction کے طور پر no-regret online learning کے
HG-DAgger (2019)انسان، control کو gating real system پرAggregated؛ plus ایک learned safety threshold model uncertainty پربہتر than DAgger اور BC driving پر؛ کوئی intervention counts دی نہیں گی
IWR (2020)انسان، via remote teleoperationIntervention اور non-intervention samples drawn equal proportion میںBeats non-interventional demos equal sample count پر
Sirius (2022)انسان، deployment کے دورانWeighted BC، weights approximated انسانی trust سے8 % gain simulation میں، 27 % real hardware پر؛ 2x تیز convergence
ThriftyDAgger (2021)سسٹم، gating novelty اور risk پرInteractive collection ایک supervision budget کے تحتUser study (N=10): 58 % اعلیٰ انسانی اور 80 % اعلیٰ robot performance than next best method
Fleet-DAgger (2022)سسٹم، allocation attention fleet کے پارFleet learning scored Return on Human Effort سےUp تک 8.8x اعلیٰ ROHE than baselines
Sirius-Fleet (2024)Anomaly predictors self-adapting criteria کے ساتھMulti-task learning ایک visual world model کے ساتھکم intervention requests جیسے autonomy بہتر ہو
Leaderboard view policies کا measured score سے موازنہ کرتے ہوئے
Ranking policies ایک دوسرے کے خلاف مطلب ہے کچھ صرف جب ہر entry ایک جیسا protocol چلایا۔ یہ apply کرتا ہے آپ کے اپنے تین rounds کے لیے بھی۔

چار metrics logging کے لائق rate کے ساتھ

  • Takeovers ہر run میں۔ بیس short corrections اور ایک long سے similar rates دیں اور describe کریں مختلف policies - ایک jittery، ایک single blind spot کے ساتھ۔
  • Mean intervention length۔ بڑھتا length ایک falling count کے ساتھ مطلب ہے باقی ناکامیاں ہیں hard، جو ہے کیسا late progress۔
  • Time سے first intervention۔ ایک policy جو مزید far جاتا ہے helping سے پہلے ہے improving یہاں تک کہ جب total rate flat ہو۔
  • جہاں interventions cluster۔ Bin کریں flag سے normalised episode progress؛ ایک stable peak rounds میں points ایک bottleneck۔

ایک round protocol جو آپ واقعی چلا سکتے ہیں

ایک measured round ہے چھ steps اور produce ایک row log میں۔ پہلے چار loop ہیں؛ آخری دو اسے ایک measurement بناتے ہیں۔

  1. 1
    Evaluation protocol کو round zero سے پہلے freeze کریں

    لکھ دیں start pose، object placement، cameras، trial count، timeout اور success criterion۔ Table کو photograph کریں۔ اگر document کو change کرنا پڑے، series restart ہو۔

  2. 2
    Baseline کو measure کریں

    چلائیں protocol کے ساتھ کوئی interventions اور record کریں successes؛ پھر ایک چلائیں instrumented session takeover enabled کے ساتھ اور record کریں rate۔ وہ دونوں numbers ہیں round zero۔

  3. 3
    Corrections کو ایک consistent style میں collect کریں

    ایک input mode ہر round، ایک operator اگر آپ manage کر سکتے ہیں۔ Take over ایک criterion پر جو آپ بیان کر سکتے ہیں - 'gripper approach میں دو سینٹی میٹر سے زیادہ off' - اور hold کریں اسے round کے لیے۔

  4. 4
    ہر episode کو ایک جیسے دن triage کریں

    Correction، evaluation یا discard۔ Ambiguous episodes discarded جاتے ہیں، بچائے نہیں جاتے theory پر کہ مزید data مدد دیتا ہے - ایک correction جس میں آپ خود fumble کیا ہے بہتر ہے کوئی episode سے۔

  5. 5
    Mixture کو explicitly compose کریں

    Original demonstrations plus corrections، episode selection per source۔ Record کریں base count، correction count اور کوئی weighting - یہ ہے field آپ چاہتے ہیں تین ہفتوں میں۔

  6. 6
    Checkpoint سے continue کریں، پھر re-measure کریں

    Compose کریں اگلا dataset پہلے checkpoint سے بجائے base model کے، چلائیں frozen protocol plus ایک instrumented session، append کریں row، اور compare کریں پچھلے دو rounds کے خلاف۔

دو limits change کیسے آپ read ضعیف round۔ Continuing checkpoint سے initialises weights اسے سے - نہ ایک optimizer resume، تو schedule fresh start کرتا ہے اور ایک short run ایک converged checkpoint سے بہت کم move کر سکتا ہے۔ اور leader-align motion start میں takeover کے ہے least mileage real hardware پر سب سے کم chain میں؛ اگر corrections odd transient کے ساتھ شروع ہوتے ہیں تو mixture دوش سے پہلے وہاں دیکھیں۔

Measured loop، پہلے سے wired

ay-robots implements یہ چھ steps جیسے product features: take over mid-run ایک leader arm سے، keyboard یا sliders، intervention frames کے ساتھ automatically flagged؛ triage ہر episode correction، evaluation یا discard کے طور پر؛ compose اگلا dataset original demonstrations سے plus corrections، episode selection explicit per source؛ اور start اگلا تربیت run پہلے checkpoint سے بجائے base model۔

دیکھیں DAgger loop کیسے کام کرتا ہے

کیا نمبر آپ کو نہیں بتا سکتے

کچھ بھی حل شدہ نہیں ہے، اور ایک tidy curve آپ کو persuade نہیں کرنا چاہیے ورنہ۔ Intervention rate measure کرتا ہے ایک joint system - policy، hardware، operator، room - اور attributes کچھ نہیں خود۔ یہ cannot judge کہ آیا corrections اچھے تھے، اور یہ fall کریں گے happily ایک task پر جو ہو گیا آسان کیونکہ object drift دو سینٹی میٹر قریب تین ہفتوں میں۔

کیا یہ کرتا ہے turn ایک vague impression ایک column میں آپ argue کر سکتے ہیں۔ متبادل نہیں ہے ایک بہتر metric؛ یہ ہے تین ہفتے جمع اصلاحات curve آپ کو بتایا ہوگا، round تین کے بعد، جمع کرنا بند کریں۔ Survey literature defines interactive imitation learning انسانی feedback دیا intermittently robot execution کے دوران، allowing online improvement رویہ کی؛ family وسیع ہے، اور کوئی arrangement اس کی کام نہیں کر سکتا بغیر ایک number ہر round۔ دیکھیں بھی SO-100 imitation learning guide base dataset کے لیے آپ mix کرتے ہیں، ایک policy چلانا inference side کے لیے، اور DAgger loop page implemented pipeline کے لیے۔

کیا intervention rate صرف ایک ہے minus success rate؟

نہیں۔ Rate ماپتا ہے کتنا run آپ نے take over کیا؛ success rate ماپتا ہے کہ آیا task done ہوا بغیر آپ کے۔ ایک run succeed کر سکتا ہے 30 فیصد intervention rate کے ساتھ، اور run کوئی interventions کے بغیر fail ہو سکتا ہے بالکل۔ وہ بھی differ noise میں: rate move کرتا ہے smoothly ہزاروں correlated frames کے اوپر، success rate jumps کچھ binary outcomes کے درمیان۔ دونوں log کریں۔

کتنے evaluation trials کی ضرورت ہے success rate کے لیے کچھ mean کریں؟

اس سے زیادہ جو reasonable محسوس ہوتا ہے۔ Normal approximation کے تحت، 20 trials ایک true 60 فیصد success rate پر carry 11 percentage points کے قریب ایک standard error، تو ایک 10-point movement rounds کے درمیان indistinguishable ہے noise سے؛ 50 trials لاتے ہیں وہ figure تقریباً 7 کے لیے۔ اگر آپ 50 afford نہیں کر سکتے، trial count کو identical رکھیں rounds کے پار اور small movements کو treat کریں inconclusive کے طور پر۔

کیا demonstrations کے ساتھ mixing ratio corrections سے شروع کرنا چاہیے؟

Documented starting point ہے IWR کا: partition ڈیٹا intervention اور non-intervention samples میں اور draw انہیں equal proportion میں، تو corrections contribute نصف gradient تاہم چھوٹا fraction frames ہے۔ اگر آپ کا setup نہیں ہو سکتا weight sampling، approximate یہ episode counts کے ذریعے composing dataset کے دوران اور record کریں ratio۔ تربیت corrections تنہا پر ہے option rule کریں۔

میری intervention rate round کے بعد اوپر چلا۔ Round ہے ضائع؟

ضروری نہیں، لیکن check کریں boring وضاحتیں پہلے: کیا checkpoint آپ نے چلایا trained کے ساتھ match کرتا ہے، کیا ایک camera index یا mount change، کیا object placement drift، تھا correction style consistent۔ اگر تمام چار clean ہیں اور paired success rate بھی fall، suspect mixture - بہت کم base demonstrations corrections کے خلاف، یا corrections جو ایک دوسرے کو contradict۔ ایک genuine regression belongs log میں، نہ bin۔

کیا میں fixed evaluation protocol کو skip کر سکتا ہوں اور صرف intervention rate دیکھ سکتا ہوں؟

صرف اگر آپ accept کریں کہ آپ نہیں بتا سکتے improvement سے habituation۔ Rate depends آپ کے اپنے real-time threshold پر stepping میں، اور وہ threshold گرتا ہے جیسے آپ ہو policy کی quirks کے ساتھ۔ Frozen protocol ہے part measurement کی آپ کی threshold نہیں reach کر سکتی - taped marks، ایک written home pose، ایک fixed trial count، ایک criterion decided round سے پہلے۔ یہ ہے رہنا سلسلے کے پار unchanged۔

Log کو repository میں رکھیں، notebook میں نہیں: rounds ہیں دن دور، hardware gets rebuilt، اور person reading curve اکتوبر میں آپ ہیں کوئی memory کے اگست کے۔ documentation FAQ covers آپریشنل details left یہاں۔

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started