
Intervention rate - intervention frames کو run کے frames سے تقسیم کیا جائے - ایک انسان کے قابو میں DAgger loop کا سب سے سستا ایمانداری سے پیش رفت کا اشارہ ہے۔ یہ مضمون اسے اس طریقے سے متعریف کرتا ہے کہ دو لوگ ایک جیسی قیمت حاصل کریں، اسے لاگ کرنے کا طریقہ دکھاتا ہے، اور چار طریقے واضح کرتا ہے جو اسے آپ کو گمراہ کرتے ہیں: آپریٹر کی عادت، Evaluation setup میں تبدیلی، صرف اصلاحات پر تربیت، اور ایک انسان جو منگل کو پیر سے مختلف طریقے سے اصلاح کرتا ہے۔
ایک DAgger round محسوس ہوتا ہے کہ یہ پروڈکٹو ہے جب آپ اس میں ہوتے ہیں۔ آپ policy کو چلاتے ہیں، جب یہ grasp میں ٹھوکر کھاتا ہے تو قابو میں آجاتے ہیں، اصلاحات محفوظ کرتے ہیں، دوبارہ تربیت دیتے ہیں، اور اگلا run - آپ قسم کھا سکتے ہیں - تھوڑا نرم دکھائی دیتا ہے۔ دو rounds بعد آپ یہ نہیں کہہ سکتے کہ کوئی بھی چیز بدل گئی یا نہیں، کیونکہ "تھوڑا نرم" ایک مقدار نہیں ہے۔
لوپ کو ہر round میں ایک نمبر کی ضرورت ہے، اور انسان کے قابو میں لوپ میں یہ نمبر تقریباً مفت ہے: جس وقت کا حصہ آپ کے پاس control میں تھا policy کے بجائے۔ یہ مضمون اسے اس طریقے سے متعریف کرتا ہے کہ دو لوگ ایک جیسی قیمت حاصل کریں، اسے لاگ کرتا ہے، نتیجے میں منحنی پڑھتا ہے، اور چار طریقے نام دیتا ہے جو اسے گمراہ کرتے ہیں جب یہ اکیلا ہو۔ تھیوری کے لیے یہ مضمون فرض کرتا ہے، دیکھیں DAgger کی وضاحت اور انسان کے ساتھ لوپ میں variant; عملی طریقہ ہے ایک SO-100 پر DAgger loop چلانا۔
مختصر ورژن
- •Intervention rate = intervention frames / run کے frames۔ Episodes نہیں، frames، اور denominator میں جو وقت آپ نے اصلاح میں صرف کی وہ بھی شامل ہے۔
- •تین rounds میں ایک سمتل منحنی مطلب ہے کہ rounds کوئی فائدہ نہیں دے رہے - خلط کو، checkpoint کو یا کام کو بدلیں بجائے چوتھے round کو جمع کرنے کے۔
- •ایک گرتی intervention rate کا مطلب ایک بڑھتی ہوئی success rate نہیں ہے۔ آپ کی stepping in کی حد بڑھتے ہوئے trust کے ساتھ نیچے کی طرف بہتی ہے۔
- •ایک مقررہ evaluation protocol کے بغیر - ایک جیسے start poses، objects، cameras، trial count - آپ کمرے کو ماپ رہے ہیں۔
- •صرف اصلاحات پر تربیت state distribution کو بڑھاتا ہے۔ IWR کا جواب: intervention اور غیر intervention samples کو برابر تناسب میں کھینچیں۔
ایک round کو سب کچھ کے لیے ایک نمبر کی ضرورت کیوں ہے
DAgger موجود ہے ایک distribution problem کی وجہ سے، اور distribution problems آنکھ سے نظر نہیں آتے۔ Ross اور Bagnell نے دکھایا کہ نقالی کی تعلیم ایک مقررہ demonstration set پر quadratically بڑھتی ہوئی regret bound اور compounding errors کی طرف لے جاتی ہے: ایک بار جب learner وہ states چھوڑ دیتا ہے جو demonstrator نے دیکھے ہوں، ڈیٹا میں کچھ نہیں بتاتا کہ واپس کیسے آئیں۔ DAgger اسے iterating سے ٹھیک کرتا ہے - policy چلائیں، states label کریں جو یہ دیکھتا ہے، aggregate کریں، دوبارہ تربیت دیں - جو Ross، Gordon اور Bagnell نے no-regret online learning میں reduction کے طور پر فریم کیا۔
اس فریمنگ کے ایک نتیجے ہیں جو لوگ چھوڑ دیتے ہیں۔ guarantee sequence کے بارے میں ہے policies کے iterations کے، کسی سنگل run کے بارے میں نہیں۔ یہ کچھ نہیں کہتا کہ آیا آپ کا round تین مدد دیا۔ جاننے کا واحد طریقہ ہے ہر iteration کو ماپنا۔ Kelly اور colleagues نے HG-DAgger متعارف کروایا کیونکہ classic DAgger expert سے action labels مانگتا ہے جب novice ابھی بھی control میں ہو، جو paper کا دعویٰ ہے safety کو کم کر سکتا ہے اور، انسان experts کے ساتھ، recognized actuator lag کے ذریعے label quality کو degrade کرنے کا امکان ہے۔ HG-DAgger ایک safety threshold بھی سیکھتا ہے ایک model-uncertainty-based risk metric کے لیے اور DAgger اور behavioral cloning دونوں کے اوپر بہتر performance رپورٹ کرتا ہے ایک driving task پر۔ یہ intervention counts شائع نہیں کرتا؛ وہ آپ خود produce کرتے ہیں۔
Rate کو متعریف کریں تاکہ دو لوگ ایک جیسی نمبر حاصل کریں
تعریف ایک لائن ہے: intervention frames کو run کے frames سے تقسیم کریں۔ ہر مشکل چیز hidden ہے اس میں کہ کیا ایک frame کے طور پر شمار ہوتا ہے اور کیا ایک run کے طور پر۔
Frames، episodes نہیں
کم سے کم ایک intervention کے ساتھ episodes کو شمار کرنا بیکار ہے: دس episodes ایک nudge کے ساتھ اور دس جن میں آپ نے 80 فیصد چلایا دونوں "10/10" دیتے ہیں۔ Frame count انہیں الگ کرتا ہے، اور یہ granularity ہے جو recording میں پہلے سے ہے - LeRobot dataset format میں ہر timestep ایک row ہے، تو intervention flag ایک boolean column ہے state اور action کے ساتھ۔ یہاں یہ per frame میں لکھا جاتا ہے جب takeover شروع ہوتا ہے اور صاف ہوتا ہے جب control واپس آتا ہے۔
Denominator میں اصلاحات شامل ہیں
دو denominators defensible ہیں - run کے total frames، یا frames جو policy نے خود سے چلائے - اور وہ high intervention levels پر بہت نقصان پہنچاتے ہیں۔ 1000 frames میں سے 400 پر قابو لیں اور پہلا 40 فیصد دیتا ہے، دوسرا 67 فیصد۔ ایک round کو پہلے طریقے سے ماپنے کا موازنہ کریں اگلے کے ساتھ دوسری طریقے سے اور ایک حقیقی بہتری غائب ہو جاتی ہے۔ Total frames لیں اور سلسلے کے درمیان اس کو دوبارہ دیکھنے کی کوشش کریں۔
ہاتھ بدلنے والے frames کے لیے ایک بار فیصلہ کریں
ہمیشہ ایک seam ہے۔ جب control pass ہوتا ہے، کچھ frames دونوں طرفوں کے لیے: arm ہو رہی ہے، leader align ہو رہا ہے، recording منجمد ہے۔ اس pipeline میں وہ handover frames raw stream میں رہتے ہیں اور کبھی curated episode میں داخل نہیں ہوتے - وہ نہ ہی policy behaviour ہیں اور نہ ہی training کے قابل correction۔ Seam کو ایک جیسے طریقے سے ہر round میں شمار کریں: 30 Hz پر، چھ takeovers ایک دو سیکنڈ seam کے ساتھ ہر ایک 360 frames ہے، ایک فیصد point کو حرکت دینے کے لیے کافی۔
Frames یا episodes؛ total run یا autonomous-only؛ handover frames اندر یا باہر۔ ان میں سے کوئی بھی تبدیل ہوا خاموشی سے rounds کے درمیان curve کو meaningless بناتا ہے۔ تینوں کو لکھ دیں۔
اسے لاگ کریں تاکہ نمبر session سے بچے
ایک metric running process کے status panel میں ایک readout ہے: یہ restart پر غائب ہو جاتا ہے اور plot نہیں ہو سکتا۔ ایک append-only line ہر run کے لیے پورے سلسلے کو cover کرتا ہے - اس میں بھی شامل ہے کہ کون سا checkpoint آپ نے چلایا، کیونکہ یہ ہر round کو بدلتا ہے اور انہیں mix کرنا غلط چیزوں کو غلط کرتا ہے۔
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}دو fields وزن رکھتے ہیں۔ train_mix ہے جو آپ نے اگلی training job کو دیا؛ اس کے بغیر کچھ بھی attribute نہیں کیا جا سکتا۔ eval_protocol fixed test کا نام دیتا ہے جو آپ نے بعد میں چلایا، اور وہ field سب سے زیادہ خالی چھوڑا جاتا ہے۔ ay-robots cockpit میں takeover status running session کے لیے intervention frame count رپورٹ کرتا ہے، تو logging instrumentation کے بجائے transcription ہے؛ dataset documentation covers کرتا ہے کہ per-frame columns کہاں land کرتے ہیں۔

منحنی کو پڑھیں: تین rounds، ایک verdict
تین rounds سب سے کم ہے پڑھنے کے لیے، کیونکہ دو points ہمیشہ ایک line ہیں۔ نیچے ٹیبل ایک bookkeeping template ہے placeholder numbers کے ساتھ، کسی run سے measurements نہیں۔ آپ monotone decrease کو ڈھونڈ رہے ہیں fixed test پر success میں بڑھتے ہوئے match کے ساتھ۔
| Round | Checkpoint چلایا | Frames | Intervention frames | Rate | Successes (of 20) |
|---|---|---|---|---|---|
| 0 (baseline) | base policy | 5 900 | 1 380 | 23.4 % | 7 |
| 1 | round 0 mix سے | 5 610 | 980 | 17.5 % | 10 |
| 2 | round 1 mix سے | 5 412 | 611 | 11.3 % | 11 |
| 3 | round 2 mix سے | 5 380 | 598 | 11.1 % | 12 |
Rounds ایک اور دو کام کر رہے ہیں۔ Round تین نہیں ہے: 11.3 11.1 فیصد کے خلاف کسی بھی چیز پر جو run-to-run variation کے اندر ہے جو ایک physical arm پر ماپی جاتی ہے، اور چوتھے round کی اسی اصلاحات سے ایک دوپہر صرف ضائع ہوتی ہے۔ Flat segment کہتا ہے کوئی چیز structural بدلیں۔
- باقی ناکامیاں teleoperation سے قابل اصلاح نہیں ہیں - object reach سے باہر، gripper geometry، ایک joint اپنی limit پر۔ کوئی correction data kinematic wall کو ٹھیک نہیں کرتا۔
- اصلاحات بہت کم ہیں base dataset کے خلاف gradient کو حرکت دینے کے لیے، اور کچھ بھی انہیں وزن نہیں دیتا۔
- اصلاحات ایک دوسرے کو contraddict کرتی ہیں، تو policy دو strategies کو average کرتی ہے اور ان کے درمیان landing کرتی ہے۔
- ناکامی upstream ہے: ایک camera move ہو گیا، lighting بدل گیا، wrist view اب training کے ساتھ match نہیں کرتا۔
- کام اس policy class کے ceiling پر ہے اس hardware پر، اور اگلا قدم زیادہ base data ہے۔
آخری دو loop کی ناکامیاں نہیں ہیں۔ Sirius-Fleet میں انسان کے لیے declining need ہے طے شدہ نتیجہ: جیسے جیسے robot autonomy بہتر ہو، اس کے anomaly predictors adapt کرتے ہیں اپنے prediction criteria، leading سے کم requests تک انسانی intervention کے لیے اور آہستہ آہستہ reducing انسانی workload over time۔ وہاں criterion adapt کرتا ہے مقصد پر۔ ایک manual loop میں آپ کا adapt بھی کرتا ہے، خاموشی سے - تو ایک rate جو flattens کیونکہ کام اپنے ceiling پر ہے exactly ترح لگتا ہے ایک جو flattened کیونکہ operator نے noticing بند کیا۔ کون ہے اگلا مسئلہ۔
Trap 1: گرتی ہوئی rate بڑھتی ہوئی success rate نہیں ہے
Intervention rate بالکل ایک چیز کو ماپتا ہے: run کے کتنے حصے کو آپ نے own کریں کرنے کا فیصلہ کیا۔ یہ فیصلہ آپ کا ہے، real time میں بنایا گیا، اور یہ حرکت کرتا ہے۔ Round zero میں آپ first bad approach angle پر take over کرتے ہیں؛ round تین تک آپ نے policy کو ایک درجن سے recover کرتے ہوئے دیکھا ہے اور آپ اسے کوشش کرنے دیتے ہیں۔ آپ کی threshold move ہوا؛ policy شاید نہیں۔ Rate دونوں طریقوں سے گرتا ہے۔
انسانی trust ہے کم سے کم ایک modelled quantity literature میں بجائے فرض ایک constant کے۔ Sirius re-weights training samples سے approximated انسانی trust اور optimises policy کے ساتھ weighted behavioral cloning، reporting ایک 8 فیصد boost simulation میں اور 27 فیصد real hardware پر state of the art کے اوپر policy success rate میں، دگنا convergence speed۔ یہ trust کو treat کرتا ہے ایک weight کے طور پر data پر۔ یہ correct نہیں کرتا threshold آپ کے سر میں round zero اور round تین کے درمیان۔
آپ drift کو remove نہیں کر سکتے، تو rate کو pair کریں کوئی چیز سے جو آپ کی threshold نہیں پہنچ سکتی: ایک fixed set trials کے جس میں آپ بالکل intervene نہیں کرتے، scored ایک criterion کے خلاف جو round سے پہلے لکھا گیا۔ ایک rate جو گرتا ہے جب paired success rate flat رہتی ہے ہے signature habituation کی - قابل قدر catching، کیونکہ loop کے اندر سے یہ محسوس ہوتا ہے pیش رفت۔
| Intervention rate | Success rate مقررہ protocol پر | سب سے ممکنہ پڑھائی |
|---|---|---|
| گرتا ہے | بڑھتا ہے | Round نے کام کیا۔ جاری رکھیں۔ |
| گرتا ہے | سمتل | آپ کا threshold drift، یا اصلاحات effort کو ہٹایا بغیر ناکامیاں ہٹائے۔ |
| گرتا ہے | گرتا ہے | Corrections policy کو degrade ہو رہے ہیں۔ Mixture اور ان کی internal consistency کو check کریں۔ |
| سمتل | سمتل | Round کچھ نہیں خریدا۔ Mixture، checkpoint یا task کو بدلیں مزید جمع کرنے سے پہلے۔ |
| بڑھتا ہے | گرتا ہے | Regression۔ Training mix، ایک changed camera یا checkpoint mix-up کو suspect کریں method سے پہلے۔ |
Trap 2: ایک fixed protocol کے بغیر، آپ کمرے کو ماپ رہے ہیں
Real-robot evaluation مہنگا ہے اور دوبارہ کرنے میں مشکل۔ SIMPLER authors motivate کرتے ہیں simulated evaluation سے observation سے کہ real-world evaluation ایسے policies کا scalable نہیں ہے اور reproducibility challenges کا سامنا کرتا ہے likely سے بدتر ہو جانے والے جیسے policies اپنے task spectrum کو broaden کریں۔ RoboArena attack کرتا ہے اسے دوسری طرف سے، پہلے سے زیادہ 600 pairwise real-robot evaluation episodes سات generalist policies کے اوپر، چلائے جاتے ہیں evaluators سے سات academic institutions پر DROID platform۔ اس کے evaluators اپنے tasks اور environments pick کرتے ہیں لیکن must judge policies کی pairs double-blind؛ paper رپورٹ کرتا ہے کہ یہ crowd-sourced ranking tracks generalist-policy performance زیادہ accurately than conventional، centralised evaluation۔
آپ 600 paired episodes run نہیں کریں گے ایک SO-100 پر ایک workshop میں۔ جو آپ کر سکتے ہیں وہ ہے variance کو ہٹانا جو آپ control کرتے ہیں - ایک list بورنگ enough کہ یہ usually skip ہو جاتی ہے۔
| Dimension | یہ freeze کریں | کیا drift ہوتا ہے اگر آپ نہیں کرتے |
|---|---|---|
| Start pose | ایک written home position، driven ہر trial سے پہلے | Trajectory start ہوتا ہے out of distribution |
| Objects | Taped marks، اور same physical objects reserved evaluation کے لیے | ایک 'بہتر' policy واقعی ایک closer object ہے |
| Cameras اور light | Same mounts، indices، exposure؛ blinds بند؛ photograph کریں setup | Swapped camera indices alone سے dominates ہو سکتے ہیں result |
| Trials اور stop rule | Fixed n، fixed timeout، criterion written round سے پہلے | Post-hoc criteria turn near-misses تمہاری ضرورت میں کچھ بھی |
| Operator رویہ | No interventions evaluation trials کے دوران | Evaluation another correction session بن جاتا ہے |
پھر arithmetic، unforgiving trial counts پر جو workshop afford کر سکتی ہے۔ Normal approximation کے تحت، 60 فیصد success 20 trials پر carry کرتا ہے ایک standard error near 11 percentage points - 0.6 times 0.4 over 20 کا square root - اور difference دونوں ایسے rounds کے درمیان carry کرتا ہے تقریباً 15۔ ایک jump 60 سے 70 فیصد تک ہے اس لیے کچھ نہ ہونے کے ساتھ consistent۔ Fifty trials لاتے ہیں per-round figure تقریباً 7 points، اور cost ایک دوپہر۔
یہ asymmetry ہے argument intervention rate کے لیے: computed ہزاروں frames کے اوپر بجائے بیس binary outcomes کے، یہ earlier اور smoothly move کرتا ہے۔ Caveat یہ ہے کہ frames ایک episode کے اندر بہت correlated ہیں - ایک bad grasp yields سو consecutive intervention frames - تو effective sample size closer ہے takeovers کی تعداد کے۔ Rate کو treat کریں early indicator کے طور پر اور success rate کو slow ground truth کے طور پر۔
Evaluation episodes کو کبھی composed training dataset میں داخل نہیں ہونا چاہیے - ورنہ round n+1 scored ہے data پر جو یہ trained تھا، اور curve measure کرتا ہے memorization۔
Trap 3: صرف اصلاحات پر تربیت policy کو bend کرتی ہے
اصلاحات ہیں interesting data، تو instinct ہے انہیں پر train کرنا۔ نہ کریں۔ وہ آتے ہیں construction سے narrow slice کے state space جہاں policy پہلے سے ہی failing تھی اور say تقریباً کچھ بھی نہیں majority run کے جو کام کیا۔ Fine-tune اس slice پر تنہا اور آپ کو get کریں ایک policy good ایک botched approach سے recover کرنے میں جو forget کیا ہے کیسے ایک clean بنانا۔
Mandlekar اور colleagues نے built کیا ان کا remote intervention system اس کے دور۔ Framing ان کا: manipulation tasks contain bottleneck regions requiring ایک sequence precise actions - inserting ایک pod ایک coffee machine میں ہے ان کی مثال - جہاں small deviations lead کرتے ہیں states میں demonstrations نے کبھی cover نہیں کیا۔ الگورتھم انہوں نے trains iteratively نئے data پر تو policy learns bottlenecks کو traverse کریں، اور وہ report کرتے ہیں agents trained intervention data پر beat کرتے ہیں agents trained ایک equivalent number samples پر non-interventional demonstrators سے۔
- تیز: ایک short run over کچھ درجن episodes ہے cheap enough دوبارہ کرنے کے لیے
- Targeted: gradient dominated ہے states سے جو آپ کو care کرتے ہیں
- سستا testing کے لیے کہ آیا correction style learnable ہے بالکل
- Fine-tune distribution اب resemble نہیں کرتا task distribution
- Nominal رویہ degrade ہو سکتا ہے visibly ایک single round میں
- Rate گر سکتا ہے جب success گرتی ہے اس کے ساتھ - clean segments traded recoveries کے لیے
Mixing ratio ہے ایک hyperparameter اور deserves ہے لکھا جانا۔ Composing اگلا dataset ہے جہاں یہ فیصلہ ہے: original demonstrations plus correction set، episode selection explicit per source بجائے rule جو quietly pull کرتا ہے ہے جو available ہے۔ یہاں وہ ایک compose step ہے cockpit میں، اور result ہے ایک ordinary dataset - دیکھیں تربیت documentation۔ کیا کوئی tool آپ کے لیے نہیں کرتا وہ ہے recording جو ratio produced جو curve۔
Trap 4: انسان ایک consistent expert نہیں ہے
DAgger کی theory فرض کرتا ہے ایک expert۔ آپ نہیں ہو technical sense میں: آپ کی corrections نہیں ہیں samples ایک fixed conditional distribution سے over actions۔ ACT authors name اسے جب listing obstacles سے fine manipulation - errors compound کرتے ہیں over time، اور انسانی demonstrations ہو سکتے ہیں non-stationary۔ سسٹم انہوں نے پھر بھی reach کرتا ہے 80 سے 90 فیصد success چھ real tasks پر دس منٹ سے demonstrations، تو مسئلہ ہے tractable، موجود نہیں۔
Robomimic study makes point سے data side۔ پار چھ offline algorithms پر پانچ simulated اور تین real-world multi-stage tasks، اس کے lessons میں شامل ہیں sensitivity design choices کو، dependence demonstration quality پر، اور - سب سے زیادہ hurt یہاں - variability stopping criteria سے، کیونکہ تربیت اور evaluation objectives differ۔ Checkpoint lowest loss کے ساتھ ہے نہیں reliably وہ highest success rate کے ساتھ۔
ایک hardware version ہے اس: input mode shapes correction۔ ایک leader-follower setup produces continuous، انسان کی pace trajectories۔ Keyboard nudges ہیں clamped hard سے server - دو degrees arm joints پر ہر call، چار gripper پر - تو ایک جیسی intent پہنچتی ہے ایک staircase طور پر small steps۔ Sliders send کرتے ہیں absolute targets اور server move کرتا ہے پر زیادہ سے زیادہ چھ degrees ان کی طرف ہر call۔ تین modes، تین action distributions؛ mixing تینوں ایک correction set میں اور پھر wondering کیوں approach twitchy ہو گیا ہے self-inflicted۔ teleoperation documentation covers کیا ہر mode بھیجتا ہے۔
Interventions کو وزن کرنا: IWR اور کیا بعد میں آیا
اگر corrections valuable minority ہیں، principled fix ہے weight بجائے exclusivity۔ Intervention Weighted Regression ہے reference implementation: data partitioned ہے intervention اور non-intervention samples میں، اور دونوں partitions sampled ہیں equal proportion میں تربیت کے دوران۔ ایک correction set جو frames کا پانچ فیصد ہے پھر contribute کرتا ہے نصف gradient، بغیر nominal رویہ vanishing۔
Equal proportion ایک starting point ہے، نہ ایک law۔ Sirius generalises اسے replacing binary partition کے ایک continuous weight سے approximated انسانی trust؛ Sirius-Fleet moves decision upstream، ایک visual world model استعمال کر اور anomaly predictors فیصلہ کریں جب ایک انسان پوچھا جاتا ہے۔ Common thread: intervention flag ہے ایک training signal، نہ صرف ایک bookkeeping column۔
| Method | کون فیصلہ کرتا ہے جب انسان act کرتا ہے | کیسے intervention data استعمال ہوتا ہے | Reported result |
|---|---|---|---|
| DAgger (2011) | Fixed schedule؛ expert labels visited states | ایک growing dataset، unweighted | Framed ایک reduction کے طور پر no-regret online learning کے |
| HG-DAgger (2019) | انسان، control کو gating real system پر | Aggregated؛ plus ایک learned safety threshold model uncertainty پر | بہتر than DAgger اور BC driving پر؛ کوئی intervention counts دی نہیں گی |
| IWR (2020) | انسان، via remote teleoperation | Intervention اور non-intervention samples drawn equal proportion میں | Beats non-interventional demos equal sample count پر |
| Sirius (2022) | انسان، deployment کے دوران | Weighted BC، weights approximated انسانی trust سے | 8 % gain simulation میں، 27 % real hardware پر؛ 2x تیز convergence |
| ThriftyDAgger (2021) | سسٹم، gating novelty اور risk پر | Interactive collection ایک supervision budget کے تحت | User study (N=10): 58 % اعلیٰ انسانی اور 80 % اعلیٰ robot performance than next best method |
| Fleet-DAgger (2022) | سسٹم، allocation attention fleet کے پار | Fleet learning scored Return on Human Effort سے | Up تک 8.8x اعلیٰ ROHE than baselines |
| Sirius-Fleet (2024) | Anomaly predictors self-adapting criteria کے ساتھ | Multi-task learning ایک visual world model کے ساتھ | کم intervention requests جیسے autonomy بہتر ہو |

چار metrics logging کے لائق rate کے ساتھ
- Takeovers ہر run میں۔ بیس short corrections اور ایک long سے similar rates دیں اور describe کریں مختلف policies - ایک jittery، ایک single blind spot کے ساتھ۔
- Mean intervention length۔ بڑھتا length ایک falling count کے ساتھ مطلب ہے باقی ناکامیاں ہیں hard، جو ہے کیسا late progress۔
- Time سے first intervention۔ ایک policy جو مزید far جاتا ہے helping سے پہلے ہے improving یہاں تک کہ جب total rate flat ہو۔
- جہاں interventions cluster۔ Bin کریں flag سے normalised episode progress؛ ایک stable peak rounds میں points ایک bottleneck۔
ایک round protocol جو آپ واقعی چلا سکتے ہیں
ایک measured round ہے چھ steps اور produce ایک row log میں۔ پہلے چار loop ہیں؛ آخری دو اسے ایک measurement بناتے ہیں۔
- 1Evaluation protocol کو round zero سے پہلے freeze کریں
لکھ دیں start pose، object placement، cameras، trial count، timeout اور success criterion۔ Table کو photograph کریں۔ اگر document کو change کرنا پڑے، series restart ہو۔
- 2Baseline کو measure کریں
چلائیں protocol کے ساتھ کوئی interventions اور record کریں successes؛ پھر ایک چلائیں instrumented session takeover enabled کے ساتھ اور record کریں rate۔ وہ دونوں numbers ہیں round zero۔
- 3Corrections کو ایک consistent style میں collect کریں
ایک input mode ہر round، ایک operator اگر آپ manage کر سکتے ہیں۔ Take over ایک criterion پر جو آپ بیان کر سکتے ہیں - 'gripper approach میں دو سینٹی میٹر سے زیادہ off' - اور hold کریں اسے round کے لیے۔
- 4ہر episode کو ایک جیسے دن triage کریں
Correction، evaluation یا discard۔ Ambiguous episodes discarded جاتے ہیں، بچائے نہیں جاتے theory پر کہ مزید data مدد دیتا ہے - ایک correction جس میں آپ خود fumble کیا ہے بہتر ہے کوئی episode سے۔
- 5Mixture کو explicitly compose کریں
Original demonstrations plus corrections، episode selection per source۔ Record کریں base count، correction count اور کوئی weighting - یہ ہے field آپ چاہتے ہیں تین ہفتوں میں۔
- 6Checkpoint سے continue کریں، پھر re-measure کریں
Compose کریں اگلا dataset پہلے checkpoint سے بجائے base model کے، چلائیں frozen protocol plus ایک instrumented session، append کریں row، اور compare کریں پچھلے دو rounds کے خلاف۔
دو limits change کیسے آپ read ضعیف round۔ Continuing checkpoint سے initialises weights اسے سے - نہ ایک optimizer resume، تو schedule fresh start کرتا ہے اور ایک short run ایک converged checkpoint سے بہت کم move کر سکتا ہے۔ اور leader-align motion start میں takeover کے ہے least mileage real hardware پر سب سے کم chain میں؛ اگر corrections odd transient کے ساتھ شروع ہوتے ہیں تو mixture دوش سے پہلے وہاں دیکھیں۔
Measured loop، پہلے سے wired
ay-robots implements یہ چھ steps جیسے product features: take over mid-run ایک leader arm سے، keyboard یا sliders، intervention frames کے ساتھ automatically flagged؛ triage ہر episode correction، evaluation یا discard کے طور پر؛ compose اگلا dataset original demonstrations سے plus corrections، episode selection explicit per source؛ اور start اگلا تربیت run پہلے checkpoint سے بجائے base model۔
دیکھیں DAgger loop کیسے کام کرتا ہےکیا نمبر آپ کو نہیں بتا سکتے
کچھ بھی حل شدہ نہیں ہے، اور ایک tidy curve آپ کو persuade نہیں کرنا چاہیے ورنہ۔ Intervention rate measure کرتا ہے ایک joint system - policy، hardware، operator، room - اور attributes کچھ نہیں خود۔ یہ cannot judge کہ آیا corrections اچھے تھے، اور یہ fall کریں گے happily ایک task پر جو ہو گیا آسان کیونکہ object drift دو سینٹی میٹر قریب تین ہفتوں میں۔
کیا یہ کرتا ہے turn ایک vague impression ایک column میں آپ argue کر سکتے ہیں۔ متبادل نہیں ہے ایک بہتر metric؛ یہ ہے تین ہفتے جمع اصلاحات curve آپ کو بتایا ہوگا، round تین کے بعد، جمع کرنا بند کریں۔ Survey literature defines interactive imitation learning انسانی feedback دیا intermittently robot execution کے دوران، allowing online improvement رویہ کی؛ family وسیع ہے، اور کوئی arrangement اس کی کام نہیں کر سکتا بغیر ایک number ہر round۔ دیکھیں بھی SO-100 imitation learning guide base dataset کے لیے آپ mix کرتے ہیں، ایک policy چلانا inference side کے لیے، اور DAgger loop page implemented pipeline کے لیے۔
کیا intervention rate صرف ایک ہے minus success rate؟▾
نہیں۔ Rate ماپتا ہے کتنا run آپ نے take over کیا؛ success rate ماپتا ہے کہ آیا task done ہوا بغیر آپ کے۔ ایک run succeed کر سکتا ہے 30 فیصد intervention rate کے ساتھ، اور run کوئی interventions کے بغیر fail ہو سکتا ہے بالکل۔ وہ بھی differ noise میں: rate move کرتا ہے smoothly ہزاروں correlated frames کے اوپر، success rate jumps کچھ binary outcomes کے درمیان۔ دونوں log کریں۔
کتنے evaluation trials کی ضرورت ہے success rate کے لیے کچھ mean کریں؟▾
اس سے زیادہ جو reasonable محسوس ہوتا ہے۔ Normal approximation کے تحت، 20 trials ایک true 60 فیصد success rate پر carry 11 percentage points کے قریب ایک standard error، تو ایک 10-point movement rounds کے درمیان indistinguishable ہے noise سے؛ 50 trials لاتے ہیں وہ figure تقریباً 7 کے لیے۔ اگر آپ 50 afford نہیں کر سکتے، trial count کو identical رکھیں rounds کے پار اور small movements کو treat کریں inconclusive کے طور پر۔
کیا demonstrations کے ساتھ mixing ratio corrections سے شروع کرنا چاہیے؟▾
Documented starting point ہے IWR کا: partition ڈیٹا intervention اور non-intervention samples میں اور draw انہیں equal proportion میں، تو corrections contribute نصف gradient تاہم چھوٹا fraction frames ہے۔ اگر آپ کا setup نہیں ہو سکتا weight sampling، approximate یہ episode counts کے ذریعے composing dataset کے دوران اور record کریں ratio۔ تربیت corrections تنہا پر ہے option rule کریں۔
میری intervention rate round کے بعد اوپر چلا۔ Round ہے ضائع؟▾
ضروری نہیں، لیکن check کریں boring وضاحتیں پہلے: کیا checkpoint آپ نے چلایا trained کے ساتھ match کرتا ہے، کیا ایک camera index یا mount change، کیا object placement drift، تھا correction style consistent۔ اگر تمام چار clean ہیں اور paired success rate بھی fall، suspect mixture - بہت کم base demonstrations corrections کے خلاف، یا corrections جو ایک دوسرے کو contradict۔ ایک genuine regression belongs log میں، نہ bin۔
کیا میں fixed evaluation protocol کو skip کر سکتا ہوں اور صرف intervention rate دیکھ سکتا ہوں؟▾
صرف اگر آپ accept کریں کہ آپ نہیں بتا سکتے improvement سے habituation۔ Rate depends آپ کے اپنے real-time threshold پر stepping میں، اور وہ threshold گرتا ہے جیسے آپ ہو policy کی quirks کے ساتھ۔ Frozen protocol ہے part measurement کی آپ کی threshold نہیں reach کر سکتی - taped marks، ایک written home pose، ایک fixed trial count، ایک criterion decided round سے پہلے۔ یہ ہے رہنا سلسلے کے پار unchanged۔
Log کو repository میں رکھیں، notebook میں نہیں: rounds ہیں دن دور، hardware gets rebuilt، اور person reading curve اکتوبر میں آپ ہیں کوئی memory کے اگست کے۔ documentation FAQ covers آپریشنل details left یہاں۔
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started