Tabletop robot workspace от типа, използван като фиксиран evaluation setup за повторни policy runs
DAggerEvaluationImitation LearningRobot DataSO-100

Измерване на DAgger Loop: Intervention Rate, Evaluation Protocol и капановете между тях

AY-Robots ResearchAugust 27, 202615 мин четене

Intervention rate - intervention frames разделени на frames на хода - е най-евтиния честен сигнал за прогрес, който един human-gated DAgger loop има. Тази статия го определя така, че двама хора да изчислят една и съща стойност, показва как да го логирате и преминава през четирите начина, по които ви подвежда: operator habituation, плаващ evaluation setup, обучение само на corrections и човек, който коригира различно на вторник отколкото на понеделник.

DAgger round се чувства продуктивен, докато си в него. Вкарвате policy, prevземате контрола, когато фалира захватът, запазвате corrections, преподготвяте и следващия ход изглежда - щяхте да се клеветате - малко по-гладък. Два хода по-късно не можете да кажете дали нещо се е променило, защото "малко по-гладък" не е количество.

Loop-ът трябва една цифра на ход, и в one human-gated loop тази цифра е почти безплатна: фракцията на хода, през който сте имали контрола вместо policy. Тази статия го определя така че двама хора да изчислят една и съща стойност, го логира, чете резултатната крива и именува четирите начина, по които ви подвежда, когато стои сам. За теорията, която този парче предполага, вижте DAgger explainer и human-gated variant; the hands-on counterpart is running a DAgger loop on an SO-100.

Кратката версия

  • Intervention rate = intervention frames / frames на хода. Frames, не episodes, и знаменателят включва frames, които прекарахте коригирайки.
  • Плоска крива над три хода означава, че ходовете не купуват нищо - променете смесването, checkpoint или задачата вместо да събирате четвърти.
  • Падаща intervention rate не е растяща success rate. Вашата граница за намеса се спуска надолу с растящо доверие.
  • Без фиксиран evaluation protocol - същите начални позиции, обекти, камери, проба - измервате стаята.
  • Обучението само на corrections изкривява разпределението на състоянието. IWR отговор: изваждане на intervention и non-intervention samples в равна пропорция.

Защо един ход трябва число вообще

DAgger съществува поради проблем с разпределението, и проблемите с разпределението са невидими на окото. Ross и Bagnell показаха, че imitation learning на фиксиран демонстрационен набор води до натрупване на грешки и a regret bound растящ квадратично в хоризонта на времето: веднъж когато обучаващият напусне състояния, които демонстраторът е посетил, нищо в данните не му казва как да се върне. DAgger поправя това чрез итерация - run policy, label state, aggregate, retrain - което Ross, Gordon и Bagnell представят като редукция към no-regret online learning.

Тази рамка има последица, която хората прескачат. Гаранцията се отнася до последователността на policies над итерациите, не до някоя отделна пътека. Не казва нищо за това дали вашия ход три помогна. Единственият начин да знаете е да измерите всяка итерация. Kelly и колегите представиха HG-DAgger, защото classic DAgger иска етикети на действие от експерта, докато новакът е все още в контрол, което статията твърди може да намали безопасност и, с човешки експерти, вероятно е да нарушат качеството на етикета чрез възприятие lag. HG-DAgger също научава праг безопасност за метрика на риск на базата на несигурност на модел и докладва подобрени резултати пред DAgger и behavioral cloning при управление на автомобил. Не публикува intervention counts; тези произвеждате сам.

Определяне на ставката така че двама хора да получат един и същ номер

Определението е един ред: intervention frames разделени на frames на хода. Всичко трудно се крие в това, което се брои като frame и какво се брои като ход.

Frames, не episodes

Броенето на episodes с поне една намеса е безполезно: десет episodes с един pushes и десет в които вкараха осемдесет процента beide дават "10/10". The frame count разделя ги и това е гранулярност, която записването вече има - в LeRobot dataset format всеки timestep е ред, така че intervention flag е един булев столб до state и action. Тук е написано per frame момента takeover starts и изчистено когато контрол се връща.

Знаменателят включва corrections

Два знаменателя са защитаващи - total frames на хода или frames policy управлял автономно - и те се различават лошо при high intervention levels. Вземете контрол за 400 от 1000 frames и първия дава 40 процента, втория 67 процента. Сравняване един ход измерван първия начин против следващия измерван втория начин е как един истински поправка изчезва. Вземете total frames и никога не преглеждайте избора mid-series.

Решете веднъж какво се случва с handover frames

Винаги има шев. Когато контрол се предава, някои frames принадлежат на никоя страна: arm е задържан, leader е подравняващ, записването е замразено. В този pipeline тези handover frames остават в raw stream и никога не влизат curated episode - те нито са policy behavior нито correction заслужаващ обучение. Броенето на шева същия начин всеки ход: при 30 Hz, шест takeovers с двусекунден шев всеки е 360 frames, достатъчно да преместите точка на процента.

Трите решения, които нарушават сравнимост

Frames или episodes; total ход или autonomous-only; handover frames in или out. Някой от трите променен мълчаливо между ходове прави кривата безсмислена. Запишете и трите.

Логиране така че число оцелява сесията

Метрика в панел на статус на текущ процес е четене: изчезва при restart и не може бъде заложена. Един append-only ред per ход покрива цялата серия - включително което checkpoint вкараха, защото това се променя всеки ход и смесване им инвалидира какво следва.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Един ред per ход. Записване на знаменател и handover convention до числото има по-голямо значение отколкото имена на полета.

Два полета носят теглото. train_mix е това което хранихте следната обучаваща работа; без него нищо не може бъде атрибут. eval_protocol назова фиксирана тест която разиграхте след това и е полето най-често оставено empty. В ay-robots cockpit takeover status докладите intervention frame count за текущата сесия, така че логиране е преписване по-скоро от инструментация; dataset documentation покрива където per-frame столбци се приземяват.

Training configuration matrix показващ policies, datasets и checkpoints side by side
Всеки ход променя checkpoint и dataset mix. Число чийто комбинация не е записана не може бъде атрибуирана.

Четене крива: три хода, един вердикт

Три хода е минимум за четене, защото две точки са винаги линия. Таблицата долу е bookkeeping template с placeholder числа, не измервания от всеки ход. Вие търсите монотонна намалялост съвпадаща растяща успех на фиксирана тест.

ХодCheckpoint drivenFramesIntervention framesRateSuccesses (of 20)
0 (baseline)base policy5 9001 38023.4 %7
1from round 0 mix5 61098017.5 %10
2from round 1 mix5 41261111.3 %11
3from round 2 mix5 38059811.1 %12

Ходове един и два правят работа. Ход три не: 11.3 против 11.1 процента е вътре в run-to-run вариация на нищо измерено на физическия arm, и четвърти ход същите corrections траши един следобед за нищо. Плоския сегмент казва промени нещо структурално.

  • Останалите повреди не са поправяни чрез teleoperation - обект out of reach, gripper geometry, joint в своя лимит. Никой correction data поправя кинематична стена.
  • Corrections са твърде малко против base dataset да преместят градиент и нищо ги тегло.
  • Corrections се противоречат един на друг, така че policy осреднява две стратегии и приземява между тях.
  • Повредата е upstream: камера е преместена, осветление е се променило, wrist view не съвпада обучение.
  • Задачата е в потолъка този policy class на този hardware и следващия стъпка е повече base данни.

Последния два не са повреди на loop. В Sirius-Fleet намаляваща нужда на човека е designed резултат: като robot autonomy се подобрява, неговото anomaly predictors адаптират своя prediction критерии, водещи до по-малко искания за human intervention и постепенно намаляваща человешка работна товар над времето. Там критерий адаптира по цел. В ръчен loop твоя адаптира и мълчаливо - така че rate които плосни защото задачата е на своя потолък изглежда точно като един който плосни защото оператор престана забелязвам. Което е следният проблем.

Капан 1: падаща ставка не е растяща успешна ставка

Intervention rate измерва точно един нещо: колко много на хода вие решихте да притежавате. Това решение е ваше, направено реално време, и се движи. В ход нула вие преземете първия лош approach angle; by ход три вие видяхте policy възстановяване от дузина от тях и позволявате на то да опита. Вашия праг преместен; policy може не. Rate пада всеки начин.

Human trust е поне modeled количество в литературата вместо assumed константа. Sirius re-weights обучаващи samples с approximated human trust и оптимизира policy с weighted behavioral cloning, докладвай 8 процента boost в симулация и 27 процента на истински hardware над state на art в policy success rate, на двойния convergence speed. Това лекува trust като тежест на данни. Това не поправя праг в твоя глава между ход нула и ход три.

Вие не можете отстранете drift, така че двойка rate с нещо твоя праг не може докосне: фиксирана набор от trials при което вие не intervene на всички, вкара срещу критерий написан преди хода. Rate която падне докато paired success rate остава мърта е подпис на habituation - стоящо хвати, защото от вътре loop то се чувства като прогрес.

Intervention rateSuccess rate on fixed protocolMost likely reading
fallsrisesХод работи. Продължи.
fallsflatТвоя праг се дрейфа или corrections отстранено усилие без отстранение повреди.
fallsfallsCorrections деградира policy. Проверете смесване и тяхната вътрешна последователност.
flatflatХод купи нищо. Променете смеси, checkpoint или задачата преди събра повече.
risesfallsРегресия. Подозирайте обучаваща смес, променена камера или checkpoint смесване преди подозирайте метод.

Капан 2: без фиксиран протокол, вие измервате стаята

Real-robot evaluation е скъпа и трудна повтори. SIMPLER авторите мотивиран симулиран evaluation наблюдение че real-world evaluation такива policies не е масштабируема и лицо reproducibility предизвикателства вероятно да се влошат като policies разширяват своя задача спектър. RoboArena атаки то от другия страна, с повече от 600 pairwise real-robot evaluation episodes през седем generalist policies, разиграни от evaluators при седем академични институции на DROID платформа. Неговия evaluators избирате своя собствено задачи и среди но трябва преценете двойки от policies двойна-слепо; статия докладва че това crowd-sourced класиране следи generalist-policy резултат по-точно отколкото conventional, централизирана evaluation.

Вие няма да разиграите 600 двойни episodes един SO-100 в workshop. Какво вие можете да направите е отстранете вариация вие контрол - списък достатъчно скучен че обикновено се получи skipped.

ИзмерениеЗамразяване товаКакво дрейфа ако вие правите не
Start poseНаписан home position, управлян преди всеки trialТраектория стартира out of распределение
ОбектиTaped маркира, и същия физически обекти запазени за evaluationЕдин 'по-добър' policy е наистина по-близо обект
Камери и светлинаСъщия мъртви, индекси, изложение; blinds затворени; снимка setupSwapped камера индекси един може доминира резултат
Trials и stop ruleФиксирана n, фиксирана timeout, критерий написан преди ходаPost-hoc критерии обръщане near-misses в какво вие нужда
Оператор поведениеНикой interventions по време evaluation trialsEvaluation става още един correction сесия

Тогава аритметиката, безпощадна при trial брой один workshop може позволи. Под нормален approximation, 60 процента успех над 20 trials носи standard error около 11 процента точка - square root на 0.6 пъти 0.4 над 20 - и разлика между две такива ходове носи около 15. Jump от 60 до 70 процента е следователно последователна с нищо което е се случило. Петдесят trials носи per-ход фигура до грубо 7 точка, и цена един следобед.

Това асиметрия е аргумент за intervention rate: изчислена над хиляди frames по-скоро отколкото двадесет двоични резултати, то движи по-рано и по-гладко. Caveat е че frames в един episode са тежко корелирани - един лош grasp дава сто последователни intervention frames - така че effective sample size е по-близо до число от takeovers. Третира rate като ранния индикатор и success rate като бавна ground truth.

Запазете evaluation episodes извън обучаваща basejn

Evaluation episodes трябва никога влизат composed обучаващо датасет - иначе ход n+1 е очаква на данни то беше обучава и крива измерва memorization.

Капан 3: обучение само на corrections огъва policy

Corrections са интересния данни, така че инстинкт е обучение на тях. Правете не. Те дойде по конструкция от тясна разреза на state пространство където policy беше вече неуспешна и казв почти нищо относно мнозинството от хода което работи. Fine-tune на този разреза един и вие получава един policy добър в възстановяване от ботчана approach която забравила как да направи почисто един.

Mandlekar и колегите построили своя дистанционна intervention система около това. Техния рамка: manipulation задачи съдържа bottleneck региони които нуждата на последователност прецизни действия - вмъкване pod в coffee machine е техния пример - където малки отклонения водят в states демонстрации никога покриха. Техния алгоритъм обучава итеративно на новия данни така че policy научава да пресече тези bottlenecks и те докладват че агенти обучени на intervention данни бия агенти обучени на еквивалент число на samples от non-interventional демонстратори.

Corrections-only fine-tuning срещу composed смес
Какво corrections-only получава вие
  • Бързо: един кратък ход над няколко дузина episodes е евтин достатъчно повтори
  • Целевой: градиент е доминирана от states вие грижа относно
  • Евтин за тестване дали един correction стил е learnable на всички
Какво то цена
  • Fine-tune распределение не по-дълго напомня задача распределение
  • Номинален поведение може деградира видимо в един ход
  • Rate може пада докато успех пада с него - почисти сегменти тревожат за recoveries

Мешинг съотношение е hyperparameter и заслужава бъде написана надолу. Composing следващия датасет е където то е решено: оригинален демонстрации плюс correction набор, episode селекция per източник по-скоро от правило което мълчаливо издърпа в каквото е налично. Тук че е един compose стъпка в cockpit и резултат е един обикновен датасет - вижте обучаване документация. Какво никой инструмент правилен за вас е записване която съотношение произведено която крива.

Капан 4: човека не е един последователен експерт

DAgger теория предполага един експерт. Вие не са един в техническо значение: твоя corrections не са samples от един фиксиран условен распределение над действия. The ACT авторите назовават това когато лист на препятства да fine манипулация - грешки compound над времето, и human демонстрации може бъде non-stationary. Техния система все още достига 80 до 90 процента успех на шест истински задачи от десет минути на демонстрации, така че проблем е tractable, не absent.

The robomimic проучване направи точка от данни страна. През шест offline алгоритми на пет симулиран и три real-world многостепенна задачи, своя уроци включи чувствителност на design избори, зависимост на демонстрация качество, и - един който болки най-много тук - вариабилност възникваща от стопирай критерии, защото обучаване и evaluation цели различават. The checkpoint с най-низко загуба не е надежно един с най-висок успех ставка.

Има един hardware версия на това: input начин форми correction. Един leader-follower setup произведе continuous, human-paced траектории. Keyboard nudges са clamped твърдо от сървър - две степени per повикване на arm съединения, четири на gripper - така че същия intent пристига като staircase на малко стъпки. Sliders изпратете абсолютна цели и сървър движи най-много шест степени към тях per повикване. Три начина, три действие распределения; смесване и трите в един correction набор и тогава чудо защо подход обърнало twitch е self-inflicted. The teleoperation документация покрива какво всеки режим изпраща.

Тежащ interventions: IWR и какво дойде след

Ако corrections са на цена мнозинство, то принципирана поправка е тежест по-скоро от exclusivity. Intervention Weighted Regression е референция внедряване: данни е разделен в intervention и non-intervention samples, и две разделения са взети в равна пропорция по време обучаване. Един correction набор که е пет процента на frames това придружава половина на градиент, без номинален поведение изчезваше от распределение.

Равна пропорция е начална точка, не закон. Sirius обобщава то чрез заменя на двоична разделение с един continuous тежест от approximated human trust; Sirius-Fleet премества решение upstream, използвайки един визуален light модел и anomaly predictors да решете когато един човек е попитан на всички. The обща нишка: intervention флаг е един обучаване сигнал, не един bookkeeping столб.

МетодКойто решава когато човека действатКак intervention данни е използванаДокладана резултат
DAgger (2011)Фиксирана график; експерт етикета посетено statesЕдин растящ датасет, unweightedРамка като един редукция да no-regret онлайн научаване
HG-DAgger (2019)Човека, gating контрол на един истински системаКомбинирана; плюс един научена праг безопасност на model несигурностПо-добър от DAgger и BC на управление; никой intervention брой дадена
IWR (2020)Човека, през дистанционна teleoperationIntervention и non-intervention samples издърпана в равна пропорцияБийте non-interventional демонстрации при равна sample брой
Sirius (2022)Човека, по време развръщанеПретеглена BC, теглиця от approximated human trust8 % придобиване в симулация, 27 % на истински hardware; 2x по-бързо convergence
ThriftyDAgger (2021)Системата, gating на novelty и рискИнтерактивна събира под един наблюдение бюджетПотребител проучване (N=10): 58 % по-висок човек и 80 % по-висок robot резултат отколкото следния най-добър метод
Fleet-DAgger (2022)Системата, разпределение внимание през един флотФлот научаване очакван от Return на Human EffortДо 8.8x по-висок ROHE отколкото baselines
Sirius-Fleet (2024)Anomaly predictors със self-адаптиране критерииМногозадачна научаване със един визуален world моделПо-малко intervention искания като autonomy се подобрява
Leaderboard вижте сравняваща robot policies от измерена брой
Ranking policies срещу всеки друг означава нещо един когато всеки запис разиграни същия протокол. Че се отнася по твоя собствено три ходове и.

Четири метрики стоящо логиране до rate

  • Takeovers per ход. Двадесет къси corrections и един дълъг един дават подобна ставка и описват различна policies - един jittery, един със един един слепа място.
  • Средно intervention дължина. Растяща дължина със един падаща брой означава останалите повреди са един трудни, които е какво позна прогрес изглежда.
  • Времето до първи intervention. Един policy че получава по-далеч преди нуждата помощ е подобряваща дори когато общо ставка е плоска.
  • Където interventions група. Bin флаг от нормализирана episode прогрес; един стабилен върх през ходове точка един един bottleneck.

Един ход протокол вие може наистина разиграите

Един измерена ход има шест стъпки и произведе един ред в логиране. The първи четири са loop; последния два направи то един измерване.

  1. 1
    Замразяване evaluation протокол преди ход нула

    Запишете надолу начало поза, обект място, камери, trial брой, timeout и успех критерий. Снимка маса. Ако документ трябва промени, серия рестарт.

  2. 2
    Измерване baseline

    Разиграй протокол със никой interventions и запазване successes; тогава разиграй един инструментирана сесия със takeover разрешени и запазване ставка. Тези две числа са ход нула.

  3. 3
    Събирани corrections един един последователен стил

    Един входа режим per ход, един оператор ако вие може справи то. Вземете над на един критерий вие може казват се предложи - 'gripper повече от две сантиметра от на подход' - и запазване то за ход.

  4. 4
    Triage всеки episode един един ден

    Correction, evaluation или отказ. Неясни episodes получават отказ, не запазени на теория че повече данни помощи - един correction в което вие собствено fumbled е по-лошо от никой episode.

  5. 5
    Составяй смес явно

    Оригинален демонстрации плюс corrections, episode селекция per източник. Запазване база брой, correction брой и никой тежест - това е полето вие ще желай в три седмици.

  6. 6
    Продължи от checkpoint, тогава re-measure

    Обучи composed датасет от предишния checkpoint по-скоро отколкото база модел, разиграй замразена протокол плюс един инструментирана сесия, append ред, и сравнете против предишния два ходове.

Два ограничи промени как вие прочетете един слаб ход. Продължаваща от jedan checkpoint инициализира тежести от то - не един оптимизатор резюме, така че график начина fresh и един кратък ход от един converged checkpoint може преместите много малко. И leader-align движение на начало един takeover има най-малко пробег на истински hardware на всичко в веригата; ако corrections всички начало с един нечетно преходна, погледнете там преди обвиняване смесване.

Один измерена loop, вече проводена нагоре

ay-robots внедря тези шест стъпки като продукт характеристики: вземете над mid-run от един leader ръка, клавиатура или sliders, със intervention frames отмечани автоматично; triage всеки episode като correction, evaluation или отказ; направи следния датасет от оригинален демонстрации плюс corrections, episode селекция явно per източник; и начало следния обучаване разиграй от предишния checkpoint по-скоро отколкото база модел.

Вижте как DAgger loop работи

Какво числа не може казват вам

Нищо от този не е решено, и един neat крива трябва не убеди вие иначе. The intervention ставка измерва един съвместна система - policy, hardware, оператор, стая - и атрибути нищо на своя собствено. То не може преценете дали corrections са били добра и то ще пада радост на един задачата която получи по-лесно защото обект дрейфа два сантиметра по-близо над три седмици.

Какво то правилност е обърни един vague впечатление в един столб вие може спор със. Алтернатива не е един по-добър метрика; то е три седмици на събирани corrections крива щеше казал вам, след ход три, до стоп събират. The проучване литература определи интерактивна imitation научаване като човек обратна дадена intermittently по време robot разполагане, позволяваща един онлайн подобрение на поведението; семейство е широк и никой арангиране на то работи без един число per ход. Вижте и SO-100 imitation научаване ръководство за база датасет вие смес срещу, разиграване един policy за inference страна, и DAgger loop страница за внедрена pipeline.

Е intervention ставка един един минус успех ставка?

Не. The ставка мерки колко много един ход вие взе над; успех ставка мерки дали задачата получи направи без вие. Един ход може успей със един 30 процента intervention ставка, и един ход със никой interventions може неуспех извън. Те и различи на шум: ставка движи гладко над хиляди корелирани frames, успех ставка скоци между един handful на двоични резултати. Логиране и двете.

Колко многу evaluation trials направи аз нуждам за успех ставка да означава нещо?

Повече от чувства разумна. Под нормален approximation, 20 trials при един истински 60 процента успех ставка носи един standard грешка около 11 процента точка, така че един 10-point движение между ходове е неразличима от шум; 50 trials носи че фигура да грубо 7. Ако вие не може позволе 50, запазване trial брой идентични през ходове и третира малко движения като неубедена.

Какво смесване съотношение на демонстрации до corrections трябва аз начало със?

Документирана начална точка е IWR: разделен данни в intervention и non-intervention samples и издърпана тях в равна пропорция, така че corrections придружават половина на градиент как малка един фракция на frames те са. Ако твоя setup не може тежест вземане, approximation то през episode брой когато съставяне датасет и запазване съотношение. Обучаване на corrections един е опция да отличи.

Мой intervention ставка отиде нагоре след един ход. Е ход загубена?

Не обяснително, но проверете един скучни обяснения първи: направи checkpoint вие управлявал съвпада един вие обучена, направи един камера индекс или един монтаж промени, направи обект място дрейфа, беше correction стил последователна. Ако всички четири са чисти и paired успех ставка и паднал, подозирайте смесване - твърде малко база демонстрации срещу corrections или corrections което противоречат един друг. Един истински регресия принадлежи в логиране, не един отказ.

Може аз пропуск фиксиран evaluation протокол и един един погледнете intervention ставка?

Един ако вие приемете че вие не може казват подобрение от habituation. The ставка зависи на твоя собствено реално време праг за стъпа в, и че праг падне както вие получава използван да policy причудите. Един замразена протокол е част на измерване твоя праг не може достига - taped маркира, един написан начало поза, един фиксирана trial брой, един критерий решена преди ход. То има да остая неизменна през серия.

Запазете логиране в repository, не в един тетрадка: ходове са дни разделени, hardware получава pré-built, и лице четене крива в октомври е вие със никой памет на август. The документация FAQ покрива оперативни детайли оставени извън тук.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started