
Рівень втручання - кадри втручання поділені на кадри запуску - це найдешевший чесний сигнал прогресу, який має цикл DAgger керований людиною. Ця стаття визначає його так, щоб дві люди обчислили одне й те саме значення, показує, як його логувати, і розбирає чотири способи, якими він вас вводить в оман: привичка оператора, дрейфуюча установка оцінювання, навчання лише на виправленнях і людина, яка виправляє по-іншому у вівторок, ніж у понеділок.
Раунд DAgger почувається продуктивним, поки ви в ньому. Ви керуєте політикою, перебираєте, коли вона збивається при хваті, зберігаєте виправлення, перенавчаєте, і наступний запуск виглядає - ви б присягнули - трохи плавніше. Два раунди пізніше ви не можете сказати, чи щось змінилось, тому що "трохи плавніше" - це не величина.
Цикл потребує одне число на раунд, а в циклі керованому людиною це число майже безкоштовне: частка запуску, під час якої ви мали контроль замість політики. Ця стаття визначає його так, щоб дві люди обчислили одне й те саме значення, логує його, читає результуючу криву та називає чотири способи, якими він вас вводить в оман, коли він стоїть окремо. Для теорії цього твору див. пояснювач DAgger та варіант керований людиною; практичний аналог є запуск цикла DAgger на SO-100.
Коротка версія
- •Рівень втручання = кадри втручання / кадри запуску. Кадри, не епізоди, і знаменник включає кадри, які ви витратили на виправлення.
- •Плоска крива протягом трьох раундів означає, що раунди не дають нічого - замість цього змініть суміш, контрольну точку чи завдання.
- •Падаючий рівень втручання - це не зростаючий рівень успіху. Ваш поріг втручання знижується в міру зростання довіри.
- •Без зафіксованого протоколу оцінювання - однакові стартові позиції, об'єкти, камери, кількість випробувань - ви вимірюєте кімнату.
- •Навчання лише на виправленнях перекошує розподіл стану. Відповідь IWR: проводьте проби втручання та невтручання в рівних пропорціях.
Чому раунд потребує числа взагалі
DAgger існує через проблему розподілу, а проблеми розподілу невидимі для ока. Росс і Бальнелл показали, що навчання наслідування на фіксованому наборі демонстрацій веде до накопичення помилок і обмеження жалю, що зростає квадратично з часовою горизонтом: як тільки учень залишає стани, які відвідував демонстратор, ніщо в даних не скаже йому, як повернутись. DAgger виправляє це ітерацією - запустіть політику, позначте стани, які вона відвідує, агрегуйте, перенавчайте - яку Росс, Гордон і Бальнелл обрамляють як редукцію до навчання без жалю онлайн.
Цей каркас має наслідок, який люди пропускають. Гарантія стосується послідовності політик над ітераціями, а не будь-якого окремого запуску. Він нічого не говорить про те, чи ваш раунд три допоміг. Єдиний спосіб дізнатися - виміряти кожну ітерацію. Келлі та колеги запровадили HG-DAgger тому, що класичний DAgger просить експерта про позначки дій, тоді як новачок все ще керує, що папір стверджує, може зменшити безпеку і, з людськими експертами, ймовірно, погіршить якість позначки через сприйняту затримку виконавця. HG-DAgger також навчається порогу безпеки для метрики ризику на основі невизначеності моделі та повідомляє про покращену продуктивність як над DAgger, так і над поведінковим клонуванням на задачі водіння. Він не публікує лічильники втручання; ви створюєте їх самостійно.
Визначення ставки так, щоб дві люди отримали одне число
Визначення - це один рядок: кадри втручання поділені на кадри запуску. Все складне приховується в тому, що рахується кадром і що рахується запуском.
Кадри, не епізоди
Підрахунок епізодів з принаймні одним втручанням непотрібний: десять епізодів з одним поштовхом кожен і десять, в яких ви керували вісімдесятьма відсотками, обидва дають "10/10". Кількість кадрів розділяє їх, і це гранулярність, яку запис уже має - у форматі набору даних LeRobot кожен часовий крок - це рядок, тому прапор втручання - це один логічний стовпець поруч з станом та дією. Тут він записується за кадр, коли починається перехоплення, і очищається, коли контроль повертається.
Знаменник включає виправлення
Два знаменники можна захистити - загальна кількість кадрів запуску або кадри, які політика керувала автономно - і вони сильно розходяться при високих рівнях втручання. Перехопліть 400 з 1000 кадрів і перший дає 40 відсотків, другий 67 відсотків. Порівняння одного раунду, вимірюваного першим способом, проти наступного, вимірюваного другим способом, - це як справжнє покращення зникає. Беріть загальні кадри й ніколи не переглядайте вибір в середині серії.
Одного разу вирішіть, що трапляється з кадрами передачі
Завжди є шов. Коли контроль передається, деякі кадри належать жодній стороні: рука утримується, лідер вирівнюється, запис заморожений. У цьому конвеєрі ці кадри передачі залишаються в потоці сировини й ніколи не входять до підібраного епізоду - вони ні поведінка політики, ні виправлення, вартісне навчання. Рахуйте шов однаково кожен раунд: при 30 Гц шість перехоплень з двосекундним швом кожен - це 360 кадрів, достатньо, щоб змінити відсоткову точку.
Кадри або епізоди; загальний запуск або тільки автономний; кадри передачі в або вне. Будь-яке з трьох змінилось тихо між раундами робить криву змістовною. Запишіть усі три.
Логування його так, щоб число пережило сеанс
Метрика на панелі стану запущеного процесу - це показ: вона зникає при перезавантаженні й не може бути побудована. Один рядок, що додається один раз за запуск, охоплює всю серію - включаючи яку контрольну точку ви керували, оскільки вона змінюється кожен раунд і змішування їх робить недійсним те, що слідує.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Два поля несуть вагу. train_mix - це те, що ви вбудували в наступне завдання навчання; без нього нічого не можна приписати. eval_protocol називає фіксований тест, який ви запустили пізніше, і це поле найчастіше залишається порожнім. У cockpit ay-robots стан перехоплення повідомляє кількість кадрів втручання для поточного сеансу, тому логування - це переписування, а не інструментування; документація набору даних охоплює, де приходять стовпці за кадр.

Читання кривої: три раунди, один вердикт
Три раунди - це мінімум для читання, оскільки дві точки завжди є лінією. Таблиця нижче - це шаблон бухгалтерського обліку із числами-заповнювачами, а не вимірюваннями з будь-якого запуску. Ви шукаєте монотонне зменшення, пов'язане зі збільшенням успіху на фіксованому тесті.
| Раунд | Контрольна точка керована | Кадри | Кадри втручання | Ставка | Успіхи (з 20) |
|---|---|---|---|---|---|
| 0 (базовий) | базова політика | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | зі суміші раунду 0 | 5 610 | 980 | 17,5 % | 10 |
| 2 | зі суміші раунду 1 | 5 412 | 611 | 11,3 % | 11 |
| 3 | зі суміші раунду 2 | 5 380 | 598 | 11,1 % | 12 |
Раунди один і два працюють. Раунд три - ні: 11,3 проти 11,1 відсотка знаходиться в межах коливання запуску на запуск чого-небудь, вимірюваного на фізичному руці, і четвертий раунд тих же виправлень витрачає вечір зарано. Плоский сегмент говорить щось змінити структурно.
- Залишкові збої не коригуються телеоперуванням - об'єкт поза досяжністю, геометрія захоплювача, суглоб на його межі. Ніякі дані про виправлення не усунуть кінематичну стіну.
- Виправлення занадто мало проти базового набору даних, щоб зрушити градієнт, і нічого їх не зважує.
- Виправлення суперечать одне одному, тому політика усереднює дві стратегії й приземляється між ними.
- Невдача - це вище за течією: камера рухнулась, освітлення змінилось, вид запястя більше не відповідає навчанню.
- Завдання на стелі цього класу політики на цьому обладнанні, і наступний крок - більше базових даних.
Останні два не є невдачами циклу. У Sirius-Fleet знижена потреба в людині - це розроблений результат: у міру покращення автономії робота його предиктори аномалій адаптують свої критерії прогнозування, що призводить до менших запитів на втручання людини та поступово зменшує робоче навантаження людини з часом. Там критерій адаптується навмисне. У ручному циклі ваш адаптується також, тихо - тому ставка, яка вирівнюється, тому що завдання на його стелі, виглядає точно як одна, яка вирівнялась, тому що оператор перестав помічати. Це наступна проблема.
Пастка 1: падаючий рівень втручання - це не зростаючий рівень успіху
Рівень втручання вимірює точно одне: скільки запуску ви вирішили прийняти. Це рішення - ваше, прийняте в реальному часі, і воно рухається. У раунді нуль ви перебираєте при першому поганому куті підходу; до раунду три ви спостерігали, як політика відновилась від дюжини з них і дозволяєте їй спробувати. Ваш поріг рухнувся; політика можливо, ні. Ставка падає так чи інакше.
Людська довіра - це принаймні змодельована величина в літературі, а не передбачувана константа. Sirius перезважує зразки навчання з наближеною людською довірою та оптимізує політику з зважованим поведінковим клонуванням, повідомляючи про 8-відсотковий приріст у симуляції та 27 відсотків на реальному обладнанні над найсучаснішим рівнем у частоті успіху політики, при подвійній швидкості конвергенції. Це трактує довіру як вагу на дані. Це не виправляє поріг у вашій голові між раундом нуль і раундом три.
Ви не можете усунути дрейф, тому спаруйте ставку з чимось, чого ваш поріг не може торкнутися: фіксований набір випробувань, в яких ви взагалі не втручаєтесь, оцінений за критерієм, написаним до раунду. Ставка, яка падає, поки спаровується ставка успіху залишається постійною, - це підпис звички - варто перехопити, тому що ізнутри циклу це відчувається як прогрес.
| Рівень втручання | Рівень успіху на фіксованому протоколі | Найбільш вірогідне читання |
|---|---|---|
| падає | зростає | Раунд сработал. Продовжіть. |
| падає | плоска | Ваш поріг дрейфував, або виправлення видалили зусилля без видалення збоїв. |
| падає | падає | Виправлення деградують політику. Перевірте суміш і їх внутрішню послідовність. |
| плоска | плоска | Раунд не дав нічого. Змініть суміш, контрольну точку чи завдання перед збиранням більше. |
| зростає | падає | Регресія. Підозрюйте суміш навчання, змінену камеру або змішування контрольної точки перед підозрою методу. |
Пастка 2: без фіксованого протоколу ви вимірюєте кімнату
Оцінювання в реальному роботі дороге й важко повторяється. Автори SIMPLER мотивують симульовану оцінювання спостереженням, що оцінювання в реальному світі таких політик не масштабується й стоїть перед проблемами відтворюваності, які ймовірно погіршуватимуться в міру розширення спектру завдань політик. RoboArena атакує це з іншого боку з більш ніж 600 попарними епізодами оцінювання реального робота на сім узагальнених політик, запущених оцінювачами на сімох навчальних установах на платформі DROID. Його оцінювачі вибирають власні завдання та середовища, але повинні судити пари політик у подвійному сліпому тесті; папір повідомляє, що такий краудсорсинг-рейтинг відстежує продуктивність узагальненої політики точніше, ніж звичайна централізована оцінювання.
Ви не запустите 600 парних епізодів на одному SO-100 на майстерні. Що ви можете зробити, - це видалити дисперсію, яку ви контролюєте - список настільки нудний, що він зазвичай пропускається.
| Вимір | Заморозьте це | Що дрейфує, якщо ви цього не зробите |
|---|---|---|
| Стартова поза | Написана домашня позиція, керована перед кожним випробуванням | Траєкторія починається поза розподілом |
| Об'єкти | Позначені позначки та ті самі фізичні об'єкти, зарезервовані для оцінювання | "Краща" політика насправді ближчий об'єкт |
| Камери та світло | Однакові кріплення, індекси, експозиція; жалюзі закриті; сфотографуйте установку | Самі замінені індекси камери можуть домінувати результатом |
| Випробування та правило зупину | Фіксоване n, фіксований час очікування, критерій написаний до раунду | Постфактум критерії перетворюють близькі промахи на те, що ви потребуєте |
| Поведінка оператора | Без втручань під час випробувань оцінювання | Оцінювання стає ще однією сеансом виправлення |
Потім арифметика, безжальна при кількості випробувань, яку майстерня може дозволити собі. За нормальним наближенням, 60-відсотковий успіх протягом 20 випробувань несе стандартну помилку близько 11 відсоткових пунктів - квадратний корінь 0,6 разів 0,4 протягом 20 - і різниця між двома такими раундами несе близько 15. Стрибок з 60 на 70 відсотків тому узгоджується з нічого не трапилось. П'ятдесят випробувань приводять цифру за раунд до приблизно 7 пунктів і коштує вечір.
Ця асиметрія - аргумент для рівня втручання: обчислюється протягом тисяч кадрів замість двадцяти бінарних результатів, він рухається раніше й більш плавно. Застереження полягає в тому, що кадри в епізоді сильно корельовані - один поганий хват дає сто послідовних кадрів втручання - тому ефективний розмір вибірки ближче до кількості перехоплень. Рівень як ранній показник і рівень успіху як повільна земна істина.
Епізоди оцінювання ніколи не повинні входити до складеного набору даних для навчання - інакше раунд n+1 оцінюється на даних, на яких він був навчений, а крива вимірює меморизацію.
Пастка 3: навчання лише на виправленнях згинає політику
Виправлення - це цікаві дані, тому інстинкт - навчатися на них. Не робіть цього. Вони приходять за конструкцією з вузького зрізу простору стану, де політика вже не вдавалась, і кажуть майже нічого про більшість запуску, що працював. Тонко налаштуйте на цей зріз окремо й ви отримаєте політику, хорошу при відновленні від зіпсованого підходу, яка забула, як робити чистий.
Мандлекар та колеги побудували свою систему дистанційного втручання навколо цього. Їх каркас: маніпуляційні завдання містять вузькі місця, які вимагають послідовності точних дій - вставлення капсули в кавоварку - їхній приклад - де невеликі відхилення приводять до станів, які демонстрації ніколи не охоплювали. Їхний алгоритм навчається ітеративно на нових даних, щоб політика навчилась проходити через ці вузькі місця, і вони повідомляють, що агенти, навчені на даних втручання, бивають агентів, навчених на еквівалентній кількості зразків від невтручаючих демонстраторів.
- Швидко: короткий запуск на декількох десятків епізодів дешево повторюється
- Орієнтовано: градієнт домінується станами, які ви дбаєте про
- Дешево для тестування, чи стиль виправлення взагалі навчається
- Розподіл тонко налаштованого більше не нагадує розподіл завдання
- Номінальна поведінка може погіршитися помітно в межах одного раунду
- Ставка може падати, поки успіх падає з нею - чисті сегменти торгуються на відновлення
Коефіцієнт змішування - це гіперпараметр і заслуговує на те, щоб бути записаним. Складання наступного набору даних - це де вона вирішується: оригінальні демонстрації плюс набір виправлень, вибір епізоду явно за джерелом, а не правило, яке тихо витягує все, що доступне. Тут це один крок складу в cockpit, і результат - звичайний набір даних - див. документацію навчання. Що жоден інструмент не робить для вас - це запис, який коефіцієнт виробив яку криву.
Пастка 4: людина не послідовний експерт
Теорія DAgger припускає експерта. Ви не один у технічному сенсі: ваші виправлення - це не зразки з фіксованого умовного розподілу над діями. Автори ACT називають це при перерахуванні перешкод точній маніпуляції - помилки накопичуються з часом, і людські демонстрації можуть бути нестаціонарними. Їхня система все ще досягає 80-90 відсотків успіху на шести справжніх завданнях із десяти хвилин демонстрацій, тому проблема розв'язна, а не відсутня.
Дослідження robomimic робить це з боку даних. На шести офлайн-алгоритмах на п'яти симульованих та трьох реальних багатоетапних завданнях його уроки включають чутливість до вибору дизайну, залежність від якості демонстрацій та - той, який найбільше ранить тут - мінливість через критерії зупину, оскільки цілі навчання та оцінювання відрізняються. Контрольна точка з найменшою втратою не надійно та з найвищою швидкістю успіху.
Є апаратна версія цього: режим введення формує виправлення. лідер-послідовник установка створює безперервні, керовані людиною траєкторії. Клавіатурні поштовхи затиснуті твердо сервером - два градуса за виклик на суглобах рук, чотири на захоплювачі - тому та ж намір приходить як сходи дрібних кроків. Повзунки відправляють абсолютні цілі й сервер рухається максимум шість градусів до них за виклик. Три режими, три розподіли дій; змішування всіх трьох в один набір виправлень і потім цікавитися, чому підхід став дергучим, - це самопричинене. документація телеоперування охоплює те, що кожен режим відправляє.
Зважування втручань: IWR і що було потім
Якщо виправлення - це цінна меншість, принцип виправлення - вага замість виключності. Intervention Weighted Regression - це еталонна реалізація: дані розділяються на проби втручання та невтручання, й обидва розділи беруться у рівних пропорціях під час навчання. Набір виправлень, який становить п'ять відсотків кадрів, тоді сприяє половині градієнту, без того щоб номінальна поведінка зникла з розподілу.
Рівна пропорція - це стартова точка, не закон. Sirius узагальнює її, замінюючи бінарний розділ безперервною вагою з наближеною людською довірою; Sirius-Fleet рухає рішення вище за течією, використовуючи візуальну світову модель та предиктори аномалій, щоб вирішити, коли людина запитується взагалі. Спільна нитка: прапор втручання - це сигнал навчання, не просто стовпець бухгалтерського обліку.
| Метод | Хто вирішує, коли людина діє | Як використовуються дані втручання | Повідомлений результат |
|---|---|---|---|
| DAgger (2011) | Фіксований розклад; експерт позначає відвідані стани | Один зростаючий набір даних, незважений | Сформульований як редукція до навчання без жалю онлайн |
| HG-DAgger (2019) | Людина, керуючи контролем на реальній системі | Агрегований; плюс навичка поріг безпеки щодо невизначеності моделі | Краще, ніж DAgger та BC при водінні; лічильники втручання не наведені |
| IWR (2020) | Людина, через дистанційне телеоперування | Проби втручання та невтручання беруться у рівних пропорціях | Переважує невтручаючі демонстрації з рівною кількістю проб |
| Sirius (2022) | Людина, під час розгортання | Зважене BC, ваги з наближеної людської довіри | 8 % приріст у симуляції, 27 % на реальному обладнанні; конвергенція в 2x швидша |
| ThriftyDAgger (2021) | Система, керуючи на новизні та ризику | Інтерактивна збірка під бюджетом нагляду | Дослідження користувача (N=10): на 58 % вища продуктивність людини та на 80 % вища продуктивність робота, ніж наступний найкращий метод |
| Fleet-DAgger (2022) | Система, виділяючи увагу на протягом флоту | Навчання флоту оцінено за Return on Human Effort | До 8,8x вищий ROHE, ніж базові лінії |
| Sirius-Fleet (2024) | Предиктори аномалій з самоадаптивними критеріями | Багатозадачне навчання з візуальною світовою моделлю | Менше запитів втручання в міру покращення автономії |

Чотири метрики, вартісні логування поруч зі ставкою
- Перехоплення за запуск. Двадцять коротких виправлень та один довгий дають подібні ставки й описують різні політики - одна дерганута, одна з однією глухою пляттю.
- Середня довжина втручання. Зростаюча довжина зі спадною кількістю означає, що залишкові збої - це важкі, що це виглядає як пізній прогрес.
- Час до першого втручання. Політика, яка йде далі перед потребою в допомозі, удосконалюється, навіть коли загальна ставка плоска.
- Де скупчуються втручання. Bin прапор за нормалізованим прогресом епізоду; стабільний пік на раундах вказує на одне вузьке місце.
Протокол раунду, який ви можете насправді запустити
Виміряний раунд має шість кроків і створює один рядок в журналі. Перші чотири - це цикл; останні два роблять його вимірюванням.
- 1Заморозьте протокол оцінювання перед раундом нуль
Запишіть стартову позу, розміщення об'єкта, камери, кількість випробувань, час очікування та критерій успіху. Сфотографуйте стіл. Якщо документ потребує змін, серія перезавантажується.
- 2Виміряйте базовий рівень
Запустіть протокол без втручань і записуйте успіхи; потім запустіть один інструментований сеанс зі ввімкненим перехоплюванням і записуйте ставку. Ці два числа - раунд нуль.
- 3Збирайте виправлення в один послідовний стиль
Один режим введення за раунд, один оператор, якщо ви можете це керувати. Перебирайте за критерієм, який ви можете озвучити - 'захоплювач більше ніж на два сантиметри від підходу' - і утримуйте його за раунд.
- 4Сортуйте кожен епізод того ж дня
Виправлення, оцінювання або скидання. Неясні епізоди скидаються, не зберігаються на теорії, що більше даних допомагає - виправлення, в якому ви самі спотикнулись, гірше, ніж не епізод.
- 5Склади суміш явно
Оригінальні демонстрації плюс виправлення, вибір епізоду за джерелом. Запис основної кількості, кількості виправлень та будь-якого зважування - це поле, яке ви бажатимете через три тижні.
- 6Продовжуйте з контрольної точки, потім перевимірюйте
Навчайте складеному набору даних від попередньої контрольної точки, а не базовою моделлю, запустіть зафіксований протокол плюс один інструментований сеанс, додайте рядок і порівняйте проти попередніх двох раундів.
Два обмеження змінюють, як ви читаєте слабкий раунд. Продовження з контрольної точки ініціалізує ваги з неї - не резюме оптимізатора, тому розклад починається свіжий і короткий запуск з конвергованої контрольної точки может рухнути дуже мало. І лідер-вирівнювальний рух на початку перехоплення має найменше пробігу на реальному обладнанні чого-небудь в ланцюзі; якщо виправлення все починаються з одного дивного перехідного, шукайте там перед обвинуванням суміші.
Виміряний цикл, вже електрифіцований
ay-robots реалізує ці шість кроків як функції продукту: перехопліть посередині запуску від лідера, клавіатури або повзунків, з автоматично позначеними кадрами втручання; сортуйте кожен епізод як виправлення, оцінювання або скидання; складіть наступний набір даних з оригінальних демонстрацій плюс виправлення, вибір епізоду явно за джерелом; та запустіть наступне завдання навчання з попередньої контрольної точки замість базової моделі.
Див., як працює цикл DAggerЩо числа не можуть вам розповісти
Нічого з цього не вирішено, і охайна крива не повинна вас переконати протилежне. Рівень втручання вимірює спільну систему - політику, обладнання, оператора, кімнату - і нічого не приписує самостійно. Він не може судити, чи були виправлення хорошими, і він щасливо падатиме на завдання, яке стало легшим, тому що об'єкт дрейфував на два сантиметри ближче протягом трьох тижнів.
Що він робить, - це перетворює невизначене враження на стовпець, з яким ви можете сперечатися. Альтернатива - не краща метрика; це три тижні збиранння виправлень, крива яких би вам розповіла, після раунду три, скинути. Бібліографія визначає інтерактивне навчання наслідування як людський зворотний зв'язок, виданий перебійно під час виконання робота, дозволяючи онлайн покращення поведінки; сім'я широка й жодна упорядкованість не працює без числа на раунд. Див. також керівництво навчання наслідування SO-100 для базового набору даних, який ви змішуєте проти, запуск політики для сторони висновку та сторінка циклу DAgger для реалізованого конвеєру.
Чи рівень втручання - це просто один мінус рівень успіху?▾
Ні. Ставка вимірює, скільки запуску ви перехопили; рівень успіху вимірює, чи завдання було виконано без вас. Запуск може успішним при 30-відсотковому рівні втручання, а запуск без втручання може повністю не пройтись. Вони також відрізняються в шумі: ставка рухається плавно протягом тисяч корельованих кадрів, рівень успіху стрибає між кількома бінарними результатами. Логуйте обидва.
Скільки спроб оцінювання мені потрібно, щоб рівень успіху щось означав?▾
Більше, ніж здається розумним. За нормальним наближенням, 20 випробувань при справжньому 60-відсотковому рівні успіху несе стандартну помилку близько 11 відсоткових пунктів, тому 10-точковий рух між раундами неможна розрізнити від шуму; 50 випробувань приводять цифру до приблизно 7. Якщо ви не можете дозволити собі 50, тримайте кількість спроб однаковою на раундах й розглядайте малі рухи як невизначені.
Який коефіцієнт змішування демонстрацій до виправлень я повинен почати?▾
Задокументована стартова точка - IWR: розділіть дані на проби втручання та невтручання й беріть їх у рівних пропорціях, тому виправлення сприяють половині градієнту, якою б малою часткою кадрів вони не були. Якщо ваша установка не може зважувати вибірку, наблизьте її через кількості епізодів при складанні набору даних й записуйте коефіцієнт. Навчання на одних виправленнях - це варіант, який потрібно виключити.
Мій рівень втручання виріс після раунду. Раунд витрачено?▾
Не обов'язково, але спочатку перевірте нудні пояснення: чи контрольна точка, яку ви керували, відповідала тій, яку ви навчали, чи камери індекс або монтаж змінився, чи розміщення об'єкта дрейфувало, чи стиль виправлення був послідовним. Якщо все чотири чисті й спарована ставка успіху також впала, підозрюйте суміш - занадто мало базових демонстрацій проти виправлень або виправлення, які суперечать одне одному. Справжня регресія належить до журналу, не в смітник.
Чи можу я пропустити зафіксований протокол оцінювання й просто спостерігати рівень втручання?▾
Тільки якщо ви приймаєте, що не можете розрізнити покращення від звички. Ставка залежить від вашого власного порогу в реальному часі для втручання й цей поріг падає, коли ви звикаєте до химерних риб політики. Зафіксований протокол - це частина виміру, якої ваш поріг не може досягнути - позначені позначки, написана домашня поза, фіксована кількість спроб, критерій вирішений до раунду. Він має залишатися незмінним на протягом серії.
Тримайте журнал в репозиторії, не в записнику: раунди розділені днями, обладнання перебудовується, й людина, яка читає криву в жовтні - це ви без пам'яті серпня. FAQ документації охоплює операційні деталі, залишені тут.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started