
Простий DAgger просить людину позначити стани, поки робот все ще їде. На реальній апаратурі це небезпечно і дає погані позначки. Керовані варіанти замінюють сліпу розмітку на шлюз, який має утримувати хтось: людина в HG-DAgger, класифікатор безпеки в SafeDAgger, розбіжність ансамблю в EnsembleDAgger, кошторисна оцінка новизни та ризику в ThriftyDAgger. У цій статті порівнюються варіанти за тим, хто керує шлюзом, який сигнал його відкриває та що це коштує кожному — і чому форма з керуванням людини та єдина, яка витримує контакт з реальною рукою.
Клонована політика відмовляє там, де закінчився її навчальний набір. Виправлення полягає в постійному збиранні даних під власним розподілом станів політики замість розподілу демонстратора, що робить DAgger і що вступ до агрегації набору даних охоплює з перших принципів. Залишається невирішеною незручна частина оригінального алгоритму: поки той, що навчається, їде, експерт має сказати, що він би зробив, для кожного стану, не маючи керування.
У симуляторі з написаним експертом це безплатно. На столі з реальною рукою це ні безплатно, ні безпечно. Автори HG-DAgger точно формулюють заперечення: такі схеми вибірки "потребують, щоб експерт надавав позначки дій без повного керування системою", що "може зменшити безпеку і, при використанні людей як експертів, ймовірно знизить якість зібраних позначок через сприйняте запізнення виконавців" (Kelly et al., 2019). У цьому реченні криються два невдачі: політика продовжує їхати в стани, на які ніхто не хоче, і позначки, куплені за цей ризик, гірше, ніж ті, що виробляє людина, тримаючи керування. Кожен варіант нижче відповідає на одне запитання — поставити шлюз на керування та дати комусь вирішити, коли його відкрити. Вони відрізняються тим, хто цей хтось.
Коротка версія
- •Керовані варіанти замінюють сліпу розмітку перемикачем між керуванням політики та керуванням експерта. Те, що їх розділяє — хто володіє перемикачем.
- •HG-DAgger передає перемикач людині та агрегує лише дані, записані під час безперервного керування людини.
- •SafeDAgger передає його бінарному класифікатору, який передбачає відхилення від еталонної політики; EnsembleDAgger потребує низької дисперсії ансамблю та малої відстані до дії експерта одночасно.
- •LazyDAgger додає гістерезис, щоб керування не коливалось; ThriftyDAgger керує новизною або розрахованим ризиком під явним бюджетом втручання.
- •Керовані роботом сигнали потребують чогось, чого в тонко налаштованому VLA на розважальній руці зазвичай немає: еталонної політики, дешевого ансамблю або відкаліброваної епістемічної невизначеності.
- •Шлюз — половина методу. Те, що відбувається з сегментами втручання потім — змішування, вирівнювання, агрегація — визначає, чи покращив раунд щось.
Керовані людиною та керовані роботом: розділення, яке має значення
Інтерактивне навчання підробляння має власне дослідження; Celemin та колеги каталогізують його за типом зворотного зв'язку, інтерфейсом, моделлю навчання, користувацьким досвідом, застосуванням та контрольною точкою. Розмежування, яке вирішує вашу інженерію, простіше за будь-яку з цих осей, і недавні роботи називають його прямо: метод керований людиною коли керівник вирішує, коли втручатися, та керований роботом коли агент вирішує, коли попросити допомогу (Cai et al., 2025). Все інше — це механіка, яка служить одному з цих двох виборів. Обмін видно з самого початку: людський шлюз коштує постійної уваги, а робочий шлюз обіцяє повернути цю увагу — але лише якщо сигнал, на якому він грунтується, заслуговує довіри, а побудова цього сигналу — це власне дослідницька проблема.
SafeDAgger: класифікатор, який передбачає власне відхилення
SafeDAgger Zhang та Cho (2016) — найраніший з цих шлюзів. Запит еталонної політики — це дорога частина, тому друга мала мережа — політика безпеки — передбачає, чи варто взагалі запитувати. Вона "повертає бінарну позначку, що вказує, чи основна політика ймовірно відхилиться від еталонної політики без запиту її". Позначка визначається щодо квадратичного відхилення L2 між діями двох політик із порогом tau, і класифікатор встановлюється з бінарною перехресною ентропією. Під час роботи він вирішує для кожного стану, чи той, що навчається, продовжує їхати, або еталон переймає керування. Анотація повідомляє про менше запитів еталону в симуляторі гонянь на машинах плюс прискорення збіжності, яке автори приписують автоматизованому ефекту навчального плану, без наведення цифр для будь-якого.
Підвох полягає в визначенні, не в результатах. Навчання класифікатора потребує дії еталонної політики на кожному стані, який використовується для його встановлення, що припускає, що еталон — це інша програма. Якщо ваш еталон — людина з керуючою рукою, цей набір позначок не дешевий, і метод втрачає властивість, для якої він був розроблений.
EnsembleDAgger: сумнів та розбіжність, обидва
Menda, Driggs-Campbell та Kochenderfer (2019) трактують шлюз як ймовірнісне запитання. EnsembleDAgger "апроксимує Гаусів процес за допомогою ансамблю нейронних мереж" і читає дисперсію ансамблю як проксі довіри: висока дисперсія означає область, на відміну від навчальних даних, що — припускаючи, що експерт уникає станів відмови — корелює з близькістю до відмови. Правило є кон'юнкцією. Той, що навчається, може діяти лише коли відстань L2 між його середньою дією та дією експерта залишається нижче одного порога (розбіжність) та дисперсія його передбаченої дії залишається нижче другої (сумнів). Якщо будь-яка не вдається, експерт переймає керування. Мета — максимізувати частку дій того, що навчається, обмежуючи ймовірність відмови; стаття повідомляє про покращену безпеку та навчання проти інших варіантів DAgger на інвертованому маятнику та MuJoCo HalfCheetah.
Це тихо дискваліфікує повне правило для керування на відстані. Відстань між дією того, що навчається, та дією експерта потребує дії експерта в цьому стані, в цей момент. З написаним експертом, добре. З людиною людина повинна постійно виробляти дії — це точно тяжар, який були призначені видалити керовані варіанти. Термін сумніву окремо керується на відстані; кон'юнкція — ні.
LazyDAgger: зупинити коливання перемикача
Hoque та колеги (2021) атакували вартість, яку не вимірювали ранні роботи: сам перемикач. Кожне втручання "перериває іншу роботу, яку робить людина, спричиняє затримку з кожним переходом контексту між керуванням керівника та автономним керуванням, і вимагає часу на виконання". Шлюз, який відкривається і закривається десять разів на хвилину, гірше, ніж той, що відкривається один раз на десять секунд, при однаковій частці автономності. LazyDAgger розширює SafeDAgger асиметричними порогами — складніше увійти в керування керівника, ніж залишатися в ньому — тому система не коливається на кордоні. У симуляції він "може зменшити переходи контексту в середньому на 60% порівняно з SafeDAgger на 3 завданнях безперервного керування, зберігаючи продуктивність політики найсучаснішого рівня"; у маніпуляції тканиною з ABB YuMi він "зменшує переходи контексту на 60%, досягаючи на 60% вищого рівня успіху, ніж SafeDAgger під час виконання".
ThriftyDAgger: новизна або ризик, під бюджетом
ThriftyDAgger (Hoque et al., CoRL 2021) починається з бюджету керівника, а не політики. Він "використовує навчену політику перемикання для запиту втручань лише в станах, які достатньо (1) нові, де політика робота не має еталонної поведінки для наслідування, або (2) ризиковані, де робот має низьку впевненість у завершенні завдання", з новою метрикою для оцінки цього ризику. Бюджет — вхідне, не вихідне: ви вказуєте, скільки часу люди витратять. Застосовується під час виконання метод "досягає 100% рівня успіху як на симуляції, так і на фізичних завданнях", і дослідження користувачів з десятьма учасниками, які контролюють флот з трьох роботів поруч з завданням концентрації, повідомляють, що він "збільшує продуктивність людини та робота на 58% та 80% відповідно в порівнянні з наступним найкращим алгоритмом, зменшуючи навантаження на керівника". Налаштування флоту — природна домівка для цієї роботи; Fleet-DAgger пізніше формалізував інтерактивне навчання флоту з кількома роботами та керівниками, пропонуючи Return on Human Effort як кількість для оптимізації.
HG-DAgger: людина тримає шлюз
Kelly et al. (2019) йдуть іншим шляхом. Немає політики перемикання. Той, що навчається, розгортається "поки експерт не спостерігає, що новачок увійшов в небезпечну область простору станів", після чого експерт переймає керування та веде систему назад. Правило агрегації — сувора частина: "Позначки дій експерта збираються та додаються до набору даних лише під час цих траєкторій відновлення, під час яких людський експерт має безперервне керування системою." Ніщо не позначається, поки людина є глядачем.
Це не зупиняється на перемикачі. HG-DAgger також "вивчає поріг безпеки для метрики ризику на основі невизначеності моделі, яка може використовуватися для передбачення продуктивності повністю натренованого новачка в різних областях простору станів": він записує, наскільки невпевнено виглядав той, що навчається, в моменти втручання людини, та усереднює останню чверть цих записів, де той, що навчається, найбільше нагадує свою остаточну форму. Це не шлюз, який керує робот, а діагностика, яка говорить вам, де очікується, що остаточна політика буде дотримуватися. Оцінка охоплює симульовану та реальну задачу керування та повідомляє про покращену продуктивність порівняно з DAgger та наслідуванням поведінки.
Одна пов'язана лінія змінює те, що вважається позначкою. Expert Intervention Learning Spencer та колег стверджує, що "будь-яка кількість експертного зворотного зв'язку, чи то через втручання, чи через невтручання, надає інформацію про якість поточного стану, оптимальність дії чи обоє", формалізована як обмеження на функцію цінності того, що навчається, і розв'язана за допомогою онлайн-навчання без жалю. За цим прочитанням ділянки, де людина спостерігала і нічого не робила, — це слабкий позитивний доказ, а не порожнечина. EIL вивчає уникнення зіткнення приблизно за одну хвилину експертного керування.

Варіанти поруч
| Метод | Хто відкриває шлюз | Сигнал | Потребує доступ | Повідомлено |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Ніхто — той, що навчається, завжди їде | Жоден; експерт позначає кожен відвідуваний стан | Експерт, здатний позначити позаполітичні стани, не маючи керування | Зменшення без жалю з гарантіями під розподілом станів того, що навчається |
| HG-DAgger (Kelly et al., 2019) | Людський керівник | Судження керівника про те, що стан небезпечний | Хтось спостерігає, і чисте передавання керування | Перемагає DAgger та наслідування поведінки на симульованій та реальній задачі керування; також вивчає поріг ризику |
| SafeDAgger (Zhang & Cho, 2016) | Робот | Бінарний класифікатор для відхилення L2 від еталону вище tau | Доступна для запиту еталонна політика для позначок класифікатора | Менше запитів еталону в симуляторі гонянь, швидша збіжність (цифра не надана) |
| EnsembleDAgger (Menda et al., 2019) | Робот | Дисперсія ансамблю та відстань до дії експерта, обидва під порогом | Ансамбль мереж плюс дія експерта на кожному кроці | Покращена безпека та навчання на маятнику та HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Робот, з гістерезисом | Сигнал SafeDAgger з окремими порогами входу та виходу | Те, що потребує SafeDAgger, плюс другий поріг для налаштування | ~60% менше переходів контексту на 3 завданнях; 60% вищий успіх на тканині YuMi |
| ThriftyDAgger (Hoque et al., 2021) | Робот, під бюджетом | Новизна або розрахований ризик невиконання завдання | Навчений оцінювач ризику та зазначений бюджет втручання | 100% успіху під час виконання; дослідження користувачів (N=10): 58% та 80% виграшу порівняно з наступним найкращим |
| EIL (Spencer et al., 2020) | Людина — невтручання теж рахується | Втручання та його відсутність як обмеження на функцію цінності | Онлайн-навчання без жалю над обмеженням цінності | Уникнення зіткнення приблизно з однієї хвилини експертного керування |
Що купує кожен шлюз і що він коштує
Прочитайте вниз за колонкою "потреб" і виявиться закономірність: кожен керований роботом сигнал там — це проксі, який потрібно виробити, і кожен проксі має свою рахунок.
- Сигнали розбіжності (SafeDAgger, LazyDAgger, половина правила EnsembleDAgger) потребують еталонної політики. Або у вас є написаний експерт, у якому випадку цікава проблема вже вирішена, або людина продовжує виробляти дії у фоні, щоб можна було обчислити відстань.
- Сигнали сумніву потребують відкаліброваної епістемічної невизначеності. Ансамбль малих мереж керування наближається до неї; ансамбль моделі vision-language-action з трьома мільярдами параметрів — це насамперед проблема пам'яті та затримки.
- Сигнали новизни та ризику потребують навченого оцінювача завершення завдання, встановленого на достатній кількості успішних та невдалих розгортань. Щодо завдання, над яким ви все ще працюєте, ці дані не існують у першому раунді.
- Людський шлюз потребує уваги та нічого більше — єдиний доступний сигнал у першій день, у будь-якій архітектурі політики, без додаткової моделі для навчання.
- Жоден робочий шлюз не видаляє людину з кімнати. Вони зменшують, як часто людина повинна діяти, а не то, чи повинна вона присутствувати.
Є тихіша відмінність в тому, що виробляє шлюз. Робочий шлюз, який спрацьовує посередині траєкторії, дає людині рухому руку в довільній позі. Людський шлюз дозволяє оператору вибрати момент — після досягнення, перед захватом, а не посередині поштовху. Сегменти відновлення від обох не однаково чисті, і ці сегменти — це весь продукт раунду.
Чому форма, керована людиною, перемагає на реальній апаратурі
Це інженерний аргумент, а не результат контрольної точки — жодна робота, яку ми знайшли, не запускає всі п'ять шлюзів на одному маніпуляторі з тією ж класою політики. Він спирається на чотири пункти.
По-перше, керівник все одно там. Ніхто не залишає SO-100 arm запущеним без нагляду поруч з предметами, які він може збити. Як тільки хтось спостерігає, граничної вартості надання їм кнопки перехоплення близько нуля; побудова відкаліброваного оцінювача ризику — це проект.
По-друге, невизначеність, яку ви можете насправді виміряти на сучасній політиці, часто неправильна кількість. Голова дифузії або узгодження потоку виробляє дисперсію на вибіркових чанках дії, і ця дисперсія відображає мультимодальність, яку голова була навчена представляти, а не епістемічне незнання про стан. Термін сумніву EnsembleDAgger використовує ансамбль саме для захоплення останнього. Два виглядають як одне число і не являються; action chunking та flow matching записи охоплюють, як ці голови випускають дії з самого початку.
По-третє, невдачі, які мають значення в маніпуляції, часто семантичні, а не статистично необичайні. Політика, що закриває захват на два сантиметри раніше, або впевнено тягнеться за неправильною з двох однакових кубиків, не в стані з високою дисперсією — вона впевнена і неправильна. Жоден поріг дисперсії це не спіймає; людина, яка спостерігає, одразу це спіймає.
По-четвертіше, якість позначки — оригінальний пункт HG-DAgger, і той, який найчастіше пропускається. Позначки, зібрані, поки людина має безперервне керування, перемагають позначки розповідані над рухомою системою. Якщо мета — коригуючі дані, вартості агрегування, то бремя доказу лежить на автоматизованому шлюзі.
Картина переворачується, коли один керівник відповідає за багато роботів — режим, на який спрямовані дослідження користувачів ThriftyDAgger та формалізація Fleet-DAgger. З флотом людська увага — це дефіцитний ресурс, і неідеальне розподілення краще, ніж жодне. З однією рукою на одному столі ви не в тому режимі.
Цикл, керований людиною, вже підключений
Перехоплення під час роботи сеансу виводу, прапори втручання на кадр на коригованих сегментах, курування кожного запуску в коригування або оцінку, складання змішаного набору даних із вибраних джерел та продовження навчання з існуючої контрольної точки вбудовані, а не написані вручну. Перехоплення працює з керуючою рукою або клавіатурою та повзунками, якщо у вас нема однієї.
Дивіться, як працює цикл DAggerШлюз — половина методу; обробка даних — інша половина
Шлюз вирішує, які кадри керувала людина, а не що з ними робити, і це друге рішення — де раунди найчастіше пропадають. Перше правило — це те, для якого D у DAgger стоїть: агрегація, а не заміна. Тонке налаштування checkpoint чисто на кількасот коригування кадрах дає вам модель, яка бачила майже нічого, крім відновлень, та забула номінальну траєкторію.
Друге правило полягає в тому, що кадри втручання не є звичайними кадрами. Mandlekar та ін. побудували систему дистанційного телеоперування для маніпуляції 6-DoF, що дозволяє операторам контролювати політики та перехоплювати при невдачі, а потім навчались ітеративно за допомогою алгоритму, який "заохочує політику вивчати, як переходити через вузькі місця через втручання"; агенти, навчені на цих даних, перевищили агентів, навчених на рівній кількості звичайних зразків демонстрації. Sirius штовхає ідею в розгортання, "переважуючи навчальні зразки наближеною довірою людини та оптимізуючи політики за допомогою зваженого наслідування поведінки". Обидва потребують маркера на кадр того, що керувалося людиною, саме тому intervention прапор має більше значення, ніж виглядає.
Третє правило полягає в тому, що автоматичне змішування — це пастка. Складений набір даних, чиї джерела ви не можете перерахувати — це той, який ви не можете відлагодити, коли наступний раунд гірше. На цій платформі кроку складення явне з цієї причини — оригінальний набір даних плюс коригування, вибір епізоду на джерело, і результат — звичайний LeRobot dataset який синхронізується та навчається як будь-який інший; dataset documentation охоплює сторону формату.
| Крок у раунді | Що він виробляє | Найпоширеніший спосіб, як це піде не так |
|---|---|---|
| Запустити виведення з включеним записом | Запуск під власним розподілом станів політики | Записано як простий телеопураль, втрачаючи те, що політика керувала |
| Перехопити при невдачі | Сегменти коригування з прапором втручання на кадр | Коригування косметичного коливання, навчання стилю, а не відновлення |
| Курувати кожен епізод | Коригування, оцінка або відкидання | Зберегти все; невдалий перехоп коштує більше, ніж вартість епізоду |
| Синхронізувати коригування | Набір даних з версіями поруч з оригіналом | Коригування, які ніколи не покидають локальну машину |
| Складіть змішаний набір даних | Оригінал плюс коригування, явний вибір | Тиха автозміш, так що пізніший регрес не може бути простежен до джерела |
| Продовжити з контрольної точки | Контрольна точка, ініціалізована від попередньої | Очікування відновлення оптимізатора; ваги ініціалізують модель, вони не відновлюють стан оптимізатора |
Встановлення шлюзу, який людина насправді може утримувати
"Людина вирішує" не є специфікацією. Два оператори з різними порогами створюють непорівнянні раунди, і дрейфуючий поріг створює тенденцію, яку ви не можете прочитати. Напишіть тригери перед першим запуском.
- Назвіть умови, які відкривають шлюз — підхід вимкнено більше, ніж фіксована маржа, захват закривається на нічому, шарнір дрейфує до обмеження, затримка більше, ніж секунду чи дві — та утримуйте список без змін для раунду.
- Назвіть те, що його не відкриває. Перехід політика відновлюється самостійно — це сигнал навчання; перехоплення там видаляє відновлення, яке вона вже знає.
- Перехопіть досить рано для чистого передавання, верніть, як тільки стан можна відновити.
- Запишіть, чому ви перехопили, за епізодом. Три раунди пізніше це єдиний запис того, чи повернеться така ж невдача.
- Утримуйте камери, текст завдання та оператора постійними протягом раундів. Змініть один, і числа перестають бути порівнюваними.
Механічно передавання має два варіанти. З керуючою рукою, керуюча рука повинна досягти поточної позиції послідуючої руки перед передачею крутного моменту, інакше рука стрибає; цей рух вирівнювання — найменше протестований частина ланцюга на реальній апаратурі. Без керуючої руки перехоплення вручну від першого натискання клавіші: послідуюча рука утримується, а оператор підштовхує її шарнір за шарниром з клавіатури або тягне повзунки, з затиском на боці сервера, утримуючи кожен вхід малим — кількох градусів на натискання клавіші, кілька на оновлення повзунка, тому що великий крок в утримуваній позі — це як ви знімаєте сервопривід. Версія крок за кроком з прив'язками клавіш в пішехідний переговір раунду DAgger на SO-100; фон обох режимів телеопураю в документах телеопураю та запис керуючого-послідуючого.

Читання, чи зробив шлюз щось
Метрика раунду, керованого людиною — це рівень втручання: кадри втручання, поділені на кадри запуску. Він має одну роботу — якщо він не падає через раунди, раунд нічого не купив, і наступний повинен змінити щось інше, ніж кількість даних.
Це упереджена метрика, і ви повинні знати як. Вона вимірює поріг оператора настільки ж як компетенцію політики, саме тому список тригерів залишається нерухомим; оператор, який розслабляється протягом сеансу, виробляє кривулю, яка падає, з нічим позаду. Вона також ігнорує серйозність — десять кадрів, щоб зупинити зіткнення, та десять, щоб підштовхнути захват, виглядають однаково. Поєднайте це з фіксованим набором оцінки, з якого ніколи не були вийняті коригуючі дані. Стаття про вимірювання циклу DAgger працює через дизайн оцінки, включаючи те, як утримувати оціночні епізоди поза змішуванням навчання.
- Працює на першій день, у будь-якій архітектурі політики, без додаткової моделі для навчання
- Спіймає впевнені та неправильні невдачи, які жоден поріг дисперсії не виявляє
- Виробляє коригування, записане, поки оператор мав повне керування, у момент, який він вибрав
- Дає маркер на кадр, який методи з вирівнюванням втручання, такі як IWR та Sirius, споживають
- Коштує постійного нагляду; він не масштабується на одну людину та багато роботів
- Залежить від послідовності оператора — дрейфуючий поріг коруктує рівень втручання
- Самостійно не виробляє модель ризику; навчена поріг HG-DAgger та оцінювач ThriftyDAgger — це додаткова машинерія
- Рахує кадри, не наслідки
- Не може врятувати політику, чия невдача вище за течією від керування, таку як переміщена камера або помилково позначена строка завдання
Відкриті запитання варто тримати в поле зору
Контрольні точки слабкі. Spencer та колеги вивчили ті, що використовуються для тестування підходів навчання підробляння, та виявили їх "реалізованими та простими і тому недостатніми для захоплення важчих режимів помилки складання, видягатих у проблемах прийняття рішень у реальному світі" — та, проти навколишньої літератури, знайшли просте наслідування поведінки робило добре на них. Це причина бути скептичним до будь-якого ранжування варіантів DAgger, що залежать від цих завдань, включаючи деякі числа в таблиці вище.
Керовані роботом шлюзи на великих політиках також не вирішені. Робота AIM замінює невизначеність на проксі Q-функцію, яка наслідує правило втручання людини, та повідомляє про 40% поліпшення у вартості перехоплення та ефективності навчання порівняно з ThriftyDAgger — у безперервному та дискретному керуванні, а не на моделі vision-language-action, яка керує маніпулятором. Чи передаватиме будь-яка з цих шлюзів до тонко налаштованої VLA — відкрито. Дослідження висуває пов'язану точку: термінологія та структура поля не уніфіковані в літературі, що ускладнює порівняння методів. На вашій власній руці ваші записи — це доказ, який у вас є.
HG-DAgger дійсно DAgger, якщо людина позначає лише під час втручань?▾
Він зберігає частину, яка має значення — дані, зібрані під розподілом станів, який індукує той, що навчається, агреговані з тим, що було раніше — та відкидає частину, яка не витримує контакту з апаратурою. Kelly et al. представляють це як варіант; гарантія без жалю 2011 року не передається без змін.
Чи можу я використовувати керований роботом шлюз на тонко налаштованій політиці VLA на SO-100?▾
Не прямо. Класифікатор SafeDAgger потребує доступної для запиту еталонної політики, якої у вас немає. EnsembleDAgger потребує ансамблю, який для моделі з мільярдами параметрів означає кілька копій у пам'яті плюс вартість їх виведення. ThriftyDAgger потребує оцінювача ризику, встановленого на успіхи та невдачи, які не існують перед вашими першими раундами.
Як довго повинен бути один перехоп?▾
Достатньо довго, щоб досягти стану, від якого політика може продовжити, і не більше: розширені перехоплення перетворюють запуск на сеанс демонстрації та повнять набір коригування номінальною поведінкою. Знахідка LazyDAgger також різує іншим способом — багато дуже коротких перемикачів — це їх власна вартість.
Чи повинен я навчатися лише на коригованих сегментах?▾
Ні — це найпоширеніший спосіб витратити раунд. Модель, тонко налаштована лише на відновлення, бачила майже нічого, крім відновлень. Змішайте коригування в оригінальний набір даних з явно вибраними джерелами; щоб піти далі, дивіться на підходи з вирівнюванням втручання, такі як IWR або Sirius, які збільшують вагу кадрів, керованих людиною, а не ізолюючи їх.
Що робити, якщо рівень втручання не падає після раунду?▾
Приймайте це в буквальному розумінні: раунд не допоміг. Перед додаванням коригувань перевірте дешевші пояснення — чи дрейфував поріг оператора, були коригування косметичними, чи дійсно складений набір даних містив їх, чи навчання розпочалося з передбачуваної контрольної точки. Раунд, який тихо почався з базової моделі, виглядає точно як раунд, який не навчався.
Чи несе невтручання інформацію?▾
Під Expert Intervention Learning, так: ділянки, де керівник спостерігав та не діяв, читаються як слабкий доказ того, що стан та дія були прийнятними, формалізовані як обмеження на функцію цінності. Більшість практичних конвеєрів, включаючи цей, позначають лише те, що керувала людина.
Для однієї руки на столі вибір зроблений: тримайте шлюз самостійно, напишіть, що його відкриває, та витратьте зусилля на обробку даних позаду, а не на автоматизацію перемикача. Сторона платформи описана на сторінці циклу DAgger, параметри навчання на сімейство політики під навчання та ціни. Для фону почніть з навчання підробляння та навчання підробляння на SO-100; для першого запуску, запустіть вашу першу політику — коротший шлях.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started