Абстрактне рендерування сцени маніпуляції роботом, що ілюструє розподіл стану, який вивчена política відвідує під час виконання
DAggerImitation LearningBehavior CloningRobot LearningТеорія

DAgger пояснено: Чому Behavior Cloning дрейфує та що насправді доводить Dataset Aggregation

AY-Robots ResearchAugust 27, 202615 хв читання

Behavior cloning тренується на розподілі стану експерта та потім розгортається самостійно. Розрив між цими двома розподілами – це причина, чому política, що виглядає добре в валідації, падає зі столу на кроці 300. Це теоретичний розділ нашої серії DAgger: звідки бере початок квадратичний член помилки, що змінює dataset aggregation, що припускає доказ без жалю та яку частину рахунку повинен оплатити людський експерт.

Існує специфічна помилка, з якою зустрічається кожен, хто тренує política маніпуляції рано чи пізно. Política тягнеться до куба, підходить на два сантиметри, коливається, дрейфує в сторону, потім робить щось не пов'язане із завданням. Валідаційна втрата була гарною. Open-loop replay проти ізольованих епізодів був гарним. Проте рука опиняється в позі, яка не з'являється ніде в даних тренування, і звідти їй немає чого розумного сказати.

Ця помилка має назву та усталену теорію. Це перша з чотирьох статей про DAgger, і вона охоплює сам аргумент: чому тренування política на власних траєкторіях демонстратора створює помилку, яка може зростати з квадратом довжини епізоду, що змінює dataset aggregation та що не обіцяє доказ без жалю. Цикл на реальному обладнанні висвітлюється в запуску DAgger цикла на SO-100, варіант керований людиною в HG-DAgger та людське-керовані втручання, та питання вимірювання в вимірюванні DAgger цикла.

Коротка версія

  • Behavior cloning тренується на розподілі стану експерта та оцінюється на власному. Невідповідність накопичується протягом епізоду.
  • Ross та Bagnell показали, що додаткова вартість може зростати як T у квадраті разів помилка на кроці; папір DAgger перефразовує цю межу та зазначає, що вона тісна.
  • DAgger позначає стани, які сама política відвідує, та перетренировує на кожному датасеті, зібраному до цих пір, а не лише на найновішому.
  • Гарантія – це зведення до no-regret online learning: агрегація та перетренування – це Follow-The-Leader.
  • Вона дотримується найкращої втрати, досяжної в класі política, а не щодо нуля – і експерт все ще повинен позначити стани, які він ніколи не мав би виробити.

Припущення, яке поведінка клонування тихо робить

Датасет демонстрації – це купа пар спостереження-дії. Behavior cloning підбирає функцію для цієї купи звичайним навчанням під контролем та припиняється там. Це найстаріша ідея в цій галузі. ALVINN Pomerleau, 1988, був трьохшаровою мережею backpropagation, яка приймала зображення від камери та сканера діапазону та виробляла напрямок, в якому повинен рухатися транспортний засіб; вона тренувалася на змодельованих дорожних зображеннях і слідувала реальним дорогам за деяких польових умов. Рецепт не змінився багато; мережі мають.

Те, що пропускається, – це перевірка того, звідки ці пари взялися. Кожна з них лежить на траєкторії, яку виробив демонстратор. Política, яку ви розгортаєте, виробляє свою власну. З моменту, коли вона відхиляється, вона запитується про стани, які не були в розподілі тренування, і її відповідь рухає її далі. Ross, Gordon та Bagnell відкривають папір DAgger саме з цього: послідовне передбачення порушує припущення i.i.d. під статистичним навчанням, оскільки власні передбачення учня визначають входи, які він бачить далі.

Найчіткіша ілюстрація в цьому папері – це не робот взагалі. Клонування майже оптимального планувальника для Super Mario Bros. створило política, яка постійно застрявала об перешкоду замість того, щоб стрибнути через неї. Причина – це весь аргумент в одному реченні: експерт завжди стрибав із зручної відстані, тому датасет не містив стану, в якому Mario був притиснутий до перешкоди, і тому не було етикетки для того, що робити, коли він був.

Замініть Mario на SO-100 arm і структура ідентична. Ваші демонстрації показують чистий підхід та чистий захват, а не захід закривається на два сантиметри коротше – тому política не має ідеї, що робити звідти, і що б вона не здогадалась, рухає її далі. Covariate shift – це властивість процедури збору даних, а не архітектури мережі.

Звідки бере початок квадратичний член

Папір 2010 AISTATS Ross та Bagnell, Efficient Reductions for Imitation Learning, робить накопичення точним. Нехай T – горизонт завдання, нехай вартість завдання обмежена одиничним інтервалом, і нехай epsilon – це сурогатна втрата, виміряна під розподілом стану експерта – число, яке повідомляє ваш набір валідації. Тоді додаткова вартість запуску цієї política протягом T кроків, щодо експерта, обмежена T у квадраті разів epsilon. Ross, Gordon та Bagnell переформулюють це як Теорему 2.1 в папері DAgger та додають речення, яке має значення: межа тісна. Проблеми існують, де política з втратою epsilon на розподілі експерта насправді несе додаткову вартість, яка зростає квадратично в T.

Тісна не означає типову. Квадратичний член – це найгірший випадок для класу проблем, а не прогноз про вашу задачу pick-and-place. Що він встановлює, так це те, що більше демонстрацій експерта не може видалити проблему: це лише підсилює оцінку epsilon на розподілі, на якому política не буде протестована.

Шлях втечі – в тому ж папері, переформульованої як Теорема 2.2. Якщо política досягає втрати epsilon під своїм власним розподілом стану, і одна неправильна дія коштує максимум u за вартістю до кінця під експертом, додаткова вартість обмежена u разів T разів epsilon – лінійна за горизонтом. Константа u – це цікава величина: максимум 1 для розбіжності 0-1 з експертом, та O(1) щоразу, коли експерт може відновитися в кілька кроків. У найгіршому випадку це O(T), і лінійна межа тоді не краща за квадратичну.

УстановленняМежа додаткової вартості над експертомНа чому вона ґрунтується
Behavior cloning (Ross & Bagnell 2010, переформульовано як Thm. 2.1 в Ross et al. 2011)T у квадраті разів epsilonepsilon виміряна на розподілі стану експерта; вартість в [0,1]; межа тісна
Будь-яка política з втратою epsilon під своїм розподілом (Thm. 2.2)u разів T разів epsilonu обмежує штраф вартості до кінця за одну неправильну дію; максимум 1 для втрати 0-1, O(T) найгірший випадок
Forward training (Ross & Bagnell 2010)u разів T разів epsilonодна política на часовий крок; потребує T політик та відомого, скінченного T
SMILe (Ross & Bagnell 2010)майже лінійна в T та epsilon на деяких класах проблемalpha в O(1/T у квадраті), N в O(T у квадраті log T); дає стохастичну суміш
DAgger (Thm. 3.2, Ross et al. 2011)u разів T разів epsilon_N, плюс O(1)N порядку uT; сильно опукла обмежена втрата; no-regret learner; epsilon_N – це найкраща втрата з урахуванням
Робочий простір робота, що представляє стани, які política відвідує, але ніколи не з'являлися в демонстраційному наборі
Стани, які мають значення для раунду DAgger, – це ті, які ніхто не демонстрував: захват майже не вдалась, напівзакритий захват, рука минаючи об'єкт.

Дві спроби, які передували DAgger

Forward training – це чесна, але непрактична відповідь. Тренуйте окрему política для кожного часового кроку, по порядку, кожна на розподілі стану, індукованому політиками вже зафіксованими для попередніх кроків, тому кожна política бачить саме той розподіл, який вона матиме. Вловлювання в описі: T політик, тренованих послідовно, без раннього припинення. Для маніпуляції епізоду на 30 кадрів на секунду, T знаходиться в сотнях.

SMILe, з того самого папера, та SEARN, з роботи Daume, Langford та Marcu з структурованого передбачення, беруть іншу дорогу: одна стаціонарна política, але стохастична. Кожна ітерація тренує компонент та додає його до суміші, зміщуючи масу вірогідності від експерта. Результат – це суміш, в якій деякі компоненти гірші за інших – на фізичній руці, контролер, який може відібрати поганий компонент під час руху. Це заявлена мотивація для бажання стаціонарної детермінованої política замість.

DAgger: одна ідея, одна коробка

Dataset Aggregation зберігає детерміновану política та рухає виправлення в збір даних. Кожен раунд: розгорніть поточну política, записуйте стани, які вона відвідує, запитайте експерта, яка була б правильна дія в кожному, додайте ці пари до датасету, який у вас уже є, перетренуйте на об'єднанні. Назва – це алгоритм – ви агрегуєте, ви ніколи не відкидаєте.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
Мета-алгоритм DAgger, Алгоритм 3.1 Ross, Gordon & Bagnell (2011).

Три деталі мають більше ваги, ніж вони виглядають. Етикетки – це для станів, відвідуваних змішаною política, але дії надходять від експерта – política надає запитання, експерт – відповіді. Перетренування на всій агрегації, що робить кожен раунд кроком Follow-The-Leader: на раунді n ви вибираєте найкращу política з урахуванням для кожної траєкторії до цих пір. Це фреймворк, на якому ґрунтується доказ. І алгоритм закінчується поверненням найкращої política з послідовності, вибраної на наборі валідації, оскільки теореми гарантують, що деякі política в послідовності хороша, а не остання.

Beta schedule і чому це не ручка налаштування

Змішана política – це beta_i разів експерт плюс один мінус beta_i разів learner. Момент практичний: перші кілька навчених політик тренуються на дуже малій кількості даних, допускають багато помилок, і інакше витрачали б розгортання на стани, які стають неактуальними, коли política покращується.

Теорія накладає саме одну умову: рухома середня бета повинна йти до нуля. Аналіз працює з beta_i обмежене на (1 - alpha) до степеня i-1, для константи alpha незалежної від T.

РозкладЩо це робитьЩо повідомляє папір
beta_1 = 1Перший раунд – чиста демонстрація експерта; жодна початкова política не потрібнаРекомендована початкова точка в кожному варіанті
beta_i = 1 якщо i = 1, інакше 0Експерт лише в раунді один; жоден вільний параметрВерсія без параметрів папера, яка кажеш часто дає найкращі результати на практиці; 2980 на Super Mario Bros. після 20 ітерацій
beta_i = p^(i-1) з p = 0.5Вірогідність експерта розпадається геометрично3030 на тому ж тесті, трохи попереду версії без параметрів
beta_i = p^(i-1) з p = 0.9Експерт залишається в циклі набагато довшеПомітно повільніше сходження; все ще поліпшується, коли 20 ітерацій закінчились

Розрив між 2980 та 3030 на шкалі, що працює до приблизно 4300, невеликий, але пояснення папера вартий найкориснішої практичної записки в розділі. З версією без параметрів, Mario застряг в тому ж місці рано та генерував масу майже дублікованих даних з цієї однієї локації; дозволяючи експертові керувати часткою часу як розблокував його, так і розширив різноманітність станів. Розклад менше про коефіцієнт змішування, ніж про те, продовжує ваша збір даних виробляти нові стани або ту саму помилку.

Чому розклад не передається на фізичну руку як написано

Стохастична суміш на кроці часу означає перемикання влади контролю на швидкість контролю, 30 разів на секунду на типовій установці SO-100. Жоден телеопераційний інтерфейс це не робить безпечним чи змістовним. На реальному обладнанні beta schedule поступається людському рішенню про коли взяти контроль: інший алгоритм з іншим аналізом.

Гарантія: зведення до no-regret online learning

Ось ход, який робить папір тим, що вона є. Розглядайте кожен раунд DAgger як один приклад в проблемі online learning, де втрата на раунді i – це сурогатна втрата під розподілом стану política, використаної на раунді i. Учень приймає commitment на política перед тим, як побачити цю втрату, та послідовність не стаціонарна, оскільки вона залежить від політик, виробленої до цих пір.

Алгоритм – це no-regret, якщо його середня втрата над N раундами наближається до найкращої однієї política з урахуванням. Follow-The-Leader на сильно опуклих втратах – це такий алгоритм, з середнім жалем, що скорочується порядку 1/N – і перетренування на повній агрегації – це саме Follow-The-Leader. Будь-який інший no-regret learner виконав би службу: аналіз – це зведення, а не властивість одного оптимізатора.

Одна лема перекриває розрив між змішаною política, яка зібрала дані, та навченою política, яка буде розгорнута: Лема 4.1 обмежує L1 відстань між їх розподілами стану на 2 T beta_i. Ось чому бета повинна розпадатися – поки експерт все ще має помітну владу контролю, стани, які ви збираєте, – це не стани, які буде виробляти ваша política. Поєднайте лему з межею жалю та основний результат випливає: після приблизно T ітерацій, деякі política в послідовності мають сурогатну втрату під своїм розподілом в межах O(1/T) з epsilon_N. Введіть це в лінійну межу та ви приземлюєтесь на Теорему 3.2.

Емпірична сторона скромна за поточних стандартів. У Super Tux Kart керований базис не покращив його середню падіння за коло, коли прибуло більше даних, DAgger досяг política, яка ніколи не падала з трека після п'ятнадцяти ітерацій, та SMILe після двадцяти все ще падала приблизно двічі за коло. На еталоні почеркуіння, точність символу пройшла 82 відсотка без структури, 83.6 відсотка керовано, 85.5 відсотка з DAgger. Жоден із них не є результатом маніпуляції.

Що доказ не обіцяє

Твердження теореми умовні, а умови несуть навантаження.

Гарантія DAgger, прочитана уважно
Що вона вам дає
  • Межа лінійна, а не квадратична в T, за припущеннями.
  • Стаціонарна детермінована política замість стохастичної суміші.
  • Справжнє зведення: будь-який no-regret online learner поміщається.
  • Конкретна кількість ітерацій – приблизно T раундів перед тим, як терм жалю перестане мати значення.
  • Гарантія щонайменше для однієї política в послідовності, звідси закриваюча хід валідації.
Що вона вам не дає
  • Вона дотримується epsilon_N, найкращої втрати в класі з урахуванням, а не щодо нуля. Якщо ваш клас не може представити експерта, він на практиці порожній.
  • Їй потрібен метод no-regret або сильно опуклий сурогатний збиток – сильніше, ніж зведення класифікації, на якому він будується, як зазначають автори.
  • Константа u може бути O(T) у найгіршому випадку, і лінійна межа тоді падає назад до квадратичної.
  • Вона обмежує ітерації, а не етикетки експерта. На роботі, етикетки – це бюджет.
  • Вона припускає, що експерт може бути запитаний у кожному відвіданому стані та відповідає правильно там. Це припущення – це вся вартість.

Один інший результат часто цитується як спростування та не є. Rajaraman, Yang, Jiao та Ramachandran вивчають minimax обмеження imitation learning в episodic MDPs з кінцевим простором стану S та горизонтом H, та доводять нижню межу suboptimality порядку |S| H у квадраті над N, яка тримається навіть коли учень може активно запитати експерта в відвіданих станах. Це найгірший випадок для класу MDPs за фіксованого бюджету епізоду, і те, що вона виключає, – це ідея, що взаємодія покращує minimax рейтинг; теорема DAgger – це інше твердження, що обмежує розгорнену política щодо того, що її власний клас política може досягти.

Swamy, Choudhury, Bagnell та Wu пізніше класифікували ці алгоритми за тим, які моменти поведінки експерта вони збігаються, та запровадили поняття moment recoverability, яке розмежовує, наскільки добре кожна сім'я пом'якшує накопичувальну помилку. Огляди Osa та Celemin охоплюють алгоритмічний ландшафт та інтерфейси людського зворотного зв'язку.

Рахунок: позначення станів, які експерт ніколи не виробив

Все вище припускає експерта, який може бути запитаний будь-де. В симуляції з планувальником, який майже безкоштовний – експерименти з Mario використовували майже оптимального планувальника з повним доступом до стану гри. З людиною на роботі це домінуюча вартість, та дивна: людина повинна виробити правильну дію в конфігурації, яку їх власна компетентність ніколи не мала б створити.

Kelly, Sidrane, Driggs-Campbell та Kochenderfer прямо формулюють заперечення в папері HG-DAgger. Ванільний DAgger вимагає від експерта надати етикетки дій, не будучи повністю під контролем системи. Це зменшує безпеку, і з людськими експертами це, ймовірно, погіршить якість зібраних етикеток, які вони приписують сприйманому затримуванню актюатора. Етикетка, яку ви отримуєте, це не етикетка, яку припускав алгоритм.

Laskey та колеги атакують проблему з іншого боку з DART, та їх фреймворк прямої мови: on-policy техніки втомляючі для людських супервізорів, додають обчислювальне навантаження, та можуть відвідати небезпечні стани під час тренування. Їхня альтернатива впускає калібровану шум у власні демонстрації супервізора, тому відновлення потрібно демонструвати без того, щоб робот коли-небудь запускав недовірчу política. На MuJoCo Humanoid вони повідомляють DART, що зменшує кумулятивну нагороду супервізора на 5 відсотків під час тренування, поки DAgger виконує політики з 80 відсотками менше кумулятивної нагороди, ніж супервізор; на захопленні в безладі з Toyota HSR, середнє збільшення 62 відсотка над behavior cloning.

SafeDAgger Zhang та Cho розглядає запити на посилання política як скарцейний ресурс: окремі безпека política прогнозує, без запиту, чи збирається основна política відхилятися від посилання за межею, та лише ці стани передаються. Усі три реагують на той самий факт – аналіз DAgger нічого не стягує для етикеток експерта, та реальність стягує багато.

Частина, про яку ніхто вас не попереджує

Позначення off-distribution станів розумово складніше, ніж демонстрація завдання. Звичайна демонстрація означає виконання моторного плану, який ви вже маєте. Корекція política, яка поставила захват деінде, де ви ніколи не буваете, означає конструювання відновлення на щвидку, під тиском часу, з роботом, яка все ще рухається. Сподіватися менше корисних хвилин на сеанс, ніж в звичайному сеансі запису, та спостерігати, як якість вашої власної корекції розпадається протягом одного.

Структура датасету LeRobot, що показує епізоди, кадри та колони на кадр як зберігаються на диску
Корекції стають датасетом лише одного разу, коли марковані кадри втручання – у форматі LeRobot, стовпець на кадр поряд спостереженням та дією.

Що це означає для SO-100 на вашому столі

Переведіть горизонт у свої власні одиниці. Двадцятисекундний епізод на 30 кадрів на секунду – це 600 кроків рішення, і T у кожній межі вище – це те число. При T = 600 розрив між терміном, який масштабується з T, та одним, який масштабується з T у квадраті, – це розрив між política, яка відновлюється від поганого підходу, та однією, яка не робить.

Це частина причини, чому дія chunking допомагає: коли política видає короткої послідовності дій на крок висновку, кількість точок рішення падає, і так само падає кількість шансів накопичувати. Zhao, Kumar, Levine та Finn називають накопичувальну помилку як мотивацію для Action Chunking with Transformers та повідомляють про успіх 80 до 90 відсотків на шести складних реальних завданнях, на низькокош біманних обладнання, від десяти хвилин демонстрацій. Chunking не видаляє covariate shift – стани все ще власні política – але скорочує ефективний горизонт. Див. action chunking та SO-100 imitation learning guide.

Друга переклад – це метрика прогресу. Ви не можете виміряти epsilon під розподілом власної política безпосередньо – це потребує експертних дій основи істини для кожного відвіданого стану, те, що ви намагаєтесь уникнути виробництва. Те, що цикл, керований людиною, дає вам замість цього – це intervention rate: частка кадрів у запуску, протягом яких людина взяла контроль. Це проксі, та вона рухається з причин, не пов'язаних з política – терплива операторка втручається менше. Використовується послідовно, це число, яке говорить, чи стоїв раунд полудня.

Третій переклад – це попередження про якість даних, яке аналіз не охоплює. Mandlekar та колеги вивчали шість алгоритмів offline learning на п'яти змодельованих та трьох реальних завданнях багатоетапної маніпуляції, та повідомляють про чутливість до вибору алгоритму, залежність від якості демонстрацій та варіабельність, спричинену критерієм зупинки. Belkhale, Cui та Sadigh стверджують, що якість датасету повинна бути формалізована через action divergence та transition diversity, та зазначають, що різноманітність стану не завжди корисна. Раунд DAgger додає стани, які ніхто навмисно не вибрав: деякі – це дані відновлення, які вам потрібні, деякі – це робот, що б'ється, поки ви шукаєте контроль takeover.

Механічно раунд – це шість кроків: запустіть висновок з записуванням ввімкнено, візьміть контроль, коли política несе себе, перегляньте запуск та подайте кожний епізод, синхронізуйте корекції, складіть змішаний датасет з оригіналів плюс корекції з вибором епізоду, зробленим явно на джерело, та продовжуйте тренування від попередньої контрольної точки замість базової моделі. На ay-robots ці кроки існують як кнопки, які видаляють трубопровід, але не судження. Два застереження: продовження з контрольної точки ініціалізує ваги та не є відновленням оптимізатора, та хід вирівнювання leader-arm все ще легко тестується на обладнанні. Див. тренування та датасети.

Цикл DAgger, вже підключений

Takeover під час живого запуску висновку, позначення втручання на кадр, подання епізодів як корекцій чи оцінок, складання змішаного датасету з явним вибором епізоду на джерело, та продовження тренування від існуючої контрольної точки – це все вбудовано. Ви все ще вирішуєте, коли брати контроль та що зберігати – та частина не автоматизується.

Див., як працює цикл DAgger

Сімейне дерево в одній таблиці

МетодХто вибирає станиЩо надає експертГоловна вартість
Behavior cloningЕкспертЧисті демонстраціїЖодні дані відновлення; помилка може накопичуватися квадратично в T
Forward trainingУчень, на часовий крокЕтикетки вздовж індукованого розподілуT окремих політик; непридатна для довгих горизонтів
SMILe / SEARNСтохастична суміш експерта та учняЕтикетки вздовж розподілу сумішіКомпоненти суміші відрізняються якістю
DAggerЗмішана política, beta розпадається до нуляПравильна дія для кожного відвіданого стануПозначення станів, які експерт ніколи не мав би виробити, не будучи під контролем
DARTЕксперт, збурений впущеним шумомДемонстрації під каліброваним шумомШум повинен бути калібрований до помилки учня
HG-DAggerУчень, поки людина не бере контрольКорекції лише в сегментах, керованих людиноюЗалежить від судження людини про коли втручатися
SafeDAggerУчень, відфільтрований защитною брамоюЕтикетки лише коли брама запитуєСама брама повинна бути тренована та довіреною

Часто задавані запитання

Чи я насправді спостерігатиму квадратичне зростання помилки на своєму роботі?

Не як чиста крива. Межа – це найгірший випадок: тісна в тому, що деякі проблеми її досягають, а не що ваша буде. Те, що ви бачите – це наслідок – política, яка оцінюється добре на ізольованих кадрах, не працює на реальному завданні, та не поліпшується, коли ви записуєте більше тієї ж самої. Якщо більше чистих даних перестає допомагати, це covariate shift, а не проблема обсягу даних.

Чи я повинен реалізовувати суміш beta, щоб назвати це DAgger?

Версія без параметрів – експерт у раунді один, чистий учень потім – це законний спеціальний випадок та часто найбільш ефективний у оригінальних експериментах. Те, що ви не можете скинути, – це агрегація: перетренування лише на найновіших корекціях розбиває інтерпретацію Follow-The-Leader, це звідки бере жалю аргумент no-regret. Тренування на корекціях самих по собі – це набагато слабша процедура.

Чому повернути найкращу política на наборі валідації замість останню?

Оскільки теореми гарантують, що хороша política існує деінде в послідовності, а не що це остання ітерація – межа – це мінімум над послідовністю. Доставка того, що вийшло з останнього раунду, відкидає заявлену умову результату, та останній раунд не є надійно найбільшим.

Скільки раундів я повинен запланувати?

Теорія хоче ітерацій порядку T, яка для епізоду 600-кроку – це не число, яке хто-небудь запускає на обладнанні. Оригінальні експерименти запустили двадцять ітерацій на кожному тесті. На практиці ви запускаєте раунди, поки intervention rate перестає падати, далеко нижче графіка, який припускає аналіз – справжня розрив між теорією та практикою.

Що якщо мій клас política просто не може представити експерта?

Тоді DAgger не врятує вас, та межа говорить так – вона виражена щодо epsilon_N, найкращої втрати в класі з урахуванням. Якщо це великий, оскільки неправильної архітектури, пропущеного спостереження чи камери, яка не може бачити сцену, агрегація дає вам política, яка оптимальна в класі, який не може виконати завдання. Запустіть open-loop replay проти ізольованих епізодів перед тим, як збирати корекції.

Куди йти звідси

Якщо ви ще не тренували política, ця теорія передчасна: спочатку записуйте датасет, починаючи з тренування вашої першої política та desktop client. Якщо ви розглядаєте інші сто чистих демонстрацій проти запуску корекцій: чисті демонстрації не вирішують проблему розповсюдження. Для механіки продовжуйте з людськи-керованого варіанта та потім пройти SO-100.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started