Оператор, контролирующий робот-манипулятор через интерфейс телеоперации, руки на элементах управления и готовы к перехвату
DAggerИнтерактивное обучение имитацииHG-DAggerПолитики роботовSO-100

HG-DAgger и гейтированные варианты: кто решает, когда перехватить управление политикой робота

AY-Robots ResearchAugust 27, 202615 мин чтения

Обычный DAgger просит человека обозначить состояния, пока робот все еще ездит. На реальном оборудовании это небезопасно и дает плохие метки. Гейтированные варианты заменяют слепое обозначение на переключатель, который кто-то должен держать: человек в HG-DAgger, классификатор безопасности в SafeDAgger, несогласие ансамбля в EnsembleDAgger, оценка новизны и риска с бюджетом в ThriftyDAgger. Эта статья сравнивает их по тому, кто владеет гейтом, какой сигнал его открывает и что каждый стоит — и почему форма с человеческим гейтом — это та, которая выживает при контакте с реальным рычагом.

Клонированная политика терпит неудачу там, где ее обучающие данные закончились. Исправление — это продолжить сбор данных под собственным распределением состояний политики вместо демонстратора, что делает DAgger и что введение в агрегацию набора данных охватывает с первых принципов. Это оставляет открытой неудобную часть исходного алгоритма: пока учащийся ездит, эксперт должен сказать, что бы они сделали, для каждого состояния, без контроля.

В симуляторе со сценарным экспертом это бесплатно. На столе с реальным рычагом это ни то, ни другое. Авторы HG-DAgger точно формулируют возражение: такие схемы выборки «требуют, чтобы эксперт предоставил метки действий без полного контроля над системой», что «может снизить безопасность и, при использовании людей в качестве экспертов, вероятно, снизит качество собранных меток из-за воспринимаемой задержки привода» (Kelly et al., 2019). В этом предложении скрыты два отказа: политика продолжает ездить в состояния, которые никто не хочет, и метки, купленные с этим риском, хуже тех, которые производит человек, держащий управление. Каждый вариант ниже отвечает на один и тот же вопрос — положить гейт на управление и позволить кому-то решить, когда он открывается. Они отличаются тем, кто этот кто-то.

Краткая версия

  • Гейтированные варианты заменяют слепое обозначение переключателем между управлением политикой и управлением экспертом. Что их разделяет, это кто владеет переключателем.
  • HG-DAgger дает переключатель человеку и агрегирует только данные, записанные пока человек имел непрерывный контроль.
  • SafeDAgger дает его двоичному классификатору, предсказывающему отклонение от опорной политики; EnsembleDAgger требует низкой вариации ансамбля и небольшого расстояния до действия эксперта одновременно.
  • LazyDAgger добавляет гистерезис, поэтому управление не прыгает туда-сюда; ThriftyDAgger закрывает доступ на основе новизны или оцененного риска в явном бюджете вмешательства.
  • Робот-гейтированные сигналы требуют того, что тонко настроенная VLA на любительском рычаге обычно не имеет: опорная политика, дешевый ансамбль или калиброванная эпистемическая неопределенность.
  • Гейт — это половина метода. Что происходит с сегментами вмешательства после этого — смешивание, взвешивание, агрегирование — решает, улучшила ли раунд что-либо.

Человеческий гейт и робот-гейт: разделение, которое имеет значение

Интерактивное обучение имитации имеет свой собственный обзор; Celemin и коллеги каталогизируют его по типу обратной связи, интерфейсу, модели обучения, пользовательскому опыту, применению и тесту. Различие, которое определяет вашу инженерию, проще, чем любая из этих осей, и недавние работы называют его напрямую: метод является человеческий гейт когда надзирающий решает, когда вмешаться, и робот-гейт когда агент решает, когда попросить помощь (Cai et al., 2025). Все остальное — это механика, служащая одному из этих двух выборов. Торговля видна с самого начала: человеческий гейт требует постоянного внимания, и робот-гейт обещает вернуть это внимание — но только если сигнал, который он закрывает, надежен, и построение этого сигнала — это его собственная проблема исследования.

SafeDAgger: классификатор, предсказывающий собственное отклонение

SafeDAgger (Zhang and Cho, 2016) Zhang и Cho — самый ранний из этих гейтов. Запрос опорной политики — дорогостоящая часть, поэтому вторая, маленькая сеть — политика безопасности — предсказывает, стоит ли вообще запрашивать. Она «возвращает двоичную метку, указывающую, вероятно ли основная политика отклониться от опорной политики без запроса». Метка определяется по отношению к квадратичному отклонению L2 между действиями двух политик с порогом tau, и классификатор соответствует двоичной кросс-энтропии. Во время выполнения он решает для каждого состояния, продолжает ли учащийся ездить или опорный берет на себя. Аннотация сообщает о меньшем количестве запросов к опорной политике в симуляторе гонок плюс ускорение скорости конвергенции, которое авторы приписывают эффекту автоматического учебного плана, без указания какой-либо цифры для любого из них.

Уловка в определении, не в результатах. Обучение классификатора требует действия опорной политики на каждом состоянии, используемом для его подгонки, что предполагает, что опорная политика — это другая программа. Если ваша опорная политика — это человек с ведущим рычагом, этот набор меток не дешев, и метод теряет свойство, для которого он был разработан.

EnsembleDAgger: сомнение и расхождение, оба

Menda, Driggs-Campbell и Kochenderfer (2019) рассматривают гейт как вероятностный вопрос. EnsembleDAgger «аппроксимирует гауссов процесс, используя ансамбль нейронных сетей» и читает вариацию ансамбля как прокси уверенности: высокая вариация означает регион, в отличие от данных обучения, который — при условии, что эксперт избегает состояний отказа — коррелирует с близостью к отказу. Правило — конъюнкция. Учащийся может действовать только тогда, когда расстояние L2 между его средним действием и действием эксперта остается ниже одного порога (расхождение) и дисперсия его прогнозируемого действия остается ниже второго (сомнение). Если любое из них не удается, эксперт берет управление. Цель состоит в том, чтобы максимизировать долю действий учащегося при ограничении вероятности отказа; документ сообщает об улучшенной безопасности и обучении по сравнению с другими вариантами DAgger на перевернутом маятнике и MuJoCo HalfCheetah.

Термин расхождения требует действия эксперта

Это тихо дисквалифицирует полное правило для присмотра без рук. Расстояние между действием учащегося и действием эксперта требует действия эксперта в этом состоянии, в этот момент. Со сценарным экспертом — хорошо. С человеком человек должен постоянно производить действия — это в точности то, что гейтированные варианты были призваны убрать. Только термин сомнения безопасен для рук; конъюнкция — нет.

LazyDAgger: остановить переключатель от щебета

Hoque и коллеги (2021) атаковали стоимость, которую более ранние документы не измеряли: сам переключатель. Каждое вмешательство «прерывает другую работу, которую выполняет человек, приводит к задержкам при каждом переключении контекста между надзиратором и автономным управлением, и требует времени на выполнение». Гейт, который открывается и закрывается десять раз в минуту, хуже, чем тот, который открывается один раз на десять секунд при идентичной автономной доле. LazyDAgger расширяет SafeDAgger асимметричными порогами — сложнее войти в управление надзирателя, чем остаться в нем — поэтому система не колеблется на границе. В симуляции это «может уменьшить переключения контекста в среднем на 60% по сравнению с SafeDAgger на 3 непрерывных задачах управления при сохранении лучшей производительности политики»; в манипулировании тканью с ABB YuMi это «уменьшает переключения контекста на 60% при достижении на 60% более высокого коэффициента успеха чем SafeDAgger во время выполнения».

ThriftyDAgger: новизна или риск, с бюджетом

ThriftyDAgger (Hoque et al., CoRL 2021) начинается с бюджета надзирателя, а не политики. Он «использует изученную политику переключения для запроса вмешательств только в состояниях, которые достаточно (1) новы, где политика робота не имеет опорного поведения для имитации, или (2) рискованны, где робот имеет низкую уверенность в выполнении задачи», с новой метрикой для оценки этого риска. Бюджет — это вход, не результат: вы указываете, сколько человеческого времени вы потратите. Применяется во время выполнения метод «достигает 100% коэффициента успеха как на симуляции, так и на физических задачах», и исследование пользователя с десятью участниками, контролирующими флот из трех роботов вместе с задачей концентрации, сообщает, что это «увеличивает производительность человека и робота на 58% и 80% соответственно по сравнению со следующим лучшим алгоритмом при одновременном снижении нагрузки на надзирателя». Параметр флота — это естественный дом для этой работы; Fleet-DAgger позже формализовал интерактивное обучение флота с несколькими роботами и надзирателями, предлагая Return on Human Effort как количество для оптимизации.

HG-DAgger: человек держит гейт

Kelly et al. (2019) идут в другом направлении. Нет политики переключения. Учащийся развернут «до тех пор, пока эксперт не заметит, что новичок вошел в небезопасный регион пространства состояний», в этот момент эксперт берет управление и направляет систему обратно. Правило агрегирования — это строгая часть: «Метки действий эксперта собираются и добавляются в набор данных только во время этих восстановительных траекторий, во время которых эксперт-человек имеет непрерывное управление системой.» Ничего не обозначается пока человек — зритель.

Это не останавливается на переключателе. HG-DAgger также «изучает порог безопасности для метрики риска на основе неопределенности модели, который может использоваться для прогнозирования производительности полностью обученного новичка в различных регионах пространства состояний»: он записывает, насколько неопределен был учащийся в моменты вмешательства человека, и усредняет последнюю четверть этих записей, где учащийся больше всего напоминает свою финальную форму. Это не гейт, который робот работает, а диагностика, которая говорит вам, где готовая политика ожидается держать. Оценка охватывает смоделированную и реальную задачу вождения и сообщает об улучшенной производительности по сравнению как с DAgger, так и с поведенческим клонированием.

Одна связанная линия меняет то, что считается меткой. Spencer и коллеги Expert Intervention Learning утверждают, что «любое количество экспертной обратной связи, будь то вмешательство или невмешательство, предоставляет информацию о качестве текущего состояния, оптимальности действия или обоих», формализованное как ограничение на функцию значения учащегося и решенное без сожалений в сетевом обучении. Под этим прочтением, участки, где человек смотрел и ничего не делал, являются слабым положительным доказательством, а не пустотой. EIL изучает избежание столкновений примерно за одну минуту управления экспертом.

Рабочее пространство робот-манипулятора с камерами, расположенными для сбора данных во время контролируемого развертывания политики
Раунд с человеческим гейтом — это обычный запуск вывода с прикрепленным рекордером. Кадры, которые управлял оператор, отмечены; остальное остается как было.

Варианты рядом

МетодКто открывает гейтСигналНужны доступныеСообщено
DAgger (Ross et al., 2011)Никто — учащийся всегда ездитНет; эксперт обозначает каждое посещенное состояниеЭксперт, способный обозначить вне распределения состояний, не имея контроляСнижение без сожалений с гарантиями под распределением состояний учащегося
HG-DAgger (Kelly et al., 2019)Человек-надзирательРешение надзирателя, что состояние небезопасноКто-то наблюдающий и чистая передача управленияПобеждает DAgger и поведенческое клонирование на симуляции и реальной задаче вождения; также изучает порог риска
SafeDAgger (Zhang & Cho, 2016)РоботДвоичный классификатор для отклонения L2 от опорной выше tauЗапрашиваемая опорная политика для меток классификатораМеньше запросов к опорной политике в симуляторе гонок, более быстрая конвергенция (цифра не дана)
EnsembleDAgger (Menda et al., 2019)РоботВариация ансамбля и расстояние до действия эксперта, оба под порогомАнсамбль сетей плюс действие эксперта на каждом этапеУлучшенная безопасность и обучение на маятнике и HalfCheetah
LazyDAgger (Hoque et al., 2021)Робот, с гистерезисомСигнал SafeDAgger с отдельными порогами входа и выходаТо, что нужно SafeDAgger, плюс второй порог для настройки~60% меньше переключений контекста на 3 задачах; 60% более высокий успех на YuMi ткани
ThriftyDAgger (Hoque et al., 2021)Робот, с бюджетомНовизна или оцененный риск невыполнения задачиИзученная оценка риска и указанный бюджет вмешательства100% успех во время выполнения; исследование пользователя (N=10): 58% и 80% прирост против следующего лучшего
EIL (Spencer et al., 2020)Человек — невмешательство тоже считаетсяВмешательство и его отсутствие как ограничения на функцию значенияОбучение без сожалений в сети над ограничением значенияИзбежание столкновений примерно за одну минуту управления экспертом

Что каждый гейт покупает, и что он стоит

Прочитайте вниз колонку «нужные» и паттерн падает: каждый робот-гейтированный сигнал там — это прокси, который должен быть изготовлен, и каждый прокси имеет свой счет.

  • Сигналы расхождения (SafeDAgger, LazyDAgger, половина правила EnsembleDAgger) требуют опорной политики. Либо у вас есть сценарный эксперт, в этом случае интересная проблема уже решена, либо человек постоянно производит действия в фоне, поэтому расстояние может быть вычислено.
  • Сигналы сомнения требуют калиброванной эпистемической неопределенности. Ансамбль небольших контрольных сетей ее аппроксимирует; ансамбль трехмиллиардного параметра модели видения-языка-действия — это проблема памяти и задержки в первую очередь.
  • Сигналы новизны и риска требуют изученной оценки завершения задачи, подобранной на достаточном количестве успешных и неудачных развертываний. На задаче, которую вы все еще заставляете работать, эти данные не существуют в раунде один.
  • Человеческий гейт требует внимания и ничего больше — единственный доступный сигнал в день один, на любой архитектуре политики, без дополнительной модели для обучения.
  • Ни один робот-гейт не убирает человека из комнаты. Они снижают то, как часто должен действовать человек, не то, должны ли они быть.

Есть тихое различие в том, что производит гейт. Робот-гейт, срабатывающий в середине траектории, передает человеку движущееся плечо в произвольной позе. Человеческий гейт позволяет оператору выбрать момент — после захвата, перед сжатием, не в середине поворота. Сегменты восстановления из двух не одинаково чистые, и эти сегменты — весь продукт раунда.

Почему форма с человеческим гейтом выигрывает на реальном оборудовании

Это инженерный аргумент, не результат бенчмарка — ни один документ, который мы нашли, не запускает все пять гейтов на одном манипуляторе с одним классом политики. Он опирается на четыре пункта.

Во-первых, надзиратель там в любом случае. Никто не оставляет рычаг SO-100 работающим без присмотра рядом с объектами, которые он может опрокинуть. Когда кто-то наблюдает, предельная стоимость предоставления им кнопки перехвата близка к нулю; построение калиброванной оценки риска — это проект.

Во-вторых, неопределенность, которую вы можете фактически измерить на современной политике, часто не является правильным количеством. Голова диффузии или согласования потоков производит дисперсию по выбранным фрагментам действий, и эта дисперсия отражает мультимодальность, которую голова была обучена представлять, а не эпистемическое невежество о состоянии. Термин сомнения EnsembleDAgger использует ансамбль именно для захвата последнего. Эти два выглядят как одно и то же число и не являются; запись фрагментирование действий и согласование потоков записи охватывают, как эти головы выдают действия в первую очередь.

В-третьих, сбои, которые имеют значение в манипулировании, часто являются семантическими, а не статистически необычными. Политика, закрывающая захватывающую на два сантиметра рано, или с уверенностью доходящая до неправильной из двух идентичных кубов, не в состояния с высокой дисперсией — это уверенная и неправильная. Никакой порог дисперсии это не поймает; человек, наблюдающий, это поймет немедленно.

В-четвертых, качество метки — исходная точка HG-DAgger, и та, которая чаще всего пропускается. Метки, собранные пока человек имеет непрерывный контроль, превосходят метки, рассказанные над движущейся системой. Если целью являются корректирующие данные, стоящие агрегирования, бремя доказывания лежит с автоматизированным гейтом.

Где робот-гейты действительно окупаются

Картина переворачивается, когда один надзиратель отвечает за многих роботов — режим, который изучение пользователя ThriftyDAgger и формализация Fleet-DAgger целевые. С флотом человеческое внимание — это редкий ресурс, и несовершенное распределение превосходит ничего. С одним рычагом на одном столе вы не в этом режиме.

Цикл с человеческим гейтом, уже подключен

Перехват во время сеанса вывода, флаги вмешательства за кадр на исправленных сегментах, кураторство каждого запуска на исправления или оценку, составление смешанного набора данных из источников, которые вы выбираете, и продолжение обучения с существующей контрольной точки, встроены, а не написаны вручную. Перехват работает с ведущим рычагом или с клавиатурой и ползунками, если у вас нет одного.

Смотрите, как работает цикл DAgger

Гейт — это половина метода; обработка данных — это другая половина

Гейт решает, какие кадры ездил человек, а не что с ними делать, и это второе решение — где раунды наиболее часто тратятся впустую. Первое правило — то, на что указывает D в DAgger: агрегируй, не заменяй. Тонкая настройка контрольная точка чисто на нескольких сотнях кадров коррекции дает вам модель, которая видела почти ничего, кроме восстановлений и забыла номинальную траекторию.

Второе правило состоит в том, что кадры вмешательства — не обычные кадры. Mandlekar et al. построили систему дистанционного телеуправления для манипулирования 6-DoF, позволяющую операторам контролировать политики и перехватывать при сбое, затем обучали итеративно алгоритмом, который «поощряет политику учиться, как пересекать узкие места через вмешательства»; агенты, обученные на этих данных, превосходили агентов, обученных на равном количестве обычных образцов демонстрации. Sirius продвигает идею в развертывание, «переобъемлив образцы обучения с приблизительным человеческим доверием и оптимизируя политики с взвешенным поведенческим клонированием». Оба требуют маркера за кадр того, что управлялось человеком, что является причиной, по которой флаг вмешательство имеет большее значение, чем кажется.

Третье правило состоит в том, что автоматическое смешивание — это ловушка. Составленный набор данных, источники которого вы не можете перечислить — это набор, который вы не можете отладить, когда следующий раунд становится хуже. На этой платформе шаг композиции явный по этой причине — исходный набор данных плюс исправления, выбор эпизода по источнику, и результат — обычный LeRobot набор данных который синхронизируется и обучается как любой другой; документация набора данных охватывает сторону формата.

Шаг в раундеЧто он производитНаиболее распространенный способ, которым это идет неправильно
Запустить вывод с включенной записьюЗапуск под собственным распределением состояния политикиЗаписано как простая телеоперация, теряя, что политика была вождением
Перехватить при сбоеСегменты коррекции с флагом вмешательства за кадрКоррекция косметического дрожания, обучение стилю, а не восстановлению
Курировать каждый эпизодИсправления, оценка или отклоненияДержу все; испорченный перехват стоит больше, чем стоил эпизод
Синхронизировать исправленияВерсионированный набор данных рядом с исходнымИсправления, которые никогда не оставляют локальную машину
Составить смешанный набор данныхИсходное плюс исправления, явный выборТихое автоматическое смешивание, поэтому более поздняя регрессия не может быть отслежена до источника
Продолжить с контрольной точкиКонтрольная точка инициализирована из предыдущейОжидание возобновления оптимизатора; веса инициализируют модель, они не восстанавливают состояние оптимизатора

Установка гейта, который человек может действительно держать

«Человек решает» — не спецификация. Два оператора с разными порогами производят несравнимые раунды, и дрейфующий порог производит тренд, который вы не можете прочитать. Напишите триггеры перед первым запуском.

  1. Назовите условия, которые открывают гейт — подход отключен более чем на фиксированный запас, захватывающий захват закрывается ни на что, сустав дрейфует в сторону предела, застой более чем на секунду или две — и держите список неизменным для раунда.
  2. Назовите то, что это не открывает. Перелет политика восстанавливается сама по себе это сигнал обучения; перехват там удаляет восстановление, которое она уже знает.
  3. Перехватите рано достаточно для чистой передачи, передайте как можно скорее, как только состояние восстанавливаемо.
  4. Зарегистрируйте, почему вы взяли на себя, за эпизод. Три раунда спустя это единственный запись о том, вернется ли та же ошибка.
  5. Держите камеры, текст задачи и оператора постоянными по раундам. Измените одно и числа перестанут быть сравнимы.

Механически передача имеет два варианта. С ведущим рычагом, ведущий должен достичь текущей позы последователя перед передачей крутящего момента, или рычаг прыгает; это движение выравнивания — наименее протестированная часть цепи на реальном оборудовании. Без ведущего рычага перехват является ручным с первого нажатия клавиши: последователь держится и оператор подталкивает его сустав за суставом с клавиатуры или тащит ползунки, при этом серверные фиксаторы держат каждый ввод малым — пара градусов за нажатие клавиши, горстка за обновление ползунка, потому что большой шаг в удерживаемую позу — это как вы снимаете сервопривод. Пошаговая версия с привязками клавиш находится в прохождении раунда DAgger на SO-100; фон обоих режимов телеуправления находится в документация телеоперации и запись лидер-последователь.

Сравнение поддерживаемых архитектур политики с их обучением и характеристиками вывода
Гейт не зависит от архитектуры. Какую политику вы исправляете, изменяет стоимость обучения раунда, а не как работает перехват.

Чтение, сделал ли гейт что-нибудь

Метрика раунда с человеческим гейтом — это частота вмешательства: кадры вмешательства, разделенные на кадры запуска. Это имеет одну работу — если оно не падает по раундам, раунд ничего не купил, и следующий должен измениться на чем-то другом, кроме количества данных.

Это предвзятая метрика, и вы должны знать, как. Это измеряет порог оператора столько же, сколько компетентность политики, поэтому список триггеров остается зафиксированным; оператор, который расслабляется в течение сеанса, производит падающую кривую с ничем позади. Это также игнорирует серьезность — десять кадров для остановки столкновения и десять для толкания захвата выглядят идентично. Сочетайте это с фиксированным набором оценки, из которого никогда не были взяты данные коррекции. Статья об измерении цикла DAgger работает через дизайн оценки, включая то, как держать эпизоды оценки из смеси обучения.

Человеческий гейт, честно
Что он дает вам
  • Работает в день один, на любой архитектуре политики, без дополнительной модели для калибровки
  • Ловит уверенные и неправильные сбои, которые порог дисперсии не обнаруживает
  • Производит исправления, записанные пока оператор имел полный контроль, в момент, который он выбрал
  • Приносит маркер за кадр, который методы, взвешенные вмешательством, такие как IWR и Sirius, потребляют
Что он этого не делает
  • Стоит постоянный надзор; он не масштабируется на одного человека и много роботов
  • Зависит от согласованности оператора — дрейфующий порог портит частоту вмешательства
  • Не производит модель риска самостоятельно; изученный порог HG-DAgger и оценка ThriftyDAgger — это дополнительная механика
  • Считает кадры, не последствия
  • Не может спасти политику, чей отказ находится выше по течению от управления, такую как обменянная камера или неправильная строка задачи

Открытые вопросы, достойные внимания

Бенчмарки слабы. Spencer и коллеги изучили те, которые используются для тестирования подходов обучения имитации, и обнаружили, что они «реализуемы и просты и поэтому недостаточны для захвата более сложных режимов ошибок, составления, вызванных в реальных проблемах принятия решений» — и, против окружающей литературы, обнаружили, что простое поведенческое клонирование хорошо работало на них. Это причина скептически относиться к любому рейтингу вариантов DAgger, основанному на этих задачах, включая некоторые числа в таблице выше.

Робот-гейты на больших политиках также не решены. Работа AIM заменяет неопределенность прокси Q-функцией, имитирующей правило вмешательства человека, и сообщает о 40% улучшении в стоимости перехвата и эффективности обучения по сравнению с ThriftyDAgger — в непрерывном и дискретном управлении, а не на модели действия видения-языка, управляющей манипулятором. То, передается ли какой-либо из этих гейтов в тонко настроенную VLA, остается открытым вопросом. Опрос выдвигает связанный момент: терминология и структура области не унифицированы по всей литературе, что затрудняет сравнение методов. На вашем собственном рычаге ваши журналы — это доказательство, которое у вас есть.

Является ли HG-DAgger действительно DAgger, если человек обозначает только во время вмешательств?

Он держит часть, которая имеет значение — данные, собранные под распределением состояния, которое индуцирует учащийся, агрегированные с тем, что было раньше — и отбрасывает часть, которая не выживает контакт с оборудованием. Kelly et al. представляют это как вариант; гарантия без сожалений 2011 года не переносится без изменений.

Могу ли я использовать робот-гейт на политике VLA, тонко настроенной на SO-100?

Не прямолинейно. Классификатор SafeDAgger требует запрашиваемую опорную политику, которую у вас нет. EnsembleDAgger требует ансамбля, что для многомиллиардной модели параметров означает несколько копий в памяти плюс их стоимость вывода. ThriftyDAgger требует оценку риска, подобранную на успехи и неудачи, которые не существуют до ваших первых раундов.

Как долго должен быть один перехват?

Долго достаточно, чтобы достичь состояния, из которого политика может продолжить, и не дольше: длительные перехваты превращают запуск в сеанс демонстрации и переполняют набор исправлений номинальным поведением. Вывод LazyDAgger режет по-другому — много очень коротких переключений — это их собственная стоимость.

Должен ли я обучаться только на исправленных сегментах?

Нет — это наиболее распространенный способ потратить раунд впустую. Модель, тонко настроенная только на восстановлениях, видела почти ничего, кроме восстановлений. Смешайте исправления в исходный набор данных с источниками, выбранными явно; чтобы пойти дальше, посмотрите на подходы, взвешенные вмешательством, такие как IWR или Sirius, которые увеличивают вес кадров, управляемых человеком, вместо их изоляции.

Что если частота вмешательства не падает после раунда?

Возьми это за чистую монету: раунд не помог. Перед добавлением исправлений проверьте более дешевые объяснения — дрейфовал ли порог оператора, были ли исправления косметическими, содержал ли составленный набор данных их, была ли обучение инициализировано из предполагаемой контрольной точки. Раунд, который молча начался с базовой модели, выглядит в точности как раунд, который не научился.

Несет ли невмешательство информацию?

Согласно Expert Intervention Learning, да: участки, где надзиратель наблюдал и не действовал, читаются как слабое доказательство того, что состояние и действие были приемлемы, формализованные как ограничение на функцию значения. Большинство практических конвейеров, включая этот, отмечают только то, что управлял человек.

Для одного рычага на столе выбор сделан: держите гейт сами, напишите, что его открывает, и потратьте усилия на обработку данных позади него, чем на автоматизацию переключателя. Сторона платформы описана на странице цикла DAgger, параметры обучения для семейства политики под обучение и цены. Для фона, начните с обучение имитации и обучение имитации на SO-100; для первого запуска запустите вашу первую политику это более короткий путь.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started