Рабочее пространство настольного робота, используемое в качестве фиксированной оценочной установки для повторных прогонов политики
DAggerОценкаОбучение имитацииДанные роботаSO-100

Измерение DAgger-цикла: коэффициент вмешательства, протокол оценки и подводные камни

AY-Robots ResearchAugust 27, 202615 мин чтения

Коэффициент вмешательства (кадры вмешательства, разделённые на кадры прогона) — это самый дешёвый честный сигнал прогресса, который имеет DAgger-цикл под управлением человека. Эта статья определяет его так, чтобы два человека получили одно и то же значение, показывает, как его регистрировать, и разбирает четыре способа, которыми он вас вводит в заблуждение: привыкание оператора, дрейф оценочной установки, обучение только на коррекциях и человек, который исправляет по-разному во вторник и в понедельник.

Раунд DAgger кажется продуктивным, пока вы его проводите. Вы управляете политикой, берёте управление, когда она запутается с захватом, сохраняете коррекции, переобучаете, и следующий прогон выглядит — вы бы поклялись — немного плавнее. Два раунда спустя вы не можете сказать, изменилось ли что-нибудь, потому что «немного плавнее» — это не величина.

Цикл нужен один номер за раунд, и в цикле под управлением человека этот номер почти бесплатен: доля прогона, в течение которого вы имели управление вместо политики. Эта статья определяет его так, чтобы два человека вычислили одно и то же значение, записывают его, читают полученную кривую и называют четыре способа, которыми он вас вводит в заблуждение, когда он стоит отдельно. Для теории, которую этот материал предполагает, см. пояснение DAgger и вариант под управлением человека; практический аналог — это запуск DAgger-цикла на SO-100.

Краткая версия

  • Коэффициент вмешательства = кадры вмешательства / кадры прогона. Кадры, не эпизоды, и знаменатель включает кадры, затраченные на коррекцию.
  • Плоская кривая за три раунда означает, что раунды не дают ничего — измените смесь, checkpoint или задачу вместо сбора четвёртого.
  • Падающий коэффициент вмешательства — это не растущий коэффициент успеха. Ваш порог для вмешательства смещается вниз по мере роста доверия.
  • Без замороженного протокола оценки — одинаковые исходные позы, объекты, камеры, количество проб — вы измеряете комнату.
  • Обучение только на коррекциях искажает распределение состояний. Ответ IWR: рисуйте образцы вмешательства и отсутствия вмешательства в равной пропорции.

Почему раунду вообще нужен номер

DAgger существует из-за проблемы распределения, и проблемы распределения невидимы глазу. Росс и Багнелл показали, что обучение имитации на фиксированном наборе демонстраций приводит к накапливающимся ошибкам и границе сожаления, растущей квадратично во временном горизонте: как только учащийся покидает состояния, которые посетил демонстратор, ничего в данных не говорит ему, как вернуться. DAgger исправляет это путём итерации — запустите политику, обозначьте состояния, которые она посещает, агрегируйте, переобучайте — что Росс, Гордон и Багнелл интерпретируют как сведение к обучению онлайн без сожаления.

Эта формулировка имеет следствие, которое люди пропускают. Гарантия касается последовательности политик над итерациями, а не любого одного прогона. Она ничего не говорит о том, помогли ли ваши раунды три. Единственный способ узнать — измерить каждую итерацию. Келли и коллеги представили HG-DAgger, потому что классический DAgger просит эксперта обозначить действия, пока новичок всё ещё управляет, что статья утверждает, может снизить безопасность и, с людьми-экспертами, вероятно, ухудшит качество разметки из-за воспринимаемой задержки исполнителя. HG-DAgger также изучает порог безопасности для метрики риска на основе неопределённости модели и сообщает об улучшенной производительности над DAgger и поведенческим клонированием в задаче вождения. Он не публикует счётчики вмешательства; вы создаёте их сами.

Определение коэффициента так, чтобы два человека получили одно и то же число

Определение — одна строка: кадры вмешательства разделены на кадры прогона. Все трудности скрыты в том, что считается кадром и что считается прогоном.

Кадры, не эпизоды

Подсчёт эпизодов с хотя бы одним вмешательством бесполезен: десять эпизодов с одним толчком каждый и десять, в которых вы управляли восемьдесят процентов, оба дают «10/10». Подсчёт кадров разделяет их, и это уже имеющаяся в записи гранулярность — в формате набора данных LeRobot каждый временной шаг — это строка, поэтому флаг вмешательства — это один логический столбец рядом с состоянием и действием. Здесь он записывается за кадр в момент начала перехвата и очищается, когда управление возвращается.

Знаменатель включает коррекции

Два знаменателя оправданы — общие кадры прогона или кадры, которыми политика управляла автономно — и они плохо расходятся на высоких уровнях вмешательства. Возьмите управление на 400 из 1000 кадров, и первый даёт 40 процентов, второй 67 процентов. Сравнение одного раунда, измеренного первым способом, с следующим, измеренным вторым, — вот как реальное улучшение исчезает. Возьмите общие кадры и никогда не пересматривайте выбор во время серии.

Решите один раз, что происходит с кадрами передачи

Всегда есть шов. Когда управление передаётся, некоторые кадры не принадлежат ни одной стороне: рука удерживается, лидер выравнивается, запись заморожена. В этом конвейере эти кадры передачи остаются в необработанном потоке и никогда не входят в обработанный эпизод — они не являются поведением политики и не стоят коррекции для обучения. Считайте шов одинаково каждый раунд: при 30 Гц шесть перехватов с двусекундным швом каждый — это 360 кадров, достаточно, чтобы сдвинуть процентный пункт.

Три решения, которые нарушают сравнимость

Кадры или эпизоды; полный прогон или только автономный; кадры передачи включены или нет. Любое из трёх, изменённых бесшумно между раундами, делает кривую бессмысленной. Запишите все три.

Логирование, чтобы число пережило сеанс

Метрика на панели статуса выполняющегося процесса — это показание: она исчезает при перезагрузке и не может быть отображена. Одна строка только-добавление на прогон охватывает всю серию — включая какой checkpoint вы управляли, так как это изменяется каждый раунд и перепутывание их делает недействительным всё, что следует.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Одна строка за прогон. Запись знаменателя и соглашения передачи рядом с числом имеет большее значение, чем имена полей.

Два поля несут вес. train_mix — это то, что вы дали следующей работе обучения; без неё ничто не может быть приписано. eval_protocol называет фиксированный тест, который вы запустили впоследствии, и это поле чаще всего оставляется пустым. В кабине ay-robots статус перехвата сообщает количество кадров вмешательства для текущего сеанса, поэтому логирование — это транскрипция, а не инструментирование; документация набора данных охватывает, где заканчиваются столбцы за кадр.

Матрица конфигурации обучения, показывающая политики, наборы данных и checkpoints рядом
Каждый раунд изменяет checkpoint и смешивание набора данных. Число, комбинация которого не была записана, не может быть приписано.

Чтение кривой: три раунда, один вердикт

Три раунда — это минимум для показания, потому что две точки всегда линия. Таблица ниже — это шаблон бухгалтерского учёта с заполнителями чисел, а не измерения из какого-либо прогона. Вы ищете монотонное уменьшение, совпадающее с увеличением успеха на фиксированном тесте.

РаундУправляемый checkpointКадрыКадры вмешательстваКоэффициентУспехи (из 20)
0 (базовый)базовая политика5 9001 38023,4 %7
1из смешивания раунда 05 61098017,5 %10
2из смешивания раунда 15 41261111,3 %11
3из смешивания раунда 25 38059811,1 %12

Раунды один и два выполняют работу. Раунд три — нет: 11,3 против 11,1 процента находится внутри вариации от прогона к прогону всего, что измеряется на физической руке, и четвёртый раунд одних и тех же коррекций тратит полдень впустую. Плоский сегмент говорит: измените что-то структурное.

  • Оставшиеся сбои не исправляются телеуправлением — объект вне досягаемости, геометрия захвата, сустав на пределе. Никакие данные коррекции не исправляют кинематическую стену.
  • Коррекций слишком мало по сравнению с базовым набором данных, чтобы сдвинуть градиент, и ничто их не взвешивает.
  • Коррекции противоречат друг другу, поэтому политика усредняет две стратегии и приземляется между ними.
  • Сбой находится выше по течению: камера сдвинулась, освещение изменилось, вид запястья больше не совпадает с обучением.
  • Задача находится на потолке этого класса политик на этом оборудовании, и следующий шаг — больше базовых данных.

Последние два — это не сбои цикла. В Sirius-Fleet снижающаяся необходимость в человеке — это запроектированный результат: по мере совершенствования автономности робота его предикторы аномалий адаптируют свои критерии предсказания, приводя к меньшему количеству запросов на вмешательство человека и постепенно снижая рабочую нагрузку человека с течением времени. Там критерий адаптируется намеренно. В вашем ручном цикле ваш также адаптируется, молча — поэтому коэффициент, выравнивающийся потому, что задача находится на потолке, выглядит точно так же, как выравнивающийся потому, что оператор перестал замечать. Это следующая проблема.

Ловушка 1: падающий коэффициент — это не растущий коэффициент успеха

Коэффициент вмешательства измеряет ровно одно: какую часть прогона вы решили контролировать. Это решение принимаете вы, принимаемое в реальном времени, и оно меняется. В раунде нуль вы берёте управление при первом плохом угле подхода; к раунду три вы видели, как политика восстанавливается от дюжины из них, и вы даёте ей попробовать. Ваш порог сдвинулся; политика может и не сдвинуться. Коэффициент падает в любом случае.

Человеческое доверие — это хотя бы моделируемая величина в литературе, а не предполагаемая константа. Sirius переотвешивает образцы обучения приблизительным человеческим доверием и оптимизирует политику с помощью взвешенного поведенческого клонирования, сообщая о росте на 8 процентов в симуляции и 27 процентов на реальном оборудовании по сравнению с передовым уровнем в коэффициенте успеха политики, в два раза быстрее сходимости. Это рассматривает доверие как вес на данные. Это не исправляет порог в вашей голове между раундом нуль и раундом три.

Вы не можете устранить дрейф, поэтому свяжите коэффициент с чем-то, чего ваш порог не может коснуться: фиксированный набор проб, в которых вы вообще не вмешиваетесь, оценённый по критерию, написанному перед раундом. Коэффициент, который падает, пока парный коэффициент успеха остаётся на месте, — это подпись привыкания — стоит поймать, потому что изнутри цикла это кажется прогрессом.

Коэффициент вмешательстваКоэффициент успеха на фиксированном протоколеНаиболее вероятное показание
падаетрастётРаунд сработал. Продолжайте.
падаетплоскийВаш порог сдвинулся, или коррекции удалили усилие без удаления сбоев.
падаетпадаетКоррекции деградируют политику. Проверьте смешивание и их внутреннюю согласованность.
плоскийплоскийРаунд ничего не купил. Измените смешивание, checkpoint или задачу перед сбором большего.
растётпадаетРегрессия. Подозревайте смешивание обучения, изменённую камеру или путаницу checkpoints перед подозрением в методе.

Ловушка 2: без фиксированного протокола вы измеряете комнату

Оценка на настоящем роботе дорогая и трудно повторяемая. Авторы SIMPLER мотивируют моделируемую оценку наблюдением, что оценка таких политик в реальном мире не масштабируемо и сталкивается с проблемами воспроизводимости, которые, вероятно, усугубятся, когда политики расширят свой спектр задач. RoboArena атакует это с другой стороны, с более чем 600 парными эпизодами оценки на настоящем роботе среди семи обобщённых политик, запущенными оценщиками на семи академических учреждениях на платформе DROID. Его оценщики выбирают свои собственные задачи и среды, но должны судить пары политик вслепую; статья сообщает, что это краудсорсированное ранжирование отслеживает производительность обобщённой политики более точно, чем условная, централизованная оценка.

Вы не запустите 600 парных эпизодов на одном SO-100 в мастерской. Что вы можете сделать, так это удалить дисперсию, которую вы контролируете — список достаточно скучный, чтобы его обычно пропускали.

ИзмерениеЗаморозьте этоЧто дрейфует, если вы этого не сделаете
Исходная позаПисьменная домашняя позиция, управляемая перед каждой пробойТраектория начинается вне распределения
ОбъектыОтмеченные места, и те же физические объекты, зарезервированные для оценки«Лучшая» политика на самом деле — это более близкий объект
Камеры и светОдинаковые крепления, индексы, выдержка; жалюзи закрыты; сфотографируйте установкуТолько переставленные индексы камер могут доминировать результат
Пробы и правило остановкиФиксированное n, фиксированный таймаут, критерий, написанный перед раундомПостфактум критерии превращают почти-промахи в то, что вам нужно
Поведение оператораНет вмешательств во время оценочных пробОценка становится ещё одним сеансом коррекции

Затем арифметика, жестокая при количествах проб, которые может позволить себе мастерская. При нормальной аппроксимации 60-процентный успех за 20 проб несёт стандартную ошибку около 11 процентных пунктов — квадратный корень из 0,6 раза 0,4 за 20 — и разница между двумя такими раундами примерно 15. Прыжок с 60 на 70 процентов, следовательно, согласуется с тем, что ничего не произошло. Пятьдесят проб приводят показатель за раунд примерно к 7 пунктам и стоят полдня.

Эта асимметрия — это аргумент за коэффициент вмешательства: вычисляется за тысячи кадров, а не за двадцать двоичных результатов, он движется раньше и плавнее. Оговорка в том, что кадры внутри эпизода сильно коррелированы — один плохой захват даёт сто последовательных кадров вмешательства — поэтому эффективный размер выборки ближе к количеству перехватов. Рассматривайте коэффициент как ранний индикатор и коэффициент успеха как медленную наземную истину.

Держите оценочные эпизоды вне пула обучения

Оценочные эпизоды никогда не должны входить в составленный набор данных обучения — иначе раунд n+1 оценивается на данных, на которых он был обучен, и кривая измеряет запоминание.

Ловушка 3: обучение только на коррекциях изгибает политику

Коррекции — это интересные данные, поэтому инстинкт — обучать на них. Не делайте этого. Они приходят по конструкции из узкого среза пространства состояний, где политика уже терпела неудачу, и говорят почти ничего о большинстве прогона, который сработал. Тонко настройте только на этот срез, и вы получите политику, хорошую в восстановлении после испорченного подхода, которая забыла, как сделать чистый подход.

Мандлекар и коллеги построили свою систему удалённого вмешательства вокруг этого. Их формулировка: задачи манипуляции содержат узкие места, требующие последовательности точных действий — вставка стручка в кофемашину — это их пример — где небольшие отклонения приводят в состояния, которые демонстрации никогда не охватывали. Их алгоритм итеративно обучается новым данным, так что политика учится преодолевать эти узкие места, и они сообщают, что агенты, обученные на данных вмешательства, превосходят агентов, обученных эквивалентному количеству образцов от неинтервенционных демонстраторов.

Точная настройка только коррекций в сравнении со смешанной смесью
Что вам даёт только коррекция
  • Быстро: короткий прогон за несколько десятков эпизодов дешёв достаточно, чтобы повторить
  • Целевой: градиент доминируется состояниями, о которых вы заботитесь
  • Дешево для тестирования, усваивается ли вообще стиль коррекции
Что это стоит
  • Распределение тонкой настройки больше не напоминает распределение задач
  • Номинальное поведение может видимо деградировать в течение одного раунда
  • Коэффициент может падать, пока успех падает с ним — чистые сегменты, обменённые на восстановления

Коэффициент смешивания — это гиперпараметр и заслуживает быть записанным. Составление следующего набора данных — это то, где это решается: исходные демонстрации плюс набор коррекций, выбор эпизода явно на источник, а не правило, которое тихо тянет, что доступно. Здесь это один шаг составления в кабине, и результат — это обычный набор данных — см. документацию обучения. Ни один инструмент не записывает, какой коэффициент произвёл какую кривую.

Ловушка 4: человек — не последовательный эксперт

Теория DAgger предполагает эксперта. Вы не один в техническом смысле: ваши коррекции — это не образцы из фиксированного условного распределения над действиями. Авторы ACT называют это при перечислении препятствий для тонкой манипуляции — ошибки накапливаются с течением времени, и человеческие демонстрации могут быть нестационарными. Их система всё ещё достигает 80–90 процентов успеха на шести реальных задачах из десяти минут демонстраций, поэтому проблема решаема, а не отсутствует.

Исследование robomimic делает точку со стороны данных. Среди шести офлайн алгоритмов на пяти моделируемых и трёх реальных многоэтапных задачах его уроки включают чувствительность к выбору дизайна, зависимость от качества демонстрации и — самый болезненный здесь — вариабельность, вытекающая из критериев остановки, потому что цели обучения и оценки отличаются. Checkpoint с наименьшей потерей — это не надёжно тот, с наивысшим коэффициентом успеха.

Существует аппаратная версия этого: режим ввода формирует коррекцию. лидер-последователь настройка производит непрерывные, управляемые человеком траектории. Клавишные толчки сильно зажимаются сервером — два градуса за вызов на суставах руки, четыре на захвате — поэтому одно и то же намерение приходит как лестница из маленьких шагов. Ползунки отправляют абсолютные цели, и сервер движется не более чем на шесть градусов к ним за вызов. Три режима, три распределения действий; смешивание всех трёх в один набор коррекций и затем удивление, почему подход стал нервным, — самопричинённое. документация телеуправления охватывает то, что каждый режим отправляет.

Взвешивание вмешательств: IWR и то, что пришло после

Если коррекции — это ценное меньшинство, принципиальное исправление — это вес, а не исключительность. Intervention Weighted Regression — это эталонная реализация: данные разбиваются на образцы вмешательства и отсутствия вмешательства, и две разделы выбираются в равной пропорции во время обучения. Набор коррекций, составляющий пять процентов кадров, затем вносит половину градиента, без того, чтобы номинальное поведение исчезало из распределения.

Равная пропорция — это начальная точка, не закон. Sirius обобщает это, заменяя двоичное разделение непрерывным весом приблизительного человеческого доверия; Sirius-Fleet перемещает решение выше по течению, используя визуальную мировую модель и предикторы аномалий, чтобы решить, когда человека вообще спрашивают. Общая нить: флаг вмешательства — это сигнал обучения, а не только столбец бухгалтерского учёта.

МетодКто решает, когда человек действуетКак используются данные вмешательстваСообщённый результат
DAgger (2011)Фиксированное расписание; эксперт обозначает посещённые состоянияОдин растущий набор данных, невзвешенныйСформулировано как сведение к обучению онлайн без сожаления
HG-DAgger (2019)Человек, управление воротами на реальной системеАгрегировано; плюс усвоенный порог безопасности на неопределённость моделиЛучше, чем DAgger и BC в вождении; счётчики вмешательства не даны
IWR (2020)Человек, через удалённое телеуправлениеОбразцы вмешательства и отсутствия вмешательства рисуются в равной пропорцииПобеждает неинтервенционные демо при равном количестве образцов
Sirius (2022)Человек, во время развёртыванияВзвешенный BC, веса из приблизительного человеческого доверияВыигрыш 8 % в симуляции, 27 % на реальном оборудовании; сходимость в 2 раза быстрее
ThriftyDAgger (2021)Система, управление на новизну и рискИнтерактивная коллекция под бюджетом надзораИсследование пользователя (N=10): на 58 % выше человеческая и на 80 % выше производительность робота, чем следующий лучший метод
Fleet-DAgger (2022)Система, выделение внимания по флотуОбучение флота, оценённое по возврату на человеческие усилияДо 8,8x выше ROHE, чем базовые
Sirius-Fleet (2024)Предикторы аномалий с самоадаптирующимися критериямиМногозадачное обучение с визуальной мировой модельюМеньше запросов на вмешательство по мере совершенствования автономности
Вид таблицы лидеров, сравнивающий политики роботов по измеренному баллу
Ранжирование политик друг против друга означает что-то только если каждая запись запустила один и тот же протокол. Это также относится к вашим трём раундам.

Четыре метрики, стоящие логирования рядом с коэффициентом

  • Перехваты за прогон. Двадцать коротких коррекций и одна длинная дают похожие коэффициенты и описывают разные политики — одна нервная, одна с одной слепой зоной.
  • Средняя длина вмешательства. Растущая длина с падающим счётом означает, что оставшиеся сбои — это сложные, что выглядит как поздний прогресс.
  • Время до первого вмешательства. Политика, которая продвигается дальше перед нужной помощью, улучшается, даже если общий коэффициент плоский.
  • Где вмешательства скапливаются. Разместите флаг по нормализованному прогрессу эпизода; стабильный пик через раунды указывает на одно узкое место.

Протокол раунда, который вы действительно можете запустить

Измеренный раунд имеет шесть шагов и производит одну строку в журнале. Первые четыре — это цикл; последние два делают его измерением.

  1. 1
    Заморозьте протокол оценки перед раундом нуль

    Запишите исходную позу, размещение объектов, камеры, количество проб, таймаут и критерий успеха. Сфотографируйте стол. Если документ должен измениться, серия перезапускается.

  2. 2
    Измерьте базовый уровень

    Запустите протокол без вмешательств и записите успехи; затем запустите один инструментированный сеанс с включённым перехватом и записите коэффициент. Эти два числа — раунд нуль.

  3. 3
    Собирайте коррекции в одном последовательном стиле

    Один режим ввода за раунд, один оператор, если вы можете управлять. Возьмите управление на критерии, который вы можете произнести вслух — «захват более чем на два сантиметра смещён при подходе» — и держите его за раунд.

  4. 4
    Сортируйте каждый эпизод в один день

    Коррекция, оценка или отказ. Двусмысленные эпизоды отбрасываются, не сохраняются на теории, что больше данных помогает — коррекция, в которой вы сами запутались, хуже, чем нет эпизода.

  5. 5
    Составьте смесь явно

    Исходные демонстрации плюс коррекции, выбор эпизода за источник. Записите базовый счётчик, счётчик коррекции и любое взвешивание — это поле, которое вам понадобится через три недели.

  6. 6
    Продолжите от checkpoint, затем переизмеряйте

    Обучите составленный набор данных из предыдущего checkpoint, а не базовой модели, запустите замороженный протокол плюс один инструментированный сеанс, добавьте строку и сравните с предыдущими двумя раундами.

Два ограничения изменяют то, как вы читаете слабый раунд. Продолжение от checkpoint инициализирует веса из него — не возобновление оптимизатора, поэтому расписание начинается заново и короткий прогон из сходящегося checkpoint может переместиться очень мало. И движение выравнивания лидера в начале перехвата имеет наименьший пробег на реальном оборудовании всего в цепи; если коррекции все начинаются с нечётного переходного процесса, посмотрите там, прежде чем винить смесь.

Измеренный цикл, уже подключённый

ay-robots реализует эти шесть шагов как функции продукта: возьмите управление во время прогона от лидер-руки, клавиатуры или ползунков, с флагами кадров вмешательства автоматически; сортируйте каждый эпизод как коррекция, оценка или отказ; составьте следующий набор данных из исходных демонстраций плюс коррекции, выбор эпизода явно за источник; и начните следующий прогон обучения от предыдущего checkpoint вместо базовой модели.

Посмотрите, как работает DAgger-цикл

Что числа не могут вам рассказать

Ничто из этого не решено, и аккуратная кривая не должна вас убеждать иначе. Коэффициент вмешательства измеряет совместную систему — политика, оборудование, оператор, комната — и не приписывает ничего сама по себе. Он не может судить, были ли коррекции хорошими, и он с удовольствием упадёт на задачу, которая стала проще, потому что объект сдвинулся на два сантиметра ближе за три недели.

Что он делает, так это превращает смутное впечатление в столбец, с которым вы можете спорить. Альтернатива — это не лучшая метрика; это три недели сбора коррекций, которые кривая сказала бы вам, после раунда три, прекратить сбор. Обзорная литература определяет интерактивное обучение имитации как обратную связь от человека, даваемую периодически во время выполнения робота, позволяя онлайн улучшение поведения; семья широка, и никакое расположение её не работает без числа за раунд. См. также руководство SO-100 по обучению имитации для базового набора данных, против которого вы смешиваете, запуск политики для стороны вывода, и страница DAgger-цикла для реализованного конвейера.

Является ли коэффициент вмешательства просто один минус коэффициент успеха?

Нет. Коэффициент измеряет, какую часть прогона вы взяли; коэффициент успеха измеряет, завершилась ли задача без вас. Прогон может завершиться с 30-процентным коэффициентом вмешательства, и прогон без вмешательств может полностью не пройти. Они также отличаются шумом: коэффициент движется плавно за тысячи коррелированных кадров, коэффициент успеха прыгает между несколькими двоичными результатами. Логируйте оба.

Сколько оценочных проб мне нужно, чтобы коэффициент успеха что-то означал?

Больше, чем кажется разумным. При нормальной аппроксимации, 20 проб при истинном 60-процентном коэффициенте успеха несут стандартную ошибку около 11 процентных пунктов, поэтому движение на 10 пунктов между раундами неотличимо от шума; 50 проб приводят эту цифру примерно к 7. Если вы не можете позволить себе 50, держите количество проб одинаковым по раундам и рассматривайте маленькие движения как неубедительные.

Какой коэффициент смешивания демонстраций и коррекций я должен начать?

Документированная начальная точка — это IWR: разбейте данные на образцы вмешательства и отсутствия вмешательства и рисуйте их в равной пропорции, так что коррекции вносят половину градиента, однако малую фракцию кадров они есть. Если ваша установка не может взвешивать выборку, приблизьте через счётчики эпизодов при составлении набора данных и запишите коэффициент. Обучение только на коррекциях — это опция, которую нужно исключить.

Мой коэффициент вмешательства повысился после раунда. Раунд потрачен впустую?

Необязательно, но сначала проверьте скучные объяснения: совпадал ли checkpoint, которым вы управляли, с тем, на котором вы тренировались, изменился ли индекс камеры или крепление, дрейфовало ли размещение объектов, был ли стиль коррекции последовательным. Если все четыре чистые и парный коэффициент успеха также упал, подозревайте смесь — слишком мало базовых демонстраций против коррекций или коррекции, которые противоречат друг другу. Подлинная регрессия принадлежит журналу, не мусорным бакам.

Могу ли я пропустить фиксированный протокол оценки и просто смотреть коэффициент вмешательства?

Только если вы принимаете, что вы не можете отличить улучшение от привыкания. Коэффициент зависит от вашего собственного порога в реальном времени для вмешательства, и этот порог падает по мере того, как вы привыкаете к причудам политики. Замороженный протокол — это часть измерения, которой ваш порог не может достичь — отмеченные места, письменная домашняя поза, фиксированный счётчик проб, критерий, решённый перед раундом. Это должно оставаться неизменным по всей серии.

Держите журнал в хранилище, не в ноутбуке: раунды разделены днями, оборудование перестраивается, и человек, читающий кривую в октябре — это вы без памяти августа. документация часто задаваемых вопросов охватывает операционные детали, оставленные здесь.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started