
Wskaźnik interwencji - ramki interwencji podzielone przez ramki przebiegu - jest najtańszym uczciwym sygnałem postępu, jaki ma pętla DAgger sterowana przez człowieka. Artykuł definiuje go tak, aby dwie osoby obliczyły tę samą wartość, pokazuje, jak go rejestrować, i omawia cztery sposoby, w jakie cię zwodzi: przyzwyczajenie operatora, dryfującą konfigurację ewaluacji, trening tylko na poprawkach oraz człowieka, który koryguje inaczej we wtorek niż w poniedziałek.
Runda DAgger wydaje się produktywna, gdy się w niej znajdujesz. Prowadzisz politykę, przejmujesz kontrolę, gdy potknie się o chwycenie, zapisujesz poprawki, przeprowadzasz retraining, i następny przebieg wygląda - przysięgłbyś - trochę gładziej. Dwie rundy później nie potrafisz powiedzieć, czy cokolwiek się zmieniło, bo "trochę gładziej" nie jest wielkością.
Pętla potrzebuje jednej liczby na rundę, a w pętli sterowanej przez człowieka ta liczba jest prawie darmowa: część przebiegu, w której miałeś kontrolę zamiast polityki. Artykuł definiuje to tak, aby dwie osoby obliczyły tę samą wartość, rejestruje to, odczytuje wynikową krzywą i wymienia cztery sposoby, w jakie cię zwodzi, gdy stoi samodzielnie. Aby zapoznać się z teorią, którą ten artykuł zakłada, zobacz wyjaśnienie DAgger oraz wariant sterowany przez człowieka; praktycznym odpowiednikiem jest uruchomienie pętli DAgger na SO-100.
Krótka wersja
- •Wskaźnik interwencji = ramki interwencji / ramki przebiegu. Ramki, nie epizody, a mianownik obejmuje ramki, które spędziłeś na korygowaniu.
- •Płaska krzywa przez trzy rundy oznacza, że rundy niczego nie kupują - zmień mieszankę, punkt kontrolny lub zadanie zamiast zbierać czwartą.
- •Spadający wskaźnik interwencji nie jest rosnącym wskaźnikiem sukcesu. Twój próg interwencji spada wraz ze wzrostem zaufania.
- •Bez zamrożonego protokołu ewaluacji - te same początkowe pozycje, obiekty, kamery, liczba prób - mierzysz pomieszczenie.
- •Trening tylko na poprawkach pochyla rozkład stanu. Odpowiedź IWR: rysuj próbki interwencji i braku interwencji w równych proporcjach.
Dlaczego runda w ogóle potrzebuje liczby
DAgger istnieje z powodu problemu rozkładu, a problemy rozkładu są niewidoczne dla oka. Ross i Bagnell pokazali, że imitation learning na ustalonym zestawie demonstracji prowadzi do narastających błędów i ograniczenia skruchy rosnącego kwadratowo w horyzoncie czasowym: gdy uczeń opuści stany odwiedzane przez demonstratora, nic w danych nie mówi mu, jak wrócić. DAgger to naprawia poprzez iterację - uruchom politykę, oznacz stany, które odwiedza, zagreguj, dokonaj retrainingu - co Ross, Gordon i Bagnell prezentują jako redukcję do nauki online bez skruchy.
To ujęcie ma konsekwencję, którą ludzie pomijają. Gwarancja dotyczy sekwencji polityk na iteracjach, nie żadnego pojedynczego przebiegu. Mówi nic o tym, czy twoja runda trzy pomogła. Jedynym sposobem na wiedzę jest zmierzenie każdej iteracji. Kelly i współpracownicy wprowadzili HG-DAgger, ponieważ klasyczny DAgger prosi eksperta o etykiety akcji, gdy początkujący jest jeszcze w kontroli, co artykuł twierdzi może zmniejszyć bezpieczeństwo i, w przypadku ekspertów człowieka, może pogorszyć jakość etykiet poprzez postrzeganą opóźnienie siłownika. HG-DAgger również uczy się progu bezpieczeństwa dla metryki ryzyka opartej na niepewności modelu i raportuje ulepszoną wydajność w stosunku zarówno do DAgger jak i behavioral cloning na zadaniu jazdy. Nie publikuje liczników interwencji; te wyprodukujesz sam.
Definiowanie wskaźnika tak, aby dwie osoby uzyskały tę samą liczbę
Definicja to jeden wiersz: ramki interwencji podzielone przez ramki przebiegu. Wszystko trudne kryje się w tym, co liczy się jako ramka i co liczy się jako przebieg.
Ramki, nie epizody
Liczenie epizodów z co najmniej jedną interwencją jest bezużyteczne: dziesięć epizodów z jednym pchnięciem każdy i dziesięć, w których prowadziłeś osiemdziesiąt procent, obydwa dają "10/10". Liczba ramek je rozdziela, i jest to ziarnistość, którą zapis już ma - w formacie zestawu danych LeRobot każdy krok czasowy to wiersz, więc flaga interwencji to jedna kolumna logiczna obok stanu i akcji. Tutaj jest napisane na ramkę w momencie rozpoczęcia przejęcia i wyczyszczone, gdy kontrola powraca.
Mianownik obejmuje poprawki
Dwa mianowniki są obronne - całkowite ramki przebiegu lub ramki, które polityka prowadziła autonomicznie - i różnią się znacznie przy wysokim poziomie interwencji. Przejmij kontrolę na 400 z 1000 ramek, a pierwszy daje 40 procent, drugi 67 procent. Porównanie jednej rundy zmierzonej w pierwszy sposób do następnej zmierzonej w drugi jest jak rzeczywista poprawa znika. Weź całkowite ramki i nigdy nie powracaj do tego wyboru w środku serii.
Zdecyduj raz, co się dzieje z ramkami przekazywania
Zawsze jest szew. Gdy kontrola przechodzi, niektóre ramki należą do żadnej strony: ramię jest trzymane, lider się wyrównuje, zapis jest zamrożony. W tym potoku te ramki przekazywania pozostają w surowym strumieniu i nigdy nie wchodzą do kurowanego epizodu - są ani zachowaniem polityki ani poprawką godną treningowania. Licz szew w ten sam sposób każdą rundę: przy 30 Hz sześć przejęć z dwusekundowym szewem każdy to 360 ramek, wystarczająco, aby przesunąć punkt procentowy.
Ramki lub epizody; całkowity przebieg lub tylko autonomiczny; ramki przejęcia wewnątrz lub na zewnątrz. Każdy z trzech zmieniony w ciszy między rundami czyni krzywą bezsensowną. Zapisz wszystkie trzy.
Rejestrowanie go, aby liczba przetrwała sesję
Metryka w panelu stanu procesu uruchomionego jest wskazaniem: znika przy ponownym uruchomieniu i nie można jej wykreślić. Jeden wiersze tylko do dołączenia na przebieg obejmuje całą serię - w tym który punkt kontrolny prowadziłeś, ponieważ zmienia się każdą rundę i pomylenie ich unieważnia to, co następuje.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dwa pola noszą wagę. train_mix to to, co podałeś do następnego zadania treningowego; bez niego nic nie można przypisać. eval_protocol wymienia ustalony test, który przeprowadziłeś później, i jest polem najczęściej pozostawianym pustym. W kokpicie ay-robots status przejęcia zgłasza liczbę ramek interwencji dla bieżącej sesji, więc rejestrowanie jest przepisywaniem niż oprzyrządowaniem; dokumentacja zestawu danych obejmuje, gdzie wylądują kolumny na ramkę.

Czytanie krzywej: trzy rundy, jeden werdykt
Trzy rundy to minimum do odczytania, bo dwa punkty są zawsze linią. Poniższa tabela to szablon księgowości z liczbami zastępczymi, a nie pomiarami z żadnego przebiegu. Szukasz monotonnego spadku dopasowanego przez wzrost sukcesu na ustalonym teście.
| Runda | Punkt kontrolny prowadzony | Ramki | Ramki interwencji | Wskaźnik | Sukcesy (z 20) |
|---|---|---|---|---|---|
| 0 (linia bazowa) | polityka bazowa | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | z mieszanki rundy 0 | 5 610 | 980 | 17,5 % | 10 |
| 2 | z mieszanki rundy 1 | 5 412 | 611 | 11,3 % | 11 |
| 3 | z mieszanki rundy 2 | 5 380 | 598 | 11,1 % | 12 |
Rundy jeden i dwie wykonują pracę. Runda trzy nie: 11,3 przeciw 11,1 procent jest w wariancie zmieniającym się z przebiegu na przebieg czegokolwiek mierzonego na fizycznym ramieniu, a czwarta runda tych samych poprawek spędza popołudnie na niczym. Płaski segment mówi zmienić coś strukturalnie.
- Pozostałe niepowodzenia nie są korygowalne poprzez teleoperację - obiekt poza zasięgiem, geometria chwytaka, połączenie u jego granic. Żadne dane poprawek nie naprawiają kinematycznej ściany.
- Poprawki są zbyt małe w stosunku do zestawu danych bazowych, aby przesunąć gradient, i nic ich nie waży.
- Poprawki się ze sobą kłócą, więc polityka uśrednia dwie strategie i ląduje między nimi.
- Niepowodzenie jest upstream: kamera się poruszyła, oświetlenie się zmieniło, widok nadgarstka już nie pasuje do treningowania.
- Zadanie jest na suficie tej klasy polityki na tym sprzęcie, a następnym krokiem są więcej dane bazowe.
Ostatnie dwie to nie niepowodzenia pętli. W Sirius-Fleet malejąca potrzeba człowieka to zaprojektowany wynik: w miarę poprawy autonomii robota jego predyktory anomalii dostosowują swoje kryteria prognozowania, co prowadzi do mniej wniosków o interwencję człowieka i stopniowo zmniejsza obciążenie człowieka w czasie. Tam kriterium celowo się dostosowuje. W pętli ręcznej twoje również się dostosowuje, cicho - więc wskaźnik, który się spłaszcza dlatego że zadanie jest na suficie, wygląda dokładnie jak jeden, który się spłaszczy dlatego że operator przestał zauważać. To następny problem.
Pułapka 1: spadający wskaźnik nie jest rosnącym wskaźnikiem sukcesu
Wskaźnik interwencji mierzy dokładnie jedną rzecz: ile przebiegu zdecydowałeś przejąć. Ta decyzja jest twoja, podejmowana w czasie rzeczywistym, i się porusza. W rundzie zero przejmujesz kontrolę przy pierwszym złym kącie podejścia; do rundy trzy oglądałeś jak polityka wraca z tuzina i puszczasz ją spróbować. Twój próg się przesunął; polityka może nie. Wskaźnik spada w każdym razie.
Zaufanie człowieka jest przynajmniej modelowaną wielkością w literaturze zamiast założonej stałej. Sirius ponownie waży próbki treningowe z przybliżonym zaufaniem człowieka i optymalizuje politykę z ważonym behavioral cloning, raportując 8 procentowy wzrost w symulacji i 27 procent na rzeczywistym sprzęcie nad stanem sztuki w wskaźniku sukcesu polityki, przy dwukrotnej prędkości konwergencji. To traktuje zaufanie jako wagę w danych. Nie poprawia to progu w twojej głowie między rundą zero a rundą trzy.
Nie możesz usunąć dryf, więc powiąż wskaźnik z czymś, czego twój próg nie może dotknąć: ustalonym zestawem prób, w którym w ogóle się nie ingerują, ocenianym względem kryterium napisanego przed rundą. Wskaźnik, który spada, gdy sparowany wskaźnik sukcesu pozostaje w miejscu, to sygnatura przyzwyczajenia - warto złapać, bo z wewnątrz pętli to wygląda na postęp.
| Wskaźnik interwencji | Wskaźnik sukcesu na ustalonym protokole | Najbardziej prawdopodobne czytanie |
|---|---|---|
| spada | rośnie | Runda zadziałała. Kontynuuj. |
| spada | płaska | Twój próg się przesunął, lub poprawki usunęły wysiłek bez usunięcia niepowodzeń. |
| spada | spada | Poprawki degradują politykę. Sprawdź mieszankę i ich wewnętrzną spójność. |
| płaska | płaska | Runda niczego nie kupiła. Zmień mieszankę, punkt kontrolny lub zadanie przed zebraniem więcej. |
| rośnie | spada | Regresja. Podejrzewaj mieszankę treningową, zmienioną kamerę lub zamieszanie punktu kontrolnego przed podejrzewaniem metody. |
Pułapka 2: bez ustalonego protokołu mierzysz pomieszczenie
Ewaluacja na rzeczywistym robocie jest kosztowna i trudna do powtórzenia. Autorzy SIMPLER motywują ewaluację symulowaną obserwacją, że rzeczywista ewaluacja takich polityk nie jest skalowalna i napotyka wyzwania reprodukowalności, które będą się pogarszać wraz z poszerzaniem się spektrum zadań polityk. RoboArena atakuje to z drugiej strony, z ponad 600 parami rzeczywistych epizodów ewaluacji robotów na siedmiu ogólniestowych politykach, uruchomioną przez ewaluatorów w siedmiu instytucjach akademickich na platformie DROID. Jej ewaluatorzy wybierają własne zadania i środowiska, ale muszą судить pary polityk na ślepo; artykuł raportuje, że to crowdsourcingowe ranking śledzi wydajność ogólniestowej polityki dokładniej niż konwencjonalna, scentralizowana ewaluacja.
Nie będziesz uruchamiać 600 sparowanych epizodów na jednym SO-100 w warsztacie. Co możesz zrobić, to usunąć wariancję, którą kontrolujesz - listę nudną wystarczająco, aby zwykle została pominięta.
| Wymiar | Zamrozić to | Co się dryfuje, jeśli nie |
|---|---|---|
| Początkowa pozycja | Napisana pozycja domowa, prowadzona przed każdą próbą | Trajektoria zaczyna się poza rozkładem |
| Obiekty | Zaznaczone znaki i te same fizyczne obiekty zarezerwowane do ewaluacji | "Lepsza" polityka to naprawdę bliższy obiekt |
| Kamery i światło | Te same mocowania, indeksy, ekspozycja; żaluzje zamknięte; sfotografuj ustawienie | Zamienione indeksy kamer mogą zdominować wynik |
| Próby i reguła zatrzymania | Ustalona n, ustalony timeout, kryterium napisane przed rundą | Kryteria post-hoc zamieniają prawie-trafienia na to, czego potrzebujesz |
| Zachowanie operatora | Brak interwencji podczas prób ewaluacji | Ewaluacja staje się inną sesją poprawek |
Wtedy arytmetyka, bezlitosna przy liczbach prób, które warsztat może sobie pozwolić. Przy normalnym przybliżeniu 60 procent sukcesu w 20 próbach nosi błąd standardowy w pobliżu 11 punktów procentowych - pierwiastek kwadratowy z 0,6 razy 0,4 w 20 - i różnica między dwiema takimi rundami nosi około 15. Skok z 60 na 70 procent jest zatem zgodny z niczym się nie zmieniającym. Pięćdziesiąt prób przynieś na-rundę figurę do około 7 punktów i kosztuje popołudnie.
Ta asymetria jest argumentem dla wskaźnika interwencji: obliczonego w tysiącach ramek zamiast dwudziestu wyników binarnych, porusza się wcześniej i bardziej gładko. Zastrzeżenie jest, że ramki w epizodzie są silnie skorelowane - jeden błędny chwytak daje sto kolejnych ramek interwencji - więc efektywny rozmiar próbki jest bliższy liczbie przejęć. Traktuj wskaźnik jako wczesny wskaźnik i wskaźnik sukcesu jako powolną absolutną prawdę.
Epizody ewaluacji nigdy nie wchodzą do skompilowanego zestawu danych treningowych - w innym razie runda n+1 jest oceniana na danych, na których została wytrenowana, i krzywa mierzy memorizację.
Pułapka 3: trening tylko na poprawkach gnie politykę
Poprawki to interesujące dane, więc instynkt jest trenować na nich. Nie rob tego. Przychodzą z konstrukcji z wąskiego wycinka przestrzeni stanu, gdzie polityka już nie powodzia się i mówią prawie nic o większości przebiegu, który zadziałał. Dostrojaj tylko na tym wycinku, a uzyskasz politykę dobrą w powrocie z sfałszowanego podejścia, która zapomniała jak zrobić czyste.
Mandlekar i współpracownicy zbudowali swój system interwencji na odległość wokół tego. Ich ujęcie: zadania manipulacji zawierają regiony wąskich gardeł wymagające sekwencji precyzyjnych akcji - wkładanie buta do kawy maszyny jest ich przykładem - gdzie małe odchylenia prowadzą do stanów, które demonstracje nigdy nie obejmowały. Ich algorytm trenuje iteracyjnie na nowych danych, aby polityka nauczyła się przechodzić przez te wąskie gardła, i raportują, że agenci wytrenowani na danych interwencji biją agentów wytrenowanych na równoważnej liczbie próbek od nieinwencyjnych demonstrantów.
- Szybko: krótki przebieg w kilkadziesiąt epizodów jest wystarczająco tani do powtórzenia
- Ukierunkowany: gradient jest zdominowany przez stany, na których ci zależy
- Tanie do testowania, czy styl poprawki jest w ogóle możliwy do nauki
- Rozkład dostrojenia już nie przypomina rozkładu zadania
- Nominalne zachowanie może się pogarszać widoczenie w obrębie jednej rundy
- Wskaźnik może spaść, gdy sukces pada z nim - czyste segmenty wymieniane na powroty
Współczynnik mieszania to hiperparametr i zasługuje na to, aby być zapisanym. Komponowanie następnego zestawu danych to miejsce, gdzie jest decyzja: oryginalne demonstracje plus zbiór poprawek, wybór epizodu jawny na źródło zamiast reguły, która cicho pociąga w cokolwiek jest dostępne. Tutaj to jeden krok compose w kokpicie, a wynik to zwykły zbiór danych - zobacz dokumentacja treningowa. Co żaden narzędzie nie robi dla ciebie, to rejestrowanie którego współczynnika wyprodukował którą krzywą.
Pułapka 4: człowiek nie jest spójnym ekspertem
Teoria DAgger zakłada eksperta. Nie jesteś jednym w sensie technicznym: twoje poprawki to nie próbki z ustalonego rozkładu warunkowego nad akcjami. Autorzy ACT wymienią to, gdy wymienią przeszkody do precyzyjnej manipulacji - błędy nakładają się w czasie, a demonstracje człowieka mogą być niestacjonarne. Ich system nadal osiąga 80 do 90 procent sukcesu na sześciu rzeczywistych zadaniach z dziesięciu minut demonstracji, więc problem jest możliwy do leczenia, nie nieobecny.
Badanie robomimic robi punkt ze strony danych. W całej sześciu algorytmach offline w pięciu symulowanych i trzech rzeczywistych wieloetapowych zadaniach, jego lekcje obejmują wrażliwość na wybory projektowania, zależność od jakości demonstracji i - jeden, który boli tutaj najbardziej - zmienność wynikającą z kryteriów zatrzymania, ponieważ cele treningowe i ewaluacyjne się różnią. Punkt kontrolny z najniższą stratą nie jest niezawodnie tym z najwyższym wskaźnikiem sukcesu.
Jest sprzętowa wersja tego: tryb wejścia kształtuje poprawkę. lider-wyznacznik setup daje ciągłe trajektorie w tempie człowieka. Pchnięcia klawiaturą są twardo zaciśnięte przez serwer - dwa stopnie na połączenie na stawach ramienia, cztery na chwytaku - więc ta sama intencja przychodzi jako schody małych kroków. Suwaki wysyłają cele bezwzględne i serwer porusza się najwyżej o sześć stopni w kierunku nich na połączenie. Trzy tryby, trzy rozkłady akcji; mieszanie wszystkich trzech w jeden zbiór poprawek, a potem zastanawianie się dlaczego podejście stało się drażliwe to self-inflicted. dokumentacja teleoperacji obejmuje, co każdy tryb wysyła.
Ważenie interwencji: IWR i to, co przyszło później
Jeśli poprawki są wartościową mniejszością, zasadniczy fix to waga zamiast wyłączności. Intervention Weighted Regression to implementacja referencyjna: dane są podzielone na próbki interwencji i braku interwencji, i dwie partycje są próbkowane w równych proporcjach podczas treningowania. Zbiór poprawek, który stanowi pięć procent ramek, następnie przyczynia się o połowę gradientu, bez tego, że nominalne zachowanie zanika z rozkładu.
Równa proporcja to punkt początkowy, nie prawo. Sirius to uogólnia, zastępując binarną partycję ciągłą wagą z przybliżonym zaufaniem człowieka; Sirius-Fleet przesuwa decyzję upstream, używając wizualnego modelu świata i predyktorów anomalii do decyzji, kiedy człowiek jest w ogóle pytany. Wspólny wątek: flaga interwencji to sygnał treningowy, nie tylko kolumna księgowości.
| Metoda | Kto decyduje, kiedy człowiek działa | Jak dane interwencji są wykorzystywane | Raportowany wynik |
|---|---|---|---|
| DAgger (2011) | Ustalony harmonogram; expert oznacza odwiedzone stany | Jeden rosnący zbiór danych, nieważony | Ujęty jako redukcja do nauki online bez skruchy |
| HG-DAgger (2019) | Człowiek, bramkując kontrolę na systemie rzeczywistym | Zagregowany; plus nauczony próg bezpieczeństwa na niepewności modelu | Lepsze niż DAgger i BC na jazdy; brak liczników interwencji danym |
| IWR (2020) | Człowiek, poprzez zdalną teleoperację | Próbki interwencji i braku interwencji rysowane w równych proporcjach | Bije nieinwencyjne demonstracje na równoważnej liczbie próbek |
| Sirius (2022) | Człowiek, podczas wdrożenia | Ważony BC, wagi z przybliżonego zaufania człowieka | 8 % wzrost w symulacji, 27 % na rzeczywistym sprzęcie; 2x szybsza konwergencja |
| ThriftyDAgger (2021) | System, bramkując na nowości i ryzyko | Interaktywna kolekcja pod budżetem nadzoru | Badanie użytkownika (N=10): 58 % wyższe wydajność człowieka i 80 % wyższy robot niż następna najlepsza metoda |
| Fleet-DAgger (2022) | System, przydzielając uwagę na całej flocie | Uczenie floty oceniane przez Return on Human Effort | Aż 8,8 razy wyższa ROHE niż linie bazowe |
| Sirius-Fleet (2024) | Predyktory anomalii z samoadaptacyjnymi kryteriami | Wielozadaniowe uczenie się z wizualnym modelem świata | Mniej wniosków o interwencję, gdy autonomia poprawia się |

Cztery metryki warte zarejestrowania obok wskaźnika
- Przejęcia na przebieg. Dwadzieścia krótkich poprawek i jeden długi dają podobne wskaźniki i opisują różne polityki - jedna drażliwa, jedna z jedną ślepą plamą.
- Średnia długość interwencji. Rosnąca długość ze spadającą liczbą oznacza, że pozostałe niepowodzenia są trudnymi, co wygląda jak postęp końcowy.
- Czas do pierwszej interwencji. Polityka, która dostaje się dalej przed potrzebą pomocy, poprawia się, nawet gdy całkowity wskaźnik jest płaski.
- Gdzie interwencje się skupiają. Rozporządź flagę przez znormalizowany postęp epizodu; stabilny pik w rundach wskazuje na jeden wąski gardeł.
Protokół rundy, który naprawdę możesz uruchomić
Zmierzona runda ma sześć kroków i wyniku jeden wiersz w logu. Pierwsze cztery to pętla; ostatnie dwie czynią ją pomiarem.
- 1Zamróż protokół ewaluacji przed rundą zero
Zapisz początkową pozycję, umieszczenie obiektu, kamery, liczbę prób, timeout i kryterium sukcesu. Sfotografuj stół. Jeśli dokument musi się zmienić, seria się restartuje.
- 2Zmierz linię bazową
Uruchom protokół bez interwencji i zanotuj sukcesy; następnie uruchom jedną sesję oprzyrządowaną z włączoną przejęciem i zanotuj wskaźnik. Te dwie liczby to runda zero.
- 3Zbierz poprawki w jednym spójnym stylu
Jeden tryb wejścia na rundę, jeden operator, jeśli możesz. Przejmij kontrolę na kryterium, które potrafisz powiedzieć na głos - 'chwytak więcej niż dwa centymetry poza przy podejściu' - i trzymaj ją na rundę.
- 4Triage każdy epizod tego samego dnia
Poprawka, ewaluacja lub odrzucenie. Niejednoznaczne epizody są odrzucane, nie zapisywane na teorii, że więcej danych pomaga - poprawka, w której sam się potkniąłeś, jest gorsza niż żaden epizod.
- 5Komponuj mieszankę jawnie
Oryginalne demonstracje plus poprawki, wybór epizodu na źródło. Zanotuj liczbę bazową, liczbę poprawek i dowolne ważenie - to pole, które będziesz chciał za trzy tygodnie.
- 6Kontynuuj z punktu kontrolnego, a następnie ponownie zmierz
Trenuj skompilowany zbiór danych z poprzedniego punktu kontrolnego zamiast modelu bazowego, uruchom zamrożony protokół plus jedną sesję oprzyrządowaną, dołącz wiersz i porównaj z poprzednimi dwiema rundami.
Dwa limity zmieniają sposób czytania słabej rundy. Kontynuowanie z punktu kontrolnego inicjalizuje wagi z niego - nie wznowienie optymalizatora, więc harmonogram zaczyna się od nowa i krótki przebieg z zbieżnego punktu kontrolnego może przesunąć bardzo mało. A ruch wyrównania lidera na początku przejęcia ma najmniej przebiegu na rzeczywistym sprzęcie czegokolwiek w łańcuchu; jeśli poprawki wszystkie zaczynają się od dziwnego przejścia, szukaj tam zanim winisz mieszankę.
Zmierzona pętla, już podłączona
ay-robots wdraża te sześć kroków jako funkcje produktu: przejmij kontrolę w trakcie przebiegu z ramienia lidera, klawiatury lub suwaków, z automatycznie oznaczonymymi ramkami interwencji; triage każdy epizod jako poprawka, ewaluacja lub odrzucenie; komponuj następny zbiór danych z oryginalnych demonstracji plus poprawek, wybór epizodu jawny na źródło; i uruchom następne zadanie treningowe z poprzedniego punktu kontrolnego zamiast modelu bazowego.
Zobacz, jak działa pętla DAggerCo liczby nie mogą ci powiedzieć
Nic z tego nie jest rozwiązane, a schludna krzywa nie powinna cię przekonać inaczej. Wskaźnik interwencji mierzy wspólny system - polityka, sprzęt, operator, pokój - i przypisuje nic sam. Nie potrafi sądzić, czy poprawki były dobre, i będzie się ładnie spada na zadaniu, które stało się łatwiejsze, bo obiekt przesunął się dwa centymetry bliżej w ciągu trzech tygodni.
Co robi, to zamienia niejasne wrażenie na kolumnę, którą możesz się sprzeczać. Alternatywą nie jest lepsza metryka; to trzy tygodnie zbierania poprawek krzywa powiedziałaby ci, po rundzie trzeciej, aby przestać zbierać. Literatura przeglądu definiuje interaktywne imitation learning jako ludzką opinię daną przerywnie podczas wykonywania robota, pozwalając na online poprawę zachowania; rodzina jest szeroka, i nie poukład tego działa bez liczby na rundę. Zobacz również przewodnik imitation learning SO-100 dla zestawu danych bazowych, które mieszasz przeciwko, uruchomienie polityki po stronie wnioskowania, i strona pętli DAgger dla wdrożonego potoku.
Czy wskaźnik interwencji to po prostu jeden minus wskaźnik sukcesu?▾
Nie. Wskaźnik mierzy, ile przebiegu przejąłeś; wskaźnik sukcesu mierzy, czy zadanie zostało wykonane bez ciebie. Przebieg może się powieść z 30 procentowym wskaźnikiem interwencji, i przebieg bez interwencji może całkowicie się nie powieść. Różnią się również w hałasie: wskaźnik porusza się gładko w tysiącach skorelowanych ramek, wskaźnik sukcesu przeskakuje między garstką wyników binarnych. Rejestruj obydwa.
Ile prób ewaluacji potrzebuję, aby wskaźnik sukcesu cokolwiek oznaczał?▾
Więcej niż czuje się rozsądnie. Przy normalnym przybliżeniu 20 prób przy prawdziwym 60 procentowym wskaźniku sukcesu noszą błąd standardowy w pobliżu 11 punktów procentowych, więc ruch 10-punktowy między rundami nie odróżnia się od szumu; 50 prób przynieś tę figurę na około 7. Jeśli nie możesz sobie pozwolić na 50, utrzymaj liczę prób identyczną w rundach i traktuj małe ruchy jako niekonkluzywne.
Jaki współczynnik mieszania demonstracji do poprawek powinienem zacząć?▾
Udokumentowany punkt początkowy to IWR: podzielić dane na próbki interwencji i braku interwencji i rysować je w równych proporcjach, więc poprawki przyczyniają się o połowę gradientu, niezależnie od tego jak małą frakcję ramek są. Jeśli konfiguracja nie może ważyć próbkowania, przybliż to poprzez liczę epizodu przy komponowaniu zestawu danych i zanotuj współczynnik. Trening tylko na poprawkach to opcja do wykluczenia.
Mój wskaźnik interwencji poszedł w górę po rundzie. Czy runda zmarnowana?▾
Niekoniecznie, ale sprawdź nudne wyjaśnienia najpierw: czy punkt kontrolny, który prowadziłeś, zgadzał się z tym, który wytrenowałeś, czy indeks kamery lub montaż się zmienił, czy umieszczenie obiektu się przesunęło, czy styl poprawki był spójny. Jeśli wszystkie cztery są czyste i sparowany wskaźnik sukcesu również spadł, podejrzewaj mieszankę - zbyt mało demonstracji bazowych wobec poprawek, lub poprawki, które się ze sobą sprzeczają. Rzeczywista regresja należy do logu, nie do kosza.
Czy mogę pominąć ustalony protokół ewaluacji i po prostu obserwować wskaźnik interwencji?▾
Tylko jeśli zaakceptujesz, że nie możesz powiedzieć poprawę od przyzwyczajenia. Wskaźnik zależy od twojego własnego progu czasu rzeczywistego do interwencji, i ten próg spada, gdy nauczysz się dziwactw polityki. Zamrożony protokół to część pomiaru, którą twój próg nie może dotknąć - zaznaczone znaki, napisana pozycja domowa, ustalona liczba prób, kryterium zdecydowane przed rundą. To musi pozostać niezmienione w całej serii.
Trzymaj dziennik w repozytorium, nie w notebooku: rundy są dni w przepisach, sprzęt jest przebudowywany, i osoba czytająca krzywą w październiku to ty bez pamięci sierpnia. FAQ dokumentacji obejmuje szczegóły operacyjne pozostawione tutaj.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started