
Behavior cloning은 전문가의 상태 분포에 정책을 맞추고 자신의 배포에서 실행합니다. 이 두 분포 사이의 차이가 검증에서 정상으로 보이는 정책이 단계 300에서 테이블을 벗어나는 이유입니다. 이것은 우리 DAgger 시리즈의 이론 장입니다: 2차 오류항이 어디서 나오는지, Dataset aggregation이 무엇을 변경하는지, no-regret 증명이 무엇을 가정하는지, 그리고 인간 전문가가 아직도 어떤 대가를 치르는지에 대한 내용입니다.
조작 정책을 훈련하는 모든 사람이 조만간 만나는 특정한 실패가 있습니다. 정책이 큐브에 도달하고, 2센티미터 이내에 가까워지고, 망설이고, 옆으로 표류한 다음, 작업과 무관한 일을 합니다. 검증 손실은 정상이었습니다. 보유된 에피소드에 대한 오픈 루프 재생도 정상이었습니다. 그런데도 팔은 훈련 데이터에 나타나지 않는 자세에 도달하고, 거기서는 말할 수 있는 것이 없습니다.
그 실패에는 이름과 정착된 이론이 있습니다. 이것은 DAgger에 대한 4개 문서 중 첫 번째이며, 논증 자체를 다룹니다: 시연자 자신의 궤적에 대한 정책 맞추기가 에피소드 길이의 제곱으로 커질 수 있는 오류를 생성하는 이유, dataset aggregation이 변경하는 것, 그리고 no-regret 증명이 약속하지 않는 것입니다. 실제 하드웨어에서의 루프는 SO-100에서 DAgger 루프 실행에서, 인간 게이트 변형은 HG-DAgger와 인간 게이트 개입에서, 그리고 측정 문제는 DAgger 루프 측정에서 다루어집니다.
짧은 버전
- •Behavior cloning은 전문가의 상태 분포에서 훈련하고 정책 자신의 상태에서 평가됩니다. 불일치는 에피소드 전반에 걸쳐 누적됩니다.
- •Ross와 Bagnell은 추가 비용이 T 제곱 곱하기 단계당 오류로 커질 수 있음을 보였습니다. DAgger 논문은 그 한계를 다시 명시하고 이것이 tight라고 지적합니다.
- •DAgger는 정책 자신이 방문하는 상태에 레이블을 붙이고, 가장 최신의 것만이 아닌 지금까지 수집된 모든 데이터 세트에 대해 재훈련합니다.
- •보증은 no-regret online learning으로의 축소입니다: aggregating과 retraining은 Follow-The-Leader입니다.
- •이것은 0이 아닌 정책 클래스에서 달성 가능한 최선의 손실에 상대적입니다. 그리고 전문가는 여전히 그것이 생산하지 않았을 상태에 레이블을 붙여야 합니다.
Behavior cloning이 조용히 하는 가정
시연 데이터 세트는 관찰-행동 쌍의 더미입니다. Behavior cloning은 그 더미에 함수를 맞추고 그것으로 멈춥니다. 이것은 이 분야에서 가장 오래된 아이디어입니다. 1988년 Pomerleau의 ALVINN은 카메라와 레이저 거리 찾기에서 이미지를 받고 차량이 이동해야 하는 방향을 생성하는 3계층 역전파 네트워크였습니다. 시뮬레이션된 도로 이미지에서 훈련했고 일부 현장 조건에서 실제 도로를 따랐습니다. 레시피는 크게 변하지 않았습니다. 네트워크만 변했습니다.
건너뛴 것은 그 쌍이 어디서 나왔는지에 대한 확인입니다. 그들 중 모두 시연자가 생성한 궤적에 있습니다. 당신이 배포하는 정책은 자신의 것을 생성합니다. 그것이 벗어나는 순간, 그것은 훈련 분포에 없었던 상태에 대해 질의되고, 그 답은 그것을 더 멀리 이동시킵니다. Ross, Gordon 및 Bagnell은 정확히 이것으로 DAgger 논문을 엽니다: 순차 예측은 학습자 자신의 예측이 다음에 보는 입력을 결정하기 때문에 통계 학습 기저의 i.i.d. 가정을 위반합니다.
그 논문에서 가장 명확한 예시는 로봇이 아닙니다. Super Mario Bros의 거의 최적의 플래너 복제는 장애물을 건너뛰는 대신 반복적으로 막히는 정책을 생성했습니다. 이유는 전체 논증이 한 문장에 있습니다: 전문가는 항상 편안한 거리에서 뛰었으므로 데이터 세트는 Mario가 장애물에 세게 눌려있는 상태를 포함하지 않았으므로, 그가 그렇게 되면 무엇을 해야 하는지 레이블이 없었습니다.
Mario를 SO-100 arm으로 바꾸면 구조는 동일합니다. 당신의 시연은 깨끗한 접근과 깨끗한 파악을 보여줍니다. 그리퍼가 2센티미터 짧게 닫혀 있지 않습니다. 그래서 정책은 거기서 무엇을 해야 할지 모르고, 어떤 추측이든 그것을 더 멀리 이동시킵니다. Covariate shift는 data collection procedure의 속성이지, 네트워크 아키텍처의 속성이 아닙니다.
2차 항이 어디서 나오는지
2010년 Ross와 Bagnell의 AISTATS 논문 Efficient Reductions for Imitation Learning은 compounding을 정확하게 만듭니다. T를 작업 horizont로, 작업 비용을 단위 간격으로 제한하고, epsilon을 expert's 상태 분포 아래에서 측정된 대리 손실(validation set이 보고하는 숫자)로 설정합니다. 그러면 T 단계 동안 해당 정책을 실행하는 추가 비용은 T 제곱 곱하기 epsilon으로 제한됩니다. Ross, Gordon 및 Bagnell은 이것을 DAgger 논문에서 Theorem 2.1로 다시 명시하고 중요한 문장을 추가합니다: 한계는 tight입니다. 문제가 존재하여 epsilon 손실을 가진 정책이 전문가의 분포에서 실제로 T에 2차적으로 커지는 추가 비용을 발생시킵니다.
Tight은 전형적이라는 것을 의미하지 않습니다. 2차 항은 문제 클래스에 대한 최악의 경우입니다. pick-and-place 작업에 대한 예측이 아닙니다. 이것이 확립하는 것은 더 많은 전문가 시연이 문제를 제거할 수 없다는 것입니다: 정책이 테스트되지 않을 분포에서만 epsilon의 추정을 예리하게 합니다.
탈출 경로는 같은 논문에 있으며, Theorem 2.2로 다시 명시됩니다. 정책이 its own 상태 분포에서 epsilon 손실을 달성하고, 단일 잘못된 행동이 전문가 아래 최대 u의 비용을 갖는 경우, 추가 비용은 u 곱하기 T 곱하기 epsilon으로 제한됩니다. 이것은 horizont에서 선형입니다. 상수 u는 흥미로운 양입니다: 전문가와의 0-1 불일치에 대해 최대 1, 전문가가 몇 단계 내에 복구할 수 있을 때마다 O(1)입니다. 최악의 경우 O(T)이고, 선형 한계는 2차 한계보다 낫지 않습니다.
| 설정 | 전문가에 대한 추가 비용의 한계 | 기초가 되는 것 |
|---|---|---|
| Behavior cloning (Ross & Bagnell 2010, Thm. 2.1로 다시 명시됨. Ross et al. 2011) | T 제곱 곱하기 epsilon | epsilon은 전문가의 상태 분포에서 측정됨; [0,1] 범위의 비용; 한계는 tight |
| 자신의 분포에서 epsilon 손실을 가진 모든 정책 (Thm. 2.2) | u 곱하기 T 곱하기 epsilon | u는 한 잘못된 행동의 비용-계속 페널티를 제한합니다. 0-1 손실에 대해 최대 1, 최악의 경우 O(T) |
| Forward training (Ross & Bagnell 2010) | u 곱하기 T 곱하기 epsilon | timestep당 하나의 정책; T개의 정책이 필요하고 알려진, 유한한 T |
| SMILe (Ross & Bagnell 2010) | 일부 문제 클래스에서 거의 T와 epsilon에서 선형 | O(1/T 제곱)의 alpha, O(T 제곱 log T)의 N; 확률적 혼합을 생성합니다 |
| DAgger (Thm. 3.2, Ross et al. 2011) | u 곱하기 T 곱하기 epsilon_N, 플러스 O(1) | uT 정도의 N; 강하게 볼록한 경계 손실; no-regret 학습자; epsilon_N은 후견의 최선의 손실 |

DAgger 이전의 두 시도
Forward training은 정직하지만 비실용적인 답입니다. 각 timestep에 대해 순서대로 별도의 정책을 훈련하고, 각각은 이미 고정된 초기 단계의 정책이 유도하는 상태 분포에서, 모든 정책은 정확히 면할 분포를 봅니다. 설명의 포착은: T개의 정책, 순차 훈련, 조기 중단 없음. 조작 episode에서 초당 30프레임일 때, T는 수백 범위입니다.
같은 논문의 SMILe 및 Daume, Langford 및 Marcu의 구조화된 예측 작업의 SEARN은 다른 경로를 취합니다: 하나의 정상적인 정책, 하지만 확률적. 각 반복은 구성요소를 훈련하고 혼합에 추가하여, 전문가에서 멀리 확률 질량을 이동시킵니다. 결과는 일부 구성요소가 다른 것보다 나쁜 혼합입니다. 물리적 팔에서, 컨트롤러가 동작 중에 나쁜 구성요소를 샘플링할 수 있습니다. 이것은 정상적인 deterministic 정책을 원하는 명시된 동기입니다.
DAgger: 하나의 아이디어, 하나의 상자
Dataset Aggregation은 결정론적 정책을 유지하고 수정을 데이터 수집으로 이동시킵니다. 각 라운드: 현재 정책을 롤아웃하고, 방문하는 상태를 기록하고, 각 상태에서 전문가에게 올바른 행동이 무엇인지 물어보고, 이미 가진 데이터 세트에 해당 쌍을 추가하고, 합집합에 대해 재훈련합니다. 이름은 알고리즘입니다. 집계하고, 절대 버리지 마세요.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation set세 가지 세부사항은 보이는 것보다 더 큰 무게를 가집니다. 레이블은 혼합 정책이 방문한 상태에 대한 것이지만, 행동은 전문가에게서 옵니다. 정책은 질문을 제공하고, 전문가는 답을 제공합니다. 재훈련은 전체 집계에 대한 것이며, 각 라운드를 Follow-The-Leader 단계로 만듭니다: 라운드 n에서 지금까지 모든 궤적에 대해 후견에서 최선의 정책을 선택합니다. 그것이 증명이 걸려있는 프레이밍입니다. 그리고 알고리즘은 validation set에서 선택한 대로 시퀀스에서 최선의 정책을 반환하여 끝냅니다. 왜냐하면 정리는 some 시퀀스의 정책이 좋다는 것을 보증하기 때문입니다. 마지막 정책이 좋은 것이 아닙니다.
Beta 스케줄, 그리고 왜 그것이 튜닝 노브가 아닌지
혼합 정책은 beta_i 곱하기 전문가 플러스 1 빼기 beta_i 곱하기 학습자입니다. 포인트는 실용적입니다: 처음 몇 개의 학습된 정책은 매우 적은 데이터에서 훈련되고, 많은 실수를 하고, 그렇지 않으면 정책이 개선되면 무관해지는 상태에서 롤아웃을 보냅니다.
이론은 정확히 하나의 조건을 부과합니다: beta의 실행 평균이 0으로 가야 합니다. 분석은 beta_i를 상수 T와 독립적인 alpha에 대해 (1 - alpha)에서 거듭제곱 i-1로 제한하는 방식으로 작동합니다.
| 스케줄 | 하는 것 | 논문이 보고하는 것 |
|---|---|---|
| beta_1 = 1 | 첫 라운드는 순수 전문가 시연; 초기 정책이 필요하지 않음 | 모든 변형에서 권장되는 시작점 |
| beta_i = 1 if i = 1, else 0 | 라운드 1에서만 전문가; 무료 매개변수가 없습니다 | 논문의 매개변수 없는 버전, 실제로 성능이 가장 좋은 경우가 많다고 합니다. Super Mario Bros에서 20 반복 후 2980 |
| beta_i = p^(i-1) p = 0.5 포함 | 전문가 확률은 기하학적으로 감소 | 같은 벤치마크에서 3030, 매개변수 없는 버전보다 약간 앞서갑니다 |
| beta_i = p^(i-1) p = 0.9 포함 | 전문가는 루프에 훨씬 더 오래 머물러 | 현저히 느린 수렴; 20 반복이 끝났을 때 여전히 개선 중 |
2980과 3030 사이의 간격은 대략 4300까지 진행되는 척도에서 작지만, 그 설명이 섹션에서 가장 유용한 실제 주석입니다. 매개변수 없는 스케줄로 Mario는 초기에 같은 장소에 갇혔고 그 위치에서 거의 중복된 데이터의 많은 부분을 생성했습니다. 전문가가 일부 시간을 운전하도록 하면 그는 갇혔던 상태를 벗어났고 상태의 다양성을 넓혔습니다. 스케줄은 혼합 비율보다 데이터 수집이 계속 새로운 상태를 생성하는지 또는 같은 실패를 생성하는지가 중요합니다.
확률적 per-timestep 혼합은 제어 속도에서 제어 권한을 전환한다는 의미입니다. 전형적인 SO-100 설정에서는 초당 30회입니다. 어떤 원격 조작 인터페이스도 그것을 안전하게 또는 의미 있게 만듭니다. 실제 하드웨어에서 beta 스케줄은 인간의 결정 when을 인수하는 것으로 물러납니다: 다른 알고리즘과 다른 분석입니다.
보증: no-regret online learning으로의 축소
여기가 논문을 그것이 되게 하는 움직임입니다. 각 DAgger 라운드를 온라인 학습 문제의 한 예로 취급합니다. 여기서 라운드 i에서의 손실은 라운드 i에서 사용된 정책의 상태 분포 아래 대리 손실입니다. 학습자는 그 손실을 보기 전에 정책을 커밋하고, 시퀀스는 지금까지 생성된 정책에 의존하기 때문에 비정상입니다.
알고리즘은 N 라운드에 대한 평균 손실이 후견에서 최선의 단일 정책의 손실에 접근하는 경우 no-regret입니다. 강하게 볼록한 손실에서 Follow-The-Leader는 그러한 알고리즘이며, 평균 regret은 1/N 순서로 축소됩니다. 전체 집계에 대한 재훈련은 정확히 Follow-The-Leader입니다. 다른 어떤 no-regret 학습자도 유효할 것입니다: 분석은 축소이지, 하나의 최적화 프로그램의 속성이 아닙니다.
한 인용이 혼합 정책과 배포된 정책 사이의 간격을 연결합니다: Lemma 4.1은 두 상태 분포 사이의 L1 거리를 2 T beta_i로 제한합니다. 이것이 beta가 감소해야 하는 이유입니다. 전문가가 여전히 상당한 제어 권한을 갖는 동안, 수집하는 상태는 정책이 생성하는 상태가 아닙니다. 인용을 regret 한계와 결합하면 주요 결과는 다음과 같습니다: 대략 T 반복 후, 시퀀스의 일부 정책은 자신의 분포에서 대리 손실이 epsilon_N의 O(1/T) 이내입니다. 그것을 선형 한계에 공급하면 Theorem 3.2에 도달합니다.
경험적 측면은 현재 표준으로 겸손합니다. Super Tux Kart에서 감독된 기준선은 더 많은 데이터가 도착했을 때 랩당 평균 낙하를 개선하지 않았고, DAgger는 15번 반복 후 트랙을 결코 떨어지지 않는 정책에 도달했고, SMILe은 20번 후 여전히 랩당 약 두 번 떨어졌습니다. 필기 벤치마크에서 문자 정확도는 구조 없이 82%, 감독 83.6%, DAgger 85.5%를 실행했습니다. 이들 중 어느 것도 조작 결과가 아닙니다.
증명이 약속하지 않는 것
정리 명시는 조건부이고, 조건은 부담입니다.
- 명시된 가정 아래 T에서 2차보다 선형인 한계.
- 확률적 혼합이 아닌 정상적인 결정론적 정책.
- 진정한 축소: 모든 no-regret 온라인 학습자는 슬롯합니다.
- 구체적인 반복 횟수 - regret 항이 중요하지 않아질 때까지 대략 T 라운드.
- 시퀀스의 최소한 하나의 정책에 대한 보증, 따라서 종료 validation 통과.
- 0이 아닌 epsilon_N(클래스에서 후견의 최선의 손실)에 상대적입니다. 당신의 클래스가 전문가를 나타낼 수 없다면, 실제로는 비어있습니다.
- No-regret 메서드 또는 강하게 볼록한 대리 손실이 필요합니다. 빌드하는 분류 축소보다 더 강합니다. 저자가 주목하는 것처럼.
- 상수 u는 최악의 경우 O(T)일 수 있고, 선형 한계는 다시 2차로 축소됩니다.
- 반복을 제한하고 전문가 레이블은 제한합니다. 로봇에서 레이블은 예산입니다.
- 전문가를 모든 방문한 상태에서 질의할 수 있고 거기서 올바르게 답변할 수 있다고 가정합니다. 그 가정이 전체 비용입니다.
한 가지 추가 결과는 종종 논박으로 인용되며 그렇지 않습니다. Rajaraman, Yang, Jiao 및 Ramachandran은 유한 상태 공간 S와 horizont H를 가진 episodic MDP에서 imitation learning의 minimax 한계를 연구하고, 학습자가 방문한 상태에서 전문가를 적극적으로 질의할 수 있을 때도 고정된 에피소드 예산에서 보유하는 |S| H 제곱 나누기 N 정도의 suboptimality 하한을 증명합니다. 그것은 고정된 에피소드 예산에서 MDP 클래스에 대한 최악의 경우 비율이고, 규칙하는 것은 상호 작용이 minimax 속도를 개선한다는 아이디어입니다. DAgger의 정리는 다른 명시입니다. 배포된 정책을 정책 클래스가 달성할 수 있는 것에 상대적으로 제한합니다.
Swamy, Choudhury, Bagnell 및 Wu는 나중에 이 알고리즘을 전문가의 행동의 어떤 순간이 일치하는지로 분류하고, moment recoverability의 개념을 도입하여, 각 계열이 compounding 오류를 얼마나 잘 완화하는지 구분합니다. Osa와 Celemin의 조사는 알고리즘 풍경과 인간 피드백 인터페이스를 다룹니다.
청구서: 전문가가 생성하지 않은 상태에 레이블 붙이기
위의 모든 것은 어디에서나 질의할 수 있는 전문가를 가정합니다. 거의 무료인 플래너가 있는 시뮬레이션에서 - Mario 실험은 게임 상태에 전체 액세스할 수 있는 거의 최적의 플래너를 사용했습니다. 로봇의 인간과 함께 이것이 지배적인 비용이며 특이한 것입니다: 인간은 자신의 능력이 절대 생성하지 않은 구성에서 올바른 행동을 생성해야 합니다.
Kelly, Sidrane, Driggs-Campbell 및 Kochenderfer는 HG-DAgger 논문에서 이의를 직접 명시합니다. Vanilla DAgger는 전문가가 시스템을 완전히 제어하지 않는 동안 행동 레이블을 제공하도록 요구합니다. 이는 안전을 감소시키고, 인간 전문가의 경우 수집된 레이블의 품질을 저하시킬 가능성이 있으며, 이들은 인지된 액추에이터 지연으로 돌립니다. 돌려받는 레이블은 알고리즘이 가정한 레이블이 아닙니다.
Laskey와 동료는 DART로 문제의 다른 쪽에서 공격하고, 그들의 프레이밍은 무딘 것입니다: on-policy 기술은 인간 감독자에게 지루하고, 계산 부담을 추가하며, 훈련 중 위험한 상태를 방문할 수 있습니다. 그들의 대안은 감독자 자신의 시연에 보정된 노이즈를 주입하므로 로봇이 신뢰할 수 없는 정책을 실행하지 않고 복구가 시연됩니다. MuJoCo Humanoid에서 그들은 DART가 훈련 중 감독자의 누적 보상을 5%로 감소시키는 것으로 보고합니다. DAgger는 감독자보다 80% 적은 누적 보상으로 정책을 실행합니다. Toyota HSR을 가진 혼잡 속의 파악에서, behavior cloning 위에 평균 62% 증가.
Zhang과 Cho의 SafeDAgger는 참고 정책에 대한 쿼리를 부족한 자원으로 취급합니다: 별도의 안전 정책은 쿼리하지 않고 예측하여 주요 정책이 참고를 초과할 임계값 이상으로 벗어날 것인지 예측하고, 해당 상태만 전달됩니다. 세 가지 모두 같은 사실에 반응합니다. DAgger 분석은 전문가 레이블에 대해 아무것도 청구하지 않으며, 현실은 상당히 청구합니다.
분포 외 상태에 레이블을 붙이는 것은 작업을 시연하는 것보다 정신적으로 더 어렵습니다. 정상적인 시연은 이미 가지고 있는 모터 계획을 실행한다는 의미입니다. 그리퍼가 절대 그렇게 하지 않을 위치에 정책을 넣는 것을 수정한다는 것은 시간 압박 속에서 그 자리에서 복구를 구성해야 한다는 의미입니다. 로봇은 여전히 움직입니다. 평면 녹음 세션보다 각 세션당 더 적은 사용 가능한 분을 기대하고, 하나의 코스 동안 자신의 수정 품질이 저하되는 것을 관찰합니다.

당신의 책상에 있는 SO-100에 이것이 의미하는 것
horizont을 당신의 자신의 단위로 변환합니다. 초당 30프레임에서 20초 에피소드는 600 의사결정 단계이고, 위의 모든 한계에서 T는 그 숫자입니다. T = 600에서, T로 스케일링하는 항과 T 제곱으로 스케일링하는 항 사이의 차이는 나쁜 접근에서 복구하는 정책과 그렇지 않은 정책 사이의 차이입니다.
이것이 행동 청킹이 도움이 되는 이유입니다: 정책이 추론 단계당 행동의 짧은 시퀀스를 방출할 때, 의사결정 포인트의 수가 떨어지고, compounding할 기회도 떨어집니다. Zhao, Kumar, Levine 및 Finn은 Action Chunking with Transformers의 동기로 compounding 오류를 명명하고, 10분 가치의 시연으로부터 저비용 이완 하드웨어에서 6개의 어려운 실제 작업에서 80에서 90% 성공을 보고합니다. Chunking은 covariate shift를 제거하지 않습니다. 상태는 여전히 정책 자신의 것입니다. 하지만 유효한 horizont을 단축합니다. 참조 action chunking 및 SO-100 imitation learning guide.
두 번째 번역은 진행 측정입니다. epsilon을 정책 자신의 분포 아래에서 직접 측정할 수 없습니다. 이를 위해서는 모든 방문한 상태에 대해 지상-진실 전문가 행동이 필요합니다. 생성을 피하려고 노력하는 것입니다. 인간 게이트 루프가 대신 제공하는 것은 개입 속도입니다: 실행 중 프레임에서 인간이 인수한 프레임의 분수입니다. 이것은 프록시이고, 정책과 무관한 이유로 움직입니다. 환자 운영자는 덜 개입합니다. 일관되게 사용되면, 라운드가 오후의 가치가 있는지 여부를 말하는 하나의 숫자입니다.
세 번째 번역은 분석이 다루지 않는 데이터 품질 경고입니다. Mandlekar와 동료는 6개의 오프라인 학습 알고리즘을 5개의 시뮬레이션 및 3개의 실제 다단계 조작 작업에서 연구했으며, 알고리즘 설계 선택에 대한 민감성, 시연의 품질에 대한 의존성, 중지 기준으로 인한 변동성을 보고합니다. Belkhale, Cui 및 Sadigh는 데이터 세트 품질을 행동 차이와 전환 다양성을 통해 공식화해야 한다고 주장하고, 상태 다양성이 항상 유익한 것은 아니라고 지적합니다. DAgger 라운드는 아무도 의도적으로 선택하지 않은 상태를 추가합니다: 일부는 필요한 복구 데이터이고, 일부는 인수 제어를 잡으려고 분투하는 동안 로봇이 난동합니다.
기계적으로 라운드는 6단계입니다: 기록을 켜고 추론을 실행하고, 정책이 잘못 작동할 때 인수하고, 실행을 검토하고 각 에피소드를 파일하고, 수정을 동기화하고, 원본 플러스 수정으로부터 혼합 데이터 세트를 구성하여 소스별로 명시적으로 수행된 에피소드 선택으로, 기본 모델이 아닌 이전 checkpoint에서 계속 훈련합니다. ay-robots에서 이러한 단계는 배관을 제거하지만 판단을 제거하지 않는 버튼으로 존재합니다. 두 가지 주의: 체크포인트에서 계속하면 가중치를 초기화하고 옵티마이저 재개가 아니며, leader-arm 정렬 이동이 여전히 하드웨어에서 약하게 테스트됩니다. 참조 training 및 datasets.
이미 배선된 DAgger 루프
라이브 추론 실행 중 인수, per-frame 개입 표시, 에피소드를 수정 또는 평가로 파일, 소스별로 명시적인 에피소드 선택으로 혼합 데이터 세트를 구성하고, 기존 체크포인트에서 계속 훈련하는 것이 모두 기본 제공됩니다. 당신은 여전히 인수할 시기와 무엇을 유지할지 결정합니다. 그 부분은 자동화하지 않습니다.
DAgger 루프가 작동하는 방식을 참조하세요하나의 표의 계통도
| 방법 | 상태를 선택하는 것은 누구 | 전문가가 제공하는 것 | 주요 비용 |
|---|---|---|---|
| Behavior cloning | 전문가 | 깨끗한 시연 | 복구 데이터 없음; T에서 오류가 2차적으로 복합할 수 있음 |
| Forward training | 학습자, per timestep | 유도 분포를 따라 레이블 | T개의 별도 정책; 긴 horizont에는 사용 불가 |
| SMILe / SEARN | 전문가와 학습자의 확률적 혼합 | 혼합의 분포를 따라 레이블 | 혼합의 구성 요소가 품질이 다름 |
| DAgger | 혼합 정책, beta 0으로 감소 | 방문한 모든 상태에 대해 올바른 행동 | 제어 중이 아닌 전문가가 생성하지 않은 상태에 레이블 붙이기 |
| DART | 전문가, 주입된 노이즈로 방해 | 보정된 노이즈 아래의 시연 | 노이즈는 학습자의 오류에 맞춰 조정되어야 함 |
| HG-DAgger | 학습자, 인간이 인수할 때까지 | 인간 게이트 세그먼트에서만 수정 | 개입할 시기에 대한 인간의 판단에 따라 다름 |
| SafeDAgger | 학습자, 안전 게이트로 필터링 | 게이트가 요청할 때만 레이블 | 게이트 자체는 훈련되고 신뢰되어야 함 |
자주 묻는 질문들
내 로봇에서 실제로 2차 오류 성장을 관찰할까요?▾
깨끗한 곡선으로는 아닙니다. 한계는 최악의 경우입니다: 일부 문제가 달성한다는 점에서 tight입니다. 당신의 것이 아닙니다. 당신이 보는 것은 그 결과입니다. 정책은 보유된 프레임에서 점수가 잘 나오고, 실제 작업에 실패하고, 같은 더를 기록할 때 개선하지 않습니다. 더 많은 깨끗한 데이터가 도움을 멈추면, 그것은 데이터 볼륨 문제가 아닌 covariate shift입니다.
이것을 DAgger라고 부르기 위해 beta 혼합을 구현해야 합니까?▾
매개변수 없는 버전 - 라운드 1의 전문가, 이후의 순수 학습자 - 합법적인 특수 사례이며 종종 원본 실험에서 최고 성능을 발휘했습니다. 버릴 수 없는 것은 집계입니다: 최신 수정에서만 재훈련하는 것은 Follow-The-Leader 해석을 깨뜨립니다. 이것은 no-regret 논증이 나오는 곳입니다. 수정만으로 훈련하는 것은 훨씬 더 약한 절차입니다.
마지막 대신 validation set에서 최선의 정책을 반환하는 이유는 무엇입니까?▾
정리는 시퀀스의 어딘가에 좋은 정책이 존재한다는 것을 보증하기 때문입니다. 마지막 반복이 아닙니다. 한계는 시퀀스에서 최소값에 있습니다. 마지막 라운드에서 나온 무엇을 배운다면 명시된 결과의 조건을 폐기합니다. 그리고 마지막 라운드는 신뢰할 수 있게 최선이 아닙니다.
몇 라운드를 계획해야 합니까?▾
이론은 T 정도의 반복을 원합니다. 600 단계 에피소드의 경우 누구도 하드웨어에서 실행하지 않는 숫자입니다. 원본 실험은 모든 벤치마크에서 20개의 반복을 실행했습니다. 실제로는 개입 속도가 멈출 때까지 라운드를 실행합니다. 분석이 가정하는 수보다 훨씬 낮습니다. 이론과 실제 사이의 실제 간격입니다.
내 정책 클래스가 단순히 전문가를 나타낼 수 없다면?▾
그러면 DAgger는 당신을 구하지 못하고, 한계는 그렇게 말합니다. epsilon_N(클래스에서 후견의 최선의 손실)에 상대적으로 표현됩니다. 잘못된 아키텍처 때문에 크다면, 관찰 누락, 장면을 볼 수 없는 카메라, 집계는 당신에게 작업을 할 수 없는 클래스 내에서 최적인 정책을 제공합니다. 수정을 수집하기 전에 보유된 에피소드에 대해 오픈 루프 재생을 실행합니다.
여기에서 어디로 갈까
정책을 아직 훈련하지 않았다면, 이 이론은 시기상조입니다: 먼저 데이터 세트를 기록하고, 첫 정책 훈련 및 desktop client에서 시작합니다. 다른 100개의 깨끗한 시연을 시작 수정과 비교하고 있다면: 깨끗한 시연은 분포 문제를 해결하지 않습니다. 기계적인 것의 경우, human-gated variant 및 SO-100 walkthrough를 계속하세요.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started