
순수 DAgger는 로봇이 아직 운전 중일 때 인간이 상태에 라벨을 지정하도록 요청합니다. 실제 하드웨어에서 그것은 안전하지 않으며 좋지 않은 라벨을 생성합니다. 게이트 변형은 누군가 들고 있어야 하는 게이트로 맹목적 라벨 지정을 교체합니다: HG-DAgger의 인간, SafeDAgger의 안전 분류기, EnsembleDAgger의 앙상블 불일치, ThriftyDAgger의 예산 신규성 및 위험 추정. 이 기사는 게이트를 소유한 사람, 게이트를 열 신호, 각각의 비용을 비교합니다. 그리고 왜 인간 게이트형이 실제 팔과의 접촉에서 생존하는 형태인지를 설명합니다.
복제된 정책은 학습 데이터가 부족한 곳에서 실패합니다. 해결책은 시연자의 상태 분포 대신 정책 자신의 상태 분포에서 데이터를 계속 수집하는 것입니다. 이것이 DAgger가 하는 일이고 데이터 집계 소개 는 첫 원칙부터 다룹니다. 원래 알고리즘의 어색한 부분을 남깁니다: 학습자가 운전하는 동안 전문가는 제어 중이 아닌 모든 상태에서 자신이 무엇을 했을지 말해야 합니다.
스크립트된 전문가가 있는 시뮬레이터에서는 무료입니다. 실제 팔이 있는 테이블에서는 자유롭지도 안전하지도 않습니다. HG-DAgger 저자들은 이의를 정확히 제시합니다: 그러한 샘플링 스킴은 "전문가가 시스템을 완전히 제어하지 않고 행동 라벨을 제공해야 합니다". 이는 "안전성을 감소시킬 수 있고, 인간을 전문가로 사용할 때는 감지된 구동기 지연으로 인해 수집된 라벨의 품질을 저하시킬 가능성이 높습니다" (Kelly et al., 2019). 그 문장에는 두 가지 실패가 숨어 있습니다: 정책은 계속해서 아무도 원하지 않는 상태로 운전되고, 그 위험으로 구매한 라벨은 제어 중인 인간이 생성하는 라벨보다 나쁩니다. 아래의 모든 변형은 같은 질문에 답합니다. 제어에 게이트를 놓고 누군가 그것을 열 때를 결정하도록 하세요. 그들은 그 누군가가 누구인지에 따라 다릅니다.
짧은 버전
- •게이트형 변형은 맹목적 라벨 지정을 정책 제어와 전문가 제어 사이의 스위치로 교체합니다. 그들을 분리하는 것은 스위치를 소유한 사람입니다.
- •HG-DAgger는 스위치를 인간에게 제공하고 인간이 중단되지 않은 제어를 가진 동안 기록된 데이터만 집계합니다.
- •SafeDAgger는 참조 정책으로부터의 편차를 예측하는 이진 분류기에 제공합니다. EnsembleDAgger는 낮은 앙상블 분산과 전문가 행동에 대한 작은 거리를 동시에 요구합니다.
- •LazyDAgger는 히스테리시스를 추가하여 제어가 핑퐁되지 않도록 합니다. ThriftyDAgger는 명시적 개입 예산 하에 신규성 또는 추정 위험에 게이트를 설정합니다.
- •로봇 게이트형 신호는 취미 수준의 팔에 미세 조정된 VLA가 일반적으로 부족한 것이 필요합니다: 참조 정책, 저렴한 앙상블 또는 보정된 인식론적 불확실성.
- •게이트는 방법의 절반입니다. 개입 세그먼트 이후에 일어나는 일 - 혼합, 가중치, 집계 - 라운드가 무엇이든 개선했는지 결정합니다.
인간 게이트형 및 로봇 게이트형: 중요한 분할
대화형 모방 학습은 자체 설문조사를 가지고 있습니다. Celemin과 동료들은 피드백 유형, 인터페이스, 학습 모델, 사용자 경험, 응용 및 벤치마크에 따라 카탈로그합니다. 귀하의 엔지니어링을 결정하는 구분은 이러한 축보다 더 간단하며 최근 작업은 직접 이름을 붙입니다: 감시자가 개입할 때를 결정할 때 메서드는 인간 게이트형 이고, 에이전트가 도움을 요청할 때를 결정할 때 로봇 게이트형 입니다 (Cai et al., 2025). 다른 모든 것은 이 두 선택 중 하나를 제공하는 기계입니다. 거래는 시작부터 명확합니다: 인간 게이트는 지속적인 주의가 필요하고, 로봇 게이트는 그 주의를 돌려주기로 약속합니다. 하지만 게이트를 설정하는 신호가 신뢰할 수 있어야만 하고, 그 신호를 만드는 것은 자체 연구 문제입니다.
SafeDAgger: 자신의 편차를 예측하는 분류기
Zhang과 Cho의 SafeDAgger (2016)는 이러한 게이트의 가장 초기입니다. 참조 정책을 쿼리하는 것이 비용이 많이 드는 부분이므로 작은 두 번째 네트워크 - 안전 정책 - 쿼리가 전혀 가치 있는지 예측합니다. 이는 "주요 정책이 쿼리 없이 참조 정책에서 편차가 가능성이 높은지 여부를 나타내는 이진 라벨을 반환합니다". 라벨은 두 정책의 행동 사이의 제곱 L2 편차와 임계값 tau에 대해 정의되며, 분류기는 이진 교차 엔트로피로 맞춰집니다. 런타임에 학습자가 운전을 계속하는지 또는 참조가 인수하는지 상태별로 결정합니다. 초록은 자동화된 커리큘럼 효과로 인한 참조 쿼리 감소와 수렴 속도 향상을 보고하지만 어느 쪽에도 숫자를 제공하지 않습니다.
catch는 결과가 아니라 정의에 있습니다. 분류기를 훈련하려면 참조 정책의 행동이 맞춰진 모든 상태에서 필요하며, 이는 참조가 또 다른 프로그램이라고 가정합니다. 참조가 리더 팔을 가진 사람인 경우 해당 라벨 세트는 저렴하지 않으며 방법은 설계 대상인 속성을 잃습니다.
EnsembleDAgger: 의심과 불일치, 모두
Menda, Driggs-Campbell 및 Kochenderfer (2019)는 게이트를 확률 질문으로 취급합니다. EnsembleDAgger는 "신경망의 앙상블을 사용하여 가우스 과정을 근사화"하고 앙상블 분산을 신뢰도 프록시로 읽습니다: 높은 분산은 학습 데이터와 다른 영역을 의미하며, 이는 (전문가가 실패 상태를 피한다고 가정하면) 실패에 가까움과 연관됩니다. 규칙은 결합입니다. 학습자는 평균 행동과 전문가 행동 사이의 L2 거리가 한 임계값 (불일치) 아래로 유지될 때만 행동할 수 있습니다. 그리고 예측된 행동의 분산이 두 번째 (의심) 아래로 유지됩니다. 둘 중 하나라도 실패하면 전문가가 제어합니다. 목표는 실패 확률을 제약하면서 학습자의 행동 몫을 최대화하는 것입니다. 논문은 역진자와 MuJoCo HalfCheetah에서 다른 DAgger 변형에 비해 개선된 안전성과 학습을 보고합니다.
이것은 조용히 손을 떼지 않은 감시를 위한 전체 규칙을 박탈합니다. 학습자의 행동과 전문가의 행동 사이의 거리는 그 상태에서, 그 순간에 전문가의 행동을 필요로 합니다. 스크립트된 전문가의 경우 문제없습니다. 인간의 경우 인간이 계속해서 행동을 생성해야 합니다. 이는 게이트형 변형이 제거하도록 설계된 정확한 부담입니다. 의심 항만은 손을 떼지 않습니다. 결합은 아닙니다.
LazyDAgger: 스위치가 채터링되지 않도록 중지
Hoque 및 동료들 (2021)은 이전 논문이 측정하지 않은 비용을 공격했습니다: 스위치 자체입니다. 각 개입은 "감시자가 수행하는 다른 작업을 중단하고, 감시자와 자율 제어 사이의 각 컨텍스트 스위치로 지연 시간을 초래하며, 수행 시간이 필요합니다". 분당 10번 열리고 닫히는 게이트는 10초 동안 한 번 열리는 게이트보다 나쁩니다. 동일한 자율 몫에서. LazyDAgger는 SafeDAgger를 비대칭 임계값으로 확장합니다. 감시자 제어를 유지하기보다 입력하기가 더 어렵기 때문에 시스템이 경계에서 진동하지 않습니다. 시뮬레이션에서는 "3개의 연속 제어 작업에서 SafeDAgger에 비해 평균 60% 컨텍스트 스위치 감소"를 제공할 수 있습니다. 패브릭 조작에서 ABB YuMi를 사용하면 "60% 컨텍스트 스위치 감소"를 제공하면서 "실행 시간에 SafeDAgger보다 60% 높은 성공률"을 달성합니다.
ThriftyDAgger: 신규성 또는 위험, 예산 하에
ThriftyDAgger (Hoque et al., CoRL 2021)는 정책이 아닌 감시자의 예산에서 시작합니다. 이는 "로봇 정책이 모방할 참조 행동이 없는 곳 또는 로봇이 작업 완료에 대한 신뢰도가 낮은 곳인 (1) 충분히 새로운 상태에서만 개입을 요청하기 위해 학습된 스위칭 정책을 사용합니다 (2) 위험한 곳" 그 위험을 추정하기 위한 새로운 메트릭. 예산은 결과가 아닌 입력입니다: 얼마나 많은 인간 시간을 소비할 것인지 명시합니다. 실행 시 적용되면 방법은 "시뮬레이션과 물리적 작업 모두에서 100% 성공률을 달성"하고, 10명의 참가자가 집중력 작업과 함께 3개의 로봇 함대를 제어하는 사용자 연구는 "다음 최고 알고리즘보다 58% 및 80% 향상"을 보고합니다 감시자 부담을 줄입니다". 함대 설정은 이 작업의 자연 집입니다. Fleet-DAgger는 나중에 여러 로봇 및 감시자와의 대화형 함대 학습을 공식화하고 반환 인간 노력을 최적화할 수량으로 제안합니다.
HG-DAgger: 인간이 게이트를 보유합니다.
Kelly et al. (2019)는 다른 방향으로 갑니다. 스위칭 정책이 없습니다. 학습자는 "전문가가 초보자가 상태 공간의 안전하지 않은 영역에 진입했다고 관찰할 때까지" 롤아웃되고, 그 시점에서 전문가가 제어를 잡고 시스템을 다시 안내합니다. 집계 규칙은 엄격한 부분입니다: "전문가 행동 라벨은 인간 전문가가 시스템을 중단되지 않은 제어했던 이 복구 궤적 중에만 수집되고 데이터세트에 추가됩니다." 인간이 관찰자였을 때 라벨이 지정되지 않습니다.
스위치에서 멈추지 않습니다. HG-DAgger는 또한 "참조 정책에서의 편차에 대한 모델 불확실성 기반 위험 메트릭의 안전 임계값을 학습할 수 있으며, 이는 완전히 훈련된 초보자의 상태 공간의 다른 영역에서 성능을 예측하는 데 사용할 수 있습니다": 학습자가 인간이 개입한 순간에 얼마나 불확실했는지 기록하고 이러한 레코드의 마지막 1/4을 평균냅니다. 여기서 학습자가 최종 형태와 가장 유사합니다. 이것은 로봇이 작동하는 게이트가 아니라 완성된 정책이 잡을 것으로 예상되는 위치를 알려주는 진단입니다. 평가는 시뮬레이션된 및 실제 운전 작업을 포함하고 DAgger 및 행동 복제 모두에 비해 개선된 성능을 보고합니다.
한 가지 관련된 라인은 라벨이 무엇인지를 변경합니다. Spencer와 동료들의 전문가 개입 학습은 "개입 또는 비개입 여부, 임의의 전문가 피드백이 현재 상태의 품질, 행동의 최적성 또는 둘 다에 대한 정보를 제공합니다"라고 주장하고, 학습자의 가치 함수에 대한 제약으로 공식화되고 후회 없는 온라인 학습으로 해결됩니다. 그 읽기 하에서, 인간이 보고 아무것도 하지 않은 늘어나는 부분은 빈 것이 아니라 약한 긍정적 증거입니다. EIL은 약 1분의 전문가 제어로부터 충돌 회피를 학습합니다.

나란히 있는 변형
| 방법 | 누가 게이트를 엽니까 | 신호 | 필요한 것 | 보고됨 |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | 아무도 아님 — 학습자는 항상 운전합니다 | 없음; 전문가는 방문한 모든 상태에 라벨을 붙입니다 | 제어 중이 아닌 동안 오프 정책 상태에 라벨을 지정할 수 있는 전문가 | 학습자의 상태 분포 하에 보증이 있는 후회 없는 감소 |
| HG-DAgger (Kelly et al., 2019) | 인간 감시자 | 상태가 안전하지 않다는 감시자의 판단 | 누군가 보는 것과 제어의 깔끔한 인수 | 시뮬레이션된 및 실제 운전 작업에서 DAgger 및 행동 복제를 이기고; 또한 위험 임계값을 학습합니다 |
| SafeDAgger (Zhang & Cho, 2016) | 로봇 | 참조 위에서 L2 편차에 대한 이진 분류기 | 분류기의 라벨을 위한 쿼리 가능한 참조 정책 | 경주 시뮬레이터에서 더 적은 참조 쿼리, 더 빠른 수렴 (제공된 숫자 없음) |
| EnsembleDAgger (Menda et al., 2019) | 로봇 | 앙상블 분산 및 전문가 행동까지의 거리, 모두 임계값 미만 | 네트워크 앙상블 및 각 단계의 전문가 행동 | 진자 및 HalfCheetah에서 개선된 안전성 및 학습 |
| LazyDAgger (Hoque et al., 2021) | 로봇, 히스테리시스 포함 | SafeDAgger의 신호 (별도 항목 및 출구 임계값 포함) | SafeDAgger가 필요한 것 + 조정할 두 번째 임계값 | 3개 작업에서 약 60% 더 적은 컨텍스트 스위치; YuMi 패브릭에서 60% 더 높은 성공 |
| ThriftyDAgger (Hoque et al., 2021) | 로봇, 예산 하에 | 신규성 또는 작업 완료의 추정 위험 | 학습된 위험 추정기 및 명시된 개입 예산 | 실행 시간에 100% 성공; 사용자 연구 (N=10): 다음 최고에 비해 58% 및 80% 이득 |
| EIL (Spencer et al., 2020) | 인간 — 비개입도 계산합니다. | 가치 함수에 대한 제약으로 개입 및 부재 | 가치 제약에 대한 온라인 후회 없는 학습 | 약 1분의 전문가 제어로부터 충돌 회피 |
각 게이트가 구매하는 것과 청구하는 것
"필요" 열을 읽으면 패턴이 떨어집니다: 모든 로봇 게이트형 신호는 제조되어야 하는 프록시이며, 각 프록시는 자체 청구서가 있습니다.
- 불일치 신호 (SafeDAgger, LazyDAgger, EnsembleDAgger의 규칙의 절반)는 참조 정책이 필요합니다. 스크립트된 전문가가 있거나 흥미로운 문제가 이미 해결되었거나 인간이 거리를 계산할 수 있도록 배경에서 계속해서 행동을 생성합니다.
- 의심 신호는 보정된 인식론적 불확실성이 필요합니다. 작은 제어 네트워크의 앙상블은 이를 근사화합니다. 30억 매개변수 비전 언어 행동 모델의 앙상블은 메모리 및 지연 시간 문제입니다.
- 신규성 및 위험 신호는 충분한 성공 및 실패한 롤아웃에 맞춰진 작업 완료의 학습된 추정기가 필요합니다. 아직 작동하는 작업에서 그 데이터는 라운드 1에 없습니다.
- 인간 게이트는 주의와 아무것도 필요하지 않습니다. 유일한 신호는 1일차에, 모든 정책 아키텍처에서, 훈련할 추가 모델 없이 사용 가능합니다.
- 로봇 게이트도 인간을 방에서 제거하지 않습니다. 그들은 인간이 얼마나 자주 행동해야 하는지 감소시키고, 그들이 존재해야 하는지 여부는 아닙니다.
게이트가 생성하는 것에는 더 조용한 차이가 있습니다. 로봇 게이트가 중간 궤적에서 발생하면 사람에게 임의 포즈의 움직이는 팔을 전달합니다. 인간 게이트는 운영자가 순간을 선택할 수 있게 합니다. 도달 후, 그래스프 전에, 스윙 중간이 아닙니다. 두 가지에서의 복구 세그먼트는 동등하게 깨끗하지 않으며, 그 세그먼트는 라운드의 전체 제품입니다.
왜 인간 게이트형이 실제 하드웨어에서 승리하는가
이것은 벤치마크 결과가 아니라 엔지니어링 논증입니다. 같은 매니퓰레이터에서 같은 정책 클래스로 5개 게이트를 모두 실행하는 논문을 찾지 못했습니다. 네 가지 포인트에 기반합니다.
먼저, 감시자가 어쨌든 있습니다. 아무도 SO-100 팔 을 떨어뜨릴 수 있는 물체 옆에서 무인으로 실행하지 않습니다. 누군가 보고 있으면, 그들에게 인수 버튼을 제공하는 한계 비용은 거의 0입니다. 보정된 위험 추정기를 구축하는 것은 프로젝트입니다.
둘째, 현대 정책에서 실제로 측정할 수 있는 불확실성은 종종 잘못된 수량입니다. 확산 또는 흐름 일치 헤드는 샘플링된 행동 청크에 걸쳐 분산을 생성하고, 그 분산은 헤드가 나타내도록 훈련된 다중 모드를 반영합니다. 상태에 대한 인식론적 무지가 아닙니다. EnsembleDAgger의 의심 항은 후자를 캡처하기 위해 정확히 앙상블을 사용합니다. 둘은 같은 숫자처럼 보이고 아닙니다. 행동 청킹 및 흐름 일치 항목은 이러한 헤드가 먼저 행동을 내보내는 방식을 다룹니다.
셋째, 조작에서 중요한 실패는 통계적으로 비정상적이기보다 의미론적입니다. 그리퍼를 2센티미터 일찍 닫거나 두 개의 동일한 정육면체 중 잘못된 것에 자신감 있게 도달하는 정책은 높은 분산 상태에 있지 않습니다. 자신감 있고 잘못되었습니다. 분산 임계값이 그것을 잡지 않습니다; 보는 사람이 즉시 잡습니다.
넷째, 라벨 품질 - 원래 HG-DAgger 포인트이고 가장 자주 건너뜁니다. 인간이 중단되지 않은 제어를 가진 동안 수집된 라벨은 움직이는 시스템 위에 설명된 라벨을 능가합니다. 목표가 집계할 가치 있는 수정 데이터인 경우, 증명 부담은 자동화된 게이트와 함께 놓여 있습니다.
한 감시자가 많은 로봇을 담당할 때 사진이 뒤집힙니다. ThriftyDAgger의 사용자 연구 및 Fleet-DAgger의 공식화가 대상으로 하는 레짐입니다. 함대를 사용하면 인간의 주의가 부족한 자원이고 불완전한 할당은 없습니다. 한 팔이 한 책상에 있는 경우 그 레짐에 있지 않습니다.
인간 게이트형 루프, 이미 배선됨
실행 추론 세션 중 인수, 수정 세그먼트의 프레임별 개입 플래그, 각 실행을 수정사항 또는 평가로 큐레이팅, 선택한 소스에서 혼합 데이터세트 작성, 기존 체크포인트에서 계속 훈련이 손으로 스크립트되기보다는 내장되어 있습니다. 인수는 리더 팔 또는 하나가 없는 경우 키보드 및 슬라이더와 함께 작동합니다.
DAgger 루프가 실행되는 방식 보기게이트는 방법의 절반입니다. 데이터 처리가 다른 절반입니다.
게이트는 인간이 운전한 프레임을 결정하지만, 그들에게 무엇을 할지는 아닙니다. 그리고 두 번째 결정은 라운드가 가장 자주 낭비되는 곳입니다. 첫 번째 규칙은 DAgger에서 D가 나타내는 규칙입니다: 집계하고, 교체하지 마십시오. 미세 조정 체크포인트 순수하게 수백 개의 수정 프레임에서 당신을 제공합니다 거의 회복만 보았으며 명목 궤적을 잊었습니다.
두 번째 규칙은 개입 프레임이 일반 프레임이 아니라는 것입니다. Mandlekar et al.은 운영자가 정책을 모니터링하고 실패에 대해 인수할 수 있는 6 자유도 조작을 위한 원격 텔레오퍼레이션 시스템을 구축했으며, 그 이후 "정책이 개입을 통해 병목 지점을 통과하는 방법을 배우도록 권장하는" 알고리즘을 사용하여 반복적으로 훈련했습니다. 그 데이터에 대해 훈련된 에이전트는 동일한 수의 일반 시연 샘플에 대해 훈련된 에이전트를 능가했습니다. Sirius는 배포에 아이디어를 밀어냅니다. "근사화된 인간 신뢰로 훈련 샘플을 재가중치 지정하고 가중치 행동 복제로 정책을 최적화합니다". 둘 다 인간이 운전한 것의 프레임별 마커가 필요하며, 이는 왜 개입 플래그가 나타나는 것보다 더 중요한지입니다.
세 번째 규칙은 자동 혼합이 함정이라는 것입니다. 소스를 열거할 수 없는 구성 데이터세트는 다음 라운드가 더 나쁠 때 디버깅할 수 없습니다. 이 플랫폼에서 compose 단계는 그 이유로 명시적입니다. 원본 데이터세트 + 수정사항, 소스별 에피소드 선택, 결과는 일반 LeRobot 데이터세트 이며 다른 것과 같이 동기화되고 훈련합니다. 데이터세트 문서 형식 측면을 다룹니다.
| 라운드의 단계 | 생성하는 것 | 가장 일반적인 방식 |
|---|---|---|
| 기록을 켜고 추론 실행 | 정책의 자체 상태 분포 하의 실행 | 순수 원격 조작으로 기록되고, 정책이 운전했음을 잃음 |
| 실패에서 인수 | 프레임별 개입 플래그가 있는 수정 세그먼트 | 화장 흔들림 수정, 스타일이 아니라 복구 교육 |
| 각 에피소드 큐레이션 | 수정사항, 평가 또는 할인 | 모든 것을 유지하고, 엉망인 인수는 에피소드의 가치보다 더 비용이 듭니다. |
| 수정사항 동기화 | 원본 옆에 있는 버전 지정된 데이터세트 | 로컬 머신을 떠나지 않은 수정사항 |
| 혼합 데이터세트 작성 | 원본 + 수정사항, 명시적 선택 | 자동 혼합이 조용히, 나중에 회귀를 소스로 추적할 수 없습니다 |
| 체크포인트에서 계속 | 이전 체크포인트에서 초기화된 체크포인트 | 옵티마이저 재개를 기대하고; 가중치는 모델을 초기화하고 옵티마이저 상태를 복원하지 않습니다. |
사람이 실제로 들 수 있는 게이트 설정
"인간이 결정합니다"는 사양이 아닙니다. 서로 다른 임계값을 가진 두 운영자는 비교할 수 없는 라운드를 생성하고, 드리프팅 임계값은 읽을 수 없는 추세를 생성합니다. 첫 번째 실행 전에 트리거를 작성하십시오.
- 게이트를 여는 조건을 이름 지정하십시오. 접근이 고정된 마진을 초과하고, 그리퍼가 아무것도 닫지 않으며, 관절이 한계를 향해 표류하고, 1초 또는 2초 이상의 정지입니다. 그리고 라운드에 대해 목록을 변경하지 않도록 유지하십시오.
- 그것을 열지 않는 것의 이름을 지정하십시오. 정책이 자체적으로 복구하는 오버슈트는 훈련 신호입니다. 거기서 인수하면 이미 알고 있는 복구를 삭제합니다.
- 깨끗한 인수를 위해 충분히 일찍 인수하고, 상태가 복구 가능하게 되면 바로 다시 손을 뻗으십시오.
- 왜 당신이 인수했는지 에피소드별로 기록하십시오. 3개의 라운드는 같은 실패가 돌아오는지 여부의 유일한 기록입니다.
- 라운드를 통해 카메라, 작업 텍스트 및 운영자를 일정하게 유지하십시오. 하나를 변경하고 숫자가 비교 가능하지 않습니다.
기계적으로 인수에는 두 가지 변형이 있습니다. 리더 팔을 사용하면, 리더는 토크 전송 전에 추종자의 현재 포즈에 도달해야 합니다. 그렇지 않으면 팔이 점프합니다. 이 정렬 이동은 실제 하드웨어에서 가장 적게 테스트된 체인 부분입니다. 리더 팔이 없으면 인수는 첫 번째 키프레스에서 수동입니다: 추종자가 열려 있고 운영자가 키보드에서 관절별로 또는 슬라이더를 끌어서 조정합니다. 서버 측 클램프는 각 입력을 작게 유지합니다. 몇 도 키프레스당, 슬라이더 업데이트당 한 줌. 왜냐하면 큰 단계가 들고 있는 포즈로 이동하는 것이 서보를 어떻게 제거하는지이기 때문입니다. 키 바인딩이 있는 단계별 버전은 SO-100에서 DAgger 라운드 안내 에 있습니다. 두 원격 조작 모드에 대한 배경은 원격 조작 문서 및 리더-추종자 항목 에 있습니다.

게이트가 무엇을 했는지 읽기
인간 게이트형 라운드의 메트릭은 개입율입니다: 라운드의 프레임을 실행의 프레임으로 나눈 개입 프레임. 하나의 작업이 있습니다. 라운드를 통해 떨어지지 않으면 라운드가 아무것도 구매하지 않았고, 다음 라운드는 데이터 양 이외의 것을 변경해야 합니다.
이것은 편견이 있는 메트릭이며 알아야 합니다. 그것은 정책의 능력만큼 운영자의 임계값을 측정하며, 이는 왜 트리거 목록이 고정된 상태로 유지되는지입니다. 세션 동안 이완되는 운영자는 뒤에 아무것도 없는 떨어지는 곡선을 생성합니다. 또한 심각성을 무시합니다. 충돌을 중지하는 10개 프레임과 그래스프를 움직이는 10개는 동일하게 보입니다. 수정 데이터가 절대 도출되지 않은 고정 평가 세트와 짝을 지으십시오. DAgger 루프 측정에 대한 문서 는 평가 설계를 통해 작동하며, 훈련 믹스에서 평가 에피소드를 유지하는 방법을 포함합니다.
- 1일차에 작동하고, 모든 정책 아키텍처에서, 보정할 추가 모델 없음
- 분산 임계값이 감지하지 못하는 자신감 있고 잘못된 실패를 잡음
- 운영자가 선택한 순간에 풀 컨트롤에서 기록된 수정사항 생성
- IWR 및 Sirius와 같은 개입 가중치 방법이 소비하는 프레임별 마커 생성
- 지속적인 감시 비용; 한 사람과 많은 로봇으로 확장되지 않음
- 운영자 일관성에 따라 다름 - 드리프팅 임계값이 개입율을 손상시킴
- 자체적으로 위험 모델을 생성하지 않습니다. HG-DAgger의 학습된 임계값 및 ThriftyDAgger의 추정기는 추가 기계입니다.
- 프레임을 계산하고, 결과는 계산하지 않습니다.
- 컨트롤 업스트림의 실패가 있는 정책을 구할 수 없으며, 예를 들어 교환된 카메라 또는 잘못된 레이블이 지정된 작업 문자열
뷰에 유지할 가치가 있는 공개 질문
벤치마크는 약합니다. Spencer와 동료들은 모방 학습 접근법을 테스트하는 데 사용되는 것들을 검토하고 "실현 가능하고 간단하며 실제 세계 의사 결정 문제에서 볼 수 있는 오류 복합의 더 어려운 레짐을 캡처하기에 불충분"하다고 발견했습니다. 그리고 주변 문헌에 대해, 순수 행동 복제가 그들에 대해 잘 수행했습니다. 그것은 위의 테이블의 DAgger 변형 순위에 의존하는 이유로, 일부 숫자를 포함하여 의심의 이유입니다.
대규모 정책에서 로봇 게이트도 해결되지 않습니다. AIM 작업은 불확실성을 인간 개입 규칙을 모방하는 프록시 Q 함수로 대체하고 ThriftyDAgger에 비해 인수 비용 및 학습 효율성에서 40% 개선을 보고합니다. 연속 및 이산 제어에서, 매니퓰레이터를 운전하는 비전 언어 행동 모델에서는 아닙니다. 이러한 게이트가 미세 조정된 VLA로 전송되는지 여부는 열려 있습니다. 설문조사는 관련 포인트를 작성합니다: 분야의 용어 및 구조는 문헌 전체에서 통일되지 않으며, 이는 메서드를 비교하기 어렵게 합니다. 귀신 팔에서, 귀신 로그는 당신이 가진 증거입니다.
HG-DAgger는 인간이 개입 중에만 라벨을 지정하면 정말 DAgger입니까?▾
중요한 부분을 유지합니다. 학습자가 유도하는 상태 분포 하에서 수집되고 이전과 집계된 데이터. 그리고 하드웨어와의 접촉에서 생존하지 않는 부분을 떨어뜨립니다. Kelly et al.은 변형으로 제시합니다. 2011년 후회 없는 보증은 변경되지 않은 상태로 이월되지 않습니다.
SO-100에서 미세 조정된 VLA 정책에 로봇 게이트를 사용할 수 있습니까?▾
곧바로 아닙니다. SafeDAgger의 분류기는 없는 쿼리 가능한 참조 정책이 필요합니다. EnsembleDAgger는 앙상블이 필요하며, 다중 십억 매개변수 모델의 경우 메모리에 여러 복사본과 그들의 추론 비용을 의미합니다. ThriftyDAgger는 첫 번째 라운드 전에 없는 성공 및 실패에 맞춰진 위험 추정기가 필요합니다.
단일 인수는 얼마나 오래되어야 합니까?▾
정책이 계속할 수 있는 상태에 도달할 만큼 길고, 그 이상은 아님: 연장된 인수는 실행을 시연 세션으로 바꾸고 수정 세트를 명목 행동으로 범람시킵니다. LazyDAgger의 발견은 다른 방식으로도 절단됩니다. 많은 매우 짧은 스위치는 자신의 비용입니다.
수정 세그먼트에서만 훈련해야 합니까?▾
아니요. 이것이 라운드를 낭비하는 가장 일반적인 방법입니다. 복구에서만 미세 조정된 모델은 거의 아무것도 보지 못했지만 복구입니다. 명시적으로 선택한 소스와 원본 데이터세트에 수정사항을 혼합하십시오. 더 나아가려면 인간이 운전한 프레임을 가중치 아래가 아닌 가중치를 더하는 IWR 또는 Sirius와 같은 개입 가중치 접근법을 살펴보십시오.
라운드 이후 개입율이 떨어지지 않으면 어떻게 됩니까?▾
면 가치대로 그것을 받으십시오: 라운드가 도움이 되지 않았습니다. 수정사항을 추가하기 전에 더 저렴한 설명을 확인하십시오. 운영자의 임계값이 드리프트되었습니까, 수정사항이 화장이었습니까, 구성된 데이터세트가 실제로 포함했습니까, 훈련이 의도된 체크포인트에서 초기화되었습니까. 조용히 기본 모델에서 시작한 라운드는 실패한 라운드를 배우는 것처럼 보입니다.
비개입이 정보를 전달합니까?▾
전문가 개입 학습에서 예: 감시자가 보고 행동하지 않은 늘어나는 부분은 상태와 행동이 수용 가능했다는 약한 증거로 읽혀지고, 가치 함수에 대한 제약으로 공식화됩니다. 이 플랫폼을 포함한 대부분의 실제 파이프라인은 인간이 운전한 것만 표시합니다.
한 팔이 책상에 있으면 선택이 이루어집니다. 게이트를 직접 들고, 열지 못하는 조건을 작성하고, 스위치를 자동화하는 대신 데이터 처리에 노력을 소비하십시오. 플랫폼 측은 DAgger 루프 페이지 에 설명되어 있으며, 정책 패밀리당 훈련 옵션은 훈련 및 가격 책정 에 있습니다. 배경을 위해 모방 학습 및 SO-100에서 모방 학습 으로 시작하십시오. 첫 번째 실행의 경우, 첫 번째 정책 실행 이 더 짧은 경로입니다.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started