
Saf DAgger, politika henüz sürüş sırasında insandan durumları etiketlemesini ister. Gerçek donanımda bu güvenli değildir ve kötü etiketler üretir. Kapılı varyantlar kör etiketlemeyi birinin tutması gereken bir kapı ile değiştirir: HG-DAgger'de insan, SafeDAgger'de bir güvenlik sınıflandırıcısı, EnsembleDAgger'de bir topluluk'un anlaşmazlığı, ThriftyDAgger'de bütçeli bir yenilik-ve-risk tahmini. Bu makale, kapıyı kimin kontrol ettiğini, neyi açtığını ve her birinin ne maliyeti olduğunu karşılaştırır — ve neden insan-kapılı biçim gerçek bir kolun temasında hayatta kalan olanıdır.
Klonlanmış bir politika, eğitim verileri bittiği yerde başarısız olur. Çözüm, gösteri yapanın dağılımı yerine politikanın kendi durumu dağılımı altında veri toplama yapmaya devam etmektir — bu DAgger'in yaptığı şey ve dataset aggregation'a giriş ilk ilkelerden ele alır. Orijinal algoritmanın garip kısmını açıkta bırakır: öğrenme sürüş yapıyor iken, uzman her durum için ne yapmış olacaklarını söylemesi gerekir, kontrolde olmadan.
Komut dosyası uzmanı olan bir simülatörde bu ücretsizdir. Yanında gerçek bir kol olan bir masada ne ücretsiz ne de güvenlidir. HG-DAgger yazarları itirazı tam olarak belirtir: bu tür örnekleme şemaları "uzmanın sistem üzerinde tam kontrol sahibi olmadan eylem etiketleri sağlamasını gerektirir", bu da "güvenliği azaltabilir ve insanlar uzman olarak kullanırken, algılanan aktuatör gecikmesi nedeniyle toplanan etiketlerin kalitesini bozma olasılığı yüksektir" (Kelly vd., 2019). O cümledeki iki başarısızlık saklıdır: politika kimsenin istemediği durumları yönlendirmeye devam eder ve bu riskle satın alınan etiketler, bir insan kontrolleri tutarken ürettiği etiketlerden daha kötüdür. Aşağıdaki her varyant aynı soruyu yanıtlar — kontrole bir kapı koyun ve birinin onu ne zaman açacağına karar vermesini sağlayın. Aralarındaki fark, o birinin kim olduğudur.
Kısa versiyon
- •Kapılı varyantlar kör etiketlemeyi politika kontrolü ve uzman kontrolü arasında bir anahtarla değiştirir. Onları ayıran şey, anahtarın kim tarafından kontrol edildiğidir.
- •HG-DAgger anahtarı insana verir ve yalnızca insan kesintisiz kontrol sahibi iken kaydedilen verileri toplar.
- •SafeDAgger bunu bir referans politikasından sapmayı tahmin eden ikili bir sınıflandırıcıya verir; EnsembleDAgger düşük topluluk varyansı ve uzman eyleminden küçük mesafe gerektirir.
- •LazyDAgger, kontrol ileri-geri dalgalanması yapmayacak şekilde hysteres ekler; ThriftyDAgger açık müdahale bütçesi altında yenilik veya tahmini riski kapıya koyar.
- •Robot-kapılı sinyaller, hobi-sınıfı bir kol üzerinde ince ayarlı bir VLA'nın genellikle yaşadığı bir şey gerektirir: bir referans politikası, ucuz bir topluluk veya kalibre edilmiş epistemik belirsizlik.
- •Kapı yöntemin yarısıdır. Müdahale segmentlerine sonra ne olur — karıştırma, ağırlıklandırma, toplama — turda bir iyileşme sağlayıp sağlamadığına karar verir.
İnsan-kapılı ve robot-kapılı: önemli olan bölünme
Etkileşimli taklit öğrenmenin kendi anket araştırması vardır; Celemin ve meslektaşları bunu geribildirim türü, arayüz, öğrenme modeli, kullanıcı deneyimi, uygulama ve kıyaslama ile kataloglar. Mühendisliğinizi belirleyen ayrım, bu eksenlerden herhangi birinden daha basittir ve son çalışma bunu doğrudan adlandırır: bir yöntem human-gated denetçi müdahale zamanına karar verdiğinde ve robot-gated ajan yardım istediğinde karar verdiğinde (Cai vd., 2025). Diğer her şey bu iki seçimden birine hizmet eden makineridir. Ticaret başından itibaren görülür: insan kapısı sürekli dikkat gerektirir ve robot kapısı bu dikkati geri vermeyi vaat eder — ama yalnızca kapının açtığı sinyal güvenilirse ve bu sinyali oluşturmak kendi araştırma problemidir.
SafeDAgger: kendi sapmasını tahmin eden bir sınıflandırıcı
Zhang ve Cho'nun SafeDAgger'ı (2016), bu kapıların en eskisidir. Referans politikasını sorgulamak pahalı kısımdır, bu nedenle küçük bir ağ — güvenlik politikası — sorgulamanın faydalı olup olmadığını tahmin eder. "Birincil politikanın, sorgulamadan bir referans politikasından sapma olasılığını gösteren ikili bir etiket döndürür". Etiket, iki politikanın eylemleri arasında eşik tau'yu aşan kare L2 sapmasına karşı tanımlanır ve sınıflandırıcı ikili çapraz entropisi ile uyumludur. Çalışma zamanında, her durum için öğrenenin sürüş yapmaya devam edip etmediğine veya referansın devraldığına karar verir. Özet, bir araba yarışı simülatöründe daha az referans sorgusu ve yazarların otomatik müfredeme etkisine atfettikleri bir yakınsama hız artışı bildirir, hiçbiri için bir rakam vermez.
Tuzak tanımda, sonuçlarda değildir. Sınıflandırıcıyı eğitmek, uydurmak için kullanılan her durum üzerinde referans politikasının eylemini gerektirir, bu da referansın başka bir program olduğunu varsayar. Referansınız bir lider kol olan kişi ise, o etiket seti ucuz değildir ve yöntem tasarlandığı mülkü kaybeder.
EnsembleDAgger: kuşku ve tutarsızlık, her ikisi de
Menda, Driggs-Campbell ve Kochenderfer (2019) kapıyı olasılıklı bir soruya dönüştürür. EnsembleDAgger "sinir ağlarından oluşan bir topluluğu kullanarak Gauss Sürecini yaklaştırır" ve topluluk varyansını bir güven proxy'si olarak okur: yüksek varyans, eğitim verilerinden farklı bir bölge anlamına gelir ve bu — uzmanın başarısızlık durumlarını avladığını varsayarak — başarısızlığa yakınlık ile ilişkilidir. Kural bir birleşimdir. Öğrenen, yalnızca L2 mesafesi ortalaması eylemine karşı bir eşik altında kaldığında hareket edebilir (tutarsızlık) ve tahmin edilen eyleminin varyansı ikinci bir eşik altında kalır (kuşku). Her ikisi de başarısız olursa, uzman kontrol üstlenir. Amaç, başarısızlık olasılığını sınırlandırırken öğrenene eylem payı en üst düzeye çıkarmaktır; makale, ters sarkacak ve MuJoCo HalfCheetah'ta diğer DAgger varyantlarına karşı iyileştirilmiş güvenlik ve öğrenme bildirir.
Bu sessizce bağımsız denetim için tam kuralı diskalifiye eder. Öğrenene ait eylem ve uzmanın eylemi arasındaki mesafe, o durum ve o anı uzmanın eylemini gerektirir. Komut dosyası uzmanı ile güzel. İnsan ile, insan sürekli eylem üretmek zorundadır — kapılı varyantlar kaldırmak için tasarlandığı tam yük. Kuşku terimi tek başına bağımsız; birleşim değildir.
LazyDAgger: anahtarın tıklamayı durdur
Hoque ve meslektaşları (2021) önceki makaleler ölçmemiş bir maliyete saldırdı: anahtarın kendisi. Her müdahale "denetçinin yaptığı diğer işleri keser, denetçi ve otonom kontrol arasında bağlam anahtarı ile gecikme gerektirir ve gerçekleştirmek için zaman gerektirir". Dakikada on kez açılan ve kapanan bir kapı, on saniye açılan bir kapıdan daha kötüdür, aynı otonom payda. LazyDAgger, SafeDAgger'ı asimetrik eşiklerle genişletir — denetçi kontrolüne girmek daha zordur kalıp devam etmekten — bu nedenle sistem sınırda salınmaz. Simülasyonda "3 sürekli kontrol görevinde SafeDAgger'ın üzerinde ortalama %60 bağlam anahtarı azaltabilir ve son teknoloji politika performansını koruyabilir"; kumaş manipülasyonunda ABB YuMi ile "SafeDAgger'ın üzerinde %60 bağlam anahtarı azaltır ve yürütme zamanında %60 daha yüksek başarı oranı sağlar".
ThriftyDAgger: yenilik veya risk, bir bütçe altında
ThriftyDAgger (Hoque vd., CoRL 2021), politika yerine denetçinin bütçesinden başlar. "Müdahaleleri yalnızca yeterince (1) yeni olan durumlarda talep eder, robot politikasının taklit edecek referans davranışı yoktur veya (2) riskli, robot görev tamamlamada düşük güvene sahip olduğu yerde", bu riski tahmin etmek için yeni bir metrik ile. Bütçe, çıktı değil giriştir: ne kadar insan zamanı harcayacağınızı belirtirsiniz. Yürütme zamanında uygulandığında yöntem "hem simülasyon hem de fiziksel görevlerde %100 başarı oranı sağlar" ve on katılımcı ile üç robotik filo kontrolünü yapan ve bir konsantrasyon görevini yürüten bir kullanıcı çalışması, bunun "denetçi yükünü azaltırken sonraki en iyi algoritma ile karşılaştırıldığında insan ve robot performansını sırasıyla %58 ve %80 arttırdığını" bildirir. Filo ayarı bu çalışmanın doğal yuvası; Fleet-DAgger daha sonra birden fazla robot ve denetçi ile etkileşimli filo öğrenmesini resmileştirmiş, İnsan Çabasının Geri Dönüşünü optimize etmek için miktarı önermiştir.
HG-DAgger: insan kapıyı tutar
Kelly vd. (2019) öbür tarafa gider. Anahtarlama politikası yoktur. Öğrenenin "çalıştırılması, uzmanın acemi'nin durum alanının güvenli olmayan bir bölgesine girdiğini gözlemledinceye kadar devam eder", bu noktada uzman kontrol üstlenir ve sistemi geri yönlendirir. Toplama kuralı sıkı kısımdır: "Uzman eylem etiketleri yalnızca bu kurtarma yörüngeleri sırasında toplanır ve veri setine eklenir, bunun sırasında insan uzman kesintisiz kontrol sahibi olur." İnsan bir izleyici iken hiçbir şey etiketlenmez.
Anahtarda durmaz. HG-DAgger ayrıca "model-belirsizliğe dayalı risk metriği için bir güvenlik eşiği öğrenir ve bunu tamamen eğitilmiş acemi'nin durum alanının farklı bölgelerindeki performansını tahmin etmek için kullanılabilir": öğrenen'in insan müdahale ettiği anların belirsizliğini kaydeder ve bu kayıtların son çeyreğinin ortalamasını alır, öğrenen'in son biçimine en çok benzediği yerde. Bu robotun işlettiği bir kapı değil, bitirilmiş politikanın tutacak olması beklenen yeri söyleyen bir tanıdır. Değerlendirme, benzetilmiş ve gerçek dünya sürüş görevini kapsar ve DAgger ve davranış klonlamaya karşı iyileştirilmiş performans bildirir.
Bir ilişkili hattı, etikete neyin sayıldığını değiştirir. Spencer ve meslektaşlarının Uzman Müdahale Öğrenmesi, "müdahale veya müdahale etmeme biçiminde herhangi bir uzman geribildirimi, mevcut durumun kalitesi, eylemin optimalitesi veya her ikisi hakkında bilgi sağlar", öğrenenin değer fonksiyonunun bir kısıtı olarak resmileştirilmiş ve pişmanlıksız çevrimiçi öğrenme ile çözülmüş olarak tutulur. Bu okuma altında, insan izlediği ve hiçbir şey yapmadığı çizgiler zayıf pozitif kanıt yerine boş değildir. EIL, yaklaşık bir dakika uzman kontrolünden çarpışma kaçınmayı öğrenir.

Yan yana varyantlar
| Yöntem | Kapıyı kim açar | Sinyal | Kullanılabilir | Bildirilmiş |
|---|---|---|---|---|
| DAgger (Ross vd., 2011) | Kimse — öğrenen her zaman sürüş yapar | Hiçbiri; uzman her ziyaret edilen durumu etiketler | Kontrolde olmayan cari durumları etiketleyebilen bir uzman | Öğrenenin durumu dağılımı altında garantiler ile pişmanlıksız indirim |
| HG-DAgger (Kelly vd., 2019) | İnsan denetçi | Denetçinin durumun güvenli olmadığı yargısı | Birini izlemek ve kontrol iadesi temiz | Benzetilmiş ve gerçek sürüş görevinde DAgger ve davranış klonlamayı yener; ayrıca bir risk eşiği öğrenir |
| SafeDAgger (Zhang & Cho, 2016) | Robot | Referanstan L2 sapması için ikili sınıflandırıcı tau üzerinde | Sınıflandırıcının etiketleri için sorgulanabilir referans politikası | Araba yarışı simülatöründe daha az referans sorgusu, daha hızlı yakınsama (rakam yok) |
| EnsembleDAgger (Menda vd., 2019) | Robot | Topluluk varyansı ve uzman eylemine olan mesafe, her ikisi de eşik altında | Ağ topluluğu artı her adımda uzmanın eylemi | Sarkacak ve HalfCheetah'ta iyileştirilmiş güvenlik ve öğrenme |
| LazyDAgger (Hoque vd., 2021) | Robot, hysteres ile | SafeDAgger'ın sinyali ayrı giriş ve çıkış eşikleri ile | SafeDAgger'ın ihtiyacı artı ayarlanması gereken ikinci eşik | 3 görev üzerinde ~%60 daha az bağlam anahtarı; YuMi kumaş'ında %60 daha yüksek başarı |
| ThriftyDAgger (Hoque vd., 2021) | Robot, bir bütçe altında | Yenilik veya görev tamamlama için tahmini risk | Öğrenilen risk tahminleyici ve belirtilen müdahale bütçesi | %100 yürütme zamanında başarı; kullanıcı çalışması (N=10): sonraki en iyiye karşı %58 ve %80 kazançları |
| EIL (Spencer vd., 2020) | İnsan — müdahale etmeme de sayılır | Müdahale ve yokluğu değer fonksiyonu kısıtları olarak | Değer kısıtı üzerinde çevrimiçi pişmanlıksız öğrenme | Yaklaşık bir dakika uzman kontrolünden çarpışma kaçınması |
Her kapı neyi satın alır, ve ne yüklenir
"İhtiyaçlar" sütunu aşağı okuyun ve bir desen ortaya çıkar: oradaki her robot-kapılı sinyal üretilmesi gereken bir proxy'dir ve her proxy'nin kendi faturası vardır.
- Tutarsızlık sinyalleri (SafeDAgger, LazyDAgger, EnsembleDAgger kuralının yarısı) bir referans politikasına ihtiyaç duyar. Ya komut dosyası uzmanınız vardır, bu durumda ilginç sorun halihazırda çözülmüştür veya bir insan mesafe hesaplanabilecek şekilde arka planda eylemleri üretmeye devam eder.
- Kuşku sinyalleri kalibre edilmiş epistemik belirsizliğe ihtiyaç duyar. Küçük kontrol ağlarının topluluğu bunu yaklaştırır; üç milyar parametreli bir görüntü-dil-eylem modeli topluluğu önce bellek ve gecikme problemidir.
- Yenilik ve risk sinyalleri görev tamamlamanın öğrenilen bir tahminleyicisine ihtiyaç duyar, yeterli başarılı ve başarısız rollout üzerinde uyumlu. Hala çalışmaya çalıştığınız bir görevde, o veri ilk turda mevcut değildir.
- İnsan kapısı dikkat ve başka hiçbir şey gerektirmez — gün birinde herhangi bir politika mimarisi ile herhangi bir ekstra model eğitmesi olmaksızın mevcut olan tek sinyal.
- Hiçbir robot kapısı insanı odadan çıkarmaz. Bunlar insanın ne sıklıkla hareket etmesi gerektiğini azaltır, olması gerekip gerekmediğini değil.
Kapının üreteceğinde daha sessiz bir fark var. Bir robot kapısı yörüngernin ortasında ateşlenir bir kişiye keyfi bir poza bir kolu atar. İnsan kapısı operatörün anı seçmesine izin verir — ulaştırmanın sonra, el öncesi, sallanışın ortasında değil. İki turdan geri dönüş segmentleri eşit derecede temiz değil ve bu segmentler turun tüm ürünü.
Neden insan-kapılı biçim gerçek donanımda kazanır
Bu bir mühendislik argümanıdır, kıyaslama sonucu değil — aynı manipülatör ile aynı politika sınıfında beş kapıyı çalıştıran bir makale bulamadık. Dört noktaya dayanır.
Birincisi, denetçi zaten orada. Kimse bir SO-100 kol çalıştırmaz yanında devriltiğini istediği nesneleri yapamayarak. Biri izlerken, onlara devralma düğmesi vermenin marjinal maliyeti sıfıra yakındır; kalibre edilmiş risk tahminleyici inşa etmek bir projedir.
İkincisi, modern bir politika üzerinde ölçebileceğiniz belirsizlik genellikle yanlış miktardır. Difüzyon veya akış eşleştirme başlığı, örneklenmiş eylem çünklerine yönelik varyans üretir ve bu varyans, başlığın temsil etmek için eğitildiği çok modaliteyi yansıtır, durum hakkında epistemik cehalet değil. EnsembleDAgger'ın kuşku terimi tam olarak ikincisini yakalaması için topluluk kullanır. İkisine benziyor ve değildir; eylem parçalanması ve akış eşleştirme girişleri bu başlıkların ilk yerde nasıl eylem yayınlandığını kapsar.
Üçüncüsü, manipülasyonda önemli olan başarısızlıklar genellikle istatistiksel olarak alışılmadık yerine anlamsal. Politika gripper'i iki santimetre erken kapatmak veya özgüvenle özdeş iki küpten yanlışı almak için ulaşmak, yüksek varyans durumunda değildir — özgüvenli ve yanlıştır. Hiçbir varyans eşiği bunu yakalar; izleyen bir kişi hemen yakalar.
Dördüncüsü, etiket kalitesi — orijinal HG-DAgger noktası ve en sık atlanılanı. İnsan kesintisiz kontrole sahip iken toplanan etiketler, hareketli bir sistem üzerinde anlatılan etiketleri yener. Amaç toplama değeri olan düzeltici veri ise, kanıt yükü otomatik kapıda yatıyor.
Resim, bir denetçi birden fazla robota sorumlu olduğunda kaşır — ThriftyDAgger'ın kullanıcı çalışması ve Fleet-DAgger'ın resmileştirmesinin hedef aldığı rejim. Bir filo ile, insan dikkat kıt kaynak ve eksik olmayan kusurlu bir ayırma. Bir kol bir masanın üzerinde sen bu rejimde değilsin.
İnsan-kapılı döngü, zaten kablolu
Çalışan çıkarım oturumu sırasında devralma, düzeltilmiş segmentlerde çerçeve başına müdahale bayrakları, her turunu düzeltmeleri veya değerlendirmeye kurması, seçtiğiniz kaynaklardan bir karışık veri seti oluşturması ve mevcut bir denetim noktasından devam eden eğitim elle komut dosyası yerine yerleştirilmiştir. Devralma bir lider kol ile veya bir tane yoksa klavye ve kaydırıcı ile çalışır.
DAgger döngüsünün nasıl çalıştığını görünKapı yöntemin yarısıdır; veri işleme diğer yarısıdır
Bir kapı, bir insanın sürüş yaptığı çerçevelere karar verir, bunlarla ne yapacağına değil ve o ikinci karar turlarda en sık boşa harcanır. İlk kural, DAgger'daki D'nin ne olduğudur: topla, değiştirme. İnce ayarlama bir denetim noktası yalnızca birkaç yüz düzeltme çerçevesi üzerinde yapıldığında, neredeyse hiçbir şey görmeyen ve nominal yörüngeyi unutmuş bir model sunar.
İkinci kural, müdahale çerçevelerinin sıradan çerçeveler olmadığıdır. Mandlekar vd. 6-DoF manipülasyon için uzak teleoperation sistemi inşa etti, operatörlerin politikaları izlemesine ve başarısızlığa müdahale etmesine izin verdi, sonra "politikanın müdahaleler aracılığıyla darboğazları nasıl geçeceğini öğrenmeyi teşvik ettiği" bir algoritma ile yinelemeli olarak eğitti; bu veriler üzerinde eğitilen ajanlar sıradan gösteri numunelerine eşit sayı ile eğitilen ajanları yenmiş. Sirius fikri dağıtıma itter, "İnsan güvenini yaklaştırarak eğitim numunelerini yeniden ağırlandırma ve ağırlıklı davranış klonlama ile politikaları optimize etme". Her ikisine de bir insanın sürüş yaptığının çerçeve başına işaretleyicisine ihtiyaç vardır, bu nedenle müdahale bayrağı göründüğünden daha önemlidir.
Üçüncü kural, otomatik karıştırmanın bir tuzak olmasıdır. Kaynaklarını numaralandıramayacağınız bir tumuş veri seti bir sonraki tur daha kötü hale geldiğinde hata ayıklayamayacağınız olandır. Bu platformda tercih adımı bu nedenle açıktır — orijinal veri seti artı düzeltmeler, kaynak başına bölüm seçimi ve sonuç sıradan bir LeRobot veri seti bu senkronize olur ve başka herhangi bir şekilde eğitilir; veri seti belgelendirmesi format tarafını kapsar.
| Turdaki adım | Ne üretir | Bunun en yaygın yanlış gitmesi |
|---|---|---|
| Kaydedici açık ile çıkarım çalıştırın | Öğrenenin kendi durumu dağılımı altında çalıştırma | Politika sürüş yaptığını kaybederek düz teleoperation olarak kaydedilmiş |
| Başarısızlıkta devral | Düzeltme segmentleri çerçeve başına müdahale bayrağı ile | Kozmetik sallanış düzeltme, stil öğretimi kurtarma yerine |
| Her bölümü kütüphanele | Düzeltmeler, değerlendirme veya atıklar | Herşey tutma; hatalı bir devralma episodu değerindendi daha pahalıya mal olur |
| Düzeltmeleri senkronize et | Orijinalin yanında sürümlü veri seti | Hiçbir zaman yerel makine bırakmayan düzeltmeler |
| Karışık veri setini oluştur | Orijinal artı düzeltmeler, açık seçim | Sessiz otomatik karıştırma, bu nedenle daha sonra regresyon bir kaynağa izlenemez |
| Denetim noktasından devam et | Önceki birinden başlatılmış bir denetim noktası | Bir optimize edici özeti bekleniyor; ağırlıklar modeli başlat, optimizer durumunu geri yüklemiyor |
Kişinin gerçekten tutabileceği bir kapı ayarla
"İnsan karar verir" bir spesifikasyon değildir. Farklı eşiklere sahip iki operatör karşılaştırılamayan turlar üretir ve sürüklenen eşik okunamayan trend üretir. İlk turu önce tetikleyicileri yaz.
- Kapıyı açan koşulları adlandırın — yaklaşım bir sabit marjdan birden fazla kapalı, hiçbir şeye kapanan grepper, darboğazya sürüklenen eklem, bir saniye veya iki stall — ve turun listesini değiştirilmemiş tutun.
- Bunun açılmadığını adlandır. Politikanın kendisinden kurtulduğu polisye oversoot eğitim sinyali; orada devral orada biliyor kurtarmayı siler.
- Temiz devralma için çok erken devral, durum kurtarılabilir olur olmaz geri ver.
- Neden devralsa, bölüm başına kaydediyor. Üç tur sonra o turun kaydıdır başarısızlık geri dönüş olup olmadığı.
- Kameralar, görev metni ve operatör turlar arası sabit tutun. Bir değişim ve sayılar karşılaştırılamaz duruma gelir.
Mekanik olarak devralmanın iki varyant vardır. Lider kol ile lider, torque aktarılmadan önce izleyen'in mevcut pozuna ulaşması veya kol atıyor; bu hizalama hareket gerçek donanımda en az test edilmiş kısmıdır. Lider kol olmadan devralma ilk tuş basısından el ile: izleyen tutulur ve operatör onu klavye'den eklem başına nudge etme veya kaydırıcılar sürükle, sunucu tarafında sınırlar her girişi küçük tutmak — keypress başına bir kaç derece, kaydırıcı güncelleme başına bir çift çünkü bir tutulan poza büyük adım servo soyma yoludur. Adım adım versiyon anahtarlamalarla SO-100 üzerinde bir DAgger turu yürüyüş; her iki teleoperation modu arka planı teleoperation belgelendirmesi ve lider-izleyen girişi içinde.

Kapı bir şey yaptıysa oku
İnsan-kapılı turun metriği müdahale oranıdır: müdahale çerçeveleri turun çerçeveleri ile bölünen. Bir iş vardır — turlar boyunca düşmezse, tur hiçbir şey satın almadı ve sonraki değişim verileri miktarı dışında başka bir şey.
Taraflı bir metriktir ve nasıl olduğunu bilmelisin. Operatörün eşiğini politikanın yeterliliği kadar ölçer, bu neden tetik listesi sabit kalır; bir oturum üzerinde gevşek bir operatör arkasında hiçbir şey olmayan bir düşüş eğrisi üretir. Ayrıca önemini görmezden gelir — bir çarpışmayı durdurmak on çerçeve ve bir kavrama nudge on çerçeve özdeş görün. Hiçbir düzeltme verisi hiç çizilen sabit değerlendirme seti ile eşleştir. DAgger döngüsü ölçme makalesini değerlendirme tasarımı aracılığıyla işleri, eğitim karışımının dış değerlendirme bölümleri tutma dahil.
- Gün birinde herhangi bir politika mimarisi ile çalışır, kalibre etmek için hiçbir ekstra model ile
- Hiçbir varyans eşiğinin algılamadığı özgüvenli-ve-yanlış başarısızlıkları yakalar
- Operatörün tam kontrole sahip iken ve seçtikleri anı kaydedilmiş düzeltmeleri üretir
- Müdahale-ağırlıklı metodlar IWR ve Sirius gibi tüketim için çerçeve başına işaretleyici verir
- Sürekli gözetim maliyetleri; çok robota ölçeklenmez
- Operatör tutarlılığına bağlıdır — sürüklenen eşik müdahale oranı yozlaştırır
- Kendi tarafından hiçbir risk modeli üretmez; HG-DAgger'ın öğrenilen eşik ve ThriftyDAgger tahminleyici ekstra makineridir
- Çerçeveleri sayar, sonuçları değil
- Politika başarısızlığı kontrolün yukarısında, örneğin takas kamerası veya yanlış etiketlenmiş görev dizesi kurtarılamaz
Görüş açısından açık sorular tutmaya değer
Karşılaştırmaları zayıf. Spencer ve meslektaşları taklit öğrenme yöntemlerini test etmek için kullanılan olanları incelediler ve "gerçekleştirilebilir ve basit ve bu nedenle gerçek dünya karar alma problemlerinde görülen hata compounding daha zor rejimi yakalaması için yetersiz" olarak buldu — ve çevre literatürün karşısında, saf davranış klonlamayı iyi yaptığını buldu. Bu, DAgger varyantlarının sıralaması kalan tüm görevlere kuşkulu olması için nedendir, yukarıdaki tabloyu da içeren.
Büyük politikalar üzerinde robot kapıları da çözülmemiş. AIM iş belirsizliğini insan müdahale kuralı taklit eden proxy Q-işlevi ile değiştirir ve ThriftyDAgger'ın üzerinde devralma maliyeti ve öğrenme verimliliğinde %40 iyileşme bildiriri — sürekli ve ayrık kontrolde, manipülatörü çalıştıran görüntü-dil-eylem modeli üzerinde değil. Bu kapılardan herhangi birinin ince ayarlı VLA'ya aktarıp aktarmadığı açıktır. Anket ilişkili bir nokta yapan: alanın terminolojisi ve yapısı literatür arası birleşmiş değildir, bu metodlar karşılaştırmayı zorlaştırır. Kendi kolunuz üzerinde, günlükleriniz sahip kanıt.
İnsan yalnızca müdahaleler sırasında etiket veriyorsa HG-DAgger gerçekten DAgger midir?▾
Bu konuda kalmaz — veri toplanır öğrenenin induler durumu dağılımı altında, öncekisi ile toplanır — ve donanımın teması ile hayatta kalmayan kısmı düşürür. Kelly vd. bunu varyant olarak sunar; 2011 pişmanlıksız garanti değişmemiş ileriye taşınmaz.
SO-100 üzerinde ince ayarlı VLA politikasında robot kapısını kullanabilir miyim?▾
Doğrudan değil. SafeDAgger'ın sınıflandırıcısı sahip olmayan sorgulanabilir referans politikasına ihtiyaç duyar. EnsembleDAgger topluluğa ihtiyaç duyar, bu çok milyar parametreli model için bellek ve çıkarım maliyeti yanında birkaç kopya anlamına gelir. ThriftyDAgger ilk turdan önce mevcut olmayan başarıları ve başarısızlıkları uyumlu risk tahminleyicisine ihtiyaç duyar.
Tek bir devralma ne kadar sürmeli?▾
Politikanın devam edebileceği durumuyla ulaşacak kadar uzun ve daha uzun: genişletilmiş devralma turunu gösteri oturumuna çeviri ve düzeltme setini nominal davranış ile seli. LazyDAgger'ın bulgusu diğer tarafa da keskin — çok sayıda çok kısa anahtarlar kendi maliyetlerdir.
Sadece düzeltilmiş segmentler üzerinde eğitim verebilir miyim?▾
Hayır — tur atılmanın en yaygın yoludur. Yalnızca kurtarmalarda eğitilen model neredeyse hiçbir şey görmeyen ve nominal davranışı unutmuş. Düzeltmeleri orijinal veri seti ile açık seçilen kaynaklardan karıştırın; daha uzağa gitmek için müdahale-ağırlıklı yaklaşımlar IWR veya Sirius gibi bak, insan sürüş çerçeveleri yalıtmak yerine yukarı ağırlık.
Müdahale oranı turdan sonra düşmezse ne?▾
Yüz değerini al: tur yardım etmedi. Düzeltmeler eklemeden önce daha ucuz açıklamalar kontrol et — operatörün eşik kaymış, düzeltmeler kozmetikti, tumuş veri seti gerçekten onları içerdi, eğitim niyet denetim noktasından başlatıldı. Sessizce taban modelden başlayan tur başarısız başlayan turdan tam olarak benzin.
Müdahale etmeme bilgi taşıyor mu?▾
Uzman Müdahale Öğrenmesi altında, evet: denetçi izleyen ve hareket etmedi çizgiler durum ve eylem kabul edilebilir zayıf kanıt değer fonksiyonu kısıt olarak okunan olarak okunur. Çoğu pratik boru hattı, bu dahil, yalnızca insan sürüş yaptığını işaretle.
Masanın üzerinde tek kol için seçim yapılmıştır: kapıyı kendin tutun, onu açan şeyleri yaz ve tur arkasındaki veri işlemeye anahtar otomatikleştirmeye geçirilen çaba harca. Platform tarafı açıklanan DAgger döngü sayfası, politika aile başına eğitim seçenek altında eğitim ve fiyatlandırma. Arka plan, başla taklit öğrenme ve SO-100 üzerinde taklit öğrenme; ilk tur için ilk politikanızı çalıştırın daha kısa yol.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started