
Müdahale hızı - müdahale kareleri bölü koşunun kareleri - insan-geçitli DAgger döngüsünün sahip olduğu en ucuz dürüst ilerleme sinyalidir. Bu makale bunu, iki kişinin aynı değeri hesaplaması için tanımlar, nasıl günlüğe kaydedileceğini gösterir ve onu yanlış yönlendirebilecek dört yoldan geçer: operatör alışkanlığı, bölünen bir değerlendirme kurulumu, yalnızca düzeltmeler üzerine eğitim ve bir kişi Pazartesi günü Salı günü farklı şekilde düzeltme yapan.
Bir DAgger turu, içinde iken üretken hissettiriyor. Policy'yi yürütüyorsunüz, kavramayı kaçırdığında devralıyorsunuz, düzeltmeleri kaydediyorsunuz, yeniden eğitiyorsunuz ve sonraki koşu - yemin edebilirsiniz - biraz daha pürüzsüz görünüyor. İki tur sonra hiçbir şey değişip değişmediğini söyleyemiyorsunuz, çünkü "biraz daha pürüzsüz" bir nicelik değil.
Döngü bir tur başına bir sayıya ihtiyaç duyar ve insan-geçitli bir döngüde bu sayı neredeyse ücretsizdir: policy yerine kontrolde olduğunuz koşun kesri. Bu makale bunu, iki kişinin aynı değeri hesaplaması için tanımlar, günlüğe kaydeder, ortaya çıkan eğriyi okur ve onu tek başına durduğunda onu yanlış yönlendirebilecek dört yolu adlandırır. Teori için bu yazı şunları varsayar: DAgger açıklayıcısı ve insan-geçitli çeşit; pratik karşılığı bir SO-100 üzerinde DAgger döngüsü çalıştırmak.
Kısa versiyon
- •Müdahale hızı = müdahale kareleri / koşunun kareleri. Kareler, bölümler değil ve payda düzeltmek için harcadığınız kareleri içerir.
- •Üç tur boyunca düz bir eğri turlara hiçbir şey satın almadığı anlamına gelir - karışımı, kontrol noktasını veya görevi değiştirin, dördüncü bir turu toplamak yerine.
- •Düşen bir müdahale hızı yükselen bir başarı hızı değildir. Adım atma eşiğiniz güven büyüdükçe aşağı doğru bölünür.
- •Dondurulmuş bir değerlendirme protokolü olmadan - aynı başlangıç pozu, nesneler, kameralar, deneme sayısı - odayı ölçüyorsünüz.
- •Yalnızca düzeltmeler üzerine eğitim devlet dağılımını çarpıtır. IWR'nin cevabı: müdahale ve müdahale olmayan örnekleri eşit oranda çizin.
Neden bir turu her şeyden bir sayıya ihtiyaç duyuyor
DAgger bir dağıtım sorunu nedeniyle var ve dağıtım sorunları gözle görülmez. Ross ve Bagnell gösterdi ki taklit öğrenme sabit bir gösteri seti üzerinde bileşik hatalara ve zaman ufkunda ikinci dereceden büyüyen bir pişmanlık sınırına yol açar: öğrenen, gösteri yapan tarafından ziyaret edilen durumları terk ettiğinde, veriler içinde nasıl geri geleceğini söyleyen hiçbir şey yoktur. DAgger bunu yineleme yaparak düzeltir - policy çalıştırma, ziyaret ettiği durumları etiketleme, toplama, yeniden eğitim - Ross, Gordon ve Bagnell çerçevesi hiçbir pişmanlık online öğrenmesine indirgeme olarak.
Bu çerçevelemenin insanların atladığı bir sonucu var. Garanti iterasyonlar üzerinde policy sırasıyla ilgilidir, herhangi bir tek koşu değil. Sizin üçüncü turunuzun yardımcı olup olmadığı hakkında hiçbir şey söylemez. Bilmenin tek yolu her tekrarı ölçmektir. Kelly ve meslektaşları HG-DAgger'ı tanıttılar çünkü klasik DAgger, öğrenci hala kontrol altındayken uzman eylem etiketleri ister, bu makalede güvenliği azaltabileceğini ve insan uzmanlarla, algılanan aktüatör gecikmesi aracılığıyla etiket kalitesini bozma olasılığı yüksek olduğunu tartışır. HG-DAgger ayrıca bir model-belirsizlik-tabanlı risk metriği için bir güvenlik eşiği öğrenir ve DAgger ve davranışsal klonlama üzerinde iyileştirilmiş performansı bir sürüş görevinde bildirir. Müdahale sayıları yayınlamaz; bunları kendiniz üretirsiniz.Hızı tanımlamak böylece iki kişi aynı sayıyı alırTanım bir satırdır: müdahale kareleri bölü koşunun kareleri. Tüm zorluk, bir kare olarak ne sayılır ve ne sayılır olarak gizlidir.
Bölümler değil kareler
En az bir müdahaleye sahip bölümleri saymak işe yaramaz: on bölüm birer nudge ile ve on bölüm yüzde seksen uncu oranı içinde sürülen her ikisi de "10/10" verir. Kare sayısı bunları ayırır ve kaydın zaten sahip olduğu parçalılıktır -
LeRobot veri seti biçiminde
her zaman adımı bir satır olduğundan, müdahale bayrağı durum ve eylem yanında bir boole sütunudur. Burada devralma başladığı anda kare başına yazılır ve kontrol geri döndüğünde silinir.Payda düzeltmeleri içerirİki payda savunulabilir - koşunun toplam kareleri veya policy'nin bağımsız olarak sürüdüğü kareler - ve yüksek müdahale seviyelerinde kötü şekilde farklılık gösterir. 1000 karenin 400'ünü devralın ve ilk yüzde 40 veriyor, ikinci yüzde 67 veriyor. Bir turu ilk şekilde ölçülen diğerine karşı ölçmek, gerçek bir iyileşmenin nasıl ortadan kalktığıdır. Toplam kareleri alın ve serinin ortasında asla seçimi ziyaret etmeyin.
Teslim alma kareleri için ne olacağını bir kez belirleyin
Her zaman bir dikiş var. Kontrol geçtiğinde, bazı kareler hiçbir tarafa ait değildir: kol tutulur, lider hizalanır, kayıt dondurulur. Bu boru hattında bu teslim alma kareleri ham akışta kalır ve asla küratör
bölüm
- ne policy davranışı ne de eğitim için değecek bir düzeltme. Dikiş her turda aynı şekilde sayın: 30 Hz'de, altı devralma ve iki saniye dikiş her biri 360 karedir, bir yüzde puan hareket etmek için yeterlidir.Karşılaştırılabilirliği kıran üç kararKareler veya bölümler; toplam koşu veya yalnızca özerk; teslim alma kareleri içinde veya dışında. Turlar arasında sessizce değiştirilmiş herhangi biri eğriyi anlamsız hale getirir. Üçünü yazın.
Çalışan bir işlemin durum panelindeki bir metrik bir okumadır: yeniden başlatmada kaybolur ve çizilemez. Tur başına bir satır tüm seriyi kapsar - sürülen
kontrol noktası
dahil olmak üzere, çünkü bu her tur değişir ve karıştırılması sonrasını geçersiz kılar.Tur başına bir satır. Paydayı ve teslim alma kuralını sayı yanında kaydetmek alan adlarından daha önemlidir.İki alan ağırlık taşır.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}sonraki eğitim işine ne yedirdiğinizdir; onsuz hiçbir şey atfedilemez. eval_protocol çalıştırdığınız sabit testi adlandırır ve boş bırakılan alandır. Ay-robots pit panelinde devralma durumu, çalışan oturum için müdahale kare sayısını bildirir, bu nedenle günlüğe kaydetme enstrümantasyon yerine transkripsiyon olur; veri seti belgelendirmesi kare başına sütunların nereye iniş yaptığını kapsar.Training yapılandırması matrisi policies, veri setleri ve kontrol noktalarını yan yana gösteriyorHer tur kontrol noktası ve veri seti karışımını değiştirir. Kombinasyonu kaydedilmeyen bir sayı atfedilemez.

Tur
Sürülen kontrol noktası
| Kareler | Müdahale kareleri | Hız | Başarılar (20'den) | 0 (temel) | temel policy |
|---|---|---|---|---|---|
| 5 900 | 1 380 | 23,4 % | 7 | 1 | tur 0 karışımından |
| 5 610 | 980 | 17,5 % | 10 | 2 | tur 1 karışımından |
| 5 412 | 611 | 11,3 % | 11 | 3 | tur 2 karışımından |
| 5 380 | 598 | 11,1 % | 12 | Tur bir ve iki iş yapıyor. Üç tur değil: yüzde 11,3 yüzde 11,1 karşı fiziksel bir kol üzerinde ölçülen herhangi bir şeyin tur-tur değişimi içinde. Dördüncü aynı düzeltmelerin turu bir öğleden sonra hiçbir şey için harcıyor. Düz segment bir şeyi yapısal olarak değiştirme söyleyor. | Kalan arızalar teleoperation tarafından düzeltilmez - nesne ulaş dışı, gripper geometrisi, bir eklem sınırında. Düzeltme verisi kinematik duvarı düzeltmez. |
Düzeltmeler temel veri seti karşı çok az, gradyanı taşımak için ve hiçbir şey ağırlıklandırır.
- Düzeltmeler birbirini çelişir, bu nedenle policy iki strateji ortalaması ve aralarında iniş yap.
- Arıza akışta yukarı: bir kamera taşındı, aydınlatma değişti, bilek görünümü artık eğitim ile eşleşmiyor.
- Görev bu policy sınıfında bu donanım üzerinde tavana ulaşıyor ve sonraki adım daha fazla temel veri.
- Son ikisi döngünün arızaları değil. Sirius-Fleet içinde insan ihtiyacının azalması tasarlanan sonuçtur: robot otonomi iyileştikçe, anomali yordayıcıları tahmin kriterleri uyarlar, insan müdahalesi için daha az isteğe yol açar ve kademeli olarak zamanla insan iş yükünü azaltır. Orada kriter amaçlı uyarlar. Manuel bir döngüde sizin de uyarlar, sessizce - yani tavana ulaşan düz bir hız operatörün fark etmeyi durdurduğu için düz görünüyor. Hangi sonraki sorun.
- Tuzak 1: düşen bir hız yükselen bir başarı hızı değil
Müdahale hızı tam olarak bir şey ölçüyor: koşunun ne kadarını sahiplenmeye karar veriyorsunuz. Bu karar sizin, gerçek zamanlı yapılan ve hareket ediyor. Tur sıfırda ilk kötü yaklaşım açısında devralıyorsunuz; tur üç de policy'nin bir düzineden biri kurtulduğunu izlediniz ve bunu denemeyi bırakıyorsunuz. Eşiğiniz taşındı;
policy
olmayabilir. Hız her iki yönde de düşüyor.İnsan güveni en azından edebiyatta modellenen bir nicelik olarak sabit bir sabit olmaktan ziyade. Sirius, insan güvenini yaklaşık olarak eğitim örneklerini yeniden ağırlıklandırır ve policy'yi ağırlıklı davranışsal klonlama ile optimize eder, benzer davranış klonlamaya göre durum sanatından itibaryen, gerçek donanımda yüzde 27 simülasyonda yüzde 8 artış rapor eder, iki kat hızlı yakınsaklık hızında başarı. Bu güveni veriye bir ağırlık olarak tedavi eder. Tur sıfırdan tur üç arasında başınızdaki eşiği düzeltmez.Bölünemeyin kaldıramazsınız, bu nedenle hızı eşiğinize dokunmasını yapamayacak bir şeyle eşleştirin: müdahale etmediğiniz sabit bir deneme seti, tur önce yazılmış bir kriter karşı puanlandı. Eşleştirilmiş başarı hızı durgun kalırken düşen bir hız alışkanlığın imzası - yakalayacak değer, çünkü döngü içinden ilerleme gibi hissettiriyor.
Müdahale hızı
Sabit protokol üzerinde başarı hızı
| En olası okuma | düşüyor | yükseliyor |
|---|---|---|
| Tur çalıştı. Devam et. | düşüyor | düz |
| Eşiğiniz bölündü veya düzeltmeler arızaları kaldırmadan çabayı kaldırdı. | düşüyor | düşüyor |
| Düzeltmeler policy bozuyor. Karışım ve iç tutarlılığını kontrol et. | düz | düz |
| Tur hiçbir şey satın almadı. Daha fazla toplamadan önce karışım, kontrol noktası veya görevi değiştir. | yükseliyor | düşüyor |
| Regresyon. Eğitim karışımı, değiştirilmiş kamera veya kontrol noktası karışımından şüphe et, yöntem şüphelenilmesinden önce. | Tuzak 2: sabit bir protokol olmadan, odayı ölçüyorsünüz | Gerçek robot değerlendirmesi pahalı ve tekrarlanması zor. SIMPLER yazarları, böyle politikaların gerçek dünya değerlendirmesinin ölçeklenebilir olmadığını ve politikalar görev spektrumunu genişledikçe kötüleşme olasılığı olan yeniden üretilebilirlik zorlukları ile karşı karşıya olduğu gözlemi ile simüle edilmiş değerlendirmeyi motive ediyor. RoboArena diğer taraftan bunu saldırı yapıyor, DROID platformunda yedi akademik kurumda değerlendiriciler tarafından çalıştırılan yedi generalci policy arasında 600'den fazla ikili gerçek robot değerlendirme bölümleri ile. Değerlendiriciler kendi görevlerini ve ortamlarını seçerler, ancak politika çiftlerini çift-körü yargılamalıdırlar; kağıt bu kitle kaynaklı sıralama merkezi olmayan, merkezileştirilmiş değerlendirmeden daha doğru olarak generalci policy performansını izler dilini raporlar. |
Bir çalışma alanında 600 eşleştirilmiş bölüm çalıştırmayacaksınız
SO-100
de. Yapabileceğiniz şey, kontrolü altında olduğunuz varyansı kaldırmaktır - genellikle atlanacak kadar sıkıcı bir liste.BoyutBunu dondur
| Yapmazsan ne bölünür | Başlangıç pozu | Her deneme öncesi sürülen yazılı bir ev konumu |
|---|---|---|
| Yörünge dağıtım dışında başlıyor | Nesneler | Bantlı işaretler ve değerlendirme için ayrılan aynı fiziksel nesneler |
| Daha 'iyi' bir policy aslında daha yakın bir nesnedir | Kameralar ve ışık | Aynı montajlar, endeksler, pozlama; jaluziler kapalı; kurulumu fotoğrafla |
| Sadece kamera endekslerinin karşılaştırılması sonucu bastırabilen | Denemeler ve durdurma kuralı | Sabit n, sabit zaman aşımı, kriter tur öncesi yazıldı |
| Hoc kriterleri neredeyse kaçakları istediğin şey çevir | Operatör davranışı | Değerlendirme denemeleri sırasında müdahale yok |
| Değerlendirme başka bir düzeltme oturumuna döner | O zaman, bir çalışma alanının gücünde deneme sayılarında amansız aritmetik. Normal yaklaşma altında, 20 deneme üzerinde yüzde 60 başarısı yakın yüzde 11 puan standart hatasını taşır - 20 üzerinde 0,6 kez 0,4 karenin karekökü - ve iki deneme arasındaki fark yaklaşık 15 puan taşır. 60'dan yüzde 70'e sıçrama bu nedenle hiçbir şey olmadığı ile tutarlıdır. Elli deneme, kare sayısını kabaca 7 puana getirir ve öğleden sonra maliyeti. | Bu asimetri müdahale hızı için argümandır: yirmi ikili sonuç yerine binlerce kare üzerinde hesaplanan, daha erken ve daha sorunsuz hareket eder. Uyarı, bir bölüm içindeki karelerin yoğun şekilde ilişkili olmasıdır - bir kötü kavrama yüzüne ard arda müdahale kareleri verir - bu nedenle etkili örnek boyutu devralma sayısına daha yakındır. Hızı erken gösterge ve başarı hızını yavaş zemin gerçeği olarak tedavi et. |
Değerlendirme bölümleri eğitim havuzu dışında tutun
Değerlendirme bölümleri hiçbir zaman oluşturulmuş eğitim veri setine girmez - aksi takdirde tur n+1 eğitildiği veriye karşı puanlandı ve eğri ezber ölçüyor.
Düzeltmeler ilgi çekici verilerdir, bu nedenle içgüdü bunları eğitmektir. Yapma. Bunlar inşaat tarafından policy'nin zaten başarısız olduğu ve koşunun geri kalanında hiçbir şey söyleyen dar devlet alanı diliminden gelir. O dilim yalnızca ince ayar yapın ve temiz bir yaklaşım yapmayı unutmuş bir botched yaklaşımdan iyileşmede iyi bir policy alırsınız.
Mandlekar ve meslektaşları uzaktan müdahale sistemini buna etrafında inşa etti. Çerçeve: manipülasyon görevleri bottleneck bölgelerini içerir kesin eylemler dizisini gerektiren - bir kahve makinesine bir pod eklemek örnek - küçük sapmaların gösteriler asla kapsamadığı devletlere yol açtığı. Algoritmaları iteratif olarak yeni veriye eğitim yapıyor policy bu darboğazları geçmeyi öğrenmek için ve müdahale verisi üzerine eğitim ajanları müdahale olmayan gösteri yapıcılardan eşdeğer örnek sayısı üzerine eğitim yapan ajanları yencek rapor ediyor.
Yalnızca düzeltmeler ince ayarı karşı oluşturulmuş karışım
Yalnızca düzeltmeler size ne verir
- Düzeltme stili öğrenilebilir olup olmadığını test etmek için ucuz
- Ince ayar dağılımı artık görev dağılımına benzemiyor
- Nominal davranış tek bir tur içinde görülebilir şekilde kötüleşebilir
- Hız başarı ile birlikte düşebilir - temiz bölümler kurtarmaları için alışveriş
- Karışım oranı bir hiperparameter ve yazılı olmak istiyor. Sonraki veri seti oluşturmak karar verilir nerede: orijinal gösteri artı düzeltme seti, kaynak başına bölüm seçimi açık yerine sessizce kullanılabilir ne çeker kural. Orada pit de bir bileşik adım ve sonuç sıradan bir veri seti -
- eğitim belgelendirmesi
. Hiçbir araç sizin için hangi oranı hangi eğriyi ürettiyini kaydetmek yapmaz.Tuzak 4: insan tutarlı bir uzman değilDAgger teorisi bir uzman varsayar. Teknik anlamda bir değilsiniz: düzeltmeleriniz eylemler üzerinde sabit bir koşullu dağılım örnekleri değildir. ACT yazarları bunu ince manipülasyonda engeller listelenirken adlandırır - hatalar zamanla bileşir ve insan gösterileri durağan olmayabilir. Sistem hala simülasyonda yüzde 80 yüzde 90 başarısını on dakika gösteriden altı gerçek görevde ulaşıyor, bu nedenle sorun izlenebilir, yok değil.
Robomimic çalışması noktayı veri tarafından yapar. Beş simüle edilmiş ve üç gerçek dünya çok aşamalı görev üzerinde altı çevrimdışı algoritması arasında, dersleri tasarım seçimlerine duyarlılık, gösteri kalitesine bağımlılık ve - en çok acısı burada - durma kriterlerinden kaynaklanan değişkenlik içerir, çünkü eğitim ve değerlendirme hedefleri farklılık gösterir. En düşük kayıp kontrol noktası en yüksek başarı hızına sahip olması güvenilir değildir.
Bunun donanım versiyonu vardır: giriş modu düzeltmeyi şekiller.
lider takipçi
kuruluşu insan tarafından hızlandırılan sürekli yörüngeler üretir. Klavye nudge'leri sunucu tarafından sert tutturulmuş - kol eklemleri üzerinde iki derece per çağrısı, gripper üzerinde dört - aynı amaç küçük adımlar merdiveni olarak gelir. Kaydırıcılar mutlak hedefler gönderir ve sunucu onlara doğru çağrı başına en çok altı derece hareket ediyor. Üç mod, üç eylem dağılımı; üçünü de bir düzeltme seti içine karıştırmak ve sonra yaklaşmanın neden titrek olduğunu merak etmek kendi kendine yapılan. teleoperation belgelendirmesi her modun gönderdiğini kapsar.Müdahaleleri tartılandırmak: IWR ve sonrasında ne geldiDüzeltmeler değerlerin azınlığı ise, ilkeli fix ağırlık yerine münhasırlık. Müdahale Ağırlıklı Regresyon referans uygulamadır: veriler müdahale ve müdahale olmayan örneklere bölünür ve iki bölüm eğitim sırasında eşit oranda örneğe alınır. Karelerin yüzde beş olan bir düzeltme seti sonra gradyanın yarısında katkı verir, nominal davranış dağılımdan kaybolmadan.
Eşit oran başlangıç noktası, yasa değil. Sirius onu yaklaşık insan güveni ile sürekli bir ağırlıkla ikili bölümü değiştirerek genelleştirir; Sirius-Fleet karar akışta yukarı hareket ediyor, bir görseli bir dünya modeli ve anomali yordayıcıları bir insanın hiç ne zaman sorulmuş karar vermek için kullanarak. Ortak dişli: müdahale bayrağı eğitim sinyali, sadece muhasebe sütunu değil.
Yöntem
Kim karar verir ne zaman insan hareket ediyor
| Müdahale verisi nasıl kullanıldığı | Bildirilen sonuç | DAgger (2011) | Sabit jadwal; uzman ziyaret edilen devletleri etiketler |
|---|---|---|---|
| Bir büyüyen veri seti, ağırlıksız | Hiçbir pişmanlık online öğrenmeye indirgeme olarak çerçeveli | HG-DAgger (2019) | İnsan, gerçek sistem kontrolü geçit |
| Toplandı; artı bir model belirsizliğine öğrenilmiş bir güvenlik eşiği | Sürüş üzerinde DAgger ve BC'den daha iyi; müdahale sayıları verilmeyen | IWR (2020) | İnsan, uzaktan teleoperation via |
| Müdahale ve müdahale olmayan örnekleri eşit oranda alınan | Müdahale olmayan gösteri yapıcılar eşdeğer örnek sayısında yener | Sirius (2022) | İnsan, dağıtım sırasında |
| Ağırlıklı BC, yaklaşık insan güveninden ağırlıklar | Simülasyonda yüzde 8 kazanç, gerçek donanımda yüzde 27; 2x daha hızlı yakınsaklık | ThriftyDAgger (2021) | Sistem, yenilik ve risk geçidi |
| Denetim bütçesi altında etkileşimli koleksiyon | Kullanıcı çalışması (N=10): sonraki en iyi yöntem daha yüksek insan ve yüzde 80 daha yüksek robot performansından yüzde 58 | Fleet-DAgger (2022) | Sistem, bir filo arasında dikkat tahsisi |
| İnsan çabası dönüş tarafından puanlandığı filo öğrenme | Taban çizgileri daha yüksek 8,8x ROHE'a kadar | Sirius-Fleet (2024) | Kendi uyarlanabilir kriterleri ile anomali yordayıcılar |
| Görsel dünya modeli ile çok görev öğrenme | Otonomi iyileştikçe daha az müdahale istekleri | Robot politikalarını ölçülen puan tarafından karşılaştıran lider panosu | Policy'leri birbirlerine karşı sıralamak, her giriş aynı protokol çalıştırıldığında anlam kazanır. Bu kendi üç tur için de geçerli. |

Ortalama müdahale uzunluğu. Düşen bir sayı ile yükselen uzunluk kalan arızaların zor olanlar olması anlamına geliyor, hangi geç ilerleme gibi görünüyor.
- İlk müdahaleye zaman. İlk yardıma ihtiyaç duymadan daha ileri bir policy geçiş olan toplam hızı düz bile iyileştiriyor.
- Müdahale kümeleri nerede. Normalleştirilmiş bölüm ilerlemesine göre bayrağı kutular; turlar arasında istikrarlı bir tepe bir bottleneck işaret ediyor.
- Gerçekte çalışabilileceğin bir tur protokolü
- Ölçülen tur altı adım ve bir günlük satır üretir. İlk dört döngü; son iki bunu bir ölçüm yapıyor.
Sıfır tur öncesi değerlendirme protokolü dondur
Ev pozu, nesne yerleşim, kamera, deneme sayısı, zaman aşımı ve başarı kriteri başlangıç yaz. Tabloyu fotoğrafla. Belge değişmesi gereken, seriler yeniden başlar.
- 1Taban çizgisini ölçün
Protokol hiçbir müdahaleler ile çalıştırın ve başarıları kaydet; sonra bir müdahale etkinleştirilmiş enstrümantasyonlu bir oturum çalıştırın ve hızı kaydet. Bu iki sayı tur sıfır.
- 2Düzeltmeleri bir tutarlı stil içinde topla
Tur başına bir giriş modu, mümkün kılabilir bir operatör. Dışarı bir kriter üzerinde al - 'gripper yaklaşımda iki santimetreden daha fazla' - ve turda tutun.
- 3Aynı gün her bölümü sınıflandır
Düzeltme, değerlendirme veya at. Belirsiz bölümler kaydedilmemiş, daha fazla verisi yardımcı olması teorisinde atılır - düzeltme hangi kendin fumbled daha kötüdür hiçbir bölüm.
- 4Karışım açıkça oluştur
Orijinal gösterim artı düzeltmeler, kaynak başına bölüm seçimi. Temel sayı, düzeltme sayısı ve herhangi bir tartılama kaydet - hangi oran hangi eğriyi ürettiğini üç hafta isteyecek alandır.
- 5Kontrol noktasından devam et, sonra yeniden ölçün
Önceki kontrol noktasından oluşturulmuş veri seti eğit tabanı modeli yerine, dondurulmuş protokol artı bir enstrümantasyonlu oturum çalıştırın, satırı ekleyin ve önceki iki turla karşılaştırın.
- 6İki sınır zayıf tur nasıl okuyorsunuz değiştir. Kontrol noktasından devam etmek ağırlıkları başlatır - bir optimizer özgeçmiş değil, bu nedenle zamanlama taze başlıyor ve yakınsanmış bir kontrol noktasından kısa bir koşu çok az hareket edebilir. Ve takeover en başında lider-hizala hareket, donanımda en az mil var zincir herhangi bir şey; düzeltmeler bir tuhaf geçici başlamışsa, karışımı suçlamadan önce orada bakın.
Ölçülen döngü, zaten kablolu
ay-robots bu altı adımı ürün özellikleri olarak uygular: bir lider kol, klavye veya kaydırıcılardan tur ortasında devral, müdahale kareleri otomatik olarak işaretli; her bölümü düzeltme, değerlendirme veya atla sınıflandır; sonraki veri setini orijinal gösterim artı düzeltmelerden oluştur, kaynak başına bölüm seçimi açık; ve sonraki eğitim çalışmasını temel model yerine önceki kontrol noktasından başlat.
DAgger döngüsü nasıl çalışıyor gör
Sayıların anlatamayacağı şeyler
Bunun hiç biri çözülmez ve düzekli eğri sizi aksi inanmaya ikna etmez. Müdahale hızı ortak sistemi ölçer - policy, donanım, operatör, oda - ve hiçbir şey kendi başına atfetmez. Düzeltmelerin iyi olup olmadığını yargılayamaz ve nesne üç hafta üzerinde iki santimetre daha yakın bölünen görev üzerinde mutlu düşer.Yapı vague bir izlenim bir sütun çevir argümanı yapabilir. Alternatif daha iyi bir metrik değil; eğri tur üç sonra toplamak durdur söyler üç hafta düzeltme toplama. Araştırma edebiyat etkileşimli taklit öğrenme tanımlar insan geri bildirim aralıklı verilen robot yürütme sırasında, davranış çevrimiçi iyileştirilmesine izin verilmek; aile geniş ve hiçbir düzenlemesi tur başına sayı olmadan çalışır. Ayrıca görmek
SO-100 taklit öğrenme kılavuzu
temel veri seti için karşı karışımı, bir policy çalıştırmak çıkarım tarafı için ve DAgger döngü sayfası uygulanır boru hattı için.DAgger döngü sayfası uygulanır boru hattı için.
Müdahale hızı sadece biri eksi başarı hızı mı?▾
Hayır. Hız ölçer ne kadar bir koşu devralırsın; başarı hızı ölçer görev siz olmadan yapılıp yapılmadığı. Koşu başarı yüzde 30 müdahale hızı ve hiçbir müdahaleler ile bir koşu tamamen başarısız yüzde. Ayrıca gürültü farklı: hızı pürüzsüz koreli binlerce kare üzerinde hareket, başarı hızı bir avuç ikili sonuç arasında sıçra. Her ikisiniz de günlüğe kaydettirin.
Başarı hızı birşey anlamına gelmesi için kaç değerlendirme deneme gerekliyor?▾
Makul hissettirenden daha fazla. Normal yaklaşma altında, 20 deneme bir gerçek yüzde 60 başarısında standart hata yakın yüzde 11 noktası taşıyabilir, bu nedenle turlar arasında 10 noktalı hareket gürültüden ayırt edilmez; 50 deneme kabaca 7 rakam getir. Gücünüz 50 gücü, turlar boyunca deneme sayısını tutarlı tutun ve küçük hareketleri ezber kapanmamış olarak tedavi edin.
Gösteri karşı düzeltmeler hangi karışım oranı başlayabilirim?▾
Belgeli başlangıç noktası IWR: veri müdahale ve müdahale olmayan örneklerine bölün ve eşit oranda çekin, bu nedenle düzeltmeler gradient yarısı katkı çerçevelerin kesri ne kadar küçükse. Kurulumu ağırlık örneklemesi yapamaz, oluşturma veri seti ve kayıt oranı yaklaştırmak için bölüm sayılarını. Yalnızca düzeltmeler eğitim, hariç tutmak için seçeneği.
Bir tur sonra müdahale hızı gitti. Tur atılıp mı?▾
Mutlaka değil, ama sıkıcı açıklamalarını ilk kontrol: devralma kontrol noktası eğitim kontrol noktası eşleş, kamera endeksi veya monte değiştirildi, nesne yerleşimi bölündü, düzeltme stil tutarlı. Dördünü temiz ve eşleştirilmiş başarı hızı da düştü, karışım şüphe et - düzeltmelere karşı çok temel gösterim, veya birbirlerini çelişen düzeltmeler. Gerçek regresyon günlüğe, bin değil.
Dondurulmuş değerlendirme protokolü atla ve sadece müdahale hızı izle?▾
Yalnızca iyileştirilmeden alışkanlığı söyleyemez kabul et. Hız bağlı bir gerçek zamanlı kendi eşik adım atma, ve eşik düşüyor policy'nin hileçlikleri alışkınsın açıldı. Dondurulmuş protokol ölçümün kısmı eşiğinize ulaşamaz - bantlı işaretler, yazılı bir ev pozu, sabit deneme sayısı, kriter tur öncesi karar. Seriye değişmeden kalması lazım.
Depo not defter yaz günlüğü tutun: turlar ayrı günler, donanım yeniden yapılmış ve Ekim kağıdı oku kişi hiç Ağustos hafızası olmayan. belgelendirme SSS sol operasyonel detayları kapsar.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started