
Behavior cloning bir politikayı uzmanın durum dağılımına uydurur ve ardından kendi başına konuşlandırılır. Bu iki dağılım arasındaki boşluk, doğrulamada iyi görünen bir politikanın 300. adımda masadan düşmesi nedenidir. Bu, DAgger serimizin teori bölümüdür: ikinci dereceden hata terimi nereden geldiği, dataset aggregation'ın ne değiştirdiği, no-regret kanıtının ne varsaydığı ve insan uzmanının hala hangi faturayı ödemesi gerektiği.
Bir manipülasyon politikası eğiten herkesin er ya da geç karşılaştığı özel bir hata vardır. Politika küpü uzanır, iki santimetreden daha yaklaşır, tereddüt eder, yana sapıyor, sonra göreve ilişkisiz bir şey yapar. Doğrulama kaybı iyiydi. Tutulan bölümlere karşı açık döngü tekrar oynatma iyiydi. Yine de kol, eğitim verilerinde hiçbir yerde görülmeyen bir duruşta sona eriyor ve oradan söyleyecek mantıklı bir şeyi yok.
Bu başarısızlığın bir adı ve bu adının arkasında tutarlı bir teori vardır. Bu, DAgger hakkında dört makalenin birincisidir ve argüman kendisini kapsar: neden bir politikayı gösterici kendi yörüngelerine uydurmanın kare alınan bölüm uzunluğu ile büyüyebilen bir hata ürettiği, dataset aggregation'ın ne değiştirdiği ve no-regret kanıtının ne vaat etmediği. Gerçek donanımdaki döngü SO-100'de bir DAgger döngüsü çalıştırmak ile kapsanmıştır, insan gütü variant HG-DAgger ve insan gütü müdahaleler ile kapsamlı ve ölçüm sorusu bir DAgger döngüsü ölçmek ile.
Kısa versiyon
- •Behavior cloning uzmanın durum dağılımında eğitilir ve politikanın kendi üzerinde değerlendirilir. Uyuşmazlık bölüm üzerinde bileşikleştirilir.
- •Ross ve Bagnell, ekstra maliyetin T kare çarpı adım başına hata olarak büyüyebileceğini göstermiştir; DAgger belgesi bu sınırı yeniden durumlandırır ve sıkı olduğunu kaydeder.
- •DAgger, politikanın kendisinin ziyaret ettiği durumları etiketler ve şimdiye kadar toplanan her veri seti üzerinde yeniden eğitilir, sadece en yenisi değil.
- •Garanti, no-regret çevrimiçi öğrenmeye indirgenmedir: toplama ve yeniden eğitim Lider Takip et'tir.
- •Sıfıra göre değil, politika sınıfında ulaşılabilecek en iyi kaybına göredir - ve uzman hala üretmemiş olacağı durumları etiketlemesi gerekir.
Behavior cloning sessizce yaptığı varsayım
Bir gösteri veri seti, gözlem-aksiyon çiftlerinin bir yığınıdır. Behavior cloning bu yığına olağan denetimli öğrenme ile bir işlev uydurur ve burada durur. Alan içinde en eski fikirdir. Pomerleau'nun 1988'deki ALVINN'i, bir kameradan ve lazer mesafeli bulucu görüntülerini alarak bir araç tarafından seyahat edilmesi gereken yönü üreten üç katmanlı bir geri yayılım ağı idi; simüle edilmiş yol görüntüleri üzerinde eğitildi ve bazı alan koşulları altında gerçek yolları izledi. Tarif çok değişmedi; ağlar değişti.
Atlanıp giden şey, bu çiftlerin nereden geldiğinin kontrol edilmesidir. Bunların her biri, gösterici tarafından üretilen bir yörüngeye yatar. Konuşlandırdığınız politika kendi oluşturur. Sapan anda, eğitim dağılımında olmayan durumlar hakkında sorgulanıyor ve onun cevabı bunu daha uzağa götürüyor. Ross, Gordon ve Bagnell DAgger kağıdını tam olarak bununla açarlar: sıralı tahmin, istatistiksel öğrenmenin altında yatan i.i.d. varsayımını ihlal eder, çünkü öğrenensinin kendi tahminleri sonraki göreceği girdileri belirler.
Bu belgede en açık örnek bir robot değildir. Süper Mario Bros. için yakın optimal bir planlayıcıyı klonlamak, politikayı tekrar tekrar bir engele karşı sıkışıp atlayan bir politika üretti. Neden tüm argüman bir cümledir: uzman her zaman rahat bir mesafeden atladı, bu nedenle veri seti Mario'nun bir engele karşı sıkışmış olduğu hiçbir durumu içermedi ve bu nedenle oradan ne yapılacağı konusunda hiçbir etiketi olmadı.
Mario'yu bir SO-100 kolu ile değiştirin ve yapı eşittir. Gösterimleriniz temiz bir yaklaşım ve temiz bir tutuş gösterir, greifer iki santimetrey kısa kapatmaz - bu nedenle politika oradan ne yapılacağını bilmiyor ve varsaydığı herhangi bir şey onu daha uzağa götürüyor. Covariate shift, ağ mimarisinin değil, veri toplama prosedürü nün bir özelliğidir.
İkinci dereceden terimin nereden geldiği
Ross ve Bagnell tarafından 2010 AISTATS makalesı, Imitation Learning için Verimli İndirgemeler, bileşikleri kesinleştir. T görev ufkunu, görev maliyetini birim aralıkta sınırlı olsun ve epsilon'u uzmanın durum dağılımı altında ölçülen vekil kaybı olsun - doğrulama setinizin raporladığı sayı. O zaman o politikayı T adım çalıştırmanın ekstra maliyeti, uzmanla ilgili olarak, T kare çarpı epsilon ile sınırlandırılır. Ross, Gordon ve Bagnell bunu DAgger makalesinde Teorem 2.1 olarak yeniden durumlandırır ve önemli cümleyi ekler: sınır sıkıdır. Bir politikanın uzmanın dağılımında epsilon kaybı gerçekten de T'de ikinci dereceden bir şekilde büyüyen ekstra maliyet katlanması gereken sorunlar bulunur.
Sıkı tipik anlamına gelmez. İkinci dereceden terimi, problemler sınıfı üzerinde en kötü durumdur, pick-and-place göreviniz hakkında bir tahmin değildir. Kuran, daha fazla uzman gösteri sorunu kaldıramayacağıdır: politikanın test edilmemiş olacağı dağılımda epsilon tahminini keskinleştirmenin yollarını alır.
Kaçış yolu aynı kağıtta, Teorem 2.2 olarak yeniden durumlandırılmıştır. Bir politika kendi durum dağılımı altında epsilon kaybını başarırsa ve tek bir yanlış aksiyon uzman altında en fazla u cost-to-go'ya mal olursa, ekstra maliyet u çarpı T çarpı epsilon ile sınırlandırılır - horizon'de doğrusal. Sabit u ilginç miktar: uzmanla 0-1 uyuşmazlığı için en fazla 1 ve uzman birkaç adım içinde kurtulabilirse O(1). En kötü durumda O(T)'dir ve doğrusal sınır daha sonra ikinci dereceden sınırdan daha iyi değildir.
| Ayarı | Uzman üzerinde ekstra maliyet sınırı | Ne dayanmaktadır |
|---|---|---|
| Behavior cloning (Ross & Bagnell 2010, Ross et al. 2011'de Thm. 2.1 olarak yeniden durumlandırılmıştır) | T kare çarpı epsilon | epsilon uzmanın durum dağılımında ölçülmüş; [0,1]'de maliyet; sınır sıkıdır |
| Kendi dağılımı altında epsilon kaybı olan herhangi bir politika (Thm. 2.2) | u çarpı T çarpı epsilon | u, tek bir yanlış aksiyon cost-to-go cezasını bağlar; 0-1 kaybı için en fazla 1, O(T) en kötü durum |
| İleri eğitim (Ross & Bagnell 2010) | u çarpı T çarpı epsilon | zaman adımı başına bir politika; T politikası ve bilinen, sonlu T'ye ihtiyaç duyar |
| SMILe (Ross & Bagnell 2010) | bazı problem sınıflarında T'de ve epsilon'da neredeyse doğrusal | alpha O(1/T kare)'de, N O(T kare log T)'de; stokastik bir karışım verir |
| DAgger (Thm. 3.2, Ross et al. 2011) | u çarpı T çarpı epsilon_N, artı O(1) | N uT sırasında; güçlü dışbükey sınırlı kayıp; no-regret öğreneni; epsilon_N, geriye dönüş en iyi kaybıdır |

DAgger'dan önce gelen iki girişim
İleri eğitim, dürüst ama pratik olmayan cevaptır. Her zaman adımı için ayrı bir politika eğitin, sırayla, her biri zaten sabitlenmiş erkek politikaları tarafından açılan durum dağılımı üzerinde, bu nedenle her politika tam olarak yüzleşeceği dağılımı görür. Yakalama açıklamadadır: T politikası, sırayla eğitildi, erken durdurma yok. Manipülasyon episode saniye başına 30 kare, T yüzlerce.
SMILe, aynı kağıttan ve SEARN, Daume, Langford ve Marcu'nun yapılandırılmış tahmin hakkındaki çalışmasından, diğer rota: bir sabit politika, ancak stokastik. Her yineleme bir bileşen eğitilir ve bir karışıma ekler, olasılık kütlesini uzmantan uzağa kaydırır. Sonuç, bazı bileşenleri diğerlerinden daha kötü olan bir karışımdır - fiziksel bir kol üzerinde, hareket ortasında kötü bir bileşeni örnekleyebilen bir kontrolör. Bu, sabit bir deterministik politika istemenin belirtilen motivasyonudur.
DAgger: bir fikir, bir kutu
Dataset Aggregation deterministik politikayı tutar ve onarımı veri toplama alanına taşır. Her tur: mevcut politikayı dışarı alın, ziyaret ettiği durumları kaydedin, uzmantan her birinde doğru aksiyon ne olacağını sorun, bu çiftleri zaten sahip olduğunuz veri setine ekleyin, birleşim üzerinde yeniden eğitin. Ad, algoritma - siz toplarınız, asla atmazsınız.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setÜç detay göründüğünden daha fazla ağırlık taşır. Etiketler, karma politika tarafından ziyaret edilen durumlar içindir, ancak eylemler uzman gelir - politika soruları, uzman cevaplarını sunar. Yeniden eğitim, tüm birleşim üzerindedir, bu da her turu bir Lider Takip Et adımı yapar: tur n'de şimdiye kadar her yörünge üzerinde geriye dönüş en iyi politikayı seçersiniz. Bu çerçeve, kanıtın sarkıtıldığı yerdir. Ve algoritma doğrulama seti seçilmiş sıradaki en iyi politikayı döndürerek sona erer, çünkü teoremler bazı sıradaki politika iyidir, son değil garanti eder.
Beta programı ve neden tuning düğmesi değildir
Karma politika, beta_i çarpı uzman artı bir eksi beta_i çarpı öğrenci. Nokta pratiktir: ilk birkaç öğrenilmiş politika çok az veri üzerinde eğitilir, birçok hata yapar ve aksi takdirde tanıtım politika iyileştirildikten sonra ilgisiz olan durumlarda geçer.
Teori tam olarak bir koşul uygular: betas'ın koşuşan ortalaması sıfıra gitmelidir. Analiz, beta_i ile T'den bağımsız bir sabit alfa için (1 - alfa) i-1 gücüne sınırlanmış şekilde çalışır.
| Takvim | Ne yaptığı | Gazete ne raportar |
|---|---|---|
| beta_1 = 1 | İlk tur saf uzman gösteri; başlangıç politikası gerekli değildir | Her varyantta önerilen başlangıç noktası |
| beta_i = 1 eğer i = 1, else 0 | Tur birinde uzman; ücretsiz parametre yok | Kağıdın parametresiz versiyonu, hangisinin pratikte en iyi performans gösterdiğini söyler; 20 yinelemeden sonra Süper Mario Bros.'ta 2980 |
| beta_i = p^(i-1) p = 0.5 ile | Uzman olasılığı geometrik bozunur | Aynı ölçütte 3030, parametresiz versiyondan biraz ileride |
| beta_i = p^(i-1) p = 0.9 ile | Uzman döngüde çok daha uzun kalır | Belirgin yavaş yakınlaşma; 20 yineleme sona erdiğinde hala iyileştiriliyor |
2980 ile 3030 arasındaki boşluk kabaca 4300'e kadar ölçeklendirilir, ancak kağıdın açıklaması en yararlı pratik nottur. Parametresiz programa göre, Mario erkende aynı yerde sıkışıp, o konumdan toplu neredeyse yon veri üretmiş; uzmanın zamanın bir kısmını sürüş yaptırması hem onu çözmedi hem de durum çeşitliliğini genişletti. Program, karıştırma oranından daha az veri toplama tutarlı yeni durumlar üretmeye devam ettiğini veya aynı başarısızlığını veya aynı başarısızlığını belirtir.
Stokastik per-timestep karışımı, kontrol oranında kontrol otoritesini değiştirmek anlamına gelir, tipik bir SO-100 kurulumunda saniyede 30 kez. Hiçbir teleoperasyon arayüzü bunu güvenli veya anlamlı yapmaz. Gerçek donanımda, beta programı ne zaman devralmak istediği konusunda insan bir karar vermek için değiştirilir: farklı bir algoritma farklı bir analiz ile.
Garantı: no-regret çevrimiçi öğrenmeye indirgeme
İşte kağıdı şu hale getiren hamle. Her DAgger turunu, kayıp, tur i'de kullanılan politika durum dağılımı altında vekil kaybı olan çevrimiçi öğrenme sorununda bir örnek olarak tedavi edin. Öğreneni, bu kaybı görmeden önce bir politikaya işlemek için ve sıra, şimdiye kadar üretilmiş politikalara bağlı olduğu için durağan değildir.
Bir algoritma, N turlardaki ortalama kaybı, geriye dönüş en iyi tek politikanın yönüne yaklaşırsa no-regret'tir. Lider Takip et güçlü dışbükey kayıplarında, ortalama pişmanlık 1/N sırasında - ve tüm birleşim üzerinde yeniden eğitim tam olarak Lider Takip Et'tir. Başka herhangi bir no-regret öğreneni hizmet edebilir: analiz, bir optimizcinin özelliği değil, indirgenmedir.
Bir lemma, karma politika tarafından toplanan veri ile konuşlandırılacak öğrenilmiş politika arasındaki boşluğu köprüler: Lemma 4.1 durum dağılımları arasında L1 mesafesini 2 T beta_i ile sınırlandırır. Bu, betas'ın neden bozulması gerektiğidir - uzman hala takdir edilen kontrol otoritesini tutar, topladığınız durumlar politikanızın üreteceği durumlar değildir. Lemma'yı pişmanlık sınırı ile birleştirin ve ana sonuç izler: kabaca T yinelemesinden sonra, sıradaki bazı politika vekil kaybını kendi dağılımı altında O(1/T) epsilon_N içinde vardır. Doğrusal sınırda besleyin ve Teorem 3.2'ye iniş yaparsınız.
Ampirik taraf mevcut standartlar tarafından mütevazıdır. Süper Tux Kart'ta denetimli taban başına düşüşleri iyileştirmedi çünkü daha fazla veri geldi, DAgger on beş yinelemeden sonra asla rotada düşen bir politikaya ulaştı ve SMILe yirmiden sonra hala tur başına kabaca iki kez düştü. El yazısı ölçütünde, karakter doğruluğu yapısız % 82, denetimli % 83.6, DAgger ile % 85.5 çalıştı. Bunların hiçbiri bir manipülasyon sonucudur.
Kanıtın ne vaat etmediği
Teorem ifadeleri koşulludur ve koşullar yük taşıyıcısıdır.
- Belirtilen varsayımlar altında T'de ikinci dereceden yerine doğrusal sınırlandırılmış.
- Stokastik karışım yerine sabit deterministik politika.
- Gerçek indirgeme: herhangi bir no-regret çevrimiçi öğreneni.
- Somut yineleme sayısı - pişmanlık terimi önemsiz olmaya başlamadan kabaca T turlara.
- Sıradaki en az bir politika için garanti, bu nedenle kapanış doğrulama geçişi.
- Sıfıra göre değil, sınıf içinde epsilon_N en iyi kayıbına göre. Sınıfınız uzmanı temsil edemezse, pratikte boştur.
- Bir no-regret yöntemi veya güçlü dışbükey vekil kaybı gerektirir - yazarların belirttiği gibi, bunu oluşturduğu sınıflandırma indirgenmesinden daha güçlü.
- Sabit u, en kötü durumda O(T) olabilir ve doğrusal sınır daha sonra ikinci dereceden sınıra geri çöker.
- Yinelemeleri sınırlandırır, uzman etiketleri değil. Bir robotta, etiketler bütçedir.
- Uzmanın ziyaret edilen her durumda sorgulanabileceğini ve orada doğru bir şekilde cevap verileceğini varsayar. Bu varsayım tüm maliyettir.
Genellikle bir reddetme olarak alıntı yapılan bir sonuç daha vardır ve değildir. Rajaraman, Yang, Jiao ve Ramachandran, episodik MDPs'lerde imitation learning'in minimax limitlerini sonlu durum boşluğu S ve horizon H ile inceledikçin ve öğrenenin ziyaret edilen durumlarında uzmanı etkin bir şekilde sorgulamasına izin verdiğinde bile tutma tutumsuzluk alt sınırını kanıtlarlar. Bu, sabit bölüm bütçesinde MDPs sınıfı üzerinde en kötü durumdur ve etkileşim minimax oranını iyileştirmediği fikrini yönetir; DAgger'ın teoremi farklı bir açıklamadır, konuşlandırılan politika kendi politika sınıfının elde etmesine göre sınırlandırılır.
Swamy, Choudhury, Bagnell ve Wu daha sonra bu algoritmaları hangi uzman davranışı anlarını tarafından sınıflandırdı ve bileşik hatayı ne kadar hafiflettiğini sınıflandıran bir anlık kurtarılabilirlik kavramını tanıttı. Osa ve Celemin tarafından ankeller algoritmik manzarayı ve insan-geri bildirim arabirimlerini kapsar.
Fatura: Uzmanın hiçbir zaman üretmediği durumları etiketlemek
Yukarıdakilerin tümü, her yerden sorgulanabilen bir uzman varsayar. Simülasyonda, neredeyse ücretsiz olan planlayıcı ile - Mario deneyleri oyun durumuna tam erişim içeren neredeyse optimal bir planlayıcı kullanmıştır. İnsan bir robotta, baskın maliyet ve tuhaflık: insan kendi yeterliliğinin asla yaratmadığı bir yapılandırmada doğru bir aksiyon üretmelidir.
Kelly, Sidrane, Driggs-Campbell ve Kochenderfer, HG-DAgger makalesinde itirazı doğrudan belirler. Vanila DAgger, sistemin tam kontrolünü almak olmayan aksiyon etiketleri sağlamak için uzman gerektirir. Bu güvenliği azaltır ve insan uzmanlar ile algılanan aktüatör gecikmesiyle ilgili toplanan etiketlerin kalitesini bozması olasıdır. Geri aldığınız etiket algoritmanın varsaydığı etiket değildir.
Laskey ve meslektaşları DART ile soruna diğer taraftan saldırırlar ve çerçeveleri açıktır: politika teknikler insan gözetmenleri için sıkıcı, hesaplama yükü ekler ve eğitim sırasında tehlikeli durumları ziyaret edebilir. Alternatifler, denetleyicinin kendi gösterimlerine kalibire gürültü enjekte eder, robot untrusted politikasını asla çalıştırmadan kurtarma gösterilir. MuJoCo İnsansı'nda DART denetleyicinin kümülatif ödülünü eğitim sırasında % 5 azalttığını bildirirken DAgger, gözetmen başına % 80 daha az kümülatif ödülle politika yürütülür; kargaşada engelle tutma ile Toyota HSR, ortalama % 62 behavior cloning'de artış.
Zhang ve Cho'nun SafeDAgger, referans politikasına sorgular nadir kaynağı olarak ele alır: ayrı bir güvenlik politikası, sorgulamadan, birincil politika referanstan eşiğin ötesinde sapıp sapmayacağını tahmin eder ve sadece bu durumlar ele alınır. Üçü de aynı gerçeğe tepki verir - DAgger analiz uzman etiketleri için hiçbir şey yüklemez ve gerçeklik çok yükler.
Distribution dışı durumları etiketlemek görev yapmaktan zihinsel olarak daha zordur. Normal bir gösteri, zaten sahip olduğunuz bir motor planu yürütmek anlamına gelir. Greiferi asla olmadığınız yere koymuş bir politikayı düzeltmek, zaman baskısı altında spot'ta bir kurtarma yapmak anlamına gelir, robot hala hareket ediyor. Düz bir kayıt oturumundan oturum başına daha az kullanılabilir dakika bekleyin ve kursun iyileşmesini gözlemleyin.

Masanızda bir SO-100 için bu ne anlama gelir
Horizon'u kendi birimlerinize çevirin. Saniyede 30 kare hızında yirmi saniyelik bir bölüm, 600 karar adımıdır ve yukarıdaki her sınırda T, bu sayıdır. T = 600'de, T'de ölçeklenen bir terim ile T kare'de ölçeklendirilmiş biri arasındaki fark, kötü bir yaklaşımdan kurtulabilen bir politika ile bir politika arasında fark vardır.
Bu, aksiyon daha iyi neden yardım: bir politika çıkarım adımı başına kısa bir aksiyon sırası yayınladığında, karar noktası sayısı düşer ve bileşikleştirmek için şans düşer. Zhao, Kumar, Levine ve Finn, Transformers ile Action Chunking'i bileşik hata olarak adlandırır ve düşük maliyetli bimanual donanımdaki on dakika değer gösteri dokuz zor gerçek dünya görevlerinde % 80 ile % 90 başarısı raportar. Dilimleme covariate shift'i kaldırmaz - durumlar hala politikanın kendisinin - ancak etkili horizon'u kısaltır. Bkz. aksiyon dilimleme ve SO-100 imitation learning kılavuzu.
İkinci çeviri ilerleme metriğidir. Epsilon'u politika durum dağılımı altında doğrudan ölçütemezsiniz - bu, üretme çalışmalarının olduğu hiçbir yerden temel gerçek uzman eylemlerine ihtiyaç duyar. İnsan gütü döngüsünün size verdiği şey bunun yerine, müdahale oranı: koşu sırasında insan tarafından alınan karelerin kesri. Vekil ve yönetilmemeyen nedenler için hareket eder - sabırlı bir operatör daha az müdahale eder. Sürekli kullanıldığında, tur değer bir tur olup olmadığını söyleyen tek sayıdır.
Üçüncü çeviri, analiziyle kapsanmayan bir veri kalitesi uyarısıdır. Mandlekar ve meslektaşları altı çevrimdışı öğrenme algoritmasını beş simüle ve üç gerçek dünya çok aşamalı manipülasyon görevlerinde inceledikçin ve algoritmik tasarım seçimlerine duyarlılık, gösterimler kalitesine bağlılık ve durdurma kriteri nedeniyle değişkenlik bildirirler. Belkhale, Cui ve Sadigh, veri seti kalitesinin aksiyon farklılığı ve geçiş çeşitliliği yoluyla biçimlendirilmesi gerektiğini ve durum çeşitliliğinin her zaman faydalı olmadığını tartışırlar. Bir DAgger turu hiç kimse tarafından kasıtlı olarak seçilmemiş durumları ekler: bazıları ihtiyaç duyduğunuz kurtarma verisidir, bazıları robot devralan kontrol için çırpılıyor.
Mekanik olarak tur altı adımdır: kayıt üzerinde tahmini çalıştırın, politika kötü davranırken devralmak, koşu gözden geçirin ve her bölümü dosyalayın, düzeltmeleri senkronize edin, orijinalleri artı düzeltmeler ile karma bir veri seti besleyin ve öncekinden devam eğitim yapın checkpoint taban modeli yerine. ay-robots'ta bu adımlar düğmeler olarak vardır, borular kaldırır ancak yargı değil. İki uyarı: checkpoint'ten devam etmek ağırlıkları başlatmaz ve optimizer özgeçmiş değildir ve lider kol hizalama hareketi hala donanımda hafif test edilir. Bkz. eğitim ve veri setleri.
DAgger döngüsü, zaten yazılı
Canlı bir tahmini koşu sırasında devralma, çerçeve başına müdahale işaretlemesi, bölümleri düzeltmeler veya değerlendirmeler olarak dosyalama, kaynak başına açık bölüm seçimi ile karma veri seti oluşturma ve mevcut bir checkpoint'ten devam eğitimi yapmanın tümü yerleşiktir. Çok devralmak ve saklamak istediğinizi karar verirsiniz - bu kısım otomatik değildir.
DAgger döngüsünün nasıl çalıştığını görmekAile ağacı, bir tabloda
| Yöntem | Devletleri kim seçer | Uzman ne sağlar | Ana maliyet |
|---|---|---|---|
| Behavior cloning | Uzman | Temiz gösteriler | Kurtarma verisi yok; hata T'de ikinci dereceden bileşik olabilir |
| İleri eğitim | Öğrenenin zaman adımı başına | Uyarılan dağılım boyunca etiketler | T ayrı politika; uzun ufuklar için kullanılamaz |
| SMILe / SEARN | Uzman ve öğrenenin stokastik bir karışımı | Karışım dağılımı boyunca etiketler | Karışımın bileşenleri kalitede farklıdır |
| DAgger | Karma politika, beta sıfıra bozunuyor | Ziyaret edilen her durum için doğru aksiyon | Uzmanın asla üretmeyeceği durumları etiketlemek, kontrol değil |
| DART | Uzman, enjekte edilen gürültü tarafından karmaşıklaştırılmış | Kalibre gürültü altında gösterimler | Gürültü öğrenenin hatasına kalibre edilmelidir |
| HG-DAgger | Öğrenenin insan devralmaya kadar | Düzeltmeler sadece insan gütü segmentlerinde | İnsan'ın ne zaman müdahale ettiği konusundaki yargısına bağlıdır |
| SafeDAgger | Öğrenenin, güvenlik kapısı tarafından süzülmesi | Etiketler sadece kapı sorunduğunda | Kapının kendisinin eğitilmesi ve güvenilmesi gerekir |
Sık sorulan sorular
Robotumda ikinci dereceden hata büyümesi gözlemleyecek miyim?▾
Temiz bir eğri olarak değil. Sınır en kötü durumdur: bazı sorun elde etme sırasında sıkı, sizinkinin olmayacak. Gördüğünüz, sonuç - iyi puanlar puanlamada, gerçek görevde başarısız ve daha kayıt kaydı daha kayıt yapmaz. Daha temiz veri yardım etmeyi durursa, bu covariate shift'tir, veri-cilt sorunu değildir.
DAgger çağırmak için beta karışımını uygulamalı mıyım?▾
Parametresiz versiyon - tur birinde uzman, saf öğrenci sonrası - meşru özel durumdur ve genellikle orijinal deneylerde en iyi performans gösterir. Düşürebileceğin şey agregasyondur: en yeni düzeltmeler üzerinde yeniden eğitim Lider Takip Et yorumunu kırar, bu no-regret argümanının geldiği yerdir. Tek başına düzeltmeler üzerinde eğitim çok daha zayıf bir prosedürdür.
Son biri yerine doğrulama seti'nde en iyi politikayı neden dönüş?▾
Çünkü teoremler sıradaki iyi bir politika var, son yineleme değil garanti eder - sınır sıradaki minimumdadır. Son turdan çıkan herhangi bir şey gönderme, sonucun belirtilen koşulunu atar ve son tur güvenilir olmayan en iyi.
Kaç tur planlayacağım?▾
Teori T sırasında yineleme istiyor, 600 adımlı bölüm için, hiç kimse donanımda çalıştırmaz. Orijinal deneyler her ölçütte yirmi yinelemeleri çalıştırdı. Pratikte, müdahale oranı düşmeyi durduruncaya kadar turlar çalıştırırsınız, analiz en kötü durumdaki sayının çok aşağısı - teori ve uygulama arasında gerçek boşluk.
Politika sınıfım basit uzmanı temsil edemezse?▾
Daha sonra DAgger seni kurtarmaz ve sınır söyler - epsilon_N en iyi kayıba göre göreceli olarak ifade edilir. Yanlış mimari veya eksik gözlem veya sahneyi göremeyen bir kamera nedeniyle büyükse, agregasyon görevi yapamayan sınıf içinde optimal bir politika verir. Tutulan bölümlere karşı açık döngü tekrar oynatma düzeltme toplama çalıştırıncaya kadar çalıştırın.
Buradan nereye git
Henüz bir politika eğitilmediyse, bu teori erkenci: ilk olarak bir veri seti kaydedin, başlangıç ilk politikanızı eğitim ve masaüstü istemcisi. Başka yüz temiz gösterimler başlayan düzeltmelere karşı tartılsanız: temiz gösterimler dağıtım sorununu düzeltmez. Mekanik, devam insan gütü variant ve daha sonra SO-100 geçiş.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started