Bir masada teleoperasyon ve policy eğitimi için kurulmuş olan düşük maliyetli SO-100 robot kolu
DAggerSO-100Taklit ÖğrenmesiVLATeleoperasyon

Bir SO-100'de VLA Policy ile DAgger Loop'u Çalıştırma

AY-Robots ResearchAugust 27, 202615 dakikalık okuma

Bir SO-100 kolu üzerinde yapılmış tek bir insan-kontrollü DAgger turunun adım adım hesabı: policy'i çalıştırın ve kaydedin, yanlış gitse üstlenin, turunu düzeltme olarak dosyalayın, karışık bir veri seti oluşturun ve bir checkpoint'ten eğitimi devam ettirin. Lider kolu olmayan kişiler için klavye ve kaydırıcı üstlenme yolunu içerir ve bir turnu değersiz kılan dört hatayı içerir.

Policy'iniz çalışır. Küpe uzanır, greifer bir santim çok erken kapatır ve sanki tutmuş gibi devam eder. Hiçbir hata oluşmaz ve eğitim kaybına bakmanız hiçbir açıklamayı bulamaz. Çözüm, aynı gösterimlerde başka 20 000 gradient adımı değildir. Kollunuzu tam yanlış giden yere geri koymak, bunun yerine ne yaptığınızı kaydetmek ve sonraki checkpoint'i eski veriler artı bu düzeltme üzerinde eğitmektir. Bu bir DAgger turudur ve bunu bir SO-100 üzerinde vision-language-action policy ile nasıl çalıştırdığınız burada.

Teori başka yerde: veri seti agregasyonu neden işe yarar ve insan kontrolleme bunu nasıl değiştirir. Bu işletme kılavuzudur ve eğitilmiş bir checkpoint, çalışan bir kamera seti ve hareket eden bir kol varsayar. Aşağıdaki altı adım, bu platformun DAgger sayfasında uygulandığı şekliyle döngüdür, ancak sıra kendi betiklerinizden de aynıdır.

Kısaca bir tur

  • Eğitilmiş policy'i çalıştırın ve kaydedin, turun kendi görev metniyle genel teleoperation etiketi yerine.
  • Davranış yanlış giderse hemen üstlenin: lider kollu ayna el değişimi, olmadığında klavye veya kaydırıcılar üzerinden anında ve manuel.
  • Her turnu ayıkla: düzeltme olarak dosyala, değerlendirme bölümü olarak sakla veya sil.
  • Karışımı elle oluştur - orijinal gösterimler artı düzeltmeler, kaynaklar başına seçilen bölümler. Hiçbir zaman düzeltmeler üzerinde eğitmeyin.
  • Son checkpoint'ten eğitimi devam ettirin ve hangi checkpoint'in hangi karışımı ürettiğini not edin.
  • Turun bir şey değer olup olmadığını söyleyen sayı, eğitim kaybı değil intervention rate'dir.

İkinci tur neden sadece daha fazla veri değildir

Behavior cloning, insanın ziyaret ettiği durumlar üzerinde eğitim alır. Test zamanında policy'nin neden olduğu durumları ziyaret eder ve küçük aksiyon hataları, gösterimlerin kapsamadığı durumlara bileşke oluşturur. Ross, Gordon ve Bagnell bu başarısızlığı AISTATS 2011 için formallaştırdılar ve durağan deterministik bir policy'yi eğiten ve indirgemeye göre, neden olduğu durum dağılımı altında iyi performans göstermesi gereken yinelemeli bir algoritmayla yanıtladılar: mevcut policy'yi çalıştırın, uzman gerçekten ulaştığı durumları etiketlesin, bunları veri setine ekleyin, yeniden eğitin, yineleyin. Kelly ve diğerleri HG-DAgger ile sorguyu pratik hale getirdiler, burada insan kontrolleri tutmak yerine tutmak yerine kontrol etmek istediğinde ne zaman devralsın karar verir; simüle edilmiş ve gerçek özerk sürüş görevinde DAgger ve behavior cloning'in her ikisinden daha iyi performans bildirirler. İnsan kontrolü, masaüstü bir kol üzerinde döngüyü tolere edilebilir kılanı budur - yalnızca bir şey yanlış giderse ellerinizi hareket ettirirsiniz.

İki sonuç teoriden pratikte daha fazla önemlidir. Düzeltmeler olağan gösterimler değildir: Mandlekar ve diğerlerinin tanımladığı darboğaz bölgelerine yoğunlaşırlar, küçük bir sapma policy'yi gösterimlerin hiçbir zaman kapsamadığı durumlara düşürür. Ve sadece bu zor parçalardan yapılan bir veri seti kötü şekillendirilmiş bir veri setidir - Belkhale, Cui ve Sadigh veri tarafından tartışırlar ki durum çeşitliliği her zaman faydalı değildir ve aksiyon ıraksaması ve geçiş çeşitliliği birlikte veri seti kalitesini belirler. Karışık veri seti bir uzlaşma değil, amacıdır.

Birinci turundan önce bunları dondur

Bir DAgger turu, bir policy'yi zaman içinde kendisine karşı karşılaştırır. Turlar arasında veri seti olmayan herhangi bir değişiklik bu karşılaştırmayı anlamsız yapar.

  • Kamera konumları ve montajlar, bilekçe kamerası da dahil. Bir kelepçeyi gevşetin ve gözlem dağılımını değiştirdiniz, policy'i değil.
  • Exposure ve white balance, yakalama yığını bunları sabitlemesine izin verirse. Turlar arasında auto-exposure kayması yavaş, görünmez bir alan kayması olur.
  • Kol kalibrasyonu ve servo sıfır konumları. Yeniden kalibre etmeniz gerekirse, ondan önce kaydedilen her şeyi ayrı bir veri seti olarak değerlendirin.
  • Görev metni. Buradaki her VLA buna şartlandırılır; döngü ortasında yeniden yazı yazmak farklı bir görevdir.
  • Aydınlatma, masa yüzeyi, nesne seti. Yeni bir nesne yeni bir deney, sonraki tur değildir.
  • Kayıt çerçeve hızı. İki örnekleme rasterinde intervention rate'leri karşılaştırmak rasterden gelen farklılıklar üretir.
Bilekçe kamerası isteğe bağlı mobilya değildir

Hsu ve diğerleri el-merkezli bir görüş ile olağan üçüncü şahıs görüşü karşılaştırdılar ve gözlemci bakış açısı tutarlı bir şekilde eğitim verimliliğini ve dağıtım-dışı genellemeyi geliştirdi, sahneden daha azını görmesine rağmen. Beş-eklemli bir kol üzerinde, grieper zamanlaması genellikle düzeltmelerinizin düzelttiği şeydir ve grieper zamanlaması bilekçe görüşünün taşıdığıdır.

Tur, sondan sona

  1. 1
    Çıkarım çalıştırın ve kaydedin

    Turunu geliştirmek istediğiniz checkpoint'e karşı çalıştırın, ardından kaydı çıkarım köküne başlatın. Bu şekilde kaydedilmesi, turunun kendi görev metni olan orijinal teleoperation etiketi yerine policy'nin eğitildiği şeyi devralır. Kayıt olmadan başarısızlığı izleyebilirsiniz ancak bunu eğitemediz.

    bash
    # two calls, not one: the run, then its recording
    POST /inference/start      # model_id, and hf_repo_id = the checkpoint to drive
    POST /recording/start      # root=inference
    # root=inference also makes the recording inherit the run's task text
  2. 2
    Yanlış giderse üstlenin

    Üstlenin'i basın ve giriş modunu seçin: lider kolu, klavye veya kaydırıcılar. Koşucu duraklatılır, siz düzeltirsiniz, geri teslim edersiniz. Sürüşte işaretlenen çerçeveler otomatik olarak müdahaleler olarak işaretlenir.

    bash
    POST /inference/takeover/start   # input = leader | keyboard | sliders
    POST /inference/takeover/nudge   # keyboard, relative delta per call
    POST /inference/takeover/set     # sliders, absolute target
    POST /inference/takeover/stop    # back to the policy
  3. 3
    Bölümleri ayıkla

    Bölüm başına karar verin: düzeltme olarak dosyala, değerlendirme olarak sakla veya sil. Policy'nin yardımsız tamamladığı bir tur değerlendirme verisidir.

  4. 4
    Düzeltme veri setini senkronize et

    Düzeltmeler, her policy başına yerel bir veri sette toplanır ve otomatik senkronizasyon yoluyla bulut depolamasına gider. İçine koydığunız şeyden başka hiçbir şey karışmaz.

  5. 5
    Karışık veri seti oluştur

    Orijinal veri seti ile düzeltme veri setini birleştirin, kaynaklar başına bölümleri açıkça seçerek. Sonuç bundan itibaren sıradan bir veri setidir.

    bash
    POST /training/datasets/compose
      sources  = [ original_dataset, korrekturen_<policy> ]
      episodes = explicit selection per source
  6. 6
    Checkpoint'ten eğitim devamı yapın

    Temel model yerine önceki checkpoint'ten karışımı eğitin. Hangi checkpoint'i ve hangi karışımı not edin; bu çift olmadan tur tekrarlanabilir değildir.

    bash
    # field on the training job
    base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint>
    # the platform passes it to the training pod as BASE_CKPT_S3

Adım 2 ayrıntılı: üstlenmenin iki yolu

Lider kolu ile

İçinde leader-follower modu üstlenme, aynı pozda olmayan iki kol arasında bir el değişimidir. Üstlen'i bastığında koşucu duraklatılır ve lider, takipçinin mevcut pozisyonuna yönlendirilir, böylece tork aktarıldığında hiçbir şey atlamaz. Bu hizalama sürüşü zaman aşımına uğrarsa, lideri elle hizalayıp yalnızca ikisi beş derece içinde iken serbest bırakırsınız. Bundan sonra normal şekilde teleoperasyon yaparsınız ve aksiyon sütunu komut verdiğinizi kaydeder.

Bu yol hakkında dürüst olun: hizalama sürüşü ve tork el değişimi, gerçek donanımda döngünün en az test edilmiş bölümüdür. El değişimini yavaş, zararsız bir pozda test edin, önemsediğiniz bir turda buna güvenmeden önce. Lider kolu üç moddan en pürüzsüz düzeltmeleri üretir ve mekanik olarak en çok yanlış gidebilir.

Lider kolu olmadan: klavye ve kaydırıcılar

Bunu okuyan çoğu kişi bir kolu sahip. Bu yeterli. Üstlen'i bastığınız anda klavye veya kaydırıcı giriş seçin ve üstlenme hemen ve manueldir - hizalamak için ikinci bir kol yok, bu yüzden hizalama adımı yok. Takipçi pozunu tutar ve giriş bekler.

Giriş moduKolun nasıl hareket ettiğiSunucu tarafından uygulanan çağrı başına limitKilitlenmiş olduğunda
Lider koluAyna, takipçiyi lider'in eklem açılarından yönlendirirBu modda itme veya set çağrısı yok; ayna sürekli takipçi hedefleri yazarHiçbir zaman kilitli değil ve giriş modu verilmezse varsayılandır - ancak ikinci bir kola ihtiyaç duyar; lider kimliği olmadan üstlenme reddedilir
KlavyeTuş basışı başına göreceli itme, üstlenme itme uç noktasına gönderilirEklem başına 2 derece, grieper için 4 derece sabit sınırıÜstlenme lider modunda başlatıldıysa 409 ile reddedilir
KaydırıcılarMutlak hedef pose, üstlenme set uç noktasına gönderilirÇağrı başına hedef doğrultusunda 6 derecelik seyahat; arayüz saniyede yaklaşık on kez göndermeye devam ederÜstlenme lider modunda başlatıldıysa 409 ile reddedilir

Sıkıştırmalar arayüzde değil sunucu tarafında uygulanır, çünkü bir veri yolu servo kolu üzerindeki yanlış yazılan bir delta çarpışmadır. Klavye düzeltmeleri adım adım ve biraz kaba çıkar; kaydırıcı düzeltmeleri daha pürüzsüz, sunucu hedefe doğru yürürken arayüz akışa devam eder. Her iki şekilde de aksiyon sütunu tam komut verilen pose vektörünü alır ve müdahale işareti lider yolu ile aynıdır, bu yüzden klavye düzeltmeleri format farkı olmadan aynı veri setine iner.

text
Q / A   joint 1      R / F   joint 4
W / S   joint 2      T / G   joint 5
E / D   joint 3      Z / X   gripper
Yığındaki başka yerde olduğu gibi aynı tuş düzeni, bu yüzden kayıttan kas belleği taşınır.
Bir SO-100 veri seti üzerinde GR00T fine-tuning çalıştırmasının sıralanmış adımlarını gösteren eğitim rehberi
Bir turun eğitim tarafı, ilk çalıştırma gibi aynı rehberli sıralamdır; yalnızca checkpoint alanı farklıdır.

Düğmeye ne zaman basılacağı

Geç değil erken. Grieper hiçbir şey üzerine kapatıldıktan sonra başlayan bir düzeltme, policy'nin girmemesi gereken bir başarısızlıktan kurtulmayı öğretir ve kurtarma verisi kaçınma verisinden çok daha az değerlidir. Yolun yanlış olduğundan emin olduğunuz ilk anda müdahale edin, zor kısmı düzeltin, durum policy'nin daha önce işlediği duruma geri dönür dönmez teslim edin. ThriftyDAgger, sabit bir insan bütçesi altında yenilik ve tahmini risk kapısını açarak bu kararı otomatikleştirir, ancak zaten izlenen bir insanla tek kollu bir kol üzerinde insan kapısı, ayarlayacağınız herhangi bir şeyden daha ucuz ve daha iyi kalibre edilmiş olur.

Açık kaynaklı yığın ve birkaç betikle yapılabilir. Maliyeti muhasebe, ve muhasebe DAgger turlarının ölüm yeridir.

  1. Kendi çıkarım betiğinizden çerçeveleri LeRobot veri setine yazın, policy'nin eğitildiği görev dizesi ile.
  2. Policy döngüsünü duraklatın, komut kaynağını değiştirin ve sürdürdüğünüz her çerçeveyi müdahale olarak işaretleyin. Bayrak olmadan düzeltmeler olağan gösterimler gibi görünür.
  3. Policy'nin kontrolü bıraktığı ile ilk girdinin arası geçiş çerçeveleri hakkında ne olacağını kasıtlı olarak karar verin.
  4. Düzeltmeleri her policy başına kendi veri setinde tutun ve karışımın yeniden inşa edilebilmesi için episode endekslerini elle takip edin.
  5. Fine-tuning giriş noktasını önceki checkpoint'e işaret edin ve günlükte bu ağırlıkları yüklediğini kontrol edin.

Adım 3 ayrıntılı: ayıklama kaliteye karar verir

Turdan sonra bazı çerçeveler müdahaleler olarak işaretlenmiş bir kaydınız var. Üç hedef var ve yanlışı sessizce sonraki turnu zehirler.

  • Müdahalenin gerçek bir düzeltme olduğunda düzeltme olarak dosyala: policy yanlış bir yere gidiyordu ve girdisi policy'nin kendisinin ürettiği durumdan doğru şeyi gösterdi.
  • Temiz özerk turlar ve dikkat için üstlendiğiniz turlar için değerlendirme olarak saklayın. Değerlendirme bölümleri sonraki checkpoint'i nasıl ölçeceğinizdir ve bunlar hiçbir zaman eğitilmemelidir.
  • İlgisiz bir şey tarafından bozulan turları atın - düştü kamera çerçevesi, durmuş servo, devirmek bir nesne. Dağınık bir düzeltme düzeltme yoktan kötüdür.
Dondurma çerçeveleri eğitim verilerine değil ham kayıta ait

Policy'nin kontrol bıraktığı ile ilk girdinin arası arasında, kol yerinde kalır recorder yazımı tutar - biraz farklı görüntüler ile eşleştirilmiş aynı pozların bir çalıştırması. Burada bu el değişimi çerçeveleri ham kaydında kalır ve düzeltme veri setinin dışında. Döngüyü kendiniz inşa ederseniz bunları kasıtlı olarak kesin: bunları eğitilen policy hareket etmesi gereken yerde durmayı öğrenir.

Adım 5 ayrıntılı: karışımı oluşturma

Kompozisyon orijinal veri seti artı düzeltme veri setini alır ve LeRobot veri seti olan yeni, sıradan bir veri seti üretir ki bu diğer herhangi bir gibi eğitim alır. Önemli özellik episode seçimi kaynaklar başına açık - hiçbir şey otomatik olarak karışmaz. Bu, policy'nin tuhaf davrandığı ve ne üzerinde eğitildiğini yeniden inşa etmek zorunda olduğunuz ilk zamana kadar küçük görünür.

Açık soru oran ve kimse transfer yapan bir sayıya sahip değildir. Edebiyatın kabul ettiği şey düzeltmelerin çerçeve paylarından daha fazla sayılması gerektiğidir. Mandlekar ve diğerleri müdahale sistemi tarafından toplanan veriler üzerinde yinelemeli olarak yeniden eğitim alırlar, böylece policy darboğazları geçmeyi öğrenir ve bu şekilde eğitilen ajanların müdahale olmayan gösteren kişilerle aynı sayıda örnek üzerinde eğitilen ajanları geçtiğini bildirirler. Sirius daha ileri gider ve eğitim örneklerini yaklaştırılmış insan güvenine göre yeniden ağırlandırır, benzetimde yüzde 8 kazanç ve gerçek donanımda benzetimden sonra yüzde 27 policy başarı oranında, iki kez yakınsama hızında bildirir. Buradaki eğitim giriş noktalarının hiçbiri örnek-ağırlama düğmesi açığa çıkarmaz, bu yüzden kaba ikame her düzeltme bölümünü tutmak ve orijinal gösterimleri altörneklemek - ve yaptığınızı yazmaktır.

SO-100 veri setinin kamera akışları olan bölümleri gösteren veri seti kayıt görüşü
Düzeltme bölümleri çerçeve başına müdahale bayrağı olan sıradan bölümlerdir, bu yüzden orijinal veri seti ile dönüştürme olmadan oluşur.

Adım 6 ayrıntılı: checkpoint'ten devam etmek gerçekten ne demektir

Karışımı temel modelinden eğitmek çalışır ancak önceki turunu atar ve tam bir çalıştırma maliyeti olur. Önceki checkpoint devam etmek daha hızlı ve genellikle daha iyidir. Ayrıca cümlelerin önereceğinden daha sınırlıdır.

Ağırlık başlatması, optimizer devamı değildir

Yalnızca ağırlık checkpoint parametreleri ve hiçbir şey içerir. Yüklenmesi bir sonraki çalıştırmaya temel modelinden daha iyi bir başlangıç noktası verir, ancak optimizer momentler, öğrenme oranı çizelgesi konumu ve veri sırası tümü sıfırdan başlar. Devam eden çalıştırmanın başında kayıp dalgasını beklemeyin, bunu başarısızlık olarak okumayın ve turnu devam etmekle çağırmayın. Bu sıcak başlangıçtır.

PolicyBoyutGPU katmanıAksiyon adımı başına çıkarımVeri seti biçimiDenemesi değer olan bölümler
GR00T N1.7yaklaşık 3 B, fine-tuning sırasında yaklaşık 40 M eğitilmişA100 80 GB veya H100 80 GByaklaşık 152 msLeRobot v2.0 veya v2.150
GR00T N1.5yaklaşık 3 BA100 80 GB veya H100 80 GByaklaşık 165 msLeRobot v2.0 veya v2.150
Pi0.5PaliGemma omurga üzerinde yaklaşık 3 BA100 80 GB veya H100 80 GByaklaşık 485 msLeRobot v3.050
SmolVLAyaklaşık 450 MRTX 4090 veya herhangi bir 24 GB kartyaklaşık 245 msLeRobot v3.030
ACTyaklaşık 80 M, sıfırdan eğitilmişRTX 4090 veya herhangi bir 24 GB kartyaklaşık 20 msLeRobot v3.050

Gecikme DAgger döngüsü içinde bir demo sırasında olmadığı şekilde bileşke oluşturur: aksiyon adımı başına yaklaşık 485 ms'de yanlışsa değil çünkü kol çekindiği için üstlenmişsindir ve çekinme düzeltmeleri kullanışlı eğitim verisi değildir. Nihai başarı oranını kovalayan yerine veriler üzerinde yineleme yapıyorsanız hızlı bir model üzerinde yineleyin. Shukor ve diğerleri SmolVLA'yı tek bir GPU üzerinde eğitmek ve tüketici GPU'ları veya CPU'lar üzerinde dağıtmak için tasarlandığını tanımlarlar, aksiyonu tahmininden yürütmeyi ayırmak için eşzamanlı çıkarım yığınıyla - üstlenme döngüsünü yanıt vermeyi tutar.

Veri seti biçimleri değiştirilemezdir. GR00T LeRobot v2.0 veya v2.1 alır ve Isaac-GR00T deposu girdisini eklenen modality açıklaması dosyası ile LeRobot v2 biçiminin bir versiyonu olarak tanımlar; yeni eğitmenleri burası v3.0 beklenir. Karışımı yanlış versiyonda oluşturmak kötü policy üretme yerine yükleme sırasında başarısız olur - daha iyi başarısızlık modu, hala israf bir kuyruk yeri. veri seti belgelendirmesi hangi eğitmenin hangi biçimi aldığını listeler.

Döngü, muhasebe zaten yapılmış

Lider kolu, klavye veya kaydırıcılar ile üstlenme; çerçeve başına müdahale işareti; turları düzeltme veya değerlendirmeler olarak dosyalama; kaynaklar başına açık episode seçimi ile karışık bir veri seti oluşturma; ve base model yerine checkpoint'ten eğitim devamı. Sizin için kalması olan kararlar hangi turun düzeltme olarak sayılacağı, karışıma neyin gireceği ve intervention rate'in düşmeyi ne zaman bırakacağıdır.

DAgger döngüsünün nasıl bağlantılı olduğunu görmek

Bir turnu israf etmenin dört yolu

1. Düzeltmeleri yalnız eğitmek

En yaygın başarısızlık ve en tempting kestirme yol. Yalnızca düzeltme veri seti neredeyse tamamen görevin zor ortası, yaklaşım ve geri çekilme kayıp; policy zor kısmında daha iyi olur ve oraya nasıl ulaşılacağını unutur. Agregasyon yöntemin bir uygulama detayı değil, mekanizmasıdır: eski veriler, düzeltmelerin bir parçasını hareket ettirirken davranışın geri kalanını yerinde tutar.

2. Turlar arasında kamera taşımak

İki santim kaydıran bir kamera başladığınız policy'den kötü bir policy üretir ve günü alan bir tanı. Buradaki her VLA görüntülere şartlandırılır; ortak durum tek başına nesnele nerede olduğunu açıklığa kavuşturmaz. İlk turdan önce kurulumu fotoğraflayın ve sonraki her birinden önce o fotoğrafı kontrol edin.

3. El değişimi yapılarını eğitim verilerine sokmamak

Yukarıda kapsanan ve listede görünmez olduğu için. Semptom policy'nin önceki turun operatörünün üstlendiği tam yerde bir kesir saniye için durması. Çekinme gibi görünür; taklit itu.

4. Sıcak başlangıcı devam etmek çağırmak

Optimizer durumunun taşındığına inanırsanız ilk kayıp dalgası hata olarak okunur ve korruptlı veriler arayarsınız. Optimizer'nin taze başladığını bilirseniz dalgayı beklenen ve ardından geleni bakarsınız. Aynı sayılar, zıt sonuçlar.

Turnu ölçmek

İnsan-kontrollü döngü metriği intervention rate'dir: siz kontrol altındayken kaydedilen çerçeveler, turların toplam çerçeveleri ile bölünür. Üstlenme durumunda ve turun sorduğu soruya cevap veren tek sayıdır. Eğitim kaybı policy geliştirip geliştirmediğinden bağımsız olarak düşer; başarı oranı bir masaüstü kolun ürettiği örnek boyutlarda ikili ve gürültülüdür. Intervention rate sürekli, policy'nin neden olduğu durumlar üzerinde ölçülür ve policy'yi daha azına ihtiyaç duyar dağınıklaşır.

Bunu yalnızca aynı koşullar altında kaydedilen turlar arasında karşılaştırın. Tam argüman ve iki turdan fazla yaşayan bir değerlendirme seti inşa etme DAgger döngüsünü ölçme üzerindeki makalede. Tur bir gerçekçi bir fizibilite testidir: üstlenmenin donanımınız üzerinde çalıştığını, düzeltmelerin bayraklarıyla iniş olduğunu ve devam çalıştırmasının adlandırdığınız checkpoint'i yüklediğini kontrol etmediniz. Turlar iki ve üç oranın hareket etmeye başlaması gereken yerlerdir. Dörtte hareket etmemişse problem DAgger'dan hava akışı.

Tur başına yazınNeden daha sonra önemli
Sürülen CheckpointBunu olmadan bir karışıma bir geliştirmeyi atfetmediniz
Üstlenme için kullanılan giriş moduKlavye düzeltmeleri lider düzeltmelerinden daha kaba ve veri gösterir
Turlarının sayısı ve her biri nasıl ayıklandıTurun önem taşıyacak kadar düzeltme olup olmadığı
Intervention rate çalıştırma başına ve ortalamaDöngünün ilerleme metriği
Kaynaklar başına tam episode seçimiTurnu yeniden üretme veya geri alma tek yolu
Sıcak başlangıç veya taze eğitimBir hafta sonra bakacağınız kayıp eğrisini açıklar

Henüz bir checkpoint'iniz yoksa

Döngü biri olmadan giriş noktası yok. Bir ilk veri seti kaydedin, bir ilk policy eğitin, çalıştırın - kayıt, eğitim ve policy çalıştırma bu yolu kapsar. Kayıt istemcisi indirme sayfasında, GPU katmanları ve saatlik oranlar fiyatlandırma sayfasında ve kullanılabilir bir bölüm SO-100 veri koleksiyonu kılavuzunda görülüyor. Düzeltmelerden önce gösterimleri doğru alın: DAgger onarım mekanizması ve neredeyse doğru olan bir şeyde çok daha iyi işler.

Lider kolu olmadan DAgger döngüsü çalıştırabilir miyim?

Evet. Üstlen'i bastığınızda klavye veya kaydırıcı giriş seçin: üstlenme hemen ve manueldir, hizalamak için ikinci kol yok. Klavye sunucu tarafından 2 derece eklem başına ve grieper için 4 derecede sabit sıkıştırılmış göreceli itme gönderir; kaydırıcılar mutlak bir hedef gönderir ve sunucu çağrı başına en fazla 6 derece doğru hareket ederken arayüz akışa devam eder. Aksiyon sütunu ve müdahale işareti lider modu ile aynıdır, bu yüzden düzeltmeleri veri sette ayırt edilemezdir.

Bir tur kaç düzeltme gerektiriyor?

Savunulabilir evrensel sayı yok, çerçeve sayısı episode sayısından daha fazla önemlidir. Çalışan kural düzeltmelerin karışımda kaybolmaması olur: 200 orijinal bölüm ve üç düzeltme bölümü ile hiçbir şey hareket etmeyecek. Aynı kurtarmanın üç tekrarı yerine birçok başlangıç konfigürasyonundan başarısız davranışı kapatan düzeltmelere aim.

Neden yalnızca düzeltmeleri eğitmek o kadar kötü bir fikirdir?

Çünkü düzeltmeler neredeyse tamamen görevin zor ortasıdır. Yaklaşım, hizalama ve geri çekilme kayıp, bu yüzden policy zaten iyi yaptığı şeyi kaybeder ve düzelttiğiniz bölümde geliştirme sağlar. Eski verileri tutmak ve ekleme mekanizmasıdır, isteğe bağlı ekstra değil.

Checkpoint'ten devam etmek önceki eğitim çalıştırması devamı mı?

Hayır. Yalnızca ağırlık checkpoint parametreleri geri yükler ve hiçbir şey: optimizer momentler, öğrenme oranı çizelgesi konumu ve veri sırası taze başlar. Bu sıcak başlangıç ve ilk kayıp dalgası beklenen yerine semptom değil. Bir hafta sonra eğriyi doğru okumanız için iki taraftan hangisini gerçekten yaptığınızı yazın.

Intervention rate düşmezse ne?

Turları eklemeyi durdurun. Düz oran düzeltmelerin düşündüğünüz şeyi öğretmediği anlamına gelir. Olağan nedenler hava akışı: kamera taşındı, düzeltmeler kaçınma verisi olabilmek için çok geç başlar, el değişimi çerçeveleri eğitim setinde veya görev gözlemlerden policy gerçekten alır belirlemez.

Bunların hiçbiri çözülen bir problem değildir ve hiçbiri tıklama değildir. Etkileşimli taklit öğrenmesi aktivdir araştırma alanı tam olarak sorulardan dolayı - ne zaman müdahale, insan ne ağırlıklı tuttu, ne kadar eski veri tutulacak - hiçbir yerleşik yanıtlara sahip değildir; Celemin ve diğerleri tarafından anket kalan açıktır. Döngünün ne var ölçülebilir yakınsama dikkatli çalıştırıldığında, birkaç yüz euro'ya mal olan donanım üzerinde. Kurulumu dondur, erken müdahale et, dürüst ayıkla, kasıtlı oluştur ve her seferinde intervention rate'i kaydet.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started