
Bir SO-100 kolu üzerinde yapılmış tek bir insan-kontrollü DAgger turunun adım adım hesabı: policy'i çalıştırın ve kaydedin, yanlış gitse üstlenin, turunu düzeltme olarak dosyalayın, karışık bir veri seti oluşturun ve bir checkpoint'ten eğitimi devam ettirin. Lider kolu olmayan kişiler için klavye ve kaydırıcı üstlenme yolunu içerir ve bir turnu değersiz kılan dört hatayı içerir.
Policy'iniz çalışır. Küpe uzanır, greifer bir santim çok erken kapatır ve sanki tutmuş gibi devam eder. Hiçbir hata oluşmaz ve eğitim kaybına bakmanız hiçbir açıklamayı bulamaz. Çözüm, aynı gösterimlerde başka 20 000 gradient adımı değildir. Kollunuzu tam yanlış giden yere geri koymak, bunun yerine ne yaptığınızı kaydetmek ve sonraki checkpoint'i eski veriler artı bu düzeltme üzerinde eğitmektir. Bu bir DAgger turudur ve bunu bir SO-100 üzerinde vision-language-action policy ile nasıl çalıştırdığınız burada.
Teori başka yerde: veri seti agregasyonu neden işe yarar ve insan kontrolleme bunu nasıl değiştirir. Bu işletme kılavuzudur ve eğitilmiş bir checkpoint, çalışan bir kamera seti ve hareket eden bir kol varsayar. Aşağıdaki altı adım, bu platformun DAgger sayfasında uygulandığı şekliyle döngüdür, ancak sıra kendi betiklerinizden de aynıdır.
Kısaca bir tur
- •Eğitilmiş policy'i çalıştırın ve kaydedin, turun kendi görev metniyle genel teleoperation etiketi yerine.
- •Davranış yanlış giderse hemen üstlenin: lider kollu ayna el değişimi, olmadığında klavye veya kaydırıcılar üzerinden anında ve manuel.
- •Her turnu ayıkla: düzeltme olarak dosyala, değerlendirme bölümü olarak sakla veya sil.
- •Karışımı elle oluştur - orijinal gösterimler artı düzeltmeler, kaynaklar başına seçilen bölümler. Hiçbir zaman düzeltmeler üzerinde eğitmeyin.
- •Son checkpoint'ten eğitimi devam ettirin ve hangi checkpoint'in hangi karışımı ürettiğini not edin.
- •Turun bir şey değer olup olmadığını söyleyen sayı, eğitim kaybı değil intervention rate'dir.
İkinci tur neden sadece daha fazla veri değildir
Behavior cloning, insanın ziyaret ettiği durumlar üzerinde eğitim alır. Test zamanında policy'nin neden olduğu durumları ziyaret eder ve küçük aksiyon hataları, gösterimlerin kapsamadığı durumlara bileşke oluşturur. Ross, Gordon ve Bagnell bu başarısızlığı AISTATS 2011 için formallaştırdılar ve durağan deterministik bir policy'yi eğiten ve indirgemeye göre, neden olduğu durum dağılımı altında iyi performans göstermesi gereken yinelemeli bir algoritmayla yanıtladılar: mevcut policy'yi çalıştırın, uzman gerçekten ulaştığı durumları etiketlesin, bunları veri setine ekleyin, yeniden eğitin, yineleyin. Kelly ve diğerleri HG-DAgger ile sorguyu pratik hale getirdiler, burada insan kontrolleri tutmak yerine tutmak yerine kontrol etmek istediğinde ne zaman devralsın karar verir; simüle edilmiş ve gerçek özerk sürüş görevinde DAgger ve behavior cloning'in her ikisinden daha iyi performans bildirirler. İnsan kontrolü, masaüstü bir kol üzerinde döngüyü tolere edilebilir kılanı budur - yalnızca bir şey yanlış giderse ellerinizi hareket ettirirsiniz.
İki sonuç teoriden pratikte daha fazla önemlidir. Düzeltmeler olağan gösterimler değildir: Mandlekar ve diğerlerinin tanımladığı darboğaz bölgelerine yoğunlaşırlar, küçük bir sapma policy'yi gösterimlerin hiçbir zaman kapsamadığı durumlara düşürür. Ve sadece bu zor parçalardan yapılan bir veri seti kötü şekillendirilmiş bir veri setidir - Belkhale, Cui ve Sadigh veri tarafından tartışırlar ki durum çeşitliliği her zaman faydalı değildir ve aksiyon ıraksaması ve geçiş çeşitliliği birlikte veri seti kalitesini belirler. Karışık veri seti bir uzlaşma değil, amacıdır.
Birinci turundan önce bunları dondur
Bir DAgger turu, bir policy'yi zaman içinde kendisine karşı karşılaştırır. Turlar arasında veri seti olmayan herhangi bir değişiklik bu karşılaştırmayı anlamsız yapar.
- Kamera konumları ve montajlar, bilekçe kamerası da dahil. Bir kelepçeyi gevşetin ve gözlem dağılımını değiştirdiniz, policy'i değil.
- Exposure ve white balance, yakalama yığını bunları sabitlemesine izin verirse. Turlar arasında auto-exposure kayması yavaş, görünmez bir alan kayması olur.
- Kol kalibrasyonu ve servo sıfır konumları. Yeniden kalibre etmeniz gerekirse, ondan önce kaydedilen her şeyi ayrı bir veri seti olarak değerlendirin.
- Görev metni. Buradaki her VLA buna şartlandırılır; döngü ortasında yeniden yazı yazmak farklı bir görevdir.
- Aydınlatma, masa yüzeyi, nesne seti. Yeni bir nesne yeni bir deney, sonraki tur değildir.
- Kayıt çerçeve hızı. İki örnekleme rasterinde intervention rate'leri karşılaştırmak rasterden gelen farklılıklar üretir.
Hsu ve diğerleri el-merkezli bir görüş ile olağan üçüncü şahıs görüşü karşılaştırdılar ve gözlemci bakış açısı tutarlı bir şekilde eğitim verimliliğini ve dağıtım-dışı genellemeyi geliştirdi, sahneden daha azını görmesine rağmen. Beş-eklemli bir kol üzerinde, grieper zamanlaması genellikle düzeltmelerinizin düzelttiği şeydir ve grieper zamanlaması bilekçe görüşünün taşıdığıdır.
Tur, sondan sona
- 1Çıkarım çalıştırın ve kaydedin
Turunu geliştirmek istediğiniz checkpoint'e karşı çalıştırın, ardından kaydı çıkarım köküne başlatın. Bu şekilde kaydedilmesi, turunun kendi görev metni olan orijinal teleoperation etiketi yerine policy'nin eğitildiği şeyi devralır. Kayıt olmadan başarısızlığı izleyebilirsiniz ancak bunu eğitemediz.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Yanlış giderse üstlenin
Üstlenin'i basın ve giriş modunu seçin: lider kolu, klavye veya kaydırıcılar. Koşucu duraklatılır, siz düzeltirsiniz, geri teslim edersiniz. Sürüşte işaretlenen çerçeveler otomatik olarak müdahaleler olarak işaretlenir.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Bölümleri ayıkla
Bölüm başına karar verin: düzeltme olarak dosyala, değerlendirme olarak sakla veya sil. Policy'nin yardımsız tamamladığı bir tur değerlendirme verisidir.
- 4Düzeltme veri setini senkronize et
Düzeltmeler, her policy başına yerel bir veri sette toplanır ve otomatik senkronizasyon yoluyla bulut depolamasına gider. İçine koydığunız şeyden başka hiçbir şey karışmaz.
- 5Karışık veri seti oluştur
Orijinal veri seti ile düzeltme veri setini birleştirin, kaynaklar başına bölümleri açıkça seçerek. Sonuç bundan itibaren sıradan bir veri setidir.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Checkpoint'ten eğitim devamı yapın
Temel model yerine önceki checkpoint'ten karışımı eğitin. Hangi checkpoint'i ve hangi karışımı not edin; bu çift olmadan tur tekrarlanabilir değildir.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Adım 2 ayrıntılı: üstlenmenin iki yolu
Lider kolu ile
İçinde leader-follower modu üstlenme, aynı pozda olmayan iki kol arasında bir el değişimidir. Üstlen'i bastığında koşucu duraklatılır ve lider, takipçinin mevcut pozisyonuna yönlendirilir, böylece tork aktarıldığında hiçbir şey atlamaz. Bu hizalama sürüşü zaman aşımına uğrarsa, lideri elle hizalayıp yalnızca ikisi beş derece içinde iken serbest bırakırsınız. Bundan sonra normal şekilde teleoperasyon yaparsınız ve aksiyon sütunu komut verdiğinizi kaydeder.
Bu yol hakkında dürüst olun: hizalama sürüşü ve tork el değişimi, gerçek donanımda döngünün en az test edilmiş bölümüdür. El değişimini yavaş, zararsız bir pozda test edin, önemsediğiniz bir turda buna güvenmeden önce. Lider kolu üç moddan en pürüzsüz düzeltmeleri üretir ve mekanik olarak en çok yanlış gidebilir.
Lider kolu olmadan: klavye ve kaydırıcılar
Bunu okuyan çoğu kişi bir kolu sahip. Bu yeterli. Üstlen'i bastığınız anda klavye veya kaydırıcı giriş seçin ve üstlenme hemen ve manueldir - hizalamak için ikinci bir kol yok, bu yüzden hizalama adımı yok. Takipçi pozunu tutar ve giriş bekler.
| Giriş modu | Kolun nasıl hareket ettiği | Sunucu tarafından uygulanan çağrı başına limit | Kilitlenmiş olduğunda |
|---|---|---|---|
| Lider kolu | Ayna, takipçiyi lider'in eklem açılarından yönlendirir | Bu modda itme veya set çağrısı yok; ayna sürekli takipçi hedefleri yazar | Hiçbir zaman kilitli değil ve giriş modu verilmezse varsayılandır - ancak ikinci bir kola ihtiyaç duyar; lider kimliği olmadan üstlenme reddedilir |
| Klavye | Tuş basışı başına göreceli itme, üstlenme itme uç noktasına gönderilir | Eklem başına 2 derece, grieper için 4 derece sabit sınırı | Üstlenme lider modunda başlatıldıysa 409 ile reddedilir |
| Kaydırıcılar | Mutlak hedef pose, üstlenme set uç noktasına gönderilir | Çağrı başına hedef doğrultusunda 6 derecelik seyahat; arayüz saniyede yaklaşık on kez göndermeye devam eder | Üstlenme lider modunda başlatıldıysa 409 ile reddedilir |
Sıkıştırmalar arayüzde değil sunucu tarafında uygulanır, çünkü bir veri yolu servo kolu üzerindeki yanlış yazılan bir delta çarpışmadır. Klavye düzeltmeleri adım adım ve biraz kaba çıkar; kaydırıcı düzeltmeleri daha pürüzsüz, sunucu hedefe doğru yürürken arayüz akışa devam eder. Her iki şekilde de aksiyon sütunu tam komut verilen pose vektörünü alır ve müdahale işareti lider yolu ile aynıdır, bu yüzden klavye düzeltmeleri format farkı olmadan aynı veri setine iner.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Düğmeye ne zaman basılacağı
Geç değil erken. Grieper hiçbir şey üzerine kapatıldıktan sonra başlayan bir düzeltme, policy'nin girmemesi gereken bir başarısızlıktan kurtulmayı öğretir ve kurtarma verisi kaçınma verisinden çok daha az değerlidir. Yolun yanlış olduğundan emin olduğunuz ilk anda müdahale edin, zor kısmı düzeltin, durum policy'nin daha önce işlediği duruma geri dönür dönmez teslim edin. ThriftyDAgger, sabit bir insan bütçesi altında yenilik ve tahmini risk kapısını açarak bu kararı otomatikleştirir, ancak zaten izlenen bir insanla tek kollu bir kol üzerinde insan kapısı, ayarlayacağınız herhangi bir şeyden daha ucuz ve daha iyi kalibre edilmiş olur.
Açık kaynaklı yığın ve birkaç betikle yapılabilir. Maliyeti muhasebe, ve muhasebe DAgger turlarının ölüm yeridir.
- Kendi çıkarım betiğinizden çerçeveleri LeRobot veri setine yazın, policy'nin eğitildiği görev dizesi ile.
- Policy döngüsünü duraklatın, komut kaynağını değiştirin ve sürdürdüğünüz her çerçeveyi müdahale olarak işaretleyin. Bayrak olmadan düzeltmeler olağan gösterimler gibi görünür.
- Policy'nin kontrolü bıraktığı ile ilk girdinin arası geçiş çerçeveleri hakkında ne olacağını kasıtlı olarak karar verin.
- Düzeltmeleri her policy başına kendi veri setinde tutun ve karışımın yeniden inşa edilebilmesi için episode endekslerini elle takip edin.
- Fine-tuning giriş noktasını önceki checkpoint'e işaret edin ve günlükte bu ağırlıkları yüklediğini kontrol edin.
Aynı altı adım düğme olarak vardır. Otomatikleştirilen, elle yanlış gitmesi kolay şeydir: çerçeve başına müdahale bayrağı, düzeltmeler ve değerlendirmeler arasındaki bölme ve hangi checkpoint'in hangi karışımı ürettiğinin kaydı. Seçmeyen hiçbir şey oluşturulmuş bir veri setine girmez.
Sizin için karar vermez. Hangi turun düzeltme olarak sayılacağı, karışıma neyin gireceği ve intervention rate'in düşmeyi ne zaman bırakacağı karar çağrılarıdır. Alanlar eğitim altında, giriş modları teleoperasyon altında belgelenmiştir.
Adım 3 ayrıntılı: ayıklama kaliteye karar verir
Turdan sonra bazı çerçeveler müdahaleler olarak işaretlenmiş bir kaydınız var. Üç hedef var ve yanlışı sessizce sonraki turnu zehirler.
- Müdahalenin gerçek bir düzeltme olduğunda düzeltme olarak dosyala: policy yanlış bir yere gidiyordu ve girdisi policy'nin kendisinin ürettiği durumdan doğru şeyi gösterdi.
- Temiz özerk turlar ve dikkat için üstlendiğiniz turlar için değerlendirme olarak saklayın. Değerlendirme bölümleri sonraki checkpoint'i nasıl ölçeceğinizdir ve bunlar hiçbir zaman eğitilmemelidir.
- İlgisiz bir şey tarafından bozulan turları atın - düştü kamera çerçevesi, durmuş servo, devirmek bir nesne. Dağınık bir düzeltme düzeltme yoktan kötüdür.
Policy'nin kontrol bıraktığı ile ilk girdinin arası arasında, kol yerinde kalır recorder yazımı tutar - biraz farklı görüntüler ile eşleştirilmiş aynı pozların bir çalıştırması. Burada bu el değişimi çerçeveleri ham kaydında kalır ve düzeltme veri setinin dışında. Döngüyü kendiniz inşa ederseniz bunları kasıtlı olarak kesin: bunları eğitilen policy hareket etmesi gereken yerde durmayı öğrenir.
Adım 5 ayrıntılı: karışımı oluşturma
Kompozisyon orijinal veri seti artı düzeltme veri setini alır ve LeRobot veri seti olan yeni, sıradan bir veri seti üretir ki bu diğer herhangi bir gibi eğitim alır. Önemli özellik episode seçimi kaynaklar başına açık - hiçbir şey otomatik olarak karışmaz. Bu, policy'nin tuhaf davrandığı ve ne üzerinde eğitildiğini yeniden inşa etmek zorunda olduğunuz ilk zamana kadar küçük görünür.
Açık soru oran ve kimse transfer yapan bir sayıya sahip değildir. Edebiyatın kabul ettiği şey düzeltmelerin çerçeve paylarından daha fazla sayılması gerektiğidir. Mandlekar ve diğerleri müdahale sistemi tarafından toplanan veriler üzerinde yinelemeli olarak yeniden eğitim alırlar, böylece policy darboğazları geçmeyi öğrenir ve bu şekilde eğitilen ajanların müdahale olmayan gösteren kişilerle aynı sayıda örnek üzerinde eğitilen ajanları geçtiğini bildirirler. Sirius daha ileri gider ve eğitim örneklerini yaklaştırılmış insan güvenine göre yeniden ağırlandırır, benzetimde yüzde 8 kazanç ve gerçek donanımda benzetimden sonra yüzde 27 policy başarı oranında, iki kez yakınsama hızında bildirir. Buradaki eğitim giriş noktalarının hiçbiri örnek-ağırlama düğmesi açığa çıkarmaz, bu yüzden kaba ikame her düzeltme bölümünü tutmak ve orijinal gösterimleri altörneklemek - ve yaptığınızı yazmaktır.

Adım 6 ayrıntılı: checkpoint'ten devam etmek gerçekten ne demektir
Karışımı temel modelinden eğitmek çalışır ancak önceki turunu atar ve tam bir çalıştırma maliyeti olur. Önceki checkpoint devam etmek daha hızlı ve genellikle daha iyidir. Ayrıca cümlelerin önereceğinden daha sınırlıdır.
Yalnızca ağırlık checkpoint parametreleri ve hiçbir şey içerir. Yüklenmesi bir sonraki çalıştırmaya temel modelinden daha iyi bir başlangıç noktası verir, ancak optimizer momentler, öğrenme oranı çizelgesi konumu ve veri sırası tümü sıfırdan başlar. Devam eden çalıştırmanın başında kayıp dalgasını beklemeyin, bunu başarısızlık olarak okumayın ve turnu devam etmekle çağırmayın. Bu sıcak başlangıçtır.
| Policy | Boyut | GPU katmanı | Aksiyon adımı başına çıkarım | Veri seti biçimi | Denemesi değer olan bölümler |
|---|---|---|---|---|---|
| GR00T N1.7 | yaklaşık 3 B, fine-tuning sırasında yaklaşık 40 M eğitilmiş | A100 80 GB veya H100 80 GB | yaklaşık 152 ms | LeRobot v2.0 veya v2.1 | 50 |
| GR00T N1.5 | yaklaşık 3 B | A100 80 GB veya H100 80 GB | yaklaşık 165 ms | LeRobot v2.0 veya v2.1 | 50 |
| Pi0.5 | PaliGemma omurga üzerinde yaklaşık 3 B | A100 80 GB veya H100 80 GB | yaklaşık 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | yaklaşık 450 M | RTX 4090 veya herhangi bir 24 GB kart | yaklaşık 245 ms | LeRobot v3.0 | 30 |
| ACT | yaklaşık 80 M, sıfırdan eğitilmiş | RTX 4090 veya herhangi bir 24 GB kart | yaklaşık 20 ms | LeRobot v3.0 | 50 |
Gecikme DAgger döngüsü içinde bir demo sırasında olmadığı şekilde bileşke oluşturur: aksiyon adımı başına yaklaşık 485 ms'de yanlışsa değil çünkü kol çekindiği için üstlenmişsindir ve çekinme düzeltmeleri kullanışlı eğitim verisi değildir. Nihai başarı oranını kovalayan yerine veriler üzerinde yineleme yapıyorsanız hızlı bir model üzerinde yineleyin. Shukor ve diğerleri SmolVLA'yı tek bir GPU üzerinde eğitmek ve tüketici GPU'ları veya CPU'lar üzerinde dağıtmak için tasarlandığını tanımlarlar, aksiyonu tahmininden yürütmeyi ayırmak için eşzamanlı çıkarım yığınıyla - üstlenme döngüsünü yanıt vermeyi tutar.
Veri seti biçimleri değiştirilemezdir. GR00T LeRobot v2.0 veya v2.1 alır ve Isaac-GR00T deposu girdisini eklenen modality açıklaması dosyası ile LeRobot v2 biçiminin bir versiyonu olarak tanımlar; yeni eğitmenleri burası v3.0 beklenir. Karışımı yanlış versiyonda oluşturmak kötü policy üretme yerine yükleme sırasında başarısız olur - daha iyi başarısızlık modu, hala israf bir kuyruk yeri. veri seti belgelendirmesi hangi eğitmenin hangi biçimi aldığını listeler.
Döngü, muhasebe zaten yapılmış
Lider kolu, klavye veya kaydırıcılar ile üstlenme; çerçeve başına müdahale işareti; turları düzeltme veya değerlendirmeler olarak dosyalama; kaynaklar başına açık episode seçimi ile karışık bir veri seti oluşturma; ve base model yerine checkpoint'ten eğitim devamı. Sizin için kalması olan kararlar hangi turun düzeltme olarak sayılacağı, karışıma neyin gireceği ve intervention rate'in düşmeyi ne zaman bırakacağıdır.
DAgger döngüsünün nasıl bağlantılı olduğunu görmekBir turnu israf etmenin dört yolu
1. Düzeltmeleri yalnız eğitmek
En yaygın başarısızlık ve en tempting kestirme yol. Yalnızca düzeltme veri seti neredeyse tamamen görevin zor ortası, yaklaşım ve geri çekilme kayıp; policy zor kısmında daha iyi olur ve oraya nasıl ulaşılacağını unutur. Agregasyon yöntemin bir uygulama detayı değil, mekanizmasıdır: eski veriler, düzeltmelerin bir parçasını hareket ettirirken davranışın geri kalanını yerinde tutar.
2. Turlar arasında kamera taşımak
İki santim kaydıran bir kamera başladığınız policy'den kötü bir policy üretir ve günü alan bir tanı. Buradaki her VLA görüntülere şartlandırılır; ortak durum tek başına nesnele nerede olduğunu açıklığa kavuşturmaz. İlk turdan önce kurulumu fotoğraflayın ve sonraki her birinden önce o fotoğrafı kontrol edin.
3. El değişimi yapılarını eğitim verilerine sokmamak
Yukarıda kapsanan ve listede görünmez olduğu için. Semptom policy'nin önceki turun operatörünün üstlendiği tam yerde bir kesir saniye için durması. Çekinme gibi görünür; taklit itu.
4. Sıcak başlangıcı devam etmek çağırmak
Optimizer durumunun taşındığına inanırsanız ilk kayıp dalgası hata olarak okunur ve korruptlı veriler arayarsınız. Optimizer'nin taze başladığını bilirseniz dalgayı beklenen ve ardından geleni bakarsınız. Aynı sayılar, zıt sonuçlar.
Turnu ölçmek
İnsan-kontrollü döngü metriği intervention rate'dir: siz kontrol altındayken kaydedilen çerçeveler, turların toplam çerçeveleri ile bölünür. Üstlenme durumunda ve turun sorduğu soruya cevap veren tek sayıdır. Eğitim kaybı policy geliştirip geliştirmediğinden bağımsız olarak düşer; başarı oranı bir masaüstü kolun ürettiği örnek boyutlarda ikili ve gürültülüdür. Intervention rate sürekli, policy'nin neden olduğu durumlar üzerinde ölçülür ve policy'yi daha azına ihtiyaç duyar dağınıklaşır.
Bunu yalnızca aynı koşullar altında kaydedilen turlar arasında karşılaştırın. Tam argüman ve iki turdan fazla yaşayan bir değerlendirme seti inşa etme DAgger döngüsünü ölçme üzerindeki makalede. Tur bir gerçekçi bir fizibilite testidir: üstlenmenin donanımınız üzerinde çalıştığını, düzeltmelerin bayraklarıyla iniş olduğunu ve devam çalıştırmasının adlandırdığınız checkpoint'i yüklediğini kontrol etmediniz. Turlar iki ve üç oranın hareket etmeye başlaması gereken yerlerdir. Dörtte hareket etmemişse problem DAgger'dan hava akışı.
| Tur başına yazın | Neden daha sonra önemli |
|---|---|
| Sürülen Checkpoint | Bunu olmadan bir karışıma bir geliştirmeyi atfetmediniz |
| Üstlenme için kullanılan giriş modu | Klavye düzeltmeleri lider düzeltmelerinden daha kaba ve veri gösterir |
| Turlarının sayısı ve her biri nasıl ayıklandı | Turun önem taşıyacak kadar düzeltme olup olmadığı |
| Intervention rate çalıştırma başına ve ortalama | Döngünün ilerleme metriği |
| Kaynaklar başına tam episode seçimi | Turnu yeniden üretme veya geri alma tek yolu |
| Sıcak başlangıç veya taze eğitim | Bir hafta sonra bakacağınız kayıp eğrisini açıklar |
Henüz bir checkpoint'iniz yoksa
Döngü biri olmadan giriş noktası yok. Bir ilk veri seti kaydedin, bir ilk policy eğitin, çalıştırın - kayıt, eğitim ve policy çalıştırma bu yolu kapsar. Kayıt istemcisi indirme sayfasında, GPU katmanları ve saatlik oranlar fiyatlandırma sayfasında ve kullanılabilir bir bölüm SO-100 veri koleksiyonu kılavuzunda görülüyor. Düzeltmelerden önce gösterimleri doğru alın: DAgger onarım mekanizması ve neredeyse doğru olan bir şeyde çok daha iyi işler.
Lider kolu olmadan DAgger döngüsü çalıştırabilir miyim?▾
Evet. Üstlen'i bastığınızda klavye veya kaydırıcı giriş seçin: üstlenme hemen ve manueldir, hizalamak için ikinci kol yok. Klavye sunucu tarafından 2 derece eklem başına ve grieper için 4 derecede sabit sıkıştırılmış göreceli itme gönderir; kaydırıcılar mutlak bir hedef gönderir ve sunucu çağrı başına en fazla 6 derece doğru hareket ederken arayüz akışa devam eder. Aksiyon sütunu ve müdahale işareti lider modu ile aynıdır, bu yüzden düzeltmeleri veri sette ayırt edilemezdir.
Bir tur kaç düzeltme gerektiriyor?▾
Savunulabilir evrensel sayı yok, çerçeve sayısı episode sayısından daha fazla önemlidir. Çalışan kural düzeltmelerin karışımda kaybolmaması olur: 200 orijinal bölüm ve üç düzeltme bölümü ile hiçbir şey hareket etmeyecek. Aynı kurtarmanın üç tekrarı yerine birçok başlangıç konfigürasyonundan başarısız davranışı kapatan düzeltmelere aim.
Neden yalnızca düzeltmeleri eğitmek o kadar kötü bir fikirdir?▾
Çünkü düzeltmeler neredeyse tamamen görevin zor ortasıdır. Yaklaşım, hizalama ve geri çekilme kayıp, bu yüzden policy zaten iyi yaptığı şeyi kaybeder ve düzelttiğiniz bölümde geliştirme sağlar. Eski verileri tutmak ve ekleme mekanizmasıdır, isteğe bağlı ekstra değil.
Checkpoint'ten devam etmek önceki eğitim çalıştırması devamı mı?▾
Hayır. Yalnızca ağırlık checkpoint parametreleri geri yükler ve hiçbir şey: optimizer momentler, öğrenme oranı çizelgesi konumu ve veri sırası taze başlar. Bu sıcak başlangıç ve ilk kayıp dalgası beklenen yerine semptom değil. Bir hafta sonra eğriyi doğru okumanız için iki taraftan hangisini gerçekten yaptığınızı yazın.
Intervention rate düşmezse ne?▾
Turları eklemeyi durdurun. Düz oran düzeltmelerin düşündüğünüz şeyi öğretmediği anlamına gelir. Olağan nedenler hava akışı: kamera taşındı, düzeltmeler kaçınma verisi olabilmek için çok geç başlar, el değişimi çerçeveleri eğitim setinde veya görev gözlemlerden policy gerçekten alır belirlemez.
Bunların hiçbiri çözülen bir problem değildir ve hiçbiri tıklama değildir. Etkileşimli taklit öğrenmesi aktivdir araştırma alanı tam olarak sorulardan dolayı - ne zaman müdahale, insan ne ağırlıklı tuttu, ne kadar eski veri tutulacak - hiçbir yerleşik yanıtlara sahip değildir; Celemin ve diğerleri tarafından anket kalan açıktır. Döngünün ne var ölçülebilir yakınsama dikkatli çalıştırıldığında, birkaç yüz euro'ya mal olan donanım üzerinde. Kurulumu dondur, erken müdahale et, dürüst ayıkla, kasıtlı oluştur ve her seferinde intervention rate'i kaydet.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started