Human-gated DAgger, uçtan uca

Policy yanlış yaptığında devralın, sonra tam o düzeltmeyi eğitin.

Behavior Cloning ile eğitilmiş bir policy yalnızca demonstrasyonlarınızın ziyaret ettiği durumları bilir. DAgger bu boşluğu, policy'nin kendisinin ulaştığı durumlardan gelen verilerle kapatır. AY-Robots döngünün tamamını bir SO-100 üzerinde çalıştırır: bir checkpoint'i çalıştırın, çalışma sırasında devralın, düzeltilmiş epizotları saklayın, karışımı bir araya getirin ve az önce çalıştırdığınız checkpoint'ten eğitime devam edin.

  • HG-DAgger, human-gated
  • SO-100 / SO-101
  • ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
  • Tur başına müdahale oranı

Eğitilmiş bir policy neden hiç gösterilmemiş bir şeyi yapar

Behavior Cloning, kontrolü sıradan bir gözetimli öğrenme problemi gibi ele alır: gözlem girer, eklem hedefi çıkar, bir insanın kaydettiği karelere uydurulur. Bu yalnızca robot insanın ziyaret ettiği durumlarda kaldığı sürece geçerlidir, ama robot orada kalmaz. Kırk milisaniye erken kapanan bir gripper, küpü gösterilen konumundan iki milimetre kaydırır. Bir sonraki gözlem eğitim kümesinde bulunmayan bir gözlemdir, dolayısıyla oradaki aksiyon bir ekstrapolasyondur ve ondan sonraki durum daha da uzağa düşer. Eğitim dağılımı ile öğrenilen policy'nin fiilen ürettiği dağılım iki farklı şeydir ve epizot ilerledikçe ikincisi birincisinden gitgide uzaklaşır.

Ross, Gordon ve Bagnell bu indirgeme sorununu 2011'de tam olarak tarif etti ve zararı sayısallaştırdı: uzman dağılımı altında e olasılıkla hata yapan bir sınıflandırıcı, T adımlık bir ufukta kendi ürettiği dağılım altında T karesi çarpı e mertebesinde hata yapabilir, çünkü bir hata uzmanın hiç üretmediği gözlemler doğurur ve hatalar böylece birikir. Onların çözümü, bu sayfanın konu edindiği algoritmadır: mevcut policy'yi çalıştır, ziyaret ettiği durumlar için uzman etiketleri topla, bunları o ana kadar toplanmış her şeyle birleştir, yeniden eğit, tekrarla. Aynı türden daha fazla demonstrasyon yardımcı olmaz, çünkü aynı dağılımdan yeniden örnekler. Policy'nin ulaştığı durumlar üzerindeki etiketler işe yarar. Burada uygulanan varyant human-gated'dir (HG-DAgger, Kelly ve ark.): policy, bir kişi işlerin kötüye gittiğine karar edip devralana kadar kontrolü elinde tutar; böylece düzeltmeler yalnızca gerekli oldukları yerde üretilir ve kol, operatörün izin vermeyeceği bir duruma asla sürülmez.

  • Behavior Cloning yalnızca eğitildiği durum dağılımı üzerinde geçerlidir.
  • Hata kendi kendini büyütür: küçük bir sapma tanıdık olmayan bir durum üretir, o da daha büyük bir sapma üretir.
  • Çözüm daha fazla demonstrasyon değil, policy'nin kendisinin ulaştığı durumlar üzerindeki etiketlerdir.
  • Human-gated, müdahale anına bir otonomi skorunun değil operatörün karar vermesi demektir.

Hata neden birikir

Ufku sürükleyin. Behavior Cloning altında beklenen ek maliyet, adım sayısının yaklaşık karesiyle büyür, çünkü her hata demonstrasyonların hiç kapsamadığı durumlar üretir; bir biriktirme döngüsü ise büyümeyi doğrusala yakın tutar (Ross ve ark., 2011).

200
1.0 %
Behavior Cloning
400
DAgger
2.00
200×
Behavior Cloning ÷ DAgger
0.000100200300400050100150200Beklenen ek maliyet (sınır)
Görev ufku (adım)

Ross ve ark. (2011) çalışmasındaki sınırlardan türetilmiş açıklayıcı eğriler, robotunuzdan alınmış ölçümler değildir. Önemli olan eğrinin biçimidir, sayılar değil.

Tek bir DAgger turu, altı adım

Bu, platformun döngüyü fiilen nasıl çalıştırdığıdır, bir şema değil. Aşağıdaki her adım kokpitteki bir kontrole karşılık gelir.

Döngüyü adım adım izleyin

Aynı altı adım, teker teker, her birinde kolda ve veri kümesinde ne olduğuyla birlikte.

01

Policy'yi çalıştırın ve kaydedin

Eğittiğiniz bir checkpoint'e karşı bir inference çalıştırması başlatın. Çalıştırma, kendi görev metniyle birlikte gerçekleşirken kaydedilir; böylece kareler sonradan yalnızca izlenebilen bir video değil, kullanılabilir eğitim verisi olur.

1 / 6

Platformun sizden aldığı yük

Buradaki her madde, aksi halde kendinizin kurup bakımını yapması gereken bir döngü adımıdır.

Leader kol olmadan devralma

Çalıştırmanın başında klavye veya slider girişini seçin, tek bir laptop ile düzeltme yapabilirsiniz. Klavye dürtmeleri sunucu tarafında eklem başına iki dereceye, gripperda dört dereceye sabitlenir; slider hedefleri mutlaktır ve sunucu her çağrıda bunlara doğru en fazla altı derece hareket eder. Sınırlar arayüzde değil sunucuda uygulanır, bu yüzden takılı kalan bir tuş kolu savuramaz.

Teleoperasyon dokümanları

Kare başına işaretlenen müdahaleler

Kolu elinizde tuttuğunuz sürece kaydedilen her kare bir müdahale bayrağı taşır ve action sütunu komut verilen tam pozu içerir. Bayrak sütununu elle tutmanız ya da sonradan kare indisleriyle hizalamanız gerekmez.

LeRobot veri kümesi formatı

Ayıklama: düzeltme, değerlendirme veya çöp

Her çalıştırma, kaydetme kartında tek bir karar alır. Düzeltme çalıştırmaları bir sonraki eğitim turunu besler, değerlendirme çalıştırmaları eğitimin dışında kalır ve böylece temiz bir ölçüm olarak kalır, kötü çalıştırmalar ise karışımı sessizce zehirlemek yerine ortadan kalkar.

Session'lar ve epizotlar

Karışımı açıkça oluşturun

n. turun eğitim kümesini siz bir araya getirirsiniz: orijinal veri kümesi artı düzeltmeler, epizotlar kaynak başına seçilir. Otomatik karıştırma yok, gizli simülasyon verisi yok ve oluşturulan sonuç diğer her veri kümesi gibi davranır.

Veri kümeleri

Bir checkpoint'ten devam edin

Bir eğitim çalıştırmasını temel model yerine az önce çalıştırdığınız checkpoint'e yönlendirin, böylece her tur bir öncekinin bitirdiği yerden başlar. Yalnızca ağırlıkları ilklendirir; optimizer durumu geri yüklenmez, bu yüzden ilk turu bir fizibilite testi gibi ele almak isabetli olur.

Eğitim

Tur başına kiralanan GPU'lar

ACT ve SmolVLA bir 4090 üzerinde, Pi0 ile GR00T N1.5 veya N1.7 80 GB'lık bir A100 üzerinde. Bir tur başlatırsınız, pod ayağa kalkar, checkpoint'ler bucket'ınıza düşer ve turun sürdüğü saatler kadar ödeme yaparsınız.

GPU fiyatlandırması

Turlarınızı planlayın

Müdahale oranı, döngünün ilerleme metriğidir: düzeltilmiş kareler bölü çalıştırmanın kare sayısı. Nereden başladığınızı ve her turun size ne kazandırdığını ayarlayın, istediğiniz noktaya kaç tur gerektiğini görün.

30 %
25 %
3 000
TurMüdahale oranıDüzeltilmiş kareler
1
30.0%
900
2
22.5%
675
3
16.9%
506
4
12.7%
380
5
9.5%
285
6
7.1%
214
Σ2 960

Bir model, bir tahmin değil. Gerçek turlar düzensiz ilerler ve oranı kıpırdatmayan bir tur size hiçbir şey kazandırmamıştır; izlemeye değer sinyal tam olarak budur.

Döngüyü kendiniz kurmak ile burada çalıştırmak

Bunların hiçbiri elle yapılamayacak şeyler değil. Mesele, kaç akşamınızın turlara değil altyapıya gittiğidir; bir satır da var ki orada kendiniz yapmak açıkça daha iyi bir cevaptır.

Döngü adımıElle kurulumAY-Robots'ta
Çalıştırma sırasında devralmaBir leader kol ya da servo veri yolu üzerinde kendi kodunuz. Güvenli sınırlar dahil klavye ve slider devralmasını siz yazıp gerçek donanımda hata ayıklarsınız.Çalıştırma başlarken seçilen leader kol, klavye veya slider. Açı sınırları sunucuda yaşar.
Müdahaleleri işaretlemeBayrak sütununu siz eklersiniz, kare indisiyle hizalı tutarsınız ve kayıt formatı her değiştiğinde yeniden kontrol edersiniz.Devralma sırasında kaydedilen her kare otomatik olarak işaretlenir, action sütununda komut verilen pozla birlikte.
Çalıştırmaları sıralamaDizin kuralları ve shell script'leri. Devir anının çevresindeki donuk kareleri bulup ayıklamak size kalır.Kaydetme kartında çalıştırma başına tek bir karar. Devir kareleri raw dizininde kalır.
Karışık veri kümesi kurmaFormat sürümü başına merge script'leri. Epizot indislerini, metadata'yı ve video referanslarını tutarlı tutmak yorucu olan kısımdır.Kaynak başına epizot seçimiyle orijinal artı düzeltmelerden oluşturun; sonuç normal bir veri kümesidir.
Bir sonraki turu son policy'den başlatmaCheckpoint'i eğiticiye kendiniz bağlarsınız ve gerçek bir resume istiyorsanız optimizer durumunu da geri yükleyebilirsiniz.Temel checkpoint için tek bir alan. Yalnızca ağırlıklar: checkpoint'ten ilklendirir, optimizer resume'u değildir.
Eğitim döngüsü üzerinde kontrolTam kontrol. Kendi loss'unuz, kendi zaman çizelgeniz, kendi ablasyonlarınız, kendi ölçümleriniz, araya giren bir platform yok. Araştırma sorusu eğitim döngüsünün kendisiyse, bunu elle yapın.Sabit bir policy listesi ve formun sunduğu hiperparametrelerle sabit bir yol, keyfi kod değil.

Bunun dayandığı makaleler

Döngüyle tartışmaya girmeden önce bunları okuyun. Her bağlantı bir ödeme duvarına değil özet sayfasına gider.

  1. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning

    Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)

    Orijinal DAgger makalesi: hata birikimi problemini ortaya koyar, sade gözetimli yaklaşım için T-kare sınırını verir ve öğrenicinin kendisinin ziyaret ettiği durumlardan veri biriktirmeyi önerir.

  2. HG-DAgger: Interactive Imitation Learning with Human Experts

    Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019

    Human-gated varyant: uzman, policy'nin seçtiği durumlar hakkında sorgulanmak yerine kontrolü ne zaman alacağına kendisi karar verir; bu platformun uyguladığı mod tam olarak budur.

  3. EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning

    Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019

    Müdahaleleri kapılamanın başka bir yolu: öğrenicinin tek başına hareket edebileceği anlar için bir güven sinyali olarak ensemble anlaşmazlığı. Kararı bir insana bırakmakla karşılaştırmak için yararlı bir örnek.

  4. ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning

    Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021

    İnsan dikkatini kıt bir kaynak olarak ele alır ve yalnızca yeni ya da riskli durumlarda yardım ister; bir kişinin kolu bütün öğleden sonra denetlediği durumlarda doğru çerçeve budur.

  5. DART: Noise Injection for Robust Imitation Learning

    Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017

    Dürüst alternatif: policy'yi çevrimiçi düzeltmek yerine, uzman toparlanmayı gösterecek şekilde demonstrasyonları bozar. Müdahalelere karar vermeden önce bilinmesi gereken bir yaklaşım.

  6. Interactive Imitation Learning in Robotics: A Survey

    Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600

    Alanın haritası: hangi insan geri bildirimi biçimlerinin var olduğu, bunları hangi arayüzlerin taşıdığı ve DAgger tarzı müdahalenin bunlar arasında nerede durduğu.

  7. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

    Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705

    ACT makalesi. Action chunking, ucuz bir kolun bir taklit policy'si tarafından sürülebilmesinin nedenidir ve ACT, bir DAgger turunda en hızlı iterasyon yapılabilecek policy'dir.

  8. π0: A Vision-Language-Action Flow Model for General Robot Control

    Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164

    Önceden eğitilmiş bir vision-language modeli üzerine kurulu, flow matching tabanlı bir VLA ve burada fine-tune edebileceğiniz checkpoint'lerden biri; makale yeni becerilerin yalnızca temel modelden değil fine-tuning'den geldiğini açıkça belirtir.

İnsanların gerçekten sorduğu sorular

DAgger için leader kola ihtiyacım var mı?

Hayır. Çalıştırmayı başlatırken klavye veya slider girişini seçin, devralma ilk kareden itibaren manuel olur ve tarayıcıdan sürülür. Leader kol ince hareketler için daha keyiflidir ve kolun devretmeden önce kendini hizaladığı tek moddur, ama döngü onsuz da çalışır.

Kaç DAgger turuna ihtiyacım var?

Dürüst bir sabit sayı yok. Müdahale oranını izleyin: bir turdan diğerine düşmüyorsa, o tur size hiçbir şey kazandırmamıştır ve sorun genellikle tur sayısından çok görev kurulumunda, kameralarda ya da orijinal veri kümesindedir.

Bu gerçek DAgger mi yoksa daha gevşek bir şey mi?

Bu HG-DAgger, yani human-gated varyant. Klasik DAgger, policy'nin seçtiği durumlar hakkında uzmanı sorgular; bunların arasında hiçbir aklı başında operatörün gerçek bir kolu ulaştırmasına izin vermeyeceği durumlar da vardır. Burada bir kişi ne zaman müdahale edeceğine karar verir ve yalnızca o segmentler etikete dönüşür.

Yalnızca düzeltmeler üzerinde mi eğitim yapıyorum?

Hayır, ve bunu yapmamalısınız. Yalnızca düzeltmeler üzerinde eğitim, size sadece toparlanmayı bilen bir policy verir. Oluşturulan veri kümesi, her kaynaktan epizotların açıkça seçildiği, orijinal veri artı düzeltmelerdir.

Bir checkpoint'ten devam etmek eğitim çalıştırmasını sürdürür mü?

Ağırlıkları o checkpoint'ten ilklendirir. Optimizer durumu geri yüklenmez, dolayısıyla katı anlamda bir resume değildir. Pratikte öğrenilmiş davranışı tur boyunca taşıyan şey ağırlıklardır, ama ikisinden hangisini aldığınızı bilmekte fayda var.

Müdahale oranı nasıl hesaplanır?

Müdahale olarak işaretlenen kareler bölü çalıştırmanın toplam kare sayısı. Devralma durumunda gösterilir ve tur başına, çalıştırdığınız checkpoint ile eğittiğiniz karışımın yanına not edilmeye değer tek sayıdır.

Bu döngüyü hangi policy'lerle çalıştırabilirim?

ACT, SmolVLA, Pi0 ve GR00T N1.5 veya N1.7. Döngünün kendisi yalnızca veri kümesi ve checkpoint ürettiği için policy'den bağımsızdır; pratikteki fark, bir turun ne kadar sürdüğü ve hangi GPU'yu gerektirdiğidir.

Bunu bir robota sahip olmadan yapabilir miyim?

Pazar yerinden veri kümesi satın alarak ya da operatör görevlendirerek robot olmadan da kayıt ve eğitim yapabilirsiniz, ayrıca live sayfasında tarayıcıdan gerçek bir SO-100 sürebilirsiniz. Bir DAgger turu farklıdır: çalıştırma sırasında devralabileceğiniz bir kol gerektirir, dolayısıyla döngünün kendisi için kendi masanızda donanım isteyeceksiniz.

Drive a real arm

A real SO-100, live in the browser. No signup, no hardware needed.

İlk turunuzu bu hafta çalıştırın

İstemciyi kurun, elinizde zaten olan bir checkpoint'i çalıştırın ve kol küpün ötesine ilk uzandığında devralın. Bu tek çalıştırma, minyatür bir DAgger turudur: sonrasındaki her şey karışımı oluşturmak ve GPU saatlerini ödemektir.