Sabit bir değerlendirme kurulumu için tekrarlanan policy koşularında kullanılan türde bir tabletop robot çalışma alanı
DAggerDeğerlendirmeTaklit ÖğrenmeRobot VerisiSO-100

Bir DAgger Döngüsünü Ölçmek: Müdahale Hızı, Değerlendirme Protokolü ve Aralarındaki Tuzaklar

AY-Robots ResearchAugust 27, 202615 dakikalık okuma

Müdahale hızı - müdahale kareleri bölü koşunun kareleri - insan-geçitli DAgger döngüsünün sahip olduğu en ucuz dürüst ilerleme sinyalidir. Bu makale bunu, iki kişinin aynı değeri hesaplaması için tanımlar, nasıl günlüğe kaydedileceğini gösterir ve onu yanlış yönlendirebilecek dört yoldan geçer: operatör alışkanlığı, bölünen bir değerlendirme kurulumu, yalnızca düzeltmeler üzerine eğitim ve bir kişi Pazartesi günü Salı günü farklı şekilde düzeltme yapan.

Bir DAgger turu, içinde iken üretken hissettiriyor. Policy'yi yürütüyorsunüz, kavramayı kaçırdığında devralıyorsunuz, düzeltmeleri kaydediyorsunuz, yeniden eğitiyorsunuz ve sonraki koşu - yemin edebilirsiniz - biraz daha pürüzsüz görünüyor. İki tur sonra hiçbir şey değişip değişmediğini söyleyemiyorsunuz, çünkü "biraz daha pürüzsüz" bir nicelik değil.

Döngü bir tur başına bir sayıya ihtiyaç duyar ve insan-geçitli bir döngüde bu sayı neredeyse ücretsizdir: policy yerine kontrolde olduğunuz koşun kesri. Bu makale bunu, iki kişinin aynı değeri hesaplaması için tanımlar, günlüğe kaydeder, ortaya çıkan eğriyi okur ve onu tek başına durduğunda onu yanlış yönlendirebilecek dört yolu adlandırır. Teori için bu yazı şunları varsayar: DAgger açıklayıcısı ve insan-geçitli çeşit; pratik karşılığı bir SO-100 üzerinde DAgger döngüsü çalıştırmak.

Kısa versiyon

  • Müdahale hızı = müdahale kareleri / koşunun kareleri. Kareler, bölümler değil ve payda düzeltmek için harcadığınız kareleri içerir.
  • Üç tur boyunca düz bir eğri turlara hiçbir şey satın almadığı anlamına gelir - karışımı, kontrol noktasını veya görevi değiştirin, dördüncü bir turu toplamak yerine.
  • Düşen bir müdahale hızı yükselen bir başarı hızı değildir. Adım atma eşiğiniz güven büyüdükçe aşağı doğru bölünür.
  • Dondurulmuş bir değerlendirme protokolü olmadan - aynı başlangıç pozu, nesneler, kameralar, deneme sayısı - odayı ölçüyorsünüz.
  • Yalnızca düzeltmeler üzerine eğitim devlet dağılımını çarpıtır. IWR'nin cevabı: müdahale ve müdahale olmayan örnekleri eşit oranda çizin.

Neden bir turu her şeyden bir sayıya ihtiyaç duyuyor

DAgger bir dağıtım sorunu nedeniyle var ve dağıtım sorunları gözle görülmez. Ross ve Bagnell gösterdi ki taklit öğrenme sabit bir gösteri seti üzerinde bileşik hatalara ve zaman ufkunda ikinci dereceden büyüyen bir pişmanlık sınırına yol açar: öğrenen, gösteri yapan tarafından ziyaret edilen durumları terk ettiğinde, veriler içinde nasıl geri geleceğini söyleyen hiçbir şey yoktur. DAgger bunu yineleme yaparak düzeltir - policy çalıştırma, ziyaret ettiği durumları etiketleme, toplama, yeniden eğitim - Ross, Gordon ve Bagnell çerçevesi hiçbir pişmanlık online öğrenmesine indirgeme olarak.

Bu çerçevelemenin insanların atladığı bir sonucu var. Garanti iterasyonlar üzerinde policy sırasıyla ilgilidir, herhangi bir tek koşu değil. Sizin üçüncü turunuzun yardımcı olup olmadığı hakkında hiçbir şey söylemez. Bilmenin tek yolu her tekrarı ölçmektir. Kelly ve meslektaşları HG-DAgger'ı tanıttılar çünkü klasik DAgger, öğrenci hala kontrol altındayken uzman eylem etiketleri ister, bu makalede güvenliği azaltabileceğini ve insan uzmanlarla, algılanan aktüatör gecikmesi aracılığıyla etiket kalitesini bozma olasılığı yüksek olduğunu tartışır. HG-DAgger ayrıca bir model-belirsizlik-tabanlı risk metriği için bir güvenlik eşiği öğrenir ve DAgger ve davranışsal klonlama üzerinde iyileştirilmiş performansı bir sürüş görevinde bildirir. Müdahale sayıları yayınlamaz; bunları kendiniz üretirsiniz.Hızı tanımlamak böylece iki kişi aynı sayıyı alırTanım bir satırdır: müdahale kareleri bölü koşunun kareleri. Tüm zorluk, bir kare olarak ne sayılır ve ne sayılır olarak gizlidir.

Bölümler değil kareler

En az bir müdahaleye sahip bölümleri saymak işe yaramaz: on bölüm birer nudge ile ve on bölüm yüzde seksen uncu oranı içinde sürülen her ikisi de "10/10" verir. Kare sayısı bunları ayırır ve kaydın zaten sahip olduğu parçalılıktır -

LeRobot veri seti biçiminde

her zaman adımı bir satır olduğundan, müdahale bayrağı durum ve eylem yanında bir boole sütunudur. Burada devralma başladığı anda kare başına yazılır ve kontrol geri döndüğünde silinir.Payda düzeltmeleri içerirİki payda savunulabilir - koşunun toplam kareleri veya policy'nin bağımsız olarak sürüdüğü kareler - ve yüksek müdahale seviyelerinde kötü şekilde farklılık gösterir. 1000 karenin 400'ünü devralın ve ilk yüzde 40 veriyor, ikinci yüzde 67 veriyor. Bir turu ilk şekilde ölçülen diğerine karşı ölçmek, gerçek bir iyileşmenin nasıl ortadan kalktığıdır. Toplam kareleri alın ve serinin ortasında asla seçimi ziyaret etmeyin.

Teslim alma kareleri için ne olacağını bir kez belirleyin

Her zaman bir dikiş var. Kontrol geçtiğinde, bazı kareler hiçbir tarafa ait değildir: kol tutulur, lider hizalanır, kayıt dondurulur. Bu boru hattında bu teslim alma kareleri ham akışta kalır ve asla küratör

bölüm

- ne policy davranışı ne de eğitim için değecek bir düzeltme. Dikiş her turda aynı şekilde sayın: 30 Hz'de, altı devralma ve iki saniye dikiş her biri 360 karedir, bir yüzde puan hareket etmek için yeterlidir.Karşılaştırılabilirliği kıran üç kararKareler veya bölümler; toplam koşu veya yalnızca özerk; teslim alma kareleri içinde veya dışında. Turlar arasında sessizce değiştirilmiş herhangi biri eğriyi anlamsız hale getirir. Üçünü yazın.

Sayının oturumu aşması için günlüğe kaydedilmesi

Çalışan bir işlemin durum panelindeki bir metrik bir okumadır: yeniden başlatmada kaybolur ve çizilemez. Tur başına bir satır tüm seriyi kapsar - sürülen

kontrol noktası

dahil olmak üzere, çünkü bu her tur değişir ve karıştırılması sonrasını geçersiz kılar.Tur başına bir satır. Paydayı ve teslim alma kuralını sayı yanında kaydetmek alan adlarından daha önemlidir.İki alan ağırlık taşır.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
train_mix

sonraki eğitim işine ne yedirdiğinizdir; onsuz hiçbir şey atfedilemez. eval_protocol çalıştırdığınız sabit testi adlandırır ve boş bırakılan alandır. Ay-robots pit panelinde devralma durumu, çalışan oturum için müdahale kare sayısını bildirir, bu nedenle günlüğe kaydetme enstrümantasyon yerine transkripsiyon olur; veri seti belgelendirmesi kare başına sütunların nereye iniş yaptığını kapsar.Training yapılandırması matrisi policies, veri setleri ve kontrol noktalarını yan yana gösteriyorHer tur kontrol noktası ve veri seti karışımını değiştirir. Kombinasyonu kaydedilmeyen bir sayı atfedilemez.

Eğriyi okumak: üç tur, bir kararı
Üç tur minimum bir okuma için gereklidir, çünkü iki nokta her zaman bir çizgidir. Aşağıdaki tablo yer tutucu sayılarla bir muhasebe şablonudur, herhangi bir koşudan ölçümler değildir. Sabit bir testte başarının artmasıyla eşleştirilen monoton bir düşüş arıyorsunuz.

Tur

Sürülen kontrol noktası

KarelerMüdahale kareleriHızBaşarılar (20'den)0 (temel)temel policy
5 9001 38023,4 %71tur 0 karışımından
5 61098017,5 %102tur 1 karışımından
5 41261111,3 %113tur 2 karışımından
5 38059811,1 %12Tur bir ve iki iş yapıyor. Üç tur değil: yüzde 11,3 yüzde 11,1 karşı fiziksel bir kol üzerinde ölçülen herhangi bir şeyin tur-tur değişimi içinde. Dördüncü aynı düzeltmelerin turu bir öğleden sonra hiçbir şey için harcıyor. Düz segment bir şeyi yapısal olarak değiştirme söyleyor.Kalan arızalar teleoperation tarafından düzeltilmez - nesne ulaş dışı, gripper geometrisi, bir eklem sınırında. Düzeltme verisi kinematik duvarı düzeltmez.

Düzeltmeler temel veri seti karşı çok az, gradyanı taşımak için ve hiçbir şey ağırlıklandırır.

  • Düzeltmeler birbirini çelişir, bu nedenle policy iki strateji ortalaması ve aralarında iniş yap.
  • Arıza akışta yukarı: bir kamera taşındı, aydınlatma değişti, bilek görünümü artık eğitim ile eşleşmiyor.
  • Görev bu policy sınıfında bu donanım üzerinde tavana ulaşıyor ve sonraki adım daha fazla temel veri.
  • Son ikisi döngünün arızaları değil. Sirius-Fleet içinde insan ihtiyacının azalması tasarlanan sonuçtur: robot otonomi iyileştikçe, anomali yordayıcıları tahmin kriterleri uyarlar, insan müdahalesi için daha az isteğe yol açar ve kademeli olarak zamanla insan iş yükünü azaltır. Orada kriter amaçlı uyarlar. Manuel bir döngüde sizin de uyarlar, sessizce - yani tavana ulaşan düz bir hız operatörün fark etmeyi durdurduğu için düz görünüyor. Hangi sonraki sorun.
  • Tuzak 1: düşen bir hız yükselen bir başarı hızı değil

Müdahale hızı tam olarak bir şey ölçüyor: koşunun ne kadarını sahiplenmeye karar veriyorsunuz. Bu karar sizin, gerçek zamanlı yapılan ve hareket ediyor. Tur sıfırda ilk kötü yaklaşım açısında devralıyorsunuz; tur üç de policy'nin bir düzineden biri kurtulduğunu izlediniz ve bunu denemeyi bırakıyorsunuz. Eşiğiniz taşındı;

policy

olmayabilir. Hız her iki yönde de düşüyor.İnsan güveni en azından edebiyatta modellenen bir nicelik olarak sabit bir sabit olmaktan ziyade. Sirius, insan güvenini yaklaşık olarak eğitim örneklerini yeniden ağırlıklandırır ve policy'yi ağırlıklı davranışsal klonlama ile optimize eder, benzer davranış klonlamaya göre durum sanatından itibaryen, gerçek donanımda yüzde 27 simülasyonda yüzde 8 artış rapor eder, iki kat hızlı yakınsaklık hızında başarı. Bu güveni veriye bir ağırlık olarak tedavi eder. Tur sıfırdan tur üç arasında başınızdaki eşiği düzeltmez.Bölünemeyin kaldıramazsınız, bu nedenle hızı eşiğinize dokunmasını yapamayacak bir şeyle eşleştirin: müdahale etmediğiniz sabit bir deneme seti, tur önce yazılmış bir kriter karşı puanlandı. Eşleştirilmiş başarı hızı durgun kalırken düşen bir hız alışkanlığın imzası - yakalayacak değer, çünkü döngü içinden ilerleme gibi hissettiriyor.

Müdahale hızı

Sabit protokol üzerinde başarı hızı

En olası okumadüşüyoryükseliyor
Tur çalıştı. Devam et.düşüyordüz
Eşiğiniz bölündü veya düzeltmeler arızaları kaldırmadan çabayı kaldırdı.düşüyordüşüyor
Düzeltmeler policy bozuyor. Karışım ve iç tutarlılığını kontrol et.düzdüz
Tur hiçbir şey satın almadı. Daha fazla toplamadan önce karışım, kontrol noktası veya görevi değiştir.yükseliyordüşüyor
Regresyon. Eğitim karışımı, değiştirilmiş kamera veya kontrol noktası karışımından şüphe et, yöntem şüphelenilmesinden önce.Tuzak 2: sabit bir protokol olmadan, odayı ölçüyorsünüzGerçek robot değerlendirmesi pahalı ve tekrarlanması zor. SIMPLER yazarları, böyle politikaların gerçek dünya değerlendirmesinin ölçeklenebilir olmadığını ve politikalar görev spektrumunu genişledikçe kötüleşme olasılığı olan yeniden üretilebilirlik zorlukları ile karşı karşıya olduğu gözlemi ile simüle edilmiş değerlendirmeyi motive ediyor. RoboArena diğer taraftan bunu saldırı yapıyor, DROID platformunda yedi akademik kurumda değerlendiriciler tarafından çalıştırılan yedi generalci policy arasında 600'den fazla ikili gerçek robot değerlendirme bölümleri ile. Değerlendiriciler kendi görevlerini ve ortamlarını seçerler, ancak politika çiftlerini çift-körü yargılamalıdırlar; kağıt bu kitle kaynaklı sıralama merkezi olmayan, merkezileştirilmiş değerlendirmeden daha doğru olarak generalci policy performansını izler dilini raporlar.

Bir çalışma alanında 600 eşleştirilmiş bölüm çalıştırmayacaksınız

SO-100

de. Yapabileceğiniz şey, kontrolü altında olduğunuz varyansı kaldırmaktır - genellikle atlanacak kadar sıkıcı bir liste.BoyutBunu dondur

Yapmazsan ne bölünürBaşlangıç pozuHer deneme öncesi sürülen yazılı bir ev konumu
Yörünge dağıtım dışında başlıyorNesnelerBantlı işaretler ve değerlendirme için ayrılan aynı fiziksel nesneler
Daha 'iyi' bir policy aslında daha yakın bir nesnedirKameralar ve ışıkAynı montajlar, endeksler, pozlama; jaluziler kapalı; kurulumu fotoğrafla
Sadece kamera endekslerinin karşılaştırılması sonucu bastırabilenDenemeler ve durdurma kuralıSabit n, sabit zaman aşımı, kriter tur öncesi yazıldı
Hoc kriterleri neredeyse kaçakları istediğin şey çevirOperatör davranışıDeğerlendirme denemeleri sırasında müdahale yok
Değerlendirme başka bir düzeltme oturumuna dönerO zaman, bir çalışma alanının gücünde deneme sayılarında amansız aritmetik. Normal yaklaşma altında, 20 deneme üzerinde yüzde 60 başarısı yakın yüzde 11 puan standart hatasını taşır - 20 üzerinde 0,6 kez 0,4 karenin karekökü - ve iki deneme arasındaki fark yaklaşık 15 puan taşır. 60'dan yüzde 70'e sıçrama bu nedenle hiçbir şey olmadığı ile tutarlıdır. Elli deneme, kare sayısını kabaca 7 puana getirir ve öğleden sonra maliyeti.Bu asimetri müdahale hızı için argümandır: yirmi ikili sonuç yerine binlerce kare üzerinde hesaplanan, daha erken ve daha sorunsuz hareket eder. Uyarı, bir bölüm içindeki karelerin yoğun şekilde ilişkili olmasıdır - bir kötü kavrama yüzüne ard arda müdahale kareleri verir - bu nedenle etkili örnek boyutu devralma sayısına daha yakındır. Hızı erken gösterge ve başarı hızını yavaş zemin gerçeği olarak tedavi et.

Değerlendirme bölümleri eğitim havuzu dışında tutun

Değerlendirme bölümleri hiçbir zaman oluşturulmuş eğitim veri setine girmez - aksi takdirde tur n+1 eğitildiği veriye karşı puanlandı ve eğri ezber ölçüyor.

Tuzak 3: yalnızca düzeltmeler üzerine eğitim policy bükülüyor

Düzeltmeler ilgi çekici verilerdir, bu nedenle içgüdü bunları eğitmektir. Yapma. Bunlar inşaat tarafından policy'nin zaten başarısız olduğu ve koşunun geri kalanında hiçbir şey söyleyen dar devlet alanı diliminden gelir. O dilim yalnızca ince ayar yapın ve temiz bir yaklaşım yapmayı unutmuş bir botched yaklaşımdan iyileşmede iyi bir policy alırsınız.

Mandlekar ve meslektaşları uzaktan müdahale sistemini buna etrafında inşa etti. Çerçeve: manipülasyon görevleri bottleneck bölgelerini içerir kesin eylemler dizisini gerektiren - bir kahve makinesine bir pod eklemek örnek - küçük sapmaların gösteriler asla kapsamadığı devletlere yol açtığı. Algoritmaları iteratif olarak yeni veriye eğitim yapıyor policy bu darboğazları geçmeyi öğrenmek için ve müdahale verisi üzerine eğitim ajanları müdahale olmayan gösteri yapıcılardan eşdeğer örnek sayısı üzerine eğitim yapan ajanları yencek rapor ediyor.

Yalnızca düzeltmeler ince ayarı karşı oluşturulmuş karışım

Yalnızca düzeltmeler size ne verir

Ne maksadı
Hızlı: birkaç bölüm üzerinde kısa koşu tekrarlamak için yeterince ucuz
  • Düzeltme stili öğrenilebilir olup olmadığını test etmek için ucuz
  • Ince ayar dağılımı artık görev dağılımına benzemiyor
  • Nominal davranış tek bir tur içinde görülebilir şekilde kötüleşebilir
Hedefli: gradyan umursamadığınız durumlar tarafından hakimiyet
  • Hız başarı ile birlikte düşebilir - temiz bölümler kurtarmaları için alışveriş
  • Karışım oranı bir hiperparameter ve yazılı olmak istiyor. Sonraki veri seti oluşturmak karar verilir nerede: orijinal gösteri artı düzeltme seti, kaynak başına bölüm seçimi açık yerine sessizce kullanılabilir ne çeker kural. Orada pit de bir bileşik adım ve sonuç sıradan bir veri seti -
  • eğitim belgelendirmesi

. Hiçbir araç sizin için hangi oranı hangi eğriyi ürettiyini kaydetmek yapmaz.Tuzak 4: insan tutarlı bir uzman değilDAgger teorisi bir uzman varsayar. Teknik anlamda bir değilsiniz: düzeltmeleriniz eylemler üzerinde sabit bir koşullu dağılım örnekleri değildir. ACT yazarları bunu ince manipülasyonda engeller listelenirken adlandırır - hatalar zamanla bileşir ve insan gösterileri durağan olmayabilir. Sistem hala simülasyonda yüzde 80 yüzde 90 başarısını on dakika gösteriden altı gerçek görevde ulaşıyor, bu nedenle sorun izlenebilir, yok değil.

Robomimic çalışması noktayı veri tarafından yapar. Beş simüle edilmiş ve üç gerçek dünya çok aşamalı görev üzerinde altı çevrimdışı algoritması arasında, dersleri tasarım seçimlerine duyarlılık, gösteri kalitesine bağımlılık ve - en çok acısı burada - durma kriterlerinden kaynaklanan değişkenlik içerir, çünkü eğitim ve değerlendirme hedefleri farklılık gösterir. En düşük kayıp kontrol noktası en yüksek başarı hızına sahip olması güvenilir değildir.

Bunun donanım versiyonu vardır: giriş modu düzeltmeyi şekiller.

lider takipçi

kuruluşu insan tarafından hızlandırılan sürekli yörüngeler üretir. Klavye nudge'leri sunucu tarafından sert tutturulmuş - kol eklemleri üzerinde iki derece per çağrısı, gripper üzerinde dört - aynı amaç küçük adımlar merdiveni olarak gelir. Kaydırıcılar mutlak hedefler gönderir ve sunucu onlara doğru çağrı başına en çok altı derece hareket ediyor. Üç mod, üç eylem dağılımı; üçünü de bir düzeltme seti içine karıştırmak ve sonra yaklaşmanın neden titrek olduğunu merak etmek kendi kendine yapılan. teleoperation belgelendirmesi her modun gönderdiğini kapsar.Müdahaleleri tartılandırmak: IWR ve sonrasında ne geldiDüzeltmeler değerlerin azınlığı ise, ilkeli fix ağırlık yerine münhasırlık. Müdahale Ağırlıklı Regresyon referans uygulamadır: veriler müdahale ve müdahale olmayan örneklere bölünür ve iki bölüm eğitim sırasında eşit oranda örneğe alınır. Karelerin yüzde beş olan bir düzeltme seti sonra gradyanın yarısında katkı verir, nominal davranış dağılımdan kaybolmadan.

Eşit oran başlangıç noktası, yasa değil. Sirius onu yaklaşık insan güveni ile sürekli bir ağırlıkla ikili bölümü değiştirerek genelleştirir; Sirius-Fleet karar akışta yukarı hareket ediyor, bir görseli bir dünya modeli ve anomali yordayıcıları bir insanın hiç ne zaman sorulmuş karar vermek için kullanarak. Ortak dişli: müdahale bayrağı eğitim sinyali, sadece muhasebe sütunu değil.

Yöntem

Kim karar verir ne zaman insan hareket ediyor

Müdahale verisi nasıl kullanıldığıBildirilen sonuçDAgger (2011)Sabit jadwal; uzman ziyaret edilen devletleri etiketler
Bir büyüyen veri seti, ağırlıksızHiçbir pişmanlık online öğrenmeye indirgeme olarak çerçeveliHG-DAgger (2019)İnsan, gerçek sistem kontrolü geçit
Toplandı; artı bir model belirsizliğine öğrenilmiş bir güvenlik eşiğiSürüş üzerinde DAgger ve BC'den daha iyi; müdahale sayıları verilmeyenIWR (2020)İnsan, uzaktan teleoperation via
Müdahale ve müdahale olmayan örnekleri eşit oranda alınanMüdahale olmayan gösteri yapıcılar eşdeğer örnek sayısında yenerSirius (2022)İnsan, dağıtım sırasında
Ağırlıklı BC, yaklaşık insan güveninden ağırlıklarSimülasyonda yüzde 8 kazanç, gerçek donanımda yüzde 27; 2x daha hızlı yakınsaklıkThriftyDAgger (2021)Sistem, yenilik ve risk geçidi
Denetim bütçesi altında etkileşimli koleksiyonKullanıcı çalışması (N=10): sonraki en iyi yöntem daha yüksek insan ve yüzde 80 daha yüksek robot performansından yüzde 58Fleet-DAgger (2022)Sistem, bir filo arasında dikkat tahsisi
İnsan çabası dönüş tarafından puanlandığı filo öğrenmeTaban çizgileri daha yüksek 8,8x ROHE'a kadarSirius-Fleet (2024)Kendi uyarlanabilir kriterleri ile anomali yordayıcılar
Görsel dünya modeli ile çok görev öğrenmeOtonomi iyileştikçe daha az müdahale istekleriRobot politikalarını ölçülen puan tarafından karşılaştıran lider panosuPolicy'leri birbirlerine karşı sıralamak, her giriş aynı protokol çalıştırıldığında anlam kazanır. Bu kendi üç tur için de geçerli.
Hız yanında günlüğe kaydedilecek dört metrik
Tur başına devrihi. Yirmi kısa düzeltme ve biri uzun olanı benzer hızlar veriyor ve farklı politikaları anlatıyor - biri sıçrayan, biri tek bir kör nokta ile.

Ortalama müdahale uzunluğu. Düşen bir sayı ile yükselen uzunluk kalan arızaların zor olanlar olması anlamına geliyor, hangi geç ilerleme gibi görünüyor.

  • İlk müdahaleye zaman. İlk yardıma ihtiyaç duymadan daha ileri bir policy geçiş olan toplam hızı düz bile iyileştiriyor.
  • Müdahale kümeleri nerede. Normalleştirilmiş bölüm ilerlemesine göre bayrağı kutular; turlar arasında istikrarlı bir tepe bir bottleneck işaret ediyor.
  • Gerçekte çalışabilileceğin bir tur protokolü
  • Ölçülen tur altı adım ve bir günlük satır üretir. İlk dört döngü; son iki bunu bir ölçüm yapıyor.

Sıfır tur öncesi değerlendirme protokolü dondur

Ev pozu, nesne yerleşim, kamera, deneme sayısı, zaman aşımı ve başarı kriteri başlangıç yaz. Tabloyu fotoğrafla. Belge değişmesi gereken, seriler yeniden başlar.

  1. 1
    Taban çizgisini ölçün

    Protokol hiçbir müdahaleler ile çalıştırın ve başarıları kaydet; sonra bir müdahale etkinleştirilmiş enstrümantasyonlu bir oturum çalıştırın ve hızı kaydet. Bu iki sayı tur sıfır.

  2. 2
    Düzeltmeleri bir tutarlı stil içinde topla

    Tur başına bir giriş modu, mümkün kılabilir bir operatör. Dışarı bir kriter üzerinde al - 'gripper yaklaşımda iki santimetreden daha fazla' - ve turda tutun.

  3. 3
    Aynı gün her bölümü sınıflandır

    Düzeltme, değerlendirme veya at. Belirsiz bölümler kaydedilmemiş, daha fazla verisi yardımcı olması teorisinde atılır - düzeltme hangi kendin fumbled daha kötüdür hiçbir bölüm.

  4. 4
    Karışım açıkça oluştur

    Orijinal gösterim artı düzeltmeler, kaynak başına bölüm seçimi. Temel sayı, düzeltme sayısı ve herhangi bir tartılama kaydet - hangi oran hangi eğriyi ürettiğini üç hafta isteyecek alandır.

  5. 5
    Kontrol noktasından devam et, sonra yeniden ölçün

    Önceki kontrol noktasından oluşturulmuş veri seti eğit tabanı modeli yerine, dondurulmuş protokol artı bir enstrümantasyonlu oturum çalıştırın, satırı ekleyin ve önceki iki turla karşılaştırın.

  6. 6
    İki sınır zayıf tur nasıl okuyorsunuz değiştir. Kontrol noktasından devam etmek ağırlıkları başlatır - bir optimizer özgeçmiş değil, bu nedenle zamanlama taze başlıyor ve yakınsanmış bir kontrol noktasından kısa bir koşu çok az hareket edebilir. Ve takeover en başında lider-hizala hareket, donanımda en az mil var zincir herhangi bir şey; düzeltmeler bir tuhaf geçici başlamışsa, karışımı suçlamadan önce orada bakın.

    Ölçülen döngü, zaten kablolu

ay-robots bu altı adımı ürün özellikleri olarak uygular: bir lider kol, klavye veya kaydırıcılardan tur ortasında devral, müdahale kareleri otomatik olarak işaretli; her bölümü düzeltme, değerlendirme veya atla sınıflandır; sonraki veri setini orijinal gösterim artı düzeltmelerden oluştur, kaynak başına bölüm seçimi açık; ve sonraki eğitim çalışmasını temel model yerine önceki kontrol noktasından başlat.

Yapı vague bir izlenim bir sütun çevir argümanı yapabilir. Alternatif daha iyi bir metrik değil; eğri tur üç sonra toplamak durdur söyler üç hafta düzeltme toplama. Araştırma edebiyat etkileşimli taklit öğrenme tanımlar insan geri bildirim aralıklı verilen robot yürütme sırasında, davranış çevrimiçi iyileştirilmesine izin verilmek; aile geniş ve hiçbir düzenlemesi tur başına sayı olmadan çalışır. Ayrıca görmek

SO-100 taklit öğrenme kılavuzu

temel veri seti için karşı karışımı, bir policy çalıştırmak çıkarım tarafı için ve DAgger döngü sayfası uygulanır boru hattı için.DAgger döngü sayfası uygulanır boru hattı için.

Müdahale hızı sadece biri eksi başarı hızı mı?

Hayır. Hız ölçer ne kadar bir koşu devralırsın; başarı hızı ölçer görev siz olmadan yapılıp yapılmadığı. Koşu başarı yüzde 30 müdahale hızı ve hiçbir müdahaleler ile bir koşu tamamen başarısız yüzde. Ayrıca gürültü farklı: hızı pürüzsüz koreli binlerce kare üzerinde hareket, başarı hızı bir avuç ikili sonuç arasında sıçra. Her ikisiniz de günlüğe kaydettirin.

Başarı hızı birşey anlamına gelmesi için kaç değerlendirme deneme gerekliyor?

Makul hissettirenden daha fazla. Normal yaklaşma altında, 20 deneme bir gerçek yüzde 60 başarısında standart hata yakın yüzde 11 noktası taşıyabilir, bu nedenle turlar arasında 10 noktalı hareket gürültüden ayırt edilmez; 50 deneme kabaca 7 rakam getir. Gücünüz 50 gücü, turlar boyunca deneme sayısını tutarlı tutun ve küçük hareketleri ezber kapanmamış olarak tedavi edin.

Gösteri karşı düzeltmeler hangi karışım oranı başlayabilirim?

Belgeli başlangıç noktası IWR: veri müdahale ve müdahale olmayan örneklerine bölün ve eşit oranda çekin, bu nedenle düzeltmeler gradient yarısı katkı çerçevelerin kesri ne kadar küçükse. Kurulumu ağırlık örneklemesi yapamaz, oluşturma veri seti ve kayıt oranı yaklaştırmak için bölüm sayılarını. Yalnızca düzeltmeler eğitim, hariç tutmak için seçeneği.

Bir tur sonra müdahale hızı gitti. Tur atılıp mı?

Mutlaka değil, ama sıkıcı açıklamalarını ilk kontrol: devralma kontrol noktası eğitim kontrol noktası eşleş, kamera endeksi veya monte değiştirildi, nesne yerleşimi bölündü, düzeltme stil tutarlı. Dördünü temiz ve eşleştirilmiş başarı hızı da düştü, karışım şüphe et - düzeltmelere karşı çok temel gösterim, veya birbirlerini çelişen düzeltmeler. Gerçek regresyon günlüğe, bin değil.

Dondurulmuş değerlendirme protokolü atla ve sadece müdahale hızı izle?

Yalnızca iyileştirilmeden alışkanlığı söyleyemez kabul et. Hız bağlı bir gerçek zamanlı kendi eşik adım atma, ve eşik düşüyor policy'nin hileçlikleri alışkınsın açıldı. Dondurulmuş protokol ölçümün kısmı eşiğinize ulaşamaz - bantlı işaretler, yazılı bir ev pozu, sabit deneme sayısı, kriter tur öncesi karar. Seriye değişmeden kalması lazım.

Depo not defter yaz günlüğü tutun: turlar ayrı günler, donanım yeniden yapılmış ve Ekim kağıdı oku kişi hiç Ağustos hafızası olmayan. belgelendirme SSS sol operasyonel detayları kapsar.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started