
Kadar campur tangan - bingkai campur tangan dibahagi dengan bingkai larian - ialah isyarat kemajuan jujur yang paling murah yang dimiliki oleh gelung DAgger berpintu manusia. Artikel ini mentakrifkannya supaya dua orang mengira nilai yang sama, menunjukkan cara mencatatnya, dan membincangkan empat cara ia boleh mengelirukan anda: pembiasaan operator, persediaan penilaian yang menghanyut, latihan hanya pada pembetulan, dan manusia yang membetulkan secara berbeza pada hari Selasa berbanding hari Isnin.
Pusingan DAgger terasa produktif semasa anda melakukannya. Anda memandu polisi, mengambil alih apabila ia tersasar semasa menggenggam, menyimpan pembetulan, melatih semula, dan larian seterusnya kelihatan - anda akan bersumpah - sedikit lebih licin. Dua pusingan kemudian anda tidak dapat mengatakan sama ada apa-apa telah berubah, kerana "sedikit lebih licin" bukanlah satu kuantiti.
Gelung ini memerlukan satu nombor bagi setiap pusingan, dan dalam gelung berpintu manusia, nombor itu hampir percuma: iaitu pecahan larian semasa anda memegang kawalan dan bukannya polisi. Artikel ini mentakrifkannya supaya dua orang mengira nilai yang sama, mencatatnya, membaca lengkung yang terhasil, dan menamakan empat cara ia mengelirukan anda apabila ia berdiri sendiri. Untuk teori yang diandaikan oleh artikel ini, lihat penerangan DAgger dan varian berpintu manusia; rakan sepadan praktikalnya ialah menjalankan gelung DAgger pada SO-100.
Versi ringkas
- •Kadar campur tangan = bingkai campur tangan / bingkai larian. Bingkai, bukan episod, dan penyebut merangkumi bingkai yang digunakan untuk membetulkan.
- •Lengkung yang mendatar sepanjang tiga pusingan bermaksud pusingan itu tidak membawa sebarang faedah - ubah campuran, checkpoint atau tugas berbanding mengumpul pusingan keempat.
- •Kadar campur tangan yang menurun bukan bermakna kadar kejayaan yang meningkat. Ambang anda untuk campur tangan menghanyut ke bawah apabila kepercayaan meningkat.
- •Tanpa protokol penilaian yang dibekukan - postur mula, objek, kamera, bilangan percubaan yang sama - anda sebenarnya mengukur bilik itu sendiri.
- •Melatih hanya pada pembetulan memesongkan taburan keadaan. Jawapan IWR: ambil sampel campur tangan dan bukan-campur-tangan dalam nisbah yang sama.
Mengapa satu pusingan memerlukan nombor sama sekali
DAgger wujud kerana masalah taburan, dan masalah taburan tidak kelihatan oleh mata kasar. Ross dan Bagnell menunjukkan bahawa pembelajaran peniruan pada set demonstrasi tetap membawa kepada ralat yang berganda dan sempadan regret yang berkembang secara kuadratik mengikut ufuk masa: sebaik sahaja pembelajar meninggalkan keadaan yang dilawati oleh penunjuk cara, tiada apa-apa dalam data itu memberitahunya cara untuk kembali. DAgger membetulkan ini melalui lelaran - jalankan polisi, labelkan keadaan yang dilawatinya, gabungkan, latih semula - yang dirumuskan oleh Ross, Gordon dan Bagnell sebagai satu pengurangan kepada pembelajaran dalam talian tanpa regret.
Rumusan ini mempunyai satu akibat yang sering diabaikan orang. Jaminan itu berkaitan dengan turutan polisi merentasi lelaran, bukan mana-mana larian tunggal. Ia tidak menyatakan apa-apa tentang sama ada anda pada pusingan ketiga membantu. Satu-satunya cara untuk mengetahuinya ialah dengan mengukur setiap lelaran. Kelly dan rakan-rakan memperkenalkan HG-DAgger kerana DAgger klasik meminta pakar memberi label tindakan semasa novis masih mengawal, yang menurut kertas kerja itu boleh menjejaskan keselamatan dan, dengan pakar manusia, berkemungkinan merosakkan kualiti label akibat lag aktuator yang dirasakan. HG-DAgger juga mempelajari ambang keselamatan untuk metrik risiko berasaskan ketidakpastian model dan melaporkan prestasi yang lebih baik berbanding DAgger dan behavioural cloning pada tugas memandu. Ia tidak menerbitkan sebarang kiraan campur tangan; itu anda hasilkan sendiri.
Mentakrifkan kadar itu supaya dua orang mendapat nombor yang sama
Takrifannya satu baris sahaja: bingkai campur tangan dibahagi dengan bingkai larian. Semua kerumitan tersembunyi dalam apa yang dikira sebagai satu bingkai dan apa yang dikira sebagai satu larian.
Bingkai, bukan episod
Mengira episod yang mempunyai sekurang-kurangnya satu campur tangan tidak berguna: sepuluh episod dengan satu senggatan kecil setiap satu dan sepuluh episod yang anda pandu lapan puluh peratus daripadanya kedua-duanya memberikan "10/10". Kiraan bingkai membezakan kedua-duanya, dan itulah tahap kehalusan yang sudah ada dalam rakaman - dalam format set data LeRobot setiap langkah masa ialah satu baris, jadi penanda campur tangan ialah satu lajur boolean di sebelah state dan action. Di sini ia ditulis bagi setiap bingkai sebaik sahaja pengambilalihan bermula dan dikosongkan apabila kawalan dikembalikan.
Penyebut merangkumi pembetulan
Dua penyebut boleh dipertahankan - jumlah bingkai larian, atau bingkai yang dipandu polisi secara autonomi - dan kedua-duanya berbeza dengan ketara pada tahap campur tangan yang tinggi. Ambil alih untuk 400 daripada 1000 bingkai dan yang pertama memberikan 40 peratus, yang kedua 67 peratus. Membandingkan satu pusingan yang diukur mengikut cara pertama dengan pusingan seterusnya yang diukur mengikut cara kedua adalah cara peningkatan sebenar hilang begitu sahaja. Gunakan jumlah bingkai dan jangan sekali-kali menukar pilihan itu di tengah-tengah siri.
Tentukan sekali sahaja apa yang berlaku kepada bingkai serah tangan
Selalu ada satu jahitan. Apabila kawalan berpindah tangan, sesetengah bingkai tidak tergolong pada mana-mana pihak: lengan sedang ditahan, leader sedang menjajarkan diri, rakaman dibekukan. Dalam saluran paip ini, bingkai serah tangan itu kekal dalam aliran mentah dan tidak pernah memasuki episod yang telah dikurasi - ia bukan tingkah laku polisi mahupun pembetulan yang berbaloi untuk dilatih. Kira jahitan itu dengan cara yang sama pada setiap pusingan: pada 30 Hz, enam pengambilalihan dengan jahitan dua saat setiap satu bersamaan 360 bingkai, cukup untuk menggerakkan satu mata peratusan.
Bingkai atau episod; jumlah larian atau autonomi sahaja; bingkai serah tangan dimasukkan atau tidak. Mana-mana satu daripada ketiga-tiga ini yang berubah secara senyap antara pusingan menjadikan lengkung itu tidak bermakna. Catatkan ketiga-tiganya.
Mencatatnya supaya nombor itu bertahan melangkaui sesi
Metrik dalam panel status proses yang sedang berjalan hanyalah paparan: ia hilang apabila dimulakan semula dan tidak boleh diplot. Satu baris tambah-sahaja bagi setiap larian merangkumi keseluruhan siri - termasuk checkpoint yang anda gunakan, kerana ia berubah setiap pusingan dan mengelirukannya akan menjadikan segala yang berikut tidak sah.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Dua medan membawa bobot yang paling penting. train_mix ialah apa yang anda masukkan ke dalam kerja latihan seterusnya; tanpanya tiada apa-apa boleh dikaitkan sebab-akibat. eval_protocol menamakan ujian tetap yang anda jalankan selepas itu, dan ini medan yang paling kerap dibiarkan kosong. Dalam kokpit ay-robots, status pengambilalihan melaporkan kiraan bingkai campur tangan bagi sesi yang sedang berjalan, jadi pencatatan hanyalah transkripsi dan bukannya instrumentasi; dokumentasi set data menerangkan di mana lajur bagi setiap bingkai itu tersimpan.

Membaca lengkung: tiga pusingan, satu keputusan
Tiga pusingan ialah jumlah minimum untuk sesuatu bacaan, kerana dua titik akan sentiasa membentuk satu garis. Jadual di bawah ialah templat pencatatan dengan nombor sekadar contoh, bukan ukuran daripada mana-mana larian sebenar. Anda sedang mencari penurunan monoton yang disertai peningkatan kejayaan pada ujian tetap.
| Pusingan | Checkpoint yang digunakan | Bingkai | Bingkai campur tangan | Kadar | Kejayaan (daripada 20) |
|---|---|---|---|---|---|
| 0 (garis dasar) | polisi asas | 5 900 | 1 380 | 23.4 % | 7 |
| 1 | daripada campuran pusingan 0 | 5 610 | 980 | 17.5 % | 10 |
| 2 | daripada campuran pusingan 1 | 5 412 | 611 | 11.3 % | 11 |
| 3 | daripada campuran pusingan 2 | 5 380 | 598 | 11.1 % | 12 |
Pusingan satu dan dua memberi kesan. Pusingan tiga tidak: 11.3 berbanding 11.1 peratus berada dalam lingkungan variasi larian-ke-larian bagi apa-apa sahaja yang diukur pada lengan fizikal, dan pusingan keempat dengan pembetulan yang sama hanya membazirkan satu petang tanpa hasil. Segmen mendatar ini menandakan sesuatu yang struktur perlu diubah.
- Kegagalan yang tinggal tidak boleh dibetulkan melalui teleoperasi - objek di luar jangkauan, geometri gripper, sendi pada hadnya. Tiada data pembetulan yang dapat mengatasi halangan kinematik.
- Pembetulan terlalu sedikit berbanding set data asas untuk menggerakkan gradien, dan tiada apa-apa yang memberi bobot kepadanya.
- Pembetulan saling bercanggah, jadi polisi merata-ratakan dua strategi dan berakhir di antara kedua-duanya.
- Kegagalan berpunca lebih awal dalam rantaian: kamera tergerak, pencahayaan berubah, pandangan wrist tidak lagi sepadan dengan latihan.
- Tugas ini telah mencapai siling bagi kelas polisi ini pada perkakasan ini, dan langkah seterusnya ialah lebih banyak data asas.
Dua yang terakhir bukanlah kegagalan gelung itu sendiri. Dalam Sirius-Fleet, keperluan manusia yang semakin berkurang adalah hasil yang memang direka: apabila autonomi robot bertambah baik, peramal anomalinya menyesuaikan kriteria ramalannya, menyebabkan lebih sedikit permintaan campur tangan manusia dan secara beransur-ansur mengurangkan beban kerja manusia dari semasa ke semasa. Di situ kriteria itu menyesuaikan diri secara sengaja. Dalam gelung manual, kriteria anda turut menyesuaikan diri, tetapi secara senyap - jadi kadar yang mendatar kerana tugas telah mencapai siling kelihatan sama persis seperti kadar yang mendatar kerana operator berhenti menyedari. Itulah masalah seterusnya.
Perangkap 1: kadar yang menurun bukan kadar kejayaan yang meningkat
Kadar campur tangan mengukur tepat satu perkara sahaja: berapa banyak larian yang anda putuskan untuk anda kawal sendiri. Keputusan itu milik anda, dibuat secara masa nyata, dan ia berubah-ubah. Pada pusingan sifar anda mengambil alih pada sudut pendekatan buruk yang pertama; menjelang pusingan tiga anda telah melihat polisi pulih daripada sebelas kejadian sedemikian dan anda membiarkannya mencuba. Ambang anda telah berubah; polisi itu mungkin tidak. Kadar itu tetap menurun dalam kedua-dua keadaan.
Kepercayaan manusia sekurang-kurangnya merupakan kuantiti yang dimodelkan dalam literatur, bukan pemalar yang diandaikan. Sirius memberi bobot semula kepada sampel latihan menggunakan anggaran kepercayaan manusia dan mengoptimumkan polisi dengan behavioural cloning berwajaran, melaporkan peningkatan 8 peratus dalam simulasi dan 27 peratus pada perkakasan sebenar berbanding kaedah terkini dalam kadar kejayaan polisi, pada kelajuan penumpuan dua kali ganda. Itu memperlakukan kepercayaan sebagai satu bobot pada data. Ia tidak membetulkan ambang dalam fikiran anda antara pusingan sifar dan pusingan tiga.
Anda tidak dapat menghapuskan hanyutan ini, jadi gandingkan kadar itu dengan sesuatu yang tidak boleh disentuh oleh ambang anda: satu set percubaan tetap di mana anda langsung tidak campur tangan, dinilai berdasarkan kriteria yang ditulis sebelum pusingan bermula. Kadar yang menurun sedangkan kadar kejayaan yang digandingkan kekal tidak berubah adalah tanda pembiasaan - patut dikesan, kerana dari dalam gelung itu ia terasa seperti kemajuan.
| Kadar campur tangan | Kadar kejayaan pada protokol tetap | Tafsiran yang paling mungkin |
|---|---|---|
| menurun | meningkat | Pusingan itu berkesan. Teruskan. |
| menurun | mendatar | Ambang anda telah hanyut, atau pembetulan mengurangkan usaha tanpa mengurangkan kegagalan. |
| menurun | menurun | Pembetulan sedang merosakkan polisi. Semak campuran dan konsistensi dalamannya. |
| mendatar | mendatar | Pusingan itu tidak membawa sebarang faedah. Ubah campuran, checkpoint atau tugas sebelum mengumpul lebih banyak data. |
| meningkat | menurun | Regresi. Syaki campuran latihan, kamera yang telah berubah atau kekeliruan checkpoint terlebih dahulu sebelum mengesyaki kaedah itu sendiri. |
Perangkap 2: tanpa protokol tetap, anda mengukur bilik itu sendiri
Penilaian pada robot sebenar mahal dan sukar diulang. Penulis SIMPLER mewajarkan penilaian simulasi dengan pemerhatian bahawa penilaian dunia sebenar bagi polisi sedemikian tidak boleh diskalakan dan menghadapi cabaran kebolehulangan yang berkemungkinan bertambah teruk apabila polisi memperluas skop tugasnya. RoboArena pula menanganinya dari sudut yang berbeza, dengan lebih daripada 600 episod penilaian robot sebenar secara berpasangan merentasi tujuh polisi generalis, dijalankan oleh penilai di tujuh institusi akademik di atas platform DROID. Penilainya memilih tugas dan persekitaran mereka sendiri tetapi perlu menilai pasangan polisi secara double-blind; kertas kerja itu melaporkan bahawa kedudukan yang dijana secara crowd-sourced ini menjejaki prestasi polisi generalis dengan lebih tepat berbanding penilaian konvensional yang berpusat.
Anda tidak akan menjalankan 600 episod berpasangan pada satu SO-100 di dalam sebuah bengkel. Apa yang boleh anda lakukan ialah menghapuskan varians yang berada dalam kawalan anda - satu senarai yang cukup membosankan sehingga selalunya diabaikan.
| Dimensi | Bekukan ini | Apa yang menghanyut jika anda tidak melakukannya |
|---|---|---|
| Postur mula | Kedudukan asal yang ditulis, dipandu sebelum setiap percubaan | Trajektori bermula di luar taburan |
| Objek | Tanda pita, dan objek fizikal yang sama dikhaskan untuk penilaian | Polisi yang 'lebih baik' sebenarnya cumalah objek yang lebih dekat |
| Kamera dan cahaya | Mounting, indeks, pendedahan yang sama; bidai ditutup; ambil gambar persediaan | Pertukaran indeks kamera sahaja boleh mendominasi keputusan |
| Percubaan dan peraturan henti | n tetap, had masa tetap, kriteria ditulis sebelum pusingan | Kriteria post-hoc mengubah kejadian nyaris-berjaya menjadi apa sahaja yang anda perlukan |
| Tingkah laku operator | Tiada campur tangan semasa percubaan penilaian | Penilaian bertukar menjadi satu lagi sesi pembetulan |
Kemudian aritmetiknya, yang tidak memaafkan pada bilangan percubaan yang mampu dijalankan oleh sebuah bengkel. Di bawah penghampiran normal, kejayaan 60 peratus daripada 20 percubaan membawa ralat piawai lebih kurang 11 mata peratusan - punca kuasa dua bagi 0.6 didarab 0.4 dibahagi 20 - dan perbezaan antara dua pusingan sedemikian membawa lebih kurang 15. Oleh itu, lonjakan daripada 60 kepada 70 peratus tetap konsisten dengan kemungkinan tiada apa-apa yang sebenarnya berubah. Lima puluh percubaan mengurangkan angka bagi setiap pusingan kepada lebih kurang 7 mata, dan mengambil masa satu petang.
Ketidaksimetrian ini adalah hujah untuk kadar campur tangan: dikira merentasi beribu-ribu bingkai berbanding dua puluh hasil binari, ia bergerak lebih awal dan lebih licin. Peringatannya ialah bingkai dalam satu episod sangat berkorelasi - satu genggaman yang gagal menghasilkan seratus bingkai campur tangan berturut-turut - jadi saiz sampel yang berkesan lebih hampir kepada bilangan pengambilalihan. Anggap kadar itu sebagai penunjuk awal dan kadar kejayaan sebagai ground truth yang perlahan.
Episod penilaian tidak boleh sesekali dimasukkan ke dalam set data latihan yang disusun - jika tidak, pusingan n+1 akan dinilai menggunakan data yang telah dilatih ke atasnya, dan lengkung itu sebenarnya hanya mengukur penghafalan.
Perangkap 3: melatih hanya pada pembetulan memesongkan polisi
Pembetulan itu adalah data yang menarik, jadi naluri semula jadi ialah untuk melatih menggunakannya. Jangan lakukan itu. Ia datang, mengikut sifatnya, daripada sekeping sempit ruang keadaan di mana polisi sudah pun gagal, dan hampir tidak menyatakan apa-apa tentang majoriti larian yang berjaya. Tala-halus hanya pada sekeping itu dan anda akan mendapat polisi yang mahir memulihkan diri daripada pendekatan yang tersasar tetapi telah lupa cara membuat pendekatan yang bersih.
Mandlekar dan rakan-rakan membina sistem campur tangan jauh mereka berdasarkan hal ini. Rumusan mereka: tugas manipulasi mengandungi kawasan bottleneck yang memerlukan satu urutan tindakan yang tepat - memasukkan pod ke dalam mesin kopi adalah contoh mereka - di mana penyimpangan kecil membawa kepada keadaan yang tidak pernah dirangkumi oleh demonstrasi. Algoritma mereka melatih secara berlelar pada data baharu supaya polisi belajar melintasi bottleneck tersebut, dan mereka melaporkan bahawa ejen yang dilatih dengan data campur tangan mengatasi ejen yang dilatih dengan bilangan sampel yang sama daripada penunjuk cara bukan-campur-tangan.
- Pantas: larian singkat merentasi beberapa dozen episod cukup murah untuk diulang
- Tersasar: gradien didominasi oleh keadaan yang anda ambil berat
- Murah untuk menguji sama ada satu gaya pembetulan boleh dipelajari sama sekali
- Taburan tala-halus tidak lagi menyerupai taburan tugas sebenar
- Tingkah laku nominal boleh merosot secara ketara dalam satu pusingan sahaja
- Kadar boleh menurun sedangkan kejayaan turut menurun bersamanya - segmen bersih ditukar dengan pemulihan
Nisbah campuran adalah satu hiperparameter dan wajar dicatatkan. Menyusun set data seterusnya adalah tempat ia diputuskan: demonstrasi asal ditambah set pembetulan, pemilihan episod dinyatakan secara eksplisit mengikut sumber dan bukannya satu peraturan yang secara senyap menarik masuk apa sahaja yang ada. Di sini itu adalah satu langkah compose dalam kokpit, dan hasilnya ialah satu set data biasa - lihat dokumentasi latihan. Apa yang tidak dilakukan oleh mana-mana alat untuk anda ialah mencatat nisbah mana yang menghasilkan lengkung yang mana.
Perangkap 4: manusia bukan pakar yang konsisten
Teori DAgger mengandaikan seorang pakar. Anda bukan pakar dalam erti kata teknikal: pembetulan anda bukan sampel daripada satu taburan bersyarat tetap ke atas tindakan. Penulis ACT menyebut hal ini apabila menyenaraikan halangan kepada manipulasi halus - ralat berganda dari semasa ke semasa, dan demonstrasi manusia boleh bersifat tidak pegun (non-stationary). Sistem mereka masih mencapai kejayaan 80 hingga 90 peratus pada enam tugas sebenar hasil daripada sepuluh minit demonstrasi, jadi masalah ini boleh diatasi, bukannya tidak wujud.
Kajian robomimic menegaskan perkara ini dari sudut data. Merentasi enam algoritma luar talian pada lima tugas simulasi dan tiga tugas dunia sebenar berbilang peringkat, pengajarannya termasuk kepekaan terhadap pilihan reka bentuk, kebergantungan pada kualiti demonstrasi, dan - yang paling menyakitkan di sini - variabiliti yang timbul daripada kriteria pemberhentian, kerana objektif latihan dan penilaian berbeza. Checkpoint dengan loss paling rendah tidak semestinya checkpoint dengan kadar kejayaan paling tinggi.
Terdapat versi perkakasan bagi perkara ini: mod input membentuk pembetulan. Satu susunan leader-follower menghasilkan trajektori yang berterusan dan mengikut rentak manusia. Senggatan keyboard dihadkan dengan ketat oleh server - dua darjah bagi setiap panggilan pada sendi lengan, empat pada gripper - jadi niat yang sama tiba sebagai satu tangga langkah-langkah kecil. Slider menghantar sasaran mutlak dan server bergerak paling banyak enam darjah ke arahnya bagi setiap panggilan. Tiga mod, tiga taburan tindakan; mencampurkan ketiga-tiganya ke dalam satu set pembetulan dan kemudian tertanya-tanya mengapa pendekatan menjadi tersentak-sentak adalah masalah yang anda cipta sendiri. dokumentasi teleoperasi menerangkan apa yang dihantar oleh setiap mod.
Memberi bobot kepada campur tangan: IWR dan apa yang menyusul selepasnya
Jika pembetulan adalah minoriti yang bernilai, penyelesaian yang berprinsip ialah bobot, bukannya eksklusiviti. Intervention Weighted Regression ialah pelaksanaan rujukan: data dipartisikan kepada sampel campur tangan dan bukan-campur-tangan, dan kedua-dua partisi disampel dalam nisbah yang sama semasa latihan. Set pembetulan yang merangkumi lima peratus daripada bingkai kemudiannya menyumbang separuh daripada gradien, tanpa tingkah laku nominal hilang daripada taburan.
Nisbah sama adalah titik permulaan, bukan satu hukum. Sirius menggeneralisasikannya dengan menggantikan partisi binari dengan bobot berterusan daripada anggaran kepercayaan manusia; Sirius-Fleet pula memindahkan keputusan itu ke peringkat yang lebih awal, menggunakan model dunia visual dan peramal anomali untuk menentukan bila sahaja manusia perlu diminta. Benang merah yang sama: penanda campur tangan adalah isyarat latihan, bukan sekadar lajur pencatatan.
| Kaedah | Siapa yang menentukan bila manusia bertindak | Bagaimana data campur tangan digunakan | Keputusan yang dilaporkan |
|---|---|---|---|
| DAgger (2011) | Jadual tetap; pakar melabelkan keadaan yang dilawati | Satu set data yang berkembang, tanpa bobot | Dirumuskan sebagai pengurangan kepada pembelajaran dalam talian tanpa regret |
| HG-DAgger (2019) | Manusia, mengawal pintu kawalan pada sistem sebenar | Digabungkan; ditambah ambang keselamatan yang dipelajari berdasarkan ketidakpastian model | Lebih baik daripada DAgger dan BC pada tugas memandu; tiada kiraan campur tangan diberikan |
| IWR (2020) | Manusia, melalui teleoperasi jauh | Sampel campur tangan dan bukan-campur-tangan diambil dalam nisbah yang sama | Mengatasi demonstrasi bukan-campur-tangan pada bilangan sampel yang sama |
| Sirius (2022) | Manusia, semasa deployment | BC berwajaran, bobot daripada anggaran kepercayaan manusia | Peningkatan 8% dalam simulasi, 27% pada perkakasan sebenar; penumpuan 2x lebih pantas |
| ThriftyDAgger (2021) | Sistem, mengawal pintu berdasarkan kebaharuan dan risiko | Pengumpulan interaktif di bawah bajet penyeliaan | Kajian pengguna (N=10): prestasi manusia 58% lebih tinggi dan prestasi robot 80% lebih tinggi berbanding kaedah terbaik seterusnya |
| Fleet-DAgger (2022) | Sistem, mengagihkan perhatian merentasi satu armada | Pembelajaran armada dinilai melalui Return on Human Effort | Sehingga 8.8x ROHE lebih tinggi berbanding garis dasar |
| Sirius-Fleet (2024) | Peramal anomali dengan kriteria yang menyesuaikan diri sendiri | Pembelajaran berbilang tugas dengan model dunia visual | Lebih sedikit permintaan campur tangan apabila autonomi bertambah baik |

Empat metrik yang berbaloi dicatat di sebelah kadar itu
- Pengambilalihan bagi setiap larian. Dua puluh pembetulan pendek dan satu pembetulan panjang memberikan kadar yang serupa tetapi menggambarkan polisi yang berbeza - satu yang menggeletar, satu lagi dengan satu titik buta tunggal.
- Purata panjang campur tangan. Panjang yang meningkat berserta kiraan yang menurun bermaksud kegagalan yang tinggal adalah yang paling sukar, dan itulah rupa kemajuan pada peringkat lewat.
- Masa sehingga campur tangan pertama. Polisi yang dapat bergerak lebih jauh sebelum memerlukan bantuan sedang bertambah baik walaupun jumlah kadar kekal mendatar.
- Di mana campur tangan berkelompok. Kelompokkan penanda mengikut kemajuan episod yang dinormalkan; puncak yang stabil merentasi pusingan menandakan satu bottleneck.
Satu protokol pusingan yang benar-benar boleh anda jalankan
Satu pusingan yang diukur mempunyai enam langkah dan menghasilkan satu baris dalam log. Empat langkah pertama ialah gelung itu sendiri; dua langkah terakhir menjadikannya satu ukuran.
- 1Bekukan protokol penilaian sebelum pusingan sifar
Catatkan postur mula, penempatan objek, kamera, bilangan percubaan, had masa dan kriteria kejayaan. Ambil gambar meja itu. Jika dokumen itu perlu diubah, siri itu bermula semula.
- 2Ukur garis dasar
Jalankan protokol tanpa sebarang campur tangan dan catatkan kejayaan; kemudian jalankan satu sesi berinstrumen dengan pengambilalihan diaktifkan dan catatkan kadarnya. Kedua-dua nombor itu adalah pusingan sifar.
- 3Kumpulkan pembetulan dalam satu gaya yang konsisten
Satu mod input bagi setiap pusingan, satu operator jika mampu diuruskan. Ambil alih berdasarkan kriteria yang boleh anda sebutkan dengan kuat - 'gripper terleset lebih daripada dua sentimeter semasa pendekatan' - dan kekalkan kriteria itu sepanjang pusingan.
- 4Triage setiap episod pada hari yang sama
Pembetulan, penilaian atau buang. Episod yang meragukan dibuang, bukan disimpan atas teori bahawa lebih banyak data membantu - satu pembetulan yang mana anda sendiri tersasar adalah lebih teruk daripada tiada episod langsung.
- 5Susun campuran secara eksplisit
Demonstrasi asal ditambah pembetulan, pemilihan episod mengikut sumber. Catatkan bilangan asas, bilangan pembetulan dan sebarang pemberatan - inilah medan yang akan anda perlukan tiga minggu dari sekarang.
- 6Sambung daripada checkpoint, kemudian ukur semula
Latih set data yang disusun itu bermula daripada checkpoint sebelumnya dan bukannya model asas, jalankan protokol yang dibekukan berserta satu sesi berinstrumen, tambahkan baris itu, dan bandingkan dengan dua pusingan sebelumnya.
Dua had ini mengubah cara anda mentafsir satu pusingan yang lemah. Menyambung daripada satu checkpoint hanya memulakan bobot daripadanya - bukan sambungan optimizer, jadi jadual bermula semula dari awal dan satu larian pendek daripada checkpoint yang telah menumpu boleh bergerak sedikit sahaja. Dan pergerakan penjajaran leader pada permulaan pengambilalihan mempunyai paling sedikit mileage pada perkakasan sebenar berbanding apa-apa sahaja dalam rantaian itu; jika semua pembetulan bermula dengan satu transien yang ganjil, periksa di situ dahulu sebelum menyalahkan campuran.
Gelung yang diukur, sudah tersedia
ay-robots melaksanakan enam langkah ini sebagai ciri produk: ambil alih di tengah-tengah larian daripada lengan leader, keyboard atau slider, dengan bingkai campur tangan ditandakan secara automatik; triage setiap episod sebagai pembetulan, penilaian atau buang; susun set data seterusnya daripada demonstrasi asal ditambah pembetulan, pemilihan episod dinyatakan secara eksplisit mengikut sumber; dan mulakan larian latihan seterusnya daripada checkpoint sebelumnya dan bukannya model asas.
Lihat cara gelung DAgger berfungsiApa yang tidak dapat diberitahu oleh nombor-nombor itu
Tiada satu pun daripada ini benar-benar selesai, dan satu lengkung yang kemas tidak sepatutnya memujuk anda untuk berfikir sebaliknya. Kadar campur tangan mengukur satu sistem bersama - polisi, perkakasan, operator, bilik - dan tidak mengaitkan sebab-akibat kepada mana-mana satu dengan sendirinya. Ia tidak dapat menilai sama ada pembetulan itu baik, dan ia akan menurun dengan senang hati pada tugas yang menjadi lebih mudah kerana objek itu menghanyut dua sentimeter lebih dekat sepanjang tiga minggu.
Apa yang ia lakukan ialah mengubah satu tanggapan kabur menjadi satu lajur yang boleh anda perdebatkan. Alternatifnya bukanlah metrik yang lebih baik; ia adalah tiga minggu mengumpul pembetulan yang sepatutnya, menurut lengkung itu, sudah diberitahu kepada anda selepas pusingan tiga untuk berhenti mengumpul. Literatur tinjauan mentakrifkan pembelajaran peniruan interaktif sebagai maklum balas manusia yang diberikan secara berkala semasa pelaksanaan robot, membolehkan penambahbaikan tingkah laku secara dalam talian; keluarga kaedah ini luas, dan tiada satu susunan pun daripadanya berfungsi tanpa satu nombor bagi setiap pusingan. Lihat juga panduan pembelajaran peniruan SO-100 untuk set data asas yang anda campurkan, menjalankan satu polisi untuk sudut inferens, dan halaman gelung DAgger untuk saluran paip yang telah dilaksanakan.
Adakah kadar campur tangan hanya satu tolak kadar kejayaan?▾
Tidak. Kadar itu mengukur berapa banyak satu larian yang anda ambil alih; kadar kejayaan pula mengukur sama ada tugas itu selesai tanpa anda. Satu larian boleh berjaya walaupun dengan kadar campur tangan 30 peratus, dan satu larian tanpa sebarang campur tangan boleh gagal sepenuhnya. Kedua-duanya juga berbeza dari segi hingar: kadar bergerak dengan licin merentasi beribu-ribu bingkai yang berkorelasi, manakala kadar kejayaan melompat antara segelintir hasil binari. Catatkan kedua-duanya.
Berapa banyak percubaan penilaian yang saya perlukan supaya kadar kejayaan itu bermakna?▾
Lebih daripada apa yang terasa munasabah. Di bawah penghampiran normal, 20 percubaan pada kadar kejayaan sebenar 60 peratus membawa ralat piawai lebih kurang 11 mata peratusan, jadi pergerakan 10 mata antara pusingan tidak dapat dibezakan daripada hingar; 50 percubaan mengurangkan angka itu kepada lebih kurang 7. Jika anda tidak mampu menjalankan 50 percubaan, pastikan bilangan percubaan sama merentasi semua pusingan dan anggap pergerakan kecil sebagai tidak muktamad.
Nisbah campuran demonstrasi kepada pembetulan yang manakah patut saya mulakan?▾
Titik permulaan yang didokumenkan ialah milik IWR: partisikan data kepada sampel campur tangan dan bukan-campur-tangan dan sampel kedua-duanya dalam nisbah yang sama, supaya pembetulan menyumbang separuh daripada gradien tidak kira betapa kecilnya pecahan bingkai yang dimilikinya. Jika persediaan anda tidak dapat memberi bobot kepada persampelan, anggarkannya melalui bilangan episod semasa menyusun set data dan catatkan nisbah itu. Melatih hanya pada pembetulan semata-mata adalah pilihan yang perlu disisihkan.
Kadar campur tangan saya meningkat selepas satu pusingan. Adakah pusingan itu terbuang sia-sia?▾
Tidak semestinya, tetapi semak dahulu penjelasan yang membosankan: adakah checkpoint yang anda gunakan sepadan dengan yang anda latih, adakah indeks atau mounting kamera berubah, adakah penempatan objek menghanyut, adakah gaya pembetulan konsisten. Jika keempat-empatnya bersih dan kadar kejayaan yang digandingkan turut menurun, syaki campuran itu - terlalu sedikit demonstrasi asas berbanding pembetulan, atau pembetulan yang saling bercanggah. Satu regresi yang sebenar patut dicatat dalam log, bukan dibuang.
Bolehkah saya lewati protokol penilaian tetap dan hanya memerhatikan kadar campur tangan?▾
Hanya jika anda menerima hakikat bahawa anda tidak dapat membezakan peningkatan sebenar daripada pembiasaan. Kadar itu bergantung pada ambang masa nyata anda sendiri untuk campur tangan, dan ambang itu menurun apabila anda semakin biasa dengan keanehan polisi. Protokol yang dibekukan itulah bahagian ukuran yang tidak dapat dicapai oleh ambang anda - tanda pita, postur asal yang ditulis, bilangan percubaan tetap, kriteria yang diputuskan sebelum pusingan. Ia perlu kekal tidak berubah sepanjang siri itu.
Simpan log dalam repositori, bukan dalam buku nota: pusingan berjarak beberapa hari, perkakasan dibina semula, dan orang yang membaca lengkung itu pada bulan Oktober adalah anda sendiri yang tiada lagi ingatan tentang bulan Ogos. FAQ dokumentasi merangkumi butiran operasi yang tidak dinyatakan di sini.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started