
DAgger biasa meminta manusia melabel keadaan (states) semasa robot masih memandu. Pada perkakasan sebenar, ini tidak selamat dan menghasilkan label yang lemah. Varian berpintu menggantikan pelabelan buta dengan satu pintu yang perlu dipegang oleh seseorang: manusia dalam HG-DAgger, pengelas keselamatan dalam SafeDAgger, percanggahan ensemble dalam EnsembleDAgger, anggaran kebaharuan-dan-risiko berbajet dalam ThriftyDAgger. Artikel ini membandingkan kaedah-kaedah tersebut berdasarkan siapa memegang pintu, isyarat apa yang membukanya, dan apakah kos setiap satu — serta sebab bentuk berpintu manusia adalah yang bertahan apabila bersentuhan dengan lengan robot sebenar.
Sesebuah polisi terklon gagal pada titik data latihannya kehabisan. Penyelesaiannya ialah terus mengumpul data di bawah taburan keadaan (state distribution) polisi itu sendiri, bukan taburan pendemonstrasi, dan itulah yang dilakukan oleh DAgger serta yang dibincangkan oleh pengenalan kepada agregasi dataset dari prinsip asas. Ia meninggalkan bahagian janggal algoritma asal tidak terjawab: semasa pembelajar (learner) memandu, pakar sepatutnya menyatakan apa yang akan dilakukannya, bagi setiap keadaan, tanpa berada dalam kawalan.
Dalam simulator dengan pakar berskrip, itu percuma. Di atas meja dengan lengan sebenar, ia tidak percuma dan tidak selamat. Penulis HG-DAgger menyatakan bantahan ini dengan tepat: skema pensampelan sedemikian "require the expert to provide action labels without being fully in control of the system", yang "can decrease safety and, when using humans as experts, is likely to degrade the quality of the collected labels due to perceived actuator lag" (Kelly et al., 2019). Dua kegagalan tersembunyi dalam ayat itu: polisi terus memandu ke dalam keadaan yang tidak dikehendaki sesiapa, dan label yang diperoleh dengan risiko itu lebih buruk daripada label yang dihasilkan manusia semasa memegang kawalan. Setiap varian di bawah menjawab soalan yang sama — letakkan satu pintu pada kawalan dan biarkan seseorang menentukan bila ia dibuka. Perbezaannya terletak pada siapa orang itu.
Versi ringkas
- •Varian berpintu menggantikan pelabelan buta dengan satu suis antara kawalan polisi dan kawalan pakar. Yang membezakan mereka ialah siapa memegang suis itu.
- •HG-DAgger memberikan suis itu kepada manusia dan hanya mengagregat data yang dirakam semasa manusia memegang kawalan tanpa gangguan.
- •SafeDAgger memberikannya kepada pengelas binari yang meramalkan sisihan daripada polisi rujukan; EnsembleDAgger memerlukan varians ensemble yang rendah dan jarak yang kecil kepada tindakan pakar pada masa yang sama.
- •LazyDAgger menambah histerisis supaya kawalan tidak berayun-ayun (ping-pong); ThriftyDAgger membuka pintu berdasarkan kebaharuan atau anggaran risiko di bawah bajet intervensi yang eksplisit.
- •Isyarat berpintu robot memerlukan sesuatu yang biasanya tiada pada VLA yang di-fine-tune di atas lengan kelas hobi: sebuah polisi rujukan, sebuah ensemble yang murah, atau ketidakpastian epistemik yang ditentukur (calibrated).
- •Pintu itu hanya separuh daripada kaedah. Apa yang berlaku kepada segmen intervensi selepas itu — dicampur, diberi pemberat, diagregat — menentukan sama ada pusingan itu memberi sebarang penambahbaikan.
Berpintu manusia dan berpintu robot: perbezaan yang penting
Pembelajaran peniruan interaktif mempunyai kajian ulasannya sendiri; Celemin dan rakan-rakan mengkatalogkannya mengikut jenis maklum balas, antara muka, model pembelajaran, pengalaman pengguna, aplikasi dan penanda aras (benchmark). Namun perbezaan yang benar-benar menentukan kejuruteraan anda lebih ringkas daripada mana-mana paksi tersebut, dan kajian terkini menamakannya secara langsung: sesuatu kaedah adalah berpintu manusia (human-gated) apabila penyelia yang menentukan bila untuk campur tangan, dan berpintu robot (robot-gated) apabila ejen yang menentukan bila untuk meminta bantuan (Cai et al., 2025). Segala yang lain hanyalah jentera yang berkhidmat kepada salah satu daripada dua pilihan ini. Pertukarannya jelas sejak awal: pintu manusia memerlukan perhatian berterusan, manakala pintu robot menjanjikan untuk mengembalikan perhatian itu — tetapi hanya jika isyarat yang menjadi asas pintu itu boleh dipercayai, dan membina isyarat tersebut adalah masalah penyelidikan tersendiri.
SafeDAgger: pengelas yang meramalkan sisihannya sendiri
SafeDAgger (2016) oleh Zhang dan Cho adalah yang paling awal antara pintu-pintu ini. Menyoal (query) polisi rujukan adalah bahagian yang mahal, jadi satu rangkaian kecil kedua — polisi keselamatan — meramalkan sama ada penyoalan itu berbaloi dilakukan sama sekali. Ia "returns a binary label indicating whether the primary policy is likely to deviate from a reference policy without querying it". Label itu ditakrifkan berdasarkan sisihan L2 kuasa dua antara tindakan kedua-dua polisi dengan ambang tau, dan pengelas itu dilatih (fit) dengan binary cross-entropy. Pada masa jalanan (run time), ia menentukan bagi setiap keadaan sama ada pembelajar terus memandu atau rujukan mengambil alih. Abstrak melaporkan lebih sedikit penyoalan rujukan dalam simulator perlumbaan kereta ditambah percepatan penumpuan (convergence) yang dikaitkan oleh penulis dengan kesan kurikulum automatik, tanpa memberikan angka bagi kedua-duanya.
Perangkapnya terletak pada takrifan, bukan pada keputusan. Melatih pengelas itu memerlukan tindakan polisi rujukan pada setiap keadaan yang digunakan untuk melatihnya, dan ini mengandaikan rujukan tersebut adalah satu lagi program. Jika rujukan anda ialah seorang manusia dengan lengan pemimpin (leader arm), set label itu tidak murah dan kaedah ini kehilangan sifat yang direka untuknya.
EnsembleDAgger: keraguan dan percanggahan, kedua-duanya
Menda, Driggs-Campbell dan Kochenderfer (2019) melayan pintu itu sebagai persoalan kebarangkalian. EnsembleDAgger "approximates a Gaussian Process using an ensemble of neural networks" dan membaca varians ensemble sebagai proksi keyakinan: varians tinggi bermaksud kawasan yang tidak seperti data latihan, yang — dengan andaian pakar mengelakkan keadaan kegagalan — berkorelasi dengan kedekatan kepada kegagalan. Peraturannya ialah satu konjunksi. Pembelajar hanya boleh bertindak apabila jarak L2 antara tindakan purata dan tindakan pakar kekal di bawah satu ambang (percanggahan) dan varians tindakan yang diramalkannya kekal di bawah ambang kedua (keraguan). Jika salah satu gagal, pakar mengambil kawalan. Matlamatnya ialah memaksimumkan bahagian tindakan pembelajar sambil mengekang kebarangkalian kegagalan; kajian ini melaporkan keselamatan dan pembelajaran yang lebih baik berbanding varian DAgger lain pada bandul terbalik (inverted pendulum) dan MuJoCo HalfCheetah.
Ini secara senyap-senyap menghilangkan kelayakan peraturan penuh untuk penyeliaan bebas tangan (hands-off). Jarak antara tindakan pembelajar dan tindakan pakar memerlukan tindakan pakar pada keadaan itu, pada saat itu. Dengan pakar berskrip, tiada masalah. Dengan manusia, manusia itu perlu menghasilkan tindakan secara berterusan — beban yang sepatutnya dihapuskan oleh varian berpintu ini. Terma keraguan sahaja bersifat bebas tangan; konjunksi itu tidak.
LazyDAgger: menghentikan suis daripada berayun-ayun
Hoque dan rakan-rakan (2021) menyerang satu kos yang tidak diukur oleh kertas-kertas terdahulu: suis itu sendiri. Setiap intervensi "interrupts other work the human is doing, incurs latency with each context switch between supervisor and autonomous control, and requires time to perform". Satu pintu yang terbuka dan tertutup sepuluh kali seminit adalah lebih buruk daripada satu yang terbuka sekali selama sepuluh saat, pada bahagian autonomi yang sama. LazyDAgger melanjutkan SafeDAgger dengan ambang tidak simetri — lebih sukar untuk memasuki kawalan penyelia berbanding untuk kekal di dalamnya — supaya sistem tidak berayun-ayun pada sempadan. Dalam simulasi ia "can reduce context switches by an average of 60% over SafeDAgger on 3 continuous control tasks while maintaining state-of-the-art policy performance"; dalam manipulasi fabrik dengan ABB YuMi ia "reduces context switches by 60% while achieving a 60% higher success rate than SafeDAgger at execution time".
ThriftyDAgger: kebaharuan atau risiko, di bawah bajet
ThriftyDAgger (Hoque et al., CoRL 2021) bermula daripada bajet penyelia dan bukan daripada polisi. Ia "uses a learned switching policy to solicit interventions only at states that are sufficiently (1) novel, where the robot policy has no reference behavior to imitate, or (2) risky, where the robot has low confidence in task completion", dengan satu metrik baharu untuk menganggarkan risiko tersebut. Bajet itu adalah input, bukan hasil: anda menyatakan berapa banyak masa manusia yang akan dibelanjakan. Apabila digunakan pada masa pelaksanaan, kaedah ini "achieves a 100% success rate on both the simulation and physical tasks", dan satu kajian pengguna dengan sepuluh peserta yang mengawal armada tiga robot sambil melakukan tugas tumpuan melaporkan bahawa ia "increases human and robot performance by 58% and 80% respectively compared to the next best algorithm while reducing supervisor burden". Persekitaran armada adalah tempat semula jadi bagi kerja ini; Fleet-DAgger kemudiannya memformalkan pembelajaran armada interaktif dengan pelbagai robot dan penyelia, mencadangkan Return on Human Effort sebagai kuantiti untuk dioptimumkan.
HG-DAgger: manusia memegang pintu
Kelly et al. (2019) mengambil pendekatan sebaliknya. Tiada polisi suis. Pembelajar dijalankan "until the expert observes that the novice has entered an unsafe region of the state space", dan pada ketika itu pakar mengambil kawalan dan membimbing sistem itu kembali. Peraturan agregasi adalah bahagian yang ketat: "Expert action labels are only collected and added to the dataset during these recovery trajectories, during which the human expert has uninterrupted control of the system." Tiada apa-apa dilabel semasa manusia hanya menjadi penonton.
Ia tidak berhenti pada suis sahaja. HG-DAgger juga "learns a safety threshold for a model-uncertainty-based risk metric that can be used to predict the performance of the fully trained novice in different regions of the state space": ia mencatat betapa tidak pastinya pembelajar pada saat-saat manusia campur tangan dan mengambil purata suku terakhir rekod tersebut, iaitu ketika pembelajar paling menyerupai bentuk akhirnya. Ini bukan satu pintu yang dikendalikan oleh robot tetapi satu diagnostik yang memberitahu anda di mana polisi yang telah siap dijangka akan bertahan. Penilaian ini merangkumi satu tugas pemanduan simulasi dan satu tugas pemanduan dunia sebenar, dan melaporkan prestasi yang lebih baik berbanding kedua-dua DAgger dan behavior cloning.
Satu garis kerja berkaitan mengubah apa yang dikira sebagai label. Expert Intervention Learning oleh Spencer dan rakan-rakan berpendirian bahawa "any amount of expert feedback, whether by intervention or non-intervention, provides information about the quality of the current state, the optimality of the action, or both", diformalkan sebagai kekangan pada fungsi nilai (value function) pembelajar dan diselesaikan dengan pembelajaran dalam talian no-regret. Di bawah tafsiran ini, tempoh di mana manusia hanya memerhati dan tidak berbuat apa-apa adalah bukti positif yang lemah, bukannya kosong. EIL mempelajari pengelakan perlanggaran daripada kira-kira satu minit kawalan pakar.

Varian-varian berdampingan
| Kaedah | Siapa membuka pintu | Isyarat | Keperluan yang tersedia | Dilaporkan |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Tiada sesiapa — pembelajar sentiasa memandu | Tiada; pakar melabel setiap keadaan yang dilawati | Seorang pakar yang mampu melabel keadaan off-policy tanpa berada dalam kawalan | Pengurangan no-regret dengan jaminan di bawah taburan keadaan pembelajar |
| HG-DAgger (Kelly et al., 2019) | Penyelia manusia | Pertimbangan penyelia bahawa keadaan itu tidak selamat | Seseorang yang memerhati, dan penyerahan kawalan yang bersih | Mengatasi DAgger dan behavior cloning pada satu tugas pemanduan simulasi dan satu dunia sebenar; turut mempelajari satu ambang risiko |
| SafeDAgger (Zhang & Cho, 2016) | Robot | Pengelas binari untuk sisihan L2 daripada rujukan melebihi tau | Polisi rujukan yang boleh disoal untuk label pengelas | Lebih sedikit penyoalan rujukan dalam simulator perlumbaan, penumpuan lebih pantas (tiada angka diberikan) |
| EnsembleDAgger (Menda et al., 2019) | Robot | Varians ensemble dan jarak kepada tindakan pakar, kedua-duanya di bawah ambang | Satu ensemble rangkaian ditambah tindakan pakar pada setiap langkah | Keselamatan dan pembelajaran yang lebih baik pada bandul dan HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | Robot, dengan histerisis | Isyarat SafeDAgger dengan ambang masuk dan keluar yang berasingan | Apa yang diperlukan SafeDAgger, ditambah satu ambang kedua untuk ditala | ~60% lebih sedikit pertukaran konteks pada 3 tugas; 60% kejayaan lebih tinggi pada fabrik YuMi |
| ThriftyDAgger (Hoque et al., 2021) | Robot, di bawah bajet | Kebaharuan, atau anggaran risiko tidak menyiapkan tugas | Satu penganggar risiko yang dipelajari dan satu bajet intervensi yang dinyatakan | 100% kejayaan pada masa pelaksanaan; kajian pengguna (N=10): peningkatan 58% dan 80% berbanding algoritma terbaik seterusnya |
| EIL (Spencer et al., 2020) | Manusia — bukan-intervensi turut dikira | Intervensi dan ketiadaannya sebagai kekangan pada fungsi nilai | Pembelajaran dalam talian no-regret ke atas satu kekangan nilai | Pengelakan perlanggaran daripada kira-kira satu minit kawalan pakar |
Apa yang dibeli oleh setiap pintu, dan apa yang dikenakannya
Baca menurun lajur "keperluan" dan satu corak akan ketara: setiap isyarat berpintu robot di situ ialah satu proksi yang perlu dibina, dan setiap proksi mempunyai bilnya sendiri.
- Isyarat percanggahan (SafeDAgger, LazyDAgger, separuh daripada peraturan EnsembleDAgger) memerlukan satu polisi rujukan. Sama ada anda mempunyai pakar berskrip, dan dalam hal ini masalah yang menarik sudah pun diselesaikan, atau seorang manusia terus menghasilkan tindakan di latar belakang supaya satu jarak dapat dikira.
- Isyarat keraguan memerlukan ketidakpastian epistemik yang ditentukur. Satu ensemble rangkaian kawalan kecil boleh menghampirinya; satu ensemble model vision-language-action tiga bilion parameter adalah masalah memori dan latensi terlebih dahulu.
- Isyarat kebaharuan dan risiko memerlukan satu penganggar terlatih bagi penyelesaian tugas, yang dilatih pada larian (rollout) berjaya dan gagal yang mencukupi. Pada tugas yang masih dalam proses menjadikannya berfungsi, data itu tidak wujud pada pusingan pertama.
- Pintu manusia hanya memerlukan perhatian dan tiada apa-apa lagi — satu-satunya isyarat yang tersedia pada hari pertama, pada mana-mana seni bina polisi, tanpa model tambahan untuk dilatih.
- Tiada pintu robot yang menghapuskan manusia daripada bilik itu. Ia hanya mengurangkan kekerapan manusia perlu bertindak, bukan sama ada mereka perlu hadir.
Terdapat perbezaan yang lebih senyap pada apa yang dihasilkan oleh pintu itu. Satu pintu robot yang tercetus di tengah-tengah trajektori menyerahkan kepada seseorang satu lengan yang sedang bergerak pada postur (pose) yang sewenang-wenangnya. Satu pintu manusia membolehkan operator memilih saatnya — selepas capaian (reach), sebelum genggaman, bukan di tengah-tengah ayunan. Segmen pemulihan daripada kedua-duanya tidak sama bersihnya, dan segmen-segmen itulah keseluruhan hasil pusingan itu.
Mengapa bentuk berpintu manusia menang pada perkakasan sebenar
Ini adalah hujah kejuruteraan, bukan hasil penanda aras — tiada kertas kerja yang kami temui menjalankan kesemua lima pintu pada manipulator yang sama dengan kelas polisi yang sama. Ia bersandar pada empat perkara.
Pertama, penyelia sememangnya berada di situ. Tiada sesiapa membiarkan lengan SO-100 berjalan tanpa pengawasan di sebelah objek yang boleh ditumbangkannya. Sebaik sahaja seseorang sedang memerhati, kos tambahan (marginal cost) untuk memberikan mereka butang pengambilalihan adalah hampir sifar; membina satu penganggar risiko yang ditentukur adalah satu projek tersendiri.
Kedua, ketidakpastian yang benar-benar boleh anda ukur pada polisi moden selalunya adalah kuantiti yang salah. Kepala diffusion atau flow-matching menghasilkan varians merentasi kepingan (chunk) tindakan yang disampel, dan varians itu mencerminkan multimodaliti yang dilatih untuk diwakili oleh kepala tersebut, bukan ketidaktahuan epistemik tentang keadaan. Terma keraguan EnsembleDAgger menggunakan satu ensemble tepat untuk menangkap yang kedua. Kedua-duanya kelihatan seperti nombor yang sama tetapi tidak; entri action chunking dan flow matching membincangkan bagaimana kepala-kepala tersebut mengeluarkan tindakan pada asasnya.
Ketiga, kegagalan yang penting dalam manipulasi selalunya bersifat semantik, bukan luar biasa dari segi statistik. Satu polisi yang menutup penggenggam (gripper) dua sentimeter terlalu awal, atau mencapai dengan yakin ke arah kiub yang salah antara dua kiub serupa, tidak berada dalam keadaan varians tinggi — ia yakin dan silap. Tiada ambang varians yang menangkap itu; seseorang yang memerhati menangkapnya serta-merta.
Keempat, kualiti label — perkara asal HG-DAgger, dan yang paling kerap dilangkau. Label yang dikumpul semasa manusia memegang kawalan tanpa gangguan mengatasi label yang dinaratifkan ke atas sistem yang sedang bergerak. Jika matlamatnya ialah data pembetulan yang berbaloi untuk diagregat, beban pembuktian terletak pada pintu automatik.
Gambaran itu berbalik apabila seorang penyelia bertanggungjawab ke atas banyak robot — rejim yang disasarkan oleh kajian pengguna ThriftyDAgger dan pemformalan Fleet-DAgger. Dengan satu armada, perhatian manusia adalah sumber yang terhad dan satu peruntukan yang tidak sempurna masih lebih baik daripada tiada langsung. Dengan satu lengan pada satu meja, anda tidak berada dalam rejim itu.
Gelung berpintu manusia, sudah tersedia terpasang
Pengambilalihan semasa sesi inferens sedang berjalan, penanda intervensi per-bingkai pada segmen yang dibetulkan, penkuratan (curating) setiap larian menjadi pembetulan atau penilaian, penggubahan (composing) satu dataset campuran daripada sumber pilihan anda, dan penyambungan latihan daripada checkpoint sedia ada — semuanya terbina di dalam sistem, bukannya diskrip secara manual. Pengambilalihan berfungsi dengan lengan pemimpin (leader arm), atau dengan papan kekunci dan slider jika anda tidak mempunyainya.
Lihat bagaimana gelung DAgger berjalanPintu hanyalah separuh daripada kaedah; pengendalian data adalah separuh yang lain
Satu pintu menentukan bingkai mana yang dipandu oleh manusia, bukan apa yang perlu dilakukan dengannya, dan keputusan kedua itulah yang paling kerap membazirkan pusingan. Peraturan pertama ialah yang diwakili oleh huruf D dalam DAgger: agregat, jangan gantikan. Melakukan fine-tuning ke atas satu checkpoint semata-mata pada beberapa ratus bingkai pembetulan memberi anda satu model yang hampir tidak pernah melihat apa-apa selain pemulihan dan telah melupakan trajektori normal.
Peraturan kedua ialah bingkai intervensi bukanlah bingkai biasa. Mandlekar et al. membina satu sistem teleoperasi jarak jauh untuk manipulasi 6-DoF yang membenarkan operator memantau polisi dan mengambil alih apabila berlaku kegagalan, kemudian melatih secara berulang (iteratively) dengan satu algoritma yang "encourages the policy to learn how to traverse bottlenecks through the interventions"; ejen yang dilatih dengan data itu mengatasi ejen yang dilatih dengan bilangan sampel demonstrasi biasa yang sama. Sirius membawa idea ini ke tahap penggunaan sebenar, "re-weighing training samples with approximated human trust and optimizing the policies with weighted behavioral cloning". Kedua-duanya memerlukan penanda per-bingkai tentang apa yang dipandu oleh manusia, itulah sebabnya penanda intervention lebih penting daripada yang kelihatan.
Peraturan ketiga ialah pencampuran automatik adalah satu perangkap. Satu dataset gubahan yang sumbernya tidak dapat anda senaraikan adalah satu dataset yang tidak dapat anda nyahpepijat (debug) apabila pusingan seterusnya menjadi lebih buruk. Atas sebab itu, pada platform ini langkah compose adalah eksplisit — dataset asal ditambah pembetulan, pemilihan episod mengikut sumber, dan hasilnya ialah satu dataset LeRobot biasa yang disegerak dan dilatih seperti mana-mana yang lain; dokumentasi dataset membincangkan bahagian format.
| Langkah dalam satu pusingan | Apa yang dihasilkannya | Cara paling biasa ia menjadi silap |
|---|---|---|
| Jalankan inferens dengan rakaman dihidupkan | Satu larian di bawah taburan keadaan polisi itu sendiri | Dirakam sebagai teleoperasi biasa, kehilangan fakta bahawa satu polisi sedang memandu |
| Ambil alih apabila berlaku kegagalan | Segmen pembetulan dengan penanda intervensi per-bingkai | Membetulkan gegaran kosmetik, mengajar gaya dan bukannya satu pemulihan |
| Kuratkan setiap episod | Pembetulan, penilaian, atau buangan | Menyimpan segala-galanya; satu pengambilalihan yang tersasar lebih memberatkan daripada nilai episod itu sendiri |
| Segerakkan pembetulan | Satu dataset berversi di sebelah yang asal | Pembetulan yang tidak pernah meninggalkan mesin tempatan |
| Gubah dataset campuran | Asal ditambah pembetulan, pemilihan eksplisit | Pencampuran-automatik senyap, menyebabkan kemerosotan kemudian tidak dapat dikesan kembali ke sumbernya |
| Sambung daripada satu checkpoint | Satu checkpoint yang dimulakan daripada yang sebelumnya | Menjangka penyambungan semula optimizer; pemberat hanya memulakan model, ia tidak memulihkan keadaan optimizer |
Menetapkan satu pintu yang benar-benar boleh dipegang seseorang
"Manusia yang menentukan" bukanlah satu spesifikasi. Dua operator dengan ambang yang berbeza menghasilkan pusingan yang tidak boleh dibandingkan, dan satu ambang yang melencong (drifting) menghasilkan trend yang tidak dapat dibaca. Tuliskan pencetus (triggers) sebelum larian pertama.
- Namakan syarat-syarat yang membuka pintu itu — capaian (approach) tersasar melebihi margin tetap, penggenggam menutup pada kekosongan, satu sendi melencong ke arah had, kebuntuan (stall) lebih daripada satu atau dua saat — dan kekalkan senarai itu tanpa perubahan sepanjang pusingan.
- Namakan juga apa yang tidak membuka pintu itu. Terlajak (overshoot) yang dipulihkan sendiri oleh polisi adalah isyarat latihan; mengambil alih di situ memadamkan satu pemulihan yang sudah diketahuinya.
- Ambil alih cukup awal untuk penyerahan yang bersih, dan serahkan kembali sebaik sahaja keadaan boleh dipulihkan.
- Catatkan sebab anda mengambil alih, bagi setiap episod. Tiga pusingan kemudian, itulah satu-satunya rekod sama ada kegagalan yang sama berulang.
- Kekalkan kamera, teks tugas dan operator tetap merentasi pusingan. Ubah satu sahaja dan nombor-nombor itu tidak lagi boleh dibandingkan.
Dari segi mekanikal, penyerahan mempunyai dua varian. Dengan lengan pemimpin (leader arm), pemimpin perlu mencapai postur semasa pengikut (follower) sebelum tork dipindahkan, jika tidak lengan itu akan tersentak; pergerakan penjajaran ini adalah bahagian rantaian yang paling kurang diuji pada perkakasan sebenar. Tanpa lengan pemimpin, pengambilalihan adalah manual sejak ketukan kekunci pertama: pengikut ditahan dan operator menolaknya sendi demi sendi daripada papan kekunci atau menyeret slider, dengan penyekat (clamp) di bahagian pelayan mengekalkan setiap input kecil — beberapa darjah bagi setiap ketukan kekunci, sedikit bagi setiap kemas kini slider, kerana satu langkah besar ke dalam postur yang ditahan adalah cara servo menjadi rosak (strip). Versi langkah demi langkah dengan pemetaan kekunci terdapat dalam panduan lengkap satu pusingan DAgger pada SO-100; latar belakang bagi kedua-dua mod teleoperasi terdapat dalam dokumentasi teleoperasi dan entri pemimpin-pengikut (leader-follower).

Membaca sama ada pintu itu memberi sebarang kesan
Metrik bagi satu pusingan berpintu manusia ialah kadar intervensi: bingkai intervensi dibahagikan dengan bingkai larian tersebut. Ia mempunyai satu tugas — jika ia tidak menurun merentasi pusingan, pusingan itu tidak membeli apa-apa, dan pusingan seterusnya perlu mengubah sesuatu selain jumlah data.
Ia adalah metrik yang berat sebelah (biased) dan anda perlu tahu bagaimana. Ia mengukur ambang operator sama banyak dengan kecekapan polisi, itulah sebabnya senarai pencetus kekal tetap; seorang operator yang semakin longgar sepanjang satu sesi menghasilkan lengkung menurun tanpa sebarang makna di sebaliknya. Ia juga mengabaikan keterukan — sepuluh bingkai untuk menghentikan satu perlanggaran dan sepuluh untuk menolak sedikit satu genggaman kelihatan serupa. Padankan ia dengan satu set penilaian tetap yang tidak pernah diambil data pembetulan daripadanya. Artikel mengenai pengukuran satu gelung DAgger membincangkan reka bentuk penilaian secara terperinci, termasuk cara mengekalkan episod penilaian di luar campuran latihan.
- Berfungsi sejak hari pertama, pada mana-mana seni bina polisi, tanpa model tambahan untuk ditentukur
- Menangkap kegagalan yang yakin-tetapi-silap yang tidak dapat dikesan oleh mana-mana ambang varians
- Menghasilkan pembetulan yang dirakam semasa operator memegang kawalan penuh, pada saat yang mereka pilih sendiri
- Menghasilkan penanda per-bingkai yang digunakan oleh kaedah berpemberat-intervensi seperti IWR dan Sirius
- Memerlukan penyeliaan berterusan; ia tidak berskala untuk seorang dan banyak robot
- Bergantung kepada konsistensi operator — satu ambang yang melencong merosakkan kadar intervensi
- Tidak menghasilkan sebarang model risiko dengan sendirinya; ambang terlatih HG-DAgger dan penganggar ThriftyDAgger adalah jentera tambahan
- Mengira bingkai, bukan akibat
- Tidak dapat menyelamatkan satu polisi yang kegagalannya berpunca lebih awal daripada kawalan, seperti kamera yang tertukar atau rentetan tugas yang salah label
Soalan terbuka yang perlu terus diberi perhatian
Penanda aras (benchmark) yang ada adalah lemah. Spencer dan rakan-rakan meneliti penanda aras yang digunakan untuk menguji pendekatan pembelajaran peniruan dan mendapati ia "realizable and simple and thus insufficient for capturing the harder regimes of error compounding seen in real-world decision making problems" — dan, berbeza daripada literatur sekeliling, mendapati behavior cloning biasa berprestasi baik padanya. Itu adalah sebab untuk bersikap skeptikal terhadap sebarang kedudukan (ranking) varian DAgger yang bersandar pada tugas-tugas tersebut, termasuk sesetengah angka dalam jadual di atas.
Pintu robot pada polisi besar juga belum diselesaikan. Kerja AIM menggantikan ketidakpastian dengan satu fungsi-Q proksi yang meniru peraturan intervensi manusia dan melaporkan peningkatan 40% dalam kos pengambilalihan dan kecekapan pembelajaran berbanding ThriftyDAgger — dalam kawalan selanjar (continuous) dan diskret, bukan pada satu model vision-language-action yang memandu satu manipulator. Sama ada mana-mana pintu ini boleh dipindahkan kepada satu VLA yang di-fine-tune masih terbuka untuk dikaji. Kajian ulasan itu turut membuat satu perkara berkaitan: terminologi dan struktur bidang ini tidak bersatu merentasi literatur, yang menyukarkan perbandingan kaedah. Pada lengan anda sendiri, log andalah bukti yang anda ada.
Adakah HG-DAgger benar-benar DAgger jika manusia hanya melabel semasa intervensi?▾
Ia mengekalkan bahagian yang penting — data yang dikumpul di bawah taburan keadaan yang diinduksi oleh pembelajar, diagregat dengan apa yang datang sebelumnya — dan membuang bahagian yang tidak bertahan apabila bersentuhan dengan perkakasan. Kelly et al. mempersembahkannya sebagai satu varian; jaminan no-regret tahun 2011 tidak terpakai tanpa perubahan.
Bolehkah saya menggunakan satu pintu robot pada satu polisi VLA yang di-fine-tune pada satu SO-100?▾
Tidak semudah itu. Pengelas SafeDAgger memerlukan satu polisi rujukan yang boleh disoal yang anda tidak miliki. EnsembleDAgger memerlukan satu ensemble, yang bagi satu model berbilion parameter bermaksud beberapa salinan dalam memori ditambah kos inferensnya. ThriftyDAgger memerlukan satu penganggar risiko yang dilatih pada kejayaan dan kegagalan yang belum wujud sebelum pusingan pertama anda.
Berapa lamakah satu pengambilalihan tunggal sepatutnya berlangsung?▾
Cukup lama untuk mencapai satu keadaan yang boleh diteruskan oleh polisi, dan tidak lebih lama daripada itu: pengambilalihan yang dilanjutkan mengubah larian itu menjadi satu sesi demonstrasi dan membanjiri set pembetulan dengan tingkah laku normal. Penemuan LazyDAgger turut memotong pada arah yang satu lagi — terlalu banyak suis yang sangat pendek juga mempunyai kosnya sendiri.
Patutkah saya melatih hanya pada segmen yang telah dibetulkan?▾
Tidak — itu adalah cara paling biasa untuk membazirkan satu pusingan. Satu model yang di-fine-tune hanya pada pemulihan hampir tidak pernah melihat apa-apa selain pemulihan. Campurkan pembetulan ke dalam dataset asal dengan sumber yang dipilih secara eksplisit; untuk melangkah lebih jauh, lihat pendekatan berpemberat-intervensi seperti IWR atau Sirius, yang menambah pemberat pada bingkai yang dipandu manusia dan bukannya mengasingkannya.
Bagaimana jika kadar intervensi tidak menurun selepas satu pusingan?▾
Terimalah seadanya: pusingan itu tidak membantu. Sebelum menambah lagi pembetulan, periksa dahulu penjelasan yang lebih murah — adakah ambang operator melencong, adakah pembetulan itu sekadar kosmetik, adakah dataset gubahan itu benar-benar mengandunginya, adakah latihan dimulakan daripada checkpoint yang dimaksudkan. Satu pusingan yang secara senyap bermula daripada model asas kelihatan sama persis seperti satu pusingan yang gagal belajar.
Adakah bukan-intervensi membawa maklumat?▾
Di bawah Expert Intervention Learning, ya: tempoh di mana penyelia memerhati dan tidak bertindak dibaca sebagai bukti lemah bahawa keadaan dan tindakan itu boleh diterima, diformalkan sebagai satu kekangan pada fungsi nilai. Kebanyakan saluran paip (pipeline) praktikal, termasuk yang ini, hanya menandakan apa yang dipandu oleh manusia.
Bagi satu lengan tunggal di atas satu meja, pilihannya sudah dibuat: pegang sendiri pintu itu, tuliskan apa yang membukanya, dan curahkan usaha pada pengendalian data di sebaliknya berbanding pada mengautomasikan suis itu. Bahagian platform diterangkan pada halaman gelung DAgger, pilihan latihan mengikut keluarga polisi di bawah latihan dan harga. Untuk latar belakang, mulakan dengan pembelajaran peniruan dan pembelajaran peniruan pada SO-100; untuk larian pertama, jalankan polisi pertama anda adalah laluan yang lebih pendek.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started