Tabletop na workspace ng robot, ng uring ginagamit bilang fixed evaluation setup para sa paulit-ulit na policy run
DAggerEbalwasyonImitation LearningDatos ng RobotSO-100

Pagsukat sa Isang DAgger Loop: Intervention Rate, Evaluation Protocol, at ang mga Patibong sa Pagitan

AY-Robots ResearchAugust 27, 202615 minutong babasahin

Ang intervention rate — intervention frames hinati sa frames ng run — ang pinakamurang tapat na progress signal na taglay ng isang human-gated DAgger loop. Dine-define ito ng artikulong ito para magkapareho ang value na kinukuha ng dalawang tao sa pagkalkula, ipinapakita kung paano ito i-log, at sinusuri ang apat na paraan kung paano ito nakapagliligaw sa iyo: operator habituation, isang lumilihis na evaluation setup, pag-train lamang sa mga correction, at isang taong iba ang paraan ng pag-correct tuwing Martes kumpara sa Lunes.

Pakiramdam mo produktibo ang isang DAgger round habang nasa gitna ka nito. Dinadrive mo ang policy, kinukuha mo ang kontrol kapag napalpak nito ang grasp, sine-save ang mga correction, nagre-retrain, at ang susunod na run ay mukhang — masisigurado mo — medyo mas smooth. Pagkalipas ng dalawang round, hindi mo na masasabi kung may nagbago talaga, dahil ang "medyo mas smooth" ay hindi isang dami (quantity).

Kailangan ng loop ng isang numero kada round, at sa isang human-gated loop, halos libre ang numerong iyon: ang bahagi (fraction) ng run kung kailan ikaw, hindi ang policy, ang may kontrol. Dine-define ito ng artikulong ito para magkatugma ang value na kinukuha ng dalawang tao, ino-log ito, binabasa ang resultang curve, at binabanggit ang apat na paraan kung paano ito nakapagliligaw kapag mag-isa lang ito. Para sa teoryang ipinapalagay ng artikulong ito, tingnan ang ang paliwanag sa DAgger at ang human-gated na variant; ang hands-on na katapat nito ay pagpapatakbo ng isang DAgger loop sa isang SO-100.

Ang Maikling Bersyon

  • Intervention rate = intervention frames / frames ng run. Frames, hindi episodes, at kasama sa denominator ang mga frame na ginugol mo sa pag-correct.
  • Ang isang patag (flat) na curve sa loob ng tatlong round ay nangangahulugang walang naidudulot ang mga round na iyon — baguhin ang mixture, ang checkpoint, o ang task sa halip na mangolekta pa ng ikaapat.
  • Ang bumababang intervention rate ay hindi katumbas ng tumataas na success rate. Bumababa ang iyong threshold para sa pakikialam habang lumalaki ang tiwala (trust).
  • Kung walang frozen na evaluation protocol — parehong start pose, mga bagay (objects), camera, bilang ng trial — sinusukat mo na lang ang kuwarto.
  • Ang pag-train lamang sa mga correction ay nagpapaliko (skew) sa state distribution. Ang sagot ng IWR: kumuha ng intervention at non-intervention na sample nang pantay-pantay ang proporsyon.

Bakit Kailangan Talaga ng Numero ang Isang Round

Umiiral ang DAgger dahil sa isang problema sa distribution, at ang mga problema sa distribution ay hindi nakikita ng mata. Ipinakita nina Ross at Bagnell na ang imitation learning sa isang fixed demonstration set ay humahantong sa compounding errors at isang regret bound na lumalaki nang quadratic sa time horizon: kapag umalis na ang learner sa mga state na binisita ng demonstrator, walang laman sa datos na magsasabi kung paano bumalik. Inaayos ito ng DAgger sa pamamagitan ng pag-iterate — patakbuhin ang policy, i-label ang mga state na binibisita nito, i-aggregate, mag-retrain — na binalangkas nina Ross, Gordon, at Bagnell bilang isang reduction sa no-regret online learning.

May bunga ang pagbalangkas na ito na kadalasang nilalaktawan ng mga tao. Ang guarantee ay tungkol sa sunod-sunod na policy sa mga iteration, hindi sa isang solong run. Wala itong sinasabi tungkol sa kung ang iyong round three ay nakatulong. Ang tanging paraan para malaman ito ay sukatin ang bawat iteration. Ipinakilala nina Kelly at mga kasamahan ang HG-DAgger dahil sa classic DAgger, hinihingi sa expert ang action labels habang ang novice pa rin ang may kontrol, na sa argumento ng papel ay maaaring magpababa ng safety at, sa kaso ng human expert, malamang na maghihina ang kalidad ng label dahil sa naramdamang actuator lag. Natututo rin ang HG-DAgger ng safety threshold para sa isang risk metric na batay sa model-uncertainty, at inirereport nitong mas magaling ang performance kaysa parehong DAgger at behavioural cloning sa isang driving task. Wala itong pinapublish na intervention count; ikaw mismo ang gumagawa noon.

Pagde-define sa Rate Para Magkatugma ang Numero ng Dalawang Tao

Isang linya lang ang definition: intervention frames hinati sa frames ng run. Nakatago ang lahat ng kahirapan sa kung ano ang binibilang na frame at kung ano ang binibilang na run.

Frames, Hindi Episodes

Walang kwenta ang pagbilang ng episodes na may kahit isang intervention: sampung episode na may isang maliit na correction (nudge) bawat isa at sampung episode kung saan ikaw ang nagmaneho ng walumpung porsyento — pareho lang ang resulta: "10/10". Pinaghihiwalay sila ng bilang ng frame, at ito na nga ang granularity na taglay na ng recording — sa LeRobot dataset format bawat timestep ay isang row, kaya ang intervention flag ay isang boolean column lang sa tabi ng state at action. Dito, isinusulat ito kada frame sa mismong sandali na magsimula ang takeover at binubura kapag bumalik na ang kontrol.

Kasama sa Denominator ang mga Correction

May dalawang denominator na makatwiran — kabuuang frame ng run, o mga frame kung saan ang policy mismo ang nagmaneho — at malayo ang agwat nila sa mataas na antas ng intervention. Kung 400 sa 1000 frame ang inagaw mo, ibibigay ng una ang 40 porsyento, ng pangalawa ang 67 porsyento. Ang paghahambing ng isang round na sinukat sa unang paraan laban sa susunod na sinukat sa pangalawang paraan ang dahilan kung bakit nawawala ang isang tunay na pag-unlad. Gamitin ang kabuuang frame at huwag na itong babaguhin sa gitna ng series.

Magpasya Nang Isang Beses Kung Ano ang Mangyayari sa mga Handover Frame

Palaging may tahi (seam). Kapag lumilipat ang kontrol, may mga frame na hindi kabilang sa alinmang panig: nakahawak ang braso, nag-aalign ang leader, nakafreeze ang recording. Sa pipeline na ito, nananatili ang mga handover frame na ito sa raw stream at hindi kailanman pumapasok sa curated na episode — hindi sila kabilang sa policy behaviour ni isang correction na sulit i-train. Bilangin ang tahi (seam) sa parehong paraan sa bawat round: sa 30 Hz, anim na takeover na may dalawang-segundong tahi bawat isa ay 360 frame — sapat na para umusog ang isang percentage point.

Ang Tatlong Desisyon na Sumisira sa Comparability

Frames o episodes; kabuuang run o autonomous-only; kasama o wala ang handover frame. Kapag tahimik na nabago ang alinman sa tatlong ito sa pagitan ng mga round, nawawalan ng saysay ang curve. Isulat ang lahat ng tatlo.

Pag-log Nito Para Mabuhay ang Numero Kahit Matapos ang Session

Ang isang metric sa status panel ng isang tumatakbong proseso ay isang readout lamang: nawawala ito pagka-restart at hindi ito magagawang i-plot. Isang append-only na linya kada run ang sumasakop sa buong series — kasama kung aling checkpoint ang dinrive mo, dahil nagbabago ito sa bawat round at ang paghahalo dito ay nagpapawalang-bisa sa susunod.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Isang linya kada run. Mas mahalaga ang pag-record ng denominator at handover convention sa tabi ng numero kaysa sa mga pangalan ng field.

Dalawang field ang may bigat. train_mix ang ipinakain mo sa susunod na training job; kung wala ito, wala nang maiaatribwido. eval_protocol ang nagbibigay ng pangalan sa fixed test na pinatakbo mo pagkatapos, at ito ang field na madalas na naiiwang blangko. Sa ay-robots cockpit, ang takeover status ay nag-uulat ng intervention frame count para sa tumatakbong session, kaya ang pag-log ay transcription na lang, hindi instrumentation; sinasakop ng dataset documentation kung saan napupunta ang mga per-frame column.

Training configuration matrix na nagpapakita ng mga policy, dataset, at checkpoint nang magkatabi
Nagbabago ang checkpoint at dataset mix sa bawat round. Ang isang numero na hindi na-record ang kombinasyon ay hindi na maiaatribwido.

Pagbasa sa Curve: Tatlong Round, Isang Pasya

Tatlong round ang minimum para makapagbasa, dahil dalawang punto ay palaging isang linya lamang. Ang talahanayan sa ibaba ay isang bookkeeping template na may placeholder na numero, hindi sukat mula sa anumang aktwal na run. Ang hinahanap mo ay isang monotone na pagbaba na katumbas ng pagtaas sa success sa isang fixed test.

RoundCheckpoint na DinriveFramesIntervention FramesRateSuccesses (sa 20)
0 (baseline)base policy5 9001 38023.4 %7
1mula sa mix ng round 05 61098017.5 %10
2mula sa mix ng round 15 41261111.3 %11
3mula sa mix ng round 25 38059811.1 %12

Gumagana ang round one at two. Hindi ang round three: ang 11.3 laban sa 11.1 porsyento ay nasa loob pa rin ng run-to-run variation ng anumang sinusukat sa isang pisikal na braso, at ang ikaapat na round ng parehong uri ng correction ay gugugol ng isang hapon nang walang kabuluhan. Sinasabi ng patag (flat) na segment na baguhin ang isang bagay na estruktural.

  • Ang mga natitirang kabiguan ay hindi maaayos sa pamamagitan ng teleoperation — bagay na hindi maabot, geometry ng gripper, isang joint na nasa hangganan na nito. Walang correction data ang makakaayos sa isang kinematic na pader.
  • Masyadong kaunti ang mga correction laban sa base dataset para maiusog ang gradient, at walang nagbibigay sa kanila ng timbang (weight).
  • Nagkakasalungatan ang mga correction, kaya ini-average ng policy ang dalawang estratehiya at napupunta sa pagitan nila.
  • Nasa itaas (upstream) ang kabiguan: gumalaw ang isang camera, nagbago ang ilaw, hindi na tugma ang wrist view sa training.
  • Nasa ceiling na ng klaseng ito ng policy sa hardware na ito ang task, at ang susunod na hakbang ay dagdag pang base data.

Ang huling dalawa ay hindi kabiguan ng loop. Sa Sirius-Fleet, ang bumababang pangangailangan sa tao ay ang idinisenyong resulta: habang bumubuti ang autonomy ng robot, inaadapt ng mga anomaly predictor nito ang kanilang prediction criteria, na humahantong sa mas kaunting kahilingan para sa human intervention at unti-unting pagbaba ng human workload sa paglipas ng panahon. Doon, sinasadyang mag-adapt ang criterion. Sa isang manual na loop, ang sa iyo ay umaadapt din, ngunit tahimik — kaya ang isang rate na pumapatag dahil nasa ceiling na ang task ay eksaktong kamukha ng isang rate na pumatag dahil huminto na ang operator sa pagpansin. Ito na ang susunod na problema.

Patibong 1: Ang Bumababang Rate ay Hindi Katumbas ng Tumataas na Success Rate

Sinusukat ng intervention rate ang eksaktong isang bagay: kung gaano karaming bahagi ng run ang pinili mong angkinin (own). Ikaw ang gumagawa ng desisyong iyon, sa real time, at ito ay gumagalaw. Sa round zero, inaagaw mo ang kontrol sa unang masamang approach angle; pagdating ng round three, napanood mo nang gumaling ang policy mula sa isang dosenang katulad nito, kaya hinayaan mo itong subukan. Gumalaw ang iyong threshold; ang policy ay maaaring hindi. Bumababa ang rate sa magkabilang kaso.

Ang human trust ay hindi bababa sa isang modelled na dami (quantity) sa literatura sa halip na isang ipinapalagay na constant. Muling nagtitimbang (re-weight) ang Sirius sa mga training sample gamit ang approximated human trust at ino-optimize ang policy gamit ang weighted behavioural cloning, na nag-uulat ng 8 porsyentong pagtaas sa simulation at 27 porsyento sa real hardware kumpara sa state of the art sa policy success rate, sa doble ring bilis ng convergence. Tinuturing nito ang trust bilang isang weight sa datos. Hindi nito inaayos ang threshold sa isipan mo sa pagitan ng round zero at round three.

Hindi mo maaalis ang drift, kaya ipares ang rate sa isang bagay na hindi kayang salingin ng iyong threshold: isang fixed set ng trial kung saan hindi ka kikilos (intervene) kahit kailan, na sinusukat laban sa isang criterion na isinulat bago ang round. Ang isang rate na bumababa habang nananatiling pareho ang kaparehang success rate ay ang senyales ng habituation — dapat itong mahuli, dahil mula sa loob ng loop, parang progress ito sa pakiramdam.

Intervention rateSuccess rate sa fixed protocolPinakamalamang na Pagbasa
bumababatumataasGumana ang round. Magpatuloy.
bumababapatagLumihis ang iyong threshold, o inalis ng mga correction ang effort nang hindi inaalis ang mga kabiguan.
bumabababumababaSinisira (degrade) ng mga correction ang policy. Suriin ang mixture at ang internal consistency nila.
patagpatagWalang naidulot ang round. Baguhin ang mixture, checkpoint, o task bago mangolekta pa.
tumataasbumababaRegression. Pagdudahan muna ang training mix, isang binagong camera, o isang checkpoint mix-up bago pagdudahan ang method.

Patibong 2: Kung Walang Fixed Protocol, Kuwarto ang Sinusukat Mo

Mahal at mahirap ulitin ang real-robot evaluation. Ini-motivate ng mga may-akda ng SIMPLER ang simulated evaluation sa pamamagitan ng obserbasyon na ang real-world evaluation ng ganitong uri ng policy ay hindi scalable at humaharap sa mga hamon sa reproducibility na malamang lalala habang lumalawak ang task spectrum ng mga policy. Nilalapitan ito ng RoboArena mula sa kabilang panig, gamit ang mahigit 600 pairwise real-robot evaluation episode sa pitong generalist policy, na pinatakbo ng mga evaluator sa pitong akademikong institusyon gamit ang DROID platform. Pinipili ng mga evaluator nito ang sarili nilang task at environment ngunit kailangan nilang husgahan ang mga pares ng policy nang double-blind; iniuulat ng papel na ang crowd-sourced na ranking na ito ay mas tumpak na sumusubaybay sa performance ng generalist-policy kaysa sa kombensyonal, centralized na evaluation.

Hindi ka makakapagpatakbo ng 600 pares na episode sa isang SO-100 sa isang workshop. Ang kaya mong gawin ay alisin ang variance na kontrolado mo — isang listahang boring na kadalasa'y nilalaktawan.

DimensyonI-freeze ItoAno ang Lilihis Kung Hindi
Start PoseIsang nakasulat na home position, dinrive bago ang bawat trialNagsisimula ang trajectory na out of distribution
Mga Bagay (Objects)Mga taped na marka, at ang parehong pisikal na mga bagay na nakalaan para sa evaluationAng isang 'mas magandang' policy ay talagang isang mas malapit na bagay lamang
Mga Camera at IlawParehong mounts, indices, exposure; nakasara ang blinds; kunan ng litrato ang setupAng pagpalit lamang ng camera indices ay maaaring mangibabaw sa resulta
Mga Trial at Stop RuleFixed na n, fixed na timeout, criterion na isinulat bago ang roundGinagawa ng post-hoc na criteria ang mga near-miss sa kahit ano ang kailangan mo
Ugali ng OperatorWalang intervention sa panahon ng evaluation trialNagiging isa pang correction session ang evaluation

Pagkatapos ay ang arithmetic, na walang patawad sa bilang ng trial na kayang tustusan ng isang workshop. Sa ilalim ng normal approximation, ang 60 porsyentong success sa 20 trial ay may standard error na malapit sa 11 percentage point — ang square root ng 0.6 na pinarami sa 0.4 hinati sa 20 — at ang pagkakaiba sa pagitan ng dalawang ganitong round ay may bitbit na humigit-kumulang 15. Kaya ang tumalon mula 60 tungo sa 70 porsyento ay konsistent pa rin sa walang nangyaring pagbabago. Ang limampung trial ay nagbababa ng per-round na figure sa humigit-kumulang 7 puntos, at nangangailangan ng isang hapon.

Ang asymmetry na ito ang argumento para sa intervention rate: kinakalkula sa libo-libong frame sa halip na dalawampung binary na outcome, gumagalaw ito nang mas maaga at mas maayos (smooth). Ang caveat ay malaki ang correlation ng mga frame sa loob ng isang episode — isang masamang grasp ay nagbubunga ng daan-daang magkakasunod na intervention frame — kaya ang effective sample size ay mas malapit sa bilang ng mga takeover. Ituring ang rate bilang early indicator at ang success rate bilang mabagal na ground truth.

Panatilihin ang mga Evaluation Episode Wala sa Training Pool

Ang mga evaluation episode ay hindi dapat kailanman pumasok sa composed training dataset — kung hindi, ang round n+1 ay sinusukat gamit ang datos na pinag-training rin dito, at ang curve ay nagsusukat na lang ng memorisation.

Patibong 3: Ang Pag-train Lamang sa mga Correction ay Bumabaluktot sa Policy

Ang mga correction ang kawili-wiling datos, kaya ang instinct ay i-train ang mga ito. Huwag. Nagmumula sila, sa likas na paraan, mula sa makitid na hiwa (slice) ng state space kung saan nabigo na ang policy, at halos wala silang sinasabi tungkol sa karamihan ng run na gumana. Kung fine-tune ka lamang sa hiwang iyon, magkakaroon ka ng policy na magaling gumaling mula sa isang napalpak na approach ngunit nakalimutan na kung paano gumawa ng isang malinis na approach.

Ginawa nina Mandlekar at mga kasamahan ang kanilang remote intervention system batay dito. Ang kanilang pagbalangkas: naglalaman ang mga manipulation task ng bottleneck region na nangangailangan ng sunod-sunod na tumpak (precise) na aksyon — ang paglagay ng pod sa loob ng isang coffee machine ang kanilang halimbawa — kung saan ang maliliit na deviation ay humahantong sa mga state na hindi kailanman nasakop ng mga demonstration. Ang kanilang algorithm ay nagti-train nang paulit-ulit (iteratively) sa bagong datos para matutunan ng policy na tumawid sa mga bottleneck na iyon, at inireport nilang ang mga agent na trained sa intervention data ay natatalo ang mga agent na trained sa katumbas na bilang ng sample mula sa non-interventional na mga demonstrator.

Corrections-only na Fine-tuning Laban sa Isang Composed na Mixture
Ang Nakukuha Mo sa Corrections-only
  • Mabilis: isang maikling run sa ilang dosenang episode ay mura nang sapat para ulitin
  • Targeted: pinangungunahan ang gradient ng mga state na pinapahalagahan mo
  • Mura para subukan kung natutunan talaga ang isang correction style
Ang Halaga Nito
  • Hindi na kahawig ng task distribution ang fine-tune distribution
  • Maaaring lumala nang halata ang nominal na ugali sa loob ng iisang round
  • Maaaring bumaba ang rate habang bumabagsak din ang success kasabay nito — ipinagpalit ang malilinis na segment para sa mga recovery

Ang mixing ratio ay isang hyperparameter at karapat-dapat na isulat. Ang pag-compose ng susunod na dataset ang siyang pagpapasyahan dito: orihinal na demonstration kasama ang correction set, kung saan ang episode selection ay malinaw kada source sa halip na isang rule na tahimik na kumukuha kung anuman ang available. Dito, iyon ay isang compose step lamang sa cockpit, at ang resulta ay isang ordinaryong dataset — tingnan ang training documentation. Ang hindi ginagawa ng kahit anong tool para sa iyo ay ang pag-record kung aling ratio ang gumawa ng aling curve.

Patibong 4: Ang Tao ay Hindi Isang Consistent na Expert

Ipinapalagay ng teorya ng DAgger na may isang expert. Hindi ka isa sa teknikal na kahulugan: ang mga correction mo ay hindi mga sample mula sa isang fixed conditional distribution sa ibabaw ng mga aksyon. Binabanggit ito ng mga may-akda ng ACT nang ilista nila ang mga balakid sa fine manipulation — ang mga error ay nagko-compound sa paglipas ng panahon, at ang mga human demonstration ay maaaring non-stationary. Ang kanilang sistema ay umaabot pa rin sa 80 hanggang 90 porsyentong success sa anim na tunay na task mula sa sampung minuto ng demonstration, kaya ang problema ay masosolusyunan (tractable), hindi wala.

Ipinapakita ng pag-aaral ng robomimic ang parehong punto mula sa panig ng datos. Sa anim na offline algorithm sa limang simulated at tatlong real-world multi-stage task, kabilang sa mga aral nito ang sensitivity sa mga desisyon sa disenyo, pagdepende sa kalidad ng demonstration, at — ang pinakasumasakit dito — ang variability na nagmumula sa stopping criteria, dahil magkaiba ang training at evaluation objectives. Ang checkpoint na may pinakamababang loss ay hindi palaging siya ring may pinakamataas na success rate.

May bersyon nito sa hardware: hinuhubog ng input mode ang correction. Ang isang leader-follower na setup ay gumagawa ng tuluy-tuloy, human-paced na mga trajectory. Ang mga keyboard nudge ay mahigpit na kinakapit (clamp) ng server — dalawang degree kada call sa arm joints, apat sa gripper — kaya ang parehong intensyon ay dumarating bilang isang hagdanan ng maliliit na hakbang. Ang mga slider ay nagpapadala ng absolute target at ang server ay gumagalaw ng hanggang anim na degree patungo sa mga ito kada call. Tatlong mode, tatlong action distribution; ang paghahalo ng lahat ng tatlo sa isang correction set at pagkatapos ay pagtataka kung bakit naging twitchy ang approach ay sarili mong kagagawan. Sinasakop ng teleoperation documentation kung ano ang ipinapadala ng bawat mode.

Pagtimbang sa mga Intervention: IWR at ang Sumunod Dito

Kung ang mga correction ang mahalagang minorya, ang prinsipyadong ayos ay weight sa halip na exclusivity. Ang Intervention Weighted Regression ang reference implementation: hinahati (partition) ang datos sa intervention at non-intervention na sample, at ang dalawang partition ay sinasample nang pantay-pantay na proporsyon habang nagta-training. Ang isang correction set na limang porsyento lamang ng mga frame ay nag-aambag pagkatapos ng kalahati ng gradient, nang hindi nawawala ang nominal na ugali mula sa distribution.

Ang pantay na proporsyon ay isang panimulang punto, hindi isang batas. Ginagawang mas heneral (generalize) ito ng Sirius sa pamamagitan ng pagpapalit sa binary partition ng isang continuous na weight mula sa approximated human trust; inililipat ng Sirius-Fleet ang desisyon paitaas (upstream), gamit ang isang visual world model at mga anomaly predictor para magpasya kung kailan pa lamang hihingin ang tao. Ang karaniwang sinulid: ang intervention flag ay isang training signal, hindi lang isang bookkeeping column.

MethodSino ang Nagpapasya Kung Kailan Kikilos ang TaoPaano Ginagamit ang Intervention DataIniulat na Resulta
DAgger (2011)Fixed na iskedyul; ni-label ng expert ang mga binisitang stateIsang lumalaking dataset, walang weightBinalangkas bilang isang reduction sa no-regret online learning
HG-DAgger (2019)Ang tao, gumagate ng kontrol sa isang tunay na sistemaAggregated; kasama ang isang natutunang safety threshold sa model uncertaintyMas magaling kaysa DAgger at BC sa driving; walang ibinigay na intervention count
IWR (2020)Ang tao, sa pamamagitan ng remote teleoperationIntervention at non-intervention na sample, kinuha nang pantay-pantay ang proporsyonNatatalo ang non-interventional na demo sa parehong bilang ng sample
Sirius (2022)Ang tao, habang naka-deployWeighted BC, ang weight ay mula sa approximated human trust8% na gain sa simulation, 27% sa real hardware; 2x mas mabilis na convergence
ThriftyDAgger (2021)Ang sistema, gumagate batay sa novelty at riskInteractive na koleksyon sa ilalim ng isang supervision budgetUser study (N=10): 58% mas mataas na human at 80% mas mataas na robot performance kaysa sa susunod na pinakamahusay na method
Fleet-DAgger (2022)Ang sistema, naglalaan ng atensyon sa buong fleetFleet learning na sinusukat sa pamamagitan ng Return on Human EffortHanggang 8.8x na mas mataas na ROHE kaysa sa mga baseline
Sirius-Fleet (2024)Mga anomaly predictor na may self-adapting na criteriaMulti-task learning gamit ang isang visual world modelMas kaunting intervention request habang bumubuti ang autonomy
Leaderboard view na naghahambing ng mga robot policy ayon sa sinukat na iskor
Ang pag-rank ng mga policy laban sa isa't isa ay may kahulugan lamang kapag bawat entry ay tumakbo sa parehong protocol. Angkop din ito sa iyong sariling tatlong round.

Apat na Metric na Dapat I-log Kasama ng Rate

  • Mga takeover kada run. Dalawampung maiikling correction at isang mahaba ay nagbibigay ng magkatulad na rate ngunit naglalarawan ng magkaibang policy — isa jittery, isa may iisang blind spot.
  • Mean intervention length. Ang tumataas na haba kasabay ng bumababang bilang ay nangangahulugang ang mga natitirang kabiguan ay ang mahihirap na uri, na siyang itsura ng late progress.
  • Time to first intervention. Ang isang policy na nakararating nang mas malayo bago ito mangailangan ng tulong ay bumubuti kahit patag ang kabuuang rate.
  • Kung saan nagkukumpol ang mga intervention. I-bin ang flag ayon sa normalized episode progress; ang isang matatag na peak sa mga round ay tumuturo sa isang bottleneck.

Isang Round Protocol na Talagang Kaya Mong Patakbuhin

May anim na hakbang ang isang measured na round at gumagawa ito ng isang row sa log. Ang unang apat ay ang loop; ang huling dalawa ang gumagawa nitong isang measurement.

  1. 1
    I-freeze ang Evaluation Protocol Bago ang Round Zero

    Isulat ang start pose, paglalagay ng mga bagay, camera, bilang ng trial, timeout, at success criterion. Kunan ng litrato ang mesa. Kung kailangang baguhin ang dokumento, magre-restart ang series.

  2. 2
    Sukatin ang Baseline

    Patakbuhin ang protocol nang walang intervention at i-record ang mga successes; pagkatapos ay patakbuhin ang isang instrumented na session na naka-enable ang takeover at i-record ang rate. Ang dalawang numerong iyon ang round zero.

  3. 3
    Kumolekta ng mga Correction sa Isang Consistent na Estilo

    Isang input mode kada round, isang operator kung kaya mong pamahalaan. Umagaw ng kontrol batay sa isang criterion na kaya mong sabihin nang malakas — 'gripper na mahigit dalawang sentimetro ang layo sa approach' — at panatilihin ito sa buong round.

  4. 4
    I-triage ang Bawat Episode sa Parehong Araw

    Correction, evaluation, o discard. Ang mga ambiguous na episode ay itinatapon (discard), hindi sine-save sa teoryang nakakatulong ang dagdag na datos — ang isang correction kung saan ikaw mismo ang napalpak ay mas masama kaysa walang episode.

  5. 5
    I-compose ang Mixture nang Malinaw

    Orihinal na demonstration kasama ang mga correction, episode selection kada source. I-record ang base count, correction count, at anumang weighting — ito ang field na gugustuhin mong makita pagkalipas ng tatlong linggo.

  6. 6
    Magpatuloy Mula sa Checkpoint, Pagkatapos ay Sukatin Muli

    I-train ang composed dataset mula sa nakaraang checkpoint sa halip na ang base model, patakbuhin ang frozen protocol kasama ang isang instrumented na session, idagdag (append) ang row, at ihambing laban sa nakaraang dalawang round.

May dalawang limitasyon na nagbabago kung paano mo babasahin ang isang mahinang round. Ang pagpapatuloy mula sa isang checkpoint ay nag-initialize lamang ng mga weight mula rito — hindi ito optimiser resume, kaya nagsisimulang muli ang schedule at isang maikling run mula sa isang converged na checkpoint ay maaaring kaunti lamang ang maiuusog. At ang leader-align na paggalaw sa simula ng isang takeover ang may pinakakaunting mileage sa real hardware sa buong chain; kung lahat ng correction ay nagsisimula sa isang kakaibang transient, doon muna tumingin bago sisihin ang mixture.

Ang Measured na Loop, Nakahanda na

Ipinapatupad ng ay-robots ang anim na hakbang na ito bilang mga product feature: pag-agaw ng kontrol sa gitna ng run mula sa isang leader arm, keyboard, o slider, na awtomatikong nafla-flag ang mga intervention frame; pag-triage sa bawat episode bilang correction, evaluation, o discard; pag-compose ng susunod na dataset mula sa orihinal na demonstration kasama ang mga correction, na malinaw ang episode selection kada source; at pagsisimula ng susunod na training run mula sa nakaraang checkpoint sa halip na ang base model.

Tingnan Kung Paano Gumagana ang DAgger Loop

Ang Hindi Masasabi Sa Iyo ng mga Numero

Wala pa sa mga ito ang nalutas, at hindi ka dapat kumbinsihin ng isang maayos na curve na iba ang totoo. Sinusukat ng intervention rate ang isang joint system — policy, hardware, operator, kuwarto — at wala itong iniaatribwido nang mag-isa. Hindi nito mahuhusgahan kung maganda ba ang mga correction, at masaya itong bababa sa isang task na naging mas madali dahil lumapit nang dalawang sentimetro ang bagay sa loob ng tatlong linggo.

Ang ginagawa nito ay gawing isang column na kaya mong pagtalunan ang isang malabong impresyon. Ang alternatibo ay hindi isang mas magandang metric; ito ay tatlong linggo ng pangongolekta ng mga correction na sana'y sinabihan ka na ng curve, matapos ang round three, na itigil na ang pangongolekta. Dine-define ng survey literature ang interactive imitation learning bilang human feedback na ibinibigay paminsan-minsan (intermittently) habang isinasagawa ang robot execution, na nagpapahintulot ng online improvement ng ugali; malawak ang pamilya nito, at walang ayos nito ang gagana nang walang numero kada round. Tingnan din ang ang gabay sa imitation learning para sa SO-100 para sa base dataset na pinaghahaluan mo, pagpapatakbo ng isang policy para sa panig ng inference, at ang pahina ng DAgger loop para sa naipatupad na pipeline.

Ang Intervention Rate Ba ay Isa Lamang Bawas ang Success Rate?

Hindi. Sinusukat ng rate kung gaano karaming bahagi ng run ang inagaw mong kontrolin; sinusukat ng success rate kung natapos ba ang task nang wala ka. Maaaring magtagumpay ang isang run kahit may 30 porsyentong intervention rate, at maaaring bumagsak nang tuluyan ang isang run na walang intervention. Naiiba rin sila sa noise: gumagalaw nang maayos (smoothly) ang rate sa libo-libong correlated na frame, samantalang tumatalon ang success rate sa pagitan ng ilang binary na outcome lamang. I-log pareho.

Ilang Evaluation Trial ang Kailangan Ko Para May Kahulugan ang Success Rate?

Higit pa sa pakiramdam mong makatwiran. Sa ilalim ng normal approximation, ang 20 trial sa isang tunay na 60 porsyentong success rate ay may standard error na malapit sa 11 percentage point, kaya ang isang 10-puntong galaw sa pagitan ng mga round ay hindi makikilala sa noise; ang 50 trial ay nagbababa nito sa humigit-kumulang 7. Kung hindi mo kayang gumawa ng 50, panatilihing pareho ang bilang ng trial sa lahat ng round at ituring ang maliliit na galaw bilang hindi konklusibo.

Anong Mixing Ratio ng Demonstration sa Correction ang Dapat Kong Simulan?

Ang naka-dokumentong panimulang punto ay ang sa IWR: hatiin ang datos sa intervention at non-intervention na sample at kunin ang mga ito nang pantay-pantay ang proporsyon, kaya ang mga correction ay nag-aambag ng kalahati ng gradient gaano man kaliit na bahagi sila ng mga frame. Kung hindi kayang timbangin (weight) ng iyong setup ang sampling, i-approximate ito sa pamamagitan ng episode count kapag kino-compose ang dataset at i-record ang ratio. Ang pag-train lamang sa mga correction ang opsyon na dapat alisin (rule out).

Tumaas ang Intervention Rate Ko Pagkatapos ng Isang Round. Sayang Ba ang Round?

Hindi kinakailangan, ngunit suriin muna ang mga boring na paliwanag: tugma ba ang checkpoint na dinrive mo sa checkpoint na tinrain, may nagbago bang camera index o mount, lumihis ba ang paglalagay ng bagay, consistent ba ang correction style. Kung malinis ang lahat ng apat at bumagsak din ang kaparehang success rate, pagdudahan ang mixture — masyadong kaunting base demonstration laban sa mga correction, o mga correction na nagsasalungat sa isa't isa. Ang isang tunay na regression ay kabilang sa log, hindi sa basurahan.

Puwede Ko Bang Laktawan ang Fixed Evaluation Protocol at Panoorin na Lang ang Intervention Rate?

Puwede lamang kung tatanggapin mong hindi mo na makikilala ang improvement mula sa habituation. Nakadepende ang rate sa sarili mong real-time na threshold para kumilos, at bumababa ang threshold na iyon habang nasasanay ka sa mga kakaibang gawi (quirks) ng policy. Ang frozen na protocol ang bahagi ng measurement na hindi kayang abutin ng iyong threshold — mga taped na marka, isang nakasulat na home pose, isang fixed na bilang ng trial, isang criterion na napagpasyahan bago ang round. Kailangan nitong manatiling hindi nagbabago sa buong series.

Panatilihin ang log sa repository, hindi sa isang notebook: magkakalayo ng mga araw ang mga round, muling binubuo ang hardware, at ang taong magbabasa ng curve sa Oktubre ay ikaw rin, ngunit wala nang alaala ng Agosto. Sinasakop ng documentation FAQ ang mga detalyeng operasyonal na naiwan dito.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started