
Interventionsfrekvensen - interventionsframes divideret med framene i kørslen - er det billigeste ærlige fremgangssignal, en human-gated DAgger-løkke har. Denne artikel definerer den således, at to mennesker beregner den samme værdi, viser, hvordan man logger den, og gennemgår de fire måder, den vildleder dig på: operatørens vænning, et drivende evalueringssæt, træning kun på rettelser, og en menneske, der retter anderledes tirsdag end mandag.
En DAgger-runde føles produktiv, mens du er i den. Du kører politikken, overtager når den fumler gribingen, gemmer rettelserne, genstarter, og næste kørslen ser ud - du ville sværge på det - lidt glattere. To runder senere kan du ikke sige, om noget ændrede sig, fordi 'lidt glattere' ikke er en mængde.
Løkken har brug for et tal pr. runde, og i en human-gated løkke er det tal næsten gratis: andelen af kørslen, hvorunder du havde kontrol i stedet for politikken. Denne artikel definerer den således, at to mennesker beregner den samme værdi, logger den, læser den resulterende kurve og navngiver de fire måder, den vildleder dig på, når den står alene. For teorien, som dette stykke antager, se DAgger-forklaring og den human-gated variant; den praktiske modpart er at køre en DAgger-løkke på en SO-100.
Den korte version
- •Interventionsfrekvens = interventionsframes / frames i kørslen. Frames, ikke episoder, og nævneren inkluderer de frames, du brugte på korrektion.
- •En flad kurve over tre runder betyder, at runderne køber intet - skift blandingen, checkpoint eller opgave i stedet for at samle en fjerde.
- •En faldende interventionsfrekvens er ikke en stigende succesrate. Din tærskel for at træde ind glider nedad, efterhånden som tilliden vokser.
- •Uden en frossen evalueringsprotokol - samme startpositioner, objekter, kameraer, antal forsøg - måler du rummet.
- •Træning kun på rettelser skævvridr tilstandsfordelingen. IWR's svar: tegn interventions- og ikke-interventionssamples i lige proportion.
Hvorfor en runde har brug for et tal overhovedet
DAgger eksisterer på grund af et distributionsproblem, og distributionsproblemer er usynlige for øjet. Ross og Bagnell viste, at imitativ læring på et fast demonstrationssæt fører til sammensatte fejl og en fortrydelse bundet, som vokser kvadratisk i tidshorisonten: når først læreren forlader de tilstande, som demonstranten besøgte, fortæller intet i dataene den, hvordan den skal komme tilbage. DAgger fikser dette ved at iterere - kør politikken, mærk de tilstande, den besøger, aggreger, gentræn - som Ross, Gordon og Bagnell ramme som en reduktion til no-regret online læring.
Det rammeværk har en konsekvens, folk springer over. Garantien angår sekvensen af politikker over iterationer, ikke nogen enkelt kørslen. Det siger intet om, hvorvidt din runde tre hjalp. Den eneste måde at vide er at måle hver iteration. Kelly og kolleger introducerede HG-DAgger, fordi klassisk DAgger spørger eksperten om handlingslabels, mens nybegyndelsen stadig har kontrol, som papiret argumenterer for, kan reducere sikkerhed og, med menneskelige eksperter, sandsynligt nedbryde labellykvaliteten gennem opfattet aktuatorlag. HG-DAgger lærer også en sikkerhedstærskel for en modelsikkerhed-baseret risikomaaling og rapporterer forbedret ydeevne over både DAgger og behavioral cloning på en køreopgave. Det udgiver ingen interventionsantal; dem frembringer du selv.
Definition af hastigheden således, at to mennesker får det samme tal
Definitionen er en linje: interventionsframes divideret med frames i kørslen. Alt vanskeligt gemmer sig i hvad der tæller som en frame og hvad der tæller som en kørslen.
Frames, ikke episoder
At tælle episoder med mindst en intervention er værdiløst: ti episoder med ét skub hver og ti, hvor du kørte firs procent, giver begge '10/10'. Framene tæller adskiller dem, og det er granulariteten, som optagelsen allerede har - i LeRobot datasætformat er hvert tidstrin en række, så interventionsflagen er én boolsk kolonne ved siden af tilstand og handling. Her skrives det pr. frame det øjeblik, takeover starter, og slettes, når kontrollen vender tilbage.
Nævneren inkluderer korrektionerne
To nævnere er forsvarlighed - totale frames i kørslen, eller frames politikken kørte autonomt - og de adskiller sig dårligt ved høje interventionsniveauer. Overtag 400 af 1000 frames, og den første giver 40 procent, den anden 67 procent. Sammenligning af en runde målt den første vej mod næste målt den anden er, hvordan en ægte forbedring forsvinder. Tag totale frames og gensøg aldrig valget midt i serien.
Afgør engang hvad der sker med handover-frames
Der er altid en søm. Når kontrollen skifter, tilhører nogle frames ingen side: armen holdes, lederen justerer, optagelsen er frosset. I denne pipeline forbliver disse handover-frames i den rå stream og går aldrig ind i den kurateret episode - de er hverken politikopførsel eller en rettelse værd træning på. Tæl sømmene på samme måde hver runde: ved 30 Hz er seks takeovers med en to-sekunders søm hver 360 frames, nok til at flytte et procentpoint.
Frames eller episoder; total kørsel eller kun autonome; handover-frames ind eller ud. Enhver af de tre ændret stilfærdigt mellem runder gør kurven meningsløs. Skriv alle tre ned.
Logging det således nummeret overlever sessionen
En metrik i statuspanelet for en igangværende proces er en aflæsning: det forsvinder på omstart og kan ikke plotes. En linje pr. kørslen til en appendonly dækker hele serien - herunder hvilken checkpoint du kørte, da det ændres hver runde og blanding af dem ugyldighed, hvad der følger.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}To felter bærer vægten. train_mix er hvad du gav det næste træningsjob; uden det kan intet tilskrives. eval_protocol navngiver den faste test, du kørte efterfølgende, og er det felt, der oftest efterlades tomt. I ay-robots cockpittet rapporterer takeover-status interventionsframe-antallet for den igangværende session, så logging er afskrift snarere end instrumentering; datasætdokumentationen dækker, hvor de per-frame-kolonner lander.

Læsning af kurven: tre runder, en dom
Tre runder er minimumet for en læsning, fordi to punkter altid er en linje. Tabellen nedenfor er en bogholderiskabelon med pladsholdernumre, ikke målinger fra nogen kørslen. Du leder efter et monotont fald matchet af en stigning i succes på en fast test.
| Runde | Checkpoint kørt | Frames | Interventions-frames | Frekvens | Succeser (af 20) |
|---|---|---|---|---|---|
| 0 (baseline) | base politik | 5 900 | 1 380 | 23,4 % | 7 |
| 1 | fra runde 0 blanding | 5 610 | 980 | 17,5 % | 10 |
| 2 | fra runde 1 blanding | 5 412 | 611 | 11,3 % | 11 |
| 3 | fra runde 2 blanding | 5 380 | 598 | 11,1 % | 12 |
Runde én og to arbejder. Runde tre gør det ikke: 11,3 mod 11,1 procent ligger inden for kørslen-til-kørslen variation af alt målt på en fysisk arm, og en fjerde runde med samme rettelser bruger en eftermiddag til intet. Det flade segment siger, at skift noget strukturelt.
- De resterende fejl kan ikke rettes ved teleoperation - objekt uden for rækkevidde, griber geometri, et led på sin grænse. Ingen rettelsesdata fikser en kinematisk mur.
- Korrektionerne er for få mod base-datasættet til at flytte gradienten, og intet vejer dem.
- Korrektionerne modsiger hinanden, så politikken gennemsnitliggør to strategier og lander mellem dem.
- Fejlen er opstrøms: et kamera flyttede sig, belysningen ændrede sig, håndledets syn svarer ikke længere træningen.
- Opgaven er på loftet for denne politikklasse på dette hardware, og næste skridt er mere base-data.
De sidste to er ikke fejl i løkken. I Sirius-Fleet er et faldende behov for mennesket det designede resultat: efterhånden som robotautonomi forbedres, tilpasser dens anomaliforskere deres forudsigelseskriteria, hvilket fører til færre anmodninger om menneskelig intervention og gradvis reducerer menneskelig arbejdsbelastning over tid. Der tilpasser kritikken med vilje. I en manuel løkke tilpasses din også, stilfærdigt - så en sats, der fladfar, fordi opgaven er på sit loft, ligner præcis en, der fladfar, fordi operatøren holdt op med at bemærke. Hvilket er det næste problem.
Faldgrubet 1: en faldende sats er ikke en stigende succesrate
Interventionsfrekvensen måler præcis én ting: hvor meget af kørslen du besluttede at eje. Den beslutning er din, truffet i realtid, og den bevæger sig. I runde nul overtager du ved den første dårlige tilgangsvinkle; i runde tre har du set politikken komme sig fra et dusin af dem, og du lader den prøve. Din tærskel bevægede sig; politikken måske ikke. Satsen falder alligevel.
Menneskelig tillid er mindst en modelleret mængde i litteraturen snarere end en antaget konstant. Sirius genvejler træningssamples med tilnærmet menneskelig tillid og optimerer politikken med vejleder behavioral cloning, rapporterer en 8 procent boost i simulation og 27 procent på rigtigt hardware over de seneste år inden for politik succesrate, med to gange konvergenshastighed. Det behandler tillid som en vægt på dataene. Det retter ikke tærsklen i dit hoved mellem runde nul og runde tre.
Du kan ikke fjerne driften, så parret satsen med noget, din tærskel ikke kan røre: et fast antal forsøg, hvor du slet ikke intervenerer, scoret mod et kriterium skrevet før runden. En sats, der falder, mens den parret succesrate forbliver, er signaturen på vænning - værd at få fat i, fordi fra inde i løkken føles det som fremgang.
| Interventionsfrekvens | Succesrate på fast protokol | Mest sandsynlig læsning |
|---|---|---|
| falder | stiger | Runden virkede. Fortsæt. |
| falder | flad | Din tærskel drev, eller korrektionerne fjernede indsats uden at fjerne fejl. |
| falder | falder | Korrektioner forringer politikken. Kontroller blandingen og deres interne konsistens. |
| flad | flad | Runden købte intet. Skift blanding, checkpoint eller opgave før du samler mere. |
| stiger | falder | Regression. Mistænk træningsblandingen, et ændret kamera eller en checkpoint-blanding, før du mistænker metoden. |
Faldgrubet 2: uden en fast protokol måler du rummet
Real-robot evaluering er dyr og svær at gentage. SIMPLER forfatterne motiverer simuleret evaluering med iagttagelsen, at real-verdens evaluering af sådanne politikker ikke er skalerbar og står over for reproducerbarhedsproblemer, der sandsynligt forværres, da politikker udbreder deres opgavespektrum. RoboArena angriber det fra den anden side, med mere end 600 parvis real-robot evalueringsepisoder på tværs af syv generalistpolitikker, kørt af evaluatorer på syv akademiske institutioner på DROID-platformen. Dens evaluatorer vælger deres egne opgaver og miljøer, men må bedømme politikpar dobbeltklindt; papiret rapporterer, at denne crowd-sourced rangering sporer generalistpolitik-ydeevne mere præcist end konventionel, centraliseret evaluering.
Du kører ikke 600 parrede episoder på en SO-100 i et værksted. Hvad du kan gøre er at fjerne den varians, du styrer - en liste kedelig nok, at den normalt bliver sprunget over.
| Dimension | Frys dette | Hvad driver, hvis du ikke gør |
|---|---|---|
| Startposition | En skrevet hjemposition, kørt før hver forsøg | Banen starter uden for distribution |
| Objekter | Tapet mærker, og de samme fysiske objekter forbeholdt evaluering | En 'bedre' politik er virkelig et nærmere objekt |
| Kameraer og lys | Samme monteringer, indekser, eksponering; persienner lukket; fotografer opkvarteringen | Byttede kameraindekser kan alene dominere resultatet |
| Forsøg og stoppregel | Fast n, fast timeout, kriterium skrevet før runden | Post-hoc kriterier gør næsten-misse til hvad som helst, du har brug for |
| Operatøradfærd | Ingen interventioner under evalueringsforsøg | Evaluering bliver en anden korrektionssession |
Så aritmetikken, hensynsløs ved forsøgstallene, et værksted har råd til. Under normalapproksimationen giver 60 procents succes over 20 forsøg en standardfejl nær 11 procentpoint - kvadratroden af 0,6 gange 0,4 over 20 - og forskellen mellem to sådanne runder bærer omkring 15. Et hop fra 60 til 70 procent er derfor i overensstemmelse med, at intet er sket. Halvtreds forsøg bringer per-runde-figuren til cirka 7 point og koster en eftermiddag.
Denne asymmetri er argumentet for interventionsfrekvensen: beregnet over tusinder af frames snarere end tyve binære resultater, bevæger den sig tidligere og mere glat. Forholdet er, at frames inden for en episode er stærkt korrelerede - en dårlig gribning giver hundrede på hinanden følgende interventionsframes - så den effektive stikprøvestørrelse er tættere på antallet af takeovers. Behandl satsen som den tidlige indikator og succesraten som langsom jordlig sandhed.
Evalueringsepisoder må aldrig gå ind i det sammensatte træningsdatasæt - ellers er runde n+1 scoret på data, det blev trænet på, og kurven måler memorering.
Faldgrubet 3: træning kun på rettelser bøjer politikken
Korrektionerne er de interessante data, så instinktet er at træne på dem. Gør det ikke. De kommer ved konstruktion fra det snævre udsnit af tilstandsrum, hvor politikken allerede fejlede, og siger næsten intet om størstedelen af løbeturen, der virkede. Finjustering på det udsnit alene, og du får en politik, der er god til at komme sig over en fumlet tilgang, der har glemt, hvordan man laver en ren.
Mandlekar og kolleger byggede deres fjerninterventionssystem omkring dette. Deres rammeværk: manipulationsopgaver indeholder flaskehalsregioner, der kræver en sekvens af præcise handlinger - indsætning af en pod i en kaffemaskine er deres eksempel - hvor små afvigelser fører ind i stater, som demonstrationerne aldrig dækkede. Deres algoritme træner iterativt på de nye data, så politikken lærer at gennemkryds disse flaskehalse, og de rapporterer, at agenter trænet på interventionsdata slår agenter trænet på et tilsvarende antal sampler fra ikke-interventionelle demonstranter.
- Hurtigt: en kort løb over nogle få dusin episoder er billig nok til at gentage
- Målrettet: gradienten domineres af de tilstande, du ønsker om
- Billigt at teste, om en korrektionsstil er lærbar overhovedet
- Finjusterings-distributionen ligner ikke længere opgavefordelingen
- Nominel adfærd kan forringes synligt inden for en enkelt runde
- Satsen kan falde, mens succes falder med den - rene segmenter byttet for genopretninger
Blandingsforholdet er en hyperparameter og fortjener at blive skrevet ned. Sammensat det næste datasæt er, hvor det besluttet: oprindelige demonstrationer plus korrektionssættet, episodevalg eksplicit pr. kilde snarere end en regel, der stilfærdigt trækker ind, hvad der end er tilgængeligt. Her er det et sammensæt trin i cockpittet, og resultatet er et almindeligt datasæt - se træningsdokumentationen. Hvad intet værktøj gør for dig er at registrere, hvilken ratio som producerede hvilken kurve.
Faldgrubet 4: mennesket er ikke en konsistent ekspert
DAgger's teori antager en ekspert. Du er ikke en i teknisk forstand: dine rettelser er ikke sampler fra en fast betinget fordeling over handlinger. ACT-forfatterne nævner dette, når de lister hindringer for finjusteret manipulation - fejl sammensættes over tid, og menneskelige demonstrationer kan være ikke-stationær. Deres system når stadig 80 til 90 procents succes på seks rigtige opgaver fra ti minutters demonstrationer, så problemet er løseligt, ikke fraværende.
Robomimic-undersøgelsen gør pointen fra datasidesen. På tværs af seks offline-algoritmer på fem simulerede og tre real-verdens multi-etape-opgaver inkluderer dets lektioner følsomhed over for designvalg, afhængighed af demonstrationskvalitet, og - den, der gør ondt mest her - variabilitet, der skyldes stoppkriterier, fordi trænings- og evalueringsobjektiver adskiller sig. Pointet med det laveste tab er ikke pålideligt det med den højeste succesrate.
Der er en hardwareversion heraf: inputmoden former korrektionen. En leder-følger opstilling frembringer kontinuerlige, menneskestyrede baner. Tastaturskubene er hårdklammet af serveren - to grader pr. opkald på armens led, fire på griberen - så samme hensigt ankommer som en trappe med små trin. Skydere sender absolutte mål, og serveren bevæger sig højst seks grader mod dem pr. opkald. Tre tilstande, tre handlingsfordelinger; blanding alle tre i ét korrektionssæt og derefter undring over, hvorfor tilgangen blev nervøs er selvovervældet. teleoperation dokumentation dækker hvad hver tilstand sender.
Vejning af interventionerne: IWR og hvad der kom efter
Hvis korrektioner er den værdifulde minoritet, er det principielle fix vægt snarere end eksklusivitet. Intervention Weighted Regression er referenceimplementeringen: dataene er opdelt i interventions- og ikke-interventionsampler, og de to partitioner samples i lige proportion under træning. Et korrektionssæt, der er fem procent af framene, bidrager derefter til halvdelen af gradienten uden, at nominel adfærd forsvinder fra fordelingen.
Lige proportion er et udgangspunkt, ikke en lov. Sirius generaliserer den ved at erstatte den binære partition med en kontinuerlig vægt fra tilnærmet menneskelig tillid; Sirius-Fleet flytter beslutningen opstrøms, bruger en visuelt verdensmodel og anomaliforskere til at beslutte, når en menneske bliver spurgt overhovedet. Den fælles tråd: interventionsflagen er et træningssignal, ikke kun en bogholderkolonne.
| Metode | Hvem bestemmer, når mennesket handler | Hvordan interventionsdata bruges | Rapporteret resultat |
|---|---|---|---|
| DAgger (2011) | Fast tidsplan; ekspert labels besøgte tilstande | Et voksende datasæt, uvægtet | Rammet som en reduktion til no-regret online læring |
| HG-DAgger (2019) | Mennesket, portegating kontrol på et virkeligt system | Aggregeret; plus en lært sikkerhedstærskel på modelusikkerhed | Bedre end DAgger og BC på kørsel; ingen interventionsantal givet |
| IWR (2020) | Mennesket, via fjern teleoperation | Interventions- og ikke-interventionsampler tegnet i lige proportion | Slår ikke-interventionelle demoer ved lige stikprøveantal |
| Sirius (2022) | Mennesket, under deployment | Vejleder BC, vægte fra tilnærmet menneskelig tillid | 8 % gevinst i simulation, 27 % på rigtigt hardware; 2x hurtigere konvergens |
| ThriftyDAgger (2021) | Systemet, portegating på nyt og risiko | Interaktiv samling under et oversigtsbudget | Brugeretude (N=10): 58 % højere menneske og 80 % højere robot ydeevne end den næstbedste metode |
| Fleet-DAgger (2022) | Systemet, allokering af opmærksomhed på tværs af et fleet | Flottelæring scoret ved Return on Human Effort | Op til 8,8x højere ROHE end baselines |
| Sirius-Fleet (2024) | Anomaliforskere med selv-tilpassende kriterier | Multi-task læring med en visuelt verdensmodel | Færre interventionsanmodninger efterhånden som autonomi forbedres |

Fire metrikker værd at logge ved siden af satsen
- Takeovers pr. kørsel. Tyve korte rettelser og én lang giver lignende priser og beskriver forskellige politikker - en nervøs, en med et enkelt blindt område.
- Gennemsnitlig interventionslængde. Stigende længde med et faldende antal betyder, de resterende fejl er de hårde, som er hvad sent fremskridt lyder.
- Tid til første intervention. En politik, der kommer længere før behov for hjælp, forbedres selv når den samlede sats er flad.
- Hvor interventioner klynger. Skraldespand flaget efter normaliseret episodeprogression; en stabil top på tværs af runder pegger på en faldgrubet.
En rundeprotokol, som du faktisk kan køre
En målt runde har seks trin og frembringer en række i loggen. De første fire er løkken; de sidste to gør det til en måling.
- 1Frys evalueringsprotokollen før runde nul
Skriv ned startposition, objekt placering, kameraer, forsøgsantal, timeout og succesriterium. Fotografer bordet. Hvis dokumentet skal ændres, genstarter serien.
- 2Mål basistallet
Kør protokollen uden interventioner og registrer succeserne; kør derefter en instrumenteret session med takeover aktiveret og registrer satsen. De to tal er runde nul.
- 3Samle rettelser i én konsistent stil
En inputtilstand pr. runde, en operatør hvis du kan styre det. Overtag på et kriterium, du kan sige højt - 'griber mere end to centimeter væk ved tilgang' - og hold det for runden.
- 4Sorter hver episode samme dag
Rettelse, evaluering eller kassér. Tvetydige episoder slettes, ikke gemmes på den teori, at mere data hjælper - en rettelse, hvor du selv fumlet er værre end ingen episode.
- 5Sammensætter blandingen eksplicit
Oprindelige demonstrationer plus rettelser, episodevalg pr. kilde. Registrer base-antal, rettelsesantal og enhver vejning - dette er det felt, du vil have brug for om tre uger.
- 6Fortsæt fra checkpoint, og måle igen
Træn det sammensatte datasæt fra det forrige checkpoint snarere end basemodellen, kør den frosne protokol plus en instrumenteret session, tilføj rækken, og sammenlign mod de tidligere to runder.
To grænser ændrer, hvordan du læser en svag runde. Fortsæt fra et checkpoint initialiserer vægtene fra det - ikke en optimizer-genoptag, så tidsplanen starter frisk, og en kort løb fra et konvergeret checkpoint kan bevæge meget lidt. Og leder-align-bevægelsen ved starten af en takeover har den mindste kilometerstand på rigtigt hardware af alt i kæden; hvis rettelser alle begynder med et uligt forbigående, se der før du beskylder blandingen.
Den målte løkke, allerede ledning op
ay-robots implementerer disse seks trin som produktfunktioner: overtag mid-run fra en leder-arm, tastatur eller skydere, med interventionsframes flagget automatisk; sorter hver episode som rettelse, evaluering eller kassér; sammensæt det næste datasæt fra de oprindelige demonstrationer plus rettelserne, episodevalg eksplicit pr. kilde; og start det næste træningslauf fra det forrige checkpoint i stedet for basemodellen.
Se, hvordan DAgger-løkken virkerHvad tallene ikke kan fortælle dig
Ingen af dette er løst, og en ordnet kurve burde ikke overbevise dig anderledes. Interventionsfrekvensen måler et sammensat system - politik, hardware, operatør, rum - og tilskriver intet af sig selv. Det kan ikke bedømme, om korrektionerne var gode, og det falder gladlygt på en opgave, der blev lettere, fordi objektet drev to centimeter tættere over tre uger.
Hvad det gør er at gøre et vagt indtryk til en kolonne, du kan argumentere med. Alternativet er ikke en bedre metrik; det er tre ugers samling af rettelser, kurven ville have fortalt dig, efter runde tre, at holde op med samlingen. Undersøgelseslitteraturen definerer interaktiv imitativ læring som menneskelig feedback givet periodisk under robot-eksekution, hvilket tillader online forbedring af adfærden; familien er bred, og ingen ordning af det virker uden et tal pr. runde. Se også SO-100 imitativ lærings guide til base-datasættet, du blander mod, køring af en politik til inferenssiden, og DAgger loop-siden til den implementerede pipeline.
Er interventionsfrekvensen bare en minus succesraten?▾
Nej. Satsen måler, hvor meget af en løb, du overtog; succesraten måler, om opgaven blev udført uden dig. En løb kan lykkes med en 30 procents interventionsfrekvens, og en løb uden interventioner kan fejle helt. De adskiller sig også i støj: satsen bevæger sig glat over tusinder af korrelerede frames, succesraten hopper mellem en håndfuld binære resultater. Log begge.
Hvor mange evalueringsforsøg skal jeg bruge til, at succesraten betyder noget?▾
Mere end det føles rimeligt. Under normalapproksimationen giver 20 forsøg ved en sand 60 procents succesrate en standardfejl nær 11 procentpoint, så en 10-points bevægelse mellem runder er uadskillelig fra støj; 50 forsøg bringer det tal til cirka 7. Hvis du ikke har råd til 50, skal du holde forsøgsantallet identisk på tværs af runder og behandle små bevægelser som ukonkluderet.
Hvilket blandingsforhold af demonstrationer til rettelser skal jeg starte med?▾
Det dokumenterede udgangspunkt er IWR's: partition dataene ind i interventions- og ikke-interventionsampler og tegn dem i lige proportion, så korrektionerne bidrager til halvdelen af gradienten, hvor en lille brøkdel af framene de er. Hvis din opsætning ikke kan vægte sampling, tilnærm den gennem episodantal, når du sammensætter datasættet og registrer forholdet. Træning kun på rettelser er den mulighed, du skal udelukke.
Min interventionsfrekvens gik op efter en runde. Er runden spildt?▾
Ikke nødvendigvis, men kontroller de kedelige forklaringer først: matchede checkpoint du kørte den, du trænet, gjorde et kameraindeks eller montering ændring, gjorde objekt placering drift, var korrektionsstilen konsistent. Hvis alle fire er rene, og den parrede succesrate også faldt, mistænkt blandingen - for få base-demonstrationer mod rettelserne eller rettelser, der modsiger hinanden. En ægte regression hører til i loggen, ikke i skraldespanden.
Kan jeg springe over den faste evalueringsprotokol og bare se på interventionsfrekvensen?▾
Kun hvis du accepterer, at du ikke kan skelne forbedring fra vænning. Satsen afhænger af din egen realtids-tærskel for at træde ind, og den tærskel falder, efterhånden som du bliver vant til politikkens særheder. Den frosne protokol er den del af målingen, din tærskel ikke kan nå - tapet mærker, en skrevet hjemposition, et fast forsøgsantal, et kriterium fastsat før runden. Det skal blive uændret på tværs af serien.
Holde loggen i arkivet, ikke i en notesbog: runder er dage fra hinanden, hardware bliver genopbygget, og den person, der læser kurven i oktober, er du uden hukommelse af august. dokumentation FAQ dækker de operationelle detaljer, der er udeladt her.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started