
Intervention rate – interventionsramar dividerat med ramarna i körningen – är den billigaste ärliga förloppprognosbeteckning som en människostyrda DAgger-loop har. Den här artikeln definierar den så att två personer beräknar samma värde, visar hur man loggar den, och går igenom de fyra sätten den vilseleder dig: operatörens habituation, en driftande evalueringskonfiguration, träning endast på korrigeringar, och en människa som korrigerar annorlunda på tisdag än på måndag.
En DAgger-runda känns produktiv när du är inne i den. Du styr policyn, tar över när den misslyckas med greppet, sparar korrigeringarna, tränar om, och nästa körning ser ut – du skulle svära på det – lite smidigare. Två rundor senare kan du inte säga om något förändrades, för "lite smidigare" är inte en storhet.
Loopen behöver ett tal per runda, och i en människostyrda loop är det numret nästan gratis: fraktionen av körningen under vilken du hade kontrollen istället för policyn. Den här artikeln definierar den så två personer beräknar samma värde, loggar den, läser den resulterande kurvan, och namnger de fyra sätten den vilseleder dig när den står ensam. För teorin detta stycke antar, se DAgger-förklararen och människostyrda varianten; motsvarigheten praktisk sida är köra en DAgger-loop på en SO-100.
Kortversionen
- •Intervention rate = interventionsramar / ramar i körningen. Ramar, inte episoder, och nämnaren inkluderar ramarna du tillbringade med att korrigera.
- •En platt kurva över tre rundor betyder att rundorna köper ingenting – ändra blandningen, checkpointen eller uppgiften istället för att samla in en fjärde.
- •En fallande intervention rate är inte en stigande success rate. Din tröskel för att gå in sjunker nedåt när förtroendet växer.
- •Utan ett fryst evalueringsprotokoll – samma startpositioner, objekt, kameror, försöksantal – mäter du rummet.
- •Träning endast på korrigeringar snedvrider tillståndsfördelningen. IWRs svar: rita interventions- och icke-interventionssamples i lika proportion.
Varför en runda behöver ett tal alls
DAgger existerar på grund av ett distributionsproblem, och distributionsproblem är osynliga för ögat. Ross och Bagnell visade att imitation learning på en fast demonstrationsuppsättning leder till ackumulerande fel och en regretgräns som växer kvadratiskt i tidshorisonten: när eleven lämnar de tillstånd som demonstratören besökt, ingenting i data säger honom hur han ska komma tillbaka. DAgger fixar detta genom att iterera – kör policyn, etiketta tillstånden den besöker, aggregera, träna om – vilket Ross, Gordon och Bagnell ram som en reducering till no-regret online learning.
Det framing har en konsekvens människor hoppar över. Garantin berör sekvensen av policyer över iterationer, inte någon enskild körning. Det säger ingenting om huruvida din runda tre hjälpte. Det enda sättet att veta är att mäta varje iteration. Kelly och kollegor införde HG-DAgger för att klassisk DAgger frågar experten om åtgärdsetiketter medan nybörjaren fortfarande är i kontroll, vilket artikeln hävdar kan minska säkerhet och, med mänskliga experter, sannolikt kommer att degradera etikettekvalitet genom upplevd aktuatorlagring. HG-DAgger lär också en säkerhetströskel för ett modellövertygelsesbaserat riskmått och rapporterar förbättrad prestanda över både DAgger och beteendekloning på en köruppgift. Det publicerar inga interventionsnummer; dessa producerar du själv.
Definiering av hastigheten så två personer får samma tal
Definitionen är en linje: interventionsramar dividerat med ramar av körningen. Allt svårt gömmer sig i vad som räknas som en ram och vad som räknas som en körning.
Ramar, inte episoder
Att räkna episoder med minst en intervention är värdelöst: tio episoder med en liten knuff var och tio där du körde åttio procent ger båda "10/10". Ramräkningen separerar dem, och det är granulariteten inspelningen redan har – i LeRobot-datasetformatet varje tidssteg är en rad, så interventionsflaggan är en booleskt kolumn vid sidan av tillstånd och åtgärd. Här är det skrivet per ram när övertagningen startar och rensat när kontrollen återvänder.
Nämnaren inkluderar korrigeringarna
Två nämnare är försvarsbara – totala ramar av körningen, eller ramar policyn körde autonomt – och de divergerar dåligt vid höga interventionsnivåer. Ta över för 400 av 1000 ramar och den första ger 40 procent, den andra 67 procent. Att jämföra en runda mätt på det första sättet mot nästa mätt på det andra är hur en verklig förbättring försvinner. Ta totala ramar och gå aldrig igen valet mittserie.
Bestäm en gång vad som händer med överhandsramar
Det är alltid en söm. När kontroll passerar över, vissa ramar tillhör ingen sida: armen hålls, ledaren är på väg, inspelningen är fryst. I denna pipeline förblir dessa överhandsramar i råströmmen och går aldrig in i den kurerad episod – de är varken policyns beteende eller en värd träning på. Räkna sömen på samma sätt varje runda: vid 30 Hz, sex övertagningar med en två sekunders söm var är 360 ramar, tillräckligt för att flytta en procentenhet.
Ramar eller episoder; total körning eller autonomt endast; överhandsramar in eller ut. Någon av de tre ändrade tyst mellan rundor gör kurvan meningslös. Skriv ner alla tre.
Logga den så numret överlevir sessionen
En metrisk i statuspanelen för en körande process är en läsning: den försvinner vid omstart och kan inte plottas. En append-only linje per körning täcker hela serien – inklusive vilken checkpoint du körde, eftersom det ändras varje runda och blanda dem upp ogiltigförklarar vad som följer.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Två fält bär vikten. train_mix är vad du matade nästa träningsjobb; utan det kan ingenting tillskrivas. eval_protocol namnger det fasta testet du körde därefter, och är fältet oftast lämnat tomt. I ay-robots cockpiten rapporterar övertagningsstatusen interventionsramräkningen för den körande sessionen, så loggning är transkription snarare än instrumentering; datasetdokumentationen täcker var per-frame kolumnerna landar.

Läsa kurvan: tre rundor, en dom
Tre rundor är minimum för en läsning, för två poäng är alltid en linje. Tabellen nedan är en bokföringsmall med platshållartal, inte mätningar från någon körning. Du letar efter ett monotont fall matchat av en ökning i framgång på ett fast test.
| Runda | Checkpoint körde | Ramar | Interventionsramar | Hastighet | Framgångar (av 20) |
|---|---|---|---|---|---|
| 0 (baslinje) | base policy | 5 900 | 1 380 | 23.4 % | 7 |
| 1 | från runda 0 blandning | 5 610 | 980 | 17.5 % | 10 |
| 2 | från runda 1 blandning | 5 412 | 611 | 11.3 % | 11 |
| 3 | från runda 2 blandning | 5 380 | 598 | 11.1 % | 12 |
Runda ett och två gör arbete. Runda tre gör inte det: 11.3 mot 11.1 procent är inom körnings-till-körnings variationen av något mätt på en fysisk arm, och en fjärde runda av samma korrigeringar tillbringar en eftermiddag för ingenting. Det platta segmentet säger att ändra något strukturellt.
- De återstående misslyckandena är inte korrigerbara genom teleoperation – objekt utom räckhåll, grippergeometri, ett sammanfogning vid sin gräns. Ingen korrigeringsdata fixar en kinematisk vägg.
- Korrigeringarna är för få mot basdatauppsättningen för att flytta gradienten, och ingenting väger dem.
- Korrigeringarna motsäger varandra, så policyn genomsnitt två strategier och landar mellan dem.
- Misslyckandet är uppströms: en kamera flyttade, belysningen ändrades, handledvyn matchar inte längre träningen.
- Uppgiften är vid taket för denna policysklass på denna hårdvara, och nästa steg är mer basdata.
De två sista är inte misslyckanden i loopen. I Sirius-Fleet är ett minskande behov för människan det designade resultatet: när robotens autonomi förbättras, anpassar dess anomaliförutsägare sitt förutsägelsekriterier, vilket leder till färre förfrågningar om mänsklig intervention och gradvis minskar mänsklig arbetsbelastning över tiden. Där anpassas kriteriet med syfte. I en manuell loop anpassas din också, tyst – så en hastighet som förflackas för att uppgiften är vid sitt tak ser exakt likadan ut som en som förflackas för att operatören slutade märka det. Vilket är nästa problem.
Fälla 1: en fallande hastighet är inte en stigande success rate
Intervention rate mäter exakt en sak: hur mycket av körningen du beslutade att äga. Det beslutet är ditt, fattat i realtid, och det rör sig. I runda noll tar du över vid den första dåliga approximationsvinkeln; vid runda tre har du tittat på policyn återhämta sig från ett dussin av dem och du låter den försöka. Din tröskel flyttades; policyn kan inte ha. Hastigheten faller båda vägen.
Mänskligt förtroende är åtminstone en modellerad storhet i litteraturen snarare än en antagen konstant. Sirius väger om träningssamples med approximerat mänskligt förtroende och optimerar policyn med viktat beteendekloning, rapporterar en 8 procents boost i simulering och 27 procent på verklig hårdvara över state of the art i policyframgång, vid dubbelt konvergenshastighet. Det behandlar förtroende som en vikt på data. Det korrigerar inte tröskeln i ditt huvud mellan runda noll och runda tre.
Du kan inte ta bort driften, så parkoppla hastigheten med något din tröskel inte kan röra: en fast uppsättning försök där du inte ingriper alls, poängvärderad mot ett kriterium skrivet före runda. En hastighet som faller medan den parad framgångshastighet håller sig stilla är signaturen på habituation – värd att fånga, för inifrån loopen känns det som framsteg.
| Intervention rate | Framgångshastighet på fast protokoll | Mest sannolikt läsning |
|---|---|---|
| faller | stiger | Runda fungerade. Fortsätt. |
| faller | platt | Din tröskel driftade, eller korrigeringarna tog bort ansträngning utan att ta bort misslyckanden. |
| faller | faller | Korrigeringar försämrar policyn. Kontrollera blandningen och deras interna konsistens. |
| platt | platt | Runda köpte ingenting. Ändra blandning, checkpoint eller uppgift före insamling av fler. |
| stiger | faller | Regression. Misstänk träningsblandning, en ändrad kamera eller en checkpointblandning-förbistring före misstänkande av metoden. |
Fälla 2: utan ett fast protokoll mäter du rummet
Verklig robotevaluering är dyr och svår att upprepa. SIMPLER-författarna motiverar simulerad evaluering med observationen att verklig evaluering av sådana policyer inte är skalbar och möter reproducerbarhetsutmaningar som sannolikt försämras när policyer utökar sitt uppgiftsspektrum. RoboArena attackerar det från andra sidan, med mer än 600 parvis verklig robotbewering episoder över sju generalistpolicyer, körda av utvärderare på sju akademiska institutioner på DROID-plattformen. Dess utvärderare plockar sina egna uppgifter och miljöer men måste bedöma policypar dubbelblindat; artikeln rapporterar att denna crowdsourcad rankning spårar generalistpolicyprestanda mer exakt än konventionell, centraliserad evaluering.
Du kör inte 600 parade episoder på en SO-100 i en workshop. Vad du kan göra är ta bort variansen du styr – en lista så tråkig att det vanligtvis blir överhopp.
| Dimension | Frys detta | Vad drivs om du inte gör det |
|---|---|---|
| Startposition | En skriven hemposition, körd före varje försök | Banan startar utanför distributionen |
| Objekt | Tejpmärkta märken, och samma fysiska objekt reserverade för evaluering | En "bättre" policy är verkligen ett närmare objekt |
| Kameror och ljus | Samma monteringar, index, exponering; persienner stängda; fotografi på uppsättningen | Byta kameraindex ensamt kan dominera resultatet |
| Försök och stoppningsregel | Fixad n, fast timeout, kriterium skrivet före runda | Post-hoc kriterier förvandlar nästan-missar till vad du behöver |
| Operatörsbeteende | Ingen intervention under evalueringförsöken | Evaluering blir en annan korrigeringssession |
Då aritmetiken, obarmhärtig vid försöksräkningen en workshop kan ge sig själv. Under normalapproximationen, 60 procents framgång över 20 försök bär ett standardfel nära 11 procentpoäng – kvadratroten av 0,6 gånger 0,4 över 20 – och skillnaden mellan två sådana rundor bär cirka 15. Ett hopp från 60 till 70 procent är därför i överensstämmelse med ingenting som hänt. Femtio försök för per-round siffran till ungefär 7 poäng, och kostar en eftermiddag.
Denna asymmetri är argumentet för intervention rate: beräknad över tusentals ramar snarare än tjugo binära resultat, rör sig den tidigare och smidigare. Varningen är att ramar inom en episod är starkt korrelerade – en dålig grip ger hundra på varandra följande interventionsramar – så den effektiva urvalsstorleken är närmare antalet övertagningar. Behandla hastigheten som tidlig indikatorn och framgångshastigheten som långsam sanningsvär.
Evalueringsepisoder måste aldrig gå in i den sammansatta träningsdatauppsättningen – annars är runda n+1 poängvärderad på data den tränade på, och kurvan mäter memorering.
Fälla 3: träning endast på korrigeringar böjer policyn
Korrigeringarna är de intressanta data, så instinkten är att träna på dem. Gör inte det. De kommer genom konstruktion från det smala skivstycket av tillståndsrymden där policyn redan misslyckades och säger nästan ingenting om merparten av körningen som fungerade. Fintrimmat på bara det skivstycket och du får en policy bra på att återhämta sig från ett förstört tillvagaläggande som har glömt hur man gör ett rent.
Mandlekar och kollegor byggde sitt fjärrkontrollsystem kring detta. Deras ramning: manipulationsuppgifter innehåller flaskhalsregioner som kräver en sekvens av exakta åtgärder – att infoga en pod i en kaffemaskin är deras exempel – där små avvikelser leder in i tillstånd demonstrationerna aldrig täckte. Deras algoritm tränar iterativt på de nya data så policyn lär sig att korsa dessa flaskhalsar, och de rapporterar att agenter tränade på interventionsdata slår agenter tränade på ett ekvivalent antal sampler från icke-interventionella demonstratörer.
- Snabbt: en kort körning över ett fåtal episoder är billig nog att upprepa
- Målriktat: gradienten domineras av tillstånden du bryr dig om
- Billigt för att testa om en korrigeringsstil är lärlighet alls
- Fintrimningsfördelningen liknar inte längre uppgiftsfördelningen
- Nominellt beteende kan försämras märkbart inom en enda runda
- Hastigheten kan falla medan framgång faller med det – rena segment utbytta för återhämtningar
Blandningsförhållandet är en hyperparameter och förtjänar att skrivas ner. Att komponera nästa dataset är där det är beslutat: originaldemonstrationerna plus korrigeringssetet, episodval per källa snarare än en regel som tyst drar in vad som är tillgängligt. Där är en komponeringssteg i cockpiten, och resultatet är ett vanligt dataset – se träningsdokumentationen. Vad inget verktyg gör för dig är registrering av vilket förhållande som producerade vilken kurva.
Fälla 4: människan är inte en konsekvent expert
DAggers teori antar en expert. Du är inte en i teknisk mening: dina korrigeringar är inte sampler från en fixerad betingad fördelning över åtgärder. ACT-författarna namnger detta när de listar hindren för finkornig manipulation – fel ackumuleras över tiden, och mänskliga demonstrationer kan vara icke-stationära. Deras system når fortfarande 80 till 90 procents framgång på sex verkliga uppgifter från tio minuters demonstrationer, så problemet är löslöst, inte frånvarande.
Robomimic-studien gör poängen från datasidan. Över sex offline-algoritmer på fem simulerade och tre verklig-världens multi-steg uppgifter, dess lärdomar inkluderar känslighet för designval, beroende på demonstrationskvalitet, och – den som gör ont mest här – variabilitet från stoppingskriterier, för tränings- och evalueringsmål skiljer sig. Checkpointen med lägsta förlustkostnad är inte tillförlitligt den med högsta framgångshastighet.
Det finns en hårdvaruversion av detta: inmatningsläget formar korrigeringen. En leader-follower inställning producerar kontinuerlig, människotakterad banor. Tangentbordsnudgar är hårt fäst av servern – två grader per samtal på armsammanfogningar, fyra på grepparen – så samma avsikt anländer som ett trappsteg av små steg. Skjutreglage skickar absoluta mål och servern rör högst sex grader mot dem per samtal. Tre lägen, tre åtgärdsfördelningar; blanda alla tre i en korrigeringssats och undra sedan varför tillvagaläggandet blev skakigt är självbildat. teleoperation-dokumentationen täcker vad varje läge skickar.
Väga interventionerna: IWR och vad som kom senare
Om korrigeringar är den värdefulla minoriteten, den principierade fixeringen är vikt snarare än exklusivitet. Intervention Weighted Regression är referensimplementationen: data är partitionerad in interventions- och icke-interventionssamples, och de två partitionerna provtas i lika proportion under träning. En korrigeringssats som är fem procent av ramarna bidrar sedan hälften av gradienten, utan att nominellt beteende försvinner från fördelningen.
Lika proportion är en utgångspunkt, inte en lag. Sirius generaliserar den genom att ersätta binärpartitionen med en kontinuerlig vikt från approximerat mänskligt förtroende; Sirius-Fleet flyttar beslutet uppströms, använder en visuell världsmodell och anomaliförutsägare för att bestämma när en människa frågas alls. Gemensam tråd: interventionsflaggan är en träningssignal, inte bara en bokföringskolumn.
| Metod | Vem beslutar när människan agerar | Hur interventionsdata används | Rapporterat resultat |
|---|---|---|---|
| DAgger (2011) | Fast schema; expert märker besökta tillstånd | En växande dataset, oviktad | Framad som en reducering till no-regret online learning |
| HG-DAgger (2019) | Människan, portgrind kontroll på ett verkligt system | Aggregerad; plus en lärd säkerhetströskel på modellövertygelse | Bättre än DAgger och BC på körning; inga interventionsnummer givna |
| IWR (2020) | Människan, via fjärrteleoperering | Interventions- och icke-interventionssamples dragna i lika proportion | Slår icke-interventionell demos på lika samplerantal |
| Sirius (2022) | Människan, under distribution | Viktad BC, vikter från approximerat mänskligt förtroende | 8 % ökning i simulering, 27 % på verklig hårdvara; 2x snabbare konvergens |
| ThriftyDAgger (2021) | Systemet, portgrind på nyhetsartiklar och risk | Interaktiv insamling under en övervakningsbudget | Användstudie (N=10): 58 % högre människa och 80 % högre robotprestanda än nästa bästa metod |
| Fleet-DAgger (2022) | Systemet, allokering av uppmärksamhet över en flotta | Flottas inlärning poängvärderad av Return on Human Effort | Upp till 8,8x högre ROHE än baslinjer |
| Sirius-Fleet (2024) | Anomaliförutsägare med självadapterande kriterier | Multi-uppgiftsinlärning med en visuell världsmodell | Färre interventionsförfrågningar när autonomin förbättras |

Fyra mätvärden värda att logga bredvid hastigheten
- Övertagningar per körning. Tjugo korta korrigeringar och en lång ger liknande hastigheter och beskriver olika policyer – en skakig, en med ett enda blint fläck.
- Genomsnittlig interventionslängd. Stigande längd med ett fallande antal betyder att återstående misslyckanden är de svåra, vilket är vad sen framsteg ser ut som.
- Tid till första intervention. En policy som får längre före den behöver hjälp förbättras även när den totala hastigheten är platt.
- Där interventioner klustrar. Bin flaggan genom normaliserad episodframsteg; en stabil topp över rundor pekar på ett flaskhalssystem.
Ett rundprotokoll du faktiskt kan köra
En mätt runda har sex steg och producerar en rad i loggen. De första fyra är loopen; de två sista gör det till en mätning.
- 1Frys evalueringsprotokollen före runda noll
Skriv ned startposition, objektplacering, kameror, försöksantal, timeout och framgångskriterium. Fotografi på bordet. Om dokumentet måste ändras, serien startar om.
- 2Mäta baslinjen
Kör protokollet utan interventioner och registrera framgångarna; kör sedan en instrumenterad session med övertagande aktiverat och registrera hastigheten. Dessa två nummer är runda noll.
- 3Samla in korrigeringar i en konsekvent stil
Ett inmatningsläge per runda, en operatör om du kan hantera det. Ta över på ett kriterium du kan säga högt – "gripper mer än två centimeter av vid tillvagaläggande" – och håll det för runda.
- 4Sortera varje episod samma dag
Korrigering, evaluering eller kassera. Tvetydiga episoder blir kasserade, inte sparade på teorin att mer data hjälper – en korrigering där du själv fumlade är värre än ingen episod.
- 5Komponera blandningen explicit
Originaldemonstrationerna plus korrigeringar, episodval per källa. Registrera basantal, korrigeringsantal och någon viktning – detta är fältet du vill ha om tre veckor.
- 6Fortsätt från checkpointen, då re-mäta
Träna den sammansatta dataseten från föregående checkpoint snarare än basmodellen, kör det frysta protokollet plus en instrumenterad session, lägg till raden, och jämför mot de tidigare två rundorna.
Två gränser ändrar hur du läser en svag runda. Att fortsätta från en checkpoint initialiserar vikterna från den – inte en optimisörsomstart, så schemat startar friskt och en kort körning från en konvergerad checkpoint kan röra sig väldigt lite. Och leader-align rörelse vid början av en övertagning har den minsta millage på verklig hårdvara av något i kedjan; om korrigeringar alla börjar med en konstig transient, titta där före att skylla blandningen.
Mätt loopen, redan ledningsverkstycka
ay-robots implementerar dessa sex steg som produktfunktioner: ta över mitt-körning från en ledare arm, tangentbord eller skjutreglage, med interventionsramar flaggade automatiskt; sortera varje episod som korrigering, evaluering eller kassera; komponera nästa dataset från originaldemonstrationerna plus korrigeringarna, episodval explicit per källa; och starta nästa träningskörning från föregående checkpoint istället för basmodellen.
Se hur DAgger-loopen fungerarVad numren inte kan säga dig
Ingenting av detta är löst, och en städad kurva bör inte övertyga dig annars. Intervention rate mäter ett gemensamt system – policy, hårdvara, operatör, rum – och tillskriver ingenting på egen hand. Det kan inte bedöma om korrigeringarna var bra, och det kommer att falla glatt på en uppgift som blev lättare för att objektet driftade två centimeter närmare över tre veckor.
Vad det gör är vända ett vagt intryck in i en kolumn du kan argumentera med. Alternativet är inte ett bättre mätvärde; det är tre veckor av insamlande korrigeringar kurvan skulle ha sagt dig, efter runda tre, att sluta samla in. Undersökningslitteraturen definierar interaktiv imitation learning som mänsklig feedback given intermittent under robotexekvering, vilket tillåter online förbättring av beteendet; familjen är bred, och ingen arrangemang av det fungerar utan ett tal per runda. Se även SO-100 imitation learning guide för basdatauppsättningen du blandar mot, köra en policy för inferenssidan, och DAgger loop sida för den implementerade pipelinen.
Är intervention rate bara ett minus framgångshastigheten?▾
Nej. Hastigheten mäter hur mycket av en körning du tog över; framgångshastigheten mäter om uppgiften utfördes utan dig. En körning kan lyckas med en 30 procents interventionshastighet, och en körning utan interventioner kan misslyckas helt och hållet. De skiljer sig också i brus: hastigheten rör sig smidigt över tusentals korrelerade ramar, framgångshastigheten hoppar mellan ett fåtal binära resultat. Logga båda.
Hur många evalueringförsök behöver jag för framgångshastigheten att betyda något?▾
Mer än vad som känns rimligt. Under normalapproximationen, 20 försök vid en sann 60 procents framgångshastighet bär ett standardfel nära 11 procentpoäng, så en 10-punkts förflyttning mellan rundor är omöjlig att skilja från brus; 50 försök för denna siffra till ungefär 7. Om du inte kan ge dig 50, behåll försöksräkningen identisk över rundor och behandla små rörelser som inkonclusiva.
Vad blandningsförhållande av demonstrationer till korrigeringar ska jag börja med?▾
Den dokumenterade utgångspunkten är IWRs: partitionera data in interventions- och icke-interventionssamples och dra dem i lika proportion, så korrigeringarna bidrar hälften av gradienten hur liten en fraktion av ramarna de är. Om din inställning inte kan väga provtagning, ungefärlig det genom episodantal när du komponerar dataseten och registrerar förhållandet. Träning på endast korrigeringar är alternativet att utesluta.
Min intervention rate gick upp efter en runda. Är runda bortkastad?▾
Inte nödvändigtvis, men kontrollera de tråkiga förklaringarna först: matchade checkpointen du körde den du tränade, gjorde en kameraindex eller montering förändring, gjorde objektplacering drift, var korrigeringsstilen konsekvent. Om alla fyra är rena och den parade framgångshastigheten också föll, misstänk blandningen – för få basdemonstrationerna mot korrigeringarna, eller korrigeringar som motsäger varandra. En äkta regression tillhör loggen, inte papperskorgen.
Kan jag hoppa över det frysta evalueringsprotokollen och bara titta på intervention rate?▾
Bara om du accepterar att du inte kan säga förbättring från habituation. Hastigheten beror på din egen realtidströskel för att gå in, och denna tröskel faller när du blir van vid policynklar. Det frysta protokollet är delen av mätningen din tröskel inte kan nå – tejpmärkta märken, en skriven hemposition, ett fast försöksantal, ett kriterium beslutet före runda. Det måste hålla sig oförändrat över serien.
Behåll loggen i förvaringsplatsen, inte i en anteckningsbok: rundor är dagar ifrån varandra, hårdvara blir ombyggd, och personen som läser kurvan i oktober är du utan minne från augusti. dokumentation FAQ täcker de operativa detaljer som lämnats här.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started