
Il tasso di intervento - frame di intervento diviso i frame dell'esecuzione - è il segnale di progresso più economico e onesto che un loop di DAgger controllato dall'uomo può avere. Questo articolo lo definisce in modo che due persone calcolino lo stesso valore, mostra come registrarlo e analizza i quattro modi in cui ti inganna: abitazione dell'operatore, una configurazione di valutazione che deriva, allenamento solo su correzioni, e un uomo che corregge diversamente il martedì che il lunedì.
Un round di DAgger sembra produttivo mentre lo stai facendo. Guidi la policy, la rilevi quando fallisce l'afferraggio, salvi le correzioni, riallegni, e l'esecuzione successiva sembra - lo giureresti - un po' più fluida. Due round dopo non riesci a dire se è cambiato qualcosa, perché "un po' più fluida" non è una quantità.
Il loop ha bisogno di un numero per round, e in un loop controllato dall'uomo quel numero è quasi gratuito: la frazione dell'esecuzione durante la quale hai avuto il controllo invece della policy. Questo articolo lo definisce in modo che due persone calcolino lo stesso valore, lo registra, legge la curva risultante e nomina i quattro modi in cui ti inganna quando sta da solo. Per la teoria di cui questo articolo presuppone, vedi il documento di spiegazione su DAgger e la variante controllata dall'uomo; il corrispettivo pratico è eseguire un loop di DAgger su un SO-100.
La versione breve
- •Tasso di intervento = frame di intervento / frame dell'esecuzione. Frame, non episodi, e il denominatore include i frame che hai trascorso correggendo.
- •Una curva piatta su tre round significa che i round non comprano nulla - cambia il mix, il checkpoint o il compito invece di raccogliere un quarto.
- •Un tasso di intervento decrescente non è un tasso di successo crescente. La tua soglia per intervenire diminuisce mentre la fiducia cresce.
- •Senza un protocollo di valutazione congelato - stesse pose di inizio, oggetti, telecamere, numero di prove - stai misurando la stanza.
- •L'allenamento solo su correzioni distorce la distribuzione dello stato. La risposta di IWR: estrai campioni di intervento e non intervento in proporzioni uguali.
Perché un round ha bisogno di un numero in primo luogo
DAgger esiste a causa di un problema di distribuzione, e i problemi di distribuzione sono invisibili all'occhio. Ross e Bagnell hanno mostrato che l'apprendimento per imitazione su un insieme di dimostrazioni fisse porta a errori composti e a un limite di rimpianto che cresce quadraticamente nell'orizzonte temporale: una volta che lo studente lascia gli stati visitati dal dimostratore, nulla nei dati gli dice come tornare indietro. DAgger lo risolve iterando - esegui la policy, etichetta gli stati che visita, aggrega, riallegna - che Ross, Gordon e Bagnell inquadrano come una riduzione all'apprendimento online senza rimpianto.
Questo inquadramento ha una conseguenza che le persone saltano. La garanzia riguarda la sequenza di policy su iterazioni, non alcun singolo run. Non dice nulla se il tuo round tre ha aiutato. L'unico modo per saperlo è misurare ogni iterazione. Kelly e colleghi hanno introdotto HG-DAgger perché il DAgger classico chiede all'esperto le etichette di azione mentre il novizio è ancora in controllo, il che il documento sostiene può diminuire la sicurezza e, con esperti umani, è probabile che degradi la qualità dell'etichetta attraverso il lag dell'attuatore percepito. HG-DAgger impara anche una soglia di sicurezza per una metrica di rischio basata sull'incertezza del modello e segnala prestazioni migliorate sia rispetto a DAgger che al behavioral cloning su un compito di guida. Non pubblica i conteggi di intervento; quelli li produci tu stesso.
Definire il tasso in modo che due persone ottengono lo stesso numero
La definizione è una riga: frame di intervento diviso frame dell'esecuzione. Tutto ciò che è difficile si nasconde in cosa conta come un frame e cosa conta come un run.
Frame, non episodi
Contare gli episodi con almeno un intervento è inutile: dieci episodi con un tocco ciascuno e dieci in cui hai guidato l'80 percento entrambi danno "10/10". Il conteggio dei frame li separa, ed è la granularità che la registrazione ha già - nel formato del dataset LeRobot ogni timestep è una riga, quindi il flag di intervento è una colonna booleana accanto allo stato e all'azione. Qui è scritto per frame nel momento in cui inizia la ripresa e cancellato quando il controllo ritorna.
Il denominatore include le correzioni
Due denominatori sono difendibili - frame totali dell'esecuzione, o frame che la policy ha guidato autonomamente - e divergono terribilmente a livelli di intervento elevati. Riprendi il controllo per 400 di 1000 frame e il primo dà il 40 percento, il secondo il 67 percento. Confrontare un round misurato nel primo modo con il successivo misurato nel secondo modo è come un miglioramento reale scompare. Prendi frame totali e non rivisitare mai la scelta tra serie.
Decidi una volta cosa succede ai frame di handover
C'è sempre una cucitura. Quando il controllo passa, alcuni frame appartengono a nessuna delle due parti: il braccio è trattenuto, il leader sta allineando, la registrazione è congelata. In questa pipeline quegli frame di handover rimangono nel flusso grezzo e non entrano mai nell'episodio curato episodio - non sono né il comportamento della policy né una correzione che vale la pena allenarsi. Conta la cucitura nello stesso modo ogni round: a 30 Hz, sei handover con una cucitura di due secondi ciascuno sono 360 frame, abbastanza per spostare un punto percentuale.
Frame o episodi; run totale o solo autonomo; frame di handover dentro o fuori. Uno qualsiasi dei tre cambiato silenziosamente tra i round rende la curva senza significato. Scrivi tutti e tre.
Registrarlo in modo che il numero sopravvive alla sessione
Una metrica nel pannello di stato di un processo in esecuzione è una lettura: scompare al riavvio e non può essere tracciata. Una riga solo append per run copre tutta la serie - incluso quale checkpoint hai guidato, poiché cambia ogni round e mescolarli invalida quello che segue.
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
"frames": 5412, "intervention_frames": 611, "rate": 0.113,
"takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
"handover_frames": "excluded", "episodes_kept_as_correction": 5,
"train_mix": {"base_demos": 120, "corrections": 41},
"eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}Due campi portano il peso. train_mix è quello che hai alimentato al prossimo lavoro di allenamento; senza di esso nulla può essere attribuito. eval_protocol nomina il test fisso che hai eseguito in seguito, ed è il campo più spesso lasciato vuoto. Nel cockpit di ay-robots lo stato di ripresa segnala il conteggio dei frame di intervento per la sessione in esecuzione, quindi la registrazione è trascrizione piuttosto che strumentazione; il documentazione del dataset copre dove le colonne per frame atterrano.

Leggere la curva: tre round, un verdetto
Tre round è il minimo per una lettura, perché due punti sono sempre una linea. La tabella seguente è un modello di contabilità con numeri segnaposto, non misurazioni da alcun run. Stai cercando una diminuzione monotona abbinata da un aumento del successo su un test fisso.
| Round | Checkpoint guidato | Frame | Frame di intervento | Tasso | Successi (su 20) |
|---|---|---|---|---|---|
| 0 (baseline) | policy di base | 5 900 | 1 380 | 23,4% | 7 |
| 1 | dal mix del round 0 | 5 610 | 980 | 17,5% | 10 |
| 2 | dal mix del round 1 | 5 412 | 611 | 11,3% | 11 |
| 3 | dal mix del round 2 | 5 380 | 598 | 11,1% | 12 |
I round uno e due stanno facendo un lavoro. Il round tre non lo è: il 11,3 percento contro l'11,1 percento è all'interno della variazione da run a run di qualsiasi cosa misurata su un braccio fisico, e un quarto round delle stesse correzioni spende un pomeriggio per nulla. Il segmento piatto dice di cambiare qualcosa di strutturale.
- I fallimenti rimanenti non sono correggibili per teleoperazione - oggetto fuori portata, geometria della pinza, un giunto al suo limite. Nessun dato di correzione corregge un muro cinematico.
- Le correzioni sono troppo poche rispetto al dataset di base per muovere il gradiente, e nulla le pesa.
- Le correzioni si contraddicono a vicenda, quindi la policy fa la media di due strategie e atterra tra di loro.
- Il fallimento è a monte: una telecamera si è mossa, l'illuminazione è cambiata, la vista del polso non corrisponde più all'allenamento.
- Il compito è al massimo di questa classe di policy su questo hardware, e il passo successivo sono più dati di base.
Gli ultimi due non sono fallimenti del loop. In Sirius-Fleet una diminuzione della necessità di umani è il risultato progettato: poiché l'autonomia del robot migliora, i suoi predittori di anomalie adattano i loro criteri di previsione, portando a meno richieste di intervento umano e riducendo gradualmente il carico di lavoro umano nel tempo. Lì il criterio si adatta di proposito. In un loop manuale il tuo si adatta troppo, silenziosamente - quindi un tasso che si appiattisce perché il compito è al suo massimo sembra esattamente come uno che si è appiattito perché l'operatore ha smesso di notare. Che è il prossimo problema.
Tranello 1: un tasso decrescente non è un tasso di successo crescente
Il tasso di intervento misura esattamente una cosa: quanto dell'esecuzione hai deciso di possedere. Quella decisione è tua, presa in tempo reale, e si muove. Nel round zero intervieni al primo angolo di approccio cattivo; entro il round tre hai visto la policy recuperare da una dozzina di loro e la lasci provare. La tua soglia si è mossa; il policy potrebbe non essersi mosso. Il tasso cala in entrambi i casi.
La fiducia umana è almeno una quantità modellata nella letteratura piuttosto che una costante assunta. Sirius ripesa i campioni di allenamento con la fiducia umana approssimata e ottimizza la policy con il behavioral cloning ponderato, segnalando un aumento dell'8 percento in simulazione e del 27 percento su hardware reale rispetto lo stato dell'arte nel tasso di successo della policy, alla doppia velocità di convergenza. Questo tratta la fiducia come un peso sui dati. Non corregge la soglia nella tua testa tra il round zero e il round tre.
Non puoi rimuovere la deriva, quindi accoppia il tasso con qualcosa che la tua soglia non può toccare: un insieme fisso di prove in cui non intervieni affatto, valutato rispetto a un criterio scritto prima del round. Un tasso che scende mentre il tasso di successo accoppiato rimane fermo è la firma dell'abitazione - vale la pena catturare, perché da dentro il loop sembra un progresso.
| Tasso di intervento | Tasso di successo su protocollo fisso | Lettura più probabile |
|---|---|---|
| scende | sale | Il round ha funzionato. Continua. |
| scende | piatto | La tua soglia è derivata, o le correzioni hanno rimosso lo sforzo senza rimuovere i fallimenti. |
| scende | scende | Le correzioni stanno degradando la policy. Controlla il mix e la loro coerenza interna. |
| piatto | piatto | Il round non ha comprato nulla. Cambia mix, checkpoint o compito prima di raccogliere di più. |
| sale | scende | Regressione. Sospetta il mix di allenamento, una telecamera cambiata o un mix di checkpoint prima di sospettare il metodo. |
Tranello 2: senza un protocollo fisso, stai misurando la stanza
La valutazione del robot reale è costosa e difficile da ripetere. Gli autori di SIMPLER motivano la valutazione simulata con l'osservazione che la valutazione nel mondo reale di tali policy non è scalabile e affronta sfide di riproducibilità che probabilmente peggioreranno man mano che le policy ampliano il loro spettro di compiti. RoboArena lo attacca dall'altro lato, con più di 600 episodi di valutazione accoppiati su robot reale tra sette policy generaliste, eseguiti da valutatori in sette istituti accademici sulla piattaforma DROID. I suoi valutatori scelgono i loro compiti e ambienti ma devono giudicare le coppie di policy alla cieca; il documento segnala che questa classificazione crowdsourced traccia le prestazioni della policy generalista più accuratamente della valutazione centralizzata convenzionale.
Non eseguirai 600 episodi accoppiati su un SO-100 in un laboratorio. Quello che puoi fare è rimuovere la varianza che controlli - un elenco noioso abbastanza che di solito viene saltato.
| Dimensione | Congela questo | Cosa deriva se non lo fai |
|---|---|---|
| Posa di inizio | Una posizione di base scritta, guidata prima di ogni prova | La traiettoria inizia fuori distribuzione |
| Oggetti | Marchi incollati e gli stessi oggetti fisici riservati per la valutazione | Una policy 'migliore' è davvero un oggetto più vicino |
| Telecamere e luce | Stessi montaggi, indici, esposizione; persiane chiuse; fotografa la configurazione | Gli indici della telecamera scambiati soli possono dominare il risultato |
| Prove e regola di arresto | n fisso, timeout fisso, criterio scritto prima del round | I criteri post-hoc trasformano i quasi-mancati in qualsiasi cosa tu abbia bisogno |
| Comportamento dell'operatore | Nessun intervento durante le prove di valutazione | La valutazione diventa un'altra sessione di correzione |
Quindi l'aritmetica, spietata ai conteggi dei test che un laboratorio può permettersi. Secondo l'approssimazione normale, il 60 percento di successo su 20 prove porta un errore standard vicino a 11 punti percentuali - la radice quadrata di 0,6 volte 0,4 su 20 - e la differenza tra due di questi round porta circa 15. Un balzo dal 60 al 70 percento è quindi coerente con nulla che sia successo. Cinquanta prove portano la cifra per round a circa 7 punti, e costano un pomeriggio.
Questa asimmetria è l'argomento per il tasso di intervento: calcolato su migliaia di frame piuttosto che venti risultati binari, si muove prima e più fluidamente. L'avvertenza è che i frame all'interno di un episodio sono fortemente correlati - un afferraggio scadente produce cento frame di intervento consecutivi - quindi la dimensione del campione effettivo è più vicina al numero di handover. Tratta il tasso come l'indicatore iniziale e il tasso di successo come la lenta verità del suolo.
Gli episodi di valutazione non devono mai entrare nel dataset di allenamento composto - altrimenti il round n+1 viene valutato su dati su cui è stato allenato, e la curva misura la memorizzazione.
Tranello 3: l'allenamento solo su correzioni piega la policy
Le correzioni sono i dati interessanti, quindi l'istinto è allenarsi su di loro. Non lo fare. Vengono per costruzione dalla fetta ristretta dello spazio di stato dove la policy stava già fallendo e dicono quasi nulla della maggior parte dell'esecuzione che ha funzionato. Fine-tune su quella sola fetta e ottieni una policy brava a recuperare da un approccio fallito che ha dimenticato come farne uno pulito.
Mandlekar e colleghi hanno costruito il loro sistema di intervento remoto attorno a questo. Il loro inquadramento: i compiti di manipolazione contengono regioni di collo di bottiglia che richiedono una sequenza di azioni precise - inserire un baccello in una macchina da caffè è il loro esempio - dove piccole deviazioni portano in stati che le dimostrazioni non hanno mai coperto. Il loro algoritmo allena iterativamente sui nuovi dati in modo che la policy impari a attraversare quei colli di bottiglia, e segnalano che gli agenti allenati su dati di intervento battono gli agenti allenati su un numero equivalente di campioni da dimostranti non intervenzionisti.
- Veloce: un breve run su pochi episodi è abbastanza economico da ripetere
- Mirato: il gradiente è dominato dagli stati di cui ti preoccupi
- Economico per testare se uno stile di correzione è apprendibile
- La distribuzione di fine-tune non assomiglia più alla distribuzione del compito
- Il comportamento nominale può degradarsi visibilmente all'interno di un singolo round
- Il tasso può scendere mentre il successo scende con esso - segmenti puliti scambiati per recuperi
Il rapporto di miscelazione è un iperparametro e merita di essere scritto. Comporre il prossimo dataset è dove viene deciso: dimostrazioni originali più l'insieme di correzioni, selezione di episodi per fonte piuttosto che una regola che silenziosamente tira in tutto ciò che è disponibile. Lì è un passo di composizione nel cockpit, e il risultato è un dataset ordinario - vedi la documentazione di allenamento. Quello che nessuno strumento fa per te è registrare quale rapporto ha prodotto quale curva.
Tranello 4: l'umano non è un esperto coerente
La teoria di DAgger presuppone un esperto. Non sei uno nel senso tecnico: le tue correzioni non sono campioni da una distribuzione condizionale fissa su azioni. Gli autori di ACT lo nominano quando elencano gli ostacoli alla manipolazione fine - gli errori si compongono nel tempo, e le dimostrazioni umane possono essere non stazionarie. Il loro sistema arriva comunque all'80-90 percento di successo su sei compiti reali da dieci minuti di dimostrazioni, quindi il problema è trattabile, non assente.
Lo studio di robomimic fa il punto dal lato dei dati. In sei algoritmi offline su cinque compiti simulati e tre compiti multi-stadio nel mondo reale, le sue lezioni includono sensibilità alle scelte progettuali, dipendenza dalla qualità delle dimostrazioni, e - quella che fa più male qui - variabilità derivante dai criteri di arresto, perché gli obiettivi di allenamento e valutazione differiscono. Il checkpoint con la perdita più bassa non è affidabilmente quello con il tasso di successo più alto.
C'è una versione hardware di questo: la modalità di input forma la correzione. Un'impostazione leader-follower produce traiettorie continue e a ritmo umano. I nudge della tastiera sono bloccati duramente dal server - due gradi per chiamata sui giunti del braccio, quattro sulla pinza - quindi lo stesso intento arriva come una scala di piccoli passi. I cursori inviano obiettivi assoluti e il server si muove al massimo sei gradi verso di loro per chiamata. Tre modalità, tre distribuzioni di azione; mescolare tutte e tre in un insieme di correzioni e poi chiedersi perché l'approccio è diventato tremolante è autodannazione. La documentazione di teleoperazione copre cosa invia ogni modalità.
Pesare gli interventi: IWR e cosa è venuto dopo
Se le correzioni sono la minoranza di valore, la correzione principiata è peso piuttosto che esclusività. Intervention Weighted Regression è l'implementazione di riferimento: i dati sono partizionati in campioni di intervento e non intervento, e le due partizioni sono campionate in proporzioni uguali durante l'allenamento. Un insieme di correzioni che è il 5 percento dei frame quindi contribuisce metà il gradiente, senza che il comportamento nominale scompaia dalla distribuzione.
La proporzione uguale è un punto di partenza, non una legge. Sirius la generalizza sostituendo la partizione binaria con un peso continuo da fiducia umana approssimata; Sirius-Fleet sposta la decisione a monte, usando un modello di mondo visivo e predittori di anomalie per decidere quando un umano viene chiesto affatto. Il filo conduttore comune: il flag di intervento è un segnale di allenamento, non solo una colonna di contabilità.
| Metodo | Chi decide quando l'umano agisce | Come vengono utilizzati i dati di intervento | Risultato segnalato |
|---|---|---|---|
| DAgger (2011) | Pianificazione fissa; l'esperto etichetta gli stati visitati | Un dataset crescente, senza peso | Inquadrato come una riduzione all'apprendimento online senza rimpianto |
| HG-DAgger (2019) | L'umano, controllando il controllo su un sistema reale | Aggregato; più una soglia di sicurezza imparata sull'incertezza del modello | Meglio di DAgger e BC sulla guida; nessun conteggio di intervento dato |
| IWR (2020) | L'umano, tramite teleoperazione remota | Campioni di intervento e non intervento disegnati in proporzioni uguali | Batte demo non intervenzionisti al conteggio di campioni uguale |
| Sirius (2022) | L'umano, durante la distribuzione | BC ponderato, pesi dalla fiducia umana approssimata | Guadagno dell'8% in simulazione, 27% su hardware reale; convergenza 2x più veloce |
| ThriftyDAgger (2021) | Il sistema, controllando su novità e rischio | Raccolta interattiva con un budget di supervisione | Studio dell'utente (N=10): prestazioni umane del 58% superiore e prestazioni del robot dell'80% superiore rispetto al miglior metodo successivo |
| Fleet-DAgger (2022) | Il sistema, allocando l'attenzione su una flotta | Apprendimento da flotta valutato per Ritorno sullo Sforzo Umano | Fino a 8,8x ROHE superiore alle baseline |
| Sirius-Fleet (2024) | Predittori di anomalie con criteri autoadattanti | Apprendimento multi-compito con un modello di mondo visivo | Meno richieste di intervento man mano che l'autonomia migliora |

Quattro metriche che vale la pena registrare accanto al tasso
- Handover per run. Venti correzioni brevi e una lunga danno tassi simili e descrivono policy diverse - una tremolante, una con un unico punto cieco.
- Lunghezza di intervento media. L'aumento della lunghezza con un calo del conteggio significa che i fallimenti rimanenti sono i difficili, che è come appare il tardo progresso.
- Tempo al primo intervento. Una policy che arriva più lontano prima di aver bisogno di aiuto sta migliorando anche quando il tasso totale è piatto.
- Dove si raggruppano gli interventi. Raccogli il flag per progresso di episodio normalizzato; un picco stabile tra i round punta a un singolo collo di bottiglia.
Un protocollo di round che puoi effettivamente eseguire
Un round misurato ha sei fasi e produce una riga nel registro. I primi quattro sono il loop; gli ultimi due lo rendono una misurazione.
- 1Congela il protocollo di valutazione prima del round zero
Scrivi la posa di inizio, il posizionamento degli oggetti, le telecamere, il conteggio dei test, il timeout e il criterio di successo. Fotografa il tavolo. Se il documento deve cambiare, la serie ricomincia.
- 2Misurare la baseline
Esegui il protocollo senza interventi e registra i successi; quindi esegui una sessione strumentata con takeover abilitato e registra il tasso. Quei due numeri sono il round zero.
- 3Raccogli le correzioni in uno stile coerente
Una modalità di input per round, un operatore se riesci. Riprendi il controllo su un criterio che puoi dire ad alta voce - 'pinza più di due centimetri di distanza all'approccio' - e mantienilo per il round.
- 4Triage ogni episodio lo stesso giorno
Correzione, valutazione o scarta. Gli episodi ambigui vengono scartati, non salvati sulla teoria che più dati aiutano - una correzione in cui tu stesso sei inciampato è peggio di nessun episodio.
- 5Componi il mix esplicitamente
Dimostrazioni originali più correzioni, selezione di episodi per fonte. Registra conteggio di base, conteggio di correzioni e qualsiasi peso - questo è il campo che vuoi in tre settimane.
- 6Continua dal checkpoint, quindi remisura
Allena il dataset composto dal checkpoint precedente piuttosto che dal modello di base, esegui il protocollo congelato più una sessione strumentata, aggiungi la riga, e confronta contro i due round precedenti.
Due limiti cambiano come leggi un round debole. Continuare da un checkpoint inizializza i pesi da esso - non una ripresa dell'ottimizzatore, quindi la pianificazione ricomincia da capo e un breve run da un checkpoint convergente può muoversi molto poco. E il movimento di allineamento del leader all'inizio di una ripresa ha il percorso più breve su hardware reale di qualsiasi cosa nella catena; se le correzioni iniziano tutte con un transiende strano, guardala prima di incolpare il mix.
Il loop misurato, già cablato
ay-robots implementa questi sei passaggi come caratteristiche di prodotto: riprendi il controllo a metà run da un braccio leader, tastiera o cursori, con frame di intervento contrassegnati automaticamente; triage ogni episodio come correzione, valutazione o scarta; componi il dataset successivo dalle dimostrazioni originali più le correzioni, selezione di episodi esplicita per fonte; e inizia il prossimo run di allenamento dal checkpoint precedente invece dal modello di base.
Vedi come funziona il loop di DAggerQuello che i numeri non possono dirti
Nulla di questo è risolto, e una curva ordinata non dovrebbe persuaderti altrimenti. Il tasso di intervento misura un sistema congiunto - policy, hardware, operatore, stanza - e non attribuisce nulla di per sé. Non può giudicare se le correzioni erano buone, e scenderà felicemente su un compito che è diventato più facile perché l'oggetto è derivato due centimetri più vicino su tre settimane.
Quello che fa è trasformare un'impressione vaga in una colonna con cui puoi discutere. L'alternativa non è una metrica migliore; sono tre settimane di raccolta di correzioni che la curva ti avrebbe detto, dopo il round tre, di smettere di raccogliere. La letteratura di indagine definisce l'apprendimento per imitazione interattivo come il feedback umano dato intermittentemente durante l'esecuzione del robot, consentendo un miglioramento online del comportamento; la famiglia è ampia, e nessun arrangiamento di essa funziona senza un numero per round. Vedi anche la guida di apprendimento per imitazione SO-100 per il dataset di base con cui mescoli, eseguire una policy per il lato dell'inferenza, e la pagina del loop di DAgger per la pipeline implementata.
Il tasso di intervento è solo uno meno il tasso di successo?▾
No. Il tasso misura quanto dell'esecuzione hai ripreso; il tasso di successo misura se il compito è stato completato senza di te. Un run può avere successo con un tasso di intervento del 30 percento, e un run senza interventi può fallire del tutto. Differiscono anche nel rumore: il tasso si muove fluidamente su migliaia di frame correlati, il tasso di successo salta tra una manciata di risultati binari. Registra entrambi.
Quante prove di valutazione mi servono affinché il tasso di successo significhi qualcosa?▾
Più di quanto sembra ragionevole. Secondo l'approssimazione normale, 20 prove a un vero tasso di successo del 60 percento portano un errore standard vicino a 11 punti percentuali, quindi un movimento di 10 punti tra i round è indistinguibile dal rumore; 50 prove portano quella cifra a circa 7. Se non puoi permetterti 50, mantieni il conteggio dei test identico tra i round e tratta i piccoli movimenti come inconcludenti.
Quale rapporto di mix di dimostrazioni a correzioni dovrei iniziare?▾
Il punto di partenza documentato è quello di IWR: partizioni i dati in campioni di intervento e non intervento e li disegni in proporzioni uguali, quindi le correzioni contribuiscono metà il gradiente non importa quanta frazione dei frame sono. Se la tua configurazione non può pesare il campionamento, approssimalo tramite conteggi di episodi quando componi il dataset e registra il rapporto. L'allenamento solo su correzioni è l'opzione da escludere.
Il mio tasso di intervento è aumentato dopo un round. Il round è sprecato?▾
Non necessariamente, ma controlla prima le spiegazioni banali: il checkpoint che hai guidato corrisponde a quello che hai allenato, un indice o un montaggio della telecamera è cambiato, il posizionamento degli oggetti è derivato, lo stile di correzione era coerente. Se tutti e quattro sono puliti e il tasso di successo accoppiato è sceso anche lui, sospetta il mix - troppe poche dimostrazioni di base contro le correzioni, o correzioni che si contraddicono a vicenda. Una genuina regressione appartiene al registro, non al cestino.
Posso saltare il protocollo di valutazione fisso e solo guardare il tasso di intervento?▾
Solo se accetti che non puoi distinguere il miglioramento dall'abitazione. Il tasso dipende dalla tua soglia in tempo reale per intervenire, e quella soglia cala mentre ti abitui ai difetti della policy. Il protocollo congelato è la parte della misurazione che la tua soglia non può raggiungere - marchi incollati, una posa di base scritta, un conteggio di prove fisso, un criterio deciso prima del round. Deve rimanere invariato tra la serie.
Mantieni il registro nel repository, non in un notebook: i round sono giorni di distanza, l'hardware viene ricostruito, e la persona che legge la curva in ottobre sei tu senza memoria di agosto. La FAQ della documentazione copre i dettagli operativi tralasciati qui.
Sources
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning (DAgger)
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer: HG-DAgger - Interactive Imitation Learning with Human Experts (arXiv 2018, ICRA 2019)
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- IWR project page (Stanford): Intervention Weighted Regression
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Liu, Nasiriany, Zhang, Bao & Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Liu et al. (2024): Multi-Task Interactive Robot Fleet Learning with Visual World Models (Sirius-Fleet)
- Hoque et al. (2022): Fleet-DAgger - Interactive Robot Fleet Learning with Scalable Human Supervision
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Atreya et al. (2025): RoboArena - Distributed Real-World Evaluation of Generalist Robot Policies
- Li et al. (2024): Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started