Spazio di lavoro su tavolo del robot del tipo utilizzato come setup di valutazione fisso per esecuzioni ripetute della policy
DAggerValutazioneApprendimento per ImitazioneDati RoboticiSO-100

Misurare un Loop di DAgger: Tasso di Intervento, Protocollo di Valutazione e i Tranelli in Mezzo

AY-Robots ResearchAugust 27, 202615 min di lettura

Il tasso di intervento - frame di intervento diviso i frame dell'esecuzione - è il segnale di progresso più economico e onesto che un loop di DAgger controllato dall'uomo può avere. Questo articolo lo definisce in modo che due persone calcolino lo stesso valore, mostra come registrarlo e analizza i quattro modi in cui ti inganna: abitazione dell'operatore, una configurazione di valutazione che deriva, allenamento solo su correzioni, e un uomo che corregge diversamente il martedì che il lunedì.

Un round di DAgger sembra produttivo mentre lo stai facendo. Guidi la policy, la rilevi quando fallisce l'afferraggio, salvi le correzioni, riallegni, e l'esecuzione successiva sembra - lo giureresti - un po' più fluida. Due round dopo non riesci a dire se è cambiato qualcosa, perché "un po' più fluida" non è una quantità.

Il loop ha bisogno di un numero per round, e in un loop controllato dall'uomo quel numero è quasi gratuito: la frazione dell'esecuzione durante la quale hai avuto il controllo invece della policy. Questo articolo lo definisce in modo che due persone calcolino lo stesso valore, lo registra, legge la curva risultante e nomina i quattro modi in cui ti inganna quando sta da solo. Per la teoria di cui questo articolo presuppone, vedi il documento di spiegazione su DAgger e la variante controllata dall'uomo; il corrispettivo pratico è eseguire un loop di DAgger su un SO-100.

La versione breve

  • Tasso di intervento = frame di intervento / frame dell'esecuzione. Frame, non episodi, e il denominatore include i frame che hai trascorso correggendo.
  • Una curva piatta su tre round significa che i round non comprano nulla - cambia il mix, il checkpoint o il compito invece di raccogliere un quarto.
  • Un tasso di intervento decrescente non è un tasso di successo crescente. La tua soglia per intervenire diminuisce mentre la fiducia cresce.
  • Senza un protocollo di valutazione congelato - stesse pose di inizio, oggetti, telecamere, numero di prove - stai misurando la stanza.
  • L'allenamento solo su correzioni distorce la distribuzione dello stato. La risposta di IWR: estrai campioni di intervento e non intervento in proporzioni uguali.

Perché un round ha bisogno di un numero in primo luogo

DAgger esiste a causa di un problema di distribuzione, e i problemi di distribuzione sono invisibili all'occhio. Ross e Bagnell hanno mostrato che l'apprendimento per imitazione su un insieme di dimostrazioni fisse porta a errori composti e a un limite di rimpianto che cresce quadraticamente nell'orizzonte temporale: una volta che lo studente lascia gli stati visitati dal dimostratore, nulla nei dati gli dice come tornare indietro. DAgger lo risolve iterando - esegui la policy, etichetta gli stati che visita, aggrega, riallegna - che Ross, Gordon e Bagnell inquadrano come una riduzione all'apprendimento online senza rimpianto.

Questo inquadramento ha una conseguenza che le persone saltano. La garanzia riguarda la sequenza di policy su iterazioni, non alcun singolo run. Non dice nulla se il tuo round tre ha aiutato. L'unico modo per saperlo è misurare ogni iterazione. Kelly e colleghi hanno introdotto HG-DAgger perché il DAgger classico chiede all'esperto le etichette di azione mentre il novizio è ancora in controllo, il che il documento sostiene può diminuire la sicurezza e, con esperti umani, è probabile che degradi la qualità dell'etichetta attraverso il lag dell'attuatore percepito. HG-DAgger impara anche una soglia di sicurezza per una metrica di rischio basata sull'incertezza del modello e segnala prestazioni migliorate sia rispetto a DAgger che al behavioral cloning su un compito di guida. Non pubblica i conteggi di intervento; quelli li produci tu stesso.

Definire il tasso in modo che due persone ottengono lo stesso numero

La definizione è una riga: frame di intervento diviso frame dell'esecuzione. Tutto ciò che è difficile si nasconde in cosa conta come un frame e cosa conta come un run.

Frame, non episodi

Contare gli episodi con almeno un intervento è inutile: dieci episodi con un tocco ciascuno e dieci in cui hai guidato l'80 percento entrambi danno "10/10". Il conteggio dei frame li separa, ed è la granularità che la registrazione ha già - nel formato del dataset LeRobot ogni timestep è una riga, quindi il flag di intervento è una colonna booleana accanto allo stato e all'azione. Qui è scritto per frame nel momento in cui inizia la ripresa e cancellato quando il controllo ritorna.

Il denominatore include le correzioni

Due denominatori sono difendibili - frame totali dell'esecuzione, o frame che la policy ha guidato autonomamente - e divergono terribilmente a livelli di intervento elevati. Riprendi il controllo per 400 di 1000 frame e il primo dà il 40 percento, il secondo il 67 percento. Confrontare un round misurato nel primo modo con il successivo misurato nel secondo modo è come un miglioramento reale scompare. Prendi frame totali e non rivisitare mai la scelta tra serie.

Decidi una volta cosa succede ai frame di handover

C'è sempre una cucitura. Quando il controllo passa, alcuni frame appartengono a nessuna delle due parti: il braccio è trattenuto, il leader sta allineando, la registrazione è congelata. In questa pipeline quegli frame di handover rimangono nel flusso grezzo e non entrano mai nell'episodio curato episodio - non sono né il comportamento della policy né una correzione che vale la pena allenarsi. Conta la cucitura nello stesso modo ogni round: a 30 Hz, sei handover con una cucitura di due secondi ciascuno sono 360 frame, abbastanza per spostare un punto percentuale.

Le tre decisioni che rompono la comparabilità

Frame o episodi; run totale o solo autonomo; frame di handover dentro o fuori. Uno qualsiasi dei tre cambiato silenziosamente tra i round rende la curva senza significato. Scrivi tutti e tre.

Registrarlo in modo che il numero sopravvive alla sessione

Una metrica nel pannello di stato di un processo in esecuzione è una lettura: scompare al riavvio e non può essere tracciata. Una riga solo append per run copre tutta la serie - incluso quale checkpoint hai guidato, poiché cambia ogni round e mescolarli invalida quello che segue.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Una riga per run. Registrare il denominatore e la convenzione di handover accanto al numero è più importante che i nomi dei campi.

Due campi portano il peso. train_mix è quello che hai alimentato al prossimo lavoro di allenamento; senza di esso nulla può essere attribuito. eval_protocol nomina il test fisso che hai eseguito in seguito, ed è il campo più spesso lasciato vuoto. Nel cockpit di ay-robots lo stato di ripresa segnala il conteggio dei frame di intervento per la sessione in esecuzione, quindi la registrazione è trascrizione piuttosto che strumentazione; il documentazione del dataset copre dove le colonne per frame atterrano.

Matrice di configurazione di allenamento che mostra policy, dataset e checkpoint fianco a fianco
Ogni round cambia checkpoint e mix di dataset. Un numero la cui combinazione non era registrata non può essere attribuita.

Leggere la curva: tre round, un verdetto

Tre round è il minimo per una lettura, perché due punti sono sempre una linea. La tabella seguente è un modello di contabilità con numeri segnaposto, non misurazioni da alcun run. Stai cercando una diminuzione monotona abbinata da un aumento del successo su un test fisso.

RoundCheckpoint guidatoFrameFrame di interventoTassoSuccessi (su 20)
0 (baseline)policy di base5 9001 38023,4%7
1dal mix del round 05 61098017,5%10
2dal mix del round 15 41261111,3%11
3dal mix del round 25 38059811,1%12

I round uno e due stanno facendo un lavoro. Il round tre non lo è: il 11,3 percento contro l'11,1 percento è all'interno della variazione da run a run di qualsiasi cosa misurata su un braccio fisico, e un quarto round delle stesse correzioni spende un pomeriggio per nulla. Il segmento piatto dice di cambiare qualcosa di strutturale.

  • I fallimenti rimanenti non sono correggibili per teleoperazione - oggetto fuori portata, geometria della pinza, un giunto al suo limite. Nessun dato di correzione corregge un muro cinematico.
  • Le correzioni sono troppo poche rispetto al dataset di base per muovere il gradiente, e nulla le pesa.
  • Le correzioni si contraddicono a vicenda, quindi la policy fa la media di due strategie e atterra tra di loro.
  • Il fallimento è a monte: una telecamera si è mossa, l'illuminazione è cambiata, la vista del polso non corrisponde più all'allenamento.
  • Il compito è al massimo di questa classe di policy su questo hardware, e il passo successivo sono più dati di base.

Gli ultimi due non sono fallimenti del loop. In Sirius-Fleet una diminuzione della necessità di umani è il risultato progettato: poiché l'autonomia del robot migliora, i suoi predittori di anomalie adattano i loro criteri di previsione, portando a meno richieste di intervento umano e riducendo gradualmente il carico di lavoro umano nel tempo. Lì il criterio si adatta di proposito. In un loop manuale il tuo si adatta troppo, silenziosamente - quindi un tasso che si appiattisce perché il compito è al suo massimo sembra esattamente come uno che si è appiattito perché l'operatore ha smesso di notare. Che è il prossimo problema.

Tranello 1: un tasso decrescente non è un tasso di successo crescente

Il tasso di intervento misura esattamente una cosa: quanto dell'esecuzione hai deciso di possedere. Quella decisione è tua, presa in tempo reale, e si muove. Nel round zero intervieni al primo angolo di approccio cattivo; entro il round tre hai visto la policy recuperare da una dozzina di loro e la lasci provare. La tua soglia si è mossa; il policy potrebbe non essersi mosso. Il tasso cala in entrambi i casi.

La fiducia umana è almeno una quantità modellata nella letteratura piuttosto che una costante assunta. Sirius ripesa i campioni di allenamento con la fiducia umana approssimata e ottimizza la policy con il behavioral cloning ponderato, segnalando un aumento dell'8 percento in simulazione e del 27 percento su hardware reale rispetto lo stato dell'arte nel tasso di successo della policy, alla doppia velocità di convergenza. Questo tratta la fiducia come un peso sui dati. Non corregge la soglia nella tua testa tra il round zero e il round tre.

Non puoi rimuovere la deriva, quindi accoppia il tasso con qualcosa che la tua soglia non può toccare: un insieme fisso di prove in cui non intervieni affatto, valutato rispetto a un criterio scritto prima del round. Un tasso che scende mentre il tasso di successo accoppiato rimane fermo è la firma dell'abitazione - vale la pena catturare, perché da dentro il loop sembra un progresso.

Tasso di interventoTasso di successo su protocollo fissoLettura più probabile
scendesaleIl round ha funzionato. Continua.
scendepiattoLa tua soglia è derivata, o le correzioni hanno rimosso lo sforzo senza rimuovere i fallimenti.
scendescendeLe correzioni stanno degradando la policy. Controlla il mix e la loro coerenza interna.
piattopiattoIl round non ha comprato nulla. Cambia mix, checkpoint o compito prima di raccogliere di più.
salescendeRegressione. Sospetta il mix di allenamento, una telecamera cambiata o un mix di checkpoint prima di sospettare il metodo.

Tranello 2: senza un protocollo fisso, stai misurando la stanza

La valutazione del robot reale è costosa e difficile da ripetere. Gli autori di SIMPLER motivano la valutazione simulata con l'osservazione che la valutazione nel mondo reale di tali policy non è scalabile e affronta sfide di riproducibilità che probabilmente peggioreranno man mano che le policy ampliano il loro spettro di compiti. RoboArena lo attacca dall'altro lato, con più di 600 episodi di valutazione accoppiati su robot reale tra sette policy generaliste, eseguiti da valutatori in sette istituti accademici sulla piattaforma DROID. I suoi valutatori scelgono i loro compiti e ambienti ma devono giudicare le coppie di policy alla cieca; il documento segnala che questa classificazione crowdsourced traccia le prestazioni della policy generalista più accuratamente della valutazione centralizzata convenzionale.

Non eseguirai 600 episodi accoppiati su un SO-100 in un laboratorio. Quello che puoi fare è rimuovere la varianza che controlli - un elenco noioso abbastanza che di solito viene saltato.

DimensioneCongela questoCosa deriva se non lo fai
Posa di inizioUna posizione di base scritta, guidata prima di ogni provaLa traiettoria inizia fuori distribuzione
OggettiMarchi incollati e gli stessi oggetti fisici riservati per la valutazioneUna policy 'migliore' è davvero un oggetto più vicino
Telecamere e luceStessi montaggi, indici, esposizione; persiane chiuse; fotografa la configurazioneGli indici della telecamera scambiati soli possono dominare il risultato
Prove e regola di arreston fisso, timeout fisso, criterio scritto prima del roundI criteri post-hoc trasformano i quasi-mancati in qualsiasi cosa tu abbia bisogno
Comportamento dell'operatoreNessun intervento durante le prove di valutazioneLa valutazione diventa un'altra sessione di correzione

Quindi l'aritmetica, spietata ai conteggi dei test che un laboratorio può permettersi. Secondo l'approssimazione normale, il 60 percento di successo su 20 prove porta un errore standard vicino a 11 punti percentuali - la radice quadrata di 0,6 volte 0,4 su 20 - e la differenza tra due di questi round porta circa 15. Un balzo dal 60 al 70 percento è quindi coerente con nulla che sia successo. Cinquanta prove portano la cifra per round a circa 7 punti, e costano un pomeriggio.

Questa asimmetria è l'argomento per il tasso di intervento: calcolato su migliaia di frame piuttosto che venti risultati binari, si muove prima e più fluidamente. L'avvertenza è che i frame all'interno di un episodio sono fortemente correlati - un afferraggio scadente produce cento frame di intervento consecutivi - quindi la dimensione del campione effettivo è più vicina al numero di handover. Tratta il tasso come l'indicatore iniziale e il tasso di successo come la lenta verità del suolo.

Mantieni gli episodi di valutazione fuori dal pool di allenamento

Gli episodi di valutazione non devono mai entrare nel dataset di allenamento composto - altrimenti il round n+1 viene valutato su dati su cui è stato allenato, e la curva misura la memorizzazione.

Tranello 3: l'allenamento solo su correzioni piega la policy

Le correzioni sono i dati interessanti, quindi l'istinto è allenarsi su di loro. Non lo fare. Vengono per costruzione dalla fetta ristretta dello spazio di stato dove la policy stava già fallendo e dicono quasi nulla della maggior parte dell'esecuzione che ha funzionato. Fine-tune su quella sola fetta e ottieni una policy brava a recuperare da un approccio fallito che ha dimenticato come farne uno pulito.

Mandlekar e colleghi hanno costruito il loro sistema di intervento remoto attorno a questo. Il loro inquadramento: i compiti di manipolazione contengono regioni di collo di bottiglia che richiedono una sequenza di azioni precise - inserire un baccello in una macchina da caffè è il loro esempio - dove piccole deviazioni portano in stati che le dimostrazioni non hanno mai coperto. Il loro algoritmo allena iterativamente sui nuovi dati in modo che la policy impari a attraversare quei colli di bottiglia, e segnalano che gli agenti allenati su dati di intervento battono gli agenti allenati su un numero equivalente di campioni da dimostranti non intervenzionisti.

Fine-tuning solo correzioni contro un mix composto
Cosa ottieni solo da correzioni
  • Veloce: un breve run su pochi episodi è abbastanza economico da ripetere
  • Mirato: il gradiente è dominato dagli stati di cui ti preoccupi
  • Economico per testare se uno stile di correzione è apprendibile
Quale è il costo
  • La distribuzione di fine-tune non assomiglia più alla distribuzione del compito
  • Il comportamento nominale può degradarsi visibilmente all'interno di un singolo round
  • Il tasso può scendere mentre il successo scende con esso - segmenti puliti scambiati per recuperi

Il rapporto di miscelazione è un iperparametro e merita di essere scritto. Comporre il prossimo dataset è dove viene deciso: dimostrazioni originali più l'insieme di correzioni, selezione di episodi per fonte piuttosto che una regola che silenziosamente tira in tutto ciò che è disponibile. Lì è un passo di composizione nel cockpit, e il risultato è un dataset ordinario - vedi la documentazione di allenamento. Quello che nessuno strumento fa per te è registrare quale rapporto ha prodotto quale curva.

Tranello 4: l'umano non è un esperto coerente

La teoria di DAgger presuppone un esperto. Non sei uno nel senso tecnico: le tue correzioni non sono campioni da una distribuzione condizionale fissa su azioni. Gli autori di ACT lo nominano quando elencano gli ostacoli alla manipolazione fine - gli errori si compongono nel tempo, e le dimostrazioni umane possono essere non stazionarie. Il loro sistema arriva comunque all'80-90 percento di successo su sei compiti reali da dieci minuti di dimostrazioni, quindi il problema è trattabile, non assente.

Lo studio di robomimic fa il punto dal lato dei dati. In sei algoritmi offline su cinque compiti simulati e tre compiti multi-stadio nel mondo reale, le sue lezioni includono sensibilità alle scelte progettuali, dipendenza dalla qualità delle dimostrazioni, e - quella che fa più male qui - variabilità derivante dai criteri di arresto, perché gli obiettivi di allenamento e valutazione differiscono. Il checkpoint con la perdita più bassa non è affidabilmente quello con il tasso di successo più alto.

C'è una versione hardware di questo: la modalità di input forma la correzione. Un'impostazione leader-follower produce traiettorie continue e a ritmo umano. I nudge della tastiera sono bloccati duramente dal server - due gradi per chiamata sui giunti del braccio, quattro sulla pinza - quindi lo stesso intento arriva come una scala di piccoli passi. I cursori inviano obiettivi assoluti e il server si muove al massimo sei gradi verso di loro per chiamata. Tre modalità, tre distribuzioni di azione; mescolare tutte e tre in un insieme di correzioni e poi chiedersi perché l'approccio è diventato tremolante è autodannazione. La documentazione di teleoperazione copre cosa invia ogni modalità.

Pesare gli interventi: IWR e cosa è venuto dopo

Se le correzioni sono la minoranza di valore, la correzione principiata è peso piuttosto che esclusività. Intervention Weighted Regression è l'implementazione di riferimento: i dati sono partizionati in campioni di intervento e non intervento, e le due partizioni sono campionate in proporzioni uguali durante l'allenamento. Un insieme di correzioni che è il 5 percento dei frame quindi contribuisce metà il gradiente, senza che il comportamento nominale scompaia dalla distribuzione.

La proporzione uguale è un punto di partenza, non una legge. Sirius la generalizza sostituendo la partizione binaria con un peso continuo da fiducia umana approssimata; Sirius-Fleet sposta la decisione a monte, usando un modello di mondo visivo e predittori di anomalie per decidere quando un umano viene chiesto affatto. Il filo conduttore comune: il flag di intervento è un segnale di allenamento, non solo una colonna di contabilità.

MetodoChi decide quando l'umano agisceCome vengono utilizzati i dati di interventoRisultato segnalato
DAgger (2011)Pianificazione fissa; l'esperto etichetta gli stati visitatiUn dataset crescente, senza pesoInquadrato come una riduzione all'apprendimento online senza rimpianto
HG-DAgger (2019)L'umano, controllando il controllo su un sistema realeAggregato; più una soglia di sicurezza imparata sull'incertezza del modelloMeglio di DAgger e BC sulla guida; nessun conteggio di intervento dato
IWR (2020)L'umano, tramite teleoperazione remotaCampioni di intervento e non intervento disegnati in proporzioni ugualiBatte demo non intervenzionisti al conteggio di campioni uguale
Sirius (2022)L'umano, durante la distribuzioneBC ponderato, pesi dalla fiducia umana approssimataGuadagno dell'8% in simulazione, 27% su hardware reale; convergenza 2x più veloce
ThriftyDAgger (2021)Il sistema, controllando su novità e rischioRaccolta interattiva con un budget di supervisioneStudio dell'utente (N=10): prestazioni umane del 58% superiore e prestazioni del robot dell'80% superiore rispetto al miglior metodo successivo
Fleet-DAgger (2022)Il sistema, allocando l'attenzione su una flottaApprendimento da flotta valutato per Ritorno sullo Sforzo UmanoFino a 8,8x ROHE superiore alle baseline
Sirius-Fleet (2024)Predittori di anomalie con criteri autoadattantiApprendimento multi-compito con un modello di mondo visivoMeno richieste di intervento man mano che l'autonomia migliora
Vista della classifica che confronta le policy robotiche per punteggio misurato
Classificare le policy l'una contro l'altra significa qualcosa solo quando ogni voce ha eseguito lo stesso protocollo. Questo vale anche per i tuoi tre round.

Quattro metriche che vale la pena registrare accanto al tasso

  • Handover per run. Venti correzioni brevi e una lunga danno tassi simili e descrivono policy diverse - una tremolante, una con un unico punto cieco.
  • Lunghezza di intervento media. L'aumento della lunghezza con un calo del conteggio significa che i fallimenti rimanenti sono i difficili, che è come appare il tardo progresso.
  • Tempo al primo intervento. Una policy che arriva più lontano prima di aver bisogno di aiuto sta migliorando anche quando il tasso totale è piatto.
  • Dove si raggruppano gli interventi. Raccogli il flag per progresso di episodio normalizzato; un picco stabile tra i round punta a un singolo collo di bottiglia.

Un protocollo di round che puoi effettivamente eseguire

Un round misurato ha sei fasi e produce una riga nel registro. I primi quattro sono il loop; gli ultimi due lo rendono una misurazione.

  1. 1
    Congela il protocollo di valutazione prima del round zero

    Scrivi la posa di inizio, il posizionamento degli oggetti, le telecamere, il conteggio dei test, il timeout e il criterio di successo. Fotografa il tavolo. Se il documento deve cambiare, la serie ricomincia.

  2. 2
    Misurare la baseline

    Esegui il protocollo senza interventi e registra i successi; quindi esegui una sessione strumentata con takeover abilitato e registra il tasso. Quei due numeri sono il round zero.

  3. 3
    Raccogli le correzioni in uno stile coerente

    Una modalità di input per round, un operatore se riesci. Riprendi il controllo su un criterio che puoi dire ad alta voce - 'pinza più di due centimetri di distanza all'approccio' - e mantienilo per il round.

  4. 4
    Triage ogni episodio lo stesso giorno

    Correzione, valutazione o scarta. Gli episodi ambigui vengono scartati, non salvati sulla teoria che più dati aiutano - una correzione in cui tu stesso sei inciampato è peggio di nessun episodio.

  5. 5
    Componi il mix esplicitamente

    Dimostrazioni originali più correzioni, selezione di episodi per fonte. Registra conteggio di base, conteggio di correzioni e qualsiasi peso - questo è il campo che vuoi in tre settimane.

  6. 6
    Continua dal checkpoint, quindi remisura

    Allena il dataset composto dal checkpoint precedente piuttosto che dal modello di base, esegui il protocollo congelato più una sessione strumentata, aggiungi la riga, e confronta contro i due round precedenti.

Due limiti cambiano come leggi un round debole. Continuare da un checkpoint inizializza i pesi da esso - non una ripresa dell'ottimizzatore, quindi la pianificazione ricomincia da capo e un breve run da un checkpoint convergente può muoversi molto poco. E il movimento di allineamento del leader all'inizio di una ripresa ha il percorso più breve su hardware reale di qualsiasi cosa nella catena; se le correzioni iniziano tutte con un transiende strano, guardala prima di incolpare il mix.

Il loop misurato, già cablato

ay-robots implementa questi sei passaggi come caratteristiche di prodotto: riprendi il controllo a metà run da un braccio leader, tastiera o cursori, con frame di intervento contrassegnati automaticamente; triage ogni episodio come correzione, valutazione o scarta; componi il dataset successivo dalle dimostrazioni originali più le correzioni, selezione di episodi esplicita per fonte; e inizia il prossimo run di allenamento dal checkpoint precedente invece dal modello di base.

Vedi come funziona il loop di DAgger

Quello che i numeri non possono dirti

Nulla di questo è risolto, e una curva ordinata non dovrebbe persuaderti altrimenti. Il tasso di intervento misura un sistema congiunto - policy, hardware, operatore, stanza - e non attribuisce nulla di per sé. Non può giudicare se le correzioni erano buone, e scenderà felicemente su un compito che è diventato più facile perché l'oggetto è derivato due centimetri più vicino su tre settimane.

Quello che fa è trasformare un'impressione vaga in una colonna con cui puoi discutere. L'alternativa non è una metrica migliore; sono tre settimane di raccolta di correzioni che la curva ti avrebbe detto, dopo il round tre, di smettere di raccogliere. La letteratura di indagine definisce l'apprendimento per imitazione interattivo come il feedback umano dato intermittentemente durante l'esecuzione del robot, consentendo un miglioramento online del comportamento; la famiglia è ampia, e nessun arrangiamento di essa funziona senza un numero per round. Vedi anche la guida di apprendimento per imitazione SO-100 per il dataset di base con cui mescoli, eseguire una policy per il lato dell'inferenza, e la pagina del loop di DAgger per la pipeline implementata.

Il tasso di intervento è solo uno meno il tasso di successo?

No. Il tasso misura quanto dell'esecuzione hai ripreso; il tasso di successo misura se il compito è stato completato senza di te. Un run può avere successo con un tasso di intervento del 30 percento, e un run senza interventi può fallire del tutto. Differiscono anche nel rumore: il tasso si muove fluidamente su migliaia di frame correlati, il tasso di successo salta tra una manciata di risultati binari. Registra entrambi.

Quante prove di valutazione mi servono affinché il tasso di successo significhi qualcosa?

Più di quanto sembra ragionevole. Secondo l'approssimazione normale, 20 prove a un vero tasso di successo del 60 percento portano un errore standard vicino a 11 punti percentuali, quindi un movimento di 10 punti tra i round è indistinguibile dal rumore; 50 prove portano quella cifra a circa 7. Se non puoi permetterti 50, mantieni il conteggio dei test identico tra i round e tratta i piccoli movimenti come inconcludenti.

Quale rapporto di mix di dimostrazioni a correzioni dovrei iniziare?

Il punto di partenza documentato è quello di IWR: partizioni i dati in campioni di intervento e non intervento e li disegni in proporzioni uguali, quindi le correzioni contribuiscono metà il gradiente non importa quanta frazione dei frame sono. Se la tua configurazione non può pesare il campionamento, approssimalo tramite conteggi di episodi quando componi il dataset e registra il rapporto. L'allenamento solo su correzioni è l'opzione da escludere.

Il mio tasso di intervento è aumentato dopo un round. Il round è sprecato?

Non necessariamente, ma controlla prima le spiegazioni banali: il checkpoint che hai guidato corrisponde a quello che hai allenato, un indice o un montaggio della telecamera è cambiato, il posizionamento degli oggetti è derivato, lo stile di correzione era coerente. Se tutti e quattro sono puliti e il tasso di successo accoppiato è sceso anche lui, sospetta il mix - troppe poche dimostrazioni di base contro le correzioni, o correzioni che si contraddicono a vicenda. Una genuina regressione appartiene al registro, non al cestino.

Posso saltare il protocollo di valutazione fisso e solo guardare il tasso di intervento?

Solo se accetti che non puoi distinguere il miglioramento dall'abitazione. Il tasso dipende dalla tua soglia in tempo reale per intervenire, e quella soglia cala mentre ti abitui ai difetti della policy. Il protocollo congelato è la parte della misurazione che la tua soglia non può raggiungere - marchi incollati, una posa di base scritta, un conteggio di prove fisso, un criterio deciso prima del round. Deve rimanere invariato tra la serie.

Mantieni il registro nel repository, non in un notebook: i round sono giorni di distanza, l'hardware viene ricostruito, e la persona che legge la curva in ottobre sei tu senza memoria di agosto. La FAQ della documentazione copre i dettagli operativi tralasciati qui.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started