Operatore che supervisiona un braccio robotico attraverso un'interfaccia di teleoperazione, mani ai comandi e pronto a prendere il controllo
DAggerApprendimento per imitazione interattivoHG-DAggerPolicy roboticheSO-100

HG-DAgger e le varianti con gate: chi decide quando prendere il controllo di una policy robotica

AY-Robots ResearchAugust 27, 202615 min di lettura

DAgger ordinario chiede a un umano di etichettare gli stati mentre il robot sta ancora guidando. Su hardware reale è pericoloso e produce etichette di bassa qualità. Le varianti con gate sostituiscono l'etichettamento cieco con un gate che qualcuno deve tenere: l'umano in HG-DAgger, un classificatore di sicurezza in SafeDAgger, il disaccordo di un ensemble in EnsembleDAgger, una stima della novità e del rischio sotto budget in ThriftyDAgger. Questo articolo le confronta in base a chi possiede il gate, quale segnale lo apre e quanto costa ciascuno — e perché la forma con gate umano è quella che sopravvive al contatto con un braccio reale.

Una policy clonata fallisce dove i dati di addestramento si esauriscono. La soluzione è continuare a raccogliere dati sotto la distribuzione degli stati della policy stessa invece di quella del dimostratore, che è quello che fa DAgger e l'introduzione all'aggregazione dei dataset copre da principi primi. Lascia aperta la parte difficile dell'algoritmo originale: mentre l'apprendista guida, l'esperto è supposto dire cosa avrebbe fatto, per ogni stato, senza essere al controllo.

In un simulatore con un esperto scritto è gratuito. Su un tavolo con un braccio reale non è né gratuito né sicuro. Gli autori di HG-DAgger formulano l'obiezione precisamente: tali schemi di campionamento "richiedono all'esperto di fornire etichette di azione senza avere il controllo completo del sistema", che "può diminuire la sicurezza e, quando si usano umani come esperti, è probabile che degradi la qualità delle etichette raccolte a causa della latenza percepita dell'attuatore" (Kelly et al., 2019). Due fallimenti si nascondono in quella frase: la policy continua a guidare in stati che nessuno vuole, e le etichette comprate con quel rischio sono peggiori di quelle che un umano produce mentre tiene i comandi. Ogni variante sottostante risponde alla stessa domanda — metti un gate al controllo e lascia a qualcuno decidere quando si apre. Si differenziano in chi è quel qualcuno.

La versione breve

  • Le varianti con gate sostituiscono l'etichettamento cieco con un interruttore tra il controllo della policy e il controllo dell'esperto. Ciò che le separa è chi possiede l'interruttore.
  • HG-DAgger dà l'interruttore all'umano e aggrega solo i dati registrati mentre l'umano aveva il controllo ininterrotto.
  • SafeDAgger lo dà a un classificatore binario che predice la deviazione da una policy di riferimento; EnsembleDAgger richiede bassa varianza dell'ensemble e piccola distanza dall'azione dell'esperto contemporaneamente.
  • LazyDAgger aggiunge isteresi in modo che il controllo non oscilletti; ThriftyDAgger mette un gate sulla novità o sul rischio stimato sotto un budget di intervento esplicito.
  • I segnali con gate robotico hanno bisogno di qualcosa che una VLA fine-tuned su un braccio di classe hobbistica di solito manca: una policy di riferimento, un ensemble economico, o incertezza epistemica calibrata.
  • Il gate è metà del metodo. Quello che accade ai segmenti di intervento dopo — mescolare, pesare, aggregare — decide se il ciclo ha migliorato qualcosa.

Umano-controllato e robot-controllato: la divisione che conta

L'apprendimento per imitazione interattivo ha il suo sondaggio; Celemin e colleghi lo catalogano insieme tipo di feedback, interfaccia, modello di apprendimento, esperienza utente, applicazione e benchmark. La distinzione che decide la tua progettazione è più semplice di uno qualsiasi di questi assi, e il lavoro recente la nomina direttamente: un metodo è human-gated quando il supervisore decide quando intervenire, e robot-gated quando l'agente decide quando chiedere aiuto (Cai et al., 2025). Tutto il resto è macchinario al servizio di una di queste due scelte. Il compromesso è visibile da subito: un gate umano costa l'attenzione continua, e un gate robotico promette di restituire quell'attenzione — ma solo se il segnale che controlla è affidabile, e costruire quel segnale è un problema di ricerca a sé.

SafeDAgger: un classificatore che predice la sua stessa deviazione

Il SafeDAgger di Zhang e Cho (2016) è il primo di questi gate. Interrogare la policy di riferimento è la parte costosa, quindi una seconda rete piccola — la safety policy — predice se interrogarla è utile a priori. "Restituisce un'etichetta binaria che indica se è probabile che la policy primaria si discosti da una policy di riferimento senza interrogarla". L'etichetta è definita contro una deviazione L2 al quadrato tra le azioni delle due policy con una soglia tau, e il classificatore è adattato con entropia incrociata binaria. Al momento dell'esecuzione decide per ogni stato se l'apprendista continua a guidare o il riferimento prende il sopravvento. L'abstract riferisce meno interrogazioni del riferimento in un simulatore di corse automobilistiche più un miglioramento della velocità di convergenza che gli autori attribuiscono a un effetto curriculum automatizzato, senza dare un numero per nessuno dei due.

L'inghippo è nella definizione, non nei risultati. L'addestramento del classificatore richiede l'azione della policy di riferimento su ogni stato usato per adattarlo, il che presume che il riferimento sia un'altro programma. Se il vostro riferimento è una persona con un braccio leader, quell'insieme di etichette non è economico e il metodo perde la proprietà per cui è stato progettato.

EnsembleDAgger: dubbio e discrepanza, entrambi

Menda, Driggs-Campbell e Kochenderfer (2019) trattano il gate come una questione probabilistica. EnsembleDAgger "approssima un Processo Gaussiano utilizzando un ensemble di reti neurali" e legge la varianza dell'ensemble come proxy di confidenza: alta varianza significa una regione diversa dai dati di addestramento, il che — assumendo che l'esperto eviti stati di fallimento — correla con la prossimità al fallimento. La regola è una congiunzione. L'apprendista può agire solo quando la distanza L2 tra l'azione media e l'azione dell'esperto rimane sotto una soglia (discrepanza) e la varianza dell'azione predetta rimane sotto una seconda (dubbio). Se uno fallisce, l'esperto prende il controllo. L'obiettivo è massimizzare la quota di azioni dell'apprendista mentre si vincola la probabilità di fallimento; il paper riferisce sicurezza migliorata e apprendimento rispetto ad altri varianti di DAgger su un pendolo inverso e MuJoCo HalfCheetah.

Il termine discrepanza richiede l'azione dell'esperto

Questo silenziosamente disqualifica la regola completa per la supervisione hands-off. La distanza tra l'azione dell'apprendista e quella dell'esperto richiede l'azione dell'esperto in quello stato, in quel momento. Con un esperto scritto, va bene. Con un umano, l'umano deve produrre azioni continuamente — esattamente l'onere che le varianti con gate erano destinate a rimuovere. Il termine dubbio solo è hands-off; la congiunzione non lo è.

LazyDAgger: ferma l'interruttore dal chattare

Hoque e colleghi (2021) hanno attaccato un costo che i paper precedenti non hanno misurato: l'interruttore stesso. Ogni intervento "interrompe altro lavoro che l'umano sta facendo, incorre in latenza con ogni cambio di contesto tra supervisore e controllo autonomo, e richiede tempo per eseguire". Un gate che si apre e chiude dieci volte al minuto è peggio di uno che si apre una volta per dieci secondi, con quota autonoma identica. LazyDAgger estende SafeDAgger con soglie asimmetriche — più difficile entrare nel controllo del supervisore che rimanervi — quindi il sistema non oscilla al confine. In simulazione "può ridurre i cambi di contesto in media del 60% rispetto a SafeDAgger su 3 compiti di controllo continuo mantenendo prestazioni della policy all'avanguardia"; nella manipolazione di tessuti con un ABB YuMi "riduce i cambi di contesto del 60% ottenendo un tasso di successo del 60% più alto di SafeDAgger al momento dell'esecuzione".

ThriftyDAgger: novità o rischio, sotto budget

ThriftyDAgger (Hoque et al., CoRL 2021) inizia dal budget del supervisore piuttosto che dalla policy. Usa "una policy di commutazione imparata per sollecitare interventi solo negli stati che sono sufficientemente (1) nuovi, dove la policy robotica non ha comportamento di riferimento da imitare, o (2) rischiosi, dove il robot ha bassa confidenza nel completamento del compito", con una metrica nuova per stimare quel rischio. Il budget è un input, non un risultato: dichiari quanto tempo umano spenderai. Applicato al momento dell'esecuzione il metodo "raggiunge un tasso di successo del 100% sia sui compiti simulati che fisici", e uno studio utente con dieci partecipanti che controllano una flotta di tre robot insieme a un compito di concentrazione riferisce che "aumenta la prestazione umana e robotica rispettivamente del 58% e 80% rispetto al prossimo miglior algoritmo riducendo il carico del supervisore". L'impostazione della flotta è la casa naturale per questo lavoro; Fleet-DAgger successivamente ha formalizzato l'apprendimento interattivo della flotta con più robot e supervisori, proponendo il Ritorno sullo Sforzo Umano come la quantità da ottimizzare.

HG-DAgger: l'umano tiene il gate

Kelly et al. (2019) vanno dall'altra parte. Non c'è switching policy. L'apprendista viene fatto rollout "fino a quando l'esperto osserva che il principiante è entrato in una regione non sicura dello spazio degli stati", a quel punto l'esperto prende il controllo e guida il sistema indietro. La regola di aggregazione è la parte ristretta: "Le etichette delle azioni esperti vengono raccolte e aggiunte al dataset solo durante queste traiettorie di recupero, durante le quali l'esperto umano ha il controllo ininterrotto del sistema." Nulla viene etichettato mentre l'umano è uno spettatore.

Non si ferma allo switch. HG-DAgger impara anche "una soglia di sicurezza per una metrica di rischio basata su incertezza del modello che può essere usata per predire la prestazione del principiante completamente addestrato in diverse regioni dello spazio degli stati": registra quanto era incerto l'apprendista nei momenti in cui l'umano è intervenuto e fa la media dell'ultimo quarto di quei record, dove l'apprendista assomiglia più alla sua forma finale. Questo non è un gate che il robot opera ma una diagnostica che ti dice dove la policy finita è prevista che tenga. La valutazione copre un compito di guida simulato e un compito reale e riferisce prestazioni migliorate sia su DAgger che su behavior cloning.

Una linea correlata cambia cosa conta come etichetta. Expert Intervention Learning di Spencer e colleghi sostiene che "qualsiasi ammontare di feedback esperto, sia per intervento che per non-intervento, fornisce informazioni sulla qualità dello stato corrente, l'optimalità dell'azione, o entrambi", formalizzato come un vincolo sulla funzione valore dell'apprendista e risolto con apprendimento online no-regret. Sotto quella lettura, i tratti dove l'umano ha guardato e non ha fatto nulla sono debole evidenza positiva piuttosto che vuota. EIL impara l'evitamento delle collisioni da circa un minuto di controllo esperto.

Area di lavoro del braccio robotico con fotocamere posizionate per la raccolta dati durante un rollout di policy supervisionato
Un ciclo con gate umano è un'ordinaria sessione di inferenza con un registratore attaccato. I frame che l'operatore ha guidato vengono contrassegnati; il resto rimane come era.

Le varianti affiancate

MetodoChi apre il gateSegnaleDisponibilità necessariaRiportato
DAgger (Ross et al., 2011)Nessuno — l'apprendista guida sempreNessuno; l'esperto etichetta ogni stato visitatoUn esperto in grado di etichettare stati off-policy senza essere al controlloRiduzione no-regret con garanzie sotto la distribuzione degli stati dell'apprendista
HG-DAgger (Kelly et al., 2019)Il supervisore umanoIl giudizio del supervisore che lo stato è pericolosoQualcuno che guarda, e un passaggio di controllo pulitoBatte DAgger e behavior cloning su un compito di guida simulato e reale; impara anche una soglia di rischio
SafeDAgger (Zhang & Cho, 2016)Il robotClassificatore binario per deviazione L2 dal riferimento al di sopra di tauUna policy di riferimento interrogabile per le etichette del classificatoreMeno interrogazioni del riferimento in un simulatore di corse, convergenza più veloce (nessun numero fornito)
EnsembleDAgger (Menda et al., 2019)Il robotVarianza dell'ensemble e distanza dall'azione dell'esperto, entrambi sotto sogliaUn ensemble di reti più l'azione dell'esperto ad ogni passoSicurezza e apprendimento migliorati su pendolo e HalfCheetah
LazyDAgger (Hoque et al., 2021)Il robot, con isteresiSegnale di SafeDAgger con soglie di entrata e uscita separateQuello che SafeDAgger richiede, più una seconda soglia da sintonizzare~60% meno cambi di contesto su 3 compiti; 60% più successo su YuMi fabric
ThriftyDAgger (Hoque et al., 2021)Il robot, sotto budgetNovità, o rischio stimato di non completare il compitoUn estimatore di rischio imparato e un budget di intervento dichiaratoSuccesso del 100% al momento dell'esecuzione; studio utente (N=10): guadagni del 58% e 80% rispetto al prossimo migliore
EIL (Spencer et al., 2020)L'umano — non-intervento conta ancheIntervento e la sua assenza come vincoli sulla funzione valoreApprendimento online no-regret su un vincolo di valoreEvitamento delle collisioni da circa un minuto di controllo esperto

Quello che ogni gate acquista, e quello che costa

Leggendo giù la colonna "disponibilità necessaria" e un pattern cade fuori: ogni segnale con gate robotico è un proxy che deve essere fabbricato, e ogni proxy ha il suo conto.

  • I segnali di discrepanza (SafeDAgger, LazyDAgger, metà della regola di EnsembleDAgger) hanno bisogno di una policy di riferimento. O hai uno scritto esperto, nel qual caso il problema interessante è già risolto, o un umano continua a produrre azioni in background così una distanza può essere calcolata.
  • I segnali di dubbio hanno bisogno di incertezza epistemica calibrata. Un ensemble di piccole reti di controllo lo approssima; un ensemble di un modello vision-language-action di tre miliardi di parametri è un problema di memoria e latenza prima.
  • I segnali di novità e rischio hanno bisogno di un estimatore imparato del completamento del compito, adattato su rollout sufficientemente riusciti e falliti. Su un compito che stai ancora facendo funzionare, quei dati non esistono nel ciclo uno.
  • Il gate umano ha bisogno di attenzione e niente altro — l'unico segnale disponibile al giorno uno, su qualsiasi architettura di policy, senza modello extra da addestrare.
  • Nessun gate robotico rimuove l'umano dalla stanza. Riducono quanto spesso l'umano deve agire, non se devono essere presenti.

C'è una differenza più silenziosa in quello che il gate produce. Un gate robotico che si attiva a metà traiettoria consegna a una persona un braccio in movimento in una posa arbitraria. Un gate umano lascia all'operatore scegliere il momento — dopo la portata, prima dell'afferratura, non a metà di uno swing. I segmenti di recupero dai due non sono ugualmente puliti, e quei segmenti sono l'intero prodotto del ciclo.

Perché la forma con gate umano vince su hardware reale

Questo è un argomento di ingegneria, non un risultato di benchmark — nessun paper che abbiamo trovato esegue tutti e cinque i gate sullo stesso manipolatore con la stessa classe di policy. Si basa su quattro punti.

In primo luogo, il supervisore è lì comunque. Nessuno lascia un braccio SO-100 in esecuzione incustodito accanto a oggetti che può far cadere. Una volta che qualcuno sta guardando, il costo marginale di dargli un pulsante di takeover è vicino a zero; costruire un estimatore di rischio calibrato è un progetto.

In secondo luogo, l'incertezza che puoi effettivamente misurare su una policy moderna è spesso la quantità sbagliata. Un diffusione o una testa di flow-matching produce varianza attraverso chunk di azioni campionati, e quella varianza riflette la multimodalità che la testa era addestrata a rappresentare, non ignoranza epistemica dello stato. Il termine dubbio di EnsembleDAgger usa un ensemble precisamente per catturare il secondo. I due sembranocome lo stesso numero e non lo sono; le voci action chunking e flow matching coprono come quelle teste emettono azioni in primo luogo.

In terzo luogo, i fallimenti che contano nella manipolazione sono spesso semantici piuttosto che statisticamente inusitati. Una policy che chiude il gripper due centimetri prima, o raggiunge con fiducia il cubo sbagliato di due identici, non è in uno stato di alta varianza — è fiducioso e sbagliato. Nessuna soglia di varianza cattura questo; una persona che guarda lo cattura immediatamente.

In quarto luogo, la qualità dell'etichetta — il punto originale di HG-DAgger, e quello più spesso saltato. Le etichette raccolte mentre l'umano aveva il controllo ininterrotto battono le etichette narrate su un sistema in movimento. Se l'obiettivo è dati correttivi che vale la pena aggregare, l'onere della prova sta con il gate automatizzato.

Dove i gate robotici ripagano

Il quadro si capovolge quando un supervisore è responsabile di molti robot — il regime che lo studio utente di ThriftyDAgger e la formalizzazione di Fleet-DAgger mirano. Con una flotta, l'attenzione umana è la risorsa scarsa e un'allocazione imperfetta batte nessuna. Con un braccio su una scrivania non sei in quel regime.

Il ciclo con gate umano, già cablato

Takeover durante una sessione di inferenza in esecuzione, flag di intervento per frame sui segmenti corretti, curare ogni ciclo in correzioni o valutazione, comporre un dataset misto da fonti che scegli, e continuare l'addestramento da un checkpoint esistente sono incorporati piuttosto che scritti a mano. Takeover funziona con un braccio leader, o con tastiera e slider se non ne hai uno.

Vedi come il ciclo DAgger viene eseguito

Il gate è metà del metodo; la gestione dei dati è l'altra metà

Un gate decide quali frame un umano ha guidato, non cosa farne, e quella seconda decisione è dove i cicli vengono sprecati più spesso. La prima regola è quella che la D in DAgger sta per: aggrega, non sostituire. Fine-tuning di un checkpoint puramente su poche centinaia di frame di correzione ti dà un modello che ha visto quasi nulla se non i recuperi e ha dimenticato la traiettoria nominale.

La seconda regola è che i frame di intervento non sono frame ordinari. Mandlekar et al. hanno costruito un sistema di teleoperazione remota per la manipolazione a 6-DoF che consente agli operatori di monitorare le policy e prendere il controllo su fallimento, quindi addestrare iterativamente con un algoritmo che "incoraggia la policy a imparare come attraversare i colli di bottiglia attraverso gli interventi"; gli agenti addestrati su quei dati hanno superato gli agenti addestrati su un numero uguale di campioni di dimostrazione ordinari. Sirius spinge l'idea nella distribuzione, "ri-pesando i campioni di addestramento con fiducia umana approssimata e ottimizzando le policy con behavioral cloning pesato". Entrambi hanno bisogno di un marcatore per-frame di cosa è stato guidato dall'umano, che è perché il flag di intervento conta più di quanto sembra.

La terza regola è che la miscelazione automatica è una trappola. Un dataset composto le cui fonti non puoi enumerare è uno che non puoi debuggare quando il prossimo ciclo peggiora. Su questa piattaforma il passo di composizione è esplicito per questa ragione — dataset originale più correzioni, selezione degli episodi per fonte, e il risultato è un dataset ordinario LeRobot che sincronizza e si allena come qualsiasi altro; la documentazione del dataset copre il lato del formato.

Passo in un cicloQuello che produceIl modo più comune in cui va storto
Esegui l'inferenza con la registrazione attivataUn ciclo sotto la distribuzione degli stati della policy stessaRegistrato come teleoperazione ordinaria, perdendo che una policy guidava
Prendi il controllo su fallimentoSegmenti di correzione con un flag di intervento per-frameCorreggere il wobble cosmetico, insegnare lo stile piuttosto che un recupero
Curate ogni episodioCorrezioni, valutazione, o scartaMantenere tutto; un takeover sbagliato costa più di quanto l'episodio valeva
Sincronizza le correzioniUn dataset versionato accanto all'originaleCorrezioni che non lasciano mai la macchina locale
Componi il dataset mistoOriginale più correzioni, selezione esplicitaAuto-miscelazione silenziosa, quindi una successiva regressione non può essere tracciata a una fonte
Continua da un checkpointUn checkpoint inizializzato da quello precedenteAspettandosi un riavvio dell'ottimizzatore; i pesi inizializzano il modello, non ripristinano lo stato dell'ottimizzatore

Impostare un gate che una persona può effettivamente tenere

"L'umano decide" non è una specifica. Due operatori con soglie diverse producono cicli non paragonabili, e una soglia alla deriva produce una tendenza che non puoi leggere. Scrivi i trigger prima del primo ciclo.

  1. Nomina le condizioni che aprono il gate — approccio errato di più di un margine fisso, gripper che si chiude su nulla, un giunto che va alla deriva verso un limite, una stallo di più di un secondo o due — e mantieni l'elenco invariato per il ciclo.
  2. Nomina cosa non lo apre. Overshoot di cui la policy si riprende da sola è segnale di addestramento; prendere il controllo lì cancella un recupero che già conosce.
  3. Prendi il controllo abbastanza presto per un passaggio pulito, riconsegna non appena lo stato è recuperabile.
  4. Registra il perché hai preso il controllo, per episodio. Tre cicli dopo è l'unico record se lo stesso fallimento ritorna.
  5. Mantieni telecamere, testo compito e operatore costanti tra cicli. Cambiane uno e i numeri smettono di essere comparabili.

Meccanicamente il passaggio ha due varianti. Con un braccio leader, il leader deve raggiungere la posa corrente del follower prima che la coppia si trasferisca, o il braccio salta; questo movimento di allineamento è la parte meno testata della catena su hardware reale. Senza un braccio leader il takeover è manuale dal primo tasto premuto: il follower è tenuto e l'operatore lo urta giunto per giunto dalla tastiera o trascina slider, con morsetti lato server che mantengono ogni input piccolo — un paio di gradi per tasto premuto, una manciata per aggiornamento slider, perché un grande passo in una posa trattenuta è come scassi un servo. La versione passo dopo passo con i binding di tasti è in la procedura dettagliata di un ciclo DAgger su un SO-100; background su entrambe le modalità di teleoperazione è in i documenti di teleoperazione e la voce leader-follower.

Confronto di architetture di policy supportate con le loro caratteristiche di addestramento e inferenza
Il gate è agnostico dell'architettura. Quale policy correggi cambia il costo di addestramento di un ciclo, non come funziona il takeover.

Leggere se il gate ha fatto qualcosa

La metrica di un ciclo con gate umano è il tasso di intervento: frame di intervento diviso i frame della corsa. Ha un lavoro — se non cade tra cicli, il ciclo non ha comprato nulla, e il prossimo dovrebbe cambiare qualcosa diverso dalla quantità di dati.

È una metrica distorta e dovresti sapere come. Misura la soglia dell'operatore tanto quanto la competenza della policy, che è perché l'elenco di trigger rimane fisso; un operatore che si rilassa durante una sessione produce una curva in calo senza nulla dietro. Ignora anche la gravità — dieci frame per fermare una collisione e dieci per spingere un'afferratura sembrano identici. Accoppialo con un insieme di valutazione fisso da cui nessun dato di correzione è mai stato estratto. L'articolo sulla misurazione di un ciclo DAgger funziona attraverso il design della valutazione, incluso come mantenere gli episodi di valutazione fuori dal mix di addestramento.

Il gate umano, onestamente
Quello che ti dà
  • Funziona al giorno uno, su qualsiasi architettura di policy, senza modello extra da calibrare
  • Cattura i fallimenti confident-and-wrong che nessuna soglia di varianza rileva
  • Produce correzioni registrate mentre l'operatore aveva il controllo completo, in un momento che ha scelto
  • Fornisce un marcatore per-frame che metodi ponderati di intervento come IWR e Sirius consumano
Quello che non fa
  • Costa supervisione continua; non scala a una persona e molti robot
  • Dipende dalla coerenza dell'operatore — una soglia alla deriva corrompe il tasso di intervento
  • Non produce modello di rischio da solo; la soglia imparata di HG-DAgger e l'estimatore di ThriftyDAgger sono macchinario extra
  • Conta frame, non conseguenze
  • Impossibile salvare una policy il cui fallimento è a monte del controllo, come una fotocamera scambiata o una stringa di compito etichettata male

Domande aperte che vale la pena tenere d'occhio

I benchmark sono deboli. Spencer e colleghi hanno esaminato quelli utilizzati per testare gli approcci di apprendimento per imitazione e li hanno trovati "realizzabili e semplici e quindi insufficienti per catturare i regimi più difficili di composizione di errori visti nei problemi di decisione nel mondo reale" — e, rispetto alla letteratura circostante, hanno trovato il plain behavior cloning fece bene su di loro. Questo è motivo di essere scettici di qualsiasi ranking di varianti di DAgger che si basa su quei compiti, inclusi alcuni numeri nella tabella sopra.

I gate robotici su policy grandi non sono risolti nemmeno. Il lavoro AIM sostituisce l'incertezza con una Q-function proxy che imita la regola di intervento umano e riferisce un miglioramento del 40% nel costo di takeover e nell'efficienza di apprendimento rispetto a ThriftyDAgger — in controllo continuo e discreto, non su un modello vision-language-action che guida un manipolatore. Se uno qualsiasi di questi gate si trasferisce a una VLA fine-tuned è aperto. Il sondaggio fa un punto correlato: la terminologia e la struttura del campo non sono unificate nella letteratura, il che rende i metodi difficili da comparare. Sul vostro braccio, i vostri log sono l'evidenza che avete.

HG-DAgger è veramente DAgger se l'umano etichetta solo durante gli interventi?

Mantiene la parte che importa — dati raccolti sotto la distribuzione degli stati che l'apprendista induce, aggregati con quello che veniva prima — e scarta la parte che non sopravvive al contatto con l'hardware. Kelly et al. lo presentano come una variante; la garanzia no-regret del 2011 non si riporta invariata.

Posso usare un gate robotico su una policy VLA fine-tuned su un SO-100?

Non direttamente. Il classificatore di SafeDAgger ha bisogno di una policy di riferimento interrogabile che non hai. EnsembleDAgger ha bisogno di un ensemble, che per un modello multi-miliardi-parametri significa diverse copie in memoria più il loro costo di inferenza. ThriftyDAgger ha bisogno di un estimatore di rischio adattato su successi e fallimenti che non esistono prima dei tuoi primi cicli.

Quanto a lungo dovrebbe essere un singolo takeover?

Abbastanza lungo da raggiungere uno stato da cui la policy può continuare, e non più: i takeover estesi trasformano la corsa in una sessione di dimostrazione e inondano l'insieme delle correzioni con comportamento nominale. Il risultato di LazyDAgger taglia anche l'altro modo — molti molto brevi switch sono il loro costo proprio.

Devo addestrare solo sui segmenti corretti?

No — questo è il modo più comune di sprecare un ciclo. Un modello fine-tuned solo su recuperi ha visto quasi nulla se non recuperi. Mischia correzioni nel dataset originale con fonti scelte esplicitamente; per andare più lontano, guarda approcci ponderati di intervento come IWR o Sirius, che danno più peso ai frame guidati da umani piuttosto che isolarli.

Cosa se il tasso di intervento non cade dopo un ciclo?

Prendilo al valore nominale: il ciclo non ha aiutato. Prima di aggiungere correzioni, controlla le spiegazioni più economiche — la soglia dell'operatore è andata alla deriva, le correzioni erano cosmetiche, il dataset composto effettivamente le conteneva, l'addestramento è stato inizializzato dal checkpoint previsto. Un ciclo che silenziosamente ha iniziato dal modello base sembra esattamente come un ciclo che non ha imparato.

Non-intervento porta informazioni?

Secondo Expert Intervention Learning, sì: i tratti dove il supervisore ha guardato e non ha agito vengono letti come debole evidenza che lo stato e l'azione erano accettabili, formalizzati come un vincolo sulla funzione valore. La maggior parte dei pipeline pratici, incluso questo, marcano solo quello che l'umano ha guidato.

Per un singolo braccio su una scrivania la scelta è fatta: tieni tu il gate, scrivi cosa lo apre, e spendi lo sforzo sulla gestione dei dati dietro invece che su automazione dello switch. Il lato della piattaforma è descritto su la pagina del ciclo DAgger, opzioni di addestramento per famiglia di policy sotto addestramento e prezzi. Per background, inizia con apprendimento per imitazione e apprendimento per imitazione su SO-100; per un primo ciclo, esegui la tua prima policy è il percorso più breve.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started