Representación abstracta de una escena de manipulación robótica, ilustrando la distribución de estados que una policy aprendida visita durante la ejecución
DAggerAprendizaje por ImitaciónComportamiento ClonadoAprendizaje RobóticoTeoría

DAgger Explicado: Por qué el Comportamiento Clonado Diverge y Lo Que Realmente Demuestra la Agregación de Conjuntos de Datos

AY-Robots ResearchAugust 27, 202615 min lectura

El aprendizaje por imitación ajusta una policy a la distribución de estados del experto y luego se despliega por sí sola. La brecha entre esas dos distribuciones es por qué una policy que parece correcta en validación se sale de la mesa en el paso 300. Este es el capítulo de teoría de nuestra serie DAgger: de dónde viene el término de error cuadrático, qué cambia la agregación de conjuntos de datos, qué asume la prueba de no-arrepentimiento, y qué parte del coste aún tiene que pagar el experto humano.

Hay un fracaso específico que todo el que entrena una policy de manipulación conoce tarde o temprano. La policy alcanza el cubo, se acerca a dos centímetros, duda, se desliza hacia los lados, luego hace algo que no tiene nada que ver con la tarea. La pérdida de validación era correcta. La repetición en circuito abierto contra episodios retenidos era correcta. Y sin embargo el brazo termina en una pose que no aparece en ningún lugar en los datos de entrenamiento, y desde allí no tiene nada sensato que decir.

Ese fracaso tiene un nombre y una teoría establecida detrás. Este es el primero de cuatro artículos sobre DAgger, y cubre el argumento en sí: por qué ajustar una policy a las trayectorias propias del demostrador produce un error que puede crecer con el cuadrado de la longitud del episodio, qué cambia la agregación de conjuntos de datos, y qué no promete la prueba de no-arrepentimiento. El bucle en hardware real se cubre en ejecutar un bucle DAgger en un SO-100, la variante con puerta humana en HG-DAgger e intervenciones con puerta humana, y la cuestión de medición en medir un bucle DAgger.

La versión corta

  • El aprendizaje por imitación entrena en la distribución de estados del experto y se evalúa en la del propio policy. La falta de coincidencia se agrava durante el episodio.
  • Ross y Bagnell mostraron que el coste adicional puede crecer como T al cuadrado por el error de cada paso; el artículo DAgger reafirma ese límite y nota que es ajustado.
  • DAgger etiqueta estados que el policy mismo visita, y se reentrena en cada conjunto de datos recopilado hasta ahora, no solo el más reciente.
  • La garantía es una reducción al aprendizaje en línea sin arrepentimiento: agregar y reentrenar es Seguir-al-Líder.
  • Se mantiene relativo a la mejor pérdida alcanzable en la clase de policy, no relativo a cero - y el experto aún tiene que etiquetar estados que nunca habría producido.

La suposición que el aprendizaje por imitación hace en silencio

Un conjunto de datos de demostración es un montón de pares observación-acción. El aprendizaje por imitación ajusta una función a ese montón con aprendizaje supervisado ordinario y se detiene allí. Es la idea más antigua en el campo. ALVINN de Pomerleau, en 1988, era una red de retropropagación de tres capas que tomaba imágenes de una cámara y un escáner láser y producía la dirección que el vehículo debería viajar; fue entrenada en imágenes de carreteras simuladas y siguió carreteras reales bajo algunas condiciones de campo. La receta no ha cambiado mucho; las redes sí.

Lo que se omite es una verificación de de dónde vinieron esos pares. Cada uno de ellos se encuentra en una trayectoria que el demostrador produjo. La policy que despliegas produce la suya propia. En el momento en que se desvía, se le está haciendo una pregunta sobre estados que no estaban en la distribución de entrenamiento, y su respuesta la mueve más lejos. Ross, Gordon y Bagnell abren el artículo DAgger exactamente con esto: la predicción secuencial viola el supuesto i.i.d. debajo del aprendizaje estadístico, porque las propias predicciones del aprendiz determinan las entradas que ve a continuación.

La ilustración más clara en ese artículo no es un robot en absoluto. Clonar un planificador casi óptimo para Super Mario Bros. produjo una policy que repetidamente se quedaba atrapada contra un obstáculo en lugar de saltarlo. La razón es todo el argumento en una oración: el experto siempre saltaba desde una distancia cómoda, por lo que el conjunto de datos no contenía ningún estado en el que Mario estuviera presionado contra un obstáculo, y por lo tanto ninguna etiqueta para qué hacer una vez que lo estuviera.

Cambia Mario por un brazo SO-100 y la estructura es idéntica. Tus demostraciones muestran un acercamiento limpio y un agarre limpio, no el grifo cerrándose dos centímetros en corto - entonces la policy no tiene idea de qué hacer desde allí, y lo que sea que adivine la mueve más lejos. El cambio de covariables es una propiedad del procedimiento de recopilación de datos, no de la arquitectura de la red.

De dónde viene el término cuadrático

El artículo de 2010 de AISTATS de Ross y Bagnell, Reducciones Eficientes para Aprendizaje por Imitación, hace que el compuesto sea preciso. Sea T el horizonte de la tarea, sea el coste de la tarea acotado en el intervalo unitario, y sea epsilon la pérdida sustituta medida bajo la distribución de estados del experto - el número que tu conjunto de validación reporta. Entonces el coste adicional de ejecutar esa policy durante T pasos, relativo al experto, está acotado por T al cuadrado por epsilon. Ross, Gordon y Bagnell replantean esto como Teorema 2.1 en el artículo DAgger y añaden la oración que importa: el límite es ajustado. Existen problemas donde una policy con pérdida epsilon en la distribución del experto realmente incurre en coste adicional que crece cuadráticamente en T.

Ajustado no significa típico. El término cuadrático es un caso peor sobre una clase de problemas, no una predicción sobre tu tarea pick-and-place. Lo que establece es que más demostración de experto no puede eliminar el problema: solo agudiza la estimación de epsilon en una distribución en la que la policy no será probada.

La ruta de escape está en el mismo artículo, replantea como Teorema 2.2. Si una policy logra pérdida epsilon bajo su propia distribución de estados, y una sola acción incorrecta cuesta como máximo u en coste futuro bajo el experto, el coste adicional está acotado por u por T por epsilon - lineal en el horizonte. La constante u es la cantidad interesante: como máximo 1 para desacuerdo 0-1 con el experto, y O(1) siempre que el experto pueda recuperarse en unos pocos pasos. En el peor de los casos es O(T), y el límite lineal no es mejor que el cuadrático.

ConfiguraciónLímite en coste adicional sobre el expertoEn qué se basa
Comportamiento clonado (Ross & Bagnell 2010, replantea como Thm. 2.1 en Ross et al. 2011)T al cuadrado por epsilonepsilon medida en la distribución de estados del experto; coste en [0,1]; el límite es ajustado
Cualquier policy con pérdida epsilon bajo su propia distribución (Thm. 2.2)u por T por epsilonu acota la penalización de coste futuro de una acción incorrecta; como máximo 1 para pérdida 0-1, O(T) en el peor caso
Entrenamiento hacia adelante (Ross & Bagnell 2010)u por T por epsilonuna policy por paso de tiempo; necesita T policies y un T conocido, finito
SMILe (Ross & Bagnell 2010)casi lineal en T y epsilon en algunas clases de problemasalpha en O(1/T al cuadrado), N en O(T al cuadrado log T); produce una mezcla estocástica
DAgger (Thm. 3.2, Ross et al. 2011)u por T por epsilon_N, más O(1)N en el orden de uT; pérdida acotada fuertemente convexa; aprendiz sin arrepentimiento; epsilon_N es la mejor pérdida en retrospectiva
Espacio de trabajo robótico representando estados que una policy visita que nunca aparecieron en el conjunto de demostraciones
Los estados que importan para una ronda DAgger son los que nadie demostró: el agarre casi fallido, el grifo semi-abierto, el brazo pasando el objeto.

Los dos intentos que vinieron antes de DAgger

El entrenamiento hacia adelante es la respuesta honesta pero impráctica. Entrena una policy separada para cada paso de tiempo, en orden, cada una en la distribución de estado inducida por las policies ya fijadas para pasos anteriores, para que cada policy vea exactamente la distribución que enfrentará. La trampa está en la descripción: T policies, entrenadas secuencialmente, sin parada anticipada. Para un episodio de manipulación a 30 fotogramas por segundo, T está en los cientos.

SMILe, del mismo artículo, y SEARN, del trabajo de Daume, Langford y Marcu sobre predicción estructurada, toman la otra ruta: una policy estacionaria, pero estocástica. Cada iteración entrena un componente y lo añade a una mezcla, desplazando la masa de probabilidad lejos del experto. El resultado es una mezcla en la que algunos componentes son peores que otros - en un brazo físico, un controlador que puede muestrear un componente malo a mitad de movimiento. Esa es la motivación establecida para querer un determinista policy en lugar de uno estocástico.

DAgger: una idea, una caja

Agregación de Conjuntos de Datos mantiene la policy determinista y mueve la solución a la recopilación de datos. Cada ronda: ejecuta el policy actual, registra los estados que visita, pregunta al experto cuál sería la acción correcta en cada uno, añade esos pares al conjunto de datos que ya tienes, reentrena en la unión. El nombre es el algoritmo - agregas, nunca descartas.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
El meta-algoritmo DAgger, Algoritmo 3.1 de Ross, Gordon & Bagnell (2011).

Tres detalles tienen más peso de lo que parecen. Las etiquetas son para estados visitados por el policy mixto, pero las acciones provienen del experto - el policy proporciona las preguntas, el experto las respuestas. El reentrenamiento está en el agregado completo, lo que hace que cada ronda sea un paso Seguir-al-Líder: en la ronda n eliges la mejor policy en retrospectiva sobre cada trayectoria hasta ahora. Ese encuadre es en el que se cuelga la prueba. Y el algoritmo termina devolviendo la mejor policy en la secuencia según se elige en un conjunto de validación, porque los teoremas garantizan que alguna policy en la secuencia es buena, no que la última sea.

El horario beta, y por qué no es un parámetro de sintonización

El policy mixto es beta_i por el experto más uno menos beta_i por el aprendiz. El punto es práctico: los primeros policies aprendidos se entrenan con muy pocos datos, cometen muchos errores, y de otra manera pasarían la ejecución en estados que se vuelven irrelevantes una vez que el policy mejora.

La teoría impone exactamente una condición: el promedio móvil de los betas debe ir a cero. El análisis funciona con beta_i acotado por (1 - alpha) a la potencia i-1, para una constante alpha independiente de T.

HorarioLo que haceLo que el artículo reporta
beta_1 = 1La primera ronda es demostración pura del experto; no se necesita policy inicialEl punto de partida recomendado en cada variante
beta_i = 1 si i = 1, sino 0Experto solo en la ronda uno; sin parámetro libreLa versión sin parámetros del artículo, que dice que a menudo funciona mejor en la práctica; 2980 en Super Mario Bros. después de 20 iteraciones
beta_i = p^(i-1) con p = 0.5La probabilidad de experto decae geométricamente3030 en el mismo benchmark, ligeramente por delante de la versión sin parámetros
beta_i = p^(i-1) con p = 0.9El experto permanece en el bucle mucho más tiempoConvergencia marcadamente más lenta; aún mejorando cuando terminaron las 20 iteraciones

La brecha entre 2980 y 3030 en una escala que va hasta aproximadamente 4300 es pequeña, pero la explicación del artículo es la nota práctica más útil en la sección. Con el horario sin parámetros, Mario se quedó atrapado en el mismo lugar temprano y generó una masa de datos casi duplicados desde esa ubicación; dejar que el experto conduzca una fracción del tiempo tanto lo desatrapó como amplió la variedad de estados. El horario es menos sobre la proporción de mezcla que sobre si tu recopilación de datos sigue produciendo nuevos estados o el mismo fracaso.

Por qué el horario no se transfiere a un brazo físico tal como está escrito

Una mezcla estocástica por paso de tiempo significa cambiar la autoridad de control a la velocidad de control, 30 veces por segundo en una configuración SO-100 típica. Ninguna interfaz de teleoperation hace eso seguro o significativo. En hardware real el horario beta da paso a una decisión humana sobre cuándo tomar el control: un algoritmo diferente con un análisis diferente.

La garantía: una reducción al aprendizaje en línea sin arrepentimiento

Aquí está el movimiento que hace el artículo lo que es. Trata cada ronda DAgger como un ejemplo en un problema de aprendizaje en línea, donde la pérdida en la ronda i es la pérdida sustituta bajo la distribución de estado del policy utilizado en la ronda i. El aprendiz se compromete a un policy antes de ver esa pérdida, y la secuencia es no-estacionaria porque depende de los policies producidos hasta ahora.

Un algoritmo es sin arrepentimiento si su pérdida promedio sobre N rondas se acerca a la del mejor policy único en retrospectiva. Seguir-al-Líder en pérdidas fuertemente convexas es tal algoritmo, con arrepentimiento promedio contrayéndose en el orden de 1/N - y reentrenar en el agregado completo es precisamente Seguir-al-Líder. Cualquier otro aprendiz sin arrepentimiento serviría: el análisis es una reducción, no una propiedad de un optimizador.

Un lema une la brecha entre el policy mixto que recopiló los datos y el policy aprendido que será desplegado: El Lema 4.1 acota la distancia L1 entre sus distribuciones de estado por 2 T beta_i. Esta es la razón por la que los betas deben decaer - mientras el experto aún tiene autoridad de control apreciable, los estados que recopila no son los estados que tu policy producirá. Combina el lema con el límite de arrepentimiento y el resultado principal sigue: después de aproximadamente T iteraciones, algún policy en la secuencia tiene pérdida sustituta bajo su propia distribución dentro de O(1/T) de epsilon_N. Alimenta eso en el límite lineal y aterrizas en el Teorema 3.2.

El lado empírico es modesto según los estándares actuales. En Super Tux Kart la línea base supervisada no mejoró sus caídas promedio por vuelta a medida que llegaban más datos, DAgger alcanzó una policy que nunca se cayó de la pista después de quince iteraciones, y SMILe después de veinte aún se cayó aproximadamente dos veces por vuelta. En el benchmark de escritura a mano, la precisión de carácter fue 82 por ciento sin estructura, 83.6 por ciento supervisado, 85.5 por ciento con DAgger. Ninguno de estos es un resultado de manipulación.

Lo que la prueba no promete

Las afirmaciones de teoremas son condicionales, y las condiciones son fundamentales.

La garantía DAgger, leída con cuidado
Lo que te da
  • Un límite lineal en lugar de cuadrático en T, bajo los supuestos establecidos.
  • Un policy determinista estacionario en lugar de una mezcla estocástica.
  • Una reducción genuina: cualquier aprendiz sin arrepentimiento encaja.
  • Un contador de iteraciones concreto - aproximadamente T rondas antes de que el término de arrepentimiento deje de importar.
  • Una garantía para al menos un policy en la secuencia, de ahí el pase de validación final.
Lo que no te da
  • Es relativo a epsilon_N, la mejor pérdida en la clase en retrospectiva, no relativo a cero. Si tu clase no puede representar al experto, está vacía en la práctica.
  • Necesita un método sin arrepentimiento o una pérdida sustituta fuertemente convexa - más fuerte que las reducciones de clasificación en las que se construye, como los autores notan.
  • La constante u puede ser O(T) en el peor caso, y el límite lineal entonces colapsa de nuevo a cuadrático.
  • Acota iteraciones, no etiquetas de experto. En un robot, las etiquetas son el presupuesto.
  • Asume que el experto puede ser consultado en cada estado visitado y responde correctamente allí. Ese supuesto es el coste completo.

Un resultado adicional a menudo se cita como refutación y no lo es. Rajaraman, Yang, Jiao y Ramachandran estudian los límites minimax del aprendizaje por imitación en MDPs episódicos con un espacio de estado finito S y horizonte H, y prueban un límite de suboptimalidad inferior en el orden de |S| H al cuadrado sobre N que se mantiene incluso cuando el aprendiz puede consultar activamente al experto en estados visitados. Esa es una tasa de caso peor sobre una clase de MDPs en un presupuesto de episodio fijo, y lo que descarta es la idea de que la interacción mejora la tasa minimax; el teorema de DAgger es una afirmación diferente, acotando la policy desplegada relativa a lo que su propia clase de policy puede lograr.

Swamy, Choudhury, Bagnell y Wu posteriormente clasificaron estos algoritmos por cuáles momentos del comportamiento del experto coinciden, e introdujeron una noción de recuperabilidad de momento que delinea qué tan bien cada familia mitiga el error compuesto. Los estudios de Osa y de Celemin cubren el panorama algorítmico y las interfaces de retroalimentación humana.

La factura: etiquetar estados que el experto nunca produjo

Todo lo anterior asume un experto que puede ser consultado en cualquier lugar. En simulación con un planificador que es casi gratis - los experimentos de Mario usaban un planificador casi óptimo con acceso completo al estado del juego. Con un humano en un robot es el coste dominante, y uno peculiar: el humano tiene que producir una acción correcta en una configuración que su propia competencia nunca habría creado.

Kelly, Sidrane, Driggs-Campbell y Kochenderfer plantean la objeción directamente en el artículo HG-DAgger. DAgger puro requiere que el experto suministre etiquetas de acción mientras no tiene control total del sistema. Esto reduce la seguridad, y con expertos humanos es probable que degrade la calidad de las etiquetas recopiladas, que atribuyen a la latencia de actuador percibida. La etiqueta que obtienes de vuelta no es la etiqueta que el algoritmo asumió.

Laskey y colegas atacan el problema desde el otro lado con DART, y su marco es directo: las técnicas en política son tediosas para supervisores humanos, añaden carga computacional, y pueden visitar estados peligrosos durante el entrenamiento. Su alternativa inyecta ruido calibrado en las propias demostraciones del supervisor, para que la recuperación sea demostrada sin que el robot ejecute nunca una policy no confiable. En MuJoCo Humanoid reportan que DART disminuye la recompensa acumulada del supervisor en 5 por ciento durante el entrenamiento, mientras que DAgger ejecuta policies con 80 por ciento menos recompensa acumulada que el supervisor; en agarre en desorden con un Toyota HSR, un aumento promedio de 62 por ciento sobre el aprendizaje por imitación.

SafeDAgger de Zhang y Cho trata las consultas a la policy de referencia como el recurso escaso: una policy de seguridad separada predice, sin consultar, si la policy primaria está a punto de desviarse de la referencia más allá de un umbral, y solo esos estados se entregan. Los tres reaccionan al mismo hecho - el análisis DAgger no cobra nada por etiquetas de experto, y la realidad cobra mucho.

La parte que nadie te advierte

Etiquetar estados fuera de distribución es mentalmente más difícil que demostrar la tarea. Una demostración normal significa ejecutar un plan motor que ya tienes. Corregir una policy que ha puesto el grifo en algún lugar donde nunca irías significa construir una recuperación sobre la marcha, bajo presión de tiempo, con el robot aún en movimiento. Espera menos minutos utilizables por sesión que en una sesión de grabación simple, y observa tu propia calidad de corrección degradarse durante el curso de uno.

Estructura de conjunto de datos LeRobot mostrando episodios, fotogramas y columnas por fotograma según se almacenan en disco
Las correcciones se convierten en un conjunto de datos solo una vez que los fotogramas de intervención están marcados - en el formato LeRobot, una columna por fotograma junto con observación y acción.

Lo que esto significa para un SO-100 en tu escritorio

Traduce el horizonte a tus propias unidades. Un episodio de veinte segundos a 30 fotogramas por segundo es 600 pasos de decisión, y T en cada límite anterior es ese número. A T = 600, la diferencia entre un término que escala con T y uno que escala con T al cuadrado es la diferencia entre una policy que se recupera de un mal acercamiento y una que no.

Esta es parte de por qué el chunking de acciones ayuda: cuando una policy emite una secuencia corta de acciones por paso de inferencia, el número de puntos de decisión cae, y también lo hace el número de oportunidades para componer. Zhao, Kumar, Levine y Finn nombran el error compuesto como la motivación para Action Chunking with Transformers, y reportan 80 a 90 por ciento de éxito en seis tareas difíciles del mundo real, en hardware bimanual de bajo costo, a partir de diez minutos de demostraciones. El chunking no elimina el cambio de covariables - los estados aún son los del policy - pero acorta el horizonte efectivo. Ver chunking de acciones y la guía de aprendizaje por imitación SO-100.

La segunda traducción es la métrica de progreso. No puedes medir epsilon bajo la distribución del policy propia directamente - eso necesita acciones de experto de verdad fundamental para cada estado visitado, la cosa que estás tratando de evitar producir. Lo que un bucle con puerta humana te da en su lugar es la tasa de intervención: la fracción de fotogramas en una ejecución durante los cuales el humano había tomado el control. Es una representación, y se mueve por razones no relacionadas con el policy - un operador paciente interviene menos. Usada consistentemente, es el único número que dice si una ronda valió la tarde.

Una tercera traducción es una advertencia de calidad de datos que el análisis no cubre. Mandlekar y colegas estudiaron seis algoritmos de aprendizaje fuera de línea en cinco tareas de manipulación multi-etapa simuladas y tres del mundo real, y reportan una sensibilidad a elecciones de diseño algorítmico, una dependencia de la calidad de las demostraciones, y variabilidad causada por el criterio de parada. Belkhale, Cui y Sadigh argumentan que la calidad del conjunto de datos debe formalizarse a través de la divergencia de acción y la diversidad de transición, y notan que la diversidad de estado no siempre es beneficiosa. Una ronda DAgger añade estados que nadie eligió deliberadamente: algunos son los datos de recuperación que necesitas, algunos son el robot agitándose mientras buscas a tientas el control de takeover.

Mecánicamente una ronda es seis pasos: ejecuta inferencia con grabación activada, toma el control cuando el policy falla, revisa la ejecución y archiva cada episodio, sincroniza las correcciones, compone un conjunto de datos mixto a partir de originales más correcciones con selección de episodio hecha explícitamente por fuente, y continúa entrenando desde el checkpoint anterior en lugar del modelo base. En ay-robots esos pasos existen como botones, lo que elimina la fontanería pero no el juicio. Dos advertencias: continuar desde un checkpoint inicializa pesos y no es un curriculum de optimizador, y el movimiento de alineación de brazo líder aún está ligeramente probado en hardware. Ver entrenamiento y conjuntos de datos.

El bucle DAgger, ya conectado

Takeover durante una ejecución de inferencia activa, marcado de intervención por fotograma, archivado de episodios como correcciones o evaluaciones, composición de un conjunto de datos mixto con selección de episodio explícita por fuente, y continuación del entrenamiento desde un checkpoint existente están todos integrados. Aún decides cuándo tomar el control y qué mantener - esa parte no se automatiza.

Mira cómo funciona el bucle DAgger

El árbol genealógico, en una tabla

MétodoQuién elige los estadosLo que el experto suministraCoste principal
Aprendizaje por imitaciónEl expertoDemostraciones limpiasSin datos de recuperación; el error puede componer cuadráticamente en T
Entrenamiento hacia adelanteEl aprendiz, por paso de tiempoEtiquetas a lo largo de la distribución inducidaT policies separadas; inutilizable para horizontes largos
SMILe / SEARNUna mezcla estocástica de experto y aprendizEtiquetas a lo largo de la distribución de la mezclaLos componentes de la mezcla difieren en calidad
DAggerEl policy mixto, beta decayendo a ceroUna acción correcta para cada estado visitadoEtiquetar estados que el experto nunca produciría, mientras no está en control
DARTEl experto, perturbado por ruido inyectadoDemostraciones bajo ruido calibradoEl ruido debe calibrarse al error del aprendiz
HG-DAggerEl aprendiz, hasta que el humano toma el controlCorrecciones solo en segmentos con puerta humanaDepende del juicio del humano sobre cuándo intervenir
SafeDAggerEl aprendiz, filtrado por una puerta de seguridadEtiquetas solo cuando la puerta preguntaLa puerta misma debe ser entrenada y confiable

Preguntas frecuentes

¿Realmente observaré crecimiento de error cuadrático en mi robot?

No como una curva limpia. El límite es un caso peor: ajustado en que algún problema lo alcanza, no que el tuyo lo hará. Lo que ves es la consecuencia - una policy que puntúa bien en fotogramas retenidos, falla en la tarea real, y no mejora cuando grabas más de lo mismo. Si más datos limpios dejan de ayudar, eso es cambio de covariables, no un problema de volumen de datos.

¿Tengo que implementar la mezcla beta para llamarlo DAgger?

La versión sin parámetros - experto en la ronda uno, aprendiz puro después - es un caso especial legítimo y a menudo funcionó mejor en los experimentos originales. Lo que no puedes soltar es la agregación: reentrenar solo en las correcciones más nuevas rompe la interpretación Seguir-al-Líder, que es donde viene el argumento sin arrepentimiento. Entrenar solo en correcciones es un procedimiento mucho más débil.

¿Por qué devolver el mejor policy en un conjunto de validación en lugar del último?

Porque los teoremas garantizan que existe un policy bueno en algún lugar en la secuencia, no que sea la iteración final - el límite está en el mínimo sobre la secuencia. Enviar lo que salió de la última ronda descarta una condición establecida del resultado, y la última ronda no es confiablemente la mejor.

¿Cuántas rondas debo planificar?

La teoría quiere iteraciones en el orden de T, que para un episodio de 600 pasos no es un número que nadie ejecuta en hardware. Los experimentos originales ejecutaron veinte iteraciones en cada benchmark. En la práctica ejecutas rondas hasta que la tasa de intervención deja de caer, muy por debajo del contador que el análisis asume - una brecha real entre teoría y práctica.

¿Qué pasa si mi clase de policy simplemente no puede representar al experto?

Entonces DAgger no te salva, y el límite lo dice - se expresa relativo a epsilon_N, la mejor pérdida en la clase en retrospectiva. Si eso es grande por una arquitectura equivocada, una observación faltante o una cámara que no puede ver la escena, la agregación te da un policy que es óptimo dentro de una clase que no puede hacer la tarea. Ejecuta repetición en circuito abierto contra episodios retenidos antes de recopilar correcciones.

A dónde ir desde aquí

Si aún no has entrenado una policy, esta teoría es prematura: primero registra un conjunto de datos, comenzando desde entrenar tu primer policy y el cliente de escritorio. Si estás sopesando otras cien demostraciones limpias contra iniciar correcciones: las demostraciones limpias no solucionan un problema de distribución. Para la mecánica, continúa con la variante con puerta humana y luego el recorrido SO-100.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started