
DAgger puro pide a un humano que etiquete estados mientras el robot todavía está conduciendo. En hardware real eso no es seguro y produce etiquetas de mala calidad. Las variantes con gate reemplazan el etiquetado ciego con una compuerta que alguien debe mantener: el humano en HG-DAgger, un clasificador de seguridad en SafeDAgger, el desacuerdo de un ensamble en EnsembleDAgger, una estimación de novedad y riesgo presupuestada en ThriftyDAgger. Este artículo las compara por quién controla la compuerta, qué señal la abre, y cuánto cuesta cada una — y por qué la forma con gate humano es la que sobrevive el contacto con un brazo real.
Una política clonada falla donde sus datos de entrenamiento se acaban. La solución es seguir recolectando datos bajo la distribución de estados propia de la política en lugar de la del demostrador, que es lo que hace DAgger y que la introducción a la agregación de conjuntos de datos cubre desde primeros principios. Deja abierta la parte incómoda del algoritmo original: mientras el aprendiz conduce, el experto se supone que debe decir qué habría hecho, para cada estado, sin estar en control.
En un simulador con un experto escribido eso es gratis. En una mesa con un brazo real es ni gratis ni seguro. Los autores de HG-DAgger plantean la objeción con precisión: tales esquemas de muestreo requieren que el experto proporcione etiquetas de acción sin estar completamente en control del sistema, lo que puede disminuir la seguridad y, cuando se usan humanos como expertos, es probable que degrade la calidad de las etiquetas recolectadas debido al lag de actuador percibido (Kelly et al., 2019). Dos fallos se esconden en esa frase: la política sigue conduciendo hacia estados que nadie quiere que entre, y las etiquetas compradas con ese riesgo son peores que las que un humano produce mientras sostiene los controles. Cada variante abajo contesta la misma pregunta — pon una compuerta en el control y deja que alguien decida cuándo se abre. Se diferencian en quién es ese alguien.
La versión corta
- •Las variantes con gate reemplazan el etiquetado ciego con un interruptor entre control de política y control experto. Lo que las separa es quién controla el interruptor.
- •HG-DAgger le da el interruptor al humano y agrega solo datos registrados mientras el humano tenía control ininterrumpido.
- •SafeDAgger se lo da a un clasificador binario que predice desviación de una política de referencia; EnsembleDAgger requiere baja varianza de ensamble y pequeña distancia a la acción experta al mismo tiempo.
- •LazyDAgger añade histéresis para que el control no oscile; ThriftyDAgger controla por gate en novedad o riesgo estimado bajo un presupuesto de intervención explícito.
- •Las señales con gate robótico necesitan algo que una VLA fina típicamente carece en un brazo de clase hobby: una política de referencia, un ensamble barato, o incertidumbre epistémica calibrada.
- •La compuerta es la mitad del método. Lo que sucede a los segmentos de intervención después — mezclar, pesar, agregar — decide si la ronda mejoró algo.
Con gate humano y con gate robótico: la división que importa
El aprendizaje interactivo por imitación tiene su propia encuesta; Celemin y colegas lo clasifican junto con tipo de feedback, interfaz, modelo de aprendizaje, experiencia de usuario, aplicación y benchmark. La distinción que decide tu ingeniería es más simple que cualquiera de esos ejes, y trabajo reciente lo nombra directamente: un método es con gate humano cuando el supervisor decide cuándo intervenir, y con gate robótico cuando el agente decide cuándo pedir ayuda (Cai et al., 2025). Todo lo demás es maquinaria sirviendo una de esas dos opciones. El intercambio es visible desde el principio: una compuerta humana cuesta atención continua, y una compuerta robótica promete devolver esa atención — pero solo si la señal en la que controla es confiable, y construir esa señal es su propio problema de investigación.
SafeDAgger: un clasificador que predice su propia desviación
SafeDAgger (2016) de Zhang y Cho es la más temprana de estas compuertas. Consultar la política de referencia es la parte cara, así que una segunda red pequeña — la política de seguridad — predice si consultar vale la pena en absoluto. Devuelve una etiqueta binaria indicando si la política primaria es probable que se desvíe de una política de referencia sin consultarla. La etiqueta se define contra una desviación L2 al cuadrado entre las acciones de las dos políticas con un umbral tau, y el clasificador se ajusta con binary cross-entropy. En tiempo de ejecución decide por estado si el aprendiz sigue conduciendo o la referencia toma el control. El resumen reporta menos consultas de referencia en un simulador de carreras de coches más una aceleración de velocidad de convergencia que los autores atribuyen a un efecto de currículo automático, sin dar una cifra para ninguno.
El problema está en la definición, no en los resultados. Entrenar el clasificador requiere la acción de la política de referencia en cada estado usado para ajustarlo, lo que asume que la referencia es otro programa. Si tu referencia es una persona con un brazo líder, ese conjunto de etiquetas no es barato y el método pierde la propiedad para la que fue diseñado.
EnsembleDAgger: duda y discrepancia, ambas
Menda, Driggs-Campbell y Kochenderfer (2019) tratan la compuerta como una pregunta probabilística. EnsembleDAgger aproxima un Proceso Gaussiano usando un ensamble de redes neuronales y lee la varianza del ensamble como un proxy de confianza: alta varianza significa una región desigual de los datos de entrenamiento, que — asumiendo que el experto evita estados de fallo — se correlaciona con proximidad al fallo. La regla es una conjunción. El aprendiz puede actuar solo cuando la distancia L2 entre su acción media y la acción experta se mantiene por debajo de un umbral (discrepancia) y la varianza de su acción predicha se mantiene por debajo de una segunda (duda). Si alguno falla, el experto toma el control. El objetivo es maximizar la parte del aprendiz en acciones mientras se restringe la probabilidad de fallo; el papel reporta seguridad y aprendizaje mejorados contra otras variantes de DAgger en un péndulo invertido y MuJoCo HalfCheetah.
Esto silenciosamente descalifica la regla completa para supervisión sin manos. La distancia entre la acción del aprendiz y la del experto requiere la acción del experto en ese estado, en ese momento. Con un experto escribido, bien. Con un humano, el humano debe producir acciones continuamente — exactamente la carga que se suponía que las variantes con gate eliminarían. El término de duda solo es sin manos; la conjunción no lo es.
LazyDAgger: detén el interruptor de vibrar
Hoque y colegas (2021) atacaron un costo que los documentos anteriores no midieron: el interruptor en sí. Cada intervención interrumpe otro trabajo que el humano está haciendo, incurre en latencia con cada cambio de contexto entre supervisor y control autónomo, y requiere tiempo para realizar. Una compuerta que se abre y cierra diez veces por minuto es peor que una que se abre una vez por diez segundos, a parte autónoma idéntica. LazyDAgger extiende SafeDAgger con umbrales asimétricos — más difícil entrar en control de supervisor que mantenerse en él — para que el sistema no oscile en el límite. En simulación puede reducir cambios de contexto en un promedio de 60% sobre SafeDAgger en 3 tareas de control continuo mientras se mantiene el rendimiento de política de última generación; en manipulación de tela con un ABB YuMi reduce cambios de contexto en 60% mientras se logra una tasa de éxito 60% más alta que SafeDAgger en tiempo de ejecución.
ThriftyDAgger: novedad o riesgo, bajo un presupuesto
ThriftyDAgger (Hoque et al., CoRL 2021) comienza desde el presupuesto del supervisor en lugar de la política. Usa una política de conmutación aprendida para solicitar intervenciones solo en estados que son suficientemente (1) novedosos, donde la política de robot no tiene comportamiento de referencia para imitar, o (2) riesgosos, donde el robot tiene baja confianza en completar la tarea, con una métrica nueva para estimar ese riesgo. El presupuesto es una entrada, no un resultado: declaras cuánto tiempo humano gastarás. Aplicado en tiempo de ejecución el método logra una tasa de éxito del 100% en tanto las tareas de simulación como las tareas físicas, y un estudio de usuario con diez participantes controlando una flota de tres robots junto a una tarea de concentración reporta que aumenta el rendimiento humano y de robot en 58% y 80% respectivamente en comparación con el siguiente mejor algoritmo mientras reduce la carga de supervisor. La configuración de flota es el hogar natural para este trabajo; Fleet-DAgger después formalizó el aprendizaje de flota interactivo con múltiples robots y supervisores, proponiendo Return on Human Effort como la cantidad a optimizar.
HG-DAgger: el humano sostiene la compuerta
Kelly et al. (2019) van por el otro lado. No hay política de conmutación. El aprendiz se despliega hasta que el experto observa que el novato ha entrado en una región insegura del espacio de estados, en cuyo punto el experto toma el control y guía al sistema atrás. La regla de agregación es la parte estricta: Las etiquetas de acción experta se recolectan y se agregan al conjunto de datos solo durante estas trayectorias de recuperación, durante las cuales el experto humano tiene control ininterrumpido del sistema. Nada se etiqueta mientras el humano es un espectador.
No se detiene en el interruptor. HG-DAgger también aprende un umbral de seguridad para una métrica de riesgo basada en incertidumbre de modelo que puede usarse para predecir el rendimiento del novato totalmente entrenado en diferentes regiones del espacio de estados: registra cuán incierto estaba el aprendiz en los momentos en que el humano intervino y promedia el último cuarto de esos registros, donde el aprendiz más se parece a su forma final. Eso no es una compuerta que el robot opera sino un diagnóstico que te dice dónde se espera que la política terminada se mantenga. La evaluación cubre una tarea de conducción simulada y del mundo real y reporta rendimiento mejorado tanto sobre DAgger como sobre behavior cloning.
Una línea relacionada cambia lo que cuenta como etiqueta. Expert Intervention Learning de Spencer y colegas sostiene que cualquier cantidad de feedback experto, ya sea por intervención o no intervención, proporciona información sobre la calidad del estado actual, la optimalidad de la acción, o ambas, formalizado como una restricción en la función de valor del aprendiz y resuelto con aprendizaje en línea sin arrepentimiento. Bajo esa lectura, los tramos donde el humano miró y no hizo nada son débil evidencia positiva en lugar de vacío. EIL aprende evitación de colisiones de aproximadamente un minuto de control experto.

Las variantes lado a lado
| Método | Quién abre la compuerta | Señal | Necesidades disponibles | Reportado |
|---|---|---|---|---|
| DAgger (Ross et al., 2011) | Nadie — el aprendiz siempre conduce | Ninguno; el experto etiqueta cada estado visitado | Un experto capaz de etiquetar estados fuera de distribución mientras no está en control | Reducción sin arrepentimiento con garantías bajo la distribución de estados del aprendiz |
| HG-DAgger (Kelly et al., 2019) | El supervisor humano | El juicio del supervisor de que el estado no es seguro | Alguien observando, y un traspaso limpio de control | Vence a DAgger y behavior cloning en una tarea de conducción simulada y real; también aprende un umbral de riesgo |
| SafeDAgger (Zhang & Cho, 2016) | El robot | Clasificador binario para desviación L2 de la referencia por encima de tau | Una política de referencia consultable para las etiquetas del clasificador | Menos consultas de referencia en un simulador de carreras, convergencia más rápida (sin cifra dada) |
| EnsembleDAgger (Menda et al., 2019) | El robot | Varianza de ensamble y distancia a la acción experta, ambas por debajo de umbral | Un ensamble de redes más la acción experta en cada paso | Seguridad y aprendizaje mejorados en péndulo y HalfCheetah |
| LazyDAgger (Hoque et al., 2021) | El robot, con histéresis | Señal de SafeDAgger con umbrales de entrada y salida separados | Lo que SafeDAgger necesita, más un segundo umbral para sintonizar | ~60% menos cambios de contexto en 3 tareas; 60% éxito más alto en tela YuMi |
| ThriftyDAgger (Hoque et al., 2021) | El robot, bajo un presupuesto | Novedad, o riesgo estimado de no completar la tarea | Un estimador de riesgo aprendido y un presupuesto de intervención declarado | Éxito del 100% en tiempo de ejecución; estudio de usuario (N=10): ganancias de 58% y 80% sobre el siguiente mejor |
| EIL (Spencer et al., 2020) | El humano — la no intervención también cuenta | Intervención y su ausencia como restricciones en la función de valor | Aprendizaje en línea sin arrepentimiento sobre una restricción de valor | Evitación de colisiones de aproximadamente un minuto de control experto |
Lo que cada compuerta compra, y qué cobra
Lee hacia abajo la columna necesidades y un patrón cae: cada señal con gate robótico allí es un proxy que tiene que ser manufacturado, y cada proxy tiene su propia factura.
- Las señales de discrepancia (SafeDAgger, LazyDAgger, la mitad de la regla de EnsembleDAgger) necesitan una política de referencia. O tienes un experto escribido, en cuyo caso el problema interesante ya está resuelto, o un humano sigue produciendo acciones en segundo plano para que una distancia pueda calcularse.
- Las señales de duda necesitan incertidumbre epistémica calibrada. Un ensamble de pequeñas redes de control la aproxima; un ensamble de un modelo de visión-lenguaje-acción de tres mil millones de parámetros es un problema de memoria y latencia primero.
- Las señales de novedad y riesgo necesitan un estimador aprendido de terminación de tarea, ajustado en suficientes rollouts exitosos y fallidos. En una tarea que aún estás haciendo funcionar, esos datos no existen en la ronda uno.
- La compuerta humana necesita atención y nada más — la única señal disponible en el día uno, en cualquier arquitectura de política, sin modelo extra que entrenar.
- Ninguna compuerta robótica elimina al humano de la sala. Reducen la frecuencia con que el humano debe actuar, no si debe estar presente.
Hay una diferencia más silenciosa en lo que la compuerta produce. Una compuerta robótica disparándose a mitad de trayectoria entrega a una persona un brazo en movimiento en una pose arbitraria. Una compuerta humana deja al operador elegir el momento — después del alcance, antes del agarre, no a mitad de un swing. Los segmentos de recuperación de los dos no son igualmente limpios, y esos segmentos son el producto completo de la ronda.
Por qué la forma con gate humano gana en hardware real
Este es un argumento de ingeniería, no un resultado de benchmark — ningún artículo que encontramos ejecuta los cinco gates en el mismo manipulador con la misma clase de política. Descansa en cuatro puntos.
Primero, el supervisor está allí de todas formas. Nadie deja un brazo SO-100 corriendo desatendido junto a objetos que puede tumbar. Una vez que alguien está observando, el costo marginal de darle un botón de takeover es cercano a cero; construir un estimador de riesgo calibrado es un proyecto.
Segundo, la incertidumbre que realmente puedes medir en una política moderna a menudo es la cantidad equivocada. Una cabeza de difusión o flow-matching produce varianza entre segmentos de acción muestreados, y esa varianza refleja la multimodalidad que la cabeza fue entrenada a representar, no ignorancia epistémica sobre el estado. El término de duda de EnsembleDAgger usa un ensamble precisamente para capturar este último. Los dos se ven como el mismo número y no lo son; las entradas de chunking de acción y flow matching cubren cómo esas cabezas emiten acciones en primer lugar.
Tercero, los fallos que importan en manipulación a menudo son semánticos en lugar de estadísticamente inusuales. Una política cerrando el gripper dos centímetros antes, o alcanzando confiadamente el cubo equivocado de dos idénticos, no está en un estado de alta varianza — está confiada y equivocada. Ningún umbral de varianza atrapa eso; una persona observando lo atrapa inmediatamente.
Cuarto, calidad de etiqueta — el punto original de HG-DAgger, y el más a menudo omitido. Las etiquetas recolectadas mientras el humano tiene control ininterrumpido vencen etiquetas narradas sobre un sistema en movimiento. Si el objetivo es datos correctivos que vale la pena agregar, la carga de la prueba recae en la compuerta automatizada.
La imagen da vuelta cuando un supervisor es responsable de muchos robots — el régimen que el estudio de usuario de ThriftyDAgger y la formalización de Fleet-DAgger apuntan. Con una flota, la atención humana es el recurso escaso y una asignación imperfecta vence a ninguna. Con un brazo en un escritorio no estás en ese régimen.
El bucle con gate humano, ya conectado
Takeover durante una sesión de inferencia en ejecución, banderas de intervención por fotograma en los segmentos corregidos, curando cada corrida en correcciones o evaluación, componiendo un conjunto de datos mixto de fuentes que eliges, y continuando el entrenamiento desde un checkpoint existente están construidos en lugar de ser escritos a mano. Takeover funciona con un brazo líder, o con teclado y sliders si no tienes uno.
Ver cómo corre el bucle de DAggerLa compuerta es la mitad del método; el manejo de datos es la otra mitad
Una compuerta decide qué fotogramas condujo un humano, no qué hacer con ellos, y esa segunda decisión es dónde las rondas se desperdician más a menudo. La primera regla es la que la D en DAgger significa: agregue, no reemplace. Fine-tuning de un checkpoint puramente en unos pocos cientos de fotogramas de corrección te da un modelo que ha visto casi nada más que recuperaciones y ha olvidado la trayectoria nominal.
La segunda regla es que los fotogramas de intervención no son fotogramas ordinarios. Mandlekar et al. construyeron un sistema de teleoperación remota para manipulación 6-DoF dejando operadores monitorear políticas y tomar el control al fallar, luego entrenaron iterativamente con un algoritmo que anima a la política a aprender cómo atravesar cuellos de botella a través de las intervenciones; agentes entrenados en esos datos superaron agentes entrenados en un número igual de muestras de demostración ordinaria. Sirius empuja la idea hacia el despliegue, repesando muestras de entrenamiento con confianza humana aproximada y optimizando las políticas con behavioral cloning ponderado. Ambos necesitan un marcador por fotograma de qué fue conducido por humano, que es por qué el intervention flag importa más de lo que parece.
La tercera regla es que la mezcla automática es una trampa. Un conjunto de datos compuesto cuyos orígenes no puedes enumerar es uno que no puedes depurar cuando la siguiente ronda empeora. En esta plataforma el paso de compose es explícito por esa razón — conjunto de datos original más correcciones, selección de episodio por fuente, y el resultado es un dataset ordinario LeRobot que se sincroniza y entrena como cualquier otro; la documentación de conjunto de datos cubre el lado del formato.
| Paso en una ronda | Lo que produce | La forma más común en que falla |
|---|---|---|
| Ejecutar inferencia con grabación activada | Una corrida bajo la distribución de estados propia de la política | Registrada como teleoperación ordinaria, perdiendo que una política estaba conduciendo |
| Tomar el control al fallar | Segmentos de corrección con un intervention flag por fotograma | Corrigiendo bamboleo cosmético, enseñando estilo en lugar de una recuperación |
| Curar cada episodio | Correcciones, evaluación, o descartes | Mantener todo; un takeover fallido cuesta más de lo que el episodio vale |
| Sincronizar las correcciones | Un conjunto de datos versionado junto al original | Correcciones que nunca dejan la máquina local |
| Componer el conjunto de datos mixto | Original más correcciones, selección explícita | Auto-mezcla silenciosa, para que una regresión posterior no pueda rastrearse a una fuente |
| Continuar desde un checkpoint | Un checkpoint inicializado desde el anterior | Esperando un reinicio de optimizador; los pesos inicializan el modelo, no restauran el estado del optimizador |
Configurar una compuerta que una persona realmente puede sostener
El humano decide no es una especificación. Dos operadores con umbrales diferentes producen rondas incomparables, y un umbral a la deriva produce una tendencia que no puedes leer. Escribe los disparadores abajo antes de la primera corrida.
- Nombra las condiciones que abren la compuerta — alcance desviado más de un margen fijo, gripper cerrando en nada, una articulación a la deriva hacia un límite, un estancamiento de más de un segundo o dos — y mantén la lista sin cambios para la ronda.
- Nombra qué no la abre. El exceso de recorrido que la política se recupera por cuenta propia es señal de entrenamiento; tomar el control allí elimina una recuperación que ya conoce.
- Toma el control lo suficientemente temprano para un traspaso limpio, devuelve tan pronto como el estado es recuperable.
- Registra por qué tomaste el control, por episodio. Tres rondas después es el único registro de si el mismo fallo retorna.
- Mantén cámaras, texto de tarea y operador constantes en rondas. Cambia una y los números dejan de ser comparables.
Mecánicamente el traspaso tiene dos variantes. Con un brazo líder, el líder tiene que alcanzar la pose actual del seguidor antes de que se transfiera el torque, o el brazo salta; este movimiento de alineación es la parte menos probada de la cadena en hardware real. Sin un brazo líder el takeover es manual desde el primer keypress: el seguidor se sostiene y el operador lo empuja articulación por articulación desde el teclado o arrastra sliders, con abrazaderas del lado del servidor manteniendo cada entrada pequeña — un par de grados por keypress, un puñado por actualización de slider, porque un paso grande en una pose sostenida es cómo desnudas un servo. La versión paso a paso con las asignaciones de teclas está en el tutorial de una ronda de DAgger en un SO-100; trasfondo en ambos modos de teleoperación está en la documentación de teleoperación y la entrada líder-seguidor.

Leyendo si la compuerta hizo algo
La métrica de una ronda con gate humano es la intervention rate: fotogramas de intervención divididos por fotogramas de la corrida. Tiene un trabajo — si no cae en rondas, la ronda no compró nada, y la siguiente debe cambiar algo que no sea la cantidad de datos.
Es una métrica sesgada y deberías saber cómo. Mide el umbral del operador tanto como la competencia de la política, que es por qué la lista de disparadores se mantiene fija; un operador que se relaja en una sesión produce una curva caída con nada detrás. También ignora severidad — diez fotogramas para detener una colisión y diez para empujar un agarre se ven idénticos. Empareja con un conjunto de evaluación fijo sin datos de corrección jamás extraído. El artículo sobre medir un bucle de DAgger funciona a través del diseño de evaluación, incluyendo cómo mantener episodios de evaluación fuera de la mezcla de entrenamiento.
- Funciona en el día uno, en cualquier arquitectura de política, sin modelo extra que calibrar
- Atrapa fallos confiados-y-equivocados que ningún umbral de varianza detecta
- Produce correcciones registradas mientras el operador tenía control completo, en un momento que eligió
- Produce un marcador por fotograma que métodos ponderados por intervención como IWR y Sirius consumen
- Cuesta supervisión continua; no escala a una persona y muchos robots
- Depende de la consistencia del operador — un umbral a la deriva corrompe la intervention rate
- Produce ningún modelo de riesgo por sí solo; el umbral aprendido de HG-DAgger y el estimador de ThriftyDAgger son maquinaria extra
- Cuenta fotogramas, no consecuencias
- No puede rescatar una política cuyo fallo está aguas arriba del control, como una cámara intercambiada o una cadena de tarea mal etiquetada
Preguntas abiertas que vale la pena mantener a la vista
Los benchmarks son débiles. Spencer y colegas examinaron los usados para probar enfoques de aprendizaje por imitación y los encontraron realizables y simples y por lo tanto insuficientes para capturar los regímenes más difíciles de composición de errores vistos en problemas de toma de decisiones del mundo real — y, contra la literatura circundante, encontraron que plain behavior cloning se fue bien en ellos. Esa es razón para ser escéptico de cualquier ranking de variantes de DAgger descansando en esas tareas, incluyendo algunos números en la tabla arriba.
Las compuertas robóticas en políticas grandes tampoco se resuelven. El trabajo AIM reemplaza incertidumbre con una función Q proxy imitando la regla de intervención humana y reporta una mejora del 40% en costo de takeover y eficiencia de aprendizaje sobre ThriftyDAgger — en control continuo y discreto, no en un modelo de visión-lenguaje-acción conduciendo un manipulador. Si ninguno de estos gates transfiere a una VLA fina está abierto. La encuesta hace un punto relacionado: la terminología y estructura del campo no se unifican en toda la literatura, lo que hace métodos difíciles de comparar. En tu propio brazo, tus registros son la evidencia que tienes.
¿Es HG-DAgger realmente DAgger si el humano solo etiqueta durante intervenciones?▾
Mantiene la parte que importa — datos recolectados bajo la distribución de estados que el aprendiz induce, agregados con lo que vino antes — y suelta la parte que no sobrevive el contacto con hardware. Kelly et al. lo presentan como una variante; la garantía sin arrepentimiento de 2011 no se mantiene sin cambios.
¿Puedo usar una compuerta robótica en una política VLA fina en un SO-100?▾
No directamente. El clasificador de SafeDAgger necesita una política de referencia consultable que no tienes. EnsembleDAgger necesita un ensamble, que para un modelo de parámetros multi-mil-millones significa varias copias en memoria más su costo de inferencia. ThriftyDAgger necesita un estimador de riesgo ajustado en éxitos y fallos que no existen antes de tus primeras rondas.
¿Cuánto debe durar un solo takeover?▾
Lo suficiente para alcanzar un estado que la política pueda continuar, y no más: takeovers extendidos convierten la corrida en una sesión de demostración e inundan el conjunto de correcciones con comportamiento nominal. El hallazgo de LazyDAgger corta el otro camino también — muchos conmutadores muy cortos son su propio costo.
¿Debo entrenar solo en los segmentos corregidos?▾
No — esa es la forma más común de desperdiciar una ronda. Un modelo fine-tuned solo en recuperaciones ha visto casi nada más que recuperaciones. Mezcla correcciones en el conjunto de datos original con fuentes elegidas explícitamente; para ir más lejos, mira enfoques ponderados por intervención como IWR o Sirius, que pesan más los fotogramas conducidos por humano en lugar de aislarlos.
¿Qué si la intervention rate no cae después de una ronda?▾
Tómalo al pie de la letra: la ronda no ayudó. Antes de agregar correcciones, verifica las explicaciones más baratas — ¿se desvió el umbral del operador, fueron las correcciones cosméticas, contenía realmente el conjunto de datos compuesto, se inicializó el entrenamiento desde el checkpoint previsto. Una ronda que silenciosamente comenzó desde el modelo base se ve exactamente como una ronda que falló en aprender.
¿Lleva información la no intervención?▾
Bajo Expert Intervention Learning, sí: los tramos donde el supervisor miró y no actuó se leen como débil evidencia de que estado y acción fueron aceptables, formalizado como una restricción en la función de valor. La mayoría de pipelines prácticos, incluyendo este, marcan solo lo que el humano condujo.
Para un solo brazo en un escritorio la elección está hecha: sostén la compuerta tú mismo, escribe lo que la abre, y gasta el esfuerzo en el manejo de datos detrás de ella en lugar de en automatizar el interruptor. El lado de la plataforma se describe en la página de bucle de DAgger, opciones de entrenamiento por familia de política bajo entrenamiento y precios. Para trasfondo, empieza con aprendizaje por imitación y aprendizaje por imitación en el SO-100; para una primera corrida, ejecuta tu primera política es el camino más corto.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (ICRA 2019): HG-DAgger — Interactive Imitation Learning with Human Experts
- Zhang, Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Menda, Driggs-Campbell, Kochenderfer (IROS 2019): EnsembleDAgger — A Bayesian Approach to Safe Imitation Learning
- Hoque et al. (2021): LazyDAgger — Reducing Context Switching in Interactive Imitation Learning
- Hoque, Balakrishna, Novoseller, Wilcox, Brown, Goldberg (CoRL 2021, PMLR 164:598-608): ThriftyDAgger — Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Hoque et al. (2022): Fleet-DAgger — Interactive Robot Fleet Learning with Scalable Human Supervision
- Spencer et al. (2020): Learning from Interventions — Human-robot interaction as both explicit and implicit feedback (RSS 2020)
- Spencer et al. (2021): Feedback in Imitation Learning — The Three Regimes of Covariate Shift
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job — Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Celemin et al. (2022): Interactive Imitation Learning in Robotics — A Survey
- Cai, Peng, Zhou (2025): Robot-Gated Interactive Imitation Learning with Adaptive Intervention Mechanism
- LeRobot — making AI for robotics more accessible with end-to-end learning (Hugging Face)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started