
Relato paso a paso de una ronda DAgger supervisada por humanos en un brazo SO-100: ejecutar la política y grabarla, tomar control cuando algo sale mal, registrar la ejecución como corrección, componer un conjunto de datos mixto y continuar el entrenamiento desde un punto de control. Incluye la ruta de takeover por teclado y controles deslizantes para quienes no tienen un brazo líder, y los cuatro errores que hacen que una ronda sea inútil.
Tu política se ejecuta. Llega al cubo, cierra el gripper un centímetro demasiado pronto y sigue adelante como si lo tuviera. Nada produce un error, y ninguna cantidad de análisis de la pérdida de entrenamiento lo explica. La solución no es otros 20 000 pasos de gradiente en las mismas demostraciones. Es poner tu mano de vuelta en el brazo exactamente donde sale mal, registrar lo que hiciste en su lugar y entrenar el siguiente punto de control con los datos antiguos más esa corrección. Eso es una ronda DAgger, y así es como se ejecuta en un SO-100 con una política de visión-lenguaje-acción.
La teoría está en otro lado: por qué funciona la agregación de conjuntos de datos y qué cambia la supervisión humana al respecto. Este es el manual de operación, y asume un punto de control entrenado, un conjunto de cámaras que funciona y un brazo que se mueve. Los seis pasos siguientes son el bucle tal como se implementa en la página DAgger de esta plataforma, pero la secuencia es la misma con tus propios scripts.
Una ronda en breve
- •Ejecutar la política entrenada y grabarla, con el texto de tarea de la ejecución en lugar de una etiqueta de teleoporación genérica.
- •Tomar control en el momento en que el comportamiento sale mal: un handover espejo con un brazo líder, inmediato y manual por teclado o controles deslizantes sin uno.
- •Hacer triaje de cada ejecución: registrarla como corrección, mantenerla como episodio de evaluación o descartarla.
- •Componer la mezcla a mano - demostraciones originales más correcciones, episodios elegidos por fuente. Nunca entrenar solo con correcciones.
- •Continuar entrenamiento desde el último punto de control, y anotaré qué punto de control produjo qué mezcla.
- •El número que dice si la ronda valió la pena es la tasa de intervención, no la pérdida de entrenamiento.
Por qué la segunda ronda no es solo más datos
El aprendizaje por comportamiento entrena en los estados que visitó un humano. En el tiempo de prueba, la política visita los estados que causa, y pequeños errores de acción se acumulan en estados que ninguna demostración cubrió. Ross, Gordon y Bagnell formalizaron ese fallo para AISTATS 2011 y lo respondieron con un algoritmo iterativo que entrena una política determinista estacionaria y, bajo su reducción, tiene que funcionar bien bajo la distribución de estados que induce: ejecutar la política actual, hacer que el experto etiquete los estados que realmente alcanzó, agregar eso al conjunto de datos, reentrenar, repetir. Kelly et al. hicieron práctica la consulta con HG-DAgger, donde el humano decide cuándo tomar control en lugar de etiquetar estados sin sostener los controles; reportan rendimiento mejorado tanto sobre DAgger como sobre aprendizaje por comportamiento en una tarea de conducción autónoma simulada y real. La supervisión humana es lo que hace el bucle tolerable en un brazo de escritorio - solo mueves las manos cuando algo sale mal.
Dos consecuencias importan más en la práctica que la teoría. Las correcciones no son demostraciones ordinarias: se concentran en las regiones de cuello de botella que describe Mandlekar et al., donde una pequeña desviación empuja la política a estados que las demostraciones nunca cubrieron. Y un conjunto de datos hecho solo de esas partes difíciles es un conjunto de datos mal formado - Belkhale, Cui y Sadigh argumentan desde el lado de los datos que la diversidad de estados no siempre es beneficiosa, y que la divergencia de acciones y la diversidad de transiciones juntas deciden la calidad del conjunto de datos. El conjunto de datos mixto no es un compromiso, es el punto.
Congela estos antes de la ronda uno
Una ronda DAgger compara una política consigo misma a través del tiempo. Cualquier cosa que cambies entre rondas que no sea el conjunto de datos hace esa comparación sin sentido.
- Posiciones y montajes de cámaras, incluida la cámara de muñeca. Afloja una abrazadera y cambiaste la distribución de observación, no la política.
- Exposición y balance de blancos, si tu pila de captura te permite fijarlos. El cambio automático de exposición entre rondas es una desviación de dominio lenta e invisible.
- Calibración del brazo y posiciones cero del servo. Si debes recalibrar, trata todo lo grabado antes de ello como un conjunto de datos separado.
- El texto de la tarea. Cada VLA aquí se condiciona a él; reformularlo a mitad del bucle es una tarea diferente.
- Iluminación, superficie de la mesa, conjunto de objetos. Un nuevo objeto es un nuevo experimento, no la siguiente ronda.
- La velocidad de fotogramas de grabación. Comparar tasas de intervención en dos rásteres de muestreo produce diferencias que provienen del rástel.
Hsu et al. compararon una vista centrada en la mano contra la vista de terceros usual y encontraron que la perspectiva de ojo en mano mejoró consistentemente la eficiencia de entrenamiento y la generalización fuera de distribución, a pesar de ver menos de la escena. En un brazo de cinco articulaciones, el tiempo del gripper es generalmente lo que tus correcciones están arreglando, y el tiempo del gripper es lo que lleva la vista de muñeca.
La ronda, de extremo a extremo
- 1Ejecutar inferencia y grabarla
Inicia la ejecución contra el punto de control que quieres mejorar, luego inicia la grabación en la raíz de inferencia. Grabado de esa manera hereda el texto de tarea de la propia ejecución, que es lo que la política fue entrenada, en lugar de la etiqueta de teleoporación predeterminada. Sin la grabación puedes ver el fallo pero no entrenar con él.
bash# two calls, not one: the run, then its recording POST /inference/start # model_id, and hf_repo_id = the checkpoint to drive POST /recording/start # root=inference # root=inference also makes the recording inherit the run's task text - 2Tomar control cuando sale mal
Presiona Tomar control y elige el modo de entrada: brazo líder, teclado o controles deslizantes. El corredor se pausa, corriges, devuelves. Los fotogramas grabados mientras conducías están marcados como intervenciones automáticamente.
bashPOST /inference/takeover/start # input = leader | keyboard | sliders POST /inference/takeover/nudge # keyboard, relative delta per call POST /inference/takeover/set # sliders, absolute target POST /inference/takeover/stop # back to the policy - 3Hacer triaje de los episodios
Decide por episodio: registrar como corrección, mantener como evaluación o descartar. Una ejecución que la política completó sin ayuda es datos de evaluación.
- 4Sincronizar el conjunto de datos de corrección
Las correcciones se recopilan en un conjunto de datos local por política y van al almacenamiento en la nube a través de la sincronización automática. Nada se mezcla que no hayas puesto allí.
- 5Componer el conjunto de datos mixto
Combina el conjunto de datos original con el conjunto de datos de correcciones, eligiendo episodios explícitamente por fuente. El resultado es un conjunto de datos ordinario desde ese punto en adelante.
bashPOST /training/datasets/compose sources = [ original_dataset, korrekturen_<policy> ] episodes = explicit selection per source - 6Continuar entrenamiento desde el punto de control
Entrena la mezcla desde el punto de control anterior en lugar del modelo base. Anota qué punto de control y qué mezcla; sin ese par la ronda no es reproducible.
bash# field on the training job base_checkpoint = s3://ay-robots/checkpoints/<run>/<checkpoint> # the platform passes it to the training pod as BASE_CKPT_S3
Paso 2 en detalle: las dos formas de tomar control
Con un brazo líder
En modo liderazgo-seguidor el takeover es un handover entre dos brazos que no están en la misma posición. Presionar Tomar control pausa el corredor e impulsa el líder hacia la posición actual del seguidor, así nada salta cuando se transfiere el torque. Si esa alineación se agota, alineas el líder a mano y solo liberas cuando los dos estén dentro de cinco grados. A partir de entonces teleoperas normalmente y la columna de acción registra lo que comandaste.
Sé honesto sobre esta ruta: la alineación y el handover de torque son la parte menos probada del bucle en hardware real. Prueba el handover en una posición lenta e inofensiva antes de confiar en él en una ejecución que te importe. Un brazo líder produce las correcciones más suave de los tres modos, y también tiene lo más que puede salir mal mecánicamente.
Sin un brazo líder: teclado y controles deslizantes
La mayoría de las personas leyendo esto poseen un brazo. Eso es suficiente. Elige entrada de teclado o controles deslizantes en el momento en que presionas Tomar control, y el takeover es inmediato y manual - no hay un segundo brazo para alinear, así que no hay paso de alineación. El seguidor sostiene su posición y espera entrada.
| Modo de entrada | Cómo se mueve el brazo | Límite por llamada aplicado por el servidor | Bloqueado cuando |
|---|---|---|---|
| Brazo líder | El espejo impulsa el seguidor desde los ángulos articulares del líder | Sin nudge o llamadas set en este modo; el espejo escribe objetivos del seguidor continuamente | Nunca bloqueado, y el predeterminado si no se proporciona modo de entrada - pero necesita un segundo brazo; sin una id de líder el takeover es rechazado |
| Teclado | Nudge relativo por pulsación de tecla, enviado al punto final de nudge de takeover | Límite duro a 2 grados por articulación, 4 grados para el gripper | Rechazado con 409 si el takeover se inició en modo de liderazgo |
| Controles deslizantes | Posición de destino absoluta, enviada al punto final de establecimiento de takeover | Como máximo 6 grados de desplazamiento hacia el destino por llamada; la interfaz sigue enviando aproximadamente diez veces por segundo | Rechazado con 409 si el takeover se inició en modo de liderazgo |
Los límites se aplican en el lado del servidor, no en la interfaz, porque un delta mal escrito en un brazo de servo de bus es una colisión. Las correcciones de teclado salen paso a paso y algo gruesas; las correcciones de controles deslizantes son más suave, porque el servidor camina hacia el destino mientras la interfaz sigue transmitiendo. De cualquier manera la columna de acción recibe el vector de posición completo comandado y el marcado de intervención es idéntico a la ruta de liderazgo, así que las correcciones de teclado aterrizan en el mismo conjunto de datos sin una diferencia de formato.
Q / A joint 1 R / F joint 4
W / S joint 2 T / G joint 5
E / D joint 3 Z / X gripper
Cuándo presionar el botón
Temprano en lugar de tarde. Una corrección que comienza después de que el gripper se haya cerrado en nada enseña recuperación de un fallo en el que la política no debería haber entrado, y los datos de recuperación valen mucho menos que los datos de prevención. Interrumpe en el primer momento en que estés seguro de que la trayectoria es incorrecta, corrige a través de la parte difícil, devuelve tan pronto como el estado es uno que la política manejó antes. ThriftyDAgger automatiza esa decisión al permitir intervenciones en novedad y riesgo estimado bajo un presupuesto humano fijo, pero en un brazo único con un humano ya viendo, la puerta humana es más barata y mejor calibrada que cualquier cosa que sintonices.
Hacible con la pila de código abierto y algunos scripts. Lo que cuesta es llevar registros, y los registros son donde mueren las rondas DAgger.
- Escribe fotogramas de tu propio script de inferencia en un conjunto de datos LeRobot, con la cadena de tarea que la política fue entrenada.
- Pausa el bucle de política, cambia la fuente de comando y marca cada fotograma que conduces como una intervención. Sin la marca, las correcciones se ven como demostraciones ordinarias.
- Decide deliberadamente qué ocurre en los fotogramas de transición entre la política que suelta control y tu primera entrada.
- Mantén correcciones en su propio conjunto de datos por política, y rastrea índices de episodios a mano para que la mezcla pueda ser reconstruida.
- Apunta la entrada de ajuste fino en el punto de control anterior, y verifica en el registro que cargó esos pesos.
Los mismos seis pasos existen como botones. Lo que es automatizado es lo que es fácil de equivocarse a mano: la marca de intervención por fotograma, la división entre correcciones y evaluaciones, y el registro de qué punto de control produjo qué mezcla. Nada entra en un conjunto de datos compuesto que no hayas seleccionado.
No decide por ti. Qué ejecución cuenta como corrección, qué episodios entran en la mezcla, y cuándo parar siguen siendo llamadas de juicio. Los campos están documentados bajo entrenamiento, los modos de entrada bajo teleoporación.
Paso 3 en detalle: el triaje decide la calidad
Después de la ejecución tienes una grabación con algunos fotogramas marcados como intervenciones. Existen tres destinos, y el incorrecto envenena silenciosamente la siguiente ronda.
- Registrar como corrección cuando la intervención fue una verdadera solución: la política se dirigía a algún lugar incorrecto y tu entrada mostró la cosa correcta desde un estado que la propia política produjo.
- Mantener como evaluación para ejecuciones autónomas limpias y para ejecuciones que asumiste por precaución. Los episodios de evaluación son cómo mides el siguiente punto de control, y nunca deben ser entrenados.
- Descartar ejecuciones arruinadas por algo no relacionado - un fotograma de cámara caído, un servo estancado, un objeto que derribaste. Una corrección desordenada es peor que ninguna corrección.
Entre la política que suelta control y tu primera entrada, el brazo se mantiene inmóvil mientras el grabador sigue escribiendo - una ejecución de posiciones idénticas emparejadas con imágenes ligeramente diferentes. Aquí esos fotogramas de handover permanecen en la grabación cruda y fuera del conjunto de datos de corrección. Si construyes el bucle tú mismo, córtalos deliberadamente: una política entrenada en ellos aprende a pausar donde debe actuar.
Paso 5 en detalle: composición de la mezcla
La composición toma el conjunto de datos original más el conjunto de datos de correcciones y produce un nuevo conjunto de datos ordinario LeRobot que entrena como cualquier otro. La propiedad importante es que la selección de episodios es explícita por fuente - nada se mezcla automáticamente. Eso suena menor hasta la primera vez que una política se comporta extrañamente y tienes que reconstruir lo que fue entrenado en.
La pregunta abierta es la razón, y nadie tiene un número que se transfiera. Lo que la literatura sí acuerda es que las correcciones deben contar más que su participación de fotogramas. Mandlekar et al. reentrena iterativamente en los datos que su sistema de intervención recopila, así que la política aprende a atravesar los cuellos de botella, y reportan que los agentes entrenados de esa manera superan a agentes entrenados en un número equivalente de muestras de demostradores no intervencionales. Sirius va más allá y re-pondera muestras de entrenamiento por confianza humana aproximada, reportando una ganancia del 8 por ciento en simulación y del 27 por ciento en hardware real en tasa de éxito de política contra los métodos que compara, a dos veces la velocidad de convergencia. Ninguno de los puntos de entrada de entrenamiento aquí expone un botón de ponderación de muestras, así que el sustituto crudo es mantener cada episodio de corrección mientras subestreas las demostraciones originales - y escribir lo que hiciste.

Paso 6 en detalle: qué significa realmente continuar desde un punto de control
Entrenar la mezcla desde el modelo base funciona pero descarta la ronda anterior y cuesta una ejecución completa. Continuar desde el anterior punto de control es más rápido y generalmente mejor. También es más limitado que lo que sugiere la frase.
Un punto de control solo de pesos contiene los parámetros y nada más. Cargarlo da a la siguiente ejecución un punto de partida mejor que el modelo base, pero momentos del optimizador, posición de programación de tasa de aprendizaje y orden de datos comienzan desde cero. Espera un pico de pérdida al comienzo de la ejecución continuada, no la leas como un fallo, y no llames a la ronda un resumen. Es un inicio en caliente.
| Política | Tamaño | Nivel de GPU | Inferencia por paso de acción | Formato de conjunto de datos | Episodios antes de que valga la pena intentarlo |
|---|---|---|---|---|---|
| GR00T N1.7 | aproximadamente 3 B, aproximadamente 40 M entrenados durante el ajuste fino | A100 80 GB o H100 80 GB | aproximadamente 152 ms | LeRobot v2.0 o v2.1 | 50 |
| GR00T N1.5 | aproximadamente 3 B | A100 80 GB o H100 80 GB | aproximadamente 165 ms | LeRobot v2.0 o v2.1 | 50 |
| Pi0.5 | aproximadamente 3 B en una base PaliGemma | A100 80 GB o H100 80 GB | aproximadamente 485 ms | LeRobot v3.0 | 50 |
| SmolVLA | aproximadamente 450 M | RTX 4090 o cualquier tarjeta de 24 GB | aproximadamente 245 ms | LeRobot v3.0 | 30 |
| ACT | aproximadamente 80 M, entrenado desde cero | RTX 4090 o cualquier tarjeta de 24 GB | aproximadamente 20 ms | LeRobot v3.0 | 50 |
La latencia se compone dentro de un bucle DAgger de una manera en que no lo hace durante una demostración: a aproximadamente 485 ms por paso de acción asumes control porque el brazo vaciló, no porque estuviera mal, y los datos de corrección de vacilación no son útiles. Si estás iterando sobre datos en lugar de perseguir una tasa de éxito final, itera en un modelo rápido. Shukor et al. describen SmolVLA como diseñado para entrenar en una sola GPU e implementar en GPUs de consumo o CPUs, con una pila de inferencia asincrónica que desacopla la predicción de acción de la ejecución para permitir tasas de control más altas - la propiedad que mantiene un bucle de takeover responsivo.
Los formatos de conjunto de datos no son intercambiables. GR00T toma LeRobot v2.0 o v2.1, y el repositorio Isaac-GR00T describe su entrada como un sabor del formato LeRobot v2 con un archivo de descripción de modalidad agregado; los entrenadores más nuevos aquí esperan v3.0. Una mezcla compuesta en la versión incorrecta falla en el tiempo de carga en lugar de producir una política mala - el modo de fallo mejor, todavía una ranura de cola desaprovechada. El documentación de conjunto de datos lista qué formato cada entrenador toma.
El bucle, con los registros ya hechos
Takeover con un brazo líder, teclado o controles deslizantes; marcado de intervención por fotograma; presentar ejecuciones como correcciones o evaluaciones; componer un conjunto de datos mixto con una selección explícita de episodios por fuente; y continuar entrenamiento desde un punto de control en lugar del modelo base. Lo que sigue siendo tu decisión es qué ejecución cuenta como corrección, qué entra en la mezcla, y cuándo la tasa de intervención ha dejado de caer.
Ver cómo se cablean el bucle DAggerCuatro formas de desperdiciar una ronda
1. Entrenar solo con las correcciones
El fallo más común y el atajo más tentador. Un conjunto de datos solo de correcciones es casi enteramente la mitad difícil de la tarea, con enfoque y retirada desaparecidas; la política mejora en la parte difícil y olvida cómo llegar allí. La agregación no es un detalle de implementación del método, es el mecanismo: los datos antiguos son lo que mantiene el resto del comportamiento en su lugar mientras las correcciones mueven una parte de él.
2. Mover una cámara entre rondas
Una cámara que se desplaza dos centímetros entre rondas produce una política peor que la que iniciaste, y un diagnóstico que cuesta un día. Cada VLA aquí se condiciona en imágenes; el estado articular solo no desambigua dónde está el objeto. Fotografía la configuración antes de la primera ronda y comprueba esa fotografía antes de cada una posterior.
3. Dejar artefactos de handover en el entrenamiento
Cubierto arriba, y en la lista porque es invisible. El síntoma es una política que se detiene durante una fracción de segundo exactamente donde el operador de la ronda anterior asumió el control. Se ve como vacilación; es imitación.
4. Llamar a un inicio en caliente un resumen
Si crees que el estado del optimizador se trasladó, el pico de pérdida inicial se lee como un error y vas cazando datos corruptos. Si sabes que el optimizador comenzó fresco, el pico es esperado y miras lo que viene después. Números iguales, conclusiones opuestas.
Medir la ronda
La métrica para un bucle supervisado por humanos es la tasa de intervención: fotogramas grabados mientras estabas en control, divididos por fotogramas totales de la ejecución. Está en el estado de takeover, y es el único número que responde la pregunta que la ronda hizo. La pérdida de entrenamiento cae independientemente de si la política mejoró; la tasa de éxito es binaria y ruidosa en los tamaños de muestra que produce un brazo de escritorio. La tasa de intervención es continua, medida en los estados que la propia política causó, y cae a medida que la política te necesita menos.
Compárala solo en ejecuciones grabadas bajo condiciones idénticas. El argumento completo, y cómo construir un conjunto de evaluación que sobreviva más de dos rondas, está en el artículo sobre medición de un bucle DAgger. La ronda uno es realísticamente una prueba de viabilidad: estás comprobando que el takeover funciona en tu hardware, que las correcciones aterrizan con sus marcas, y que la ejecución continuada cargó el punto de control que nombraste. Las rondas dos y tres son donde la tasa debe comenzar a cambiar. Si no ha cambiado en la ronda cuatro, el problema está aguas arriba de DAgger.
| Escribe por ronda | Por qué importa después |
|---|---|
| Punto de control que fue conducido | Sin él no puedes atribuir una mejora a una mezcla |
| Modo de entrada usado para el takeover | Las correcciones de teclado son más gruesas que las correcciones de líder, y se ve en los datos |
| Número de ejecuciones y cómo fue triado cada una | Si la ronda tuvo suficientes correcciones para importar |
| Tasa de intervención por ejecución, y el promedio | La métrica de progreso del bucle |
| Selección exacta de episodios por fuente | La única manera de reproducir o deshacer una ronda |
| Inicio en caliente o entrenamiento fresco | Explica la curva de pérdida que mirarás en una semana |
Si aún no tienes un punto de control
El bucle no tiene punto de entrada sin uno. Graba un primer conjunto de datos, entrena una primera política, ejecútala - grabación, entrenamiento y ejecutar la política cubren ese camino. El cliente de grabación está en la página de descargas, niveles de GPU y tarifas por hora en la página de precios, y lo que se parece a un episodio usable en la guía de recopilación de datos SO-100. Obtén las demostraciones correctas antes de las correcciones: DAgger es un mecanismo de reparación, y funciona mucho mejor en algo que casi fue correcto ya.
¿Puedo ejecutar un bucle DAgger sin un brazo líder?▾
Sí. Elige entrada de teclado o controles deslizantes cuando presionas Tomar control: el takeover es inmediato y manual, sin un segundo brazo para alinear. El teclado envía nudges relativos que el servidor fija duramente a 2 grados por articulación y 4 para el gripper; los controles deslizantes envían un objetivo absoluto y el servidor se mueve como máximo 6 grados hacia él por llamada, mientras la interfaz sigue transmitiendo. La columna de acción y el marcado de intervención son iguales al modo de liderazgo, así que las correcciones son indistinguibles en el conjunto de datos.
¿Cuántas correcciones necesita una ronda?▾
No hay un número universal defendible, y el recuento de fotogramas importa más que el recuento de episodios. La regla de funcionamiento es que las correcciones no deben perderse en la mezcla: con 200 episodios originales y tres episodios de corrección, nada se moverá. Apunta a correcciones que cubran el comportamiento que falla desde varias configuraciones de inicio en lugar de tres repeticiones del mismo rescate.
¿Por qué entrenar solo con correcciones es tan mala idea?▾
Porque las correcciones son casi enteramente la mitad difícil de la tarea. Enfoque, alineación y retirada faltan, así que la política pierde lo que ya hizo bien mientras mejora en la parte que arreglaste. Mantener los datos antiguos y agregar a ellos es el mecanismo en sí, no un extra opcional.
¿Continuar desde un punto de control reanuda la ejecución de entrenamiento anterior?▾
No. Un punto de control solo de pesos restaura parámetros y nada más: momentos del optimizador, posición de programación de tasa de aprendizaje y orden de datos comienzan frescos. Es un inicio en caliente, y un pico de pérdida inicial es esperado en lugar de un síntoma. Escribe qué de los dos realmente hiciste, así lees la curva correctamente una semana después.
¿Qué pasa si la tasa de intervención no cae?▾
Deja de agregar rondas. Una tasa plana significa que las correcciones no están enseñando lo que crees. Las causas habituales son aguas arriba: una cámara se movió, las correcciones comienzan demasiado tarde para ser datos de prevención, fotogramas de handover están en el conjunto de datos de entrenamiento, o la tarea está subdeterminada por las observaciones que la política realmente obtiene.
Nada de esto es un problema resuelto y nada de ello es un clic. El aprendizaje de imitación interactivo es un área de investigación activa precisamente porque sus preguntas - cuándo intervenir, cómo ponderar lo que hizo el humano, cuánto datos antiguos mantener - no tienen respuestas establecidas; la encuesta por Celemin et al. mapea qué aún está abierto. Lo que el bucle sí tiene es convergencia medible cuando se ejecuta cuidadosamente, en hardware que cuesta unos pocos cientos de euros. Congela la configuración, intervén temprano, haz triaje honestamente, compone deliberadamente, y registra la tasa de intervención cada vez.
Sources
- Ross, Gordon, Bagnell (AISTATS 2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Kelly, Sidrane, Driggs-Campbell, Kochenderfer (2019): HG-DAgger - Interactive Imitation Learning with Human Experts
- Mandlekar et al. (2020): Human-in-the-Loop Imitation Learning using Remote Teleoperation
- Liu, Nasiriany, Zhang, Bao, Zhu (2022): Robot Learning on the Job - Human-in-the-Loop Autonomy and Learning During Deployment (Sirius)
- Hoque et al. (2021): ThriftyDAgger - Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Belkhale, Cui, Sadigh (2023): Data Quality in Imitation Learning
- Hsu et al. (2022): Vision-Based Manipulators Need to Also See from Their Hands
- Zhao et al. (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- Black et al. (2024): Pi0 - A Vision-Language-Action Flow Model for General Robot Control
- Bjorck et al. (2025): GR00T N1 - An Open Foundation Model for Generalist Humanoid Robots
- Shukor et al. (2025): SmolVLA - A Vision-Language-Action Model for Affordable and Efficient Robotics
- LeRobot documentation (Hugging Face)
- NVIDIA Isaac-GR00T repository
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started