Espacio de trabajo del robot de sobremesa del tipo utilizado como configuración de evaluación fija para ejecuciones de política repetidas
DAggerEvaluaciónAprendizaje por imitaciónDatos de robotSO-100

Medición de un bucle DAgger: tasa de intervención, protocolo de evaluación y las trampas intermedias

AY-Robots ResearchAugust 27, 2026lectura de 15 min

La tasa de intervención (fotogramas de intervención divididos por fotogramas de la ejecución) es la señal de progreso más barata y honesta que tiene un bucle DAgger controlado por humanos. Este artículo la define para que dos personas calculen el mismo valor, muestra cómo registrarla, y analiza las cuatro formas en que te engaña: habituación del operador, una configuración de evaluación que se desplaza, entrenamiento solo en correcciones, y un humano que corrige diferente el martes que el lunes.

Una ronda DAgger se siente productiva mientras estás en ella. Conduces la política, asumes el control cuando falla en el agarre, guardas las correcciones, reentrenas, y la siguiente ejecución se ve (lo juraría) un poco más suave. Dos rondas después no puedes decir si algo cambió, porque «un poco más suave» no es una cantidad.

El bucle necesita un número por ronda, y en un bucle controlado por humanos ese número es casi gratis: la fracción de la ejecución durante la cual tenías control en lugar de la política. Este artículo lo define para que dos personas calculen el mismo valor, lo registra, lee la curva resultante y nombra las cuatro formas en que te engaña cuando está solo. Para la teoría que este artículo asume, consulta la guía de DAgger y la variante controlada por humanos; la contraparte práctica es ejecutar un bucle DAgger en un SO-100.

La versión corta

  • Tasa de intervención = fotogramas de intervención / fotogramas de la ejecución. Fotogramas, no episodios, y el denominador incluye los fotogramas que pasaste corrigiendo.
  • Una curva plana en tres rondas significa que las rondas no compran nada: cambia la mezcla, el checkpoint o la tarea en lugar de recopilar una cuarta.
  • Una tasa de intervención decreciente no es una tasa de éxito creciente. Tu umbral para intervenir se desplaza hacia abajo a medida que crece la confianza.
  • Sin un protocolo de evaluación congelado (mismas poses de inicio, objetos, cámaras, recuento de pruebas), estás midiendo la habitación.
  • El entrenamiento solo en correcciones sesga la distribución de estado. La respuesta de IWR: dibuja muestras de intervención y no intervención en proporción igual.

Por qué una ronda necesita un número en absoluto

DAgger existe por un problema de distribución, y los problemas de distribución son invisibles a simple vista. Ross y Bagnell mostraron que el aprendizaje por imitación en un conjunto de demostración fijo conduce a errores compuestos y un límite de arrepentimiento que crece cuadráticamente con el horizonte de tiempo: una vez que el alumno abandona los estados que visitó el demostrador, nada en los datos le dice cómo volver. DAgger lo arregla iterando (ejecuta la política, etiqueta los estados que visita, agrega, reentrena), lo que Ross, Gordon y Bagnell enmarcan como una reducción al aprendizaje online sin arrepentimiento.

Ese marco tiene una consecuencia que la gente se salta. La garantía se refiere a la secuencia de políticas sobre iteraciones, no a ninguna ejecución única. No dice nada sobre si tu ronda tres ayudó. La única forma de saber es medir cada iteración. Kelly y colegas introdujeron HG-DAgger porque DAgger clásico pide al experto etiquetas de acción mientras el novato aún tiene control, lo que el artículo argumenta puede disminuir la seguridad y, con expertos humanos, es probable que degrade la calidad de la etiqueta a través del retraso de actuador percibido. HG-DAgger también aprende un umbral de seguridad para una métrica de riesgo basada en la incertidumbre del modelo e informa un rendimiento mejorado sobre DAgger y clonación de comportamiento en una tarea de conducción. No publica recuentos de intervención; esos los produces tú mismo.

Definiendo la tasa para que dos personas obtengan el mismo número

La definición es una línea: fotogramas de intervención divididos por fotogramas de la ejecución. Todo lo difícil se esconde en lo que cuenta como fotograma y lo que cuenta como ejecución.

Fotogramas, no episodios

Contar episodios con al menos una intervención es inútil: diez episodios con un ajuste cada uno y diez en los que condujiste el 80 por ciento dan ambos «10/10». El recuento de fotogramas los separa, y es la granularidad que la grabación ya tiene (en el formato de conjunto de datos LeRobot cada paso de tiempo es una fila, así que la bandera de intervención es una columna booleana al lado del estado y la acción. Aquí se escribe por fotograma en el momento en que comienza la asunción de control y se borra cuando vuelve el control.

El denominador incluye las correcciones

Dos denominadores son defensibles (total de fotogramas de la ejecución, o fotogramas que la política condujo de forma autónoma), y divergen mucho en altos niveles de intervención. Asume el control durante 400 de 1000 fotogramas y el primero da 40 por ciento, el segundo 67 por ciento. Comparar una ronda medida de la primera manera contra la siguiente medida de la segunda es cómo una mejora real desaparece. Toma fotogramas totales y nunca revisite la opción en el medio de la serie.

Decide una vez qué sucede con los fotogramas de traspaso

Siempre hay una costura. Cuando el control se transfiere, algunos fotogramas pertenecen a ninguno de los lados: el brazo está agarrado, el líder se está alineando, la grabación está congelada. En este pipeline esos fotogramas de traspaso permanecen en la secuencia sin procesar y nunca entran en el episodio curado (ni son comportamiento de la política ni una corrección que valga la pena entrenar). Cuenta la costura de la misma manera cada ronda: a 30 Hz, seis traspasos con una costura de dos segundos cada uno son 360 fotogramas, suficientes para mover un punto porcentual.

Las tres decisiones que rompen la comparabilidad

Fotogramas o episodios; ejecución total o solo autónoma; fotogramas de traspaso dentro o fuera. Cualquiera de los tres cambiados en silencio entre rondas hace que la curva sea sin sentido. Escribe los tres.

Registrándolo para que el número sobreviva a la sesión

Una métrica en el panel de estado de un proceso en ejecución es una lectura: desaparece al reiniciar y no se puede graficar. Una línea de solo apéndice por ejecución cubre toda la serie (incluyendo qué checkpoint condujiste, ya que eso cambia cada ronda y mezclarlo invalida lo que sigue).

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Una línea por ejecución. Registrar el denominador y la convención de traspaso junto al número importa más que los nombres de campo.

Dos campos llevan el peso. train_mix es lo que alimentaste al siguiente trabajo de entrenamiento; sin él nada se puede atribuir. eval_protocol nombra la prueba fija que ejecutaste después, y es el campo más frecuentemente dejado en blanco. En el cockpit de ay-robots el estado de asunción de control informa el recuento de fotogramas de intervención para la sesión en ejecución, así que registrar es transcripción en lugar de instrumentación; la documentación del conjunto de datos cubre dónde aterrizan las columnas por fotograma.

Matriz de configuración de entrenamiento que muestra políticas, conjuntos de datos y checkpoints lado a lado
Cada ronda cambia la mezcla de checkpoint y conjunto de datos. Un número cuya combinación no fue registrada no se puede atribuir.

Leyendo la curva: tres rondas, un veredicto

Tres rondas es el mínimo para una lectura, porque dos puntos siempre son una línea. La tabla a continuación es una plantilla de contabilidad con números de marcador de posición, no mediciones de ninguna ejecución. Buscas una disminución monótona combinada con un aumento en el éxito en una prueba fija.

RondaCheckpoint conducidoFotogramasFotogramas de intervenciónTasaÉxitos (de 20)
0 (línea base)política base5 9001 38023,4 %7
1de mezcla ronda 05 61098017,5 %10
2de mezcla ronda 15 41261111,3 %11
3de mezcla ronda 25 38059811,1 %12

Las rondas uno y dos están haciendo trabajo. La ronda tres no: 11,3 contra 11,1 por ciento está dentro de la variación de ejecución a ejecución de cualquier cosa medida en un brazo físico, y una cuarta ronda de las mismas correcciones gasta una tarde para nada. El segmento plano dice cambiar algo estructural.

  • Los fallos restantes no son corregibles por teleoperación (objeto fuera de alcance, geometría del gripper, una articulación en su límite). Ningún dato de corrección arregla una pared cinemática.
  • Las correcciones son demasiado pocas contra el conjunto de datos base para mover el gradiente, y nada las pondera.
  • Las correcciones se contradicen entre sí, así que la política promedia dos estrategias y aterrizó entre ellas.
  • El fallo es anterior: una cámara se movió, la iluminación cambió, la vista de la muñeca ya no coincide con el entrenamiento.
  • La tarea está en el techo de esta clase de política en este hardware, y el siguiente paso es más datos base.

Los dos últimos no son fallos del bucle. En Sirius-Fleet una necesidad decreciente del humano es el resultado diseñado: a medida que mejora la autonomía del robot, sus predictores de anomalía adaptan sus criterios de predicción, lo que lleva a menos solicitudes de intervención humana y reduce gradualmente la carga de trabajo del humano con el tiempo. Allí el criterio se adapta a propósito. En un bucle manual el tuyo también se adapta, silenciosamente (así que una tasa que se aplana porque la tarea está en su techo se ve exactamente como una que se aplana porque el operador dejó de notar). Cual es el siguiente problema.

Trampa 1: una tasa decreciente no es una tasa de éxito creciente

La tasa de intervención mide exactamente una cosa: cuánto de la ejecución decidiste poseer. Esa decisión es tuya, hecha en tiempo real, y se mueve. En la ronda cero asumes el control al primer ángulo de aproximación malo; para la ronda tres has visto a la política recuperarse de una docena de ellos y la dejas intentar. Tu umbral se movió; la política puede que no. La tasa cae de cualquier manera.

La confianza humana es al menos una cantidad modelada en la literatura en lugar de una constante asumida. Sirius repesa las muestras de entrenamiento con confianza humana aproximada y optimiza la política con clonación de comportamiento ponderado, informando un aumento del 8 por ciento en simulación y 27 por ciento en hardware real sobre el estado del arte en tasa de éxito de política, a dos veces la velocidad de convergencia. Eso trata la confianza como un peso en los datos. No corrige el umbral en tu cabeza entre la ronda cero y la ronda tres.

No puedes eliminar la deriva, así que empareja la tasa con algo que tu umbral no puede tocar: un conjunto fijo de pruebas en las que no intervienes en absoluto, puntuadas contra un criterio escrito antes de la ronda. Una tasa que cae mientras la tasa de éxito emparejada se mantiene es la firma de habituación (vale la pena atrapar, porque desde dentro del bucle se siente como progreso).

Tasa de intervenciónTasa de éxito en protocolo fijoLectura más probable
caesubeLa ronda funcionó. Continúa.
caeplanoTu umbral se desplazó, o las correcciones eliminaron esfuerzo sin eliminar fallos.
caecaeLas correcciones están degradando la política. Verifica la mezcla y su consistencia interna.
planoplanoLa ronda no compró nada. Cambia mezcla, checkpoint o tarea antes de recopilar más.
subecaeRegresión. Sospecha mezcla de entrenamiento, una cámara cambiada o una confusión de checkpoint antes de sospechar el método.

Trampa 2: sin un protocolo fijo, mides la habitación

La evaluación de robots reales es cara y difícil de repetir. Los autores de SIMPLER motivan la evaluación simulada con la observación de que la evaluación en el mundo real de tales políticas no es escalable y enfrenta desafíos de reproducibilidad que probablemente empeoren a medida que las políticas amplíen su espectro de tareas. RoboArena lo ataca desde el otro lado, con más de 600 episodios de evaluación de robots reales emparejados en siete políticas generalistas, ejecutados por evaluadores en siete instituciones académicas en la plataforma DROID. Sus evaluadores eligen sus propias tareas y entornos pero deben juzgar pares de políticas a ciegas; el artículo informa que esta clasificación abarrotada rastrea el rendimiento de la política generalista más precisamente que la evaluación convencional centralizada.

No ejecutarás 600 episodios emparejados en un SO-100 en un taller. Lo que puedes hacer es eliminar la varianza que controlas (una lista lo suficientemente aburrida como para que usualmente se omita).

DimensiónCongela estoLo que se desplaza si no lo haces
Pose inicialUna posición de inicio escrita, conducida antes de cada pruebaLa trayectoria comienza fuera de distribución
ObjetosMarcas pegadas, y los mismos objetos físicos reservados para evaluaciónUna política «mejor» es realmente un objeto más cercano
Cámaras y luzMismos soportes, índices, exposición; persianas cerradas; fotografía de la configuraciónSolo los índices de cámara intercambiados pueden dominar el resultado
Pruebas y regla de paradan fijo, tiempo de espera fijo, criterio escrito antes de la rondaLos criterios posteriores convierten los casi errores en lo que necesitas
Comportamiento del operadorSin intervenciones durante pruebas de evaluaciónLa evaluación se convierte en otra sesión de corrección

Luego la aritmética, despiadada en los recuentos de pruebas que un taller puede permitirse. Bajo la aproximación normal, 60 por ciento de éxito en 20 pruebas lleva un error estándar cerca de 11 puntos porcentuales (la raíz cuadrada de 0,6 veces 0,4 en 20), y la diferencia entre dos rondas tales lleva aproximadamente 15. Un salto de 60 a 70 por ciento es, por lo tanto, consistente con que no haya sucedido nada. Cincuenta pruebas traen la cifra por ronda a aproximadamente 7 puntos y cuestan una tarde.

Esta asimetría es el argumento para la tasa de intervención: computada sobre miles de fotogramas en lugar de veinte resultados binarios, se mueve antes y más suavemente. La advertencia es que los fotogramas dentro de un episodio están fuertemente correlacionados (un agarre malo produce cien fotogramas de intervención consecutivos), así que el tamaño de muestra efectivo está más cerca del número de traspasos. Trata la tasa como el indicador temprano y la tasa de éxito como verdad fundamental lenta.

Mantén los episodios de evaluación fuera del conjunto de entrenamiento compuesto

Los episodios de evaluación nunca deben entrar en el conjunto de datos de entrenamiento compuesto; de lo contrario, la ronda n+1 se puntúa en datos en los que fue entrenada, y la curva mide memorización.

Trampa 3: entrenar solo en correcciones dobla la política

Las correcciones son los datos interesantes, así que el instinto es entrenar en ellos. No lo hagas. Vienen por construcción de la rebanada estrecha del espacio de estado donde la política ya estaba fallando y no dicen casi nada sobre la mayoría de la ejecución que funcionó. Ajusta finamente en esa rebanada solo y obtienes una política buena para recuperarse de un enfoque arruinado que ha olvidado cómo hacer uno limpio.

Mandlekar y colegas construyeron su sistema de intervención remota alrededor de esto. Su marco: las tareas de manipulación contienen regiones de cuello de botella que requieren una secuencia de acciones precisas (insertar una vaina en una máquina de café es su ejemplo), donde pequeñas desviaciones conducen a estados que las demostraciones nunca cubrieron. Su algoritmo entrena iterativamente en los datos nuevos para que la política aprenda a atravesar esos cuellos de botella, e informan que los agentes entrenados en datos de intervención superan a los agentes entrenados en un número equivalente de muestras de demostradores no intervencionales.

Ajuste fino solo correcciones versus mezcla compuesta
Lo que solo correcciones te consigue
  • Rápido: una ejecución corta en algunos episodios es lo suficientemente barato como para repetir
  • Dirigido: el gradiente es dominado por los estados que te importan
  • Barato para probar si un estilo de corrección es aprendible en absoluto
Lo que te cuesta
  • La distribución de ajuste fino ya no se asemeja a la distribución de tareas
  • El comportamiento nominal puede degradarse visiblemente dentro de una sola ronda
  • La tasa puede caer mientras el éxito cae con ella (segmentos limpios intercambiados por recuperaciones)

La relación de mezcla es un hiperparámetro y merece ser anotada. Componer el siguiente conjunto de datos es donde se decide: demostraciones originales más el conjunto de correcciones, selección de episodios por fuente en lugar de una regla que silenciosamente tira en lo que esté disponible. Aquí eso es un paso de composición en el cockpit, y el resultado es un conjunto de datos ordinario (consulta la documentación de entrenamiento). Lo que ninguna herramienta hace por ti es registrar qué relación produjo qué curva.

Trampa 4: el humano no es un experto consistente

La teoría de DAgger asume un experto. Tú no lo eres en el sentido técnico: tus correcciones no son muestras de una distribución condicional fija sobre acciones. Los autores de ACT nombran esto al enumerar los obstáculos para la manipulación fina (los errores se componen con el tiempo, y las demostraciones humanas pueden ser no estacionarias). Su sistema aún alcanza 80 a 90 por ciento de éxito en seis tareas reales a partir de diez minutos de demostraciones, así que el problema es manejable, no ausente.

El estudio de robomimic hace el punto desde el lado de los datos. En seis algoritmos offline en cinco tareas simuladas y tres tareas reales multiestado, sus lecciones incluyen sensibilidad a las opciones de diseño, dependencia de la calidad de la demostración, y (la que más duele aquí) la variabilidad que surge de los criterios de parada, porque los objetivos de entrenamiento y evaluación difieren. El checkpoint con la pérdida más baja no es confiablemente el que tiene la tasa de éxito más alta.

Hay una versión de hardware de esto: el modo de entrada forma la corrección. Una configuración líder-seguidor produce trayectorias continuas, con ritmo humano. Los ajustes de teclado están sujetos fuertemente por el servidor (dos grados por llamada en las articulaciones del brazo, cuatro en el gripper), así que la misma intención llega como una escalera de pasos pequeños. Los deslizadores envían objetivos absolutos y el servidor se mueve como máximo seis grados hacia ellos por llamada. Tres modos, tres distribuciones de acciones; mezclar los tres en un conjunto de correcciones y luego preguntarse por qué el enfoque se volvió irritable es auto-infligido. La documentación de teleoperación cubre lo que cada modo envía.

Ponderando las intervenciones: IWR y lo que vino después

Si las correcciones son la minoría valiosa, la corrección principiada es peso en lugar de exclusividad. Intervention Weighted Regression es la implementación de referencia: los datos se dividen en muestras de intervención y no intervención, y las dos particiones se muestrean en proporción igual durante el entrenamiento. Un conjunto de correcciones que es el cinco por ciento de los fotogramas entonces contribuye la mitad del gradiente, sin que el comportamiento nominal desaparezca de la distribución.

La proporción igual es un punto de partida, no una ley. Sirius la generaliza reemplazando la partición binaria con un peso continuo desde confianza humana aproximada; Sirius-Fleet mueve la decisión aguas arriba, usando un modelo de mundo visual y predictores de anomalía para decidir cuándo se pide un humano en absoluto. El hilo común: la bandera de intervención es una señal de entrenamiento, no solo una columna de contabilidad.

MétodoQuién decide cuándo actúa el humanoCómo se usan los datos de intervenciónResultado reportado
DAgger (2011)Horario fijo; experto etiqueta estados visitadosUn conjunto de datos en crecimiento, sin ponderarEnmarcado como una reducción al aprendizaje online sin arrepentimiento
HG-DAgger (2019)El humano, controlando el control en un sistema realAgregado; más un umbral de seguridad aprendido en incertidumbre del modeloMejor que DAgger y BC en conducción; sin recuentos de intervención dados
IWR (2020)El humano, a través de teleoperación remotaMuestras de intervención y no intervención extraídas en proporción igualSupera demostraciones no intervencionales en recuento de muestra igual
Sirius (2022)El humano, durante el despliegueBC ponderado, pesos de la confianza humana aproximadaGanancia del 8 % en simulación, 27 % en hardware real; convergencia 2x más rápida
ThriftyDAgger (2021)El sistema, controlando en novedad y riesgoRecopilación interactiva bajo un presupuesto de supervisiónEstudio de usuario (N=10): 50 % más alto rendimiento humano y 80 % más alto rendimiento de robot que el siguiente mejor método
Fleet-DAgger (2022)El sistema, asignando atención a través de una flotaAprendizaje de flota puntuado por retorno del esfuerzo humanoHasta 8,8x ROHE más alto que líneas de base
Sirius-Fleet (2024)Predictores de anomalía con criterios que se auto-adaptanAprendizaje multitarea con un modelo de mundo visualMenos solicitudes de intervención a medida que mejora la autonomía
Vista de clasificación comparando políticas de robots por puntuación medida
Clasificar políticas una contra otra significa algo solo cuando cada entrada ejecutó el mismo protocolo. Eso se aplica a tus tres rondas también.

Cuatro métricas que vale la pena registrar junto a la tasa

  • Traspasos por ejecución. Veinte correcciones cortas y una larga dan tasas similares y describen políticas diferentes (una nerviosa, una con un único punto ciego).
  • Longitud media de intervención. Longitud creciente con un recuento decreciente significa que los fallos restantes son los difíciles, que es lo que se ve el progreso tardío.
  • Tiempo hasta la primera intervención. Una política que llega más lejos antes de necesitar ayuda está mejorando incluso cuando la tasa total es plana.
  • Dónde se agrupan las intervenciones. Agrupa la bandera por progreso de episodio normalizado; un pico estable en las rondas apunta a un cuello de botella.

Un protocolo de ronda que realmente puedas ejecutar

Una ronda medida tiene seis pasos y produce una fila en el registro. Los primeros cuatro son el bucle; los dos últimos la hacen una medición.

  1. 1
    Congela el protocolo de evaluación antes de la ronda cero

    Escribe pose inicial, colocación de objetos, cámaras, recuento de pruebas, tiempo de espera y criterio de éxito. Fotografía la mesa. Si el documento tiene que cambiar, la serie se reinicia.

  2. 2
    Mide la línea de base

    Ejecuta el protocolo sin intervenciones y registra los éxitos; luego ejecuta una sesión instrumentada con asunción de control habilitada y registra la tasa. Esos dos números son la ronda cero.

  3. 3
    Recopila correcciones en un estilo consistente

    Un modo de entrada por ronda, un operador si puedes manejarlo. Asume el control en un criterio que puedas decir en voz alta («gripper a más de dos centímetros en la aproximación») y mantenlo para la ronda.

  4. 4
    Triaja cada episodio el mismo día

    Corrección, evaluación o descarte. Los episodios ambiguos se descartan, no se guardan en la teoría de que más datos ayudan (una corrección en la que tú mismo tropezaste es peor que ningún episodio).

  5. 5
    Compone la mezcla explícitamente

    Demostraciones originales más correcciones, selección de episodios por fuente. Registra recuento base, recuento de correcciones y cualquier ponderación (este es el campo que querrás en tres semanas).

  6. 6
    Continúa desde el checkpoint, luego re-mide

    Entrena el conjunto de datos compuesto desde el checkpoint anterior en lugar del modelo base, ejecuta el protocolo congelado más una sesión instrumentada, añade la fila y compara contra las dos rondas anteriores.

Dos límites cambian cómo lees una ronda débil. Continuar desde un checkpoint inicializa los pesos desde él (no es una reanudación de optimizador, así que el horario comienza fresco y una ejecución corta desde un checkpoint convergido puede moverse muy poco). Y el movimiento de alineación de líder al inicio de una asunción de control tiene el menor kilometraje en hardware real de cualquier cosa en la cadena; si las correcciones todas comienzan con un transitorio extraño, mira allí antes de culpar la mezcla.

El bucle medido, ya cableado

ay-robots implementa estos seis pasos como características de producto: asume el control a mitad de ejecución desde un brazo líder, teclado o deslizadores, con fotogramas de intervención marcados automáticamente; triaja cada episodio como corrección, evaluación o descarte; compone el siguiente conjunto de datos a partir de las demostraciones originales más las correcciones, selección de episodios explícita por fuente; e inicia la siguiente ejecución de entrenamiento desde el checkpoint anterior en lugar del modelo base.

Mira cómo funciona el bucle DAgger

Lo que los números no pueden decirte

Nada de esto está resuelto, y una curva ordenada no debe persuadirte de lo contrario. La tasa de intervención mide un sistema conjunto (política, hardware, operador, habitación) y no atribuye nada por sí mismo. No puede juzgar si las correcciones fueron buenas, y caerá felizmente en una tarea que se hizo más fácil porque el objeto se desplazó dos centímetros más cerca en tres semanas.

Lo que hace es convertir una impresión vaga en una columna con la que puedes discutir. La alternativa no es una métrica mejor; son tres semanas de recopilación de correcciones que la curva te habría dicho, después de la ronda tres, que dejaras de recopilar. La literatura de encuesta define el aprendizaje por imitación interactivo como retroalimentación humana dada de forma intermitente durante la ejecución del robot, permitiendo una mejora en línea del comportamiento; la familia es amplia, y ningún arreglo de ella funciona sin un número por ronda. Ver también la guía de aprendizaje por imitación del SO-100 para el conjunto de datos base que mezclas contra, ejecutando una política para el lado de inferencia, y la página de bucle DAgger para el pipeline implementado.

¿Es la tasa de intervención solo uno menos la tasa de éxito?

No. La tasa mide cuánto de una ejecución asumiste; la tasa de éxito mide si la tarea se completó sin ti. Una ejecución puede tener éxito con una tasa de intervención del 30 por ciento, y una ejecución sin intervenciones puede fallar completamente. También difieren en ruido: la tasa se mueve suavemente en miles de fotogramas correlacionados, la tasa de éxito salta entre algunos resultados binarios. Registra ambas.

¿Cuántas pruebas de evaluación necesito para que la tasa de éxito signifique algo?

Más de lo que se siente razonable. Bajo la aproximación normal, 20 pruebas con una verdadera tasa de éxito del 60 por ciento llevan un error estándar cerca de 11 puntos porcentuales, así que un movimiento de 10 puntos entre rondas es indistinguible del ruido; 50 pruebas traen esa cifra a aproximadamente 7. Si no puedes permitirte 50, mantén el recuento de pruebas idéntico entre rondas y trata los pequeños movimientos como inconcluyentes.

¿Qué relación de demostración a correcciones debo comenzar?

El punto de partida documentado es de IWR: particiona los datos en muestras de intervención y no intervención y extrae de ellas en proporción igual, para que las correcciones contribuyan la mitad del gradiente sin importar qué fracción de los fotogramas sean. Si tu configuración no puede ponderar muestreo, aproxima mediante recuentos de episodios al componer el conjunto de datos y registra la relación. Entrenar solo en correcciones es la opción a descartar.

Mi tasa de intervención subió después de una ronda. ¿Se desperdició la ronda?

No necesariamente, pero verifica primero las explicaciones aburridas: ¿el checkpoint que condujiste coincidió con el que entrenaste, cambió un índice de cámara o montaje, se desplazó la colocación de objetos, fue el estilo de corrección consistente? Si los cuatro están limpios y la tasa de éxito emparejada también cayó, sospecha la mezcla (pocas demostraciones base contra las correcciones, o correcciones que se contradicen). Una regresión genuina pertenece al registro, no a la papelera.

¿Puedo saltarme el protocolo de evaluación fijo y solo ver la tasa de intervención?

Solo si aceptas que no puedes distinguir mejora de habituación. La tasa depende de tu propio umbral en tiempo real para intervenir, y ese umbral cae a medida que te acostumbras a las peculiaridades de la política. El protocolo congelado es la parte de la medición que tu umbral no puede alcanzar (marcas pegadas, pose inicial escrita, recuento de pruebas fijo, criterio decidido antes de la ronda). Tiene que permanecer sin cambios en toda la serie.

Mantén el registro en el repositorio, no en un cuaderno: las rondas están separadas por días, el hardware se reconstruye, y la persona que lee la curva en octubre eres tú sin memoria de agosto. La documentación FAQ cubre los detalles operacionales omitidos aquí.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started