Espace de travail robotique de table du type utilisé comme configuration d'évaluation fixe pour les exécutions de politique répétées
DAggerÉvaluationApprentissage par imitationDonnées robotiquesSO-100

Mesure d'une boucle DAgger : Taux d'intervention, protocole d'évaluation et les pièges entre les deux

AY-Robots ResearchAugust 27, 202615 min de lecture

Le taux d'intervention — images d'intervention divisées par les images de la course — est le signal de progrès le moins cher et honnête qu'une boucle DAgger contrôlée par humain puisse avoir. Cet article le définit de sorte que deux personnes calculent la même valeur, montre comment l'enregistrer, et parcourt les quatre façons dont il vous induit en erreur : l'habituation de l'opérateur, une configuration d'évaluation qui dérive, l'entraînement uniquement sur les corrections, et un humain qui corrige différemment le mardi que le lundi.

Une itération DAgger semble productive pendant que vous la menez. Vous conduisez la politique, vous prenez le contrôle quand elle rate la saisie, vous enregistrez les corrections, vous réentraînez, et la course suivante semble — vous le jureriez — un peu plus fluide. Deux itérations plus tard, vous ne pouvez pas dire si quelque chose a changé, car « un peu plus fluide » n'est pas une quantité.

La boucle a besoin d'un nombre par itération, et dans une boucle contrôlée par humain, ce nombre est presque gratuit : la fraction de la course pendant laquelle vous aviez le contrôle au lieu de la politique. Cet article le définit de sorte que deux personnes calculent la même valeur, l'enregistre, lit la courbe résultante, et nomme les quatre façons dont il vous induit en erreur lorsqu'il est seul. Pour la théorie que ce texte suppose, voir l'explication de DAgger et la variante contrôlée par humain; l'équivalent pratique est exécution d'une boucle DAgger sur un SO-100.

La version courte

  • Taux d'intervention = images d'intervention / images de la course. Images, pas d'épisodes, et le dénominateur inclut les images que vous avez passées à corriger.
  • Une courbe plate sur trois itérations signifie que les itérations n'achètent rien — changez le mélange, le checkpoint ou la tâche au lieu de collecter une quatrième.
  • Un taux d'intervention en baisse n'est pas un taux de succès en hausse. Votre seuil pour intervenir s'abaisse à mesure que la confiance grandit.
  • Sans un protocole d'évaluation gelé — mêmes poses de départ, objets, caméras, nombre d'essais — vous mesurez la salle.
  • L'entraînement uniquement sur les corrections biaise la distribution d'état. La réponse d'IWR : tirez les échantillons d'intervention et de non-intervention à parts égales.

Pourquoi une itération a besoin d'un nombre à tout

DAgger existe à cause d'un problème de distribution, et les problèmes de distribution sont invisibles à l'œil. Ross et Bagnell ont montré que l'apprentissage par imitation sur un ensemble de démonstration fixe mène à des erreurs composées et une borne de regret croissant quadratiquement dans l'horizon temporel : une fois que le modèle s'éloigne des états visités par le démonstrateur, rien dans les données ne lui dit comment revenir. DAgger règle cela en itérant — exécutez la politique, étiquetez les états qu'elle visite, agrégez, réentraînez — ce que Ross, Gordon et Bagnell encadrent comme une réduction en apprentissage en ligne sans regret.

Ce cadre a une conséquence que les gens sautent. La garantie concerne la séquence de politiques sur les itérations, non une seule course. Elle ne dit rien sur le fait que votre itération trois a aidé. Le seul moyen de savoir est de mesurer chaque itération. Kelly et ses collègues ont introduit HG-DAgger car le DAgger classique demande à l'expert des étiquettes d'action tandis que le novice a toujours le contrôle, ce que l'article soutient peut diminuer la sécurité et, avec des experts humains, est susceptible de réduire la qualité de l'étiquette par décalage d'actionneur perçu. HG-DAgger apprend aussi un seuil de sécurité pour une métrique de risque basée sur l'incertitude du modèle et rapporte une performance améliorée sur DAgger et le clonage comportemental sur une tâche de conduite. Il ne publie pas les décomptes d'intervention ; vous les produisez vous-même.

Définir le taux de sorte que deux personnes obtiennent le même nombre

La définition est une ligne : images d'intervention divisées par images de la course. Tout ce qui est difficile se cache dans ce qui compte comme une image et ce qui compte comme une course.

Images, pas d'épisodes

Compter les épisodes avec au moins une intervention est inutile : dix épisodes avec une nudge chacun et dix dans lesquels vous avez conduit quatre-vingts pour cent donnent tous les deux « 10/10 ». Le décompte d'images les sépare, et c'est la granularité que l'enregistrement a déjà — dans le format du dataset LeRobot chaque pas de temps est une ligne, ainsi le drapeau d'intervention est une colonne booléenne à côté de l'état et de l'action. Ici, il est écrit par image au moment où la prise de contrôle commence et effacé quand le contrôle revient.

Le dénominateur inclut les corrections

Deux dénominateurs sont défendables — images totales de la course, ou images que la politique a conduites de manière autonome — et ils divergent beaucoup aux niveaux d'intervention élevés. Prenez le contrôle pendant 400 des 1000 images et le premier donne 40 pour cent, le second 67 pour cent. Comparer une itération mesurée de la première façon contre la suivante mesurée de la deuxième façon est comment une amélioration réelle disparaît. Prenez les images totales et ne revisitez jamais le choix au milieu de la série.

Décidez une fois ce qui se passe aux images de transition

Il y a toujours une couture. Quand le contrôle passe, certaines images n'appartiennent à aucun côté : le bras est maintenu, le leader s'aligne, l'enregistrement est gelé. Dans ce pipeline, ces images de transition restent dans le flux brut et n'entrent jamais dans l'épisode — elles ne sont ni un comportement de politique ni une correction digne d'être entraînée. Comptez la couture de la même manière chaque itération : à 30 Hz, six reprises de contrôle avec une couture de deux secondes chacune font 360 images, assez pour déplacer un point de pourcentage.

Les trois décisions qui cassent la comparabilité

Images ou épisodes ; course totale ou autonome uniquement ; images de transition dedans ou dehors. N'importe lesquelles des trois changées silencieusement entre les itérations rend la courbe insignifiante. Écrivez les trois.

L'enregistrer de sorte que le nombre survive à la session

Une métrique dans le panneau d'état d'un processus en cours est une lecture : elle disparaît au redémarrage et ne peut pas être tracée. Une ligne d'ajout seul par course couvre la série entière — y compris quel checkpoint vous avez conduit, puisque cela change chaque itération et les confondre invalide ce qui suit.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Une ligne par course. L'enregistrement du dénominateur et de la convention de transition à côté du nombre importe plus que les noms de champs.

Deux champs portent le poids. train_mix est ce que vous avez alimenté le prochain travail d'entraînement ; sans lui rien ne peut être attribué. eval_protocol nomme le test fixe que vous avez exécuté par la suite, et est le champ le plus souvent laissé vide. Dans le cockpit ay-robots, le rapport d'état de reprise rapporte le décompte d'images d'intervention pour la session en cours, donc l'enregistrement est plutôt une transcription qu'une instrumentation ; la documentation du dataset couvre où les colonnes par image atterrissent.

Matrice de configuration d'entraînement montrant les politiques, datasets et checkpoints côte à côte
Chaque itération change le mélange de checkpoint et de dataset. Un nombre dont la combinaison n'a pas été enregistrée ne peut pas être attribué.

Lire la courbe : trois itérations, un verdict

Trois itérations est le minimum pour une lecture, car deux points font toujours une ligne. Le tableau ci-dessous est un modèle de tenue de livre avec des nombres d'espace réservé, pas des mesures d'une course réelle. Vous cherchez une diminution monotone appariée par une augmentation du succès sur un test fixe.

ItérationCheckpoint conduitImagesImages d'interventionTauxSuccès (sur 20)
0 (baseline)politique de base5 9001 38023,4 %7
1du mélange d'itération 05 61098017,5 %10
2du mélange d'itération 15 41261111,3 %11
3du mélange d'itération 25 38059811,1 %12

Les itérations un et deux font du travail. L'itération trois ne l'est pas : 11,3 contre 11,1 pour cent est à l'intérieur de la variation d'une course à l'autre de tout ce qui est mesuré sur un bras physique, et une quatrième itération des mêmes corrections dépense un après-midi pour rien. Le segment plat dit de changer quelque chose de structurel.

  • Les défaillances restantes ne sont pas corrigeables par télé-opération — objet hors de portée, géométrie du préhenseur, une articulation à sa limite. Aucune donnée de correction ne fixe un mur cinématique.
  • Les corrections sont trop peu nombreuses par rapport au dataset de base pour déplacer le gradient, et rien ne les pondère.
  • Les corrections se contredisent les unes les autres, donc la politique fait la moyenne de deux stratégies et atterrit entre elles.
  • L'échec en amont : une caméra a bougé, l'éclairage a changé, la vue du poignet ne correspond plus à l'entraînement.
  • La tâche atteint le plafond de cette classe de politique sur ce matériel, et l'étape suivante est plus de données de base.

Les deux derniers ne sont pas des défaillances de la boucle. Dans Sirius-Fleet, un besoin décroissant de l'humain est le résultat conçu : à mesure que l'autonomie robotique s'améliore, ses prédicteurs d'anomalie adaptent leurs critères de prédiction, menant à moins de demandes d'intervention humaine et réduisant progressivement la charge de travail humaine au fil du temps. Là, le critère s'adapte à dessein. Dans une boucle manuelle, le vôtre s'adapte aussi, silencieusement — donc un taux qui s'aplatit parce que la tâche atteint son plafond ressemble exactement à celui qui s'est aplati parce que l'opérateur a arrêté de remarquer. Ce qui est le problème suivant.

Piège 1 : un taux en baisse n'est pas un taux de succès en hausse

Le taux d'intervention mesure exactement une chose : la part de la course que vous avez décidé de maîtriser. Cette décision est la vôtre, prise en temps réel, et elle se déplace. À l'itération zéro, vous prenez le contrôle au premier angle d'approche mauvais ; à l'itération trois, vous avez regardé la politique se rétablir d'une douzaine d'entre eux et vous la laissez essayer. Votre seuil s'est déplacé ; la politique peut ne pas l'avoir fait. Le taux baisse de toute façon.

La confiance humaine est au moins une quantité modélisée dans la littérature plutôt qu'une constante supposée. Sirius pondère à nouveau les échantillons d'entraînement avec la confiance humaine approximée et optimise la politique avec le clonage comportemental pondéré, rapportant un gain de 8 pour cent en simulation et 27 pour cent sur du matériel réel par rapport à l'état de l'art en taux de succès de la politique, à deux fois la vitesse de convergence. Cela traite la confiance comme un poids sur les données. Cela ne corrige pas le seuil dans votre tête entre l'itération zéro et l'itération trois.

Vous ne pouvez pas supprimer la dérive, alors associez le taux à quelque chose que votre seuil ne peut pas toucher : un ensemble fixe d'essais dans lesquels vous n'intervenez pas du tout, notés par rapport à un critère écrit avant l'itération. Un taux qui baisse tandis que le taux de succès associé reste inchangé est la signature de l'habituation — digne d'être capturée, car de l'intérieur de la boucle, cela semble du progrès.

Taux d'interventionTaux de succès sur le protocole fixeLecture la plus probable
baisseaugmenteL'itération a fonctionné. Continuez.
baisseplatVotre seuil a dérivé, ou les corrections ont supprimé l'effort sans supprimer les défaillances.
baissebaisseLes corrections dégradent la politique. Vérifiez le mélange et leur cohérence interne.
platplatL'itération n'a rien acheté. Changez mélange, checkpoint ou tâche avant de collecter plus.
augmentebaisseRégression. Soupçonnez mélange d'entraînement, une caméra changée ou une confusion de checkpoint avant de soupçonner la méthode.

Piège 2 : sans un protocole fixe, vous mesurez la salle

L'évaluation sur robot réel est chère et difficile à répéter. Les auteurs de SIMPLER motivent l'évaluation simulée par l'observation que l'évaluation réelle en monde des politiques n'est pas scalable et fait face à des défis de reproductibilité susceptibles de s'aggraver à mesure que les politiques élargissent leur spectre de tâches. RoboArena l'attaque de l'autre côté, avec plus de 600 épisodes d'évaluation sur robot réel appariés entre sept politiques généralistes, exécutés par des évaluateurs de sept institutions académiques sur la plateforme DROID. Ses évaluateurs choisissent leurs propres tâches et environnements mais doivent juger les paires de politiques en aveugle ; l'article rapporte que ce classement participatif suit la performance des politiques généralistes plus précisément que l'évaluation conventionnelle et centralisée.

Vous n'allez pas exécuter 600 épisodes appariés sur un SO-100 dans un atelier. Ce que vous pouvez faire, c'est supprimer la variance que vous contrôlez — une liste ennuyeuse assez pour qu'elle soit généralement sautée.

DimensionGeler ceciCe qui dérive si vous ne le faites pas
Pose de départUne position d'accueil écrite, conduite avant chaque essaiLa trajectoire commence hors distribution
ObjetsMarques collées, et les mêmes objets physiques réservés à l'évaluationUne politique « meilleure » est vraiment un objet plus proche
Caméras et lumièreMêmes montures, indices, exposition ; stores fermés ; photographiez la configurationLes indices de caméra permutés seuls peuvent dominer le résultat
Essais et règle d'arrêtn fixé, délai d'attente fixe, critère écrit avant l'itérationLes critères post-hoc transforment les presque-ratés en ce que vous avez besoin
Comportement de l'opérateurPas d'interventions pendant les essais d'évaluationL'évaluation devient une autre session de correction

Ensuite l'arithmétique, impitoyable aux décomptes d'essai qu'un atelier peut se permettre. Sous l'approximation normale, 60 pour cent de succès sur 20 essais porte une erreur-type près de 11 points de pourcentage — la racine carrée de 0,6 fois 0,4 sur 20 — et la différence entre deux de ces itérations porte environ 15. Un saut de 60 à 70 pour cent est donc cohérent avec rien s'étant passé. Cinquante essais portent le chiffre par itération à environ 7 points, et coûtent un après-midi.

Cette asymétrie est l'argument pour le taux d'intervention : calculé sur des milliers d'images plutôt que vingt résultats binaires, il se déplace plus tôt et plus régulièrement. La mise en garde est que les images dans un épisode sont fortement corrélées — une mauvaise saisie produit cent images d'intervention consécutives — donc la taille d'échantillon effective est plus proche du nombre de reprises de contrôle. Traitez le taux comme l'indicateur précoce et le taux de succès comme la vérité au sol lente.

Gardez les épisodes d'évaluation hors du pool d'entraînement

Les épisodes d'évaluation ne doivent jamais entrer dans le dataset d'entraînement composé — sinon l'itération n+1 est notée sur les données sur lesquelles elle a été entraînée, et la courbe mesure la mémorisation.

Piège 3 : l'entraînement uniquement sur les corrections plie la politique

Les corrections sont les données intéressantes, donc l'instinct est de les entraîner. Ne le faites pas. Elles viennent par construction de la tranche étroite d'espace d'état où la politique échouait déjà et disent presque rien de la majorité de la course qui a fonctionné. Fine-tuner sur cette tranche seule et vous obtenez une politique bonne pour se rétablir d'une approche maladroite qui a oublié comment en faire une propre.

Mandlekar et ses collègues ont construit leur système d'intervention à distance autour de cela. Leur encadrement : les tâches de manipulation contiennent des régions de goulot nécessitant une séquence d'actions précises — insérer une capsule dans une machine à café est leur exemple — où les petits écarts mènent à des états que les démonstrations n'ont jamais couverts. Leur algorithme s'entraîne de manière itérative sur les nouvelles données de sorte que la politique apprenne à traverser ces goulots, et ils rapportent que les agents entraînés sur les données d'intervention battent les agents entraînés sur un nombre équivalent d'échantillons de démonstrateurs non-intervenant.

Fine-tuning corrections uniquement par rapport à un mélange composé
Ce que corrections uniquement vous obtient
  • Rapide : une courte course sur quelques douzaines d'épisodes est assez bon marché pour répéter
  • Ciblé : le gradient est dominé par les états qui vous intéressent
  • Bon marché pour tester si un style de correction est apprenante du tout
Ce qu'il coûte
  • La distribution fine-tune ne ressemble plus à la distribution de tâche
  • Le comportement nominal peut se dégrader visiblement dans une seule itération
  • Le taux peut baisser tandis que le succès baisse avec lui — des segments propres échangés contre les récupérations

Le rapport de mélange est un hyperparamètre et mérite d'être noté. Composer le prochain dataset est où il est décidé : démonstrations originales plus l'ensemble de correction, sélection d'épisode par source plutôt qu'une règle qui tire silencieusement dans tout ce qui est disponible. Ici, c'est une étape de composition dans le cockpit, et le résultat est un dataset ordinaire — voir la documentation d'entraînement. Ce qu'aucun outil ne fait pour vous est d'enregistrer quel rapport a produit quelle courbe.

Piège 4 : l'humain n'est pas un expert cohérent

La théorie de DAgger suppose un expert. Vous ne l'êtes pas au sens technique : vos corrections ne sont pas des échantillons d'une distribution conditionnelle fixe sur les actions. Les auteurs d'ACT nomment cela quand ils énumèrent les obstacles à la manipulation fine — les erreurs se composent au fil du temps, et les démonstrations humaines peuvent être non-stationnaires. Leur système atteint toujours 80 à 90 pour cent de succès sur six tâches réelles à partir de dix minutes de démonstrations, donc le problème est traitable, pas absent.

L'étude robomimic énonce le point du côté des données. Sur six algorithmes hors ligne sur cinq tâches simulées et trois tâches réelles multi-étapes, ses leçons incluent la sensibilité aux choix de conception, la dépendance à la qualité de la démonstration, et — celle qui fait le plus mal ici — la variabilité résultant des critères d'arrêt, car les objectifs d'entraînement et d'évaluation diffèrent. Le checkpoint avec la perte la plus basse n'est pas fiablement celui avec le taux de succès le plus élevé.

Il y a une version matérielle de cela : le mode d'entrée façonne la correction. Une configuration leader-follower produit des trajectoires continues au rythme humain. Les nudges au clavier sont fixés dur par le serveur — deux degrés par appel sur les articulations du bras, quatre sur le préhenseur — de sorte que la même intention arrive comme un escalier de petits pas. Les curseurs envoient des cibles absolues et le serveur se déplace au maximum six degrés vers eux par appel. Trois modes, trois distributions d'action ; mélanger les trois dans un ensemble de correction et puis se demander pourquoi l'approche est devenue saccadée est auto-infligée. La documentation de télé-opération couvre ce que chaque mode envoie.

Pondérer les interventions : IWR et ce qui a suivi

Si les corrections sont la minorité précieuse, le correctif principié est le poids plutôt que l'exclusivité. Intervention Weighted Regression est l'implémentation de référence : les données sont partitionnées en échantillons d'intervention et de non-intervention, et les deux partitions sont échantillonnées à parts égales pendant l'entraînement. Un ensemble de correction qui est cinq pour cent des images contribue ensuite à moitié le gradient, sans que le comportement nominal ne disparaisse de la distribution.

La part égale est un point de départ, pas une loi. Sirius le généralise en remplaçant la partition binaire par un poids continu de la confiance humaine approximée ; Sirius-Fleet déplace la décision en amont, en utilisant un modèle de monde visuel et des prédicteurs d'anomalie pour décider quand un humain est sollicité à tout. Le fil commun : le drapeau d'intervention est un signal d'entraînement, pas seulement une colonne de tenue de livre.

MéthodeQui décide quand l'humain agitComment les données d'intervention sont utiliséesRésultat rapporté
DAgger (2011)Calendrier fixe ; l'expert étiquette les états visitésUn dataset croissant, non pondéréEncadré comme une réduction en apprentissage en ligne sans regret
HG-DAgger (2019)L'humain, contrôlant le contrôle sur un système réelAgrégé ; plus un seuil de sécurité appris sur l'incertitude du modèleMieux que DAgger et BC sur la conduite ; pas de décomptes d'intervention donnés
IWR (2020)L'humain, via télé-opération à distanceÉchantillons d'intervention et de non-intervention tirés à parts égalesBat les démos non-intervenantes à décompte d'échantillon égal
Sirius (2022)L'humain, pendant le déploiementBC pondéré, poids de la confiance humaine approximéeGain de 8 % en simulation, 27 % sur matériel réel ; convergence 2x plus rapide
ThriftyDAgger (2021)Le système, contrôlant la nouveauté et le risqueCollection interactive sous un budget de supervisionÉtude utilisateur (N=10) : performance humaine 58 % plus élevée et performance robotique 80 % plus élevée que la meilleure méthode suivante
Fleet-DAgger (2022)Le système, allouant l'attention à travers une flotteApprentissage de la flotte noté par Rendement de l'effort humainJusqu'à 8,8x ROHE plus élevé que les baselines
Sirius-Fleet (2024)Prédicteurs d'anomalie avec critères d'adaptation automatiqueApprentissage multi-tâche avec un modèle de monde visuelMoins de demandes d'intervention à mesure que l'autonomie s'améliore
Vue de classement comparant les politiques robotiques par score mesuré
Classer les politiques les unes contre les autres ne veut dire quelque chose que si chaque entrée a exécuté le même protocole. Cela s'applique aussi à vos trois itérations.

Quatre métriques dignes d'être enregistrées à côté du taux

  • Reprises de contrôle par course. Vingt courtes corrections et une longue donnent des taux similaires et décrivent des politiques différentes — une saccadée, une avec un seul point faible.
  • Longueur d'intervention moyenne. La longueur croissante avec un décompte en baisse signifie que les défaillances restantes sont les difficiles, ce à quoi ressemble le progrès tardif.
  • Temps jusqu'à la première intervention. Une politique qui va plus loin avant d'avoir besoin d'aide s'améliore même quand le taux total est plat.
  • Où les interventions se regroupent. Classez le drapeau par progrès d'épisode normalisé ; un pic stable entre les itérations pointe un seul goulot.

Un protocole de cours que vous pouvez réellement exécuter

Une course mesurée a six étapes et produit une ligne dans le log. Les quatre premières sont la boucle ; les deux dernières en font une mesure.

  1. 1
    Geler le protocole d'évaluation avant l'itération zéro

    Notez la pose de départ, le placement des objets, les caméras, le décompte des essais, le délai d'attente et le critère de succès. Photographiez la table. Si le document doit changer, la série recommence.

  2. 2
    Mesurer la baseline

    Exécutez le protocole sans interventions et enregistrez les succès ; puis exécutez une session instrumentée avec la reprise de contrôle activée et enregistrez le taux. Ces deux nombres sont l'itération zéro.

  3. 3
    Collectez les corrections dans un seul style cohérent

    Un mode d'entrée par itération, un opérateur si vous pouvez le gérer. Prenez le contrôle sur un critère que vous pouvez énoncer à haute voix — « préhenseur à plus de deux centimètres d'écart à l'approche » — et tenez-le pour l'itération.

  4. 4
    Triez chaque épisode le même jour

    Correction, évaluation ou rejet. Les épisodes ambigus sont rejetés, pas enregistrés sous la théorie que plus de données aide — une correction dans laquelle vous-même avez fumé est pire que pas d'épisode.

  5. 5
    Composez le mélange explicitement

    Démonstrations originales plus corrections, sélection d'épisode par source. Enregistrez le décompte de base, le décompte de correction et tout pondération — c'est le champ que vous allez vouloir dans trois semaines.

  6. 6
    Continuez depuis le checkpoint, puis re-mesurez

    Entraînez le dataset composé depuis le checkpoint précédent plutôt que le modèle de base, exécutez le protocole gelé plus une session instrumentée, ajoutez la ligne, et comparez contre les deux itérations précédentes.

Deux limites changent comment vous lisez une itération faible. Continuer depuis un checkpoint initialise les poids depuis lui — pas une reprise d'optimiseur, donc le calendrier recommence et une courte course depuis un checkpoint convergé peut se déplacer très peu. Et le mouvement d'alignement du leader au début d'une reprise de contrôle a le moins de kilométrage de tout ce qui est dans la chaîne ; si les corrections commencent toutes par une transitoire bizarre, regardez là avant de blâmer le mélange.

La boucle mesurée, déjà câblée

ay-robots implémente ces six étapes comme des caractéristiques de produit : prenez le contrôle en milieu de course à partir d'un bras leader, du clavier ou des curseurs, avec les images d'intervention signalées automatiquement ; triez chaque épisode comme correction, évaluation ou rejet ; composez le prochain dataset à partir des démonstrations originales plus les corrections, sélection d'épisode explicite par source ; et commencez le prochain travail d'entraînement depuis le checkpoint précédent au lieu du modèle de base.

Voir comment la boucle DAgger fonctionne

Ce que les nombres ne peuvent pas vous dire

Rien de cela n'est résolu, et une courbe soignée ne devrait pas vous persuader du contraire. Le taux d'intervention mesure un système conjoint — politique, matériel, opérateur, salle — et n'attribue rien de seul. Il ne peut pas juger si les corrections étaient bonnes, et il chutera joyeusement sur une tâche qui s'est améliorée parce que l'objet s'est rapproché de deux centimètres au cours de trois semaines.

Ce qu'il fait, c'est transformer une impression vague en une colonne avec laquelle vous pouvez vous quereller. L'alternative n'est pas une meilleure métrique ; c'est trois semaines de collecte de corrections que la courbe vous aurait dit, après l'itération trois, d'arrêter de collecter. La littérature d'enquête définit l'apprentissage par imitation interactif comme la rétroaction humaine donnée par intermittence pendant l'exécution du robot, permettant une amélioration en ligne du comportement ; la famille est large, et aucune disposition de celle-ci ne fonctionne sans un nombre par itération. Voir aussi le guide d'apprentissage par imitation SO-100 pour le dataset de base que vous mélangez contre, exécuter une politique pour le côté inférence, et la page de la boucle DAgger pour le pipeline implémenté.

Le taux d'intervention est-il simplement un moins le taux de succès ?

Non. Le taux mesure la part d'une course que vous avez prise en charge ; le taux de succès mesure si la tâche s'est terminée sans vous. Une course peut réussir avec un taux d'intervention de 30 pour cent, et une course sans interventions peut échouer complètement. Elles diffèrent aussi en bruit : le taux se déplace régulièrement sur des milliers de cadres corrélés, le taux de succès saute entre une poignée de résultats binaires. Enregistrez les deux.

Combien d'essais d'évaluation me faut-il pour que le taux de succès signifie quelque chose ?

Plus qu'il ne semble raisonnable. Sous l'approximation normale, 20 essais à un taux de succès vrai de 60 pour cent portent une erreur-type près de 11 points de pourcentage, donc un mouvement de 10 points entre les itérations est indistinguible du bruit ; 50 essais portent ce chiffre à environ 7. Si vous ne pouvez pas vous permettre 50, gardez le décompte d'essai identique entre les itérations et traitez les petits mouvements comme inconclus.

Quel rapport de mélange de démonstrations aux corrections dois-je commencer ?

Le point de départ documenté est celui d'IWR : partitionnez les données en échantillons d'intervention et de non-intervention et tirez-les à parts égales, de sorte que les corrections contribuent à la moitié du gradient si petite fraction que soit celle des images. Si votre configuration ne peut pas peser l'échantillonnage, approximez-le par des décomptes d'épisode lors de la composition du dataset et enregistrez le rapport. L'entraînement uniquement sur les corrections est l'option à écarter.

Mon taux d'intervention a augmenté après une itération. L'itération est-elle gaspillée ?

Pas nécessairement, mais vérifiez d'abord les explications ennuyeuses : le checkpoint que vous avez conduit correspondait-il à celui que vous avez entraîné, un index de caméra ou un montage a-t-il changé, le placement des objets a-t-il dérivé, le style de correction était-il cohérent. Si les quatre sont propres et le taux de succès associé a aussi baissé, soupçonnez le mélange — trop peu de démonstrations de base contre les corrections, ou des corrections qui se contredisent. Une véritable régression appartient au log, pas à la corbeille.

Puis-je ignorer le protocole d'évaluation fixe et simplement regarder le taux d'intervention ?

Seulement si vous acceptez de ne pas pouvoir distinguer l'amélioration de l'habituation. Le taux dépend de votre propre seuil en temps réel pour intervenir, et ce seuil s'abaisse à mesure que vous vous habituez aux bizarreries de la politique. Le protocole gelé est la partie de la mesure que votre seuil ne peut pas atteindre — des marques collées, une pose d'accueil écrite, un décompte d'essai fixe, un critère décidé avant l'itération. Il doit rester inchangé dans la série.

Gardez le log dans le repository, pas dans un cahier : les itérations sont à des jours d'intervalle, le matériel est reconstruit, et la personne lisant la courbe en octobre est vous sans mémoire d'août. La FAQ de documentation couvre les détails opérationnels laissés de côté ici.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started