Tabletop ρομποτικός χώρος εργασίας του είδους που χρησιμοποιείται ως ένα fixed evaluation setup για επαναλαμβανόμενες policy runs
DAggerΑξιολόγησηImitation LearningRobot DataSO-100

Μέτρηση ενός DAgger Loop: Intervention Rate, Evaluation Protocol και οι Παγίδες ανάμεσά τους

AY-Robots ResearchAugust 27, 202615 λεπτά ανάγνωση

Το intervention rate - intervention frames διαιρούμενα με τα frames της εκτέλεσης - είναι το φθηνότερο ειλικρινές σήμα προόδου που έχει ένας human-gated DAgger loop. Αυτό το άρθρο το ορίζει έτσι ώστε δύο άτομα να υπολογίσουν την ίδια τιμή, δείχνει πώς να το καταγράψετε και ανιχνεύει τους τέσσερις τρόπους που σας παραπλανά: operator habituation, ένα drifting evaluation setup, training μόνο σε corrections και ένας άνθρωπος που διορθώνει διαφορετικά την Τρίτη από τη Δευτέρα.

Ένας DAgger κύκλος αισθάνεται παραγωγικός ενώ είστε μέσα του. Οδηγείτε την πολιτική, παίρνετε τον έλεγχο όταν χαμηλώνει στη σύλληψη, αποθηκεύετε τις διορθώσεις, ξαναεκπαιδεύετε και η επόμενη εκτέλεση φαίνεται - θα το ορκίζατε - λίγο ομαλότερη. Δύο κύκλοι αργότερα δεν μπορείτε να πείτε αν κάτι άλλαξε, επειδή το "λίγο ομαλότερο" δεν είναι ποσότητα.

Το loop χρειάζεται έναν αριθμό ανά κύκλο, και σε ένα human-gated loop αυτός ο αριθμός είναι σχεδόν δωρεάν: το κλάσμα της εκτέλεσης κατά το οποίο είχατε τον έλεγχο αντί της πολιτικής. Αυτό το άρθρο το ορίζει έτσι δύο άτομα να υπολογίσουν την ίδια τιμή, το καταγράφει, διαβάζει την προκύπτουσα καμπύλη και ονοματίζει τους τέσσερις τρόπους που σας παραπλανά όταν στέκεται μόνο του. Για τη θεωρία που υποθέτει αυτό το κομμάτι, δείτε την εξήγηση DAgger και τη human-gated παραλλαγή; το hands-on αντίστοιχο είναι εκτέλεση ενός DAgger loop σε ένα SO-100.

Η σύντομη έκδοση

  • Intervention rate = intervention frames / frames της εκτέλεσης. Frames, όχι episodes, και ο παρονομαστής περιλαμβάνει τα frames που δαπανήσατε στη διόρθωση.
  • Μια επίπεδη καμπύλη σε τρεις κύκλους σημαίνει ότι οι κύκλοι δεν αγοράζουν τίποτα - αλλάξτε το μίγμα, το checkpoint ή την εργασία αντί να συλλέγετε ένα τέταρτο.
  • Ένα πτώνον intervention rate δεν είναι ένα αυξανόμενο success rate. Το κατώφλι σας για να ανέβετε μετατοπίζεται προς τα κάτω καθώς αυξάνεται η εμπιστοσύνη.
  • Χωρίς ένα frozen evaluation protocol - οι ίδιες starting poses, αντικείμενα, κάμερες, αριθμός δοκιμών - μετράτε το δωμάτιο.
  • Το training μόνο σε corrections παραποιεί την κατανομή κατάστασης. Η απάντηση του IWR: σχεδιάστε intervention και non-intervention δείγματα σε ίση αναλογία.

Γιατί ένας κύκλος χρειάζεται ένα αριθμό καθόλου

Το DAgger υπάρχει επειδή υπάρχει ένα πρόβλημα κατανομής, και τα προβλήματα κατανομής είναι αόρατα στο μάτι. Οι Ross και Bagnell έδειξαν ότι imitation learning σε ένα σταθερό σύνολο επίδειξης οδηγεί σε σφάλματα σύνθεσης και ένα regret bound που αυξάνεται τετραγωνικά στον ορίζοντα του χρόνου: μόλις ο μαθητής φύγει από τις καταστάσεις που επισκέφθηκε ο αναδείκτης, τίποτα στα δεδομένα του λέει πώς να επιστρέψει. Το DAgger το διορθώνει με επανάληψη - εκτέλεση της πολιτικής, ετικέτα των καταστάσεων που επισκέπτεται, συγκέντρωση, ξαναεκπαίδευση - που οι Ross, Gordon και Bagnell πλαισιώνουν ως μια μείωση σε no-regret online learning.

Αυτός ο σχεδιασμός έχει μια συνέπεια που οι άνθρωποι παραλείπουν. Η εγγύηση αφορά την ακολουθία των πολιτικών σε όλες τις επαναλήψεις, όχι κάποιον μόνο κύκλο. Δεν λέει τίποτα για το αν ο κύκλος τρία βοήθησε. Ο μόνος τρόπος να το ξέρετε είναι να μετρήσετε κάθε επανάληψη. Ο Kelly και συνάδελφοι εισήγαγαν το HG-DAgger επειδή το κλασικό DAgger ζητά από τον εμπειρογνώμονα ετικέτες δράσης ενώ ο νέος εξακολουθεί να έχει τον έλεγχο, το οποίο το άρθρο υποστηρίζει ότι μπορεί να μειώσει την ασφάλεια και, με ανθρώπινους ειδικούς, είναι πιθανό να υποβαθμίσει την ποιότητα της ετικέτας μέσω της αντιληπτής actuator lag. Το HG-DAgger μαθαίνει επίσης ένα κατώφλι ασφάλειας για μια μετρική κινδύνου που βασίζεται στη model uncertainty και αναφέρει βελτιωμένη απόδοση σε σχέση με τόσο το DAgger όσο και behavioral cloning σε μια εργασία οδήγησης. Δεν δημοσιεύει αριθμούς παρεμβάσεων· εκείνες τις παράγετε ο ίδιος.

Ορίζοντας το rate έτσι δύο άτομα να πάρουν τον ίδιο αριθμό

Ο ορισμός είναι μια γραμμή: intervention frames διαιρούμενα με frames της εκτέλεσης. Όλα τα δύσκολα κρύβονται σε αυτό που μετράει ως frame και τι μετράει ως εκτέλεση.

Frames, όχι episodes

Ο μέτρησης episodes με τουλάχιστον μια παρέμβαση είναι άχρηστη: δέκα episodes με ένα nudge το καθένα και δέκα κατά τα οποία οδηγήσατε ενενήντα τοις εκατό και οι δύο δίνουν "10/10". Ο μέτρημα frames τα χωρίζει και είναι η κοκκοβάρυνση που η εγγραφή ήδη έχει - στη μορφή LeRobot dataset κάθε χρονικό βήμα είναι μια σειρά, έτσι η σημαία παρέμβασης είναι μια boolean στήλη δίπλα στην κατάσταση και τη δράση. Εδώ γράφεται ανά frame τη στιγμή που ξεκινά η ανάληψη ελέγχου και διαγράφεται όταν ο έλεγχος επιστρέφει.

Ο παρονομαστής περιλαμβάνει τις διορθώσεις

Δύο παρονομαστές είναι υπεράσπιστοι - συνολικά frames της εκτέλεσης ή frames που η πολιτική οδήγησε αυτόνομα - και αποκλίνουν σκληρά σε υψηλά επίπεδα παρέμβασης. Πάρτε τον έλεγχο για 400 από 1000 frames και ο πρώτος δίνει 40 τοις εκατό, ο δεύτερος 67 τοις εκατό. Η σύγκριση ενός κύκλου που μετράται με τον πρώτο τρόπο έναντι του επόμενου που μετράται με τον δεύτερο είναι πώς μια πραγματική βελτίωση εξαφανίζεται. Πάρτε συνολικά frames και μην ξαναδείτε την επιλογή σε εν λόγω σειρές.

Αποφασίστε μια φορά τι συμβαίνει με τα handover frames

Υπάρχει πάντα ένας δερματοπλαστής. Όταν ο έλεγχος μεταφέρεται, ορισμένα frames ανήκουν σε κανέναν: το βραχίονα κρατείται, ο ηγέτης ευθυγραμμίζεται, η εγγραφή είναι παγωμένη. Σε αυτή τη pipeline εκείνα τα handover frames παραμένουν στη surw stream και δεν μπαίνουν ποτέ στο curated episode - δεν είναι ούτε πολιτική συμπεριφορά ούτε μια διόρθωση που αξίζει να εκπαιδευτεί. Μετρήστε το δερματοπλαστής ο ίδιος τρόπος κάθε κύκλο: στα 30 Hz, έξι ανάληψη με δύο δευτερολέπτων δερματοπλαστής το καθένα είναι 360 frames, αρκετά για να μετακινήσετε ένα ποσοστιαίο σημείο.

Οι τρεις αποφάσεις που σπάνε τη συγκρισιμότητα

Frames ή episodes; συνολική εκτέλεση ή αυτόνομη-μόνο; handover frames μέσα ή έξω. Οποιοδήποτε από τα τρία άλλαξε σιωπηλά μεταξύ των κύκλων κάνει την καμπύλη άνευ νοήματος. Γράψτε και τα τρία.

Καταγραφή του έτσι ώστε ο αριθμός να επιζήσει της συνόδου

Μια μετρική στο πίνακα κατάστασης μιας εκτελούμενης διαδικασίας είναι ένα readout: εξαφανίζεται σε επανεκκίνηση και δεν μπορεί να σχεδιαστεί. Μια append-only σειρά ανά εκτέλεση καλύπτει ολόκληρη τη σειρά - συμπεριλαμβανομένου του checkpoint που οδηγήσατε, αφού αυτό αλλάζει κάθε κύκλο και ο μπερδέματα τα μειώνει ότι ακολουθεί.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Μια σειρά ανά εκτέλεση. Η εγγραφή του παρονομαστή και της handover σύμβασης δίπλα στον αριθμό έχει περισσότερη βάρος από τα ονόματα πεδίων.

Δύο πεδία κουβαλούν το βάρος. train_mix είναι αυτό που δώσατε στην επόμενη εργασία εκπαίδευσης; χωρίς αυτό, τίποτα δεν μπορεί να αποδοθεί. eval_protocol ονοματίζει το σταθερό δοκιμή που τρέξατε αργότερα, και είναι το πεδίο που συχνότερα αφήνεται κενό. Στο ay-robots cockpit το takeover status αναφέρει το intervention frame count για την εκτελούμενη συνόδο, έτσι η καταγραφή είναι αντιγραφή και όχι όργανα· το dataset documentation καλύπτει όπου τα ανά-frame columns προσγειώνονται.

Training configuration matrix που δείχνει πολιτικές, σύνολα δεδομένων και checkpoints side by side
Κάθε κύκλος αλλάζει checkpoint και dataset mix. Ένας αριθμός του οποίου ο συνδυασμός δεν καταγράφηκε δεν μπορεί να αποδοθεί.

Ανάγνωση της καμπύλης: τρεις κύκλοι, μια απόφαση

Τρεις κύκλοι είναι το ελάχιστο για μια ανάγνωση, επειδή δύο σημεία είναι πάντα μια γραμμή. Ο πίνακας παρακάτω είναι ένα πρότυπο σημειωματάριου με αριθμούς placeholder, όχι μετρήσεις από κάποιον κύκλο. Αναζητάτε μια monotone decrease matched από αύξηση στην επιτυχία σε σταθερό δοκιμή.

ΚύκλοςCheckpoint drivenFramesIntervention framesRateSuccesses (of 20)
0 (baseline)base policy5 9001 38023.4 %7
1from round 0 mix5 61098017.5 %10
2from round 1 mix5 41261111.3 %11
3from round 2 mix5 38059811.1 %12

Οι κύκλοι ένα και δύο κάνουν δουλειά. Ο κύκλος τρία δεν είναι: 11.3 έναντι 11.1 τοις εκατό είναι μέσα στη run-to-run παραλλαγή από οτιδήποτε μετράται σε ένα φυσικό βραχίονα, και ένας τέταρτος κύκλος του ίδιου corrections ξοδεύει ένα απόγευμα για τίποτα. Το flat segment λέει αλλάξτε κάτι δομικό.

  • Οι υπόλοιπες αποτυχίες δεν είναι διορθώσιμες με teleoperation - αντικείμενο εκτός εμβέλειας, γεωμετρία αρπάγης, ένα joint στο όριό του. Κανένα δεδομένο διόρθωσης δεν διορθώνει ένα κινηματικό τοίχο.
  • Οι διορθώσεις είναι πολύ λίγες έναντι του base dataset για να μετακινήσουν την κλίση, και τίποτα τα ζυγίζει.
  • Οι διορθώσεις έρχονται σε αντίθεση η μία με την άλλη, οπότε η πολιτική προσεγγίζει δύο στρατηγικές και προσγειώνεται μεταξύ τους.
  • Η αποτυχία είναι upstream: ένα κάμερα μετακινήθηκε, το φωτισμό άλλαξε, η άποψη του καρπού δεν ταιριάζει πλέον με εκπαίδευση.
  • Η εργασία είναι στο ταβάνι αυτής της κατηγορίας πολιτικής σε αυτό το υλικό, και το επόμενο βήμα είναι περισσότερα base δεδομένα.

Τα δύο τελευταία δεν είναι αποτυχίες του loop. Στο Sirius-Fleet μια πτωτή ανάγκη για τον άνθρωπο είναι το σχεδιασμένο αποτέλεσμα: καθώς η ρομποτική αυτονομία βελτιώνεται, οι προγνωστικοί ανιχνευτές ανωμαλιών του προσαρμόζουν τα κριτήρια πρόβλεψης τους, οδηγώντας σε λιγότερες αιτήματα για ανθρώπινη παρέμβαση και σταδιακή μείωση του ανθρώπινου φόρτου εργασίας με την πάροδο του χρόνου. Εκεί το κριτήριο προσαρμόζεται σκόπιμα. Σε ένα manual loop το δικό σας προσαρμόζεται και πάλι, σιωπηλά - έτσι ένα rate που ισοπεδώνεται επειδή η εργασία είναι στο ταβάνι της φαίνεται ακριβώς σαν κάποιο που ισοπεδώνεται επειδή ο χειριστής σταμάτησε να παρατηρεί. Ποιο είναι το επόμενο πρόβλημα.

Παγίδα 1: ένα πτώνον rate δεν είναι ένα αυξανόμενο success rate

Το intervention rate μετράει ακριβώς ένα πράγμα: πόσο από την εκτέλεση αποφασίσατε να κατέχετε. Εκείνη η απόφαση είναι δική σας, λαμβάνεται σε πραγματικό χρόνο, και μετακινείται. Στον κύκλο μηδέν παίρνετε τον έλεγχο στην πρώτη κακή γωνία προσέγγισης· μέχρι τον κύκλο τρία έχετε παρακολουθήσει την πολιτική να ανακάμπτει από ένα dozen από αυτά και την αφήνετε να δοκιμάσει. Το κατώφλι σας μετακινήθηκε· η policy ίσως να μην. Το rate πέφτει και τα δύο.

Η ανθρώπινη εμπιστοσύνη είναι τουλάχιστον μια modeled ποσότητα στη βιβλιογραφία και όχι μια υποτιθέμενη σταθερά. Το Sirius επαναζυγίζει δείγματα εκπαίδευσης με προσέγγιση ανθρώπινη εμπιστοσύνη και βελτιστοποιεί την πολιτική με weighted behavioral cloning, αναφέροντας ένα 8 τοις εκατό boost σε προσομοίωση και 27 τοις εκατό σε πραγματικό υλικό έναντι του state of the art σε policy success rate, σε διπλάσια convergence speed. Αυτό αντιμετωπίζει την εμπιστοσύνη ως βάρος στα δεδομένα. Δεν διορθώνει το κατώφλι στο κεφάλι σας μεταξύ κύκλου μηδέν και κύκλου τρία.

Δεν μπορείτε να αφαιρέσετε το drift, έτσι ζευγαρώστε το rate με κάτι που το κατώφλι σας δεν μπορεί να αγγίξει: ένα σταθερό σύνολο δοκιμών κατά τα οποία δεν παρεμβαίνετε καθόλου, σκοραρισμένα έναντι ενός κριτηρίου γραμμένου πριν τον κύκλο. Ένα rate που πέφτει ενώ το paired success rate παραμένει put είναι η υπογραφή του habituation - αξίζει κάτσιμο, επειδή από μέσα στο loop αισθάνεται σαν πρόοδος.

Intervention rateSuccess rate on fixed protocolMost likely reading
πέφτειαυξάνεταιΟ κύκλος δούλεψε. Συνεχίστε.
πέφτειflatΤο κατώφλι σας διολίσθησε ή οι διορθώσεις αφαίρεσαν προσπάθεια χωρίς να αφαιρέσουν αποτυχίες.
πέφτειπέφτειΟι διορθώσεις υποβαθμίζουν την πολιτική. Ελέγξτε το μίγμα και την εσωτερική συνέπειά τους.
flatflatΟ κύκλος δεν αγόρασε τίποτα. Αλλάξτε μίγμα, checkpoint ή εργασία πριν συλλέξετε περισσότερα.
αυξάνεταιπέφτειRegression. Υποψιάσθε training mix, ένα μετακινημένο κάμερα ή ένα checkpoint mix-up πριν υποψιάσθε τη μέθοδο.

Παγίδα 2: χωρίς ένα fixed protocol, μετράτε το δωμάτιο

Η real-robot evaluation είναι ακριβή και δύσκολη να επαναληφθεί. Οι συγγραφείς SIMPLER αιτιολογούν τη simulated evaluation με την παρατήρηση ότι η real-world evaluation τέτοιων πολιτικών δεν είναι κλιμακώσιμη και αντιμετωπίζει προκλήσεις reproducibility που είναι πιθανό να χειροτερευθούν καθώς οι πολιτικές διευρύνουν το φάσμα εργασιών τους. Το RoboArena το επιτίθεται από την άλλη πλευρά, με περισσότερες από 600 paired real-robot evaluation episodes σε εφτά generalist πολιτικές, τρέχοντας από evaluators σε εφτά ακαδημαϊκά ιδρύματα στη πλατφόρμα DROID. Οι evaluators του επιλέγουν τις δικές τους εργασίες και περιβάλλοντα αλλά πρέπει να κρίνουν ζευγάρια πολιτικών double-blind; το άρθρο αναφέρει ότι αυτή η crowd-sourced κατάταξη ακολουθεί την απόδοση generalist-policy με περισσότερη ακρίβεια από τη συμβατική, κεντρικοποιημένη αξιολόγηση.

Δεν θα τρέξετε 600 paired episodes σε ένα SO-100 σε ένα workshop. Αυτό που μπορείτε να κάνετε είναι να αφαιρέσετε τη διακύμανση που ελέγχετε - ένα κατάλογο αρκετά βαρετό ώστε συνήθως αγνοείται.

ΔιάστασηΠαγώστε αυτόΤι διολισθαίνει αν δεν το κάνετε
Start poseΜια γραμμένη home position, οδηγούμενη πριν από κάθε δοκιμήΗ τροχιά ξεκινά out of distribution
ΑντικείμεναTaped marks και τα ίδια φυσικά αντικείμενα κρατημένα για αξιολόγησηΜια 'καλύτερη' πολιτική είναι πραγματικά ένα κοντινότερο αντικείμενο
Κάμερες και φωςΟι ίδιες τοποθετήσεις, indices, exposure· κλειστές κατακόρυφες; φωτογραφήστε τη ρύθμισηΤα ανταλλαγμένα κάμερα indices μόνο μπορούν να κυριαρχήσουν το αποτέλεσμα
Δοκιμές και stop ruleΣταθερό n, σταθερό timeout, κριτήριο γραμμένο πριν τον κύκλοΚριτήρια post-hoc μετατρέπουν κοντινές απώλειες σε ό,τι χρειάζεστε
Operator behaviourΚανένα intervention κατά τις εργασίες αξιολόγησηςΗ αξιολόγηση γίνεται μια άλλη συνόδου διόρθωσης

Τότε η αριθμητική, ανελέητη στους αριθμούς δοκιμής ενός workshop. Κάτω από τη normal approximation, 60 τοις εκατό επιτυχία σε 20 δοκιμές φέρει ένα standard error κοντά στα 11 ποσοστιαία σημεία - η τετραγωνική ρίζα 0.6 φορές 0.4 πάνω από 20 - και η διαφορά μεταξύ δύο τέτοιων κύκλων φέρει περίπου 15. Ένα jump από 60 σε 70 τοις εκατό είναι επομένως συνεπές με τίποτα που δεν συνέβη. Πενήντα δοκιμές φέρουν το per-round σχήμα στο περίπου 7 σημεία και κοστολόγηση ένα απόγευμα.

Αυτή η ασυμμετρία είναι το επιχείρημα για το intervention rate: υπολογισμένο σε χιλιάδες frames αντί binary outcomes, κινείται νωρίτερα και πιο ομαλά. Ο προειδοποίηση είναι ότι frames μέσα σε ένα episode είναι σκληρά συσχετισμένα - μια κακή σύλληψη αποδόσεις εκατό συνεχόμενα intervention frames - έτσι το effective δείγμα μέγεθος είναι κοντινότερο στον αριθμό των takeovers. Μεταχειριστείτε το rate ως ο πρώιμος δείκτης και το success rate ως αργή ground truth.

Κρατήστε τα αξιολόγησης episodes έξω από το training pool

Τα αξιολόγησης episodes πρέπει ποτέ να μην μπουν στο composed training dataset - διαφορετικά ο κύκλος n+1 σκοράρεται σε δεδομένα που τρενάρησε και η καμπύλη μετράει memorisation.

Παγίδα 3: training μόνο σε corrections κάμπτει την πολιτική

Οι διορθώσεις είναι τα ενδιαφέρον δεδομένα, έτσι η본能είναι να εκπαιδεύσει με αυτά. Μην. Έρχονται από την κατασκευή από το ضيق slice του state space όπου η πολιτική ήδη αποτυγχάνει και λένε σχεδόν τίποτα για τη πλειονότητα της εκτέλεσης που δούλεψε. Fine-tune στη σφαίρα μόνο και παίρνετε μια πολιτική καλή ανάκαμψης από ένα botched approach που έχει ξεχάσει πώς να κάνει ένα καθαρό.

Οι Mandlekar και συνάδελφοι χτίσανε το remote intervention system τους γύρω από αυτό. Η framing τους: τα manipulation tasks περιέχουν bottleneck περιοχές που απαιτούν ένα ακολουθία precise δράσεων - η εισαγωγή ενός pod σε μια μηχανή καφέ είναι το παράδειγμα τους - όπου μικρές αποκλίσεις οδηγούν σε καταστάσεις τις επιδείξεις δεν δούλεψαν. Τα αλγόριθμα τους εκπαιδεύει iteratively στα νέα δεδομένα έτσι η πολιτική μαθαίνει να διατρέχει εκείνα τα bottlenecks και αναφέρουν ότι αγέντες που εκπαιδεύθηκαν σε intervention δεδομένα κερδίζουν αγέντες που εκπαιδεύθηκαν σε ένα ισοδύναμο δείγμα μη-interventional αναδείκτες.

Corrections-only fine-tuning έναντι ενός composed μίγματος
Τι corrections-only σας παίρνει
  • Γρήγορα: μια σύντομη εκτέλεση σε λίγα dozen episodes είναι φθηνή αρκετή να επανάληψη
  • Στοχευμένα: η κλίση κυριαρχείται από τις καταστάσεις που νοιάζεστε
  • Φθηνά για δοκιμή αν ένα correction στυλ είναι learnable καθόλου
Τι κοστολόγηση
  • Η fine-tune κατανομή δεν ομοιάζει πλέον με την κατανομή εργασίας
  • Η nominal συμπεριφορά μπορεί να υποβαθμιστεί ορατά μέσα σε έναν κύκλο
  • Το rate μπορεί να πέσει ενώ η επιτυχία πέφτει με αυτό - καθαρά segments traded για recoveries

Το μίγμα αναλογία είναι ένα hyperparameter και αξίζει να γραφτεί κάτω. Κατάρτιση του επόμενου dataset είναι όπου αποφασίζεται: original επιδείξεις συν το correction set, επιλογή episode explicit ανά πηγή αντί ένας κανόνας που σιωπηλά τραβά σε ό,τι είναι διαθέσιμο. Εκεί ότι είναι ένα compose βήμα στο cockpit και το αποτέλεσμα είναι ένα συνηθισμένο dataset - δείτε το training documentation. Τι όχι εργαλείο κάνει για εσάς είναι εγγραφή ποια αναλογία παράγει ποια καμπύλη.

Παγίδα 4: ο άνθρωπος δεν είναι ένας συνεπής εμπειρογνώμονας

Η θεωρία DAgger υποθέτει έναν εμπειρογνώμονα. Δεν είστε ένας στη τεχνική έννοια: οι διορθώσεις σας δεν είναι δείγματα από ένα σταθερό conditional κατανομή σε σχέση δράσεων. Οι συγγραφείς ACT ονοματίζουν αυτό όταν καταγράφουν τα εμπόδια fine manipulation - τα σφάλματα συντάσσουν με την πάροδο του χρόνου και ανθρώπινα επιδείξεων μπορούν να είναι non-stationary. Το σύστημα τους ακόμη φτάνει 80 έως 90 τοις εκατό επιτυχία σε έξι πραγματικές εργασίες από δέκα λεπτά επιδείξεων, έτσι το πρόβλημα είναι feasible, όχι απών.

Η robomimic μελέτη κάνει το σημείο από την πλευρά δεδομένων. Σε έξι offline αλγόριθμα σε πέντε simulated και τρία real-world multi-stage εργασίες, οι μαθήματα περιλαμβάνουν ευαισθησία σε σχεδιασμό επιλογές, εξάρτηση σε επίδειξη ποιότητα, και - εκείνη που τραυματίζει εδώ - variability προερχόμενη από κριτήρια σταματήσεως, επειδή εκπαίδευση και αξιολόγηση αντικείμενο διαφέρουν. Το checkpoint με τη χαμηλότερη απώλεια δεν είναι αξιόπιστα ο ένας με το υψηλότερο success rate.

Υπάρχει μια hardware έκδοση αυτού: το input mode διαμορφώνει τη διόρθωση. Ένα leader-follower ρύθμιση παράγει συνεχή, human-paced τροχιές. Πληκτρολόγημα nudges είναι στριμωγμένο σκληρά από το server - δύο μοίρες ανά κλήση σε τα arm joints, τέσσερις στη αρπάγη - έτσι η ίδια πρόθεση αφίχνευται ως σκάλα μικρά βήματα. Sliders στείλετε απόλυτα targets και το server κινείται στις περισσότερες έξι μοίρες προς τα αυτά ανά κλήση. Τρία modes, τρία δράσης κατανομές; μίξη όλα τρία σε ένα correction σύνολο και τότε αναρωτιέται γιατί η προσέγγιση έγινε twitchy είναι αυτο-επιβαλλόμενο. Το teleoperation documentation καλύπτει τι κάθε mode στέλνει.

Ζύγιση των παρεμβάσεων: IWR και τι ήρθε αργότερα

Αν διορθώσεις είναι η πολύτιμη μειονότητα, το principled fix είναι βάρος αντί αποκλειστικότητα. Intervention Weighted Regression είναι η αναφορά εφαρμογή: τα δεδομένα εμερικεύονται σε intervention και non-intervention δείγματα και το δύο χωρίστε δείγματα σε ίση αναλογία κατά την εκπαίδευση. Ένα correction σύνολο που είναι πέντε τοις εκατό στα frames τότε συνεισφέρει μισό την κλίση, χωρίς η nominal συμπεριφορά εξαφανίζεται από τη κατανομή.

Ίση αναλογία είναι ένα σημείο αρχής, όχι νόμος. Sirius generalises το ένα αντικατάσταση δυαδικό χωρίστε με ένα συνεχής βάρος από προσέγγιση ανθρώπινη εμπιστοσύνη; Sirius-Fleet κινείται την απόφαση upstream, χρησιμοποιώντας ένα οπτικό κόσμο μοντέλο και ανωμαλίας predictors να αποφασίσει όταν ένας άνθρωπος είναι ζητηθεί καθόλου. Το κοινό thread: η intervention σημαία είναι ένα training σήμα, όχι μόνο ένα σημειωματάριο στήλη.

ΜέθοδοςΠοιος αποφασίζει όταν ο άνθρωπος δραΠώς το intervention δεδομένα χρησιμοποιείταιΑναφερόμενη αποτέλεσμα
DAgger (2011)Σταθερό schedule; expert ετικέτες επισκέπτεται καταστάσειςΈνα growing dataset, unweightedFramed ως μια μείωση να no-regret online learning
HG-DAgger (2019)Ο άνθρωπος, gating έλεγχος σε ένα πραγματικό σύστημαAggregated; συν ένα μαθημένο κατώφλι ασφάλειας σε model uncertaintyΚαλύτερα από DAgger και BC σε οδήγηση; αριθμούς παρέμβασης δεν δίνονται
IWR (2020)Ο άνθρωπος, via remote teleoperationIntervention και non-intervention δείγματα τραβήχτηκαν σε ίση αναλογίαΚερδίζει μη-interventional demos στο ισοδύναμο δείγμα count
Sirius (2022)Ο άνθρωπος, κατά την ανάπτυξηΣταθμισμένα BC, βάρη από προσέγγιση ανθρώπινη εμπιστοσύνη8 % κέρδος σε προσομοίωση, 27 % σε πραγματικό υλικό; 2x γρηγορότερη convergence
ThriftyDAgger (2021)Το σύστημα, gating σε novelty και κίνδυνοςΔιαδραστική συλλογή κάτω από ένα εποπτεία προϋπολογισμόUser μελέτη (N=10): 58 % υψηλότερα ανθρώπινα και 80 % υψηλότερα robot απόδοση από το επόμενο καλύτερο μέθοδο
Fleet-DAgger (2022)Το σύστημα, αποδίδοντας προσοχή σε ένα fleetFleet μάθηση σκοράρεται από Return on Human EffortΜέχρι 8.8x υψηλότερα ROHE από baselines
Sirius-Fleet (2024)Ανωμαλίες predictors με self-adapting κριτήριαMulti-task μάθηση με ένα οπτικό κόσμο μοντέλοΛιγότερες intervention αιτήματα ως αυτονομία βελτιώνεται
Leaderboard άποψη σύγκρισης ρομπότ πολιτικές από μετρηθείσα βαθμολογία
Κατάταξη πολιτικές έναντι ο ένας άλλο σημαίνει κάτι μόνο όταν κάθε εγγραφή τρέχει το ίδιο πρωτόκολλο. Που ισχύει σε σας δικός τρεις κύκλοι πολύ.

Τέσσερις μετρικές αξίζει καταγραφή δίπλα στο rate

  • Takeovers ανά εκτέλεση. Είκοσι σύντομη διορθώσεων και ένα μακρύ δίνουν παρόμοια rates και περιγράφουν διαφορετικές πολιτικές - ένα jittery, ένα με ένα μόνο blind spot.
  • Μέσα intervention μήκος. Αυξανόμενα μήκος με ένα πέφτον μέτρημα σημαίνει τα υπόλοιπα αποτυχίες είναι οι δύσκολο, ποιο είναι τι τελική πρόοδος μοιάζει.
  • Χρόνος πρώτα παρέμβαση. Ένας πολιτική που παίρνει περισσότερα πριν νέα βοήθεια είναι βελτίωση ακόμη όταν το ολικό rate είναι flat.
  • Όπου παρεμβάσεις cluster. Bin ο σημαία από κανονικοποίηση episode πρόοδο; ένα σταθερό κορυφή σε κύκλοι σημεία σε ένα bottleneck.

Ένα κύκλο πρωτόκολλο που μπορείτε καθορίζουν εκτέλεση

Ένα μετρηθέν κύκλο έχει έξι βήματα και παράγει μια σειρά στο log. Ο πρώτος τέσσερις είναι το loop; το τελευταίο δύο κάνουν αυτό ένα μέτρηση.

  1. 1
    Παγώστε το αξιολόγηση πρωτόκολλο πριν κύκλο μηδέν

    Γράψτε down σημείο έναρξης, placement αντικειμένων, κάμερες, μέτρημα δοκιμής, timeout και επιτυχία κριτήριο. Φωτογραφήστε το τραπέζι. Αν το έγγραφο έχει να αλλάξει, η σειρά ξαναρχίνει.

  2. 2
    Μέτρηση baseline

    Εκτέλεση το πρωτόκολλο με αριθμό παρεμβάσεις και εγγραφή το successes; τότε τρέχει ένα όργανο συνόδου με takeover ενεργοποιηθεί και εγγραφή το rate. Εκείνα δύο αριθμοί είναι κύκλο μηδέν.

  3. 3
    Συλλέγουν διορθώσεων σε ένα συνεπή στυλ

    Ένα input mode ανά κύκλο, ένα χειριστής αν μπορείτε διαχειριστείτε. Πάρτε over σε ένα κριτήριο μπορείτε κατάσταση out loud - 'αρπάγη περισσότερο από δύο εκατοστά off σε προσέγγιση' - και κρατήστε για το κύκλο.

  4. 4
    Triage κάθε επεισόδιο ο ίδιο ημέρα

    Διόρθωση, αξιολόγηση ή απόρριψη. Διφορούμενα επεισόδια παίρνουν απορρίφθηκε, όχι αποθηκευμένα σε ο θεωρία ότι περισσότερα δεδομένα βοηθά - ένα διόρθωση σε ποιες εσείς χαμηλά είναι χειρότερα από αριθμό επεισόδιο.

  5. 5
    Σύνθεση το μίγμα ρητά

    Original επιδείξεις συν διορθώσεις, επιλογή επεισόδιο ανά πηγή. Εγγραφή base μέτρημα, διόρθωση μέτρημα και κάθε ζύγιση - αυτό είναι το πεδίο θα θέλει σε τρεις εβδομάδες.

  6. 6
    Συνεχίστε από το checkpoint, τότε ανα-μέτρηση

    Τρένο το composed dataset από το προηγούμενη checkpoint όχι ο base μοντέλο, τρέξιμο του κρύσταλλο πρωτόκολλο συν ένα όργανο συνόδου, προσθήκη ο σειρά, και σύγκριση έναντι του προηγούμενα δύο κύκλοι.

Δύο όρια αλλαγή πώς διαβάσατε ένα αδύναμο κύκλο. Συνεχίζεται από ένα checkpoint initialises το βάρη από αυτό - όχι ένα optimizer resume, έτσι το schedule ξεκινά φρέσκο και ένα σύντομο τρέχει από ένα συγκλίνων checkpoint μπορεί να κινηθεί πολύ λίγα. Και ο ηγέτης-ευθυγράμμιση κίνηση σε το ξεκίνημα ενός takeover έχει το λιγότερο mileage σε πραγματικό υλικό κάθε σε το chain; αν διορθώσεις όλα ξεκινά με ένα περίεργο transient, βρούμε εκεί πριν ένας κατηγορία το μίγμα.

Το μετρηθέν loop, ήδη σύρματα

ay-robots εφαρμόζει αυτά τα έξι βήματα ως χαρακτηριστικά προϊόντος: πάρτε over mid-run από ένας ηγέτης βραχίονα, πληκτρολόγημα ή sliders, με intervention frames σημαία αυτόματα; triage κάθε επεισόδιο ως διόρθωση, αξιολόγηση ή απόρριψη; σύνθεση ο επόμενο dataset από ο original επιδείξεις συν το διορθώσεις, επιλογή επεισόδιο ρητά ανά πηγή; και ξεκινά το επόμενο εκπαίδευση εκτέλεση από το προηγούμενο checkpoint αντί ο base μοντέλο.

Δείτε πώς το DAgger loop δουλεύει

Τι τα αριθμοί δεν μπορεί να πείτε

Κανένα αυτό επιλύθηκε, και ένα τακτοποιημένο καμπύλη δεν πρέπει να πείσει εσείς διαφορετικά. Το intervention rate μετράει ένα joint σύστημα - πολιτική, υλικό, χειριστής, δωμάτιο - και χαρακτηρίζει τίποτα από μόνο του. Δεν μπορεί κρίνουν αν διορθώσεις ήταν καλά, και αυτό θα πέσει ευτυχώς σε ένα εργασία που έγινε ευκολότερη επειδή το αντικείμενο παρασύρθη δύο εκατοστά κοντάρει σε τρεις εβδομάδες.

Τι αυτό κάνει είναι γύρω ένα αόριστο εντύπωση σε μια στήλη μπορείτε επιχείρημα με. Η εναλλακτική δεν είναι ένα καλύτερα μετρικά; είναι τρεις εβδομάδες συλλογή διορθώσεων ο καμπύλη θα έχει είπε εσείς, μετά κύκλο τρία, στο στάση συλλογή. Η έρευνα βιβλιογραφία καθορίζει διαδραστική imitation μάθηση ως ανθρώπινα σχόλια δωμάτια περιστασιακός κατά ρομπότ εκτέλεση, έχοντας ένα online βελτίωση της συμπεριφορών· ο οικογένεια είναι ευρύ, και κανένα ρύθμιση αυτό δουλεύει χωρίς ένα αριθμό ανά κύκλο. Δείτε επίσης την SO-100 imitation μάθηση οδηγό για το base δεδομένα μίγμα έναντι, τρέχοντας μια πολιτική για ο ανάρτηση πλευρά, και τη DAgger loop σελίδα για ο εφαρμογή pipeline.

Είναι το intervention rate μόνο ένα μείον το success rate;

Αρ. Το rate μετράει πόσο από ένα τρέχοντας παίρνετε over; το success rate μετράει αν ο εργασία άσκηση χωρίς εσείς. Ένα εκτέλεση μπορεί να επιτύχουν με ένα 30 τοις εκατό intervention rate, και ένα τρέχοντας με αριθμό παρεμβάσεις μπορεί αποτύχει εξ ολοκλήρου. Αυτές διαφέρουν επίσης σε θόρυβο: το rate κινείται ομαλά πάνω χιλιάδες συσχετισμένα frames, το success rate άλματα μεταξύ λίγων δυαδικό αποτελέσματα. Σύνδεση και τα δύο.

Πόσα αξιολόγηση δοκιμές κάνω χρειάζονται για το success rate να σημαίνει κάτι;

Περισσότερο από αισθάνεται λογικό. Κάτω από το κανονικό προσέγγιση, 20 δοκιμές σε ένα αληθινό 60 τοις εκατό success rate φέρουν ένα τυπικό σφάλμα κοντά στα 11 ποσοστιαία σημεία, έτσι ένα 10-point κίνηση μεταξύ κύκλοι είναι αδιάκριτα από θόρυβο; 50 δοκιμές φέρουν ότι σχήμα σε περίπου 7. Αν δεν μπορείτε να αξιοποιήσει 50, κρατήστε το δοκιμή μέτρημα ίδιο σε κύκλοι και μεταχείριση μικρό κινήσεις ως inconclusive.

Τι μίγμα αναλογία από επιδείξεις να διορθώσεις πρέπει ξεκινώ με;

Ο τεκμηριωμένο σημείο έναρξης είναι IWR'του: χωρίστε ο δεδομένα σε intervention και non-intervention δείγματα και τραβήξιμο αυτά σε ίση αναλογία, έτσι ο διορθώσεις συμβάλλουν μισό ο κλίση όπως μικρό ένα κλάσμα του frames αυτά είναι. Αν σας ρύθμιση δεν μπορεί ζύγιση δείγμα, κατά προσέγγιση το μέσω επεισόδιο αριθμούς όταν σύνθεση το dataset και εγγραφή το αναλογία. Εκπαίδευση σε διορθώσεις μόνο είναι το επιλογή να κανόνα έξω.

Ο παρέμβαση rate πήγε up μετά ένας κύκλο. Είναι το κύκλο σπατάλη;

Όχι ανάγκη, αλλά ελέγχος το βαρετό εξηγήσεις πρώτα: κάνω ο checkpoint που ήδη χαμηλά ταίριασμα το ένας μάθανε, κάνω ένα κάμερα δείκτη ή τοποθέτηση αλλαγή, κάνω αντικείμενο τοποθέσία drift, ήταν ο διόρθωση στυλ συνεπής. Αν όλα τέσσερις είναι καθαρά και το paired success rate επίσης έπεσε, ύποπτη το μίγμα - πολύ λίγα base επιδείξεις έναντι ο διορθώσεις ή διορθώσεις που έρχονται σε αντίθεση ο άλλα. Ένα γνήσιο regression ανήκει σε ο log, όχι ο bin.

Μπορώ παραλείπω ο κρύσταλλο αξιολόγηση πρωτόκολλο και μόνο παρακολούθηση ο intervention rate;

Μόνο αν δεχθείτε που δεν μπορείτε πείτε βελτίωση από habituation. Το rate εξαρτάται σε σας δικός πραγματικό χρόνο κατώφλι για stepping σε, και ότι κατώφλι πέφτει ως παίρνετε χρησιμοποιηθεί να ο πολιτική'ς quirks. Το κρύσταλλο πρωτόκολλο είναι ο μέρος ο μέτρηση σας κατώφλι δεν μπορεί προσέγγιση - taped σημάδια, ένα γραμμένη home pose, ένα σταθερό δοκιμή μέτρημα, ένα κριτήριο αποφασίστηκε πριν ο κύκλο. Αυτό έχει στάση αμετάβλητη σε ο σειρά.

Κρατήστε ο log σε ο αποθετήριο, όχι σε ένα σημειωματάριο: κύκλοι είναι ημέρες χώρια, υλικό παίρνει ξαναχτισμένο, και ο πρόσωπο ανάγνωση ο καμπύλη σε Οκτώβριος είναι εσείς με αριθμό μνήμη του Αύγουστο. Ο documentation FAQ καλύπτει ο λειτουργικό λεπτομέρεις αριστερά έξω εδώ.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started