Саясатты қайта-қайта жүргізу үшін тұрақты бағалау ортасы ретінде пайдаланылатын үстел үстіндегі робот жұмыс кеңістігі
DAggerБағалауЕліктеп оқытуРобот деректеріSO-100

DAgger циклін өлшеу: араласу жиілігі, бағалау хаттамасы және олардың аралығындағы тұзақтар

AY-Robots ResearchAugust 27, 202615 минуттық оқылым

Араласу жиілігі — араласу кадрларының жүгіріс кадрларына қатынасы — адам бақылайтын DAgger циклінің қолда бар ең арзан әрі шынайы прогресс сигналы. Бұл мақала оны екі адам бірдей мәнді есептейтіндей етіп анықтайды, оны қалай тіркеу керектігін көрсетеді және сізді адастыратын төрт жайтты талдайды: оператордың дағдылануы, бағалау ортасының ауытқуы, тек түзетулерде ғана оқыту және дүйсенбіге қарағанда сейсенбіде басқаша түзететін адам.

DAgger раунды өтіп жатқан кезде өнімді болып көрінеді. Сіз саясатты басқарасыз, ол қармауда сасқанда басқаруды қолға аласыз, түзетулерді сақтайсыз, қайта оқытасыз, және келесі жүгіріс — сіз ант етерліктей — сәл тегісірек көрінеді. Екі раундтан кейін сіз ештеңенің өзгергенін айта алмайсыз, өйткені «сәл тегісірек» сан емес.

Циклге раунд сайын бір сан керек, ал адам бақылайтын циклде бұл сан дерлік тегін: сіз саясаттың орнына басқаруда болған жүгірістің үлесі. Бұл мақала оны екі адам бірдей мәнді есептейтіндей етіп анықтайды, тіркейді, алынған қисықты оқиды және ол жалғыз тұрғанда сізді адастыратын төрт жолды атайды. Бұл мақала болжайтын теория үшін қараңыз: DAgger түсіндірмесі және адам бақылайтын нұсқа; практикалық сәйкестігі — SO-100-де DAgger циклін жүргізу.

Қысқаша нұсқасы

  • Араласу жиілігі = араласу кадрлары / жүгіріс кадрлары. Кадрлар, эпизодтар емес, әрі бөлгіш сіз түзетуге жұмсаған кадрларды да қамтиды.
  • Үш раунд бойы тегіс қисық раундтардың пайдасыз екенін білдіреді — төртіншісін жинаудың орнына қоспаны, чекпоинтті немесе тапсырманы өзгертіңіз.
  • Түсіп бара жатқан араласу жиілігі — жоғарылап бара жатқан сәттілік жиілігі емес. Сенім артқан сайын араласуға кірісу шегіңіз төмендей береді.
  • Тұрақтандырылған бағалау хаттамасы болмаса — бірдей бастапқы позалар, заттар, камералар, сынақ саны — сіз бөлмені өлшеп отырсыз.
  • Тек түзетулерде оқыту күй үлестірімін бұрмалайды. IWR-дың жауабы: араласу және араласусыз үлгілерді тең үлесте алу.

Раундқа неге жалпы сан керек

DAgger үлестірім мәселесі салдарынан бар, ал үлестірім мәселелері көзге көрінбейді. Ross пен Bagnell еліктеп оқытудың бекітілген демонстрация жиынында қолданылуы жинақталатын қателерге және уақыт горизонтында квадраттық түрде өсетін өкініш шегіне әкелетінін көрсетті: үйренуші демонстратор болған күйлерден шыққан сәтте, деректерде оның қалай қайтуы керектігін айтатын ештеңе жоқ. DAgger мұны итерациялау арқылы түзетеді — саясатты жүргізу, ол баратын күйлерді белгілеу, жинақтау, қайта оқыту — мұны Ross, Gordon және Bagnell өкінішсіз онлайн оқытуға дейінгі редукция ретінде тұжырымдайды.

Бұл тұжырымдаманың адамдар назардан тыс қалдыратын салдары бар. Кепілдік итерациялар бойындағы саясаттар тізбегіне қатысты, жеке бір жүгіріске емес. Ол сіздің үшінші раундыңыздың пайда әкелген-әкелмегені туралы ештеңе айтпайды. Мұны білудің жалғыз жолы — әр итерацияны өлшеу. Kelly және әріптестері HG-DAgger-ді енгізді, себебі классикалық DAgger жаңадан үйренуші әлі басқаруда тұрғанда сарапшыдан әрекет белгілерін сұрайды, ал мақала бұл қауіпсіздікті төмендетуі мүмкін және адам сарапшылармен, актуатор кідірісін сезіну арқылы белгі сапасын нашарлатуы ықтимал деп дәлелдейді. HG-DAgger сонымен қатар модель белгісіздігіне негізделген тәуекел метрикасы үшін қауіпсіздік шегін үйренеді және жүргізу тапсырмасында DAgger пен мінез-құлықты клондаудан жақсы нәтиже көрсетеді деп хабарлайды. Ол ешбір араласу санын жарияламайды; оларды сіз өзіңіз шығарасыз.

Жиілікті екі адам бірдей санды алатындай анықтау

Анықтама бір жол: араласу кадрларының жүгіріс кадрларына қатынасы. Барлық қиындық не кадр саналады және не жүгіріс саналады дегенге тығылған.

Кадрлар, эпизодтар емес

Кем дегенде бір араласуы бар эпизодтарды санау пайдасыз: әрқайсысында бір түрткісі бар он эпизод пен сіз сексен пайызын басқарған он эпизод екеуі де «10/10» береді. Кадр саны оларды ажыратады, әрі бұл жазбада бұрыннан бар түйіршіктілік — LeRobot деректер жиыны форматында әр уақыт қадамы жол болып табылады, сондықтан араласу жалауы күй мен әрекеттің қасындағы бір логикалық баған. Мұнда ол басқаруды қолға алу басталған сәтте кадр сайын жазылады және басқару қайтарылғанда өшіріледі.

Бөлгіш түзетулерді де қамтиды

Екі бөлгіш те қорғауға тұрарлық — жүгірістің жалпы кадрлары немесе саясат автономды түрде басқарған кадрлар — және олар жоғары араласу деңгейлерінде қатты алшақтайды. 1000 кадрдың 400-ін қолға алсаңыз, біріншісі 40 пайыз береді, екіншісі — 67 пайыз. Бір раундты бірінші тәсілмен, келесісін екіншісімен өлшеп салыстыру нақты жақсарудың жоғалу тәсілі. Жалпы кадрларды алыңыз және таңдауды серия ортасында қайта қарамаңыз.

Тапсыру кадрларына не болатынын бір рет шешіңіз

Әрдайым бір жік болады. Басқару өткен кезде кейбір кадрлар ешбір жаққа тиесілі емес: қол ұсталып тұр, лидер туралайды, жазба тоқтап тұр. Бұл құбырда сол тапсыру кадрлары шикі ағында қалады және іріктелген эпизодқа ешқашан кірмейді — олар саясат мінез-құлығы да, оқытуға тұрарлық түзету де емес. Жікті әр раундта бірдей санаңыз: 30 Гц жиілікте, әрқайсысы екі секундтық жігі бар алты рет қолға алу — 360 кадр, бұл пайыздық тармақты жылжытуға жеткілікті.

Салыстырмалылықты бұзатын үш шешім

Кадрлар ме әлде эпизодтар ма; жалпы жүгіріс пе әлде тек автономды бөлік пе; тапсыру кадрлары кіре ме әлде шыға ма. Осы үшеуінің кез келгені раундтар арасында үнсіз өзгертілсе, қисық мағынасыз болады. Үшеуін де жазып қойыңыз.

Санды сессиядан кейін де сақтап қалатындай тіркеу

Жұмыс істеп тұрған үдерістің күй тақтасындағы метрика — жай ғана көрсеткіш: ол қайта іске қосылғанда жоғалады және оны графикке салуға болмайды. Раунд сайын тек қосу үшін жазылатын бір жол бүкіл серияны қамтиды — соның ішінде қай чекпоинтті жүргізгеніңіз де, себебі бұл әр раундта өзгереді және оларды шатастыру келесісін жарамсыз етеді.

json
{"round": 2, "run_id": "inf-2026-08-24-1108", "checkpoint": "ckpt-8500",
 "frames": 5412, "intervention_frames": 611, "rate": 0.113,
 "takeovers": 7, "input": "keyboard", "denominator": "total_run_frames",
 "handover_frames": "excluded", "episodes_kept_as_correction": 5,
 "train_mix": {"base_demos": 120, "corrections": 41},
 "eval_protocol": "protocol-A", "eval_trials": 20, "eval_successes": 11}
Жүгіріс сайын бір жол. Бөлгіш пен тапсыру конвенциясын санның қасында жазып қою өріс атауларынан гөрі маңыздырақ.

Салмақты екі өріс көтереді. train_mix — сіз келесі оқыту тапсырмасына не бергеніңіз; онсыз ештеңені ешкімге телуге болмайды. eval_protocol — сіз одан кейін жүргізген тұрақты сынақтың атауы, әрі бұл ең жиі бос қалдырылатын өріс. ay-robots кокпитінде қолға алу мәртебесі жұмыс істеп тұрған сессия үшін араласу кадрларының санын хабарлайды, сондықтан тіркеу — аспаптау емес, көшіру. деректер жиыны құжаттамасы кадр бойынша бағандардың қайда түсетінін қамтиды.

Саясаттарды, деректер жиындарын және чекпоинттерді қатар көрсететін оқыту конфигурациясы матрицасы
Әр раунд чекпоинт пен деректер жиыны қоспасын өзгертеді. Қандай комбинациямен алынғаны жазылмаған санды ешкімге телуге болмайды.

Қисықты оқу: үш раунд, бір қорытынды

Оқу үшін минимум үш раунд қажет, себебі екі нүкте әрқашан бір түзу сызық болады. Төмендегі кесте — есеп жүргізу үлгісі, орынбасар сандары бар, ешбір нақты жүгірістен алынған өлшемдер емес. Сіз тұрақты сынақтағы сәттіліктің өсуімен қатар жүретін монотонды төмендеуді іздеп отырсыз.

РаундЖүргізілген чекпоинтКадрларАраласу кадрларыЖиілікСәттіліктер (20-дан)
0 (базалық)базалық саясат5 9001 38023.4 %7
10-раунд қоспасынан5 61098017.5 %10
21-раунд қоспасынан5 41261111.3 %11
32-раунд қоспасынан5 38059811.1 %12

Бірінші және екінші раунд нәтиже беріп жатыр. Үшінші раунд бермейді: 11.3 бен 11.1 пайыз арасындағы айырма физикалық қолда өлшенген кез келген шаманың жүгірістен жүгіріске дейінгі ауытқуы шегінде жатыр, ал бірдей түзетулердің төртінші раунды бір түсті бекерге жұмсайды. Тегіс сегмент құрылымдық бір нәрсені өзгертуді талап етеді дейді.

  • Қалған сәтсіздіктер телеоперациямен түзетілмейді — зат қолжетімсіз, қармауыш геометриясы, буын өз шегінде тұр. Ешбір түзету деректері кинематикалық қабырғаны жөндемейді.
  • Түзетулер градиентті жылжыту үшін базалық деректер жиынына қарағанда тым аз, әрі оларды ешнәрсе салмақтамайды.
  • Түзетулер бір-біріне қайшы келеді, сондықтан саясат екі стратегияны орташалап, олардың арасында қалады.
  • Сәтсіздіктің көзі жоғарырақта: камера жылжыды, жарықтандыру өзгерді, білезік көрінісі оқытудағыдай емес.
  • Тапсырма осы жабдықтағы осы саясат класының шегіне жетті, келесі қадам — көбірек базалық деректер.

Соңғы екеуі циклдің сәтсіздігі емес. Sirius-Fleet-те адамға деген қажеттіліктің азаюы — жобаланған нәтиже: робот автономиясы жақсарған сайын, оның ауытқу болжаушылары болжау критерийлерін бейімдейді, бұл адамнан сұралатын араласу сұраныстарының азаюына және уақыт өте адам жүктемесінің біртіндеп төмендеуіне әкеледі. Онда критерий әдейі бейімделеді. Қолмен басқарылатын циклде сіздікі де бейімделеді, бірақ үнсіз — сондықтан тапсырма өз шегіне жеткендіктен тегістелген жиілік оператордың байқауды тоқтатқандықтан тегістелген жиіліктен дәл солай көрінеді. Бұл келесі мәселе.

1-тұзақ: түсіп бара жатқан жиілік — өсіп бара жатқан сәттілік жиілігі емес

Араласу жиілігі нақты бір нәрсені өлшейді: жүгірістің қанша бөлігін сіз меншіктеуге шештіңіз. Бұл шешім — сіздікі, нақты уақытта қабылданады, әрі ол жылжиды. Нөлінші раундта сіз алғашқы жаман жақындау бұрышында басқаруды қолға аласыз; үшінші раундқа қарай сіз саясаттың оннан астам мұндай жағдайдан қалпына келгенін көрдіңіз де, оған көрсетуге мүмкіндік бересіз. Сіздің шегіңіз жылжыды; саясат жылжымаған болуы мүмкін. Жиілік екі жағдайда да төмендейді.

Адам сенімі әдебиетте болжамды тұрақты емес, кемінде модельденетін шама. Sirius жуықталған адам сеніміне сүйене отырып, оқыту үлгілерін қайта салмақтайды және саясатты салмақталған мінез-құлықты клондаумен оңтайландырады, симуляцияда 8 пайыздық, ал нақты жабдықта саясат сәттілік жиілігі бойынша заманауи деңгейден 27 пайыздық артықшылықты, әрі жинақталу жылдамдығының екі есе жоғарылауын хабарлайды. Бұл сенімді деректерге салынатын салмақ ретінде қарастырады. Ол нөлінші раунд пен үшінші раунд арасында сіздің басыңыздағы шекті түзетпейді.

Ығысуды жоя алмайсыз, сондықтан жиілікті шегіңіз тие алмайтын нәрсемен жұптаңыз: сіз мүлдем араласпайтын, раундтан бұрын жазылған критерий бойынша бағаланатын тұрақты сынақтар жиынтығы. Жұптасқан сәттілік жиілігі орнында тұрғанда араласу жиілігінің төмендеуі — дағдылану белгісі; мұны байқау маңызды, себебі цикл ішінен қарағанда бұл прогресс сияқты сезіледі.

Араласу жиілігіТұрақты хаттама бойынша сәттілік жиілігіЕң ықтимал түсіндірме
төмендейдіөседіРаунд нәтиже берді. Жалғастырыңыз.
төмендейдітұрақтыСіздің шегіңіз жылжыды, немесе түзетулер сәтсіздіктерді емес, күш-жігерді ғана алып тастады.
төмендейдітөмендейдіТүзетулер саясатты нашарлатып жатыр. Қоспа мен олардың ішкі үйлесімділігін тексеріңіз.
тұрақтытұрақтыРаунд ешнәрсе бермеді. Көбірек жинамас бұрын қоспаны, чекпоинтті немесе тапсырманы өзгертіңіз.
өседітөмендейдіКему. Әдісті күдіктенер алдында оқыту қоспасын, өзгерген камераны немесе чекпоинт шатасуын күдіктеніңіз.

2-тұзақ: тұрақты хаттамасыз сіз бөлмені өлшейсіз

Нақты робот бойынша бағалау қымбат әрі қайталауы қиын. SIMPLER авторлары симуляцияланған бағалауды мынадай байқаумен негіздейді: мұндай саясаттарды нақты әлемде бағалау масштабталмайды және саясаттар тапсырма спектрін кеңейткен сайын нашарлауы ықтимал қайталанушылық қиындықтарына тап болады. RoboArena мұны басқа жақтан шабуылдайды: жеті академиялық мекеменің бағалаушылары DROID платформасында жеті жалпы мақсатты саясат бойынша 600-ден астам жұпты нақты робот бағалау эпизодын жүргізген. Оның бағалаушылары өз тапсырмалары мен орталарын өздері таңдайды, бірақ саясат жұптарын қос-соқыр әдіспен бағалауы керек; мақала бұл көпшілік көзінен алынған рейтингтің жалпы мақсатты саясат өнімділігін дәстүрлі, орталықтандырылған бағалауға қарағанда дәлірек бақылайтынын хабарлайды.

Сіз бір SO-100 шеберханада 600 жұпты эпизод жүргізбейсіз. Сіз жасай алатыны — өзіңіз бақылайтын дисперсияны жою; бұл әдетте елеусіз қалдырылатындай жалықтырарлық тізім.

ӨлшемМұны бекітіңізБекітпесеңіз не ауытқиды
Бастапқы позаӘр сынақтан бұрын жүргізілетін, жазбаша тіркелген үй позициясыТраектория үлестірімнен тыс жерден басталады
ЗаттарСкотчпен белгіленген орындар және бағалау үшін бөлек сақталған дәл сол физикалық заттар«Жақсырақ» саясат шын мәнінде жақынырақ жатқан зат қана
Камералар мен жарықБірдей бекітпелер, индекстер, экспозиция; перделер жабық; орнатуды суретке түсіріңізТек камера индекстерінің ауысуы нәтижеге басым түрде әсер етуі мүмкін
Сынақтар және тоқтату ережесіБекітілген n, бекітілген тайм-аут, раундтан бұрын жазылған критерийКейінгі критерийлер шектес сәтсіздіктерді керегіңізге айналдырады
Оператор мінез-құлқыБағалау сынақтары кезінде араласу жоқБағалау тағы бір түзету сессиясына айналады

Одан кейін арифметика келеді, ол шеберхана көтере алатын сынақ санында кешірімсіз. Қалыпты жуықтауда, 20 сынақтан алынған 60 пайыздық сәттілік шамамен 11 пайыздық тармақтық стандартты қатеге ие болады — бұл 0.6-ны 0.4-ке көбейтіп 20-ға бөлудің квадрат түбірі — ал осындай екі раунд арасындағы айырма шамамен 15-ті құрайды. Сондықтан 60-тан 70 пайызға секіру ештеңенің болмағанымен де сәйкес келеді. Елу сынақ раунд басына шаққандағы көрсеткішті шамамен 7 тармаққа дейін түсіреді және бір түске тұрады.

Бұл асимметрия — араласу жиілігінің пайдасына дәлел: жиырма екілік нәтиженің орнына мыңдаған кадр бойынша есептелгендіктен, ол ертерек және тегісірек жылжиды. Ескерту мынада: бір эпизод ішіндегі кадрлар қатты корреляцияланған — бір сәтсіз қармау жүзге жуық қатарынан келетін араласу кадрын береді — сондықтан тиімді үлгі көлемі қолға алу санына жақынырақ. Жиілікті ерте индикатор, ал сәттілік жиілігін баяу негізгі шындық ретінде қарастырыңыз.

Бағалау эпизодтарын оқыту жиынынан тыс ұстаңыз

Бағалау эпизодтары құрастырылған оқыту деректер жиынына ешқашан кірмеуі керек — әйтпесе n+1 раунд өзі оқытылған деректер бойынша бағаланады, ал қисық жаттап алуды өлшейді.

3-тұзақ: тек түзетулерде оқыту саясатты бұрмалайды

Түзетулер — қызықты дерек, сондықтан оларда оқыту инстинктивті түрде тартымды көрінеді. Олай істемеңіз. Олар өз табиғаты бойынша саясат бұрыннан сәтсіз болған күй кеңістігінің тар тілімінен келеді және жұмыс істеген жүгірістің көп бөлігі туралы дерлік ештеңе айтпайды. Тек сол тілімде дәл баптасаңыз, сіз бүлінген жақындаудан қалпына келуге шебер, бірақ таза жақындау жасауды ұмытып қалған саясатты аласыз.

Mandlekar және әріптестері қашықтан араласу жүйесін дәл осының айналасында құрды. Олардың тұжырымдамасы: манипуляция тапсырмаларында дәл әрекеттер тізбегін қажет ететін тар өткел аймақтары бар — кофе машинасына капсула салу олардың мысалы — мұнда шағын ауытқулар демонстрациялар ешқашан қамтымаған күйлерге әкеледі. Олардың алгоритмі саясат осы тар өткелдерден өтуді үйренуі үшін жаңа деректерде итеративті түрде оқытады, әрі олар араласу деректерінде оқытылған агенттер араласусыз демонстраторлардан алынған тең үлгі санында оқытылған агенттерден асып түседі деп хабарлайды.

Тек түзетулерде дәл баптау мен құрастырылған қоспаны салыстыру
Тек түзетулер сізге не береді
  • Жылдам: бірнеше ондаған эпизод бойынша қысқа жүгіріс қайталауға жеткілікті арзан
  • Мақсатты: градиентте сізге қажет күйлер басым
  • Түзету стилінің жалпы алғанда үйренуге келетінін тексеру үшін арзан
Оның бағасы қандай
  • Дәл баптау үлестірімі тапсырма үлестіріміне енді ұқсамайды
  • Қалыпты мінез-құлық бір раунд ішінде-ақ көзге көрінерліктей нашарлауы мүмкін
  • Жиілік сәттілікпен бірге төмендеуі мүмкін — таза сегменттер қалпына келтірулерге айырбасталады

Қоспа коэффициенті — гиперпараметр, әрі оны жазып қою керек. Келесі деректер жиынын құрастыру — бұл шешілетін жер: түпнұсқа демонстрациялар қосу түзету жиыны, эпизод таңдауы қолда барды үнсіз тартатын ереженің орнына, көз бойынша нақты көрсетіледі. Мұнда бұл кокпиттегі бір құрастыру қадамы, ал нәтиже — қарапайым деректер жиыны — қараңыз оқыту құжаттамасын. Ешбір құрал сіз үшін жасамайтыны — қай коэффициенттің қай қисықты бергенін жазып қою.

4-тұзақ: адам тұрақты сарапшы емес

DAgger-дің теориясы сарапшыны болжайды. Сіз техникалық мағынада ондай емессіз: сіздің түзетулеріңіз әрекеттер бойынша бекітілген шартты үлестірімнен алынған үлгілер емес. ACT авторлары дәл манипуляцияға кедергілерді санамалағанда мұны атайды — қателер уақыт өте жинақталады, әрі адам демонстрациялары стационарсыз болуы мүмкін. Олардың жүйесі әлі де он минуттық демонстрациядан алты нақты тапсырмада 80-90 пайыз сәттілікке жетеді, сондықтан бұл мәселе шешілмейтін емес, шешілетін.

robomimic зерттеуі мұны деректер жағынан көрсетеді. Бес симуляцияланған және үш нақты әлемдегі көп сатылы тапсырмада алты офлайн алгоритм бойынша оның сабақтары дизайн таңдауларына сезімталдықты, демонстрация сапасына тәуелділікті және — мұнда ең көп ауыратыны — тоқтату критерийлерінен туындайтын құбылмалылықты қамтиды, себебі оқыту мен бағалау мақсаттары әртүрлі. Ең төмен шығынды чекпоинт ең жоғары сәттілік жиілігіне ие чекпоинт бола бермейді.

Мұның жабдықтық нұсқасы да бар: кіріс режимі түзетуді қалыптастырады. Лидер-фолловер конфигурациясы үздіксіз, адам қарқынындағы траекторияларды береді. Пернетақта түрткілері серверде қатаң шектеледі — қол буындарында әр шақыруға екі градус, қармауышта төрт градус — сондықтан бір ниет кішкентай қадамдардың сатысы ретінде келеді. Слайдерлер абсолютті мақсаттарды жібереді, ал сервер оларға қарай әр шақыруда ең көбі алты градус жылжиды. Үш режим, үш әрекет үлестірімі; үшеуін бір түзету жиынына араластырып алып, содан кейін жақындаудың неге дірілдек болғанына таң қалу — өзіңіздің қолыңыздан жасалған нәрсе. Телеоперация құжаттамасы әр режимнің нені жіберетінін қамтиды.

Араласуларды салмақтау: IWR және одан кейінгісі

Түзетулер бағалы азшылық болса, принципті шешім — ерекшелік емес, салмақ. Intervention Weighted Regression — эталондық іске асыру: деректер араласу және араласусыз үлгілерге бөлінеді, әрі екі бөлік оқыту кезінде тең үлесте іріктеледі. Кадрлардың бес пайызын құрайтын түзету жиыны, сонда да, қалыпты мінез-құлықтың үлестірімнен жоғалуынсыз, градиенттің жартысына үлес қосады.

Тең үлес — заң емес, бастапқы нүкте. Sirius бұл екілік бөлуді жуықталған адам сенімінен алынған үздіксіз салмаққа алмастыру арқылы жалпылайды; Sirius-Fleet шешімді жоғарырақ жылжытады, адамнан жалпы сұралатын-сұралмайтынын шешу үшін көрнекі әлем моделі мен ауытқу болжаушыларын пайдаланады. Ортақ желі: араласу жалауы — тек есеп жүргізу бағаны емес, оқыту сигналы.

ӘдісАдам қашан әрекет ететінін кім шешедіАраласу деректері қалай пайдаланыладыХабарланған нәтиже
DAgger (2011)Бекітілген кесте; сарапшы барған күйлерге белгі қоядыБір өсіп келе жатқан деректер жиыны, салмақсызӨкінішсіз онлайн оқытуға дейінгі редукция ретінде тұжырымдалған
HG-DAgger (2019)Адам, нақты жүйеде басқаруды қақпалайдыЖинақталған; әрі модель белгісіздігі бойынша үйренілген қауіпсіздік шегі қосымшаЖүргізуде DAgger пен BC-ден жақсы; араласу саны берілмеген
IWR (2020)Адам, қашықтан телеоперация арқылыАраласу және араласусыз үлгілер тең үлесте алынадыТең үлгі санында араласусыз демонстрациялардан асып түседі
Sirius (2022)Адам, іске қосу кезіндеСалмақталған BC, салмақтар жуықталған адам сеніміненСимуляцияда 8 % өсім, нақты жабдықта 27 %; жинақталу 2 есе жылдам
ThriftyDAgger (2021)Жүйе, жаңашылдық пен тәуекел бойынша қақпалайдыҚадағалау бюджеті аясындағы интерактивті жинауПайдаланушы зерттеуі (N=10): келесі үздік әдіске қарағанда 58 % жоғары адам және 80 % жоғары робот өнімділігі
Fleet-DAgger (2022)Жүйе, флот бойынша назарды бөледіАдами күш-жігердің қайтарымы (ROHE) бойынша бағаланатын флот оқытуБазалық әдістермен салыстырғанда ROHE 8.8x-ке дейін жоғары
Sirius-Fleet (2024)Өзін-өзі бейімдейтін критерийлері бар ауытқу болжаушыларыКөрнекі әлем моделімен көп тапсырмалы оқытуАвтономия жақсарған сайын азайған араласу сұраныстары
Робот саясаттарын өлшенген ұпай бойынша салыстыратын көш бастаушылар тақтасы көрінісі
Саясаттарды бір-бірімен рейтингілеу тек әр жазба бірдей хаттамамен жүргізілгенде ғана мағына береді. Бұл өз үш раундыңызға да қатысты.

Жиіліктің қасында тіркеуге тұрарлық төрт метрика

  • Жүгіріс басына қолға алу саны. Жиырма қысқа түзету мен бір ұзақ түзету ұқсас жиілік береді, бірақ әртүрлі саясатты сипаттайды — бірі дірілдек, екіншісінде жалғыз соқыр аймақ бар.
  • Орташа араласу ұзақтығы. Саны азайып жатқанда ұзақтығы өсуі қалған сәтсіздіктердің қиынырақ екенін білдіреді — кеш прогресс дәл осылай көрінеді.
  • Алғашқы араласуға дейінгі уақыт. Көмек қажет болғанша алысырақ баратын саясат жалпы жиілік тегіс болса да жақсарып жатыр.
  • Араласулар қай жерде шоғырланады. Жалауды қалыпталған эпизод прогресі бойынша бөлектеп жинаңыз; раундтар бойы тұрақты шың бір тар өткелге меңзейді.

Нақты жүргізуге болатын раунд хаттамасы

Өлшенген раундта алты қадам бар және журналда бір жол береді. Алғашқы төртеуі — цикл; соңғы екеуі оны өлшемге айналдырады.

  1. 1
    Нөлінші раундтан бұрын бағалау хаттамасын бекітіңіз

    Бастапқы позаны, зат орналасуын, камераларды, сынақ санын, тайм-аутты және сәттілік критерийін жазып қойыңыз. Үстелді суретке түсіріңіз. Құжат өзгеруге тиіс болса, серия қайта басталады.

  2. 2
    Базалық деңгейді өлшеу

    Хаттаманы ешбір араласусыз жүргізіп, сәттіліктерді жазыңыз; содан кейін қолға алу қосылған бір аспаптандырылған сессия жүргізіп, жиілікті жазыңыз. Осы екі сан — нөлінші раунд.

  3. 3
    Түзетулерді бір үйлесімді стильде жинаңыз

    Раунд басына бір кіріс режимі, мүмкін болса бір оператор. Дауыстап айта алатын критерий бойынша қолға алыңыз — «қармауыш жақындауда екі сантиметрден астам ауытқыды» — және оны раунд бойы ұстаныңыз.

  4. 4
    Әр эпизодты сол күні сұрыптаңыз

    Түзету, бағалау немесе тастау. Екіұшты эпизодтар көбірек дерек пайдалы деген теориямен сақталмай, тасталады — өзіңіз сасқан түзету эпизодсыздан да нашар.

  5. 5
    Қоспаны нақты құрастырыңыз

    Түпнұсқа демонстрациялар қосу түзетулер, көз бойынша эпизод таңдауы. Базалық санды, түзету санын және кез келген салмақтауды жазып қойыңыз — бұл үш аптадан кейін керек болатын өріс.

  6. 6
    Чекпоинттен жалғастырыңыз, содан кейін қайта өлшеңіз

    Құрастырылған деректер жиынын базалық модельдің орнына алдыңғы чекпоинттен оқытыңыз, тұрақтандырылған хаттама мен бір аспаптандырылған сессияны жүргізіңіз, жолды журналға қосыңыз және алдыңғы екі раундпен салыстырыңыз.

Әлсіз раундты қалай оқитыныңызды екі шектеу өзгертеді. Чекпоинттен жалғастыру салмақтарды одан бастайды — бұл оптимизаторды қайта жалғастыру емес, сондықтан кесте жаңадан басталады, және жинақталған чекпоинттен қысқа жүгіріс өте азға жылжуы мүмкін. Ал қолға алудың басындағы лидерге туралау қозғалысы тізбектегі кез келген нәрседен нақты жабдықта ең аз жүрілген жол; түзетулердің барлығы біртүрлі өтпелі кезеңнен басталса, қоспаны кінәламас бұрын сол жерге қараңыз.

Өлшенген цикл, қазірдің өзінде дайын

ay-robots осы алты қадамды өнім мүмкіндіктері ретінде іске асырады: жүгіріс ортасында лидер қолдан, пернетақтадан немесе слайдерлерден басқаруды қолға алу, араласу кадрларын автоматты белгілеумен; әр эпизодты түзету, бағалау немесе тастау ретінде сұрыптау; келесі деректер жиынын түпнұсқа демонстрациялар мен түзетулерден құрастыру, көз бойынша нақты эпизод таңдауымен; және келесі оқыту жүгірісін базалық модельдің орнына алдыңғы чекпоинттен бастау.

DAgger циклінің қалай жұмыс істейтінін көру

Сандар сізге не айта алмайды

Мұның ешқайсысы шешілген жоқ, әрі ұқыпты қисық сізді керісінше сендірмеуі керек. Араласу жиілігі бірлескен жүйені — саясатты, жабдықты, операторды, бөлмені — өлшейді және өз бетінше ешнәрсеге телу жасамайды. Ол түзетулердің жақсы болғанын-болмағанын бағалай алмайды, әрі зат үш апта бойы екі сантиметрге жақынырақ жылжығандықтан жеңілдеген тапсырмада қуана төмендейді.

Ол не істейді — бұлдыр әсерді дауласуға болатын бағанға айналдырады. Балама — жақсырақ метрика емес; ол қисық үшінші раундтан кейін жинауды тоқтат деп айтатын түзетулерді үш апта бойы жинау. Шолу әдебиеті интерактивті еліктеп оқытуды робот орындауы кезінде уақтылы-уақтылы берілетін, мінез-құлықтың онлайн жақсаруына мүмкіндік беретін адам кері байланысы ретінде анықтайды; отбасы кең, әрі оның ешбір құрылымы раунд басына бір санынсыз жұмыс істемейді. Сондай-ақ қараңыз: SO-100 еліктеп оқыту нұсқаулығын — қарсы араластыратын базалық деректер жиыны үшін, саясатты жүргізу — инференс жағы үшін, және DAgger циклі бетін — іске асырылған құбыр үшін.

Араласу жиілігі жай ғана бірден сәттілік жиілігін алып тастағанмен бірдей ме?

Жоқ. Жиілік жүгірістің қанша бөлігін сіз қолға алғаныңызды өлшейді; сәттілік жиілігі тапсырманың сізсіз орындалғанын-орындалмағанын өлшейді. Жүгіріс 30 пайыздық араласу жиілігімен де сәтті болуы мүмкін, ал ешбір араласусыз жүгіріс мүлдем сәтсіз аяқталуы мүмкін. Олар шуылда да ерекшеленеді: жиілік мыңдаған корреляцияланған кадр бойынша тегіс жылжиды, ал сәттілік жиілігі бірнеше екілік нәтиже арасында секіреді. Екеуін де тіркеңіз.

Сәттілік жиілігі мағыналы болуы үшін маған қанша бағалау сынағы керек?

Ақылға қонымды сезілетіннен көбірек. Қалыпты жуықтауда, шынайы 60 пайыздық сәттілік жиілігінде 20 сынақ шамамен 11 пайыздық тармақтық стандартты қатеге ие болады, сондықтан раундтар арасындағы 10 тармақтық жылжу шуылдан ажыратылмайды; 50 сынақ бұл көрсеткішті шамамен 7-ге дейін түсіреді. 50-ге жете алмасаңыз, сынақ санын раундтар бойы бірдей ұстаңыз және шағын жылжуларды түйінсіз деп қарастырыңыз.

Демонстрациялар мен түзетулердің қандай қоспа коэффициентінен бастауым керек?

Құжатталған бастапқы нүкте — IWR-дікі: деректерді араласу және араласусыз үлгілерге бөліп, тең үлесте алыңыз, сонда түзетулер кадрлардың қаншалықты аз үлесін құрса да градиенттің жартысына үлес қосады. Егер сіздің орнатуыңыз іріктеуді салмақтай алмаса, деректер жиынын құрастырғанда мұны эпизод саны арқылы жуықтап, коэффициентті жазып қойыңыз. Тек түзетулерде оқыту — болдырмау керек нұсқа.

Раундтан кейін менің араласу жиілігім өсті. Раунд бекерге кетті ме?

Міндетті түрде емес, бірақ алдымен жалықтырарлық түсіндірмелерді тексеріңіз: сіз жүргізген чекпоинт оқытылған чекпоинтпен сәйкес пе, камера индексі немесе бекітпесі өзгерді ме, зат орналасуы ауытқыды ма, түзету стилі бірізді болды ма. Осы төртеуі де таза болса әрі жұптасқан сәттілік жиілігі де төмендесе, қоспаны күдіктеніңіз — түзетулерге қарсы тым аз базалық демонстрациялар, немесе бір-біріне қайшы келетін түзетулер. Нағыз кему журналға жазылуға тиіс, себетке емес.

Тұрақты бағалау хаттамасын өткізіп жіберіп, тек араласу жиілігін бақылай алам ба?

Тек жақсаруды дағдыланудан ажырата алмайтыныңызбен келіссеңіз ғана. Жиілік сіздің араласуға кірісудегі өз нақты уақыттағы шегіңізге тәуелді, ал бұл шек саясаттың ерекшеліктеріне үйренген сайын төмендейді. Тұрақтандырылған хаттама — шегіңіз жете алмайтын өлшем бөлігі: скотчпен белгіленген орындар, жазбаша үй позасы, бекітілген сынақ саны, раундтан бұрын шешілген критерий. Ол серия бойы өзгермей қалуы керек.

Журналды дәптерде емес, репозиторийде сақтаңыз: раундтар күндермен ерекшеленеді, жабдық қайта құрастырылады, әрі қазанда қисықты оқитын адам — тамыз туралы ешбір естелігі жоқ сіз боласыз. құжаттама ЖҚС (FAQ) мұнда қалдырылған операциялық егжей-тегжейлерді қамтиды.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started