
ఆచారణ సంచిక్రణ నిపుణుల స్థితి పంపిణీపై ఒక విధానాన్ని సరిపోల్చుకుంది మరియు తరువాత దానిని స్వతంత్రంగా ప్రయోగించారు. ఆ రెండు పంపిణీల మధ్య అంతరం ఎందుకంటే ధ్రువీకరణలో సరిగ్గా కనిపించే విధానం ఆరోహణ 300 వద్ద టేబుల్ నుండి బయటకు వెళ్తుంది. ఇది మా DAgger సిరీస్ యొక్క సిద్ధాంత అధ్యాయం: చతురస్రాకార లోపం పదం ఎక్కడ నుండి వస్తుంది, డేటాసెట్ సమీకరణ ఏమిని మారుస్తుంది, పశ్చాత్తాపం లేని రుజువు ఏమిని సూచిస్తుంది, మరియు విల్లు యొక్క ఏ భాగం మానవ నిపుణుడు ఇంకా చెల్లించవలసి ఉంటుంది.
తారుమారు విధానాన్ని శిక్షణ చేసే ప్రతిఒక్కరు చెందా లేదా తరువాత ఎదుర్కొనే నిర్దిష్ట విఫలత ఉంది. విధానం క్యూబ్ కోసం చేరుకుంటుంది, రెండు సెంటీమీటర్ల లోపల ఉంటుంది, సంకోచం చెందుతుంది, పక్కకు విచలనం చెందుతుంది, ఆపై పనికి సంబంధం లేని ఏదో చేస్తుంది. ధ్రువీకరణ నష్టం బాగా ఉంది. కలిగి ఉన్న ఎపిసోడ్ల కూడా ఓపెన్-లూప్ పునరాభివృద్ధి బాగా ఉంది. ఇంకా చేయి శిక్షణ డేటాలో ఎక్కడా కనిపించని ఆసనంలో చివరికి చేరుకుంటుంది, మరియు అక్కడ నుండి దానికు చెప్పడానికి సంబంధితమైన ఏదీ లేదు.
ఆ విఫలతకు ఒక నామం మరియు దాని వెనుక ఒక స్థిరమైన సిద్ధాంత భాగం ఉంది. ఇది DAgger, మరియు ఇది వాదన కూడా కవర్ చేస్తుంది: ప్రదర్శనకారి యొక్క స్వంత పథాల పై విధానాన్ని సరిపోల్చుకోవడం ఎందుకు ఎపిసోడ్ పొడవు యొక్క చతురస్రంతో వృద్ధి చెందగలిగిన లోపాన్ని ఉత్పత్తి చేస్తుంది, డేటాసెట్ సమీకరణ ఏమిని మారుస్తుంది, మరియు పశ్చాత్తాపం లేని రుజువు ఏమిని వాగ్దానం చేయదు. నిజమైన హార్డ్వేర్లోని లూప్ కవర్ చేయబడింది SO-100 పై DAgger లూప్ను నడుపుటము, మానవ-గేట్ చేయబడిన వేరియంట్ HG-DAgger మరియు మానవ-గేట్ చేయబడిన జోక్యాలు, మరియు కొలత ప్రశ్న DAgger లూప్ను కొలవడం.
చిన్న సంస్కరణ
- •ఆచారణ సంచిక్రణ నిపుణుల స్థితి పంపిణీపై శిక్షణ చేస్తుంది మరియు విధానం యొక్క స్వంతంపై మూల్యాంకనం చేయబడుతుంది. సమస్యకరత ఎపిసోడ్ జరిగినప్పుడు సమ్మేళనం చేస్తుంది.
- •రాస్ మరియు బాగ్నెల్ అదనపు ఖర్చు T స్క్వేర్డ్ సార్లు ప్రతి-దశ లోపం గా విస్తరించగలదని చూపించారు; DAgger కాగితం ఆ సరిహద్దును పునరుద్ఘటిస్తుంది మరియు ఇది గట్టిగా ఉందని గమనించారు.
- •DAgger విధానం కూడా సందర్శించే స్థితుల లేబల్లు, మరియు ఇప్పటి వరకు సేకరించిన ప్రతి డేటాసెట్పై పునः శిక్షణ చేస్తుంది, కేవలం సరికొత్తది కాదు.
- •ఖాతర పశ్చాత్తాపం లేని ఆన్లైన్ అభ్యాసానికి తగ్గింపు: సమీకరణ మరియు పునः శిక్షణ నేత అనుసరణ.
- •ఇది విధానం విభాగంలో సాధించిన ఉత్తమ నష్టానికి సంబంధించి ఉంటుంది, సున్నాకు సంబంధించి కాదు - మరియు నిపుణుడు ఇంకా తయారు చేయని స్థితుల లేబల్ చేయవలసి ఉంటుంది.
ఆచారణ సంచిక్రణ నిశ్శబ్దంగా చేసే ఊహ
ప్రదర్శన డేటాసెట్ పరిశీలన-చర్య జతల సమూహం. ఆచారణ సంచిక్రణ సాధారణ పర్యవేక్షిత అభ్యాసంతో ఆ సమూహానికి ఒక ఫంక్షన్ను సరిపోల్చుకుంది మరియు అక్కడ ఆగిపోయింది. ఇది ఈ రంగంలో పురాతన ఆలోచన. పొమెర్లీ యొక్క ALVINN, 1988 లో, కెమెరా నుండి చిత్రాలను మరియు లేజర్ పరిధి ఫైండర్ నుండి తీసుకోసిన మరియు వాహనం ప్రయాణించవలసిన దిశను ఉత్పత్తి చేసిన త్రీ-పొర బ్యాక్-ప్రోపగేషన్ నెట్వర్క్. ఇది అనుకరించిన రోడ్ చిత్రాలపై శిక్షణ చేయబడింది మరియు కొన్ని క్షేత్ర పరిస్థితుల కింద నిజమైన రోడ్లను అనుసరించింది. రెసిపీ చాలా మారలేదు; నెట్వర్క్లు మారిపోయాయి.
ఆ జతలు ఎక్కడ నుండి వచ్చాయో చెక్ చేయడం వదిలివేయబడుతుంది. వాటిలో ప్రతిఒక్కటి ప్రదర్శనకారి ఉత్పత్తి చేసిన పథం మీద ఉంటుంది. మీరు ప్రయోగించే విధానం దానిని ఉత్పత్తి చేస్తుంది. ఇది విచలనం చెందిన క్షణం, శిక్షణ పంపిణీలో లేని స్థితుల గురించి ప్రశ్నించబడుతుంది, మరియు దాని సమాధానం దానిని మరింత బయటకు నెట్టివేస్తుంది. రాస్, గోర్డన్ మరియు బాగ్నెల్ DAgger కాగితాన్ని ఇదేవిధంగా తెరుస్తారు: క్రమానికర ఊహ i.i.d. సాంఖ్యక అభ్యాస కింద గీసిన ఊహను ఉల్లంఘిస్తుంది, ఎందుకంటే శిక్షణార్థి యొక్క స్వంత అంచనాలు దానికి తదుపరి చూసే ఇన్పుట్లను నిర్ణయిస్తాయి.
ఆ కాగితంలో స్పష్టమైన ఉదాహరణ రోబోట్ కాదు. సూపర్ మారియో బ్రదర్ల కోసం సమీప-సరైన ప్లానర్ను సంచిక్రణ చేయడం ఆటలో సూచనకు బదులుగా ఆటలో ఆటలో విఫలమయ్యే విధానాన్ని ఉత్పత్తి చేసింది. కారణం సమస్త వాదన ఒక వాక్యంలో: నిపుణుడు ఎల్లప్పుడు సుఖమైన దూరం నుండి దూకాడు, కాబట్టి డేటాసెట్లో మారియో ఆటలుకు చేపట్టిన స్థితి లేదు, కాబట్టి అతను ఆ విధంగా కూడా ఉన్నప్పుడు ఏమి చేయాలో లేబల్ లేదు.
మారియోను SO-100 చేయి కు మార్చండి మరియు నిర్మాణం ఒకేలా ఉంటుంది. మీ ప్రదర్శనలు శుభ్రమైన విధానం మరియు శుభ్రమైన పట్టును చూపుతాయి, గ్రిప్పర్ రెండు సెంటీమీటర్ల చిన్నదిగా మూసుకోవడం కాదు - కాబట్టి విధానం అక్కడ నుండి ఏమి చేయాలో ఆలోచన లేనిది, మరియు ఏ ఊహ ఉన్నప్పటికీ దానిని మరింత బయటకు తీసుకెళ్తుంది. సహచర విస్థాపన డేటా సేకరణ విధానం యొక్క ఆస్తి, నెట్వర్క్ ఆర్కిటెక్చర్ కాదు.
చతురస్రాకార పదం ఎక్కడ నుండి వస్తుంది
రాస్ మరియు బాగ్నెల్ యొక్క 2010 AISTATS కాగితం, అనుకరణ అభ్యాసం కోసం సమర్థ పరిమితులు, సమ్మేళనాన్ని ఖచ్చితంగా చేస్తుంది. T విధాన క్షితిజం, విధానం ఖర్చు యూనిట్ విరామంలో సరిహద్దు, మరియు విధానం నిపుణుల నుండి కొలిచిన ప్రత్యామ్నాయ నష్టం సరిహద్దు నిపుణుల స్థితి పంపిణీ - మీ ధ్రువీకరణ సెట్ నివేదించిన సంఖ్య. అప్పుడు ఆ విధానాన్ని T దశలకు నడుపుటము యొక్క అదనపు ఖర్చు, నిపుణికి సంబంధించి, T స్క్వేర్డ్ సార్లు విధానం ద్వారా సరిహద్దు. రాస్, గోర్డన్ మరియు బాగ్నెల్ ఇదిని DAgger కాగితంలో థియోరెమ్ 2.1 గా పునరుద్ఘటిస్తారు మరియు ముఖ్యమైన వాక్యాన్ని జోడిస్తారు: సరిహద్దు గట్టిగా ఉంటుంది. నిపుణుల పంపిణీపై విధానం నష్టంతో సమస్యలు T లో చతురస్రాకారంగా వృద్ధి చెందే అదనపు ఖర్చుకు నిజానికి సంభవిస్తాయి.
గట్టిగా సాధారణమైనది కాదు. చతురస్రాకార పదం సమస్యల విభాగంపై చెత్త సందర్భం, మీ పిక్-మరియు-ప్లేస్ విధానం గురించి అంచనా కాదు. ఇది స్థాపిస్తున్నది ఉంది మరంత నిపుణ ప్రదర్శన సమస్యను తొలగించలేము: ఇది విధానం పర్యవేక్షించనప్పుడు పంపిణీపై విధానం యొక్క అంచనాను మీకు నీరసపరుస్తుంది.
తప్పించిపోయే మార్గం అదే కాగితంలో, థియోరెమ్ 2.2 గా పునరుద్ఘటించబడింది. విధానం పతనం చెందినట్లయితే దాని స్వంత స్థితి పంపిణీ, మరియు ఒక్క చేపట్టిన చర్య నిపుణిలో చెల్లెందుకు అత్యధిక u ఖర్చులో ఆధారపడుతుంది, అదనపు ఖర్చు u సార్ల T సార్ల విధానం ద్వారా సరిహద్దు - క్షితిజ పరిధిలో సరళ. నిరంతర u ఆసక్తికరమైన పరిమాణం: నిపుణినకు 0-1 విభేదం కోసం సరిగ్గా 1, మరియు O(1) నిపుణుడు కొన్ని దశలలో కోలుకోగలిగినప్పుడు. చెత్త సందర్భంలో ఇది O(T), మరియు సరళ సరిహద్దు చతురస్రాకార కంటే బాగాలేదు.
| సెట్టింగ్ | నిపుణి పై అదనపు ఖర్చుపై సరిహద్దు | ఇది దీపం మీద ఉంటుంది |
|---|---|---|
| ఆచారణ సంచిక్రణ (రాస్ మరియు బాగ్నెల్ 2010, రాస్ మరియు ఇతరులు 2011 లో థియోరెమ్. 2.1 గా పునరుద్ఘటించబడినది) | T స్క్వేర్డ్ సార్లు విధానం | నిపుణుల స్థితి పంపిణీపై కొలిచిన విధానం; [0,1] లో ఖర్చు; సరిహద్దు గట్టిగా ఉంటుంది |
| దాని స్వంత పంపిణీ (థియోరెమ్. 2.2) క్రింద విధానం నష్టంతో ఏదైనా విధానం | u సార్లు T సార్లు విధానం | u ఒక చేపట్టిన చర్య యొక్క చెల్లెందుకు శిక్ష సరిహద్దుకు పరిమితం; 0-1 నష్టం కోసం సరిగ్గా 1, O(T) చెత్త సందర్భం |
| ఫార్వర్డ్ శిక్షణ (రాస్ మరియు బాగ్నెల్ 2010) | u సార్లు T సార్లు విధానం | ప్రతి సమయ దశకు ఒక విధానం; T విధానాలు మరియు ఒక తెలిసిన, పరిమిత T అవసరమైనది |
| SMILe (రాస్ మరియు బాగ్నెల్ 2010) | సమస్య నిర్దిష్ట తరగతులపై T మరియు విధానం లో సమీప-సరళ | alpha O(1/T స్క్వేర్డ్) లో, N O(T స్క్వేర్డ్ log T) లో; ఒక యాదృచ్ఛిక మిశ్రణాన్ని ఇస్తుంది |
| DAgger (థియోరెమ్. 3.2, రాస్ మరియు ఇతరులు 2011) | u సార్లు T సార్లు విధానం_N, ప్లస్ O(1) | N uT క్రమంలో; బలంగా కుంభాకార సరిహద్దు నష్టం; పశ్చాత్తాపం లేని శిక్షణార్థి; విధానం_N అనేది అసంభవ్యత లో ఉత్తమ నష్టం |

DAgger కు ముందు వచ్చిన రెండు ప్రయత్నాలు
ఫార్వర్డ్ శిక్షణ సత్యమైన కానీ అవాస్తవమైన సమాధానం. ప్రతి సమయ దశకు ప్రత్యేక విధానాన్ని శిక్షణ చేయండి, క్రమంలో, ప్రతిఒక్కటి ఇదివరకు సరిపోల్చిన విధానాల ద్వారా ప్రేరేపించిన స్థితి పంపిణీపై, కాబట్టి ప్రతి విధానం ఎక్కువ పంపిణీని ఉంచుకుంటుంది చూసేందుకు ఉంటుంది. ఈ క్యాచ్ వివరణలో ఉంది: T విధానాలు, క్రమానికరంగా శిక్షణ చేయబడినవి, ఆచిరిగా నిలిచిపోవడం లేదు. ఒక తారుమారుకు ఎపిసోడ్ సెకనుకు 30 ఫ్రేమ్ల వద్ద, T నూటలలో ఉంది.
SMILe, అదే కాగితం నుండి, మరియు SEARN, డాউమ్, లాంగ్ఫోర్డ్ మరియు మర్కు యొక్క నిర్మిత అంచనా కార్యపై ఇతర మార్గం: ఒక స్థిర విధానం, కానీ యాదృచ్ఛిక. ప్రతి పునరుక్తి ఒక భాగాన్ని శిక్షణ చేస్తుంది మరియు ఆ మిశ్రణకు జోడిస్తుంది, సంభావ్యత ద్రవ్యరాశిని నిపుణి నుండి దూరంగా మార్చుతుంది. ఫలితం ఒక మిశ్రణ ఇందులో కొన్ని భాగాలు ఇతరులకంటే చెత్తవి - ఒక భౌతిక చేయిపై, ఒక నియంత్రకం ఆటలు-కదలిక మధ్య చెత్త భాగాన్ని నమూనా చేయగలదు. ఒక స్థిర విధానాన్ని కోరుకునే చెప్పిన ప్రేరణ నిర్ధారక విధానం బదులుగా.
DAgger: ఒక ఆలోచన, ఒక పెట్టె
డేటాసెట్ సమీకరణ నిర్ధారక విధానాన్ని ఉంచుకుంటుంది మరియు సరిదిద్దుకోవడాన్ని డేటా సేకరణలో తరలిస్తుంది. ప్రతి రౌండ్: ప్రస్తుత విధానాన్ని పెరిగేందుకు, సందర్శించే స్థితులను రికార్డ్ చేయండి, నిపుణుని ఒక్కోటిలో సరైన చర్య ఏమిటిని అడగండి, ఆ జతలను మీరు ఇప్పటికే ఉన్న డేటాసెట్కు జోడించండి, యూనియన్లో పునः శిక్షణ చేయండి. పేరు అల్గారిథమ్ - మీరు సమీకరణ చేస్తారు, మీరు ఎప్పుడూ విసర్జించరు.
D <- {} # the aggregate dataset
pi_hat_1 <- any policy in Pi
for i = 1 .. N:
pi_i = beta_i * expert + (1 - beta_i) * pi_hat_i
roll out pi_i for T steps, record every visited state s
D_i = { (s, expert(s)) for every visited state s }
D = D union D_i # aggregate, do not replace
pi_hat_{i+1} = train on all of D
return the best pi_hat_i on a validation setమూడు వివరాలు అవి కనిపించే దానికంటే ఎక్కువ బరువు తీసుకుంటాయి. లేబల్లు మిశ్రిత విధానం సందర్శించే స్థితుల కోసం ఉన్నాయి, కానీ చర్యలు నిపుణి నుండి వస్తాయి - విధానం ప్రశ్నలను అందిస్తుంది, నిపుణుడు సమాధానలు. పునः శిక్షణ సమస్త సమీకరణపై ఉంది, ఇది ప్రతి రౌండ్ను నేత అనుసరణ దశ చేస్తుంది: రౌండ్ n వద్ద మీరు ఇప్పటి వరకు ప్రతి పథం లో అసంభవ్యత లో ఉత్తమ విధానాన్ని ఎంచుకుంటారు. ఆ ఫ్రేమింగ్ రుజువు వేలాడుకోవడం. మరియు అల్గారిథమ్ ధ్రువీకరణ సెట్లో ఎంచుకున్న సిరీస్లో ఉత్తమ విధానాన్ని తిరిగి ఇవ్వడం ద్వారా ముగుస్తుంది, ఎందుకంటే సిద్ధాంతాలు తెలుసుకుంటాయి కొన్ని సిరీస్లో విధానం ఒడ్డయ, చివరిది కాదు.
బీటా షెడ్యూల్, మరియు ఇది ట్యూనింగ్ నాబ్ ఎందుకు కాదు
మిశ్రిత విధానం beta_i సార్ల నిపుణుడు ప్లస్ ఒక మైనస్ beta_i సార్ల శిక్షణార్థి. పాయింట్ ఆచరణీయం: మొదటి కొన్ని నేర్చుకున్న విధానాలు చాలా తక్కువ డేటాపై శిక్షణ చేయబడతాయి, చాలా లోపాలు చేస్తాయి, లేకపోతే రోల్ఔట్ ఆ స్థితులలో ఖర్చు చేస్తాయి ఇది విధానం మెరుగ్గా ఉంటే ఇక చెల్లనిది.
సిద్ధాంతం సరిగ్గా ఒక పరిస్థితిని విధిస్తుంది: బీటాస్ యొక్క నడుస్ విధానం సున్నాకు వెళ్లాలి. విశ్లేషణ beta_i తో సరిహద్దు (1 - alpha) యొక్క శక్తి i-1 కు, స్థిరమైన alpha స్వతంత్రమైన T కోసం.
| షెడ్యూల్ | ఇది ఏమి చేస్తుంది | ఆ కాగితం నివేదిస్తుంది |
|---|---|---|
| beta_1 = 1 | మొదటి రౌండ్ స్వచ్ఛ నిపుణ ప్రదర్శన; ప్రారంభిక విధానం అవసరం లేదు | ప్రతి వేరియంట్లో సిఫార్సు చేయబడిన ప్రారంభ బిందువు |
| beta_i = 1 i = 1 అయితే, లేకపోతే 0 | మొదటి రౌండ్లో కేవలం నిపుణుడు; ఉచిత పారామితి లేదు | ఆ కాగితం యొక్క పారామితి-రహిత సంస్కరణ, ఇది చెప్పిన ఆచరణలో తరచుగా ఉత్తమమైనది; 20 పునరుక్తుల తర్వాత సూపర్ మారియో బ్రదర్లపై 2980 |
| beta_i = p^(i-1) p = 0.5 కు | నిపుణ సంభావ్యత జ్యామితిసంబంధమైనంగా క్షయం | అదే బెంచ్మార్క్పై 3030, పారామితి-రహిత సంస్కరణ కంటే కొద్దిగా ముందు |
| beta_i = p^(i-1) p = 0.9 కు | నిపుణుడు లూప్లో చాలా ఎక్కువ సమయం ఉంటాడు | గుర్తించదగ్గ నెమ్మది కలయిక; 20 పునరుక్తులు ముగిసినప్పుడు కూడా మెరుగ్గా ఉంటుంది |
సుమారుగా 4300 వరకు నడిచే స్కేల్పై 2980 మరియు 3030 మధ్య అంతరం చిన్నది, కానీ ఆ కాగితం యొక్క ఆ వివరణ విభాగంలో చాలా ఉపయోగకరమైన ఆచరణాత్మక గమనిక. పారామితి-రహిత షెడ్యూల్ సహాయంతో, మారియో ఆరంభానికి అదే స్థానంలో ఫిక్సయ్యాడు మరియు ఆ ఒక చర్చపై నుండి సమీప-నకిలీ డేటా సమూహాన్ని ఉత్పత్తి చేసాడు; నిపుణుడిని సమయం భిన్నాన్ని నడపనివ్వడం దాని నుండి రెండూ విడిచిపెట్టారు మరియు రాష్ట్రాల వైవిధ్యం విస్తరించారు. షెడ్యూల్ మిశ్రణ నిష్పత్తి గురించి కంటే మీ డేటా సేకరణ కొత్త స్థితులను ఉత్పత్తి చేస్తూ ఉందా లేదా అదే విఫలత గురించి తక్కువ.
ఒక యాదృచ్ఛిక ప్రతి-సమయ దశ మిశ్రణ నియంత్రణ రేటుపై నియంత్రణ అధికారాన్ని మార్చడం, సాధారణ SO-100 సెట్ఆప్లో సెకనుకు 30 సార్లు. టెలిఓపరేషన్ ఇంటర్ఫేస్ ఏదీ దానిని సురక్షితం లేదా అర్థవంతం చేయదు. నిజమైన హార్డ్వేర్లో బీటా షెడ్యూల్ ఒక మానవ నిర్ణయానికి ఎప్పుడు చేపట్టాలి: వేరే సిద్ధాంతం కలిగిన వేరే అల్గారిథమ్.
ఖాతర: పశ్చాత్తాపం లేని ఆన్లైన్ అభ్యాసానికి తగ్గింపు
ఇక్కడ కాగితాన్ని చేసే కదలిక. ప్రతి DAgger రౌండ్ను ఆన్లైన్ అభ్యాస సమస్యలో ఒక ఉదాహరణగా పరిగణించండి, ఇక్కడ రౌండ్ i వద్ద నష్టం రౌండ్ i వద్ద ఉపయోగించిన విధానం యొక్క స్థితి పంపిణీ కింద ప్రత్యామ్నాయ నష్టం. శిక్షణార్థి ఆ నష్టాన్ని చూసే ముందు విధానానికి నిశ్చితార్థం చేస్తారు, మరియు సిరీస్ నిర్వాహకం కాదు ఎందుకంటే ఇది ఇప్పటి వరకు ఉత్పత్తి చేయబడిన విధానాలపై ఆధారపడుతుంది.
ఒక అల్గారిథమ్ పశ్చాత్తాపం లేనిది N రౌండ్ల నుండి సగటు నష్టం అసంభవ్యత లో ఉత్తమ ఏకైక విధానానికి చేరుకుంటే. నేత అనుసరణ బలంగా కుంభాకార నష్టాలపై ఆ అల్గారిథమ్, సగటు పశ్చాత్తాపం 1/N యొక్క క్రమంలో చిన్న - మరియు పూర్తి సమీకరణ పై పునः శిక్షణ సరిగ్గా నేత అనుసరణ. ఏదైనా ఇతర పశ్చాత్తాపం లేని శిక్షణార్థి కూడా సేవ చేస్తారు: విశ్లేషణ తగ్గింపు, ఒక ఆప్టిమిజర్ ఆస్తి కాదు.
ఒక లెమ్మ డేటాను సేకరించిన మిశ్రిత విధానం మరియు అంతర్భాగం చేయబడిన నేర్చుకున్న విధానం మధ్య అంతరాన్ని చేపట్టుకుంటుంది: లెమ్మ 4.1 వారి స్థితి పంపిణీల మధ్య L1 దూరాన్ని 2 T beta_i ద్వారా సరిహద్దు. ఎందుకంటే బీటాలు చిన్నవిగా ఉండాలి - నిపుణుడు ఇప్పటికీ గణనీయమైన నియంత్రణ అధికారాన్ని కలిగి ఉంటాడు, మీరు సేకరించిన స్థితులు మీ విధానం ఉత్పత్తి చేస్తుంది అంటారు కాదు. లెమ్మని పశ్చాత్తాపం సరిహద్దుతో సంయోగించండి మరియు ప్రధాన ఫలితం అనుసరిస్తుంది: సుమారుగా T పునరుక్తుల తర్వాత, సిరీస్లో కొన్ని విధానం దాని స్వంత పంపిణీ క్రింద ప్రత్యామ్నాయ నష్టం O(1/T) యొక్క epsilon_N లో ఉంటుంది. దానిని సరళ సరిహద్దులో చేయండి మరియు మీరు థియోరెమ్ 3.2 వద్ద ల్యాండ్ చేస్తారు.
అనుభవిక వైపు ప్రస్తుత ప్రమాణాల ద్వారా సాధారణమైనది. సూపర్ టక్స్ కార్ట్లో పర్యవేక్షిత ఆధారం మరింత డేటా రావడంతో ఎక్కువ ప్రతి ల్యాప్ ఖాళీలను మెరుగ్గా చేయలేదు, DAgger పదిహేను పునరుక్తుల తర్వాత ట్రాక్ను ఎక్కువ పడని విధానాన్ని చేరుకున్నారు, మరియు SMILe ఇరవై తర్వాత ఇంకా ప్రతి ల్యాప్కు సుమారుగా రెండుసార్లు పడ్డారు. హస్తలిపి బెంచ్మార్క్లో, అక్షర ఖచ్చితత్వం నిర్మాణం లేకుండా 82 శాతం, 83.6 శాతం పర్యవేక్షిత, DAgger తో 85.5 శాతం నడిచింది. వీటిలో ఏదీ తారుమారు ఫలితం కాదు.
రుజువు ఏమిని వాగ్దానం చేయదు
సిద్ధాంత ప్రకటనలు షరతులతో కూడినవి, మరియు పరిస్థితులు బరువు వహిస్తాయి.
- T లో సరళ విధానం చతురస్రాకార కంటే, చెప్పిన ఊహలు లోపల.
- యాదృచ్ఛిక మిశ్రణ కంటే నిర్వాహకం నిర్ధారక విధానం.
- నిజమైన తగ్గింపు: ఏదైనా పశ్చాత్తాపం లేని ఆన్లైన్ శిక్షణార్థి స్లాట్లు.
- ఖచ్చితమైన పునరుక్తి సంఖ్య - పశ్చాత్తాపం పదం ముఖ్యమైనదిగా ఆగిపోయే ముందు సుమారుగా T రౌండ్లు.
- సిరీస్లో కనీసం ఒక విధానానికి ఖాతర, కాబట్టి సముమ్మక ధ్రువీకరణ పాస్.
- ఇది epsilon_N కు సంబంధించినది, అసంభవ్యత లో విభాగంలో ఉత్తమ నష్టం, సున్నాకు కాదు. మీ విభాగం నిపుణుడిని సూచించలేకపోతే, ఇది ఆచరణలో ఖాళీ.
- ఇది పశ్చాత్తాపం లేని పద్ధతి లేదా బలంగా కుంభాకార ప్రత్యామ్నాయ నష్టం - ఇది నిర్మిస్తున్న వర్గీకరణ తగ్గుదల కంటే బలంగా, రచయితలు గమనించినట్లుగా.
- స్థిరమైన u చెత్త సందర్భంలో O(T) కావచ్చు, మరియు సరళ సరిహద్దు సరిగ్గా చతురస్రాకారానికి తిరిగి కూలిపోతుంది.
- ఇది పునరుక్తులను సరిహద్దుకు చేస్తుంది, నిపుణ లేబల్లు కాదు. రోబోట్పై, లేబల్లు బడ్జెట్.
- ఇది నిపుణుడిని ప్రతి సందర్శించిన స్థితిలో అడగవచ్చునని మరియు అక్కడ సరిగ్గా సమాధానమిస్తారని ఊహిస్తుంది. ఆ ఊహ మొత్తం ఖర్చు.
ఒక మరు ఫలితం తరచుగా రిఫ్యూటేషన్గా పట్టిపట్టుకుంటారు మరియు ఒక లేదు. రాజారామన్, యాంగ్, జియో మరియు రామచందర్ సంపర్కిత MDPs లో అనుకరణ అభ్యాసం యొక్క మినిమాక్స్ పరిమితులను పరిమిత స్థితి స్పేస్ S మరియు క్షితిజ H తో అధ్యయనం చేస్తారు, మరియు |S| H స్క్వేర్డ్ N కంటే ఆర్డర్ మీద సుబోప్టిమాలిటీ లోअ సరిహద్దును నిరూపిస్తారు ఎమ్డిపి అధ్యయనం చేసేటప్పుడు కూడా, మరియు ఇది చెత్త-కేసు రేటు ఒక నిర్ణీత ఎపిసోడ్ బడ్జెట్ను ఒక MDP స్థాయిలో, మరియు ఇది తిరస్కరించేది ఇంటరాక్షన్ మినిమాక్స్ రేటు మెరుగ్గా చేస్తుందనే ఆలోచన; DAgger యొక్క సిద్ధాంతం వేరే ప్రకటన, దాని స్వంత విధానం విభాగం సాధించగలిగినదానికి సంబంధించి అంతర్ భాగం విధానాన్ని సరిహద్దుకు చేస్తుంది.
స్వామి, చౌధరి, బాగ్నెల్ మరియు వూ తరువాత ఆ అల్గారిథమ్లను నిపుణుల ప్రవర్తన యొక్క ఎన్ని క్షణాలను వర్గీకరించారు, మరియు ఒక క్షణం పునరుద్ధారణ యొక్క భావన ప్రవేశపెట్టారు ఇది ప్రతిఒక్క కుటుంబం సమ్మేళన లోపాన్ని ఎంత బాగా తగ్గిస్తుందో సరిహద్దుకు చేస్తుంది. ఓసా మరియు సెలెమిన్ ద్వారా సర్వేలు అల్గోరిథమిక్ ల్యాండ్స్కేప్ మరియు మానవ-ఫీడ్బ్యాక్ ఇంటర్ఫేస్లను కవర్ చేస్తాయి.
బిల్లు: నిపుణుడు ఎప్పుడూ ఉత్పత్తి చేయని లేబల్ స్థితులు
పైన ఉన్న సమస్త నిపుణుడిని ఊహిస్తుంది ఎక్కడ అయితే చేయవచ్చు. అనుకరణలో ఒక ప్లానర్ అది సుమారుగా ఉచితం - మారియో ప్రయోగాలు గేమ్ స్థితికి పూర్తి ప్రాప్యతకు సమీప-సరైన ప్లానర్ను ఉపయోగించారు. రోబోట్లో మానవ సమక్షం ఇది ప్రధాన ఖర్చు, మరియు ఎక్కువ అందం: మానవుడు సరైన చర్య ఒక కాన్ఫిగరేషన్లో ఉత్పత్తి చేయాలి వారి స్వంత సామర్థ్యం ఎప్పుడూ సృష్టించలేదు.
కెల్లీ, సిద్రానె, డ్రిగ్స్-కాంపబెల్ మరియు కోచెండర్ఫర్ HG-DAgger కాగితంలో సరిగ్గా ఆక్షేపణను రూపొందిస్తారు. వనిల్లా DAgger నిపుణుడు చర్య లేబల్లను సరఫర్రాచేయవలసి ఉంది సిస్టమ్పై పూర్తిగా నియంత్రణలో లేనీ. ఇది భద్రత కోసం తగ్గిస్తుంది, మరియు మానవ నిపుణులతో సేకరించిన లేబల్ల నాణ్యతను పచ్చబట్టాల సంభావ్యత, ఎక్కువ కనిపించే యాక్టుయేటర్ పిండికు. బ్యాక్లో మీరు పొందిన లేబల్ అల్గారిథమ్ ఊహించిన లేబల్ కాదు.
లాస్కీ మరియు సహకారులు DART సంగా సమస్యను సాధించారు, మరియు వారి ఫ్రేమింగ్ నిస్సంగం: విధానం పర్యవేక్షణ నిపుణులకు సెమిక్రియమైన, గణనీయ బరువులు జోడించండి, మరియు శిక్షణ సమయంలో ప్రమాదకరమైన స్థితులను సందర్శించవచ్చు. వారి ప్రత్యామ్నాయం పర్యవేక్షకుల స్వంత ప్రదర్శనలలో క్రమాంకనం చేయబడిన నోయిజ్ను చేర్చుతుంది, కాబట్టి కోలుకోవడం ప్రదర్శించబడుతుంది రోబోట్ ఎప్పుడూ విశ్వసించని విధానాన్ని నడిపోకుండా. MuJoCo హ్యూమనాయిడ్లో వారు DART నివేదించారు శిక్షణ సమయంలో పర్యవేక్షకుల సంచిత నిమజ్జనాన్ని 5 శాతం ద్వారా తగ్గిస్తుంది, DAgger సంపాదిస్తుంది పర్యవేక్షకుల కంటే 80 శాతం తక్కువ సంచిత నిమజ్జనం కలిగిన విధానాలు; టయోటా HSR సంగా చిందిలో గ్రాస్చేయడం, ఆచారణ సంచిక్రణ పైన సగటు 62 శాతం పెరుగుదల.
జాంగ్ మరియు చో యొక్క SafeDAgger సూచన విధానానికి ప్రశ్నలను ఆశ్చర్యకరమైన సంపద గా పరిగణిస్తుంది: ఒక ప్రత్యేక భద్రత విధానం, ప్రశ్న చేయకుండా, ప్రాధమిక విధానం సూచన నుండి ఒక సరిహద్దు పైకు విచలనం సేసుకోవడం జరుగుతుందో లేదో ఊహిస్తుంది, మరియు కేవలం ఆ స్థితులను వారసుతారు. మూడూ అదే వాస్తవానికి ప్రతిస్పందిస్తాయి - DAgger విశ్లేషణ నిపుణ లేబల్ల కోసం ఖర్చు చేయదు, మరియు నిజం చాలా ఎక్కువ ఖర్చు చేస్తుంది.
ఆఫ్-డిస్ట్రిబ్యూషన్ స్థితుల లేబలింగ్ విధానాన్ని ప్రదర్శించడం కంటే మానసికంగా కష్టం. సాధారణ ప్రదర్శన మీరు ఇప్పటికే ఉన్న మోటారు ప్లాన్ను అమలు చేస్తుంది. ఒక గ్రిప్పర్ను ఎక్కడా నీవు చేయనివిధంగా ఒక విధానాన్ని సరిదిద్దుకోవడం స్పాట్లో కోలుకోవడాన్ని నిర్మించడం అర్థం, సమయ ఒత్తిడిలో, రోబోట్ ఇంకా కదులుతున్న సమక్ష. సంగ్రహ రికార్డింగ్ సెషన్కు కంటే సెషన్ కు న్యూనతర ఉపయోగ నిమిషాలు ఆశిస్తారు, మరియు ఒక కోర్సులో మీ స్వంత సరిదిద్దుకోవడ నాణ్యత క్షీణతను చూడండి.

ఇది మీ డెస్క్పై SO-100 కోసం అర్థం
క్షితిజం మీ స్వంత యూనిట్లకు అనువదించండి. సెకనుకు 30 ఫ్రేమ్ల వద్ద ఇరవై-రెండవ ఎపిసోడ్ 600 నిర్ణయ దశలు, మరియు T పైన ప్రతి సరిహద్దులో ఆ సంఖ్య. T = 600 వద్ద, T సంగా స్కేలింగ్ చేసే పదం మరియు T స్క్వేర్డ్ సంగా స్కేలింగ్ చేసే ఒక తేడా చెత్త విధానం నుండి కోలుకోవడం విధానం మరియు అవాస్తవం మధ్య తేడా.
చర్య చంకింగ్ సహాయపడటం పార్టు అందుకే: ఒక విధానం అనుమానం దశకు చర్యల చిన్న క్రమాన్ని విడుదల చేసినప్పుడు, నిర్ణయ పాయింట్ల సంఖ్య ఎక్కువ పడిపోయి, సమ్మేళన సంభవ చేసుకోవడానికి సంభవాల సంఖ్య సమక్షం. జావో, కుమార్, లెవిన్ మరియు ఫిన్ సమ్మేళన లోపాన్ని ట్రాన్స్ఫార్మర్ల సంగా చర్య చంకింగ్కు ప్రేరణగా పేర్కొంటారు, మరియు ఆరు కష్టమైన నిజమైన-ప్రపంచ విధానాలపై 80 నుండి 90 శాతం సఫల్యతను నివేదిస్తారు, తక్కువ-ఖర్చు బైమానువల్ హార్డ్వేర్పై, నిమిషాలకు ఉదాహరణల నుండి. చంకింగ్ సహచర విస్థాపనను చేయదు - స్థితులు నిర్ణయం స్వంత ఎక్కువ ఉంటాయి - కానీ ఇది సమర్థవంత క్షితిజం చిన్నతరం. చూడండి చర్య చంకింగ్ మరియు SO-100 అనుకరణ అభ్యాస గైడ్.
రెండవ అనువాదం ప్రగతి మెట్రిక్. విధానం స్వంత పంపిణీ కింద విధానం కొలవలేరు నేరుగా - ఆ అవసరం నిజమైన-వాస్తవ నిపుణ చర్యలు ప్రతి సందర్శించిన స్థితికి, విషయం మీరు ఉత్పత్తి తప్పించుకోవడానికి ప్రయత్నిస్తున్నారు. మానవ-గేట్ చేయబడిన లూప్ మీకు ఎక్కువ ఇస్తుంది జోక్యం రేటు: ఒక రన్లో ఫ్రేమ్ల భిన్నం ఎక్కువ మానవుడు చేపట్టిన సమక్ష. ఇది ప్రాక్సీ, మరియు ఇది కారణాలకు కారణమైనది విధానానికి సంబంధం లేని - ఓ రోగి ఆపరేటర్ తక్కువ జోక్యం. ఉపయోగించిన అస్థిరం, ఇది ఒక సంఖ్య ఒక రౌండ్ మధ్యాహ్నం విలువ ఉందో లేదో చెప్పుతుంది.
మూడవ అనువాదం డేటా-నాణ్యత హెచ్చరిక విశ్లేషణ కవర్ చేయదు. మండ్లెకార్ మరియు సహకారులు ఐదు అనుకరించిన మరియు మూడు నిజమైన-ప్రపంచ బహు-దశ తారుమారు విధానాలపై ఆరు ఆఫ్లైన్ అభ్యాస అల్గారిథమ్లను అధ్యయనం చేసారు, మరియు అల్గోరిథమిక్ డిజైన్ ఎంపికలకు సున్నితత్వం నివేదించారు, ప్రదర్శనల నాణ్యతపై ఆధారపడటం, మరియు ఆపే ప్రమాణం ద్వారా విచలనం. బెల్ఖాలె, కుయి మరియు సదీక్ డేటాసెట్ నాణ్యత చర్య విభేదం మరియు రవాణా వైవిధ్య మీ సమర్థ చేయవలసి ఉందని వాదించారు, మరియు స్థితి వైవిధ్యం ఎల్లప్పుడు ప్రయోజనకరం కాదని గమనించారు. DAgger రౌండ్ స్థితులను జోడిస్తుంది ఎవరూ ఇద్దరు ఎంచుకోలేదు: కొన్ని కోలుకోవడం డేటా మీకు అవసరం, కొన్ని రోబోట్ flailing మీరు తీసుకోవడం నియంత్రణ కోసం fumble సమక్ష.
యాంత్రికంగా రౌండ్ ఆరు దశలు: రికార్డింగ్ సంగా నిర్ణయం నడుపుటము, విధానం దుర్లక్ష్యం చేసినప్పుడు చేపట్టుకోవడం, రన్ సమీక్షించండి మరియు ప్రతిఒక్క ఎపిసోడ్ ఫైల్ చేయండి, సరిదిద్దుకోవడం సమన్వయం చేయండి, అసలు ప్లస్ సరిదిద్దుకోవడం నుండి మిశ్రిత డేటాసెట్ నిర్మించండి స్పష్టమైన ఎపిసోడ్ ఎంపిక ప్రతిఒక్క సోర్స్ కు చేయబడింది, మరియు ముందు నుండి శిక్షణ కొనసాగించండి చెక్పాయింట్ బేస్ మోడల్ కంటే. ay-robots లో ఆ దశలు బటన్ల గా ఉన్నాయి, ఇది నాళాలను తీసివేస్తుంది కానీ తీర్పులో కాదు. రెండు అంచెలు: చెక్పాయింట్ నుండి కొనసాగించడం బరువులను ప్రారంభిస్తుంది మరియు ఒక ఆప్టిమిజర్ పునరారంభం కాదు, మరియు నేత-చేయి ఆరోహణ కదలిక ఇంకా హార్డ్వేర్ను తేలికగా పరీక్షించారు. చూడండి శిక్షణ మరియు డేటాసెట్లు.
DAgger లూప్, ఇప్పటికీ కనెక్ట్ చేయబడ్డ
లైవ్ అనుమానం రన్ సమయంలో తీసుకోవడం, ప్రతి-ఫ్రేమ్ జోక్యం గుర్తు, సరిదిద్దుకోవడం లేదా మూల్యాంకనాలగా ఎపిసోడ్లను ఫైల్ చేయడం, స్పష్టమైన ఎపిసోడ్ ఎంపిక ప్రతిఒక్క సోర్స్ కు మిశ్రిత డేటాసెట్ నిర్మించడం, మరియు ఒక చెక్పాయింట్ నుండి శిక్షణ కొనసాగించడం అందరూ నిర్మిత. మీరు ఇంకా చేపట్టుకోవడం ఎప్పుడు మరియు ఏమి ఉంచాలో నిర్ణయించారు - ఆ భాగం స్వయంచాలక కాదు.
DAgger లూప్ ఎలా చేస్తుందో చూడండికుటుంబ చెట్టు, ఒక టేబుల్లో
| పద్ధతి | స్థితులను ఎవరు ఎంచుకుంటారు | నిపుణుడు సరఫర్రా ఏమిటి | ప్రధాన ఖర్చు |
|---|---|---|---|
| ఆచారణ సంచిక్రణ | నిపుణుడు | శుభ్రమైన ప్రదర్శనలు | కోలుకోవడం డేటా లేదు; లోపం T లో చతురస్రాకారంగా సమ్మేళనం చేయగలదు |
| ఫార్వర్డ్ శిక్షణ | శిక్షణార్థి, ప్రతి సమయ దశకు | ప్రేరేపించిన పంపిణీ సంగా లేబల్లు | T ప్రత్యేక విధానాలు; దీర్ఘ క్షితిజ కోసం ఉపయోగించలేనిది |
| SMILe / SEARN | నిపుణుడు మరియు శిక్షణార్థి యొక్క యాదృచ్ఛిక మిశ్రణ | మిశ్రణ యొక్క పంపిణీ సంగా లేబల్లు | మిశ్రణ భాగాలు నాణ్యత లో భిన్నం |
| DAgger | మిశ్రిత విధానం, బీటా సున్నాకు చిన్నతరం | సందర్శించిన ప్రతిఒక్క స్థితికి సరైన చర్య | నిపుణుడు ఎప్పుడూ ఉత్పత్తి చేయని లేబల్ స్థితులు, నియంత్రణలో లేనీ సమక్ష |
| DART | నిపుణుడు, చేర్చిన నోయిజ్ ద్వారా ఆందోళన | క్రమాంకనం చేయబడిన నోయిజ్ కింద ప్రదర్శనలు | నోయిజ్ శిక్షణార్థి యొక్క లోపానికి క్రమాంకనం చేయవలసి ఉంటుంది |
| HG-DAgger | మానవుడు చేపట్టుకోవడం వరకు శిక్షణార్థి | కేవలం మానవ-గేట్ చేయబడిన విభాగాలలో సరిదిద్దుకోవడం | మానవుడు ఎప్పుడు జోక్యం చేయాలో తీర్పు పై ఆధారపడుతుంది |
| SafeDAgger | శిక్షణార్థి, భద్రత గేట్ ద్వారా ఫిల్టర్ చేయబడినది | గేట్ అడిగినప్పుడు కేవలం లేబల్లు | గేట్ కూడా శిక్షణ చేయవలసి ఉంటుంది మరియు నమ్మవలసి ఉంటుంది |
తరచుగా అడిగిన ప్రశ్నలు
నా రోబోట్పై నిజానికి చతురస్రాకార లోపం వృద్ధిని పరిశీలిస్తానా?▾
శుభ్రమైన వక్రం కాదు. సరిహద్దు చెత్త సందర్భం: కొన్ని సమస్య దానిని అందిస్తుందని గట్టి, మీది చేయదని. మీరు చూసిన పరిణామం - కలిగి ఉన్న ఫ్రేమ్ల కు బాగా స్కోర్ చేసే విధానం, నిజమైన విధానం విఫలమయ్యింది, మరియు మీరు ఎక్కువ అదే రికార్డ్ చేసినప్పుడు మెరుగ్గా కాదు. ఆ ఎక్కువ శుభ్రమైన డేటా సహాయం ఆపిస్తుంది, ఆ సహచర విస్థాపన, డేటా-వాల్యూమ్ సమస్య కాదు.
దానిని DAgger పిలవడానికి నేను బీటా మిశ్రణ అమలు చేయవలసి ఉంటుందా?▾
పారామితి-రహిత సంస్కరణ - మొదటి రౌండ్లో నిపుణుడు, తరువాత స్వచ్ఛ శిక్షణార్థి - ఒక చట్టపరమైన ప్రత్యేక సందర్భం మరియు సాధారణంగా అసలు ప్రయోగాలలో ఉత్తమ కొర్తు. మీరు డ్రాప్ చేయలేనిది సమీకరణ: కేవలం సరికొత్త సరిదిద్దుకోవడం పై పునః శిక్షణ నేత అనుసరణ వ్యాఖ్య విచ్ఛిన్నం, ఆ ఎక్కడ పశ్చాత్తాపం లేని వాదన నుండి. సరిదిద్దుకోవడం ఒక కళ్ళకు శిక్షణ చాలా బలహీన విధానం.
చివరిది బదులుగా ధ్రువీకరణ సెట్లో ఉత్తమ విధానం ఎందుకు తిరిగి ఇవ్వాలి?▾
సిద్ధాంతాలు ఒక మంచి విధానం సిరీస్లో ఎక్కడో నిర్ధారిస్తుందని, చివరి పునరుక్తి కాదని - సరిహద్దు సిరీస్ కంటే కనిష్ఠంపై. చివరి రౌండ్ నుండి బయటకు వచ్చిన దానిని సరఫర్రా ఫలితం యొక్క ఆ అక్షర పరిస్థితి విసర్జించారు, మరియు చివరి రౌండ్ ఆదరణీయంగా ఉత్తమం కాదు.
నేను ఎన్ని రౌండ్ల కోసం ప్లాన్ చేయవలసి ఉంటుంది?▾
సిద్ధాంతం T క్రమంలో పునరుక్తులు కోరుకుంటుంది, 600-దశ ఎపిసోడ్ కోసం ఎవరూ హార్డ్వేర్పై నడిపే సంఖ్య కాదు. అసలు ప్రయోగాలు ప్రతిఒక్క బెంచ్మార్క్లో ఇరవై పునరుక్తులు నడిపారు. ఆచరణలో మీరు జోక్యం రేటు పడటం ఆపటం వరకు రౌండ్లు నడుపుటము, విశ్లేషణ సూచిస్తుంది సంఖ్య చాలా దిగువకు - సిద్ధాంతం మరియు ఆచరణ మధ్య నిజమైన గెప్.
నా విధానం విభాగం నిపుణుడిని సూచించలేకపోతే?▾
అప్పుడు DAgger మిమ్మల్ని సేవ చేయదు, మరియు సరిహద్దు చెప్పుకుంటుంది - ఇది epsilon_N కు సంబంధించి వ్యక్తమైనది, అసంభవ్యత లో విభాగంలో ఉత్తమ నష్టం. ఆ చెత్త ఆర్కిటెక్చర్, తప్పిపోయిన పరిశీలన లేదా దృశ్యం చూడలేని కెమెరా కారణం చెత్త అయితే, సమీకరణ మీకు విధానం ఇస్తుంది ఆ సరైన విభాగ లోపల విధానం చేయలేని. మీరు సరిదిద్దుకోవడం సేకరించే ముందు కలిగిన ఎపిసోడ్ల ఓపెన్-లూప్ పునరాభివృద్ధి నడుపుటము.
ఇక్కడ నుండి ఎక్కడికి వెళ్లాలి
మీరు ఇంకా విధానాన్ని శిక్షణ చేయకపోతే, ఈ సిద్ధాంతం పరిపక్వం లేనిది: ముందుగా డేటాసెట్ను రికార్డ్ చేయండి, నుండి ప్రారంభించి మీ మొదటి విధానాన్ని శిక్షణ చేయడం మరియు డెస్కటాప్ క్లయింట్. మీరు సరిదిద్దుకోవడం ప్రారంభించటకు వ్యతిరేకంగా మరొక నూరు శుభ్రమైన ప్రదర్శనలను పరిశీలిస్తూ ఉంటే: శుభ్రమైన ప్రదర్శనలు పంపిణీ సమస్యను సరిదిద్దుకోవడం లేదు. యాంత్రికత కోసం, కొనసాగించండి మానవ-గేట్ చేయబడిన వేరియంట్ ఆపై SO-100 వాక్-థ్రూ.
Sources
- Ross & Bagnell (2010): Efficient Reductions for Imitation Learning (AISTATS, PMLR v9)
- Ross, Gordon & Bagnell (2011): A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
- Ross, Gordon & Bagnell (2011), AISTATS proceedings version (PMLR v15, pp. 627-635)
- Pomerleau (1988): ALVINN - An Autonomous Land Vehicle in a Neural Network (NeurIPS)
- Daume III, Langford & Marcu (2009): Search-based Structured Prediction (SEARN)
- Laskey, Lee, Fox, Dragan & Goldberg (2017): DART - Noise Injection for Robust Imitation Learning
- Kelly, Sidrane, Driggs-Campbell & Kochenderfer (2018): HG-DAgger - Interactive Imitation Learning with Human Experts
- Zhang & Cho (2016): Query-Efficient Imitation Learning for End-to-End Autonomous Driving (SafeDAgger)
- Osa, Pajarinen, Neumann, Bagnell, Abbeel & Peters (2018): An Algorithmic Perspective on Imitation Learning
- Celemin et al. (2022): Interactive Imitation Learning in Robotics - A Survey
- Rajaraman, Yang, Jiao & Ramachandran (2020): Toward the Fundamental Limits of Imitation Learning
- Swamy, Choudhury, Bagnell & Wu (2021): Of Moments and Matching - A Game-Theoretic Framework for Closing the Imitation Gap
- Mandlekar et al. (2021): What Matters in Learning from Offline Human Demonstrations for Robot Manipulation (robomimic)
- Zhao, Kumar, Levine & Finn (2023): Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT)
- Belkhale, Cui & Sadigh (2023): Data Quality in Imitation Learning (NeurIPS)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started