రోబోట్ తారుమారు దృశ్యం యొక్క నైరూప్య చిత్రణ, అమలు సమయంలో నేర్చుకున్న విధానం సందర్శించే స్థితి పంపిణీని ఉదహరిస్తుంది
DAggerఅనుకరణ అభ్యాసంఆచారణ సంచిక్రణరోబోట్ అభ్యాసంసిద్ధాంతం

DAgger వివరించబడినది: ఆచారణ సంచిక్రణ ఎందుకు విచలనం చెందుతుంది మరియు డేటాసెట్ సమీకరణ వాస్తవానికి ఏమిని నిరూపిస్తుంది

AY-Robots ResearchAugust 27, 202615 నిమిషాల చదువు

ఆచారణ సంచిక్రణ నిపుణుల స్థితి పంపిణీపై ఒక విధానాన్ని సరిపోల్చుకుంది మరియు తరువాత దానిని స్వతంత్రంగా ప్రయోగించారు. ఆ రెండు పంపిణీల మధ్య అంతరం ఎందుకంటే ధ్రువీకరణలో సరిగ్గా కనిపించే విధానం ఆరోహణ 300 వద్ద టేబుల్ నుండి బయటకు వెళ్తుంది. ఇది మా DAgger సిరీస్ యొక్క సిద్ధాంత అధ్యాయం: చతురస్రాకార లోపం పదం ఎక్కడ నుండి వస్తుంది, డేటాసెట్ సమీకరణ ఏమిని మారుస్తుంది, పశ్చాత్తాపం లేని రుజువు ఏమిని సూచిస్తుంది, మరియు విల్లు యొక్క ఏ భాగం మానవ నిపుణుడు ఇంకా చెల్లించవలసి ఉంటుంది.

తారుమారు విధానాన్ని శిక్షణ చేసే ప్రతిఒక్కరు చెందా లేదా తరువాత ఎదుర్కొనే నిర్దిష్ట విఫలత ఉంది. విధానం క్యూబ్ కోసం చేరుకుంటుంది, రెండు సెంటీమీటర్ల లోపల ఉంటుంది, సంకోచం చెందుతుంది, పక్కకు విచలనం చెందుతుంది, ఆపై పనికి సంబంధం లేని ఏదో చేస్తుంది. ధ్రువీకరణ నష్టం బాగా ఉంది. కలిగి ఉన్న ఎపిసోడ్‌ల కూడా ఓపెన్-లూప్ పునరాభివృద్ధి బాగా ఉంది. ఇంకా చేయి శిక్షణ డేటాలో ఎక్కడా కనిపించని ఆసనంలో చివరికి చేరుకుంటుంది, మరియు అక్కడ నుండి దానికు చెప్పడానికి సంబంధితమైన ఏదీ లేదు.

ఆ విఫలతకు ఒక నామం మరియు దాని వెనుక ఒక స్థిరమైన సిద్ధాంత భాగం ఉంది. ఇది DAgger, మరియు ఇది వాదన కూడా కవర్ చేస్తుంది: ప్రదర్శనకారి యొక్క స్వంత పథాల పై విధానాన్ని సరిపోల్చుకోవడం ఎందుకు ఎపిసోడ్ పొడవు యొక్క చతురస్రంతో వృద్ధి చెందగలిగిన లోపాన్ని ఉత్పత్తి చేస్తుంది, డేటాసెట్ సమీకరణ ఏమిని మారుస్తుంది, మరియు పశ్చాత్తాపం లేని రుజువు ఏమిని వాగ్దానం చేయదు. నిజమైన హార్డ్‌వేర్‌లోని లూప్ కవర్ చేయబడింది SO-100 పై DAgger లూప్‌ను నడుపుటము, మానవ-గేట్ చేయబడిన వేరియంట్ HG-DAgger మరియు మానవ-గేట్ చేయబడిన జోక్యాలు, మరియు కొలత ప్రశ్న DAgger లూప్‌ను కొలవడం.

చిన్న సంస్కరణ

  • ఆచారణ సంచిక్రణ నిపుణుల స్థితి పంపిణీపై శిక్షణ చేస్తుంది మరియు విధానం యొక్క స్వంతంపై మూల్యాంకనం చేయబడుతుంది. సమస్యకరత ఎపిసోడ్ జరిగినప్పుడు సమ్మేళనం చేస్తుంది.
  • రాస్ మరియు బాగ్నెల్ అదనపు ఖర్చు T స్క్వేర్డ్ సార్లు ప్రతి-దశ లోపం గా విస్తరించగలదని చూపించారు; DAgger కాగితం ఆ సరిహద్దును పునరుద్ఘటిస్తుంది మరియు ఇది గట్టిగా ఉందని గమనించారు.
  • DAgger విధానం కూడా సందర్శించే స్థితుల లేబల్‌లు, మరియు ఇప్పటి వరకు సేకరించిన ప్రతి డేటాసెట్‌పై పునः శిక్షణ చేస్తుంది, కేవలం సరికొత్తది కాదు.
  • ఖాతర పశ్చాత్తాపం లేని ఆన్‌లైన్ అభ్యాసానికి తగ్గింపు: సమీకరణ మరియు పునः శిక్షణ నేత అనుసరణ.
  • ఇది విధానం విభాగంలో సాధించిన ఉత్తమ నష్టానికి సంబంధించి ఉంటుంది, సున్నాకు సంబంధించి కాదు - మరియు నిపుణుడు ఇంకా తయారు చేయని స్థితుల లేబల్ చేయవలసి ఉంటుంది.

ఆచారణ సంచిక్రణ నిశ్శబ్దంగా చేసే ఊహ

ప్రదర్శన డేటాసెట్ పరిశీలన-చర్య జతల సమూహం. ఆచారణ సంచిక్రణ సాధారణ పర్యవేక్షిత అభ్యాసంతో ఆ సమూహానికి ఒక ఫంక్షన్‌ను సరిపోల్చుకుంది మరియు అక్కడ ఆగిపోయింది. ఇది ఈ రంగంలో పురాతన ఆలోచన. పొమెర్లీ యొక్క ALVINN, 1988 లో, కెమెరా నుండి చిత్రాలను మరియు లేజర్ పరిధి ఫైండర్ నుండి తీసుకోసిన మరియు వాహనం ప్రయాణించవలసిన దిశను ఉత్పత్తి చేసిన త్రీ-పొర బ్యాక్-ప్రోపగేషన్ నెట్‌వర్క్. ఇది అనుకరించిన రోడ్ చిత్రాలపై శిక్షణ చేయబడింది మరియు కొన్ని క్షేత్ర పరిస్థితుల కింద నిజమైన రోడ్‌లను అనుసరించింది. రెసిపీ చాలా మారలేదు; నెట్‌వర్క్‌లు మారిపోయాయి.

ఆ జతలు ఎక్కడ నుండి వచ్చాయో చెక్ చేయడం వదిలివేయబడుతుంది. వాటిలో ప్రతిఒక్కటి ప్రదర్శనకారి ఉత్పత్తి చేసిన పథం మీద ఉంటుంది. మీరు ప్రయోగించే విధానం దానిని ఉత్పత్తి చేస్తుంది. ఇది విచలనం చెందిన క్షణం, శిక్షణ పంపిణీలో లేని స్థితుల గురించి ప్రశ్నించబడుతుంది, మరియు దాని సమాధానం దానిని మరింత బయటకు నెట్టివేస్తుంది. రాస్, గోర్డన్ మరియు బాగ్నెల్ DAgger కాగితాన్ని ఇదేవిధంగా తెరుస్తారు: క్రమానికర ఊహ i.i.d. సాంఖ్యక అభ్యాస కింద గీసిన ఊహను ఉల్లంఘిస్తుంది, ఎందుకంటే శిక్షణార్థి యొక్క స్వంత అంచనాలు దానికి తదుపరి చూసే ఇన్‌పుట్‌లను నిర్ణయిస్తాయి.

ఆ కాగితంలో స్పష్టమైన ఉదాహరణ రోబోట్ కాదు. సూపర్ మారియో బ్రదర్‌ల కోసం సమీప-సరైన ప్లానర్‌ను సంచిక్రణ చేయడం ఆటలో సూచనకు బదులుగా ఆటలో ఆటలో విఫలమయ్యే విధానాన్ని ఉత్పత్తి చేసింది. కారణం సమస్త వాదన ఒక వాక్యంలో: నిపుణుడు ఎల్లప్పుడు సుఖమైన దూరం నుండి దూకాడు, కాబట్టి డేటాసెట్‌లో మారియో ఆటలుకు చేపట్టిన స్థితి లేదు, కాబట్టి అతను ఆ విధంగా కూడా ఉన్నప్పుడు ఏమి చేయాలో లేబల్ లేదు.

మారియోను SO-100 చేయి కు మార్చండి మరియు నిర్మాణం ఒకేలా ఉంటుంది. మీ ప్రదర్శనలు శుభ్రమైన విధానం మరియు శుభ్రమైన పట్టును చూపుతాయి, గ్రిప్పర్ రెండు సెంటీమీటర్ల చిన్నదిగా మూసుకోవడం కాదు - కాబట్టి విధానం అక్కడ నుండి ఏమి చేయాలో ఆలోచన లేనిది, మరియు ఏ ఊహ ఉన్నప్పటికీ దానిని మరింత బయటకు తీసుకెళ్తుంది. సహచర విస్థాపన డేటా సేకరణ విధానం యొక్క ఆస్తి, నెట్‌వర్క్ ఆర్కిటెక్చర్ కాదు.

చతురస్రాకార పదం ఎక్కడ నుండి వస్తుంది

రాస్ మరియు బాగ్నెల్ యొక్క 2010 AISTATS కాగితం, అనుకరణ అభ్యాసం కోసం సమర్థ పరిమితులు, సమ్మేళనాన్ని ఖచ్చితంగా చేస్తుంది. T విధాన క్షితిజం, విధానం ఖర్చు యూనిట్ విరామంలో సరిహద్దు, మరియు విధానం నిపుణుల నుండి కొలిచిన ప్రత్యామ్నాయ నష్టం సరిహద్దు నిపుణుల స్థితి పంపిణీ - మీ ధ్రువీకరణ సెట్ నివేదించిన సంఖ్య. అప్పుడు ఆ విధానాన్ని T దశలకు నడుపుటము యొక్క అదనపు ఖర్చు, నిపుణికి సంబంధించి, T స్క్వేర్డ్ సార్లు విధానం ద్వారా సరిహద్దు. రాస్, గోర్డన్ మరియు బాగ్నెల్ ఇదిని DAgger కాగితంలో థియోరెమ్ 2.1 గా పునరుద్ఘటిస్తారు మరియు ముఖ్యమైన వాక్యాన్ని జోడిస్తారు: సరిహద్దు గట్టిగా ఉంటుంది. నిపుణుల పంపిణీపై విధానం నష్టంతో సమస్యలు T లో చతురస్రాకారంగా వృద్ధి చెందే అదనపు ఖర్చుకు నిజానికి సంభవిస్తాయి.

గట్టిగా సాధారణమైనది కాదు. చతురస్రాకార పదం సమస్యల విభాగంపై చెత్త సందర్భం, మీ పిక్-మరియు-ప్లేస్ విధానం గురించి అంచనా కాదు. ఇది స్థాపిస్తున్నది ఉంది మరంత నిపుణ ప్రదర్శన సమస్యను తొలగించలేము: ఇది విధానం పర్యవేక్షించనప్పుడు పంపిణీపై విధానం యొక్క అంచనాను మీకు నీరసపరుస్తుంది.

తప్పించిపోయే మార్గం అదే కాగితంలో, థియోరెమ్ 2.2 గా పునరుద్ఘటించబడింది. విధానం పతనం చెందినట్లయితే దాని స్వంత స్థితి పంపిణీ, మరియు ఒక్క చేపట్టిన చర్య నిపుణిలో చెల్లెందుకు అత్యధిక u ఖర్చులో ఆధారపడుతుంది, అదనపు ఖర్చు u సార్ల T సార్ల విధానం ద్వారా సరిహద్దు - క్షితిజ పరిధిలో సరళ. నిరంతర u ఆసక్తికరమైన పరిమాణం: నిపుణినకు 0-1 విభేదం కోసం సరిగ్గా 1, మరియు O(1) నిపుణుడు కొన్ని దశలలో కోలుకోగలిగినప్పుడు. చెత్త సందర్భంలో ఇది O(T), మరియు సరళ సరిహద్దు చతురస్రాకార కంటే బాగాలేదు.

సెట్టింగ్నిపుణి పై అదనపు ఖర్చుపై సరిహద్దుఇది దీపం మీద ఉంటుంది
ఆచారణ సంచిక్రణ (రాస్ మరియు బాగ్నెల్ 2010, రాస్ మరియు ఇతరులు 2011 లో థియోరెమ్. 2.1 గా పునరుద్ఘటించబడినది)T స్క్వేర్డ్ సార్లు విధానంనిపుణుల స్థితి పంపిణీపై కొలిచిన విధానం; [0,1] లో ఖర్చు; సరిహద్దు గట్టిగా ఉంటుంది
దాని స్వంత పంపిణీ (థియోరెమ్. 2.2) క్రింద విధానం నష్టంతో ఏదైనా విధానంu సార్లు T సార్లు విధానంu ఒక చేపట్టిన చర్య యొక్క చెల్లెందుకు శిక్ష సరిహద్దుకు పరిమితం; 0-1 నష్టం కోసం సరిగ్గా 1, O(T) చెత్త సందర్భం
ఫార్వర్డ్ శిక్షణ (రాస్ మరియు బాగ్నెల్ 2010)u సార్లు T సార్లు విధానంప్రతి సమయ దశకు ఒక విధానం; T విధానాలు మరియు ఒక తెలిసిన, పరిమిత T అవసరమైనది
SMILe (రాస్ మరియు బాగ్నెల్ 2010)సమస్య నిర్దిష్ట తరగతులపై T మరియు విధానం లో సమీప-సరళalpha O(1/T స్క్వేర్డ్) లో, N O(T స్క్వేర్డ్ log T) లో; ఒక యాదృచ్ఛిక మిశ్రణాన్ని ఇస్తుంది
DAgger (థియోరెమ్. 3.2, రాస్ మరియు ఇతరులు 2011)u సార్లు T సార్లు విధానం_N, ప్లస్ O(1)N uT క్రమంలో; బలంగా కుంభాకార సరిహద్దు నష్టం; పశ్చాత్తాపం లేని శిక్షణార్థి; విధానం_N అనేది అసంభవ్యత లో ఉత్తమ నష్టం
రోబోట్ కార్యక్షేత్రం విధానం సందర్శించే స్థితులను సూచిస్తుంది ఇది ప్రదర్శన సెట్‌లో ఎక్కడా కనిపించలేదు
DAgger రౌండ్‌కు ముఖ్యమైన స్థితులు ఎవరూ ప్రదర్శించనివి: సమీప-మిస్ గ్రాస్, సగం-ఓపెన్ గ్రిప్పర్, వస్తువు గతం చేయి.

DAgger కు ముందు వచ్చిన రెండు ప్రయత్నాలు

ఫార్వర్డ్ శిక్షణ సత్యమైన కానీ అవాస్తవమైన సమాధానం. ప్రతి సమయ దశకు ప్రత్యేక విధానాన్ని శిక్షణ చేయండి, క్రమంలో, ప్రతిఒక్కటి ఇదివరకు సరిపోల్చిన విధానాల ద్వారా ప్రేరేపించిన స్థితి పంపిణీపై, కాబట్టి ప్రతి విధానం ఎక్కువ పంపిణీని ఉంచుకుంటుంది చూసేందుకు ఉంటుంది. ఈ క్యాచ్ వివరణలో ఉంది: T విధానాలు, క్రమానికరంగా శిక్షణ చేయబడినవి, ఆచిరిగా నిలిచిపోవడం లేదు. ఒక తారుమారుకు ఎపిసోడ్ సెకనుకు 30 ఫ్రేమ్‌ల వద్ద, T నూటలలో ఉంది.

SMILe, అదే కాగితం నుండి, మరియు SEARN, డాউమ్, లాంగ్‌ఫోర్డ్ మరియు మర్కు యొక్క నిర్మిత అంచనా కార్యపై ఇతర మార్గం: ఒక స్థిర విధానం, కానీ యాదృచ్ఛిక. ప్రతి పునరుక్తి ఒక భాగాన్ని శిక్షణ చేస్తుంది మరియు ఆ మిశ్రణకు జోడిస్తుంది, సంభావ్యత ద్రవ్యరాశిని నిపుణి నుండి దూరంగా మార్చుతుంది. ఫలితం ఒక మిశ్రణ ఇందులో కొన్ని భాగాలు ఇతరులకంటే చెత్తవి - ఒక భౌతిక చేయిపై, ఒక నియంత్రకం ఆటలు-కదలిక మధ్య చెత్త భాగాన్ని నమూనా చేయగలదు. ఒక స్థిర విధానాన్ని కోరుకునే చెప్పిన ప్రేరణ నిర్ధారక విధానం బదులుగా.

DAgger: ఒక ఆలోచన, ఒక పెట్టె

డేటాసెట్ సమీకరణ నిర్ధారక విధానాన్ని ఉంచుకుంటుంది మరియు సరిదిద్దుకోవడాన్ని డేటా సేకరణలో తరలిస్తుంది. ప్రతి రౌండ్: ప్రస్తుత విధానాన్ని పెరిగేందుకు, సందర్శించే స్థితులను రికార్డ్ చేయండి, నిపుణుని ఒక్కోటిలో సరైన చర్య ఏమిటిని అడగండి, ఆ జతలను మీరు ఇప్పటికే ఉన్న డేటాసెట్‌కు జోడించండి, యూనియన్‌లో పునः శిక్షణ చేయండి. పేరు అల్గారిథమ్ - మీరు సమీకరణ చేస్తారు, మీరు ఎప్పుడూ విసర్జించరు.

text
D            <- {}                      # the aggregate dataset
pi_hat_1     <- any policy in Pi

for i = 1 .. N:
    pi_i  = beta_i * expert  +  (1 - beta_i) * pi_hat_i
    roll out pi_i for T steps, record every visited state s
    D_i   = { (s, expert(s))  for every visited state s }
    D     = D  union  D_i               # aggregate, do not replace
    pi_hat_{i+1} = train on all of D

return the best pi_hat_i on a validation set
DAgger మెటా-అల్గారిథమ్, రాస్, గోర్డన్ మరియు బాగ్నెల్ (2011) యొక్క అల్గారిథమ్ 3.1.

మూడు వివరాలు అవి కనిపించే దానికంటే ఎక్కువ బరువు తీసుకుంటాయి. లేబల్‌లు మిశ్రిత విధానం సందర్శించే స్థితుల కోసం ఉన్నాయి, కానీ చర్యలు నిపుణి నుండి వస్తాయి - విధానం ప్రశ్నలను అందిస్తుంది, నిపుణుడు సమాధానలు. పునः శిక్షణ సమస్త సమీకరణపై ఉంది, ఇది ప్రతి రౌండ్‌ను నేత అనుసరణ దశ చేస్తుంది: రౌండ్ n వద్ద మీరు ఇప్పటి వరకు ప్రతి పథం లో అసంభవ్యత లో ఉత్తమ విధానాన్ని ఎంచుకుంటారు. ఆ ఫ్రేమింగ్ రుజువు వేలాడుకోవడం. మరియు అల్గారిథమ్ ధ్రువీకరణ సెట్‌లో ఎంచుకున్న సిరీస్‌లో ఉత్తమ విధానాన్ని తిరిగి ఇవ్వడం ద్వారా ముగుస్తుంది, ఎందుకంటే సిద్ధాంతాలు తెలుసుకుంటాయి కొన్ని సిరీస్‌లో విధానం ఒడ్డయ, చివరిది కాదు.

బీటా షెడ్యూల్, మరియు ఇది ట్యూనింగ్ నాబ్ ఎందుకు కాదు

మిశ్రిత విధానం beta_i సార్ల నిపుణుడు ప్లస్ ఒక మైనస్ beta_i సార్ల శిక్షణార్థి. పాయింట్ ఆచరణీయం: మొదటి కొన్ని నేర్చుకున్న విధానాలు చాలా తక్కువ డేటాపై శిక్షణ చేయబడతాయి, చాలా లోపాలు చేస్తాయి, లేకపోతే రోల్‌ఔట్ ఆ స్థితులలో ఖర్చు చేస్తాయి ఇది విధానం మెరుగ్గా ఉంటే ఇక చెల్లనిది.

సిద్ధాంతం సరిగ్గా ఒక పరిస్థితిని విధిస్తుంది: బీటాస్ యొక్క నడుస్ విధానం సున్నాకు వెళ్లాలి. విశ్లేషణ beta_i తో సరిహద్దు (1 - alpha) యొక్క శక్తి i-1 కు, స్థిరమైన alpha స్వతంత్రమైన T కోసం.

షెడ్యూల్ఇది ఏమి చేస్తుందిఆ కాగితం నివేదిస్తుంది
beta_1 = 1మొదటి రౌండ్ స్వచ్ఛ నిపుణ ప్రదర్శన; ప్రారంభిక విధానం అవసరం లేదుప్రతి వేరియంట్‌లో సిఫార్సు చేయబడిన ప్రారంభ బిందువు
beta_i = 1 i = 1 అయితే, లేకపోతే 0మొదటి రౌండ్‌లో కేవలం నిపుణుడు; ఉచిత పారామితి లేదుఆ కాగితం యొక్క పారామితి-రహిత సంస్కరణ, ఇది చెప్పిన ఆచరణలో తరచుగా ఉత్తమమైనది; 20 పునరుక్తుల తర్వాత సూపర్ మారియో బ్రదర్‌లపై 2980
beta_i = p^(i-1) p = 0.5 కునిపుణ సంభావ్యత జ్యామితిసంబంధమైనంగా క్షయంఅదే బెంచ్‌మార్క్‌పై 3030, పారామితి-రహిత సంస్కరణ కంటే కొద్దిగా ముందు
beta_i = p^(i-1) p = 0.9 కునిపుణుడు లూప్‌లో చాలా ఎక్కువ సమయం ఉంటాడుగుర్తించదగ్గ నెమ్మది కలయిక; 20 పునరుక్తులు ముగిసినప్పుడు కూడా మెరుగ్గా ఉంటుంది

సుమారుగా 4300 వరకు నడిచే స్కేల్‌పై 2980 మరియు 3030 మధ్య అంతరం చిన్నది, కానీ ఆ కాగితం యొక్క ఆ వివరణ విభాగంలో చాలా ఉపయోగకరమైన ఆచరణాత్మక గమనిక. పారామితి-రహిత షెడ్యూల్ సహాయంతో, మారియో ఆరంభానికి అదే స్థానంలో ఫిక్సయ్యాడు మరియు ఆ ఒక చర్చపై నుండి సమీప-నకిలీ డేటా సమూహాన్ని ఉత్పత్తి చేసాడు; నిపుణుడిని సమయం భిన్నాన్ని నడపనివ్వడం దాని నుండి రెండూ విడిచిపెట్టారు మరియు రాష్ట్రాల వైవిధ్యం విస్తరించారు. షెడ్యూల్ మిశ్రణ నిష్పత్తి గురించి కంటే మీ డేటా సేకరణ కొత్త స్థితులను ఉత్పత్తి చేస్తూ ఉందా లేదా అదే విఫలత గురించి తక్కువ.

ష్చెడ్యూల్ ఎందుకు వ్రాసిన విధంగా భౌతిక చేయికి బదిలీ కాదు

ఒక యాదృచ్ఛిక ప్రతి-సమయ దశ మిశ్రణ నియంత్రణ రేటుపై నియంత్రణ అధికారాన్ని మార్చడం, సాధారణ SO-100 సెట్‌ఆప్‌లో సెకనుకు 30 సార్లు. టెలిఓపరేషన్ ఇంటర్‌ఫేస్ ఏదీ దానిని సురక్షితం లేదా అర్థవంతం చేయదు. నిజమైన హార్డ్‌వేర్‌లో బీటా షెడ్యూల్ ఒక మానవ నిర్ణయానికి ఎప్పుడు చేపట్టాలి: వేరే సిద్ధాంతం కలిగిన వేరే అల్గారిథమ్.

ఖాతర: పశ్చాత్తాపం లేని ఆన్‌లైన్ అభ్యాసానికి తగ్గింపు

ఇక్కడ కాగితాన్ని చేసే కదలిక. ప్రతి DAgger రౌండ్‌ను ఆన్‌లైన్ అభ్యాస సమస్యలో ఒక ఉదాహరణగా పరిగణించండి, ఇక్కడ రౌండ్ i వద్ద నష్టం రౌండ్ i వద్ద ఉపయోగించిన విధానం యొక్క స్థితి పంపిణీ కింద ప్రత్యామ్నాయ నష్టం. శిక్షణార్థి ఆ నష్టాన్ని చూసే ముందు విధానానికి నిశ్చితార్థం చేస్తారు, మరియు సిరీస్ నిర్వాహకం కాదు ఎందుకంటే ఇది ఇప్పటి వరకు ఉత్పత్తి చేయబడిన విధానాలపై ఆధారపడుతుంది.

ఒక అల్గారిథమ్ పశ్చాత్తాపం లేనిది N రౌండ్‌ల నుండి సగటు నష్టం అసంభవ్యత లో ఉత్తమ ఏకైక విధానానికి చేరుకుంటే. నేత అనుసరణ బలంగా కుంభాకార నష్టాలపై ఆ అల్గారిథమ్, సగటు పశ్చాత్తాపం 1/N యొక్క క్రమంలో చిన్న - మరియు పూర్తి సమీకరణ పై పునः శిక్షణ సరిగ్గా నేత అనుసరణ. ఏదైనా ఇతర పశ్చాత్తాపం లేని శిక్షణార్థి కూడా సేవ చేస్తారు: విశ్లేషణ తగ్గింపు, ఒక ఆప్టిమిజర్ ఆస్తి కాదు.

ఒక లెమ్మ డేటాను సేకరించిన మిశ్రిత విధానం మరియు అంతర్భాగం చేయబడిన నేర్చుకున్న విధానం మధ్య అంతరాన్ని చేపట్టుకుంటుంది: లెమ్మ 4.1 వారి స్థితి పంపిణీల మధ్య L1 దూరాన్ని 2 T beta_i ద్వారా సరిహద్దు. ఎందుకంటే బీటాలు చిన్నవిగా ఉండాలి - నిపుణుడు ఇప్పటికీ గణనీయమైన నియంత్రణ అధికారాన్ని కలిగి ఉంటాడు, మీరు సేకరించిన స్థితులు మీ విధానం ఉత్పత్తి చేస్తుంది అంటారు కాదు. లెమ్మని పశ్చాత్తాపం సరిహద్దుతో సంయోగించండి మరియు ప్రధాన ఫలితం అనుసరిస్తుంది: సుమారుగా T పునరుక్తుల తర్వాత, సిరీస్‌లో కొన్ని విధానం దాని స్వంత పంపిణీ క్రింద ప్రత్యామ్నాయ నష్టం O(1/T) యొక్క epsilon_N లో ఉంటుంది. దానిని సరళ సరిహద్దులో చేయండి మరియు మీరు థియోరెమ్ 3.2 వద్ద ల్యాండ్ చేస్తారు.

అనుభవిక వైపు ప్రస్తుత ప్రమాణాల ద్వారా సాధారణమైనది. సూపర్ టక్స్ కార్ట్‌లో పర్యవేక్షిత ఆధారం మరింత డేటా రావడంతో ఎక్కువ ప్రతి ల్యాప్ ఖాళీలను మెరుగ్గా చేయలేదు, DAgger పదిహేను పునరుక్తుల తర్వాత ట్రాక్‌ను ఎక్కువ పడని విధానాన్ని చేరుకున్నారు, మరియు SMILe ఇరవై తర్వాత ఇంకా ప్రతి ల్యాప్‌కు సుమారుగా రెండుసార్లు పడ్డారు. హస్తలిపి బెంచ్‌మార్క్‌లో, అక్షర ఖచ్చితత్వం నిర్మాణం లేకుండా 82 శాతం, 83.6 శాతం పర్యవేక్షిత, DAgger తో 85.5 శాతం నడిచింది. వీటిలో ఏదీ తారుమారు ఫలితం కాదు.

రుజువు ఏమిని వాగ్దానం చేయదు

సిద్ధాంత ప్రకటనలు షరతులతో కూడినవి, మరియు పరిస్థితులు బరువు వహిస్తాయి.

DAgger ఖాతర, దగ్గరగా చదువండి
ఇది మీకు ఏమిస్తుంది
  • T లో సరళ విధానం చతురస్రాకార కంటే, చెప్పిన ఊహలు లోపల.
  • యాదృచ్ఛిక మిశ్రణ కంటే నిర్వాహకం నిర్ధారక విధానం.
  • నిజమైన తగ్గింపు: ఏదైనా పశ్చాత్తాపం లేని ఆన్‌లైన్ శిక్షణార్థి స్లాట్‌లు.
  • ఖచ్చితమైన పునరుక్తి సంఖ్య - పశ్చాత్తాపం పదం ముఖ్యమైనదిగా ఆగిపోయే ముందు సుమారుగా T రౌండ్‌లు.
  • సిరీస్‌లో కనీసం ఒక విధానానికి ఖాతర, కాబట్టి సముమ్మక ధ్రువీకరణ పాస్.
ఇది మీకు ఏమిస్తుందో కాదు
  • ఇది epsilon_N కు సంబంధించినది, అసంభవ్యత లో విభాగంలో ఉత్తమ నష్టం, సున్నాకు కాదు. మీ విభాగం నిపుణుడిని సూచించలేకపోతే, ఇది ఆచరణలో ఖాళీ.
  • ఇది పశ్చాత్తాపం లేని పద్ధతి లేదా బలంగా కుంభాకార ప్రత్యామ్నాయ నష్టం - ఇది నిర్మిస్తున్న వర్గీకరణ తగ్గుదల కంటే బలంగా, రచయితలు గమనించినట్లుగా.
  • స్థిరమైన u చెత్త సందర్భంలో O(T) కావచ్చు, మరియు సరళ సరిహద్దు సరిగ్గా చతురస్రాకారానికి తిరిగి కూలిపోతుంది.
  • ఇది పునరుక్తులను సరిహద్దుకు చేస్తుంది, నిపుణ లేబల్‌లు కాదు. రోబోట్‌పై, లేబల్‌లు బడ్జెట్.
  • ఇది నిపుణుడిని ప్రతి సందర్శించిన స్థితిలో అడగవచ్చునని మరియు అక్కడ సరిగ్గా సమాధానమిస్తారని ఊహిస్తుంది. ఆ ఊహ మొత్తం ఖర్చు.

ఒక మరు ఫలితం తరచుగా రిఫ్యూటేషన్‌గా పట్టిపట్టుకుంటారు మరియు ఒక లేదు. రాజారామన్, యాంగ్, జియో మరియు రామచందర్ సంపర్కిత MDPs లో అనుకరణ అభ్యాసం యొక్క మినిమాక్స్ పరిమితులను పరిమిత స్థితి స్పేస్ S మరియు క్షితిజ H తో అధ్యయనం చేస్తారు, మరియు |S| H స్క్వేర్డ్ N కంటే ఆర్డర్ మీద సుబోప్టిమాలిటీ లోअ సరిహద్దును నిరూపిస్తారు ఎమ్‌డిపి అధ్యయనం చేసేటప్పుడు కూడా, మరియు ఇది చెత్త-కేసు రేటు ఒక నిర్ణీత ఎపిసోడ్ బడ్జెట్‌ను ఒక MDP స్థాయిలో, మరియు ఇది తిరస్కరించేది ఇంటరాక్షన్ మినిమాక్స్ రేటు మెరుగ్గా చేస్తుందనే ఆలోచన; DAgger యొక్క సిద్ధాంతం వేరే ప్రకటన, దాని స్వంత విధానం విభాగం సాధించగలిగినదానికి సంబంధించి అంతర్ భాగం విధానాన్ని సరిహద్దుకు చేస్తుంది.

స్వామి, చౌధరి, బాగ్నెల్ మరియు వూ తరువాత ఆ అల్గారిథమ్‌లను నిపుణుల ప్రవర్తన యొక్క ఎన్ని క్షణాలను వర్గీకరించారు, మరియు ఒక క్షణం పునరుద్ధారణ యొక్క భావన ప్రవేశపెట్టారు ఇది ప్రతిఒక్క కుటుంబం సమ్మేళన లోపాన్ని ఎంత బాగా తగ్గిస్తుందో సరిహద్దుకు చేస్తుంది. ఓసా మరియు సెలెమిన్ ద్వారా సర్వేలు అల్గోరిథమిక్ ల్యాండ్‌స్కేప్ మరియు మానవ-ఫీడ్‌బ్యాక్ ఇంటర్‌ఫేస్‌లను కవర్ చేస్తాయి.

బిల్లు: నిపుణుడు ఎప్పుడూ ఉత్పత్తి చేయని లేబల్ స్థితులు

పైన ఉన్న సమస్త నిపుణుడిని ఊహిస్తుంది ఎక్కడ అయితే చేయవచ్చు. అనుకరణలో ఒక ప్లానర్ అది సుమారుగా ఉచితం - మారియో ప్రయోగాలు గేమ్ స్థితికి పూర్తి ప్రాప్యతకు సమీప-సరైన ప్లానర్‌ను ఉపయోగించారు. రోబోట్‌లో మానవ సమక్షం ఇది ప్రధాన ఖర్చు, మరియు ఎక్కువ అందం: మానవుడు సరైన చర్య ఒక కాన్ఫిగరేషన్‌లో ఉత్పత్తి చేయాలి వారి స్వంత సామర్థ్యం ఎప్పుడూ సృష్టించలేదు.

కెల్లీ, సిద్రానె, డ్రిగ్‌స్-కాంపబెల్ మరియు కోచెండర్‌ఫర్ HG-DAgger కాగితంలో సరిగ్గా ఆక్షేపణను రూపొందిస్తారు. వనిల్లా DAgger నిపుణుడు చర్య లేబల్‌లను సరఫర్రాచేయవలసి ఉంది సిస్టమ్‌పై పూర్తిగా నియంత్రణలో లేనీ. ఇది భద్రత కోసం తగ్గిస్తుంది, మరియు మానవ నిపుణులతో సేకరించిన లేబల్‌ల నాణ్యతను పచ్చబట్టాల సంభావ్యత, ఎక్కువ కనిపించే యాక్టుయేటర్ పిండికు. బ్యాక్‌లో మీరు పొందిన లేబల్ అల్గారిథమ్ ఊహించిన లేబల్ కాదు.

లాస్కీ మరియు సహకారులు DART సంగా సమస్యను సాధించారు, మరియు వారి ఫ్రేమింగ్ నిస్సంగం: విధానం పర్యవేక్షణ నిపుణులకు సెమిక్రియమైన, గణనీయ బరువులు జోడించండి, మరియు శిక్షణ సమయంలో ప్రమాదకరమైన స్థితులను సందర్శించవచ్చు. వారి ప్రత్యామ్నాయం పర్యవేక్షకుల స్వంత ప్రదర్శనలలో క్రమాంకనం చేయబడిన నోయిజ్‌ను చేర్చుతుంది, కాబట్టి కోలుకోవడం ప్రదర్శించబడుతుంది రోబోట్ ఎప్పుడూ విశ్వసించని విధానాన్ని నడిపోకుండా. MuJoCo హ్యూమనాయిడ్‌లో వారు DART నివేదించారు శిక్షణ సమయంలో పర్యవేక్షకుల సంచిత నిమజ్జనాన్ని 5 శాతం ద్వారా తగ్గిస్తుంది, DAgger సంపాదిస్తుంది పర్యవేక్షకుల కంటే 80 శాతం తక్కువ సంచిత నిమజ్జనం కలిగిన విధానాలు; టయోటా HSR సంగా చిందిలో గ్రాస్‌చేయడం, ఆచారణ సంచిక్రణ పైన సగటు 62 శాతం పెరుగుదల.

జాంగ్ మరియు చో యొక్క SafeDAgger సూచన విధానానికి ప్రశ్నలను ఆశ్చర్యకరమైన సంపద గా పరిగణిస్తుంది: ఒక ప్రత్యేక భద్రత విధానం, ప్రశ్న చేయకుండా, ప్రాధమిక విధానం సూచన నుండి ఒక సరిహద్దు పైకు విచలనం సేసుకోవడం జరుగుతుందో లేదో ఊహిస్తుంది, మరియు కేవలం ఆ స్థితులను వారసుతారు. మూడూ అదే వాస్తవానికి ప్రతిస్పందిస్తాయి - DAgger విశ్లేషణ నిపుణ లేబల్‌ల కోసం ఖర్చు చేయదు, మరియు నిజం చాలా ఎక్కువ ఖర్చు చేస్తుంది.

ఎవరూ మీకు హెచ్చరించని భాగం

ఆఫ్-డిస్ట్రిబ్యూషన్ స్థితుల లేబలింగ్ విధానాన్ని ప్రదర్శించడం కంటే మానసికంగా కష్టం. సాధారణ ప్రదర్శన మీరు ఇప్పటికే ఉన్న మోటారు ప్లాన్‌ను అమలు చేస్తుంది. ఒక గ్రిప్పర్‌ను ఎక్కడా నీవు చేయనివిధంగా ఒక విధానాన్ని సరిదిద్దుకోవడం స్పాట్‌లో కోలుకోవడాన్ని నిర్మించడం అర్థం, సమయ ఒత్తిడిలో, రోబోట్ ఇంకా కదులుతున్న సమక్ష. సంగ్రహ రికార్డింగ్ సెషన్‌కు కంటే సెషన్ కు న్యూనతర ఉపయోగ నిమిషాలు ఆశిస్తారు, మరియు ఒక కోర్సులో మీ స్వంత సరిదిద్దుకోవడ నాణ్యత క్షీణతను చూడండి.

LeRobot డేటాసెట్ నిర్మాణం డిస్క్‌లో నిల్చిన ఎపిసోడ్‌లు, ఫ్రేమ్‌లు మరియు ప్రతి-ఫ్రేమ్ నిలువు వరుసలను చూపుతుంది
సరిదిద్దుకోవడం డేటాసెట్‌గా మారుతుంది కేవలం జోక్యం ఫ్రేమ్‌లు గుర్తించిన తర్వాత - LeRobot ఫార్మాట్‌లో, పరిశీలన మరియు చర్య పక్కన ప్రతి-ఫ్రేమ్ నిలువు వరుస.

ఇది మీ డెస్క్‌పై SO-100 కోసం అర్థం

క్షితిజం మీ స్వంత యూనిట్‌లకు అనువదించండి. సెకనుకు 30 ఫ్రేమ్‌ల వద్ద ఇరవై-రెండవ ఎపిసోడ్ 600 నిర్ణయ దశలు, మరియు T పైన ప్రతి సరిహద్దులో ఆ సంఖ్య. T = 600 వద్ద, T సంగా స్కేలింగ్ చేసే పదం మరియు T స్క్వేర్డ్ సంగా స్కేలింగ్ చేసే ఒక తేడా చెత్త విధానం నుండి కోలుకోవడం విధానం మరియు అవాస్తవం మధ్య తేడా.

చర్య చంకింగ్ సహాయపడటం పార్టు అందుకే: ఒక విధానం అనుమానం దశకు చర్యల చిన్న క్రమాన్ని విడుదల చేసినప్పుడు, నిర్ణయ పాయింట్‌ల సంఖ్య ఎక్కువ పడిపోయి, సమ్మేళన సంభవ చేసుకోవడానికి సంభవాల సంఖ్య సమక్షం. జావో, కుమార్, లెవిన్ మరియు ఫిన్ సమ్మేళన లోపాన్ని ట్రాన్‌స్‌ఫార్‌మర్‌ల సంగా చర్య చంకింగ్‌కు ప్రేరణగా పేర్కొంటారు, మరియు ఆరు కష్టమైన నిజమైన-ప్రపంచ విధానాలపై 80 నుండి 90 శాతం సఫల్యతను నివేదిస్తారు, తక్కువ-ఖర్చు బైమానువల్ హార్డ్‌వేర్‌పై, నిమిషాలకు ఉదాహరణల నుండి. చంకింగ్ సహచర విస్థాపనను చేయదు - స్థితులు నిర్ణయం స్వంత ఎక్కువ ఉంటాయి - కానీ ఇది సమర్థవంత క్షితిజం చిన్నతరం. చూడండి చర్య చంకింగ్ మరియు SO-100 అనుకరణ అభ్యాస గైడ్.

రెండవ అనువాదం ప్రగతి మెట్రిక్. విధానం స్వంత పంపిణీ కింద విధానం కొలవలేరు నేరుగా - ఆ అవసరం నిజమైన-వాస్తవ నిపుణ చర్యలు ప్రతి సందర్శించిన స్థితికి, విషయం మీరు ఉత్పత్తి తప్పించుకోవడానికి ప్రయత్నిస్తున్నారు. మానవ-గేట్ చేయబడిన లూప్ మీకు ఎక్కువ ఇస్తుంది జోక్యం రేటు: ఒక రన్‌లో ఫ్రేమ్‌ల భిన్నం ఎక్కువ మానవుడు చేపట్టిన సమక్ష. ఇది ప్రాక్సీ, మరియు ఇది కారణాలకు కారణమైనది విధానానికి సంబంధం లేని - ఓ రోగి ఆపరేటర్ తక్కువ జోక్యం. ఉపయోగించిన అస్థిరం, ఇది ఒక సంఖ్య ఒక రౌండ్ మధ్యాహ్నం విలువ ఉందో లేదో చెప్పుతుంది.

మూడవ అనువాదం డేటా-నాణ్యత హెచ్చరిక విశ్లేషణ కవర్ చేయదు. మండ్లెకార్ మరియు సహకారులు ఐదు అనుకరించిన మరియు మూడు నిజమైన-ప్రపంచ బహు-దశ తారుమారు విధానాలపై ఆరు ఆఫ్‌లైన్ అభ్యాస అల్గారిథమ్‌లను అధ్యయనం చేసారు, మరియు అల్గోరిథమిక్ డిజైన్ ఎంపికలకు సున్నితత్వం నివేదించారు, ప్రదర్శనల నాణ్యతపై ఆధారపడటం, మరియు ఆపే ప్రమాణం ద్వారా విచలనం. బెల్‌ఖాలె, కుయి మరియు సదీక్ డేటాసెట్ నాణ్యత చర్య విభేదం మరియు రవాణా వైవిధ్య మీ సమర్థ చేయవలసి ఉందని వాదించారు, మరియు స్థితి వైవిధ్యం ఎల్లప్పుడు ప్రయోజనకరం కాదని గమనించారు. DAgger రౌండ్ స్థితులను జోడిస్తుంది ఎవరూ ఇద్దరు ఎంచుకోలేదు: కొన్ని కోలుకోవడం డేటా మీకు అవసరం, కొన్ని రోబోట్ flailing మీరు తీసుకోవడం నియంత్రణ కోసం fumble సమక్ష.

యాంత్రికంగా రౌండ్ ఆరు దశలు: రికార్డింగ్ సంగా నిర్ణయం నడుపుటము, విధానం దుర్లక్ష్యం చేసినప్పుడు చేపట్టుకోవడం, రన్ సమీక్షించండి మరియు ప్రతిఒక్క ఎపిసోడ్ ఫైల్ చేయండి, సరిదిద్దుకోవడం సమన్వయం చేయండి, అసలు ప్లస్ సరిదిద్దుకోవడం నుండి మిశ్రిత డేటాసెట్ నిర్మించండి స్పష్టమైన ఎపిసోడ్ ఎంపిక ప్రతిఒక్క సోర్స్ కు చేయబడింది, మరియు ముందు నుండి శిక్షణ కొనసాగించండి చెక్‌పాయింట్ బేస్ మోడల్ కంటే. ay-robots లో ఆ దశలు బటన్‌ల గా ఉన్నాయి, ఇది నాళాలను తీసివేస్తుంది కానీ తీర్పులో కాదు. రెండు అంచెలు: చెక్‌పాయింట్ నుండి కొనసాగించడం బరువులను ప్రారంభిస్తుంది మరియు ఒక ఆప్టిమిజర్ పునరారంభం కాదు, మరియు నేత-చేయి ఆరోహణ కదలిక ఇంకా హార్డ్‌వేర్‌ను తేలికగా పరీక్షించారు. చూడండి శిక్షణ మరియు డేటాసెట్‌లు.

DAgger లూప్, ఇప్పటికీ కనెక్ట్ చేయబడ్డ

లైవ్ అనుమానం రన్ సమయంలో తీసుకోవడం, ప్రతి-ఫ్రేమ్ జోక్యం గుర్తు, సరిదిద్దుకోవడం లేదా మూల్యాంకనాలగా ఎపిసోడ్‌లను ఫైల్ చేయడం, స్పష్టమైన ఎపిసోడ్ ఎంపిక ప్రతిఒక్క సోర్స్ కు మిశ్రిత డేటాసెట్ నిర్మించడం, మరియు ఒక చెక్‌పాయింట్ నుండి శిక్షణ కొనసాగించడం అందరూ నిర్మిత. మీరు ఇంకా చేపట్టుకోవడం ఎప్పుడు మరియు ఏమి ఉంచాలో నిర్ణయించారు - ఆ భాగం స్వయంచాలక కాదు.

DAgger లూప్ ఎలా చేస్తుందో చూడండి

కుటుంబ చెట్టు, ఒక టేబుల్‌లో

పద్ధతిస్థితులను ఎవరు ఎంచుకుంటారునిపుణుడు సరఫర్రా ఏమిటిప్రధాన ఖర్చు
ఆచారణ సంచిక్రణనిపుణుడుశుభ్రమైన ప్రదర్శనలుకోలుకోవడం డేటా లేదు; లోపం T లో చతురస్రాకారంగా సమ్మేళనం చేయగలదు
ఫార్వర్డ్ శిక్షణశిక్షణార్థి, ప్రతి సమయ దశకుప్రేరేపించిన పంపిణీ సంగా లేబల్‌లుT ప్రత్యేక విధానాలు; దీర్ఘ క్షితిజ కోసం ఉపయోగించలేనిది
SMILe / SEARNనిపుణుడు మరియు శిక్షణార్థి యొక్క యాదృచ్ఛిక మిశ్రణమిశ్రణ యొక్క పంపిణీ సంగా లేబల్‌లుమిశ్రణ భాగాలు నాణ్యత లో భిన్నం
DAggerమిశ్రిత విధానం, బీటా సున్నాకు చిన్నతరంసందర్శించిన ప్రతిఒక్క స్థితికి సరైన చర్యనిపుణుడు ఎప్పుడూ ఉత్పత్తి చేయని లేబల్ స్థితులు, నియంత్రణలో లేనీ సమక్ష
DARTనిపుణుడు, చేర్చిన నోయిజ్ ద్వారా ఆందోళనక్రమాంకనం చేయబడిన నోయిజ్ కింద ప్రదర్శనలునోయిజ్ శిక్షణార్థి యొక్క లోపానికి క్రమాంకనం చేయవలసి ఉంటుంది
HG-DAggerమానవుడు చేపట్టుకోవడం వరకు శిక్షణార్థికేవలం మానవ-గేట్ చేయబడిన విభాగాలలో సరిదిద్దుకోవడంమానవుడు ఎప్పుడు జోక్యం చేయాలో తీర్పు పై ఆధారపడుతుంది
SafeDAggerశిక్షణార్థి, భద్రత గేట్ ద్వారా ఫిల్టర్ చేయబడినదిగేట్ అడిగినప్పుడు కేవలం లేబల్‌లుగేట్ కూడా శిక్షణ చేయవలసి ఉంటుంది మరియు నమ్మవలసి ఉంటుంది

తరచుగా అడిగిన ప్రశ్నలు

నా రోబోట్‌పై నిజానికి చతురస్రాకార లోపం వృద్ధిని పరిశీలిస్తానా?

శుభ్రమైన వక్రం కాదు. సరిహద్దు చెత్త సందర్భం: కొన్ని సమస్య దానిని అందిస్తుందని గట్టి, మీది చేయదని. మీరు చూసిన పరిణామం - కలిగి ఉన్న ఫ్రేమ్‌ల కు బాగా స్కోర్ చేసే విధానం, నిజమైన విధానం విఫలమయ్యింది, మరియు మీరు ఎక్కువ అదే రికార్డ్ చేసినప్పుడు మెరుగ్గా కాదు. ఆ ఎక్కువ శుభ్రమైన డేటా సహాయం ఆపిస్తుంది, ఆ సహచర విస్థాపన, డేటా-వాల్యూమ్ సమస్య కాదు.

దానిని DAgger పిలవడానికి నేను బీటా మిశ్రణ అమలు చేయవలసి ఉంటుందా?

పారామితి-రహిత సంస్కరణ - మొదటి రౌండ్‌లో నిపుణుడు, తరువాత స్వచ్ఛ శిక్షణార్థి - ఒక చట్టపరమైన ప్రత్యేక సందర్భం మరియు సాధారణంగా అసలు ప్రయోగాలలో ఉత్తమ కొర్తు. మీరు డ్రాప్ చేయలేనిది సమీకరణ: కేవలం సరికొత్త సరిదిద్దుకోవడం పై పునః శిక్షణ నేత అనుసరణ వ్యాఖ్య విచ్ఛిన్నం, ఆ ఎక్కడ పశ్చాత్తాపం లేని వాదన నుండి. సరిదిద్దుకోవడం ఒక కళ్ళకు శిక్షణ చాలా బలహీన విధానం.

చివరిది బదులుగా ధ్రువీకరణ సెట్‌లో ఉత్తమ విధానం ఎందుకు తిరిగి ఇవ్వాలి?

సిద్ధాంతాలు ఒక మంచి విధానం సిరీస్‌లో ఎక్కడో నిర్ధారిస్తుందని, చివరి పునరుక్తి కాదని - సరిహద్దు సిరీస్ కంటే కనిష్ఠంపై. చివరి రౌండ్ నుండి బయటకు వచ్చిన దానిని సరఫర్రా ఫలితం యొక్క ఆ అక్షర పరిస్థితి విసర్జించారు, మరియు చివరి రౌండ్ ఆదరణీయంగా ఉత్తమం కాదు.

నేను ఎన్ని రౌండ్‌ల కోసం ప్లాన్ చేయవలసి ఉంటుంది?

సిద్ధాంతం T క్రమంలో పునరుక్తులు కోరుకుంటుంది, 600-దశ ఎపిసోడ్ కోసం ఎవరూ హార్డ్‌వేర్‌పై నడిపే సంఖ్య కాదు. అసలు ప్రయోగాలు ప్రతిఒక్క బెంచ్‌మార్క్‌లో ఇరవై పునరుక్తులు నడిపారు. ఆచరణలో మీరు జోక్యం రేటు పడటం ఆపటం వరకు రౌండ్‌లు నడుపుటము, విశ్లేషణ సూచిస్తుంది సంఖ్య చాలా దిగువకు - సిద్ధాంతం మరియు ఆచరణ మధ్య నిజమైన గెప్.

నా విధానం విభాగం నిపుణుడిని సూచించలేకపోతే?

అప్పుడు DAgger మిమ్మల్ని సేవ చేయదు, మరియు సరిహద్దు చెప్పుకుంటుంది - ఇది epsilon_N కు సంబంధించి వ్యక్తమైనది, అసంభవ్యత లో విభాగంలో ఉత్తమ నష్టం. ఆ చెత్త ఆర్కిటెక్చర్, తప్పిపోయిన పరిశీలన లేదా దృశ్యం చూడలేని కెమెరా కారణం చెత్త అయితే, సమీకరణ మీకు విధానం ఇస్తుంది ఆ సరైన విభాగ లోపల విధానం చేయలేని. మీరు సరిదిద్దుకోవడం సేకరించే ముందు కలిగిన ఎపిసోడ్‌ల ఓపెన్-లూప్ పునరాభివృద్ధి నడుపుటము.

ఇక్కడ నుండి ఎక్కడికి వెళ్లాలి

మీరు ఇంకా విధానాన్ని శిక్షణ చేయకపోతే, ఈ సిద్ధాంతం పరిపక్వం లేనిది: ముందుగా డేటాసెట్‌ను రికార్డ్ చేయండి, నుండి ప్రారంభించి మీ మొదటి విధానాన్ని శిక్షణ చేయడం మరియు డెస్కటాప్ క్లయింట్. మీరు సరిదిద్దుకోవడం ప్రారంభించటకు వ్యతిరేకంగా మరొక నూరు శుభ్రమైన ప్రదర్శనలను పరిశీలిస్తూ ఉంటే: శుభ్రమైన ప్రదర్శనలు పంపిణీ సమస్యను సరిదిద్దుకోవడం లేదు. యాంత్రికత కోసం, కొనసాగించండి మానవ-గేట్ చేయబడిన వేరియంట్ ఆపై SO-100 వాక్-థ్రూ.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started