మానవ-నియంత్రిత DAgger, ఎండ్ టు ఎండ్

పాలసీ తప్పు చేసినప్పుడు నియంత్రణ చేపట్టండి, ఆ సరిదిద్దుబాటుపైనే దాన్ని శిక్షణ ఇవ్వండి.

Behavior Cloning ద్వారా శిక్షణ పొందిన పాలసీకి మీ డెమాన్‌స్ట్రేషన్‌లు సందర్శించిన స్టేట్‌లు మాత్రమే తెలుసు. పాలసీ స్వయంగా చేరుకునే స్టేట్‌ల నుండి డేటాతో DAgger ఈ అంతరాన్ని పూరిస్తుంది. AY-Robots మొత్తం లూప్‌ను SO-100పై నడుపుతుంది: చెక్‌పాయింట్‌ను నడపండి, రన్ మధ్యలో నియంత్రణ చేపట్టండి, సరిదిద్దిన ఎపిసోడ్‌లను ఉంచండి, మిక్స్‌ను కంపోజ్ చేయండి, మరియు మీరు ఇప్పుడే నడిపిన చెక్‌పాయింట్ నుండి శిక్షణ కొనసాగించండి.

  • HG-DAgger, మానవ నియంత్రణలో
  • SO-100 / SO-101
  • ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
  • రౌండ్‌కు జోక్యం రేటు

శిక్షణ పొందిన పాలసీ ఎన్నడూ ప్రదర్శించని పని ఎందుకు చేస్తుంది

Behavior Cloning నియంత్రణను ఒక సాధారణ సూపర్‌వైజ్డ్ లెర్నింగ్‌గా చూస్తుంది: అబ్జర్వేషన్ లోపలికి, జాయింట్ టార్గెట్ బయటకు, మనిషి రికార్డ్ చేసిన ఫ్రేమ్‌లపై ఫిట్ చేయబడింది. ఇది రోబోట్ మనిషి సందర్శించిన స్టేట్‌లలోనే ఉన్నంత వరకే నిలుస్తుంది, కానీ అది అలా ఉండదు. నలభై మిల్లీసెకన్లు ముందుగా మూసుకునే గ్రిప్పర్ క్యూబ్‌ను దాని ప్రదర్శించిన పొజిషన్ నుండి రెండు మిల్లీమీటర్లు జరుపుతుంది. తర్వాతి అబ్జర్వేషన్ ట్రైనింగ్ సెట్‌లో లేనిది, కాబట్టి అక్కడి యాక్షన్ ఒక ఎక్స్ట్రాపొలేషన్, మరియు దాని తర్వాతి స్టేట్ ఇంకా దూరంగా ఉంటుంది. ట్రైనింగ్ డిస్ట్రిబ్యూషన్ మరియు నేర్చుకున్న పాలసీ నిజంగా ఉత్పత్తి చేసే డిస్ట్రిబ్యూషన్ రెండు వేర్వేరు విషయాలు, మరియు ఎపిసోడ్ నడుస్తున్న కొద్దీ రెండోది మొదటి దాని నుండి దూరమవుతూ పోతుంది.

Ross, Gordon మరియు Bagnell 2011లో సరిగ్గా ఈ రిడక్షన్ వైఫల్యాన్ని వివరించి నష్టాన్ని లెక్కగట్టారు: ఎక్స్‌పర్ట్ డిస్ట్రిబ్యూషన్ కింద probability e తో తప్పు చేసే క్లాసిఫయర్, తను ఉత్పత్తి చేసే డిస్ట్రిబ్యూషన్ కింద T స్టెప్‌ల హారిజాన్ మీద T స్క్వేర్ రెట్లు e స్థాయిలో తప్పులు చేయగలదు, ఎందుకంటే ఒక తప్పు ఎక్స్‌పర్ట్ ఎన్నడూ సృష్టించని అబ్జర్వేషన్‌లను పుట్టిస్తుంది మరియు తప్పులు పోగుపడతాయి. దీనికి వారి పరిష్కారమే ఈ పేజీ చెప్పే అల్గారిథమ్. ప్రస్తుత పాలసీని నడపండి, అది సందర్శించే స్టేట్‌లకు ఎక్స్‌పర్ట్ లేబుళ్లను సేకరించండి, ఇప్పటివరకు సేకరించిన అన్నింటితో వాటిని కలిపి, మళ్లీ శిక్షణ ఇవ్వండి, పునరావృతం చేయండి. అదే రకమైన మరిన్ని డెమాన్‌స్ట్రేషన్‌లు సహాయపడవు, ఎందుకంటే అవి అదే డిస్ట్రిబ్యూషన్ నుండే మళ్లీ నమూనా తీస్తాయి. పాలసీ చేరుకునే స్టేట్‌లపై లేబుళ్లు మాత్రమే సహాయపడతాయి. ఇక్కడ అమలు చేసిన వేరియంట్ మానవ-నియంత్రితమైనది (HG-DAgger, Kelly et al.): ఒక మనిషి తప్పు జరుగుతోందని నిర్ణయించి నియంత్రణ చేపట్టేవరకు పాలసీ నియంత్రణలో ఉంటుంది, కాబట్టి అవసరమైన చోట మాత్రమే సరిదిద్దుబాట్లు ఉత్పత్తి అవుతాయి, మరియు ఆపరేటర్ అనుమతించని స్టేట్‌లోకి ఆర్మ్‌ను ఎన్నడూ నడపమని అడగరు.

  • Behavior Cloning తాను శిక్షణ పొందిన స్టేట్ డిస్ట్రిబ్యూషన్‌పై మాత్రమే చెల్లుతుంది.
  • వైఫల్యం స్వీయ-వర్ధమానం: చిన్న విచలనం తెలియని స్టేట్‌ను సృష్టిస్తుంది, అది మరింత పెద్ద విచలనాన్ని సృష్టిస్తుంది.
  • పరిష్కారం మరిన్ని డెమాన్‌స్ట్రేషన్‌లు కాదు, పాలసీ స్వయంగా చేరుకునే స్టేట్‌లపై లేబుళ్లు.
  • మానవ-నియంత్రితం అంటే జోక్యం ఎప్పుడు చేయాలో ఆపరేటర్ నిర్ణయిస్తారు, ఏదో ఆటానమీ స్కోర్ కాదు.

తప్పు ఎందుకు పోగుపడుతుంది

హారిజాన్‌ను లాగండి. Behavior Cloning కింద ఊహించిన అదనపు వ్యయం స్టెప్‌ల సంఖ్య యొక్క దాదాపు స్క్వేర్‌తో పెరుగుతుంది, ఎందుకంటే ప్రతి తప్పు డెమాన్‌స్ట్రేషన్‌లు ఎన్నడూ కవర్ చేయని స్టేట్‌లను సృష్టిస్తుంది; ఒక అగ్రిగేషన్ లూప్ ఈ పెరుగుదలను దాదాపు లీనియర్‌గా ఉంచుతుంది (Ross et al., 2011).

200
1.0 %
Behavior Cloning
400
DAgger
2.00
200×
Behavior Cloning ÷ DAgger
0.000100200300400050100150200ఊహించిన అదనపు వ్యయం (బౌండ్)
టాస్క్ హారిజాన్ (స్టెప్‌లు)

Ross et al. (2011) బౌండ్‌ల నుండి ఇవి ఉదాహరణ కర్వ్‌లు, మీ రోబోట్ నుండి తీసుకున్న కొలతలు కావు. ఇక్కడ ముఖ్యమైనది ఆకారం, సంఖ్యలు కాదు.

ఒక DAgger రౌండ్, ఆరు దశలు

ఇది ప్లాట్‌ఫామ్ నిజంగా నడిపే విధంగా ఉన్న లూప్, ఒక స్కీమాటిక్ కాదు. కింది ప్రతి దశ కాక్‌పిట్‌లోని ఒక కంట్రోల్‌కు అనుగుణంగా ఉంటుంది.

లూప్ గుండా నడవండి

అవే ఆరు దశలు, ఒక్కొక్కటిగా, ప్రతి దానిలో ఆర్మ్‌పై మరియు డేటాసెట్‌లో ఏమి జరుగుతుందో సహా.

01

పాలసీని నడిపి రికార్డ్ చేయండి

మీరు శిక్షణ ఇచ్చిన చెక్‌పాయింట్‌కు వ్యతిరేకంగా ఒక ఇన్ఫరెన్స్ రన్ ప్రారంభించండి. రన్ జరుగుతున్నప్పుడే దాని స్వంత టాస్క్ టెక్స్ట్‌తో సహా రికార్డ్ చేయబడుతుంది, కాబట్టి ఫ్రేమ్‌లు తర్వాత చూడటానికి మాత్రమే పనికొచ్చే వీడియోగా కాకుండా ట్రైనింగ్ డేటాగా ఉపయోగపడతాయి.

1 లో 6

ప్లాట్‌ఫామ్ మీ నుండి ఏమి తొలగిస్తుంది

ఇక్కడున్న ప్రతి అంశం మీరు స్వయంగా నిర్మించి నిర్వహించాల్సిన లూప్‌లోని ఒక దశ.

leader ఆర్మ్ లేకుండా నియంత్రణ చేపట్టడం

రన్ మొదట్లో కీబోర్డ్ లేదా స్లైడర్ ఇన్‌పుట్‌ను ఎంచుకోండి, అప్పుడు ఒక్క ల్యాప్‌టాప్‌తోనే సరిదిద్దగలరు. కీబోర్డ్ నడ్జ్‌లు సర్వర్ వైపు జాయింట్‌కు రెండు డిగ్రీలకు మరియు గ్రిప్పర్‌కు నాలుగు డిగ్రీలకు పరిమితం చేయబడతాయి; స్లైడర్ టార్గెట్‌లు అబ్సొల్యూట్‌గా ఉంటాయి మరియు సర్వర్ ప్రతి కాల్‌కు గరిష్టంగా ఆరు డిగ్రీలు వాటి వైపు కదులుతుంది. ఈ పరిమితులను UI కాదు, సర్వర్ అమలు చేస్తుంది, కాబట్టి ఇరుక్కుపోయిన కీ ఆర్మ్‌ను విసిరేయలేదు.

టెలిఆపరేషన్ డాక్స్

ప్రతి ఫ్రేమ్‌కు గుర్తించిన ఇంటర్వెన్షన్‌లు

మీరు ఆర్మ్‌ను పట్టుకున్నప్పుడు రికార్డయిన ప్రతి ఫ్రేమ్ ఒక ఇంటర్వెన్షన్ ఫ్లాగ్‌ను కలిగి ఉంటుంది, మరియు action కాలమ్ పూర్తి కమాండ్ చేసిన పొజిషన్‌ను కలిగి ఉంటుంది. మీరు ఒక ఫ్లాగ్ కాలమ్‌ను చేతితో నిర్వహించాల్సిన అవసరం లేదు, తర్వాత దాన్ని ఫ్రేమ్ ఇండెక్స్‌లతో సరిచేయాల్సిన అవసరం లేదు.

LeRobot డేటాసెట్ ఫార్మాట్

ట్రయాజ్: సరిదిద్దుబాటు, ఎవాల్యుయేషన్, లేదా తొలగింపు

ప్రతి రన్‌కు save కార్డ్‌పై ఒకే ఒక నిర్ణయం ఉంటుంది. సరిదిద్దుబాటు రన్‌లు తర్వాతి ట్రైనింగ్ రౌండ్‌కు ఆహారంగా మారతాయి, ఎవాల్యుయేషన్ రన్‌లు ట్రైనింగ్ నుండి బయటే ఉండి ఒక శుభ్రమైన కొలతగా నిలుస్తాయి, మరియు చెడు రన్‌లు నిశ్శబ్దంగా మిక్స్‌ను విషతుల్యం చేయకుండా తొలగిపోతాయి.

సెషన్‌లు మరియు ఎపిసోడ్‌లు

మిక్స్‌ను స్పష్టంగా కంపోజ్ చేయడం

రౌండ్ n కోసం ట్రైనింగ్ సెట్ మీరే సమకూరుస్తారు: ఒరిజినల్ డేటాసెట్ ప్లస్ సరిదిద్దుబాట్లు, ప్రతి సోర్స్ నుండి ఎపిసోడ్‌లు ఎంచుకోబడతాయి. ఆటోమేటిక్ కలయిక లేదు, దాచిన సిమ్యులేషన్ డేటా లేదు, మరియు కంపోజ్ చేసిన ఫలితం మిగతా ఏ డేటాసెట్ లాగానే ప్రవర్తిస్తుంది.

డేటాసెట్‌లు

చెక్‌పాయింట్ నుండి కొనసాగించడం

బేస్ మోడల్‌కు బదులుగా మీరు ఇప్పుడే నడిపిన చెక్‌పాయింట్‌కు ఒక ట్రైనింగ్ రన్‌ను చూపండి, తద్వారా ప్రతి రౌండ్ చివరిది ఆగిన చోట మొదలవుతుంది. ఇది వెయిట్‌లను మాత్రమే ఇనీషియలైజ్ చేస్తుంది; ఆప్టిమైజర్ స్టేట్ పునరుద్ధరించబడదు, అందుకే రౌండ్ ఒకటిని ఒక ఫీజిబిలిటీ టెస్ట్‌గా చూడటం మంచిది.

ట్రైనింగ్

రౌండ్‌కు అద్దెకు తీసుకున్న GPUలు

4090పై ACT మరియు SmolVLA, 80 GB ఉన్న A100పై Pi0 మరియు GR00T N1.5 లేదా N1.7. మీరు ఒక రౌండ్‌ను ప్రారంభిస్తారు, పాడ్ లేస్తుంది, చెక్‌పాయింట్‌లు మీ బకెట్‌లో పడతాయి, మరియు రౌండ్ తీసుకున్న గంటలకు మాత్రమే మీరు చెల్లిస్తారు.

GPU ధరలు

మీ రౌండ్‌లను ప్లాన్ చేయండి

జోక్యం రేటు లూప్ యొక్క ప్రోగ్రెస్ మెట్రిక్: రన్ ఫ్రేమ్‌లతో భాగించిన సరిదిద్దిన ఫ్రేమ్‌లు. మీరు ఎక్కడ మొదలవుతారో, ప్రతి రౌండ్ మీకు ఎంత ప్రయోజనం చేకూరుస్తుందో సెట్ చేసి, మీరు కోరుకున్న చోటికి చేరడానికి ఎన్ని రౌండ్‌లు పడతాయో చూడండి.

30 %
25 %
3 000
రౌండ్జోక్యం రేటుసరిదిద్దిన ఫ్రేమ్‌లు
1
30.0%
900
2
22.5%
675
3
16.9%
506
4
12.7%
380
5
9.5%
285
6
7.1%
214
Σ2 960

ఇది ఒక మోడల్, అంచనా కాదు. నిజమైన రౌండ్‌లు అసమానంగా సాగుతాయి, మరియు రేటును కదిలించని రౌండ్ మీకు ఏమీ తీసుకురాలేదు; సరిగ్గా అదే గమనించదగ్గ సంకేతం.

లూప్‌ను మీరే నిర్మించడం వర్సెస్ ఇక్కడ నడపడం

వీటిలో ఏదీ చేతితో అసాధ్యం కాదు. ప్రశ్న ఎన్ని సాయంత్రాలు రౌండ్‌లలోకి కాకుండా ప్లంబింగ్‌లోకి పోతాయన్నదే, మరియు చేతితో చేయడం స్పష్టంగా మెరుగైన సమాధానం అయిన ఒక వరుస ఉంది.

లూప్ దశచేతితో సెటప్ చేయడంAY-Robotsపై
రన్ మధ్యలో నియంత్రణ చేపట్టడంఒక leader ఆర్మ్, లేదా సర్వో బస్‌పై మీ స్వంత కోడ్. కీబోర్డ్ మరియు స్లైడర్ నియంత్రణ చేపట్టడం, సురక్షిత పరిమితులతో సహా, మీరు రాసి తర్వాత నిజమైన హార్డ్‌వేర్‌పై డీబగ్ చేయాల్సిన విషయం.రన్ మొదలైనప్పుడు ఎంచుకున్న leader ఆర్మ్, కీబోర్డ్, లేదా స్లైడర్‌లు. యాంగిల్ క్లాంప్‌లు సర్వర్‌లో ఉంటాయి.
ఇంటర్వెన్షన్‌లను గుర్తించడంమీరు ఫ్లాగ్ కాలమ్‌ను జోడించి, దాన్ని ఫ్రేమ్ ఇండెక్స్‌తో సరిపోల్చి ఉంచి, రికార్డింగ్ ఫార్మాట్ మారిన ప్రతిసారీ మళ్లీ తనిఖీ చేయాలి.నియంత్రణ చేపట్టిన సమయంలో రికార్డయిన ప్రతి ఫ్రేమ్ స్వయంచాలకంగా ఫ్లాగ్ చేయబడుతుంది, action కాలమ్‌లో కమాండ్ చేసిన పొజిషన్‌తో సహా.
రన్‌లను వర్గీకరించడండైరెక్టరీ కన్వెన్షన్‌లు మరియు షెల్ స్క్రిప్ట్‌లు. హ్యాండోవర్ చుట్టూ ఉన్న ఫ్రీజ్ ఫ్రేమ్‌లను మీరే కనిపెట్టి వేరు చేయాలి.save కార్డ్‌పై ప్రతి రన్‌కు ఒక నిర్ణయం. హ్యాండోవర్ ఫ్రేమ్‌లు raw డైరెక్టరీలోనే ఉంటాయి.
మిక్స్డ్ డేటాసెట్‌ను నిర్మించడంప్రతి ఫార్మాట్ వెర్షన్‌కు మెర్జ్ స్క్రిప్ట్‌లు. ఎపిసోడ్ ఇండెక్స్‌లు, మెటాడేటా, మరియు వీడియో రిఫరెన్స్‌లను స్థిరంగా ఉంచడమే శ్రమతో కూడిన పని.ప్రతి సోర్స్ నుండి ఎపిసోడ్ ఎంపికతో ఒరిజినల్ ప్లస్ సరిదిద్దుబాట్ల నుండి కంపోజ్ చేయడం; ఫలితం ఒక సాధారణ డేటాసెట్.
చివరి పాలసీ నుండి తర్వాతి రౌండ్‌ను మొదలుపెట్టడంచెక్‌పాయింట్‌ను మీరే ట్రైనర్‌లోకి వైర్ చేస్తారు, మరియు నిజమైన రిజ్యూమ్ కావాలంటే ఆప్టిమైజర్ స్టేట్‌ను కూడా పునరుద్ధరించగలరు.బేస్ చెక్‌పాయింట్ కోసం ఒక ఫీల్డ్. వెయిట్‌లు మాత్రమే: చెక్‌పాయింట్ నుండి ఇనీషియలైజ్ చేస్తుంది, ఇది ఆప్టిమైజర్ రిజ్యూమ్ కాదు.
ట్రైనింగ్ లూప్‌పై నియంత్రణపూర్తి. మీ లాస్, మీ షెడ్యూల్, మీ ఏబ్లేషన్‌లు, మీ ఇన్‌స్ట్రుమెంటేషన్, మధ్యలో ప్లాట్‌ఫామ్ ఏదీ లేదు. రీసెర్చ్ ప్రశ్న ట్రైనింగ్ లూప్ అయితేనే దీన్ని చేతితో చేయండి.పాలసీల నిర్ణీత జాబితా మరియు ఫారమ్ చూపించే హైపర్‌పారామీటర్‌లతో ఒక స్థిర మార్గం, ఇష్టానుసార కోడ్ కాదు.

దీనికి ఆధారమైన పేపర్‌లు

లూప్‌తో వాదించే ముందు వీటిని చదవండి. ప్రతి లింక్ అబ్‌స్ట్రాక్ట్ పేజీకి వెళుతుంది, పేవాల్‌కు కాదు.

  1. A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning

    Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)

    అసలైన DAgger పేపర్: ఇది కంపౌండింగ్-ఎర్రర్ సమస్యను పేర్కొంటుంది, ప్లెయిన్ సూపర్‌వైజ్డ్ అప్రోచ్‌కు T-స్క్వేర్ బౌండ్‌ను ఇస్తుంది, మరియు లెర్నర్ స్వయంగా సందర్శించే స్టేట్‌ల నుండి డేటాను అగ్రిగేట్ చేయాలని ప్రతిపాదిస్తుంది.

  2. HG-DAgger: Interactive Imitation Learning with Human Experts

    Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019

    మానవ-నియంత్రిత వేరియంట్: పాలసీ ఎంచుకున్న స్టేట్‌ల గురించి అడగబడకుండా, ఎప్పుడు నియంత్రణ చేపట్టాలో ఎక్స్‌పర్ట్ నిర్ణయిస్తారు; ఈ ప్లాట్‌ఫామ్ అమలు చేసేది ఇదే మోడ్.

  3. EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning

    Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019

    ఇంటర్వెన్షన్‌లను గేట్ చేసే మరో మార్గం: లెర్నర్ ఒంటరిగా వ్యవహరించవచ్చా అనేదానికి కాన్ఫిడెన్స్ సిగ్నల్‌గా ఎన్సెంబుల్ డిజాగ్రిమెంట్. మనిషి దాన్ని నిర్ణయించనివ్వడానికి మంచి పోలిక.

  4. ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning

    Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021

    మానవ శ్రద్ధను కొరత వనరుగా చూసి, కొత్త లేదా రిస్కీ స్టేట్‌లలో మాత్రమే సహాయం అడుగుతుంది; ఒక వ్యక్తి మధ్యాహ్నం అంతా ఆర్మ్‌ను పర్యవేక్షించేటప్పుడు ఇదే సరైన ఫ్రేమ్.

  5. DART: Noise Injection for Robust Imitation Learning

    Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017

    నిజాయితీగల ప్రత్యామ్నాయం: పాలసీని ఆన్‌లైన్‌లో సరిదిద్దడానికి బదులుగా, ఎక్స్‌పర్ట్ రికవరీని చూపేలా డెమాన్‌స్ట్రేషన్‌లను చెదరగొట్టడం. ఇంటర్వెన్షన్‌లకు కట్టుబడే ముందు తెలుసుకోవాల్సింది.

  6. Interactive Imitation Learning in Robotics: A Survey

    Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600

    ఫీల్డ్ యొక్క మ్యాప్: మానవ ఫీడ్‌బ్యాక్ ఏ రూపాల్లో ఉంటుంది, వాటిని ఏ ఇంటర్‌ఫేస్‌లు మోస్తాయి, మరియు DAgger-తరహా జోక్యం వాటి మధ్య ఎక్కడ ఉంటుంది.

  7. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware

    Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705

    ACT పేపర్. చౌక ఆర్మ్‌ను ఇమిటేషన్ పాలసీ అసలు నడపగలగడానికి కారణం యాక్షన్ చంకింగ్, మరియు ఒక DAgger రౌండ్‌ను వేగంగా ఇటరేట్ చేయడానికి ACT అత్యంత వేగవంతమైన పాలసీ.

  8. π0: A Vision-Language-Action Flow Model for General Robot Control

    Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164

    ఒక ప్రీట్రైన్డ్ విజన్-లాంగ్వేజ్ మోడల్‌పై నిర్మించిన ఫ్లో-మ్యాచింగ్ VLA, మరియు మీరు ఇక్కడ ఫైన్-ట్యూన్ చేయగల చెక్‌పాయింట్‌లలో ఒకటి; కొత్త స్కిల్స్ బేస్ మోడల్ నుండి మాత్రమే కాక ఫైన్-ట్యూనింగ్ నుండి వస్తాయని పేపర్ స్పష్టంగా చెబుతుంది.

మనుషులు నిజంగా అడిగే ప్రశ్నలు

DAgger కోసం నాకు leader ఆర్మ్ కావాలా?

లేదు. రన్ మొదలుపెట్టేటప్పుడు కీబోర్డ్ లేదా స్లైడర్ ఇన్‌పుట్‌ను ఎంచుకోండి, అప్పుడు నియంత్రణ చేపట్టడం మొదటి ఫ్రేమ్ నుండే మాన్యువల్‌గా, బ్రౌజర్ నుండి నడుస్తుంది. సూక్ష్మ కదలికలకు leader ఆర్మ్ మరింత సౌకర్యంగా ఉంటుంది, మరియు అప్పగించే ముందు ఆర్మ్ తనంతట తానే సర్దుకునే మోడ్ కూడా అదే, కానీ లూప్ దాని లేకుండా కూడా నడుస్తుంది.

నాకు ఎన్ని DAgger రౌండ్‌లు కావాలి?

నిజాయితీగల స్థిర సంఖ్య అంటూ లేదు. జోక్యం రేటును గమనించండి: అది ఒక రౌండ్ నుండి తర్వాతిదానికి తగ్గకపోతే, ఆ రౌండ్ ఏమీ తీసుకురాలేదు, మరియు సాధారణంగా సమస్య రౌండ్‌ల సంఖ్యలో కాక టాస్క్ సెటప్‌లో, కెమెరాల్లో, లేదా ఒరిజినల్ డేటాసెట్‌లో ఉంటుంది.

ఇది నిజమైన DAgger నా లేదా అంతకంటే వదులుగా ఏదైనానా?

ఇది HG-DAgger, మానవ-నియంత్రిత వేరియంట్. క్లాసిక్ DAgger పాలసీ ఎంచుకున్న స్టేట్‌ల గురించి ఎక్స్‌పర్ట్‌ను అడుగుతుంది, అందులో ఏ వివేకవంతమైన ఆపరేటర్ కూడా ఒక నిజమైన ఆర్మ్‌ను చేరనివ్వని స్టేట్‌లు కూడా ఉంటాయి. ఇక్కడ ఎప్పుడు జోక్యం చేసుకోవాలో ఒక మనిషి నిర్ణయిస్తారు, మరియు ఆ భాగాలు మాత్రమే లేబుళ్లుగా మారతాయి.

నేను సరిదిద్దుబాట్లపై మాత్రమే శిక్షణ ఇస్తానా?

లేదు, మరియు మీరు అలా చేయకూడదు కూడా. కేవలం సరిదిద్దుబాట్లపై శిక్షణ ఇవ్వడం వల్ల కేవలం రికవర్ చేయడం మాత్రమే తెలిసిన పాలసీ వస్తుంది. కంపోజ్ చేసిన డేటాసెట్ ఒరిజినల్ డేటా ప్లస్ సరిదిద్దుబాట్లు, ప్రతి సోర్స్ నుండి ఎపిసోడ్‌లు స్పష్టంగా ఎంచుకోబడతాయి.

చెక్‌పాయింట్ నుండి కొనసాగించడం ట్రైనింగ్ రన్‌ను రిజ్యూమ్ చేస్తుందా?

ఇది ఆ చెక్‌పాయింట్ నుండి వెయిట్‌లను ఇనీషియలైజ్ చేస్తుంది. ఆప్టిమైజర్ స్టేట్ పునరుద్ధరించబడదు, కాబట్టి కచ్చితమైన అర్థంలో ఇది రిజ్యూమ్ కాదు. ఆచరణలో నేర్చుకున్న ప్రవర్తనను రౌండ్ మీదుగా మోసేది వెయిట్‌లే, కానీ మీకు ఏది వస్తుందో తెలుసుకోవడం విలువైనది.

జోక్యం రేటు ఎలా లెక్కించబడుతుంది?

ఇంటర్వెన్షన్‌గా ఫ్లాగ్ చేసిన ఫ్రేమ్‌లను రన్ యొక్క మొత్తం ఫ్రేమ్‌లతో భాగించి. ఇది టేకోవర్ స్టేటస్‌లో చూపబడుతుంది, మరియు మీరు నడిపిన చెక్‌పాయింట్ మరియు శిక్షణ ఇచ్చిన మిక్స్‌తో పాటు ప్రతి రౌండ్‌కు నోట్ చేసుకోదగ్గ ఏకైక సంఖ్య ఇదే.

ఈ లూప్‌ను నేను ఏ పాలసీలతో నడపగలను?

ACT, SmolVLA, Pi0, మరియు GR00T N1.5 లేదా N1.7. లూప్ స్వయంగా పాలసీ-అజ్ఞేయవాదం, ఎందుకంటే ఇది కేవలం డేటాసెట్‌లు మరియు చెక్‌పాయింట్‌లను మాత్రమే ఉత్పత్తి చేస్తుంది; ఆచరణాత్మక తేడా ఏమిటంటే ఒక రౌండ్ ఎంత సమయం తీసుకుంటుంది మరియు దానికి ఏ GPU కావాలి అన్నదే.

రోబోట్ లేకుండా నేను ఇది చేయగలనా?

మార్కెట్‌ప్లేస్‌లో డేటాసెట్‌లు కొనడం ద్వారా లేదా ఆపరేటర్‌లను నియమించడం ద్వారా రోబోట్ లేకుండానే మీరు రికార్డ్ చేసి శిక్షణ ఇవ్వగలరు, మరియు live పేజీలో బ్రౌజర్‌లోనే ఒక నిజమైన SO-100ను నడపగలరు. ఒక DAgger రౌండ్ వేరే విషయం: దానికి రన్ మధ్యలో మీరు నియంత్రణ చేపట్టగల ఆర్మ్ అవసరం, కాబట్టి లూప్ కోసం మీ సొంత టేబుల్‌పై హార్డ్‌వేర్ ఉండటం అవసరం.

Drive a real arm

A real SO-100, live in the browser. No signup, no hardware needed.

ఈ వారమే మీ మొదటి రౌండ్‌ను నడపండి

క్లయింట్‌ను ఇన్‌స్టాల్ చేయండి, మీ దగ్గర ఇప్పటికే ఉన్న చెక్‌పాయింట్‌ను నడపండి, మరియు ఆర్మ్ క్యూబ్‌ను దాటి చేరుకున్న మొదటిసారి నియంత్రణ చేపట్టండి. ఆ ఒక్క రన్ ఒక చిన్న DAgger రౌండ్; దాని తర్వాత జరిగేదంతా మిక్స్‌ను కంపోజ్ చేయడం మరియు GPU గంటలకు చెల్లించడం మాత్రమే.