పాలసీ తప్పు చేసినప్పుడు నియంత్రణ చేపట్టండి, ఆ సరిదిద్దుబాటుపైనే దాన్ని శిక్షణ ఇవ్వండి.
Behavior Cloning ద్వారా శిక్షణ పొందిన పాలసీకి మీ డెమాన్స్ట్రేషన్లు సందర్శించిన స్టేట్లు మాత్రమే తెలుసు. పాలసీ స్వయంగా చేరుకునే స్టేట్ల నుండి డేటాతో DAgger ఈ అంతరాన్ని పూరిస్తుంది. AY-Robots మొత్తం లూప్ను SO-100పై నడుపుతుంది: చెక్పాయింట్ను నడపండి, రన్ మధ్యలో నియంత్రణ చేపట్టండి, సరిదిద్దిన ఎపిసోడ్లను ఉంచండి, మిక్స్ను కంపోజ్ చేయండి, మరియు మీరు ఇప్పుడే నడిపిన చెక్పాయింట్ నుండి శిక్షణ కొనసాగించండి.
- HG-DAgger, మానవ నియంత్రణలో
- SO-100 / SO-101
- ACT, SmolVLA, Pi0, GR00T N1.5 / N1.7
- రౌండ్కు జోక్యం రేటు
శిక్షణ పొందిన పాలసీ ఎన్నడూ ప్రదర్శించని పని ఎందుకు చేస్తుంది
Behavior Cloning నియంత్రణను ఒక సాధారణ సూపర్వైజ్డ్ లెర్నింగ్గా చూస్తుంది: అబ్జర్వేషన్ లోపలికి, జాయింట్ టార్గెట్ బయటకు, మనిషి రికార్డ్ చేసిన ఫ్రేమ్లపై ఫిట్ చేయబడింది. ఇది రోబోట్ మనిషి సందర్శించిన స్టేట్లలోనే ఉన్నంత వరకే నిలుస్తుంది, కానీ అది అలా ఉండదు. నలభై మిల్లీసెకన్లు ముందుగా మూసుకునే గ్రిప్పర్ క్యూబ్ను దాని ప్రదర్శించిన పొజిషన్ నుండి రెండు మిల్లీమీటర్లు జరుపుతుంది. తర్వాతి అబ్జర్వేషన్ ట్రైనింగ్ సెట్లో లేనిది, కాబట్టి అక్కడి యాక్షన్ ఒక ఎక్స్ట్రాపొలేషన్, మరియు దాని తర్వాతి స్టేట్ ఇంకా దూరంగా ఉంటుంది. ట్రైనింగ్ డిస్ట్రిబ్యూషన్ మరియు నేర్చుకున్న పాలసీ నిజంగా ఉత్పత్తి చేసే డిస్ట్రిబ్యూషన్ రెండు వేర్వేరు విషయాలు, మరియు ఎపిసోడ్ నడుస్తున్న కొద్దీ రెండోది మొదటి దాని నుండి దూరమవుతూ పోతుంది.
Ross, Gordon మరియు Bagnell 2011లో సరిగ్గా ఈ రిడక్షన్ వైఫల్యాన్ని వివరించి నష్టాన్ని లెక్కగట్టారు: ఎక్స్పర్ట్ డిస్ట్రిబ్యూషన్ కింద probability e తో తప్పు చేసే క్లాసిఫయర్, తను ఉత్పత్తి చేసే డిస్ట్రిబ్యూషన్ కింద T స్టెప్ల హారిజాన్ మీద T స్క్వేర్ రెట్లు e స్థాయిలో తప్పులు చేయగలదు, ఎందుకంటే ఒక తప్పు ఎక్స్పర్ట్ ఎన్నడూ సృష్టించని అబ్జర్వేషన్లను పుట్టిస్తుంది మరియు తప్పులు పోగుపడతాయి. దీనికి వారి పరిష్కారమే ఈ పేజీ చెప్పే అల్గారిథమ్. ప్రస్తుత పాలసీని నడపండి, అది సందర్శించే స్టేట్లకు ఎక్స్పర్ట్ లేబుళ్లను సేకరించండి, ఇప్పటివరకు సేకరించిన అన్నింటితో వాటిని కలిపి, మళ్లీ శిక్షణ ఇవ్వండి, పునరావృతం చేయండి. అదే రకమైన మరిన్ని డెమాన్స్ట్రేషన్లు సహాయపడవు, ఎందుకంటే అవి అదే డిస్ట్రిబ్యూషన్ నుండే మళ్లీ నమూనా తీస్తాయి. పాలసీ చేరుకునే స్టేట్లపై లేబుళ్లు మాత్రమే సహాయపడతాయి. ఇక్కడ అమలు చేసిన వేరియంట్ మానవ-నియంత్రితమైనది (HG-DAgger, Kelly et al.): ఒక మనిషి తప్పు జరుగుతోందని నిర్ణయించి నియంత్రణ చేపట్టేవరకు పాలసీ నియంత్రణలో ఉంటుంది, కాబట్టి అవసరమైన చోట మాత్రమే సరిదిద్దుబాట్లు ఉత్పత్తి అవుతాయి, మరియు ఆపరేటర్ అనుమతించని స్టేట్లోకి ఆర్మ్ను ఎన్నడూ నడపమని అడగరు.
- Behavior Cloning తాను శిక్షణ పొందిన స్టేట్ డిస్ట్రిబ్యూషన్పై మాత్రమే చెల్లుతుంది.
- వైఫల్యం స్వీయ-వర్ధమానం: చిన్న విచలనం తెలియని స్టేట్ను సృష్టిస్తుంది, అది మరింత పెద్ద విచలనాన్ని సృష్టిస్తుంది.
- పరిష్కారం మరిన్ని డెమాన్స్ట్రేషన్లు కాదు, పాలసీ స్వయంగా చేరుకునే స్టేట్లపై లేబుళ్లు.
- మానవ-నియంత్రితం అంటే జోక్యం ఎప్పుడు చేయాలో ఆపరేటర్ నిర్ణయిస్తారు, ఏదో ఆటానమీ స్కోర్ కాదు.
తప్పు ఎందుకు పోగుపడుతుంది
హారిజాన్ను లాగండి. Behavior Cloning కింద ఊహించిన అదనపు వ్యయం స్టెప్ల సంఖ్య యొక్క దాదాపు స్క్వేర్తో పెరుగుతుంది, ఎందుకంటే ప్రతి తప్పు డెమాన్స్ట్రేషన్లు ఎన్నడూ కవర్ చేయని స్టేట్లను సృష్టిస్తుంది; ఒక అగ్రిగేషన్ లూప్ ఈ పెరుగుదలను దాదాపు లీనియర్గా ఉంచుతుంది (Ross et al., 2011).
Ross et al. (2011) బౌండ్ల నుండి ఇవి ఉదాహరణ కర్వ్లు, మీ రోబోట్ నుండి తీసుకున్న కొలతలు కావు. ఇక్కడ ముఖ్యమైనది ఆకారం, సంఖ్యలు కాదు.
ఒక DAgger రౌండ్, ఆరు దశలు
ఇది ప్లాట్ఫామ్ నిజంగా నడిపే విధంగా ఉన్న లూప్, ఒక స్కీమాటిక్ కాదు. కింది ప్రతి దశ కాక్పిట్లోని ఒక కంట్రోల్కు అనుగుణంగా ఉంటుంది.
లూప్ గుండా నడవండి
అవే ఆరు దశలు, ఒక్కొక్కటిగా, ప్రతి దానిలో ఆర్మ్పై మరియు డేటాసెట్లో ఏమి జరుగుతుందో సహా.
పాలసీని నడిపి రికార్డ్ చేయండి
మీరు శిక్షణ ఇచ్చిన చెక్పాయింట్కు వ్యతిరేకంగా ఒక ఇన్ఫరెన్స్ రన్ ప్రారంభించండి. రన్ జరుగుతున్నప్పుడే దాని స్వంత టాస్క్ టెక్స్ట్తో సహా రికార్డ్ చేయబడుతుంది, కాబట్టి ఫ్రేమ్లు తర్వాత చూడటానికి మాత్రమే పనికొచ్చే వీడియోగా కాకుండా ట్రైనింగ్ డేటాగా ఉపయోగపడతాయి.
నియంత్రణ చేపట్టి సరిదిద్దండి
ఆర్మ్ తప్పు చేసిన క్షణమే, Take over నొక్కండి. రన్నర్ ఆగిపోతుంది మరియు ఆర్మ్ మీ చేతిలో ఉంటుంది. leader ఆర్మ్తో అది ముందు follower పొజిషన్కు కదిలి నియంత్రణను అప్పగిస్తుంది; రన్ మొదట్లో ఎంచుకున్న కీబోర్డ్ లేదా స్లైడర్ ఇన్పుట్తో నియంత్రణ చేపట్టడం వెంటనే మాన్యువల్గా జరుగుతుంది. కదలికను సరిదిద్ది, తర్వాత నియంత్రణను తిరిగి పాలసీకి అప్పగించండి. నియంత్రణ చేపట్టిన సమయంలో రికార్డయిన ఫ్రేమ్లు స్వయంచాలకంగా ఇంటర్వెన్షన్గా ఫ్లాగ్ చేయబడతాయి.
రన్ను ట్రయాజ్ చేయండి
ప్రతి రన్ గురించి ఏమిటో నిర్ణయించండి: సరిదిద్దుబాటుగా ఫైల్ చేయండి, ఎవాల్యుయేషన్ రన్గా ఉంచండి, లేదా తొలగించండి. హ్యాండోవర్ చుట్టూ ఉన్న ఫ్రీజ్ ఫ్రేమ్లు raw డైరెక్టరీలోనే ఉండిపోతాయి మరియు డేటాసెట్లోకి ఎప్పుడూ చేరవు.
సరిదిద్దుబాటు డేటాసెట్ను సింక్ చేయండి
సరిదిద్దుబాట్లు ప్రతి పాలసీకి సంబంధించిన ఒక ప్రత్యేక డేటాసెట్లో సేకరించబడి, ఆటోమేటిక్ క్లౌడ్ సింక్ ద్వారా మీ బకెట్కు వెళ్తాయి. ఈ దశలో దేనితోనూ ఏదీ కలపబడదు; సరిదిద్దుబాట్లు ప్రస్తుతానికి కేవలం వాటికవే ఒక డేటాసెట్.
మిక్స్ను మీరే కంపోజ్ చేయండి
తర్వాతి రౌండ్ కోసం ట్రైనింగ్ సెట్ను నిర్మించడానికి Compose dataset ఉపయోగించండి: ఒరిజినల్ డేటాసెట్ ప్లస్ సరిదిద్దుబాట్లు, ప్రతి సోర్స్ నుండి ఎపిసోడ్లు స్పష్టంగా ఎంచుకుని. ఫలితం మిగతా ఏ డేటాసెట్ లాగానే సింక్ అయ్యి శిక్షణ పొందే ఒక సాధారణ డేటాసెట్. మీ వెనుక దేనినీ కలపడం జరగదు, సిమ్యులేషన్ డేటా ఆటోమేటిక్గా జోడించబడదు.
చెక్పాయింట్ నుండి శిక్షణ కొనసాగించండి
బేస్ మోడల్ నుండి కాకుండా Continue from checkpoint తో కంపోజ్ చేసిన డేటాసెట్కు శిక్షణ ఇవ్వండి, తద్వారా రౌండ్ మీరు ఇప్పుడే నడిపిన పాలసీ నుండి మొదలవుతుంది. ఇది ఏమిటో స్పష్టంగా చెప్పాలంటే: ఇది ఆ చెక్పాయింట్ నుండి వెయిట్లను ఇనీషియలైజ్ చేస్తుంది, ఇది ఆప్టిమైజర్ రిజ్యూమ్ కాదు.
ప్లాట్ఫామ్ మీ నుండి ఏమి తొలగిస్తుంది
ఇక్కడున్న ప్రతి అంశం మీరు స్వయంగా నిర్మించి నిర్వహించాల్సిన లూప్లోని ఒక దశ.
leader ఆర్మ్ లేకుండా నియంత్రణ చేపట్టడం
రన్ మొదట్లో కీబోర్డ్ లేదా స్లైడర్ ఇన్పుట్ను ఎంచుకోండి, అప్పుడు ఒక్క ల్యాప్టాప్తోనే సరిదిద్దగలరు. కీబోర్డ్ నడ్జ్లు సర్వర్ వైపు జాయింట్కు రెండు డిగ్రీలకు మరియు గ్రిప్పర్కు నాలుగు డిగ్రీలకు పరిమితం చేయబడతాయి; స్లైడర్ టార్గెట్లు అబ్సొల్యూట్గా ఉంటాయి మరియు సర్వర్ ప్రతి కాల్కు గరిష్టంగా ఆరు డిగ్రీలు వాటి వైపు కదులుతుంది. ఈ పరిమితులను UI కాదు, సర్వర్ అమలు చేస్తుంది, కాబట్టి ఇరుక్కుపోయిన కీ ఆర్మ్ను విసిరేయలేదు.
టెలిఆపరేషన్ డాక్స్ప్రతి ఫ్రేమ్కు గుర్తించిన ఇంటర్వెన్షన్లు
మీరు ఆర్మ్ను పట్టుకున్నప్పుడు రికార్డయిన ప్రతి ఫ్రేమ్ ఒక ఇంటర్వెన్షన్ ఫ్లాగ్ను కలిగి ఉంటుంది, మరియు action కాలమ్ పూర్తి కమాండ్ చేసిన పొజిషన్ను కలిగి ఉంటుంది. మీరు ఒక ఫ్లాగ్ కాలమ్ను చేతితో నిర్వహించాల్సిన అవసరం లేదు, తర్వాత దాన్ని ఫ్రేమ్ ఇండెక్స్లతో సరిచేయాల్సిన అవసరం లేదు.
LeRobot డేటాసెట్ ఫార్మాట్ట్రయాజ్: సరిదిద్దుబాటు, ఎవాల్యుయేషన్, లేదా తొలగింపు
ప్రతి రన్కు save కార్డ్పై ఒకే ఒక నిర్ణయం ఉంటుంది. సరిదిద్దుబాటు రన్లు తర్వాతి ట్రైనింగ్ రౌండ్కు ఆహారంగా మారతాయి, ఎవాల్యుయేషన్ రన్లు ట్రైనింగ్ నుండి బయటే ఉండి ఒక శుభ్రమైన కొలతగా నిలుస్తాయి, మరియు చెడు రన్లు నిశ్శబ్దంగా మిక్స్ను విషతుల్యం చేయకుండా తొలగిపోతాయి.
సెషన్లు మరియు ఎపిసోడ్లుమిక్స్ను స్పష్టంగా కంపోజ్ చేయడం
రౌండ్ n కోసం ట్రైనింగ్ సెట్ మీరే సమకూరుస్తారు: ఒరిజినల్ డేటాసెట్ ప్లస్ సరిదిద్దుబాట్లు, ప్రతి సోర్స్ నుండి ఎపిసోడ్లు ఎంచుకోబడతాయి. ఆటోమేటిక్ కలయిక లేదు, దాచిన సిమ్యులేషన్ డేటా లేదు, మరియు కంపోజ్ చేసిన ఫలితం మిగతా ఏ డేటాసెట్ లాగానే ప్రవర్తిస్తుంది.
డేటాసెట్లుచెక్పాయింట్ నుండి కొనసాగించడం
బేస్ మోడల్కు బదులుగా మీరు ఇప్పుడే నడిపిన చెక్పాయింట్కు ఒక ట్రైనింగ్ రన్ను చూపండి, తద్వారా ప్రతి రౌండ్ చివరిది ఆగిన చోట మొదలవుతుంది. ఇది వెయిట్లను మాత్రమే ఇనీషియలైజ్ చేస్తుంది; ఆప్టిమైజర్ స్టేట్ పునరుద్ధరించబడదు, అందుకే రౌండ్ ఒకటిని ఒక ఫీజిబిలిటీ టెస్ట్గా చూడటం మంచిది.
ట్రైనింగ్రౌండ్కు అద్దెకు తీసుకున్న GPUలు
4090పై ACT మరియు SmolVLA, 80 GB ఉన్న A100పై Pi0 మరియు GR00T N1.5 లేదా N1.7. మీరు ఒక రౌండ్ను ప్రారంభిస్తారు, పాడ్ లేస్తుంది, చెక్పాయింట్లు మీ బకెట్లో పడతాయి, మరియు రౌండ్ తీసుకున్న గంటలకు మాత్రమే మీరు చెల్లిస్తారు.
GPU ధరలుమీ రౌండ్లను ప్లాన్ చేయండి
జోక్యం రేటు లూప్ యొక్క ప్రోగ్రెస్ మెట్రిక్: రన్ ఫ్రేమ్లతో భాగించిన సరిదిద్దిన ఫ్రేమ్లు. మీరు ఎక్కడ మొదలవుతారో, ప్రతి రౌండ్ మీకు ఎంత ప్రయోజనం చేకూరుస్తుందో సెట్ చేసి, మీరు కోరుకున్న చోటికి చేరడానికి ఎన్ని రౌండ్లు పడతాయో చూడండి.
| రౌండ్ | జోక్యం రేటు | సరిదిద్దిన ఫ్రేమ్లు |
|---|---|---|
| 1 | 30.0 % | 900 |
| 2 | 22.5 % | 675 |
| 3 | 16.9 % | 506 |
| 4 | 12.7 % | 380 |
| 5 | 9.5 % | 285 |
| 6 | 7.1 % | 214 |
| Σ | 2 960 | |
ఇది ఒక మోడల్, అంచనా కాదు. నిజమైన రౌండ్లు అసమానంగా సాగుతాయి, మరియు రేటును కదిలించని రౌండ్ మీకు ఏమీ తీసుకురాలేదు; సరిగ్గా అదే గమనించదగ్గ సంకేతం.
లూప్ను మీరే నిర్మించడం వర్సెస్ ఇక్కడ నడపడం
వీటిలో ఏదీ చేతితో అసాధ్యం కాదు. ప్రశ్న ఎన్ని సాయంత్రాలు రౌండ్లలోకి కాకుండా ప్లంబింగ్లోకి పోతాయన్నదే, మరియు చేతితో చేయడం స్పష్టంగా మెరుగైన సమాధానం అయిన ఒక వరుస ఉంది.
| లూప్ దశ | చేతితో సెటప్ చేయడం | AY-Robotsపై |
|---|---|---|
| రన్ మధ్యలో నియంత్రణ చేపట్టడం | ఒక leader ఆర్మ్, లేదా సర్వో బస్పై మీ స్వంత కోడ్. కీబోర్డ్ మరియు స్లైడర్ నియంత్రణ చేపట్టడం, సురక్షిత పరిమితులతో సహా, మీరు రాసి తర్వాత నిజమైన హార్డ్వేర్పై డీబగ్ చేయాల్సిన విషయం. | రన్ మొదలైనప్పుడు ఎంచుకున్న leader ఆర్మ్, కీబోర్డ్, లేదా స్లైడర్లు. యాంగిల్ క్లాంప్లు సర్వర్లో ఉంటాయి. |
| ఇంటర్వెన్షన్లను గుర్తించడం | మీరు ఫ్లాగ్ కాలమ్ను జోడించి, దాన్ని ఫ్రేమ్ ఇండెక్స్తో సరిపోల్చి ఉంచి, రికార్డింగ్ ఫార్మాట్ మారిన ప్రతిసారీ మళ్లీ తనిఖీ చేయాలి. | నియంత్రణ చేపట్టిన సమయంలో రికార్డయిన ప్రతి ఫ్రేమ్ స్వయంచాలకంగా ఫ్లాగ్ చేయబడుతుంది, action కాలమ్లో కమాండ్ చేసిన పొజిషన్తో సహా. |
| రన్లను వర్గీకరించడం | డైరెక్టరీ కన్వెన్షన్లు మరియు షెల్ స్క్రిప్ట్లు. హ్యాండోవర్ చుట్టూ ఉన్న ఫ్రీజ్ ఫ్రేమ్లను మీరే కనిపెట్టి వేరు చేయాలి. | save కార్డ్పై ప్రతి రన్కు ఒక నిర్ణయం. హ్యాండోవర్ ఫ్రేమ్లు raw డైరెక్టరీలోనే ఉంటాయి. |
| మిక్స్డ్ డేటాసెట్ను నిర్మించడం | ప్రతి ఫార్మాట్ వెర్షన్కు మెర్జ్ స్క్రిప్ట్లు. ఎపిసోడ్ ఇండెక్స్లు, మెటాడేటా, మరియు వీడియో రిఫరెన్స్లను స్థిరంగా ఉంచడమే శ్రమతో కూడిన పని. | ప్రతి సోర్స్ నుండి ఎపిసోడ్ ఎంపికతో ఒరిజినల్ ప్లస్ సరిదిద్దుబాట్ల నుండి కంపోజ్ చేయడం; ఫలితం ఒక సాధారణ డేటాసెట్. |
| చివరి పాలసీ నుండి తర్వాతి రౌండ్ను మొదలుపెట్టడం | చెక్పాయింట్ను మీరే ట్రైనర్లోకి వైర్ చేస్తారు, మరియు నిజమైన రిజ్యూమ్ కావాలంటే ఆప్టిమైజర్ స్టేట్ను కూడా పునరుద్ధరించగలరు. | బేస్ చెక్పాయింట్ కోసం ఒక ఫీల్డ్. వెయిట్లు మాత్రమే: చెక్పాయింట్ నుండి ఇనీషియలైజ్ చేస్తుంది, ఇది ఆప్టిమైజర్ రిజ్యూమ్ కాదు. |
| ట్రైనింగ్ లూప్పై నియంత్రణ | పూర్తి. మీ లాస్, మీ షెడ్యూల్, మీ ఏబ్లేషన్లు, మీ ఇన్స్ట్రుమెంటేషన్, మధ్యలో ప్లాట్ఫామ్ ఏదీ లేదు. రీసెర్చ్ ప్రశ్న ట్రైనింగ్ లూప్ అయితేనే దీన్ని చేతితో చేయండి. | పాలసీల నిర్ణీత జాబితా మరియు ఫారమ్ చూపించే హైపర్పారామీటర్లతో ఒక స్థిర మార్గం, ఇష్టానుసార కోడ్ కాదు. |
దీనికి ఆధారమైన పేపర్లు
లూప్తో వాదించే ముందు వీటిని చదవండి. ప్రతి లింక్ అబ్స్ట్రాక్ట్ పేజీకి వెళుతుంది, పేవాల్కు కాదు.
- A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning
Stephane Ross, Geoffrey J. Gordon, J. Andrew Bagnell · 2011 · AISTATS 2011 (PMLR 15)
అసలైన DAgger పేపర్: ఇది కంపౌండింగ్-ఎర్రర్ సమస్యను పేర్కొంటుంది, ప్లెయిన్ సూపర్వైజ్డ్ అప్రోచ్కు T-స్క్వేర్ బౌండ్ను ఇస్తుంది, మరియు లెర్నర్ స్వయంగా సందర్శించే స్టేట్ల నుండి డేటాను అగ్రిగేట్ చేయాలని ప్రతిపాదిస్తుంది.
- HG-DAgger: Interactive Imitation Learning with Human Experts
Michael Kelly, Chelsea Sidrane, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1810.02890, ICRA 2019
మానవ-నియంత్రిత వేరియంట్: పాలసీ ఎంచుకున్న స్టేట్ల గురించి అడగబడకుండా, ఎప్పుడు నియంత్రణ చేపట్టాలో ఎక్స్పర్ట్ నిర్ణయిస్తారు; ఈ ప్లాట్ఫామ్ అమలు చేసేది ఇదే మోడ్.
- EnsembleDAgger: A Bayesian Approach to Safe Imitation Learning
Kunal Menda, Katherine Driggs-Campbell, Mykel J. Kochenderfer · 2019 · arXiv:1807.08364, IROS 2019
ఇంటర్వెన్షన్లను గేట్ చేసే మరో మార్గం: లెర్నర్ ఒంటరిగా వ్యవహరించవచ్చా అనేదానికి కాన్ఫిడెన్స్ సిగ్నల్గా ఎన్సెంబుల్ డిజాగ్రిమెంట్. మనిషి దాన్ని నిర్ణయించనివ్వడానికి మంచి పోలిక.
- ThriftyDAgger: Budget-Aware Novelty and Risk Gating for Interactive Imitation Learning
Ryan Hoque, Ashwin Balakrishna, Ellen Novoseller, Albert Wilcox, Daniel S. Brown, Ken Goldberg · 2021 · CoRL 2021
మానవ శ్రద్ధను కొరత వనరుగా చూసి, కొత్త లేదా రిస్కీ స్టేట్లలో మాత్రమే సహాయం అడుగుతుంది; ఒక వ్యక్తి మధ్యాహ్నం అంతా ఆర్మ్ను పర్యవేక్షించేటప్పుడు ఇదే సరైన ఫ్రేమ్.
- DART: Noise Injection for Robust Imitation Learning
Michael Laskey, Jonathan Lee, Roy Fox, Anca Dragan, Ken Goldberg · 2017 · CoRL 2017
నిజాయితీగల ప్రత్యామ్నాయం: పాలసీని ఆన్లైన్లో సరిదిద్దడానికి బదులుగా, ఎక్స్పర్ట్ రికవరీని చూపేలా డెమాన్స్ట్రేషన్లను చెదరగొట్టడం. ఇంటర్వెన్షన్లకు కట్టుబడే ముందు తెలుసుకోవాల్సింది.
- Interactive Imitation Learning in Robotics: A Survey
Carlos Celemin, Rodrigo Perez-Dattari, Eugenio Chisari, Giovanni Franzese, Leandro de Souza Rosa, Ravi Prakash, Zlatan Ajanovic, Marta Ferraz, Abhinav Valada, Jens Kober · 2022 · arXiv:2211.00600
ఫీల్డ్ యొక్క మ్యాప్: మానవ ఫీడ్బ్యాక్ ఏ రూపాల్లో ఉంటుంది, వాటిని ఏ ఇంటర్ఫేస్లు మోస్తాయి, మరియు DAgger-తరహా జోక్యం వాటి మధ్య ఎక్కడ ఉంటుంది.
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware
Tony Z. Zhao, Vikash Kumar, Sergey Levine, Chelsea Finn · 2023 · arXiv:2304.13705
ACT పేపర్. చౌక ఆర్మ్ను ఇమిటేషన్ పాలసీ అసలు నడపగలగడానికి కారణం యాక్షన్ చంకింగ్, మరియు ఒక DAgger రౌండ్ను వేగంగా ఇటరేట్ చేయడానికి ACT అత్యంత వేగవంతమైన పాలసీ.
- π0: A Vision-Language-Action Flow Model for General Robot Control
Kevin Black, Noah Brown, Danny Driess, Adnan Esmail, Michael Equi, Chelsea Finn et al. · 2024 · arXiv:2410.24164
ఒక ప్రీట్రైన్డ్ విజన్-లాంగ్వేజ్ మోడల్పై నిర్మించిన ఫ్లో-మ్యాచింగ్ VLA, మరియు మీరు ఇక్కడ ఫైన్-ట్యూన్ చేయగల చెక్పాయింట్లలో ఒకటి; కొత్త స్కిల్స్ బేస్ మోడల్ నుండి మాత్రమే కాక ఫైన్-ట్యూనింగ్ నుండి వస్తాయని పేపర్ స్పష్టంగా చెబుతుంది.
మనుషులు నిజంగా అడిగే ప్రశ్నలు
DAgger కోసం నాకు leader ఆర్మ్ కావాలా?
లేదు. రన్ మొదలుపెట్టేటప్పుడు కీబోర్డ్ లేదా స్లైడర్ ఇన్పుట్ను ఎంచుకోండి, అప్పుడు నియంత్రణ చేపట్టడం మొదటి ఫ్రేమ్ నుండే మాన్యువల్గా, బ్రౌజర్ నుండి నడుస్తుంది. సూక్ష్మ కదలికలకు leader ఆర్మ్ మరింత సౌకర్యంగా ఉంటుంది, మరియు అప్పగించే ముందు ఆర్మ్ తనంతట తానే సర్దుకునే మోడ్ కూడా అదే, కానీ లూప్ దాని లేకుండా కూడా నడుస్తుంది.
నాకు ఎన్ని DAgger రౌండ్లు కావాలి?
నిజాయితీగల స్థిర సంఖ్య అంటూ లేదు. జోక్యం రేటును గమనించండి: అది ఒక రౌండ్ నుండి తర్వాతిదానికి తగ్గకపోతే, ఆ రౌండ్ ఏమీ తీసుకురాలేదు, మరియు సాధారణంగా సమస్య రౌండ్ల సంఖ్యలో కాక టాస్క్ సెటప్లో, కెమెరాల్లో, లేదా ఒరిజినల్ డేటాసెట్లో ఉంటుంది.
ఇది నిజమైన DAgger నా లేదా అంతకంటే వదులుగా ఏదైనానా?
ఇది HG-DAgger, మానవ-నియంత్రిత వేరియంట్. క్లాసిక్ DAgger పాలసీ ఎంచుకున్న స్టేట్ల గురించి ఎక్స్పర్ట్ను అడుగుతుంది, అందులో ఏ వివేకవంతమైన ఆపరేటర్ కూడా ఒక నిజమైన ఆర్మ్ను చేరనివ్వని స్టేట్లు కూడా ఉంటాయి. ఇక్కడ ఎప్పుడు జోక్యం చేసుకోవాలో ఒక మనిషి నిర్ణయిస్తారు, మరియు ఆ భాగాలు మాత్రమే లేబుళ్లుగా మారతాయి.
నేను సరిదిద్దుబాట్లపై మాత్రమే శిక్షణ ఇస్తానా?
లేదు, మరియు మీరు అలా చేయకూడదు కూడా. కేవలం సరిదిద్దుబాట్లపై శిక్షణ ఇవ్వడం వల్ల కేవలం రికవర్ చేయడం మాత్రమే తెలిసిన పాలసీ వస్తుంది. కంపోజ్ చేసిన డేటాసెట్ ఒరిజినల్ డేటా ప్లస్ సరిదిద్దుబాట్లు, ప్రతి సోర్స్ నుండి ఎపిసోడ్లు స్పష్టంగా ఎంచుకోబడతాయి.
చెక్పాయింట్ నుండి కొనసాగించడం ట్రైనింగ్ రన్ను రిజ్యూమ్ చేస్తుందా?
ఇది ఆ చెక్పాయింట్ నుండి వెయిట్లను ఇనీషియలైజ్ చేస్తుంది. ఆప్టిమైజర్ స్టేట్ పునరుద్ధరించబడదు, కాబట్టి కచ్చితమైన అర్థంలో ఇది రిజ్యూమ్ కాదు. ఆచరణలో నేర్చుకున్న ప్రవర్తనను రౌండ్ మీదుగా మోసేది వెయిట్లే, కానీ మీకు ఏది వస్తుందో తెలుసుకోవడం విలువైనది.
జోక్యం రేటు ఎలా లెక్కించబడుతుంది?
ఇంటర్వెన్షన్గా ఫ్లాగ్ చేసిన ఫ్రేమ్లను రన్ యొక్క మొత్తం ఫ్రేమ్లతో భాగించి. ఇది టేకోవర్ స్టేటస్లో చూపబడుతుంది, మరియు మీరు నడిపిన చెక్పాయింట్ మరియు శిక్షణ ఇచ్చిన మిక్స్తో పాటు ప్రతి రౌండ్కు నోట్ చేసుకోదగ్గ ఏకైక సంఖ్య ఇదే.
ఈ లూప్ను నేను ఏ పాలసీలతో నడపగలను?
ACT, SmolVLA, Pi0, మరియు GR00T N1.5 లేదా N1.7. లూప్ స్వయంగా పాలసీ-అజ్ఞేయవాదం, ఎందుకంటే ఇది కేవలం డేటాసెట్లు మరియు చెక్పాయింట్లను మాత్రమే ఉత్పత్తి చేస్తుంది; ఆచరణాత్మక తేడా ఏమిటంటే ఒక రౌండ్ ఎంత సమయం తీసుకుంటుంది మరియు దానికి ఏ GPU కావాలి అన్నదే.
రోబోట్ లేకుండా నేను ఇది చేయగలనా?
మార్కెట్ప్లేస్లో డేటాసెట్లు కొనడం ద్వారా లేదా ఆపరేటర్లను నియమించడం ద్వారా రోబోట్ లేకుండానే మీరు రికార్డ్ చేసి శిక్షణ ఇవ్వగలరు, మరియు live పేజీలో బ్రౌజర్లోనే ఒక నిజమైన SO-100ను నడపగలరు. ఒక DAgger రౌండ్ వేరే విషయం: దానికి రన్ మధ్యలో మీరు నియంత్రణ చేపట్టగల ఆర్మ్ అవసరం, కాబట్టి లూప్ కోసం మీ సొంత టేబుల్పై హార్డ్వేర్ ఉండటం అవసరం.
A real SO-100, live in the browser. No signup, no hardware needed.
ఈ వారమే మీ మొదటి రౌండ్ను నడపండి
క్లయింట్ను ఇన్స్టాల్ చేయండి, మీ దగ్గర ఇప్పటికే ఉన్న చెక్పాయింట్ను నడపండి, మరియు ఆర్మ్ క్యూబ్ను దాటి చేరుకున్న మొదటిసారి నియంత్రణ చేపట్టండి. ఆ ఒక్క రన్ ఒక చిన్న DAgger రౌండ్; దాని తర్వాత జరిగేదంతా మిక్స్ను కంపోజ్ చేయడం మరియు GPU గంటలకు చెల్లించడం మాత్రమే.