పాలసీ ట్రైనింగ్
AY-Robots నిర్వహించే GPU లపై మేనిప్యులేషన్ పాలసీలను ట్రైన్ చేస్తుంది, కాబట్టి మీరు ట్రైనింగ్ హార్డ్వేర్ను సొంతం చేసుకోకుండా రికార్డ్ చేసిన ఎపిసోడ్ల నుండి మీ ఆర్మ్పై నడిచే పాలసీ వరకు వెళ్లగలరు. ఈ పేజీ మద్దతు ఉన్న పాలసీ రకాలను, ట్రైనింగ్ రన్ పేజీని, చెక్పాయింట్లను, మీ ఎపిసోడ్ కౌంట్ నుండి వాస్తవికంగా ఏమి ఆశించాలో కవర్ చేస్తుంది.
చివరిగా అప్డేట్ చేయబడింది 2026-08-09
మీ సొంత GPU లేకుండా ట్రైనింగ్
ఒక మేనిప్యులేషన్ పాలసీని ట్రైన్ చేయడం ఒక GPU వర్క్లోడ్, ఆధునిక విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్లకు ఒక సాధారణ వర్క్స్టేషన్కు ఉన్నదానికంటే ఎక్కువ VRAM అవసరం. AY-Robots పై ట్రైనింగ్ ప్లాట్ఫారమ్ నిర్వహించే క్లౌడ్ GPU లపై నడుస్తుంది: మీరు ఒక డేటాసెట్ను, పాలసీ రకాన్ని ఎంచుకుంటారు, రన్ను ప్రారంభిస్తారు, బ్రౌజర్ నుండి దాని పురోగతిని చూస్తారు. CUDA సెటప్ లేదు, డ్రైవర్ మ్యాచింగ్ లేదు, నిర్వహించాల్సిన ఎన్విరాన్మెంట్ లేదు.
ఇన్పుట్ ఎల్లప్పుడూ Dashboard > Datasets నుండి ఒక క్లౌడ్ డేటాసెట్. మీరు టెలిఆపరేషన్ సెషన్ల ద్వారా రికార్డ్ చేసినదైనా, LeRobot ఫార్మాట్లో అప్లోడ్ చేసినదైనా, కలిపిన డేటాసెట్లతో సహా అర్హమైనది. ట్రైన్ చేయడానికి ముందు క్యూరేట్ చేయండి: Failure లేబుల్ ఉన్న ఎపిసోడ్లు సాధారణంగా ట్రైనింగ్ సెట్ నుండి బయట ఉండాలి, ఎపిసోడ్ బ్రౌజర్లో పది నిమిషాల సమీక్ష చెడ్డ డెమాన్స్ట్రేషన్ల నుండి నేర్చుకోవడంలో ఖర్చయ్యే గంటల GPU సమయాన్ని ఆదా చేస్తుంది.
మద్దతు ఉన్న పాలసీలు
నాలుగు పాలసీ కుటుంబాలు మద్దతు ఉన్నాయి. అవి పరిమాణం, ట్రైనింగ్ ఖర్చు, మీ డేటా నుండి ఎంత గ్రహించగలవు అనేదానిలో వేరుగా ఉంటాయి, కాబట్టి సరైన ఎంపిక ఏ సాధారణ ర్యాంకింగ్ కంటే మీ టాస్క్, డేటాసెట్పై ఎక్కువగా ఆధారపడి ఉంటుంది.
| పాలసీ | రకం | లక్షణాలు |
|---|---|---|
| ACT | ట్రాన్స్ఫార్మర్, యాక్షన్ చంకింగ్ | ఒకే దశలకు బదులు భవిష్యత్ యాక్షన్ల చిన్న చంక్లను అంచనా వేస్తుంది. కాంపాక్ట్, తులనాత్మకంగా వేగంగా ట్రైన్ అవుతుంది, ఒకే స్పష్టంగా నిర్వచించిన టాస్క్కు ఒక మంచి మొదటి ఎంపిక. |
| Diffusion Policy | యాక్షన్ సీక్వెన్స్లపై డిఫ్యూజన్ | ప్రదర్శించిన యాక్షన్ల పూర్తి పంపిణీని మోడల్ చేస్తుంది, మీ డెమాన్స్ట్రేషన్లు టాస్క్ను ఒకటి కంటే ఎక్కువ చెల్లుబాటు అయ్యే మార్గాల్లో పరిష్కరించినప్పుడు ఇది సహాయపడుతుంది. ACT కంటే ట్రైన్ చేయడానికి భారీగా, ఇన్ఫరెన్స్లో నెమ్మదిగా ఉంటుంది. |
| SmolVLA | చిన్న విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్ | భాషా-ఆధారితం: మీ ఎపిసోడ్ల నుండి టాస్క్ స్ట్రింగ్ ఇన్పుట్లో భాగం అవుతుంది. పెద్ద ఫౌండేషన్ మోడల్ లేకుండా భాషా కండిషనింగ్ కావాలనుకున్నప్పుడు ఒక మంచి మధ్యస్థ మార్గం. |
| GR00T ఫైన్-ట్యూన్ | ఫౌండేషన్ మోడల్ ఫైన్-ట్యూన్ | మీ ఎపిసోడ్లపై ఒక పెద్ద ప్రీ-ట్రైన్డ్ రోబోటిక్స్ ఫౌండేషన్ మోడల్ను ఫైన్-ట్యూన్ చేస్తుంది. నాలుగింటిలో అత్యధిక పరిమితి, అత్యధిక ట్రైనింగ్ ఖర్చుతో, కఠినమైన డేటాసెట్ ఫార్మాట్ అవసరంతో. |
GR00T ఫైన్-ట్యూనింగ్ LeRobot ఫార్మాట్ వెర్షన్ 2.1 లో ఉన్న డేటాసెట్లను మాత్రమే ఆమోదిస్తుంది. ఒక v3.0 డేటాసెట్ సబ్మిషన్లో కాదు, డేటా లోడింగ్ సమయంలో విఫలమవుతుంది, కాబట్టి రన్ను ప్రారంభించడానికి ముందు ఫార్మాట్ వెర్షన్ను తనిఖీ చేయండి. ప్లాట్ఫారమ్పై రికార్డ్ చేసిన డేటాసెట్లు ఉన్నవి ఉన్నట్లుగా ఉపయోగించవచ్చు; బాహ్య అప్లోడ్ల కోసం, ముందుగా meta/info.json లో వెర్షన్ను ధృవీకరించండి.
ఒక రన్ను ప్రారంభించడం
- 1డేటాసెట్ను ఎంచుకోండి
Dashboard > Training ను తెరిచి ట్రైన్ చేయాల్సిన డేటాసెట్ను ఎంచుకోండి. ఎపిసోడ్ కౌంట్, రోబో రకం చూపబడతాయి, కాబట్టి మీరు సరైనదాన్ని ఎంచుకున్నారని నిర్ధారించుకోవచ్చు.
- 2పాలసీని ఎంచుకోండి
మద్దతు ఉన్న పాలసీ రకాలలో ఒకదాన్ని ఎంచుకోండి. మీకు ఖచ్చితంగా తెలియకపోతే, ACT తో మొదలుపెట్టండి: మీ డేటాసెట్ ఏదైనా ట్రైన్ చేయడానికి తగినంత మంచిదో లేదో తెలుసుకోవడానికి ఇదే చౌకైన మార్గం.
- 3లాంచ్ చేయండి
రన్ను ప్రారంభించండి. దానికి ఒక job id, దాని స్వంత రన్ పేజీ లభిస్తాయి, మీరు బ్రౌజర్ను మూసేయవచ్చు: ట్రైనింగ్ సర్వర్-సైడ్లో కొనసాగుతుంది, మీరు తిరిగి వచ్చినప్పుడల్లా పేజీ ప్రత్యక్ష స్థితిని చూపిస్తుంది.
ట్రైనింగ్ రన్ పేజీ
ప్రతి రన్కు ట్రైనింగ్ సమయంలో మీకు నిజంగా ఉండే రెండు ప్రశ్నలకు సమాధానం ఇచ్చే ఒక ప్రత్యేక పేజీ ఉంటుంది: ఇది నేర్చుకుంటుందా, మెషిన్ ఆరోగ్యంగా ఉందా. లెర్నింగ్ పురోగతి లాస్, లెర్నింగ్ రేట్ షెడ్యూల్, గ్రేడియంట్ నార్మ్ చార్ట్లుగా చూపబడుతుంది. వెంటనే స్థిరపడిపోయే ఒక లాస్ లేదా పేలిపోయే ఒక గ్రేడియంట్ నార్మ్ ఒక రన్ ఎదురుచూడదగినదా కాదా అని ముందుగానే చెబుతుంది.
మెషిన్ ఆరోగ్యం దానితో పాటు చూపబడుతుంది: GPU వినియోగం, మెమరీ, ట్రైనింగ్ మెషిన్ యొక్క హోస్ట్ మెట్రిక్లు. ఒక ఫేజ్ టైమ్లైన్ రన్ ప్రస్తుతం ఎక్కడ ఉందో చూపిస్తుంది, ఎన్విరాన్మెంట్ తయారీ నుండి డేటా లోడింగ్, అసలైన ట్రైనింగ్ లూప్, చెక్పాయింట్ అప్లోడ్ వరకు. ఏదైనా తప్పుగా అనిపిస్తే, బిల్ట్-ఇన్ లాగ్ వ్యూయర్ ఎలాంటి SSH యాక్సెస్ లేకుండా ముడి ట్రైనింగ్ లాగ్లను ఇస్తుంది, ఇది వైఫల్యం మీ డేటాసెట్ వల్లనా లేదా రన్ వల్లనా అని చూడటానికి సాధారణంగా సరిపోతుంది.
చెక్పాయింట్లు మరియు తిరిగి ప్రారంభించడం
చెక్పాయింట్లు ఒక పంచుకున్న పూల్లో కాకుండా, ప్రతి రన్కు విడిగా నిల్వ చేయబడతాయి, కాబట్టి ఒక రన్ పేజీలో జాబితా చేయబడిన చెక్పాయింట్లు ఎల్లప్పుడూ ఆ రన్కు, దాని కాన్ఫిగరేషన్కు మాత్రమే చెందుతాయి. ఇది వినిపించే దానికంటే ఎక్కువ ముఖ్యమైనది: వేర్వేరు సెట్టింగ్లు ఉన్న రన్ల మధ్య చెక్పాయింట్లను కలపడం నిశ్శబ్దంగా విరిగిపోయిన పాలసీలకు ఒక సాధారణ కారణం.
ఒక రన్ అంతరాయం చెందితే, మళ్లీ మొదలుపెట్టడానికి బదులు దాని తాజా చెక్పాయింట్ నుండి మీరు తిరిగి ప్రారంభించవచ్చు. మధ్యంతర చెక్పాయింట్లు కూడా వాటంతటవే ఉపయోగకరంగా ఉంటాయి: ఒక సుదీర్ఘ రన్ చివరిలో ఓవర్ఫిట్ కావడం ప్రారంభించినప్పుడు, ఒక ముందస్తు చెక్పాయింట్ తరచుగా చివరిదాని కంటే నిజమైన ఆర్మ్పై బాగా పనిచేస్తుంది.
ట్రైన్ చేసిన పాలసీని మీ ఆర్మ్పై నడపడం
ఒక పూర్తయిన పాలసీని నేరుగా మీ రోబోకు తిరిగి డిప్లాయ్ చేయవచ్చు. కాక్పిట్లో, మీ కనెక్ట్ అయిన ఆర్మ్ కోసం ట్రైన్ చేసిన పాలసీని ఎంచుకుని ఇన్ఫరెన్స్ను ప్రారంభించండి: ఇప్పుడు ఆ పాలసీ ముందు మీరు టెలిఆపరేషన్ ద్వారా ఉత్పత్తి చేసిన అదే జాయింట్ కమాండ్లను ఉత్పత్తి చేస్తుంది. ఆర్మ్ డేటాసెట్ రికార్డ్ చేయబడిన అదే రోబో రకంగా ఉండాలి, సీన్ ట్రైనింగ్ సీన్లను పోలి ఉండాలి, కెమెరా ప్లేస్మెంట్తో సహా.
మొదటి ఇన్ఫరెన్స్ రన్లను డెమోల వలె కాకుండా ప్రయోగాల వలె భావించండి. ఎమర్జెన్సీ స్టాప్ను చేతికి అందుబాటులో ఉంచండి, మీరు ప్రదర్శించిన దానికి దగ్గరగా ఉన్న ఒక ప్రారంభ స్థితి నుండి మొదలుపెట్టండి, మీరు గమనించని విషయాలకు పాలసీ సున్నితంగా ఉంటుందని ఆశించండి: కదిలిన ఒక కెమెరా, వేరే లైటింగ్, లేదా డేటాసెట్లో ఎప్పుడూ లేని ఒక వస్తువు.
మీకు ఎన్ని ఎపిసోడ్లు అవసరం
ప్లాట్ఫారమ్పై అత్యంత సాధారణ ట్రైనింగ్ తప్పు ఒక తప్పు హైపర్పారామీటర్ కాదు, చాలా తక్కువ డేటాపై ట్రైన్ చేసి పాలసీ రకం పనిచేయదని నిర్ధారించడం. ఒక ఒంటరి టేబుల్టాప్ టాస్క్కు ఒక సాధారణ నియమంగా: సుమారు 50 ఎపిసోడ్లు మీరు ప్రదర్శించిన స్థితులకు దగ్గరగా ఉన్న ప్రారంభ స్థితుల నుండి విజయవంతమయ్యే ఒక పాలసీని మీకు ఇస్తాయి, ఇరుకైన సాధారణీకరణతో. మీరు ఎపిసోడ్ల మధ్య వస్తువు ప్లేస్మెంట్ను మార్చినట్లయితే, సుమారు 100 నుండి 200 ఎపిసోడ్లు ఆ ఒక్క టాస్క్ కోసం వర్క్స్పేస్ అంతటా ఉపయోగించదగిన బలాన్ని ఇస్తాయి.
మరింత సమర్థవంతమైన పాలసీ రకాలు దీన్ని రద్దు చేయవు. 20 ఎపిసోడ్లపై ఒక GR00T ఫైన్-ట్యూన్ ఇప్పటికీ పేలవంగానే సాధారణీకరిస్తుంది; డేటా అందుబాటులో ఉన్న తర్వాత పెద్ద మోడల్లు మీకు ఇచ్చేది ఒక మెరుగైన పరిమితి. మీ బడ్జెట్ పరిమితంగా ఉంటే, ఒక పెద్ద మోడల్పై ఖర్చు చేయడానికి ముందు మరింత వైవిధ్యమైన ఎపిసోడ్లపై ఖర్చు చేయండి.
తరచుగా అడిగే ప్రశ్నలు
ఒక ట్రైనింగ్ రన్ ఎంత సమయం తీసుకుంటుంది?▾
ఇది పాలసీ రకం, డేటాసెట్ పరిమాణంపై ఆధారపడి ఉంటుంది, కాబట్టి ఒక నిజాయితీగల ఒకే సంఖ్య లేదు. ACT సాధారణంగా నాలుగింటిలో అత్యంత వేగవంతమైనది, GR00T ఫైన్-ట్యూన్లు అత్యంత నెమ్మదైనవి. రన్ పేజీలోని ఫేజ్ టైమ్లైన్, లాస్ చార్ట్లు ఒక రన్ పురోగతి సాధిస్తుందా అని ముందుగానే చూపిస్తాయి.
నేను ఒక కలిపిన డేటాసెట్పై ట్రైన్ చేయవచ్చా?▾
అవును. కలిపిన డేటాసెట్లు సాధారణ డేటాసెట్లే; మెర్జ్ వాలిడేషన్ ఇప్పటికే స్థిరమైన fps, ఫీచర్లు, రోబో రకాన్ని నిర్ధారించింది. అదే టాస్క్ యొక్క రికార్డింగ్లను మెర్జ్ చేయడం 100 నుండి 200 ఎపిసోడ్ రేంజ్ను చేరుకోవడానికి అత్యంత ప్రభావవంతమైన మార్గాలలో ఒకటి.
నా GR00T రన్ డేటా లోడింగ్ సమయంలో విఫలమవుతుంది. నేను ముందుగా ఏమి తనిఖీ చేయాలి?▾
డేటాసెట్ ఫార్మాట్ వెర్షన్. GR00T ఫైన్-ట్యూనింగ్కు LeRobot v2.1 అవసరం, ఒక v3.0 డేటాసెట్ సరిగ్గా అక్కడే విఫలమవుతుంది. మీ డేటాసెట్ యొక్క meta/info.json లో వెర్షన్ను తనిఖీ చేయండి.
ట్రైనింగ్కు ముందు నేను విఫలమైన ఎపిసోడ్లను తీసివేయాలా?▾
సాధారణంగా అవును. Failure లేబుల్ ఉన్న ఎపిసోడ్లు పాలసీకి విఫలమయ్యే ప్రవర్తనను నేర్పిస్తాయి. Recovery ఎపిసోడ్లు వేరుగా ఉంటాయి: అవి ఒక తప్పును ఎలా సరిచేయాలో చూపిస్తాయి, తరచుగా ఉంచదగినవి.
ట్రైనింగ్ సమయంలో నేను బ్రౌజర్ను తెరిచి ఉంచాలా?▾
లేదు. రన్లు సర్వర్-సైడ్లో అమలవుతాయి. మీరు తిరిగి వచ్చినప్పుడల్లా రన్ పేజీ ప్రస్తుత స్థితి, చార్ట్లు, లాగ్లను చూపిస్తుంది, ఎవరైనా చూస్తున్నారా లేదా అనే దానితో సంబంధం లేకుండా చెక్పాయింట్లు సేవ్ చేయబడతాయి.
AY-Robots టెలిఆపరేషన్ రికార్డింగ్లను LeRobot ఫార్మాట్లో ఎలా నిల్వ చేస్తుంది: ఎపిసోడ్ నిర్మాణం, డాష్బోర్డ్ ఎపిసోడ్ బ్రౌజర్, అప్లోడ్లను మెర్జ్ చేయడం, మార్కెట్ప్లేస్.
AY-Robots పై మద్దతు ఉన్న ప్రతి రోబో ఆర్మ్ దాని స్పెసిఫికేషన్లతో: SO-100, Koch v1.1, Franka FR3, FP3 మరియు Panda, WidowX-250, ALOHA ViperX-300.