పాలసీ ట్రైనింగ్

AY-Robots నిర్వహించే GPU లపై మేనిప్యులేషన్ పాలసీలను ట్రైన్ చేస్తుంది, కాబట్టి మీరు ట్రైనింగ్ హార్డ్‌వేర్‌ను సొంతం చేసుకోకుండా రికార్డ్ చేసిన ఎపిసోడ్‌ల నుండి మీ ఆర్మ్‌పై నడిచే పాలసీ వరకు వెళ్లగలరు. ఈ పేజీ మద్దతు ఉన్న పాలసీ రకాలను, ట్రైనింగ్ రన్ పేజీని, చెక్‌పాయింట్‌లను, మీ ఎపిసోడ్ కౌంట్ నుండి వాస్తవికంగా ఏమి ఆశించాలో కవర్ చేస్తుంది.

చివరిగా అప్‌డేట్ చేయబడింది 2026-08-09

మీ సొంత GPU లేకుండా ట్రైనింగ్

ఒక మేనిప్యులేషన్ పాలసీని ట్రైన్ చేయడం ఒక GPU వర్క్‌లోడ్, ఆధునిక విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్‌లకు ఒక సాధారణ వర్క్‌స్టేషన్‌కు ఉన్నదానికంటే ఎక్కువ VRAM అవసరం. AY-Robots పై ట్రైనింగ్ ప్లాట్‌ఫారమ్ నిర్వహించే క్లౌడ్ GPU లపై నడుస్తుంది: మీరు ఒక డేటాసెట్‌ను, పాలసీ రకాన్ని ఎంచుకుంటారు, రన్‌ను ప్రారంభిస్తారు, బ్రౌజర్ నుండి దాని పురోగతిని చూస్తారు. CUDA సెటప్ లేదు, డ్రైవర్ మ్యాచింగ్ లేదు, నిర్వహించాల్సిన ఎన్విరాన్మెంట్ లేదు.

ఇన్‌పుట్ ఎల్లప్పుడూ Dashboard > Datasets నుండి ఒక క్లౌడ్ డేటాసెట్. మీరు టెలిఆపరేషన్ సెషన్‌ల ద్వారా రికార్డ్ చేసినదైనా, LeRobot ఫార్మాట్‌లో అప్‌లోడ్ చేసినదైనా, కలిపిన డేటాసెట్‌లతో సహా అర్హమైనది. ట్రైన్ చేయడానికి ముందు క్యూరేట్ చేయండి: Failure లేబుల్ ఉన్న ఎపిసోడ్‌లు సాధారణంగా ట్రైనింగ్ సెట్ నుండి బయట ఉండాలి, ఎపిసోడ్ బ్రౌజర్‌లో పది నిమిషాల సమీక్ష చెడ్డ డెమాన్‌స్ట్రేషన్‌ల నుండి నేర్చుకోవడంలో ఖర్చయ్యే గంటల GPU సమయాన్ని ఆదా చేస్తుంది.

మద్దతు ఉన్న పాలసీలు

నాలుగు పాలసీ కుటుంబాలు మద్దతు ఉన్నాయి. అవి పరిమాణం, ట్రైనింగ్ ఖర్చు, మీ డేటా నుండి ఎంత గ్రహించగలవు అనేదానిలో వేరుగా ఉంటాయి, కాబట్టి సరైన ఎంపిక ఏ సాధారణ ర్యాంకింగ్ కంటే మీ టాస్క్, డేటాసెట్‌పై ఎక్కువగా ఆధారపడి ఉంటుంది.

పాలసీరకంలక్షణాలు
ACTట్రాన్స్‌ఫార్మర్, యాక్షన్ చంకింగ్ఒకే దశలకు బదులు భవిష్యత్ యాక్షన్‌ల చిన్న చంక్‌లను అంచనా వేస్తుంది. కాంపాక్ట్, తులనాత్మకంగా వేగంగా ట్రైన్ అవుతుంది, ఒకే స్పష్టంగా నిర్వచించిన టాస్క్‌కు ఒక మంచి మొదటి ఎంపిక.
Diffusion Policyయాక్షన్ సీక్వెన్స్‌లపై డిఫ్యూజన్ప్రదర్శించిన యాక్షన్‌ల పూర్తి పంపిణీని మోడల్ చేస్తుంది, మీ డెమాన్‌స్ట్రేషన్‌లు టాస్క్‌ను ఒకటి కంటే ఎక్కువ చెల్లుబాటు అయ్యే మార్గాల్లో పరిష్కరించినప్పుడు ఇది సహాయపడుతుంది. ACT కంటే ట్రైన్ చేయడానికి భారీగా, ఇన్‌ఫరెన్స్‌లో నెమ్మదిగా ఉంటుంది.
SmolVLAచిన్న విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్భాషా-ఆధారితం: మీ ఎపిసోడ్‌ల నుండి టాస్క్ స్ట్రింగ్ ఇన్‌పుట్‌లో భాగం అవుతుంది. పెద్ద ఫౌండేషన్ మోడల్ లేకుండా భాషా కండిషనింగ్ కావాలనుకున్నప్పుడు ఒక మంచి మధ్యస్థ మార్గం.
GR00T ఫైన్-ట్యూన్ఫౌండేషన్ మోడల్ ఫైన్-ట్యూన్మీ ఎపిసోడ్‌లపై ఒక పెద్ద ప్రీ-ట్రైన్డ్ రోబోటిక్స్ ఫౌండేషన్ మోడల్‌ను ఫైన్-ట్యూన్ చేస్తుంది. నాలుగింటిలో అత్యధిక పరిమితి, అత్యధిక ట్రైనింగ్ ఖర్చుతో, కఠినమైన డేటాసెట్ ఫార్మాట్ అవసరంతో.
GR00T కు LeRobot v2.1 డేటాసెట్‌లు అవసరం

GR00T ఫైన్-ట్యూనింగ్ LeRobot ఫార్మాట్ వెర్షన్ 2.1 లో ఉన్న డేటాసెట్‌లను మాత్రమే ఆమోదిస్తుంది. ఒక v3.0 డేటాసెట్ సబ్మిషన్‌లో కాదు, డేటా లోడింగ్ సమయంలో విఫలమవుతుంది, కాబట్టి రన్‌ను ప్రారంభించడానికి ముందు ఫార్మాట్ వెర్షన్‌ను తనిఖీ చేయండి. ప్లాట్‌ఫారమ్‌పై రికార్డ్ చేసిన డేటాసెట్‌లు ఉన్నవి ఉన్నట్లుగా ఉపయోగించవచ్చు; బాహ్య అప్‌లోడ్‌ల కోసం, ముందుగా meta/info.json లో వెర్షన్‌ను ధృవీకరించండి.

ఒక రన్‌ను ప్రారంభించడం

  1. 1
    డేటాసెట్‌ను ఎంచుకోండి

    Dashboard > Training ను తెరిచి ట్రైన్ చేయాల్సిన డేటాసెట్‌ను ఎంచుకోండి. ఎపిసోడ్ కౌంట్, రోబో రకం చూపబడతాయి, కాబట్టి మీరు సరైనదాన్ని ఎంచుకున్నారని నిర్ధారించుకోవచ్చు.

  2. 2
    పాలసీని ఎంచుకోండి

    మద్దతు ఉన్న పాలసీ రకాలలో ఒకదాన్ని ఎంచుకోండి. మీకు ఖచ్చితంగా తెలియకపోతే, ACT తో మొదలుపెట్టండి: మీ డేటాసెట్ ఏదైనా ట్రైన్ చేయడానికి తగినంత మంచిదో లేదో తెలుసుకోవడానికి ఇదే చౌకైన మార్గం.

  3. 3
    లాంచ్ చేయండి

    రన్‌ను ప్రారంభించండి. దానికి ఒక job id, దాని స్వంత రన్ పేజీ లభిస్తాయి, మీరు బ్రౌజర్‌ను మూసేయవచ్చు: ట్రైనింగ్ సర్వర్-సైడ్‌లో కొనసాగుతుంది, మీరు తిరిగి వచ్చినప్పుడల్లా పేజీ ప్రత్యక్ష స్థితిని చూపిస్తుంది.

ట్రైనింగ్ రన్ పేజీ

ప్రతి రన్‌కు ట్రైనింగ్ సమయంలో మీకు నిజంగా ఉండే రెండు ప్రశ్నలకు సమాధానం ఇచ్చే ఒక ప్రత్యేక పేజీ ఉంటుంది: ఇది నేర్చుకుంటుందా, మెషిన్ ఆరోగ్యంగా ఉందా. లెర్నింగ్ పురోగతి లాస్, లెర్నింగ్ రేట్ షెడ్యూల్, గ్రేడియంట్ నార్మ్ చార్ట్‌లుగా చూపబడుతుంది. వెంటనే స్థిరపడిపోయే ఒక లాస్ లేదా పేలిపోయే ఒక గ్రేడియంట్ నార్మ్ ఒక రన్ ఎదురుచూడదగినదా కాదా అని ముందుగానే చెబుతుంది.

మెషిన్ ఆరోగ్యం దానితో పాటు చూపబడుతుంది: GPU వినియోగం, మెమరీ, ట్రైనింగ్ మెషిన్ యొక్క హోస్ట్ మెట్రిక్‌లు. ఒక ఫేజ్ టైమ్‌లైన్ రన్ ప్రస్తుతం ఎక్కడ ఉందో చూపిస్తుంది, ఎన్విరాన్మెంట్ తయారీ నుండి డేటా లోడింగ్, అసలైన ట్రైనింగ్ లూప్, చెక్‌పాయింట్ అప్‌లోడ్ వరకు. ఏదైనా తప్పుగా అనిపిస్తే, బిల్ట్-ఇన్ లాగ్ వ్యూయర్ ఎలాంటి SSH యాక్సెస్ లేకుండా ముడి ట్రైనింగ్ లాగ్‌లను ఇస్తుంది, ఇది వైఫల్యం మీ డేటాసెట్ వల్లనా లేదా రన్ వల్లనా అని చూడటానికి సాధారణంగా సరిపోతుంది.

చెక్‌పాయింట్‌లు మరియు తిరిగి ప్రారంభించడం

చెక్‌పాయింట్‌లు ఒక పంచుకున్న పూల్‌లో కాకుండా, ప్రతి రన్‌కు విడిగా నిల్వ చేయబడతాయి, కాబట్టి ఒక రన్ పేజీలో జాబితా చేయబడిన చెక్‌పాయింట్‌లు ఎల్లప్పుడూ ఆ రన్‌కు, దాని కాన్ఫిగరేషన్‌కు మాత్రమే చెందుతాయి. ఇది వినిపించే దానికంటే ఎక్కువ ముఖ్యమైనది: వేర్వేరు సెట్టింగ్‌లు ఉన్న రన్‌ల మధ్య చెక్‌పాయింట్‌లను కలపడం నిశ్శబ్దంగా విరిగిపోయిన పాలసీలకు ఒక సాధారణ కారణం.

ఒక రన్ అంతరాయం చెందితే, మళ్లీ మొదలుపెట్టడానికి బదులు దాని తాజా చెక్‌పాయింట్ నుండి మీరు తిరిగి ప్రారంభించవచ్చు. మధ్యంతర చెక్‌పాయింట్‌లు కూడా వాటంతటవే ఉపయోగకరంగా ఉంటాయి: ఒక సుదీర్ఘ రన్ చివరిలో ఓవర్‌ఫిట్ కావడం ప్రారంభించినప్పుడు, ఒక ముందస్తు చెక్‌పాయింట్ తరచుగా చివరిదాని కంటే నిజమైన ఆర్మ్‌పై బాగా పనిచేస్తుంది.

ట్రైన్ చేసిన పాలసీని మీ ఆర్మ్‌పై నడపడం

ఒక పూర్తయిన పాలసీని నేరుగా మీ రోబోకు తిరిగి డిప్లాయ్ చేయవచ్చు. కాక్‌పిట్‌లో, మీ కనెక్ట్ అయిన ఆర్మ్ కోసం ట్రైన్ చేసిన పాలసీని ఎంచుకుని ఇన్‌ఫరెన్స్‌ను ప్రారంభించండి: ఇప్పుడు ఆ పాలసీ ముందు మీరు టెలిఆపరేషన్ ద్వారా ఉత్పత్తి చేసిన అదే జాయింట్ కమాండ్‌లను ఉత్పత్తి చేస్తుంది. ఆర్మ్ డేటాసెట్ రికార్డ్ చేయబడిన అదే రోబో రకంగా ఉండాలి, సీన్ ట్రైనింగ్ సీన్‌లను పోలి ఉండాలి, కెమెరా ప్లేస్‌మెంట్‌తో సహా.

మొదటి ఇన్‌ఫరెన్స్ రన్‌లను డెమోల వలె కాకుండా ప్రయోగాల వలె భావించండి. ఎమర్జెన్సీ స్టాప్‌ను చేతికి అందుబాటులో ఉంచండి, మీరు ప్రదర్శించిన దానికి దగ్గరగా ఉన్న ఒక ప్రారంభ స్థితి నుండి మొదలుపెట్టండి, మీరు గమనించని విషయాలకు పాలసీ సున్నితంగా ఉంటుందని ఆశించండి: కదిలిన ఒక కెమెరా, వేరే లైటింగ్, లేదా డేటాసెట్‌లో ఎప్పుడూ లేని ఒక వస్తువు.

మీకు ఎన్ని ఎపిసోడ్‌లు అవసరం

ప్లాట్‌ఫారమ్‌పై అత్యంత సాధారణ ట్రైనింగ్ తప్పు ఒక తప్పు హైపర్‌పారామీటర్ కాదు, చాలా తక్కువ డేటాపై ట్రైన్ చేసి పాలసీ రకం పనిచేయదని నిర్ధారించడం. ఒక ఒంటరి టేబుల్‌టాప్ టాస్క్‌కు ఒక సాధారణ నియమంగా: సుమారు 50 ఎపిసోడ్‌లు మీరు ప్రదర్శించిన స్థితులకు దగ్గరగా ఉన్న ప్రారంభ స్థితుల నుండి విజయవంతమయ్యే ఒక పాలసీని మీకు ఇస్తాయి, ఇరుకైన సాధారణీకరణతో. మీరు ఎపిసోడ్‌ల మధ్య వస్తువు ప్లేస్‌మెంట్‌ను మార్చినట్లయితే, సుమారు 100 నుండి 200 ఎపిసోడ్‌లు ఆ ఒక్క టాస్క్ కోసం వర్క్‌స్పేస్ అంతటా ఉపయోగించదగిన బలాన్ని ఇస్తాయి.

మరింత సమర్థవంతమైన పాలసీ రకాలు దీన్ని రద్దు చేయవు. 20 ఎపిసోడ్‌లపై ఒక GR00T ఫైన్-ట్యూన్ ఇప్పటికీ పేలవంగానే సాధారణీకరిస్తుంది; డేటా అందుబాటులో ఉన్న తర్వాత పెద్ద మోడల్‌లు మీకు ఇచ్చేది ఒక మెరుగైన పరిమితి. మీ బడ్జెట్ పరిమితంగా ఉంటే, ఒక పెద్ద మోడల్‌పై ఖర్చు చేయడానికి ముందు మరింత వైవిధ్యమైన ఎపిసోడ్‌లపై ఖర్చు చేయండి.

తరచుగా అడిగే ప్రశ్నలు

ఒక ట్రైనింగ్ రన్ ఎంత సమయం తీసుకుంటుంది?

ఇది పాలసీ రకం, డేటాసెట్ పరిమాణంపై ఆధారపడి ఉంటుంది, కాబట్టి ఒక నిజాయితీగల ఒకే సంఖ్య లేదు. ACT సాధారణంగా నాలుగింటిలో అత్యంత వేగవంతమైనది, GR00T ఫైన్-ట్యూన్‌లు అత్యంత నెమ్మదైనవి. రన్ పేజీలోని ఫేజ్ టైమ్‌లైన్, లాస్ చార్ట్‌లు ఒక రన్ పురోగతి సాధిస్తుందా అని ముందుగానే చూపిస్తాయి.

నేను ఒక కలిపిన డేటాసెట్‌పై ట్రైన్ చేయవచ్చా?

అవును. కలిపిన డేటాసెట్‌లు సాధారణ డేటాసెట్‌లే; మెర్జ్ వాలిడేషన్ ఇప్పటికే స్థిరమైన fps, ఫీచర్‌లు, రోబో రకాన్ని నిర్ధారించింది. అదే టాస్క్ యొక్క రికార్డింగ్‌లను మెర్జ్ చేయడం 100 నుండి 200 ఎపిసోడ్ రేంజ్‌ను చేరుకోవడానికి అత్యంత ప్రభావవంతమైన మార్గాలలో ఒకటి.

నా GR00T రన్ డేటా లోడింగ్ సమయంలో విఫలమవుతుంది. నేను ముందుగా ఏమి తనిఖీ చేయాలి?

డేటాసెట్ ఫార్మాట్ వెర్షన్. GR00T ఫైన్-ట్యూనింగ్‌కు LeRobot v2.1 అవసరం, ఒక v3.0 డేటాసెట్ సరిగ్గా అక్కడే విఫలమవుతుంది. మీ డేటాసెట్ యొక్క meta/info.json లో వెర్షన్‌ను తనిఖీ చేయండి.

ట్రైనింగ్‌కు ముందు నేను విఫలమైన ఎపిసోడ్‌లను తీసివేయాలా?

సాధారణంగా అవును. Failure లేబుల్ ఉన్న ఎపిసోడ్‌లు పాలసీకి విఫలమయ్యే ప్రవర్తనను నేర్పిస్తాయి. Recovery ఎపిసోడ్‌లు వేరుగా ఉంటాయి: అవి ఒక తప్పును ఎలా సరిచేయాలో చూపిస్తాయి, తరచుగా ఉంచదగినవి.

ట్రైనింగ్ సమయంలో నేను బ్రౌజర్‌ను తెరిచి ఉంచాలా?

లేదు. రన్‌లు సర్వర్-సైడ్‌లో అమలవుతాయి. మీరు తిరిగి వచ్చినప్పుడల్లా రన్ పేజీ ప్రస్తుత స్థితి, చార్ట్‌లు, లాగ్‌లను చూపిస్తుంది, ఎవరైనా చూస్తున్నారా లేదా అనే దానితో సంబంధం లేకుండా చెక్‌పాయింట్‌లు సేవ్ చేయబడతాయి.