
GR00T N1.7, Pi0.5, SmolVLA, ACT లేదా GR00T N1.5? నిజమైన పరిస్థితులకు సరిపోలే నిర్ణయ పట్టిక, ప్రచురించబడిన బెంచ్మార్క్ సంఖ్యలు, లేటెన్సీ, ఒక్కో రన్కు ఖర్చు మరియు ప్రతి ఎంపిక వెనుక ఉన్న లైసెన్స్లతో సహా.
ఈరోజు SO-100 క్లాస్ ఆర్మ్లో ఐదు పాలసీలను శిక్షణ ఇవ్వవచ్చు. అవి ఇన్ఫరెన్స్లో 24 రెట్లు తేడాను కలిగి ఉంటాయి లేటెన్సీ, పారామీటర్ కౌంట్లో 37, ఒక రన్ ఖర్చులో 12 రెట్లు తేడాను కలిగి ఉంటాయి, మరియు మీరు ఫలితాన్ని షిప్ చేయవచ్చా లేదా అనే దానిలో కూడా తేడా ఉంటుంది. ఐదు మోడల్ కార్డ్లు దీన్ని పరిష్కరించవు: మీకు ఉన్న ప్రశ్నకి ఏదీ సమాధానం ఇవ్వదు, నేను ముందుగా దేన్ని అమలు చేయాలి?
దిగువన ఉన్న ప్రతి సంఖ్య ఆగస్టు 2026లో పేపర్లు, రెపోలు మరియు కార్డ్ల నుండి చదవబడింది. ప్లాట్ఫారమ్ సంఖ్యలు నుండి వస్తాయి AY-Robots పాలసీ కేటలాగ్; ఇక్కడ రెండు విరుద్ధంగా ఉంటే, రెండూ చూపబడతాయి.
సంక్షిప్త వెర్షన్
- •మీ డేటాసెట్ గురించి మీకు సందేహం ఉంటే ముందుగా ACTకి శిక్షణ ఇవ్వండి: ఒక రన్కి 1 నుండి 3 USD, చెడు డేటాను కప్పిపుచ్చడానికి ముందుగా శిక్షణ పొందినది ఏదీ లేదు.
- •GR00T N1.7 మరియు Pi0.5 LIBEROలో సగం పాయింట్ లోపల ఉన్నాయి, 97.0కి వ్యతిరేకంగా 96.85 నుండి 97.5 వరకు. ఇది దేనినీ ఎంచుకోవడానికి కారణం కాదు.
- •Pi0.5 అనేది జనరలైజేషన్ ప్లే, ఖచ్చితత్వ ప్లే కాదు, మరియు 485 ms వద్ద అత్యంత నెమ్మదైనది.
- •SmolVLA, 450 M పారామీటర్లతో, ఇక్కడ ఒకే 24 GB కార్డ్లో ఫైన్-ట్యూన్ చేసే ఏకైక VLA.
- •20 ms వద్ద ACT వేగవంతమైన రియాక్టివ్ మోషన్ కోసం ఏకైక ఎంపిక. లైసెన్స్లు మిగిలిన వాటిని నిర్ణయిస్తాయి.
నిర్ణయ పట్టిక
| మీ పరిస్థితి | దీనిని శిక్షణ చేయండి | ఎందుకు |
|---|---|---|
| డేటాసెట్ నాణ్యత నిరూపించబడలేదు | ACT | ముందుగా శిక్షణ పొందిన ఏదీ విరిగిన డేటాసెట్ను దాచదు, మరియు విఫలమైతే 1 నుండి 3 USD ఖర్చవుతుంది. |
| సంపర్క-సమృద్ధి, బహుళ-దశ, భాషా-నియంత్రిత | GR00T N1.7 | నాలుగు LIBERO సూట్లలో 97.0%, అదనంగా సాపేక్ష ఎండ్-ఎఫెక్టార్ యాక్షన్ స్పేస్. |
| వేగవంతమైన ప్రతిస్పందన కదలిక, సర్వోల వద్ద ఇన్ఫరెన్స్ | ACT | 20 ms. తదుపరి వేగవంతమైనది 7.6 రెట్లు నెమ్మదిగా ఉంటుంది. |
| కొత్త వస్తువులు, కొత్త దృశ్యం, ఓపెన్-వరల్డ్ | Pi0.5 | 104 స్థానాల వరకు, అవుట్-ఆఫ్-డిస్ట్రిబ్యూషన్ ప్రవర్తన కోసం నిర్మించబడింది. |
| ఒక 24 GB కార్డ్, ఇంకా భాష కావాలి | SmolVLA | 450 M పారామీటర్లు, 30 ఎపిసోడ్ ఫ్లోర్, స్థానికంగా నడుస్తుంది. |
| 2025లో రికార్డ్ చేయబడిన రన్ను పునరుత్పత్తి చేయడం | GR00T N1.5 | మీరు తప్పనిసరిగా చేస్తేనే: LeRobot ఇప్పుడు దానిని తిరస్కరిస్తుంది, వెయిట్స్ వాణిజ్యేతరమైనవి. |
| ఇది ఉత్పత్తిగా రవాణా చేయబడుతుంది | N1.7, SmolVLA or ACT | N1.5 వాణిజ్యేతరమైనది, Pi0.5 Gemma నిబంధనలను కలిగి ఉంది, SmolVLA కార్డ్ ఏదీ పేర్కొనలేదు. |
ఐదుగురు అభ్యర్థులు
అన్నీ ఐదు విధానాలు: కెమెరా ఫ్రేమ్లు, జాయింట్ స్థానాలు మరియు, వాటిలో నాలుగుంటికి, భవిష్యత్ జాయింట్ లక్ష్యాల భాగానికి మ్యాప్ చేయబడిన భాషా సూచన. వాటిని వేరు చేసేది ఎంత మీరు రాకముందే నేర్చుకున్నారు.
| విధానం | పారామీటర్లు | లేటెన్సీ | GPU శ్రేణి | స్థానికంగా? | కనీస ఎపిసోడ్లు | ఫార్మాట్ | ఖర్చు |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
NVIDIA యొక్క ప్రస్తుత విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్, సుమారు 3 బి పారామీటర్లు, సుమారు 40 మిలియన్లు శిక్షణ పొందింది ఫైన్-ట్యూనింగ్ సమయంలో. N1.6 నుండి వచ్చిన డెల్టాలను రెపో జాబితా చేస్తుంది: వెండర్డ్ ఈగిల్ మోడల్ నుండి క్వెన్3-VL లో కాస్మోస్-రీజన్2-2బికి బ్యాక్బోన్, డిఫ్యూజన్ లేయర్లు 32 నుండి 16కి, స్టేట్ మరియు యాక్షన్ డైమెన్షన్లు 29 నుండి 132కి, యాక్షన్ హారిజన్ 16 నుండి 40కి.
చిన్న ఆర్మ్పై ముఖ్యమైనది సాపేక్ష ఎండ్-ఎఫెక్టర్ యాక్షన్ స్పేస్: N1.7 డెల్టాలను అంచనా వేస్తుంది ప్రస్తుత భంగిమ నుండి, ఇది 20K గంటల ఈగోస్కేల్ మానవ వీడియోను రోబోట్ పాలసీలోకి బదిలీ చేయడానికి అనుమతిస్తుంది. స్పెసిఫికేషన్ N1.7 పేజీలో, విధానం N1.7 ఆన్ SO-100 గైడ్లో.
ఐజాక్-GR00T README N1.7ని జనరల్ అవైలబిలిటీ విడుదలగా ప్రకటించింది, పూర్తి బెంచ్మార్క్లు మరియు మద్దతుతో. దీని హగ్గింగ్ ఫేస్ కార్డ్ ఇంకా అప్డేట్ కాలేదు: Model Version ఫీల్డ్ ఇప్పటికీ GR00T N1.7 EA అని చదువుతుంది. రెపో కొత్త డాక్యుమెంట్.
GR00T N1.5
అదే 3 B స్కేల్, ఈగిల్ 2 బ్యాక్బోన్, సిగ్లిప్2 మరియు T5, ఫ్లో-మ్యాచింగ్ డిఐటి హెడ్. ఇది మీరు ఇప్పటికే కలిగి ఉన్న ఒక ను విస్తరించడానికి ఉంది. ఇది డిఫాల్ట్గా ఉండటానికి రెండు కారణాలు: వెయిట్స్ NVIDIA's one-way non-commercial licence, మరియు ప్రస్తుత LeRobot విడుదలలు N1.5 మద్దతును తొలగించాయి. చూడండి .
Pi0.5
ఫిజికల్ ఇంటెలిజెన్స్ యొక్క VLA, పాలసీ రకం pi05. ఈ పత్రం పాలిగెమ్మా నుండి ప్రారంభించబడిన 2 B VLM మరియు 300 M యాక్షన్ ఎక్స్పర్ట్ను అందిస్తుంది, ఇది రోబోట్ను 50 Hz వద్ద నడుపుతుంది; LeRobot's pi05 config డిఫాల్ట్గా 50-స్టెప్ చంక్కు, ఆ రేటు వద్ద ఒక సెకనుకు సెట్ చేయబడింది. దీని ప్రధాన ఆకర్షణ అపరిచిత ప్రదేశాలు: నిజమైన ఇళ్లలో సుమారు 400 గంటల మొబైల్ మానిప్యులేషన్, మరియు 3, 12, 22, 53, 82 మరియు 104 ప్రదేశాలపై స్కేలింగ్ అధ్యయనం, ఇక్కడ 104-ప్రదేశాల మోడల్ టెస్ట్ ఇళ్లలోనే శిక్షణ పొందిన నియంత్రణతో సరిపోలింది.
ఒక పరిమితి, దీనిపై పేర్కొనబడింది lerobot/pi05_base కార్డ్: పోర్ట్ కేవలం ఫ్లో-మ్యాచింగ్ యాక్షన్ హెడ్ను మాత్రమే కలిగి ఉంటుంది. సబ్టాస్క్ ప్రిడిక్షన్, యాక్షన్ టోకెనైజేషన్ మరియు RL అప్స్ట్రీమ్లో విడుదల చేయబడలేదు, మరియు ఓపెన్పి దాని స్వంత రిపోజిటరీ గురించి కూడా అదే చెబుతుంది. Pi0.5 పేజీ మరియు SO-100 గైడ్పై Pi0.5 మిగిలిన వాటిని కలిగి ఉన్నాయి.
Pi0.5కి గేటెడ్ google/paligemma-3b-pt-224 టోకెనైజర్ అవసరం (gated: manual, అయితే Google అభ్యర్థనలు వెంటనే ప్రాసెస్ చేయబడతాయని చెబుతుంది). దానిని అంగీకరించకుండా మరియు hf auth login శిక్షణ వాతావరణంలో అమలు చేయకుండా, పని ప్రారంభమవుతుంది, కొంతకాలం డౌన్లోడ్ అవుతుంది, ఆపై నెట్వర్క్ లోపం వలె కనిపించే అధికార లోపం కారణంగా ఆగిపోతుంది. nvidia/GR00T-N1.7-3B గేటెడ్ కాదు, కానీ దాని nvidia/Cosmos-Reason2-2B బ్యాక్బోన్ గేటెడ్ (gated: auto). క్యూలో పెట్టే ముందు రెండింటినీ క్లియర్ చేయండి; ఒక రన్ నిష్క్రియంగా ఉంటే, స్టక్-క్యూ పేజీ ఏమి తనిఖీ చేయాలో జాబితా చేస్తుంది.
SmolVLA
450 M పారామీటర్లు, యాక్షన్ ఎక్స్పర్ట్లో సుమారు 100 M, SmolVLM-2లో VLM ఫ్రోజెన్ చేయబడి మరియు దాని మొదటి 16 లాంగ్వేజ్-మోడల్ లేయర్లు మాత్రమే ఉపయోగించబడ్డాయి. ప్రీట్రైనింగ్ కమ్యూనిటీ డేటా: 481 డేటాసెట్లు, 10.6 M ఫ్రేమ్లు, మీరు ఉపయోగించే అదే చౌకైన ఆర్మ్స్ నుండి. ఇక్కడ ఒక 24 GB కార్డ్కు సరిపోయే ఏకైక VLA, మరియు ఏకైక 30 ఎపిసోడ్ ఫ్లోర్. చూడండి SmolVLA పేజీ.
ACT
ఇది ఫౌండేషన్ మోడల్ కాదు. ALOHA నుండి వచ్చిన యాక్షన్ చంకింగ్ ట్రాన్స్ఫార్మర్ సుమారు 80 M పారామీటర్లను కలిగి ఉంటుంది, ఇది ప్రతి పనికి సున్నా నుండి, 50 Hz వద్ద 50 ప్రదర్శనలపై శిక్షణ పొందింది. ఈ పత్రం సుమారు పది నిమిషాల ప్రదర్శనల నుండి ఆరు నిజమైన బైమాన్యువల్ పనులను నివేదిస్తుంది, ప్రతి పనికి, ఇది హైలైట్ చేసే ఉదాహరణలలో 80 నుండి 90 శాతం వరకు విజయం సాధించింది. దీని ఆలోచన, యాక్షన్ చంకింగ్, ఈ పేజీలోని ప్రతి మోడల్లో ఉంది, మరియు దాని అబ్లేషన్ ఇప్పటికీ కొలుస్తుంది ప్రభావాన్ని ఉత్తమంగా: టెంపోరల్ ఎన్సెంబ్లింగ్ ఆఫ్ చేయబడిన రెండు సిమ్యులేటెడ్ పనులలో, k=1 వద్ద 1 శాతం నుండి k=100 వద్ద 44 శాతం వరకు. ACT పేజీ మిగిలిన వాటిని కలిగి ఉంది.
బెంచ్మార్క్లు వాస్తవానికి ఏమి చెబుతున్నాయి
LIBERO అనేది ఈ ఐదుంటిలో మూడు నివేదించే ఒక బెంచ్మార్క్: సిమ్యులేటెడ్ ఫ్రాంకా పాండాపై భాషా-నియంత్రిత పనులు, ప్రతి పది పనులతో క్రింద ఉన్న నాలుగు సూట్లుగా విభజించబడ్డాయి. NVIDIA ప్రతి సూట్కు 200 ట్రయల్స్ నిర్వహించింది.
| మోడల్ | ప్రాదేశిక | వస్తువు | లక్ష్యం | 10 (దీర్ఘ) | సగటు |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
ప్రతి సంఖ్య వేర్వేరు హార్నెస్ మరియు బడ్జెట్ నుండి వస్తుంది. GR00T గ్లోబల్ బ్యాచ్ 640 వద్ద 20K స్టెప్పులు నడిచింది; openpi సంఖ్య 30K చెక్పాయింట్; LeRobot పోర్ట్ LIBERO బేస్ మోడల్కు 6K స్టెప్పులు జోడించింది. SmolVLA మరింత అసమానత: దాని పేపర్ ఆ వరుసను LIBERO మొదటి నుండి, VLA ప్రీట్రైనింగ్ లేకుండా శిక్షణ ఇస్తుంది, అయితే దాని పైన ఉన్న మూడు ప్రీట్రైన్డ్ చెక్పాయింట్లను ఫైన్-ట్యూన్ చేస్తాయి. 96.85 నుండి 97.5 వరకు ఒక క్లస్టర్గా, మరియు 87.3%కి ఉన్న అంతరాన్ని వాస్తవమైనదిగా పరిగణించండి, కానీ 6.7x పారామీటర్లతో కొనుగోలు చేయబడింది.
SimplerEnv విస్తరణను చూపుతుంది, LIBERO చూపదు. NVIDIA N1.7ని N1.6తో పోలుస్తుంది, ఇది "తరాల డెల్టా"కి దగ్గరగా ఉన్న పబ్లిక్ విషయం.
| SimplerEnv సూట్ | N1.6 సగటు | N1.7 సగటు | ఉత్తమ స్వింగ్ | చెత్త స్వింగ్ |
|---|---|---|---|---|
| బ్రిడ్జ్ (WidowX), 7 పనులు | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| ఫ్రాక్టల్ (Google Robot), 6 పనులు | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | ఏదీ లేదు, ప్రతి పని మెరుగుపడింది |
బ్రిడ్జ్ వరుస ఉపయోగకరమైనది: సగటున 5.7 పాయింట్లు సాధించింది, అయితే put_eggplant_in_basket 36 కోల్పోయింది మరియు put_eggplant_in_sink 33 నుండి 2కి పడిపోయింది. ఒక కొత్త తరం పంపిణీని పైకి లేపడం కంటే కదిలిస్తుంది, కాబట్టి మీ పని N1.7 వెనుకబడిన చోట ఉంటే, సగటు ఏమీ చెప్పదు.

ఐదింటిలో, SmolVLA పేపర్ మాత్రమే SO-100 క్లాస్ ఆర్మ్ గురించి నివేదిస్తుంది: మూడు పనులలో SmolVLAకి 78.3 శాతం మరియు Pi0కి 61.7 శాతం, రెండూ మల్టీ-టాస్క్, ACT శిక్షణ పొందిన సింగిల్-టాస్క్కు 48.3 శాతంతో పోలిస్తే, ఇది సరిపోలడం లేదు. స్పష్టమైన జత SO-101 పిక్-అండ్-ప్లేస్లో రెండూ సింగిల్-టాస్క్: పంపిణీలో 70కి 90, దాని వెలుపల 40కి 50. పోల్చండి ACT వర్సెస్ SmolVLA మరియు Pi0.5 వర్సెస్ SmolVLA, లేదా బ్రౌజ్ చేయండి అరేనా.
లేటెన్సీ మరియు ఖర్చు విస్తరణను నిర్ణయిస్తాయి
ఇన్ఫరెన్స్ లేటెన్సీ అనేది ప్రజలు చివరిగా కనుగొనే మరియు మొదట చింతించే పరిమితి. బెంచ్మార్క్లో ఐదు పాయింట్లు మెరుగైన పాలసీ, కానీ ప్రతి చర్యకు అర సెకను ఎక్కువ సమయం తీసుకుంటే మీ డెస్క్పై అది అధ్వాన్నంగా కనిపిస్తుంది: కాంటాక్ట్ డైనమిక్స్ వేచి ఉండవు.
ఒక హెచ్చరిక: GR00T ఫిగర్ NVIDIA కార్డ్తో విభేదిస్తుంది, ఇది 4 డెనాయిసింగ్ దశలను మరియు ఒక కెమెరాను H100లో ఈగర్ మోడ్లో 85.8 ms, torch.compileతో 48.6 ms, పూర్తి TensorRT ద్వారా 27.9 ms వద్ద సమయం చేస్తుంది. ఇక్కడ 152 ms అనేది సర్వింగ్ ఓవర్హెడ్ మరియు ఒకటి కంటే ఎక్కువ కెమెరాలతో కూడిన మొత్తం-స్టాక్ ఫిగర్, ఫార్వర్డ్ పాస్ కాదు.
20 నుండి 485 ms లూప్ మోడల్ యొక్కది, మరియు పబ్లిక్-ఇంటర్నెట్ రౌండ్ ట్రిప్లు దీనికి తోడవుతాయి. రిమోట్ ఇన్ఫరెన్స్ నెమ్మదిగా పికప్-అండ్-ప్లేస్ కోసం ఆచరణీయం, వేగవంతమైన రియాక్టివ్ మోషన్ కోసం కాదు. మీ పనికి వేగం అవసరమైతే, ఇన్ఫరెన్స్ సర్వోల పక్కన ఉంటుంది: ACT లేదా SmolVLA, స్థానికంగా. సంబంధిత: పాలసీ మధ్యలో స్తంభిస్తుంది.
మోడల్ను మార్చకుండా సమయాన్ని ఆదా చేయడానికి ఒక మార్గం: SmolVLA పేపర్ సింక్రోనస్ ఎగ్జిక్యూషన్ను కొలుస్తుంది, ఇక్కడ పాలసీ తదుపరిదాన్ని అంచనా వేయడానికి ముందు ఒక భాగాన్ని పూర్తి చేస్తుంది, అసమకాలికంగా, ఇక్కడ అంచనా ఎగ్జిక్యూషన్తో అతివ్యాప్తి చెందుతుంది. విజయం సమానంగా ఉంటుంది, 78.3కి వ్యతిరేకంగా 73.3, కానీ అదే పికప్-అండ్-ప్లేస్ 13.75 బదులుగా 9.7 సెకన్లు పడుతుంది, మరియు ఒక నిర్ణీత విండోలో రోబోట్ 9 బదులుగా 19 సైకిళ్లను నిర్వహిస్తుంది.
లైసెన్స్లు, ఎందుకంటే ఎవరూ వాటిని తనిఖీ చేయరు
| మోడల్ | వెయిట్స్ లైసెన్స్ | కోడ్ లైసెన్స్ | వాణిజ్య ఉపయోగం |
|---|---|---|---|
| GR00T N1.7 | NVIDIA ఓపెన్ మోడల్ లైసెన్స్; కార్డ్ వాణిజ్య వినియోగాన్ని అనుమతిస్తుంది | Apache 2.0 | అవును |
| GR00T N1.5 | NVIDIA వన్-వే వాణిజ్యేతర లైసెన్స్ | Apache 2.0 | కాదు |
| Pi0.5 | pi05_base కార్డ్ మెటాడేటా లైసెన్స్: gemma అని చదువుతుంది | Apache 2.0 (openpi, LeRobot docs) | రెండూ చదవండి, అవి ఏకీభవించవు |
| SmolVLA | smolvla_base కార్డ్లో లైసెన్స్ ఫీల్డ్ లేదు | Apache 2.0 (LeRobot) | కోడ్ అవును, వెయిట్స్ పేర్కొనబడలేదు |
| ACT | బేస్ వెయిట్స్ లేవు | Apache 2.0 (LeRobot) | అవును |
Pi0.5 వరుసకు శ్రద్ధ అవసరం. LeRobot pi05 డాక్యుమెంటేషన్ openpiకి అనుగుణంగా Apache 2.0 అని పేర్కొంటుంది, అయితే హబ్ కార్డ్ lerobot/pi05_base కలిగి ఉంది license: gemma. రెండూ సజీవంగా ఉన్నాయి. GR00T N1.7కి తేలికపాటి వెర్షన్ ఉంది: Isaac-GR00T README N1.7 Apache 2.0 కింద పూర్తిగా వాణిజ్యపరంగా లైసెన్స్ చేయదగినదని ప్రస్తావించింది, అయితే దాని స్వంత లైసెన్స్ విభాగం మరియు మోడల్ కార్డ్ కోడ్ను మాత్రమే Apache 2.0 కింద మరియు వెయిట్స్ను NVIDIA కింద ఉంచాయి Open Model License.
మీరు వాస్తవంగా అమలు చేసే డిఫాల్ట్లు
ప్రతి ట్రైనర్ ఫారమ్ ఒక డిఫాల్ట్తో వస్తుంది, మరియు అవి ఏకపక్షమైనవి కావు. ACTలు LeRobot యొక్క సొంతం: బ్యాచ్ 8, lr 1e-5, 100000 శిక్షణ దశలు, చంక్ సైజు 100, ACTConfig అప్స్ట్రీమ్కు సరిపోలుతుంది మరియు k=100 from the ACT paper. క్రింద ఉన్న ఒక కాలమ్ ఒక ఉచ్చు.
| పాలసీ | బ్యాచ్ | LR | గరిష్ట దశలు | గ్రాడ్ అక్యుమ్ | వర్తిస్తుందా? | అదనపు నాబ్లు |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | yes | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | yes | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
GR00T యొక్క ఫైన్-ట్యూనింగ్ ఎంట్రీ పాయింట్ (launch_finetune.py, ఒక టైరో CLI) దాని కాన్ఫిగ్ డేటాక్లాస్లో సీడ్ ఫీల్డ్ లేదు, కాబట్టి రన్లు బిట్-ఫర్-బిట్ పునరుత్పత్తి చేయబడవు. నాన్-డిటర్మినిస్టిక్ ఇమేజ్ ఆగ్మెంటేషన్స్ నుండి రన్ల మధ్య 5 నుండి 6 శాతం వ్యత్యాసం గురించి రెపో హెచ్చరిస్తుంది, ఇది ఆన్లైన్లో చర్చించబడిన చాలా బెంచ్మార్క్ గ్యాప్ల కంటే పెద్దది. LeRobot యొక్క డిఫాల్ట్ సీడ్ 1000. గ్రాడ్-అక్యుమ్ కాలమ్ lerobot 0.5.1ని వివరిస్తుంది; అప్స్ట్రీమ్ 0.6.2 దీనిని --accelerator.gradient_accumulation.stepsగా బహిర్గతం చేస్తుంది.
మోడల్ ఎంపిక కంటే ముఖ్యమైన నాబ్
ఇది యాక్షన్ చంక్. పొడవైన చంక్లు సున్నితమైన కదలికను మరియు తక్కువ సమ్మేళన లోపాలను అందిస్తాయి, కానీ బ్లాక్ అమలులో ఉన్నప్పుడు పాలసీ కట్టుబడి ఉంటుంది, కాబట్టి కదిలే దేనికైనా ఆలస్యంగా స్పందిస్తుంది: స్థిరమైన క్యూబ్పై నమ్మకంగా ఉంటుంది, కదిలే దానిపై నిస్సహాయంగా ఉంటుంది. అది అతిగా వెళితే, అమలు చేయబడిన భాగాన్ని తగ్గించడం తిరిగి శిక్షణ ఇవ్వడం కంటే మెరుగు మరియు ఉచితం. మధ్యలో ఆగిపోయే జాయింట్ ఒక విభిన్న సమస్య; చూడండి .
- ACT: ACTConfig defaults to
chunk_size 100andn_action_steps 100. Temporal ensembling is off and requiresn_action_steps 1. - GR00T N1.7: internal horizon went 16 to 40, yet LeRobot's SO-101 example still runs
--policy.chunk_size=16 --policy.n_action_steps=16. The rollout flag was renamed to--execution-horizon. - Pi0.5: a 50-step chunk, of which LeRobot's LIBERO recipe executes 10 via
--policy.n_action_steps=10; with--policy.pretrained_pathit falls back to 50 if you omit the flag. - SmolVLA: 50-action chunks, both knobs exposed.
ఒక మధ్యాహ్నంలో ఐదుంటినీ ఎలా స్క్రీన్ చేయాలి
చౌకైన సమాధానం ఎక్కువ చదవడం కాదు. సుమారు 15 USD ఖర్చు చేసి, చేయి మీకు చెప్పనివ్వండి: ఒకసారి రికార్డ్ చేయండి, ముందుగా చౌకైన మోడల్కు శిక్షణ ఇవ్వండి, డేటా సరైనదని నిరూపించబడిన తర్వాత పెంచండి. నిర్మాణం పరిమాణం కంటే మెరుగు, మరియు .
- 1ఒకసారి 50 ఎపిసోడ్లను రికార్డ్ చేయండి
GR00T, Pi0.5 మరియు ACT, అలాగే SmolVLA యొక్క 30 కోసం యాభై అంతస్తును క్లియర్ చేస్తుంది. ప్రతి వైవిధ్యాన్ని విస్తరించకుండా పునరావృతం చేయండి: 5 క్యూబ్ స్థానాల్లో 50 ఎపిసోడ్లు శిక్షణ పొందాయి, 25 శిక్షణ పొందలేదు. మీ మొదటి డేటాసెట్ను రికార్డ్ చేయండి చూడండి.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ముందుగా ACTకి శిక్షణ ఇవ్వండి, ఎందుకంటే అది మీకు అబద్ధం చెప్పదు
ముందుగా శిక్షణ పొందిన వెయిట్లు లేవు, కాబట్టి ఇది పనిని చేస్తే, మీ డేటాసెట్ ఆ పనిని కలిగి ఉంటుంది. ACT ఫ్లాట్లైన్ అయితే, డేటాను సరిచేయండి. 24 GB కార్డ్లో 1 నుండి 3 USD, 2 నుండి 5 గంటలు.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3అదే డేటాసెట్లో SmolVLAని మార్చకుండా అమలు చేయండి
అదే డేటా, అదే ఆర్మ్, 80 M పారామీటర్లకు బదులుగా 450 M పారామీటర్లు, అదనంగా భాషా కండిషనింగ్. LeRobot ఒక A100లో సుమారు 4 గంటల పాటు 20K స్టెప్ రన్ను అమలు చేస్తుంది. ప్రీట్రైనింగ్ ఏదైనా ప్రయోజనం చేకూరుస్తుందో లేదో ఇది మీకు తెలియజేస్తుంది.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4GR00Tని ఉపయోగించే ముందు v2.1కి మార్చండి
GR00T LeRobot v2 ఫార్మాట్ యొక్క ఒక రకాన్ని, అదనంగా
meta/modality.jsonఅనే అదనపు ఫైల్ను చదువుతుంది, ఇది కనెక్ట్ చేయబడిన స్టేట్ మరియు యాక్షన్ శ్రేణులు పేరున్న ఫీల్డ్లుగా ఎలా విభజించబడతాయో మ్యాప్ చేస్తుంది. v3.0 డేటాసెట్ ఆ లోడర్ను క్రాష్ చేస్తుంది, ఎందుకంటే v3.0 అనేక ఎపిసోడ్లను భాగస్వామ్య ఫైల్లలో ప్యాక్ చేస్తుంది, అయితే v2 ప్రతి ఎపిసోడ్కు ఒకదాన్ని వ్రాసింది. Isaac-GR00T డౌన్గ్రేడ్ హెల్పర్నుscripts/lerobot_conversion/convert_v3_to_v2.pyగా అందిస్తుంది; v3 తిరస్కరణ పేజీ వేగవంతమైన మార్గం.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5మొదటి రెండు ఏదైనా మిగిల్చి ఉంటే మాత్రమే GR00T N1.7కి వెళ్ళండి
ఇక్కడ చూపిన NVIDIA యొక్క CLI ద్వారా, లేదా LeRobot యొక్క
grootపాలసీ రకం ద్వారా. NVIDIA ఫైన్-ట్యూనింగ్ కోసం 40 GB లేదా అంతకంటే ఎక్కువ VRAMని, ఇన్ఫరెన్స్ కోసం 16 GBని సిఫార్సు చేస్తుంది. OOM విషయంలో, OOM పేజీని చూడండి.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
ఆ స్క్రీనింగ్ పాస్ను అమలు చేయడానికి రెండు మార్గాలు
మూడు ఎన్విరాన్మెంట్లు, ఎందుకంటే టూల్చెయిన్లు కలిసి ఉండవు. మెయిన్లో LeRobot 0.6.2 మరియు Python 3.12 లేదా అంతకంటే కొత్తది అవసరం; Isaac-GR00T మరియు openpi వేర్వేరు uv-నిర్వహించబడే రెపోలు.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T
torchcodec0.8.0ని దాని ఏకైక వీడియో బ్యాకెండ్గా పిన్ చేస్తుంది, దీనికి FFmpeg 4 నుండి 7 అవసరం. FFmpeg 8 మద్దతు లేదు, AV1కి హామీ లేదు. - openpi మెమరీ ఫ్లోర్లు: 8 GB పైన ఇన్ఫరెన్స్, 22.5 GB పైన LoRA, 70 GB పైన పూర్తి ఫైన్-ట్యూనింగ్. చివరిది Pi0.5 A100 పని కావడానికి కారణం.
- మీరే GPUని అద్దెకు తీసుకోండి, ఆ తర్వాత దాన్ని నాశనం చేయండి, మూడు చెక్పాయింట్ పాత్లను చేతితో సరిపోల్చండి.
అదే ఐదు మోడల్లు, ఒకే రూపం. మోడల్, డేటాసెట్ మరియు హైపర్పారామీటర్లను ఎంచుకోండి; బ్యాకెండ్ అవసరమైన VRAM ద్వారా పరిమాణం చేయబడిన GPUని అద్దెకు తీసుకుంటుంది, ట్రైనర్ను నడుపుతుంది మరియు ఆబ్జెక్ట్ స్టోరేజ్కు వ్రాస్తుంది.
- శిక్షణ మ్యాట్రిక్స్ ఐదు మోడల్లు నాలుగు ఆర్మ్ల ద్వారా ఉంటుంది, ప్రతి సెల్ ఒక గైడ్: SO-100లో SmolVLA, SO-101లో ACT.
- ఇన్ఫరెన్స్ పాడ్లు
/api/inference/podద్వారా ఐడిల్ వాచ్డాగ్తో ఆటో-ప్రొవిజన్ చేయబడతాయి, కాబట్టి మర్చిపోయిన పాడ్ నిశ్శబ్దంగా బిల్ చేయదు. - బేస్ చెక్పాయింట్లు విక్రేతల స్వంతం:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACTకి ఏవీ లేవు. - CLI నుండి మరియు MCP సర్వర్ ద్వారా AI ఏజెంట్ల నుండి అదే కార్యకలాపాలు.
- హార్డ్వేర్ లేదా? లైవ్ ఆర్మ్ సైన్అప్ లేకుండా భౌతిక SO-100ని స్ట్రీమ్ చేస్తుంది; ట్రై పేజీ లోపలికి వెళ్ళే మార్గాలను చూపుతుంది.
ఫౌండేషన్ మోడల్ లేదా మొదటి నుండి
ఏ 3B మోడల్ను ఎంచుకోవాలనేది అసలు సమస్య కాదు. అసలు ప్రీట్రైన్డ్ VLAని ఉపయోగించాలా వద్దా అనేది అసలు సమస్య, ఎందుకంటే ACT ఆరు నిజమైన బైమాన్యువల్ పనులను ఒక్కొక్కటి సుమారు పది నిమిషాల డెమాన్స్ట్రేషన్ల నుండి నేర్చుకుంది, 80 M పారామీటర్లతో మరియు ఏదీ ప్రీట్రైన్ చేయబడలేదు.
- భాషా కండిషనింగ్. ACTకి ఏదీ లేదు; ఒక ACT చెక్పాయింట్ ఒక పనిని చేస్తుంది.
- మీ డెమాన్స్ట్రేషన్లలో లేని వస్తువులపై మెరుగ్గా ఉంటుంది: SO-101లో, ACT యొక్క 40% అవుట్ ఆఫ్ డిస్ట్రిబ్యూషన్కు వ్యతిరేకంగా 50%.
- అసలు మల్టీ-టాస్క్: SmolVLA ఒక చెక్పాయింట్తో మూడు SO-100 పనులలో 78.3%కి చేరుకుంటుంది; ACT కేవలం సింగిల్-టాస్క్గా మాత్రమే నడపబడింది.
- 7.6x నుండి 24x వరకు లేటెన్సీ: ACT యొక్క 20 msకి వ్యతిరేకంగా ప్రతి చర్య దశకు 152 నుండి 485 ms.
- 1 నుండి 3కి బదులుగా ప్రతి రన్కు 4 నుండి 12 USD, మరియు ఏదైనా 24 GB కార్డ్కు బదులుగా A100 టియర్.
- లైసెన్స్ ఎక్స్పోజర్, ప్లస్ మొదటి నుండి లేని గేటెడ్-రెపో వైఫల్య మోడ్.
- ప్రీట్రైన్డ్ వెయిట్స్ చెడ్డ డేటాసెట్ను కప్పిపుచ్చగలవు. విరిగిన డేటాపై సగం పనిచేసే ఫైన్-ట్యూన్ డేటాను చూసే ముందు ఒక వారం ఖర్చు అవుతుంది.
పాత రన్ను పునరుత్పత్తి చేసే సందర్భం
2025 చెక్పాయింట్ను వెంబడించడం మీకు మోడల్ ఎంపికను చేస్తుంది మరియు సమస్యను వెర్షన్ పిన్నింగ్గా మారుస్తుంది: ప్రస్తుత LeRobot N1.5ని తిరస్కరిస్తుంది, కాబట్టి మీరు పిన్ చేయండి lerobot==0.5.1. సీడ్ ఫీల్డ్ లేకుండా మరియు రన్ల మధ్య 5 నుండి 6 శాతం వ్యత్యాసంతో, పునరుత్పత్తి నిర్మాణం ద్వారా సుమారుగా ఉంటుంది. మరియు ప్లాట్ఫారమ్ వైపు ఉన్నాయి.

రెండుకు చేరిందా? ACT వర్సెస్ GR00T N1.7 మరియు GR00T N1.7 వర్సెస్ SmolVLA. ముడి వరుసలు అరేనా ఎంట్రీలలో ఉన్నాయి: GR00T N1.7, Pi0.5, SmolVLA మరియు ACT.
ఈ ప్లాట్ఫారమ్ మీకు ఎక్కడ సహాయం చేయదు
- ఇది రిమోట్ ఇన్ఫరెన్స్ను వేగవంతం చేయదు. 20 నుండి 485 ms లూప్ మోడల్కు చెందినది; ఇంటర్నెట్ రౌండ్ ట్రిప్లు దీనికి అదనంగా ఉంటాయి.
- ఇది మీ స్వంత హార్డ్వేర్లో GR00T లేదా Pi0.5ని ఫైన్-ట్యూన్ చేయదు. ఇక్కడ రెండూ క్లౌడ్-మాత్రమే; SmolVLA మరియు ACT మాత్రమే స్థానికంగా నడుస్తాయి.
- ఇది డేటాసెట్ను పరిష్కరించదు. నష్టం తగ్గుతుంది కానీ పాలసీ ఏమీ చేయదు అనేది డేటా సమస్య, ఒక సెటప్లో మాత్రమే పనిచేసే పాలసీ అనేది కవరేజ్ సమస్య.
- ఇది GR00T రన్లను పునరుత్పత్తి చేయదు: అప్స్ట్రీమ్ కాన్ఫిగ్లో సీడ్ ఫీల్డ్ లేదు.
85 మోడల్స్, 332 బెంచ్మార్క్ ఫలితాలు, ప్రతి సంఖ్య దాని మూలానికి లింక్ చేయబడింది
ఈ పేజీలోని పట్టికల క్రమబద్ధీకరించదగిన వెర్షన్: 85 విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్స్, 332 బెంచ్మార్క్ ఫలితాలు, ప్రతి ఒక్కటి దాని పేపర్ లేదా మోడల్ కార్డ్కు లింక్ చేయబడింది.
అరేనాను తెరవండిఒకదాన్ని ఎంచుకుని ముందుకు సాగడం
ఒక డిఫాల్ట్: 50 ఎపిసోడ్లను రికార్డ్ చేయండి, డేటాసెట్ను నిరూపించడానికి ACTని 1 నుండి 3 USDకి శిక్షణ ఇవ్వండి, ఆపై SmolVLAని అదే డేటాపై ఉపయోగించండి. మొత్తం 6 USD కంటే తక్కువ, మరియు అవి ముఖ్యమైన ప్రశ్నకు సమాధానం ఇస్తాయి: ఇక్కడ ప్రీట్రైనింగ్ సహాయపడుతుందా, లేదా బాటిల్నెక్ డేటానేనా. కాంటాక్ట్-రిచ్ మల్టీ-స్టెప్ టాస్క్ల కోసం GR00T N1.7కి, సీన్ మారినప్పుడు Pi0.5కి పెంచండి.
ప్లాట్ఫారమ్ వాక్త్రూ: మీ మొదటి పాలసీకి శిక్షణ ఇవ్వండి, ఆపై మీ మొదటి పాలసీని అమలు చేయండి. శిక్షణ డాక్యుమెంట్లు మరియు డేటాసెట్ డాక్యుమెంట్లు ఫారం మరియు ఫార్మాట్ను కవర్ చేస్తాయి; SO-100 పేజీ మరియు పూర్తి SO-100 గైడ్ బిల్డ్ మరియు కాలిబ్రేషన్ను కవర్ చేస్తాయి. నేపథ్యం: VLA అవలోకనం మరియు Pi0 ఫ్లో-మ్యాచింగ్ ఆర్టికల్. మీ విజయ రేటును పెంచేది డేటా నాణ్యత గైడ్.
SO-100లో నేను మొదట ఏ VLA పాలసీని శిక్షణ ఇవ్వాలి?▾
ACT, ఆపై SmolVLA. ACT మొదటి నుండి శిక్షణ ఇస్తుంది, కాబట్టి ఇది చెడు డేటాసెట్ను కప్పిపుచ్చదు, మరియు 24 GB కార్డ్లో ఒక రన్ చేయడానికి 1 నుండి 3 USD ఖర్చవుతుంది. ACT ఆ పనిని చేస్తే, GR00T N1.7 లేదా Pi0.5 రన్ కోసం 4 నుండి 12 USD వృధా కాదు.
GR00T N1.7 నిజంగా Pi0.5 కంటే మెరుగైనదా?▾
LIBEROలో అవి శబ్దం పరిధిలో ఉన్నాయి: GR00T N1.7 కోసం నాలుగు సూట్లలో 97.0%, openpiలో 30k స్టెప్ల వద్ద Pi0.5 కోసం 96.85%, LeRobot పోర్ట్ కోసం 97.5%, అన్నీ వేర్వేరు హార్నెస్ల నుండి. నిజమైన తేడాలు ప్రతి చర్య దశకు 152 ms వర్సెస్ 485 ms, v2.1 డేటాసెట్లు వర్సెస్ v3.0, మరియు బెంచ్మార్క్ ఖచ్చితత్వం వర్సెస్ ఓపెన్-వరల్డ్ జనరలైజేషన్.
వీటిలో దేనినైనా నేను ఒకే RTX 4090లో ఫైన్-ట్యూన్ చేయగలనా?▾
SmolVLA మరియు ACT, అవును; రెండూ RTX 4090 లేదా ఏదైనా 24 GB కార్డ్ కోసం జాబితా చేయబడ్డాయి మరియు స్థానికంగా నడుస్తాయి. GR00T N1.7, N1.5 మరియు Pi0.5కి A100 లేదా H100 80 GB అవసరం మరియు ఇక్కడ క్లౌడ్-మాత్రమే అందుబాటులో ఉన్నాయి. GR00T ఫైన్-ట్యూనింగ్ కోసం NVIDIA 40 GB లేదా అంతకంటే ఎక్కువ సిఫార్సు చేస్తుంది; పూర్తి Pi0.5 ఫైన్-ట్యూన్ కోసం openpi యొక్క ఫ్లోర్ 70 GB కంటే ఎక్కువ, LoRA కోసం 22.5 GB.
ఈ ఐదింటిలో దేనిని నేను వాణిజ్యపరంగా ఉపయోగించగలను?▾
GR00T N1.7 వెయిట్లు NVIDIA ఓపెన్ మోడల్ లైసెన్స్ అగ్రిమెంట్ కింద ఉన్నాయి, ఇది వాణిజ్య వినియోగాన్ని కవర్ చేస్తుందని కార్డ్ చెబుతుంది. N1.5 వెయిట్లు వాణిజ్యేతరమైనవి. SmolVLA కోడ్ LeRobotలో Apache 2.0, కానీ lerobot/smolvla_base కార్డ్లో లైసెన్స్ ఫీల్డ్ లేదు, కాబట్టి వెయిట్లు పేర్కొనబడలేదు. ACTకి లైసెన్స్ ఇవ్వడానికి బేస్ వెయిట్లు లేవు. Pi0.5 అస్పష్టంగా ఉంది: LeRobot డాక్యుమెంట్లు Apache 2.0 అని చెబుతున్నాయి, దాని కార్డ్ మెటాడేటా లైసెన్స్: gemma అని చదువుతుంది.
Sources
- NVIDIA Isaac-GR00T రిపోజిటరీ: GA స్థితి, N1.6 నుండి N1.7 మార్పులు, హార్డ్వేర్ అవసరాలు, torchcodec మరియు FFmpeg పరిమితులు, launch_finetune.py, రన్-టు-రన్ వేరియన్స్
- nvidia/GR00T-N1.7-3B మోడల్ కార్డ్: Cosmos-Reason2-2B బ్యాక్బోన్, 3 B పారామీటర్లు, ఇన్ఫరెన్స్ టైమింగ్ టేబుల్, NVIDIA ఓపెన్ మోడల్ లైసెన్స్, మోడల్ వెర్షన్ ఫీల్డ్
- nvidia/GR00T-N1.5-3B మోడల్ కార్డ్: Eagle 2 రిఫరెన్స్, SigLip2 మరియు T5, ఫ్లో మ్యాచింగ్ DiT, వన్-వే వాణిజ్యేతర లైసెన్స్
- Isaac-GR00T LIBERO ఉదాహరణ: 20K స్టెప్లు మరియు బ్యాచ్ సైజు 640 వద్ద ప్రతి సూట్కు విజయ రేట్లు, ప్రతి సూట్కు 200 ట్రయల్స్
- Isaac-GR00T SimplerEnv ఉదాహరణ: ప్రతి పనికి బ్రిడ్జ్ మరియు ఫ్రాక్టల్ విజయ రేట్లు, GR00T N1.6 వర్సెస్ N1.7
- pi0.5: ఓపెన్-వరల్డ్ జనరలైజేషన్తో కూడిన విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్ (2 B VLM ప్లస్ 300 M యాక్షన్ ఎక్స్పర్ట్, 50 Hz కంట్రోల్, సుమారు 400 గంటల మొబైల్ మానిప్యులేషన్, 3 నుండి 104 స్థానాలపై స్కేలింగ్ స్టడీ)
- openpi రిపోజిటరీ: GPU మెమరీ ఫ్లోర్లు, ఫ్లో-మ్యాచింగ్-హెడ్-మాత్రమే స్కోప్, మరియు examples/liberoలో Pi0.5 LIBERO ఫలితాలు
- lerobot/pi05_base మోడల్ కార్డ్: LeRobot పోర్ట్ యొక్క స్కోప్, లైసెన్స్: gemma మెటాడేటా, lerobot-train వినియోగం
- LeRobot pi0.5 డాక్యుమెంటేషన్: గేటెడ్ PaliGemma టోకెనైజర్, LIBERO పునరుత్పత్తి పట్టిక, n_action_steps ఫాల్బ్యాక్ ట్రాప్, Apache 2.0 స్టేట్మెంట్
- SmolVLA: సరసమైన మరియు సమర్థవంతమైన రోబోటిక్స్ కోసం విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్ (450 M పారామీటర్లు, LIBERO మరియు Meta-World పట్టికలు, SO-100 మరియు SO-101 ఫలితాలు, అసమకాలిక ఇన్ఫరెన్స్)
- LeRobot SmolVLA డాక్యుమెంటేషన్: 25కి వ్యతిరేకంగా 5 స్థానాలలో 50 ఎపిసోడ్లు, A100లో సుమారు 4 గంటల్లో 20k స్టెప్లు
- తక్కువ-ధర హార్డ్వేర్తో ఫైన్-గ్రెయిన్డ్ బైమాన్యువల్ మానిప్యులేషన్ నేర్చుకోవడం (ACT మరియు ALOHA): 80-90 శాతం వద్ద 6 పనులు, k=1 నుండి k=100 వరకు చంక్ సైజు అబ్లేషన్
- LeRobot 0.6.2: ACTConfig మరియు SmolVLAConfig డిఫాల్ట్లు, డిఫాల్ట్ సీడ్ 1000, --accelerator.gradient_accumulation.steps, Python 3.12 అవసరం, Apache 2.0
- LeRobot GR00T డాక్యుమెంటేషన్: పాలసీ రకం groot, N1.5 మద్దతు తొలగించబడింది, lerobot==0.5.1ని పిన్ చేయండి, SO-101 చంక్ సైజు ఉదాహరణ
- lerobot/smolvla_base మోడల్ కార్డ్: --policy.path ద్వారా ఉపయోగించబడే SmolVLA బేస్ చెక్పాయింట్, మరియు దాని కార్డ్ మెటాడేటా, దీనికి లైసెన్స్ ఫీల్డ్ లేదు
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started