AY-Robots పాలసీ పోలిక పట్టిక, GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA మరియు ACT కోసం పారామీటర్ కౌంట్‌లు, GPU టియర్‌లు మరియు ఇన్‌ఫరెన్స్ లేటెన్సీతో
SmolVLATinyVLAచిన్న VLAకన్స్యూమర్ GPULeRobot

చిన్న VLA మోడల్స్: TinyVLA, SmolVLA మరియు సబ్-1B కేస్

AY-Robots ResearchAugust 23, 202619 నిమిషాల చదువు

TinyVLA మరియు SmolVLA 1 బిలియన్ పారామీటర్ల లోపు పనిచేసే VLAని అందిస్తాయి. రెండు పేపర్‌ల నుండి వాస్తవ సంఖ్యలు, lerobot డిఫాల్ట్‌లు, కొలవబడిన లేటెన్సీ మరియు 24 GB కార్డ్‌లో ఒక రన్ ఎంత ఖర్చవుతుంది.

దాదాపు ప్రతి విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్ గురించి వ్రాయబడిన ప్రతిదీ డేటాసెంటర్ కార్డ్‌ను ఊహిస్తుంది. OpenVLA 7 బిలియన్ పారామీటర్లు. GR00T N1.7 మరియు Pi0.5 సుమారు 3 బిలియన్ పారామీటర్లు కలిగి ఉన్నాయి మరియు ఫైన్-ట్యూన్ చేయడానికి A100 80 GB అవసరం. మీ డెస్క్‌పై ఉన్న కార్డ్ 4090 అయితే, ఆ తరగతి మోడల్ అందుబాటులో ఉండదు.

రెండు పత్రాలు దీని అవసరం లేదని వాదిస్తున్నాయి. TinyVLA (arXiv 2409.12514, ఫిబ్రవరి 2025లో IEEE రోబోటిక్స్ అండ్ ఆటోమేషన్ లెటర్స్ ద్వారా ఆమోదించబడింది) 400 M నుండి 1.3 B బ్యాక్‌బోన్ మరియు డిఫ్యూజన్ యాక్షన్ హెడ్‌తో VLAను నిర్మిస్తుంది. SmolVLA (arXiv 2506.01844, 2 జూన్ 2025న సమర్పించబడింది) ఓపెన్ వెయిట్స్, ఓపెన్ డేటా మరియు ఒక కన్స్యూమర్ కార్డ్‌లో నడిచే స్క్రిప్ట్‌తో 450 M పారామీటర్లను అందిస్తుంది. ఇక్కడ రెండూ కొలిచినవి, మరియు సబ్-1 బిలియన్ వాదన ఎక్కడ నిలిచిపోతుందో చూడండి.

మీరు తెలుసుకోవలసినవి

  • TinyVLA మూడు పరిమాణాలలో లభిస్తుంది: 101 M శిక్షణ పొందే సామర్థ్యంతో మొత్తం 422 M, 138 M తో 740 M, 143 M తో 1.3 B. మొదటి రెండు మాత్రమే 1 B కంటే తక్కువగా ఉంటాయి.
  • దాని పట్టిక IV, ఒక A6000లో TinyVLA-1B కోసం ప్రతి చర్య అంచనాకు 14 ms ను కొలుస్తుంది, OpenVLA-7B కోసం 292 ms మరియు కుదించబడిన OpenVLA-1B కోసం 140 ms తో పోలిస్తే.
  • ఆ వేగాన్ని హెడ్ కలిగి ఉంటుంది, బ్యాక్‌బోన్ కాదు: TinyVLA-H యొక్క డిఫ్యూజన్ హెడ్‌ను ACT హెడ్‌తో మార్చితే, ఐదు నిజ-రోబోట్ పనులు 94.0 సగటు నుండి ఒకే అంకెలకు పడిపోతాయి. ఒక MLP హెడ్ అన్ని చోట్లా 0 స్కోర్ చేస్తుంది.
  • SmolVLA 450 M, అందులో సుమారు 100 M యాక్షన్ ఎక్స్‌పర్ట్, 481 కమ్యూనిటీ LeRobot డేటాసెట్‌లు మరియు 10.6 M ఫ్రేమ్‌లపై ప్రీట్రైన్ చేయబడింది. ఇది LIBEROలో 87.3 ను నివేదిస్తుంది, 3.3 B వద్ద రోబోటిక్స్-ప్రీట్రైన్డ్ Pi0 కోసం 86.0 తో పోలిస్తే, మరియు మూడు నిజమైన SO-100 పనులలో 78.3 ను నివేదిస్తుంది, 3.5 B వద్ద Pi0 కోసం 61.7 తో పోలిస్తే.
  • ఆ ప్రీట్రైనింగ్ లేకుండా సింగిల్-టాస్క్ శిక్షణ పొందినప్పుడు, SmolVLA ఆ పనులలో 40.0 కు పడిపోతుంది, ACT యొక్క 48.3 కంటే తక్కువ. చిన్నది స్వయంచాలకంగా సులభం కాదు.
  • TinyVLA కు LeRobot ఇంటిగ్రేషన్ లేదు మరియు CUDA 11.7 వీల్ స్టాక్‌ను ఉపయోగిస్తుంది. SmolVLA lerobot లో ఉంది మరియు ఇక్కడ 24 GB టియర్‌లో ప్రతి రన్‌కు సుమారు 1 నుండి 3 USD ఖర్చవుతుంది.

చిన్న VLAగా వాస్తవానికి ఏమి పరిగణించబడుతుంది

ఒక మోడల్ కార్డ్‌లోని పారామీటర్ల సంఖ్య ఒకే సంఖ్య కాదు. ఇది మొత్తం వెయిట్‌లు, ఇన్‌ఫరెన్స్ సమయంలో లోడ్ చేయబడిన వెయిట్‌లు లేదా గ్రేడియెంట్‌లను స్వీకరించే వెయిట్‌లను సూచించవచ్చు . TinyVLA రెండింటినీ నివేదిస్తుంది, మరియు వ్యత్యాసం చాలా పెద్దది: TinyVLA-H మొత్తం 1.3 B కానీ 143 M శిక్షణ ఇవ్వదగినది, ఎందుకంటే విజన్ టవర్ మరియు చాలా వరకు లాంగ్వేజ్ మోడల్ స్తంభింపజేయబడి ఉంటాయి, అయితే LoRA అడాప్టర్‌లు మరియు యాక్షన్ హెడ్ కదులుతాయి. ఈ పత్రం శిక్షణ ఇవ్వదగిన వాటాను సుమారు 5 శాతం వద్ద ఉంచుతుంది.

మోడల్పారామీటర్లుబ్యాక్‌బోన్యాక్షన్ హెడ్మూలం
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-Instructఫ్లో మ్యాచింగ్ ఎక్స్‌పర్ట్arXiv 2506.01844
Octo-Small27 MViT-S స్కేల్, T5-Base టెక్స్ట్ ఎన్‌కోడర్Diffusionocto-small-1.5 card
ACT~80 MResNet, లాంగ్వేజ్ మోడల్ లేదుడైరెక్ట్ చంక్ రెగ్రెషన్AY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 మరియు SigLIP ఎన్‌కోడర్‌లుఆటోరెగ్రెసివ్ యాక్షన్ టోకెన్‌లుarXiv 2406.09246

రెండు వరుసల గురించి చర్చించదగినవి. సుమారు 80 M వద్ద ఇక్కడ ఉన్న మిగిలిన వాటి కంటే చిన్నది కానీ లాంగ్వేజ్ మోడల్ లేదు, కాబట్టి ఇది VLA కాదు: ఇది ఒక పనిని నేర్చుకుంటుంది మరియు మరొకటి చేయమని చెప్పబడదు. 27 M వద్ద T5-Base టెక్స్ట్ ఎన్‌కోడర్ ద్వారా కండిషన్ చేయబడింది, LLM బ్యాక్‌బోన్ ద్వారా కాదు. మంచి బేస్‌లైన్‌లు, లేబుల్ సూచించిన సూచనలను రెండూ ఇవ్వవు.

1 B లైన్ ఏకపక్షమైనది

TinyVLA-H, హెడ్‌లైన్ ఫలితాలను కలిగి ఉన్న వేరియంట్, 1.3 B మరియు లైన్ పైన ఉంది. శిక్షణ సమయంలో ఒక మోడల్ 24 GBలో సరిపోతుందా మరియు ఇన్‌ఫరెన్స్ సమయంలో మీ నియంత్రణ రేటును చేరుకుంటుందా అనేది మెరుగైన ప్రశ్న. మీరు ఇక్కడ శిక్షణ ఇవ్వగల ఐదు పాలసీలు పాలసీల పేజీలో ఉన్నాయి; మీరు దాని సంఖ్యలను అందరి పక్కన చూడాలనుకుంటే TinyVLAకు ఒక అరేనా ఎంట్రీ ఉంది.

TinyVLA: వేగం హెడ్ నుండి వస్తుంది, బ్యాక్‌బోన్ నుండి కాదు

స్పష్టమైన అవగాహన ఏమిటంటే, వారు లాంగ్వేజ్ మోడల్‌ను చిన్నదిగా చేయడంతో అది వేగవంతమైంది. అయితే, పేపర్ యొక్క అబ్లేషన్ దీనికి విరుద్ధంగా చెబుతుంది. OpenVLA యొక్క 7 B బ్యాక్‌బోన్‌ను సుమారు 1 B బ్యాక్‌బోన్‌తో మార్చడం వలన ప్రతి-చర్య అంచనా 292 ms నుండి 140 msకి తగ్గింది, ఇది 2x లాభం. TinyVLA-H, పోల్చదగిన పారామీటర్ కౌంట్‌తో, అదే కార్డ్‌లో 14 ms వద్ద నడుస్తుంది. మిగిలిన 10x యాక్షన్ హెడ్.

మోడల్ప్రతి-చర్య అంచనాకొలవబడినది
OpenVLA-7B292 mssingle A6000
TinyVLA యొక్క బ్యాక్‌బోన్‌తో మార్చబడిన OpenVLA-1B140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA లాంగ్వేజ్ మోడల్ హెడ్ ద్వారా, ప్రతి యాక్షన్ డైమెన్షన్‌కు ఒకటి చొప్పున, ఆటోరెగ్రెసివ్‌గా డిస్క్రిటైజ్ చేయబడిన టోకెన్‌లుగా చర్యలను విడుదల చేస్తుంది. TinyVLA ఒక డిఫ్యూజన్ డీకోడర్‌ను జతచేస్తుంది, అది మొత్తం భాగాన్ని ఒకేసారి ఉత్పత్తి చేస్తుంది. టేబుల్ V TinyVLA-H వద్ద ఆర్కిటెక్చర్‌ను కలిగి ఉంది మరియు అదే ఐదు నిజ-రోబోట్ పనులపై హెడ్‌ను మాత్రమే మారుస్తుంది. ఇది రెండు పేపర్లలోనూ వాదనకు అత్యంత స్పష్టమైన రుజువు ఫ్లో మ్యాచింగ్ పాలసీలు చేస్తాయి, మరియు కారణం Pi0 టోకెన్ డీకోడింగ్ నుండి దూరంగా కదిలింది.

TinyVLA-H పై హెడ్టెన్నిస్ ఉంచండిమగ్ తిప్పండిక్యూబ్‌లను పేర్చండిడ్రాయర్‌ను మూసివేయండిపెట్టెను తెరవండి
డిఫ్యూజన్ (droid_diffusion)90.098.398.396.786.7
యాక్షన్ చంకింగ్ ట్రాన్స్‌ఫార్మర్13.38.38.313.323.3
మల్టీ-లేయర్ పెర్సెప్ట్రాన్00000
TinyVLA సంఖ్యలు ఏమిటి కవర్ చేస్తాయి

292 / 140 / 14 ms సంఖ్యలు టేబుల్ IV లో ఉన్నాయి, అన్నీ ఒకే A6000 పై. ఇవి ప్రతి చర్య అంచనాకు సంబంధించినవి మరియు కెమెరా క్యాప్చర్, ప్రీప్రాసెసింగ్ మరియు సర్వోలకు సీరియల్ రైట్‌ను మినహాయిస్తాయి. ప్రచురించబడిన లేటెన్సీని తక్కువ పరిమితిగా పరిగణించండి, నియంత్రణ రేటుగా ఎప్పుడూ కాదు. మా స్వంత సంఖ్యలు కూడా అదే పరిమితిని కలిగి ఉంటాయి: ఇన్‌ఫరెన్స్ లేటెన్సీని చూడండి.

TinyVLA ఏమి స్కోర్ చేసింది

బెంచ్‌మార్క్ప్రోటోకాల్TinyVLA-Hబేస్‌లైన్‌లు
మెటావరల్డ్, 50 పనులు, సిమ్మల్టీ-టాస్క్, 50 డెమోలు, 3 సీడ్‌లుకష్టాన్ని బట్టి 77.6 / 21.5 / 11.4 / 15.8, సగటు 31.6డిఫ్యూజన్ పాలసీ సగటు 10.5
రియల్ ఫ్రాంకా పాండా, 5 పనులుప్రతి పనికి 100 ట్రాజెక్టరీలు, 20 ట్రయల్స్94.0 సగటుఓపెన్‌VLA 68.3, డిఫ్యూజన్ పాలసీ 35.3
బైమాన్యువల్ UR5, 3 పనులుమల్టీ-టాస్క్, ప్రతి పనికి 10 ట్రయల్స్76.7 / 36.7 / 30.0ఓపెన్‌VLA 0 / 0 / 0, డిఫ్యూజన్ పాలసీ 40.3 / 31.3 / 43.0

ద్విహస్త వరుసకు పేపర్ స్వయంగా ఇచ్చే ఒక బోరింగ్ వివరణ ఉంది: OpenVLA అనేది Open X-Embodiment పై ముందే శిక్షణ పొందింది, ఇది పూర్తిగా సింగిల్-ఆర్మ్ డేటాను కలిగి ఉంటుంది, కాబట్టి రెండు-ఆర్మ్ యాక్షన్ స్పేస్ పంపిణీకి వెలుపల ఉంటుంది మరియు అది సున్నా స్కోర్ చేస్తుంది. డిఫ్యూజన్ పాలసీ బేస్‌లైన్ ఆ మూడు పనులలో రెండింటిలో TinyVLA-H ను ఓడిస్తుంది. నేపథ్యం ఓపెన్ ఎక్స్-ఎంబోడిమెంట్ వ్రాతపూర్వక వివరణ.

AY-Robots అరేనా లీడర్‌బోర్డ్, 85 VLA మోడల్‌లతో కూడిన 332 బెంచ్‌మార్క్ ఫలితాల క్రమబద్ధీకరించదగిన పట్టిక, ప్రతి విలువ అది వచ్చిన పేపర్ లేదా మోడల్ కార్డ్‌కు తిరిగి లింక్ చేయబడింది
ప్రతి మోడల్ బెంచ్‌మార్క్ సంఖ్యలు అవి ఎక్కడ నుండి వచ్చాయో చూసినప్పుడు మాత్రమే పోల్చదగినవి.

ఆగస్టు 2026 నాటికి TinyVLA రెపో

ఈ పేపర్ బాగుంది. కోడ్ ఒక పరిశోధనా విడుదల. రిపోజిటరీ github.com/liyaxuanliyaxuan/TinyVLA; దాని README కోడ్ విడుదలను 17 ఫిబ్రవరి 2025 నాటికి మరియు చివరి కమిట్‌ను 11 మార్చి 2025 నాటికి సూచిస్తుంది. ఒక పేపర్‌ను పునరుత్పత్తి చేయడానికి ఇది మంచిది, కానీ మీరు నిర్వహించబడే లైబ్రరీని కోరుకుంటే ఇది ఒక సమస్య.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README నుండి ఇన్‌స్టాల్ సీక్వెన్స్, 2026-08-23న రిపోజిటరీకి వ్యతిరేకంగా తనిఖీ చేయబడింది.
డిపెండెన్సీ పిన్‌లు ఒక రోజును తినేసే ఉచ్చు.

requirements.txt torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, మరియు CUDA స్టాక్‌ను 11.x వీల్స్‌కు పిన్ చేస్తుంది: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README Python 3.10ని అడుగుతుంది; lerobot 0.6.1కి 3.12 లేదా అంతకంటే కొత్తది అవసరం, కాబట్టి ఈ రెండూ ఒకే ఎన్విరాన్‌మెంట్‌ను పంచుకోలేవు. ముందుగా మీ GPU జనరేషన్ కోసం టార్చ్ 2.0.1 బిల్డ్ ఉందో లేదో నిర్ధారించుకోండి. ఒకవేళ రన్ VRAMలో ఆగిపోతే, అవుట్-ఆఫ్-మెమరీ చెక్‌లిస్ట్ ఊహించడం కంటే వేగంగా ఉంటుంది.

TinyVLA కూడా చదవదు LeRobot డేటాసెట్‌లు. దీని ఫార్మాట్ ACT-శైలి HDF5: చర్య, language_raw, మరియు మల్టీ-వ్యూ చిత్రాలు, joint_positions, qpos మరియు qvelతో కూడిన అబ్జర్వేషన్స్ గ్రూప్. రిపో RLDS ఇన్‌పుట్ కోసం data_utils/rlds_to_h5py.pyని అందిస్తుంది, మరియు ప్రతి టాస్క్ దాని dataset_dir, episode_len మరియు camera_namesతో aloha_scripts/constants.pyలో చేతితో నమోదు చేయబడుతుంది. మీ ఎపిసోడ్‌లు lerobot నుండి లేదా డెస్క్‌టాప్ క్లయింట్ నుండి వచ్చినట్లయితే, మార్పిడి మీదే.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh నుండి సంగ్రహించబడింది. పైన ఉన్న ప్రతి ఫ్లాగ్ మరియు విలువ షిప్ చేయబడిన ఫైల్‌లో ఉన్నాయి.
  • --num_gpus=8 అనేది ఎనిమిది-కార్డ్ నోడ్‌ను ఊహిస్తుంది. దీనిని 1కి సెట్ చేసి, బ్యాచ్ పరిమాణాన్ని 32 కంటే చాలా తక్కువకు తగ్గించండి. సింగిల్-GPU వేరియంట్ అప్‌స్ట్రీమ్‌లో అందుబాటులో లేదు, కాబట్టి ఈ కమాండ్‌ను 4090లో యథాతథంగా అమలు చేయలేరు.
  • --deepspeed scripts/zero2.json అనేది టాప్-లెవల్ scripts డైరెక్టరీలో లేని ఫైల్‌ను సూచిస్తుంది. DeepSpeed కాన్ఫిగ్‌లు llava-pythia/scripts/zero2.json వద్ద అందుబాటులో ఉన్నాయి. మీ మొదటి రన్‌కు ముందు పాత్‌ను సరిచేయండి.
  • README ప్రకారం, అవుట్‌పుట్ డైరెక్టరీ పేరులో llava_pythia ఉండాలి, LoRA ఎనేబుల్ చేయబడితే lora కూడా ఉండాలి.
  • బ్యాక్‌బోన్ అనేది ప్రత్యేక డౌన్‌లోడ్: lesjie/Llava-Pythia-400M, -700M లేదా -1.3B. మీరు lerobot/smolvla_baseని సూచించినట్లుగా, మీరు ఒక పాలసీని సూచించడానికి ఒకే బేస్ చెక్‌పాయింట్ లేదు.

SmolVLA: ఈ మధ్యాహ్నం మీరు అమలు చేయగల 1 B కంటే తక్కువ మోడల్

SmolVLA నిర్వహించబడే లైబ్రరీలో అదే వాదనను చేస్తుంది. ఇది SmolVLM2-500M-Video-Instruct బ్యాక్‌బోన్‌పై 450 M పారామీటర్‌లను కలిగి ఉంది, మరియు సామర్థ్యం చిన్నదిగా ఉండటం గురించిన వాదన నుండి కాకుండా configuration_smolvla.py నుండి మీరు చదవగలిగే సెట్టింగ్‌ల నుండి వస్తుంది.

configuration_smolvla.py లో సెట్టింగ్డిఫాల్ట్దీని ప్రయోజనం
num_vlm_layers16మొదటి 16 భాషా మోడల్ లేయర్‌లు మాత్రమే రన్ అవుతాయి
expert_width_multiplier0.75యాక్షన్ ఎక్స్‌పర్ట్ హిడెన్ సైజు VLMలో 75 శాతం
self_attn_every_n_layers2సెల్ఫ్-అటెన్షన్ క్రాస్-అటెన్షన్‌తో కలిపి ఉంటుంది
chunk_size / n_action_steps50 / 50ఒక పాస్ 50 చర్యలను విడుదల చేస్తుంది మరియు అన్ని 50 అమలు చేయబడతాయి
num_steps10ఫ్లో మ్యాచింగ్ డెనాయిసింగ్ 10 స్టెప్పుల వద్ద స్థిరంగా ఉంటుంది
tokenizer_max_length48సూచన 48 టోకెన్‌లకు కుదించబడుతుంది
freeze_vision_encoder / train_expert_onlyTrue / Trueఫైన్-ట్యూనింగ్ విజన్ టవర్‌ను కాకుండా ఎక్స్‌పర్ట్‌ను కదిలిస్తుంది
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000పేపర్ రెసిపీ కాదు: దాని ప్రీట్రైనింగ్ 200000 స్టెప్పులలో 100-స్టెప్ వార్మప్‌ను ఉపయోగించింది

ప్రీట్రైనింగ్ కోసం 481 కమ్యూనిటీ LeRobot datasets, 22.9 K episodes మరియు 10.6 M frames ను 4 GPUs పై, 200000 స్టెప్స్ వద్ద గ్లోబల్ బ్యాచ్ 256 తో ఉపయోగించారు; ఈ ప్రాజెక్ట్ మొత్తం సుమారు 30 K GPU hours పట్టిందని పేపర్ పేర్కొంది. గమనించదగ్గ ఒక సంఖ్య: Hugging Face లాంచ్ బ్లాగ్ 487 క్యూరేటెడ్ డేటాసెట్‌లను పేర్కొనగా, పేపర్ పట్టిక 481 అని చెబుతోంది. మేము పేపర్లోని సంఖ్యను ఉపయోగిస్తాము మరియు ఈ వ్యత్యాసాన్ని సూచిస్తాము.

బెంచ్‌మార్క్SmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO సగటు, మల్టీ-టాస్క్87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World సగటు, మల్టీ-టాస్క్57.368.2447.9 (3.5 B, robotics-pretrained)-
రియల్ SO-100, 3 టాస్క్‌లు, మల్టీ-టాస్క్ ట్రైనింగ్78.3-61.7 (3.5 B)-
రియల్ SO-100, 3 టాస్క్‌లు, సింగిల్-టాస్క్, రోబోటిక్స్ ప్రీట్రైనింగ్ లేదు40.0--48.3
SO-101 లెగో పిక్-ప్లేస్, సింగిల్-టాస్క్, ఇన్ డిస్ట్రిబ్యూషన్90--70
SO-101 లెగో పిక్-ప్లేస్, సింగిల్-టాస్క్, అవుట్ ఆఫ్ డిస్ట్రిబ్యూషన్50--40
మొత్తం పట్టికను చదవండి, హెడ్‌లైన్ వరుసను కాదు

LIBERO అనేది సిమ్యులేషన్ మరియు అక్కడ ఇప్పుడు సమర్థవంతమైన ప్రతిదీ ఎనభైలలో స్కోర్ చేస్తుంది. రియల్ SO-100 వరుస, ఇక్కడ 450 M మోడల్ 3.5 B మోడల్‌ను 16.6 పాయింట్ల తేడాతో ఓడిస్తుంది, ఇది ఆసక్తికరమైనది; దాని కింద ఉన్న వరుస ప్రతిబరువు. కమ్యూనిటీ ప్రీట్రైనింగ్ మరియు మల్టీ-టాస్క్ ట్రైనింగ్‌ను తొలగిస్తే, అదే మోడల్ ACT కింద 40.0 కి పడిపోతుంది. చిన్న మోడల్ స్వయంచాలకంగా అధ్వాన్నంగా ఉండదు, అది మెరుగైనదని కాదు, అనేది సమర్థించదగిన వాదన.

ఒక ప్రమాదం సహాయపడుతుంది: SmolVLA పేపర్ యొక్క Meta-World పట్టిక TinyVLA యొక్క స్వంత ప్రచురించిన సంఖ్యలను బేస్‌లైన్‌గా కలిగి ఉంది, కాబట్టి ఒకసారి రెండు మోడల్‌లు ఒకే పట్టికలో ఉన్నాయి, SmolVLA-0.45B 57.3 వద్ద TinyVLA-H 31.6కి వ్యతిరేకంగా. ఇది SmolVLA శిక్షణ Pi0 కంటే సుమారు 40 శాతం వేగంగా 6x తక్కువ మెమరీతో జరుగుతుందని కూడా నివేదిస్తుంది. ఇదంతా SmolVLA రచయితల నుండి వచ్చింది; అరేనా ఎంట్రీ ప్రతి విలువను దాని మూలానికి లింక్ చేస్తుంది.

SmolVLA తన సమయాన్ని ఎక్కడ గడుపుతుంది

AY-Robots SmolVLAను ప్రతి చర్య దశకు 245 ms వద్ద మరియు ACT 20 ms వద్ద పాలసీ కేటలాగ్. TinyVLA ప్రతి చర్య అంచనాకు 14 ms నివేదిస్తుంది. ఆ సంఖ్యలు పోల్చదగినవి కావు, మరియు వాటిని పోల్చదగినవిగా భావించడం ఈ అంశంలో అత్యంత సాధారణ తప్పు: కొన్నిసార్లు ఒక ఫార్వర్డ్ పాస్, కొన్ని ఆ పాస్‌ను ఒక చంక్‌లో విభజిస్తాయి యాక్షన్ చంకింగ్ దానిని అమర్టైజ్ చేస్తుంది.

  • SmolVLA ప్రతి ఫార్వర్డ్ పాస్‌కు 50 చర్యలను విడుదల చేస్తుంది మరియు అన్ని 50 చర్యలను అమలు చేస్తుంది. పేపర్ నిజమైన రోబోట్‌లపై ఉపయోగించే 30 fps వద్ద, ఒక ఇన్ఫరెన్స్ సుమారు 1.7 సెకన్ల కదలికను కవర్ చేస్తుంది.
  • అసింక్రోనస్ ఇన్ఫరెన్స్ ప్రస్తుత చంక్ ఇంకా అమలులో ఉన్నప్పుడు తదుపరి చంక్‌ను లెక్కిస్తుంది: 13.75 s సింక్రోనస్‌కు వ్యతిరేకంగా 9.7 s సగటు టాస్క్ పూర్తి, సుమారు 30 శాతం వేగంగా, మరియు 9కి వ్యతిరేకంగా స్థిరమైన 60-సెకన్ల విండోలో 19 పిక్-అండ్-ప్లేస్ సైకిల్స్.
  • విజయ రేట్లు మెరుగ్గా కాకుండా పోల్చదగినవిగా ఉన్నాయి, 78.3 సింక్రోనస్ 73.3 అసింక్రోనస్‌కు వ్యతిరేకంగా. అసింక్ థ్రూపుట్‌ను కొనుగోలు చేస్తుంది, ఖచ్చితత్వాన్ని కాదు.
  • చంకింగ్ కంప్యూట్ లేటెన్సీని దాచిపెడుతుంది, నెట్‌వర్క్ లేటెన్సీని కాదు, మరియు ఇది 50 చర్యలకు కట్టుబడి ఉన్నందున పాలసీని తక్కువ రియాక్టివ్‌గా చేస్తుంది.
రిమోట్ ఇన్‌ఫరెన్స్ ఉచితం కాదు, మరియు ఏ ప్లాట్‌ఫారమ్ భౌతిక శాస్త్రాన్ని పరిష్కరించదు

AY-Robots మీ పాలసీకి సేవ చేసే క్లౌడ్ GPU పాడ్‌ను స్వయంచాలకంగా ఏర్పాటు చేయగలదు, స్థానిక రోబోట్ క్లయింట్ ఆ ఎండ్‌పాయింట్‌తో కమ్యూనికేట్ చేస్తుంది, మరియు పాడ్ ఒక ఐడిల్ వాచ్‌డాగ్‌ను కలిగి ఉంటుంది, తద్వారా అది నిశ్శబ్దంగా బిల్లింగ్ చేయకుండా తనను తాను నాశనం చేసుకుంటుంది. అది చేయనిది ఏమిటంటే పబ్లిక్-ఇంటర్నెట్ రౌండ్ ట్రిప్‌ను తొలగించడం కాదు. ఇక్కడ ఉన్న ఐదు పాలసీలలో కంట్రోల్ లూప్ నెట్‌వర్క్ లేకుండానే ప్రతి చర్యకు 20 నుండి 485 ms ఉంటుంది, కాబట్టి రిమోట్ ఇన్‌ఫరెన్స్ నెమ్మదిగా పికప్-అండ్-ప్లేస్ కోసం ఆచరణీయం, వేగవంతమైన రియాక్టివ్ మోషన్ కోసం కాదు.

AY-Robots పాలసీల పోలిక పట్టిక GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA మరియు ACT లను పారామీటర్ కౌంట్లు, అవసరమైన GPU టైర్, ప్రతి చర్యకు ఇన్‌ఫరెన్స్ లేటెన్సీ మరియు ప్రతిదానికి అవసరమైన కనీస ఎపిసోడ్‌ల సంఖ్యతో చూపిస్తుంది.
~450 M వద్ద SmolVLA మరియు ~80 M వద్ద ACT అనేవి 24 GB కార్డ్‌కు సరిపోయే రెండు. మిగిలిన మూడు A100 లేదా H100 80 GB అవసరం.

ఒక కన్స్యూమర్ కార్డ్‌లో SmolVLAను ఫైన్-ట్యూనింగ్ చేయడం

మాన్యువల్ మార్గం, lerobot 0.6.1లో, 23 ఆగస్టు 2026 నాటికి ప్రస్తుత PyPI విడుదల. కింద ఉన్నవన్నీ అదే రోజున పొందిన Hugging Face lerobot SmolVLA డాక్యుమెంటేషన్ నుండి వచ్చాయి; గైడెడ్ వెర్షన్ మరింత సులభం.

  1. 1
    SmolVLA అదనపుతో lerobotని ఇన్‌స్టాల్ చేయండి

    SmolVLA డిపెండెన్సీలు ఐచ్ఛిక అదనపువి, బేస్ ఇన్‌స్టాల్‌లో భాగం కాదు. వాటిని ఇన్‌స్టాల్ చేయకుండా, ఆపై పాలసీ రకం ఎందుకు తెలియదని ఆశ్చర్యపోవడం సాధారణంగా అరగంట వృథా అవుతుంది.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    తగినన్ని ఎపిసోడ్‌లతో డేటాసెట్‌ను పొందండి

    డాక్యుమెంట్లు సుమారు 50 ఎపిసోడ్‌లను సిఫార్సు చేస్తాయి మరియు 25 ఎపిసోడ్‌లతో అదే పని సరిపోదని పేర్కొంటాయి. AY-Robots కనీసం 30ని నిర్దేశిస్తుంది. మీ స్వంతంగా రికార్డ్ చేయండి, లేదా డేటాసెట్ డైరెక్టరీ నుండి ప్రారంభించండి.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    ఫైన్-ట్యూన్‌ను ప్రారంభించండి

    lerobot గైడ్ నుండి కమాండ్, మార్చబడలేదు. డాక్యుమెంట్లు ఒక A100లో 20000 స్టెప్‌లకు సుమారు 4 గంటలు పడుతుందని పేర్కొంటాయి. 24 GB కార్డ్‌లో, ఎక్కువ సమయం పట్టవచ్చు మరియు దానిని కొలవండి.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    సరిపోయే వరకు బ్యాచ్ పరిమాణాన్ని తగ్గించండి

    batch_size=64 అనేది డాక్యుమెంట్ చేయబడిన ఉదాహరణ, మీ కార్డ్ గురించి హామీ కాదు. లోడింగ్ సమయాలు తక్కువగా ఉన్నప్పుడు చిన్నగా ప్రారంభించి పెంచమని డాక్యుమెంట్లు సలహా ఇస్తాయి.

    bash
    lerobot-train --help
  5. 5
    చెక్‌పాయింట్‌ను ఆర్మ్‌పై రోల్ అవుట్ చేయండి

    అదే లైబ్రరీ, ఒక కమాండ్. రియల్-టైమ్ చంకింగ్ ఫ్లాగ్‌లు డాక్యుమెంట్‌లలో కామెంట్ చేయబడ్డాయి మరియు తక్కువ-పవర్ హార్డ్‌వేర్‌పై ఉపయోగించాల్సినవి.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
చెక్‌పాయింట్ డెలివరబుల్

మీరు ఏ మార్గాన్ని ఎంచుకున్నా, మీరు దానిని ఉత్పత్తి చేసిన కాన్ఫిగ్‌తో పాటు చెక్‌పాయింట్‌తో ముగుస్తుంది. డేటాసెట్ రివిజన్, స్టెప్ కౌంట్ మరియు సీడ్‌ను దాని పక్కన ఉంచండి. lerobot డిఫాల్ట్‌గా సీడ్ 1000కి సెట్ చేస్తుంది; GR00T యొక్క ఫైన్-ట్యూనింగ్ ఎంట్రీ పాయింట్ ఎటువంటి సీడ్‌ను బహిర్గతం చేయదు, కాబట్టి ఆ రన్‌లు బిట్-ఫర్-బిట్ పునరుత్పత్తి చేయబడవు. ట్రైనింగ్ డాక్యుమెంట్‌లలో మెకానిక్స్.

చిన్న VLAని ఆర్మ్‌పై పొందడానికి రెండు మార్గాలు

మీరు మెషీన్ మరియు వైఫల్య మోడ్‌లను కలిగి ఉన్నారు. SmolVLAకి అది సహేతుకమైనది: ఒక పిప్ ఎక్స్‌ట్రా, ఒక ట్రైన్ కమాండ్, ఒక రోల్ అవుట్ కమాండ్. TinyVLAకి ఇది ఫ్రోజెన్ పిన్‌లు, విరిగిన DeepSpeed పాత్ మరియు మీరు స్వయంగా వ్రాసే డేటా మార్పిడితో కూడిన పరిశోధన పునరుత్పత్తి.

  1. 24 GB కార్డ్‌ను పొందండి, 30 నుండి 50 ఎపిసోడ్‌లను రికార్డ్ చేయండి, కెమెరా స్ట్రీమ్‌లను ఫ్రేమ్ బై ఫ్రేమ్ ధృవీకరించండి.
  2. pip install -e ".[smolvla]", lerobot/smolvla_baseకి వ్యతిరేకంగా lerobot-train, ఆపై ఆర్మ్ ప్లగ్ చేయబడిన మెషీన్‌లో చెక్‌పాయింట్‌ను సర్వ్ చేయండి.
  3. TinyVLA కోసం: ప్రత్యేక conda env, డేటాను HDF5కి మార్చండి, constants.pyలో టాస్క్‌ను నమోదు చేయండి, zero2.json పాత్‌ను సరిచేయండి, train.shను ఎనిమిది GPUల నుండి ఒకదానికి తగ్గించండి.
ప్రయోజనాలు
  • కార్డ్ చెల్లించిన తర్వాత గంటకు బిల్లింగ్ ఉండదు.
  • ఇన్‌ఫరెన్స్ సర్వోల పక్కన ఉంటుంది, వేగవంతమైన కంట్రోల్ లూప్‌ను పొందడానికి ఏకైక మార్గం.
  • మీరు పాలసీ కోడ్‌ను ప్యాచ్ చేయవచ్చు, మరియు TinyVLA ఈ విధంగా మాత్రమే అందుబాటులో ఉంటుంది.
రాజీలు
  • A 4090 ప్రతి ~3 B పాలసీని మినహాయిస్తుంది, కాబట్టి GR00T N1.7 లేదా Pi0.5కి వ్యతిరేకంగా స్థానిక పోలిక లేదు.
  • ఎన్విరాన్‌మెంట్ సెటప్ నిజమైన పని. TinyVLA యొక్క పిన్‌లు మాత్రమే ఒక రోజు ఖర్చు చేయగలవు.
  • క్యూ లేదు, రీట్రై లేదు, చెక్‌పాయింట్ స్టోరేజ్ లేదు. స్టెప్ 14000 వద్ద రీబూట్ అంటే మళ్లీ ప్రారంభించడం.

చిన్న మోడల్ తప్పు ఎంపిక అయినప్పుడు

రెండు పత్రాలు ఇక్కడ సారాంశాల కంటే మరింత జాగ్రత్తగా ఉన్నాయి. TinyVLA యొక్క వైఫల్య విశ్లేషణ నిర్దిష్టమైనది: 0.4 B వేరియంట్ సూచనను తప్పుగా చదవడం ద్వారా మూడుసార్లు విఫలమైంది, దీనిని రచయితలు చిన్న VLMలో పరిమిత భాషా గ్రహణశక్తికి ఆపాదించారు, మరియు ఆ మోడ్ 1.3 B వద్ద అదృశ్యమైంది. SmolVLA అదే వక్రాన్ని మరొక చివర నుండి చూపిస్తుంది: ఒకే నిర్మాణంలో 2.25 B వెర్షన్ LIBEROలో 88.75 మరియు Meta-Worldలో 68.24 స్కోర్ చేస్తుంది, 0.45 B మోడల్‌కు 87.3 మరియు 57.3తో పోలిస్తే.

1 B కంటే తక్కువ VLAను ఎంచుకోవడం
ఇది ఎక్కడ గెలుస్తుంది
  • 24 GB కార్డ్‌కు సరిపోతుంది, ఇది ఒక ప్రయోగాన్ని పదుల డాలర్ల నుండి కొన్ని డాలర్లకు తగ్గిస్తుంది.
  • చేతి పక్కన నడపడానికి తగినంత వేగంగా ఉంటుంది, కాబట్టి నియంత్రణ లూప్‌లో నెట్‌వర్క్ హాప్ ఉండదు.
  • ఒక వ్యక్తి రికార్డ్ చేయగల డేటాపై ఫైన్-ట్యూన్ చేస్తుంది, వేలకొలది కాకుండా పదుల ఎపిసోడ్‌లు.
  • SmolVLA యొక్క వెయిట్స్, డేటా జాబితా మరియు కోడ్ పబ్లిక్‌గా ఉన్నాయి, కాబట్టి చెడు ఫలితాన్ని డీబగ్ చేయవచ్చు.
ఇది ఎక్కడ కోల్పోతుంది
  • బలహీనమైన సూచనలను అనుసరించడం: తక్కువ భాషా పారామితులు, సారూప్య సూచన వ్యక్తీకరణలను వేరుచేయగల సామర్థ్యం తక్కువ.
  • మీరు రికార్డ్ చేయని సెటప్‌లకు తక్కువ ప్రాదేశిక మరియు దృశ్య సాధారణీకరణ.
  • డేటాసెట్ లోపాలకు మరింత సున్నితమైనది, ఆధారపడటానికి తక్కువ ప్రీట్రైనింగ్ ఉంటుంది.
  • మల్టీ-టాస్క్ మరియు లాంగ్-హారిజన్ పని ఇప్పటికీ పెద్ద మోడళ్లకు అనుకూలంగా ఉంటుంది, SmolVLA యొక్క 2.25 B వేరియంట్‌తో సహా.

నడపదగిన పోలిక TinyVLAకు వ్యతిరేకంగా SmolVLA కాదు. ఇది SmolVLAకు వ్యతిరేకంగా ACT మీ స్వంత పనిపై, మరియు SmolVLA పేపర్ ఎందుకు అనేదానికి వాదన. రోబోటిక్స్ ప్రీట్రైనింగ్ లేకుండా సింగిల్-టాస్క్‌గా శిక్షణ పొందిన SmolVLA, సింగిల్-టాస్క్ ACT 48.3 సాధించిన మూడు SO-100 పనులలో సగటున 40.0 స్కోర్ చేసింది. దీనిని 78.3కి పెంచేది కమ్యూనిటీ ప్రీట్రైనింగ్ మరియు మల్టీ-టాస్క్ శిక్షణ, కేవలం నిర్మాణం మాత్రమే కాదు. SO-101 లెగో టాస్క్‌లో, రెండు సింగిల్-టాస్క్‌లు, SmolVLA గెలుస్తుంది: పంపిణీలో 70కి వ్యతిరేకంగా 90. అప్పుడు SmolVLAకు వ్యతిరేకంగా Pi0.5 బడ్జెట్ అనుమతిస్తే.

ఈ పరిమాణంలో, డేటాసెట్ ఫలితాన్ని నిర్ణయిస్తుంది

చెడు డేటాను కవర్ చేయడానికి తక్కువ ప్రీట్రైనింగ్ ఉంటుంది, కాబట్టి లోపభూయిష్ట డేటాసెట్‌పై శుభ్రమైన లాస్ కర్వ్ లోపాన్ని నమ్మకంగా పునరుత్పత్తి చేసే విధానాన్ని మీకు అందిస్తుంది. lerobot డాక్యుమెంట్లు నిర్మాణం గురించి స్పష్టంగా ఉన్నాయి: 5 క్యూబ్ స్థానాల్లో 50 ఎపిసోడ్‌లు, ఒక్కో స్థానానికి 10, పనిచేశాయి; 25 పని చేయలేదు. లాస్ బాగా కనిపించి, చేయి ఏమీ ఉపయోగకరంగా చేయకపోతే, లాస్ పడిపోతుంది, పాలసీ ఏమీ చేయదు, పాలసీ ఒకే సెటప్‌లో మాత్రమే పనిచేస్తుంది లేదా వాస్తవానికి ఉపయోగపడే VLA శిక్షణ డేటాను సేకరించడంతో ప్రారంభించండి.

ఐదు పాలసీలు, ఒక పోలిక పట్టిక

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA మరియు ACT వాస్తవ పారామీటర్ గణనలు, ప్రతి చర్య దశకు ఇన్ఫరెన్స్ లేటెన్సీ, ప్రతిదానికి అవసరమైన GPU శ్రేణి మరియు ఏదైనా ఉపయోగకరంగా చేయడానికి ముందు కనీస ఎపిసోడ్ గణనతో.

పాలసీలను పోల్చండి

మీరు చర్య తీసుకోగల నిర్ణయ పట్టిక

మీ పరిస్థితిదీనితో ప్రారంభించండిఎందుకు
ఒక పని, మంచి ప్రదర్శనలు, భాష లేదుACT~80 M, 20 ms, 24 GB కార్డ్, డౌన్‌లోడ్ చేయడానికి బేస్ మోడల్ లేదు
కొన్ని సంబంధిత పనులు, ఒక్కోదానికి ఒక సూచనSmolVLA450 M, lerobotలో, కనీసం 30 ఎపిసోడ్‌లు, ఒక్కో రన్‌కు 1 నుండి 3 USD
ప్రత్యేకంగా TinyVLA ఫలితాన్ని పునరుత్పత్తి చేయడంTinyVLA-B or TinyVLA-Hరెపో మాత్రమే మార్గం: ఐసోలేటెడ్ ఎన్వి, మార్చబడిన డేటా
బహుళ-పనులు, విభిన్న సూచనలు, A100 బడ్జెట్GR00T N1.7 or Pi0.5~3 B, ప్రతి దశకు 152 ms మరియు 485 ms, ఒక్కో రన్‌కు 4 నుండి 12 USD
ఇంకా రోబోట్ లేదునిజమైన చేయిని నడపండిక్యూ-ఆధారిత లైవ్ ఆర్మ్‌కు సైన్అప్ మరియు హార్డ్‌వేర్ అవసరం లేదు

చివరి వరుస కోసం, లైవ్ ఆర్మ్ భౌతిక SO-100ని ప్రసారం చేస్తుంది, మీరు ఖాతా లేకుండా బ్రౌజర్ నుండి డ్రైవ్ చేయవచ్చు, మరియు ప్రారంభించడానికి మూడు మార్గాలు మిగిలిన వాటిని కవర్ చేస్తుంది. SO-100 ఇక్కడ సూచన ఆర్మ్, సుమారు 110 నుండి 150 EUR భాగాలలో, ఒక పూర్తి సెటప్ గైడ్.

సబ్-1 B మోడల్స్ తర్వాత ఏమి వస్తుంది

పారామీటర్ల సంఖ్యను తగ్గించడం VLAని చౌకగా మార్చడానికి ఒక మార్గం, మరియు ఇది స్పష్టంగా గెలిచే మార్గం కాదు. OpenVLA-OFT (arXiv 2502.19645) 7 B బ్యాక్‌బోన్‌ను ఉంచుతుంది మరియు చర్యలు ఎలా డీకోడ్ చేయబడతాయో మాత్రమే మారుస్తుంది, చర్య ఉత్పత్తి థ్రూపుట్‌లో 26x పెరుగుదలను మరియు LIBERO 76.5 నుండి 97.1 శాతానికి పెరిగినట్లు నివేదిస్తుంది. BitVLA (arXiv 2506.07530) 1-బిట్ BitNet b1.58 2B4T బ్యాక్‌బోన్ యొక్క ప్రతి బరువును టెర్నరీగా చేస్తుంది, పూర్తి-ప్రెసిషన్ OpenVLA-OFTతో సరిపోలుతూ 11.0x తక్కువ మెమరీ మరియు 4.4x తక్కువ ఎండ్-టు-ఎండ్ లేటెన్సీని నివేదిస్తుంది. X-VLA-0.9B (arXiv 2510.10274) ఫ్లో మ్యాచింగ్‌తో 1 B లైన్‌లో ఉంది.

సాధారణ అంశం: లేటెన్సీ భాషా మోడల్‌లో కాకుండా యాక్షన్ డీకోడర్‌లో ఉంటుంది. ఒక పాలసీ ఎన్ని పారామీటర్‌లను కలిగి ఉందని అడిగే ముందు, అది చర్యలను ఎలా విడుదల చేస్తుందో అడగండి. అరేనా 85 మోడల్‌లు మరియు 332 ఫలితాలను కలిగి ఉంది, ప్రతి ఒక్కటి దాని మూలానికి లింక్ చేయబడింది; మా VLA పరిచయంలో విస్తృతమైన అవలోకనం ఉంది.

నేను RTX 4090లో SmolVLAని ఫైన్-ట్యూన్ చేయవచ్చా?

అవును. SmolVLA 450 M పారామీటర్‌లను కలిగి ఉంది మరియు AY-Robots దానిని RTX 4090 / 24 GB టైర్‌లో నడుపుతుంది. lerobot ఉదాహరణ --batch_size=64ని ఉపయోగిస్తుంది, ఇది మీ కార్డ్‌కు హామీ కాకుండా ఒక ఉదాహరణ; డాక్యుమెంట్లు చిన్నగా ప్రారంభించి, లోడింగ్ సమయాలు తక్కువగా ఉన్నప్పుడు పెంచమని సలహా ఇస్తాయి. A100లో 20000 స్టెప్‌లకు డాక్యుమెంట్లు ఉదహరించిన సుమారు 4 గంటల కంటే ఎక్కువ సమయం పట్టవచ్చు.

TinyVLA lerobotలో లేదా AY-Robotsలో అందుబాటులో ఉందా?

రెండింటికీ కాదు. TinyVLA దాని పరిశోధన రిపోజిటరీలో మాత్రమే ఉంది, చివరి కమిట్ 11 మార్చి 2025, మరియు దాని ఫార్మాట్ LeRobot కాకుండా ACT-శైలి HDF5. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA మరియు ACT లను శిక్షణ ఇస్తుంది. మీకు TinyVLA కావాలంటే మీరు దానిని మీరే నిర్మించుకోవాలి, మరియు మీరు ముందుగా scripts/train.shలో DeepSpeed కాన్ఫిగ్ పాత్‌ను సరిచేయాలి.

450 M మోడల్ నిజంగా 3 B మోడల్‌తో పోటీ పడుతుందా?

రచయితల సొంత బెంచ్‌మార్క్‌ల ప్రకారం, అవును: LIBEROలో 87.3కి వ్యతిరేకంగా 86.0, రోబోటిక్స్-ప్రీట్రైన్డ్ Pi0 3.3 Bతో పోలిస్తే, మరియు మూడు నిజమైన SO-100 టాస్క్‌లలో 78.3కి వ్యతిరేకంగా 61.7, ఇక్కడ అదే పేపర్ Pi0ని 3.5 Bగా లేబుల్ చేస్తుంది. పరిమితి అదే పేపర్‌లో ఉంది: రోబోటిక్స్ ప్రీట్రైనింగ్ లేకుండా సింగిల్-టాస్క్, SmolVLA 40.0కి పడిపోతుంది, ACT యొక్క 48.3 కంటే తక్కువ.

ఒక చిన్న VLA ఏదైనా చేయడానికి ముందు నాకు ఎన్ని ఎపిసోడ్‌లు అవసరం?

AY-Robots SmolVLA కనిష్టాన్ని 30 ఎపిసోడ్‌లుగా మరియు ACT కనిష్టాన్ని 50గా నిర్ణయించింది. lerobot డాక్యుమెంట్లు సుమారు 50ని సిఫార్సు చేస్తాయి మరియు అదే పనికి 25 సరిపోదని నివేదించాయి. సంఖ్యతో పాటు నిర్మాణం కూడా ముఖ్యమైనది: పేపర్ సెట్ 5 క్యూబ్ స్థానాలను ఒక్కొక్కటి 10 ఎపిసోడ్‌లతో ఉపయోగించింది.

ప్రచురించబడిన లేటెన్సీ సంఖ్యలు ఎందుకు ఇంతగా విభేదిస్తున్నాయి?

అవి వేర్వేరు విషయాలను కొలుస్తాయి. TinyVLA A6000లో ప్రతి చర్య అంచనాకు 14 ms నివేదిస్తుంది; AY-Robots SmolVLAను 245 ms వద్ద మరియు ACTని ప్రతి చర్య దశకు 20 ms వద్ద జాబితా చేస్తుంది. కొన్ని గణాంకాలు ఒక ఫార్వర్డ్ పాస్‌ను కవర్ చేస్తాయి, కొన్ని 50-చర్యల చంక్‌లో ఒక పాస్‌ను విభజిస్తాయి, మరియు కెమెరా క్యాప్చర్ లేదా సర్వోలకు వ్రాయడం దాదాపు ఏవీ చేర్చవు.

క్లౌడ్ ఇన్ఫరెన్స్ GPU సమస్యను పరిష్కరిస్తుందా?

పాక్షికంగా. AY-Robots ఒక పాడ్‌ను స్వయంచాలకంగా అందిస్తుంది, అది పాలసీని అందిస్తుంది, అయితే స్థానిక క్లయింట్ ఆ ఎండ్‌పాయింట్‌తో మాట్లాడుతుంది, నిశ్శబ్దంగా బిల్లింగ్ చేయకుండా అది తనను తాను నాశనం చేసుకునేలా ఒక ఐడిల్ వాచ్‌డాగ్‌తో. ఇది పబ్లిక్-ఇంటర్నెట్ రౌండ్ ట్రిప్‌ను తొలగించదు, మరియు నియంత్రణ లూప్ ఇప్పటికే ప్రతి చర్య దశకు 20 నుండి 485 ms వరకు ఉంటుంది. నెమ్మదిగా పికప్-అండ్-ప్లేస్‌కు బాగానే ఉంటుంది, కానీ వేగవంతమైన రియాక్టివ్ మోషన్‌కు కాదు.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started