
TinyVLA మరియు SmolVLA 1 బిలియన్ పారామీటర్ల లోపు పనిచేసే VLAని అందిస్తాయి. రెండు పేపర్ల నుండి వాస్తవ సంఖ్యలు, lerobot డిఫాల్ట్లు, కొలవబడిన లేటెన్సీ మరియు 24 GB కార్డ్లో ఒక రన్ ఎంత ఖర్చవుతుంది.
దాదాపు ప్రతి విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్ గురించి వ్రాయబడిన ప్రతిదీ డేటాసెంటర్ కార్డ్ను ఊహిస్తుంది. OpenVLA 7 బిలియన్ పారామీటర్లు. GR00T N1.7 మరియు Pi0.5 సుమారు 3 బిలియన్ పారామీటర్లు కలిగి ఉన్నాయి మరియు ఫైన్-ట్యూన్ చేయడానికి A100 80 GB అవసరం. మీ డెస్క్పై ఉన్న కార్డ్ 4090 అయితే, ఆ తరగతి మోడల్ అందుబాటులో ఉండదు.
రెండు పత్రాలు దీని అవసరం లేదని వాదిస్తున్నాయి. TinyVLA (arXiv 2409.12514, ఫిబ్రవరి 2025లో IEEE రోబోటిక్స్ అండ్ ఆటోమేషన్ లెటర్స్ ద్వారా ఆమోదించబడింది) 400 M నుండి 1.3 B బ్యాక్బోన్ మరియు డిఫ్యూజన్ యాక్షన్ హెడ్తో VLAను నిర్మిస్తుంది. SmolVLA (arXiv 2506.01844, 2 జూన్ 2025న సమర్పించబడింది) ఓపెన్ వెయిట్స్, ఓపెన్ డేటా మరియు ఒక కన్స్యూమర్ కార్డ్లో నడిచే స్క్రిప్ట్తో 450 M పారామీటర్లను అందిస్తుంది. ఇక్కడ రెండూ కొలిచినవి, మరియు సబ్-1 బిలియన్ వాదన ఎక్కడ నిలిచిపోతుందో చూడండి.
మీరు తెలుసుకోవలసినవి
- •TinyVLA మూడు పరిమాణాలలో లభిస్తుంది: 101 M శిక్షణ పొందే సామర్థ్యంతో మొత్తం 422 M, 138 M తో 740 M, 143 M తో 1.3 B. మొదటి రెండు మాత్రమే 1 B కంటే తక్కువగా ఉంటాయి.
- •దాని పట్టిక IV, ఒక A6000లో TinyVLA-1B కోసం ప్రతి చర్య అంచనాకు 14 ms ను కొలుస్తుంది, OpenVLA-7B కోసం 292 ms మరియు కుదించబడిన OpenVLA-1B కోసం 140 ms తో పోలిస్తే.
- •ఆ వేగాన్ని హెడ్ కలిగి ఉంటుంది, బ్యాక్బోన్ కాదు: TinyVLA-H యొక్క డిఫ్యూజన్ హెడ్ను ACT హెడ్తో మార్చితే, ఐదు నిజ-రోబోట్ పనులు 94.0 సగటు నుండి ఒకే అంకెలకు పడిపోతాయి. ఒక MLP హెడ్ అన్ని చోట్లా 0 స్కోర్ చేస్తుంది.
- •SmolVLA 450 M, అందులో సుమారు 100 M యాక్షన్ ఎక్స్పర్ట్, 481 కమ్యూనిటీ LeRobot డేటాసెట్లు మరియు 10.6 M ఫ్రేమ్లపై ప్రీట్రైన్ చేయబడింది. ఇది LIBEROలో 87.3 ను నివేదిస్తుంది, 3.3 B వద్ద రోబోటిక్స్-ప్రీట్రైన్డ్ Pi0 కోసం 86.0 తో పోలిస్తే, మరియు మూడు నిజమైన SO-100 పనులలో 78.3 ను నివేదిస్తుంది, 3.5 B వద్ద Pi0 కోసం 61.7 తో పోలిస్తే.
- •ఆ ప్రీట్రైనింగ్ లేకుండా సింగిల్-టాస్క్ శిక్షణ పొందినప్పుడు, SmolVLA ఆ పనులలో 40.0 కు పడిపోతుంది, ACT యొక్క 48.3 కంటే తక్కువ. చిన్నది స్వయంచాలకంగా సులభం కాదు.
- •TinyVLA కు LeRobot ఇంటిగ్రేషన్ లేదు మరియు CUDA 11.7 వీల్ స్టాక్ను ఉపయోగిస్తుంది. SmolVLA lerobot లో ఉంది మరియు ఇక్కడ 24 GB టియర్లో ప్రతి రన్కు సుమారు 1 నుండి 3 USD ఖర్చవుతుంది.
చిన్న VLAగా వాస్తవానికి ఏమి పరిగణించబడుతుంది
ఒక మోడల్ కార్డ్లోని పారామీటర్ల సంఖ్య ఒకే సంఖ్య కాదు. ఇది మొత్తం వెయిట్లు, ఇన్ఫరెన్స్ సమయంలో లోడ్ చేయబడిన వెయిట్లు లేదా గ్రేడియెంట్లను స్వీకరించే వెయిట్లను సూచించవచ్చు . TinyVLA రెండింటినీ నివేదిస్తుంది, మరియు వ్యత్యాసం చాలా పెద్దది: TinyVLA-H మొత్తం 1.3 B కానీ 143 M శిక్షణ ఇవ్వదగినది, ఎందుకంటే విజన్ టవర్ మరియు చాలా వరకు లాంగ్వేజ్ మోడల్ స్తంభింపజేయబడి ఉంటాయి, అయితే LoRA అడాప్టర్లు మరియు యాక్షన్ హెడ్ కదులుతాయి. ఈ పత్రం శిక్షణ ఇవ్వదగిన వాటాను సుమారు 5 శాతం వద్ద ఉంచుతుంది.
| మోడల్ | పారామీటర్లు | బ్యాక్బోన్ | యాక్షన్ హెడ్ | మూలం |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | ఫ్లో మ్యాచింగ్ ఎక్స్పర్ట్ | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S స్కేల్, T5-Base టెక్స్ట్ ఎన్కోడర్ | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, లాంగ్వేజ్ మోడల్ లేదు | డైరెక్ట్ చంక్ రెగ్రెషన్ | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 మరియు SigLIP ఎన్కోడర్లు | ఆటోరెగ్రెసివ్ యాక్షన్ టోకెన్లు | arXiv 2406.09246 |
రెండు వరుసల గురించి చర్చించదగినవి. సుమారు 80 M వద్ద ఇక్కడ ఉన్న మిగిలిన వాటి కంటే చిన్నది కానీ లాంగ్వేజ్ మోడల్ లేదు, కాబట్టి ఇది VLA కాదు: ఇది ఒక పనిని నేర్చుకుంటుంది మరియు మరొకటి చేయమని చెప్పబడదు. 27 M వద్ద T5-Base టెక్స్ట్ ఎన్కోడర్ ద్వారా కండిషన్ చేయబడింది, LLM బ్యాక్బోన్ ద్వారా కాదు. మంచి బేస్లైన్లు, లేబుల్ సూచించిన సూచనలను రెండూ ఇవ్వవు.
TinyVLA-H, హెడ్లైన్ ఫలితాలను కలిగి ఉన్న వేరియంట్, 1.3 B మరియు లైన్ పైన ఉంది. శిక్షణ సమయంలో ఒక మోడల్ 24 GBలో సరిపోతుందా మరియు ఇన్ఫరెన్స్ సమయంలో మీ నియంత్రణ రేటును చేరుకుంటుందా అనేది మెరుగైన ప్రశ్న. మీరు ఇక్కడ శిక్షణ ఇవ్వగల ఐదు పాలసీలు పాలసీల పేజీలో ఉన్నాయి; మీరు దాని సంఖ్యలను అందరి పక్కన చూడాలనుకుంటే TinyVLAకు ఒక అరేనా ఎంట్రీ ఉంది.
TinyVLA: వేగం హెడ్ నుండి వస్తుంది, బ్యాక్బోన్ నుండి కాదు
స్పష్టమైన అవగాహన ఏమిటంటే, వారు లాంగ్వేజ్ మోడల్ను చిన్నదిగా చేయడంతో అది వేగవంతమైంది. అయితే, పేపర్ యొక్క అబ్లేషన్ దీనికి విరుద్ధంగా చెబుతుంది. OpenVLA యొక్క 7 B బ్యాక్బోన్ను సుమారు 1 B బ్యాక్బోన్తో మార్చడం వలన ప్రతి-చర్య అంచనా 292 ms నుండి 140 msకి తగ్గింది, ఇది 2x లాభం. TinyVLA-H, పోల్చదగిన పారామీటర్ కౌంట్తో, అదే కార్డ్లో 14 ms వద్ద నడుస్తుంది. మిగిలిన 10x యాక్షన్ హెడ్.
| మోడల్ | ప్రతి-చర్య అంచనా | కొలవబడినది |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| TinyVLA యొక్క బ్యాక్బోన్తో మార్చబడిన OpenVLA-1B | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA లాంగ్వేజ్ మోడల్ హెడ్ ద్వారా, ప్రతి యాక్షన్ డైమెన్షన్కు ఒకటి చొప్పున, ఆటోరెగ్రెసివ్గా డిస్క్రిటైజ్ చేయబడిన టోకెన్లుగా చర్యలను విడుదల చేస్తుంది. TinyVLA ఒక డిఫ్యూజన్ డీకోడర్ను జతచేస్తుంది, అది మొత్తం భాగాన్ని ఒకేసారి ఉత్పత్తి చేస్తుంది. టేబుల్ V TinyVLA-H వద్ద ఆర్కిటెక్చర్ను కలిగి ఉంది మరియు అదే ఐదు నిజ-రోబోట్ పనులపై హెడ్ను మాత్రమే మారుస్తుంది. ఇది రెండు పేపర్లలోనూ వాదనకు అత్యంత స్పష్టమైన రుజువు ఫ్లో మ్యాచింగ్ పాలసీలు చేస్తాయి, మరియు కారణం Pi0 టోకెన్ డీకోడింగ్ నుండి దూరంగా కదిలింది.
| TinyVLA-H పై హెడ్ | టెన్నిస్ ఉంచండి | మగ్ తిప్పండి | క్యూబ్లను పేర్చండి | డ్రాయర్ను మూసివేయండి | పెట్టెను తెరవండి |
|---|---|---|---|---|---|
| డిఫ్యూజన్ (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| యాక్షన్ చంకింగ్ ట్రాన్స్ఫార్మర్ | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| మల్టీ-లేయర్ పెర్సెప్ట్రాన్ | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 ms సంఖ్యలు టేబుల్ IV లో ఉన్నాయి, అన్నీ ఒకే A6000 పై. ఇవి ప్రతి చర్య అంచనాకు సంబంధించినవి మరియు కెమెరా క్యాప్చర్, ప్రీప్రాసెసింగ్ మరియు సర్వోలకు సీరియల్ రైట్ను మినహాయిస్తాయి. ప్రచురించబడిన లేటెన్సీని తక్కువ పరిమితిగా పరిగణించండి, నియంత్రణ రేటుగా ఎప్పుడూ కాదు. మా స్వంత సంఖ్యలు కూడా అదే పరిమితిని కలిగి ఉంటాయి: ఇన్ఫరెన్స్ లేటెన్సీని చూడండి.
TinyVLA ఏమి స్కోర్ చేసింది
| బెంచ్మార్క్ | ప్రోటోకాల్ | TinyVLA-H | బేస్లైన్లు |
|---|---|---|---|
| మెటావరల్డ్, 50 పనులు, సిమ్ | మల్టీ-టాస్క్, 50 డెమోలు, 3 సీడ్లు | కష్టాన్ని బట్టి 77.6 / 21.5 / 11.4 / 15.8, సగటు 31.6 | డిఫ్యూజన్ పాలసీ సగటు 10.5 |
| రియల్ ఫ్రాంకా పాండా, 5 పనులు | ప్రతి పనికి 100 ట్రాజెక్టరీలు, 20 ట్రయల్స్ | 94.0 సగటు | ఓపెన్VLA 68.3, డిఫ్యూజన్ పాలసీ 35.3 |
| బైమాన్యువల్ UR5, 3 పనులు | మల్టీ-టాస్క్, ప్రతి పనికి 10 ట్రయల్స్ | 76.7 / 36.7 / 30.0 | ఓపెన్VLA 0 / 0 / 0, డిఫ్యూజన్ పాలసీ 40.3 / 31.3 / 43.0 |
ద్విహస్త వరుసకు పేపర్ స్వయంగా ఇచ్చే ఒక బోరింగ్ వివరణ ఉంది: OpenVLA అనేది Open X-Embodiment పై ముందే శిక్షణ పొందింది, ఇది పూర్తిగా సింగిల్-ఆర్మ్ డేటాను కలిగి ఉంటుంది, కాబట్టి రెండు-ఆర్మ్ యాక్షన్ స్పేస్ పంపిణీకి వెలుపల ఉంటుంది మరియు అది సున్నా స్కోర్ చేస్తుంది. డిఫ్యూజన్ పాలసీ బేస్లైన్ ఆ మూడు పనులలో రెండింటిలో TinyVLA-H ను ఓడిస్తుంది. నేపథ్యం ఓపెన్ ఎక్స్-ఎంబోడిమెంట్ వ్రాతపూర్వక వివరణ.

ఆగస్టు 2026 నాటికి TinyVLA రెపో
ఈ పేపర్ బాగుంది. కోడ్ ఒక పరిశోధనా విడుదల. రిపోజిటరీ github.com/liyaxuanliyaxuan/TinyVLA; దాని README కోడ్ విడుదలను 17 ఫిబ్రవరి 2025 నాటికి మరియు చివరి కమిట్ను 11 మార్చి 2025 నాటికి సూచిస్తుంది. ఒక పేపర్ను పునరుత్పత్తి చేయడానికి ఇది మంచిది, కానీ మీరు నిర్వహించబడే లైబ్రరీని కోరుకుంటే ఇది ఒక సమస్య.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, మరియు CUDA స్టాక్ను 11.x వీల్స్కు పిన్ చేస్తుంది: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README Python 3.10ని అడుగుతుంది; lerobot 0.6.1కి 3.12 లేదా అంతకంటే కొత్తది అవసరం, కాబట్టి ఈ రెండూ ఒకే ఎన్విరాన్మెంట్ను పంచుకోలేవు. ముందుగా మీ GPU జనరేషన్ కోసం టార్చ్ 2.0.1 బిల్డ్ ఉందో లేదో నిర్ధారించుకోండి. ఒకవేళ రన్ VRAMలో ఆగిపోతే, అవుట్-ఆఫ్-మెమరీ చెక్లిస్ట్ ఊహించడం కంటే వేగంగా ఉంటుంది.
TinyVLA కూడా చదవదు LeRobot డేటాసెట్లు. దీని ఫార్మాట్ ACT-శైలి HDF5: చర్య, language_raw, మరియు మల్టీ-వ్యూ చిత్రాలు, joint_positions, qpos మరియు qvelతో కూడిన అబ్జర్వేషన్స్ గ్రూప్. రిపో RLDS ఇన్పుట్ కోసం data_utils/rlds_to_h5py.pyని అందిస్తుంది, మరియు ప్రతి టాస్క్ దాని dataset_dir, episode_len మరియు camera_namesతో aloha_scripts/constants.pyలో చేతితో నమోదు చేయబడుతుంది. మీ ఎపిసోడ్లు lerobot నుండి లేదా డెస్క్టాప్ క్లయింట్ నుండి వచ్చినట్లయితే, మార్పిడి మీదే.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 అనేది ఎనిమిది-కార్డ్ నోడ్ను ఊహిస్తుంది. దీనిని 1కి సెట్ చేసి, బ్యాచ్ పరిమాణాన్ని 32 కంటే చాలా తక్కువకు తగ్గించండి. సింగిల్-GPU వేరియంట్ అప్స్ట్రీమ్లో అందుబాటులో లేదు, కాబట్టి ఈ కమాండ్ను 4090లో యథాతథంగా అమలు చేయలేరు.
- --deepspeed scripts/zero2.json అనేది టాప్-లెవల్ scripts డైరెక్టరీలో లేని ఫైల్ను సూచిస్తుంది. DeepSpeed కాన్ఫిగ్లు llava-pythia/scripts/zero2.json వద్ద అందుబాటులో ఉన్నాయి. మీ మొదటి రన్కు ముందు పాత్ను సరిచేయండి.
- README ప్రకారం, అవుట్పుట్ డైరెక్టరీ పేరులో llava_pythia ఉండాలి, LoRA ఎనేబుల్ చేయబడితే lora కూడా ఉండాలి.
- బ్యాక్బోన్ అనేది ప్రత్యేక డౌన్లోడ్: lesjie/Llava-Pythia-400M, -700M లేదా -1.3B. మీరు lerobot/smolvla_baseని సూచించినట్లుగా, మీరు ఒక పాలసీని సూచించడానికి ఒకే బేస్ చెక్పాయింట్ లేదు.
SmolVLA: ఈ మధ్యాహ్నం మీరు అమలు చేయగల 1 B కంటే తక్కువ మోడల్
SmolVLA నిర్వహించబడే లైబ్రరీలో అదే వాదనను చేస్తుంది. ఇది SmolVLM2-500M-Video-Instruct బ్యాక్బోన్పై 450 M పారామీటర్లను కలిగి ఉంది, మరియు సామర్థ్యం చిన్నదిగా ఉండటం గురించిన వాదన నుండి కాకుండా configuration_smolvla.py నుండి మీరు చదవగలిగే సెట్టింగ్ల నుండి వస్తుంది.
| configuration_smolvla.py లో సెట్టింగ్ | డిఫాల్ట్ | దీని ప్రయోజనం |
|---|---|---|
| num_vlm_layers | 16 | మొదటి 16 భాషా మోడల్ లేయర్లు మాత్రమే రన్ అవుతాయి |
| expert_width_multiplier | 0.75 | యాక్షన్ ఎక్స్పర్ట్ హిడెన్ సైజు VLMలో 75 శాతం |
| self_attn_every_n_layers | 2 | సెల్ఫ్-అటెన్షన్ క్రాస్-అటెన్షన్తో కలిపి ఉంటుంది |
| chunk_size / n_action_steps | 50 / 50 | ఒక పాస్ 50 చర్యలను విడుదల చేస్తుంది మరియు అన్ని 50 అమలు చేయబడతాయి |
| num_steps | 10 | ఫ్లో మ్యాచింగ్ డెనాయిసింగ్ 10 స్టెప్పుల వద్ద స్థిరంగా ఉంటుంది |
| tokenizer_max_length | 48 | సూచన 48 టోకెన్లకు కుదించబడుతుంది |
| freeze_vision_encoder / train_expert_only | True / True | ఫైన్-ట్యూనింగ్ విజన్ టవర్ను కాకుండా ఎక్స్పర్ట్ను కదిలిస్తుంది |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | పేపర్ రెసిపీ కాదు: దాని ప్రీట్రైనింగ్ 200000 స్టెప్పులలో 100-స్టెప్ వార్మప్ను ఉపయోగించింది |
ప్రీట్రైనింగ్ కోసం 481 కమ్యూనిటీ LeRobot datasets, 22.9 K episodes మరియు 10.6 M frames ను 4 GPUs పై, 200000 స్టెప్స్ వద్ద గ్లోబల్ బ్యాచ్ 256 తో ఉపయోగించారు; ఈ ప్రాజెక్ట్ మొత్తం సుమారు 30 K GPU hours పట్టిందని పేపర్ పేర్కొంది. గమనించదగ్గ ఒక సంఖ్య: Hugging Face లాంచ్ బ్లాగ్ 487 క్యూరేటెడ్ డేటాసెట్లను పేర్కొనగా, పేపర్ పట్టిక 481 అని చెబుతోంది. మేము పేపర్లోని సంఖ్యను ఉపయోగిస్తాము మరియు ఈ వ్యత్యాసాన్ని సూచిస్తాము.
| బెంచ్మార్క్ | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO సగటు, మల్టీ-టాస్క్ | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World సగటు, మల్టీ-టాస్క్ | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| రియల్ SO-100, 3 టాస్క్లు, మల్టీ-టాస్క్ ట్రైనింగ్ | 78.3 | - | 61.7 (3.5 B) | - |
| రియల్ SO-100, 3 టాస్క్లు, సింగిల్-టాస్క్, రోబోటిక్స్ ప్రీట్రైనింగ్ లేదు | 40.0 | - | - | 48.3 |
| SO-101 లెగో పిక్-ప్లేస్, సింగిల్-టాస్క్, ఇన్ డిస్ట్రిబ్యూషన్ | 90 | - | - | 70 |
| SO-101 లెగో పిక్-ప్లేస్, సింగిల్-టాస్క్, అవుట్ ఆఫ్ డిస్ట్రిబ్యూషన్ | 50 | - | - | 40 |
LIBERO అనేది సిమ్యులేషన్ మరియు అక్కడ ఇప్పుడు సమర్థవంతమైన ప్రతిదీ ఎనభైలలో స్కోర్ చేస్తుంది. రియల్ SO-100 వరుస, ఇక్కడ 450 M మోడల్ 3.5 B మోడల్ను 16.6 పాయింట్ల తేడాతో ఓడిస్తుంది, ఇది ఆసక్తికరమైనది; దాని కింద ఉన్న వరుస ప్రతిబరువు. కమ్యూనిటీ ప్రీట్రైనింగ్ మరియు మల్టీ-టాస్క్ ట్రైనింగ్ను తొలగిస్తే, అదే మోడల్ ACT కింద 40.0 కి పడిపోతుంది. చిన్న మోడల్ స్వయంచాలకంగా అధ్వాన్నంగా ఉండదు, అది మెరుగైనదని కాదు, అనేది సమర్థించదగిన వాదన.
ఒక ప్రమాదం సహాయపడుతుంది: SmolVLA పేపర్ యొక్క Meta-World పట్టిక TinyVLA యొక్క స్వంత ప్రచురించిన సంఖ్యలను బేస్లైన్గా కలిగి ఉంది, కాబట్టి ఒకసారి రెండు మోడల్లు ఒకే పట్టికలో ఉన్నాయి, SmolVLA-0.45B 57.3 వద్ద TinyVLA-H 31.6కి వ్యతిరేకంగా. ఇది SmolVLA శిక్షణ Pi0 కంటే సుమారు 40 శాతం వేగంగా 6x తక్కువ మెమరీతో జరుగుతుందని కూడా నివేదిస్తుంది. ఇదంతా SmolVLA రచయితల నుండి వచ్చింది; అరేనా ఎంట్రీ ప్రతి విలువను దాని మూలానికి లింక్ చేస్తుంది.
SmolVLA తన సమయాన్ని ఎక్కడ గడుపుతుంది
AY-Robots SmolVLAను ప్రతి చర్య దశకు 245 ms వద్ద మరియు ACT 20 ms వద్ద పాలసీ కేటలాగ్. TinyVLA ప్రతి చర్య అంచనాకు 14 ms నివేదిస్తుంది. ఆ సంఖ్యలు పోల్చదగినవి కావు, మరియు వాటిని పోల్చదగినవిగా భావించడం ఈ అంశంలో అత్యంత సాధారణ తప్పు: కొన్నిసార్లు ఒక ఫార్వర్డ్ పాస్, కొన్ని ఆ పాస్ను ఒక చంక్లో విభజిస్తాయి యాక్షన్ చంకింగ్ దానిని అమర్టైజ్ చేస్తుంది.
- SmolVLA ప్రతి ఫార్వర్డ్ పాస్కు 50 చర్యలను విడుదల చేస్తుంది మరియు అన్ని 50 చర్యలను అమలు చేస్తుంది. పేపర్ నిజమైన రోబోట్లపై ఉపయోగించే 30 fps వద్ద, ఒక ఇన్ఫరెన్స్ సుమారు 1.7 సెకన్ల కదలికను కవర్ చేస్తుంది.
- అసింక్రోనస్ ఇన్ఫరెన్స్ ప్రస్తుత చంక్ ఇంకా అమలులో ఉన్నప్పుడు తదుపరి చంక్ను లెక్కిస్తుంది: 13.75 s సింక్రోనస్కు వ్యతిరేకంగా 9.7 s సగటు టాస్క్ పూర్తి, సుమారు 30 శాతం వేగంగా, మరియు 9కి వ్యతిరేకంగా స్థిరమైన 60-సెకన్ల విండోలో 19 పిక్-అండ్-ప్లేస్ సైకిల్స్.
- విజయ రేట్లు మెరుగ్గా కాకుండా పోల్చదగినవిగా ఉన్నాయి, 78.3 సింక్రోనస్ 73.3 అసింక్రోనస్కు వ్యతిరేకంగా. అసింక్ థ్రూపుట్ను కొనుగోలు చేస్తుంది, ఖచ్చితత్వాన్ని కాదు.
- చంకింగ్ కంప్యూట్ లేటెన్సీని దాచిపెడుతుంది, నెట్వర్క్ లేటెన్సీని కాదు, మరియు ఇది 50 చర్యలకు కట్టుబడి ఉన్నందున పాలసీని తక్కువ రియాక్టివ్గా చేస్తుంది.
AY-Robots మీ పాలసీకి సేవ చేసే క్లౌడ్ GPU పాడ్ను స్వయంచాలకంగా ఏర్పాటు చేయగలదు, స్థానిక రోబోట్ క్లయింట్ ఆ ఎండ్పాయింట్తో కమ్యూనికేట్ చేస్తుంది, మరియు పాడ్ ఒక ఐడిల్ వాచ్డాగ్ను కలిగి ఉంటుంది, తద్వారా అది నిశ్శబ్దంగా బిల్లింగ్ చేయకుండా తనను తాను నాశనం చేసుకుంటుంది. అది చేయనిది ఏమిటంటే పబ్లిక్-ఇంటర్నెట్ రౌండ్ ట్రిప్ను తొలగించడం కాదు. ఇక్కడ ఉన్న ఐదు పాలసీలలో కంట్రోల్ లూప్ నెట్వర్క్ లేకుండానే ప్రతి చర్యకు 20 నుండి 485 ms ఉంటుంది, కాబట్టి రిమోట్ ఇన్ఫరెన్స్ నెమ్మదిగా పికప్-అండ్-ప్లేస్ కోసం ఆచరణీయం, వేగవంతమైన రియాక్టివ్ మోషన్ కోసం కాదు.

ఒక కన్స్యూమర్ కార్డ్లో SmolVLAను ఫైన్-ట్యూనింగ్ చేయడం
మాన్యువల్ మార్గం, lerobot 0.6.1లో, 23 ఆగస్టు 2026 నాటికి ప్రస్తుత PyPI విడుదల. కింద ఉన్నవన్నీ అదే రోజున పొందిన Hugging Face lerobot SmolVLA డాక్యుమెంటేషన్ నుండి వచ్చాయి; గైడెడ్ వెర్షన్ మరింత సులభం.
- 1SmolVLA అదనపుతో lerobotని ఇన్స్టాల్ చేయండి
SmolVLA డిపెండెన్సీలు ఐచ్ఛిక అదనపువి, బేస్ ఇన్స్టాల్లో భాగం కాదు. వాటిని ఇన్స్టాల్ చేయకుండా, ఆపై పాలసీ రకం ఎందుకు తెలియదని ఆశ్చర్యపోవడం సాధారణంగా అరగంట వృథా అవుతుంది.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2తగినన్ని ఎపిసోడ్లతో డేటాసెట్ను పొందండి
డాక్యుమెంట్లు సుమారు 50 ఎపిసోడ్లను సిఫార్సు చేస్తాయి మరియు 25 ఎపిసోడ్లతో అదే పని సరిపోదని పేర్కొంటాయి. AY-Robots కనీసం 30ని నిర్దేశిస్తుంది. మీ స్వంతంగా రికార్డ్ చేయండి, లేదా డేటాసెట్ డైరెక్టరీ నుండి ప్రారంభించండి.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3ఫైన్-ట్యూన్ను ప్రారంభించండి
lerobot గైడ్ నుండి కమాండ్, మార్చబడలేదు. డాక్యుమెంట్లు ఒక A100లో 20000 స్టెప్లకు సుమారు 4 గంటలు పడుతుందని పేర్కొంటాయి. 24 GB కార్డ్లో, ఎక్కువ సమయం పట్టవచ్చు మరియు దానిని కొలవండి.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4సరిపోయే వరకు బ్యాచ్ పరిమాణాన్ని తగ్గించండి
batch_size=64 అనేది డాక్యుమెంట్ చేయబడిన ఉదాహరణ, మీ కార్డ్ గురించి హామీ కాదు. లోడింగ్ సమయాలు తక్కువగా ఉన్నప్పుడు చిన్నగా ప్రారంభించి పెంచమని డాక్యుమెంట్లు సలహా ఇస్తాయి.
bashlerobot-train --help - 5చెక్పాయింట్ను ఆర్మ్పై రోల్ అవుట్ చేయండి
అదే లైబ్రరీ, ఒక కమాండ్. రియల్-టైమ్ చంకింగ్ ఫ్లాగ్లు డాక్యుమెంట్లలో కామెంట్ చేయబడ్డాయి మరియు తక్కువ-పవర్ హార్డ్వేర్పై ఉపయోగించాల్సినవి.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
మీరు ఏ మార్గాన్ని ఎంచుకున్నా, మీరు దానిని ఉత్పత్తి చేసిన కాన్ఫిగ్తో పాటు చెక్పాయింట్తో ముగుస్తుంది. డేటాసెట్ రివిజన్, స్టెప్ కౌంట్ మరియు సీడ్ను దాని పక్కన ఉంచండి. lerobot డిఫాల్ట్గా సీడ్ 1000కి సెట్ చేస్తుంది; GR00T యొక్క ఫైన్-ట్యూనింగ్ ఎంట్రీ పాయింట్ ఎటువంటి సీడ్ను బహిర్గతం చేయదు, కాబట్టి ఆ రన్లు బిట్-ఫర్-బిట్ పునరుత్పత్తి చేయబడవు. ట్రైనింగ్ డాక్యుమెంట్లలో మెకానిక్స్.
చిన్న VLAని ఆర్మ్పై పొందడానికి రెండు మార్గాలు
మీరు మెషీన్ మరియు వైఫల్య మోడ్లను కలిగి ఉన్నారు. SmolVLAకి అది సహేతుకమైనది: ఒక పిప్ ఎక్స్ట్రా, ఒక ట్రైన్ కమాండ్, ఒక రోల్ అవుట్ కమాండ్. TinyVLAకి ఇది ఫ్రోజెన్ పిన్లు, విరిగిన DeepSpeed పాత్ మరియు మీరు స్వయంగా వ్రాసే డేటా మార్పిడితో కూడిన పరిశోధన పునరుత్పత్తి.
- 24 GB కార్డ్ను పొందండి, 30 నుండి 50 ఎపిసోడ్లను రికార్డ్ చేయండి, కెమెరా స్ట్రీమ్లను ఫ్రేమ్ బై ఫ్రేమ్ ధృవీకరించండి.
- pip install -e ".[smolvla]", lerobot/smolvla_baseకి వ్యతిరేకంగా lerobot-train, ఆపై ఆర్మ్ ప్లగ్ చేయబడిన మెషీన్లో చెక్పాయింట్ను సర్వ్ చేయండి.
- TinyVLA కోసం: ప్రత్యేక conda env, డేటాను HDF5కి మార్చండి, constants.pyలో టాస్క్ను నమోదు చేయండి, zero2.json పాత్ను సరిచేయండి, train.shను ఎనిమిది GPUల నుండి ఒకదానికి తగ్గించండి.
- కార్డ్ చెల్లించిన తర్వాత గంటకు బిల్లింగ్ ఉండదు.
- ఇన్ఫరెన్స్ సర్వోల పక్కన ఉంటుంది, వేగవంతమైన కంట్రోల్ లూప్ను పొందడానికి ఏకైక మార్గం.
- మీరు పాలసీ కోడ్ను ప్యాచ్ చేయవచ్చు, మరియు TinyVLA ఈ విధంగా మాత్రమే అందుబాటులో ఉంటుంది.
- A 4090 ప్రతి ~3 B పాలసీని మినహాయిస్తుంది, కాబట్టి GR00T N1.7 లేదా Pi0.5కి వ్యతిరేకంగా స్థానిక పోలిక లేదు.
- ఎన్విరాన్మెంట్ సెటప్ నిజమైన పని. TinyVLA యొక్క పిన్లు మాత్రమే ఒక రోజు ఖర్చు చేయగలవు.
- క్యూ లేదు, రీట్రై లేదు, చెక్పాయింట్ స్టోరేజ్ లేదు. స్టెప్ 14000 వద్ద రీబూట్ అంటే మళ్లీ ప్రారంభించడం.
SmolVLA ఇక్కడ ఉన్న ఐదు పాలసీలలో ఒకటి. మీరు ఫారమ్లో మోడల్ మరియు డేటాసెట్ను ఎంచుకుంటారు, బ్యాకెండ్ అవసరమైన VRAM ద్వారా GPUని అద్దెకు తీసుకుంటుంది, ట్రైనర్ను నడుపుతుంది మరియు ఆబ్జెక్ట్ స్టోరేజ్కు చెక్పాయింట్లను వ్రాస్తుంది. దశలవారీగా: SO-100లో SmolVLA, లేదా ట్రైనింగ్ పేజీలో పూర్తి మ్యాట్రిక్స్.
| SmolVLA కోసం ప్లాట్ఫారమ్ ఏమి పంపుతుంది | విలువ |
|---|---|
| బ్యాచ్ పరిమాణం | 2 |
| లెర్నింగ్ రేట్ | 1e-4 |
| గరిష్ట స్టెప్లు | 20000 |
| గ్రాడియంట్ అక్యుములేషన్ | 8, and it does not reach the trainer |
| ఫారమ్లో అదనపు నాబ్లు | seed, logFreq |
| GPU టియర్ | RTX 4090 or any 24 GB card |
| డేటాసెట్ ఫార్మాట్ | LeRobot v3.0 |
| కనీస ఎపిసోడ్లు | 30 |
ముందుగా, ఇక్కడ డిఫాల్ట్ బ్యాచ్ పరిమాణం 2, lerobot డాక్యుమెంటేషన్ ఉదాహరణలో 64 కాదు, మరియు గ్రాడియంట్ అక్యుములేషన్ సెట్టింగ్ పంపబడుతుంది కానీ SmolVLAకి ఎటువంటి ప్రభావం చూపదు, కాబట్టి ప్రభావవంతమైన బ్యాచ్ నిజంగా 2. డిఫాల్ట్ అప్స్ట్రీమ్తో సరిపోలుతుందని ఊహించకుండా ఉద్దేశపూర్వకంగా దానిని పెంచండి. రెండవది, TinyVLA ఇక్కడ అస్సలు శిక్షణ ఇవ్వబడదు.
24 GB టియర్లో ఒక రన్ 0.30 నుండి 0.60 USD గంటకు 2 నుండి 5 గంటలు పడుతుంది, సుమారు 1 నుండి 3 USD. A100 టియర్లో ~3 B పాలసీ 1.20 నుండి 2.00 USD గంటకు 3 నుండి 6 గంటలు పడుతుంది, సుమారు 4 నుండి 12 USD. ధర, మరియు CLI నుండి మరియు MCP సర్వర్ నుండి అదే ఆపరేషన్లను చూడండి.
చిన్న మోడల్ తప్పు ఎంపిక అయినప్పుడు
రెండు పత్రాలు ఇక్కడ సారాంశాల కంటే మరింత జాగ్రత్తగా ఉన్నాయి. TinyVLA యొక్క వైఫల్య విశ్లేషణ నిర్దిష్టమైనది: 0.4 B వేరియంట్ సూచనను తప్పుగా చదవడం ద్వారా మూడుసార్లు విఫలమైంది, దీనిని రచయితలు చిన్న VLMలో పరిమిత భాషా గ్రహణశక్తికి ఆపాదించారు, మరియు ఆ మోడ్ 1.3 B వద్ద అదృశ్యమైంది. SmolVLA అదే వక్రాన్ని మరొక చివర నుండి చూపిస్తుంది: ఒకే నిర్మాణంలో 2.25 B వెర్షన్ LIBEROలో 88.75 మరియు Meta-Worldలో 68.24 స్కోర్ చేస్తుంది, 0.45 B మోడల్కు 87.3 మరియు 57.3తో పోలిస్తే.
- 24 GB కార్డ్కు సరిపోతుంది, ఇది ఒక ప్రయోగాన్ని పదుల డాలర్ల నుండి కొన్ని డాలర్లకు తగ్గిస్తుంది.
- చేతి పక్కన నడపడానికి తగినంత వేగంగా ఉంటుంది, కాబట్టి నియంత్రణ లూప్లో నెట్వర్క్ హాప్ ఉండదు.
- ఒక వ్యక్తి రికార్డ్ చేయగల డేటాపై ఫైన్-ట్యూన్ చేస్తుంది, వేలకొలది కాకుండా పదుల ఎపిసోడ్లు.
- SmolVLA యొక్క వెయిట్స్, డేటా జాబితా మరియు కోడ్ పబ్లిక్గా ఉన్నాయి, కాబట్టి చెడు ఫలితాన్ని డీబగ్ చేయవచ్చు.
- బలహీనమైన సూచనలను అనుసరించడం: తక్కువ భాషా పారామితులు, సారూప్య సూచన వ్యక్తీకరణలను వేరుచేయగల సామర్థ్యం తక్కువ.
- మీరు రికార్డ్ చేయని సెటప్లకు తక్కువ ప్రాదేశిక మరియు దృశ్య సాధారణీకరణ.
- డేటాసెట్ లోపాలకు మరింత సున్నితమైనది, ఆధారపడటానికి తక్కువ ప్రీట్రైనింగ్ ఉంటుంది.
- మల్టీ-టాస్క్ మరియు లాంగ్-హారిజన్ పని ఇప్పటికీ పెద్ద మోడళ్లకు అనుకూలంగా ఉంటుంది, SmolVLA యొక్క 2.25 B వేరియంట్తో సహా.
నడపదగిన పోలిక TinyVLAకు వ్యతిరేకంగా SmolVLA కాదు. ఇది SmolVLAకు వ్యతిరేకంగా ACT మీ స్వంత పనిపై, మరియు SmolVLA పేపర్ ఎందుకు అనేదానికి వాదన. రోబోటిక్స్ ప్రీట్రైనింగ్ లేకుండా సింగిల్-టాస్క్గా శిక్షణ పొందిన SmolVLA, సింగిల్-టాస్క్ ACT 48.3 సాధించిన మూడు SO-100 పనులలో సగటున 40.0 స్కోర్ చేసింది. దీనిని 78.3కి పెంచేది కమ్యూనిటీ ప్రీట్రైనింగ్ మరియు మల్టీ-టాస్క్ శిక్షణ, కేవలం నిర్మాణం మాత్రమే కాదు. SO-101 లెగో టాస్క్లో, రెండు సింగిల్-టాస్క్లు, SmolVLA గెలుస్తుంది: పంపిణీలో 70కి వ్యతిరేకంగా 90. అప్పుడు SmolVLAకు వ్యతిరేకంగా Pi0.5 బడ్జెట్ అనుమతిస్తే.
చెడు డేటాను కవర్ చేయడానికి తక్కువ ప్రీట్రైనింగ్ ఉంటుంది, కాబట్టి లోపభూయిష్ట డేటాసెట్పై శుభ్రమైన లాస్ కర్వ్ లోపాన్ని నమ్మకంగా పునరుత్పత్తి చేసే విధానాన్ని మీకు అందిస్తుంది. lerobot డాక్యుమెంట్లు నిర్మాణం గురించి స్పష్టంగా ఉన్నాయి: 5 క్యూబ్ స్థానాల్లో 50 ఎపిసోడ్లు, ఒక్కో స్థానానికి 10, పనిచేశాయి; 25 పని చేయలేదు. లాస్ బాగా కనిపించి, చేయి ఏమీ ఉపయోగకరంగా చేయకపోతే, లాస్ పడిపోతుంది, పాలసీ ఏమీ చేయదు, పాలసీ ఒకే సెటప్లో మాత్రమే పనిచేస్తుంది లేదా వాస్తవానికి ఉపయోగపడే VLA శిక్షణ డేటాను సేకరించడంతో ప్రారంభించండి.
ఐదు పాలసీలు, ఒక పోలిక పట్టిక
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA మరియు ACT వాస్తవ పారామీటర్ గణనలు, ప్రతి చర్య దశకు ఇన్ఫరెన్స్ లేటెన్సీ, ప్రతిదానికి అవసరమైన GPU శ్రేణి మరియు ఏదైనా ఉపయోగకరంగా చేయడానికి ముందు కనీస ఎపిసోడ్ గణనతో.
పాలసీలను పోల్చండిమీరు చర్య తీసుకోగల నిర్ణయ పట్టిక
| మీ పరిస్థితి | దీనితో ప్రారంభించండి | ఎందుకు |
|---|---|---|
| ఒక పని, మంచి ప్రదర్శనలు, భాష లేదు | ACT | ~80 M, 20 ms, 24 GB కార్డ్, డౌన్లోడ్ చేయడానికి బేస్ మోడల్ లేదు |
| కొన్ని సంబంధిత పనులు, ఒక్కోదానికి ఒక సూచన | SmolVLA | 450 M, lerobotలో, కనీసం 30 ఎపిసోడ్లు, ఒక్కో రన్కు 1 నుండి 3 USD |
| ప్రత్యేకంగా TinyVLA ఫలితాన్ని పునరుత్పత్తి చేయడం | TinyVLA-B or TinyVLA-H | రెపో మాత్రమే మార్గం: ఐసోలేటెడ్ ఎన్వి, మార్చబడిన డేటా |
| బహుళ-పనులు, విభిన్న సూచనలు, A100 బడ్జెట్ | GR00T N1.7 or Pi0.5 | ~3 B, ప్రతి దశకు 152 ms మరియు 485 ms, ఒక్కో రన్కు 4 నుండి 12 USD |
| ఇంకా రోబోట్ లేదు | నిజమైన చేయిని నడపండి | క్యూ-ఆధారిత లైవ్ ఆర్మ్కు సైన్అప్ మరియు హార్డ్వేర్ అవసరం లేదు |
చివరి వరుస కోసం, లైవ్ ఆర్మ్ భౌతిక SO-100ని ప్రసారం చేస్తుంది, మీరు ఖాతా లేకుండా బ్రౌజర్ నుండి డ్రైవ్ చేయవచ్చు, మరియు ప్రారంభించడానికి మూడు మార్గాలు మిగిలిన వాటిని కవర్ చేస్తుంది. SO-100 ఇక్కడ సూచన ఆర్మ్, సుమారు 110 నుండి 150 EUR భాగాలలో, ఒక పూర్తి సెటప్ గైడ్.
సబ్-1 B మోడల్స్ తర్వాత ఏమి వస్తుంది
పారామీటర్ల సంఖ్యను తగ్గించడం VLAని చౌకగా మార్చడానికి ఒక మార్గం, మరియు ఇది స్పష్టంగా గెలిచే మార్గం కాదు. OpenVLA-OFT (arXiv 2502.19645) 7 B బ్యాక్బోన్ను ఉంచుతుంది మరియు చర్యలు ఎలా డీకోడ్ చేయబడతాయో మాత్రమే మారుస్తుంది, చర్య ఉత్పత్తి థ్రూపుట్లో 26x పెరుగుదలను మరియు LIBERO 76.5 నుండి 97.1 శాతానికి పెరిగినట్లు నివేదిస్తుంది. BitVLA (arXiv 2506.07530) 1-బిట్ BitNet b1.58 2B4T బ్యాక్బోన్ యొక్క ప్రతి బరువును టెర్నరీగా చేస్తుంది, పూర్తి-ప్రెసిషన్ OpenVLA-OFTతో సరిపోలుతూ 11.0x తక్కువ మెమరీ మరియు 4.4x తక్కువ ఎండ్-టు-ఎండ్ లేటెన్సీని నివేదిస్తుంది. X-VLA-0.9B (arXiv 2510.10274) ఫ్లో మ్యాచింగ్తో 1 B లైన్లో ఉంది.
సాధారణ అంశం: లేటెన్సీ భాషా మోడల్లో కాకుండా యాక్షన్ డీకోడర్లో ఉంటుంది. ఒక పాలసీ ఎన్ని పారామీటర్లను కలిగి ఉందని అడిగే ముందు, అది చర్యలను ఎలా విడుదల చేస్తుందో అడగండి. అరేనా 85 మోడల్లు మరియు 332 ఫలితాలను కలిగి ఉంది, ప్రతి ఒక్కటి దాని మూలానికి లింక్ చేయబడింది; మా VLA పరిచయంలో విస్తృతమైన అవలోకనం ఉంది.
నేను RTX 4090లో SmolVLAని ఫైన్-ట్యూన్ చేయవచ్చా?▾
అవును. SmolVLA 450 M పారామీటర్లను కలిగి ఉంది మరియు AY-Robots దానిని RTX 4090 / 24 GB టైర్లో నడుపుతుంది. lerobot ఉదాహరణ --batch_size=64ని ఉపయోగిస్తుంది, ఇది మీ కార్డ్కు హామీ కాకుండా ఒక ఉదాహరణ; డాక్యుమెంట్లు చిన్నగా ప్రారంభించి, లోడింగ్ సమయాలు తక్కువగా ఉన్నప్పుడు పెంచమని సలహా ఇస్తాయి. A100లో 20000 స్టెప్లకు డాక్యుమెంట్లు ఉదహరించిన సుమారు 4 గంటల కంటే ఎక్కువ సమయం పట్టవచ్చు.
TinyVLA lerobotలో లేదా AY-Robotsలో అందుబాటులో ఉందా?▾
రెండింటికీ కాదు. TinyVLA దాని పరిశోధన రిపోజిటరీలో మాత్రమే ఉంది, చివరి కమిట్ 11 మార్చి 2025, మరియు దాని ఫార్మాట్ LeRobot కాకుండా ACT-శైలి HDF5. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA మరియు ACT లను శిక్షణ ఇస్తుంది. మీకు TinyVLA కావాలంటే మీరు దానిని మీరే నిర్మించుకోవాలి, మరియు మీరు ముందుగా scripts/train.shలో DeepSpeed కాన్ఫిగ్ పాత్ను సరిచేయాలి.
450 M మోడల్ నిజంగా 3 B మోడల్తో పోటీ పడుతుందా?▾
రచయితల సొంత బెంచ్మార్క్ల ప్రకారం, అవును: LIBEROలో 87.3కి వ్యతిరేకంగా 86.0, రోబోటిక్స్-ప్రీట్రైన్డ్ Pi0 3.3 Bతో పోలిస్తే, మరియు మూడు నిజమైన SO-100 టాస్క్లలో 78.3కి వ్యతిరేకంగా 61.7, ఇక్కడ అదే పేపర్ Pi0ని 3.5 Bగా లేబుల్ చేస్తుంది. పరిమితి అదే పేపర్లో ఉంది: రోబోటిక్స్ ప్రీట్రైనింగ్ లేకుండా సింగిల్-టాస్క్, SmolVLA 40.0కి పడిపోతుంది, ACT యొక్క 48.3 కంటే తక్కువ.
ఒక చిన్న VLA ఏదైనా చేయడానికి ముందు నాకు ఎన్ని ఎపిసోడ్లు అవసరం?▾
AY-Robots SmolVLA కనిష్టాన్ని 30 ఎపిసోడ్లుగా మరియు ACT కనిష్టాన్ని 50గా నిర్ణయించింది. lerobot డాక్యుమెంట్లు సుమారు 50ని సిఫార్సు చేస్తాయి మరియు అదే పనికి 25 సరిపోదని నివేదించాయి. సంఖ్యతో పాటు నిర్మాణం కూడా ముఖ్యమైనది: పేపర్ సెట్ 5 క్యూబ్ స్థానాలను ఒక్కొక్కటి 10 ఎపిసోడ్లతో ఉపయోగించింది.
ప్రచురించబడిన లేటెన్సీ సంఖ్యలు ఎందుకు ఇంతగా విభేదిస్తున్నాయి?▾
అవి వేర్వేరు విషయాలను కొలుస్తాయి. TinyVLA A6000లో ప్రతి చర్య అంచనాకు 14 ms నివేదిస్తుంది; AY-Robots SmolVLAను 245 ms వద్ద మరియు ACTని ప్రతి చర్య దశకు 20 ms వద్ద జాబితా చేస్తుంది. కొన్ని గణాంకాలు ఒక ఫార్వర్డ్ పాస్ను కవర్ చేస్తాయి, కొన్ని 50-చర్యల చంక్లో ఒక పాస్ను విభజిస్తాయి, మరియు కెమెరా క్యాప్చర్ లేదా సర్వోలకు వ్రాయడం దాదాపు ఏవీ చేర్చవు.
క్లౌడ్ ఇన్ఫరెన్స్ GPU సమస్యను పరిష్కరిస్తుందా?▾
పాక్షికంగా. AY-Robots ఒక పాడ్ను స్వయంచాలకంగా అందిస్తుంది, అది పాలసీని అందిస్తుంది, అయితే స్థానిక క్లయింట్ ఆ ఎండ్పాయింట్తో మాట్లాడుతుంది, నిశ్శబ్దంగా బిల్లింగ్ చేయకుండా అది తనను తాను నాశనం చేసుకునేలా ఒక ఐడిల్ వాచ్డాగ్తో. ఇది పబ్లిక్-ఇంటర్నెట్ రౌండ్ ట్రిప్ను తొలగించదు, మరియు నియంత్రణ లూప్ ఇప్పటికే ప్రతి చర్య దశకు 20 నుండి 485 ms వరకు ఉంటుంది. నెమ్మదిగా పికప్-అండ్-ప్లేస్కు బాగానే ఉంటుంది, కానీ వేగవంతమైన రియాక్టివ్ మోషన్కు కాదు.
Sources
- TinyVLA: రోబోటిక్ మానిప్యులేషన్ కోసం వేగవంతమైన, డేటా-సమర్థవంతమైన విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్ల వైపు
- TinyVLA అధికారిక కోడ్ రిపోజిటరీ (README, requirements.txt, scripts/train.sh)
- TinyVLA ప్రాజెక్ట్ పేజీ
- lesjie/Llava-Pythia-1.3B, TinyVLA-H బ్యాక్బోన్ వెయిట్స్
- SmolVLA: సరసమైన మరియు సమర్థవంతమైన రోబోటిక్స్ కోసం ఒక విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్
- lerobot డాక్యుమెంటేషన్: SmolVLAని ఫైన్-ట్యూన్ చేయడం
- lerobot: configuration_smolvla.py, SmolVLA డిఫాల్ట్లు
- lerobot/smolvla_base మోడల్ కార్డ్
- SmolVLA: సమర్థవంతమైన విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్ (Hugging Face బ్లాగ్)
- PyPIలో lerobot (0.6.1, Python 3.12 లేదా అంతకంటే కొత్తది అవసరం)
- OpenVLA: ఒక ఓపెన్-సోర్స్ విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్
- విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్లను ఫైన్-ట్యూన్ చేయడం: వేగం మరియు విజయాన్ని ఆప్టిమైజ్ చేయడం (OpenVLA-OFT)
- BitVLA: రోబోటిక్స్ మానిప్యులేషన్ కోసం 1-బిట్ విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్లు
- X-VLA: స్కేలబుల్ క్రాస్-ఎంబోడిమెంట్ విజన్-లాంగ్వేజ్-యాక్షన్ మోడల్గా సాఫ్ట్-ప్రాంప్టెడ్ ట్రాన్స్ఫార్మర్
- rail-berkeley/octo-small-1.5 మోడల్ కార్డ్ (27 M పారామీటర్లు)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started