
TinyVLA සහ SmolVLA මගින් ක්රියාකාරී VLA එකක් 1B පරාමිති යටතට ගෙන එයි. පත්රිකා දෙකෙන්ම සත්ය සංඛ්යා, lerobot පෙරනිමි, මනින ලද ප්රමාදය සහ 24 GB කාඩ්පතක ධාවනයක පිරිවැය.
සෑම දෘශ්ය-භාෂා-ක්රියාකාරී ආකෘතියක් ගැන ලියැවෙන සෑම දෙයක්ම දත්ත මධ්යස්ථාන කාඩ්පතක් උපකල්පනය කරයි. OpenVLA යනු පරාමිති බිලියන 7 කි. GR00T N1.7 සහ Pi0.5 බිලියන 3ක් පමණ වන අතර, සියුම් සුසර කිරීම සඳහා A100 80 GB එකක් අවශ්ය වේ. ඔබේ මේසය මත ඇති කාඩ්පත 4090 එකක් නම්, එම ආකෘති පන්තිය ඔබට ළඟා විය නොහැක.
පත්රිකා දෙකක් තර්ක කරන්නේ ඔබට එය අවශ්ය නොවන බවයි. TinyVLA (arXiv 2409.12514, 2025 පෙබරවාරි මාසයේදී IEEE Robotics and Automation Letters විසින් පිළිගන්නා ලදී) 400 M සිට 1.3 B දක්වා වූ මූලික ව්යුහයකින් සහ විසරණ ක්රියාකාරී ශීර්ෂයකින් VLA එකක් ගොඩනඟයි. SmolVLA (arXiv 2506.01844, 2025 ජූනි 2 දින ඉදිරිපත් කරන ලදී) විවෘත බර, විවෘත දත්ත සහ එක් පාරිභෝගික කාඩ්පතක ක්රියාත්මක වන ස්ක්රිප්ට් එකක් සමඟ පරාමිති මිලියන 450ක් නිකුත් කරයි. මෙන්න දෙකම මැන බැලූ දේ සහ බිලියන 1ට අඩු තර්කය වලංගු නොවන තැන.
ඔබ දැනගත යුතු දේ
- •TinyVLA ප්රමාණ තුනකින් නිකුත් කරයි: පුහුණු කළ හැකි 101 M සමඟ මුළු 422 M, 138 M සමඟ 740 M, 143 M සමඟ 1.3 B. පළමු දෙක පමණක් 1 B ට අඩුය.
- •එහි Table IV, එක් A6000 එකක් මත TinyVLA-1B සඳහා ක්රියාකාරී අනාවැකි සඳහා මිලි තත්පර 14ක් මනිනු ලබයි, OpenVLA-7B සඳහා මිලි තත්පර 292ක් සහ කුඩා කරන ලද OpenVLA-1B සඳහා මිලි තත්පර 140ක් සමඟ සසඳන විට.
- •වේගය රඳා පවතින්නේ ශීර්ෂය මත මිස මූලික ව්යුහය මත නොවේ: TinyVLA-H හි විසරණ ශීර්ෂය ACT ශීර්ෂයක් සමඟ මාරු කළ විට, සැබෑ රොබෝ කාර්යයන් පහේ සාමාන්යය 94.0 සිට තනි ඉලක්කම් දක්වා පහත වැටේ. MLP ශීර්ෂයක් සෑම තැනකම 0ක් ලබා ගනී.
- •SmolVLA යනු 450 M වන අතර, එයින් දළ වශයෙන් 100 M ක්රියාකාරී විශේෂඥයා වේ, එය ප්රජා LeRobot දත්ත කට්ටල 481ක් සහ රාමු මිලියන 10.6ක් මත පූර්ව පුහුණු කර ඇත. එය LIBERO මත 87.3ක් වාර්තා කරයි, රොබෝ විද්යාව සඳහා පූර්ව පුහුණු කරන ලද 3.3 B Pi0 සඳහා 86.0ක් සමඟ සසඳන විට, සහ සැබෑ SO-100 කාර්යයන් තුනක් මත 78.3ක් වාර්තා කරයි, 3.5 B Pi0 සඳහා 61.7ක් සමඟ සසඳන විට.
- •එම පූර්ව පුහුණුවකින් තොරව තනි කාර්යයක් සඳහා පුහුණු කළ විට, SmolVLA එම කාර්යයන් මත 40.0 දක්වා පහත වැටේ, එය ACT හි 48.3 ට වඩා අඩුය. කුඩා වීම ස්වයංක්රීයව පහසු නොවේ.
- •TinyVLA හට LeRobot ඒකාබද්ධ කිරීමක් නොමැති අතර CUDA 11.7 රෝද තොගයක් භාවිතා කරයි. SmolVLA lerobot හි ඇති අතර මෙහි 24 GB ස්ථරයේ එක් ධාවනයකට දළ වශයෙන් 1 සිට 3 USD දක්වා වැය වේ.
ඇත්ත වශයෙන්ම කුඩා VLA එකක් ලෙස සැලකෙන්නේ කුමක්ද
මොඩලයක කාඩ්පතක ඇති පරාමිති ගණන තනි අංකයක් නොවේ. එය මුළු බර, අනුමාන කිරීමේදී පටවන ලද බර, හෝ අතරතුර අනුක්රමණ ලබා ගන්නා බර අදහස් කළ හැක . TinyVLA දෙකම වාර්තා කරන අතර, පරතරය විශාලය: TinyVLA-H මුළු 1.3 B වන නමුත් 143 M පුහුණු කළ හැකි වන්නේ, දෘශ්ය කුළුණ සහ භාෂා මොඩලයෙන් වැඩි ප්රමාණයක් ස්ථාවරව පවතින අතර LoRA ඇඩැප්ටර සහ ක්රියාකාරී ශීර්ෂය චලනය වන බැවිනි. පත්රිකාව පුහුණු කළ හැකි කොටස සියයට 5ක් පමණ ලෙස දක්වයි.
| මොඩලය | පරාමිති | පසුබිම | ක්රියාකාරී ශීර්ෂය | මූලාශ්රය |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, no language model | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregressive action tokens | arXiv 2406.09246 |
පේළි දෙකක් ගැන තර්ක කිරීමට වටී. දළ වශයෙන් 80 M වන අතර මෙහි ඇති අනෙක් සියල්ලට වඩා කුඩා නමුත් භාෂා මොඩලයක් නොමැති බැවින් එය VLA එකක් නොවේ: එය එක් කාර්යයක් ඉගෙන ගන්නා අතර තවත් කාර්යයක් කිරීමට එයට පැවසිය නොහැක. 27 M හි T5-Base පෙළ කේතකයක් හරහා සකස් කර ඇත, LLM පසුබිමක් හරහා නොවේ. හොඳ මූලික රේඛා, කිසිවක් ලේබලය ඇඟවුම් කරන උපදෙස් අනුගමනය කිරීම ලබා නොදේ.
ප්රධාන ප්රතිඵල දරන TinyVLA-H ප්රභේදය 1.3 B වන අතර රේඛාවට ඉහළින් පිහිටා ඇත. වඩා හොඳ ප්රශ්නය වන්නේ පුහුණු කිරීමේදී මොඩලයක් 24 GB තුළට ගැලපේද සහ අනුමාන කිරීමේදී ඔබේ පාලන අනුපාතයට ළඟා වේද යන්නයි. ඔබට මෙහි පුහුණු කළ හැකි ප්රතිපත්ති පහ ප්රතිපත්ති පිටුවේ ඇත; ඔබට එහි සංඛ්යා අන් සියල්ලන්ගේම සංඛ්යා සමඟ අවශ්ය නම් TinyVLA සතුව පිටියට ඇතුළුවීමක් ඇත.
TinyVLA: වේගය එන්නේ head එකෙන් මිසක් backbone එකෙන් නෙවෙයි
පැහැදිලිව පෙනෙන්නේ ඔවුන් භාෂා ආකෘතිය කුඩා කළ නිසා එය වේගවත් වූ බවයි. නමුත් පත්රිකාවේ ablation අධ්යයනයෙන් වෙනත් දෙයක් කියැවේ. OpenVLA හි 7 B backbone එක දළ වශයෙන් 1 B එකක් සමඟ මාරු කිරීමෙන් එක් ක්රියාවකට අනාවැකි කීම 292 ms සිට 140 ms දක්වා අඩු විය, එය 2x ක වාසියකි. TinyVLA-H, සැසඳිය හැකි පරාමිති ගණනකින් යුක්තව, එකම කාඩ්පතේ 14 ms කින් ක්රියාත්මක වේ. අනෙක් 10x වාසිය ලැබෙන්නේ action head එකෙනි.
| ආකෘතිය | එක් ක්රියාවකට අනාවැකි කීම | මනිනු ලැබුවේ |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA ක්රියා නිකුත් කරන්නේ භාෂා ආකෘති head එක හරහා විවික්ත ටෝකන ලෙස, එක් ක්රියා මානයකට එකක් බැගින්, ස්වයංක්රීයවය. TinyVLA මඟින් diffusion decoder එකක් අමුණා ඇති අතර එය සම්පූර්ණ chunk එක එකවර නිපදවයි. Table V හි TinyVLA-H හි architecture එක අඩංගු වන අතර, එකම සැබෑ-රොබෝ කාර්යයන් පහක් මත head එක පමණක් මාරු කරයි. එය, flow matching policies මගින් සාදන බවට වන තර්කය සඳහා වන පැහැදිලිම සාක්ෂිය වන අතර, Pi0 token decoding වලින් ඉවත් වූ හේතුවයි.
| TinyVLA-H මත හිස | ටෙනිස් තැබීම | මග් එක පෙරලීම | කියුබ් ගොඩගැසීම | ලාච්චුව වැසීම | පෙට්ටිය විවෘත කිරීම |
|---|---|---|---|---|---|
| විසරණය (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| ක්රියා ඛණ්ඩනය කිරීමේ ට්රාන්ස්ෆෝමරය | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| බහු-ස්ථර පර්සෙප්ට්රෝනය | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 ms අගයන් Table IV හි දක්වා ඇති අතර, ඒවා සියල්ලම එක් A6000 මත ලබාගෙන ඇත. ඒවා එක් ක්රියා අනාවැකියකට අදාළ වන අතර කැමරා ග්රහණය, පූර්ව සැකසීම සහ සර්වෝ වෙත අනුක්රමික ලිවීම් බැහැර කරයි. ප්රකාශිත ප්රමාදය පහළ සීමාවක් ලෙස සලකන්න, කිසිවිටෙක පාලන අනුපාතය ලෙස නොසලකන්න. අපගේම සංඛ්යා ද එම සීමාව දරයි: අනුමාන ප්රමාදය බලන්න.
TinyVLA ලබාගත් ලකුණු
| බෙන්ච්මාර්ක් | ප්රොටෝකෝලය | TinyVLA-H | මූලික රේඛා |
|---|---|---|---|
| MetaWorld, කාර්යයන් 50, සිම් | බහු-කාර්ය, නිරූපණ 50, බීජ 3 | දුෂ්කරතාවය අනුව 77.6 / 21.5 / 11.4 / 15.8, සාමාන්යය 31.6 | Diffusion Policy average 10.5 |
| සැබෑ ෆ්රැන්කා පැන්ඩා, කාර්යයන් 5 | එක් කාර්යයකට ගමන් පථ 100, අත්හදා බැලීම් 20 | 94.0 සාමාන්යය | OpenVLA 68.3, Diffusion Policy 35.3 |
| ද්විමාන UR5, කාර්යයන් 3 | බහු-කාර්ය, එක් කාර්යයකට අත්හදා බැලීම් 10 | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
ද්වි-අත් පේළියට කඩදාසියේම කම්මැලි පැහැදිලි කිරීමක් ඇත: OpenVLA පුහුණු කර ඇත්තේ Open X-Embodiment මත වන අතර, එය සම්පූර්ණයෙන්ම තනි-අත් දත්ත වලින් සමන්විත වේ, එබැවින් ද්වි-අත් ක්රියා අවකාශය බෙදාහැරීමෙන් පිටත වන අතර එයට ශුන්ය ලකුණු ලැබේ. ඩිෆියුෂන් පොලිසි බේස්ලයින් එම කාර්යයන් තුනෙන් දෙකකදී TinyVLA-H පරදවයි. පසුබිම Open X-Embodiment ලිපිය.

TinyVLA රිපෝව, 2026 අගෝස්තු වන විට
පත්රිකාව හොඳයි. කේතය පර්යේෂණ නිකුතුවකි. රිපෝසිටරිය github.com/liyaxuanliyaxuan/TinyVLA; එහි README කේත නිකුතුව 2025 පෙබරවාරි 17 දිනටත්, අවසාන commit එක 2025 මාර්තු 11 දිනටත් දක්වයි. පත්රිකාවක් ප්රතිනිෂ්පාදනය කිරීමට හොඳයි, නමුත් නඩත්තු කරන ලද පුස්තකාලයක් අවශ්ය නම් ගැටලුවකි.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt මඟින් torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, සහ CUDA stack 11.x wheels වෙතට අමුණයි: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README මඟින් Python 3.10 ඉල්ලා සිටින අතර; lerobot 0.6.1 සඳහා 3.12 හෝ ඊට නවතම සංස්කරණයක් අවශ්ය වේ, එබැවින් මේ දෙකට එකම පරිසරයක් බෙදා ගත නොහැක. මුලින්ම ඔබේ GPU පරම්පරාව සඳහා torch 2.0.1 build එකක් පවතීදැයි තහවුරු කර ගන්න. ඒ වෙනුවට VRAM මත ධාවනයක් අසාර්ථක වුවහොත්, මතකයෙන් පිටත පිරික්සුම් ලැයිස්තුව අනුමාන කිරීමට වඩා වේගවත්ය.
TinyVLA කියවන්නේද නැත LeRobot දත්ත කට්ටල. එහි ආකෘතිය ACT-විලාසිතාවේ HDF5 වේ: ක්රියාව, language_raw, සහ බහු-දර්ශන රූප, joint_positions, qpos සහ qvel සහිත නිරීක්ෂණ සමූහයක්. ගබඩාව RLDS ආදානය සඳහා data_utils/rlds_to_h5py.py සමඟ එන අතර, සෑම කාර්යයක්ම aloha_scripts/constants.py හි dataset_dir, episode_len සහ camera_names සමඟ අතින් ලියාපදිංචි කර ඇත. ඔබේ කථාංග lerobot හෝ ඩෙස්ක්ටොප් සේවාදායකයා වෙතින් පැමිණියේ නම්, පරිවර්තනය ඔබේ වගකීමයි.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 අට-කාඩ් නෝඩයක් උපකල්පනය කරයි. එය 1ට සකසා, බැච් ප්රමාණය 32ට වඩා හොඳින් අඩු කරන්න. තනි-GPU ප්රභේදයක් අප්ස්ට්රීම් නැව්ගත නොකරන බැවින්, විධානය 4090 මත එලෙසම ධාවනය කළ නොහැක.
- --deepspeed scripts/zero2.json ඉහළ මට්ටමේ scripts ඩිරෙක්ටරියේ නොමැති ගොනුවක් වෙත යොමු කරයි. DeepSpeed වින්යාසයන් llava-pythia/scripts/zero2.json හි නැව්ගත කෙරේ. ඔබගේ පළමු ධාවනයට පෙර මාර්ගය නිවැරදි කරන්න.
- README මඟින් ප්රතිදාන ඩිරෙක්ටරි නාමයට llava_pythia අඩංගු විය යුතු බවත්, LoRA සක්රීය නම් lora ද අඩංගු විය යුතු බවත් ඉල්ලා සිටී.
- බැක්බෝන් යනු වෙනම බාගත කිරීමකි: lesjie/Llava-Pythia-400M, -700M හෝ -1.3B. ඔබ lerobot/smolvla_base වෙත යොමු කරන ආකාරයට ප්රතිපත්තියක් යොමු කරන තනි මූලික චෙක්පොයින්ට් එකක් නොමැත.
SmolVLA: අද දහවල් ඔබට ධාවනය කළ හැකි 1 B ට අඩු මොඩලය
SmolVLA නඩත්තු කරන ලද පුස්තකාලයක් තුළ එකම තර්කය ඉදිරිපත් කරයි. එය SmolVLM2-500M-Video-Instruct බැක්බෝන් එකක් මත 450 M පරාමිති වන අතර, කාර්යක්ෂමතාව ලැබෙන්නේ කුඩා වීම පිළිබඳ ප්රකාශයකින් නොව, configuration_smolvla.py වෙතින් ඔබට කියවිය හැකි සැකසුම් වලිනි.
| configuration_smolvla.py හි සැකසුම | පෙරනිමි | එයින් ලැබෙන දේ |
|---|---|---|
| num_vlm_layers | 16 | පළමු භාෂා ආකෘති ස්ථර 16 පමණක් ධාවනය වේ |
| expert_width_multiplier | 0.75 | ක්රියා විශේෂඥ සැඟවුණු ප්රමාණය VLM හි 75% කි |
| self_attn_every_n_layers | 2 | ස්වයං-අවධානය හරස්-අවධානය සමඟ අන්තර් සම්බන්ධිතයි |
| chunk_size / n_action_steps | 50 / 50 | එක් වාරයකින් ක්රියා 50ක් නිකුත් කරන අතර එම 50ම ක්රියාත්මක වේ |
| num_steps | 10 | ප්රවාහ ගැලපෙන ඩෙනොයිසින් පියවර 10 කට ස්ථාවර කර ඇත |
| tokenizer_max_length | 48 | උපදෙස් ටෝකන 48කට කපා හරිනු ලැබේ |
| freeze_vision_encoder / train_expert_only | True / True | සියුම්-සුසර කිරීමෙන් විශේෂඥයා චලනය වන අතර, දෘශ්ය කුළුණ නොවේ |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | පත්රිකාවේ වට්ටෝරුව නොවේ: එහි පූර්ව පුහුණුව 200000 පියවර පුරා 100-පියවර උණුසුම් කිරීමක් භාවිතා කළේය |
පූර්ව පුහුණුව සඳහා 481 ප්රජා LeRobot දත්ත කට්ටල, 22.9 K කථාංග සහ 10.6 M රාමු 4 GPU මත, 256 ගෝලීය කණ්ඩායමක පියවර 200000ක් භාවිතා කරන ලදී; පත්රිකාවට අනුව සමස්ත ව්යාපෘතිය සඳහා GPU පැය 30 K පමණ වැය වී ඇත. අවධානය යොමු කළ යුතු එක් අංකයක්: Hugging Face දියත් කිරීමේ බ්ලොගය 487 සකස් කළ දත්ත කට්ටල ගැන සඳහන් කරන අතර පත්රිකාවේ වගුවේ 481ක් සඳහන් වේ. අපි පත්රිකාවේ අගය භාවිතා කරන අතර මෙම නොගැලපීම සටහන් කරමු.

| සංසන්දනාත්මක මිනුම් | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO සාමාන්යය, බහු-කාර්ය | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World සාමාන්යය, බහු-කාර්ය | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| සැබෑ SO-100, කාර්යයන් 3, බහු-කාර්ය පුහුණුව | 78.3 | - | 61.7 (3.5 B) | - |
| සැබෑ SO-100, කාර්යයන් 3, තනි-කාර්ය, රොබෝ විද්යා පූර්ව පුහුණුවක් නැත | 40.0 | - | - | 48.3 |
| SO-101 ලෙගෝ තෝරා තැබීම, තනි-කාර්ය, බෙදාහැරීම තුළ | 90 | - | - | 70 |
| SO-101 ලෙගෝ තෝරා තැබීම, තනි-කාර්ය, බෙදාහැරීමෙන් පිටත | 50 | - | - | 40 |
LIBERO යනු අනුකරණයකි, එහි දක්ෂ සියල්ල දැන් අසූ ගණන්වල ලකුණු ලබා ගනී. සැබෑ SO-100 පේළිය, එහිදී 450 M ආකෘතියක් 3.5 B ආකෘතියක් ලකුණු 16.6 කින් පරදවයි, එය සිත්ගන්නා සුළුය; ඊට යටින් ඇති පේළිය ප්රතිවිරුද්ධයයි. ප්රජා පූර්ව පුහුණුව සහ බහු-කාර්ය පුහුණුව ඉවත් කළ විට, එම ආකෘතිය ACT යටතේ 40.0 දක්වා පහත වැටේ. ආරක්ෂා කළ හැකි ප්රකාශය නම් කුඩා ආකෘතියක් ස්වයංක්රීයව නරක නොවන බව මිස එය වඩා හොඳ බව නොවේ.
එක් අහඹු සිදුවීමක් උපකාරී වේ: SmolVLA පත්රිකාවේ Meta-World වගුව TinyVLA හිම ප්රකාශිත සංඛ්යා මූලික රේඛාවක් ලෙස දක්වයි, එබැවින් එක් වරක් ආකෘති දෙකම එක් වගුවක, SmolVLA-0.45B 57.3 ට සහ TinyVLA-H 31.6 ට ඇත. එය SmolVLA පුහුණුව Pi0 ට වඩා 6 ගුණයකින් අඩු මතකයක් මත 40% ක් පමණ වේගවත් බව ද වාර්තා කරයි. මේ සියල්ල SmolVLA කතුවරුන්ගෙන් ලැබී ඇත; එම අරීනා ඇතුළත් කිරීම එක් එක් අගය එහි මූලාශ්රයට සම්බන්ධ කරයි.
SmolVLA එහි කාලය ගත කරන ආකාරය
AY-Robots SmolVLA ක්රියා පියවරකට 245 ms ලෙසත් ACT 20 ms ලෙසත් ප්රතිපත්ති නාමාවලිය හි ලැයිස්තුගත කරයි. TinyVLA ක්රියා අනාවැකියකට 14 ms වාර්තා කරයි. එම සංඛ්යා සැසඳිය නොහැකි අතර, ඒවා එසේ යැයි සලකා කටයුතු කිරීම මෙම මාතෘකාවේ වඩාත් පොදු වැරැද්දයි: සමහර විට එක් ඉදිරි ගමන් මාර්ගයක්, සමහර විට එම ගමන් මාර්ගය කොටසක් හරහා බෙදා හරිනු ලබන්නේ ක්රියා ඛණ්ඩනය එය අමෝර්ටයිස් කරන විටය.
- SmolVLA එක් ඉදිරි ගමන් මාර්ගයකට ක්රියා 50ක් නිකුත් කරන අතර එම 50ම ක්රියාත්මක කරයි. පත්රිකාව සැබෑ රොබෝවරුන් මත භාවිතා කරන 30 fps වේගයෙන්, එක් අනුමානයක් චලනය වන තත්පර 1.7ක් පමණ ආවරණය කරයි.
- වත්මන් ඛණ්ඩය තවමත් ක්රියාත්මක වන අතරතුර අසමමුහුර්ත අනුමානය මඟින් ඊළඟ ඛණ්ඩය ගණනය කරයි: සමමුහුර්ත 13.75 s ට සාපේක්ෂව සාමාන්ය කාර්යය සම්පූර්ණ කිරීම 9.7 s, දළ වශයෙන් 30% ක් වේගවත් වන අතර, ස්ථාවර තත්පර 60 ක කවුළුවක් තුළ 9 ට සාපේක්ෂව pick-and-place චක්ර 19 ක්.
- සාර්ථකත්ව අනුපාත වඩා හොඳ නොවී සැසඳිය හැකි විය, සමමුහුර්ත 78.3 ට සාපේක්ෂව අසමමුහුර්ත 73.3. අසමමුහුර්තභාවය මඟින් නිවැරදිභාවය නොව, ඵලදායිතාව ලබා දෙයි.
- ඛණ්ඩනය මඟින් ගණනය කිරීමේ ප්රමාදය සඟවයි මිස ජාල ප්රමාදය නොවේ, තවද එය ක්රියා 50කට කැපවී ඇති නිසා ප්රතිපත්තිය අඩු ප්රතික්රියාශීලී කරයි.
AY-Robots හට ඔබේ policy එකට සේවය කරන cloud GPU pod එකක් ස්වයංක්රීයව සැපයිය හැක, එම අතරතුර දේශීය රොබෝ සේවාදායකයා එම endpoint එක සමඟ සන්නිවේදනය කරයි. එම pod එක idle watchdog එකක් දරන නිසා, එය නිහඬව බිල්පත් කිරීම වෙනුවට තමන්වම විනාශ කර ගනී. එය නොකරන දෙය නම් public-internet round trip එක ඉවත් කිරීමයි. මෙහි ඇති policies පහ හරහා පාලන ලූපය කිසිදු ජාලයක් නොමැතිව එක් ක්රියාකාරී පියවරකට 20 සිට 485 ms දක්වා වේ, එබැවින් දුරස්ථ inference මන්දගාමී pick-and-place සඳහා සුදුසු වන අතර, වේගවත් ප්රතික්රියාශීලී චලනයන් සඳහා නොවේ.

එක් consumer card එකක් මත SmolVLA fine-tuning කිරීම
lerobot 0.6.1 මත, 2026 අගෝස්තු 23 වන විට වත්මන් PyPI නිකුතුව. පහත සියල්ලම Hugging Face lerobot SmolVLA documentation වෙතින්, එදිනම ලබාගත් ඒවාය; මඟ පෙන්වන ලද අනුවාදය වඩාත් පහසුය.
- 1smolvla අමතර සමඟ lerobot ස්ථාපනය කරන්න
SmolVLA යැපීම් විකල්ප අමතර කොටසක් වන අතර, මූලික ස්ථාපනයේ කොටසක් නොවේ. එය නොමැතිව ස්ථාපනය කර පසුව ප්රතිපත්ති වර්ගය නොදන්නේ මන්දැයි කල්පනා කිරීම සාමාන්යයෙන් පැය භාගයක් නාස්ති කිරීමකි.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2ප්රමාණවත් කථාංග සහිත දත්ත කට්ටලයක් ලබා ගන්න
ලේඛනවල කථාංග 50ක් පමණ නිර්දේශ කරන අතර, කථාංග 25ක් සහිත එකම කාර්යය ප්රමාණවත් නොවූ බව සඳහන් කරයි. AY-Robots අවම වශයෙන් 30ක් නියම කරයි. ඔබේම දත්ත වාර්තා කරන්න, නැතහොත් දත්ත කට්ටල නාමාවලියෙන් ආරම්භ කරන්න.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3සියුම්-සුසර කිරීම ආරම්භ කරන්න
lerobot මාර්ගෝපදේශයෙන් ලබාගත් විධානය, වෙනස් නොකර. ලේඛනවලට අනුව A100 එකක පියවර 20000ක් සඳහා ආසන්න වශයෙන් පැය 4ක් ගතවේ. 24 GB කාඩ්පතකදී, වැඩි කාලයක් අපේක්ෂා කර එය මැන බලන්න.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4ගැළපෙන තෙක් කණ්ඩායම් ප්රමාණය අඩු කරන්න
batch_size=64 යනු ලේඛනගත උදාහරණයකි, ඔබේ කාඩ්පත පිළිබඳ පොරොන්දුවක් නොවේ. ලේඛනවල උපදෙස් දෙන්නේ කුඩාවට ආරම්භ කර, පැටවීමේ කාලය කෙටිව පවතින තාක් වැඩි කරන ලෙසයි.
bashlerobot-train --help - 5චෙක්පොයින්ට් එක අත මත ක්රියාත්මක කරන්න
එකම පුස්තකාලය, එක් විධානයක්. තත්ය කාලීන ඛණ්ඩනය කිරීමේ ධජ ලේඛනවල අදහස් දක්වා ඇති අතර, අඩු බලැති දෘඪාංග සඳහා ඒවා භාවිතා කළ යුතුය.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
ඔබ කුමන මාර්ගයක් ගත්තද, ඔබට චෙක්පොයින්ට් එකක් සහ එය නිපදවූ වින්යාසය ලැබේ. දත්ත කට්ටල සංශෝධනය, පියවර ගණන සහ බීජය එය අසල තබා ගන්න. lerobot පෙරනිමියෙන් බීජය 1000ට සකසයි; GR00T හි සියුම්-සුසර කිරීමේ ආරම්භක ලක්ෂ්යය කිසිදු බීජයක් නිරාවරණය නොකරයි, එබැවින් එම ධාවන බිට්-සඳහා-බිට් ප්රතිනිෂ්පාදනය කළ නොහැක. පුහුණු ලේඛනවල යාන්ත්ර විද්යාව.
කුඩා VLA එකක් අතකට ලබා ගැනීමට ක්රම දෙකක්
ඔබ යන්ත්රය සහ අසාර්ථක ක්රමවල හිමිකරු වේ. SmolVLA සඳහා එය සාධාරණයි: එක් pip අමතර, එක් පුහුණු විධානයක්, එක් rollout විධානයක්. TinyVLA සඳහා එය ශීත කළ පින්, කැඩුණු DeepSpeed මාර්ගයක් සහ ඔබ විසින්ම ලියන දත්ත පරිවර්තනයක් සහිත පර්යේෂණ ප්රතිනිෂ්පාදනයකි.
- 24 GB කාඩ්පතක් ලබා ගන්න, කථාංග 30 සිට 50 දක්වා වාර්තා කරන්න, කැමරා ප්රවාහ රාමු-රාමුවෙන් සත්යාපනය කරන්න.
- pip install -e ".[smolvla]", lerobot/smolvla_base ට එරෙහිව lerobot-train කරන්න, ඉන්පසු අත සම්බන්ධ කර ඇති යන්ත්රයේ චෙක්පොයින්ට් එක සේවය කරන්න.
- TinyVLA සඳහා: වෙනම conda env, දත්ත HDF5 වෙත පරිවර්තනය කරන්න, constants.py හි කාර්යය ලියාපදිංචි කරන්න, zero2.json මාර්ගය නිවැරදි කරන්න, train.sh අට GPU වලින් එකකට කපන්න.
- කාඩ්පත ගෙවූ පසු පැයකට බිල්පත් කිරීමක් නැත.
- අනුමානය සර්වෝ යාන්ත්රණ අසල පිහිටා ඇත, වේගවත් පාලන ලූපයක් ලබා ගැනීමට ඇති එකම ක්රමය එයයි.
- ඔබට ප්රතිපත්ති කේතය පැච් කළ හැකි අතර, TinyVLA ලබා ගත හැක්කේ මේ ආකාරයට පමණි.
- 4090 කාඩ්පතක් සෑම ~3 B ප්රතිපත්තියක්ම බැහැර කරයි, එබැවින් GR00T N1.7 හෝ Pi0.5 ට එරෙහිව දේශීය සංසන්දනයක් කළ නොහැක.
- පරිසර සැකසීම සැබෑ කාර්යයයි. TinyVLA හි පින් පමණක් දවසක් ගත විය හැක.
- පෝලිමක් නැත, නැවත උත්සාහ කිරීමක් නැත, චෙක්පොයින්ට් ගබඩාවක් නැත. පියවර 14000 දී නැවත ආරම්භ කිරීම යනු නැවත ආරම්භ කිරීමයි.
SmolVLA මෙහි ඇති ප්රතිපත්ති පහෙන් එකකි. ඔබ ආකෘතියක් සහ දත්ත කට්ටලයක් තෝරා ගනී, පසුබිම අවශ්ය VRAM අනුව GPU එකක් කුලියට ගනී, පුහුණුකරු ධාවනය කර චෙක්පොයින්ට් වස්තු ගබඩාවට ලියයි. පියවරෙන් පියවර: SO-100 මත SmolVLA, නැතහොත් සම්පූර්ණ matrix එක පුහුණු පිටුව.
| SmolVLA සඳහා වේදිකාව යවන දේ | අගය |
|---|---|
| batch size | 2 |
| learning rate | 1e-4 |
| max steps | 20000 |
| gradient accumulation | 8, and it does not reach the trainer |
| extra knobs in the form | seed, logFreq |
| GPU tier | RTX 4090 or any 24 GB card |
| dataset format | LeRobot v3.0 |
| minimum episodes | 30 |
පළමුව, මෙහි පෙරනිමි කණ්ඩායම් ප්රමාණය 2 මිස lerobot ලේඛන උදාහරණයේ 64 නොවේ, සහ gradient accumulation සැකසුම යවනු ලැබුවද SmolVLA සඳහා කිසිදු බලපෑමක් නැත, එබැවින් ඵලදායී කණ්ඩායම ඇත්ත වශයෙන්ම 2 කි. පෙරනිමිය upstream සමඟ ගැලපෙනු ඇතැයි උපකල්පනය කරනවාට වඩා හිතාමතාම එය වැඩි කරන්න. දෙවනුව, TinyVLA මෙහි කිසිසේත් පුහුණු කළ නොහැක.
24 GB ස්ථරයේ ධාවනයක් පැයකට 0.30 සිට 0.60 USD දක්වා, ආසන්න වශයෙන් 1 සිට 3 USD දක්වා, පැය 2 සිට 5 දක්වා ගතවේ. A100 ස්ථරයේ ~3 B ප්රතිපත්තියක් පැයකට 1.20 සිට 2.00 USD දක්වා, ආසන්න වශයෙන් 4 සිට 12 USD දක්වා, පැය 3 සිට 6 දක්වා ගතවේ. බලන්න මිලකරණය, සහ එම මෙහෙයුම් CLI සහ MCP සේවාදායකය.
කුඩා ආකෘතියක් වැරදි තේරීමක් වන විට
සාරාංශවලට වඩා පත්රිකා දෙකම මෙහිදී වඩාත් ප්රවේශම් සහගතය. TinyVLA හි අසාර්ථක විශ්ලේෂණය නිශ්චිතය: 0.4 B ප්රභේදය උපදෙස් වැරදි ලෙස කියවීමෙන් තුන් වතාවක් අසාර්ථක විය, එය කතුවරුන් කුඩා VLM හි සීමිත භාෂා අවබෝධයට ආරෝපණය කරයි, එම මාදිලිය 1.3 B හිදී අතුරුදහන් විය. SmolVLA අනෙක් අන්තයෙන් එකම වක්රය පෙන්වයි: එකම ගෘහ නිර්මාණ ශිල්පයේ 2.25 B අනුවාදය LIBERO හි 88.75 ක් සහ Meta-World හි 68.24 ක් ලබා ගනී, 0.45 B ආකෘතිය සඳහා 87.3 සහ 57.3 ට සාපේක්ෂව.
- 24 GB කාඩ්පතකට ගැලපේ, එය අත්හදා බැලීමක් ඩොලර් දස ගණනකින් කිහිපයකට අඩු කරයි.
- අත අසල ධාවනය කිරීමට තරම් වේගවත්, එබැවින් පාලන ලූපයේ ජාල පිම්මක් නොමැත.
- එක් පුද්ගලයෙකුට වාර්තා කළ හැකි දත්ත මත සියුම් ලෙස සකස් කරයි, දහස් ගණනක් වෙනුවට කථාංග දස ගණනක්.
- SmolVLA හි බර, දත්ත ලැයිස්තුව සහ කේතය පොදු බැවින්, නරක ප්රතිඵලයක් නිදොස් කළ හැකිය.
- දුර්වල උපදෙස් අනුගමනය කිරීම: අඩු භාෂා පරාමිති, සමාන යොමු ප්රකාශන වෙන් කිරීමට ඇති හැකියාව අඩුය.
- ඔබ වාර්තා නොකළ සැකසුම් සඳහා අඩු අවකාශීය හා දෘශ්ය සාමාන්යකරණය.
- දත්ත කට්ටල දෝෂ වලට වඩා සංවේදී, යැපීමට අඩු පූර්ව පුහුණුවක් සහිතව.
- බහු-කාර්ය සහ දිගු-කාලීන වැඩ තවමත් SmolVLA හිම 2.25 B ප්රභේදය ඇතුළුව විශාල ආකෘති වලට අනුග්රහය දක්වයි.
ධාවනය කිරීමට වටිනා සංසන්දනය TinyVLA එදිරිව SmolVLA නොවේ. එය SmolVLA එදිරිව ACT ඔබේම කාර්යය මත, සහ SmolVLA පත්රිකාව එයට හේතුව සඳහා තර්කයයි. රොබෝ විද්යා පූර්ව පුහුණුවකින් තොරව තනි-කාර්යයක් ලෙස පුහුණු කරන ලද SmolVLA, තනි-කාර්ය ACT 48.3 ක් කළමනාකරණය කළ SO-100 කාර්යයන් තුනක් හරහා සාමාන්යයෙන් 40.0 ක් ලබා ගත්තේය. එය 78.3 දක්වා ඔසවා තබන්නේ ප්රජා පූර්ව පුහුණුව සහ බහු-කාර්ය පුහුණුව මිස ගෘහ නිර්මාණ ශිල්පය පමණක් නොවේ. SO-101 ලෙගෝ කාර්යය මත, තනි-කාර්ය දෙකම, SmolVLA ජය ගනී: බෙදාහැරීමේදී 70 ට එරෙහිව 90. ඉන්පසු SmolVLA එදිරිව Pi0.5 අයවැය ඉඩ දෙන්නේ නම්.
දුර්වල දත්ත ආවරණය කිරීමට පෙර පුහුණු කිරීම අඩු බැවින්, දෝෂ සහිත දත්ත කට්ටලයක් මත පිරිසිදු පාඩු වක්රයක් මඟින් දෝෂය විශ්වාසයෙන් ප්රතිනිෂ්පාදනය කරන ප්රතිපත්තියක් ඔබට ලබා දේ. lerobot ලේඛන ව්යුහය ගැන පැහැදිලිව දක්වයි: ඝනක ස්ථාන 5ක් හරහා කථාංග 50ක්, එක් ස්ථානයකට 10ක්, සාර්ථක විය; 25ක් සාර්ථක වූයේ නැත. පාඩුව හොඳින් පෙනේ නම් සහ අත කිසිදු ප්රයෝජනවත් දෙයක් නොකරන්නේ නම්, මෙතැනින් ආරම්භ කරන්න පාඩුව අඩු වේ, ප්රතිපත්තිය කිසිවක් නොකරයි, ප්රතිපත්තිය ක්රියා කරන්නේ එක් සැකසුමක පමණි හෝ ඇත්ත වශයෙන්ම භාවිතා කළ හැකි VLA පුහුණු දත්ත එකතු කිරීම.
ප්රතිපත්ති පහක්, එක් සංසන්දනාත්මක වගුවක්
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA and ACT සැබෑ පරාමිති ගණන්, එක් ක්රියා පියවරකට අනුමාන ප්රමාදය, එක් එක් අවශ්ය GPU ස්ථරය සහ ප්රයෝජනවත් යමක් කිරීමට පෙර අවම කථාංග ගණන සමඟ.
ප්රතිපත්ති සංසන්දනය කරන්නඔබට ක්රියා කළ හැකි තීරණ වගුවක්
| ඔබේ තත්ත්වය | ආරම්භ කරන්න | ඇයි |
|---|---|---|
| එක් කාර්යයක්, හොඳ නිරූපණ, භාෂාවක් නැත | ACT | ~80 M, 20 ms, 24 GB කාඩ්පත, බාගත කිරීමට මූලික ආකෘතියක් නැත |
| අදාළ කාර්යයන් කිහිපයක්, එක් එක් සඳහා එක් උපදෙසක් | SmolVLA | 450 M, in lerobot, අවම කථාංග 30ක්, එක් ධාවනයකට 1 සිට 3 USD |
| විශේෂයෙන් TinyVLA ප්රතිඵලය ප්රතිනිෂ්පාදනය කිරීම | TinyVLA-B or TinyVLA-H | ගබඩාව එකම මාර්ගයයි: හුදකලා පරිසරය, පරිවර්තනය කළ දත්ත |
| බහු-කාර්ය, විවිධ උපදෙස්, A100 අයවැය | GR00T N1.7 or Pi0.5 | ~3 B, එක් පියවරකට 152 ms සහ 485 ms, එක් ධාවනයකට 4 සිට 12 USD |
| තවම රොබෝවරයෙක් නැත | සැබෑ අතක් ධාවනය කරන්න | පෝලිම් මත පදනම් වූ සජීවී අතට ලියාපදිංචියක් හෝ දෘඪාංග අවශ්ය නොවේ |
අවසාන පේළිය සඳහා, සජීවී අත ගිණුමක් නොමැතිව බ්රවුසරයෙන් ධාවනය කළ හැකි භෞතික SO-100 එකක් විකාශනය කරයි, තවද ආරම්භ කිරීමට ක්රම තුන ඉතිරිය ආවරණය කරයි. SO-100 මෙහි යොමු අත වන අතර, කොටස් සඳහා දළ වශයෙන් යුරෝ 110 සිට 150 දක්වා වැය වන අතර, සම්පූර්ණ සැකසුම් මාර්ගෝපදේශයක් ඇත.
1 B ට අඩු මාදිලිවලින් පසුව එන්නේ කුමක්ද?
පරාමිති ගණන අඩු කිරීම VLA එකක් ලාභදායී කිරීමට එක් ක්රමයක් වන අතර එය පැහැදිලිවම ජයග්රාහී ක්රමය නොවේ. OpenVLA-OFT (arXiv 2502.19645) 7 B බැක්බෝන් එක රඳවා තබා ගන්නා අතර ක්රියා විකේතනය කරන ආකාරය පමණක් වෙනස් කරයි, ක්රියා ජනන ධාරිතාව 26 ගුණයකින් වැඩිවීමක් සහ LIBERO 76.5 සිට 97.1 දක්වා ඉහළ යාමක් වාර්තා කරයි. BitVLA (arXiv 2506.07530) 1-bit BitNet b1.58 2B4T බැක්බෝන් එකක සෑම බරක්ම ත්රිත්ව බවට පත් කරයි, 11.0x අඩු මතකයක් සහ 4.4x අඩු අන්ත-සිට-අන්ත ප්රමාදයක් වාර්තා කරන අතර සම්පූර්ණ නිරවද්යතාවයෙන් යුත් OpenVLA-OFT සමඟ ගැලපේ. X-VLA-0.9B (arXiv 2510.10274) ප්රවාහ ගැලපීම සමඟ 1 B රේඛාවේ පිහිටා ඇත.
පොදු කරුණ: ප්රමාදය පවතින්නේ භාෂා ආකෘතියේ නොව, ක්රියා විකේතකයේ ය. ප්රතිපත්තියක් ක්රියා නිකුත් කරන්නේ කෙසේදැයි විමසීමට පෙර, එහි පරාමිති කීයක් තිබේදැයි විමසන්න. අරීනා සතුව මාදිලි 85ක් සහ ප්රතිඵල 332ක් ඇත, ඒ සෑම එකක්ම එහි මූලාශ්රයට සම්බන්ධ කර ඇත; පුළුල් දළ විශ්ලේෂණයක් අපගේ VLA හැඳින්වීම තුළ ඇත.
මට RTX 4090 එකක SmolVLA fine-tune කළ හැකිද?▾
ඔව්. SmolVLA යනු 450 M පරාමිති වන අතර AY-Robots එය RTX 4090 / 24 GB ස්ථරයේ ධාවනය කරයි. lerobot උදාහරණය --batch_size=64 භාවිතා කරයි, එය ඔබේ කාඩ්පත සඳහා සහතිකයක් නොව උදාහරණයකි; ලේඛනවල උපදෙස් දෙන්නේ කුඩාවෙන් ආරම්භ කර loading times කෙටිව පවතින තාක් වැඩි කරන ලෙසයි. A100 එකක 20000 steps සඳහා ලේඛනවල සඳහන් වන ආසන්න වශයෙන් පැය 4ට වඩා වැඩි කාලයක් අපේක්ෂා කරන්න.
TinyVLA lerobot හි හෝ AY-Robots හි තිබේද?▾
දෙකටම නැත. TinyVLA පවතින්නේ එහි පර්යේෂණ ගබඩාවේ පමණි, අවසාන commit එක 2025 මාර්තු 11 වන අතර, එහි ආකෘතිය LeRobot වෙනුවට ACT-style HDF5 වේ. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA සහ ACT පුහුණු කරයි. ඔබට TinyVLA අවශ්ය නම් ඔබ එය ඔබම ගොඩනගා ගත යුතු අතර, scripts/train.sh හි ඇති DeepSpeed config path එක මුලින්ම නිවැරදි කිරීමට සිදුවනු ඇත.
450 M model එකක් ඇත්තටම 3 B model එකක් සමඟ තරඟකාරීද?▾
කතුවරුන්ගේම benchmarks අනුව, ඔව්: LIBERO මත 87.3 එදිරිව 86.0, robotics-pretrained Pi0 3.3 B සමඟ සසඳන විට, සහ සැබෑ SO-100 tasks තුනක් මත 78.3 එදිරිව 61.7, එහිදී එම පත්රිකාව Pi0 3.5 B ලෙස ලේබල් කරයි. සීමාව එම පත්රිකාවේම ඇත: robotics pretraining නොමැතිව single-task, SmolVLA 40.0 දක්වා පහත වැටේ, එය ACT හි 48.3 ට වඩා අඩුය.
කුඩා VLA එකක් යමක් කිරීමට පෙර මට කොපමණ episodes අවශ්යද?▾
AY-Robots SmolVLA අවම වශයෙන් episodes 30ක් ලෙසත් ACT අවම වශයෙන් 50ක් ලෙසත් සකසයි. lerobot docs 50ක් පමණ නිර්දේශ කරන අතර එම කාර්යය සඳහා 25ක් ප්රමාණවත් නොවූ බව වාර්තා කරයි. ගණන මෙන්ම ව්යුහයද වැදගත් වේ: පත්රිකාවේ කට්ටලය cube positions 5ක් භාවිතා කළ අතර එක් එක් සඳහා episodes 10ක් විය.
ප්රකාශිත latency අංක මෙතරම් වෙනස් වන්නේ ඇයි?▾
ඒවා විවිධ දේ මනිනු ලබයි. TinyVLA A6000 එකක action prediction එකකට 14 ms වාර්තා කරයි; AY-Robots SmolVLA 245 ms ලෙසත් ACT action step එකකට 20 ms ලෙසත් ලැයිස්තුගත කරයි. සමහර සංඛ්යා එක් forward pass එකක් ආවරණය කරයි, සමහරක් pass එකක් 50-action chunk එකක් හරහා බෙදාහරින අතර, කැමරා ග්රහණය හෝ servos වෙත ලිවීම පාහේ කිසිවක් ඇතුළත් නොවේ.
cloud inference GPU ගැටලුව විසඳනවාද?▾
අර්ධ වශයෙන්. AY-Robots policy එක සපයන pod එකක් ස්වයංක්රීයව සපයයි, දේශීය client එක එම endpoint එක සමඟ කතා කරන අතර, idle watchdog එකක් සමඟින් එය නිහඬව බිල්පත් කිරීම වෙනුවට තමන්වම විනාශ කර ගනී. එය public-internet round trip එක ඉවත් කළ නොහැකි අතර, control loop එක දැනටමත් action step එකකට 20 සිට 485 ms දක්වා වේ. මන්දගාමී pick-and-place සඳහා හොඳයි, වේගවත් reactive motion සඳහා නොවේ.
Sources
- TinyVLA: රොබෝටික් හැසිරවීම සඳහා වේගවත්, දත්ත-කාර්යක්ෂම Vision-Language-Action Models වෙත
- TinyVLA නිල කේත ගබඩාව (README, requirements.txt, scripts/train.sh)
- TinyVLA ව්යාපෘති පිටුව
- lesjie/Llava-Pythia-1.3B, TinyVLA-H backbone weights
- SmolVLA: දැරිය හැකි සහ කාර්යක්ෂම රොබෝ විද්යාව සඳහා Vision-Language-Action Model එකක්
- lerobot ලේඛන: SmolVLA fine-tuning කිරීම
- lerobot: configuration_smolvla.py, SmolVLA පෙරනිමි සැකසුම්
- lerobot/smolvla_base model card
- SmolVLA: කාර්යක්ෂම Vision-Language-Action Model (Hugging Face blog)
- PyPI හි lerobot (0.6.1, Python 3.12 හෝ නවතම අවශ්යයි)
- OpenVLA: විවෘත මූලාශ්ර Vision-Language-Action Model එකක්
- Vision-Language-Action Models Fine-Tuning කිරීම: වේගය සහ සාර්ථකත්වය ප්රශස්ත කිරීම (OpenVLA-OFT)
- BitVLA: රොබෝටික් හැසිරවීම සඳහා 1-bit Vision-Language-Action Models
- X-VLA: පරිමාණය කළ හැකි Cross-Embodiment Vision-Language-Action Model එකක් ලෙස Soft-Prompted Transformer
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started