AY-Robots ප්‍රතිපත්ති සංසන්දන වගුව, GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA සහ ACT සඳහා පරාමිති ගණන, GPU ස්ථර සහ අනුමාන ප්‍රමාදය සමඟ
SmolVLATinyVLAකුඩා VLAපාරිභෝගික GPULeRobot

කුඩා VLA මාදිලි: TinyVLA, SmolVLA සහ 1B ට අඩු අවස්ථාව

AY-Robots ResearchAugust 23, 202619 මිනිත්තු කියවීම

TinyVLA සහ SmolVLA මගින් ක්‍රියාකාරී VLA එකක් 1B පරාමිති යටතට ගෙන එයි. පත්‍රිකා දෙකෙන්ම සත්‍ය සංඛ්‍යා, lerobot පෙරනිමි, මනින ලද ප්‍රමාදය සහ 24 GB කාඩ්පතක ධාවනයක පිරිවැය.

සෑම දෘශ්‍ය-භාෂා-ක්‍රියාකාරී ආකෘතියක් ගැන ලියැවෙන සෑම දෙයක්ම දත්ත මධ්‍යස්ථාන කාඩ්පතක් උපකල්පනය කරයි. OpenVLA යනු පරාමිති බිලියන 7 කි. GR00T N1.7 සහ Pi0.5 බිලියන 3ක් පමණ වන අතර, සියුම් සුසර කිරීම සඳහා A100 80 GB එකක් අවශ්‍ය වේ. ඔබේ මේසය මත ඇති කාඩ්පත 4090 එකක් නම්, එම ආකෘති පන්තිය ඔබට ළඟා විය නොහැක.

පත්‍රිකා දෙකක් තර්ක කරන්නේ ඔබට එය අවශ්‍ය නොවන බවයි. TinyVLA (arXiv 2409.12514, 2025 පෙබරවාරි මාසයේදී IEEE Robotics and Automation Letters විසින් පිළිගන්නා ලදී) 400 M සිට 1.3 B දක්වා වූ මූලික ව්‍යුහයකින් සහ විසරණ ක්‍රියාකාරී ශීර්ෂයකින් VLA එකක් ගොඩනඟයි. SmolVLA (arXiv 2506.01844, 2025 ජූනි 2 දින ඉදිරිපත් කරන ලදී) විවෘත බර, විවෘත දත්ත සහ එක් පාරිභෝගික කාඩ්පතක ක්‍රියාත්මක වන ස්ක්‍රිප්ට් එකක් සමඟ පරාමිති මිලියන 450ක් නිකුත් කරයි. මෙන්න දෙකම මැන බැලූ දේ සහ බිලියන 1ට අඩු තර්කය වලංගු නොවන තැන.

ඔබ දැනගත යුතු දේ

  • TinyVLA ප්‍රමාණ තුනකින් නිකුත් කරයි: පුහුණු කළ හැකි 101 M සමඟ මුළු 422 M, 138 M සමඟ 740 M, 143 M සමඟ 1.3 B. පළමු දෙක පමණක් 1 B ට අඩුය.
  • එහි Table IV, එක් A6000 එකක් මත TinyVLA-1B සඳහා ක්‍රියාකාරී අනාවැකි සඳහා මිලි තත්පර 14ක් මනිනු ලබයි, OpenVLA-7B සඳහා මිලි තත්පර 292ක් සහ කුඩා කරන ලද OpenVLA-1B සඳහා මිලි තත්පර 140ක් සමඟ සසඳන විට.
  • වේගය රඳා පවතින්නේ ශීර්ෂය මත මිස මූලික ව්‍යුහය මත නොවේ: TinyVLA-H හි විසරණ ශීර්ෂය ACT ශීර්ෂයක් සමඟ මාරු කළ විට, සැබෑ රොබෝ කාර්යයන් පහේ සාමාන්‍යය 94.0 සිට තනි ඉලක්කම් දක්වා පහත වැටේ. MLP ශීර්ෂයක් සෑම තැනකම 0ක් ලබා ගනී.
  • SmolVLA යනු 450 M වන අතර, එයින් දළ වශයෙන් 100 M ක්‍රියාකාරී විශේෂඥයා වේ, එය ප්‍රජා LeRobot දත්ත කට්ටල 481ක් සහ රාමු මිලියන 10.6ක් මත පූර්ව පුහුණු කර ඇත. එය LIBERO මත 87.3ක් වාර්තා කරයි, රොබෝ විද්‍යාව සඳහා පූර්ව පුහුණු කරන ලද 3.3 B Pi0 සඳහා 86.0ක් සමඟ සසඳන විට, සහ සැබෑ SO-100 කාර්යයන් තුනක් මත 78.3ක් වාර්තා කරයි, 3.5 B Pi0 සඳහා 61.7ක් සමඟ සසඳන විට.
  • එම පූර්ව පුහුණුවකින් තොරව තනි කාර්යයක් සඳහා පුහුණු කළ විට, SmolVLA එම කාර්යයන් මත 40.0 දක්වා පහත වැටේ, එය ACT හි 48.3 ට වඩා අඩුය. කුඩා වීම ස්වයංක්‍රීයව පහසු නොවේ.
  • TinyVLA හට LeRobot ඒකාබද්ධ කිරීමක් නොමැති අතර CUDA 11.7 රෝද තොගයක් භාවිතා කරයි. SmolVLA lerobot හි ඇති අතර මෙහි 24 GB ස්ථරයේ එක් ධාවනයකට දළ වශයෙන් 1 සිට 3 USD දක්වා වැය වේ.

ඇත්ත වශයෙන්ම කුඩා VLA එකක් ලෙස සැලකෙන්නේ කුමක්ද

මොඩලයක කාඩ්පතක ඇති පරාමිති ගණන තනි අංකයක් නොවේ. එය මුළු බර, අනුමාන කිරීමේදී පටවන ලද බර, හෝ අතරතුර අනුක්‍රමණ ලබා ගන්නා බර අදහස් කළ හැක . TinyVLA දෙකම වාර්තා කරන අතර, පරතරය විශාලය: TinyVLA-H මුළු 1.3 B වන නමුත් 143 M පුහුණු කළ හැකි වන්නේ, දෘශ්‍ය කුළුණ සහ භාෂා මොඩලයෙන් වැඩි ප්‍රමාණයක් ස්ථාවරව පවතින අතර LoRA ඇඩැප්ටර සහ ක්‍රියාකාරී ශීර්ෂය චලනය වන බැවිනි. පත්‍රිකාව පුහුණු කළ හැකි කොටස සියයට 5ක් පමණ ලෙස දක්වයි.

මොඩලයපරාමිතිපසුබිමක්‍රියාකාරී ශීර්ෂයමූලාශ්‍රය
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, no language modelDirect chunk regressionAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersAutoregressive action tokensarXiv 2406.09246

පේළි දෙකක් ගැන තර්ක කිරීමට වටී. දළ වශයෙන් 80 M වන අතර මෙහි ඇති අනෙක් සියල්ලට වඩා කුඩා නමුත් භාෂා මොඩලයක් නොමැති බැවින් එය VLA එකක් නොවේ: එය එක් කාර්යයක් ඉගෙන ගන්නා අතර තවත් කාර්යයක් කිරීමට එයට පැවසිය නොහැක. 27 M හි T5-Base පෙළ කේතකයක් හරහා සකස් කර ඇත, LLM පසුබිමක් හරහා නොවේ. හොඳ මූලික රේඛා, කිසිවක් ලේබලය ඇඟවුම් කරන උපදෙස් අනුගමනය කිරීම ලබා නොදේ.

1 B රේඛාව අත්තනෝමතිකයි

ප්‍රධාන ප්‍රතිඵල දරන TinyVLA-H ප්‍රභේදය 1.3 B වන අතර රේඛාවට ඉහළින් පිහිටා ඇත. වඩා හොඳ ප්‍රශ්නය වන්නේ පුහුණු කිරීමේදී මොඩලයක් 24 GB තුළට ගැලපේද සහ අනුමාන කිරීමේදී ඔබේ පාලන අනුපාතයට ළඟා වේද යන්නයි. ඔබට මෙහි පුහුණු කළ හැකි ප්‍රතිපත්ති පහ ප්‍රතිපත්ති පිටුවේ ඇත; ඔබට එහි සංඛ්‍යා අන් සියල්ලන්ගේම සංඛ්‍යා සමඟ අවශ්‍ය නම් TinyVLA සතුව පිටියට ඇතුළුවීමක් ඇත.

TinyVLA: වේගය එන්නේ head එකෙන් මිසක් backbone එකෙන් නෙවෙයි

පැහැදිලිව පෙනෙන්නේ ඔවුන් භාෂා ආකෘතිය කුඩා කළ නිසා එය වේගවත් වූ බවයි. නමුත් පත්‍රිකාවේ ablation අධ්‍යයනයෙන් වෙනත් දෙයක් කියැවේ. OpenVLA හි 7 B backbone එක දළ වශයෙන් 1 B එකක් සමඟ මාරු කිරීමෙන් එක් ක්‍රියාවකට අනාවැකි කීම 292 ms සිට 140 ms දක්වා අඩු විය, එය 2x ක වාසියකි. TinyVLA-H, සැසඳිය හැකි පරාමිති ගණනකින් යුක්තව, එකම කාඩ්පතේ 14 ms කින් ක්‍රියාත්මක වේ. අනෙක් 10x වාසිය ලැබෙන්නේ action head එකෙනි.

ආකෘතියඑක් ක්‍රියාවකට අනාවැකි කීමමනිනු ලැබුවේ
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA ක්‍රියා නිකුත් කරන්නේ භාෂා ආකෘති head එක හරහා විවික්ත ටෝකන ලෙස, එක් ක්‍රියා මානයකට එකක් බැගින්, ස්වයංක්‍රීයවය. TinyVLA මඟින් diffusion decoder එකක් අමුණා ඇති අතර එය සම්පූර්ණ chunk එක එකවර නිපදවයි. Table V හි TinyVLA-H හි architecture එක අඩංගු වන අතර, එකම සැබෑ-රොබෝ කාර්යයන් පහක් මත head එක පමණක් මාරු කරයි. එය, flow matching policies මගින් සාදන බවට වන තර්කය සඳහා වන පැහැදිලිම සාක්ෂිය වන අතර, Pi0 token decoding වලින් ඉවත් වූ හේතුවයි.

TinyVLA-H මත හිසටෙනිස් තැබීමමග් එක පෙරලීමකියුබ් ගොඩගැසීමලාච්චුව වැසීමපෙට්ටිය විවෘත කිරීම
විසරණය (droid_diffusion)90.098.398.396.786.7
ක්‍රියා ඛණ්ඩනය කිරීමේ ට්‍රාන්ස්ෆෝමරය13.38.38.313.323.3
බහු-ස්ථර පර්සෙප්ට්‍රෝනය00000
TinyVLA අගයන් ආවරණය කරන්නේ කුමක්ද?

292 / 140 / 14 ms අගයන් Table IV හි දක්වා ඇති අතර, ඒවා සියල්ලම එක් A6000 මත ලබාගෙන ඇත. ඒවා එක් ක්‍රියා අනාවැකියකට අදාළ වන අතර කැමරා ග්‍රහණය, පූර්ව සැකසීම සහ සර්වෝ වෙත අනුක්‍රමික ලිවීම් බැහැර කරයි. ප්‍රකාශිත ප්‍රමාදය පහළ සීමාවක් ලෙස සලකන්න, කිසිවිටෙක පාලන අනුපාතය ලෙස නොසලකන්න. අපගේම සංඛ්‍යා ද එම සීමාව දරයි: අනුමාන ප්‍රමාදය බලන්න.

TinyVLA ලබාගත් ලකුණු

බෙන්ච්මාර්ක්ප්‍රොටෝකෝලයTinyVLA-Hමූලික රේඛා
MetaWorld, කාර්යයන් 50, සිම්බහු-කාර්ය, නිරූපණ 50, බීජ 3දුෂ්කරතාවය අනුව 77.6 / 21.5 / 11.4 / 15.8, සාමාන්‍යය 31.6Diffusion Policy average 10.5
සැබෑ ෆ්‍රැන්කා පැන්ඩා, කාර්යයන් 5එක් කාර්යයකට ගමන් පථ 100, අත්හදා බැලීම් 2094.0 සාමාන්‍යයOpenVLA 68.3, Diffusion Policy 35.3
ද්විමාන UR5, කාර්යයන් 3බහු-කාර්ය, එක් කාර්යයකට අත්හදා බැලීම් 1076.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

ද්වි-අත් පේළියට කඩදාසියේම කම්මැලි පැහැදිලි කිරීමක් ඇත: OpenVLA පුහුණු කර ඇත්තේ Open X-Embodiment මත වන අතර, එය සම්පූර්ණයෙන්ම තනි-අත් දත්ත වලින් සමන්විත වේ, එබැවින් ද්වි-අත් ක්‍රියා අවකාශය බෙදාහැරීමෙන් පිටත වන අතර එයට ශුන්‍ය ලකුණු ලැබේ. ඩිෆියුෂන් පොලිසි බේස්ලයින් එම කාර්යයන් තුනෙන් දෙකකදී TinyVLA-H පරදවයි. පසුබිම Open X-Embodiment ලිපිය.

AY-Robots අරීනා ලීඩර්බෝඩ්, VLA මාදිලි 85 ක වර්ග කළ හැකි වගුවක්, මිණුම් සලකුණු ප්‍රතිඵල 332 ක් සමඟින්, එක් එක් අගය එය පැමිණි පත්‍රිකාවට හෝ මාදිලි කාඩ්පතට සම්බන්ධ කර ඇත
හරස්-මාදිලි මිණුම් සලකුණු සංඛ්‍යා සැසඳිය හැක්කේ ඒවා එක් එක් පැමිණියේ කොහෙන්දැයි ඔබට දැකගත හැකි විට පමණි.

TinyVLA රිපෝව, 2026 අගෝස්තු වන විට

පත්‍රිකාව හොඳයි. කේතය පර්යේෂණ නිකුතුවකි. රිපෝසිටරිය github.com/liyaxuanliyaxuan/TinyVLA; එහි README කේත නිකුතුව 2025 පෙබරවාරි 17 දිනටත්, අවසාන commit එක 2025 මාර්තු 11 දිනටත් දක්වයි. පත්‍රිකාවක් ප්‍රතිනිෂ්පාදනය කිරීමට හොඳයි, නමුත් නඩත්තු කරන ලද පුස්තකාලයක් අවශ්‍ය නම් ගැටලුවකි.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README වෙතින් ස්ථාපන අනුක්‍රමය, 2026-08-23 දින ගබඩාවට එරෙහිව පරීක්ෂා කරන ලදී.
යැපීම් අල්පෙනෙති යනු දවසක් කන උගුලයි

requirements.txt මඟින් torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, සහ CUDA stack 11.x wheels වෙතට අමුණයි: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README මඟින් Python 3.10 ඉල්ලා සිටින අතර; lerobot 0.6.1 සඳහා 3.12 හෝ ඊට නවතම සංස්කරණයක් අවශ්‍ය වේ, එබැවින් මේ දෙකට එකම පරිසරයක් බෙදා ගත නොහැක. මුලින්ම ඔබේ GPU පරම්පරාව සඳහා torch 2.0.1 build එකක් පවතීදැයි තහවුරු කර ගන්න. ඒ වෙනුවට VRAM මත ධාවනයක් අසාර්ථක වුවහොත්, මතකයෙන් පිටත පිරික්සුම් ලැයිස්තුව අනුමාන කිරීමට වඩා වේගවත්ය.

TinyVLA කියවන්නේද නැත LeRobot දත්ත කට්ටල. එහි ආකෘතිය ACT-විලාසිතාවේ HDF5 වේ: ක්‍රියාව, language_raw, සහ බහු-දර්ශන රූප, joint_positions, qpos සහ qvel සහිත නිරීක්ෂණ සමූහයක්. ගබඩාව RLDS ආදානය සඳහා data_utils/rlds_to_h5py.py සමඟ එන අතර, සෑම කාර්යයක්ම aloha_scripts/constants.py හි dataset_dir, episode_len සහ camera_names සමඟ අතින් ලියාපදිංචි කර ඇත. ඔබේ කථාංග lerobot හෝ ඩෙස්ක්ටොප් සේවාදායකයා වෙතින් පැමිණියේ නම්, පරිවර්තනය ඔබේ වගකීමයි.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh වෙතින් කෙටි කරන ලදී. ඉහත සෑම ධජයක්ම සහ අගයක්ම නැව්ගත කළ ගොනුවේ ඇත.
  • --num_gpus=8 අට-කාඩ් නෝඩයක් උපකල්පනය කරයි. එය 1ට සකසා, බැච් ප්‍රමාණය 32ට වඩා හොඳින් අඩු කරන්න. තනි-GPU ප්‍රභේදයක් අප්ස්ට්‍රීම් නැව්ගත නොකරන බැවින්, විධානය 4090 මත එලෙසම ධාවනය කළ නොහැක.
  • --deepspeed scripts/zero2.json ඉහළ මට්ටමේ scripts ඩිරෙක්ටරියේ නොමැති ගොනුවක් වෙත යොමු කරයි. DeepSpeed වින්‍යාසයන් llava-pythia/scripts/zero2.json හි නැව්ගත කෙරේ. ඔබගේ පළමු ධාවනයට පෙර මාර්ගය නිවැරදි කරන්න.
  • README මඟින් ප්‍රතිදාන ඩිරෙක්ටරි නාමයට llava_pythia අඩංගු විය යුතු බවත්, LoRA සක්‍රීය නම් lora ද අඩංගු විය යුතු බවත් ඉල්ලා සිටී.
  • බැක්බෝන් යනු වෙනම බාගත කිරීමකි: lesjie/Llava-Pythia-400M, -700M හෝ -1.3B. ඔබ lerobot/smolvla_base වෙත යොමු කරන ආකාරයට ප්‍රතිපත්තියක් යොමු කරන තනි මූලික චෙක්පොයින්ට් එකක් නොමැත.

SmolVLA: අද දහවල් ඔබට ධාවනය කළ හැකි 1 B ට අඩු මොඩලය

SmolVLA නඩත්තු කරන ලද පුස්තකාලයක් තුළ එකම තර්කය ඉදිරිපත් කරයි. එය SmolVLM2-500M-Video-Instruct බැක්බෝන් එකක් මත 450 M පරාමිති වන අතර, කාර්යක්ෂමතාව ලැබෙන්නේ කුඩා වීම පිළිබඳ ප්‍රකාශයකින් නොව, configuration_smolvla.py වෙතින් ඔබට කියවිය හැකි සැකසුම් වලිනි.

configuration_smolvla.py හි සැකසුමපෙරනිමිඑයින් ලැබෙන දේ
num_vlm_layers16පළමු භාෂා ආකෘති ස්ථර 16 පමණක් ධාවනය වේ
expert_width_multiplier0.75ක්‍රියා විශේෂඥ සැඟවුණු ප්‍රමාණය VLM හි 75% කි
self_attn_every_n_layers2ස්වයං-අවධානය හරස්-අවධානය සමඟ අන්තර් සම්බන්ධිතයි
chunk_size / n_action_steps50 / 50එක් වාරයකින් ක්‍රියා 50ක් නිකුත් කරන අතර එම 50ම ක්‍රියාත්මක වේ
num_steps10ප්‍රවාහ ගැලපෙන ඩෙනොයිසින් පියවර 10 කට ස්ථාවර කර ඇත
tokenizer_max_length48උපදෙස් ටෝකන 48කට කපා හරිනු ලැබේ
freeze_vision_encoder / train_expert_onlyTrue / Trueසියුම්-සුසර කිරීමෙන් විශේෂඥයා චලනය වන අතර, දෘශ්‍ය කුළුණ නොවේ
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000පත්‍රිකාවේ වට්ටෝරුව නොවේ: එහි පූර්ව පුහුණුව 200000 පියවර පුරා 100-පියවර උණුසුම් කිරීමක් භාවිතා කළේය

පූර්ව පුහුණුව සඳහා 481 ප්‍රජා LeRobot දත්ත කට්ටල, 22.9 K කථාංග සහ 10.6 M රාමු 4 GPU මත, 256 ගෝලීය කණ්ඩායමක පියවර 200000ක් භාවිතා කරන ලදී; පත්‍රිකාවට අනුව සමස්ත ව්‍යාපෘතිය සඳහා GPU පැය 30 K පමණ වැය වී ඇත. අවධානය යොමු කළ යුතු එක් අංකයක්: Hugging Face දියත් කිරීමේ බ්ලොගය 487 සකස් කළ දත්ත කට්ටල ගැන සඳහන් කරන අතර පත්‍රිකාවේ වගුවේ 481ක් සඳහන් වේ. අපි පත්‍රිකාවේ අගය භාවිතා කරන අතර මෙම නොගැලපීම සටහන් කරමු.

AY-Robots හි SmolVLA ආකෘති පිටුව පරාමිති ගණන, 24 GB GPU ස්ථරය, එක් ක්‍රියා පියවරකට අනුමාන ප්‍රමාදය සහ අවම කථාංග ගණන පෙන්වයි.
වේදිකාවේ SmolVLA පිටුව: 450 M පරාමිති, එක් ක්‍රියා පියවරකට 245 ms, RTX 4090 ස්ථරය, අවම කථාංග 30.
සංසන්දනාත්මක මිනුම්SmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO සාමාන්‍යය, බහු-කාර්ය87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World සාමාන්‍යය, බහු-කාර්ය57.368.2447.9 (3.5 B, robotics-pretrained)-
සැබෑ SO-100, කාර්යයන් 3, බහු-කාර්ය පුහුණුව78.3-61.7 (3.5 B)-
සැබෑ SO-100, කාර්යයන් 3, තනි-කාර්ය, රොබෝ විද්‍යා පූර්ව පුහුණුවක් නැත40.0--48.3
SO-101 ලෙගෝ තෝරා තැබීම, තනි-කාර්ය, බෙදාහැරීම තුළ90--70
SO-101 ලෙගෝ තෝරා තැබීම, තනි-කාර්ය, බෙදාහැරීමෙන් පිටත50--40
සම්පූර්ණ වගුව කියවන්න, සිරස්තල පේළිය පමණක් නොවේ

LIBERO යනු අනුකරණයකි, එහි දක්ෂ සියල්ල දැන් අසූ ගණන්වල ලකුණු ලබා ගනී. සැබෑ SO-100 පේළිය, එහිදී 450 M ආකෘතියක් 3.5 B ආකෘතියක් ලකුණු 16.6 කින් පරදවයි, එය සිත්ගන්නා සුළුය; ඊට යටින් ඇති පේළිය ප්‍රතිවිරුද්ධයයි. ප්‍රජා පූර්ව පුහුණුව සහ බහු-කාර්ය පුහුණුව ඉවත් කළ විට, එම ආකෘතිය ACT යටතේ 40.0 දක්වා පහත වැටේ. ආරක්ෂා කළ හැකි ප්‍රකාශය නම් කුඩා ආකෘතියක් ස්වයංක්‍රීයව නරක නොවන බව මිස එය වඩා හොඳ බව නොවේ.

එක් අහඹු සිදුවීමක් උපකාරී වේ: SmolVLA පත්‍රිකාවේ Meta-World වගුව TinyVLA හිම ප්‍රකාශිත සංඛ්‍යා මූලික රේඛාවක් ලෙස දක්වයි, එබැවින් එක් වරක් ආකෘති දෙකම එක් වගුවක, SmolVLA-0.45B 57.3 ට සහ TinyVLA-H 31.6 ට ඇත. එය SmolVLA පුහුණුව Pi0 ට වඩා 6 ගුණයකින් අඩු මතකයක් මත 40% ක් පමණ වේගවත් බව ද වාර්තා කරයි. මේ සියල්ල SmolVLA කතුවරුන්ගෙන් ලැබී ඇත; එම අරීනා ඇතුළත් කිරීම එක් එක් අගය එහි මූලාශ්‍රයට සම්බන්ධ කරයි.

SmolVLA එහි කාලය ගත කරන ආකාරය

AY-Robots SmolVLA ක්‍රියා පියවරකට 245 ms ලෙසත් ACT 20 ms ලෙසත් ප්‍රතිපත්ති නාමාවලිය හි ලැයිස්තුගත කරයි. TinyVLA ක්‍රියා අනාවැකියකට 14 ms වාර්තා කරයි. එම සංඛ්‍යා සැසඳිය නොහැකි අතර, ඒවා එසේ යැයි සලකා කටයුතු කිරීම මෙම මාතෘකාවේ වඩාත් පොදු වැරැද්දයි: සමහර විට එක් ඉදිරි ගමන් මාර්ගයක්, සමහර විට එම ගමන් මාර්ගය කොටසක් හරහා බෙදා හරිනු ලබන්නේ ක්‍රියා ඛණ්ඩනය එය අමෝර්ටයිස් කරන විටය.

  • SmolVLA එක් ඉදිරි ගමන් මාර්ගයකට ක්‍රියා 50ක් නිකුත් කරන අතර එම 50ම ක්‍රියාත්මක කරයි. පත්‍රිකාව සැබෑ රොබෝවරුන් මත භාවිතා කරන 30 fps වේගයෙන්, එක් අනුමානයක් චලනය වන තත්පර 1.7ක් පමණ ආවරණය කරයි.
  • වත්මන් ඛණ්ඩය තවමත් ක්‍රියාත්මක වන අතරතුර අසමමුහුර්ත අනුමානය මඟින් ඊළඟ ඛණ්ඩය ගණනය කරයි: සමමුහුර්ත 13.75 s ට සාපේක්ෂව සාමාන්‍ය කාර්යය සම්පූර්ණ කිරීම 9.7 s, දළ වශයෙන් 30% ක් වේගවත් වන අතර, ස්ථාවර තත්පර 60 ක කවුළුවක් තුළ 9 ට සාපේක්ෂව pick-and-place චක්‍ර 19 ක්.
  • සාර්ථකත්ව අනුපාත වඩා හොඳ නොවී සැසඳිය හැකි විය, සමමුහුර්ත 78.3 ට සාපේක්ෂව අසමමුහුර්ත 73.3. අසමමුහුර්තභාවය මඟින් නිවැරදිභාවය නොව, ඵලදායිතාව ලබා දෙයි.
  • ඛණ්ඩනය මඟින් ගණනය කිරීමේ ප්‍රමාදය සඟවයි මිස ජාල ප්‍රමාදය නොවේ, තවද එය ක්‍රියා 50කට කැපවී ඇති නිසා ප්‍රතිපත්තිය අඩු ප්‍රතික්‍රියාශීලී කරයි.
දුරස්ථ inference නොමිලේ නොවන අතර, කිසිදු platform එකක් භෞතික විද්‍යාව නිවැරදි නොකරයි

AY-Robots හට ඔබේ policy එකට සේවය කරන cloud GPU pod එකක් ස්වයංක්‍රීයව සැපයිය හැක, එම අතරතුර දේශීය රොබෝ සේවාදායකයා එම endpoint එක සමඟ සන්නිවේදනය කරයි. එම pod එක idle watchdog එකක් දරන නිසා, එය නිහඬව බිල්පත් කිරීම වෙනුවට තමන්වම විනාශ කර ගනී. එය නොකරන දෙය නම් public-internet round trip එක ඉවත් කිරීමයි. මෙහි ඇති policies පහ හරහා පාලන ලූපය කිසිදු ජාලයක් නොමැතිව එක් ක්‍රියාකාරී පියවරකට 20 සිට 485 ms දක්වා වේ, එබැවින් දුරස්ථ inference මන්දගාමී pick-and-place සඳහා සුදුසු වන අතර, වේගවත් ප්‍රතික්‍රියාශීලී චලනයන් සඳහා නොවේ.

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA සහ ACT හි parameter ගණන්, අවශ්‍ය GPU tier, එක් ක්‍රියාකාරී පියවරකට inference latency සහ එක් එක් අවශ්‍ය අවම episodes ගණන පෙන්වන AY-Robots policies සංසන්දනාත්මක වගුව
SmolVLA (~450 M) සහ ACT (~80 M) යනු 24 GB කාඩ්පතකට ගැලපෙන දෙකයි. අනෙක් තුනට A100 හෝ H100 80 GB අවශ්‍ය වේ.

එක් consumer card එකක් මත SmolVLA fine-tuning කිරීම

lerobot 0.6.1 මත, 2026 අගෝස්තු 23 වන විට වත්මන් PyPI නිකුතුව. පහත සියල්ලම Hugging Face lerobot SmolVLA documentation වෙතින්, එදිනම ලබාගත් ඒවාය; මඟ පෙන්වන ලද අනුවාදය වඩාත් පහසුය.

  1. 1
    smolvla අමතර සමඟ lerobot ස්ථාපනය කරන්න

    SmolVLA යැපීම් විකල්ප අමතර කොටසක් වන අතර, මූලික ස්ථාපනයේ කොටසක් නොවේ. එය නොමැතිව ස්ථාපනය කර පසුව ප්‍රතිපත්ති වර්ගය නොදන්නේ මන්දැයි කල්පනා කිරීම සාමාන්‍යයෙන් පැය භාගයක් නාස්ති කිරීමකි.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    ප්‍රමාණවත් කථාංග සහිත දත්ත කට්ටලයක් ලබා ගන්න

    ලේඛනවල කථාංග 50ක් පමණ නිර්දේශ කරන අතර, කථාංග 25ක් සහිත එකම කාර්යය ප්‍රමාණවත් නොවූ බව සඳහන් කරයි. AY-Robots අවම වශයෙන් 30ක් නියම කරයි. ඔබේම දත්ත වාර්තා කරන්න, නැතහොත් දත්ත කට්ටල නාමාවලියෙන් ආරම්භ කරන්න.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    සියුම්-සුසර කිරීම ආරම්භ කරන්න

    lerobot මාර්ගෝපදේශයෙන් ලබාගත් විධානය, වෙනස් නොකර. ලේඛනවලට අනුව A100 එකක පියවර 20000ක් සඳහා ආසන්න වශයෙන් පැය 4ක් ගතවේ. 24 GB කාඩ්පතකදී, වැඩි කාලයක් අපේක්ෂා කර එය මැන බලන්න.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    ගැළපෙන තෙක් කණ්ඩායම් ප්‍රමාණය අඩු කරන්න

    batch_size=64 යනු ලේඛනගත උදාහරණයකි, ඔබේ කාඩ්පත පිළිබඳ පොරොන්දුවක් නොවේ. ලේඛනවල උපදෙස් දෙන්නේ කුඩාවට ආරම්භ කර, පැටවීමේ කාලය කෙටිව පවතින තාක් වැඩි කරන ලෙසයි.

    bash
    lerobot-train --help
  5. 5
    චෙක්පොයින්ට් එක අත මත ක්‍රියාත්මක කරන්න

    එකම පුස්තකාලය, එක් විධානයක්. තත්‍ය කාලීන ඛණ්ඩනය කිරීමේ ධජ ලේඛනවල අදහස් දක්වා ඇති අතර, අඩු බලැති දෘඪාංග සඳහා ඒවා භාවිතා කළ යුතුය.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
චෙක්පොයින්ට් එක භාර දිය යුතු දෙයයි

ඔබ කුමන මාර්ගයක් ගත්තද, ඔබට චෙක්පොයින්ට් එකක් සහ එය නිපදවූ වින්‍යාසය ලැබේ. දත්ත කට්ටල සංශෝධනය, පියවර ගණන සහ බීජය එය අසල තබා ගන්න. lerobot පෙරනිමියෙන් බීජය 1000ට සකසයි; GR00T හි සියුම්-සුසර කිරීමේ ආරම්භක ලක්ෂ්‍යය කිසිදු බීජයක් නිරාවරණය නොකරයි, එබැවින් එම ධාවන බිට්-සඳහා-බිට් ප්‍රතිනිෂ්පාදනය කළ නොහැක. පුහුණු ලේඛනවල යාන්ත්‍ර විද්‍යාව.

කුඩා VLA එකක් අතකට ලබා ගැනීමට ක්‍රම දෙකක්

ඔබ යන්ත්‍රය සහ අසාර්ථක ක්‍රමවල හිමිකරු වේ. SmolVLA සඳහා එය සාධාරණයි: එක් pip අමතර, එක් පුහුණු විධානයක්, එක් rollout විධානයක්. TinyVLA සඳහා එය ශීත කළ පින්, කැඩුණු DeepSpeed ​​මාර්ගයක් සහ ඔබ විසින්ම ලියන දත්ත පරිවර්තනයක් සහිත පර්යේෂණ ප්‍රතිනිෂ්පාදනයකි.

  1. 24 GB කාඩ්පතක් ලබා ගන්න, කථාංග 30 සිට 50 දක්වා වාර්තා කරන්න, කැමරා ප්‍රවාහ රාමු-රාමුවෙන් සත්‍යාපනය කරන්න.
  2. pip install -e ".[smolvla]", lerobot/smolvla_base ට එරෙහිව lerobot-train කරන්න, ඉන්පසු අත සම්බන්ධ කර ඇති යන්ත්‍රයේ චෙක්පොයින්ට් එක සේවය කරන්න.
  3. TinyVLA සඳහා: වෙනම conda env, දත්ත HDF5 වෙත පරිවර්තනය කරන්න, constants.py හි කාර්යය ලියාපදිංචි කරන්න, zero2.json මාර්ගය නිවැරදි කරන්න, train.sh අට GPU වලින් එකකට කපන්න.
වාසි
  • කාඩ්පත ගෙවූ පසු පැයකට බිල්පත් කිරීමක් නැත.
  • අනුමානය සර්වෝ යාන්ත්‍රණ අසල පිහිටා ඇත, වේගවත් පාලන ලූපයක් ලබා ගැනීමට ඇති එකම ක්‍රමය එයයි.
  • ඔබට ප්‍රතිපත්ති කේතය පැච් කළ හැකි අතර, TinyVLA ලබා ගත හැක්කේ මේ ආකාරයට පමණි.
වාසි අවාසි
  • 4090 කාඩ්පතක් සෑම ~3 B ප්‍රතිපත්තියක්ම බැහැර කරයි, එබැවින් GR00T N1.7 හෝ Pi0.5 ට එරෙහිව දේශීය සංසන්දනයක් කළ නොහැක.
  • පරිසර සැකසීම සැබෑ කාර්යයයි. TinyVLA හි පින් පමණක් දවසක් ගත විය හැක.
  • පෝලිමක් නැත, නැවත උත්සාහ කිරීමක් නැත, චෙක්පොයින්ට් ගබඩාවක් නැත. පියවර 14000 දී නැවත ආරම්භ කිරීම යනු නැවත ආරම්භ කිරීමයි.

කුඩා ආකෘතියක් වැරදි තේරීමක් වන විට

සාරාංශවලට වඩා පත්‍රිකා දෙකම මෙහිදී වඩාත් ප්‍රවේශම් සහගතය. TinyVLA හි අසාර්ථක විශ්ලේෂණය නිශ්චිතය: 0.4 B ප්‍රභේදය උපදෙස් වැරදි ලෙස කියවීමෙන් තුන් වතාවක් අසාර්ථක විය, එය කතුවරුන් කුඩා VLM හි සීමිත භාෂා අවබෝධයට ආරෝපණය කරයි, එම මාදිලිය 1.3 B හිදී අතුරුදහන් විය. SmolVLA අනෙක් අන්තයෙන් එකම වක්‍රය පෙන්වයි: එකම ගෘහ නිර්මාණ ශිල්පයේ 2.25 B අනුවාදය LIBERO හි 88.75 ක් සහ Meta-World හි 68.24 ක් ලබා ගනී, 0.45 B ආකෘතිය සඳහා 87.3 සහ 57.3 ට සාපේක්ෂව.

1 B ට අඩු VLA එකක් තෝරා ගැනීම
එය ජය ගන්නා තැන
  • 24 GB කාඩ්පතකට ගැලපේ, එය අත්හදා බැලීමක් ඩොලර් දස ගණනකින් කිහිපයකට අඩු කරයි.
  • අත අසල ධාවනය කිරීමට තරම් වේගවත්, එබැවින් පාලන ලූපයේ ජාල පිම්මක් නොමැත.
  • එක් පුද්ගලයෙකුට වාර්තා කළ හැකි දත්ත මත සියුම් ලෙස සකස් කරයි, දහස් ගණනක් වෙනුවට කථාංග දස ගණනක්.
  • SmolVLA හි බර, දත්ත ලැයිස්තුව සහ කේතය පොදු බැවින්, නරක ප්‍රතිඵලයක් නිදොස් කළ හැකිය.
එය අහිමි වන තැන
  • දුර්වල උපදෙස් අනුගමනය කිරීම: අඩු භාෂා පරාමිති, සමාන යොමු ප්‍රකාශන වෙන් කිරීමට ඇති හැකියාව අඩුය.
  • ඔබ වාර්තා නොකළ සැකසුම් සඳහා අඩු අවකාශීය හා දෘශ්‍ය සාමාන්‍යකරණය.
  • දත්ත කට්ටල දෝෂ වලට වඩා සංවේදී, යැපීමට අඩු පූර්ව පුහුණුවක් සහිතව.
  • බහු-කාර්ය සහ දිගු-කාලීන වැඩ තවමත් SmolVLA හිම 2.25 B ප්‍රභේදය ඇතුළුව විශාල ආකෘති වලට අනුග්‍රහය දක්වයි.

ධාවනය කිරීමට වටිනා සංසන්දනය TinyVLA එදිරිව SmolVLA නොවේ. එය SmolVLA එදිරිව ACT ඔබේම කාර්යය මත, සහ SmolVLA පත්‍රිකාව එයට හේතුව සඳහා තර්කයයි. රොබෝ විද්‍යා පූර්ව පුහුණුවකින් තොරව තනි-කාර්යයක් ලෙස පුහුණු කරන ලද SmolVLA, තනි-කාර්ය ACT 48.3 ක් කළමනාකරණය කළ SO-100 කාර්යයන් තුනක් හරහා සාමාන්‍යයෙන් 40.0 ක් ලබා ගත්තේය. එය 78.3 දක්වා ඔසවා තබන්නේ ප්‍රජා පූර්ව පුහුණුව සහ බහු-කාර්ය පුහුණුව මිස ගෘහ නිර්මාණ ශිල්පය පමණක් නොවේ. SO-101 ලෙගෝ කාර්යය මත, තනි-කාර්ය දෙකම, SmolVLA ජය ගනී: බෙදාහැරීමේදී 70 ට එරෙහිව 90. ඉන්පසු SmolVLA එදිරිව Pi0.5 අයවැය ඉඩ දෙන්නේ නම්.

මෙම ප්‍රමාණයෙන්, දත්ත කට්ටලය ප්‍රතිඵලය තීරණය කරයි

දුර්වල දත්ත ආවරණය කිරීමට පෙර පුහුණු කිරීම අඩු බැවින්, දෝෂ සහිත දත්ත කට්ටලයක් මත පිරිසිදු පාඩු වක්‍රයක් මඟින් දෝෂය විශ්වාසයෙන් ප්‍රතිනිෂ්පාදනය කරන ප්‍රතිපත්තියක් ඔබට ලබා දේ. lerobot ලේඛන ව්‍යුහය ගැන පැහැදිලිව දක්වයි: ඝනක ස්ථාන 5ක් හරහා කථාංග 50ක්, එක් ස්ථානයකට 10ක්, සාර්ථක විය; 25ක් සාර්ථක වූයේ නැත. පාඩුව හොඳින් පෙනේ නම් සහ අත කිසිදු ප්‍රයෝජනවත් දෙයක් නොකරන්නේ නම්, මෙතැනින් ආරම්භ කරන්න පාඩුව අඩු වේ, ප්‍රතිපත්තිය කිසිවක් නොකරයි, ප්‍රතිපත්තිය ක්‍රියා කරන්නේ එක් සැකසුමක පමණි හෝ ඇත්ත වශයෙන්ම භාවිතා කළ හැකි VLA පුහුණු දත්ත එකතු කිරීම.

ප්‍රතිපත්ති පහක්, එක් සංසන්දනාත්මක වගුවක්

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA and ACT සැබෑ පරාමිති ගණන්, එක් ක්‍රියා පියවරකට අනුමාන ප්‍රමාදය, එක් එක් අවශ්‍ය GPU ස්ථරය සහ ප්‍රයෝජනවත් යමක් කිරීමට පෙර අවම කථාංග ගණන සමඟ.

ප්‍රතිපත්ති සංසන්දනය කරන්න

ඔබට ක්‍රියා කළ හැකි තීරණ වගුවක්

ඔබේ තත්ත්වයආරම්භ කරන්නඇයි
එක් කාර්යයක්, හොඳ නිරූපණ, භාෂාවක් නැතACT~80 M, 20 ms, 24 GB කාඩ්පත, බාගත කිරීමට මූලික ආකෘතියක් නැත
අදාළ කාර්යයන් කිහිපයක්, එක් එක් සඳහා එක් උපදෙසක්SmolVLA450 M, in lerobot, අවම කථාංග 30ක්, එක් ධාවනයකට 1 සිට 3 USD
විශේෂයෙන් TinyVLA ප්‍රතිඵලය ප්‍රතිනිෂ්පාදනය කිරීමTinyVLA-B or TinyVLA-Hගබඩාව එකම මාර්ගයයි: හුදකලා පරිසරය, පරිවර්තනය කළ දත්ත
බහු-කාර්ය, විවිධ උපදෙස්, A100 අයවැයGR00T N1.7 or Pi0.5~3 B, එක් පියවරකට 152 ms සහ 485 ms, එක් ධාවනයකට 4 සිට 12 USD
තවම රොබෝවරයෙක් නැතසැබෑ අතක් ධාවනය කරන්නපෝලිම් මත පදනම් වූ සජීවී අතට ලියාපදිංචියක් හෝ දෘඪාංග අවශ්‍ය නොවේ

අවසාන පේළිය සඳහා, සජීවී අත ගිණුමක් නොමැතිව බ්‍රවුසරයෙන් ධාවනය කළ හැකි භෞතික SO-100 එකක් විකාශනය කරයි, තවද ආරම්භ කිරීමට ක්‍රම තුන ඉතිරිය ආවරණය කරයි. SO-100 මෙහි යොමු අත වන අතර, කොටස් සඳහා දළ වශයෙන් යුරෝ 110 සිට 150 දක්වා වැය වන අතර, සම්පූර්ණ සැකසුම් මාර්ගෝපදේශයක් ඇත.

1 B ට අඩු මාදිලිවලින් පසුව එන්නේ කුමක්ද?

පරාමිති ගණන අඩු කිරීම VLA එකක් ලාභදායී කිරීමට එක් ක්‍රමයක් වන අතර එය පැහැදිලිවම ජයග්‍රාහී ක්‍රමය නොවේ. OpenVLA-OFT (arXiv 2502.19645) 7 B බැක්බෝන් එක රඳවා තබා ගන්නා අතර ක්‍රියා විකේතනය කරන ආකාරය පමණක් වෙනස් කරයි, ක්‍රියා ජනන ධාරිතාව 26 ගුණයකින් වැඩිවීමක් සහ LIBERO 76.5 සිට 97.1 දක්වා ඉහළ යාමක් වාර්තා කරයි. BitVLA (arXiv 2506.07530) 1-bit BitNet b1.58 2B4T බැක්බෝන් එකක සෑම බරක්ම ත්‍රිත්ව බවට පත් කරයි, 11.0x අඩු මතකයක් සහ 4.4x අඩු අන්ත-සිට-අන්ත ප්‍රමාදයක් වාර්තා කරන අතර සම්පූර්ණ නිරවද්‍යතාවයෙන් යුත් OpenVLA-OFT සමඟ ගැලපේ. X-VLA-0.9B (arXiv 2510.10274) ප්‍රවාහ ගැලපීම සමඟ 1 B රේඛාවේ පිහිටා ඇත.

පොදු කරුණ: ප්‍රමාදය පවතින්නේ භාෂා ආකෘතියේ නොව, ක්‍රියා විකේතකයේ ය. ප්‍රතිපත්තියක් ක්‍රියා නිකුත් කරන්නේ කෙසේදැයි විමසීමට පෙර, එහි පරාමිති කීයක් තිබේදැයි විමසන්න. අරීනා සතුව මාදිලි 85ක් සහ ප්‍රතිඵල 332ක් ඇත, ඒ සෑම එකක්ම එහි මූලාශ්‍රයට සම්බන්ධ කර ඇත; පුළුල් දළ විශ්ලේෂණයක් අපගේ VLA හැඳින්වීම තුළ ඇත.

මට RTX 4090 එකක SmolVLA fine-tune කළ හැකිද?

ඔව්. SmolVLA යනු 450 M පරාමිති වන අතර AY-Robots එය RTX 4090 / 24 GB ස්ථරයේ ධාවනය කරයි. lerobot උදාහරණය --batch_size=64 භාවිතා කරයි, එය ඔබේ කාඩ්පත සඳහා සහතිකයක් නොව උදාහරණයකි; ලේඛනවල උපදෙස් දෙන්නේ කුඩාවෙන් ආරම්භ කර loading times කෙටිව පවතින තාක් වැඩි කරන ලෙසයි. A100 එකක 20000 steps සඳහා ලේඛනවල සඳහන් වන ආසන්න වශයෙන් පැය 4ට වඩා වැඩි කාලයක් අපේක්ෂා කරන්න.

TinyVLA lerobot හි හෝ AY-Robots හි තිබේද?

දෙකටම නැත. TinyVLA පවතින්නේ එහි පර්යේෂණ ගබඩාවේ පමණි, අවසාන commit එක 2025 මාර්තු 11 වන අතර, එහි ආකෘතිය LeRobot වෙනුවට ACT-style HDF5 වේ. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA සහ ACT පුහුණු කරයි. ඔබට TinyVLA අවශ්‍ය නම් ඔබ එය ඔබම ගොඩනගා ගත යුතු අතර, scripts/train.sh හි ඇති DeepSpeed config path එක මුලින්ම නිවැරදි කිරීමට සිදුවනු ඇත.

450 M model එකක් ඇත්තටම 3 B model එකක් සමඟ තරඟකාරීද?

කතුවරුන්ගේම benchmarks අනුව, ඔව්: LIBERO මත 87.3 එදිරිව 86.0, robotics-pretrained Pi0 3.3 B සමඟ සසඳන විට, සහ සැබෑ SO-100 tasks තුනක් මත 78.3 එදිරිව 61.7, එහිදී එම පත්‍රිකාව Pi0 3.5 B ලෙස ලේබල් කරයි. සීමාව එම පත්‍රිකාවේම ඇත: robotics pretraining නොමැතිව single-task, SmolVLA 40.0 දක්වා පහත වැටේ, එය ACT හි 48.3 ට වඩා අඩුය.

කුඩා VLA එකක් යමක් කිරීමට පෙර මට කොපමණ episodes අවශ්‍යද?

AY-Robots SmolVLA අවම වශයෙන් episodes 30ක් ලෙසත් ACT අවම වශයෙන් 50ක් ලෙසත් සකසයි. lerobot docs 50ක් පමණ නිර්දේශ කරන අතර එම කාර්යය සඳහා 25ක් ප්‍රමාණවත් නොවූ බව වාර්තා කරයි. ගණන මෙන්ම ව්‍යුහයද වැදගත් වේ: පත්‍රිකාවේ කට්ටලය cube positions 5ක් භාවිතා කළ අතර එක් එක් සඳහා episodes 10ක් විය.

ප්‍රකාශිත latency අංක මෙතරම් වෙනස් වන්නේ ඇයි?

ඒවා විවිධ දේ මනිනු ලබයි. TinyVLA A6000 එකක action prediction එකකට 14 ms වාර්තා කරයි; AY-Robots SmolVLA 245 ms ලෙසත් ACT action step එකකට 20 ms ලෙසත් ලැයිස්තුගත කරයි. සමහර සංඛ්‍යා එක් forward pass එකක් ආවරණය කරයි, සමහරක් pass එකක් 50-action chunk එකක් හරහා බෙදාහරින අතර, කැමරා ග්‍රහණය හෝ servos වෙත ලිවීම පාහේ කිසිවක් ඇතුළත් නොවේ.

cloud inference GPU ගැටලුව විසඳනවාද?

අර්ධ වශයෙන්. AY-Robots policy එක සපයන pod එකක් ස්වයංක්‍රීයව සපයයි, දේශීය client එක එම endpoint එක සමඟ කතා කරන අතර, idle watchdog එකක් සමඟින් එය නිහඬව බිල්පත් කිරීම වෙනුවට තමන්වම විනාශ කර ගනී. එය public-internet round trip එක ඉවත් කළ නොහැකි අතර, control loop එක දැනටමත් action step එකකට 20 සිට 485 ms දක්වා වේ. මන්දගාමී pick-and-place සඳහා හොඳයි, වේගවත් reactive motion සඳහා නොවේ.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started