AY-Robots саясаттарын салыстыру кестесі параметрлер санымен, GPU деңгейлерімен және GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA және ACT үшін инференс кідірісімен
SmolVLATinyVLAШағын VLAТұтынушылық GPULeRobot

Шағын VLA модельдері: TinyVLA, SmolVLA және 1 миллиардтан төмен параметрлер жағдайы

AY-Robots ResearchAugust 23, 202619 мин оқу

TinyVLA және SmolVLA жұмыс істейтін VLA-ны 1 миллиард параметрден төмен орналастырады. Екі мақаладан алынған нақты сандар, LeRobot әдепкі параметрлері, өлшенген кідіріс және 24 ГБ картада іске қосу қанша тұратыны.

Жазылған дерлік әрбір көру-тіл-әрекет моделі деректер орталығының картасын қажет етеді. OpenVLA 7 миллиард параметрден тұрады. GR00T N1.7 және Pi0.5 шамамен 3 миллиард параметрден тұрады және оларды дәл баптау үшін A100 80 ГБ қажет. Егер үстеліңіздегі карта 4090 болса, онда мұндай модельдер класы қолжетімсіз болады.

Екі мақала мұның қажет емес екенін дәлелдейді. TinyVLA (arXiv 2409.12514, 2025 жылдың ақпанында IEEE Robotics and Automation Letters журналы қабылдаған) 400 миллионнан 1.3 миллиардқа дейінгі негізгі құрылымнан және диффузиялық әрекет басынан VLA құрады. SmolVLA (arXiv 2506.01844, 2025 жылдың 2 маусымында ұсынылған) ашық салмақтармен, ашық деректермен және бір тұтынушы картасында жұмыс істейтін скриптпен 450 миллион параметрді жеткізеді. Міне, екеуі де не өлшегені және 1 миллиардтан төмен аргументтің қай жерде жарамсыз болатыны.

Нені білу керек

  • TinyVLA үш өлшемде жеткізіледі: жалпы 422 миллион, оның ішінде 101 миллион оқытылатын; 740 миллион, оның ішінде 138 миллион; 1.3 миллиард, оның ішінде 143 миллион. Тек алғашқы екеуі 1 миллиардтан төмен.
  • Оның IV кестесінде TinyVLA-1B үшін бір A6000-да әрекетті болжауға 14 мс, OpenVLA-7B үшін 292 мс және кішірейтілген OpenVLA-1B үшін 140 мс өлшенген.
  • Бұл жылдамдықты негізгі құрылым емес, бас бөлігі қамтамасыз етеді: TinyVLA-H диффузиялық басын ACT басына ауыстырсаңыз, бес нақты робот тапсырмасының орташа көрсеткіші 94.0-ден бір таңбалы сандарға дейін төмендейді. MLP басы барлық жерде 0 ұпай жинайды.
  • SmolVLA 450 миллион параметрден тұрады, оның шамамен 100 миллионы әрекет сарапшысы болып табылады, ол 481 қауымдастық LeRobot деректер жиынтығында және 10.6 миллион кадрда алдын ала оқытылған. Ол LIBERO-да 87.3 көрсеткішін, робототехникада алдын ала оқытылған 3.3 миллиардтық Pi0 үшін 86.0 көрсеткішін, және үш нақты SO-100 тапсырмасында 78.3 көрсеткішін, 3.5 миллиардтық Pi0 үшін 61.7 көрсеткішін хабарлайды.
  • Алдын ала оқытусыз бір тапсырмаға оқытылғанда, SmolVLA бұл тапсырмаларда 40.0-ге дейін төмендейді, бұл ACT-тің 48.3 көрсеткішінен төмен. Кішкентай болу автоматты түрде оңай дегенді білдірмейді.
  • TinyVLA-да LeRobot интеграциясы жоқ және CUDA 11.7 wheel стегін қажет етеді. SmolVLA lerobot-та қолжетімді және мұндағы 24 ГБ деңгейінде әр іске қосу үшін шамамен 1-ден 3 АҚШ долларына дейін тұрады.

Шын мәнінде кішкентай VLA не болып саналады

Модель картасындағы параметрлер саны бір сан емес. Ол жалпы салмақтарды, инференция кезінде жүктелген салмақтарды немесе градиенттерді қабылдайтын салмақтарды білдіруі мүмкін . TinyVLA екеуін де хабарлайды, және айырмашылық үлкен: TinyVLA-H жалпы 1.3 B, бірақ 143 M оқытылатын, себебі визуалды мұнара мен тіл моделінің көп бөлігі қатып қалады, ал LoRA адаптерлері мен әрекет басы қозғалады. Мақалада оқытылатын үлес шамамен 5 пайызды құрайды.

МодельПараметрлерНегізгі архитектураӘрекет басыДереккөз
TinyVLA-Sжалпы 422 M, 101 M оқытылатынLlava-Pythia ~400 MДиффузия (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-Bжалпы 740 M, 138 M оқытылатынLlava-Pythia ~700 MДиффузияarXiv 2409.12514
TinyVLA-Hжалпы 1.3 B, 143 M оқытылатынLlava-Pythia ~1.3 BДиффузияarXiv 2409.12514
SmolVLA450 M, ~100 M әрекет сарапшысыSmolVLM2-500M-Video-InstructАғын сәйкестендіру сарапшысыarXiv 2506.01844
Octo-Small27 MViT-S масштабы, T5-Base мәтін кодтағышыДиффузияocto-small-1.5 card
ACT~80 MResNet, тіл моделі жоқТікелей бөлік регрессиясыAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 және SigLIP кодтағыштарыАвторегрессивті әрекет токендеріarXiv 2406.09246

Екі қатар туралы дауласуға болады. шамамен 80 M басқаларға қарағанда кішірек, бірақ тіл моделі жоқ, сондықтан ол VLA емес: ол бір тапсырманы үйренеді және оған басқа тапсырманы орындауды айту мүмкін емес. 27 M T5-Base мәтін кодтағышы арқылы шартталған, LLM негізгі архитектурасы арқылы емес. Жақсы базалық үлгілер, бірақ екеуі де белгіде көрсетілген нұсқауларды орындауды қамтамасыз етпейді.

1 B шегі шартты

Басты нәтижелерді көрсететін TinyVLA-H нұсқасы 1.3 B және осы шектен жоғары орналасқан. Жақсырақ сұрақ – модель оқыту кезінде 24 ГБ-қа сыя ма және инференция кезінде басқару жылдамдығына жете ме. Мұнда оқытуға болатын бес саясат саясаттар бетінде; TinyVLA аренада жазбасы бар, егер сіз оның сандарын басқалармен қатар көргіңіз келсе.

TinyVLA: жылдамдық бас бөліктен келеді, негізгі құрылымнан емес

Айқын оқылым бойынша, олар тіл моделін кішірейткендіктен, ол жылдамырақ болды. Мақаладағы абляция керісінше дейді. OpenVLA-ның 7 B негізгі құрылымын шамамен 1 B құрылымға ауыстыру әр әрекетті болжауды 292 мс-тан 140 мс-қа дейін қысқартты, бұл 2 еселік өсім. TinyVLA-H, салыстырмалы параметр санымен, сол картада 14 мс жылдамдықпен жұмыс істейді. Қалған 10 еселік өсім әрекет басынан.

МодельӘрекетті болжауӨлшенген орны
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA әрекеттерді тіл моделінің басы арқылы дискреттелген токендер ретінде шығарады, әр әрекет өлшеміне бір-бірден, авторегрессивті түрде. TinyVLA бүкіл бөлікті бірден шығаратын диффузиялық декодерді қосады. V кестесі TinyVLA-H архитектурасын көрсетеді және сол бес нақты робот тапсырмасында тек басын ауыстырады. Бұл екі мақалада да дәлелдеу үшін ең таза дәлел ағынды сәйкестендіру саясаттары жасайды, және себебі Pi0 токенді декодтаудан бас тартты.

TinyVLA-H-дағы басТеннис қоюКружканы аударуКубтарды жинауТартуышты жабуҚорапты ашу
Диффузия (droid_diffusion)90.098.398.396.786.7
Әрекетті бөліктеуші трансформатор13.38.38.313.323.3
Көпқабатты перцептрон00000
TinyVLA сандары нені қамтиды

292 / 140 / 14 мс көрсеткіштері – IV кестедегі деректер, барлығы бір A6000-да. Олар әрекетті болжауға арналған және камераны түсіруді, алдын ала өңдеуді және сервоприводтарға сериялық жазуды есепке алмайды. Жарияланған кідірісті басқару жылдамдығы ретінде емес, төменгі шек ретінде қарастырыңыз. Біздің сандарымыз да осы шектеуді қамтиды: инференс кідірісін қараңыз.

TinyVLA қандай нәтиже көрсетті

БенчмаркПротоколTinyVLA-HБазалық үлгілер
MetaWorld, 50 тапсырма, симКөп тапсырмалы, 50 демо, 3 тұқымҚиындығы бойынша 77.6 / 21.5 / 11.4 / 15.8, орташа 31.6Diffusion Policy орташа 10.5
Нақты Franka Panda, 5 тапсырмаӘр тапсырмаға 100 траектория, 20 сынақ94.0 орташаOpenVLA 68.3, Diffusion Policy 35.3
Екі қолды UR5, 3 тапсырмаКөп тапсырмалы, әр тапсырмаға 10 сынақ76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Бимануалды қатардың өзіндік түсініктемесі бар, ол қағазда берілген: OpenVLA Open X-Embodiment-те алдын ала оқытылған, ол толығымен бір қолды деректерден тұрады, сондықтан екі қолды әрекет кеңістігі таралудан тыс және ол нөлдік ұпай жинайды. Диффузиялық саясаттың негізгі көрсеткіші TinyVLA-H-ті сол үш тапсырманың екеуінде жеңеді. Толығырақ Open X-Embodiment шолуында.

AY-Robots аренасының көшбасшылар тақтасы, 85 VLA моделінің 332 эталондық нәтижесі бар сұрыпталатын кесте, әрбір мән өзі шыққан мақалаға немесе модель картасына сілтемеленген
Модельаралық эталондық көрсеткіштерді әрқайсысының қайдан шыққанын көргенде ғана салыстыруға болады.

TinyVLA репозиторийі, 2026 жылдың тамыз айындағы жағдай бойынша

Мақала жақсы. Код зерттеу нәтижесі. Репозиторий github.com/liyaxuanliyaxuan/TinyVLA; оның README файлы кодтың шығарылған күнін 2025 жылдың 17 ақпаны деп көрсетеді, ал соңғы коммит 2025 жылдың 11 наурызында болған. Мақаланы қайталау үшін жақсы, бірақ егер сіз қолдау көрсетілетін кітапхананы қаласаңыз, бұл мәселе.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README-дегі орнату реті, 2026-08-23 күні репозиториймен тексерілді.
Тәуелділік бекітпелері бір күнді жоғалтатын тұзақ

requirements.txt `torch==2.0.1`, `transformers==4.37.1`, `deepspeed==0.9.5`, `peft==0.4.0`, `diffusers==0.11.1`, `numpy==1.24.4` және CUDA стегін 11.x дөңгелектеріне бекітеді: `nvidia-cuda-runtime-cu11==11.7.99`, `nvidia-cudnn-cu11==8.5.0.96`, `triton==2.0.0`. README Python 3.10 сұрайды; lerobot 0.6.1 нұсқасы 3.12 немесе одан жаңасын талап етеді, сондықтан екеуі бір ортаны бөлісе алмайды. Алдымен GPU буыныңыз үшін torch 2.0.1 құрастырылымы бар екенін растаңыз. Егер іске қосу VRAM жетіспеушілігінен тоқтап қалса, жад жетіспеушілігін тексеру тізімі болжаудан жылдамырақ болады.

TinyVLA сонымен қатар оқымайды LeRobot деректер жинақтары. Оның форматы ACT-стиліндегі HDF5: action, language_raw және көп көріністі кескіндер, joint_positions, qpos және qvel бар бақылаулар тобы. Репозиторий RLDS енгізу үшін data_utils/rlds_to_h5py.py файлын жеткізеді, және әр тапсырма aloha_scripts/constants.py файлында dataset_dir, episode_len және camera_names арқылы қолмен тіркеледі. Егер сіздің эпизодтарыңыз lerobot-тан немесе жұмыс үстелі клиентінен, конверсия сізге тиесілі.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
scripts/train.sh файлынан қысқартылған. Жоғарыдағы әрбір жалауша мен мән жеткізілген файлда бар.
  • --num_gpus=8 сегіз карталы түйінді болжайды. Оны 1-ге орнатып, пакет өлшемін 32-ден әлдеқайда төмен түсіріңіз. Жалғыз GPU нұсқасы жоғары ағынға жіберілмейді, сондықтан бұл команданы 4090-да дәл сол қалпында іске қосу мүмкін емес.
  • --deepspeed scripts/zero2.json жоғарғы деңгейдегі scripts каталогында жоқ файлды көрсетеді. DeepSpeed конфигурациялары llava-pythia/scripts/zero2.json мекенжайында орналасқан. Алғашқы іске қосу алдында жолды түзетіңіз.
  • README файлы шығыс каталогының атауында llava_pythia болуын талап етеді, сонымен қатар lora қосылған болса, lora болуы керек.
  • Негізгі модель бөлек жүктеледі: lesjie/Llava-Pythia-400M, -700M немесе -1.3B. lerobot/smolvla_base-ге нұсқағандай, саясатты нұсқайтын бір базалық бақылау нүктесі жоқ.

SmolVLA: осы түстен кейін іске қосуға болатын 1 миллиардтан төмен модель

SmolVLA қолдау көрсетілетін кітапхана ішінде дәл осындай аргументті келтіреді. Ол SmolVLM2-500M-Video-Instruct негізгі моделінде 450 миллион параметрге ие, және тиімділік оның кішкентай екендігі туралы мәлімдемеден емес, configuration_smolvla.py файлынан оқуға болатын параметрлерден туындайды.

configuration_smolvla.py файлындағы параметрӘдепкіНәтижесі
num_vlm_layers16Тек алғашқы 16 тіл моделі қабаты іске қосылады
expert_width_multiplier0.75Әрекет сарапшысының жасырын өлшемі VLM-нің 75 пайызын құрайды
self_attn_every_n_layers2Өздігінен назар аудару айқаспалы назар аударумен кезектеседі
chunk_size / n_action_steps50 / 50Бір өту 50 әрекетті шығарады және барлық 50 орындалады
num_steps10Ағынды сәйкестендіру шуды жою 10 қадамда бекітілген
tokenizer_max_length48Нұсқау 48 токенге дейін қысқартылған
freeze_vision_encoder / train_expert_onlyTrue / TrueЖіңішке баптау көру мұнарасын емес, сарапшыны жылжытады
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Мақаладағы рецепт емес: оның алдын ала оқытуы 200000 қадамда 100 қадамдық жылытуды қолданды

Алдын ала оқыту 481 қауымдастық LeRobot деректер жиынтығын, 22.9 K эпизодты және 10.6 M кадрды 4 GPU-да, 200000 қадамды 256 жаһандық пакетпен пайдаланды; құжат бүкіл жобаны шамамен 30 K GPU сағатына бағалайды. Назар аударатын бір сан: Hugging Face іске қосу блогында 487 таңдалған деректер жиынтығы көрсетілген, ал құжаттың кестесінде 481 делінген. Біз құжаттың санын қолданамыз және келіспеушілікті белгілейміз.

AY-Robots-тағы SmolVLA моделінің беті, онда параметрлер саны, 24 ГБ GPU деңгейі, әрекет қадамына арналған қорытынды кідіріс және ең аз эпизод саны көрсетілген
Платформаның SmolVLA беті: 450 M параметр, әрекет қадамына 245 мс, RTX 4090 деңгейі, ең аз 30 эпизод.
БенчмаркSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO орташа, көп міндетті87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World орташа, көп міндетті57.368.2447.9 (3.5 B, robotics-pretrained)-
Нақты SO-100, 3 міндет, көп міндетті оқыту78.3-61.7 (3.5 B)-
Нақты SO-100, 3 міндет, бір міндетті, робототехникалық алдын ала оқытусыз40.0--48.3
SO-101 легоны алу-орналастыру, бір міндетті, таратуда90--70
SO-101 легоны алу-орналастыру, бір міндетті, таратудан тыс50--40
Тақырып жолын емес, бүкіл кестені оқыңыз

LIBERO – бұл симуляция және қазір ондағы барлық құзыретті көрсеткіштер сексендіктерде. Нақты SO-100 жолы, мұнда 450 M моделі 3.5 B моделінен 16.6 ұпайға озып тұр, қызықты; оның астындағы жол – қарсы салмақ. Қауымдастық алдын ала оқытуды және көп міндетті оқытуды алып тастасақ, сол модель ACT-тен төмен, 40.0-ге дейін төмендейді. Қорғауға болатын талап – кішкентай модель автоматты түрде нашар емес, жақсы емес.

Бір кездейсоқтық көмектеседі: SmolVLA мақаласының Meta-World кестесі TinyVLA-ның өзі жариялаған сандарын базалық көрсеткіш ретінде қамтиды, сондықтан бір рет екі модель де бір кестеде орналасқан, SmolVLA-0.45B 57.3, ал TinyVLA-H 31.6. Сондай-ақ, SmolVLA жаттығуы Pi0-ге қарағанда 6 есе аз жадта шамамен 40 пайызға жылдамырақ екенін хабарлайды. Мұның бәрі SmolVLA авторларынан; арена жазбасы әрбір мәнді оның дереккөзіне сілтейді.

SmolVLA уақытын қайда жұмсайды

AY-Robots SmolVLA-ны әрекет қадамына 245 мс, ал ACT 20 мс деп көрсетеді саясат каталогында. TinyVLA әрекетті болжауға 14 мс деп хабарлайды. Бұл сандар салыстыруға келмейді, және оларды салыстыруға болатындай етіп қарастыру бұл тақырыптағы ең көп тараған қателік: кейбіреулері бір алға басуға уақыт жұмсайды, кейбіреулері оны бір бөлікке бөледі, әрекетті бөліктеу оны амортизациялағаннан кейін.

  • SmolVLA бір алға басуға 50 әрекет шығарады және барлық 50 әрекетті орындайды. Мақалада нақты роботтарда қолданылатын 30 кадр/сек жылдамдықта бір қорытынды шамамен 1.7 секунд қозғалысты қамтиды.
  • Асинхронды қорытынды ағымдағы бөлік әлі орындалып жатқанда келесі бөлікті есептейді: орташа тапсырманы орындау 9.7 с синхронды 13.75 с-қа қарсы, шамамен 30 пайызға жылдамырақ, және белгіленген 60 секундтық терезеде 19 таңдау-орналастыру циклі 9-ға қарсы.
  • Табыс көрсеткіштері жақсырақ емес, салыстырмалы болды: синхронды 78.3 асинхронды 73.3-ке қарсы. Асинхрондылық дәлдікті емес, өткізу қабілетін арттырады.
  • Бөліктеу есептеу кідірісін жасырады, желі кідірісін емес, және ол саясатты аз реактивті етеді, себебі ол 50 әрекетке міндеттелген.
Қашықтағы қорытынды тегін емес, және ешбір платформа физиканы түзетпейді

AY-Robots жергілікті робот клиенті сол нүктемен сөйлесіп тұрғанда, сіздің саясатыңызды қамтамасыз ететін бұлтты GPU подын автоматты түрде қамтамасыз ете алады, және под өзінен-өзі жойылып, үнсіз есепшот ұсынбау үшін бос тұрған бақылаушыны алып жүреді. Ол қоғамдық интернеттің айналма жолын жоймайды. Мұндағы бес саясат бойынша басқару циклі кез келген желіге дейін әрекет қадамына 20-дан 485 мс-қа дейін, сондықтан қашықтағы қорытынды баяу таңдау-орналастыру үшін жарамды, жылдам реактивті қозғалыс үшін емес.

AY-Robots саясаттарын салыстыру кестесі GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA және ACT модельдерін параметрлер санымен, қажетті GPU деңгейімен, әрекет қадамына қорытынды кідірісімен және әрқайсысына қажетті эпизодтардың ең аз санымен көрсетеді
SmolVLA ~450 M және ACT ~80 M – 24 ГБ картаға сыятын екеуі. Қалған үшеуіне A100 немесе H100 80 ГБ қажет.

SmolVLA-ны бір тұтынушы картасында дәл баптау

Қолмен жасалатын жол, lerobot 0.6.1 нұсқасында, 2026 жылғы 23 тамыздағы ағымдағы PyPI шығарылымы. Төмендегінің бәрі сол күні алынған Hugging Face lerobot SmolVLA құжаттамасынан; нұсқаулық нұсқасы жұмсағырақ.

  1. 1
    lerobot-ты smolvla қосымшасымен орнату

    SmolVLA тәуелділіктері – қосымша опция, негізгі орнатудың бөлігі емес. Оны орнатпай, содан кейін саясат түрі неге белгісіз деп таңдану – жиі кездесетін жарты сағаттық шығын.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Жеткілікті эпизодтары бар деректер жинағын алу

    Құжаттар шамамен 50 эпизодты ұсынады және 25 эпизодпен бірдей тапсырманың жеткіліксіз болғанын айтады. AY-Robots ең аз мөлшерді 30 деп белгілейді. Өзіңіз жазыңыз немесе деректер жинағы каталогынан бастаңыз.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Нақтылауды бастау

    lerobot нұсқаулығындағы өзгертілмеген пәрмен. Құжаттар 20000 қадамды бір A100-де шамамен 4 сағат деп көрсетеді. 24 ГБ картада ұзағырақ болады деп күтіңіз және оны өлшеңіз.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Сыймайынша пакет өлшемін азайтыңыз

    batch_size=64 – құжатталған мысал, картаңызға қатысты уәде емес. Құжаттар жүктеу уақыты қысқа болған кезде кішігірім мөлшерден бастап, оны арттыруды ұсынады.

    bash
    lerobot-train --help
  5. 5
    Бақылау нүктесін қолға жіберу

    Бірдей кітапхана, бір пәрмен. Нақты уақыттағы бөліктеу жалаушалары құжаттарда түсініктеме ретінде берілген және қуаты аз жабдықта қолдануға арналған.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Бақылау нүктесі – жеткізілетін өнім

Қандай жолды таңдасаңыз да, сіз бақылау нүктесіне және оны жасаған конфигурацияға ие боласыз. Деректер жинағының нұсқасын, қадам санын және тұқымды оның жанында сақтаңыз. lerobot әдепкі бойынша 1000 тұқымды пайдаланады; GR00T-тың нақтылау кіру нүктесі ешқандай тұқымды көрсетпейді, сондықтан бұл іске қосулар бит-бит бойынша қайталанбайды. Оқыту құжаттарындағы механика.

Шағын VLA-ны қолға орнатудың екі жолы

Машина мен ақау режимдері сізге тиесілі. SmolVLA үшін бұл орынды: бір pip қосымшасы, бір оқыту пәрмені, бір іске қосу пәрмені. TinyVLA үшін бұл қатып қалған пиндері, бұзылған DeepSpeed жолы және өзіңіз жазатын деректерді түрлендіруі бар зерттеу репродукциясы.

  1. 24 ГБ картаны алыңыз, 30-дан 50-ге дейін эпизод жазыңыз, камера ағындарын кадр бойынша тексеріңіз.
  2. pip install -e ".[smolvla]", lerobot/smolvla_base-ге қарсы lerobot-train іске қосыңыз, содан кейін бақылау нүктесін қол қосылған машинада қызмет көрсетіңіз.
  3. TinyVLA үшін: бөлек conda ортасы, деректерді HDF5-ке түрлендіру, constants.py файлында тапсырманы тіркеу, zero2.json жолын түзету, train.sh файлын сегіз GPU-дан бір GPU-ға қысқарту.
Артықшылықтар
  • Карта төленгеннен кейін сағаттық төлем жоқ.
  • Инференция серволардың жанында орналасқан, бұл жылдам басқару циклін алудың жалғыз жолы.
  • Саясат кодын патчтауға болады, ал TinyVLA тек осы жолмен қолжетімді.
Ымыралар
  • 4090 әрбір ~3 B саясатын жоққа шығарады, сондықтан GR00T N1.7 немесе Pi0.5-ке қарсы жергілікті салыстыру мүмкін емес.
  • Ортаны орнату – нағыз жұмыс. TinyVLA пиндерінің өзі бір күнді алуы мүмкін.
  • Кезек жоқ, қайталау жоқ, бақылау нүктесін сақтау жоқ. 14000-қадамда қайта жүктеу қайтадан бастауды білдіреді.

Шағын модель дұрыс таңдау болмаған кезде

Екі мақала да мұнда қысқаша мазмұндарға қарағанда мұқият. TinyVLA-ның ақауларды талдауы нақты: 0.4 B нұсқасы нұсқауды қате оқу арқылы үш рет сәтсіздікке ұшырады, мұны авторлар кіші VLM-дегі шектеулі тілді түсінумен байланыстырады және бұл режим 1.3 B-да жоғалып кетті. SmolVLA сол қисықты басқа жағынан көрсетеді: бірдей архитектураның 2.25 B нұсқасы LIBERO-да 88.75 және Meta-World-да 68.24 ұпай жинады, ал 0.45 B моделі үшін 87.3 және 57.3 болды.

1 B-тан төмен VLA таңдау
Қай жерде ұтады
  • 24 ГБ картаға сыяды, бұл эксперименттің құнын ондаған доллардан бірнеше долларға дейін төмендетеді.
  • Қолдың жанында жұмыс істеуге жеткілікті жылдам, сондықтан басқару циклінде желілік секіру болмайды.
  • Бір адам жаза алатын деректерге, мыңдаған емес, ондаған эпизодтарға негізделіп дәл реттеледі.
  • SmolVLA-ның салмақтары, деректер тізімі және коды жалпыға қолжетімді, сондықтан жаман нәтижені жөндеуге болады.
Қай жерде ұтылады
  • Нұсқауларды нашар орындау: тіл параметрлері аз, ұқсас сілтемелік өрнектерді ажырату қабілеті төмен.
  • Сіз жазып алмаған орнатуларға кеңістіктік және визуалды жалпылау қабілеті аз.
  • Деректер жиынтығындағы ақауларға сезімтал, сүйенетін алдын ала оқытуы аз.
  • Көп тапсырмалы және ұзақ мерзімді жұмыстар әлі де үлкен модельдерді, соның ішінде SmolVLA-ның 2.25 B нұсқасын қолдайды.

Жүргізуге тұрарлық салыстыру TinyVLA мен SmolVLA арасында емес. Бұл SmolVLA-ны өзіңіздің тапсырмаңызда ACT моделімен салыстыру, және SmolVLA мақаласы мұның себебін түсіндіреді. Робототехникалық алдын ала оқытусыз, бір тапсырмалы оқытылған SmolVLA үш SO-100 тапсырмасында орташа есеппен 40.0 ұпай жинады, ал бір тапсырмалы ACT 48.3 ұпай жинады. Оны 78.3-ке көтеретін нәрсе – тек архитектура емес, қауымдастық алдын ала оқытуы мен көп тапсырмалы оқыту. SO-101 лего тапсырмасында, екеуі де бір тапсырмалы болғанда, SmolVLA жеңеді: таралуда 70-ке қарсы 90. Содан кейін бюджет мүмкіндік берсе, SmolVLA-ны Pi0.5 моделімен салыстыру.

Бұл көлемде деректер жинағы нәтижені шешеді

Нашар деректерді жабу үшін алдын ала оқыту аз, сондықтан ақаулы деректер жинағындағы таза шығын қисығы ақауды сенімді түрде қайталайтын саясатты береді. lerobot құжаттамасы құрылым туралы анық айтады: 5 текше позициясы бойынша 50 эпизод, әр позицияға 10-нан, жұмыс істеді; 25-і жұмыс істемеді. Егер шығын жақсы көрінсе және қол ешқандай пайдалы әрекет жасамаса, мына жерден бастаңыз: шығын төмендейді, саясат ештеңе істемейді, саясат тек бір конфигурацияда жұмыс істейді немесе шын мәнінде пайдалануға болатын VLA оқыту деректерін жинау.

Бес саясат, бір салыстыру кестесі

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA және ACT нақты параметрлер санымен, әрекет қадамына арналған қорытынды кідіріспен, әрқайсысына қажетті GPU деңгейімен және пайдалы әрекет жасамас бұрынғы ең аз эпизод санымен.

Саясаттарды салыстыру

Әрекет етуге болатын шешім кестесі

Сіздің жағдайыңызБастаңызНеліктен
Бір тапсырма, жақсы демонстрациялар, тіл жоқACT~80 M, 20 ms, 24 GB карта, жүктеуге негізгі модель жоқ
Бірнеше байланысты тапсырмалар, әрқайсысына бір нұсқаулықSmolVLA450 M, lerobot-та, ең аз 30 эпизод, бір іске қосуға 1-ден 3 USD
TinyVLA нәтижесін нақты қайталауTinyVLA-B немесе TinyVLA-HРепозиторий – жалғыз жол: оқшауланған орта, түрлендірілген деректер
Көп тапсырмалы, әртүрлі нұсқаулар, A100 бюджетіGR00T N1.7 немесе Pi0.5~3 B, қадамға 152 ms және 485 ms, бір іске қосуға 4-тен 12 USD
Әлі робот жоқНақты қолды басқаруКезекке негізделген тікелей қол тіркелуді де, жабдықты да қажет етпейді

Соңғы қатар үшін, тікелей қол браузерден тіркелгісіз басқаруға болатын физикалық SO-100 ағынын жібереді, және бастаудың үш жолы қалғанын қамтиды. SO-100 мұндағы эталондық қол, бөлшектері шамамен 110-нан 150 ЕУРО-ға дейін, толық орнату нұсқаулығымен.

1 миллиардтан төмен модельдерден кейін не келеді

Параметрлер санын азайту VLA-ны арзан етудің бір жолы, бірақ бұл міндетті түрде жеңімпаз жол емес. OpenVLA-OFT (arXiv 2502.19645) 7 миллиардтық негізгі құрылымды сақтайды және тек әрекеттердің қалай декодталатынын өзгертеді, әрекеттерді генерациялау өткізу қабілетінің 26 есе артқанын және LIBERO-ның 76.5-тен 97.1 пайызға дейін өскенін хабарлайды. BitVLA (arXiv 2506.07530) 1-биттік BitNet b1.58 2B4T негізгі құрылымының әрбір салмағын үштік етеді, 11.0 есе аз жадты және 4.4 есе төмен соңынан соңына дейінгі кідірісті хабарлайды, сонымен қатар толық дәлдіктегі OpenVLA-OFT-ке сәйкес келеді. X-VLA-0.9B (arXiv 2510.10274) ағын сәйкестігімен 1 миллиардтық желіде орналасқан.

Ортақ тақырып: кідіріс тіл моделінде емес, әрекет декодерінде болады. Қанша параметрі бар екенін сұрамас бұрын, саясаттың әрекеттерді қалай шығаратынын сұраңыз. Аренада 85 моделі және 332 нәтижесі бар, олардың әрқайсысы өз дереккөзіне сілтемеленген; кеңірек шолу біздің VLA кіріспесінде.

RTX 4090-да SmolVLA-ны дәл баптай аламын ба?

Иә. SmolVLA 450 M параметрден тұрады және AY-Robots оны RTX 4090 / 24 ГБ деңгейінде іске қосады. lerobot мысалында --batch_size=64 қолданылады, бұл сіздің картаңызға кепілдік емес, тек мысал; құжаттама жүктеу уақыты қысқа болып тұрғанда кішігірім бастап, біртіндеп арттыруды ұсынады. A100-де 20000 қадам үшін құжаттамада көрсетілген шамамен 4 сағаттан ұзағырақ уақыт күтіңіз.

TinyVLA lerobot-та немесе AY-Robots-та қолжетімді ме?

Екеуі де жоқ. TinyVLA тек өзінің зерттеу репозиторийінде орналасқан, соңғы коммит 2025 жылғы 11 наурыз, және оның форматы LeRobot емес, ACT стиліндегі HDF5. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA және ACT-ті үйретеді. Егер сізге TinyVLA қажет болса, оны өзіңіз құрастырасыз, және алдымен scripts/train.sh файлындағы DeepSpeed конфигурация жолын түзетуіңіз керек болады.

450 M моделі шынымен 3 B модельмен бәсекеге қабілетті ме?

Авторлардың өз бенчмарктары бойынша, иә: LIBERO-да 87.3 қарсы 86.0, робототехникада алдын ала үйретілген Pi0 3.3 B-мен салыстырғанда, және үш нақты SO-100 тапсырмасында 78.3 қарсы 61.7, мұнда сол мақалада Pi0 3.5 B деп белгіленген. Шектеу сол мақалада көрсетілген: робототехникада алдын ала үйретусіз бір тапсырмада SmolVLA 40.0-ге дейін төмендейді, бұл ACT-тің 48.3-нен төмен.

Кішкентай VLA бірдеңе істемес бұрын қанша эпизод қажет?

AY-Robots SmolVLA үшін ең аз 30 эпизодты, ал ACT үшін ең аз 50 эпизодты белгілейді. lerobot құжаттамасы шамамен 50 эпизодты ұсынады және 25 эпизодтың сол тапсырма үшін жеткіліксіз болғанын хабарлайды. Құрылым саны сияқты маңызды: мақаладағы жиынтық әрқайсысы 10 эпизодтан тұратын 5 текше позициясын қолданды.

Жарияланған кідіріс сандары неге соншалықты сәйкес келмейді?

Олар әртүрлі нәрселерді өлшейді. TinyVLA A6000-да әрекетті болжауға 14 мс деп хабарлайды; AY-Robots SmolVLA-ны әрекет қадамына 245 мс, ал ACT-ті 20 мс деп көрсетеді. Кейбір көрсеткіштер бір алға басуды қамтиды, кейбіреулері 50 әрекеттік бөлікке бөледі, және дерлік ешқайсысы камера түсірілімін немесе сервоприводтарға жазуды қамтымайды.

Бұлттық инференция GPU мәселесін шеше ме?

Ішінара. AY-Robots саясатты қамтамасыз ететін подты автоматты түрде бөледі, ал жергілікті клиент сол соңғы нүктемен сөйлеседі, бос тұрған кезде өзін-өзі жоятын бақылаушымен, тыныш есепшот жібермеу үшін. Ол жалпы интернеттің айналма жолын жоя алмайды, және басқару циклі әрекет қадамына 20-дан 485 мс-ке дейін. Баяу алу-орналастыру үшін жақсы, бірақ жылдам реактивті қозғалыс үшін емес.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started