
TinyVLA және SmolVLA жұмыс істейтін VLA-ны 1 миллиард параметрден төмен орналастырады. Екі мақаладан алынған нақты сандар, LeRobot әдепкі параметрлері, өлшенген кідіріс және 24 ГБ картада іске қосу қанша тұратыны.
Жазылған дерлік әрбір көру-тіл-әрекет моделі деректер орталығының картасын қажет етеді. OpenVLA 7 миллиард параметрден тұрады. GR00T N1.7 және Pi0.5 шамамен 3 миллиард параметрден тұрады және оларды дәл баптау үшін A100 80 ГБ қажет. Егер үстеліңіздегі карта 4090 болса, онда мұндай модельдер класы қолжетімсіз болады.
Екі мақала мұның қажет емес екенін дәлелдейді. TinyVLA (arXiv 2409.12514, 2025 жылдың ақпанында IEEE Robotics and Automation Letters журналы қабылдаған) 400 миллионнан 1.3 миллиардқа дейінгі негізгі құрылымнан және диффузиялық әрекет басынан VLA құрады. SmolVLA (arXiv 2506.01844, 2025 жылдың 2 маусымында ұсынылған) ашық салмақтармен, ашық деректермен және бір тұтынушы картасында жұмыс істейтін скриптпен 450 миллион параметрді жеткізеді. Міне, екеуі де не өлшегені және 1 миллиардтан төмен аргументтің қай жерде жарамсыз болатыны.
Нені білу керек
- •TinyVLA үш өлшемде жеткізіледі: жалпы 422 миллион, оның ішінде 101 миллион оқытылатын; 740 миллион, оның ішінде 138 миллион; 1.3 миллиард, оның ішінде 143 миллион. Тек алғашқы екеуі 1 миллиардтан төмен.
- •Оның IV кестесінде TinyVLA-1B үшін бір A6000-да әрекетті болжауға 14 мс, OpenVLA-7B үшін 292 мс және кішірейтілген OpenVLA-1B үшін 140 мс өлшенген.
- •Бұл жылдамдықты негізгі құрылым емес, бас бөлігі қамтамасыз етеді: TinyVLA-H диффузиялық басын ACT басына ауыстырсаңыз, бес нақты робот тапсырмасының орташа көрсеткіші 94.0-ден бір таңбалы сандарға дейін төмендейді. MLP басы барлық жерде 0 ұпай жинайды.
- •SmolVLA 450 миллион параметрден тұрады, оның шамамен 100 миллионы әрекет сарапшысы болып табылады, ол 481 қауымдастық LeRobot деректер жиынтығында және 10.6 миллион кадрда алдын ала оқытылған. Ол LIBERO-да 87.3 көрсеткішін, робототехникада алдын ала оқытылған 3.3 миллиардтық Pi0 үшін 86.0 көрсеткішін, және үш нақты SO-100 тапсырмасында 78.3 көрсеткішін, 3.5 миллиардтық Pi0 үшін 61.7 көрсеткішін хабарлайды.
- •Алдын ала оқытусыз бір тапсырмаға оқытылғанда, SmolVLA бұл тапсырмаларда 40.0-ге дейін төмендейді, бұл ACT-тің 48.3 көрсеткішінен төмен. Кішкентай болу автоматты түрде оңай дегенді білдірмейді.
- •TinyVLA-да LeRobot интеграциясы жоқ және CUDA 11.7 wheel стегін қажет етеді. SmolVLA lerobot-та қолжетімді және мұндағы 24 ГБ деңгейінде әр іске қосу үшін шамамен 1-ден 3 АҚШ долларына дейін тұрады.
Шын мәнінде кішкентай VLA не болып саналады
Модель картасындағы параметрлер саны бір сан емес. Ол жалпы салмақтарды, инференция кезінде жүктелген салмақтарды немесе градиенттерді қабылдайтын салмақтарды білдіруі мүмкін . TinyVLA екеуін де хабарлайды, және айырмашылық үлкен: TinyVLA-H жалпы 1.3 B, бірақ 143 M оқытылатын, себебі визуалды мұнара мен тіл моделінің көп бөлігі қатып қалады, ал LoRA адаптерлері мен әрекет басы қозғалады. Мақалада оқытылатын үлес шамамен 5 пайызды құрайды.
| Модель | Параметрлер | Негізгі архитектура | Әрекет басы | Дереккөз |
|---|---|---|---|---|
| TinyVLA-S | жалпы 422 M, 101 M оқытылатын | Llava-Pythia ~400 M | Диффузия (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | жалпы 740 M, 138 M оқытылатын | Llava-Pythia ~700 M | Диффузия | arXiv 2409.12514 |
| TinyVLA-H | жалпы 1.3 B, 143 M оқытылатын | Llava-Pythia ~1.3 B | Диффузия | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M әрекет сарапшысы | SmolVLM2-500M-Video-Instruct | Ағын сәйкестендіру сарапшысы | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S масштабы, T5-Base мәтін кодтағышы | Диффузия | octo-small-1.5 card |
| ACT | ~80 M | ResNet, тіл моделі жоқ | Тікелей бөлік регрессиясы | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 және SigLIP кодтағыштары | Авторегрессивті әрекет токендері | arXiv 2406.09246 |
Екі қатар туралы дауласуға болады. шамамен 80 M басқаларға қарағанда кішірек, бірақ тіл моделі жоқ, сондықтан ол VLA емес: ол бір тапсырманы үйренеді және оған басқа тапсырманы орындауды айту мүмкін емес. 27 M T5-Base мәтін кодтағышы арқылы шартталған, LLM негізгі архитектурасы арқылы емес. Жақсы базалық үлгілер, бірақ екеуі де белгіде көрсетілген нұсқауларды орындауды қамтамасыз етпейді.
Басты нәтижелерді көрсететін TinyVLA-H нұсқасы 1.3 B және осы шектен жоғары орналасқан. Жақсырақ сұрақ – модель оқыту кезінде 24 ГБ-қа сыя ма және инференция кезінде басқару жылдамдығына жете ме. Мұнда оқытуға болатын бес саясат саясаттар бетінде; TinyVLA аренада жазбасы бар, егер сіз оның сандарын басқалармен қатар көргіңіз келсе.
TinyVLA: жылдамдық бас бөліктен келеді, негізгі құрылымнан емес
Айқын оқылым бойынша, олар тіл моделін кішірейткендіктен, ол жылдамырақ болды. Мақаладағы абляция керісінше дейді. OpenVLA-ның 7 B негізгі құрылымын шамамен 1 B құрылымға ауыстыру әр әрекетті болжауды 292 мс-тан 140 мс-қа дейін қысқартты, бұл 2 еселік өсім. TinyVLA-H, салыстырмалы параметр санымен, сол картада 14 мс жылдамдықпен жұмыс істейді. Қалған 10 еселік өсім әрекет басынан.
| Модель | Әрекетті болжау | Өлшенген орны |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA әрекеттерді тіл моделінің басы арқылы дискреттелген токендер ретінде шығарады, әр әрекет өлшеміне бір-бірден, авторегрессивті түрде. TinyVLA бүкіл бөлікті бірден шығаратын диффузиялық декодерді қосады. V кестесі TinyVLA-H архитектурасын көрсетеді және сол бес нақты робот тапсырмасында тек басын ауыстырады. Бұл екі мақалада да дәлелдеу үшін ең таза дәлел ағынды сәйкестендіру саясаттары жасайды, және себебі Pi0 токенді декодтаудан бас тартты.
| TinyVLA-H-дағы бас | Теннис қою | Кружканы аудару | Кубтарды жинау | Тартуышты жабу | Қорапты ашу |
|---|---|---|---|---|---|
| Диффузия (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Әрекетті бөліктеуші трансформатор | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Көпқабатты перцептрон | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 мс көрсеткіштері – IV кестедегі деректер, барлығы бір A6000-да. Олар әрекетті болжауға арналған және камераны түсіруді, алдын ала өңдеуді және сервоприводтарға сериялық жазуды есепке алмайды. Жарияланған кідірісті басқару жылдамдығы ретінде емес, төменгі шек ретінде қарастырыңыз. Біздің сандарымыз да осы шектеуді қамтиды: инференс кідірісін қараңыз.
TinyVLA қандай нәтиже көрсетті
| Бенчмарк | Протокол | TinyVLA-H | Базалық үлгілер |
|---|---|---|---|
| MetaWorld, 50 тапсырма, сим | Көп тапсырмалы, 50 демо, 3 тұқым | Қиындығы бойынша 77.6 / 21.5 / 11.4 / 15.8, орташа 31.6 | Diffusion Policy орташа 10.5 |
| Нақты Franka Panda, 5 тапсырма | Әр тапсырмаға 100 траектория, 20 сынақ | 94.0 орташа | OpenVLA 68.3, Diffusion Policy 35.3 |
| Екі қолды UR5, 3 тапсырма | Көп тапсырмалы, әр тапсырмаға 10 сынақ | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Бимануалды қатардың өзіндік түсініктемесі бар, ол қағазда берілген: OpenVLA Open X-Embodiment-те алдын ала оқытылған, ол толығымен бір қолды деректерден тұрады, сондықтан екі қолды әрекет кеңістігі таралудан тыс және ол нөлдік ұпай жинайды. Диффузиялық саясаттың негізгі көрсеткіші TinyVLA-H-ті сол үш тапсырманың екеуінде жеңеді. Толығырақ Open X-Embodiment шолуында.

TinyVLA репозиторийі, 2026 жылдың тамыз айындағы жағдай бойынша
Мақала жақсы. Код зерттеу нәтижесі. Репозиторий github.com/liyaxuanliyaxuan/TinyVLA; оның README файлы кодтың шығарылған күнін 2025 жылдың 17 ақпаны деп көрсетеді, ал соңғы коммит 2025 жылдың 11 наурызында болған. Мақаланы қайталау үшін жақсы, бірақ егер сіз қолдау көрсетілетін кітапхананы қаласаңыз, бұл мәселе.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt `torch==2.0.1`, `transformers==4.37.1`, `deepspeed==0.9.5`, `peft==0.4.0`, `diffusers==0.11.1`, `numpy==1.24.4` және CUDA стегін 11.x дөңгелектеріне бекітеді: `nvidia-cuda-runtime-cu11==11.7.99`, `nvidia-cudnn-cu11==8.5.0.96`, `triton==2.0.0`. README Python 3.10 сұрайды; lerobot 0.6.1 нұсқасы 3.12 немесе одан жаңасын талап етеді, сондықтан екеуі бір ортаны бөлісе алмайды. Алдымен GPU буыныңыз үшін torch 2.0.1 құрастырылымы бар екенін растаңыз. Егер іске қосу VRAM жетіспеушілігінен тоқтап қалса, жад жетіспеушілігін тексеру тізімі болжаудан жылдамырақ болады.
TinyVLA сонымен қатар оқымайды LeRobot деректер жинақтары. Оның форматы ACT-стиліндегі HDF5: action, language_raw және көп көріністі кескіндер, joint_positions, qpos және qvel бар бақылаулар тобы. Репозиторий RLDS енгізу үшін data_utils/rlds_to_h5py.py файлын жеткізеді, және әр тапсырма aloha_scripts/constants.py файлында dataset_dir, episode_len және camera_names арқылы қолмен тіркеледі. Егер сіздің эпизодтарыңыз lerobot-тан немесе жұмыс үстелі клиентінен, конверсия сізге тиесілі.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 сегіз карталы түйінді болжайды. Оны 1-ге орнатып, пакет өлшемін 32-ден әлдеқайда төмен түсіріңіз. Жалғыз GPU нұсқасы жоғары ағынға жіберілмейді, сондықтан бұл команданы 4090-да дәл сол қалпында іске қосу мүмкін емес.
- --deepspeed scripts/zero2.json жоғарғы деңгейдегі scripts каталогында жоқ файлды көрсетеді. DeepSpeed конфигурациялары llava-pythia/scripts/zero2.json мекенжайында орналасқан. Алғашқы іске қосу алдында жолды түзетіңіз.
- README файлы шығыс каталогының атауында llava_pythia болуын талап етеді, сонымен қатар lora қосылған болса, lora болуы керек.
- Негізгі модель бөлек жүктеледі: lesjie/Llava-Pythia-400M, -700M немесе -1.3B. lerobot/smolvla_base-ге нұсқағандай, саясатты нұсқайтын бір базалық бақылау нүктесі жоқ.
SmolVLA: осы түстен кейін іске қосуға болатын 1 миллиардтан төмен модель
SmolVLA қолдау көрсетілетін кітапхана ішінде дәл осындай аргументті келтіреді. Ол SmolVLM2-500M-Video-Instruct негізгі моделінде 450 миллион параметрге ие, және тиімділік оның кішкентай екендігі туралы мәлімдемеден емес, configuration_smolvla.py файлынан оқуға болатын параметрлерден туындайды.
| configuration_smolvla.py файлындағы параметр | Әдепкі | Нәтижесі |
|---|---|---|
| num_vlm_layers | 16 | Тек алғашқы 16 тіл моделі қабаты іске қосылады |
| expert_width_multiplier | 0.75 | Әрекет сарапшысының жасырын өлшемі VLM-нің 75 пайызын құрайды |
| self_attn_every_n_layers | 2 | Өздігінен назар аудару айқаспалы назар аударумен кезектеседі |
| chunk_size / n_action_steps | 50 / 50 | Бір өту 50 әрекетті шығарады және барлық 50 орындалады |
| num_steps | 10 | Ағынды сәйкестендіру шуды жою 10 қадамда бекітілген |
| tokenizer_max_length | 48 | Нұсқау 48 токенге дейін қысқартылған |
| freeze_vision_encoder / train_expert_only | True / True | Жіңішке баптау көру мұнарасын емес, сарапшыны жылжытады |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Мақаладағы рецепт емес: оның алдын ала оқытуы 200000 қадамда 100 қадамдық жылытуды қолданды |
Алдын ала оқыту 481 қауымдастық LeRobot деректер жиынтығын, 22.9 K эпизодты және 10.6 M кадрды 4 GPU-да, 200000 қадамды 256 жаһандық пакетпен пайдаланды; құжат бүкіл жобаны шамамен 30 K GPU сағатына бағалайды. Назар аударатын бір сан: Hugging Face іске қосу блогында 487 таңдалған деректер жиынтығы көрсетілген, ал құжаттың кестесінде 481 делінген. Біз құжаттың санын қолданамыз және келіспеушілікті белгілейміз.

| Бенчмарк | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO орташа, көп міндетті | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World орташа, көп міндетті | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Нақты SO-100, 3 міндет, көп міндетті оқыту | 78.3 | - | 61.7 (3.5 B) | - |
| Нақты SO-100, 3 міндет, бір міндетті, робототехникалық алдын ала оқытусыз | 40.0 | - | - | 48.3 |
| SO-101 легоны алу-орналастыру, бір міндетті, таратуда | 90 | - | - | 70 |
| SO-101 легоны алу-орналастыру, бір міндетті, таратудан тыс | 50 | - | - | 40 |
LIBERO – бұл симуляция және қазір ондағы барлық құзыретті көрсеткіштер сексендіктерде. Нақты SO-100 жолы, мұнда 450 M моделі 3.5 B моделінен 16.6 ұпайға озып тұр, қызықты; оның астындағы жол – қарсы салмақ. Қауымдастық алдын ала оқытуды және көп міндетті оқытуды алып тастасақ, сол модель ACT-тен төмен, 40.0-ге дейін төмендейді. Қорғауға болатын талап – кішкентай модель автоматты түрде нашар емес, жақсы емес.
Бір кездейсоқтық көмектеседі: SmolVLA мақаласының Meta-World кестесі TinyVLA-ның өзі жариялаған сандарын базалық көрсеткіш ретінде қамтиды, сондықтан бір рет екі модель де бір кестеде орналасқан, SmolVLA-0.45B 57.3, ал TinyVLA-H 31.6. Сондай-ақ, SmolVLA жаттығуы Pi0-ге қарағанда 6 есе аз жадта шамамен 40 пайызға жылдамырақ екенін хабарлайды. Мұның бәрі SmolVLA авторларынан; арена жазбасы әрбір мәнді оның дереккөзіне сілтейді.
SmolVLA уақытын қайда жұмсайды
AY-Robots SmolVLA-ны әрекет қадамына 245 мс, ал ACT 20 мс деп көрсетеді саясат каталогында. TinyVLA әрекетті болжауға 14 мс деп хабарлайды. Бұл сандар салыстыруға келмейді, және оларды салыстыруға болатындай етіп қарастыру бұл тақырыптағы ең көп тараған қателік: кейбіреулері бір алға басуға уақыт жұмсайды, кейбіреулері оны бір бөлікке бөледі, әрекетті бөліктеу оны амортизациялағаннан кейін.
- SmolVLA бір алға басуға 50 әрекет шығарады және барлық 50 әрекетті орындайды. Мақалада нақты роботтарда қолданылатын 30 кадр/сек жылдамдықта бір қорытынды шамамен 1.7 секунд қозғалысты қамтиды.
- Асинхронды қорытынды ағымдағы бөлік әлі орындалып жатқанда келесі бөлікті есептейді: орташа тапсырманы орындау 9.7 с синхронды 13.75 с-қа қарсы, шамамен 30 пайызға жылдамырақ, және белгіленген 60 секундтық терезеде 19 таңдау-орналастыру циклі 9-ға қарсы.
- Табыс көрсеткіштері жақсырақ емес, салыстырмалы болды: синхронды 78.3 асинхронды 73.3-ке қарсы. Асинхрондылық дәлдікті емес, өткізу қабілетін арттырады.
- Бөліктеу есептеу кідірісін жасырады, желі кідірісін емес, және ол саясатты аз реактивті етеді, себебі ол 50 әрекетке міндеттелген.
AY-Robots жергілікті робот клиенті сол нүктемен сөйлесіп тұрғанда, сіздің саясатыңызды қамтамасыз ететін бұлтты GPU подын автоматты түрде қамтамасыз ете алады, және под өзінен-өзі жойылып, үнсіз есепшот ұсынбау үшін бос тұрған бақылаушыны алып жүреді. Ол қоғамдық интернеттің айналма жолын жоймайды. Мұндағы бес саясат бойынша басқару циклі кез келген желіге дейін әрекет қадамына 20-дан 485 мс-қа дейін, сондықтан қашықтағы қорытынды баяу таңдау-орналастыру үшін жарамды, жылдам реактивті қозғалыс үшін емес.

SmolVLA-ны бір тұтынушы картасында дәл баптау
Қолмен жасалатын жол, lerobot 0.6.1 нұсқасында, 2026 жылғы 23 тамыздағы ағымдағы PyPI шығарылымы. Төмендегінің бәрі сол күні алынған Hugging Face lerobot SmolVLA құжаттамасынан; нұсқаулық нұсқасы жұмсағырақ.
- 1lerobot-ты smolvla қосымшасымен орнату
SmolVLA тәуелділіктері – қосымша опция, негізгі орнатудың бөлігі емес. Оны орнатпай, содан кейін саясат түрі неге белгісіз деп таңдану – жиі кездесетін жарты сағаттық шығын.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Жеткілікті эпизодтары бар деректер жинағын алу
Құжаттар шамамен 50 эпизодты ұсынады және 25 эпизодпен бірдей тапсырманың жеткіліксіз болғанын айтады. AY-Robots ең аз мөлшерді 30 деп белгілейді. Өзіңіз жазыңыз немесе деректер жинағы каталогынан бастаңыз.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Нақтылауды бастау
lerobot нұсқаулығындағы өзгертілмеген пәрмен. Құжаттар 20000 қадамды бір A100-де шамамен 4 сағат деп көрсетеді. 24 ГБ картада ұзағырақ болады деп күтіңіз және оны өлшеңіз.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Сыймайынша пакет өлшемін азайтыңыз
batch_size=64 – құжатталған мысал, картаңызға қатысты уәде емес. Құжаттар жүктеу уақыты қысқа болған кезде кішігірім мөлшерден бастап, оны арттыруды ұсынады.
bashlerobot-train --help - 5Бақылау нүктесін қолға жіберу
Бірдей кітапхана, бір пәрмен. Нақты уақыттағы бөліктеу жалаушалары құжаттарда түсініктеме ретінде берілген және қуаты аз жабдықта қолдануға арналған.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Қандай жолды таңдасаңыз да, сіз бақылау нүктесіне және оны жасаған конфигурацияға ие боласыз. Деректер жинағының нұсқасын, қадам санын және тұқымды оның жанында сақтаңыз. lerobot әдепкі бойынша 1000 тұқымды пайдаланады; GR00T-тың нақтылау кіру нүктесі ешқандай тұқымды көрсетпейді, сондықтан бұл іске қосулар бит-бит бойынша қайталанбайды. Оқыту құжаттарындағы механика.
Шағын VLA-ны қолға орнатудың екі жолы
Машина мен ақау режимдері сізге тиесілі. SmolVLA үшін бұл орынды: бір pip қосымшасы, бір оқыту пәрмені, бір іске қосу пәрмені. TinyVLA үшін бұл қатып қалған пиндері, бұзылған DeepSpeed жолы және өзіңіз жазатын деректерді түрлендіруі бар зерттеу репродукциясы.
- 24 ГБ картаны алыңыз, 30-дан 50-ге дейін эпизод жазыңыз, камера ағындарын кадр бойынша тексеріңіз.
- pip install -e ".[smolvla]", lerobot/smolvla_base-ге қарсы lerobot-train іске қосыңыз, содан кейін бақылау нүктесін қол қосылған машинада қызмет көрсетіңіз.
- TinyVLA үшін: бөлек conda ортасы, деректерді HDF5-ке түрлендіру, constants.py файлында тапсырманы тіркеу, zero2.json жолын түзету, train.sh файлын сегіз GPU-дан бір GPU-ға қысқарту.
- Карта төленгеннен кейін сағаттық төлем жоқ.
- Инференция серволардың жанында орналасқан, бұл жылдам басқару циклін алудың жалғыз жолы.
- Саясат кодын патчтауға болады, ал TinyVLA тек осы жолмен қолжетімді.
- 4090 әрбір ~3 B саясатын жоққа шығарады, сондықтан GR00T N1.7 немесе Pi0.5-ке қарсы жергілікті салыстыру мүмкін емес.
- Ортаны орнату – нағыз жұмыс. TinyVLA пиндерінің өзі бір күнді алуы мүмкін.
- Кезек жоқ, қайталау жоқ, бақылау нүктесін сақтау жоқ. 14000-қадамда қайта жүктеу қайтадан бастауды білдіреді.
SmolVLA мұндағы бес саясаттың бірі. Сіз үлгі мен деректер жинағын формада таңдайсыз, бэкэнд қажетті VRAM бойынша GPU-ны жалға алады, оқытушыны іске қосады және бақылау нүктелерін объектілік сақтау қоймасына жазады. Қадам бойынша: SO-100-дегі SmolVLA, немесе толық матрицаны оқыту бетінде.
| Платформа SmolVLA үшін не жібереді | Мән |
|---|---|
| пакет өлшемі | 2 |
| оқыту жылдамдығы | 1e-4 |
| максималды қадамдар | 20000 |
| градиентті жинақтау | 8, and it does not reach the trainer |
| формадағы қосымша реттегіштер | seed, logFreq |
| GPU деңгейі | RTX 4090 or any 24 GB card |
| деректер жинағы форматы | LeRobot v3.0 |
| ең аз эпизодтар | 30 |
Біріншіден, мұндағы әдепкі пакет өлшемі 2, lerobot құжаттамасының мысалындағы 64 емес, және градиентті жинақтау параметрі жіберілгенімен, SmolVLA үшін ешқандай әсер етпейді, сондықтан тиімді пакет шынымен де 2. Әдепкі параметр жоғарыдағымен сәйкес келеді деп болжамай, оны әдейі арттырыңыз. Екіншіден, TinyVLA мұнда мүлдем оқытылмайды.
24 ГБ деңгейіндегі іске қосу сағатына 0.30-дан 0.60 USD-ға дейін, шамамен 1-ден 3 USD-ға дейін 2-ден 5 сағатты алады. A100 деңгейінде ~3 B саясаты сағатына 1.20-дан 2.00 USD-ға дейін, шамамен 4-тен 12 USD-ға дейін 3-тен 6 сағатты алады. Қараңыз бағаларды, және сол операцияларды CLI-дан және MCP серверінен.
Шағын модель дұрыс таңдау болмаған кезде
Екі мақала да мұнда қысқаша мазмұндарға қарағанда мұқият. TinyVLA-ның ақауларды талдауы нақты: 0.4 B нұсқасы нұсқауды қате оқу арқылы үш рет сәтсіздікке ұшырады, мұны авторлар кіші VLM-дегі шектеулі тілді түсінумен байланыстырады және бұл режим 1.3 B-да жоғалып кетті. SmolVLA сол қисықты басқа жағынан көрсетеді: бірдей архитектураның 2.25 B нұсқасы LIBERO-да 88.75 және Meta-World-да 68.24 ұпай жинады, ал 0.45 B моделі үшін 87.3 және 57.3 болды.
- 24 ГБ картаға сыяды, бұл эксперименттің құнын ондаған доллардан бірнеше долларға дейін төмендетеді.
- Қолдың жанында жұмыс істеуге жеткілікті жылдам, сондықтан басқару циклінде желілік секіру болмайды.
- Бір адам жаза алатын деректерге, мыңдаған емес, ондаған эпизодтарға негізделіп дәл реттеледі.
- SmolVLA-ның салмақтары, деректер тізімі және коды жалпыға қолжетімді, сондықтан жаман нәтижені жөндеуге болады.
- Нұсқауларды нашар орындау: тіл параметрлері аз, ұқсас сілтемелік өрнектерді ажырату қабілеті төмен.
- Сіз жазып алмаған орнатуларға кеңістіктік және визуалды жалпылау қабілеті аз.
- Деректер жиынтығындағы ақауларға сезімтал, сүйенетін алдын ала оқытуы аз.
- Көп тапсырмалы және ұзақ мерзімді жұмыстар әлі де үлкен модельдерді, соның ішінде SmolVLA-ның 2.25 B нұсқасын қолдайды.
Жүргізуге тұрарлық салыстыру TinyVLA мен SmolVLA арасында емес. Бұл SmolVLA-ны өзіңіздің тапсырмаңызда ACT моделімен салыстыру, және SmolVLA мақаласы мұның себебін түсіндіреді. Робототехникалық алдын ала оқытусыз, бір тапсырмалы оқытылған SmolVLA үш SO-100 тапсырмасында орташа есеппен 40.0 ұпай жинады, ал бір тапсырмалы ACT 48.3 ұпай жинады. Оны 78.3-ке көтеретін нәрсе – тек архитектура емес, қауымдастық алдын ала оқытуы мен көп тапсырмалы оқыту. SO-101 лего тапсырмасында, екеуі де бір тапсырмалы болғанда, SmolVLA жеңеді: таралуда 70-ке қарсы 90. Содан кейін бюджет мүмкіндік берсе, SmolVLA-ны Pi0.5 моделімен салыстыру.
Нашар деректерді жабу үшін алдын ала оқыту аз, сондықтан ақаулы деректер жинағындағы таза шығын қисығы ақауды сенімді түрде қайталайтын саясатты береді. lerobot құжаттамасы құрылым туралы анық айтады: 5 текше позициясы бойынша 50 эпизод, әр позицияға 10-нан, жұмыс істеді; 25-і жұмыс істемеді. Егер шығын жақсы көрінсе және қол ешқандай пайдалы әрекет жасамаса, мына жерден бастаңыз: шығын төмендейді, саясат ештеңе істемейді, саясат тек бір конфигурацияда жұмыс істейді немесе шын мәнінде пайдалануға болатын VLA оқыту деректерін жинау.
Бес саясат, бір салыстыру кестесі
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA және ACT нақты параметрлер санымен, әрекет қадамына арналған қорытынды кідіріспен, әрқайсысына қажетті GPU деңгейімен және пайдалы әрекет жасамас бұрынғы ең аз эпизод санымен.
Саясаттарды салыстыруӘрекет етуге болатын шешім кестесі
| Сіздің жағдайыңыз | Бастаңыз | Неліктен |
|---|---|---|
| Бір тапсырма, жақсы демонстрациялар, тіл жоқ | ACT | ~80 M, 20 ms, 24 GB карта, жүктеуге негізгі модель жоқ |
| Бірнеше байланысты тапсырмалар, әрқайсысына бір нұсқаулық | SmolVLA | 450 M, lerobot-та, ең аз 30 эпизод, бір іске қосуға 1-ден 3 USD |
| TinyVLA нәтижесін нақты қайталау | TinyVLA-B немесе TinyVLA-H | Репозиторий – жалғыз жол: оқшауланған орта, түрлендірілген деректер |
| Көп тапсырмалы, әртүрлі нұсқаулар, A100 бюджеті | GR00T N1.7 немесе Pi0.5 | ~3 B, қадамға 152 ms және 485 ms, бір іске қосуға 4-тен 12 USD |
| Әлі робот жоқ | Нақты қолды басқару | Кезекке негізделген тікелей қол тіркелуді де, жабдықты да қажет етпейді |
Соңғы қатар үшін, тікелей қол браузерден тіркелгісіз басқаруға болатын физикалық SO-100 ағынын жібереді, және бастаудың үш жолы қалғанын қамтиды. SO-100 мұндағы эталондық қол, бөлшектері шамамен 110-нан 150 ЕУРО-ға дейін, толық орнату нұсқаулығымен.
1 миллиардтан төмен модельдерден кейін не келеді
Параметрлер санын азайту VLA-ны арзан етудің бір жолы, бірақ бұл міндетті түрде жеңімпаз жол емес. OpenVLA-OFT (arXiv 2502.19645) 7 миллиардтық негізгі құрылымды сақтайды және тек әрекеттердің қалай декодталатынын өзгертеді, әрекеттерді генерациялау өткізу қабілетінің 26 есе артқанын және LIBERO-ның 76.5-тен 97.1 пайызға дейін өскенін хабарлайды. BitVLA (arXiv 2506.07530) 1-биттік BitNet b1.58 2B4T негізгі құрылымының әрбір салмағын үштік етеді, 11.0 есе аз жадты және 4.4 есе төмен соңынан соңына дейінгі кідірісті хабарлайды, сонымен қатар толық дәлдіктегі OpenVLA-OFT-ке сәйкес келеді. X-VLA-0.9B (arXiv 2510.10274) ағын сәйкестігімен 1 миллиардтық желіде орналасқан.
Ортақ тақырып: кідіріс тіл моделінде емес, әрекет декодерінде болады. Қанша параметрі бар екенін сұрамас бұрын, саясаттың әрекеттерді қалай шығаратынын сұраңыз. Аренада 85 моделі және 332 нәтижесі бар, олардың әрқайсысы өз дереккөзіне сілтемеленген; кеңірек шолу біздің VLA кіріспесінде.
RTX 4090-да SmolVLA-ны дәл баптай аламын ба?▾
Иә. SmolVLA 450 M параметрден тұрады және AY-Robots оны RTX 4090 / 24 ГБ деңгейінде іске қосады. lerobot мысалында --batch_size=64 қолданылады, бұл сіздің картаңызға кепілдік емес, тек мысал; құжаттама жүктеу уақыты қысқа болып тұрғанда кішігірім бастап, біртіндеп арттыруды ұсынады. A100-де 20000 қадам үшін құжаттамада көрсетілген шамамен 4 сағаттан ұзағырақ уақыт күтіңіз.
TinyVLA lerobot-та немесе AY-Robots-та қолжетімді ме?▾
Екеуі де жоқ. TinyVLA тек өзінің зерттеу репозиторийінде орналасқан, соңғы коммит 2025 жылғы 11 наурыз, және оның форматы LeRobot емес, ACT стиліндегі HDF5. AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA және ACT-ті үйретеді. Егер сізге TinyVLA қажет болса, оны өзіңіз құрастырасыз, және алдымен scripts/train.sh файлындағы DeepSpeed конфигурация жолын түзетуіңіз керек болады.
450 M моделі шынымен 3 B модельмен бәсекеге қабілетті ме?▾
Авторлардың өз бенчмарктары бойынша, иә: LIBERO-да 87.3 қарсы 86.0, робототехникада алдын ала үйретілген Pi0 3.3 B-мен салыстырғанда, және үш нақты SO-100 тапсырмасында 78.3 қарсы 61.7, мұнда сол мақалада Pi0 3.5 B деп белгіленген. Шектеу сол мақалада көрсетілген: робототехникада алдын ала үйретусіз бір тапсырмада SmolVLA 40.0-ге дейін төмендейді, бұл ACT-тің 48.3-нен төмен.
Кішкентай VLA бірдеңе істемес бұрын қанша эпизод қажет?▾
AY-Robots SmolVLA үшін ең аз 30 эпизодты, ал ACT үшін ең аз 50 эпизодты белгілейді. lerobot құжаттамасы шамамен 50 эпизодты ұсынады және 25 эпизодтың сол тапсырма үшін жеткіліксіз болғанын хабарлайды. Құрылым саны сияқты маңызды: мақаладағы жиынтық әрқайсысы 10 эпизодтан тұратын 5 текше позициясын қолданды.
Жарияланған кідіріс сандары неге соншалықты сәйкес келмейді?▾
Олар әртүрлі нәрселерді өлшейді. TinyVLA A6000-да әрекетті болжауға 14 мс деп хабарлайды; AY-Robots SmolVLA-ны әрекет қадамына 245 мс, ал ACT-ті 20 мс деп көрсетеді. Кейбір көрсеткіштер бір алға басуды қамтиды, кейбіреулері 50 әрекеттік бөлікке бөледі, және дерлік ешқайсысы камера түсірілімін немесе сервоприводтарға жазуды қамтымайды.
Бұлттық инференция GPU мәселесін шеше ме?▾
Ішінара. AY-Robots саясатты қамтамасыз ететін подты автоматты түрде бөледі, ал жергілікті клиент сол соңғы нүктемен сөйлеседі, бос тұрған кезде өзін-өзі жоятын бақылаушымен, тыныш есепшот жібермеу үшін. Ол жалпы интернеттің айналма жолын жоя алмайды, және басқару циклі әрекет қадамына 20-дан 485 мс-ке дейін. Баяу алу-орналастыру үшін жақсы, бірақ жылдам реактивті қозғалыс үшін емес.
Sources
- TinyVLA: Роботтық манипуляцияға арналған жылдам, деректерді тиімді пайдаланатын көру-тіл-әрекет модельдеріне қарай
- TinyVLA ресми код репозиторийі (README, requirements.txt, scripts/train.sh)
- TinyVLA жоба беті
- lesjie/Llava-Pythia-1.3B, TinyVLA-H негізгі салмақтары
- SmolVLA: Қолжетімді және тиімді робототехникаға арналған көру-тіл-әрекет моделі
- lerobot құжаттамасы: SmolVLA-ны дәл баптау
- lerobot: configuration_smolvla.py, SmolVLA әдепкі параметрлері
- lerobot/smolvla_base модель картасы
- SmolVLA: Тиімді көру-тіл-әрекет моделі (Hugging Face блогы)
- PyPI-дегі lerobot (0.6.1, Python 3.12 немесе одан жаңа нұсқасын қажет етеді)
- OpenVLA: Ашық бастапқы көзді көру-тіл-әрекет моделі
- Көру-тіл-әрекет модельдерін дәл баптау: Жылдамдық пен сәттілікті оңтайландыру (OpenVLA-OFT)
- BitVLA: Роботтық манипуляцияға арналған 1-биттік көру-тіл-әрекет модельдері
- X-VLA: Масштабталатын кросс-денелі көру-тіл-әрекет моделі ретіндегі жұмсақ-промптталған трансформатор
- rail-berkeley/octo-small-1.5 модель картасы (27 M параметр)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started