
TinyVLA и SmolVLA ставаат функционален VLA под 1 милијарда параметри. Реални бројки од двата труда, стандардните поставки на LeRobot, измерена латентност и колку чини едно извршување на картичка од 24 GB.
Речиси секој визио-јазичен-акционен модел за кој се пишува претпоставува картичка за центар за податоци. OpenVLA е со 7 милијарди параметри. GR00T N1.7 и Pi0.5 се околу 3 милијарди и бараат A100 80 GB за фино подесување. Ако картичката на вашето биро е 4090, таа класа на модели е недостапна.
Два труда тврдат дека не ви е потребна. TinyVLA (arXiv 2409.12514, прифатен од IEEE Robotics and Automation Letters во февруари 2025) гради VLA од основа од 400 милиони до 1.3 милијарди параметри плус глава за дифузна акција. SmolVLA (arXiv 2506.01844, поднесен на 2 јуни 2025) испорачува 450 милиони параметри со отворени тежини, отворени податоци и скрипта што работи на една потрошувачка картичка. Еве што измерија и двата, и каде аргументот за под-1 милијарда престанува да важи.
Што треба да знаете
- •TinyVLA се испорачува во три големини: 422 милиони вкупно со 101 милион за тренирање, 740 милиони со 138 милиони, 1.3 милијарди со 143 милиони. Само првите две се под 1 милијарда.
- •Неговата Табела IV мери 14 ms по предвидување на акција за TinyVLA-1B на една A6000, наспроти 292 ms за OpenVLA-7B и 140 ms за намален OpenVLA-1B.
- •Главата ја одржува таа брзина, а не основата: заменете ја дифузната глава на TinyVLA-H со ACT глава и петте задачи на вистински робот паѓаат од просек од 94.0 на едноцифрени бројки. MLP глава постигнува 0 насекаде.
- •SmolVLA е 450 милиони, приближно 100 милиони од нив се експерт за акција, претрениран на 481 LeRobot збирки на податоци од заедницата и 10.6 милиони рамки. Известува 87.3 на LIBERO наспроти 86.0 за роботски претрениран Pi0 со 3.3 милијарди, и 78.3 на три реални SO-100 задачи наспроти 61.7 за Pi0 со 3.5 милијарди.
- •Трениран за една задача без тоа претренирање, SmolVLA паѓа на 40.0 на тие задачи, под 48.3 на ACT. Малото не е автоматски лесно.
- •TinyVLA нема интеграција со LeRobot и користи CUDA 11.7 wheel stack. SmolVLA е во lerobot и чини приближно 1 до 3 USD по извршување на нивото од 24 GB овде.
Што всушност се смета за мал VLA
Бројот на параметри на картичката на моделот не е еден број. Може да значи вкупни тежини, тежини вчитани при заклучување, или тежини кои примаат градиенти за време на . TinyVLA ги пријавува и двете, а разликата е голема: TinyVLA-H е 1.3 B вкупно, но 143 M тренирачки, бидејќи визуелната кула и поголемиот дел од јазичниот модел остануваат замрзнати додека LoRA адаптерите и акционата глава се движат. Трудот го проценува тренирачкиот удел на околу 5 проценти.
| Модел | Параметри | Основа | Акциона глава | Извор |
|---|---|---|---|---|
| TinyVLA-S | 422 M вкупно, 101 M тренирачки | Llava-Pythia ~400 M | Дифузија (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M вкупно, 138 M тренирачки | Llava-Pythia ~700 M | Дифузија | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B вкупно, 143 M тренирачки | Llava-Pythia ~1.3 B | Дифузија | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M акционен експерт | SmolVLM2-500M-Video-Instruct | Експерт за совпаѓање на проток | arXiv 2506.01844 |
| Octo-Small | 27 M | скала ViT-S, текстуален енкодер T5-Base | Дифузија | octo-small-1.5 card |
| ACT | ~80 M | ResNet, без јазичен модел | Директна регресија на парчиња | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 и SigLIP енкодери | Авторегресивни акциони токени | arXiv 2406.09246 |
Две редици вреди да се дискутираат. со приближно 80 M е помал од сè друго овде, но нема јазичен модел, па затоа не е VLA: учи една задача и не може да му се каже да прави друга. со 27 M е условен преку текстуален енкодер T5-Base, а не преку LLM основа. Добри основни линии, ниту еден не ви дава следење на инструкциите што ги подразбира етикетата.
TinyVLA-H, варијантата што ги носи главните резултати, е 1.3 B и се наоѓа над линијата. Подоброто прашање е дали моделот се вклопува во 24 GB за време на тренирањето и ја постигнува вашата контролна стапка при заклучување. Петте политики што можете да ги тренирате овде се на страницата за политики; TinyVLA има запис во арената ако сакате неговите бројки покрај оние на сите други.
TinyVLA: брзината доаѓа од главата, а не од 'backbone'
Очигледното толкување е дека го направиле јазичниот модел помал, па станал побрз. Аблацијата во трудот вели поинаку. Замената на 7 B 'backbone' на OpenVLA со приближно 1 B го намали предвидувањето по акција од 292 ms на 140 ms, што е добивка од 2 пати. TinyVLA-H, со споредлив број на параметри, работи на 14 ms на истата картичка. Другите 10 пати е 'action head'.
| Модел | Предвидување по акција | Измерено на |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA емитува акции како дискретизирани токени преку 'language model head', по еден за секоја димензија на акција, авторегресивно. TinyVLA прикачува дифузен декодер кој го произведува целиот дел одеднаш. Табела V ја содржи архитектурата на TinyVLA-H и го менува само 'head', на истите пет задачи со вистински роботи. Тоа е најчистиот доказ во кој било труд за аргументот совпаѓање на проток политиките ги прават, и причината Pi0 се оддалечи од декодирањето на токени.
| Глава на TinyVLA-H | ПоставиТопче | ПревртиШолја | НаредиКоцки | ЗатвориФиока | ОтвориКутија |
|---|---|---|---|---|---|
| Дифузија (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Трансформер за сегментирање акции | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Повеќеслоен перцептрон | 0 | 0 | 0 | 0 | 0 |
Бројките од 292 / 140 / 14 ms се од Табела IV, сите на еден A6000. Тие се по предвидување на акција и исклучуваат снимање со камера, претпроцесирање и сериско запишување на сервомоторите. Третирајте ја објавената латенција како долна граница, никогаш како контролна стапка. Нашите сопствени бројки го имаат истото ограничување: видете латенција на заклучување.
Што постигна TinyVLA
| Бенчмарк | Протокол | TinyVLA-H | Базни модели |
|---|---|---|---|
| MetaWorld, 50 задачи, симулација | Повеќезадачност, 50 демонстрации, 3 почетни вредности | 77.6 / 21.5 / 11.4 / 15.8 по тежина, просек 31.6 | Diffusion Policy просек 10.5 |
| Вистинска Franka Panda, 5 задачи | 100 траектории по задача, 20 обиди | 94.0 просек | OpenVLA 68.3, Diffusion Policy 35.3 |
| Бимануален UR5, 3 задачи | Повеќезадачност, 10 обиди по задача | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0 |
Бимануалниот ред има досадно објаснување кое самата статија го дава: OpenVLA е претходно трениран на Open X-Embodiment, кој се состои исклучиво од податоци со една рака, така што акциониот простор со две раце е надвор од дистрибуција и постигнува нула. Базната линија на дифузионата политика го надминува TinyVLA-H на две од тие три задачи. Позадина во написот за Open X-Embodiment.

Репозиториумот TinyVLA, од август 2026 година
Статијата е добра. Кодот е истражувачки испуст. Репозиториумот е github.com/liyaxuanliyaxuan/TinyVLA; неговиот README го датира објавувањето на кодот на 17 февруари 2025 година, а последниот commit е на 11 март 2025 година. Добро за репродукција на статија, проблем ако сакате одржувана библиотека.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt ги фиксира torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, и CUDA стекот на 11.x тркалата: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README бара Python 3.10; lerobot 0.6.1 бара 3.12 или понова, така што двете не можат да делат околина. Прво потврдете дека постои torch 2.0.1 изградба за вашата генерација на графички процесор. Ако извршувањето умре поради VRAM наместо тоа, контролната листа за недостиг на меморија е побрза отколку погодување.
TinyVLA исто така не чита LeRobot податочни множества. Неговиот формат е HDF5 во ACT-стил: action, language_raw, и група за набљудувања со слики од повеќе погледи, joint_positions, qpos и qvel. Складиштето испорачува data_utils/rlds_to_h5py.py за RLDS влез, и секоја задача е рачно регистрирана во aloha_scripts/constants.py со нејзиниот dataset_dir, episode_len и camera_names. Ако вашите епизоди дојдоа од lerobot или десктоп клиент, вие сте одговорни за конверзијата.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 претпоставува јазол со осум картички. Поставете го на 1 и намалете ја големината на серијата (batch size) далеку под 32. Нема варијанта со една графичка картичка (single-GPU) која се испорачува нагоре, така што командата не може да се изврши буквално на 4090.
- --deepspeed scripts/zero2.json покажува кон датотека која не е во директориумот scripts на највисоко ниво. Конфигурациите на DeepSpeed се испорачуваат на llava-pythia/scripts/zero2.json. Поправете ја патеката пред првото извршување.
- README бара името на излезниот директориум да содржи llava_pythia, плус lora ако е овозможен LoRA.
- Основата (backbone) е посебно преземање: lesjie/Llava-Pythia-400M, -700M или -1.3B. Нема единствена основна контролна точка (base checkpoint) на која насочувате политика на начинот на кој насочувате кон lerobot/smolvla_base.
SmolVLA: моделот под 1 милијарда параметри што можете да го извршите ова попладне
SmolVLA го изнесува истиот аргумент во рамките на одржувана библиотека. Тој има 450 милиони параметри на основа SmolVLM2-500M-Video-Instruct, а ефикасноста доаѓа од поставките што можете да ги прочитате од configuration_smolvla.py, наместо од тврдењето дека е мал.
| Поставка во configuration_smolvla.py | Стандардно | Што добивате |
|---|---|---|
| num_vlm_layers | 16 | Работат само првите 16 слоеви на јазичниот модел |
| expert_width_multiplier | 0.75 | Скриената големина на акциониот експерт е 75 проценти од VLM-от |
| self_attn_every_n_layers | 2 | Само-внимание испреплетено со вкрстено внимание |
| chunk_size / n_action_steps | 50 / 50 | Едно поминување емитува 50 акции и сите 50 се извршуваат |
| num_steps | 10 | Деноизирањето со усогласување на протокот е фиксирано на 10 чекори |
| tokenizer_max_length | 48 | Инструкцијата е скратена на 48 токени |
| freeze_vision_encoder / train_expert_only | True / True | Фино подесување го поместува експертот, а не визуелната кула |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Не е рецептот од трудот: неговото претходно тренирање користеше 100-чекорно загревање над 200000 чекори |
Предтренингот користеше 481 LeRobot збирки податоци од заедницата, 22.9 K епизоди и 10.6 M рамки на 4 графички процесори, 200000 чекори со глобална серија од 256; трудот го проценува целиот проект на околу 30 K GPU часа. Еден број за следење: блогот за лансирање на Hugging Face наведува 487 курирани збирки податоци, додека табелата во трудот наведува 481. Ние ја користиме бројката од трудот и го означуваме несогласувањето.

| Бенчмарк | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO просек, повеќезадачен | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World просек, повеќезадачен | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| Вистински SO-100, 3 задачи, повеќезадачен тренинг | 78.3 | - | 61.7 (3.5 B) | - |
| Вистински SO-100, 3 задачи, еднозадачен, без роботски предтренинг | 40.0 | - | - | 48.3 |
| SO-101 подигање-поставување лего, еднозадачен, во дистрибуција | 90 | - | - | 70 |
| SO-101 подигање-поставување лего, еднозадачен, надвор од дистрибуција | 50 | - | - | 40 |
LIBERO е симулација и сè што е компетентно сега постигнува резултати во осумдесеттите таму. Редот за вистински SO-100, каде што модел од 450 M победува модел од 3.5 B за 16.6 поени, е интересен; редот под него е противтежата. Отстранете го предтренингот од заедницата и повеќезадачниот тренинг и истиот модел паѓа на 40.0, под ACT. Одбранливото тврдење е дека мал модел не е автоматски полош, а не дека е подобар.
Една случајност помага: табелата Meta-World од трудот за SmolVLA ги содржи објавените бројки на TinyVLA како почетна точка, така што за прв пат двата модели се наоѓаат во една табела, SmolVLA-0.45B со 57.3 наспроти TinyVLA-H со 31.6. Исто така, се известува дека обуката на SmolVLA е околу 40 проценти побрза од Pi0 со 6 пати помалку меморија. Сето тоа доаѓа од авторите на SmolVLA; влезот во арената ги поврзува секоја вредност со нејзиниот извор.
Каде SmolVLA го поминува своето време
AY-Robots го наведува SmolVLA на 245 ms по чекор на акција и ACT на 20 ms во каталогот на политики. TinyVLA известува 14 ms по предвидување на акција. Овие бројки не се споредливи, а нивното третирање како такви е најчеста грешка во оваа тема: некои го мерат едно напредно поминување, некои го делат тоа поминување низ парче откако action chunking ќе го амортизира.
- SmolVLA емитува 50 акции по напредно поминување и ги извршува сите 50. При 30 fps што трудот ги користи на вистински роботи, едно заклучување покрива околу 1.7 секунди движење.
- Асинхроното заклучување го пресметува следниот дел додека тековниот сè уште се извршува: 9.7 s просечно завршување на задачата наспроти 13.75 s синхроно, приближно 30 проценти побрзо, и 19 циклуси на земање и поставување во фиксен прозорец од 60 секунди наспроти 9.
- Стапките на успех беа споредливи, а не подобри, 78.3 синхроно наспроти 73.3 асинхроно. Асинхроното купува пропусност, а не точност.
- Делењето на парчиња ја крие латентноста на пресметувањето, а не латентноста на мрежата, и ја прави политиката помалку реактивна бидејќи е посветена на 50 акции.
AY-Robots може автоматски да обезбеди облак GPU под кој ја опслужува вашата политика додека локалниот роботски клиент комуницира со таа крајна точка, а поодот носи неактивен надзорник за да се уништи себеси наместо тивко да наплатува. Она што не го прави е да го отстрани кружното патување преку јавниот интернет. Контролната јамка низ петте политики овде е од 20 до 485 ms по чекор на акција пред каква било мрежа, така што далечинското заклучување е изводливо за бавно земање и поставување, а не за брзо реактивно движење.

Фино подесување на SmolVLA на една потрошувачка картичка
Рачната патека, на lerobot 0.6.1, тековното PyPI издание од 23 август 2026 година. Сè подолу доаѓа од Hugging Face lerobot SmolVLA документацијата, преземена истиот ден; водената верзија е понежна.
- 1Инсталирајте lerobot со додатокот smolvla
Зависностите на SmolVLA се опционален додаток, не се дел од основната инсталација. Инсталирањето без нив, а потоа прашувањето зошто типот на политиката е непознат, е честа загуба од половина час.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Набавете податочно множество со доволно епизоди
Документацијата препорачува околу 50 епизоди и наведува дека истата задача со 25 не била доволна. AY-Robots го поставува минимумот на 30. Снимете свои, или започнете од директориумот со податочни множества.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Започнете со фино подесување
Командата од упатството за lerobot, непроменета. Документацијата наведува 20000 чекори за приближно 4 часа на една A100. На картичка од 24 GB, очекувајте подолго и измерете го.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Намалете ја големината на пакетот додека не одговара
batch_size=64 е документиран пример, а не ветување за вашата картичка. Документацијата советува да започнете со мала вредност и да ја зголемувате додека времето на вчитување останува кратко.
bashlerobot-train --help - 5Имплементирајте ја контролната точка на раката
Иста библиотека, една команда. Знаменцата за парчиња во реално време се коментирани во документацијата и се оние што треба да се користат на хардвер со мала моќност.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Без оглед на патот што ќе го изберете, ќе завршите со контролна точка плус конфигурацијата што ја произвела. Чувајте ја ревизијата на податочното множество, бројот на чекори и сидот покрај неа. lerobot стандардно користи сид 1000; влезната точка за фино подесување на GR00T воопшто не изложува сид, така што тие извршувања не се репродуцибилни бит-по-бит. Механиката е во документацијата за обука.
Два начини да се постави мал VLA на роботска рака
Вие сте сопственик на машината и начините на откажување. За SmolVLA тоа е разумно: еден pip додаток, една команда за обука, една команда за имплементација. За TinyVLA тоа е истражувачка репродукција со замрзнати пинови, скршена DeepSpeed патека и конверзија на податоци што ја пишувате сами.
- Набавете картичка од 24 GB, снимете 30 до 50 епизоди, проверете ги преносите од камерата рамка по рамка.
- pip install -e ".[smolvla]", lerobot-train против lerobot/smolvla_base, потоа послужете ја контролната точка на машината во која е приклучена раката.
- За TinyVLA: посебна conda околина, конвертирајте податоци во HDF5, регистрирајте ја задачата во constants.py, поправете ја патеката zero2.json, намалете го train.sh од осум GPU на еден.
- Без наплата по час откако картичката е платена.
- Заклучувањето се наоѓа до серво моторите, единствениот начин да се добие брза контролна јамка.
- Можете да го закрпите кодот на политиката, а TinyVLA е достапен само на овој начин.
- 4090 исклучува секоја ~3 B политика, така што нема локална споредба со GR00T N1.7 или Pi0.5.
- Поставувањето на околината е вистинската работа. Само пиновите на TinyVLA можат да чинат еден ден.
- Без редица, без повторен обид, без складирање на контролни точки. Рестартирање на чекор 14000 значи повторно започнување.
SmolVLA е една од петте политики овде. Вие избирате модел и податочно множество во форма, позадината изнајмува GPU според потребната VRAM, го извршува тренерот и ги запишува контролните точки во складиштето за објекти. Чекор по чекор: SmolVLA на SO-100, или целосната матрица на страницата за обука.
| Што испраќа платформата за SmolVLA | Вредност |
|---|---|
| големина на пакетот | 2 |
| стапка на учење | 1e-4 |
| максимални чекори | 20000 |
| акумулација на градиент | 8, and it does not reach the trainer |
| дополнителни опции во формата | seed, logFreq |
| ниво на GPU | RTX 4090 or any 24 GB card |
| формат на податочно множество | LeRobot v3.0 |
| минимални епизоди | 30 |
Прво, стандардната големина на пакетот овде е 2, а не 64 како во примерот од документацијата на lerobot, а поставката за акумулација на градиент е испратена, но нема ефект за SmolVLA, така што ефективниот пакет е навистина 2. Зголемете го намерно наместо да претпоставувате дека стандардната вредност се совпаѓа со онаа од изворот. Второ, TinyVLA воопшто не може да се обучува овде.
Извршување на нивото од 24 GB трае 2 до 5 часа по цена од 0.30 до 0.60 USD на час, приближно 1 до 3 USD. На нивото A100, политика од ~3 B е 3 до 6 часа по цена од 1.20 до 2.00 USD на час, приближно 4 до 12 USD. Видете ценовник, и истите операции од CLI и MCP серверот.
Кога мал модел е погрешен избор
Двата труда се повнимателни овде отколку резимеата. Анализата на неуспехот на TinyVLA е специфична: варијантата од 0,4 B не успеа трипати со погрешно читање на инструкцијата, што авторите го припишуваат на ограниченото разбирање на јазикот кај помалиот VLM, и тој режим исчезна кај 1,3 B. SmolVLA ја покажува истата крива од другиот крај: верзијата од 2,25 B на идентичната архитектура постигнува 88,75 на LIBERO и 68,24 на Meta-World наспроти 87,3 и 57,3 за моделот од 0,45 B.
- Се вклопува на картичка од 24 GB, што го намалува трошокот за експеримент од десетици долари на неколку.
- Доволно брз за да работи до раката, така што нема мрежен скок во контролната јамка.
- Се дотерува на податоци што едно лице може да ги сними, десетици епизоди наместо илјадници.
- Тежините, списокот со податоци и кодот на SmolVLA се јавни, така што лошиот резултат може да се дебагира.
- Послабо следење на инструкции: помалку јазични параметри, помала способност за одвојување слични референтни изрази.
- Помала просторна и визуелна генерализација на поставки што не сте ги снимиле.
- Почувствителен на дефекти во множеството податоци, со помалку претходно тренирање на кое може да се потпре.
- Повеќезадачната работа и работата со долг хоризонт сè уште фаворизираат поголеми модели, вклучувајќи ја и сопствената варијанта на SmolVLA од 2,25 B.
Споредбата што вреди да се направи не е TinyVLA наспроти SmolVLA. Тоа е SmolVLA наспроти ACT на вашата сопствена задача, а трудот за SmolVLA е аргументот зошто. Трениран со една задача без претходно тренирање за роботика, SmolVLA постигна просек од 40,0 на три SO-100 задачи каде што ACT со една задача постигна 48,3. Она што го подига на 78,3 е претходното тренирање во заедницата плус повеќезадачното тренирање, а не само архитектурата. На задачата SO-101 лего, и двете со една задача, SmolVLA победува: 90 наспроти 70 во дистрибуција. Потоа SmolVLA наспроти Pi0.5 ако буџетот дозволува.
Има помалку претходна преттренинг за покривање на лоши податоци, така што чиста крива на загуба на неисправно множество податоци ви дава политика која самоуверено го репродуцира дефектот. Документацијата на lerobot е директна во врска со структурата: 50 епизоди низ 5 позиции на коцки, по 10 за секоја позиција, функционираа; 25 не. Ако загубата изгледа добро и раката не прави ништо корисно, започнете со загубата паѓа, политиката не прави ништо, политиката работи само во едно поставување или собирање VLA податоци за обука кои се навистина употребливи.
Пет политики, една табела за споредба
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT со реален број на параметри, латентност на заклучување по чекор на акција, нивото на графички процесор што му е потребно на секој и минималниот број на епизоди пред да направи нешто корисно.
Споредете ги политикитеТабела за одлуки по која можете да постапите
| Вашата ситуација | Започнете со | Зошто |
|---|---|---|
| Една задача, добри демонстрации, без јазик | ACT | ~80 M, 20 ms, 24 GB картичка, без основен модел за преземање |
| Неколку поврзани задачи, по една инструкција за секоја | SmolVLA | 450 M, in lerobot, минимум 30 епизоди, 1 до 3 УСД по извршување |
| Специфично репродуцирање на резултатот од TinyVLA | TinyVLA-B or TinyVLA-H | Репозиториумот е единствениот пат: изолирана околина, конвертирани податоци |
| Повеќезадачност, разновидни инструкции, буџет за A100 | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms и 485 ms по чекор, 4 до 12 УСД по извршување |
| Сè уште нема робот | Управувајте со вистинска рака | Живата рака базирана на редица не бара регистрација и хардвер |
За последниот ред, раката во живо пренесува физички SO-100 со кој можете да управувате од прелистувачот без сметка, а трите начини за почеток ги покрива останатите. SO-100 е референтната рака овде, приближно 110 до 150 ЕУР во делови, со целосен водич за поставување.
Што доаѓа по моделите под 1 милијарда
Намалувањето на бројот на параметри е еден начин да се направи VLA евтин и не очигледно победнички. OpenVLA-OFT (arXiv 2502.19645) го задржува 7 B основниот модел и менува само како се декодираат дејствата, пријавувајќи 26x зголемување на пропусната моќ на генерирање дејства и LIBERO кој се зголемува од 76.5 на 97.1 проценти. BitVLA (arXiv 2506.07530) го прави секој тег на 1-битен BitNet b1.58 2B4T основен модел тернарен, пријавувајќи 11.0x помалку меморија и 4.4x помала латентност од крај до крај, додека се совпаѓа со целосно прецизниот OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) се наоѓа на линијата од 1 B со усогласување на протокот.
Заедничката нишка: декодерот за дејства, а не јазичниот модел, е местото каде што живее латентноста. Прашајте како една политика емитува дејства пред да прашате колку параметри има. Арената има 85 модели и 332 резултати, секој поврзан со неговиот извор; постои поширок преглед во нашиот вовед во VLA.
Може ли да го дотерам SmolVLA на RTX 4090?▾
Да. SmolVLA има 450 милиони параметри и AY-Robots го извршува на нивото RTX 4090 / 24 GB. Примерот на lerobot користи --batch_size=64, што е пример, а не гаранција за вашата картичка; документацијата советува да започнете со мала вредност и да ја зголемувате додека времето на вчитување останува кратко. Очекувајте подолго од приближно 4 часа што ги наведува документацијата за 20000 чекори на A100.
Дали TinyVLA е достапен во lerobot или на AY-Robots?▾
Не за двете. TinyVLA постои само во неговото истражувачко складиште, последен commit 11 март 2025 година, и неговиот формат е HDF5 во ACT-стил, а не LeRobot. AY-Robots тренира GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT. Ако сакате TinyVLA, треба сами да го изградите, и прво ќе треба да ја поправите патеката на DeepSpeed конфигурацијата во scripts/train.sh.
Дали модел од 450 милиони параметри е навистина конкурентен со модел од 3 милијарди?▾
Според сопствените бенчмаркови на авторите, да: 87.3 наспроти 86.0 на LIBERO во споредба со Pi0 претходно трениран за роботика со 3.3 милијарди параметри, и 78.3 наспроти 61.7 на три реални SO-100 задачи каде истата статија го означува Pi0 со 3.5 милијарди параметри. Ограничувањето е во истата статија: за една задача без претходно тренирање за роботика, SmolVLA паѓа на 40.0, под 48.3 на ACT.
Колку епизоди ми се потребни пред мал VLA да направи нешто?▾
AY-Robots го поставува минимумот за SmolVLA на 30 епизоди, а минимумот за ACT на 50. Документацијата на lerobot препорачува околу 50 и известува дека 25 не биле доволни за истата задача. Структурата е исто толку важна колку и бројот: сетот од статијата користел 5 позиции на коцки со по 10 епизоди за секоја.
Зошто објавените бројки за латентност толку многу се разликуваат?▾
Тие мерат различни работи. TinyVLA известува 14 ms по предвидување на акција на A6000; AY-Robots го наведува SmolVLA на 245 ms и ACT на 20 ms по чекор на акција. Некои бројки покриваат едно напредно поминување, некои го делат поминувањето низ блок од 50 акции, и речиси ниту едно не вклучува снимање од камера или запишување на сервомоторите.
Дали заклучувањето во облак го решава проблемот со графичкиот процесор?▾
Делумно. AY-Robots автоматски обезбедува под кој ја служи политиката додека локалниот клиент комуницира со таа крајна точка, со неактивен надзорник за да се уништи самиот наместо тивко да наплатува. Не може да го отстрани кружното патување преку јавниот интернет, а контролната јамка е веќе 20 до 485 ms по чекор на акција. Добро за бавно земање и поставување, не за брзо реактивно движење.
Sources
- TinyVLA: Кон брзи, податочно-ефикасни визуелно-јазично-акциони модели за роботска манипулација
- Официјално складиште за код на TinyVLA (README, requirements.txt, scripts/train.sh)
- Проектна страница на TinyVLA
- lesjie/Llava-Pythia-1.3B, тежините на основата на TinyVLA-H
- SmolVLA: Визуелно-јазично-акционен модел за достапна и ефикасна роботика
- Документација на lerobot: дотерување на SmolVLA
- lerobot: configuration_smolvla.py, стандардните поставки на SmolVLA
- lerobot/smolvla_base картичка на моделот
- SmolVLA: Ефикасен визуелно-јазично-акционен модел (блог на Hugging Face)
- lerobot на PyPI (0.6.1, бара Python 3.12 или понов)
- OpenVLA: Визуелно-јазично-акционен модел со отворен код
- Дотерување на визуелно-јазично-акциони модели: Оптимизирање на брзината и успехот (OpenVLA-OFT)
- BitVLA: 1-битни визуелно-јазично-акциони модели за роботска манипулација
- X-VLA: Трансформер со меки потсетници како скалабилен визуелно-јазично-акционен модел за повеќе инкарнации
- rail-berkeley/octo-small-1.5 картичка на моделот (27 милиони параметри)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started