Табелата за споредба на политики на AY-Robots со број на параметри, нивоа на графички процесори и латентност на заклучување за GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT
SmolVLATinyVLAМал VLAПотрошувачки графички процесорLeRobot

Мали VLA модели: TinyVLA, SmolVLA и случајот под 1 милијарда параметри

AY-Robots ResearchAugust 23, 202619 мин читање

TinyVLA и SmolVLA ставаат функционален VLA под 1 милијарда параметри. Реални бројки од двата труда, стандардните поставки на LeRobot, измерена латентност и колку чини едно извршување на картичка од 24 GB.

Речиси секој визио-јазичен-акционен модел за кој се пишува претпоставува картичка за центар за податоци. OpenVLA е со 7 милијарди параметри. GR00T N1.7 и Pi0.5 се околу 3 милијарди и бараат A100 80 GB за фино подесување. Ако картичката на вашето биро е 4090, таа класа на модели е недостапна.

Два труда тврдат дека не ви е потребна. TinyVLA (arXiv 2409.12514, прифатен од IEEE Robotics and Automation Letters во февруари 2025) гради VLA од основа од 400 милиони до 1.3 милијарди параметри плус глава за дифузна акција. SmolVLA (arXiv 2506.01844, поднесен на 2 јуни 2025) испорачува 450 милиони параметри со отворени тежини, отворени податоци и скрипта што работи на една потрошувачка картичка. Еве што измерија и двата, и каде аргументот за под-1 милијарда престанува да важи.

Што треба да знаете

  • TinyVLA се испорачува во три големини: 422 милиони вкупно со 101 милион за тренирање, 740 милиони со 138 милиони, 1.3 милијарди со 143 милиони. Само првите две се под 1 милијарда.
  • Неговата Табела IV мери 14 ms по предвидување на акција за TinyVLA-1B на една A6000, наспроти 292 ms за OpenVLA-7B и 140 ms за намален OpenVLA-1B.
  • Главата ја одржува таа брзина, а не основата: заменете ја дифузната глава на TinyVLA-H со ACT глава и петте задачи на вистински робот паѓаат од просек од 94.0 на едноцифрени бројки. MLP глава постигнува 0 насекаде.
  • SmolVLA е 450 милиони, приближно 100 милиони од нив се експерт за акција, претрениран на 481 LeRobot збирки на податоци од заедницата и 10.6 милиони рамки. Известува 87.3 на LIBERO наспроти 86.0 за роботски претрениран Pi0 со 3.3 милијарди, и 78.3 на три реални SO-100 задачи наспроти 61.7 за Pi0 со 3.5 милијарди.
  • Трениран за една задача без тоа претренирање, SmolVLA паѓа на 40.0 на тие задачи, под 48.3 на ACT. Малото не е автоматски лесно.
  • TinyVLA нема интеграција со LeRobot и користи CUDA 11.7 wheel stack. SmolVLA е во lerobot и чини приближно 1 до 3 USD по извршување на нивото од 24 GB овде.

Што всушност се смета за мал VLA

Бројот на параметри на картичката на моделот не е еден број. Може да значи вкупни тежини, тежини вчитани при заклучување, или тежини кои примаат градиенти за време на . TinyVLA ги пријавува и двете, а разликата е голема: TinyVLA-H е 1.3 B вкупно, но 143 M тренирачки, бидејќи визуелната кула и поголемиот дел од јазичниот модел остануваат замрзнати додека LoRA адаптерите и акционата глава се движат. Трудот го проценува тренирачкиот удел на околу 5 проценти.

МоделПараметриОсноваАкциона главаИзвор
TinyVLA-S422 M вкупно, 101 M тренирачкиLlava-Pythia ~400 MДифузија (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M вкупно, 138 M тренирачкиLlava-Pythia ~700 MДифузијаarXiv 2409.12514
TinyVLA-H1.3 B вкупно, 143 M тренирачкиLlava-Pythia ~1.3 BДифузијаarXiv 2409.12514
SmolVLA450 M, ~100 M акционен експертSmolVLM2-500M-Video-InstructЕксперт за совпаѓање на протокarXiv 2506.01844
Octo-Small27 Mскала ViT-S, текстуален енкодер T5-BaseДифузијаocto-small-1.5 card
ACT~80 MResNet, без јазичен моделДиректна регресија на парчињаAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 и SigLIP енкодериАвторегресивни акциони токениarXiv 2406.09246

Две редици вреди да се дискутираат. со приближно 80 M е помал од сè друго овде, но нема јазичен модел, па затоа не е VLA: учи една задача и не може да му се каже да прави друга. со 27 M е условен преку текстуален енкодер T5-Base, а не преку LLM основа. Добри основни линии, ниту еден не ви дава следење на инструкциите што ги подразбира етикетата.

Линијата од 1 B е произволна

TinyVLA-H, варијантата што ги носи главните резултати, е 1.3 B и се наоѓа над линијата. Подоброто прашање е дали моделот се вклопува во 24 GB за време на тренирањето и ја постигнува вашата контролна стапка при заклучување. Петте политики што можете да ги тренирате овде се на страницата за политики; TinyVLA има запис во арената ако сакате неговите бројки покрај оние на сите други.

TinyVLA: брзината доаѓа од главата, а не од 'backbone'

Очигледното толкување е дека го направиле јазичниот модел помал, па станал побрз. Аблацијата во трудот вели поинаку. Замената на 7 B 'backbone' на OpenVLA со приближно 1 B го намали предвидувањето по акција од 292 ms на 140 ms, што е добивка од 2 пати. TinyVLA-H, со споредлив број на параметри, работи на 14 ms на истата картичка. Другите 10 пати е 'action head'.

МоделПредвидување по акцијаИзмерено на
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA емитува акции како дискретизирани токени преку 'language model head', по еден за секоја димензија на акција, авторегресивно. TinyVLA прикачува дифузен декодер кој го произведува целиот дел одеднаш. Табела V ја содржи архитектурата на TinyVLA-H и го менува само 'head', на истите пет задачи со вистински роботи. Тоа е најчистиот доказ во кој било труд за аргументот совпаѓање на проток политиките ги прават, и причината Pi0 се оддалечи од декодирањето на токени.

Глава на TinyVLA-HПоставиТопчеПревртиШолјаНаредиКоцкиЗатвориФиокаОтвориКутија
Дифузија (droid_diffusion)90.098.398.396.786.7
Трансформер за сегментирање акции13.38.38.313.323.3
Повеќеслоен перцептрон00000
Што опфаќаат бројките на TinyVLA

Бројките од 292 / 140 / 14 ms се од Табела IV, сите на еден A6000. Тие се по предвидување на акција и исклучуваат снимање со камера, претпроцесирање и сериско запишување на сервомоторите. Третирајте ја објавената латенција како долна граница, никогаш како контролна стапка. Нашите сопствени бројки го имаат истото ограничување: видете латенција на заклучување.

Што постигна TinyVLA

БенчмаркПротоколTinyVLA-HБазни модели
MetaWorld, 50 задачи, симулацијаПовеќезадачност, 50 демонстрации, 3 почетни вредности77.6 / 21.5 / 11.4 / 15.8 по тежина, просек 31.6Diffusion Policy просек 10.5
Вистинска Franka Panda, 5 задачи100 траектории по задача, 20 обиди94.0 просекOpenVLA 68.3, Diffusion Policy 35.3
Бимануален UR5, 3 задачиПовеќезадачност, 10 обиди по задача76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Бимануалниот ред има досадно објаснување кое самата статија го дава: OpenVLA е претходно трениран на Open X-Embodiment, кој се состои исклучиво од податоци со една рака, така што акциониот простор со две раце е надвор од дистрибуција и постигнува нула. Базната линија на дифузионата политика го надминува TinyVLA-H на две од тие три задачи. Позадина во написот за Open X-Embodiment.

Табелата на AY-Robots арената, табела што може да се сортира со 85 VLA модели со 332 резултати од бенчмарк, при што секоја вредност е поврзана со статијата или картичката на моделот од која потекнува
Бројките од крос-моделните бенчмаркови се споредливи само кога можете да видите од каде потекнува секоја од нив.

Репозиториумот TinyVLA, од август 2026 година

Статијата е добра. Кодот е истражувачки испуст. Репозиториумот е github.com/liyaxuanliyaxuan/TinyVLA; неговиот README го датира објавувањето на кодот на 17 февруари 2025 година, а последниот commit е на 11 март 2025 година. Добро за репродукција на статија, проблем ако сакате одржувана библиотека.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Инсталационата низа од TinyVLA README, проверена наспроти складиштето на 2026-08-23.
Фиксираните зависности се стапица која одзема цел ден

requirements.txt ги фиксира torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, и CUDA стекот на 11.x тркалата: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README бара Python 3.10; lerobot 0.6.1 бара 3.12 или понова, така што двете не можат да делат околина. Прво потврдете дека постои torch 2.0.1 изградба за вашата генерација на графички процесор. Ако извршувањето умре поради VRAM наместо тоа, контролната листа за недостиг на меморија е побрза отколку погодување.

TinyVLA исто така не чита LeRobot податочни множества. Неговиот формат е HDF5 во ACT-стил: action, language_raw, и група за набљудувања со слики од повеќе погледи, joint_positions, qpos и qvel. Складиштето испорачува data_utils/rlds_to_h5py.py за RLDS влез, и секоја задача е рачно регистрирана во aloha_scripts/constants.py со нејзиниот dataset_dir, episode_len и camera_names. Ако вашите епизоди дојдоа од lerobot или десктоп клиент, вие сте одговорни за конверзијата.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Скратено од scripts/train.sh. Секое знаменце и вредност погоре се наоѓаат во испорачаната датотека.
  • --num_gpus=8 претпоставува јазол со осум картички. Поставете го на 1 и намалете ја големината на серијата (batch size) далеку под 32. Нема варијанта со една графичка картичка (single-GPU) која се испорачува нагоре, така што командата не може да се изврши буквално на 4090.
  • --deepspeed scripts/zero2.json покажува кон датотека која не е во директориумот scripts на највисоко ниво. Конфигурациите на DeepSpeed се испорачуваат на llava-pythia/scripts/zero2.json. Поправете ја патеката пред првото извршување.
  • README бара името на излезниот директориум да содржи llava_pythia, плус lora ако е овозможен LoRA.
  • Основата (backbone) е посебно преземање: lesjie/Llava-Pythia-400M, -700M или -1.3B. Нема единствена основна контролна точка (base checkpoint) на која насочувате политика на начинот на кој насочувате кон lerobot/smolvla_base.

SmolVLA: моделот под 1 милијарда параметри што можете да го извршите ова попладне

SmolVLA го изнесува истиот аргумент во рамките на одржувана библиотека. Тој има 450 милиони параметри на основа SmolVLM2-500M-Video-Instruct, а ефикасноста доаѓа од поставките што можете да ги прочитате од configuration_smolvla.py, наместо од тврдењето дека е мал.

Поставка во configuration_smolvla.pyСтандардноШто добивате
num_vlm_layers16Работат само првите 16 слоеви на јазичниот модел
expert_width_multiplier0.75Скриената големина на акциониот експерт е 75 проценти од VLM-от
self_attn_every_n_layers2Само-внимание испреплетено со вкрстено внимание
chunk_size / n_action_steps50 / 50Едно поминување емитува 50 акции и сите 50 се извршуваат
num_steps10Деноизирањето со усогласување на протокот е фиксирано на 10 чекори
tokenizer_max_length48Инструкцијата е скратена на 48 токени
freeze_vision_encoder / train_expert_onlyTrue / TrueФино подесување го поместува експертот, а не визуелната кула
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Не е рецептот од трудот: неговото претходно тренирање користеше 100-чекорно загревање над 200000 чекори

Предтренингот користеше 481 LeRobot збирки податоци од заедницата, 22.9 K епизоди и 10.6 M рамки на 4 графички процесори, 200000 чекори со глобална серија од 256; трудот го проценува целиот проект на околу 30 K GPU часа. Еден број за следење: блогот за лансирање на Hugging Face наведува 487 курирани збирки податоци, додека табелата во трудот наведува 481. Ние ја користиме бројката од трудот и го означуваме несогласувањето.

Страницата на моделот SmolVLA на AY-Robots која го прикажува бројот на параметри, нивото на 24 GB графички процесор, латентноста на заклучување по чекор на акција и минималниот број на епизоди
Страницата на платформата за SmolVLA: 450 M параметри, 245 ms по чекор на акција, ниво RTX 4090, минимум 30 епизоди.
БенчмаркSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO просек, повеќезадачен87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World просек, повеќезадачен57.368.2447.9 (3.5 B, robotics-pretrained)-
Вистински SO-100, 3 задачи, повеќезадачен тренинг78.3-61.7 (3.5 B)-
Вистински SO-100, 3 задачи, еднозадачен, без роботски предтренинг40.0--48.3
SO-101 подигање-поставување лего, еднозадачен, во дистрибуција90--70
SO-101 подигање-поставување лего, еднозадачен, надвор од дистрибуција50--40
Прочитајте ја целата табела, а не само насловниот ред

LIBERO е симулација и сè што е компетентно сега постигнува резултати во осумдесеттите таму. Редот за вистински SO-100, каде што модел од 450 M победува модел од 3.5 B за 16.6 поени, е интересен; редот под него е противтежата. Отстранете го предтренингот од заедницата и повеќезадачниот тренинг и истиот модел паѓа на 40.0, под ACT. Одбранливото тврдење е дека мал модел не е автоматски полош, а не дека е подобар.

Една случајност помага: табелата Meta-World од трудот за SmolVLA ги содржи објавените бројки на TinyVLA како почетна точка, така што за прв пат двата модели се наоѓаат во една табела, SmolVLA-0.45B со 57.3 наспроти TinyVLA-H со 31.6. Исто така, се известува дека обуката на SmolVLA е околу 40 проценти побрза од Pi0 со 6 пати помалку меморија. Сето тоа доаѓа од авторите на SmolVLA; влезот во арената ги поврзува секоја вредност со нејзиниот извор.

Каде SmolVLA го поминува своето време

AY-Robots го наведува SmolVLA на 245 ms по чекор на акција и ACT на 20 ms во каталогот на политики. TinyVLA известува 14 ms по предвидување на акција. Овие бројки не се споредливи, а нивното третирање како такви е најчеста грешка во оваа тема: некои го мерат едно напредно поминување, некои го делат тоа поминување низ парче откако action chunking ќе го амортизира.

  • SmolVLA емитува 50 акции по напредно поминување и ги извршува сите 50. При 30 fps што трудот ги користи на вистински роботи, едно заклучување покрива околу 1.7 секунди движење.
  • Асинхроното заклучување го пресметува следниот дел додека тековниот сè уште се извршува: 9.7 s просечно завршување на задачата наспроти 13.75 s синхроно, приближно 30 проценти побрзо, и 19 циклуси на земање и поставување во фиксен прозорец од 60 секунди наспроти 9.
  • Стапките на успех беа споредливи, а не подобри, 78.3 синхроно наспроти 73.3 асинхроно. Асинхроното купува пропусност, а не точност.
  • Делењето на парчиња ја крие латентноста на пресметувањето, а не латентноста на мрежата, и ја прави политиката помалку реактивна бидејќи е посветена на 50 акции.
Далечинското заклучување не е бесплатно, и ниту една платформа не ја поправа физиката

AY-Robots може автоматски да обезбеди облак GPU под кој ја опслужува вашата политика додека локалниот роботски клиент комуницира со таа крајна точка, а поодот носи неактивен надзорник за да се уништи себеси наместо тивко да наплатува. Она што не го прави е да го отстрани кружното патување преку јавниот интернет. Контролната јамка низ петте политики овде е од 20 до 485 ms по чекор на акција пред каква било мрежа, така што далечинското заклучување е изводливо за бавно земање и поставување, а не за брзо реактивно движење.

Табелата за споредба на политиките на AY-Robots која ги прикажува GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT со број на параметри, потребна GPU класа, латентност на заклучување по чекор на акција и минимален број на епизоди што секоја ги бара
SmolVLA на ~450 M и ACT на ~80 M се двете што се вклопуваат на картичка од 24 GB. Останатите три бараат A100 или H100 80 GB.

Фино подесување на SmolVLA на една потрошувачка картичка

Рачната патека, на lerobot 0.6.1, тековното PyPI издание од 23 август 2026 година. Сè подолу доаѓа од Hugging Face lerobot SmolVLA документацијата, преземена истиот ден; водената верзија е понежна.

  1. 1
    Инсталирајте lerobot со додатокот smolvla

    Зависностите на SmolVLA се опционален додаток, не се дел од основната инсталација. Инсталирањето без нив, а потоа прашувањето зошто типот на политиката е непознат, е честа загуба од половина час.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Набавете податочно множество со доволно епизоди

    Документацијата препорачува околу 50 епизоди и наведува дека истата задача со 25 не била доволна. AY-Robots го поставува минимумот на 30. Снимете свои, или започнете од директориумот со податочни множества.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Започнете со фино подесување

    Командата од упатството за lerobot, непроменета. Документацијата наведува 20000 чекори за приближно 4 часа на една A100. На картичка од 24 GB, очекувајте подолго и измерете го.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Намалете ја големината на пакетот додека не одговара

    batch_size=64 е документиран пример, а не ветување за вашата картичка. Документацијата советува да започнете со мала вредност и да ја зголемувате додека времето на вчитување останува кратко.

    bash
    lerobot-train --help
  5. 5
    Имплементирајте ја контролната точка на раката

    Иста библиотека, една команда. Знаменцата за парчиња во реално време се коментирани во документацијата и се оние што треба да се користат на хардвер со мала моќност.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Контролната точка е испорачлива

Без оглед на патот што ќе го изберете, ќе завршите со контролна точка плус конфигурацијата што ја произвела. Чувајте ја ревизијата на податочното множество, бројот на чекори и сидот покрај неа. lerobot стандардно користи сид 1000; влезната точка за фино подесување на GR00T воопшто не изложува сид, така што тие извршувања не се репродуцибилни бит-по-бит. Механиката е во документацијата за обука.

Два начини да се постави мал VLA на роботска рака

Вие сте сопственик на машината и начините на откажување. За SmolVLA тоа е разумно: еден pip додаток, една команда за обука, една команда за имплементација. За TinyVLA тоа е истражувачка репродукција со замрзнати пинови, скршена DeepSpeed патека и конверзија на податоци што ја пишувате сами.

  1. Набавете картичка од 24 GB, снимете 30 до 50 епизоди, проверете ги преносите од камерата рамка по рамка.
  2. pip install -e ".[smolvla]", lerobot-train против lerobot/smolvla_base, потоа послужете ја контролната точка на машината во која е приклучена раката.
  3. За TinyVLA: посебна conda околина, конвертирајте податоци во HDF5, регистрирајте ја задачата во constants.py, поправете ја патеката zero2.json, намалете го train.sh од осум GPU на еден.
Предности
  • Без наплата по час откако картичката е платена.
  • Заклучувањето се наоѓа до серво моторите, единствениот начин да се добие брза контролна јамка.
  • Можете да го закрпите кодот на политиката, а TinyVLA е достапен само на овој начин.
Недостатоци
  • 4090 исклучува секоја ~3 B политика, така што нема локална споредба со GR00T N1.7 или Pi0.5.
  • Поставувањето на околината е вистинската работа. Само пиновите на TinyVLA можат да чинат еден ден.
  • Без редица, без повторен обид, без складирање на контролни точки. Рестартирање на чекор 14000 значи повторно започнување.

Кога мал модел е погрешен избор

Двата труда се повнимателни овде отколку резимеата. Анализата на неуспехот на TinyVLA е специфична: варијантата од 0,4 B не успеа трипати со погрешно читање на инструкцијата, што авторите го припишуваат на ограниченото разбирање на јазикот кај помалиот VLM, и тој режим исчезна кај 1,3 B. SmolVLA ја покажува истата крива од другиот крај: верзијата од 2,25 B на идентичната архитектура постигнува 88,75 на LIBERO и 68,24 на Meta-World наспроти 87,3 и 57,3 за моделот од 0,45 B.

Избор на VLA под 1 B
Каде победува
  • Се вклопува на картичка од 24 GB, што го намалува трошокот за експеримент од десетици долари на неколку.
  • Доволно брз за да работи до раката, така што нема мрежен скок во контролната јамка.
  • Се дотерува на податоци што едно лице може да ги сними, десетици епизоди наместо илјадници.
  • Тежините, списокот со податоци и кодот на SmolVLA се јавни, така што лошиот резултат може да се дебагира.
Каде губи
  • Послабо следење на инструкции: помалку јазични параметри, помала способност за одвојување слични референтни изрази.
  • Помала просторна и визуелна генерализација на поставки што не сте ги снимиле.
  • Почувствителен на дефекти во множеството податоци, со помалку претходно тренирање на кое може да се потпре.
  • Повеќезадачната работа и работата со долг хоризонт сè уште фаворизираат поголеми модели, вклучувајќи ја и сопствената варијанта на SmolVLA од 2,25 B.

Споредбата што вреди да се направи не е TinyVLA наспроти SmolVLA. Тоа е SmolVLA наспроти ACT на вашата сопствена задача, а трудот за SmolVLA е аргументот зошто. Трениран со една задача без претходно тренирање за роботика, SmolVLA постигна просек од 40,0 на три SO-100 задачи каде што ACT со една задача постигна 48,3. Она што го подига на 78,3 е претходното тренирање во заедницата плус повеќезадачното тренирање, а не само архитектурата. На задачата SO-101 лего, и двете со една задача, SmolVLA победува: 90 наспроти 70 во дистрибуција. Потоа SmolVLA наспроти Pi0.5 ако буџетот дозволува.

При оваа големина, множеството податоци го одлучува исходот

Има помалку претходна преттренинг за покривање на лоши податоци, така што чиста крива на загуба на неисправно множество податоци ви дава политика која самоуверено го репродуцира дефектот. Документацијата на lerobot е директна во врска со структурата: 50 епизоди низ 5 позиции на коцки, по 10 за секоја позиција, функционираа; 25 не. Ако загубата изгледа добро и раката не прави ништо корисно, започнете со загубата паѓа, политиката не прави ништо, политиката работи само во едно поставување или собирање VLA податоци за обука кои се навистина употребливи.

Пет политики, една табела за споредба

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT со реален број на параметри, латентност на заклучување по чекор на акција, нивото на графички процесор што му е потребно на секој и минималниот број на епизоди пред да направи нешто корисно.

Споредете ги политиките

Табела за одлуки по која можете да постапите

Вашата ситуацијаЗапочнете соЗошто
Една задача, добри демонстрации, без јазикACT~80 M, 20 ms, 24 GB картичка, без основен модел за преземање
Неколку поврзани задачи, по една инструкција за секојаSmolVLA450 M, in lerobot, минимум 30 епизоди, 1 до 3 УСД по извршување
Специфично репродуцирање на резултатот од TinyVLATinyVLA-B or TinyVLA-HРепозиториумот е единствениот пат: изолирана околина, конвертирани податоци
Повеќезадачност, разновидни инструкции, буџет за A100GR00T N1.7 or Pi0.5~3 B, 152 ms и 485 ms по чекор, 4 до 12 УСД по извршување
Сè уште нема роботУправувајте со вистинска ракаЖивата рака базирана на редица не бара регистрација и хардвер

За последниот ред, раката во живо пренесува физички SO-100 со кој можете да управувате од прелистувачот без сметка, а трите начини за почеток ги покрива останатите. SO-100 е референтната рака овде, приближно 110 до 150 ЕУР во делови, со целосен водич за поставување.

Што доаѓа по моделите под 1 милијарда

Намалувањето на бројот на параметри е еден начин да се направи VLA евтин и не очигледно победнички. OpenVLA-OFT (arXiv 2502.19645) го задржува 7 B основниот модел и менува само како се декодираат дејствата, пријавувајќи 26x зголемување на пропусната моќ на генерирање дејства и LIBERO кој се зголемува од 76.5 на 97.1 проценти. BitVLA (arXiv 2506.07530) го прави секој тег на 1-битен BitNet b1.58 2B4T основен модел тернарен, пријавувајќи 11.0x помалку меморија и 4.4x помала латентност од крај до крај, додека се совпаѓа со целосно прецизниот OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) се наоѓа на линијата од 1 B со усогласување на протокот.

Заедничката нишка: декодерот за дејства, а не јазичниот модел, е местото каде што живее латентноста. Прашајте како една политика емитува дејства пред да прашате колку параметри има. Арената има 85 модели и 332 резултати, секој поврзан со неговиот извор; постои поширок преглед во нашиот вовед во VLA.

Може ли да го дотерам SmolVLA на RTX 4090?

Да. SmolVLA има 450 милиони параметри и AY-Robots го извршува на нивото RTX 4090 / 24 GB. Примерот на lerobot користи --batch_size=64, што е пример, а не гаранција за вашата картичка; документацијата советува да започнете со мала вредност и да ја зголемувате додека времето на вчитување останува кратко. Очекувајте подолго од приближно 4 часа што ги наведува документацијата за 20000 чекори на A100.

Дали TinyVLA е достапен во lerobot или на AY-Robots?

Не за двете. TinyVLA постои само во неговото истражувачко складиште, последен commit 11 март 2025 година, и неговиот формат е HDF5 во ACT-стил, а не LeRobot. AY-Robots тренира GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT. Ако сакате TinyVLA, треба сами да го изградите, и прво ќе треба да ја поправите патеката на DeepSpeed конфигурацијата во scripts/train.sh.

Дали модел од 450 милиони параметри е навистина конкурентен со модел од 3 милијарди?

Според сопствените бенчмаркови на авторите, да: 87.3 наспроти 86.0 на LIBERO во споредба со Pi0 претходно трениран за роботика со 3.3 милијарди параметри, и 78.3 наспроти 61.7 на три реални SO-100 задачи каде истата статија го означува Pi0 со 3.5 милијарди параметри. Ограничувањето е во истата статија: за една задача без претходно тренирање за роботика, SmolVLA паѓа на 40.0, под 48.3 на ACT.

Колку епизоди ми се потребни пред мал VLA да направи нешто?

AY-Robots го поставува минимумот за SmolVLA на 30 епизоди, а минимумот за ACT на 50. Документацијата на lerobot препорачува околу 50 и известува дека 25 не биле доволни за истата задача. Структурата е исто толку важна колку и бројот: сетот од статијата користел 5 позиции на коцки со по 10 епизоди за секоја.

Зошто објавените бројки за латентност толку многу се разликуваат?

Тие мерат различни работи. TinyVLA известува 14 ms по предвидување на акција на A6000; AY-Robots го наведува SmolVLA на 245 ms и ACT на 20 ms по чекор на акција. Некои бројки покриваат едно напредно поминување, некои го делат поминувањето низ блок од 50 акции, и речиси ниту едно не вклучува снимање од камера или запишување на сервомоторите.

Дали заклучувањето во облак го решава проблемот со графичкиот процесор?

Делумно. AY-Robots автоматски обезбедува под кој ја служи политиката додека локалниот клиент комуницира со таа крајна точка, со неактивен надзорник за да се уништи самиот наместо тивко да наплатува. Не може да го отстрани кружното патување преку јавниот интернет, а контролната јамка е веќе 20 до 485 ms по чекор на акција. Добро за бавно земање и поставување, не за брзо реактивно движење.

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started