Samanburðartafla AY-Robots fyrir stefnur með fjölda færibreyta, GPU flokkum og ályktunartíma fyrir GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA og ACT
SmolVLATinyVLALítil VLANeyslu-GPULeRobot

Lítil VLA líkön: TinyVLA, SmolVLA og tilfellið undir 1 milljarði færibreyta

AY-Robots ResearchAugust 23, 202619 mínútna lestur

TinyVLA og SmolVLA setja virkt VLA undir 1 milljarð færibreyta. Rauntölur úr báðum greinum, sjálfgefnar stillingar LeRobot, mældur leyndartími og hvað keyrsla kostar á 24 GB korti.

Næstum hvert sjón-tungumál-aðgerðarlíkan sem skrifað er um gerir ráð fyrir gagnamiðstöðvarkorti. OpenVLA er 7 milljarðar færibreytna. GR00T N1.7 og Pi0.5 eru um 3 milljarðar og þurfa A100 80 GB til fínstillingar. Ef kortið á skrifborðinu þínu er 4090, er sú gerð líkana utan seilingar.

Tvær greinar halda því fram að þú þurfir það ekki. TinyVLA (arXiv 2409.12514, samþykkt af IEEE Robotics and Automation Letters í febrúar 2025) byggir VLA úr 400 milljóna til 1,3 milljarða burðarás ásamt dreifingaraðgerðarhaus. SmolVLA (arXiv 2506.01844, sent inn 2. júní 2025) sendir 450 milljónir færibreytna með opnum þyngdum, opnum gögnum og skriftu sem keyrir á einu neytendakorti. Hér er það sem báðir mældu, og hvar röksemdin um undir-1 milljarð hættir að halda.

Það sem þú þarft að vita

  • TinyVLA er fáanlegt í þremur stærðum: 422 milljónir samtals með 101 milljón þjálfanlegra, 740 milljónir með 138 milljónum, 1,3 milljarðar með 143 milljónum. Aðeins fyrstu tvær eru undir 1 milljarði.
  • Tafla IV þess mælir 14 ms á hverja aðgerðarspá fyrir TinyVLA-1B á einu A6000, samanborið við 292 ms fyrir OpenVLA-7B og 140 ms fyrir minnkað OpenVLA-1B.
  • Hausinn heldur þeim hraða, ekki burðarásinn: skiptu dreifingarhaus TinyVLA-H út fyrir ACT haus og fimm raunverulegu vélmennaverkefnin falla úr 94,0 meðaltali niður í einnar tölu. MLP haus skorar 0 alls staðar.
  • SmolVLA er 450 milljónir, um 100 milljónir af því aðgerðasérfræðingurinn, forþjálfað á 481 samfélags LeRobot gagnasöfnum og 10,6 milljónum ramma. Það skilar 87,3 á LIBERO samanborið við 86,0 fyrir vélmennaforþjálfaðan Pi0 á 3,3 milljörðum, og 78,3 á þremur raunverulegum SO-100 verkefnum samanborið við 61,7 fyrir Pi0 á 3,5 milljörðum.
  • Þjálfað sem eitt verkefni án þeirrar forþjálfunar, fellur SmolVLA niður í 40,0 á þeim verkefnum, undir 48,3 hjá ACT. Lítið er ekki sjálfkrafa auðvelt.
  • TinyVLA hefur enga LeRobot samþættingu og festir CUDA 11.7 hjólastafla. SmolVLA er í lerobot og kostar um það bil 1 til 3 USD á keyrslu á 24 GB flokki hér.

Hvað telst í raun lítið VLA

Fjöldi færibreyta á líkanakorti er ekki ein tala. Það getur þýtt heildarþyngdir, þyngdir sem hlaðnar eru við ályktun, eða þyngdir sem fá halla meðan á stendur. TinyVLA skýrir frá báðum, og bilið er mikið: TinyVLA-H er 1.3 B samtals en 143 M þjálfanlegt, vegna þess að sjónkerfið og mest af málalíkaninu haldast frosin á meðan LoRA millistykki og aðgerðarhausinn hreyfast. Greinin setur þjálfanlega hlutann í um 5 prósent.

LíkanFæribreyturBurðarvirkiAðgerðarhausHeimild
TinyVLA-S422 M total, 101 M trainableLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M trainableLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M trainableLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M action expertSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, no language modelDirect chunk regressionAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersAutoregressive action tokensarXiv 2406.09246

Tvær raðir eru umdeildar. sem er um 80 M er minna en allt annað hér en hefur ekkert málalíkan, svo það er ekki VLA: það lærir eitt verkefni og er ekki hægt að segja að það geri annað. sem er 27 M er skilyrt í gegnum T5-Base textakóðara, ekki LLM burðarvirki. Góðir grunnlínur, hvorugur gefur þér leiðbeiningarnar sem merkið gefur til kynna.

1 B línan er handahófskennd

TinyVLA-H, afbrigðið sem ber fyrirsagnarárangurinn, er 1.3 B og situr fyrir ofan línuna. Betri spurningin er hvort líkan passi í 24 GB við þjálfun og nái stjórnhraða þínum við ályktun. Fimm stefnur sem þú getur þjálfað hér eru á stefnusíðunni; TinyVLA hefur færslu í vettvangi ef þú vilt sjá tölur þess við hlið annarra.

TinyVLA: hraðinn kemur frá hausnum, ekki burðarásnum

Augljós lestur er að þeir gerðu tungumálalíkanið minna, svo það varð hraðara. Ablation rannsókn greinarinnar segir annað. Að skipta út 7 B burðarás OpenVLA fyrir um það bil 1 B minnkaði spá á hverja aðgerð úr 292 ms í 140 ms, 2x aukning. TinyVLA-H, með sambærilegan fjölda færibreyta, keyrir á 14 ms á sama korti. Hin 10x aukningin er aðgerðarhausinn.

LíkanSpá á hverja aðgerðMælt á
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA gefur frá sér aðgerðir sem stakrænar tákn í gegnum tungumálalíkanhausinn, eitt fyrir hverja aðgerðarvídd, sjálfvirkt. TinyVLA tengir dreifingarkóðara sem framleiðir allan hlutann í einu lagi. Tafla V sýnir arkitektúrinn í TinyVLA-H og skiptir aðeins um hausinn, á sömu fimm raunverulegu vélmennaverkefnunum. Þetta eru hreinustu sannanirnar í hvorri greininni fyrir röksemdafærsluna flæðisjöfnun sem stefnur byggðar á flæðisjöfnun gera, og ástæðan fyrir því að Pi0 færði sig frá táknkóðun.

Á TinyVLA-HSetja tennisboltaSnúa krúsStafla kubbumLoka skúffuOpna kassa
Dreifing (droid_diffusion)90.098.398.396.786.7
Aðgerðarhluta spennir13.38.38.313.323.3
Fjöllaga skynjari00000
Hvað TinyVLA tölurnar ná yfir

Tölurnar 292 / 140 / 14 ms eru úr töflu IV, allar á einni A6000. Þær eru fyrir hverja aðgerðarspá og útiloka myndatöku, forvinnslu og raðskrift á servóin. Líta skal á birtan leyndartíma sem neðri mörk, aldrei sem stjórnhraða. Okkar eigin tölur hafa sömu takmörkun: sjá leyndartíma ályktunar.

Hvað TinyVLA skoraði

ViðmiðBókunTinyVLA-HGrunnlínur
MetaWorld, 50 verkefni, hermunFjölverkefni, 50 sýnishorn, 3 fræ77.6 / 21.5 / 11.4 / 15.8 eftir erfiðleikum, meðaltal 31.6Meðaltal dreifingarstefnu 10.5
Raunverulegur Franka Panda, 5 verkefni100 ferlar á verkefni, 20 tilraunir94.0 að meðaltaliOpenVLA 68.3, Dreifingarstefna 35.3
Tvíhöfða UR5, 3 verkefniFjölverkefni, 10 tilraunir á verkefni76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Dreifingarstefna 40.3 / 31.3 / 43.0

Tvíhandaröðin hefur leiðinlega skýringu sem greinin sjálf gefur: OpenVLA er forþjálfað á Open X-Embodiment, sem samanstendur eingöngu af einarma gögnum, svo tvíarma aðgerðarými er utan dreifingar og fær núll stig. Grunnlína dreifingarstefnunnar slær TinyVLA-H í tveimur af þessum þremur verkefnum. Bakgrunnur í greininni um Open X-Embodiment.

AY-Robots stigataflan, raðanleg tafla yfir 85 VLA líkön með 332 viðmiðunarniðurstöðum, þar sem hvert gildi er tengt aftur við greinina eða líkanakortið sem það kom frá
Viðmiðunartölur milli líkana eru aðeins sambærilegar þegar hægt er að sjá hvaðan hver og ein kom.

TinyVLA geymslan, frá ágúst 2026

Greinin er góð. Kóðinn er rannsóknarútgáfa. Geymslan er github.com/liyaxuanliyaxuan/TinyVLA; README skrá hennar dagsetur kóðaútgáfuna til 17. febrúar 2025 og síðasta commit er 11. mars 2025. Gott til að endurtaka grein, vandamál ef þú vildir viðhaldið safn.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Uppsetningarröðin úr TinyVLA README, athuguð gegn geymslunni þann 2026-08-23.
Festingar ósjálfstæðra eininga eru gildran sem étur daginn

requirements.txt festir torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, og CUDA staflann við 11.x hjólin: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README skjalið biður um Python 3.10; lerobot 0.6.1 krefst 3.12 eða nýrra, svo þau tvö geta ekki deilt umhverfi. Staðfestu fyrst að torch 2.0.1 útgáfa sé til fyrir þína GPU kynslóð. Ef keyrsla deyr vegna VRAM í staðinn, er gátlistinn fyrir minnisleysi hraðari en að giska.

TinyVLA les heldur ekki LeRobot gagnasöfn. Snið þess er ACT-stíll HDF5: action, language_raw, og athugunarhópur með fjölmyndamyndum, joint_positions, qpos og qvel. Geymslan sendir með data_utils/rlds_to_h5py.py fyrir RLDS inntak, og hvert verkefni er skráð handvirkt í aloha_scripts/constants.py með dataset_dir, episode_len og camera_names. Ef þínir þættir komu frá lerobot eða skjáborðsforritinu, þá átt þú umbreytinguna.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Stytt útgáfa af scripts/train.sh. Sérhver fáni og gildi hér að ofan er í skránni sem fylgir.
  • --num_gpus=8 gerir ráð fyrir átta korta hnút. Stilltu það á 1 og lækkaðu lotustærðina vel undir 32. Engin ein-GPU útgáfa er send uppstreymis, svo skipunina er ekki hægt að keyra orðrétt á 4090.
  • --deepspeed scripts/zero2.json vísar á skrá sem er ekki í efstu scripts möppunni. DeepSpeed stillingarnar eru sendar með á llava-pythia/scripts/zero2.json. Lagaðu slóðina fyrir fyrstu keyrslu.
  • README skjalið krefst þess að nafn úttaksmöppunnar innihaldi llava_pythia, auk lora ef LoRA er virkt.
  • Burðarvirkið er sér niðurhal: lesjie/Llava-Pythia-400M, -700M eða -1.3B. Það er enginn einn grunnathugunarpunktur sem þú vísar stefnu á eins og þú vísar á lerobot/smolvla_base.

SmolVLA: líkanið undir 1 B sem þú getur keyrt í dag

SmolVLA færir sömu rök innan viðhaldins safns. Það er 450 M færibreytur á SmolVLM2-500M-Video-Instruct burðarvirki, og skilvirkni kemur frá stillingum sem þú getur lesið úr configuration_smolvla.py frekar en frá fullyrðingu um að vera lítið.

Stilling í configuration_smolvla.pySjálfgefiðHvað það skilar
num_vlm_layers16Aðeins fyrstu 16 tungumálalíkanlögin keyra
expert_width_multiplier0.75Falin stærð aðgerðasérfræðings er 75 prósent af VLM
self_attn_every_n_layers2Sjálfsathygli samtvinnuð krossathygli
chunk_size / n_action_steps50 / 50Ein keyrsla gefur frá sér 50 aðgerðir og allar 50 eru framkvæmdar
num_steps10Flæðisjöfnun hávaðaminnkun fest við 10 skref
tokenizer_max_length48Leiðbeiningin er stytt í 48 tákn
freeze_vision_encoder / train_expert_onlyTrue / TrueFínstilling færir sérfræðinginn, ekki sjónturninn
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Ekki uppskrift úr greininni: forþjálfun hennar notaði 100 skrefa upphitun yfir 200000 skref

Forþjálfun notaði 481 LeRobot gagnasöfn samfélagsins, 22.9 K þætti og 10.6 M ramma á 4 GPUum, 200000 skrefum í alþjóðlegri lotu upp á 256; greinin metur allt verkefnið á um 30 K GPU klukkustundir. Eitt númer til að fylgjast með: Hugging Face kynningarbloggið segir 487 safnaðar gagnasöfn þar sem tafla greinarinnar segir 481. Við notum tölu greinarinnar og merkjum ósamræmið.

ViðmiðSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO meðaltal, fjölverkefni87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World meðaltal, fjölverkefni57.368.2447.9 (3.5 B, robotics-pretrained)-
Raunverulegt SO-100, 3 verkefni, fjölverkefnaþjálfun78.3-61.7 (3.5 B)-
Raunverulegt SO-100, 3 verkefni, eitt verkefni, engin forþjálfun í vélfærafræði40.0--48.3
SO-101 lego taka-setja, eitt verkefni, í dreifingu90--70
SO-101 lego taka-setja, eitt verkefni, utan dreifingar50--40
Lestu alla töfluna, ekki aðalfyrirsagnaröðina

LIBERO er hermun og allt sem er hæft skorar núna á áttunda áratugnum þar. Raunverulega SO-100 röðin, þar sem 450 M líkan sigrar 3.5 B líkan um 16.6 stig, er sú áhugaverða; röðin undir henni er mótvægið. Fjarlægðu forþjálfun samfélagsins og fjölverkefnaþjálfunina og sama líkanið fellur niður í 40.0, undir ACT. Varnarleg krafa er sú að lítið líkan sé ekki sjálfkrafa verra, ekki að það sé betra.

Eitt tilviljun hjálpar: Meta-World tafla SmolVLA greinarinnar inniheldur birtar tölur TinyVLA sem grunnlínu, svo í eitt skipti sitja báðar gerðirnar í einni töflu, SmolVLA-0.45B á 57.3 á móti TinyVLA-H á 31.6. Hún greinir einnig frá því að SmolVLA þjálfun sé um 40 prósent hraðari en Pi0 á 6x minna minni. Allt þetta kemur frá höfundum SmolVLA; skráningin í vettvanginum tengir hvert gildi við uppruna sinn.

Hvar SmolVLA eyðir tíma sínum

AY-Robots skráir SmolVLA á 245 ms á hvert aðgerðarskref og ACT á 20 ms í stefnuskrá. TinyVLA greinir frá 14 ms á hverja aðgerðarspá. Þessar tölur eru ekki sambærilegar, og að meðhöndla þær eins og þær væru er algengustu mistökin í þessu efni: sumir mæla einn framsendingarferil, sumir deila þeim ferli yfir hluta þegar aðgerðarhlutun hefur afskrifað hann.

  • SmolVLA gefur frá sér 50 aðgerðir á hverjum framsendingarferli og framkvæmir allar 50. Við 30 ramma á sekúndu sem greinin notar á raunverulegum vélmennum, nær ein ályktun yfir um 1.7 sekúndur af hreyfingu.
  • Ósamstillt ályktun reiknar næsta hluta á meðan sá núverandi er enn í framkvæmd: 9.7 s meðalverkefnalokun á móti 13.75 s samstilltri, um 30 prósent hraðari, og 19 taka-og-setja hringrásir í föstum 60 sekúndna glugga á móti 9.
  • Árangurshlutfall var sambærilegt frekar en betra, 78.3 samstillt á móti 73.3 ósamstilltu. Ósamstilling kaupir afköst, ekki nákvæmni.
  • Hlutun felur tölvuviðbragðstíma, ekki netviðbragðstíma, og hún gerir stefnuna minna viðbragðsgóða vegna þess að hún er bundin við 50 aðgerðir.
Fjarlæg ályktun er ekki ókeypis, og enginn vettvangur lagar eðlisfræði

AY-Robots geta sjálfvirkt úthlutað skýja-GPU-einingu sem þjónar stefnu þinni á meðan staðbundinn vélmennaforritari talar við þann endapunkt, og einingin er með aðgerðalausan varðhund svo hún eyðir sér frekar en að rukka hljóðlaust. Það sem hún gerir ekki er að fjarlægja hringferð um almenna internetið. Stýrilykkjan yfir fimm stefnur hér er 20 til 485 ms á hverju aðgerðarskrefi áður en nokkurt net er til staðar, svo fjarlæg ályktun er möguleg fyrir hæga tínslu og staðsetningu, en ekki fyrir hraðvirka viðbragðshreyfingu.

Samanburðartafla AY-Robots stefna sem sýnir GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA og ACT með fjölda færibreyta, nauðsynlegri GPU-flokkun, ályktunartíma á hverju aðgerðarskrefi og lágmarksfjölda þátta sem hver þarf
SmolVLA við ~450 M og ACT við ~80 M eru þær tvær sem passa á 24 GB kort. Hinar þrjár þurfa A100 eða H100 80 GB.

Fínstilling SmolVLA á einu neytendakorti

Handvirka leiðin, á lerobot 0.6.1, núverandi PyPI útgáfa frá 23. ágúst 2026. Allt hér að neðan kemur frá Hugging Face lerobot SmolVLA skjölunum, sótt sama dag; leiðbeinda útgáfan er mildari.

  1. 1
    Setja upp lerobot með smolvla viðbótinni

    SmolVLA-háðir pakkar eru valfrjáls viðbót, ekki hluti af grunnuppsetningu. Að setja upp án þeirra og velta því svo fyrir sér hvers vegna stefnugerðin er óþekkt er algeng hálftíma töf.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Fáðu gagnasafn með nægum þáttum

    Skjölin mæla með um 50 þáttum og segja að sama verkefni með 25 hafi ekki verið nóg. AY-Robots setur lágmarkið við 30. Taktu upp þína eigin, eða byrjaðu frá gagnasafnaskránni.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Hefja fínstillingu

    Skipunin úr lerobot leiðbeiningunum, óbreytt. Skjölin segja að 20000 skref taki um það bil 4 klukkustundir á einu A100. Á 24 GB korti, búist við lengri tíma og mælið hann.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Lækka lotustærðina þar til hún passar

    batch_size=64 er skjalfest dæmi, ekki loforð um kortið þitt. Skjölin ráðleggja að byrja smátt og auka á meðan hleðslutímar haldast stuttir.

    bash
    lerobot-train --help
  5. 5
    Keyra gátpunktinn út á arminn

    Sama safn, ein skipun. Rauntíma skiptingarflöggin eru útskýrð í skjölunum og eru þau sem á að nota á vélbúnaði með litla aflgjafa.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Gátpunkturinn er afraksturinn

Hvaða leið sem þú ferð, endarðu með gátpunkt ásamt stillingunum sem framleiddu hann. Haltu gagnasafnsútgáfunni, skrefafjöldanum og fræinu við hliðina á honum. lerobot notar sjálfgefið fræ 1000; fínstillingarinnar inngangspunktur GR00T sýnir ekkert fræ yfirleitt, svo þessar keyrslur eru ekki nákvæmlega endurgeranlegar. Vélbúnaður í þjálfunarskjölunum.

Tvær leiðir til að koma litlum VLA á arm

Þú átt vélina og bilunarhamina. Fyrir SmolVLA er það sanngjarnt: ein pip viðbót, ein þjálfunarskipun, ein útfærsluskipun. Fyrir TinyVLA er það rannsóknarútgáfa með frosnum pinnum, brotinni DeepSpeed slóð og gagnabreytingu sem þú skrifar sjálfur.

  1. Fáðu þér 24 GB kort, taktu upp 30 til 50 þætti, staðfestu myndavélarstraumana ramma fyrir ramma.
  2. pip install -e ".[smolvla]", lerobot-train gegn lerobot/smolvla_base, þjónaðu síðan gátpunktinum á vélinni sem armurinn er tengdur við.
  3. Fyrir TinyVLA: aðskilið conda umhverfi, breyttu gögnum í HDF5, skráðu verkefnið í constants.py, lagaðu zero2.json slóðina, minnkaðu train.sh úr átta GPU í eitt.
Kostir
  • Engin tímagjöld þegar kortið er greitt.
  • Ályktun er við hliðina á servóunum, eina leiðin til að fá hraðan stjórnlykkju.
  • Þú getur lagað stefnukóðann, og TinyVLA er aðeins fáanlegt á þennan hátt.
Málamiðlanir
  • 4090 útilokar allar ~3 B stefnur, svo enginn staðbundinn samanburður við GR00T N1.7 eða Pi0.5.
  • Uppsetning umhverfis er raunverulega vinnan. Pinnar TinyVLA einir geta kostað heilan dag.
  • Engin biðröð, engin endurtekning, engin gátpunktsgeymsla. Endurræsing á skrefi 14000 þýðir að byrja upp á nýtt.

Þegar lítið líkan er rangur kostur

Báðar greinarnar eru varkárari hér en samantektirnar. Bilunargreining TinyVLA er sértæk: 0,4 B afbrigðið mistókst þrisvar sinnum með því að lesa leiðbeiningarnar rangt, sem höfundar rekja til takmarkaðs málskilnings í minni VLM, og sá háttur hvarf við 1,3 B. SmolVLA sýnir sömu ferilinn frá hinum endanum: 2,25 B útgáfan af sömu arkitektúr skorar 88,75 á LIBERO og 68,24 á Meta-World á móti 87,3 og 57,3 fyrir 0,45 B líkanið.

Að velja VLA undir 1 B
Þar sem það vinnur
  • Passar á 24 GB kort, sem lækkar kostnað tilraunar úr tugum dollara í nokkra.
  • Nógu hratt til að keyra við hliðina á arminum, svo enginn netstökk í stjórnlykkjunni.
  • Fínstillir á gögnum sem einn einstaklingur getur tekið upp, tugum þátta frekar en þúsundum.
  • Þyngdir, gagnaskrá og kóði SmolVLA eru opinber, svo hægt er að kemba slæma niðurstöðu.
Þar sem það tapar
  • Veikari fylgni við leiðbeiningar: færri málfæribreytur, minni geta til að aðgreina svipaðar tilvísanir.
  • Minni staðbundin og sjónræn alhæfing á uppsetningar sem þú tókst ekki upp.
  • Næmari fyrir göllum í gagnasafni, með minni forþjálfun til að falla aftur á.
  • Fjölverkavinnsla og langtímaverkefni styðja enn stærri líkön, þar á meðal 2,25 B afbrigði SmolVLA.

Samanburðurinn sem vert er að keyra er ekki TinyVLA á móti SmolVLA. Það er SmolVLA á móti ACT á þínu eigin verkefni, og SmolVLA greinin er röksemdin fyrir því hvers vegna. Þjálfað í einu verkefni án forþjálfunar í vélfærafræði, náði SmolVLA að meðaltali 40,0 yfir þrjú SO-100 verkefni þar sem ACT í einu verkefni náði 48,3. Það sem lyftir því í 78,3 er forþjálfun samfélagsins ásamt fjölverkavinnsla, ekki arkitektúrinn einn. Í SO-101 legóverkefninu, bæði í einu verkefni, vinnur SmolVLA: 90 á móti 70 í dreifingu. Síðan SmolVLA á móti Pi0.5 ef fjárhagsáætlunin leyfir.

Við þessa stærð ræður gagnasafnið útkoman

Minni forþjálfun er til staðar til að hylja slæm gögn, svo hrein tapferill á gölluðu gagnasafni gefur þér stefnu sem endurskapar gallann af öryggi. lerobot skjöl eru hreinskilin um uppbyggingu: 50 þættir yfir 5 teningastöður, 10 á stöðu, virkuðu; 25 gerðu það ekki. Ef tapið lítur vel út og armurinn gerir ekkert gagnlegt, byrjaðu á tapið fellur, stefnan gerir ekkert, stefnan virkar aðeins í einni uppsetningu eða að safna VLA þjálfunargögnum sem eru raunverulega nothæf.

Fimm stefnur, ein samanburðartafla

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA og ACT með raunverulegum færibreikjafjölda, ályktunartíma á hverju aðgerðarskrefi, GPU-flokknum sem hver þarf og lágmarksfjölda þátta áður en það gerir eitthvað gagnlegt.

Bera saman stefnurnar

Ákvörðunartafla sem þú getur byggt á

Þín staðaByrjaðu áAf hverju
Eitt verkefni, góðar sýnikennslur, ekkert tungumálACT~80 M, 20 ms, 24 GB card, no base model to download
Nokkur skyld verkefni, ein leiðbeining hvertSmolVLA450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run
Endurgera TinyVLA niðurstöðuna sérstaklegaTinyVLA-B or TinyVLA-HThe repo is the only route: isolated env, converted data
Fjölverkefni, fjölbreyttar leiðbeiningar, A100 fjárhagsáætlunGR00T N1.7 or Pi0.5~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run
Enginn vélmenni ennþáStýrðu raunverulegum armiBiðraðarmiðuð lifandi armur þarf enga skráningu og engan vélbúnað

Fyrir síðustu röð, lifandi armurinn streymir líkamlegum SO-100 sem þú getur stýrt úr vafranum án reiknings, og þrjár leiðir til að byrja fjallar um restina. SO-100 er viðmiðunararmurinn hér, um það bil 110 til 150 EUR í hlutum, með fullkominni uppsetningarleiðbeiningu.

Hvað kemur eftir líkönin undir 1 B

Að minnka fjölda færibreyta er ein leið til að gera VLA ódýrt og ekki augljóslega sú vinnandi. OpenVLA-OFT (arXiv 2502.19645) heldur 7 B burðarásnum og breytir aðeins hvernig aðgerðir eru afkóðaðar, og greinir frá 26x aukningu í gegnumstreymi aðgerðamyndunar og LIBERO hækkar úr 76,5 í 97,1 prósent. BitVLA (arXiv 2506.07530) gerir hverja þyngd 1-bita BitNet b1.58 2B4T burðarásar þrígilda, og greinir frá 11,0x minni minni og 4,4x lægri heildarleynd á meðan hún passar við fullnákvæmni OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) situr á 1 B línunni með flæðisjöfnun.

Sameiginlegi þráðurinn: aðgerðarafkóðarinn, ekki tungumálalíkanið, er þar sem leyndin býr. Spyrðu hvernig stefna gefur frá sér aðgerðir áður en þú spyrð hversu margar færibreytur hún hefur. Vettvangurinn hefur 85 líkön og 332 niðurstöður, hver tengd uppruna sínum; það er víðtækara yfirlit í VLA kynningu okkar.

Get ég fínstillt SmolVLA á RTX 4090?

Já. SmolVLA er 450 M færibreytur og AY-Robots keyrir það á RTX 4090 / 24 GB flokki. Lerobot dæmið notar --batch_size=64, sem er dæmi frekar en trygging fyrir kortið þitt; skjölun ráðleggur að byrja smátt og auka á meðan hleðslutímar haldast stuttir. Búist við lengri tíma en þeim um það bil 4 klukkustundum sem skjölun nefnir fyrir 20000 skref á A100.

Er TinyVLA fáanlegt í lerobot eða á AY-Robots?

Nei við báðu. TinyVLA er aðeins til í rannsóknargeymslunni sinni, síðasta commit 11. mars 2025, og snið þess er ACT-stíll HDF5 frekar en LeRobot. AY-Robots þjálfar GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA og ACT. Ef þú vilt TinyVLA þarftu að byggja það sjálfur, og þú verður að laga DeepSpeed config slóðina í scripts/train.sh fyrst.

Er 450 M líkan virkilega samkeppnishæft við 3 B líkan?

Samkvæmt eigin viðmiðum höfundanna, já: 87.3 á móti 86.0 á LIBERO samanborið við vélfærafræði-forþjálfaðan Pi0 á 3.3 B, og 78.3 á móti 61.7 á þremur raunverulegum SO-100 verkefnum þar sem sama grein merkir Pi0 á 3.5 B. Takmörkunin er í sömu grein: eitt verkefni án vélfærafræði-forþjálfunar, SmolVLA fellur í 40.0, undir 48.3 hjá ACT.

Hversu marga þætti þarf ég áður en lítið VLA gerir eitthvað?

AY-Robots setur lágmark SmolVLA á 30 þætti og lágmark ACT á 50. Lerobot skjölun mælir með um 50 og greinir frá því að 25 hafi ekki verið nóg fyrir sama verkefni. Uppbygging skiptir jafn miklu máli og fjöldi: safn greinarinnar notaði 5 teningastöður með 10 þáttum hver.

Hvers vegna eru birtar tafir tölur svona ósamræmanlegar?

Þær mæla mismunandi hluti. TinyVLA greinir frá 14 ms á hverja aðgerðarspá á A6000; AY-Robots skráir SmolVLA á 245 ms og ACT á 20 ms á hvert aðgerðarskref. Sumar tölur ná yfir eina framsendingu, sumar skipta framsendingu yfir 50 aðgerða hluta, og næstum engar innihalda myndavélarupptöku eða skrif í servó.

Leysir skýjaályktun GPU vandamálið?

Að hluta til. AY-Robots útvegar sjálfkrafa pod sem þjónar stefnunni á meðan staðbundinn biðlari talar við þann endapunkt, með aðgerðalausum varðhundi svo hann eyðir sér frekar en að rukka hljóðlaust. Það getur ekki fjarlægt hringferð um almennt internet, og stjórnlykkjan er nú þegar 20 til 485 ms á hvert aðgerðarskref. Gott fyrir hæga tínslu og staðsetningu, ekki fyrir hraðvirka viðbragðshreyfingu.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started