AY-Robots poliitikate võrdlustabel parameetrite arvudega, GPU tasemetega ja järeldamise latentsusega mudelitele GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ja ACT
SmolVLATinyVLAVäike VLATavatarbija GPULeRobot

Väikesed VLA mudelid: TinyVLA, SmolVLA ja alla 1B parameetri juhtum

AY-Robots ResearchAugust 23, 202619 min lugemist

TinyVLA ja SmolVLA paigutavad töötava VLA alla 1 miljardi parameetri. Tegelikud numbrid mõlemast artiklist, lerobot'i vaikeseaded, mõõdetud latentsus ja mida üks käitus 24 GB kaardil maksab.

Peaaegu iga nägemis-keele-tegevuse mudel millest kirjutatakse, eeldab andmekeskuse kaarti. OpenVLA on 7 miljardit parameetrit. GR00T N1.7 ja Pi0.5 on umbes 3 miljardit ja vajavad peenhäälestamiseks A100 80 GB. Kui teie laual olev kaart on 4090, on see mudeliklass kättesaamatu.

Kaks artiklit väidavad, et seda pole vaja. TinyVLA (arXiv 2409.12514, aktsepteeritud IEEE Robotics and Automation Letters poolt veebruaris 2025) ehitab VLA 400 miljonist kuni 1,3 miljardist selgroost pluss difusioonitegevuse pea. SmolVLA (arXiv 2506.01844, esitatud 2. juunil 2025) tarnib 450 miljonit parameetrit avatud kaalude, avatud andmete ja skriptiga, mis töötab ühel tarbijakaardil. Siin on see, mida mõlemad mõõtsid, ja kus alla 1 miljardi argument enam ei kehti.

Mida peate teadma

  • TinyVLA tarnib kolmes suuruses: 422 miljonit kokku 101 miljoni treenitavaga, 740 miljonit 138 miljoniga, 1,3 miljardit 143 miljoniga. Ainult kaks esimest jäävad alla 1 miljardi.
  • Selle tabel IV mõõdab 14 ms tegevuse ennustuse kohta TinyVLA-1B jaoks ühel A6000-l, võrreldes 292 ms OpenVLA-7B ja 140 ms kahandatud OpenVLA-1B jaoks.
  • Seda kiirust hoiab pea, mitte selgroog: vahetage TinyVLA-H difusioonipea ACT pea vastu ja viis reaalse roboti ülesannet langevad 94,0 keskmiselt ühekohalisteks numbritest. MLP pea saab kõikjal 0 punkti.
  • SmolVLA on 450 miljonit, millest umbes 100 miljonit on tegevusekspert, eelkoolitatud 481 kogukonna LeRobot andmestikul ja 10,6 miljonil kaadril. See teatab LIBERO-l 87,3 võrreldes 86,0-ga robootika-eelkoolitatud Pi0-ga 3,3 miljardi juures ja 78,3 kolmel reaalsel SO-100 ülesandel võrreldes 61,7-ga Pi0-ga 3,5 miljardi juures.
  • Ühe ülesande jaoks ilma selle eelkoolituseta treenituna langeb SmolVLA nendel ülesannetel 40,0-le, mis on alla ACT 48,3. Väike ei tähenda automaatselt lihtsat.
  • TinyVLA-l puudub LeRoboti integratsioon ja see kasutab CUDA 11.7 rataste virna. SmolVLA on lerobot-is ja maksab siin 24 GB tasemel umbes 1 kuni 3 USD jooksu kohta.

Mis tegelikult loeb väikeseks VLA-ks

Mudelikaardi parameetrite arv ei ole üks number. See võib tähendada kaalu koguarvu, järeldamise ajal laaditud kaalusid või kaalusid, mis saavad gradienti . TinyVLA raporteerib mõlemat ja vahe on suur: TinyVLA-H on kokku 1,3 B, kuid treenitav on 143 M, sest nägemistorn ja enamik keelemudelist jäävad külmutatuks, samal ajal kui LoRA adapterid ja tegevuspea liiguvad. Artikkel paigutab treenitava osa umbes 5 protsendi juurde.

MudelParameetridTugivõrkTegevuspeaAllikas
TinyVLA-S422 M kokku, 101 M treenitavLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M kokku, 138 M treenitavLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1,3 B kokku, 143 M treenitavLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M tegevusekspertSmolVLM2-500M-Video-InstructVoolu sobitamise ekspertarXiv 2506.01844
Octo-Small27 MViT-S skaala, T5-Base tekstikodeerijaDiffusionocto-small-1.5 card
ACT~80 MResNet, keelemudel puudubOtsene tüki regressioonAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 ja SigLIP kodeerijadAutoregressiivsed tegevustokenidarXiv 2406.09246

Kaks rida väärivad arutelu. umbes 80 M juures on väiksem kui kõik muu siin, kuid sellel puudub keelemudel, seega ei ole see VLA: see õpib ühe ülesande ja seda ei saa käskida teist teha. 27 M juures on tingitud T5-Base tekstikodeerija kaudu, mitte LLM-i tugivõrgu kaudu. Head baasjooned, kumbki ei anna teile juhiste järgimist, mida silt eeldab.

1 B piir on meelevaldne

TinyVLA-H, peamisi tulemusi kandev variant, on 1,3 B ja asub üle joone. Parem küsimus on, kas mudel mahub treeningu ajal 24 GB-sse ja saavutab järeldamise ajal teie kontrollmäära. Viis poliitikat, mida siin treenida saab, on poliitikate lehel; TinyVLA-l on areeni kirje, kui soovite selle numbreid kõigi teiste omade kõrval.

TinyVLA: kiirus tuleb peast, mitte selgroost

Ilmselge tõlgendus on, et nad tegid keelemudeli väiksemaks, nii et see muutus kiiremaks. Artiklis toodud ablatsioonanalüüs ütleb vastupidist. OpenVLA 7 B põhiosa asendamine ligikaudu 1 B suurusega vähendas tegevuse ennustamise aega 292 ms-lt 140 ms-le, mis on 2-kordne kiirendus. TinyVLA-H, võrreldava parameetrite arvuga, töötab samal kaardil 14 ms-ga. Ülejäänud 10-kordne kiirendus tuleb tegevuspeast.

MudelTegevuse ennustamise aegMõõdetud
OpenVLA-7B292 msüks A6000
OpenVLA-1B, põhiosa vahetatud TinyVLA oma vastu140 msüks A6000
TinyVLA-1B (TinyVLA-H)14 msüks A6000

OpenVLA väljastab tegevusi diskreetsete tokenitena läbi keelemudeli pea, üks tegevusdimensiooni kohta, autoregressiivselt. TinyVLA lisab difusioondekoodri, mis toodab kogu tüki ühe korraga. Tabel V näitab TinyVLA-H arhitektuuri ja vahetab ainult pea, samadel viiel reaalse roboti ülesandel. See on kõige selgem tõend kummaski artiklis argumendi kohta, mida voolu sobitamise poliitikad esitavad, ja põhjus, miks Pi0 loobus tokenite dekodeerimisest.

TinyVLA-H peaAseta tennisepallPööra kruusiVirnasta kuubikuidSulge sahtelAva karp
Difusioon (droid_diffusion)90.098.398.396.786.7
Tegevuse tükeldamise transformaator13.38.38.313.323.3
Mitmekihiline pertseptron00000
Mida TinyVLA numbrid hõlmavad

292 / 140 / 14 ms näitajad on tabelist IV, kõik ühel A6000-l. Need on tegevuse ennustuse kohta ja ei hõlma kaamera jäädvustamist, eeltöötlust ega jadasalvestust servodele. Käsitlege avaldatud latentsust kui alumist piiri, mitte kunagi kui juhtimiskiirust. Meie enda numbrid kannavad sama piirangut: vaadake järelduse latentsus.

Mida TinyVLA saavutas

VõrdlustestProtokollTinyVLA-HBaasjooned
MetaWorld, 50 ülesannet, simMitme ülesande, 50 demo, 3 seemet77.6 / 21.5 / 11.4 / 15.8 raskusastme järgi, keskmine 31.6Diffusion Policy keskmine 10.5
Päris Franka Panda, 5 ülesannet100 trajektoori ülesande kohta, 20 katset94.0 keskmineOpenVLA 68.3, Diffusion Policy 35.3
Kahekäeline UR5, 3 ülesannetMitme ülesande, 10 katset ülesande kohta76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Bimanuaalsel real on igav selgitus, mille paber ise annab: OpenVLA on eelkoolitatud Open X-Embodimentil, mis koosneb täielikult ühekäelistest andmetest, seega on kahekäeline tegevusruum jaotusest väljas ja see saab null punkti. Difusioonipoliitika baasjoon ületab TinyVLA-H-d kahel kolmest ülesandest. Taust on Open X-Embodimenti ülevaates.

AY-Robotsi areeni edetabel, sorteeritav tabel 85 VLA mudelist 332 võrdlustulemusega, kus iga väärtus on lingitud tagasi paberile või mudelikaardile, kust see pärineb.
Mudelitevahelised võrdlusnäitajad on võrreldavad ainult siis, kui on näha, kust igaüks neist pärineb.

TinyVLA repo, seisuga august 2026

Paber on hea. Kood on uurimistöö väljalase. Repositoorium on github.com/liyaxuanliyaxuan/TinyVLA; selle README dateerib koodi väljalaske 17. veebruarile 2025 ja viimane commit on 11. märts 2025. Sobib paberi reprodutseerimiseks, probleemiks, kui soovite hooldatud teeki.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
TinyVLA README-st pärit installijärjestus, kontrollitud repositooriumi vastu 2026-08-23.
Sõltuvuste fikseerimine on lõks, mis neelab terve päeva

requirements.txt fikseerib torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 ja CUDA virna 11.x ratastele: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README nõuab Python 3.10; lerobot 0.6.1 vajab 3.12 või uuemat, seega ei saa need kaks keskkonda jagada. Veenduge esmalt, et teie GPU generatsioonile on olemas torch 2.0.1 versioon. Kui käitus sureb VRAM-i puuduse tõttu, on mäluprobleemide kontrollnimekiri kiirem kui oletamine.

TinyVLA ei loe ka LeRoboti andmestikke. Selle formaat on ACT-stiilis HDF5: action, language_raw ja vaatluste grupp mitmevaateliste piltide, joint_positions, qpos ja qvel-iga. Repositooriumis on kaasas data_utils/rlds_to_h5py.py RLDS sisendi jaoks ja iga ülesanne registreeritakse käsitsi failis aloha_scripts/constants.py koos oma dataset_dir, episode_len ja camera_names. Kui teie episoodid pärinevad lerobotist või töölauakliendist, siis teisenduse eest vastutate teie.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Lühendatud failist scripts/train.sh. Iga ülaltoodud lipp ja väärtus on kaasasolevas failis.
  • --num_gpus=8 eeldab kaheksakaardilist sõlme. Määra see 1-le ja vähenda paketi suurust tunduvalt alla 32. Ühe GPU-ga varianti ei tarnita ülesvoolu, seega ei saa käsku 4090-l sõna-sõnalt käivitada.
  • --deepspeed scripts/zero2.json viitab failile, mis ei asu ülemise taseme scripts kataloogis. DeepSpeedi konfiguratsioonid asuvad llava-pythia/scripts/zero2.json. Paranda tee enne esimest käivitust.
  • README nõuab, et väljundkataloogi nimi sisaldaks llava_pythia, pluss lora, kui LoRA on lubatud.
  • Selgroog on eraldi allalaaditav: lesjie/Llava-Pythia-400M, -700M või -1.3B. Puudub üks baaskontrollpunkt, millele poliitikat suunata, nagu suunaksid lerobot/smolvla_base'ile.

SmolVLA: alla 1 B mudel, mida saad täna pärastlõunal käivitada

SmolVLA esitab sama argumendi hooldatud teegi sees. See on 450 M parameetrit SmolVLM2-500M-Video-Instruct selgrool ja efektiivsus tuleneb seadetest, mida saab lugeda failist configuration_smolvla.py, mitte väitest, et see on väike.

Seade failis configuration_smolvla.pyVaikimisiMida see annab
num_vlm_layers16Käivituvad ainult esimesed 16 keelemudeli kihti
expert_width_multiplier0.75Tegevuseksperdi peidetud suurus on 75 protsenti VLM-i omast
self_attn_every_n_layers2Enesetähelepanu põimitud risttähelepanuga
chunk_size / n_action_steps50 / 50Üks läbimine väljastab 50 tegevust ja kõik 50 täidetakse
num_steps10Voolu sobitamise müra eemaldamine fikseeritud 10 sammuga
tokenizer_max_length48Juhis kärbitakse 48 märgini
freeze_vision_encoder / train_expert_onlyTrue / TruePeenhäälestus liigutab eksperti, mitte nägemistorni
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Mitte paberi retsept: selle eelkoolitus kasutas 100-sammulist soojendust üle 200000 sammu

Eelõpe kasutas 481 kogukonna LeRobot andmestikku, 22,9 K episoodi ja 10,6 M kaadrit 4 GPU-l, 200000 sammu globaalse partii suurusega 256; artikli kohaselt oli kogu projekti maht umbes 30 K GPU tundi. Üks number, mida jälgida: Hugging Face'i käivitusblogi mainib 487 kureeritud andmestikku, samas kui artikli tabelis on 481. Me kasutame artikli numbrit ja märgime lahknevuse.

VõrdlusalusSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO keskmine, mitmeülesanne87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World keskmine, mitmeülesanne57.368.2447.9 (3.5 B, robotics-pretrained)-
Reaalne SO-100, 3 ülesannet, mitmeülesande treening78.3-61.7 (3.5 B)-
Reaalne SO-100, 3 ülesannet, üheülesanne, ilma robootika eelõppeta40.0--48.3
SO-101 lego valimine-paigutamine, üheülesanne, jaotuses90--70
SO-101 lego valimine-paigutamine, üheülesanne, väljaspool jaotust50--40
Loe tervet tabelit, mitte ainult pealkirjarida

LIBERO on simulatsioon ja kõik pädevad tulemused jäävad seal praegu kaheksakümnendatesse. Reaalne SO-100 rida, kus 450 M mudel edestab 3.5 B mudelit 16.6 punktiga, on huvitav; selle all olev rida on vastukaaluks. Eemaldades kogukonna eelõppe ja mitmeülesande treeningu, langeb sama mudel 40.0-le, jäädes alla ACT-le. Kaitstav väide on, et väike mudel ei ole automaatselt halvem, mitte et see oleks parem.

Üks juhus aitab: SmolVLA artikli Meta-World tabelis on TinyVLA enda avaldatud numbrid baasjoonena, nii et seekord on mõlemad mudelid ühes tabelis, SmolVLA-0.45B 57.3 vastu TinyVLA-H 31.6. Samuti teatatakse, et SmolVLA treenimine on umbes 40 protsenti kiirem kui Pi0, kasutades 6 korda vähem mälu. Kõik see pärineb SmolVLA autoritelt; arena kirje lingib iga väärtuse selle allikaga.

Kus SmolVLA oma aega veedab

AY-Robots loetleb SmolVLA-d 245 ms tegevussammu kohta ja ACT 20 ms kohta poliitikate kataloogis. TinyVLA teatab 14 ms tegevuse ennustuse kohta. Need numbrid ei ole võrreldavad ja nende käsitlemine võrreldavatena on selle teema kõige levinum viga: mõned ajastavad ühe edasisuunalise läbipääsu, mõned jagavad selle läbipääsu tüki peale, kui tegevuste tükeldamine selle amortiseerib.

  • SmolVLA väljastab 50 tegevust ühe edasisuunalise läbipääsu kohta ja täidab kõik 50. 30 kaadrit sekundis, mida artikkel reaalsetel robotitel kasutab, katab üks järeldus umbes 1.7 sekundit liikumist.
  • Asünkroonne järeldus arvutab järgmise tüki, samal ajal kui praegune veel täitub: 9.7 s keskmine ülesande täitmine võrreldes 13.75 s sünkroonsega, umbes 30 protsenti kiirem, ja 19 korjamis- ja paigutustsüklit fikseeritud 60-sekundilises aknas võrreldes 9-ga.
  • Edukad määrad olid pigem võrreldavad kui paremad, 78.3 sünkroonne võrreldes 73.3 asünkroonsega. Asünkroonsus ostab läbilaskevõimet, mitte täpsust.
  • Tükeldamine peidab arvutuslatentsust, mitte võrgulatentsust, ja see muudab poliitika vähem reaktiivseks, sest see on pühendunud 50 tegevusele.
Kaugjäreldamine ei ole tasuta ja ükski platvorm ei paranda füüsikat

AY-Robots suudab automaatselt varustada pilve GPU-podi, mis teenindab teie poliitikat, samal ajal kui kohalik roboti klient suhtleb selle lõpp-punktiga, ja pod sisaldab passiivset valvekoera, nii et see hävitab end ise, selle asemel et vaikselt arveid esitada. Mida see ei tee, on avaliku interneti edasi-tagasi reisi eemaldamine. Juhtimissilmus üle siinsete viie poliitika on 20 kuni 485 ms tegevussammu kohta enne igasugust võrku, seega on kaugjäreldamine teostatav aeglaseks valimiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks.

AY-Robots poliitikate võrdlustabel, mis näitab GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ja ACT-i koos parameetrite arvuga, nõutava GPU tasemega, järeldamise latentsusega tegevussammu kohta ja minimaalse episoodide arvuga, mida igaüks vajab.
SmolVLA (~450 M) ja ACT (~80 M) on kaks, mis mahuvad 24 GB kaardile. Ülejäänud kolm vajavad A100 või H100 80 GB.

SmolVLA peenhäälestamine ühel tarbijakaardil

Käsitsi tee, lerobot 0.6.1-l, praegune PyPI väljalase seisuga 23. august 2026. Kõik allolev pärineb Hugging Face lerobot SmolVLA dokumentatsioonist, mis on samal päeval alla laaditud; juhendatud versioon on leebem.

  1. 1
    Paigalda lerobot koos smolvla lisaga

    SmolVLA sõltuvused on valikuline lisa, mis ei kuulu põhipaigalduse hulka. Paigaldamine ilma nendeta ja seejärel imestamine, miks poliisi tüüp on tundmatu, on tavaline pool tundi kaotatud aega.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Hangi piisava episoodide arvuga andmestik

    Dokumentatsioon soovitab umbes 50 episoodi ja märgib, et sama ülesande puhul 25 episoodiga ei piisanud. AY-Robots määrab miinimumiks 30. Salvesta oma andmed või alusta andmestiku kataloogist.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Alusta peenhäälestust

    Käsk lerobot juhendist, muutmata. Dokumentatsioon hindab 20000 sammu umbes 4 tunniks ühel A100-l. 24 GB kaardil oota pikemat aega ja mõõda seda.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Vähenda paketi suurust, kuni see sobib

    batch_size=64 on dokumenteeritud näide, mitte lubadus teie kaardi kohta. Dokumentatsioon soovitab alustada väikselt ja suurendada, kuni laadimisaeg püsib lühike.

    bash
    lerobot-train --help
  5. 5
    Käivita kontrollpunkt robotkäel

    Sama teek, üks käsk. Reaalajas tükeldamise lipud on dokumentatsioonis kommenteeritud ja need on need, mida kasutada madala võimsusega riistvaral.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Kontrollpunkt on tulemus

Ükskõik millise tee te valite, lõpetate kontrollpunktiga pluss konfiguratsiooniga, mis selle tootis. Hoidke andmestiku revisjon, sammude arv ja seeme selle kõrval. lerobot vaikimisi seeme on 1000; GR00T peenhäälestuse sisenemispunkt ei paljasta üldse seemet, seega need käivitused ei ole bitipõhiselt reprodutseeritavad. Mehaanika treeningu dokumentatsioonis.

Kaks viisi väikese VLA robotkäele saamiseks

Teile kuulub masin ja vearežiimid. SmolVLA puhul on see mõistlik: üks pip lisa, üks treeningkäsk, üks käivitamiskäsk. TinyVLA puhul on see uurimistöö reprodutseerimine külmutatud pinidega, katkise DeepSpeed teega ja andmete teisendusega, mille kirjutate ise.

  1. Hangi 24 GB kaart, salvesta 30 kuni 50 episoodi, kontrolli kaamera vooge kaader haaval.
  2. pip install -e ".[smolvla]", lerobot-train lerobot/smolvla_base vastu, seejärel serveeri kontrollpunkti masinas, kuhu robotkäsi on ühendatud.
  3. TinyVLA jaoks: eraldi conda keskkond, teisenda andmed HDF5-ks, registreeri ülesanne failis constants.py, paranda zero2.json tee, vähenda train.sh kaheksalt GPU-lt ühele.
Eelised
  • Puudub tunnipõhine arveldamine, kui kaart on tasutud.
  • Järeldamine toimub servode kõrval, mis on ainus viis kiire juhtimisahela saamiseks.
  • Saate poliisi koodi parandada ja TinyVLA on saadaval ainult sel viisil.
Kompromissid
  • 4090 välistab iga ~3 B poliisi, seega puudub kohalik võrdlus GR00T N1.7 või Pi0.5 vastu.
  • Keskkonna seadistamine on tõeline töö. Ainuüksi TinyVLA pinid võivad maksta terve päeva.
  • Puudub järjekord, korduskatse, kontrollpunkti salvestus. Taaskäivitus sammul 14000 tähendab uuesti alustamist.

Kui väike mudel on vale valik

Mõlemad artiklid on siin hoolikamad kui kokkuvõtted. TinyVLA veaanalüüs on spetsiifiline: 0,4 B variant ebaõnnestus kolm korda juhise valesti lugemise tõttu, mida autorid omistavad väiksema VLM-i piiratud keelelisele mõistmisele, ja see režiim kadus 1,3 B juures. SmolVLA näitab sama kõverat teisest otsast: identse arhitektuuri 2,25 B versioon saavutab LIBERO-l 88,75 ja Meta-Worldil 68,24 punkti, võrreldes 0,45 B mudeli 87,3 ja 57,3-ga.

Alla 1 B VLA valimine
Kus see võidab
  • Mahub 24 GB kaardile, mis vähendab eksperimendi maksumust kümnetelt dollaritelt paari dollarini.
  • Piisavalt kiire, et töötada käe kõrval, seega puudub juhtimisahelas võrguhüpe.
  • Peenhäälestub andmetel, mida üks inimene saab salvestada, kümneid episoode tuhandete asemel.
  • SmolVLA kaalud, andmete loend ja kood on avalikud, nii et halb tulemus on silutav.
Kus see kaotab
  • Nõrgem juhiste järgimine: vähem keeleparameetreid, väiksem võime eristada sarnaseid viitavaid väljendeid.
  • Vähem ruumilist ja visuaalset üldistamist seadistustele, mida te ei salvestanud.
  • Tundlikum andmestiku defektide suhtes, vähem eeltreeningut, millele toetuda.
  • Mitme ülesande ja pika horisondi töö eelistab endiselt suuremaid mudeleid, sealhulgas SmolVLA enda 2,25 B varianti.

Võrdlus, mida tasub teha, ei ole TinyVLA SmolVLA vastu. See on SmolVLA vastu ACT teie enda ülesandel, ja SmolVLA artikkel on argument, miks. Ühe ülesande jaoks treenitud ilma robootika eeltreeninguta saavutas SmolVLA kolmel SO-100 ülesandel keskmiselt 40,0, samas kui ühe ülesande ACT saavutas 48,3. See, mis tõstab selle 78,3-ni, on kogukonna eeltreening pluss mitme ülesande treening, mitte ainult arhitektuur. SO-101 lego ülesandel, mõlemad ühe ülesande jaoks, SmolVLA võidab: 90 versus 70 jaotuses. Seejärel SmolVLA vastu Pi0.5 kui eelarve seda võimaldab.

Selles suuruses otsustab andmestik tulemuse

Eeltreeningut on vähem, et halbu andmeid katta, seega annab puhas kaokõver defektsel andmestikul teile poliitika, mis reprodutseerib defekti enesekindlalt. lerobot'i dokumendid on struktuuri osas otsekohesed: 50 episoodi üle 5 kuubipositsiooni, 10 positsiooni kohta, töötas; 25 ei töötanud. Kui kao näitaja tundub hea ja käsi ei tee midagi kasulikku, alustage siit: kao näitaja langeb, poliitika ei tee midagi, poliitika töötab ainult ühes seadistuses või kogudes tegelikult kasutatavaid VLA treeningandmeid robotmanipulatsiooniks.

Viis poliitikat, üks võrdlustabel

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ja ACT tegelike parameetrite arvudega, järelduste latentsus iga tegevussammu kohta, GPU tase, mida igaüks vajab, ja minimaalne episoodide arv enne, kui see midagi kasulikku teeb.

Võrdle poliitikaid

Otsustustabel, mille järgi saate tegutseda

Teie olukordAlustageMiks
Üks ülesanne, head demonstratsioonid, keeletaACT~80 M, 20 ms, 24 GB kaart, baasmudelit pole vaja alla laadida
Mõned seotud ülesanded, igaühele üks juhisSmolVLA450 M, lerobot'is, minimaalselt 30 episoodi, 1 kuni 3 USD jooksu kohta
TinyVLA tulemuse spetsiifiline reprodutseerimineTinyVLA-B või TinyVLA-HRepo on ainus tee: isoleeritud keskkond, teisendatud andmed
Mitme ülesande täitmine, erinevad juhised, A100 eelarveGR00T N1.7 või Pi0.5~3 B, 152 ms ja 485 ms sammu kohta, 4 kuni 12 USD jooksu kohta
Robotit veel poleJuhi päris kättJärjekorrapõhine reaalajas käsi ei vaja registreerimist ega riistvara

Viimase rea jaoks, reaalajas käsi voogedastab füüsilist SO-100, mida saate brauserist ilma kontota juhtida, ja kolm alustamisviisi katab ülejäänu. SO-100 on siin referentskäsi, osade maksumus umbes 110 kuni 150 EUR, koos täieliku seadistusjuhendiga.

Mis tuleb pärast alla 1 B mudeleid

Parameetrite arvu vähendamine on üks viis VLA odavaks muutmiseks ja mitte ilmtingimata võidukas. OpenVLA-OFT (arXiv 2502.19645) säilitab 7 B selgroo ja muudab ainult seda, kuidas tegevusi dekodeeritakse, teatades 26-kordsest tegevuste genereerimise läbilaskevõime suurenemisest ja LIBERO tõusust 76,5-lt 97,1 protsendile. BitVLA (arXiv 2506.07530) muudab iga 1-bitise BitNet b1.58 2B4T selgroo kaalu ternaarseks, teatades 11,0x vähem mälu ja 4,4x madalama otsast-lõpuni latentsuse, samal ajal sobitudes täppis-OpenVLA-OFT-ga. X-VLA-0.9B (arXiv 2510.10274) asub 1 B joonel voolu sobitamisega.

Ühine joon: latentsus asub tegevusdekoodris, mitte keelemudelis. Küsige, kuidas poliitika tegevusi väljastab, enne kui küsite, mitu parameetrit sellel on. Areen sisaldab 85 mudelit ja 332 tulemust, millest igaüks on lingitud oma allikaga; laiem ülevaade on meie VLA sissejuhatuses.

Kas ma saan SmolVLA-d RTX 4090-l peenhäälestada?

Jah. SmolVLA on 450 miljoni parameetriga ja AY-Robots käitab seda RTX 4090 / 24 GB tasemel. lerobot näide kasutab --batch_size=64, mis on pigem näide kui garantii teie kaardile; dokumendid soovitavad alustada väikselt ja suurendada, kuni laadimisajad püsivad lühikesed. Oodake pikemat aega kui umbes 4 tundi, mida dokumendid mainivad 20000 sammu jaoks A100-l.

Kas TinyVLA on saadaval lerobot'is või AY-Robotsis?

Mõlemale ei. TinyVLA asub ainult oma uurimisrepositooriumis, viimane commit 11. märts 2025, ja selle formaat on ACT-stiilis HDF5, mitte LeRobot. AY-Robots treenib GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA ja ACT. Kui soovite TinyVLA-d, peate selle ise ehitama ja kõigepealt parandama DeepSpeedi konfiguratsioonitee failis scripts/train.sh.

Kas 450 miljoni parameetriga mudel on tõesti konkurentsivõimeline 3 miljardi parameetriga mudeliga?

Autorite enda võrdlustestide kohaselt jah: 87.3 versus 86.0 LIBERO-l võrreldes robootika-eeltreenitud Pi0-ga 3.3 miljardi parameetriga, ja 78.3 versus 61.7 kolmel reaalsel SO-100 ülesandel, kus sama artikkel märgib Pi0-d 3.5 miljardi parameetriga. Piirang on samas artiklis: ühe ülesande puhul ilma robootika eeltreeninguta langeb SmolVLA 40.0-le, mis on allpool ACT 48.3-st.

Mitu episoodi ma vajan, enne kui väike VLA midagi teeb?

AY-Robots määrab SmolVLA miinimumiks 30 episoodi ja ACT miinimumiks 50. lerobot dokumendid soovitavad umbes 50 ja teatavad, et 25 ei olnud sama ülesande jaoks piisav. Struktuur on sama oluline kui arv: artikli komplekt kasutas 5 kuubiku asendit, igaühes 10 episoodi.

Miks avaldatud latentsusnumbrid nii palju erinevad?

Nad mõõdavad erinevaid asju. TinyVLA teatab 14 ms tegevuse ennustuse kohta A6000-l; AY-Robots loetleb SmolVLA-d 245 ms ja ACT-d 20 ms tegevussammu kohta. Mõned näitajad hõlmavad ühte edasisuunalist läbimist, mõned jagavad läbimise 50-tegevuse ploki vahel ja peaaegu ükski ei sisalda kaamera jäädvustamist ega servodele kirjutamist.

Kas pilve järeldamine lahendab GPU probleemi?

Osaliselt. AY-Robots varustab automaatselt pod'i, mis teenindab poliitikat, samal ajal kui kohalik klient suhtleb selle lõpp-punktiga, koos tühikäigu valvekoeraga, nii et see hävitab end, selle asemel et vaikselt arveldada. See ei saa eemaldada avaliku interneti edasi-tagasi reisi ja juhtimissilmus on juba 20 kuni 485 ms tegevussammu kohta. Sobib aeglaseks valimiseks ja paigutamiseks, mitte kiireks reaktiivseks liikumiseks.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started