Die AY-Robots beleidsvergelykingstabel met parameter tellings, GPU vlakke en inferensie latensie vir GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA en ACT
SmolVLATinyVLAKlein VLAVerbruikers-GPULeRobot

Klein VLA Modelle: TinyVLA, SmolVLA en die Sub-1B Geval

AY-Robots ResearchAugust 23, 202619 min lees

TinyVLA en SmolVLA plaas 'n werkende VLA onder 1 B parameters. Werklike syfers uit beide referate, die lerobot verstekke, gemete latensie, en wat 'n uitvoering op 'n 24 GB kaart kos.

Byna elke visie-taal-aksie-model waaroor geskryf word, neem 'n datasentrumkaart aan. OpenVLA is 7 B parameters. GR00T N1.7 en Pi0.5 is ongeveer 3 B en benodig 'n A100 80 GB om fyn te stel. As die kaart op jou lessenaar 'n 4090 is, is daardie klas model buite bereik.

Twee referate argumenteer dat jy dit nie nodig het nie. TinyVLA (arXiv 2409.12514, aanvaar deur IEEE Robotics and Automation Letters in Februarie 2025) bou 'n VLA uit 'n 400 M tot 1.3 B ruggraat plus 'n diffusie-aksiekop. SmolVLA (arXiv 2506.01844, ingedien 2 Junie 2025) lewer 450 M parameters met oop gewigte, oop data en 'n skrip wat op een verbruikerskaart loop. Hier is wat albei gemeet het, en waar die sub-1 B argument ophou geld.

Wat jy moet weet

  • TinyVLA lewer drie groottes: 422 M totaal met 101 M opleibaar, 740 M met 138 M, 1.3 B met 143 M. Slegs die eerste twee is onder 1 B.
  • Sy Tabel IV meet 14 ms per aksievoorspelling vir TinyVLA-1B op een A6000, teenoor 292 ms vir OpenVLA-7B en 140 ms vir 'n verkleinde OpenVLA-1B.
  • Die kop handhaaf daardie spoed, nie die ruggraat nie: ruil TinyVLA-H se diffusiekop vir 'n ACT-kop en die vyf regte-robot take daal van 'n 94.0 gemiddelde na enkelsyfers. 'n MLP-kop behaal 0 oral.
  • SmolVLA is 450 M, ongeveer 100 M daarvan die aksie-kenner, vooraf opgelei op 481 gemeenskaps LeRobot datastelle en 10.6 M rame. Dit rapporteer 87.3 op LIBERO teenoor 86.0 vir 'n robotika-voorafopgeleide Pi0 teen 3.3 B, en 78.3 op drie regte SO-100 take teenoor 61.7 vir Pi0 teen 3.5 B.
  • Enkeltaak opgelei sonder daardie vooropleiding, daal SmolVLA tot 40.0 op daardie take, onder ACT se 48.3. Klein is nie outomaties maklik nie.
  • TinyVLA het geen LeRobot-integrasie nie en pen 'n CUDA 11.7 wielstapel vas. SmolVLA is in lerobot en kos ongeveer 1 tot 3 USD per lopie op die 24 GB vlak hier.

Wat werklik as 'n klein VLA tel

Die parameter telling op 'n modelkaart is nie een nommer nie. Dit kan totale gewigte, gewigte gelaai tydens inferensie, of gewigte wat gradiënte ontvang tydens . TinyVLA rapporteer beide, en die gaping is groot: TinyVLA-H is 1.3 B totaal maar 143 M opleibaar, omdat die visietoring en die meeste van die taalmodel gevries bly terwyl LoRA-adapters en die aksiekop beweeg. Die referaat stel die opleibare deel op ongeveer 5 persent.

ModelParametersRuggraatAksiekopBron
TinyVLA-S422 M totaal, 101 M opleibaarLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M totaal, 138 M opleibaarLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B totaal, 143 M opleibaarLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M aksie-kennerSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S scale, T5-Base text encoderDiffusionocto-small-1.5 card
ACT~80 MResNet, geen taalmodelDirekte brokkie-regressieAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersOutoregressiewe aksietekensarXiv 2406.09246

Twee rye is die moeite werd om oor te argumenteer. teen ongeveer 80 M is kleiner as alles anders hier, maar het geen taalmodel nie, so dit is nie 'n VLA nie: dit leer een taak en kan nie aangesê word om 'n ander te doen nie. teen 27 M word gekondisioneer deur 'n T5-Base teksenkodeerder, nie 'n LLM-ruggraat nie. Goeie basislyne, nie een gee jou die instruksievolging wat die etiket impliseer nie.

Die 1 B lyn is arbitrêr

TinyVLA-H, die variant wat die hoofopskrifresultate dra, is 1.3 B en sit bo die lyn. Die beter vraag is of 'n model in 24 GB pas tydens opleiding en jou beheerkoers tydens inferensie bereik. Die vyf beleide wat jy hier kan oplei, is op die beleidebladsy; TinyVLA het 'n arena-inskrywing as jy sy syfers langs almal anders s'n wil hê.

TinyVLA: die spoed kom van die hoof, nie die ruggraat nie

Die ooglopende interpretasie is dat hulle die taalmodel kleiner gemaak het, sodat dit vinniger geword het. Die referaat se ablasie sê anders. Die ruil van OpenVLA se 7 B ruggraat vir 'n ongeveer 1 B een het per-aksie voorspelling van 292 ms na 140 ms verminder, 'n 2x wins. TinyVLA-H, met 'n vergelykbare parameter telling, loop teen 14 ms op dieselfde kaart. Die ander 10x is die aksiehoof.

ModelPer-aksie voorspellingGemeet op
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, backbone swapped for TinyVLA's140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA stuur aksies uit as gediskretiseerde tokens deur die taalmodelhoof, een per aksiedimensie, outoregressief. TinyVLA heg 'n diffusie-dekodeerder aan wat die hele stuk in een slag produseer. Tabel V bevat die argitektuur by TinyVLA-H en ruil slegs die hoof, op dieselfde vyf regte-robot take. Dit is die skoonste bewyse in enige van die referate vir die argument vloeipas-passing beleide maak, en die rede Pi0 het wegbeweeg van token-dekodering.

Kop op TinyVLA-HPlaceTennisDraaiBekerOmStapelKubusseMaakLaaiToeMaakBoksOop
Diffusie (droid_diffusion)90.098.398.396.786.7
Aksie-segmenteringstransformator13.38.38.313.323.3
Meerlaagse perseptron00000
Wat die TinyVLA-syfers dek

Die 292 / 140 / 14 ms syfers is Tabel IV, almal op een A6000. Dit is per aksievoorspelling en sluit kamera-opname, voorverwerking en die seriële skryf na die servos uit. Behandel gepubliseerde latensie as 'n laer grens, nooit as die beheerkoers nie. Ons eie syfers het dieselfde beperking: sien inferensie-latensie.

Wat TinyVLA behaal het

Vergelykende toetsProtokolTinyVLA-HBasislyne
MetaWorld, 50 take, simMultitaak, 50 demonstrasies, 3 sade77.6 / 21.5 / 11.4 / 15.8 volgens moeilikheidsgraad, gemiddeld 31.6Diffusion Policy gemiddeld 10.5
Regte Franka Panda, 5 take100 trajekte per taak, 20 proewe94.0 gemiddeldOpenVLA 68.3, Diffusion Policy 35.3
Bimanuele UR5, 3 takeMultitaak, 10 proewe per taak76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Die bimanuële ry het 'n vervelige verduideliking wat die referaat self gee: OpenVLA is vooraf opgelei op Open X-Embodiment, wat geheel en al uit enkelarmdata bestaan, so 'n twee-arm aksiespasie is buite verspreiding en dit behaal nul. Die diffusiebeleid-basislyn klop TinyVLA-H op twee van daardie drie take. Agtergrond in die Open X-Embodiment-verslag.

Die AY-Robots arena-ranglys, 'n sorteerbare tabel van 85 VLA-modelle met 332 maatstafresultate, elke waarde teruggekoppel na die referaat of modelkaart waar dit vandaan kom
Kruismodel-maatstafgetalle is slegs vergelykbaar as jy kan sien waar elkeen vandaan kom.

Die TinyVLA-repo, soos van Augustus 2026

Die referaat is goed. Die kode is 'n navorsingsvrystelling. Die bewaarplek is github.com/liyaxuanliyaxuan/TinyVLA; sy README dateer die kodestelling na 17 Februarie 2025 en die laaste commit is 11 Maart 2025. Goed vir die reproduksie van 'n referaat, 'n probleem as jy 'n onderhoude biblioteek wou hê.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Die installasievolgorde vanaf die TinyVLA README, nagegaan teen die bewaarplek op 2026-08-23.
Die afhanklikheidspennetjies is die strik wat 'n dag opeet

requirements.txt spesifiseer torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, en die CUDA-stapel vir die 11.x wiele: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. Die README vra vir Python 3.10; lerobot 0.6.1 vereis 3.12 of nuwer, so die twee kan nie 'n omgewing deel nie. Bevestig eers dat 'n torch 2.0.1-bou vir jou GPU-generasie bestaan. As 'n uitvoering eerder op VRAM sterf, is die kontrolelys vir buite-geheue vinniger as om te raai.

TinyVLA lees ook nie LeRobot datastelle. Die formaat daarvan is ACT-styl HDF5: action, language_raw, en 'n waarnemingsgroep met multi-aansig beelde, joint_positions, qpos en qvel. Die bewaarplek verskaf data_utils/rlds_to_h5py.py vir RLDS-invoer, en elke taak word met die hand geregistreer in aloha_scripts/constants.py met sy dataset_dir, episode_len en camera_names. As jou episodes gekom het van lerobot of die rekenaarkliënt, besit jy die omskakeling.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Verkort vanaf scripts/train.sh. Elke vlag en waarde hierbo is in die verskafde lêer.
  • --num_gpus=8 aanvaar 'n agt-kaart nodus. Stel dit op 1 en verlaag die bondelgrootte ver onder 32. Geen enkel-GPU variant word stroomop verskeep nie, so die opdrag kan nie woordeliks op 'n 4090 uitgevoer word nie.
  • --deepspeed scripts/zero2.json wys na 'n lêer wat nie in die topvlak scripts-gids is nie. Die DeepSpeed-konfigurasies word by llava-pythia/scripts/zero2.json verskeep. Maak die pad reg voor jou eerste lopie.
  • Die README vereis dat die uitvoergidsnaam llava_pythia moet bevat, plus lora as LoRA geaktiveer is.
  • Die ruggraat is 'n aparte aflaai: lesjie/Llava-Pythia-400M, -700M of -1.3B. Daar is geen enkele basiskontrolepunt waarna jy 'n beleid wys op dieselfde manier as wat jy na lerobot/smolvla_base wys nie.

SmolVLA: die sub-1 B model wat jy vanmiddag kan uitvoer

SmolVLA maak dieselfde argument binne 'n onderhoude biblioteek. Dit is 450 M parameters op 'n SmolVLM2-500M-Video-Instruct ruggraat, en die doeltreffendheid kom van instellings wat jy uit configuration_smolvla.py kan lees eerder as van 'n bewering oor klein wees.

Instelling in configuration_smolvla.pyVerstekWat dit bied
num_vlm_layers16Slegs die eerste 16 taalmodel-lae loop
expert_width_multiplier0.75Aksie-ekspert se verborge grootte is 75 persent van die VLM s'n
self_attn_every_n_layers2Self-aandag afgewissel met kruis-aandag
chunk_size / n_action_steps50 / 50Een deurgang lewer 50 aksies en al 50 word uitgevoer
num_steps10Vloeipas-ontruising vasgestel op 10 stappe
tokenizer_max_length48Die instruksie word tot 48 tokens afgesny
freeze_vision_encoder / train_expert_onlyTrue / TrueFyninstelling verskuif die ekspert, nie die visietoring nie
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Nie die papierresep nie: sy vooropleiding het 'n 100-stap opwarming oor 200000 stappe gebruik

Vooropleiding het 481 gemeenskaps LeRobot datastelle, 22.9 K episodes en 10.6 M rame op 4 GPU's, 200000 stappe teen 'n globale bondel van 256 gebruik; die referaat skat die hele projek op ongeveer 30 K GPU-ure. 'n Getal om dop te hou: die Hugging Face bekendstellingsblog sê 487 saamgestelde datastelle waar die referaat se tabel 481 sê. Ons gebruik die referaat se syfer en dui die verskil aan.

VergelykingsmaatSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO gemiddeld, multi-taak87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World gemiddeld, multi-taak57.368.2447.9 (3.5 B, robotics-pretrained)-
Regte SO-100, 3 take, multi-taak opleiding78.3-61.7 (3.5 B)-
Regte SO-100, 3 take, enkel-taak, geen robotika vooropleiding40.0--48.3
SO-101 lego optel-plaas, enkel-taak, in verspreiding90--70
SO-101 lego optel-plaas, enkel-taak, buite verspreiding50--40
Lees die hele tabel, nie die opskrifry nie

LIBERO is simulasie en alles wat bekwaam is, behaal nou in die tagtigs daar. Die regte SO-100 ry, waar 'n 450 M model 'n 3.5 B een met 16.6 punte klop, is die interessante een; die ry daaronder is die teenwig. Verwyder die gemeenskapsvooropleiding en die multi-taak opleiding en dieselfde model daal tot 40.0, onder ACT. Die verdedigbare bewering is dat 'n klein model nie outomaties slegter is nie, nie dat dit beter is nie.

Een toeval help: die SmolVLA-artikel se Meta-World-tabel bevat TinyVLA se eie gepubliseerde syfers as 'n basislyn, sodat vir eers albei modelle in een tabel verskyn, SmolVLA-0.45B teen 57.3 teenoor TinyVLA-H teen 31.6. Dit rapporteer ook dat SmolVLA-opleiding ongeveer 40 persent vinniger is as Pi0 op 6x minder geheue. Alles kom van die SmolVLA-outeurs; die arena-inskrywing koppel elke waarde aan sy bron.

Waar SmolVLA sy tyd spandeer

AY-Robots lys SmolVLA teen 245 ms per aksiestap en ACT teen 20 ms in die beleidskatalogus. TinyVLA rapporteer 14 ms per aksievoorspelling. Daardie syfers is nie vergelykbaar nie, en om dit te behandel asof dit wel is, is die mees algemene fout in hierdie onderwerp: sommige meet een vorentoe-pas, sommige verdeel daardie pas oor 'n brokkie sodra aksie-segmentering dit amortiseer.

  • SmolVLA stuur 50 aksies per vorentoe-pas uit en voer al 50 uit. Teen die 30 fps wat die artikel op regte robotte gebruik, dek een inferensie ongeveer 1.7 sekondes se beweging.
  • Asinchrone inferensie bereken die volgende brokkie terwyl die huidige een nog uitvoer: 9.7 s gemiddelde taakvoltooiing teenoor 13.75 s sinchroon, ongeveer 30 persent vinniger, en 19 optel-en-plaas-siklusse in 'n vaste 60-sekonde-venster teenoor 9.
  • Sukseskoerse was vergelykbaar eerder as beter, 78.3 sinchroon teenoor 73.3 asinchroon. Asinchroon koop deurset, nie akkuraatheid nie.
  • Segmentering verberg berekeningslatensie, nie netwerklatensie nie, en dit maak die beleid minder reaktief omdat dit tot 50 aksies verbind is.
Afgeleë inferensie is nie gratis nie, en geen platform los fisika op nie

AY-Robots kan outomaties 'n wolk-GPU-pod voorsien wat jou beleid bedien terwyl die plaaslike robotkliënt met daardie eindpunt kommunikeer, en die pod dra 'n ledige waghond sodat dit homself vernietig eerder as om stilweg te faktureer. Wat dit nie doen nie, is om die publieke-internet heen-en-weer reis te verwyder. Die beheerlus oor die vyf beleide hier is 20 tot 485 ms per aksiestap voor enige netwerk hoegenaamd, so afgeleë inferensie is lewensvatbaar vir stadige optel-en-plaas, nie vir vinnige reaktiewe beweging nie.

Die AY-Robots beleidsvergelykingstabel wat GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA en ACT toon met parameter tellings, vereiste GPU-vlak, inferensie latensie per aksiestap en die minimum aantal episodes wat elkeen benodig
SmolVLA teen ~450 M en ACT teen ~80 M is die twee wat op 'n 24 GB kaart pas. Die ander drie benodig 'n A100 of H100 80 GB.

Fyninstelling van SmolVLA op een verbruikerskaart

Die handmatige pad, op lerobot 0.6.1, die huidige PyPI-vrystelling soos op 23 Augustus 2026. Alles hieronder kom uit die Hugging Face lerobot SmolVLA-dokumentasie, op dieselfde dag afgehaal; die begeleide weergawe is sagter.

  1. 1
    Installeer lerobot met die smolvla-ekstra

    Die SmolVLA-afhanklikhede is 'n opsionele ekstra, nie deel van die basisinstallasie nie. Om dit sonder dit te installeer en dan te wonder hoekom die beleidstipe onbekend is, is 'n algemene halfuur verlore.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Kry 'n datastel met genoeg episodes

    Die dokumentasie beveel ongeveer 50 episodes aan en meld dat dieselfde taak met 25 nie genoeg was nie. AY-Robots stel die minimum op 30. Neem jou eie op, of begin by die dataskikking-gids.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Begin die fyninstelling

    Die opdrag uit die lerobot-gids, ongewysig. Die dokumentasie stel 20000 stappe op ongeveer 4 uur op een A100. Op 'n 24 GB kaart, verwag langer en meet dit.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Verlaag die bondelgrootte totdat dit pas

    batch_size=64 is 'n gedokumenteerde voorbeeld, nie 'n belofte oor jou kaart nie. Die dokumentasie raad aan om klein te begin en te verhoog solank laaitye kort bly.

    bash
    lerobot-train --help
  5. 5
    Rol die kontrolepunt uit op die arm

    Dieselfde biblioteek, een opdrag. Die intydse stukke-vlae is in die dokumentasie uitkommentaar en is dié om te gebruik op lae-krag hardeware.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Die kontrolepunt is die lewerbare

Watter pad jy ook al volg, eindig jy met 'n kontrolepunt plus die konfigurasie wat dit geproduseer het. Hou die datastel-hersiening, die stap-telling en die saad daarby. lerobot verstek na saad 1000; GR00T se fyninstelling-toegangspunt blootstel geen saad hoegenaamd nie, so daardie lopies is nie bit-vir-bit reproduseerbaar nie. Meganika in die opleidingsdokumente.

Twee maniere om 'n klein VLA op 'n arm te kry

Jy besit die masjien en die foutmodusse. Vir SmolVLA is dit redelik: een pip-ekstra, een opleidingsopdrag, een uitrol-opdrag. Vir TinyVLA is dit 'n navorsingsreproduksie met bevrore penne, 'n gebroke DeepSpeed-pad en 'n datakonversie wat jy self skryf.

  1. Kry 'n 24 GB kaart, neem 30 tot 50 episodes op, verifieer die kamerastrome raam vir raam.
  2. pip install -e ".[smolvla]", lerobot-train teen lerobot/smolvla_base, bedien dan die kontrolepunt op die masjien waaraan die arm gekoppel is.
  3. Vir TinyVLA: aparte conda-omgewing, skakel data om na HDF5, registreer die taak in constants.py, maak die zero2.json-pad reg, sny train.sh van agt GPU's na een.
Voordele
  • Geen per-uur fakturering sodra die kaart betaal is nie.
  • Afleiding sit langs die servo's, die enigste manier om 'n vinnige beheerslus te kry.
  • Jy kan die beleidskode patch, en TinyVLA is slegs op hierdie manier beskikbaar.
Afwegings
  • 'n 4090 sluit elke ~3 B beleid uit, so geen plaaslike vergelyking teen GR00T N1.7 of Pi0.5 nie.
  • Omgewingopstelling is die regte werk. TinyVLA se penne alleen kan 'n dag kos.
  • Geen tou, geen herprobeer, geen kontrolepuntberging. 'n Herlaai by stap 14000 beteken om weer te begin.

Wanneer 'n klein model die verkeerde keuse is

Beide referate is hier versigtiger as wat die opsommings is. TinyVLA se foutanalise is spesifiek: die 0.4 B-variant het drie keer misluk deur die instruksie verkeerd te lees, wat die outeurs toeskryf aan beperkte taalbegrip in die kleiner VLM, en daardie modus het by 1.3 B verdwyn. SmolVLA toon dieselfde kurwe van die ander kant af: die 2.25 B-weergawe van dieselfde argitektuur behaal 88.75 op LIBERO en 68.24 op Meta-World teenoor 87.3 en 57.3 vir die 0.45 B-model.

Die keuse van 'n sub-1 B VLA
Waar dit wen
  • Pas op 'n 24 GB-kaart, wat 'n eksperiment van tientalle dollars na 'n paar verminder.
  • Vinnig genoeg om langs die arm te loop, dus geen netwerkhop in die beheerlus nie.
  • Verfyn op die data wat een persoon kan opneem, tientalle episodes eerder as duisende.
  • SmolVLA se gewigte, datalys en kode is publiek, so 'n slegte resultaat is ontfoutbaar.
Waar dit verloor
  • Swakker instruksievolging: minder taalparameters, minder vermoë om soortgelyke verwysingsuitdrukkings te skei.
  • Minder ruimtelike en visuele veralgemening na opstellings wat jy nie opgeneem het nie.
  • Meer sensitief vir datasteldefekte, met minder vooropleiding om op terug te val.
  • Multi-taak en langtermyn werk bevoordeel steeds groter modelle, insluitend SmolVLA se eie 2.25 B-variant.

Die vergelyking wat die moeite werd is om te doen, is nie TinyVLA teen SmolVLA nie. Dit is SmolVLA teen ACT op jou eie taak, en die SmolVLA-referaat is die argument hoekom. SmolVLA, enkel-taak opgelei sonder robotika-vooropleiding, het 'n gemiddeld van 40.0 behaal oor drie SO-100 take waar enkel-taak ACT 48.3 behaal het. Wat dit tot 78.3 verhoog, is gemeenskapsvooropleiding plus multi-taak opleiding, nie die argitektuur alleen nie. Op die SO-101 lego-taak, albei enkel-taak, wen SmolVLA wel: 90 teen 70 in verspreiding. Dan SmolVLA teen Pi0.5 as die begroting dit toelaat.

Op hierdie grootte besluit die datastel die uitkoms

Daar is minder vooropleiding om slegte data te dek, so 'n skoon verlieskurwe op 'n gebrekkige datastel gee jou 'n beleid wat die defek met selfvertroue reproduseer. Die lerobot-dokumente is reguit oor struktuur: 50 episodes oor 5 kubusposisies, 10 per posisie, het gewerk; 25 nie. As verlies goed lyk en die arm niks nuttigs doen nie, begin by verlies daal, beleid doen niks, beleid werk net in een opstelling of insameling van VLA-opleidingsdata wat werklik bruikbaar is.

Vyf beleide, een vergelykingstabel

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA en ACT met werklike parameter tellings, inferensie latensie per aksie stap, die GPU-vlak wat elkeen benodig en die minimum episode telling voordat dit enigiets nuttigs doen.

Vergelyk die beleide

’n Besluitstabel waarop jy kan optree

Jou situasieBegin metHoekom
Een taak, goeie demonstrasies, geen taalACT~80 M, 20 ms, 24 GB card, no base model to download
'n Paar verwante take, een instruksie elkSmolVLA450 M, in lerobot, 30 episode minimum, 1 to 3 USD per run
Reproduseer spesifiek die TinyVLA-resultaatTinyVLA-B or TinyVLA-HDie repo is die enigste roete: geïsoleerde omgewing, omgeskakelde data
Multi-taak, gevarieerde instruksies, A100-begrotingGR00T N1.7 or Pi0.5~3 B, 152 ms and 485 ms per step, 4 to 12 USD per run
Nog geen robot nieBestuur 'n regte armDie tou-gebaseerde lewendige arm benodig geen registrasie en geen hardeware nie

Vir die laaste ry, die lewendige arm stroom 'n fisiese SO-100 wat jy vanuit die blaaier kan beheer sonder 'n rekening, en die drie maniere om te begin dek die res. Die SO-100 is die verwysingsarm hier, ongeveer 110 tot 150 EUR in onderdele, met 'n volledige opstelgids.

Wat kom na die sub-1 B modelle

Die vermindering van die parameter telling is een manier om 'n VLA goedkoop te maak en nie noodwendig die wenner nie. OpenVLA-OFT (arXiv 2502.19645) behou die 7 B ruggraat en verander slegs hoe aksies gedekodeer word, en rapporteer 'n 26x toename in aksiegenerasie-deurset en LIBERO wat styg van 76.5 tot 97.1 persent. BitVLA (arXiv 2506.07530) maak elke gewig van 'n 1-bis BitNet b1.58 2B4T ruggraat ternêr, en rapporteer 11.0x minder geheue en 4.4x laer end-tot-end latensie terwyl dit volpresisie OpenVLA-OFT ewenaar. X-VLA-0.9B (arXiv 2510.10274) sit op die 1 B lyn met vloeipas.

Die gemene deler: die aksiedekodeerder, nie die taalmodel nie, is waar die latensie lê. Vra hoe 'n beleid aksies uitstuur voordat jy vra hoeveel parameters dit het. Die arena het 85 modelle en 332 resultate, elk gekoppel aan sy bron; daar is 'n breër oorsig in ons VLA-inleiding.

Kan ek SmolVLA op 'n RTX 4090 fyninstel?

Ja. SmolVLA is 450 M parameters en AY-Robots laat dit loop op die RTX 4090 / 24 GB vlak. Die lerobot voorbeeld gebruik --batch_size=64, wat 'n voorbeeld is eerder as 'n waarborg vir jou kaart; die dokumentasie raai aan om klein te begin en te vermeerder terwyl laaitye kort bly. Verwag langer as die ongeveer 4 ure wat die dokumentasie noem vir 20000 stappe op 'n A100.

Is TinyVLA beskikbaar in lerobot of op AY-Robots?

Nee vir albei. TinyVLA bestaan slegs in sy navorsingsbewaarplek, laaste commit 11 Maart 2025, en sy formaat is ACT-styl HDF5 eerder as LeRobot. AY-Robots lei GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA en ACT op. As jy TinyVLA wil hê, bou jy dit self, en jy sal eers die DeepSpeed config path in scripts/train.sh moet regmaak.

Is 'n 450 M model werklik mededingend met 'n 3 B een?

Op die outeurs se eie maatstawwe, ja: 87.3 teen 86.0 op LIBERO teenoor 'n robotika-voorafopgeleide Pi0 teen 3.3 B, en 78.3 teen 61.7 op drie regte SO-100 take waar dieselfde referaat Pi0 teen 3.5 B etiketteer. Die beperking is in dieselfde referaat: enkel-taak sonder robotika-voorafopleiding, val SmolVLA na 40.0, onder ACT se 48.3.

Hoeveel episodes het ek nodig voordat 'n klein VLA enigiets doen?

AY-Robots stel die SmolVLA minimum op 30 episodes en die ACT minimum op 50. Die lerobot dokumentasie beveel ongeveer 50 aan en rapporteer dat 25 nie genoeg was vir dieselfde taak nie. Struktuur is net so belangrik soos die aantal: die referaat se stel het 5 kubusposisies met 10 episodes elk gebruik.

Waarom verskil gepubliseerde latensienommers so baie?

Hulle meet verskillende dinge. TinyVLA rapporteer 14 ms per aksievoorspelling op 'n A6000; AY-Robots lys SmolVLA teen 245 ms en ACT teen 20 ms per aksiestap. Sommige syfers dek een vorentoe-pas, sommige verdeel 'n pas oor 'n 50-aksie-stuk, en byna geen sluit kamera-opname of die skryf na die servos in nie.

Los wolk-inferensie die GPU-probleem op?

Gedeeltelik. AY-Robots voorsien outomaties 'n pod wat die beleid bedien terwyl die plaaslike kliënt met daardie eindpunt kommunikeer, met 'n ledige waghond sodat dit homself vernietig eerder as om stilweg te faktureer. Dit kan nie die publieke-internet heen-en-weer reis verwyder nie, en die beheerlus is reeds 20 tot 485 ms per aksiestap. Goed vir stadige optel-en-plaas, nie vir vinnige reaktiewe beweging nie.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started