Tabela e krahasimit të politikave të AY-Robots me numrin e parametrave, nivelet e GPU-ve dhe vonesën e inferencës për GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dhe ACT
SmolVLATinyVLAVLA e VogëlGPU KonsumatoreLeRobot

Modele të Vogla VLA: TinyVLA, SmolVLA dhe Rasti Nën-1B

AY-Robots ResearchAugust 23, 202619 min lexuar

TinyVLA dhe SmolVLA vendosin një VLA funksional nën 1 miliard parametra. Numra realë nga të dyja punimet, parametrat e paracaktuar të lerobot, vonesa e matur, dhe sa kushton një ekzekutim në një kartë 24 GB.

Pothuajse çdo model vizion-gjuhë-veprim për të cilin shkruhet, supozon një kartë qendre të dhënash. OpenVLA ka 7 B parametra. GR00T N1.7 dhe Pi0.5 janë rreth 3 B dhe kërkojnë një A100 80 GB për t'u rregulluar (fine-tune). Nëse karta në tavolinën tuaj është një 4090, ajo klasë modelesh është e paarritshme.

Dy punime argumentojnë se nuk ju duhet. TinyVLA (arXiv 2409.12514, pranuar nga IEEE Robotics and Automation Letters në shkurt 2025) ndërton një VLA nga një shtyllë kurrizore (backbone) 400 M deri në 1.3 B plus një kokë veprimi difuzioni. SmolVLA (arXiv 2506.01844, dorëzuar më 2 qershor 2025) ofron 450 M parametra me pesha të hapura, të dhëna të hapura dhe një skript që funksionon në një kartë konsumatore. Ja çfarë matën të dy, dhe ku argumenti nën-1 B pushon së qeni i vlefshëm.

Çfarë duhet të dini

  • TinyVLA ofron tre madhësi: 422 M gjithsej me 101 M të trajnueshme, 740 M me 138 M, 1.3 B me 143 M. Vetëm dy të parat janë nën 1 B.
  • Tabela e tij IV mat 14 ms për parashikim veprimi për TinyVLA-1B në një A6000, kundrejt 292 ms për OpenVLA-7B dhe 140 ms për një OpenVLA-1B të zvogëluar.
  • Koka mban atë shpejtësi, jo shtylla kurrizore (backbone): ndërroni kokën e difuzionit të TinyVLA-H me një kokë ACT dhe pesë detyrat reale të robotit bien nga një mesatare 94.0 në shifra njëshifrore. Një kokë MLP shënon 0 kudo.
  • SmolVLA është 450 M, rreth 100 M prej tij eksperti i veprimit, i paratrajnuar në 481 grupe të dhënash komunitare LeRobot dhe 10.6 M korniza. Ai raporton 87.3 në LIBERO kundrejt 86.0 për një Pi0 të paratrajnuar në robotikë me 3.3 B, dhe 78.3 në tre detyra reale SO-100 kundrejt 61.7 për Pi0 me 3.5 B.
  • I trajnuar me një detyrë pa atë paratrajnim, SmolVLA bie në 40.0 në ato detyra, nën 48.3 të ACT. E vogla nuk është automatikisht e lehtë.
  • TinyVLA nuk ka integrim LeRobot dhe përdor një stack CUDA 11.7 wheel. SmolVLA është në lerobot dhe kushton afërsisht 1 deri në 3 USD për ekzekutim në nivelin 24 GB këtu.

Çfarë konsiderohet në të vërtetë një VLA e vogël

Numri i parametrave në një kartë modeli nuk është një numër i vetëm. Ai mund të nënkuptojë pesha totale, pesha të ngarkuara gjatë inferencës, ose pesha që marrin gradientë gjatë . TinyVLA raporton të dyja, dhe hendeku është i madh: TinyVLA-H është 1.3 B total por 143 M i trajnueshëm, sepse kulla e vizionit dhe shumica e modelit të gjuhës mbeten të ngrira ndërsa adaptuesit LoRA dhe koka e veprimit lëvizin. Punimi e vendos pjesën e trajnueshme në rreth 5 përqind.

ModeliParametratShtylla kurrizoreKoka e veprimitBurimi
TinyVLA-S422 M total, 101 M i trajnueshëmLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M total, 138 M i trajnueshëmLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B total, 143 M i trajnueshëmLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M ekspert veprimiSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 Mshkalla ViT-S, kodues teksti T5-BaseDiffusionocto-small-1.5 card
ACT~80 MResNet, pa model gjuheRegresion i drejtpërdrejtë i copaveAY-Robots catalog
OpenVLA7 BLlama 2 7 B, kodues DINOv2 dhe SigLIPTokena veprimi autoregresivëarXiv 2406.09246

Dy rreshta vlejnë të diskutohen. me rreth 80 M është më i vogël se çdo gjë tjetër këtu, por nuk ka model gjuhe, kështu që nuk është një VLA: ai mëson një detyrë dhe nuk mund t'i thuhet të bëjë një tjetër. me 27 M është i kushtëzuar përmes një koduesi teksti T5-Base, jo një shtylle kurrizore LLM. Baza të mira, asnjëra nuk ju jep ndjekjen e udhëzimeve që nënkupton etiketa.

Linja 1 B është arbitrare

TinyVLA-H, varianti që mbart rezultatet kryesore, është 1.3 B dhe qëndron mbi linjë. Pyetja më e mirë është nëse një model përshtatet në 24 GB gjatë trajnimit dhe arrin shkallën tuaj të kontrollit gjatë inferencës. Pesë politikat që mund të trajnoni këtu janë në faqen e politikave; TinyVLA ka një hyrje në arenë nëse dëshironi numrat e tij pranë atyre të të gjithëve.

TinyVLA: shpejtësia vjen nga koka, jo nga shtylla kurrizore

Leximi i dukshëm është se ata e bënë modelin e gjuhës më të vogël, kështu që u bë më i shpejtë. Ablacioni i punimit thotë të kundërtën. Zëvendësimi i shtyllës kurrizore 7 B të OpenVLA-s me një rreth 1 B e uli parashikimin për veprim nga 292 ms në 140 ms, një fitim 2x. TinyVLA-H, me një numër të krahasueshëm parametrash, funksionon në 14 ms në të njëjtën kartë. 10x tjetër është koka e veprimit.

ModeliParashikimi për veprimMatja u bë në
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, shtylla kurrizore e zëvendësuar me atë të TinyVLA-s140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA lëshon veprime si shenja të diskretizuara përmes kokës së modelit të gjuhës, një për dimension veprimi, në mënyrë autoregresive. TinyVLA bashkëngjit një dekoder difuzioni që prodhon të gjithë bllokun në një goditje të vetme. Tabela V përmban arkitekturën në TinyVLA-H dhe zëvendëson vetëm kokën, në të njëjtat pesë detyra reale të robotit. Është prova më e qartë në të dyja punimet për argumentin përputhja e rrjedhës që bëjnë politikat, dhe arsyeja Pi0 u largua nga dekodimi i shenjave.

Performanca në TinyVLA-HVendos TenisinPërmbys FilxhaninGrumbullo KubetMbyll SirtarinHap Kutinë
Difuzioni (droid_diffusion)90.098.398.396.786.7
Transformuesi i Ndarjes së Veprimeve13.38.38.313.323.3
Perceptroni me Shumë Shtresa00000
Çfarë mbulojnë shifrat e TinyVLA

Shifrat 292 / 140 / 14 ms janë nga Tabela IV, të gjitha në një A6000. Ato janë për parashikim veprimi dhe përjashtojnë kapjen e kamerës, parapërpunimin dhe shkrimin serial te servot. Trajtojeni vonesën e publikuar si një kufi të poshtëm, kurrë si shpejtësinë e kontrollit. Numrat tanë mbartin të njëjtin kufizim: shih vonesa e inferencës.

Çfarë rezultati arriti TinyVLA

Standardi i PerformancësProtokolliTinyVLA-HModelet Referencë
MetaWorld, 50 detyra, simShumë-detyra, 50 demo, 3 fara77.6 / 21.5 / 11.4 / 15.8 sipas vështirësisë, mesatarja 31.6Politika e Difuzionit mesatarja 10.5
Franka Panda reale, 5 detyra100 trajektore për detyrë, 20 prova94.0 mesatarjaOpenVLA 68.3, Diffusion Policy 35.3
UR5 Bimanual, 3 detyraShumë-detyra, 10 prova për detyrë76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Rreshti bimanual ka një shpjegim të mërzitshëm që vetë punimi jep: OpenVLA është i paratrajnuar në Open X-Embodiment, i cili përbëhet tërësisht nga të dhëna me një krah, kështu që një hapësirë veprimi me dy krahë është jashtë shpërndarjes dhe shënon zero. Baza e politikës së difuzionit mund TinyVLA-H në dy nga ato tre detyra. Sfondi në shkrimi i Open X-Embodiment.

Tabela e renditjes së arenës AY-Robots, një tabelë e renditshme me 85 modele VLA me 332 rezultate standarde, çdo vlerë e lidhur me punimin ose kartën e modelit nga i cili erdhi
Numrat e standardeve ndër-model janë të krahasueshëm vetëm kur mund të shihni se nga vjen secili.

Depoja TinyVLA, që nga gushti 2026

Punimi është i mirë. Kodi është një lëshim kërkimor. Depoja është github.com/liyaxuanliyaxuan/TinyVLA; README-ja e saj daton lëshimin e kodit në 17 shkurt 2025 dhe komitimi i fundit është 11 mars 2025. Mirë për riprodhimin e një punimi, një problem nëse do të dëshironit një bibliotekë të mirëmbajtur.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Sekuenca e instalimit nga README i TinyVLA, e kontrolluar kundrejt depozitës më 2026-08-23.
Fiksimet e varësive janë kurthi që të ha një ditë

requirements.txt fikson torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, dhe stack-un CUDA në 11.x wheels: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README kërkon Python 3.10; lerobot 0.6.1 kërkon 3.12 ose më të re, kështu që të dyja nuk mund të ndajnë një mjedis. Konfirmoni së pari nëse ekziston një version i torch 2.0.1 për gjeneratën tuaj të GPU-së. Nëse një ekzekutim ndërpritet për shkak të VRAM-it, lista e kontrollit për mungesë memorie është më e shpejtë sesa hamendësimi.

TinyVLA gjithashtu nuk lexon grupet e të dhënave LeRobot. Formati i tij është HDF5 i stilit ACT: action, language_raw, dhe një grup vëzhgimesh me imazhe me shumë pamje, joint_positions, qpos dhe qvel. Depozita përmban data_utils/rlds_to_h5py.py për inputin RLDS, dhe çdo detyrë regjistrohet manualisht në aloha_scripts/constants.py me dataset_dir, episode_len dhe camera_names. Nëse episodet tuaja erdhën nga lerobot ose klienti i desktopit, ju jeni përgjegjës për konvertimin.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Shkurtuar nga scripts/train.sh. Çdo flamur dhe vlerë e mësipërme gjendet në skedarin e dërguar.
  • --num_gpus=8 supozon një nyje me tetë karta. Vendoseni në 1 dhe ulni madhësinë e grupit (batch size) shumë poshtë 32. Asnjë variant me një GPU nuk shpërndahet lart, kështu që komanda nuk mund të ekzekutohet fjalë për fjalë në një 4090.
  • --deepspeed scripts/zero2.json tregon një skedar që nuk është në direktorinë kryesore scripts. Konfigurimet DeepSpeed shpërndahen në llava-pythia/scripts/zero2.json. Rregulloni shtegun para ekzekutimit tuaj të parë.
  • README kërkon që emri i direktorisë së daljes të përmbajë llava_pythia, plus lora nëse LoRA është aktivizuar.
  • Shtylla kurrizore (backbone) është një shkarkim i veçantë: lesjie/Llava-Pythia-400M, -700M ose -1.3B. Nuk ka një pikë kontrolli bazë të vetme ku ju drejtoni një politikë ashtu siç drejtoni te lerobot/smolvla_base.

SmolVLA: modeli nën 1 B që mund ta ekzekutoni këtë pasdite

SmolVLA bën të njëjtin argument brenda një biblioteke të mirëmbajtur. Ai ka 450 M parametra në një shtyllë kurrizore SmolVLM2-500M-Video-Instruct, dhe efikasiteti vjen nga cilësimet që mund të lexoni nga configuration_smolvla.py, sesa nga një pretendim për të qenë i vogël.

Cilësimi në configuration_smolvla.pyParazgjedhurÇfarë ofron
num_vlm_layers16Vetëm 16 shtresat e para të modelit të gjuhës ekzekutohen
expert_width_multiplier0.75Madhësia e fshehur e ekspertit të veprimit është 75 për qind e VLM-së
self_attn_every_n_layers2Vetë-vëmendja e ndërthurur me vëmendjen ndër-sektoriale
chunk_size / n_action_steps50 / 50Një kalim lëshon 50 veprime dhe të gjitha 50 ekzekutohen
num_steps10Zhurmë-heqja e përputhjes së rrjedhës e fiksuar në 10 hapa
tokenizer_max_length48Udhëzimi shkurtohet në 48 shenja
freeze_vision_encoder / train_expert_onlyTrue / TrueAkordimi i imët lëviz ekspertin, jo kullën e vizionit
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Jo receta e punimit: paratrajnimi i tij përdori një ngrohje 100-hapëshe mbi 200000 hapa

Paratrajnimi përdori 481 grupe të dhënash komunitare LeRobot, 22.9 K episode dhe 10.6 M korniza në 4 GPU, 200000 hapa me një grup global prej 256; punimi e vlerëson të gjithë projektin në rreth 30 K orë GPU. Një numër për t'u vëzhguar: blogu i lançimit të Hugging Face thotë 487 grupe të dhënash të kuruar, ndërsa tabela e punimit thotë 481. Ne përdorim shifrën e punimit dhe shënojmë mosmarrëveshjen.

Faqja e modelit SmolVLA në AY-Robots që tregon numrin e parametrave, nivelin e GPU 24 GB, vonesën e inferencës për hap veprimi dhe numrin minimal të episodeve
Faqja e platformës SmolVLA: 450 M parametra, 245 ms për hap veprimi, niveli RTX 4090, minimumi 30 episode.
Standard krahasimiSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
Mesatarja LIBERO, shumë-detyrësh87.388.7586.0 (3.3 B, robotics-pretrained)-
Mesatarja Meta-World, shumë-detyrësh57.368.2447.9 (3.5 B, robotics-pretrained)-
SO-100 real, 3 detyra, trajnimi shumë-detyrësh78.3-61.7 (3.5 B)-
SO-100 real, 3 detyra, një-detyrësh, pa paratrajnim robotik40.0--48.3
SO-101 lego pick-place, një-detyrësh, në shpërndarje90--70
SO-101 lego pick-place, një-detyrësh, jashtë shpërndarjes50--40
Lexoni të gjithë tabelën, jo rreshtin kryesor

LIBERO është simulim dhe çdo gjë kompetente shënon në të tetëdhjetat atje tani. Rreshti i vërtetë SO-100, ku një model 450 M mund një model 3.5 B me 16.6 pikë, është ai interesant; rreshti poshtë tij është kundërpesha. Hiqni paratrajnimin e komunitetit dhe trajnimin shumë-detyrësh dhe i njëjti model bie në 40.0, nën ACT. Pretendimi i mbrojtshëm është se një model i vogël nuk është automatikisht më i keq, jo se është më i mirë.

Një rastësi ndihmon: tabela Meta-World e punimit të SmolVLA përmban numrat e publikuar të TinyVLA si bazë, kështu që për një herë të dy modelet ndodhen në një tabelë, SmolVLA-0.45B në 57.3 kundrejt TinyVLA-H në 31.6. Gjithashtu raporton se trajnimi i SmolVLA është rreth 40 për qind më i shpejtë se Pi0 me 6 herë më pak memorie. E gjithë kjo vjen nga autorët e SmolVLA; hyrja në arenë lidh çdo vlerë me burimin e saj.

Ku SmolVLA kalon kohën e saj

AY-Robots liston SmolVLA në 245 ms për hap veprimi dhe ACT në 20 ms në katalogun e politikave. TinyVLA raporton 14 ms për parashikim veprimi. Këta numra nuk janë të krahasueshëm, dhe trajtimi i tyre si të tillë është gabimi më i zakonshëm në këtë temë: disa llogarisin një kalim përpara, disa e ndajnë atë kalim nëpër një copë pasi ndarja e veprimeve në copa e amortizon atë.

  • SmolVLA lëshon 50 veprime për kalim përpara dhe ekzekuton të gjitha 50. Me 30 fps që përdor punimi në robotë realë, një inferencë mbulon rreth 1.7 sekonda lëvizje.
  • Inferenca asinkrone llogarit copën tjetër ndërsa ajo aktuale ende ekzekutohet: 9.7 s kohë mesatare e përfundimit të detyrës kundrejt 13.75 s sinkrone, afërsisht 30 për qind më shpejt, dhe 19 cikle marrjeje dhe vendosjeje në një dritare fikse 60-sekondëshe kundrejt 9.
  • Shkallët e suksesit ishin të krahasueshme dhe jo më të mira, 78.3 sinkrone kundrejt 73.3 asinkrone. Asinkroniteti blen prurje, jo saktësi.
  • Ndarja në copa fsheh vonesën e llogaritjes, jo vonesën e rrjetit, dhe e bën politikën më pak reaktive sepse është e angazhuar për 50 veprime.
Inferenca në distancë nuk është falas, dhe asnjë platformë nuk rregullon fizikën

AY-Robots mund të ofrojë automatikisht një pod GPU në cloud që shërben politikën tuaj ndërsa klienti lokal i robotit komunikon me atë pikë fundore, dhe pod-i përmban një watchdog pasiv në mënyrë që të shkatërrohet vetë në vend që të faturojë në heshtje. Ajo që nuk bën është heqja e udhëtimit vajtje-ardhje në internetin publik. Cikli i kontrollit nëpër pesë politikat këtu është 20 deri në 485 ms për hap veprimi para çdo rrjeti, kështu që inferenca në distancë është e realizueshme për marrje-vendosje të ngadaltë, jo për lëvizje të shpejtë reaktive.

Tabela krahasuese e politikave të AY-Robots që tregon GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dhe ACT me numrin e parametrave, nivelin e kërkuar të GPU-së, vonesën e inferencës për hap veprimi dhe numrin minimal të episodeve që secila kërkon
SmolVLA në ~450 M dhe ACT në ~80 M janë të dyja që përshtaten në një kartë 24 GB. Tre të tjerat kërkojnë një A100 ose H100 80 GB.

Rregullimi i imët i SmolVLA në një kartë konsumatore

Shtegu manual, në lerobot 0.6.1, versioni aktual i PyPI-së që nga 23 gusht 2026. Gjithçka më poshtë vjen nga dokumentacioni i Hugging Face lerobot SmolVLA, i marrë në të njëjtën ditë; versioni i udhëzuar është më i butë.

  1. 1
    Instaloni lerobot me shtesën smolvla

    Varësitë e SmolVLA janë një shtesë opsionale, jo pjesë e instalimit bazë. Instalimi pa të dhe më pas pyetja pse lloji i politikës është i panjohur është një humbje e zakonshme gjysmë ore.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Merrni një grup të dhënash me episode të mjaftueshme

    Dokumentacioni rekomandon rreth 50 episode dhe thekson se e njëjta detyrë me 25 nuk ishte e mjaftueshme. AY-Robots e vendos minimumin në 30. Regjistroni tuajat, ose filloni nga drejtoria e grupeve të të dhënave.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Filloni rregullimin e imët

    Komanda nga udhëzuesi i lerobot, e pamodifikuar. Dokumentacioni vlerëson 20000 hapa në rreth 4 orë në një A100. Në një kartë 24 GB, prisni më gjatë dhe mateni.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Ulni madhësinë e grupit derisa të përshtatet

    batch_size=64 është një shembull i dokumentuar, jo një premtim për kartën tuaj. Dokumentacioni këshillon të filloni me të vogël dhe të rritni ndërsa kohët e ngarkimit mbeten të shkurtra.

    bash
    lerobot-train --help
  5. 5
    Vendosni pikën e kontrollit në krah

    E njëjta bibliotekë, një komandë. Flamujt e ndarjes në kohë reale janë të komentuar në dokumentacion dhe janë ata që duhen përdorur në pajisje me fuqi të ulët.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Pika e kontrollit është rezultati i dorëzueshëm

Cilëndo rrugë të merrni, përfundoni me një pikë kontrolli plus konfigurimin që e prodhoi atë. Mbani rishikimin e grupit të të dhënave, numrin e hapave dhe farën pranë tij. lerobot përdor farën 1000 si parazgjedhje; pika hyrëse e rregullimit të imët të GR00T nuk ekspozon asnjë farë, kështu që ato ekzekutime nuk janë të riprodhueshme bit-për-bit. Mekanika në dokumentacionin e trajnimit.

Dy mënyra për të vendosur një VLA të vogël në një krah

Ju zotëroni makinën dhe mënyrat e dështimit. Për SmolVLA kjo është e arsyeshme: një shtesë pip, një komandë trajnimi, një komandë vendosjeje. Për TinyVLA është një riprodhim kërkimor me pin të ngrirë, një shteg DeepSpeed të prishur dhe një konvertim të të dhënave që e shkruani vetë.

  1. Merrni një kartë 24 GB, regjistroni 30 deri në 50 episode, verifikoni transmetimet e kamerës kornizë pas kornize.
  2. pip install -e ".[smolvla]", lerobot-train kundrejt lerobot/smolvla_base, pastaj shërbeni pikën e kontrollit në makinën ku është lidhur krahu.
  3. Për TinyVLA: mjedis i veçantë conda, konvertoni të dhënat në HDF5, regjistroni detyrën në constants.py, rregulloni shtegun zero2.json, shkurtoni train.sh nga tetë GPU në një.
Avantazhe
  • Pa faturim për orë pasi karta të jetë paguar.
  • Inferenca qëndron pranë servove, e vetmja mënyrë për të marrë një cikël kontrolli të shpejtë.
  • Ju mund të ndryshoni kodin e politikës, dhe TinyVLA është i disponueshëm vetëm në këtë mënyrë.
Kompromise
  • Një 4090 përjashton çdo politikë ~3 B, kështu që nuk ka krahasim lokal kundrejt GR00T N1.7 ose Pi0.5.
  • Konfigurimi i mjedisit është puna e vërtetë. Vetëm pin-et e TinyVLA mund të kushtojnë një ditë.
  • Pa radhë, pa riprovim, pa ruajtje të pikave të kontrollit. Një rindezje në hapin 14000 do të thotë të fillosh përsëri.

Kur një model i vogël është zgjedhja e gabuar

Të dyja punimet janë më të kujdesshme këtu sesa përmbledhjet. Analiza e dështimit të TinyVLA është specifike: varianti 0.4 B dështoi tre herë duke keqlexuar udhëzimin, të cilën autorët ia atribuojnë kuptimit të kufizuar të gjuhës në VLM-në më të vogël, dhe ky modalitet u zhduk në 1.3 B. SmolVLA tregon të njëjtën kurbë nga ana tjetër: versioni 2.25 B i arkitekturës identike shënon 88.75 në LIBERO dhe 68.24 në Meta-World kundrejt 87.3 dhe 57.3 për modelin 0.45 B.

Zgjedhja e një VLA-je nën 1 B
Ku fiton
  • Përshtatet në një kartë 24 GB, gjë që ul koston e një eksperimenti nga dhjetëra dollarë në disa.
  • Mjaftueshëm i shpejtë për të funksionuar pranë krahut, kështu që nuk ka kërcim rrjeti në ciklin e kontrollit.
  • Rregullohet mirë me të dhënat që një person mund të regjistrojë, dhjetëra episode në vend të mijëra.
  • Peshat, lista e të dhënave dhe kodi i SmolVLA-së janë publike, kështu që një rezultat i keq mund të debugohet.
Ku humbet
  • Në ndjekjen e udhëzimeve: më pak parametra gjuhe, më pak aftësi për të ndarë shprehje referuese të ngjashme.
  • Më pak përgjithësim hapësinor dhe vizual në konfigurime që nuk i keni regjistruar.
  • Më i ndjeshëm ndaj defekteve të grupit të të dhënave, me më pak paratrajnim për t'u mbështetur.
  • Puna me shumë detyra dhe me horizont të gjatë ende favorizon modelet më të mëdha, duke përfshirë variantin 2.25 B të SmolVLA-së.

Krahasimi që ia vlen të bëhet nuk është TinyVLA kundër SmolVLA. Është SmolVLA kundër ACT në detyrën tuaj, dhe punimi i SmolVLA është argumenti pse. I trajnuar me një detyrë të vetme pa paratrajnim robotik, SmolVLA arriti mesatarisht 40.0 në tre detyra SO-100 ku ACT me një detyrë të vetme arriti 48.3. Ajo që e ngre në 78.3 është paratrajnimi i komunitetit plus trajnimi me shumë detyra, jo vetëm arkitektura. Në detyrën lego SO-101, të dyja me një detyrë të vetme, SmolVLA fiton: 90 kundër 70 në shpërndarje. Pastaj SmolVLA kundër Pi0.5 nëse buxheti e lejon.

Në këtë madhësi, grupi i të dhënave vendos rezultatin

Ka më pak paratrajnim paraprak për të mbuluar të dhënat e këqija, kështu që një kurbë e pastër humbjeje në një grup të dhënash me defekt ju jep një politikë që riprodhon defektin me besim. Dokumentet e lerobot janë të drejtpërdrejta për strukturën: 50 episode në 5 pozicione kubi, 10 për pozicion, funksionuan; 25 jo. Nëse humbja duket mirë dhe krahu nuk bën asgjë të dobishme, filloni te humbja bie, politika nuk bën asgjë, politika funksionon vetëm në një konfigurim ose mbledhja e të dhënave të trajnimit VLA që janë vërtet të përdorshme.

Pesë politika, një tabelë krahasimi

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dhe ACT me numër real parametrash, vonesë inferencimi për hap veprimi, nivelin e GPU-së që secili ka nevojë dhe numrin minimal të episodeve para se të bëjë diçka të dobishme.

Krahasoni politikat

Një tabelë vendimesh mbi të cilën mund të veproni

Situata juajFilloni mePse
Një detyrë, demonstrime të mira, pa gjuhëACT~80 M, 20 ms, kartë 24 GB, pa model bazë për t'u shkarkuar
Disa detyra të lidhura, një udhëzim secilaSmolVLA450 M, në lerobot, minimumi 30 episode, 1 deri në 3 USD për ekzekutim
Riprodhimi specifik i rezultatit TinyVLATinyVLA-B ose TinyVLA-HRepoja është e vetmja rrugë: mjedis i izoluar, të dhëna të konvertuara
Shumë-detyra, udhëzime të ndryshme, buxhet A100GR00T N1.7 ose Pi0.5~3 B, 152 ms dhe 485 ms për hap, 4 deri në 12 USD për ekzekutim
Pa robot endeDrejtoni një krah realKrahu i drejtpërdrejtë i bazuar në radhë nuk kërkon regjistrim dhe as pajisje

Për rreshtin e fundit, krahu live transmeton një SO-100 fizik që mund ta drejtosh nga shfletuesi pa llogari, dhe tre mënyrat për të filluar mbulon pjesën tjetër. SO-100 është krahu referencë këtu, afërsisht 110 deri në 150 EUR në pjesë, me një udhëzues të plotë konfigurimi.

Çfarë vjen pas modeleve nën 1 B

Zvogëlimi i numrit të parametrave është një mënyrë për ta bërë një VLA të lirë dhe jo domosdoshmërisht fituese. OpenVLA-OFT (arXiv 2502.19645) ruan shtyllën kurrizore 7 B dhe ndryshon vetëm mënyrën se si deshifrohen veprimet, duke raportuar një rritje 26x në prurjen e gjenerimit të veprimeve dhe LIBERO-n që rritet nga 76.5 në 97.1 për qind. BitVLA (arXiv 2506.07530) e bën çdo peshë të një shtylle kurrizore 1-bit BitNet b1.58 2B4T ternare, duke raportuar 11.0x më pak memorie dhe 4.4x vonesë më të ulët nga fillimi në fund, ndërsa përputhet me OpenVLA-OFT me saktësi të plotë. X-VLA-0.9B (arXiv 2510.10274) qëndron në linjën 1 B me përputhje fluksi.

Fili i përbashkët: dekoderi i veprimeve, jo modeli i gjuhës, është aty ku qëndron vonesa. Pyesni se si një politikë lëshon veprime përpara se të pyesni sa parametra ka. arena ka 85 modele dhe 332 rezultate, secila e lidhur me burimin e saj; ka një përmbledhje më të gjerë në hyrjen tonë në VLA.

A mund ta rregulloj SmolVLA në një RTX 4090?

Po. SmolVLA ka 450 M parametra dhe AY-Robots e ekzekuton atë në nivelin RTX 4090 / 24 GB. Shembulli i lerobot përdor --batch_size=64, i cili është një shembull dhe jo një garanci për kartën tuaj; dokumentacioni këshillon të filloni me pak dhe të rritni ndërsa kohët e ngarkimit mbeten të shkurtra. Pritni më gjatë se rreth 4 orët që dokumentacioni citon për 20000 hapa në një A100.

A është TinyVLA i disponueshëm në lerobot apo në AY-Robots?

Jo për të dyja. TinyVLA ekziston vetëm në depozitën e tij kërkimore, ndryshimi i fundit 11 Mars 2025, dhe formati i tij është HDF5 i stilit ACT dhe jo LeRobot. AY-Robots trajnon GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dhe ACT. Nëse dëshironi TinyVLA, duhet ta ndërtoni vetë, dhe do t'ju duhet të rregulloni shtegun e konfigurimit të DeepSpeed në scripts/train.sh fillimisht.

A është vërtet konkurrues një model 450 M me një model 3 B?

Në standardet e autorëve, po: 87.3 kundrejt 86.0 në LIBERO kundrejt një Pi0 të paratrajnuar për robotikë në 3.3 B, dhe 78.3 kundrejt 61.7 në tre detyra reale SO-100 ku i njëjti punim etikon Pi0 në 3.5 B. Kufiri është në të njëjtin punim: detyrë e vetme pa paratrajnim robotikë, SmolVLA bie në 40.0, nën 48.3 të ACT.

Sa episode më duhen para se një VLA i vogël të bëjë diçka?

AY-Robots vendos minimumin e SmolVLA në 30 episode dhe minimumin e ACT në 50. Dokumentacioni i lerobot rekomandon rreth 50 dhe raporton se 25 nuk ishin të mjaftueshme për të njëjtën detyrë. Struktura ka rëndësi po aq sa numri: grupi i punimit përdori 5 pozicione kubi me nga 10 episode secili.

Pse numrat e vonesës së publikuar nuk përputhen kaq shumë?

Ato masin gjëra të ndryshme. TinyVLA raporton 14 ms për parashikim veprimi në një A6000; AY-Robots liston SmolVLA në 245 ms dhe ACT në 20 ms për hap veprimi. Disa shifra mbulojnë një kalim përpara, disa ndajnë një kalim nëpër një bllok me 50 veprime, dhe pothuajse asnjë nuk përfshin kapjen e kamerës ose shkrimin te servot.

A e zgjidh inferenca në cloud problemin e GPU-së?

Pjesërisht. AY-Robots automatikisht ofron një pod që shërben politikën ndërsa klienti lokal flet me atë pikë fundore, me një mbikëqyrës pasiv në mënyrë që të shkatërrohet vetë në vend që të faturojë në heshtje. Nuk mund të heqë udhëtimin vajtje-ardhje të internetit publik, dhe cikli i kontrollit është tashmë 20 deri në 485 ms për hap veprimi. Mirë për marrje-vendosje të ngadaltë, jo për lëvizje të shpejtë reaktive.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started