AY-Robots politikas salīdzināšanas tabula ar parametru skaitu, GPU līmeņiem un secinājumu latentumu GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA un ACT
SmolVLATinyVLAMazs VLAPatērētāju GPULeRobot

Mazi VLA modeļi: TinyVLA, SmolVLA un zem 1B parametru gadījums

AY-Robots ResearchAugust 23, 202619 min lasīšanai

TinyVLA un SmolVLA ievieto funkcionējošu VLA zem 1B parametru. Reāli skaitļi no abiem rakstiem, lerobot noklusējuma iestatījumi, izmērītā latentums un cik maksā viena izpilde uz 24 GB kartes.

Gandrīz katrs redzes-valodas-darbības modelis, par ko tiek rakstīts, pieņem datu centra karti. OpenVLA ir 7 miljardi parametru. GR00T N1.7 un Pi0.5 ir aptuveni 3 miljardi un prasa A100 80 GB karti precizēšanai. Ja uz jūsu galda ir 4090 karte, šāda modeļu klase ir nesasniedzama.

Divi pētījumi apgalvo, ka jums tas nav vajadzīgs. TinyVLA (arXiv 2409.12514, pieņemts IEEE Robotics and Automation Letters 2025. gada februārī) veido VLA no 400 miljonu līdz 1,3 miljardu parametru pamata plus difūzijas darbības galvu. SmolVLA (arXiv 2506.01844, iesniegts 2025. gada 2. jūnijā) piedāvā 450 miljonus parametru ar atvērtiem svariem, atvērtiem datiem un skriptu, kas darbojas uz vienas patērētāju kartes. Lūk, ko abi izmērīja, un kur arguments par mazāk nekā 1 miljardu parametru vairs nav spēkā.

Kas jums jāzina

  • TinyVLA tiek piegādāts trīs izmēros: 422 miljoni kopā ar 101 miljonu apmācāmu, 740 miljoni ar 138 miljoniem, 1,3 miljardi ar 143 miljoniem. Tikai pirmie divi ir zem 1 miljarda.
  • Tā IV tabula mēra 14 ms par katru darbības prognozi TinyVLA-1B uz vienas A6000, salīdzinot ar 292 ms OpenVLA-7B un 140 ms samazinātam OpenVLA-1B.
  • Galva nodrošina šo ātrumu, nevis pamats: nomainiet TinyVLA-H difūzijas galvu pret ACT galvu, un pieci reālo robotu uzdevumi samazinās no 94,0 vidējā rādītāja līdz viencipara skaitļiem. MLP galva visur iegūst 0 punktus.
  • SmolVLA ir 450 miljoni, aptuveni 100 miljoni no tiem ir darbības eksperts, iepriekš apmācīts uz 481 kopienas LeRobot datu kopas un 10,6 miljoniem kadru. Tas ziņo par 87,3 LIBERO pret 86,0 robotikas iepriekš apmācītam Pi0 ar 3,3 miljardiem parametru, un 78,3 trīs reālos SO-100 uzdevumos pret 61,7 Pi0 ar 3,5 miljardiem parametru.
  • Apmācīts vienam uzdevumam bez šīs iepriekšējas apmācības, SmolVLA samazinās līdz 40,0 šajos uzdevumos, zem ACT 48,3. Mazs nenozīmē automātiski viegls.
  • TinyVLA nav LeRobot integrācijas un izmanto CUDA 11.7 riteņu steku. SmolVLA ir lerobot un šeit maksā aptuveni 1 līdz 3 USD par katru palaišanu 24 GB līmenī.

Kas patiesībā tiek uzskatīts par mazu VLA

Parametru skaits modeļa kartītē nav viens skaitlis. Tas var nozīmēt kopējo svaru skaitu, inferencē ielādētos svarus vai svarus, kas saņem gradientus laikā. TinyVLA ziņo par abiem, un atšķirība ir liela: TinyVLA-H ir 1.3 B kopā, bet 143 M apmācāmi, jo redzes tornis un lielākā daļa valodu modeļa paliek iesaldēti, kamēr LoRA adapteri un darbības galva kustas. Rakstā apmācāmā daļa ir aptuveni 5 procenti.

ModelisParametriPamatstruktūraDarbības galvaAvots
TinyVLA-S422 M kopā, 101 M apmācāmiLlava-Pythia ~400 MDiffusion (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M kopā, 138 M apmācāmiLlava-Pythia ~700 MDiffusionarXiv 2409.12514
TinyVLA-H1.3 B kopā, 143 M apmācāmiLlava-Pythia ~1.3 BDiffusionarXiv 2409.12514
SmolVLA450 M, ~100 M darbības ekspertsSmolVLM2-500M-Video-InstructFlow matching expertarXiv 2506.01844
Octo-Small27 MViT-S mērogs, T5-Base teksta kodētājsDiffusionocto-small-1.5 card
ACT~80 MResNet, bez valodu modeļaTieša fragmentu regresijaAY-Robots catalog
OpenVLA7 BLlama 2 7 B, DINOv2 and SigLIP encodersAutoregresīvi darbības marķieriarXiv 2406.09246

Divas rindas ir vērts apspriest. ar aptuveni 80 M ir mazāks par visu pārējo šeit, taču tam nav valodu modeļa, tāpēc tas nav VLA: tas apgūst vienu uzdevumu un tam nevar likt darīt citu. ar 27 M tiek kondicionēts, izmantojot T5-Base teksta kodētāju, nevis LLM pamatstruktūru. Labas bāzes līnijas, neviena no tām nenodrošina instrukciju izpildi, ko norāda etiķete.

1 B līnija ir patvaļīga

TinyVLA-H, variants, kas nodrošina galvenos rezultātus, ir 1.3 B un atrodas virs līnijas. Labāks jautājums ir, vai modelis apmācības laikā ietilpst 24 GB un sasniedz jūsu kontroles ātrumu inferencē. Piecas politikas, ko varat apmācīt šeit, ir atrodamas politiku lapā; TinyVLA ir arēnas ieraksts, ja vēlaties redzēt tā skaitļus blakus citiem.

TinyVLA: ātrums nāk no galvas, nevis no mugurkaula

Acīmredzamais secinājums ir, ka viņi samazināja valodu modeli, tāpēc tas kļuva ātrāks. Raksta ablācija liecina par pretējo. Aizstājot OpenVLA 7 B mugurkaulu ar aptuveni 1 B, samazinājās prognozēšana par darbību no 292 ms līdz 140 ms, kas ir 2x pieaugums. TinyVLA-H, ar salīdzināmu parametru skaitu, darbojas ar 14 ms uz tās pašas kartes. Pārējais 10x ir darbības galva.

ModelisPrognozēšana par darbībuMērīts uz
OpenVLA-7B292 msviens A6000
OpenVLA-1B, mugurkauls aizstāts ar TinyVLA140 msviens A6000
TinyVLA-1B (TinyVLA-H)14 msviens A6000

OpenVLA izstaro darbības kā diskretizētus žetonus caur valodu modeļa galvu, pa vienam katrai darbības dimensijai, autoregresīvi. TinyVLA pievieno difūzijas dekoderi, kas rada visu gabalu vienā piegājienā. V tabulā ir TinyVLA-H arhitektūra un tiek mainīta tikai galva, veicot tos pašus piecus reālo robotu uzdevumus. Tas ir tīrākais pierādījums abos rakstos par argumentu plūsmas saskaņošana politikām, un iemesls, kāpēc Pi0 atteicās no žetonu dekodēšanas.

Galva uz TinyVLA-HNovietot tenisa bumbiņuApgriezt krūziSakraut kubusAizvērt atvilktniAtvērt kasti
Difūzija (droid_diffusion)90.098.398.396.786.7
Darbību sadalīšanas transformators13.38.38.313.323.3
Daudzslāņu perceptrons00000
Ko aptver TinyVLA rādītāji

292 / 140 / 14 ms rādītāji ir no IV tabulas, visi uz viena A6000. Tie ir par katru darbības prognozi un neietver kameras uztveršanu, priekšapstrādi un seriālo rakstīšanu uz servomotoriem. Publicēto latentumu uzskatiet par apakšējo robežu, nekad ne par vadības ātrumu. Mūsu pašu rādītājiem ir tāds pats ierobežojums: skatiet secinājumu latentums.

Ko sasniedza TinyVLA

EtalonsProtokolsTinyVLA-HBāzes līnijas
MetaWorld, 50 uzdevumi, simulācijaDaudzuzdevumu, 50 demonstrācijas, 3 sēklas77.6 / 21.5 / 11.4 / 15.8 pēc grūtības pakāpes, vidēji 31.6Diffusion Policy vidēji 10.5
Reāls Franka Panda, 5 uzdevumi100 trajektorijas uz uzdevumu, 20 mēģinājumi94.0 vidējiOpenVLA 68.3, Diffusion Policy 35.3
Divroku UR5, 3 uzdevumiDaudzuzdevumu, 10 mēģinājumi uz uzdevumu76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Diffusion Policy 40.3 / 31.3 / 43.0

Bimanualā rinda ir ar garlaicīgu paskaidrojumu, ko sniedz pats raksts: OpenVLA ir iepriekš apmācīts uz Open X-Embodiment, kas pilnībā sastāv no vienas rokas datiem, tāpēc divu roku darbību telpa ir ārpus izplatīšanas un tā iegūst nulli punktu. Difūzijas politikas bāzes līnija pārspēj TinyVLA-H divos no šiem trim uzdevumiem. Fons Open X-Embodiment aprakstā.

AY-Robots arēnas līderu saraksts, šķirojama tabula ar 85 VLA modeļiem un 332 etalonu rezultātiem, katra vērtība ir saistīta ar rakstu vai modeļa karti, no kuras tā nākusi
Starpmodelu etalonu rādītāji ir salīdzināmi tikai tad, ja var redzēt, no kurienes katrs nāk.

TinyVLA repozitorijs, uz 2026. gada augustu

Raksts ir labs. Kods ir pētniecības izlaidums. Repozitorijs ir github.com/liyaxuanliyaxuan/TinyVLA; tā README norāda koda izlaišanas datumu 2025. gada 17. februārī un pēdējo izmaiņu 2025. gada 11. martā. Tas ir piemērots raksta reproducēšanai, bet problēma, ja vēlējāties uzturētu bibliotēku.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Instalācijas secība no TinyVLA README, pārbaudīta pret repozitoriju 2026. gada 23. augustā.
Atkarību piesaistes ir slazds, kas apēd dienu

requirements.txt piesaista torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 un CUDA steku 11.x versijām: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README prasa Python 3.10; lerobot 0.6.1 prasa 3.12 vai jaunāku, tāpēc abas nevar dalīties vienā vidē. Vispirms pārliecinieties, vai jūsu GPU paaudzei ir pieejama torch 2.0.1 versija. Ja izpilde apstājas VRAM trūkuma dēļ, atmiņas trūkuma kontrolsaraksts ir ātrāks par minēšanu.

TinyVLA arī nelasa LeRobot datu kopas. Tās formāts ir ACT stila HDF5: action, language_raw un novērojumu grupa ar vairāku skatu attēliem, joint_positions, qpos un qvel. Repozitorijs piegādā data_utils/rlds_to_h5py.py RLDS ievadei, un katrs uzdevums tiek reģistrēts manuāli aloha_scripts/constants.py ar savu dataset_dir, episode_len un camera_names. Ja jūsu epizodes nāca no lerobot vai darbvirsmas klienta, konversija ir jūsu ziņā.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Saīsināts no scripts/train.sh. Katrs iepriekš minētais karogs un vērtība ir piegādātajā failā.
  • --num_gpus=8 pieņem astoņu karšu mezglu. Iestatiet to uz 1 un samaziniet pakešu izmēru krietni zem 32. Neviena viena GPU versija netiek piegādāta augšup, tāpēc komandu nevar palaist burtiski uz 4090.
  • --deepspeed scripts/zero2.json norāda uz failu, kas nav augšējā līmeņa scripts direktorijā. DeepSpeed konfigurācijas tiek piegādātas llava-pythia/scripts/zero2.json. Pirms pirmās palaišanas izlabojiet ceļu.
  • README prasa, lai izvades direktorija nosaukums saturētu llava_pythia, kā arī lora, ja LoRA ir iespējota.
  • Pamatmodelis ir atsevišķa lejupielāde: lesjie/Llava-Pythia-400M, -700M vai -1.3B. Nav viena bāzes kontrolpunkta, uz kuru jūs norādāt politiku tā, kā jūs norādāt uz lerobot/smolvla_base.

SmolVLA: zem 1 B modelis, ko varat palaist šopēcpusdien

SmolVLA izvirza to pašu argumentu uzturētā bibliotēkā. Tam ir 450 M parametri uz SmolVLM2-500M-Video-Instruct pamatmodeļa, un efektivitāte nāk no iestatījumiem, ko varat nolasīt no configuration_smolvla.py, nevis no apgalvojuma par tā mazumu.

Iestatījums configuration_smolvla.pyNoklusējumsKo tas dod
num_vlm_layers16Tiek palaisti tikai pirmie 16 valodu modeļa slāņi
expert_width_multiplier0.75Darbības eksperta slēptais izmērs ir 75 procenti no VLM
self_attn_every_n_layers2Pašuzmanība mijas ar krustenisko uzmanību
chunk_size / n_action_steps50 / 50Viena pāreja izdod 50 darbības, un visas 50 tiek izpildītas
num_steps10Plūsmas saskaņošanas trokšņu samazināšana fiksēta uz 10 soļiem
tokenizer_max_length48Instrukcija tiek saīsināta līdz 48 marķieriem
freeze_vision_encoder / train_expert_onlyTrue / TruePrecīza pielāgošana pārvieto ekspertu, nevis redzes torni
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Nav raksta recepte: tā iepriekšējā apmācība izmantoja 100 soļu iesildīšanos vairāk nekā 200000 soļu garumā

Iepriekšējā apmācībā tika izmantotas 481 kopienas LeRobot datu kopas, 22,9 K epizodes un 10,6 M kadri uz 4 GPU, 200000 soļi ar globālo partiju 256; rakstā viss projekts tiek lēsts ap 30 K GPU stundām. Viens skaitlis, kam jāpievērš uzmanība: Hugging Face palaišanas emuārā minētas 487 atlasītas datu kopas, kur raksta tabulā minētas 481. Mēs izmantojam raksta skaitli un atzīmējam neatbilstību.

Salīdzinošais testsSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
LIBERO vidējais, daudzuzdevumu87.388.7586.0 (3.3 B, robotics-pretrained)-
Meta-World vidējais, daudzuzdevumu57.368.2447.9 (3.5 B, robotics-pretrained)-
Reālais SO-100, 3 uzdevumi, daudzuzdevumu apmācība78.3-61.7 (3.5 B)-
Reālais SO-100, 3 uzdevumi, viena uzdevuma, bez robotikas iepriekšējas apmācības40.0--48.3
SO-101 lego paņemšanas-novietošanas, viena uzdevuma, izplatījumā90--70
SO-101 lego paņemšanas-novietošanas, viena uzdevuma, ārpus izplatījuma50--40
Izlasiet visu tabulu, nevis tikai virsraksta rindu

LIBERO ir simulācija, un viss kompetentais tagad tur gūst astoņdesmitos punktus. Interesanta ir reālā SO-100 rinda, kur 450 M modelis pārspēj 3.5 B modeli par 16.6 punktiem; rinda zem tās ir pretsvars. Atņemot kopienas iepriekšējo apmācību un daudzuzdevumu apmācību, tas pats modelis nokrītas līdz 40.0, zem ACT. Aizstāvamais apgalvojums ir, ka mazs modelis nav automātiski sliktāks, nevis tas, ka tas ir labāks.

Viens nejaušs palīgs: SmolVLA raksta Meta-World tabulā ir iekļauti TinyVLA paši publicētie skaitļi kā bāzes līnija, tāpēc vienreiz abi modeļi atrodas vienā tabulā, SmolVLA-0.45B ar 57.3 pret TinyVLA-H ar 31.6. Tas arī ziņo, ka SmolVLA apmācība ir aptuveni par 40 procentiem ātrāka nekā Pi0, izmantojot 6 reizes mazāk atmiņas. Viss tas nāk no SmolVLA autoriem; arēnas ieraksts saista katru vērtību ar tās avotu.

Kur SmolVLA pavada savu laiku

AY-Robots norāda SmolVLA ar 245 ms par darbības soli un ACT ar 20 ms politiku katalogā. TinyVLA ziņo par 14 ms par darbības prognozi. Šie skaitļi nav salīdzināmi, un to uzskatīšana par salīdzināmiem ir visbiežākā kļūda šajā tēmā: daži mēra vienu pāreju uz priekšu, daži sadala šo pāreju pa gabalu, kad darbību sadalīšana gabalos to amortizē.

  • SmolVLA izdod 50 darbības vienā pārejā uz priekšu un izpilda visas 50. Pie 30 kadriem sekundē, ko raksts izmanto reālos robotos, viena secinājumu veikšana aptver aptuveni 1.7 sekundes kustības.
  • Asinhronā secinājumu veikšana aprēķina nākamo gabalu, kamēr pašreizējais vēl tiek izpildīts: vidējais uzdevuma pabeigšanas laiks 9.7 s pret 13.75 s sinhronā režīmā, aptuveni par 30 procentiem ātrāk, un 19 paņemšanas un novietošanas cikli fiksētā 60 sekunžu logā pret 9.
  • Veiksmes rādītāji bija salīdzināmi, nevis labāki: 78.3 sinhronā režīmā pret 73.3 asinhronā režīmā. Asinhronā darbība nodrošina caurlaidspēju, nevis precizitāti.
  • Sadalīšana gabalos slēpj aprēķinu latentumu, nevis tīkla latentumu, un tas padara politiku mazāk reaktīvu, jo tā ir apņēmusies veikt 50 darbības.
Attālā secināšana nav bezmaksas, un neviena platforma nelabo fiziku

AY-Robots var automātiski nodrošināt mākoņa GPU podu, kas apkalpo jūsu politiku, kamēr vietējais robota klients sazinās ar šo galapunktu, un pods satur dīkstāves sargsuni, lai tas iznīcinātu sevi, nevis klusi rēķinātu. Tas, ko tas nedara, ir publiskā interneta turp-atpakaļ ceļa novēršana. Kontroles cilpa piecās politikās šeit ir no 20 līdz 485 ms par darbības soli pirms jebkāda tīkla, tāpēc attālā secināšana ir piemērota lēnai paņemšanai un novietošanai, nevis ātrai reaktīvai kustībai.

AY-Robots politiku salīdzināšanas tabula, kas parāda GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA un ACT ar parametru skaitu, nepieciešamo GPU līmeni, secināšanas latentumu par darbības soli un minimālo epizožu skaitu, kas katrai nepieciešams
SmolVLA ar ~450 M un ACT ar ~80 M ir divi, kas der 24 GB kartei. Pārējiem trim ir nepieciešama A100 vai H100 80 GB.

SmolVLA precizēšana uz vienas patērētāju kartes

Manuālais ceļš, izmantojot lerobot 0.6.1, pašreizējo PyPI izlaidumu no 2026. gada 23. augusta. Viss zemāk minētais nāk no Hugging Face lerobot SmolVLA dokumentācijas, kas iegūta tajā pašā dienā; vadītā versija ir maigāka.

  1. 1
    Instalējiet lerobot ar smolvla papildinājumu

    SmolVLA atkarības ir papildu opcija, kas nav daļa no pamata instalācijas. Instalēšana bez tām un pēc tam brīnīšanās, kāpēc politikas tips nav zināms, ir bieži zaudēta pusstunda.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Iegūstiet datu kopu ar pietiekami daudzām epizodēm

    Dokumentācija iesaka aptuveni 50 epizodes un norāda, ka tas pats uzdevums ar 25 epizodēm nebija pietiekams. AY-Robots nosaka minimumu 30. Ierakstiet savus datus vai sāciet no datu kopu direktorija.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Sāciet precizēšanu

    Komanda no lerobot ceļveža, nemodificēta. Dokumentācija norāda, ka 20000 soļi aizņem aptuveni 4 stundas uz viena A100. Uz 24 GB kartes sagaidiet ilgāku laiku un izmēriet to.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Samaziniet partijas lielumu, līdz tas der

    batch_size=64 ir dokumentēts piemērs, nevis solījums par jūsu karti. Dokumentācija iesaka sākt ar mazu vērtību un palielināt to, kamēr ielādes laiks paliek īss.

    bash
    lerobot-train --help
  5. 5
    Izvietojiet kontrolpunktu uz rokas

    Tā pati bibliotēka, viena komanda. Reāllaika sadalīšanas karodziņi ir komentēti dokumentācijā un ir tie, kas jāizmanto mazjaudas aparatūrā.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Kontrolpunkts ir piegādājamais

Neatkarīgi no izvēlētā ceļa, jūs iegūstat kontrolpunktu un konfigurāciju, kas to radīja. Saglabājiet datu kopas revīziju, soļu skaitu un sēklu blakus. lerobot noklusējuma sēkla ir 1000; GR00T precizēšanas sākumpunkts vispār neatklāj sēklu, tāpēc šie izpildījumi nav bitu-pa-bitam reproducējami. Mehānika atrodama apmācības dokumentācijā.

Divi veidi, kā iegūt mazu VLA uz rokas

Jums pieder mašīna un kļūdu režīmi. SmolVLA gadījumā tas ir saprātīgi: viens pip papildinājums, viena apmācības komanda, viena izvietošanas komanda. TinyVLA gadījumā tā ir pētījumu reprodukcija ar fiksētām atkarībām, bojātu DeepSpeed ceļu un datu konversiju, ko rakstāt pats.

  1. Iegādājieties 24 GB karti, ierakstiet 30 līdz 50 epizodes, pārbaudiet kameras plūsmas kadru pa kadram.
  2. pip install -e ".[smolvla]", lerobot-train pret lerobot/smolvla_base, pēc tam izvietojiet kontrolpunktu mašīnā, kurā ir pievienota roka.
  3. TinyVLA gadījumā: atsevišķa conda vide, konvertējiet datus uz HDF5, reģistrējiet uzdevumu constants.py, labojiet zero2.json ceļu, samaziniet train.sh no astoņiem GPU uz vienu.
Priekšrocības
  • Nav stundas maksas, kad karte ir apmaksāta.
  • Secinājumi atrodas blakus servomotoriem, tas ir vienīgais veids, kā iegūt ātru vadības cilpu.
  • Jūs varat labot politikas kodu, un TinyVLA ir pieejams tikai šādā veidā.
Kompromisi
  • 4090 izslēdz katru ~3 B politiku, tāpēc nav lokālas salīdzināšanas ar GR00T N1.7 vai Pi0.5.
  • Vides iestatīšana ir īstais darbs. TinyVLA atkarības vien var maksāt dienu.
  • Nav rindas, nav atkārtotu mēģinājumu, nav kontrolpunktu glabāšanas. Pārstartēšana 14000. solī nozīmē sākt no jauna.

Kad mazs modelis ir nepareizā izvēle

Abi raksti šeit ir rūpīgāki nekā to kopsavilkumi. TinyVLA kļūdu analīze ir specifiska: 0,4 B variants trīs reizes kļūdījās, nepareizi nolasot instrukciju, ko autori saista ar ierobežotu valodu izpratni mazākajā VLM, un šis režīms pazuda pie 1,3 B. SmolVLA parāda to pašu līkni no otra gala: identiskās arhitektūras 2,25 B versija iegūst 88,75 punktus LIBERO un 68,24 punktus Meta-World, salīdzinot ar 87,3 un 57,3 punktiem 0,45 B modelim.

VLA izvēle zem 1 B
Kur tas uzvar
  • Der 24 GB kartei, kas samazina eksperimenta izmaksas no desmitiem dolāru līdz pāris.
  • Pietiekami ātrs, lai darbotos blakus robotrokai, tādējādi novēršot tīkla lēcienu vadības cilpā.
  • Precīzi pielāgojas datiem, ko var ierakstīt viens cilvēks, desmitiem epizožu, nevis tūkstošiem.
  • SmolVLA svari, datu saraksts un kods ir publiski pieejami, tāpēc sliktu rezultātu var atkļūdot.
Kur tas zaudē
  • Vājāka instrukciju izpilde: mazāk valodu parametru, mazāka spēja atšķirt līdzīgas atsauces izteiksmes.
  • Mazāka telpiskā un vizuālā vispārināšana uz iestatījumiem, ko neesat ierakstījis.
  • Jutīgāks pret datu kopas defektiem, ar mazāku iepriekšējo apmācību, uz ko paļauties.
  • Daudzuzdevumu un ilgtermiņa darbs joprojām dod priekšroku lielākiem modeļiem, tostarp SmolVLA paša 2,25 B variantam.

Salīdzinājums, ko ir vērts veikt, nav TinyVLA pret SmolVLA. Tas ir SmolVLA pret ACT jūsu pašu uzdevumā, un SmolVLA raksts ir arguments, kāpēc. Apmācīts vienam uzdevumam bez robotikas iepriekšējas apmācības, SmolVLA vidēji ieguva 40,0 punktus trīs SO-100 uzdevumos, kur vienuzdevuma ACT ieguva 48,3. Tas, kas to paceļ līdz 78,3, ir kopienas iepriekšējā apmācība plus daudzuzdevumu apmācība, nevis tikai arhitektūra. SO-101 lego uzdevumā, abos vienuzdevuma režīmos, SmolVLA uzvar: 90 pret 70 izplatībā. Pēc tam SmolVLA pret Pi0.5 ja budžets atļauj.

Šajā apjomā datu kopa nosaka rezultātu

Ir mazāk iepriekšējas apmācības, lai segtu sliktus datus, tāpēc tīra zudumu līkne uz defektīvas datu kopas dod jums politiku, kas pārliecinoši reproducē defektu. lerobot dokumentācija ir tieša par struktūru: 50 epizodes piecās kuba pozīcijās, 10 katrā pozīcijā, darbojās; 25 nedarbojās. Ja zudums izskatās labi un roka nedara neko noderīgu, sāciet ar zudums krītas, politika nedara neko, politika darbojas tikai vienā iestatījumā vai VLA apmācības datu vākšanu, kas patiešām ir izmantojami.

Piecas politikas, viena salīdzināšanas tabula

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA un ACT ar reālu parametru skaitu, secinājumu latentumu uz darbības soli, nepieciešamo GPU līmeni katram un minimālo epizožu skaitu, pirms tas sāk darīt kaut ko noderīgu.

Salīdzināt politikas

Lēmumu tabula, pēc kuras varat rīkoties

Jūsu situācijaSākt arKāpēc
Viens uzdevums, labas demonstrācijas, bez valodasACT~80 M, 20 ms, 24 GB karte, nav lejupielādējama bāzes modeļa
Daži saistīti uzdevumi, katram viena instrukcijaSmolVLA450 M, lerobotā, minimāli 30 epizodes, 1 līdz 3 USD par izpildi
Konkrēti reproducējot TinyVLA rezultātuTinyVLA-B or TinyVLA-HRepozitorijs ir vienīgais ceļš: izolēta vide, konvertēti dati
Daudzuzdevumu, dažādas instrukcijas, A100 budžetsGR00T N1.7 or Pi0.5~3 B, 152 ms un 485 ms uz soli, 4 līdz 12 USD par izpildi
Vēl nav robotaVadīt reālu rokuUz rindām balstītai tiešraides rokai nav nepieciešama reģistrācija un aparatūra

Pēdējai rindai, tiešraides roka straumē fizisku SO-100, ko var vadīt no pārlūkprogrammas bez konta, un trīs veidi, kā sākt aptver pārējo. Šeit SO-100 ir atsauces roka, aptuveni 110 līdz 150 EUR detaļās, ar pilnu iestatīšanas rokasgrāmatu.

Kas nāk pēc modeļiem, kas mazāki par 1 B

Parametru skaita samazināšana ir viens veids, kā padarīt VLA lētu, un tas nav acīmredzami uzvarošais veids. OpenVLA-OFT (arXiv 2502.19645) saglabā 7 B pamatu un maina tikai to, kā tiek atšifrētas darbības, ziņojot par 26x darbību ģenerēšanas caurlaidības pieaugumu un LIBERO pieaugumu no 76.5 līdz 97.1 procentiem. BitVLA (arXiv 2506.07530) padara katru 1 bita BitNet b1.58 2B4T pamata svaru trīskāršu, ziņojot par 11.0x mazāku atmiņu un 4.4x zemāku gala-līdz-galam latentumu, vienlaikus atbilstot pilnas precizitātes OpenVLA-OFT. X-VLA-0.9B (arXiv 2510.10274) atrodas uz 1 B līnijas ar plūsmas saskaņošanu.

Kopīgais pavediens: darbību dekodētājs, nevis valodu modelis, ir vieta, kur rodas latentums. Jautājiet, kā politika izstaro darbības, pirms jautājat, cik parametru tai ir. Arēna ir 85 modeļi un 332 rezultāti, katrs saistīts ar savu avotu; plašāks pārskats ir atrodams mūsu VLA ievadā.

Vai es varu precizēt SmolVLA uz RTX 4090?

Jā. SmolVLA ir 450 M parametri, un AY-Robots to palaiž uz RTX 4090 / 24 GB līmeņa. lerobot piemērs izmanto --batch_size=64, kas ir piemērs, nevis garantija jūsu kartei; dokumentācija iesaka sākt ar mazu vērtību un palielināt to, kamēr ielādes laiks paliek īss. Sagaidiet ilgāku laiku nekā aptuveni 4 stundas, ko dokumentācija norāda 20000 soļiem uz A100.

Vai TinyVLA ir pieejams lerobot vai AY-Robots?

Nē abiem. TinyVLA pastāv tikai savā pētniecības repozitorijā, pēdējā apņemšanās 2025. gada 11. martā, un tā formāts ir ACT-stila HDF5, nevis LeRobot. AY-Robots apmāca GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA un ACT. Ja vēlaties TinyVLA, jums tas jāveido pašam, un vispirms jums būs jāizlabo DeepSpeed config path in scripts/train.sh.

Vai 450 M modelis patiešām ir konkurētspējīgs ar 3 B modeli?

Pēc autoru pašu etaloniem, jā: 87.3 pret 86.0 uz LIBERO salīdzinājumā ar robotikas iepriekš apmācītu Pi0 pie 3.3 B, un 78.3 pret 61.7 trīs reālos SO-100 uzdevumos, kur tajā pašā rakstā Pi0 ir atzīmēts ar 3.5 B. Ierobežojums ir tajā pašā rakstā: viena uzdevuma bez robotikas iepriekšējas apmācības, SmolVLA samazinās līdz 40.0, zem ACT 48.3.

Cik daudz epizožu man ir nepieciešams, pirms mazs VLA kaut ko dara?

AY-Robots nosaka SmolVLA minimumu 30 epizodēs un ACT minimumu 50 epizodēs. lerobot dokumentācija iesaka ap 50 un ziņo, ka 25 nebija pietiekami tam pašam uzdevumam. Struktūra ir tikpat svarīga kā skaits: raksta komplekts izmantoja 5 kuba pozīcijas ar 10 epizodēm katrā.

Kāpēc publicētie latentuma rādītāji tik ļoti atšķiras?

Tie mēra dažādas lietas. TinyVLA ziņo par 14 ms uz darbības prognozi uz A6000; AY-Robots norāda SmolVLA pie 245 ms un ACT pie 20 ms uz darbības soli. Daži skaitļi aptver vienu pāreju uz priekšu, daži sadala pāreju pa 50 darbību bloku, un gandrīz neviens neietver kameras uztveršanu vai rakstīšanu uz servomotoriem.

Vai mākoņdatošanas secinājumi atrisina GPU problēmu?

Daļēji. AY-Robots automātiski nodrošina podu, kas apkalpo politiku, kamēr lokālais klients sazinās ar šo galapunktu, ar dīkstāves sargsuņu, lai tas iznīcinātu sevi, nevis klusi rēķinātu. Tas nevar novērst publiskā interneta apļveida ceļojumu, un vadības cilpa jau ir no 20 līdz 485 ms uz darbības soli. Labi lēnai paņemšanai un novietošanai, nevis ātrai reaktīvai kustībai.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started