Jadual perbandingan polisi AY-Robots dengan kiraan parameter, peringkat GPU dan latensi inferens untuk GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT
SmolVLATinyVLAVLA KecilGPU PenggunaLeRobot

Model VLA Kecil: TinyVLA, SmolVLA dan Kes Sub-1B

AY-Robots ResearchAugust 23, 202619 min baca

TinyVLA dan SmolVLA meletakkan VLA yang berfungsi di bawah 1 B parameter. Nombor sebenar dari kedua-dua kertas, tetapan lalai LeRobot, latensi yang diukur, dan kos satu larian pada kad 24 GB.

Hampir setiap model tindakan bahasa-penglihatan yang ditulis mengandaikan kad pusat data. OpenVLA mempunyai 7 B parameter. GR00T N1.7 dan Pi0.5 adalah sekitar 3 B dan memerlukan A100 80 GB untuk penalaan halus. Jika kad di meja anda adalah 4090, kelas model tersebut adalah di luar jangkauan.

Dua kertas kerja berhujah bahawa anda tidak memerlukannya. TinyVLA (arXiv 2409.12514, diterima oleh IEEE Robotics and Automation Letters pada Februari 2025) membina VLA daripada tulang belakang 400 J hingga 1.3 B ditambah kepala tindakan resapan. SmolVLA (arXiv 2506.01844, diserahkan 2 Jun 2025) menghantar 450 J parameter dengan berat terbuka, data terbuka dan skrip yang berjalan pada satu kad pengguna. Berikut adalah apa yang kedua-duanya ukur, dan di mana hujah sub-1 B tidak lagi relevan.

Apa yang perlu anda tahu

  • TinyVLA didatangkan dalam tiga saiz: 422 J keseluruhan dengan 101 J boleh dilatih, 740 J dengan 138 J, 1.3 B dengan 143 J. Hanya dua yang pertama berada di bawah 1 B.
  • Jadual IVnya mengukur 14 ms setiap ramalan tindakan untuk TinyVLA-1B pada satu A6000, berbanding 292 ms untuk OpenVLA-7B dan 140 ms untuk OpenVLA-1B yang dikecilkan.
  • Kepala memegang kelajuan itu, bukan tulang belakang: tukar kepala resapan TinyVLA-H dengan kepala ACT dan lima tugas robot sebenar jatuh daripada purata 94.0 kepada satu digit. Kepala MLP mencatat 0 di mana-mana.
  • SmolVLA adalah 450 J, kira-kira 100 J daripadanya adalah pakar tindakan, dilatih awal pada 481 set data komuniti LeRobot dan 10.6 J bingkai. Ia melaporkan 87.3 pada LIBERO berbanding 86.0 untuk Pi0 yang dilatih awal robotik pada 3.3 B, dan 78.3 pada tiga tugas SO-100 sebenar berbanding 61.7 untuk Pi0 pada 3.5 B.
  • Dilatih satu tugas tanpa latihan awal itu, SmolVLA jatuh kepada 40.0 pada tugas-tugas tersebut, di bawah 48.3 ACT. Kecil tidak semestinya mudah.
  • TinyVLA tidak mempunyai integrasi LeRobot dan menggunakan timbunan roda CUDA 11.7. SmolVLA berada dalam lerobot dan menelan belanja kira-kira 1 hingga 3 USD setiap larian pada peringkat 24 GB di sini.

Apa yang sebenarnya dikira sebagai VLA kecil

Jumlah parameter pada kad model bukanlah satu nombor. Ia boleh bermaksud jumlah berat, berat yang dimuatkan semasa inferens, atau berat yang menerima gradien semasa . TinyVLA melaporkan kedua-duanya, dan jurangnya besar: TinyVLA-H adalah 1.3 B jumlah tetapi 143 M boleh dilatih, kerana menara penglihatan dan kebanyakan model bahasa kekal beku manakala penyesuai LoRA dan kepala tindakan bergerak. Kertas kerja itu meletakkan bahagian yang boleh dilatih pada kira-kira 5 peratus.

ModelParameterRangka UtamaKepala TindakanSumber
TinyVLA-S422 M jumlah, 101 M boleh dilatihLlava-Pythia ~400 MPenyebaran (droid_diffusion U-Net)arXiv 2409.12514
TinyVLA-B740 M jumlah, 138 M boleh dilatihLlava-Pythia ~700 MPenyebaranarXiv 2409.12514
TinyVLA-H1.3 B jumlah, 143 M boleh dilatihLlava-Pythia ~1.3 BPenyebaranarXiv 2409.12514
SmolVLA450 M, ~100 M pakar tindakanSmolVLM2-500M-Video-InstructPakar padanan aliranarXiv 2506.01844
Octo-Small27 MSkala ViT-S, pengekod teks T5-BasePenyebaranocto-small-1.5 card
ACT~80 MResNet, tiada model bahasaRegresi cebisan langsungAY-Robots catalog
OpenVLA7 BLlama 2 7 B, pengekod DINOv2 dan SigLIPToken tindakan autoregresifarXiv 2406.09246

Dua baris patut dibahaskan. pada kira-kira 80 M adalah lebih kecil daripada yang lain di sini tetapi tiada model bahasa, jadi ia bukan VLA: ia mempelajari satu tugas dan tidak boleh diarahkan untuk melakukan yang lain. pada 27 M dikondisikan melalui pengekod teks T5-Base, bukan rangka utama LLM. Garis dasar yang baik, tiada satu pun yang memberikan anda arahan seperti yang tersirat pada label.

Garis 1 B adalah arbitrari

TinyVLA-H, varian yang membawa hasil utama, adalah 1.3 B dan berada di atas garis. Persoalan yang lebih baik ialah sama ada model muat dalam 24 GB semasa latihan dan mencapai kadar kawalan anda semasa inferens. Lima polisi yang boleh anda latih di sini terdapat di halaman polisi; TinyVLA mempunyai entri arena jika anda mahukan nombornya di samping yang lain.

TinyVLA: kelajuan datang dari kepala, bukan tulang belakang

Pembacaan yang jelas ialah mereka menjadikan model bahasa lebih kecil, jadi ia menjadi lebih pantas. Ablasi kertas kerja itu menyatakan sebaliknya. Menukar tulang belakang OpenVLA 7 B dengan yang kira-kira 1 B mengurangkan ramalan setiap tindakan daripada 292 ms kepada 140 ms, peningkatan 2x. TinyVLA-H, dengan kiraan parameter yang setanding, berjalan pada 14 ms pada kad yang sama. 10x yang lain adalah kepala tindakan.

ModelRamalan setiap tindakanDiukur pada
OpenVLA-7B292 mssingle A6000
OpenVLA-1B, tulang belakang ditukar dengan TinyVLA140 mssingle A6000
TinyVLA-1B (TinyVLA-H)14 mssingle A6000

OpenVLA mengeluarkan tindakan sebagai token diskret melalui kepala model bahasa, satu per dimensi tindakan, secara autoregresif. TinyVLA melampirkan penyahkod resapan yang menghasilkan keseluruhan cebisan dalam satu pukulan. Jadual V memegang seni bina di TinyVLA-H dan menukar hanya kepala, pada lima tugas robot sebenar yang sama. Ia adalah bukti paling jelas dalam mana-mana kertas kerja untuk hujah yang dibuat oleh polisi padanan aliran, dan sebabnya Pi0 beralih daripada penyahkodan token.

Prestasi pada TinyVLA-HLetak Bola TenisTerbalikkan CawanSusun KiubTutup LaciBuka Kotak
Penyebaran (droid_diffusion)90.098.398.396.786.7
Transformer Pemecahan Tindakan13.38.38.313.323.3
Perseptron Berbilang Lapisan00000
Apa yang diliputi oleh angka TinyVLA

Angka 292 / 140 / 14 ms adalah Jadual IV, semuanya pada satu A6000. Ia adalah bagi setiap ramalan tindakan dan tidak termasuk penangkapan kamera, prapemprosesan dan penulisan bersiri ke servo. Anggap kependaman yang diterbitkan sebagai had bawah, jangan sekali-kali sebagai kadar kawalan. Angka kami sendiri mempunyai had yang sama: lihat kependaman inferens.

Apa yang dicapai oleh TinyVLA

Penanda ArasProtokolTinyVLA-HGaris Dasar
MetaWorld, 50 tugas, simBerbilang tugas, 50 demo, 3 benih77.6 / 21.5 / 11.4 / 15.8 mengikut kesukaran, purata 31.6Purata Dasar Penyebaran 10.5
Franka Panda Sebenar, 5 tugas100 trajektori setiap tugas, 20 percubaanPurata 94.0OpenVLA 68.3, Dasar Penyebaran 35.3
UR5 Bimanual, 3 tugasBerbilang tugas, 10 percubaan setiap tugas76.7 / 36.7 / 30.0OpenVLA 0 / 0 / 0, Dasar Penyebaran 40.3 / 31.3 / 43.0

Baris bimanual mempunyai penjelasan membosankan yang diberikan oleh kertas itu sendiri: OpenVLA dilatih awal pada Open X-Embodiment, yang terdiri sepenuhnya daripada data satu lengan, jadi ruang tindakan dua lengan adalah di luar taburan dan ia mendapat skor sifar. Garis dasar dasar penyebaran mengalahkan TinyVLA-H pada dua daripada tiga tugas tersebut. Latar belakang dalam penulisan Open X-Embodiment.

Papan pendahulu arena AY-Robots, sebuah jadual yang boleh diisih bagi 85 model VLA dengan 332 hasil penanda aras, setiap nilai dihubungkan kembali ke kertas atau kad model asalnya
Nombor penanda aras silang model hanya boleh dibandingkan apabila anda dapat melihat dari mana setiap satu berasal.

Repositori TinyVLA, setakat Ogos 2026

Kertas kerja ini bagus. Kodnya adalah hasil penyelidikan. Repositori adalah github.com/liyaxuanliyaxuan/TinyVLA; README-nya menyatakan tarikh keluaran kod pada 17 Februari 2025 dan komit terakhir pada 11 Mac 2025. Baik untuk menghasilkan semula kertas kerja, tetapi menjadi masalah jika anda mahukan perpustakaan yang diselenggara.

bash
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .
Urutan pemasangan dari README TinyVLA, disemak terhadap repositori pada 2026-08-23.
Penetapan kebergantungan adalah perangkap yang memakan masa sehari

requirements.txt menetapkan torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, dan susunan CUDA kepada roda 11.x: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README meminta Python 3.10; lerobot 0.6.1 memerlukan 3.12 atau lebih baru, jadi kedua-duanya tidak boleh berkongsi persekitaran. Sahkan binaan torch 2.0.1 wujud untuk generasi GPU anda terlebih dahulu. Jika proses terhenti kerana VRAM, senarai semak kehabisan memori adalah lebih pantas daripada meneka.

TinyVLA juga tidak membaca set data LeRobot. Formatnya adalah HDF5 gaya ACT: action, language_raw, dan kumpulan pemerhatian dengan imej berbilang pandangan, joint_positions, qpos dan qvel. Repositori ini menyediakan data_utils/rlds_to_h5py.py untuk input RLDS, dan setiap tugas didaftarkan secara manual dalam aloha_scripts/constants.py dengan dataset_dir, episode_len dan camera_namesnya. Jika episod anda datang dari lerobot atau klien desktop, anda bertanggungjawab untuk penukaran.

bash
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion

deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
  --deepspeed scripts/zero2.json \
  --lora_enable True \
  --lora_module 'vit llm' \
  --lora_r 64 \
  --lora_alpha 256 \
  --non_lora_lr 2e-5 \
  --task_name "example_task_config" \
  --model_name_or_path /path/to/pretrained_vlm \
  --freeze_vision_tower True \
  --freeze_backbone True \
  --bf16 True \
  --max_steps 10000 \
  --per_device_train_batch_size 32 \
  --gradient_accumulation_steps 1 \
  --learning_rate 2e-4 \
  --lr_scheduler_type "cosine" \
  --warmup_ratio 0.005 \
  --save_steps 1000 \
  --action_head_type $ACTION_HEAD \
  --use_state True \
  --window_size 6
Dipendekkan dari scripts/train.sh. Setiap bendera dan nilai di atas terdapat dalam fail yang dihantar.
  • --num_gpus=8 mengandaikan nod lapan kad. Tetapkan kepada 1 dan kurangkan saiz kelompok jauh di bawah 32. Tiada varian GPU tunggal dihantar ke hulu, jadi arahan tidak boleh dijalankan secara verbatim pada 4090.
  • --deepspeed scripts/zero2.json menunjuk kepada fail yang tiada dalam direktori skrip peringkat atas. Konfigurasi DeepSpeed dihantar di llava-pythia/scripts/zero2.json. Betulkan laluan sebelum larian pertama anda.
  • README memerlukan nama direktori output mengandungi llava_pythia, serta lora jika LoRA diaktifkan.
  • Tulang belakang adalah muat turun berasingan: lesjie/Llava-Pythia-400M, -700M atau -1.3B. Tiada satu titik semak asas yang anda tujukan sesuatu polisi seperti anda menunjuk kepada lerobot/smolvla_base.

SmolVLA: model sub-1 B yang boleh anda jalankan petang ini

SmolVLA membuat hujah yang sama dalam perpustakaan yang diselenggara. Ia mempunyai 450 J parameter pada tulang belakang SmolVLM2-500M-Video-Instruct, dan kecekapan datang daripada tetapan yang boleh anda baca daripada configuration_smolvla.py dan bukannya daripada dakwaan tentang saiznya yang kecil.

Tetapan dalam configuration_smolvla.pyLalaiManfaatnya
num_vlm_layers16Hanya 16 lapisan model bahasa pertama yang berjalan
expert_width_multiplier0.75Saiz tersembunyi pakar tindakan adalah 75 peratus daripada VLM
self_attn_every_n_layers2Perhatian kendiri diselang-seli dengan perhatian silang
chunk_size / n_action_steps50 / 50Satu laluan mengeluarkan 50 tindakan dan kesemua 50 dilaksanakan
num_steps10Penyahbisingan padanan aliran ditetapkan pada 10 langkah
tokenizer_max_length48Arahan dipotong kepada 48 token
freeze_vision_encoder / train_expert_onlyTrue / TruePenalaan halus menggerakkan pakar, bukan menara penglihatan
optimizer_lr, warmup, decay1e-4, 1000 steps, to 2.5e-6 over 30000Bukan resipi kertas kerja: pra-latihannya menggunakan pemanasan 100 langkah selama 200000 langkah

Pra-latihan menggunakan 481 set data komuniti LeRobot, 22.9 K episod dan 10.6 J bingkai pada 4 GPU, 200000 langkah pada kelompok global 256; kertas kerja meletakkan keseluruhan projek pada kira-kira 30 K jam GPU. Satu nombor untuk diperhatikan: blog pelancaran Hugging Face menyatakan 487 set data terpilih manakala jadual kertas kerja menyatakan 481. Kami menggunakan angka kertas kerja dan menandakan percanggahan tersebut.

Halaman model SmolVLA di AY-Robots menunjukkan kiraan parameter, peringkat GPU 24 GB, kependaman inferens setiap langkah tindakan dan kiraan episod minimum
Halaman SmolVLA platform: 450 J parameter, 245 ms setiap langkah tindakan, peringkat RTX 4090, minimum 30 episod.
Penanda ArasSmolVLA 0.45 BSmolVLA 2.25 BPi0ACT
Purata LIBERO, berbilang tugas87.388.7586.0 (3.3 B, pra-latih robotik)-
Purata Meta-World, berbilang tugas57.368.2447.9 (3.5 B, pra-latih robotik)-
SO-100 sebenar, 3 tugas, latihan berbilang tugas78.3-61.7 (3.5 B)-
SO-100 sebenar, 3 tugas, tugas tunggal, tiada pra-latihan robotik40.0--48.3
SO-101 lego ambil-letak, tugas tunggal, dalam edaran90--70
SO-101 lego ambil-letak, tugas tunggal, luar edaran50--40
Baca keseluruhan jadual, bukan baris utama

LIBERO adalah simulasi dan semua yang cekap kini mencatat skor dalam lingkungan lapan puluhan di sana. Baris SO-100 sebenar, di mana model 450 J mengalahkan model 3.5 B sebanyak 16.6 mata, adalah yang menarik; baris di bawahnya adalah penimbang. Tanggalkan pra-latihan komuniti dan latihan berbilang tugas dan model yang sama jatuh kepada 40.0, di bawah ACT. Tuntutan yang boleh dipertahankan ialah model kecil tidak semestinya lebih teruk, bukan bahawa ia lebih baik.

Satu kebetulan membantu: jadual Meta-World dalam kertas SmolVLA membawa nombor TinyVLA sendiri yang diterbitkan sebagai garis dasar, jadi buat pertama kalinya kedua-dua model berada dalam satu jadual, SmolVLA-0.45B pada 57.3 berbanding TinyVLA-H pada 31.6. Ia juga melaporkan latihan SmolVLA sekitar 40 peratus lebih pantas daripada Pi0 dengan 6x kurang memori. Semua ini datang daripada pengarang SmolVLA; entri arena memautkan setiap nilai kepada sumbernya.

Di mana SmolVLA menghabiskan masanya

AY-Robots menyenaraikan SmolVLA pada 245 ms setiap langkah tindakan dan ACT pada 20 ms dalam katalog polisi. TinyVLA melaporkan 14 ms setiap ramalan tindakan. Nombor-nombor ini tidak boleh dibandingkan, dan menganggapnya seolah-olah ia boleh dibandingkan adalah kesilapan paling biasa dalam topik ini: ada yang mengukur satu laluan ke hadapan, ada yang membahagikan laluan itu merentasi satu cebisan setelah pengecilan tindakan melunaskannya.

  • SmolVLA mengeluarkan 50 tindakan setiap laluan ke hadapan dan melaksanakan kesemua 50 tindakan. Pada 30 fps yang digunakan oleh kertas kerja pada robot sebenar, satu inferens meliputi kira-kira 1.7 saat pergerakan.
  • Inferens tak segerak mengira cebisan seterusnya sementara cebisan semasa masih dilaksanakan: purata penyiapan tugas 9.7 s berbanding 13.75 s segerak, kira-kira 30 peratus lebih pantas, dan 19 kitaran pilih-dan-letak dalam tetingkap 60 saat yang ditetapkan berbanding 9.
  • Kadar kejayaan adalah setanding dan bukannya lebih baik, 78.3 segerak berbanding 73.3 tak segerak. Async membeli daya pemprosesan, bukan ketepatan.
  • Pengecilan menyembunyikan kependaman pengiraan, bukan kependaman rangkaian, dan ia menjadikan polisi kurang reaktif kerana ia komited kepada 50 tindakan.
Inferens jauh tidak percuma, dan tiada platform membetulkan fizik

AY-Robots boleh menyediakan pod GPU awan secara automatik yang melayani polisi anda sementara klien robot tempatan berkomunikasi dengan titik akhir tersebut, dan pod tersebut membawa pengawas terbiar (idle watchdog) supaya ia memusnahkan dirinya sendiri daripada mengecas secara senyap. Apa yang tidak dilakukannya ialah menghapuskan perjalanan pergi balik internet awam. Gelung kawalan merentasi lima polisi di sini adalah 20 hingga 485 ms setiap langkah tindakan sebelum sebarang rangkaian, jadi inferens jauh boleh dilaksanakan untuk 'pick-and-place' yang perlahan, bukan untuk gerakan reaktif yang pantas.

Jadual perbandingan polisi AY-Robots menunjukkan GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT dengan kiraan parameter, tahap GPU yang diperlukan, latensi inferens setiap langkah tindakan dan bilangan episod minimum yang diperlukan oleh setiap satu
SmolVLA pada ~450 M dan ACT pada ~80 M adalah dua yang muat pada kad 24 GB. Tiga yang lain memerlukan A100 atau H100 80 GB.

Penalaan halus SmolVLA pada satu kad pengguna

Laluan manual, pada lerobot 0.6.1, keluaran PyPI semasa pada 23 Ogos 2026. Segala-galanya di bawah berasal dari dokumentasi Hugging Face lerobot SmolVLA, yang diambil pada hari yang sama; versi berpandu adalah lebih lembut.

  1. 1
    Pasang lerobot dengan tambahan smolvla

    Kebergantungan SmolVLA adalah tambahan pilihan, bukan sebahagian daripada pemasangan asas. Memasang tanpanya dan kemudian tertanya-tanya mengapa jenis polisi tidak diketahui adalah kerugian setengah jam yang biasa.

    bash
    git clone https://github.com/huggingface/lerobot.git
    cd lerobot
    pip install -e ".[smolvla]"
  2. 2
    Dapatkan set data dengan episod yang mencukupi

    Dokumen mengesyorkan sekitar 50 episod dan menyatakan bahawa tugas yang sama dengan 25 episod tidak mencukupi. AY-Robots menetapkan minimum pada 30. Rakam sendiri, atau mulakan dari direktori set data.

    bash
    # any LeRobotDataset on the Hub works as --dataset.repo_id
    # lerobot/svla_so100_pickplace is the paper's own 50-episode set:
    # 5 cube positions, 10 episodes each
  3. 3
    Mulakan penalaan halus

    Perintah dari panduan lerobot, tidak diubah suai. Dokumen menyatakan 20000 langkah mengambil masa kira-kira 4 jam pada satu A100. Pada kad 24 GB, jangkakan lebih lama dan ukurnya.

    bash
    cd lerobot && lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/mydataset \
      --batch_size=64 \
      --steps=20000 \
      --output_dir=outputs/train/my_smolvla \
      --job_name=my_smolvla_training \
      --policy.device=cuda \
      --wandb.enable=true
  4. 4
    Kurangkan saiz kelompok sehingga ia muat

    batch_size=64 adalah contoh yang didokumenkan, bukan janji mengenai kad anda. Dokumen menasihatkan untuk bermula dengan saiz kecil dan meningkatkannya selagi masa muat kekal pendek.

    bash
    lerobot-train --help
  5. 5
    Laksanakan titik semak pada lengan

    Perpustakaan yang sama, satu perintah. Bendera pemecahan masa nyata dikomenkan dalam dokumen dan merupakan pilihan yang sesuai untuk perkakasan berkuasa rendah.

    bash
    lerobot-rollout \
      --strategy.type=base \
      --robot.type=so101_follower \
      --robot.port=/dev/ttyACM0 \
      --robot.id=my_blue_follower_arm \
      --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \
      --task="Grasp a lego block and put it in the bin." \
      --policy.path=HF_USER/FINETUNE_MODEL_NAME
Titik semak adalah hasil yang boleh dihantar

Apa jua laluan yang anda ambil, anda akan berakhir dengan titik semak serta konfigurasi yang menghasilkannya. Simpan semakan set data, kiraan langkah dan benih di sampingnya. lerobot lalai kepada benih 1000; titik masuk penalaan halus GR00T tidak mendedahkan sebarang benih sama sekali, jadi larian tersebut tidak boleh dihasilkan semula bit-demi-bit. Mekanik dalam dokumen latihan.

Dua cara untuk mendapatkan VLA kecil pada lengan

Anda memiliki mesin dan mod kegagalan. Untuk SmolVLA itu munasabah: satu pip tambahan, satu perintah latihan, satu perintah pelaksanaan. Untuk TinyVLA ia adalah reproduksi penyelidikan dengan pin beku, laluan DeepSpeed yang rosak dan penukaran data yang anda tulis sendiri.

  1. Dapatkan kad 24 GB, rakam 30 hingga 50 episod, sahkan aliran kamera bingkai demi bingkai.
  2. pip install -e ".[smolvla]", lerobot-train terhadap lerobot/smolvla_base, kemudian hidangkan titik semak pada mesin yang disambungkan lengan.
  3. Untuk TinyVLA: persekitaran conda yang berasingan, tukar data kepada HDF5, daftar tugas dalam constants.py, betulkan laluan zero2.json, potong train.sh dari lapan GPU kepada satu.
Kelebihan
  • Tiada bil setiap jam setelah kad dibayar.
  • Inferens terletak di sebelah servo, satu-satunya cara untuk mendapatkan gelung kawalan yang pantas.
  • Anda boleh menampal kod polisi, dan TinyVLA hanya tersedia dengan cara ini.
Pertukaran
  • Kad 4090 menolak setiap polisi ~3 B, jadi tiada perbandingan tempatan terhadap GR00T N1.7 atau Pi0.5.
  • Penyediaan persekitaran adalah kerja sebenar. Pin TinyVLA sahaja boleh memakan masa sehari.
  • Tiada giliran, tiada cuba semula, tiada penyimpanan titik semak. But semula pada langkah 14000 bermakna bermula semula.

Apabila model kecil adalah pilihan yang salah

Kedua-dua kertas kerja lebih berhati-hati di sini berbanding ringkasan. Analisis kegagalan TinyVLA adalah spesifik: varian 0.4 B gagal tiga kali dengan salah membaca arahan, yang mana penulis mengaitkan kepada pemahaman bahasa yang terhad dalam VLM yang lebih kecil, dan mod itu hilang pada 1.3 B. SmolVLA menunjukkan lengkung yang sama dari hujung yang lain: versi 2.25 B bagi seni bina yang sama mencatat 88.75 pada LIBERO dan 68.24 pada Meta-World berbanding 87.3 dan 57.3 untuk model 0.45 B.

Memilih VLA bawah 1 B
Di mana ia menang
  • Muat pada kad 24 GB, yang mengurangkan kos eksperimen daripada puluhan dolar kepada beberapa dolar.
  • Cukup pantas untuk dijalankan di sebelah lengan, jadi tiada lompatan rangkaian dalam gelung kawalan.
  • Penalaan halus pada data yang boleh dirakam oleh seorang, puluhan episod dan bukannya ribuan.
  • Berat, senarai data dan kod SmolVLA adalah awam, jadi hasil yang buruk boleh dinyahpepijat.
Di mana ia kalah
  • Kepatuhan arahan yang lebih lemah: parameter bahasa yang lebih sedikit, kurang keupayaan untuk memisahkan ekspresi rujukan yang serupa.
  • Generalisasi ruang dan visual yang kurang kepada persediaan yang anda tidak rakam.
  • Lebih sensitif kepada kecacatan set data, dengan kurang pra-latihan untuk bergantung.
  • Kerja berbilang tugas dan jangka panjang masih memihak kepada model yang lebih besar, termasuk varian 2.25 B SmolVLA sendiri.

Perbandingan yang patut dijalankan bukanlah TinyVLA berbanding SmolVLA. Ia adalah SmolVLA berbanding ACT pada tugas anda sendiri, dan kertas kerja SmolVLA adalah hujah mengapa. Dilatih satu tugas tanpa pra-latihan robotik, SmolVLA mencatatkan purata 40.0 merentasi tiga tugas SO-100 di mana ACT satu tugas mencapai 48.3. Apa yang mengangkatnya kepada 78.3 adalah pra-latihan komuniti ditambah latihan berbilang tugas, bukan seni bina semata-mata. Pada tugas lego SO-101, kedua-duanya satu tugas, SmolVLA memang menang: 90 berbanding 70 dalam pengedaran. Kemudian SmolVLA berbanding Pi0.5 jika bajet mengizinkan.

Pada saiz ini, set data menentukan hasilnya

Kurang pra-latihan sebelum ini untuk menampung data yang buruk, jadi lengkung kerugian yang bersih pada set data yang rosak memberikan anda polisi yang menghasilkan semula kecacatan dengan yakin. Dokumen lerobot berterus terang tentang struktur: 50 episod merentasi 5 posisi kiub, 10 setiap posisi, berjaya; 25 tidak. Jika kerugian kelihatan baik dan lengan tidak melakukan apa-apa yang berguna, mulakan dengan kerugian jatuh, polisi tidak melakukan apa-apa, polisi hanya berfungsi dalam satu persediaan atau mengumpul data latihan VLA yang benar-benar boleh digunakan.

Lima polisi, satu jadual perbandingan

GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT dengan kiraan parameter sebenar, latensi inferens setiap langkah tindakan, tahap GPU yang diperlukan oleh setiap satu dan kiraan episod minimum sebelum ia melakukan sesuatu yang berguna.

Bandingkan polisi

Jadual keputusan yang boleh anda bertindak atasnya

Situasi andaMulakan denganMengapa
Satu tugas, demonstrasi yang baik, tiada bahasaACT~80 M, 20 ms, kad 24 GB, tiada model asas untuk dimuat turun
Beberapa tugas berkaitan, satu arahan setiap satuSmolVLA450 M, dalam lerobot, minimum 30 episod, 1 hingga 3 USD setiap larian
Menghasilkan semula hasil TinyVLA secara khususTinyVLA-B or TinyVLA-HRepo adalah satu-satunya laluan: persekitaran terpencil, data yang ditukar
Pelbagai tugas, arahan yang pelbagai, bajet A100GR00T N1.7 or Pi0.5~3 B, 152 ms dan 485 ms setiap langkah, 4 hingga 12 USD setiap larian
Belum ada robotPandu lengan sebenarLengan langsung berasaskan giliran tidak memerlukan pendaftaran dan tiada perkakasan

Untuk baris terakhir, lengan langsung menstrimkan SO-100 fizikal yang boleh anda pandu dari pelayar tanpa akaun, dan tiga cara untuk bermula meliputi selebihnya. SO-100 SO-100 ialah lengan rujukan di sini, kira-kira 110 hingga 150 EUR dalam bahagian, dengan panduan persediaan lengkap.

Apa yang datang selepas model sub-1 B

Mengecilkan kiraan parameter adalah satu cara untuk menjadikan VLA murah dan bukan semestinya cara yang menang. OpenVLA-OFT (arXiv 2502.19645) mengekalkan tulang belakang 7 B dan hanya mengubah cara tindakan dinyahkod, melaporkan peningkatan 26x dalam daya pemprosesan penjanaan tindakan dan LIBERO meningkat dari 76.5 kepada 97.1 peratus. BitVLA (arXiv 2506.07530) menjadikan setiap berat tulang belakang 1-bit BitNet b1.58 2B4T ternari, melaporkan 11.0x kurang memori dan 4.4x latensi hujung ke hujung yang lebih rendah sambil menyamai OpenVLA-OFT ketepatan penuh. X-VLA-0.9B (arXiv 2510.10274) berada pada garis 1 B dengan padanan aliran.

Benang merahnya: penyahkod tindakan, bukan model bahasa, adalah punca latensi. Tanya bagaimana polisi mengeluarkan tindakan sebelum anda bertanya berapa banyak parameter yang dimilikinya. Arena itu arena mempunyai 85 model dan 332 hasil, setiap satu dipautkan kepada sumbernya; terdapat gambaran keseluruhan yang lebih luas dalam pengenalan VLA kami.

Bolehkah saya menala halus SmolVLA pada RTX 4090?

Ya. SmolVLA mempunyai 450 M parameter dan AY-Robots menjalankannya pada peringkat RTX 4090 / 24 GB. Contoh lerobot menggunakan --batch_size=64, yang merupakan contoh dan bukannya jaminan untuk kad anda; dokumen menasihatkan untuk bermula dengan kecil dan meningkatkannya selagi masa pemuatan kekal pendek. Jangkakan masa yang lebih lama daripada kira-kira 4 jam yang disebut dalam dokumen untuk 20000 langkah pada A100.

Adakah TinyVLA tersedia dalam lerobot atau di AY-Robots?

Tidak untuk kedua-duanya. TinyVLA hanya terdapat dalam repositori penyelidikannya, komit terakhir 11 Mac 2025, dan formatnya adalah HDF5 gaya ACT dan bukannya LeRobot. AY-Robots melatih GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT. Jika anda mahukan TinyVLA, anda perlu membangunkannya sendiri, dan anda perlu membetulkan laluan konfigurasi DeepSpeed dalam scripts/train.sh terlebih dahulu.

Adakah model 450 M benar-benar berdaya saing dengan model 3 B?

Berdasarkan penanda aras penulis sendiri, ya: 87.3 berbanding 86.0 pada LIBERO berbanding Pi0 yang telah dilatih robotik pada 3.3 B, dan 78.3 berbanding 61.7 pada tiga tugas SO-100 sebenar di mana kertas yang sama melabelkan Pi0 pada 3.5 B. Hadnya terdapat dalam kertas yang sama: tugas tunggal tanpa pra-latihan robotik, SmolVLA jatuh kepada 40.0, di bawah ACT 48.3.

Berapa banyak episod yang saya perlukan sebelum VLA kecil berfungsi?

AY-Robots menetapkan minimum SmolVLA pada 30 episod dan minimum ACT pada 50. Dokumen lerobot mengesyorkan sekitar 50 dan melaporkan bahawa 25 tidak mencukupi untuk tugas yang sama. Struktur adalah sama pentingnya dengan bilangan: set kertas itu menggunakan 5 posisi kiub dengan 10 episod setiap satu.

Mengapa angka latensi yang diterbitkan sangat berbeza?

Mereka mengukur perkara yang berbeza. TinyVLA melaporkan 14 ms setiap ramalan tindakan pada A6000; AY-Robots menyenaraikan SmolVLA pada 245 ms dan ACT pada 20 ms setiap langkah tindakan. Beberapa angka meliputi satu laluan ke hadapan, beberapa membahagikan laluan merentasi segmen 50 tindakan, dan hampir tiada yang termasuk tangkapan kamera atau penulisan ke servo.

Adakah inferens awan menyelesaikan masalah GPU?

Sebahagiannya. AY-Robots secara automatik menyediakan pod yang melayani polisi manakala klien tempatan berkomunikasi dengan titik akhir tersebut, dengan pengawas terbiar supaya ia memusnahkan dirinya sendiri dan bukannya mengebil secara senyap. Ia tidak dapat menghapuskan perjalanan pergi balik internet awam, dan gelung kawalan sudah pun 20 hingga 485 ms setiap langkah tindakan. Baik untuk pilih-dan-letak yang perlahan, bukan untuk gerakan reaktif yang pantas.

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started