
TinyVLA dan SmolVLA meletakkan VLA yang berfungsi di bawah 1 B parameter. Nombor sebenar dari kedua-dua kertas, tetapan lalai LeRobot, latensi yang diukur, dan kos satu larian pada kad 24 GB.
Hampir setiap model tindakan bahasa-penglihatan yang ditulis mengandaikan kad pusat data. OpenVLA mempunyai 7 B parameter. GR00T N1.7 dan Pi0.5 adalah sekitar 3 B dan memerlukan A100 80 GB untuk penalaan halus. Jika kad di meja anda adalah 4090, kelas model tersebut adalah di luar jangkauan.
Dua kertas kerja berhujah bahawa anda tidak memerlukannya. TinyVLA (arXiv 2409.12514, diterima oleh IEEE Robotics and Automation Letters pada Februari 2025) membina VLA daripada tulang belakang 400 J hingga 1.3 B ditambah kepala tindakan resapan. SmolVLA (arXiv 2506.01844, diserahkan 2 Jun 2025) menghantar 450 J parameter dengan berat terbuka, data terbuka dan skrip yang berjalan pada satu kad pengguna. Berikut adalah apa yang kedua-duanya ukur, dan di mana hujah sub-1 B tidak lagi relevan.
Apa yang perlu anda tahu
- •TinyVLA didatangkan dalam tiga saiz: 422 J keseluruhan dengan 101 J boleh dilatih, 740 J dengan 138 J, 1.3 B dengan 143 J. Hanya dua yang pertama berada di bawah 1 B.
- •Jadual IVnya mengukur 14 ms setiap ramalan tindakan untuk TinyVLA-1B pada satu A6000, berbanding 292 ms untuk OpenVLA-7B dan 140 ms untuk OpenVLA-1B yang dikecilkan.
- •Kepala memegang kelajuan itu, bukan tulang belakang: tukar kepala resapan TinyVLA-H dengan kepala ACT dan lima tugas robot sebenar jatuh daripada purata 94.0 kepada satu digit. Kepala MLP mencatat 0 di mana-mana.
- •SmolVLA adalah 450 J, kira-kira 100 J daripadanya adalah pakar tindakan, dilatih awal pada 481 set data komuniti LeRobot dan 10.6 J bingkai. Ia melaporkan 87.3 pada LIBERO berbanding 86.0 untuk Pi0 yang dilatih awal robotik pada 3.3 B, dan 78.3 pada tiga tugas SO-100 sebenar berbanding 61.7 untuk Pi0 pada 3.5 B.
- •Dilatih satu tugas tanpa latihan awal itu, SmolVLA jatuh kepada 40.0 pada tugas-tugas tersebut, di bawah 48.3 ACT. Kecil tidak semestinya mudah.
- •TinyVLA tidak mempunyai integrasi LeRobot dan menggunakan timbunan roda CUDA 11.7. SmolVLA berada dalam lerobot dan menelan belanja kira-kira 1 hingga 3 USD setiap larian pada peringkat 24 GB di sini.
Apa yang sebenarnya dikira sebagai VLA kecil
Jumlah parameter pada kad model bukanlah satu nombor. Ia boleh bermaksud jumlah berat, berat yang dimuatkan semasa inferens, atau berat yang menerima gradien semasa . TinyVLA melaporkan kedua-duanya, dan jurangnya besar: TinyVLA-H adalah 1.3 B jumlah tetapi 143 M boleh dilatih, kerana menara penglihatan dan kebanyakan model bahasa kekal beku manakala penyesuai LoRA dan kepala tindakan bergerak. Kertas kerja itu meletakkan bahagian yang boleh dilatih pada kira-kira 5 peratus.
| Model | Parameter | Rangka Utama | Kepala Tindakan | Sumber |
|---|---|---|---|---|
| TinyVLA-S | 422 M jumlah, 101 M boleh dilatih | Llava-Pythia ~400 M | Penyebaran (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M jumlah, 138 M boleh dilatih | Llava-Pythia ~700 M | Penyebaran | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B jumlah, 143 M boleh dilatih | Llava-Pythia ~1.3 B | Penyebaran | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M pakar tindakan | SmolVLM2-500M-Video-Instruct | Pakar padanan aliran | arXiv 2506.01844 |
| Octo-Small | 27 M | Skala ViT-S, pengekod teks T5-Base | Penyebaran | octo-small-1.5 card |
| ACT | ~80 M | ResNet, tiada model bahasa | Regresi cebisan langsung | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, pengekod DINOv2 dan SigLIP | Token tindakan autoregresif | arXiv 2406.09246 |
Dua baris patut dibahaskan. pada kira-kira 80 M adalah lebih kecil daripada yang lain di sini tetapi tiada model bahasa, jadi ia bukan VLA: ia mempelajari satu tugas dan tidak boleh diarahkan untuk melakukan yang lain. pada 27 M dikondisikan melalui pengekod teks T5-Base, bukan rangka utama LLM. Garis dasar yang baik, tiada satu pun yang memberikan anda arahan seperti yang tersirat pada label.
TinyVLA-H, varian yang membawa hasil utama, adalah 1.3 B dan berada di atas garis. Persoalan yang lebih baik ialah sama ada model muat dalam 24 GB semasa latihan dan mencapai kadar kawalan anda semasa inferens. Lima polisi yang boleh anda latih di sini terdapat di halaman polisi; TinyVLA mempunyai entri arena jika anda mahukan nombornya di samping yang lain.
TinyVLA: kelajuan datang dari kepala, bukan tulang belakang
Pembacaan yang jelas ialah mereka menjadikan model bahasa lebih kecil, jadi ia menjadi lebih pantas. Ablasi kertas kerja itu menyatakan sebaliknya. Menukar tulang belakang OpenVLA 7 B dengan yang kira-kira 1 B mengurangkan ramalan setiap tindakan daripada 292 ms kepada 140 ms, peningkatan 2x. TinyVLA-H, dengan kiraan parameter yang setanding, berjalan pada 14 ms pada kad yang sama. 10x yang lain adalah kepala tindakan.
| Model | Ramalan setiap tindakan | Diukur pada |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, tulang belakang ditukar dengan TinyVLA | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA mengeluarkan tindakan sebagai token diskret melalui kepala model bahasa, satu per dimensi tindakan, secara autoregresif. TinyVLA melampirkan penyahkod resapan yang menghasilkan keseluruhan cebisan dalam satu pukulan. Jadual V memegang seni bina di TinyVLA-H dan menukar hanya kepala, pada lima tugas robot sebenar yang sama. Ia adalah bukti paling jelas dalam mana-mana kertas kerja untuk hujah yang dibuat oleh polisi padanan aliran, dan sebabnya Pi0 beralih daripada penyahkodan token.
| Prestasi pada TinyVLA-H | Letak Bola Tenis | Terbalikkan Cawan | Susun Kiub | Tutup Laci | Buka Kotak |
|---|---|---|---|---|---|
| Penyebaran (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| Transformer Pemecahan Tindakan | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| Perseptron Berbilang Lapisan | 0 | 0 | 0 | 0 | 0 |
Angka 292 / 140 / 14 ms adalah Jadual IV, semuanya pada satu A6000. Ia adalah bagi setiap ramalan tindakan dan tidak termasuk penangkapan kamera, prapemprosesan dan penulisan bersiri ke servo. Anggap kependaman yang diterbitkan sebagai had bawah, jangan sekali-kali sebagai kadar kawalan. Angka kami sendiri mempunyai had yang sama: lihat kependaman inferens.
Apa yang dicapai oleh TinyVLA
| Penanda Aras | Protokol | TinyVLA-H | Garis Dasar |
|---|---|---|---|
| MetaWorld, 50 tugas, sim | Berbilang tugas, 50 demo, 3 benih | 77.6 / 21.5 / 11.4 / 15.8 mengikut kesukaran, purata 31.6 | Purata Dasar Penyebaran 10.5 |
| Franka Panda Sebenar, 5 tugas | 100 trajektori setiap tugas, 20 percubaan | Purata 94.0 | OpenVLA 68.3, Dasar Penyebaran 35.3 |
| UR5 Bimanual, 3 tugas | Berbilang tugas, 10 percubaan setiap tugas | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, Dasar Penyebaran 40.3 / 31.3 / 43.0 |
Baris bimanual mempunyai penjelasan membosankan yang diberikan oleh kertas itu sendiri: OpenVLA dilatih awal pada Open X-Embodiment, yang terdiri sepenuhnya daripada data satu lengan, jadi ruang tindakan dua lengan adalah di luar taburan dan ia mendapat skor sifar. Garis dasar dasar penyebaran mengalahkan TinyVLA-H pada dua daripada tiga tugas tersebut. Latar belakang dalam penulisan Open X-Embodiment.

Repositori TinyVLA, setakat Ogos 2026
Kertas kerja ini bagus. Kodnya adalah hasil penyelidikan. Repositori adalah github.com/liyaxuanliyaxuan/TinyVLA; README-nya menyatakan tarikh keluaran kod pada 17 Februari 2025 dan komit terakhir pada 11 Mac 2025. Baik untuk menghasilkan semula kertas kerja, tetapi menjadi masalah jika anda mahukan perpustakaan yang diselenggara.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt menetapkan torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4, dan susunan CUDA kepada roda 11.x: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README meminta Python 3.10; lerobot 0.6.1 memerlukan 3.12 atau lebih baru, jadi kedua-duanya tidak boleh berkongsi persekitaran. Sahkan binaan torch 2.0.1 wujud untuk generasi GPU anda terlebih dahulu. Jika proses terhenti kerana VRAM, senarai semak kehabisan memori adalah lebih pantas daripada meneka.
TinyVLA juga tidak membaca set data LeRobot. Formatnya adalah HDF5 gaya ACT: action, language_raw, dan kumpulan pemerhatian dengan imej berbilang pandangan, joint_positions, qpos dan qvel. Repositori ini menyediakan data_utils/rlds_to_h5py.py untuk input RLDS, dan setiap tugas didaftarkan secara manual dalam aloha_scripts/constants.py dengan dataset_dir, episode_len dan camera_namesnya. Jika episod anda datang dari lerobot atau klien desktop, anda bertanggungjawab untuk penukaran.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 mengandaikan nod lapan kad. Tetapkan kepada 1 dan kurangkan saiz kelompok jauh di bawah 32. Tiada varian GPU tunggal dihantar ke hulu, jadi arahan tidak boleh dijalankan secara verbatim pada 4090.
- --deepspeed scripts/zero2.json menunjuk kepada fail yang tiada dalam direktori skrip peringkat atas. Konfigurasi DeepSpeed dihantar di llava-pythia/scripts/zero2.json. Betulkan laluan sebelum larian pertama anda.
- README memerlukan nama direktori output mengandungi llava_pythia, serta lora jika LoRA diaktifkan.
- Tulang belakang adalah muat turun berasingan: lesjie/Llava-Pythia-400M, -700M atau -1.3B. Tiada satu titik semak asas yang anda tujukan sesuatu polisi seperti anda menunjuk kepada lerobot/smolvla_base.
SmolVLA: model sub-1 B yang boleh anda jalankan petang ini
SmolVLA membuat hujah yang sama dalam perpustakaan yang diselenggara. Ia mempunyai 450 J parameter pada tulang belakang SmolVLM2-500M-Video-Instruct, dan kecekapan datang daripada tetapan yang boleh anda baca daripada configuration_smolvla.py dan bukannya daripada dakwaan tentang saiznya yang kecil.
| Tetapan dalam configuration_smolvla.py | Lalai | Manfaatnya |
|---|---|---|
| num_vlm_layers | 16 | Hanya 16 lapisan model bahasa pertama yang berjalan |
| expert_width_multiplier | 0.75 | Saiz tersembunyi pakar tindakan adalah 75 peratus daripada VLM |
| self_attn_every_n_layers | 2 | Perhatian kendiri diselang-seli dengan perhatian silang |
| chunk_size / n_action_steps | 50 / 50 | Satu laluan mengeluarkan 50 tindakan dan kesemua 50 dilaksanakan |
| num_steps | 10 | Penyahbisingan padanan aliran ditetapkan pada 10 langkah |
| tokenizer_max_length | 48 | Arahan dipotong kepada 48 token |
| freeze_vision_encoder / train_expert_only | True / True | Penalaan halus menggerakkan pakar, bukan menara penglihatan |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | Bukan resipi kertas kerja: pra-latihannya menggunakan pemanasan 100 langkah selama 200000 langkah |
Pra-latihan menggunakan 481 set data komuniti LeRobot, 22.9 K episod dan 10.6 J bingkai pada 4 GPU, 200000 langkah pada kelompok global 256; kertas kerja meletakkan keseluruhan projek pada kira-kira 30 K jam GPU. Satu nombor untuk diperhatikan: blog pelancaran Hugging Face menyatakan 487 set data terpilih manakala jadual kertas kerja menyatakan 481. Kami menggunakan angka kertas kerja dan menandakan percanggahan tersebut.

| Penanda Aras | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| Purata LIBERO, berbilang tugas | 87.3 | 88.75 | 86.0 (3.3 B, pra-latih robotik) | - |
| Purata Meta-World, berbilang tugas | 57.3 | 68.24 | 47.9 (3.5 B, pra-latih robotik) | - |
| SO-100 sebenar, 3 tugas, latihan berbilang tugas | 78.3 | - | 61.7 (3.5 B) | - |
| SO-100 sebenar, 3 tugas, tugas tunggal, tiada pra-latihan robotik | 40.0 | - | - | 48.3 |
| SO-101 lego ambil-letak, tugas tunggal, dalam edaran | 90 | - | - | 70 |
| SO-101 lego ambil-letak, tugas tunggal, luar edaran | 50 | - | - | 40 |
LIBERO adalah simulasi dan semua yang cekap kini mencatat skor dalam lingkungan lapan puluhan di sana. Baris SO-100 sebenar, di mana model 450 J mengalahkan model 3.5 B sebanyak 16.6 mata, adalah yang menarik; baris di bawahnya adalah penimbang. Tanggalkan pra-latihan komuniti dan latihan berbilang tugas dan model yang sama jatuh kepada 40.0, di bawah ACT. Tuntutan yang boleh dipertahankan ialah model kecil tidak semestinya lebih teruk, bukan bahawa ia lebih baik.
Satu kebetulan membantu: jadual Meta-World dalam kertas SmolVLA membawa nombor TinyVLA sendiri yang diterbitkan sebagai garis dasar, jadi buat pertama kalinya kedua-dua model berada dalam satu jadual, SmolVLA-0.45B pada 57.3 berbanding TinyVLA-H pada 31.6. Ia juga melaporkan latihan SmolVLA sekitar 40 peratus lebih pantas daripada Pi0 dengan 6x kurang memori. Semua ini datang daripada pengarang SmolVLA; entri arena memautkan setiap nilai kepada sumbernya.
Di mana SmolVLA menghabiskan masanya
AY-Robots menyenaraikan SmolVLA pada 245 ms setiap langkah tindakan dan ACT pada 20 ms dalam katalog polisi. TinyVLA melaporkan 14 ms setiap ramalan tindakan. Nombor-nombor ini tidak boleh dibandingkan, dan menganggapnya seolah-olah ia boleh dibandingkan adalah kesilapan paling biasa dalam topik ini: ada yang mengukur satu laluan ke hadapan, ada yang membahagikan laluan itu merentasi satu cebisan setelah pengecilan tindakan melunaskannya.
- SmolVLA mengeluarkan 50 tindakan setiap laluan ke hadapan dan melaksanakan kesemua 50 tindakan. Pada 30 fps yang digunakan oleh kertas kerja pada robot sebenar, satu inferens meliputi kira-kira 1.7 saat pergerakan.
- Inferens tak segerak mengira cebisan seterusnya sementara cebisan semasa masih dilaksanakan: purata penyiapan tugas 9.7 s berbanding 13.75 s segerak, kira-kira 30 peratus lebih pantas, dan 19 kitaran pilih-dan-letak dalam tetingkap 60 saat yang ditetapkan berbanding 9.
- Kadar kejayaan adalah setanding dan bukannya lebih baik, 78.3 segerak berbanding 73.3 tak segerak. Async membeli daya pemprosesan, bukan ketepatan.
- Pengecilan menyembunyikan kependaman pengiraan, bukan kependaman rangkaian, dan ia menjadikan polisi kurang reaktif kerana ia komited kepada 50 tindakan.
AY-Robots boleh menyediakan pod GPU awan secara automatik yang melayani polisi anda sementara klien robot tempatan berkomunikasi dengan titik akhir tersebut, dan pod tersebut membawa pengawas terbiar (idle watchdog) supaya ia memusnahkan dirinya sendiri daripada mengecas secara senyap. Apa yang tidak dilakukannya ialah menghapuskan perjalanan pergi balik internet awam. Gelung kawalan merentasi lima polisi di sini adalah 20 hingga 485 ms setiap langkah tindakan sebelum sebarang rangkaian, jadi inferens jauh boleh dilaksanakan untuk 'pick-and-place' yang perlahan, bukan untuk gerakan reaktif yang pantas.

Penalaan halus SmolVLA pada satu kad pengguna
Laluan manual, pada lerobot 0.6.1, keluaran PyPI semasa pada 23 Ogos 2026. Segala-galanya di bawah berasal dari dokumentasi Hugging Face lerobot SmolVLA, yang diambil pada hari yang sama; versi berpandu adalah lebih lembut.
- 1Pasang lerobot dengan tambahan smolvla
Kebergantungan SmolVLA adalah tambahan pilihan, bukan sebahagian daripada pemasangan asas. Memasang tanpanya dan kemudian tertanya-tanya mengapa jenis polisi tidak diketahui adalah kerugian setengah jam yang biasa.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2Dapatkan set data dengan episod yang mencukupi
Dokumen mengesyorkan sekitar 50 episod dan menyatakan bahawa tugas yang sama dengan 25 episod tidak mencukupi. AY-Robots menetapkan minimum pada 30. Rakam sendiri, atau mulakan dari direktori set data.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3Mulakan penalaan halus
Perintah dari panduan lerobot, tidak diubah suai. Dokumen menyatakan 20000 langkah mengambil masa kira-kira 4 jam pada satu A100. Pada kad 24 GB, jangkakan lebih lama dan ukurnya.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4Kurangkan saiz kelompok sehingga ia muat
batch_size=64 adalah contoh yang didokumenkan, bukan janji mengenai kad anda. Dokumen menasihatkan untuk bermula dengan saiz kecil dan meningkatkannya selagi masa muat kekal pendek.
bashlerobot-train --help - 5Laksanakan titik semak pada lengan
Perpustakaan yang sama, satu perintah. Bendera pemecahan masa nyata dikomenkan dalam dokumen dan merupakan pilihan yang sesuai untuk perkakasan berkuasa rendah.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
Apa jua laluan yang anda ambil, anda akan berakhir dengan titik semak serta konfigurasi yang menghasilkannya. Simpan semakan set data, kiraan langkah dan benih di sampingnya. lerobot lalai kepada benih 1000; titik masuk penalaan halus GR00T tidak mendedahkan sebarang benih sama sekali, jadi larian tersebut tidak boleh dihasilkan semula bit-demi-bit. Mekanik dalam dokumen latihan.
Dua cara untuk mendapatkan VLA kecil pada lengan
Anda memiliki mesin dan mod kegagalan. Untuk SmolVLA itu munasabah: satu pip tambahan, satu perintah latihan, satu perintah pelaksanaan. Untuk TinyVLA ia adalah reproduksi penyelidikan dengan pin beku, laluan DeepSpeed yang rosak dan penukaran data yang anda tulis sendiri.
- Dapatkan kad 24 GB, rakam 30 hingga 50 episod, sahkan aliran kamera bingkai demi bingkai.
- pip install -e ".[smolvla]", lerobot-train terhadap lerobot/smolvla_base, kemudian hidangkan titik semak pada mesin yang disambungkan lengan.
- Untuk TinyVLA: persekitaran conda yang berasingan, tukar data kepada HDF5, daftar tugas dalam constants.py, betulkan laluan zero2.json, potong train.sh dari lapan GPU kepada satu.
- Tiada bil setiap jam setelah kad dibayar.
- Inferens terletak di sebelah servo, satu-satunya cara untuk mendapatkan gelung kawalan yang pantas.
- Anda boleh menampal kod polisi, dan TinyVLA hanya tersedia dengan cara ini.
- Kad 4090 menolak setiap polisi ~3 B, jadi tiada perbandingan tempatan terhadap GR00T N1.7 atau Pi0.5.
- Penyediaan persekitaran adalah kerja sebenar. Pin TinyVLA sahaja boleh memakan masa sehari.
- Tiada giliran, tiada cuba semula, tiada penyimpanan titik semak. But semula pada langkah 14000 bermakna bermula semula.
SmolVLA adalah salah satu daripada lima polisi di sini. Anda memilih model dan set data dalam borang, bahagian belakang menyewa GPU mengikut VRAM yang diperlukan, menjalankan pelatih dan menulis titik semak ke storan objek. Langkah demi langkah: SmolVLA pada SO-100, atau matriks penuh pada halaman latihan.
| Apa yang platform hantar untuk SmolVLA | Nilai |
|---|---|
| saiz kelompok | 2 |
| kadar pembelajaran | 1e-4 |
| langkah maksimum | 20000 |
| pengumpulan gradien | 8, and it does not reach the trainer |
| tombol tambahan dalam borang | seed, logFreq |
| tahap GPU | RTX 4090 or any 24 GB card |
| format set data | LeRobot v3.0 |
| episod minimum | 30 |
Pertama, saiz kelompok lalai di sini ialah 2, bukan 64 dalam contoh dokumentasi lerobot, dan tetapan pengumpulan gradien dihantar tetapi tidak mempunyai kesan untuk SmolVLA, jadi kelompok berkesan sebenarnya ialah 2. Tingkatkannya secara sengaja daripada menganggap lalai sepadan dengan hulu. Kedua, TinyVLA tidak boleh dilatih di sini sama sekali.
Larian pada tahap 24 GB mengambil masa 2 hingga 5 jam pada 0.30 hingga 0.60 USD sejam, kira-kira 1 hingga 3 USD. Pada tahap A100, polisi ~3 B mengambil masa 3 hingga 6 jam pada 1.20 hingga 2.00 USD sejam, kira-kira 4 hingga 12 USD. Lihat harga, dan operasi yang sama dari CLI dan pelayan MCP.
Apabila model kecil adalah pilihan yang salah
Kedua-dua kertas kerja lebih berhati-hati di sini berbanding ringkasan. Analisis kegagalan TinyVLA adalah spesifik: varian 0.4 B gagal tiga kali dengan salah membaca arahan, yang mana penulis mengaitkan kepada pemahaman bahasa yang terhad dalam VLM yang lebih kecil, dan mod itu hilang pada 1.3 B. SmolVLA menunjukkan lengkung yang sama dari hujung yang lain: versi 2.25 B bagi seni bina yang sama mencatat 88.75 pada LIBERO dan 68.24 pada Meta-World berbanding 87.3 dan 57.3 untuk model 0.45 B.
- Muat pada kad 24 GB, yang mengurangkan kos eksperimen daripada puluhan dolar kepada beberapa dolar.
- Cukup pantas untuk dijalankan di sebelah lengan, jadi tiada lompatan rangkaian dalam gelung kawalan.
- Penalaan halus pada data yang boleh dirakam oleh seorang, puluhan episod dan bukannya ribuan.
- Berat, senarai data dan kod SmolVLA adalah awam, jadi hasil yang buruk boleh dinyahpepijat.
- Kepatuhan arahan yang lebih lemah: parameter bahasa yang lebih sedikit, kurang keupayaan untuk memisahkan ekspresi rujukan yang serupa.
- Generalisasi ruang dan visual yang kurang kepada persediaan yang anda tidak rakam.
- Lebih sensitif kepada kecacatan set data, dengan kurang pra-latihan untuk bergantung.
- Kerja berbilang tugas dan jangka panjang masih memihak kepada model yang lebih besar, termasuk varian 2.25 B SmolVLA sendiri.
Perbandingan yang patut dijalankan bukanlah TinyVLA berbanding SmolVLA. Ia adalah SmolVLA berbanding ACT pada tugas anda sendiri, dan kertas kerja SmolVLA adalah hujah mengapa. Dilatih satu tugas tanpa pra-latihan robotik, SmolVLA mencatatkan purata 40.0 merentasi tiga tugas SO-100 di mana ACT satu tugas mencapai 48.3. Apa yang mengangkatnya kepada 78.3 adalah pra-latihan komuniti ditambah latihan berbilang tugas, bukan seni bina semata-mata. Pada tugas lego SO-101, kedua-duanya satu tugas, SmolVLA memang menang: 90 berbanding 70 dalam pengedaran. Kemudian SmolVLA berbanding Pi0.5 jika bajet mengizinkan.
Kurang pra-latihan sebelum ini untuk menampung data yang buruk, jadi lengkung kerugian yang bersih pada set data yang rosak memberikan anda polisi yang menghasilkan semula kecacatan dengan yakin. Dokumen lerobot berterus terang tentang struktur: 50 episod merentasi 5 posisi kiub, 10 setiap posisi, berjaya; 25 tidak. Jika kerugian kelihatan baik dan lengan tidak melakukan apa-apa yang berguna, mulakan dengan kerugian jatuh, polisi tidak melakukan apa-apa, polisi hanya berfungsi dalam satu persediaan atau mengumpul data latihan VLA yang benar-benar boleh digunakan.
Lima polisi, satu jadual perbandingan
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT dengan kiraan parameter sebenar, latensi inferens setiap langkah tindakan, tahap GPU yang diperlukan oleh setiap satu dan kiraan episod minimum sebelum ia melakukan sesuatu yang berguna.
Bandingkan polisiJadual keputusan yang boleh anda bertindak atasnya
| Situasi anda | Mulakan dengan | Mengapa |
|---|---|---|
| Satu tugas, demonstrasi yang baik, tiada bahasa | ACT | ~80 M, 20 ms, kad 24 GB, tiada model asas untuk dimuat turun |
| Beberapa tugas berkaitan, satu arahan setiap satu | SmolVLA | 450 M, dalam lerobot, minimum 30 episod, 1 hingga 3 USD setiap larian |
| Menghasilkan semula hasil TinyVLA secara khusus | TinyVLA-B or TinyVLA-H | Repo adalah satu-satunya laluan: persekitaran terpencil, data yang ditukar |
| Pelbagai tugas, arahan yang pelbagai, bajet A100 | GR00T N1.7 or Pi0.5 | ~3 B, 152 ms dan 485 ms setiap langkah, 4 hingga 12 USD setiap larian |
| Belum ada robot | Pandu lengan sebenar | Lengan langsung berasaskan giliran tidak memerlukan pendaftaran dan tiada perkakasan |
Untuk baris terakhir, lengan langsung menstrimkan SO-100 fizikal yang boleh anda pandu dari pelayar tanpa akaun, dan tiga cara untuk bermula meliputi selebihnya. SO-100 SO-100 ialah lengan rujukan di sini, kira-kira 110 hingga 150 EUR dalam bahagian, dengan panduan persediaan lengkap.
Apa yang datang selepas model sub-1 B
Mengecilkan kiraan parameter adalah satu cara untuk menjadikan VLA murah dan bukan semestinya cara yang menang. OpenVLA-OFT (arXiv 2502.19645) mengekalkan tulang belakang 7 B dan hanya mengubah cara tindakan dinyahkod, melaporkan peningkatan 26x dalam daya pemprosesan penjanaan tindakan dan LIBERO meningkat dari 76.5 kepada 97.1 peratus. BitVLA (arXiv 2506.07530) menjadikan setiap berat tulang belakang 1-bit BitNet b1.58 2B4T ternari, melaporkan 11.0x kurang memori dan 4.4x latensi hujung ke hujung yang lebih rendah sambil menyamai OpenVLA-OFT ketepatan penuh. X-VLA-0.9B (arXiv 2510.10274) berada pada garis 1 B dengan padanan aliran.
Benang merahnya: penyahkod tindakan, bukan model bahasa, adalah punca latensi. Tanya bagaimana polisi mengeluarkan tindakan sebelum anda bertanya berapa banyak parameter yang dimilikinya. Arena itu arena mempunyai 85 model dan 332 hasil, setiap satu dipautkan kepada sumbernya; terdapat gambaran keseluruhan yang lebih luas dalam pengenalan VLA kami.
Bolehkah saya menala halus SmolVLA pada RTX 4090?▾
Ya. SmolVLA mempunyai 450 M parameter dan AY-Robots menjalankannya pada peringkat RTX 4090 / 24 GB. Contoh lerobot menggunakan --batch_size=64, yang merupakan contoh dan bukannya jaminan untuk kad anda; dokumen menasihatkan untuk bermula dengan kecil dan meningkatkannya selagi masa pemuatan kekal pendek. Jangkakan masa yang lebih lama daripada kira-kira 4 jam yang disebut dalam dokumen untuk 20000 langkah pada A100.
Adakah TinyVLA tersedia dalam lerobot atau di AY-Robots?▾
Tidak untuk kedua-duanya. TinyVLA hanya terdapat dalam repositori penyelidikannya, komit terakhir 11 Mac 2025, dan formatnya adalah HDF5 gaya ACT dan bukannya LeRobot. AY-Robots melatih GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA dan ACT. Jika anda mahukan TinyVLA, anda perlu membangunkannya sendiri, dan anda perlu membetulkan laluan konfigurasi DeepSpeed dalam scripts/train.sh terlebih dahulu.
Adakah model 450 M benar-benar berdaya saing dengan model 3 B?▾
Berdasarkan penanda aras penulis sendiri, ya: 87.3 berbanding 86.0 pada LIBERO berbanding Pi0 yang telah dilatih robotik pada 3.3 B, dan 78.3 berbanding 61.7 pada tiga tugas SO-100 sebenar di mana kertas yang sama melabelkan Pi0 pada 3.5 B. Hadnya terdapat dalam kertas yang sama: tugas tunggal tanpa pra-latihan robotik, SmolVLA jatuh kepada 40.0, di bawah ACT 48.3.
Berapa banyak episod yang saya perlukan sebelum VLA kecil berfungsi?▾
AY-Robots menetapkan minimum SmolVLA pada 30 episod dan minimum ACT pada 50. Dokumen lerobot mengesyorkan sekitar 50 dan melaporkan bahawa 25 tidak mencukupi untuk tugas yang sama. Struktur adalah sama pentingnya dengan bilangan: set kertas itu menggunakan 5 posisi kiub dengan 10 episod setiap satu.
Mengapa angka latensi yang diterbitkan sangat berbeza?▾
Mereka mengukur perkara yang berbeza. TinyVLA melaporkan 14 ms setiap ramalan tindakan pada A6000; AY-Robots menyenaraikan SmolVLA pada 245 ms dan ACT pada 20 ms setiap langkah tindakan. Beberapa angka meliputi satu laluan ke hadapan, beberapa membahagikan laluan merentasi segmen 50 tindakan, dan hampir tiada yang termasuk tangkapan kamera atau penulisan ke servo.
Adakah inferens awan menyelesaikan masalah GPU?▾
Sebahagiannya. AY-Robots secara automatik menyediakan pod yang melayani polisi manakala klien tempatan berkomunikasi dengan titik akhir tersebut, dengan pengawas terbiar supaya ia memusnahkan dirinya sendiri dan bukannya mengebil secara senyap. Ia tidak dapat menghapuskan perjalanan pergi balik internet awam, dan gelung kawalan sudah pun 20 hingga 485 ms setiap langkah tindakan. Baik untuk pilih-dan-letak yang perlahan, bukan untuk gerakan reaktif yang pantas.
Sources
- TinyVLA: Ke Arah Model Visi-Bahasa-Tindakan yang Pantas dan Cekap Data untuk Manipulasi Robotik
- Repositori kod rasmi TinyVLA (README, requirements.txt, scripts/train.sh)
- Halaman projek TinyVLA
- lesjie/Llava-Pythia-1.3B, pemberat tulang belakang TinyVLA-H
- SmolVLA: Model Visi-Bahasa-Tindakan untuk Robotik yang Mampu Milik dan Cekap
- Dokumentasi lerobot: penalaan halus SmolVLA
- lerobot: configuration_smolvla.py, tetapan lalai SmolVLA
- Kad model lerobot/smolvla_base
- SmolVLA: Model Visi-Bahasa-Tindakan yang Cekap (blog Hugging Face)
- lerobot di PyPI (0.6.1, memerlukan Python 3.12 atau lebih baru)
- OpenVLA: Model Visi-Bahasa-Tindakan Sumber Terbuka
- Penalaan Halus Model Visi-Bahasa-Tindakan: Mengoptimumkan Kelajuan dan Kejayaan (OpenVLA-OFT)
- BitVLA: Model Visi-Bahasa-Tindakan 1-bit untuk Manipulasi Robotik
- X-VLA: Transformer Berpencetus Lembut sebagai Model Visi-Bahasa-Tindakan Merentas Embodimen yang Boleh Skala
- Kad model rail-berkeley/octo-small-1.5 (27 M parameter)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started