
SmolVLA 450 million parametrlik VLA bo'lib, bitta 24 GB kartada nozik sozlanadi. Haqiqiy lerobot 0.6.1 buyruqlari, haqiqiy standart sozlamalar, bir kunni yo'qotadigan tuzoqlar va bir ishga tushirish qancha turishi.
SmolVLA bir ekranda
- •450 M parametr, ulardan taxminan 100 M tasi oqim moslashtirish harakat eksperti. lerobot faqat shu ekspertni o'rgatadi va VLMni muzlatilgan holda saqlaydi, shuning uchun u bitta kartaga sig'adi.
- •LeRobot'ning hisoblash qo'llanmasi smolvla guruhini AdamW bilan 8 partiyada taxminan 10 dan 16 GB gacha eng yuqori VRAMga ega deb ko'rsatadi. Shuning uchun 24 GB.
- •Kirish nuqtasi lerobot-train. 2025-yil iyun oyidagi SmolVLA blog posti hali ham python lerobot/scripts/train.py ni chop etadi, bu yo'l endi mavjud emas. Quyida keltirilganlarning barchasi lerobot 0.6.1.
- •Kosinus jadvali 30000 qadamda pasayish uchun oldindan o'rnatilgan. lerobot 0.6.1 uni qisqaroq ishga tushirish uchun pastga o'lchamini o'zgartiradi va uni qayd etadi, lekin hech qachon yuqoriga emas: standart 100000 qadamli ish 70000 qadam uchun 2.5e-6 darajasida tugaydi.
- •O'ttiz epizod AY-Robots minimalidir, 24 GB darajasida ishlatish 1 dan 3 USD gacha turadi, 80 GB modellari uchun esa 4 dan 12 gacha.
Haqiqiy qo'lda vizual til harakat modelini xohlaydigan ko'pchilik apparat chegarasida to'xtaydi. GR00T N1.7 va Pi0.5 har biri taxminan uch milliard parametrga ega va A100 80 GB yoki H100 ni talab qiladi. Agar sizda RTX 4090 bilan o'yin kompyuteri bo'lsa, bu yo'lning oxiri. SmolVLA istisno hisoblanadi: 450 M parametr, LeRobot ichida, bitta iste'molchi kartasida nozik sozlash va CPUdan xizmat ko'rsatish uchun qurilgan.
Avval qo'lda yo'l: lerobotni o'rnating, lerobot/smolvla_base nazorat nuqtasini torting, haqiqiy buyruqni ishga tushiring, u sodir bo'layotganda ishni o'qing. Keyin platforma yo'li va u qayerda yordam bermasligi.
SmolVLA nima, siz tekshirishingiz mumkin bo'lgan raqamlarda
SmolVLA - bu oqim moslashuvi siyosati kichik ko'rish-til modeliga o'rnatilgan. Asosiy qism SmolVLM2-500M-Video-Instruct; maqolada uning til modelining faqat dastlabki 16 qatlami saqlanadi, har bir kamera kadrini tasvirni plitkalash o'rniga piksel aralashtirish bilan 64 vizual tokenga cheklaydi va har ikkinchi blokda o'zaro diqqatni o'z-o'zidan diqqat qatlami bilan almashtiradi. Xulosa chiqarish narxi dizayn cheklovi bo'lgan, keyinchalik o'ylab topilgan narsa emas.
| Xususiyat | Qiymat | Manba |
|---|---|---|
| Jami parametrlar | about 450 M | maqola |
| Harakat eksperti | about 100 M, flow matching | maqola |
| VLM asosi | HuggingFaceTB/SmolVLM2-500M-Video-Instruct | vlm_model_name |
| Ishlatilgan VLM qatlamlari | til modelining dastlabki 16 tasi | num_vlm_layers = 16 |
| Kadr uchun vizual tokenlar | 64, pixel shuffle, no tiling | maqola |
| Oldindan o'qitish | 481 community datasets, 22.9 K episodes, 10.6 M frames; 200000 steps at global batch 256 on 4 GPUs | maqola |
Benchmarklar odamlarning 450 M model bilan shug'ullanishiga sababdir. LIBEROda u 7 B OpenVLA uchun 76.5 ga va 3.3 B robototexnika uchun oldindan o'qitilgan Pi0 uchun 86.0 ga qarshi o'rtacha 87.3 foizni tashkil etadi; Meta-Worldda 47.9 ga qarshi 57.3. Haqiqiy SO-100 apparatida ko'p vazifali o'qitish tanlash va joylashtirishda 75 foiz, yig'ishda 90, saralashda 70 foiz natija beradi, o'rtacha 78.3 ni tashkil etadi, bu yerda ACT vazifa bo'yicha o'qitilgan o'rtacha 48.3 ni tashkil etdi. Xuddi shu qatorlar har bir nashr etilgan VLA yonida joylashgan SmolVLA arena yozuvi va ACT va SmolVLA taqqoslash.
SmolVLA hamma narsada 3 B modeldan yaxshiroq emas. Maqolaning o'z SO-101 jadvali buni ko'rsatadi: tarqatishda 90 foiz muvaffaqiyat, undan tashqarida 50 foiz, hech qachon oldindan o'qitilmagan platformada. Uning da'vo qilgan va qo'llab-quvvatlagan narsasi shundaki, Pi0 ga qarshi u 6 barobar kam xotirada taxminan 40 foiz tezroq o'qitiladi.
Nima uchun 24 GB karta birinchi ishga tushirish uchun to'g'ri tanlovdir
LeRobot hisoblash hajmini aniqlash bo'yicha qo'llanmani taqdim etadi, bu repo'dagi eng foydali sahifadir. U siyosatlarni magistral o'lchami bo'yicha guruhlaydi va har bir guruh uchun bitta VRAM konvertini beradi, bu AdamW bilan batch size 8 da o'lchanadi, bu lerobotning standart sozlamasi. Faqat optimizator holati oddiy oldinga va orqaga o'tishdan 30 dan 100 foizgacha qo'shimcha yuk beradi, shuning uchun bular faqat og'irliklar ko'rsatkichlari emas.
| Guruh | Siyosatlar | Eng yuqori VRAM (batch 8, AdamW) | Boshlang'ich GPUlar |
|---|---|---|---|
| Yengil BC | act, vqbet, tdmpc | taxminan 2 dan 6 GB gacha | RTX 3060, L4 |
| Diffuziya | diffusion, multi_task_dit | taxminan 8 dan 14 GB gacha | RTX 4070+, L4 |
| Kichik VLA | smolvla | taxminan 10 dan 16 GB gacha | RTX 4080+, L4, A10G |
| Katta VLA | pi0, pi0_fast, pi05, xvla, wall_x | taxminan 24 dan 40 GB gacha | A100 40 GB+ |
| Multimodal | groot, eo1 | taxminan 24 dan 40 GB gacha | A100 40 GB+ |
Batch 8 da o'n dan o'n olti gigabayt bu asosiy dalil: 24 GB karta bunga qo'shimcha ravishda dataloaderni ham sig'dira oladi. AY-Robots SmolVLA'ni RTX 4090 yoki istalgan 24 GB kartaga joylashtiradi, minimal 30 epizod, LeRobot v3.0 ma'lumotlari bilan, har bir harakat bosqichi uchun 245 ms. Ijaraga olinganda, bu soatiga 0.30 dan 0.60 USD gacha bo'lgan narxda 2 dan 5 soatni tashkil etadi, ya'ni har bir nozik sozlash ishga tushirish uchun taxminan 1 dan 3 USD, GR00T va Pi0.5 talab qiladigan 80 GB darajadagi 4 dan 12 USD ga qarshi (narxlar). Muvaffaqiyatsiz SmolVLA ishga tushirish bir kofe narxi; muvaffaqiyatsiz GR00T ishga tushirish esa tushlik narxi.

- Sizda mavjud bo'lishi mumkin bo'lgan uskunaga mos keladi: taxminan 10 dan 16 GB gacha, 8 partiyada.
- Behuda ishlatilgan ish soatlar va bir xonali dollarga tushadi, shuning uchun ma'lumotlar to'plami haqida xato qilishga qurbingiz yetadi.
- Lerobot tegi ostida bo'lishilgan jamoat ma'lumotlar to'plamlarida oldindan o'qitilgan, haqiqiy SO-100 va SO-101 natijalari bilan.
- U lerobotning o'zida yashaydi: sotuvchi repozitoriyasi yo'q va smolvla_base cheklanmagan.
- 450 M baribir 450 M: tarqatishdan tashqari muvaffaqiyat maqolaning SO-101 jadvalida 90 foizdan 50 foizga tushadi.
- U LeRobot v3.0 ma'lumotlarini talab qiladi; v2.1 yozuvi konvertatsiya qilinishi kerak (dataset rejected v3).
- Har bir harakat bosqichi uchun 245 ms malakali tanlash va joylashtirish boshqaruvchisi, reaktiv emas.
- Hujjatlar misoli A100 da 64 partiyani ishga tushiradi; 24 GB da siz partiyani devor soati bilan almashtirasiz.
0-qadam: ishni bayroqlar emas, ma'lumotlar to'plami hal qiladi
Agar yozuv yomon bo'lsa, quyidagilarning hech biri ahamiyatga ega emas. LeRobot SmolVLA sahifasi ochiq aytadi: mos yozuvlar ma'lumotlar to'plami 5 ta kub pozitsiyasida 50 ta epizoddan iborat edi, har bir pozitsiya uchun 10 tadan, va 25 ta epizodda bajarilgan xuddi shu vazifa yomon natija berdi. Har bir variatsiya bo'yicha takrorlash umumlashtiradi, xom epizodlar soni emas. Hech qachon yozmaganmisiz? Boshlang birinchi ma'lumotlar to'plamingizni yozing, bilan ish stoli mijozi, bu teleoperatsiya sessiyasidan, yoki ma'lumotlar to'plami katalogi dan birini oling.
- AY-Robots'da kamida 30 epizod, LeRobot mos yozuvlar retsepti uchun taxminan 50.
- Tarqatishda kutgan har bir variatsiya, bir necha marta takrorlangan.
- Bir vazifa satri, yozish va tarqatish vaqtida bir xil yozilgan. Model shu matnga asoslangan.
- Ruxsat etilgan kameralar. Yozish va tarqatish o'rtasida ko'chirilgan kamera toza yo'qotish egri chizig'i harakatsiz qo'l berishining eng keng tarqalgan sababidir.
- Hech qachon o'qitmagan, sinovdan o'tkazish uchun halol narsangiz bo'lishi uchun ajratilgan variatsiya.
SmolVLA, Pi0.5 va ACT LeRobot v3.0 ni xohlaydi. GR00T N1.7 va N1.5 v2.0 yoki v2.1 ni xohlaydi va ularning yuklovchisi v3.0 da ishlamay qoladi. Bir marta yozib oling, keyinroq modellarni solishtirishni rejalashtiring va siz baribir bir yo'l bilan o'zgartirasiz: dataset rejected v3.
# v2.1 -> v3.0: aggregates per-episode files into shards and writes the episode offsets
python -m lerobot.scripts.convert_dataset_v21_to_v30 --repo-id=${HF_USER}/so100_pick_placeBu haqda ko'proq ma'lumot yuqori sifatli VLA o'quv ma'lumotlarini qanday to'plash kerak. Qisqacha aytganda: bir vazifaning ataylab o'zgarishlari bilan 30 dan 50 gacha toza epizodlar uchta vazifaning 200 ta tartibsiz epizodlarini mag'lub etadi, bu farqni hech qanday giperparametr yopa olmaydi.
lerobot 0.6.1 o'rnatish
# LeRobot needs Python 3.12 or newer as of 0.6.x
conda create -y -n lerobot python=3.12
conda activate lerobot
# TorchCodec decodes the dataset videos and wants ffmpeg
conda install ffmpeg -c conda-forge
# Base package is deliberately thin; extras pull the rest
pip install 'lerobot[smolvla,training,core_scripts]'
# Sanity check: prints the lerobot version, the GPU torch sees, and the console scripts you got
lerobot-infoAsosiy lerobot o'rnatish yengil bo'lib, og'ir bog'liqliklarni qo'shimcha paketlar ortida yashiradi: smolvla transformerlar, num2words va accelerate'ni qo'shadi, training ma'lumotlar to'plami steki va wandb'ni, core_scripts apparat va vizualizatsiya bog'liqliklarini. Linuxda o'rnatish yo'li sizning CUDA wheel'ingizni ham belgilaydi: PyPI sukut bo'yicha 580.65 drayver minimal talabiga ega cu130 wheel'ini taqdim etadi, shuning uchun eski drayverda avval cu128 indeksidan torch'ni, keyin esa lerobot'ni o'rnating.
--policy.path=lerobot/smolvla_base oldindan o'qitilgan 450 M nazorat nuqtasini yuklaydi va uni nozik sozlaydi. --policy.type=smolvla yangi SmolVLA yaratadi va konfiguratsiyaning sukut bo'yicha load_vlm_weights = False qiymati siz so'ramasangiz, SmolVLM2 tayanch og'irliklarini ham tortib olmasligini anglatadi. Agar xato qilsangiz, ish muvaffaqiyatli o'qitiladi, xarajat bir xil bo'ladi va hech qanday o'tkaziladigan narsa o'rganilmaydi.
Mashg'ulotni ishga tushirish, buyruqma-buyruq
- 1Hubga qarshi autentifikatsiya qilish
Asosiy nazorat nuqtasi Hubdan keladi va sizning ma'lumotlar to'plamingiz ham shunday bo'lishi mumkin.
bashhf auth login - 2Variantlarni bir marta o'qib chiqing
Quvur liniyasi va siyosat konfiguratsiyasining har bir maydoni bayroqdir. Manbaga kirishdan oldin uni ko'rib chiqing.
bashlerobot-train --help - 3Nozik sozlashni boshlash
Hujjatlar misoli bitta A100 da 64 ta partiyani ishga tushiradi; hisoblash qo'llanmasining o'z A100 40 GB langari 16 ta partiya, 8 esa 24 GB ekvivalenti. Bu yerda ataylab rejalashtiruvchi bayrog'i yo'q, quyida ko'ring.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/so100_pick_place \ --batch_size=8 \ --steps=20000 \ --save_freq=2000 \ --log_freq=200 \ --seed=1000 \ --output_dir=outputs/train/smolvla_pick_place \ --job_name=smolvla_pick_place \ --policy.device=cuda \ --wandb.enable=true - 4Faqat yo'qotishni emas, balki jurnal qatorini o'qing
Har bir --log_freq qadamda lerobot yo'qotish, grdn, lr, updt_s, data_s, smp/s va CUDA da mem_gb ni chop etadi. mem_gb partiyaning sig'ishini, lr jadvalning pasayishini, va data_s ning updt_s ga yaqinlashishi dataloader ning tiqilinch ekanligini, GPU emasligini bildiradi.
bash# if data_s creeps toward updt_s lerobot-train ... --num_workers=8 - 5Solishtirish mumkin bo'lgan nazorat nuqtalarini to'plang
save_freq sukut bo'yicha 20000 ga teng, shuning uchun 20000 qadamli ish bir nazorat nuqtasini qoldiradi va uni solishtirish uchun hech narsa qolmaydi. 2000 ni o'rnating. Hubga yuklash uchun --policy.repo_id kerak.
bash--save_freq=2000 \ --policy.repo_id=${HF_USER}/smolvla_pick_place \ --save_checkpoint_to_hub=true - 6Agar mashina ishdan chiqsa, davom ettiring
--config_path ni nazorat nuqtasi yonidagi train_config.json ga yo'naltiring. lerobot mavjud output_dir ga ishga tushirishdan bosh tortadi, agar siz davom ettirmasangiz, shuning uchun siz tasodifan ishni qayta yozib yubora olmaysiz.
bashlerobot-train \ --config_path=<path to the saved train_config.json> \ --resume=true
Natijani haqiqatan ham o'zgartiradigan bayroqlar
| Bayroq | Nima qiladi | 24 GB da |
|---|---|---|
| --batch_size | Har bir qadamdagi namunalar, VRAM da taxminan chiziqli | 4 to 8 |
| --steps | Jami optimizator qadamlari | 20000 first pass |
| --policy.scheduler_decay_steps | Kosinusli parchalanish uzunligi, oldindan o'rnatilgan 30000 | Only bites above 30000 |
| --policy.use_amp | Aralash aniqlik; SmolVLA da dtype maydoni yo'q | true when memory is tight |
| --num_workers | Dataloader jarayonlari, sukut bo'yicha 4 | Raise until data_s stops climbing |
| --dataset.eval_split | Har bir vazifa uchun ajratilgan epizodlar ulushi | 0.1, with --eval_steps |
| --policy.freeze_vision_encoder | Ko'rish minorasini muzlatilgan holda saqlaydi | true on 24 GB |
| --policy.train_expert_only | Faqat ~100 M ekspert gradientlarni oladi | true first |
SmolVLA kosinus jadvalini oldindan belgilaydi: scheduler_warmup_steps = 1000, scheduler_decay_steps = 30000, scheduler_decay_lr = 2.5e-6. Eski tavsiyalarga ko'ra, 20000 qadamli ish o'rtacha pasayishda to'xtab qoladi. 0.6.1 versiyasida esa bunday emas: CosineDecayWithWarmupSchedulerConfig.build() ga --steps beriladi, va num_decay_steps ostida u ikkalasini ham qayta masshtablaydi, isinishni 1000 dan 666 ga va pasayishni 30000 dan 20000 ga, shu bilan birga Auto-scaling LR scheduler deb chop etadi. U hech qachon yuqoriga qayta masshtablamaydi: pasayish min(current_step, decay_steps) bilan cheklanadi, shuning uchun standart --steps=100000 30000-qadamdan oxirigacha, ishning 70 foizida pastda turadi. Faqatgina shu uzun tomon hali ham --policy.scheduler_decay_steps ni talab qiladi. lr ustuni siz tekshiradigan joy.
Agar hech narsaga tegmasangiz, siz meros qilib oladigan standart sozlamalar
Bir siyosat konfiguratsiyasi lerobotda o'zining optimizator va jadval oldindan sozlamalarini olib yuradi, va agar siz use_policy_training_preset=false ni o'rnatmasangiz, bu oldindan sozlamalar ustunlik qiladi. Odamlar SmolVLA o'qitish haqida beradigan savollarning yarmi ular mavjudligini bilmagan standart sozlama bilan javob beriladi.
| Sozlama | lerobot 0.6.1 dagi standart | Belgilangan joyi |
|---|---|---|
| chunk_size / n_action_steps | 50 / 50 | SmolVLAConfig |
| num_steps (flow matching denoise) | 10 | SmolVLAConfig |
| optimizer_lr | 1e-4 | SmolVLAConfig |
| scheduler_warmup_steps | 1000 | SmolVLAConfig |
| scheduler_decay_steps | 30000 | SmolVLAConfig |
| scheduler_decay_lr | 2.5e-6 | SmolVLAConfig |
| freeze_vision_encoder | true | SmolVLAConfig |
| train_expert_only | true | SmolVLAConfig |
| batch_size / steps | 8 / 100000 | TrainPipelineConfig |
| seed / save_freq / num_workers | 1000 / 20000 / 4 | TrainPipelineConfig |
Odamlarni hayratga soladigan ikki qator bu freeze_vision_encoder va train_expert_only, ikkalasi ham rost. Qutidan tashqarida siz taxminan 100 M parametrni o'rgatasiz, 450 M emas, shuning uchun u 24 GB ga sig'adi. LeRobot'ning to'rt GPU H100 klasteridagi o'zining mos yozuvlar ishi ikkalasini ham 'false' ga o'zgartiradi; bitta 24 GB kartada bu ishlaydigan ishni ga aylantiradi.
Xotira cheklanganida qo'llanmaning maslahati – batch hajmini kamaytirish va samarali batchni tiklash uchun gradient akkumulyatsiyasidan foydalanish. lerobot 0.6.1 da gradient akkumulyatsiyasi yo'q: TrainPipelineConfig bunday maydonga ega emas va bu satr chiqarilgan paketda hech qayerda ko'rinmaydi. AY-Robots shakli SmolVLA uchun 8 gradient akkumulyatsiya qiymatini ko'rsatadi va uni ham qo'llamaydi. 24 GB da sizning dastaklaringiz --batch_size, ikkita muzlatish sukut qiymatlari va --policy.use_amp.
Ish qancha vaqt oladi va qancha qadam yetarli
LeRobot taxminan 50 epizodli ma'lumotlar to'plami bo'yicha besh epoch uchun, 30 fps tezlikda taxminan 45000 kadr uchun real vaqt ankrajlarini nashr etadi. Kattalik tartibidagi raqamlar, hujjatlarda aytilishicha, lekin ular bir soat va bir kun kutish o'rtasidagi farqdir.
| Sozlash | Siyosat | Paket | Haqiqiy vaqt |
|---|---|---|---|
| Yagona L4 / A10G (24 GB) | smolvla | 4 | about 3 to 6 h |
| Yagona A100 40 GB | smolvla | 16 | about 1 to 2 h |
| 4 x H100 80 GB accelerate bilan | smolvla | 32 | about 1 to 2 h |
| Yagona RTX 4090 / RTX 3090 (24 GB) | act | 8 | about 30 to 60 min |
Qoida ma'lumotlar to'plami bo'yicha 5 dan 10 gacha epoxa, aniq qadamlar soni emas: steps_per_epoch = ceil(total_frames / (num_gpus x batch_size)). Hujjatlarda ko'rsatilgan ma'lumotlar to'plamida, lerobot/svla_so100_pickplace, metama'lumotlar 50 epizod va 19631 kadrni ko'rsatadi: 8 paket har bir epoxa uchun taxminan 2454 qadam beradi, shuning uchun 20000 qadam taxminan 8 epoxaga teng. Paketni yarmiga kamaytiring va bir xil byudjet epoxalarning yarmini sotib oladi, shuning uchun --batch_size ga teginganingizda buni qayta bajaring.
Nozik sozlashdan o'tgan siyosatni qo'lga qayta qo'llash
lerobot-rollout \
--strategy.type=base \
--robot.type=so100_follower \
--robot.port=/dev/ttyACM0 \
--robot.id=my_follower_arm \
--robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30}}" \
--task="Grasp the cube and put it in the box." \
--policy.path=${HF_USER}/smolvla_pick_placeHarakat qadami uchun 245 ms ni noto'g'ri tushunish oson: siyosat oldinga o'tishda chunk_size = 50 harakatni chiqaradi va ulardan n_action_steps = 50 tasini bajaradi, shuning uchun bu xarajatni qancha tez-tez to'lashingiz servo buyruqni qancha tez-tez olishiga emas, balki shu tugmalar bilan belgilanadi. Bu harakatni bo'laklarga ajratish nima beradi va nima uchun 245 ms model 30 Hz qo'lni boshqara oladi. Qolgan narsa bo'lak oxiridagi xulosa chiqarish kechikishidir.
| O'lchov (SmolVLA, haqiqiy SO-100) | Sinxron | Asinxron |
|---|---|---|
| Bajarish vaqti, olib qo'yish, 10 sinov | 13.75 s | 9.70 s |
| Belgilangan vaqt oralig'ida olib qo'yish sikllari | 9 | 19 |
| Uch vazifa bo'yicha o'rtacha muvaffaqiyat darajasi | 78.3 % | 73.3 % |
Uchinchi qator ko'pchilik maqolalar e'tibordan chetda qoldiradigan narsadir. Asinxron xulosa chiqarish taxminan 30 foizga tezroq va belgilangan vaqt oralig'ida o'tkazuvchanlikni taxminan ikki baravar oshiradi, va maqolada muvaffaqiyat darajalari taqqoslanadigan deb ataladi, bu o'rtacha hisobda shunday. Buning ostida, saralash 70 dan 50 foizga tushgan, olib qo'yish esa 5 ga oshgan. lerobot 0.6.1 bir xil ikkilik faylda boshqa dastakni olib yuradi: --inference.type=rtc skriptning o'z foydalanish bloki sekin VLA'lar, Pi0, Pi0.5 va SmolVLA uchun tavsiya qiladigan real vaqt rejimida bo'laklarga ajratishga o'tishni ta'minlaydi.
Boshqaruv sikli modelga qarab harakat qadami uchun 20 dan 485 ms gacha, va ustiga jamoat internetidagi borib-kelishlar ishlaydigan siyosatni ikkilanuvchi siyosatga aylantiradi. Masofaviy xulosa chiqarish sekin olib qo'yish uchun maqbul, tez reaktiv harakat uchun emas: agar vazifa tezkor tuzatishlarni talab qilsa, GPU qo'l bilan bir xil LANda bo'lishi kerak.
Mashg'ulot uchun mavzudan tashqari, ammo u har qanday giperparametrdan ko'ra ko'proq SO-100 loyihalarini yakunlaydi. SO-100 va SO-101 dagi Feetech STS3215 servolari 7.4 V da ishlaydi; 12 V ularni ishdan chiqaradi. LeKiwi 7.4 V qo'lni 12 V baza bilan aralashtiradi, bu noto'g'ri barrel jakning noto'g'ri rozetkani topishiga sabab bo'ladi.
Bir xil nazorat nuqtasiga ikki yo'l
Siz mashinaga, muhitga va disk raskadrovkaga egasiz. Yagona bulutga bog'liqlik - bu asosiy nazorat nuqtasini Hubdan yuklab olish. Agar siz siyosatni o'zgartirmoqchi bo'lsangiz, ma'lumotlar tarmog'ingizni tark eta olmasa yoki karta bo'sh turgan bo'lsa, bu to'g'ri yo'l.
- Siz CUDA g'ildiragini, drayverni, ffmpeg yig'ilishini va ma'lumot yuklagichni nazorat qilasiz.
- Siz configuration_smolvla.py faylini yamashingiz va shu kuni tushdan keyin qayta o'qitishingiz mumkin.
- Siz elektr energiyasi va vaqt uchun to'laysiz, har bir ishga tushirish uchun emas, va TorchCodecni o'zingiz disk raskadrovka qilasiz.
pip install 'lerobot[smolvla,training,core_scripts]'
hf auth login
lerobot-train \
--policy.path=lerobot/smolvla_base \
--dataset.repo_id=${HF_USER}/so100_pick_place \
--batch_size=8 --steps=20000 \
--save_freq=2000 --seed=1000 \
--output_dir=outputs/train/smolvla_pick_place \
--job_name=smolvla_pick_place \
--policy.device=cuda --wandb.enable=trueBir shakl ortidagi xuddi shu ish: siz model va ma'lumotlar to'plamini tanlaysiz, backend kerakli VRAM bo'yicha GPU ijaraga oladi, o'qituvchini ishga tushiradi va nazorat nuqtalari obyekt saqlash joyiga yozadi. Ma'lumotlar to'plami Hugging Face repo identifikatoridan, ommaviy katalogdan, yoki sizning mashinangizdan kelishi mumkin. SO-100 da SmolVLA dan boshlang, yoki o'qitish sahifasidagi matritsasidan.
| Maydon | Platform SmolVLA uchun yuboradigan standart qiymat | Izoh |
|---|---|---|
| paket hajmi | 2 | 24 GB darajasi uchun ehtiyotkor |
| o'rganish tezligi | 1e-4 | Lerobot oldindan sozlamasi |
| maksimal qadamlar | 20000 | LeRobot hujjatlaridagi mos yozuv ishi |
| gradient to'planishi | 8 | Shaklda ko'rsatilgan, qo'llanilmagan |
| qo'shimcha sozlamalar | seed, logFreq | Seed ishni takrorlanuvchan qiladi |
- 24 GB darajasida 2 dan 5 soatgacha, har bir ishga tushirish uchun taxminan 1 dan 3 USD gacha.
- /cli dagi terminaldan va /mcp dagi AI agentlaridan bir xil operatsiyalar.
- Xulosa podlari bo'sh turgan kuzatuvchini olib yuradi, shuning uchun unutilgan pod jimgina hisob-kitob qilish o'rniga o'zini yo'q qiladi.
- Hali qo'l yo'qmi? /live ro'yxatdan o'tmasdan boshqarishingiz mumkin bo'lgan jismoniy SO-100 ni translyatsiya qiladi.
Navbatda qolib ketgan ish xato emas, balki spot bozorining alomatidir: o'qitish ishi navbatda qolib ketdi. Qadam-baqadam: birinchi siyosatingizni o'qiting va o'qitish hujjatlari.
SmolVLA noto'g'ri tanlov bo'lganda
SmolVLA toʻgʻri birinchi ishga tushirish boʻlganligini aniqlash testi uning ishlaganligida emas, balki muvaffaqiyatsizlik sizga nimadir aytganligidadir. 60 yoki 70 foizga erishilsa, kattaroq model keyingi oʻrinli xarajat boʻladi: maʼlumot signal olib keladi. 10 foizga erishilsa, 3 B model ham koʻpincha 10 foizga erishadi, buni siz oʻn ikki dollar oʻrniga uch dollarga oʻrgandingiz.

Koʻproq pul sarflashdan oldin oʻqishga arziydi: Pi0.5 SmolVLAga qarshi bir xil gʻoya boʻyicha koʻproq imkoniyat uchun, va GR00T N1.7 SmolVLAga qarshi NVIDIA yoʻli uchun, ikkalasi ham 80 GB darajasida, har bir ishga tushirish 4 dan 12 USD gacha. Boshqa yoʻl, ACT arzonroq asosdir: 80 M parametr, har bir harakat bosqichi uchun 20 ms, til shartlari yoʻq. Barcha beshtasi joylashgan siyosatlar sahifasi; arenada 85 ta model va 332 ta benchmark natijalari mavjud.

Biror narsani masshtablashdan oldingi nazorat roʻyxati
lroʻzining 2.5e-6 minimal qiymatiga yetdimi? 30000 qadamdan pastda lerobot pasayishni qayta masshtablaydi va ishga tushirishda bu haqda xabar beradi; undan yuqorida,--policy.scheduler_decay_stepsni oʻzingiz oʻrnating.- Birdan ortiq nazorat nuqtasi va
--dataset.eval_splitbilan ajratilgan epizodlar, shuning uchun baholash yoʻqotishi maʼlum bir maʼnoga ega boʻladi. - Siyosat umuman harakat qiladimi? Harakatsiz qoʻl bilan tushayotgan yoʻqotishning oʻziga xos sabablari bor: yoʻqotish tushadi, siyosat hech narsa qilmaydi.
- U sahna oʻzgarishidan omon qoladimi? Agar yoʻq boʻlsa: siyosat faqat bitta sozlamada ishlaydi.
- Urugʻni yozib oldingizmi? lerobot sukut boʻyicha 1000 ga teng, shuning uchun ikkita tegilmagan ish qiyosiy boʻlib qoladi.
- Faqat shundan keyin: koʻproq epizodlar, koʻproq oʻzgarishlar yoki kattaroq model. Shu tartibda.
Nima uchun bu modellar mavjudligi va ular til kiritish bilan nima qilishlari haqida, fon hisoblanadi; yigʻishni orqali birinchi ishiga olib boradi. Tayyor nazorat nuqtasi uchun, ; agar qoʻl hech qachon koʻrinmasa, .
SmolVLA ni oʻz qoʻlingizda oʻrgating
Modelni, qoʻlni tanlang va qoʻllanma sizga aniq standartlarni, maʼlumotlar toʻplami formatini va ishning narxini beradi. SmolVLA 24 GB darajasida, har bir ish uchun 1 dan 3 USD gacha turadi.
Oʻqitish qoʻllanmalarini ochishRTX 4090'da SmolVLA'ni haqiqatan ham nozik sozlashim mumkinmi?▾
Ha. LeRobot'ning hisoblash qo'llanmasida SmolVLA AdamW bilan batch 8 da taxminan 10 dan 16 GB gacha eng yuqori VRAM talab qilishi ko'rsatilgan va 24 GB iste'molchi kartalari buning uchun qulay deb hisoblanadi. Hujjatlar misolidagi batch 64 bitta A100 bilan juftlashtirilgan. Xotira batch bilan deyarli chiziqli ravishda o'lchanadi, shuning uchun 4 yoki 8 dan foydalaning va mem_gb ni kuzating.
Menga aslida nechta epizod kerak?▾
AY-Robots minimal miqdorni 30 deb belgilaydi. LeRobot hujjatlarida taxminan 50 ta tavsiya etiladi va bir xil vazifaning 25 ta epizodi yomon natija bergani qayd etilgan. Tuzilma sonidan muhimroq: mos yozuvlar to'plami har biri 10 ta epizoddan iborat 5 ta kub pozitsiyasidan iborat edi va aynan shu takrorlash umumlashtirishga yordam beradi.
Hujjatlarda batch 64 deyilgan, platforma batch 2 yuboradi. Qaysi biri to'g'ri?▾
Ikkalasi ham, turli xil apparat uchun. Hujjatlar misolida batch 64 ishlatiladi va bitta A100 da 20000 qadam uchun taxminan 4 soat vaqt ko'rsatilgan; hisoblash qo'llanmasining A100 40 GB uchun batch 16. Batch 2 bu AY-Robots 24 GB darajasida yuboradigan narsa. Mahalliy ravishda 4 dan 8 gacha o'rtacha hisoblanadi va epoch arifmetikasi u bilan o'zgaradi.
SO-100 da birinchi ishga tushirish uchun SmolVLA yoki ACT?▾
Agar vazifa bitta takrorlanuvchi harakat bo'lsa va siz eng tez tsiklni istasangiz ACT: harakat qadami uchun 20 ms, 80 M parametr, til shartlari yo'q. Agar siz til shartlarini, bitta checkpointda bir nechta vazifa satrlarini va oldindan o'qitilgan bazani istasangiz SmolVLA. Ikkalasi ham 24 GB darajasida joylashgan, shuning uchun tanlov byudjet emas, balki vazifadir.
--policy.scheduler_decay_steps ni o'rnatishim kerakmi?▾
Faqat --steps 30000 dan yuqori bo'lganda. SmolVLA kosinus parchalanishini 30000 qadamda oldindan o'rnatadi va lerobot 0.6.1 qisqaroq ish uchun uni o'zi pastga o'lchaydi, bu jarayonda "Auto-scaling LR scheduler" ni qayd etadi. U hech qachon yuqoriga o'lchamaydi, shuning uchun standart --steps=100000 oxirgi 70000 qadamni 2.5e-6 darajasida qoldiradi.
Sources
- SmolVLA: Arzon va Samarali Robototexnika uchun Ko'rish-Til-Harakat Modeli
- SmolVLA: Samarali Ko'rish-Til-Harakat Modeli (Hugging Face blogi)
- lerobot/smolvla_base model kartasi
- LeRobot hujjatlari: SmolVLA
- LeRobot hujjatlari: LeRobot o'qitish uchun hisoblash apparat qo'llanmasi
- LeRobot hujjatlari: O'rnatish
- LeRobot hujjatlari: LeRobotDataset v3.0 va v2.1 konverteri
- LeRobot hujjatlari: Asinxron xulosa
- lerobot v0.6.1: configuration_smolvla.py
- lerobot v0.6.1: TrainPipelineConfig
- lerobot v0.6.1: CosineDecayWithWarmupSchedulerConfig
- lerobot v0.6.1: lerobot_rollout.py (strategiyalar va RTC xulosa)
- lerobot v0.6.1: pyproject.toml (qo'shimchalar va konsol kirish nuqtalari)
- PyPI da lerobot
- lerobot/svla_so100_pickplace ma'lumotlar to'plami (50 epizod, 19631 kadr, v3.0)
Sources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot/smolvla_base model card
- LeRobot docs: SmolVLA
- LeRobot docs: Compute HW Guide for LeRobot Training
- LeRobot docs: Installation
- LeRobot docs: LeRobotDataset v3.0 and the v2.1 converter
- LeRobot docs: Asynchronous Inference
- lerobot v0.6.1: configuration_smolvla.py
- lerobot v0.6.1: TrainPipelineConfig
- lerobot v0.6.1: CosineDecayWithWarmupSchedulerConfig
- lerobot v0.6.1: lerobot_rollout.py (strategies and RTC inference)
- lerobot v0.6.1: pyproject.toml (extras and console entry points)
- lerobot on PyPI
- lerobot/svla_so100_pickplace dataset (50 episodes, 19631 frames, v3.0)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started