
TinyVLA மற்றும் SmolVLA ஆகியவை 1 பில்லியன் அளவுருக்களுக்குக் குறைவான ஒரு செயல்படும் VLA-வை வழங்குகின்றன. இரு ஆய்வுக் கட்டுரைகளிலிருந்தும் உண்மையான எண்கள், LeRobot இயல்புநிலைகள், அளவிடப்பட்ட தாமதம் மற்றும் 24 GB கார்டில் ஒரு இயக்கம் எவ்வளவு செலவாகும் என்பது பற்றிய தகவல்கள்.
கிட்டத்தட்ட ஒவ்வொரு பார்வை-மொழி-செயல் மாதிரி பற்றி எழுதப்படும் கட்டுரைகள் ஒரு தரவு மைய அட்டையை (datacentre card) அடிப்படையாகக் கொண்டவை. OpenVLA 7 பில்லியன் அளவுருக்களைக் (parameters) கொண்டுள்ளது. GR00T N1.7 மற்றும் Pi0.5 சுமார் 3 பில்லியன் அளவுருக்களைக் கொண்டுள்ளன, மேலும் அவற்றைச் செம்மைப்படுத்த (fine-tune) ஒரு A100 80 GB தேவைப்படுகிறது. உங்கள் மேசையில் உள்ள அட்டை ஒரு 4090 ஆக இருந்தால், அந்த வகை மாதிரிகள் எட்டாத தூரத்தில் உள்ளன.
இரண்டு ஆய்வுக் கட்டுரைகள் இதற்குத் தேவையில்லை என்று வாதிடுகின்றன. TinyVLA (arXiv 2409.12514, பிப்ரவரி 2025 இல் IEEE Robotics and Automation Letters ஆல் ஏற்றுக்கொள்ளப்பட்டது) ஒரு 400 மில்லியன் முதல் 1.3 பில்லியன் வரையிலான பேக்போன் (backbone) மற்றும் ஒரு டிஃப்யூஷன் ஆக்ஷன் ஹெட் (diffusion action head) ஆகியவற்றிலிருந்து ஒரு VLA ஐ உருவாக்குகிறது. SmolVLA (arXiv 2506.01844, ஜூன் 2, 2025 அன்று சமர்ப்பிக்கப்பட்டது) 450 மில்லியன் அளவுருக்களைத் திறந்த எடைகள் (open weights), திறந்த தரவு (open data) மற்றும் ஒரு நுகர்வோர் அட்டையில் (consumer card) இயங்கும் ஒரு ஸ்கிரிப்ட் உடன் வழங்குகிறது. இரண்டும் அளவிட்டவை மற்றும் 1 பில்லியனுக்கும் குறைவான அளவுருக்கள் என்ற வாதம் எங்கு நிற்கிறது என்பது இங்கே.
நீங்கள் தெரிந்து கொள்ள வேண்டியவை
- •TinyVLA மூன்று அளவுகளில் வருகிறது: 422 மில்லியன் மொத்த அளவுருக்களுடன் 101 மில்லியன் பயிற்சி செய்யக்கூடியவை, 740 மில்லியன் மொத்த அளவுருக்களுடன் 138 மில்லியன் பயிற்சி செய்யக்கூடியவை, 1.3 பில்லியன் மொத்த அளவுருக்களுடன் 143 மில்லியன் பயிற்சி செய்யக்கூடியவை. முதல் இரண்டு மட்டுமே 1 பில்லியனுக்குக் கீழே உள்ளன.
- •அதன் அட்டவணை IV, ஒரு A6000 இல் TinyVLA-1B க்கு ஒரு செயல் கணிப்புக்கு 14 மில்லி விநாடிகள் என்றும், OpenVLA-7B க்கு 292 மில்லி விநாடிகள் என்றும், சுருக்கப்பட்ட OpenVLA-1B க்கு 140 மில்லி விநாடிகள் என்றும் அளவிடுகிறது.
- •அந்த வேகத்தை ஹெட் (head) தான் தக்கவைக்கிறது, பேக்போன் (backbone) அல்ல: TinyVLA-H இன் டிஃப்யூஷன் ஹெட்டை ஒரு ACT ஹெட்டுடன் மாற்றினால், ஐந்து உண்மையான ரோபோ பணிகள் 94.0 சராசரியில் இருந்து ஒற்றை இலக்கங்களுக்குக் குறைகின்றன. ஒரு MLP ஹெட் எல்லா இடங்களிலும் 0 மதிப்பெண் பெறுகிறது.
- •SmolVLA 450 மில்லியன் அளவுருக்களைக் கொண்டுள்ளது, அதில் சுமார் 100 மில்லியன் செயல் நிபுணர் (action expert), 481 சமூக LeRobot தரவுத்தொகுப்புகள் மற்றும் 10.6 மில்லியன் பிரேம்களில் முன்-பயிற்சி பெற்றது. இது LIBERO இல் 87.3 ஐப் பதிவு செய்கிறது, அதேசமயம் ரோபோடிக்ஸ்-முன்-பயிற்சி பெற்ற Pi0 3.3 பில்லியனில் 86.0 ஐப் பதிவு செய்கிறது, மேலும் மூன்று உண்மையான SO-100 பணிகளில் 78.3 ஐப் பதிவு செய்கிறது, அதேசமயம் Pi0 3.5 பில்லியனில் 61.7 ஐப் பதிவு செய்கிறது.
- •அந்த முன்-பயிற்சி இல்லாமல் ஒற்றைப் பணியில் பயிற்சி பெற்றால், SmolVLA அந்த பணிகளில் 40.0 ஆகக் குறைகிறது, இது ACT இன் 48.3 ஐ விடக் குறைவு. சிறியது தானாகவே எளிதானது அல்ல.
- •TinyVLA க்கு LeRobot ஒருங்கிணைப்பு இல்லை மற்றும் ஒரு CUDA 11.7 வீல் ஸ்டேக்கை (wheel stack) பயன்படுத்துகிறது. SmolVLA lerobot இல் உள்ளது மற்றும் இங்குள்ள 24 GB அடுக்கில் ஒரு ரன்னுக்கு தோராயமாக 1 முதல் 3 USD செலவாகும்.
உண்மையில் ஒரு சிறிய VLA என்று கருதப்படுவது எது
ஒரு மாதிரி அட்டையில் உள்ள அளவுரு எண்ணிக்கை ஒரு எண் அல்ல. இது மொத்த எடைகள், அனுமானத்தின் போது ஏற்றப்பட்ட எடைகள் அல்லது சாய்வுகளைப் பெறும் எடைகள் ஆகியவற்றைக் குறிக்கலாம். . TinyVLA இரண்டையும் தெரிவிக்கிறது, மேலும் இடைவெளி பெரியது: TinyVLA-H மொத்தம் 1.3 பில்லியன் ஆனால் 143 மில்லியன் பயிற்சி செய்யக்கூடியது, ஏனெனில் விஷன் டவர் மற்றும் பெரும்பாலான மொழி மாதிரி உறைந்திருக்கும், அதே நேரத்தில் LoRA அடாப்டர்கள் மற்றும் ஆக்ஷன் ஹெட் நகரும். இந்த ஆய்வுக் கட்டுரை பயிற்சி செய்யக்கூடிய பங்கை சுமார் 5 சதவீதமாகக் குறிப்பிடுகிறது.
| மாதிரி | அளவுருக்கள் | முதுகெலும்பு | செயல் தலைப்பு | ஆதாரம் |
|---|---|---|---|---|
| TinyVLA-S | 422 M total, 101 M trainable | Llava-Pythia ~400 M | Diffusion (droid_diffusion U-Net) | arXiv 2409.12514 |
| TinyVLA-B | 740 M total, 138 M trainable | Llava-Pythia ~700 M | Diffusion | arXiv 2409.12514 |
| TinyVLA-H | 1.3 B total, 143 M trainable | Llava-Pythia ~1.3 B | Diffusion | arXiv 2409.12514 |
| SmolVLA | 450 M, ~100 M action expert | SmolVLM2-500M-Video-Instruct | Flow matching expert | arXiv 2506.01844 |
| Octo-Small | 27 M | ViT-S scale, T5-Base text encoder | Diffusion | octo-small-1.5 card |
| ACT | ~80 M | ResNet, no language model | Direct chunk regression | AY-Robots catalog |
| OpenVLA | 7 B | Llama 2 7 B, DINOv2 and SigLIP encoders | Autoregressive action tokens | arXiv 2406.09246 |
இரண்டு வரிசைகள் விவாதிக்கத்தக்கவை. சுமார் 80 மில்லியனில் உள்ள ACT, இங்குள்ள மற்ற அனைத்தையும் விட சிறியது, ஆனால் அதற்கு மொழி மாதிரி இல்லை, எனவே இது ஒரு VLA அல்ல: இது ஒரு பணியைக் கற்றுக்கொள்கிறது மற்றும் மற்றொரு பணியைச் செய்யும்படி கூற முடியாது. 27 மில்லியனில் உள்ள Octo-Small, LLM முதுகெலும்பு அல்லாமல், T5-Base டெக்ஸ்ட் என்கோடர் மூலம் நிபந்தனைக்குட்படுத்தப்பட்டுள்ளது. நல்ல அடிப்படை மாதிரிகள், ஆனால் லேபிள் குறிப்பிடும் அறிவுறுத்தலைப் பின்பற்றுதலை இவை இரண்டும் வழங்குவதில்லை.
TinyVLA-H, தலைப்புச் செய்தியின் முடிவுகளைக் கொண்ட மாறுபாடு, 1.3 பில்லியன் மற்றும் கோட்டிற்கு மேலே உள்ளது. ஒரு மாதிரி பயிற்சியின் போது 24 GB இல் பொருந்தி, அனுமானத்தின் போது உங்கள் கட்டுப்பாட்டு விகிதத்தை அடைகிறதா என்பதே சிறந்த கேள்வி. நீங்கள் இங்கு பயிற்சி செய்யக்கூடிய ஐந்து கொள்கைகள் கொள்கைகள் பக்கத்தில் உள்ளன; மற்ற அனைவரின் எண்களுடன் அதன் எண்களையும் நீங்கள் விரும்பினால், TinyVLA ஒரு அரினா உள்ளீட்டைக் கொண்டுள்ளது.
TinyVLA: வேகம் தலையிலிருந்து வருகிறது, முதுகெலும்பிலிருந்து அல்ல
மொழி மாதிரியைச் சிறியதாக்கியதால் அது வேகமாகச் செயல்பட்டது என்பது வெளிப்படையான புரிதல். ஆனால் ஆய்வுக் கட்டுரையின் நீக்குதல் பகுப்பாய்வு வேறுவிதமாகக் கூறுகிறது. OpenVLA-வின் 7 B முதுகெலும்பை தோராயமாக 1 B முதுகெலும்புடன் மாற்றியபோது, ஒரு செயலுக்கான கணிப்பு 292 ms இலிருந்து 140 ms ஆகக் குறைந்தது, இது 2x ஆதாயம். TinyVLA-H, ஒப்பிடக்கூடிய அளவுரு எண்ணிக்கையுடன், அதே கார்டில் 14 ms இல் இயங்குகிறது. மற்ற 10x ஆதாயம் செயல் தலையிலிருந்து வருகிறது.
| மாடல் | ஒரு செயலுக்கான கணிப்பு | அளவிடப்பட்டது |
|---|---|---|
| OpenVLA-7B | 292 ms | single A6000 |
| OpenVLA-1B, backbone swapped for TinyVLA's | 140 ms | single A6000 |
| TinyVLA-1B (TinyVLA-H) | 14 ms | single A6000 |
OpenVLA, மொழி மாதிரி தலை வழியாக, ஒவ்வொரு செயல் பரிமாணத்திற்கும் ஒரு தனித்த டோக்கனாக, தானாகவே செயல்களை வெளியிடுகிறது. TinyVLA ஒரு டிஃப்யூஷன் டீகோடரை இணைக்கிறது, அது முழு தொகுதியையும் ஒரே நேரத்தில் உருவாக்குகிறது. அட்டவணை V, TinyVLA-H இன் கட்டமைப்பைக் கொண்டுள்ளது மற்றும் அதே ஐந்து உண்மையான ரோபோ பணிகளில் தலையை மட்டுமே மாற்றுகிறது. இது, ஃப்ளோ மேட்சிங் கொள்கைகள் உருவாக்குகின்றன என்பதற்கான மிகத் தெளிவான ஆதாரம், மற்றும் Pi0 டோக்கன் டீகோடிங்கிலிருந்து விலகிச் சென்றதற்கான காரணம்.
| TinyVLA-H இல் தலை | டென்னிஸ் வை | மக் புரட்டு | கியூப்களை அடுக்கவும் | அறையை மூடு | பெட்டியைத் திற |
|---|---|---|---|---|---|
| டிஃப்யூஷன் (droid_diffusion) | 90.0 | 98.3 | 98.3 | 96.7 | 86.7 |
| செயல் துண்டுபடுத்தும் டிரான்ஸ்ஃபார்மர் | 13.3 | 8.3 | 8.3 | 13.3 | 23.3 |
| பல அடுக்கு பெர்செப்ட்ரான் | 0 | 0 | 0 | 0 | 0 |
292 / 140 / 14 மில்லி வினாடி புள்ளிவிவரங்கள் அட்டவணை IV இல் உள்ளன, அனைத்தும் ஒரு A6000 இல். இவை ஒரு செயல் கணிப்பிற்கானவை மற்றும் கேமரா பிடிப்பு, முன் செயலாக்கம் மற்றும் சர்வோக்களுக்கு தொடர் எழுதுதல் ஆகியவற்றைத் தவிர்த்து. வெளியிடப்பட்ட தாமதத்தை ஒரு குறைந்தபட்ச வரம்பாகக் கருதுங்கள், ஒருபோதும் கட்டுப்பாட்டு விகிதமாக அல்ல. எங்கள் சொந்த எண்களும் அதே வரம்பைக் கொண்டுள்ளன: இன்ஃபரன்ஸ் லேட்டன்சியைப் பார்க்கவும்.
TinyVLA பெற்ற மதிப்பெண்
| பெஞ்ச்மார்க் | நெறிமுறை | TinyVLA-H | அடிப்படைத் தரவுகள் |
|---|---|---|---|
| மெட்டாவர்ல்ட், 50 பணிகள், சிம் | பல பணி, 50 டெமோக்கள், 3 சீட்கள் | சிரமத்தின் அடிப்படையில் 77.6 / 21.5 / 11.4 / 15.8, சராசரி 31.6 | டிஃப்யூஷன் பாலிசி சராசரி 10.5 |
| உண்மையான ஃபிராங்கா பாண்டா, 5 பணிகள் | ஒரு பணிக்கு 100 பாதைகள், 20 சோதனைகள் | 94.0 சராசரி | OpenVLA 68.3, டிஃப்யூஷன் பாலிசி 35.3 |
| இரு கைகள் கொண்ட UR5, 3 பணிகள் | பல பணி, ஒரு பணிக்கு 10 சோதனைகள் | 76.7 / 36.7 / 30.0 | OpenVLA 0 / 0 / 0, டிஃப்யூஷன் பாலிசி 40.3 / 31.3 / 43.0 |
இரு-கை வரிசைக்கு, ஆய்வுக் கட்டுரை ஒரு சலிப்பான விளக்கத்தை அளிக்கிறது: OpenVLA ஆனது Open X-Embodiment இல் முன்-பயிற்சி செய்யப்பட்டுள்ளது, இது முழுவதுமாக ஒற்றை-கை தரவுகளைக் கொண்டுள்ளது, எனவே இரு-கை செயல்வெளி விநியோகத்திற்கு வெளியே உள்ளது மற்றும் அது பூஜ்ஜிய மதிப்பெண் பெறுகிறது. டிஃப்யூஷன் பாலிசி பேஸ்லைன் அந்த மூன்று பணிகளில் இரண்டில் TinyVLA-H ஐ வெல்கிறது. பின்னணி விவரங்கள் Open X-Embodiment விளக்கக் கட்டுரையில்.

TinyVLA களஞ்சியம், ஆகஸ்ட் 2026 நிலவரப்படி
ஆய்வுக் கட்டுரை நன்றாக உள்ளது. குறியீடு ஒரு ஆராய்ச்சி வெளியீடு. களஞ்சியம் github.com/liyaxuanliyaxuan/TinyVLA; அதன் README குறியீடு வெளியீட்டை 17 பிப்ரவரி 2025 என்றும் கடைசி கமிட் 11 மார்ச் 2025 என்றும் குறிப்பிடுகிறது. ஒரு ஆய்வுக் கட்டுரையை மீண்டும் உருவாக்க இது நன்றாக இருக்கும், ஆனால் பராமரிக்கப்படும் ஒரு நூலகத்தை நீங்கள் விரும்பினால் இது ஒரு சிக்கலாகும்.
git clone https://github.com/liyaxuanliyaxuan/TinyVLA
conda create -n tinyvla python=3.10 -y
conda activate tinyvla
pip install --upgrade pip
pip install -r requirements.txt
cd policy_heads && pip install -e .
cd ../llava-pythia && pip install -e .requirements.txt ஆனது torch==2.0.1, transformers==4.37.1, deepspeed==0.9.5, peft==0.4.0, diffusers==0.11.1, numpy==1.24.4 மற்றும் CUDA ஸ்டேக்கை 11.x வீல்களுக்குப் பயன்படுத்துகிறது: nvidia-cuda-runtime-cu11==11.7.99, nvidia-cudnn-cu11==8.5.0.96, triton==2.0.0. README ஆனது Python 3.10 ஐக் கேட்கிறது; lerobot 0.6.1 ஆனது 3.12 அல்லது அதற்குப் புதிய பதிப்பைக் கோருகிறது, எனவே இரண்டும் ஒரு சூழலைப் பகிர முடியாது. உங்கள் GPU தலைமுறைக்கு ஒரு torch 2.0.1 உருவாக்கம் உள்ளதா என்பதை முதலில் உறுதிப்படுத்தவும். ஒருவேளை VRAM இல் ஒரு செயல்பாடு நின்றுவிட்டால், நினைவகப் பற்றாக்குறை சரிபார்ப்புப் பட்டியல் யூகிப்பதை விட வேகமாக இருக்கும்.
TinyVLA ஆனது வாசிப்பதில்லை LeRobot தரவுத்தொகுப்புகள். அதன் வடிவம் ACT-பாணி HDF5: செயல், language_raw, மற்றும் பல-பார்வை படங்கள், joint_positions, qpos மற்றும் qvel கொண்ட ஒரு அவதானிப்புக் குழு. களஞ்சியம் RLDS உள்ளீட்டிற்காக data_utils/rlds_to_h5py.py ஐ வழங்குகிறது, மேலும் ஒவ்வொரு பணியும் aloha_scripts/constants.py இல் அதன் dataset_dir, episode_len மற்றும் camera_names உடன் கையால் பதிவு செய்யப்படுகிறது. உங்கள் எபிசோடுகள் lerobot இலிருந்து அல்லது டெஸ்க்டாப் கிளையன்ட் இலிருந்து வந்திருந்தால், மாற்றத்தை நீங்கள் தான் செய்ய வேண்டும்.
# scripts/train.sh, the real flags from the repository
ACTION_HEAD=droid_diffusion
deepspeed --master_port 29600 --num_gpus=8 --num_nodes=1 ./train_tinyvla.py \
--deepspeed scripts/zero2.json \
--lora_enable True \
--lora_module 'vit llm' \
--lora_r 64 \
--lora_alpha 256 \
--non_lora_lr 2e-5 \
--task_name "example_task_config" \
--model_name_or_path /path/to/pretrained_vlm \
--freeze_vision_tower True \
--freeze_backbone True \
--bf16 True \
--max_steps 10000 \
--per_device_train_batch_size 32 \
--gradient_accumulation_steps 1 \
--learning_rate 2e-4 \
--lr_scheduler_type "cosine" \
--warmup_ratio 0.005 \
--save_steps 1000 \
--action_head_type $ACTION_HEAD \
--use_state True \
--window_size 6- --num_gpus=8 என்பது எட்டு கார்டு நோடை (node) குறிக்கிறது. இதை 1 ஆக அமைத்து, பேட்ச் அளவை 32க்குக் கீழே குறைக்கவும். ஒற்றை-GPU மாறுபாடு (variant) அப்ஸ்ட்ரீமில் அனுப்பப்படவில்லை, எனவே இந்த கட்டளையை 4090 இல் அப்படியே இயக்க முடியாது.
- --deepspeed scripts/zero2.json என்பது மேல்-நிலை ஸ்கிரிப்ட்ஸ் கோப்பகத்தில் இல்லாத ஒரு கோப்பைக் குறிக்கிறது. DeepSpeed உள்ளமைவுகள் llava-pythia/scripts/zero2.json இல் அனுப்பப்படுகின்றன. உங்கள் முதல் இயக்கத்திற்கு முன் பாதையைச் சரிசெய்யவும்.
- README ஆனது வெளியீட்டு கோப்பகத்தின் பெயரில் llava_pythia ஐக் கொண்டிருக்க வேண்டும், மேலும் LoRA இயக்கப்பட்டிருந்தால் lora ஐயும் கொண்டிருக்க வேண்டும்.
- பேக்போன் ஒரு தனி பதிவிறக்கம்: lesjie/Llava-Pythia-400M, -700M அல்லது -1.3B. lerobot/smolvla_base ஐ நீங்கள் சுட்டிக்காட்டுவது போல, ஒரு கொள்கையை சுட்டிக்காட்ட ஒரு ஒற்றை அடிப்படை செக்பாயிண்ட் (checkpoint) இல்லை.
SmolVLA: இன்று மதியம் நீங்கள் இயக்கக்கூடிய 1 பில்லியனுக்கும் குறைவான மாதிரி
SmolVLA ஒரு பராமரிக்கப்படும் நூலகத்திற்குள் அதே வாதத்தை முன்வைக்கிறது. இது SmolVLM2-500M-Video-Instruct பேக்போனில் 450 M அளவுருக்களைக் கொண்டுள்ளது, மேலும் அதன் செயல்திறன் சிறியதாக இருப்பதற்கான கூற்றிலிருந்து வருவதை விட, configuration_smolvla.py இலிருந்து நீங்கள் படிக்கக்கூடிய அமைப்புகளிலிருந்து வருகிறது.
| configuration_smolvla.py இல் உள்ள அமைப்பு | இயல்புநிலை | அதன் பயன் |
|---|---|---|
| num_vlm_layers | 16 | முதல் 16 மொழி மாதிரி அடுக்குகளை மட்டுமே இயக்குகிறது |
| expert_width_multiplier | 0.75 | செயல் நிபுணரின் மறைக்கப்பட்ட அளவு VLM இன் 75 சதவீதம் |
| self_attn_every_n_layers | 2 | சுய-கவனம் குறுக்கு-கவனத்துடன் மாறி மாறி செயல்படுகிறது |
| chunk_size / n_action_steps | 50 / 50 | ஒரு பாஸ் 50 செயல்களை வெளியிடுகிறது, மேலும் அனைத்து 50 செயல்களும் செயல்படுத்தப்படுகின்றன |
| num_steps | 10 | ஃப்ளோ மேட்சிங் டினாய்சிங் 10 படிகளில் சரிசெய்யப்பட்டுள்ளது |
| tokenizer_max_length | 48 | அறிவுறுத்தல் 48 டோக்கன்களாகக் குறைக்கப்படும் |
| freeze_vision_encoder / train_expert_only | True / True | ஃபைன்-ட்யூனிங் நிபுணரை நகர்த்துகிறது, விஷன் டவரை அல்ல |
| optimizer_lr, warmup, decay | 1e-4, 1000 steps, to 2.5e-6 over 30000 | இது ஆய்வுக் கட்டுரையின் செய்முறை அல்ல: அதன் முன்-பயிற்சி 200000 படிகளில் 100-படி வார்ம்அப்பைப் பயன்படுத்தியது |
முன்பயிற்சியானது 481 சமூக LeRobot தரவுத்தொகுப்புகள், 22.9 K எபிசோடுகள் மற்றும் 10.6 M பிரேம்களை 4 GPU-களில், 200000 படிகளில் 256 உலகளாவிய தொகுப்பில் பயன்படுத்தியது; இந்த ஆய்வு முழு திட்டத்தையும் சுமார் 30 K GPU மணிநேரம் என மதிப்பிடுகிறது. கவனிக்க வேண்டிய ஒரு எண்: Hugging Face வெளியீட்டு வலைப்பதிவு 487 தொகுக்கப்பட்ட தரவுத்தொகுப்புகளைக் குறிப்பிடுகிறது, அதேசமயம் ஆய்வுக் கட்டுரையின் அட்டவணை 481 என்று கூறுகிறது. நாங்கள் ஆய்வுக் கட்டுரையின் எண்ணிக்கையைப் பயன்படுத்துகிறோம் மற்றும் இந்த முரண்பாட்டைப் பதிவு செய்கிறோம்.

| அளவுகோல் | SmolVLA 0.45 B | SmolVLA 2.25 B | Pi0 | ACT |
|---|---|---|---|---|
| LIBERO சராசரி, பல-பணி | 87.3 | 88.75 | 86.0 (3.3 B, robotics-pretrained) | - |
| Meta-World சராசரி, பல-பணி | 57.3 | 68.24 | 47.9 (3.5 B, robotics-pretrained) | - |
| உண்மையான SO-100, 3 பணிகள், பல-பணி பயிற்சி | 78.3 | - | 61.7 (3.5 B) | - |
| உண்மையான SO-100, 3 பணிகள், ஒற்றை-பணி, ரோபோடிக்ஸ் முன்பயிற்சி இல்லை | 40.0 | - | - | 48.3 |
| SO-101 லெகோ எடுத்து வைக்கும் பணி, ஒற்றை-பணி, விநியோகத்தில் | 90 | - | - | 70 |
| SO-101 லெகோ எடுத்து வைக்கும் பணி, ஒற்றை-பணி, விநியோகத்திற்கு வெளியே | 50 | - | - | 40 |
LIBERO ஒரு உருவகப்படுத்துதல் ஆகும், மேலும் அங்குள்ள அனைத்து திறமையான மதிப்பெண்களும் இப்போது எண்பதுகளில் உள்ளன. உண்மையான SO-100 வரிசை, அங்கு ஒரு 450 M மாதிரி 3.5 B மாதிரியை 16.6 புள்ளிகள் வித்தியாசத்தில் தோற்கடிக்கிறது, இது சுவாரஸ்யமானது; அதற்கு கீழே உள்ள வரிசை எதிர் எடை. சமூக முன்பயிற்சி மற்றும் பல-பணி பயிற்சியை நீக்கினால், அதே மாதிரி ACT-க்கு கீழ் 40.0 ஆக குறைகிறது. ஒரு சிறிய மாதிரி தானாகவே மோசமானது அல்ல, அது சிறந்தது என்பதல்ல என்பதே பாதுகாக்கக்கூடிய கூற்று.
ஒரு தற்செயல் நிகழ்வு உதவுகிறது: SmolVLA கட்டுரையின் Meta-World அட்டவணை TinyVLA இன் வெளியிடப்பட்ட எண்களை ஒரு அடிப்படையாகக் கொண்டுள்ளது, எனவே ஒருமுறை இரு மாடல்களும் ஒரே அட்டவணையில் உள்ளன, SmolVLA-0.45B 57.3 ஆகவும் TinyVLA-H 31.6 ஆகவும் உள்ளன. இது SmolVLA பயிற்சி Pi0 ஐ விட சுமார் 40 சதவீதம் வேகமாக 6 மடங்கு குறைவான நினைவகத்தில் நடப்பதாகவும் தெரிவிக்கிறது. இவை அனைத்தும் SmolVLA ஆசிரியர்களிடமிருந்து வந்தவை; அரங்க நுழைவு ஒவ்வொரு மதிப்பையும் அதன் மூலத்துடன் இணைக்கிறது.
SmolVLA அதன் நேரத்தை எங்கு செலவிடுகிறது
AY-Robots SmolVLA ஐ ஒரு செயல் படிக்கு 245 ms ஆகவும் ACT 20 ms ஆகவும் கொள்கை பட்டியல் இல் பட்டியலிடுகிறது. TinyVLA ஒரு செயல் கணிப்புக்கு 14 ms ஐப் புகாரளிக்கிறது. இந்த எண்கள் ஒப்பிட முடியாதவை, அவற்றை ஒப்பிடக்கூடியவை என்று கருதுவது இந்த தலைப்பில் மிகவும் பொதுவான தவறு: சில ஒரு முன்னோக்கி செல்லும் நேரத்தை, சில அந்த நேரத்தை ஒரு துண்டில் பிரித்து செயல் துண்டாக்கம் அதை ஈடுசெய்கிறது.
- SmolVLA ஒரு முன்னோக்கி செல்லும் போது 50 செயல்களை வெளியிடுகிறது மற்றும் அனைத்து 50 செயல்களையும் செயல்படுத்துகிறது. உண்மையான ரோபோக்களில் கட்டுரை பயன்படுத்தும் 30 fps இல், ஒரு அனுமானம் சுமார் 1.7 வினாடிகள் இயக்கத்தை உள்ளடக்கியது.
- ஒத்திசைவற்ற அனுமானம் தற்போதைய துண்டு இன்னும் செயல்படும் போது அடுத்த துண்டைக் கணக்கிடுகிறது: 13.75 வினாடிகள் ஒத்திசைவானதற்கு எதிராக சராசரியாக 9.7 வினாடிகள் பணி நிறைவு, தோராயமாக 30 சதவீதம் வேகமாக, மற்றும் ஒரு நிலையான 60 வினாடி சாளரத்தில் 9 க்கு எதிராக 19 பிக்-அண்ட்-பிளேஸ் சுழற்சிகள்.
- வெற்றி விகிதங்கள் சிறப்பாக இருப்பதை விட ஒப்பிடக்கூடியதாக இருந்தன, 73.3 ஒத்திசைவற்றதற்கு எதிராக 78.3 ஒத்திசைவானது. ஒத்திசைவற்றது செயல்திறனை வாங்குகிறது, துல்லியத்தை அல்ல.
- துண்டாக்கம் கணக்கீட்டு தாமதத்தை மறைக்கிறது, நெட்வொர்க் தாமதத்தை அல்ல, மேலும் இது கொள்கையை குறைவான எதிர்வினையாற்றுகிறது, ஏனெனில் இது 50 செயல்களுக்கு உறுதியளிக்கிறது.
AY-Robots ஆனது உங்கள் கொள்கைக்கு சேவை செய்யும் ஒரு கிளவுட் GPU பாட்-ஐ தானாகவே வழங்க முடியும், உள்ளூர் ரோபோ கிளையன்ட் அந்த எண்ட்பாயிண்டுடன் பேசும்போது, மேலும் அந்த பாட் ஒரு செயலற்ற வாட்ச்டாக்-ஐக் கொண்டிருப்பதால், அது அமைதியாக பில் செய்வதை விட தன்னைத்தானே அழித்துக் கொள்கிறது. அது செய்யாதது என்னவென்றால், பொது இணைய ரவுண்ட் ட்ரிப்-ஐ நீக்குவதுதான். இங்குள்ள ஐந்து கொள்கைகளுக்கான கட்டுப்பாட்டு சுழற்சி, எந்த நெட்வொர்க்கும் இல்லாமல், ஒரு செயல் படிக்கு 20 முதல் 485 மில்லி விநாடிகள் ஆகும், எனவே, ரிமோட் இன்ஃபரன்ஸ் மெதுவான பிக்-அண்ட்-பிளேஸ்-க்கு சாத்தியமானது, வேகமான எதிர்வினை இயக்கத்திற்கு அல்ல.

ஒரு நுகர்வோர் கார்டில் SmolVLA-ஐ ஃபைன்-ட்யூன் செய்தல்
கையேடு வழி, lerobot 0.6.1 இல், 23 ஆகஸ்ட் 2026 நிலவரப்படி தற்போதைய PyPI வெளியீடு. கீழே உள்ள அனைத்தும் அதே நாளில் பெறப்பட்ட Hugging Face lerobot SmolVLA ஆவணத்திலிருந்து வந்தவை; வழிகாட்டப்பட்ட பதிப்பு மிகவும் எளிமையானது.
- 1smolvla கூடுதல் அம்சத்துடன் lerobot ஐ நிறுவவும்
SmolVLA சார்புகள் ஒரு விருப்பமான கூடுதல், அடிப்படை நிறுவலில் ஒரு பகுதி அல்ல. அதை நிறுவாமல், கொள்கை வகை ஏன் தெரியவில்லை என்று ஆச்சரியப்படுவது பொதுவாக அரை மணிநேரத்தை வீணடிக்கும்.
bashgit clone https://github.com/huggingface/lerobot.git cd lerobot pip install -e ".[smolvla]" - 2போதுமான எபிசோட்களுடன் ஒரு தரவுத்தொகுப்பைப் பெறுங்கள்
ஆவணங்கள் சுமார் 50 எபிசோட்களைப் பரிந்துரைக்கின்றன, மேலும் 25 எபிசோட்களுடன் அதே பணி போதுமானதாக இல்லை என்று கூறுகின்றன. AY-Robots குறைந்தபட்சம் 30 ஆக நிர்ணயிக்கிறது. உங்களுடையதை பதிவு செய்யவும், அல்லது தரவுத்தொகுப்பு அடைவிலிருந்து தொடங்கவும்.
bash# any LeRobotDataset on the Hub works as --dataset.repo_id # lerobot/svla_so100_pickplace is the paper's own 50-episode set: # 5 cube positions, 10 episodes each - 3நுண்ணிய சரிசெய்தலைத் தொடங்கவும்
lerobot வழிகாட்டியிலிருந்து வரும் கட்டளை, மாற்றப்படாதது. ஆவணங்கள் 20000 படிகளை ஒரு A100 இல் தோராயமாக 4 மணிநேரம் என்று குறிப்பிடுகின்றன. ஒரு 24 GB கார்டில், அதிக நேரம் ஆகும் என்று எதிர்பார்க்கலாம் மற்றும் அதை அளவிடவும்.
bashcd lerobot && lerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/mydataset \ --batch_size=64 \ --steps=20000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --wandb.enable=true - 4பொருந்தும் வரை தொகுதி அளவைக் குறைக்கவும்
batch_size=64 என்பது ஆவணப்படுத்தப்பட்ட ஒரு எடுத்துக்காட்டு, உங்கள் கார்டைப் பற்றிய வாக்குறுதி அல்ல. ஆவணங்கள் சிறியதாகத் தொடங்கி, ஏற்றுதல் நேரம் குறைவாக இருக்கும் வரை அதிகரிக்க அறிவுறுத்துகின்றன.
bashlerobot-train --help - 5சரிபார்ப்புப் புள்ளியை கையில் பயன்படுத்தவும்
அதே நூலகம், ஒரு கட்டளை. நிகழ்நேர துண்டாக்குதல் கொடிகள் ஆவணங்களில் கருத்துத் தெரிவிக்கப்பட்டுள்ளன, மேலும் அவை குறைந்த சக்தி வன்பொருளில் பயன்படுத்தப்பட வேண்டியவை.
bashlerobot-rollout \ --strategy.type=base \ --robot.type=so101_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_blue_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 8, width: 640, height: 480, fps: 30}}" \ --task="Grasp a lego block and put it in the bin." \ --policy.path=HF_USER/FINETUNE_MODEL_NAME
நீங்கள் எந்தப் பாதையை எடுத்தாலும், ஒரு சரிபார்ப்புப் புள்ளி மற்றும் அதை உருவாக்கிய உள்ளமைவுடன் முடிவடையும். தரவுத்தொகுப்பு திருத்தம், படி எண்ணிக்கை மற்றும் விதையை அதனுடன் வைத்திருங்கள். lerobot இயல்பாக விதை 1000 ஐப் பயன்படுத்துகிறது; GR00T இன் நுண்ணிய சரிசெய்தல் நுழைவுப் புள்ளி எந்த விதையையும் வெளிப்படுத்தவில்லை, எனவே அந்த இயக்கங்கள் பிட்-க்கு-பிட் மீண்டும் உருவாக்க முடியாதவை. பயிற்சி ஆவணங்களில் உள்ள இயக்கவியல்.
ஒரு சிறிய VLA ஐ ஒரு கையில் பெறுவதற்கான இரண்டு வழிகள்
நீங்கள் இயந்திரத்தையும் தோல்வி முறைகளையும் சொந்தமாக வைத்திருக்கிறீர்கள். SmolVLA க்கு அது நியாயமானது: ஒரு pip கூடுதல், ஒரு பயிற்சி கட்டளை, ஒரு வெளியீட்டு கட்டளை. TinyVLA க்கு இது உறைந்த பின்கள், உடைந்த DeepSpeed பாதை மற்றும் நீங்கள் சொந்தமாக எழுதும் தரவு மாற்றம் கொண்ட ஒரு ஆராய்ச்சி மறுஉருவாக்கம் ஆகும்.
- ஒரு 24 GB கார்டைப் பெறுங்கள், 30 முதல் 50 எபிசோட்களைப் பதிவு செய்யுங்கள், கேமரா ஸ்ட்ரீம்களை பிரேம் பை பிரேமாக சரிபார்க்கவும்.
- pip install -e ".[smolvla]", lerobot/smolvla_base க்கு எதிராக lerobot-train ஐ இயக்கவும், பின்னர் சரிபார்ப்புப் புள்ளியை கை இணைக்கப்பட்டுள்ள இயந்திரத்தில் வழங்கவும்.
- TinyVLA க்கு: தனி conda env, தரவை HDF5 ஆக மாற்றவும், constants.py இல் பணியைப் பதிவு செய்யவும், zero2.json பாதையை சரிசெய்யவும், train.sh ஐ எட்டு GPU களில் இருந்து ஒன்றாகக் குறைக்கவும்.
- கார்டுக்கு பணம் செலுத்தியவுடன் ஒரு மணிநேர கட்டணம் இல்லை.
- ஊகித்தல் சர்வோக்களுக்கு அடுத்ததாக அமர்ந்திருக்கிறது, இது ஒரு வேகமான கட்டுப்பாட்டு சுழற்சியைப் பெறுவதற்கான ஒரே வழி.
- நீங்கள் கொள்கை குறியீட்டை சரிசெய்யலாம், மேலும் TinyVLA இந்த வழியில் மட்டுமே கிடைக்கும்.
- ஒரு 4090 ஒவ்வொரு ~3 B கொள்கையையும் நிராகரிக்கிறது, எனவே GR00T N1.7 அல்லது Pi0.5 க்கு எதிராக உள்ளூர் ஒப்பீடு இல்லை.
- சூழல் அமைவுதான் உண்மையான வேலை. TinyVLA இன் பின்கள் மட்டுமே ஒரு நாளைக்கு செலவாகும்.
- வரிசை இல்லை, மீண்டும் முயற்சி இல்லை, சரிபார்ப்புப் புள்ளி சேமிப்பு இல்லை. படி 14000 இல் ஒரு மறுதொடக்கம் மீண்டும் தொடங்குவதைக் குறிக்கிறது.
SmolVLA இங்குள்ள ஐந்து கொள்கைகளில் ஒன்றாகும். நீங்கள் ஒரு படிவத்தில் மாதிரி மற்றும் தரவுத்தொகுப்பைத் தேர்வு செய்கிறீர்கள், பின்தளம் தேவையான VRAM மூலம் ஒரு GPU ஐ வாடகைக்கு எடுத்து, பயிற்சியாளரை இயக்கி, சரிபார்ப்புப் புள்ளிகளை பொருள் சேமிப்பகத்தில் எழுதுகிறது. படிப்படியாக: SO-100 இல் SmolVLA, அல்லது முழு மேட்ரிக்ஸ் பயிற்சிப் பக்கத்தில்.
| SmolVLA க்காக தளம் அனுப்புவது | மதிப்பு |
|---|---|
| தொகுதி அளவு | 2 |
| கற்றல் விகிதம் | 1e-4 |
| அதிகபட்ச படிகள் | 20000 |
| கிரேடியன்ட் குவிப்பு | 8, and it does not reach the trainer |
| படிவத்தில் கூடுதல் கட்டுப்பாடுகள் | seed, logFreq |
| GPU அடுக்கு | RTX 4090 or any 24 GB card |
| தரவுத்தொகுப்பு வடிவம் | LeRobot v3.0 |
| குறைந்தபட்ச எபிசோட்கள் | 30 |
முதலில், இங்குள்ள இயல்புநிலை தொகுதி அளவு 2, lerobot ஆவண எடுத்துக்காட்டில் உள்ள 64 அல்ல, மேலும் கிரேடியன்ட் குவிப்பு அமைப்பு அனுப்பப்பட்டாலும் SmolVLA க்கு எந்த விளைவையும் ஏற்படுத்தாது, எனவே பயனுள்ள தொகுதி உண்மையில் 2 ஆகும். இயல்புநிலை மேல்நிலைக்குப் பொருந்துவதாகக் கருதுவதற்குப் பதிலாக வேண்டுமென்றே அதை உயர்த்தவும். இரண்டாவதாக, TinyVLA இங்கு பயிற்சி செய்ய முடியாதது.
24 GB அடுக்கில் ஒரு இயக்கம் ஒரு மணிநேரத்திற்கு 0.30 முதல் 0.60 USD வரை 2 முதல் 5 மணிநேரம் ஆகும், தோராயமாக 1 முதல் 3 USD. A100 அடுக்கில் ஒரு ~3 B கொள்கை ஒரு மணிநேரத்திற்கு 1.20 முதல் 2.00 USD வரை 3 முதல் 6 மணிநேரம் ஆகும், தோராயமாக 4 முதல் 12 USD. விலை நிர்ணயம் மற்றும் CLI மற்றும் MCP சர்வரில் இருந்து அதே செயல்பாடுகளைப் பார்க்கவும்.
ஒரு சிறிய மாதிரி தவறான தேர்வாக இருக்கும்போது
இரண்டு ஆய்வுக் கட்டுரைகளும் சுருக்கங்களை விட இங்கு மிகவும் கவனமாக உள்ளன. TinyVLA இன் தோல்வி பகுப்பாய்வு குறிப்பிட்டது: 0.4 B மாறுபாடு அறிவுறுத்தலை தவறாகப் படித்ததால் மூன்று முறை தோல்வியடைந்தது, இதை ஆசிரியர்கள் சிறிய VLM இல் உள்ள வரையறுக்கப்பட்ட மொழி புரிதலுக்குக் காரணம் கூறுகின்றனர், மேலும் அந்த முறை 1.3 B இல் மறைந்துவிட்டது. SmolVLA அதே வளைவை மறுமுனையில் இருந்து காட்டுகிறது: ஒரே மாதிரியான கட்டமைப்பின் 2.25 B பதிப்பு LIBERO இல் 88.75 மற்றும் Meta-World இல் 68.24 மதிப்பெண்களைப் பெறுகிறது, அதேசமயம் 0.45 B மாதிரிக்கு 87.3 மற்றும் 57.3.
- 24 GB கார்டில் பொருந்துகிறது, இது ஒரு சோதனையின் செலவை பல டாலர்களில் இருந்து ஒரு சில டாலர்களாகக் குறைக்கிறது.
- கையின் அருகில் இயங்கும் அளவுக்கு வேகமாக உள்ளது, எனவே கட்டுப்பாட்டு சுழற்சியில் நெட்வொர்க் ஹாப் இல்லை.
- ஒரு நபரால் பதிவு செய்யக்கூடிய தரவுகளில் நன்றாக சரிசெய்யப்படுகிறது, ஆயிரக்கணக்கான அத்தியாயங்களுக்குப் பதிலாக பத்துப் பன்னிரண்டு அத்தியாயங்கள்.
- SmolVLA இன் எடைகள், தரவுப் பட்டியல் மற்றும் குறியீடு பொதுவில் உள்ளன, எனவே ஒரு மோசமான முடிவை பிழைத்திருத்த முடியும்.
- பலவீனமான அறிவுறுத்தல் பின்பற்றுதல்: குறைவான மொழி அளவுருக்கள், ஒத்த குறிப்பு வெளிப்பாடுகளைப் பிரித்தறியும் திறன் குறைவு.
- நீங்கள் பதிவு செய்யாத அமைப்புகளுக்கு குறைவான இடஞ்சார்ந்த மற்றும் காட்சி பொதுமைப்படுத்தல்.
- தரவுத்தொகுப்பு குறைபாடுகளுக்கு அதிக உணர்திறன், நம்புவதற்கு குறைவான முன் பயிற்சி.
- பல-பணி மற்றும் நீண்ட-கால வேலைகள் இன்னும் பெரிய மாதிரிகளுக்கு ஆதரவாக உள்ளன, இதில் SmolVLA இன் சொந்த 2.25 B மாறுபாடும் அடங்கும்.
இயக்கப்பட வேண்டிய ஒப்பீடு TinyVLA க்கு எதிராக SmolVLA அல்ல. இது SmolVLA க்கு எதிராக ACT உங்கள் சொந்த பணியில், மற்றும் SmolVLA கட்டுரை அதற்கான காரணம். ரோபோடிக்ஸ் முன் பயிற்சி இல்லாமல் ஒற்றை-பணியில் பயிற்சி பெற்ற SmolVLA, மூன்று SO-100 பணிகளில் சராசரியாக 40.0 மதிப்பெண் பெற்றது, அங்கு ஒற்றை-பணி ACT 48.3 ஐ நிர்வகித்தது. அதை 78.3 ஆக உயர்த்துவது சமூக முன் பயிற்சி மற்றும் பல-பணி பயிற்சி, கட்டிடக்கலை மட்டும் அல்ல. SO-101 லெகோ பணியில், இரண்டுமே ஒற்றை-பணி, SmolVLA வெற்றி பெறுகிறது: விநியோகத்தில் 70 க்கு எதிராக 90. பின்னர் SmolVLA க்கு எதிராக Pi0.5 பட்ஜெட் அனுமதித்தால்.
மோசமான தரவுகளை ஈடுசெய்ய குறைவான முன் பயிற்சி உள்ளது, எனவே குறைபாடுள்ள தரவுத்தொகுப்பில் ஒரு தெளிவான இழப்பு வளைவு, குறைபாட்டை நம்பிக்கையுடன் மீண்டும் உருவாக்கும் ஒரு கொள்கையை உங்களுக்கு வழங்குகிறது. lerobot ஆவணங்கள் அமைப்பு பற்றி வெளிப்படையாக உள்ளன: 5 கியூப் நிலைகளில் 50 எபிசோடுகள், ஒரு நிலைக்கு 10, வேலை செய்தது; 25 வேலை செய்யவில்லை. இழப்பு சரியாகத் தெரிந்தால் மற்றும் கை எதுவும் பயனுள்ளதாக செய்யவில்லை என்றால், இழப்பு குறைகிறது, கொள்கை எதுவும் செய்யவில்லை, கொள்கை ஒரு அமைப்பில் மட்டுமே வேலை செய்கிறது அல்லது உண்மையில் பயன்படுத்தக்கூடிய உயர்தர VLA பயிற்சித் தரவைச் சேகரித்தல் என்பதில் இருந்து தொடங்கவும்.
ஐந்து கொள்கைகள், ஒரு ஒப்பீட்டு அட்டவணை
GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA மற்றும் ACT ஆகியவை உண்மையான அளவுரு எண்ணிக்கைகள், ஒரு செயல் படிக்கு ஊகிக்கும் தாமதம், ஒவ்வொன்றிற்கும் தேவையான GPU அடுக்கு மற்றும் பயனுள்ள எதையும் செய்வதற்கு முன் குறைந்தபட்ச எபிசோட் எண்ணிக்கை ஆகியவற்றுடன்.
கொள்கைகளை ஒப்பிடுகநீங்கள் செயல்படக்கூடிய ஒரு முடிவெடுக்கும் அட்டவணை
| உங்கள் நிலைமை | இதனுடன் தொடங்கவும் | ஏன் |
|---|---|---|
| ஒரு பணி, நல்ல விளக்கங்கள், மொழி இல்லை | ACT | ~80 M, 20 ms, 24 GB கார்டு, பதிவிறக்க அடிப்படை மாதிரி இல்லை |
| சில தொடர்புடைய பணிகள், ஒவ்வொன்றிற்கும் ஒரு அறிவுறுத்தல் | SmolVLA | 450 M, lerobot இல், குறைந்தபட்சம் 30 எபிசோடுகள், ஒரு ஓட்டத்திற்கு 1 முதல் 3 USD |
| குறிப்பாக TinyVLA முடிவை மீண்டும் உருவாக்குதல் | TinyVLA-B அல்லது TinyVLA-H | ரெப்போ மட்டுமே வழி: தனிமைப்படுத்தப்பட்ட சூழல், மாற்றப்பட்ட தரவு |
| பல பணிகள், மாறுபட்ட அறிவுறுத்தல்கள், A100 பட்ஜெட் | GR00T N1.7 அல்லது Pi0.5 | ~3 B, ஒரு படிக்கு 152 ms மற்றும் 485 ms, ஒரு ஓட்டத்திற்கு 4 முதல் 12 USD |
| இன்னும் ரோபோ இல்லை | ஒரு உண்மையான கையை இயக்கவும் | வரிசை அடிப்படையிலான நேரடி கைக்கு பதிவு மற்றும் வன்பொருள் தேவையில்லை |
கடைசி வரிசைக்கு, நேரடி கை கணக்கு இல்லாமல் உலாவியில் இருந்து இயக்கக்கூடிய ஒரு SO-100 ஐ நேரடியாக ஒளிபரப்புகிறது, மேலும் தொடங்குவதற்கான மூன்று வழிகள் மீதமுள்ளவற்றை உள்ளடக்கியது. SO-100 இங்குள்ள குறிப்பு கை ஆகும், பாகங்களில் தோராயமாக 110 முதல் 150 யூரோக்கள் ஆகும், அதனுடன் ஒரு முழுமையான அமைவு வழிகாட்டி.
1 பில்லியனுக்கும் குறைவான மாடல்களுக்குப் பிறகு வருவது என்ன?
பாராமீட்டர் எண்ணிக்கையைக் குறைப்பது VLA ஐ மலிவாக மாற்றுவதற்கான ஒரு வழி, ஆனால் இது வெளிப்படையாக வெற்றி பெறும் வழி அல்ல. OpenVLA-OFT (arXiv 2502.19645) 7 B பேக்போனை வைத்துக்கொண்டு, செயல்கள் எவ்வாறு டிகோட் செய்யப்படுகின்றன என்பதை மட்டுமே மாற்றுகிறது, இது செயல் உருவாக்கும் செயல்திறனில் 26 மடங்கு அதிகரிப்பையும், LIBERO 76.5 சதவீதத்திலிருந்து 97.1 சதவீதமாக உயர்வதையும் தெரிவிக்கிறது. BitVLA (arXiv 2506.07530) ஒரு 1-பிட் BitNet b1.58 2B4T பேக்போனின் ஒவ்வொரு எடையையும் மும்மடங்காக மாற்றுகிறது, இது 11.0 மடங்கு குறைவான நினைவகத்தையும் 4.4 மடங்கு குறைவான எண்ட்-டு-எண்ட் தாமதத்தையும் தெரிவிக்கிறது, அதே நேரத்தில் முழு-துல்லியமான OpenVLA-OFT உடன் பொருந்துகிறது. X-VLA-0.9B (arXiv 2510.10274) ஃப்ளோ மேட்சிங்குடன் 1 B வரிசையில் அமைகிறது.
பொதுவான அம்சம்: தாமதம் மொழி மாதிரியில் இல்லை, செயல் டிகோடரில் தான் உள்ளது. ஒரு கொள்கை எத்தனை பாராமீட்டர்களைக் கொண்டுள்ளது என்று கேட்பதற்கு முன், அது எவ்வாறு செயல்களை வெளியிடுகிறது என்று கேளுங்கள். The arena 85 மாடல்களையும் 332 முடிவுகளையும் கொண்டுள்ளது, ஒவ்வொன்றும் அதன் மூலத்துடன் இணைக்கப்பட்டுள்ளன; ஒரு பரந்த கண்ணோட்டம் எங்கள் VLA அறிமுகத்தில்.
RTX 4090 இல் SmolVLA ஐ நான் ஃபைன்-ட்யூன் செய்ய முடியுமா?▾
ஆம். SmolVLA 450 M அளவுருக்களைக் கொண்டது, AY-Robots அதை RTX 4090 / 24 GB அடுக்கில் இயக்குகிறது. lerobot எடுத்துக்காட்டு --batch_size=64 ஐப் பயன்படுத்துகிறது, இது உங்கள் கார்டுக்கு ஒரு உத்தரவாதம் அல்ல, மாறாக ஒரு எடுத்துக்காட்டு; ஆவணங்கள் சிறியதாகத் தொடங்கி, ஏற்றுதல் நேரம் குறைவாக இருக்கும்போது அதிகரிக்க அறிவுறுத்துகின்றன. A100 இல் 20000 படிகளுக்கு ஆவணங்கள் குறிப்பிடும் தோராயமாக 4 மணிநேரத்தை விட அதிக நேரம் எதிர்பார்க்கலாம்.
TinyVLA lerobot இல் அல்லது AY-Robots இல் கிடைக்குமா?▾
இரண்டுக்கும் இல்லை. TinyVLA அதன் ஆராய்ச்சி களஞ்சியத்தில் மட்டுமே உள்ளது, கடைசி கமிட் 11 மார்ச் 2025, மற்றும் அதன் வடிவம் LeRobot ஐ விட ACT-பாணி HDF5 ஆகும். AY-Robots GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA மற்றும் ACT ஐப் பயிற்றுவிக்கிறது. உங்களுக்கு TinyVLA தேவைப்பட்டால், அதை நீங்களே உருவாக்க வேண்டும், மேலும் scripts/train.sh இல் உள்ள DeepSpeed config பாதையை முதலில் சரிசெய்ய வேண்டும்.
450 M மாதிரி உண்மையில் 3 B மாதிரியுடன் போட்டியிட முடியுமா?▾
ஆசிரியர்களின் சொந்த அளவுகோல்களின்படி, ஆம்: LIBERO இல் 87.3 க்கு எதிராக 86.0, 3.3 B இல் ரோபோடிக்ஸ்-முன்பயிற்சி பெற்ற Pi0 உடன் ஒப்பிடும்போது, மற்றும் மூன்று உண்மையான SO-100 பணிகளில் 78.3 க்கு எதிராக 61.7, அதே ஆய்வுக் கட்டுரை Pi0 ஐ 3.5 B எனக் குறிப்பிடுகிறது. அதே ஆய்வுக் கட்டுரையில் வரம்பு உள்ளது: ரோபோடிக்ஸ் முன்பயிற்சி இல்லாத ஒற்றைப் பணியில், SmolVLA 40.0 ஆகக் குறைகிறது, இது ACT இன் 48.3 ஐ விடக் குறைவு.
ஒரு சிறிய VLA எதையும் செய்வதற்கு முன் எனக்கு எத்தனை எபிசோடுகள் தேவை?▾
AY-Robots SmolVLA இன் குறைந்தபட்சத்தை 30 எபிசோடுகளாகவும், ACT இன் குறைந்தபட்சத்தை 50 ஆகவும் நிர்ணயிக்கிறது. lerobot ஆவணங்கள் சுமார் 50 ஐ பரிந்துரைக்கின்றன மற்றும் அதே பணிக்கு 25 போதுமானதாக இல்லை என்று தெரிவிக்கின்றன. எண்ணிக்கை போலவே கட்டமைப்பும் முக்கியமானது: ஆய்வுக் கட்டுரையின் தொகுப்பு 5 கியூப் நிலைகளை ஒவ்வொன்றிற்கும் 10 எபிசோடுகளுடன் பயன்படுத்தியது.
வெளியிடப்பட்ட தாமத எண்கள் ஏன் இவ்வளவு வேறுபடுகின்றன?▾
அவை வெவ்வேறு விஷயங்களை அளவிடுகின்றன. TinyVLA ஒரு A6000 இல் ஒரு செயல் கணிப்புக்கு 14 ms ஐப் புகாரளிக்கிறது; AY-Robots SmolVLA ஐ ஒரு செயல் படிக்கு 245 ms ஆகவும் ACT ஐ 20 ms ஆகவும் பட்டியலிடுகிறது. சில புள்ளிவிவரங்கள் ஒரு ஃபார்வர்ட் பாஸை உள்ளடக்குகின்றன, சில ஒரு பாஸை 50-செயல் துண்டுகளாகப் பிரிக்கின்றன, மேலும் கிட்டத்தட்ட எதுவும் கேமரா பிடிப்பு அல்லது சர்வோக்களுக்கு எழுதுவதை உள்ளடக்கவில்லை.
கிளவுட் இன்ஃபரன்ஸ் GPU சிக்கலைத் தீர்க்கிறதா?▾
ஓரளவு. AY-Robots ஒரு பாலிசியை வழங்கும் ஒரு பாட்-ஐ தானாகவே வழங்குகிறது, அதே நேரத்தில் உள்ளூர் கிளையன்ட் அந்த இறுதிப்புள்ளியுடன் பேசுகிறது, ஒரு செயலற்ற வாட்ச்டாக் உடன், அது தானாகவே அழிந்துவிடும், அமைதியாக பில் செய்யாது. இது பொது-இணைய ரவுண்ட் டிரிப்பை அகற்ற முடியாது, மேலும் கட்டுப்பாட்டு சுழற்சி ஏற்கனவே ஒரு செயல் படிக்கு 20 முதல் 485 ms ஆகும். மெதுவான பிக்-அண்ட்-பிளேஸுக்கு நல்லது, ஆனால் வேகமான எதிர்வினை இயக்கத்திற்கு அல்ல.
Sources
- TinyVLA: ரோபோடிக் கையாளுதலுக்கான வேகமான, தரவு-திறமையான பார்வை-மொழி-செயல் மாதிரிகளை நோக்கி
- TinyVLA அதிகாரப்பூர்வ குறியீடு களஞ்சியம் (README, requirements.txt, scripts/train.sh)
- TinyVLA திட்டப் பக்கம்
- lesjie/Llava-Pythia-1.3B, TinyVLA-H இன் பேக்போன் எடைகள்
- SmolVLA: மலிவான மற்றும் திறமையான ரோபோடிக்ஸிற்கான ஒரு பார்வை-மொழி-செயல் மாதிரி
- lerobot ஆவணங்கள்: SmolVLA ஐ ஃபைன்-ட்யூன் செய்தல்
- lerobot: configuration_smolvla.py, SmolVLA இன் இயல்புநிலைகள்
- lerobot/smolvla_base மாதிரி அட்டை
- SmolVLA: திறமையான பார்வை-மொழி-செயல் மாதிரி (Hugging Face வலைப்பதிவு)
- PyPI இல் lerobot (0.6.1, Python 3.12 அல்லது புதியது தேவை)
- OpenVLA: ஒரு திறந்த மூல பார்வை-மொழி-செயல் மாதிரி
- பார்வை-மொழி-செயல் மாதிரிகளை ஃபைன்-ட்யூன் செய்தல்: வேகம் மற்றும் வெற்றியை மேம்படுத்துதல் (OpenVLA-OFT)
- BitVLA: ரோபோடிக் கையாளுதலுக்கான 1-பிட் பார்வை-மொழி-செயல் மாதிரிகள்
- X-VLA: அளவிடக்கூடிய குறுக்கு-உருவாக்க பார்வை-மொழி-செயல் மாதிரியாக மென்-தூண்டப்பட்ட டிரான்ஸ்ஃபார்மர்
- rail-berkeley/octo-small-1.5 மாதிரி அட்டை (27 M அளவுருக்கள்)
Sources
- TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation
- TinyVLA official code repository (README, requirements.txt, scripts/train.sh)
- TinyVLA project page
- lesjie/Llava-Pythia-1.3B, the TinyVLA-H backbone weights
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- lerobot documentation: fine-tuning SmolVLA
- lerobot: configuration_smolvla.py, the SmolVLA defaults
- lerobot/smolvla_base model card
- SmolVLA: Efficient Vision-Language-Action Model (Hugging Face blog)
- lerobot on PyPI (0.6.1, requires Python 3.12 or newer)
- OpenVLA: An Open-Source Vision-Language-Action Model
- Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success (OpenVLA-OFT)
- BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation
- X-VLA: Soft-Prompted Transformer as Scalable Cross-Embodiment Vision-Language-Action Model
- rail-berkeley/octo-small-1.5 model card (27 M parameters)
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started