Табелата за споредба на политики на AY-Robots која ги прикажува GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA и ACT рамо до рамо со број на параметри, ниво на графички процесор, латентност на заклучување и минимален број на епизоди
vla-моделитренинг-на-политикиизбор-на-моделlerobotso-100

Која VLA политика треба да ја тренирате во 2026 година?

AY-Robots ResearchAugust 23, 202618 мин читање

GR00T N1.7, Pi0.5, SmolVLA, ACT или GR00T N1.5? Табела за одлучување прилагодена на реални ситуации, со објавените бенчмарк бројки, латентност, цена по извршување и лиценци зад секој избор.

Пет политики може да се тренираат на рака од класа SO-100 денес. Тие се разликуваат за фактор од 24 во инференција латентност, 37 во број на параметри и 12 во тоа колку чини едно извршување, и во тоа дали можете да го испорачате резултатот. Пет картички на модели нема да го решат тоа: ниту една не одговара на прашањето што го имате, која да ја извршам прво?

Секој број подолу е прочитан од трудовите, репозиториумите и картичките во август 2026 година. Броевите на платформата доаѓаат од каталог на политики на AY-Robots; каде што двете не се согласуваат, прикажани се и двете.

Кратката верзија

  • Тренирајте го ACT прво ако се сомневате во вашето множество податоци: 1 до 3 USD по извршување, ништо претходно тренирано за да ги покрие лошите податоци.
  • GR00T N1.7 и Pi0.5 се наоѓаат во рамките на половина поен на LIBERO, 97.0 наспроти 96.85 до 97.5. Тоа не е причина да се избере ниту еден.
  • Pi0.5 е за генерализација, а не за точност, и е најбавен со 485 ms.
  • SmolVLA, со 450 M параметри, е единствениот VLA овде што се дотерува на една 24 GB картичка.
  • ACT со 20 ms е единствената опција за брзо реактивно движење. Лиценците го одлучуваат остатокот.

Табелата за одлучување

Вашата ситуацијаОбучете го оваЗошто
Квалитетот на податочното множество е недокажанACTНишто претходно обучено не крие скршено податочно множество, а неуспехот чини 1 до 3 УСД.
Богато со контакт, повеќечекорно, јазично-условеноGR00T N1.797.0% преку четири LIBERO пакети, плус релативен акционен простор на крајниот ефектор.
Брзо реактивно движење, заклучување кај сервомоторитеACT20 ms. Следниот најбрз е 7.6 пати побавен.
Нови објекти, нова сцена, отворен светPi0.5Изграден за однесување надвор од дистрибуција, низ до 104 локации.
Една 24 GB картичка, сè уште сакате јазикSmolVLA450 M parameters, минимум 30 епизоди, работи локално.
Репродукција на извршување снимено во 2025 годинаGR00T N1.5Само ако морате: LeRobot сега го отфрла, тежините се некомерцијални.
Ова ќе биде испорачано како производN1.7, SmolVLA or ACTN1.5 е некомерцијален, Pi0.5 ги носи условите на Gemma, картичката на SmolVLA не наведува ништо.

Петте кандидати

Сите пет се политики: рамки од камера, позиции на зглобови и, за четири од нив, јазична инструкција, мапирана на дел од идни цели на зглобовите. Она што ги одвојува е колку е научено пред да пристигнете.

ПолитикаПараметриЛатентностНиво на графички процесорЛокално?Мин. епизодиФорматЦена
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

Тековниот модел за визија-јазик-акција на NVIDIA, околу 3 милијарди параметри, приближно 40 милиони тренирани за време на фино подесување. Репозиториумот ги наведува разликите од N1.6: основа од Eagle модел од добавувач до Cosmos-Reason2-2B на Qwen3-VL, слоеви на дифузија од 32 на 16, димензии на состојба и акција од 29 на 132, хоризонт на акција од 16 на 40.

Она што е важно за мала рака е релативниот акционен простор на крајниот ефектор: N1.7 предвидува делта од тековната поза, што овозможува 20K часа човечко видео од EgoScale да се пренесе во роботска политика. Спецификации на страницата на N1.7, процедура во водичот за N1.7 на SO-100.

GA во репозиториумот, EA на картичката на моделот

README-то на Isaac-GR00T го прогласува N1.7 за Општа Достапност издание, со целосни бенчмаркови и поддршка. Неговата Hugging Face картичка не е ажурирана: полето Model Version сè уште гласи GR00T N1.7 EA. Репозиториумот е поновиот документ.

GR00T N1.5

Иста скала од 3 B, Eagle 2 основа, SigLip2 и T5, DiT глава за усогласување на проток. Постои за да прошири што веќе го имате. Две работи го прават лош стандард: тежините носат еднонасочна некомерцијална лиценца на NVIDIA, а тековните изданија на LeRobot ја отстранија поддршката за N1.5. Видете .

Pi0.5

На Physical Intelligence VLA, тип на политика pi05. Трудот дава 2 B VLM иницијализиран од PaliGemma плус 300 M експерт за акција, кој го движи роботот со 50 Hz; конфигурацијата pi05 на LeRobot стандардно користи парче од 50 чекори, една секунда со таа брзина. Главната предност се невидени места: околу 400 часа мобилна манипулација во реални домови и студија за скалирање на 3, 12, 22, 53, 82 и 104 локации, каде моделот со 104 локации се совпадна со контрола тренирана на самите тест домови.

Едно ограничување, наведено на lerobot/pi05_base картичката: портот носи само action head. Subtask prediction, action tokenization and RL were not released upstream, and openpi says the same of сопственото складиште. Страницата Pi0.5 и водичот Pi0.5 на SO-100 го имаат остатокот.

Замката што ја јаде целото попладне: затворени складишта

Pi0.5 го бара затворениот google/paligemma-3b-pt-224 токенизатор (gated: manual, иако Google вели дека барањата се обработуваат веднаш). Без да го прифатите и да извршите hf auth login во околината за обука, задачата започнува, презема некое време, а потоа умира поради грешка при авторизација што изгледа како мрежен дефект. nvidia/GR00T-N1.7-3B не е затворен, но неговиот nvidia/Cosmos-Reason2-2B бекбон е (gated: auto). Исчистете ги и двете пред да ги ставите во ред; ако извршувањето стои во мирување, страницата за заглавени редици наведува што да проверите.

SmolVLA

450 милиони параметри, околу 100 милиони во експертот за акција, на SmolVLM-2 со замрзнат VLM и користени само неговите први 16 слоеви на јазичниот модел. Предобуката беше податоци од заедницата: 481 збир на податоци, 10,6 милиони рамки, од истите евтини раце што ги користите. Единствениот VLA овде што се вклопува на една 24 GB картичка, и единствениот 30 епизода под. Видете страницата SmolVLA.

ACT

Не е основен модел. Action Chunking Transformer од ALOHA има околу 80 M параметри тренирани од нула по задача, на 50 демонстрации со 50 Hz. Трудот известува за шест реални бимануални задачи од приближно десет минути демонстрации за секоја, со 80 до 90 проценти на примерите што ги истакнува. Неговата идеја, акционо групирање, е во секој модел на оваа страница, а неговата аблација сè уште го мери ефектот најдобро: над две симулирани задачи со исклучено темпорално здружување, успехот се зголемува од 1 процент при k=1 на 44 проценти при k=100. Страницата на ACT го има остатокот.

Што всушност велат бенчмарковите

LIBERO е единствениот бенчмарк за кој известуваат три од овие пет: задачи условени од јазик на симулирана Franka Panda, поделени во четирите пакети подолу со по десет задачи. NVIDIA изврши 200 обиди по пакет.

МоделПросторноОбјектЦел10 (Долго)Просек
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Овие редови не се строго споредливи

Секој број доаѓа од различен систем и буџет. GR00T изврши 20K чекори со глобална серија од 640; бројката openpi е контролна точка од 30K; портот LeRobot додаде 6K чекори на основниот модел LIBERO. SmolVLA е дополнително несогласување: неговиот труд го тренира тој ред на LIBERO од нула, без претходна обука на VLA, додека трите над него ги дотеруваат претходно обучените контролни точки. Третирајте ги 96.85 до 97.5 како еден кластер, а јазот до 87.3% како реален, но купен со 6.7 пати повеќе параметри.

SimplerEnv го покажува ширењето, што LIBERO не го прави. NVIDIA го споредува N1.7 со N1.6, најблиската јавна работа до генерациска делта.

SimplerEnv пакетПросек на N1.6Просек на N1.7Најдобро отстапувањеНајлошо отстапување
Мост (WidowX), 7 задачи56.6%62.3%stack_cube 5.0 до 48.0put_eggplant_in_basket 89.0 до 53.0
Фрактал (Google Robot), 6 задачи52.0%72.5%open_drawer 0.0 до 65.0ништо, секоја задача се подобри

Редот Bridge е корисниот: 5.7 поени добиени во просек додека put_eggplant_in_basket изгуби 36, а put_eggplant_in_sink падна од 33 на 2. Нова генерација ја поместува дистрибуцијата наместо да ја подига, па ако вашата задача е таму каде што N1.7 регресираше, просекот не кажува ништо.

Табелата со резултати на арената AY-Robots, табела што може да се сортира со 85 модели за визија-јазик-акција со 332 резултати од бенчмарк, секоја вредност поврзана со трудот или картичката на моделот од кој потекнува
Арената содржи 85 VLA модели и 332 резултати од бенчмарк, секој поврзан со неговиот труд или картичка на моделот. Корисно за проверка дали бројот цитиран во објава на блог е реален.

Од петте, само трудот на SmolVLA известува за рака од класа SO-100: 78.3 проценти за SmolVLA и 61.7 за Pi0 низ три задачи, и двете повеќезадачни, наспроти 48.3 за ACT обучен за една задача, што не е споредливо. Чистото спарување е и двете еднозадачни на SO-101 pick-and-place: 90 наспроти 70 во дистрибуција, 50 наспроти 40 надвор од неа. Споредете на ACT наспроти SmolVLA и Pi0.5 наспроти SmolVLA, или прелистајте ја арената.

Латентноста и цената одлучуваат за распоредувањето

Латентност на заклучување е ограничувањето што луѓето го откриваат последно и прво го жалат. Политика пет поени подобра на бенчмарк, но половина секунда по чекор на акција изгледа полошо на вашето биро: динамиката на контакт не чека.

Една забелешка: бројката за GR00T не се согласува со картичката на NVIDIA, која мери 4 чекори на деноизирање и една камера на 85.8 ms на H100 во eager режим, 48.6 ms со torch.compile, 27.9 ms преку целосен TensorRT. Овде, 152 ms е бројка за целиот стек со оптоварување на сервисирање и повеќе од една камера, а не само forward pass.

Далечинското заклучување има строг лимит

Јамката од 20 до 485 ms е на моделот, а патувањата преку јавниот интернет се додаваат на тоа. Далечинското заклучување е изводливо за бавно земање и поставување (pick-and-place), но не и за брзо реактивно движење. Ако вашата задача бара брзина, заклучувањето се наоѓа до сервомоторите: ACT или SmolVLA, локално. Поврзано: политиката замрзнува среде движење.

Еден начин да се добие време без промена на моделот: трудот SmolVLA мери синхроно извршување, каде што политиката завршува еден дел пред да го предвиди следниот, наспроти асинхроното, каде што предвидувањето се преклопува со извршувањето. Успехот е сличен, 78.3 наспроти 73.3, но истото земање и поставување (pick-and-place) трае 9.7 секунди наместо 13.75, а во фиксен прозорец роботот управува со 19 циклуси наместо 9.

Лиценци, проверени бидејќи никој не ги проверува

МоделЛиценца за тежиниЛиценца за кодКомерцијална употреба
GR00T N1.7NVIDIA Open Model License; картичката дозволува комерцијална употребаApache 2.0да
GR00T N1.5NVIDIA еднонасочна некомерцијална лиценцаApache 2.0не
Pi0.5метаподатоците на картичката pi05_base читаат лиценца: gemmaApache 2.0 (openpi, LeRobot документи)прочитајте ги двете, не се согласуваат
SmolVLAнема поле за лиценца на картичката smolvla_baseApache 2.0 (LeRobot)код да, тежини ненаведени
ACTне постојат основни тежиниApache 2.0 (LeRobot)да

Редот за Pi0.5 бара внимание. Документацијата на LeRobot pi05 наведува Apache 2.0 конзистентно со openpi, додека картичката на Hub за lerobot/pi05_base носи license: gemma. Двете се активни. GR00T N1.7 има поблага верзија: README-то на Isaac-GR00T попатно наведува дека N1.7 е целосно комерцијално лиценциран под Apache 2.0, додека неговиот сопствен дел за лиценца и картичката на моделот го ставаат само кодот под Apache 2.0, а тежините под NVIDIA Open Model License.

Стандардните поставки што всушност ќе ги извршите

Секоја форма на обучувач испорачува стандардна вредност, и тие не се произволни. Оние на ACT се сопствени на LeRobot: серија 8, lr 1e-5, 100000 чекори на обука, големина на парче 100, што одговара на ACTConfig upstream и k=100 од ACT трудот. Една колона подолу е стапица.

ПолитикаСеријаLRМакс. чекориАкумулација на градиентСе применува?Дополнителни параметри
GR00T N1.7321e-4200001yessaveSteps
GR00T N1.511e-5200016yessaveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Репродуцибилност, датирано август 2026

Влезната точка за фино подесување на GR00T (launch_finetune.py, tyro CLI) нема поле за семе во својата config dataclass, така што извршувањата не се репродуцибилни бит-по-бит. Репозиториумот исто така предупредува за 5 до 6 проценти варијанса помеѓу извршувањата од недетерминистички аугментации на слики, поголема од повеќето разлики во бенчмарк за кои се расправа онлајн. Стандардното семе на LeRobot е 1000. Колоната за акумулација на градиент го опишува lerobot 0.5.1; upstream 0.6.2 го изложува како --accelerator.gradient_accumulation.steps.

Параметарот што е поважен од изборот на модел

Тоа е акциониот дел. Подолгите делови даваат помазно движење и помалку кумулативни грешки, но политиката е посветена додека блокот се извршува, па реагира доцна на сè што се движи: самоуверена на статична коцка, безнадежна на подвижна. Ако претера, скратувањето на извршениот дел е подобро од претренирање и е бесплатно. Зглоб што застанува прерано е поинаков проблем; видете .

  • ACT: ACTConfig defaults to chunk_size 100 and n_action_steps 100. Темпоралното ансамблирање е исклучено и бара n_action_steps 1.
  • GR00T N1.7: внатрешниот хоризонт се зголеми од 16 на 40, но LeRobot's SO-101 example still runs --policy.chunk_size=16 --policy.n_action_steps=16. Знамето за извршување беше преименувано во --execution-horizon.
  • Pi0.5: дел од 50 чекори, од кои LeRobot's LIBERO recipe executes 10 via --policy.n_action_steps=10; со --policy.pretrained_path се враќа на 50 ако го изоставите знамето.
  • SmolVLA: делови од 50 акции, двете контроли се изложени.

Како да ги проверите сите пет за едно попладне

Најевтиниот одговор не е повеќе читање. Потрошете околу 15 USD и дозволете ѝ на раката да ви каже: снимете еднаш, прво тренирајте го евтиниот модел, ескалирајте откако ќе докаже дека податоците се добри. Структурата е поважна од обемот, поентата на и .

  1. 1
    Снимете 50 епизоди еднаш

    Педесет го расчистува теренот за GR00T, Pi0.5 и ACT, и 30-те на SmolVLA. Повторете ја секоја варијација наместо да се расплинувате: 50 епизоди низ 5 позиции на коцки тренирани таму каде што 25 не беа. Видете снимање на вашето прво множество податоци.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Прво тренирајте го ACT, бидејќи не може да ве лаже

    Без претходно тренирани тежини, па ако воопшто ја извршува задачата, вашето множество податоци ја содржи задачата. Ако ACT стагнира, поправете ги податоците. 1 до 3 УСД, 2 до 5 часа на картичка од 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Стартувајте го SmolVLA на истото множество податоци, непроменето

    Исти податоци, иста рака, 450 M параметри наместо 80 M, плус јазично условување. LeRobot проценува извршување од 20K чекори на приближно 4 часа на еден A100. Ова е она што ви кажува дали претходното тренирање носи некаква корист.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Конвертирајте на v2.1 пред да го допрете GR00T

    GR00T чита варијанта на LeRobot v2 форматот плус дополнителна meta/modality.json мапа која покажува како споените низи на состојби и акции се делат на именувани полиња. Множество податоци од v3.0 го урива тој вчитувач, бидејќи v3.0 пакува многу епизоди во споделени датотеки каде што v2 пишуваше по една за секоја епизода. Isaac-GR00T го испорачува помошникот за намалување на верзијата како scripts/lerobot_conversion/convert_v3_to_v2.py; страницата за отфрлање на v3 е брзиот пат.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Ескалирајте на GR00T N1.7 само ако првите две оставиле нешто нерешено

    Преку CLI на NVIDIA, прикажан овде, или типот на политика groot на LeRobot. NVIDIA препорачува 40 GB или повеќе VRAM за фино подесување, 16 GB за инференција. При OOM, видете ја страницата за OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Два начини да се изврши тој скрининг премин

Три околини, бидејќи синџирите на алатки не коегзистираат. LeRobot на главната гранка е 0.6.2 и бара Python 3.12 или понов; Isaac-GR00T и openpi се посебни репозиториуми управувани со uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T го фиксира torchcodec 0.8.0 како единствен видео бекенд, барајќи FFmpeg 4 до 7. FFmpeg 8 не е поддржан, AV1 не е загарантиран.
  • Минимални барања за меморија на openpi: инференција над 8 GB, LoRA над 22.5 GB, целосно фино подесување над 70 GB. Тоа последното е причината зошто Pi0.5 е работа за A100.
  • Изнајмете го GPU сами, уништете го потоа, рачно усогласете три множества патеки на контролни точки.

Фундаментален модел или од нула

Вистинската дилема не е кој 3 B модел да се избере. Туку дали воопшто да се користи претходно трениран VLA, со оглед на тоа што ACT научи шест реални бимануални задачи од околу десет минути демонстрации за секоја, со 80 M параметри и ништо претходно тренирано.

Фино подесување на претходно трениран VLA наместо тренирање на ACT од нула
Што добивате
  • Јазично условување. ACT нема; една ACT контролна точка извршува една задача.
  • Подобро на објекти отсутни од вашите демонстрации: на SO-101, 50% наспроти 40% на ACT надвор од дистрибуцијата.
  • Воопшто мултитаскинг: SmolVLA достигнува 78.3% низ три SO-100 задачи со една контролна точка; ACT беше извршен само како единечна задача.
Што ве чини
  • 7.6x до 24x поголема латенција: 152 до 485 ms по чекор на акција наспроти 20 ms на ACT.
  • 4 до 12 USD по извршување наместо 1 до 3, и A100 ниво наместо која било 24 GB картичка.
  • Изложеност на лиценца, плус режим на неуспех на затворено складиште што не постои од нула.
  • Претходно тренираните тежини може да маскираат лош сет на податоци. Фино подесување што делумно работи на оштетени податоци чини една недела пред да ги погледнете податоците.

Случајот на репродукција на старо извршување

Потрагата по контролна точка од 2025 година го прави изборот на модел за вас и го претвора проблемот во фиксирање на верзијата: тековниот LeRobot го отфрла N1.5, па вие ја фиксирате верзијата lerobot==0.5.1. Без поле за семе и со варијанса од 5 до 6 проценти помеѓу извршувањата, репродукцијата е приближна по конструкција. и ја имаат страната на платформата.

Страницата за директна споредба на AY-Robots за GR00T N1.7 наспроти Pi0.5, прикажувајќи ги броевите на параметри, барањата за графички процесор, латентноста на заклучување, форматот на податочното множество и минималниот број на епизоди еден до друг.
Директна споредба на /compare/groot-n1-7-vs-pi0-5. Двата 3 B модели изгледаат заменливи на спецификациски лист, но не се: едниот бара LeRobot v2.1, другиот бара v3.0.

Сведени на два? ACT наспроти GR00T N1.7 и GR00T N1.7 наспроти SmolVLA. Суровите редови се наоѓаат во записите на арената: GR00T N1.7, Pi0.5, SmolVLA и ACT.

Каде оваа платформа не ви помага

  • Не може да го забрза далечинското заклучување. Јамката од 20 до 485 ms му припаѓа на моделот; интернет рунд-триповите се додаваат на тоа.
  • Не може да ги дотера GR00T или Pi0.5 на вашиот сопствен хардвер. И двата се само во облак овде; само SmolVLA и ACT работат локално.
  • Не може да поправи податочно множество. Загубата паѓа, но политиката не прави ништо е проблем со податоците, политика која работи само во едно поставување е проблем со покриеноста.
  • Не може да ги направи извршувањата на GR00T репродуктивни: конфигурацијата нагоре нема поле за семе.

85 модели, 332 резултати од бенчмарк, секој број поврзан со неговиот извор

Верзијата на табелите на оваа страница што може да се сортира: 85 модели за визија-јазик-акција, 332 резултати од бенчмарк, секој поврзан со неговиот труд или картичка на моделот.

Отвори ја арената

Избирање еден и продолжување

Еден стандард: сними 50 епизоди, тренирај ACT за 1 до 3 УСД за да го докажеш множеството податоци, потоа SmolVLA на истите податоци. Заедно под 6 УСД, и тие одговараат на прашањето што е важно: дали претренингот помага овде, или дали тесното грло се податоците. Ескалирај на GR00T N1.7 за повеќечекорни задачи богати со контакт, на Pi0.5 кога сцената се менува.

Водич за платформата: обучи ја твојата прва политика, потоа изврши ја твојата прва политика. документацијата за обука и документацијата за множества податоци ги покриваат формата и форматот; страницата SO-100 и целосниот водич за SO-100 ги покриваат изградбата и калибрацијата. Позадина: прегледот на VLA и статијата за Pi0 flow-matching. Она што ќе ја зголеми твојата стапка на успех е водичот за квалитет на податоци.

Која VLA политика треба прво да ја тренирам на SO-100?

ACT, потоа SmolVLA. ACT тренира од нула, така што не може да маскира лош сет на податоци, а едно извршување чини 1 до 3 USD на картичка од 24 GB. Ако ACT воопшто ја изврши задачата, 4 до 12 USD за извршување на GR00T N1.7 или Pi0.5 не се потрошени залудно.

Дали GR00T N1.7 е навистина подобар од Pi0.5?

На LIBERO тие се во рамките на шумот: 97.0% низ четири пакети за GR00T N1.7, 96.85% за Pi0.5 на 30k чекори во openpi, 97.5% за LeRobot портот, сите од различни системи. Вистинските разлики се 152 ms по чекор на акција наспроти 485 ms, v2.1 сетови на податоци наспроти v3.0, и точност на бенчмарк наспроти генерализација во отворен свет.

Можам ли да фино-подесам нешто од ова на една RTX 4090?

SmolVLA и ACT, да; и двете се наведени за RTX 4090 или која било картичка од 24 GB и работат локално. GR00T N1.7, N1.5 и Pi0.5 бараат A100 или H100 80 GB и овде се само за облак. NVIDIA препорачува 40 GB или повеќе за GR00T фино-подесување; минимумот на openpi е над 70 GB за целосно Pi0.5 фино-подесување, 22.5 GB за LoRA.

Кој од овие пет можам да го користам комерцијално?

Тежините на GR00T N1.7 се под Договорот за лиценца за отворен модел на NVIDIA, кој картичката вели дека покрива комерцијална употреба. Тежините на N1.5 се некомерцијални. Кодот на SmolVLA е Apache 2.0 во LeRobot, но картичката lerobot/smolvla_base не содржи поле за лиценца, така што тежините не се наведени. ACT нема основни тежини за лиценцирање. Pi0.5 е двосмислен: документите на LeRobot велат Apache 2.0, неговите метаподатоци на картичката гласат license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started