Tabela porównawcza polityk AY-Robots pokazująca GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA i ACT obok siebie z liczbą parametrów, poziomem GPU, opóźnieniem wnioskowania i minimalną liczbą epizodów
modele-vlatrening-politykwybór-modelulerobotso-100

Którą politykę VLA powinieneś trenować w 2026 roku?

AY-Robots ResearchAugust 23, 202618 min czytania

GR00T N1.7, Pi0.5, SmolVLA, ACT czy GR00T N1.5? Tabela decyzyjna dopasowana do rzeczywistych sytuacji, z opublikowanymi wynikami benchmarków, opóźnieniem, kosztem uruchomienia i licencjami stojącymi za każdym wyborem.

Pięć polityk można dziś trenować na ramieniu klasy SO-100. Różnią się one czynnikiem 24 w inferencji opóźnienia, 37 w liczbie parametrów i 12 w koszcie uruchomienia, oraz w tym, czy można wysłać wynik. Pięć kart modeli tego nie rozstrzygnie: żadna nie odpowiada na pytanie, które masz, którą uruchomić najpierw?

Każda liczba poniżej została odczytana z artykułów, repozytoriów i kart w sierpniu 2026. Numery platform pochodzą z katalogu polityk AY-Robots; tam, gdzie się różnią, pokazane są obie.

Wersja skrócona

  • Trenuj ACT najpierw, jeśli wątpisz w swój zbiór danych: 1 do 3 USD za uruchomienie, nic wstępnie wytrenowanego, aby zakryć złe dane.
  • GR00T N1.7 i Pi0.5 mieszczą się w granicach pół punktu na LIBERO, 97.0 wobec 96.85 do 97.5. To nie jest powód, aby wybrać którąkolwiek.
  • Pi0.5 to gra na generalizację, nie na dokładność, i najwolniejsza z 485 ms.
  • SmolVLA, z 450 M parametrami, to jedyny VLA tutaj, który dostraja się na jednej karcie 24 GB.
  • ACT z 20 ms to jedyna opcja dla szybkiego ruchu reaktywnego. Licencje decydują o reszcie.

Tabela decyzyjna

Twoja sytuacjaTrenuj toDlaczego
Nieudowodniona jakość zbioru danychACTŻaden wstępnie wytrenowany model nie ukryje uszkodzonego zbioru danych, a niepowodzenie kosztuje od 1 do 3 USD.
Bogate w kontakt, wieloetapowe, warunkowane językowoGR00T N1.797,0% w czterech pakietach LIBERO, plus względna przestrzeń akcji efektora końcowego.
Szybki ruch reaktywny, wnioskowanie na serwachACT20 ms. Następny najszybszy jest 7,6 razy wolniejszy.
Nowe obiekty, nowa scena, otwarty światPi0.5Zbudowany dla zachowań poza rozkładem, w maksymalnie 104 lokalizacjach.
Jedna karta 24 GB, nadal chcesz językaSmolVLA450 M parametrów, minimum 30 epizodów, działa lokalnie.
Odtwarzanie przebiegu zarejestrowanego w 2025 rokuGR00T N1.5Tylko jeśli musisz: LeRobot teraz to odrzuca, wagi są niekomercyjne.
To zostanie wysłane jako produktN1.7, SmolVLA or ACTN1.5 jest niekomercyjny, Pi0.5 podlega warunkom Gemma, karta SmolVLA nie określa żadnych.

Pięciu kandydatów

Wszystkie pięć to polityki: klatki z kamery, pozycje przegubów oraz, dla czterech z nich, instrukcja językowa, mapowana na fragment przyszłych celów przegubów. To, co je różni, to ile zostało nauczone, zanim się pojawiłeś.

PolitykaParametryOpóźnieniePoziom GPULokalnie?Min. epizodówFormatKoszt
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

Obecny model wizualno-językowo-akcyjny firmy NVIDIA, około 3 mld parametrów, z czego około 40 mln wytrenowano podczas dostrajania. Repozytorium wymienia różnice w stosunku do N1.6: szkielet z modelu Eagle dostarczonego przez dostawcę do Cosmos-Reason2-2B na Qwen3-VL, warstwy dyfuzyjne z 32 do 16, wymiary stanu i akcji z 29 do 132, horyzont akcji z 16 do 40.

W przypadku małego ramienia liczy się względna przestrzeń akcji efektora końcowego: N1.7 przewiduje delty od aktualnej pozycji, co pozwala na przeniesienie 20 tysięcy godzin ludzkich nagrań wideo EgoScale do polityki robota. Specyfikacja na stronie N1.7, procedura w przewodniku N1.7 na SO-100.

GA w repozytorium, EA na karcie modelu

Plik README Isaac-GR00T deklaruje N1.7 jako wydanie Ogólnej Dostępności, z pełnymi testami porównawczymi i wsparciem. Karta Hugging Face nie została jeszcze zaktualizowana: pole Model Version nadal wyświetla GR00T N1.7 EA. Repozytorium jest nowszym dokumentem.

GR00T N1.5

Ta sama skala 3 B, rdzeń Eagle 2, SigLip2 i T5, głowica DiT z dopasowaniem przepływu. Istnieje, aby rozszerzyć , który już posiadasz. Dwie rzeczy sprawiają, że jest to słaby wybór domyślny: wagi posiadają jednostronną, niekomercyjną licencję NVIDIA, a obecne wydania LeRobot usunęły wsparcie dla N1.5. Zobacz .

Pi0.5

VLA firmy Physical Intelligence z , typ polityki pi05. Artykuł przedstawia VLM o rozmiarze 2 B zainicjowany z PaliGemma plus eksperta akcji 300 M, sterującego robotem z częstotliwością 50 Hz; konfiguracja pi05 LeRobot domyślnie używa 50-krokowego fragmentu, jednej sekundy przy tej szybkości. Główną zaletą są nieznane miejsca: około 400 godzin mobilnej manipulacji w prawdziwych domach oraz badanie skalowania obejmujące 3, 12, 22, 53, 82 i 104 lokalizacje, gdzie model ze 104 lokalizacji dorównał kontroli wytrenowanej na samych domach testowych.

Jedno ograniczenie, podane na karcie lerobot/pi05_base: port przenosi tylko dopasowującą przepływ głowicę akcji. Przewidywanie podzadań, tokenizacja akcji i RL nie zostały udostępnione upstream, a openpi mówi to samo o swoim własnym repozytorium. Strona Pi0.5 i przewodnik Pi0.5 na SO-100 zawierają resztę.

Pułapka, która pochłania popołudnie: repozytoria z bramką

Pi0.5 wymaga tokenizatora google/paligemma-3b-pt-224 z bramką (gated: manual, choć Google twierdzi, że żądania są przetwarzane natychmiast). Bez zaakceptowania go i uruchomienia hf auth login w środowisku treningowym, zadanie uruchamia się, pobiera przez chwilę, a następnie kończy się błędem autoryzacji, który wygląda jak awaria sieci. nvidia/GR00T-N1.7-3B nie ma bramki, ale jego rdzeń nvidia/Cosmos-Reason2-2B ma (gated: auto). Wyczyść oba przed dodaniem do kolejki; jeśli uruchomienie pozostaje bezczynne, strona z zablokowaną kolejką wymienia, co należy sprawdzić.

SmolVLA

450 M parametrów, około 100 M w ekspercie akcji, na SmolVLM-2 z zamrożonym VLM i tylko jego pierwsze 16 warstw modelu językowego. Wstępne szkolenie opierało się na danych społeczności: 481 zbiorów danych, 10.6 M klatek, z tych samych tanich ramion, których używasz. Jedyny VLA tutaj, który mieści się na jednej karcie 24 GB, i jedyny z progiem 30 epizodów. Zobacz stronę SmolVLA.

ACT

Nie jest to model podstawowy. Action Chunking Transformer z ALOHA to około 80 M parametrów trenowanych od podstaw dla każdego zadania, na 50 demonstracjach przy 50 Hz. Artykuł opisuje sześć rzeczywistych zadań dwuręcznych, z około dziesięciu minut demonstracji każde, osiągając 80 do 90 procent na przykładach, które podkreśla. Jego idea, action chunking, jest obecna w każdym modelu na tej stronie, a jego ablacja nadal mierzy najlepiej efekt: w dwóch symulowanych zadaniach z wyłączonym ensemblingiem czasowym, sukces wzrasta z 1 procenta przy k=1 do 44 procent przy k=100. Strona ACT zawiera resztę.

Co faktycznie mówią benchmarki

LIBERO to jeden z benchmarków, o którym raportują trzy z tych pięciu: zadania warunkowane językowo na symulowanym robocie Franka Panda, podzielone na cztery poniższe zestawy po dziesięć zadań każdy. NVIDIA przeprowadziła 200 prób dla każdego zestawu.

ModelPrzestrzenneObiektoweCelowe10 (Długie)Średnia
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Te wiersze nie są ściśle porównywalne

Każda liczba pochodzi z innego zestawu testowego i budżetu. GR00T działał przez 20 tys. kroków przy globalnej partii 640; wartość openpi to punkt kontrolny 30 tys.; port LeRobot dodał 6 tys. kroków do modelu bazowego LIBERO. SmolVLA to dalsze niedopasowanie: jego artykuł trenuje ten wiersz na LIBERO od zera, bez wstępnego trenowania VLA, podczas gdy trzy powyżej dostrajają wstępnie wytrenowane punkty kontrolne. Traktuj 96.85 do 97.5 jako jedną grupę, a lukę do 87.3% jako rzeczywistą, ale uzyskaną kosztem 6.7x większej liczby parametrów.

SimplerEnv pokazuje rozrzut, czego nie robi LIBERO. NVIDIA porównuje N1.7 z N1.6, co jest najbliższą publiczną rzeczą do generational delta..

Zestaw SimplerEnvŚrednia N1.6Średnia N1.7Najlepsza zmianaNajgorsza zmiana
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

Wiersz Bridge jest tym użytecznym: średnio 5.7 punktu zysku, podczas gdy put_eggplant_in_basket stracił 36, a put_eggplant_in_sink spadł z 33 do 2. Nowa generacja przesuwa rozkład zamiast go podnosić, więc jeśli twoje zadanie znajduje się tam, gdzie N1.7 zanotował regres, średnia nic nie mówi.

Tabela liderów areny AY-Robots, sortowalna tabela 85 modeli wizualno-językowo-akcyjnych z 332 wynikami benchmarków, każda wartość powiązana z publikacją lub kartą modelu, z której pochodzi
Arena zawiera 85 modeli VLA i 332 wyniki benchmarków, każdy z nich powiązany z odpowiednią publikacją lub kartą modelu. Przydatne do sprawdzenia, czy liczba cytowana w poście na blogu jest prawdziwa.

Spośród pięciu, tylko publikacja SmolVLA raportuje o ramieniu klasy SO-100: 78.3 procent dla SmolVLA i 61.7 dla Pi0 w trzech zadaniach, oba wielozadaniowe, w porównaniu do 48.3 dla ACT trenowanego jednorazowo, co nie jest porównaniem jeden do jednego. Czyste porównanie to oba jednorazowe zadania na SO-101 typu pick-and-place: 90 do 70 w dystrybucji, 50 do 40 poza nią. Porównaj na ACT kontra SmolVLA i Pi0.5 kontra SmolVLA, lub przeglądaj arenę.

Opóźnienie i koszt decydują o wdrożeniu

Opóźnienie wnioskowania to ograniczenie, które ludzie odkrywają na końcu i żałują jako pierwsze. Polityka o pięć punktów lepsza w benchmarku, ale zajmująca pół sekundy na krok akcji, wygląda gorzej na Twoim biurku: dynamika kontaktu nie czeka.

Jedna uwaga: dane GR00T nie zgadzają się z kartą NVIDIA, która mierzy 4 kroki odszumiania i jedną kamerę na 85.8 ms na H100 w trybie eager, 48.6 ms z torch.compile, 27.9 ms przez pełny TensorRT. Wartość 152 ms tutaj to wynik dla całego stosu, uwzględniający narzut serwowania i więcej niż jedną kamerę, a nie tylko przejście w przód.

Zdalne wnioskowanie ma twardy limit

Pętla od 20 do 485 ms należy do modelu, a do tego dochodzą czasy podróży w obie strony przez publiczny internet. Zdalne wnioskowanie jest wykonalne dla wolnego podnoszenia i odkładania (pick-and-place), ale nie dla szybkiego ruchu reaktywnego. Jeśli Twoje zadanie wymaga szybkości, wnioskowanie odbywa się obok serwomechanizmów: ACT lub SmolVLA, lokalnie. Powiązane: polityka zawiesza się w trakcie ruchu.

Jednym ze sposobów na zaoszczędzenie czasu bez zmiany modelu jest to, że artykuł SmolVLA mierzy wykonanie synchroniczne, gdzie polityka kończy fragment przed przewidzeniem następnego, w porównaniu do asynchronicznego, gdzie przewidywanie nakłada się na wykonanie. Sukces jest podobny, 78.3 wobec 73.3, ale to samo zadanie podnoszenia i odkładania zajmuje 9.7 sekundy zamiast 13.75, a w ustalonym oknie robot wykonuje 19 cykli zamiast 9.

Licencje, sprawdzone bo nikt ich nie sprawdza

ModelLicencja wagLicencja koduUżycie komercyjne
GR00T N1.7NVIDIA Open Model License; karta zezwala na użycie komercyjneApache 2.0tak
GR00T N1.5Jednostronna licencja niekomercyjna NVIDIAApache 2.0nie
Pi0.5metadane karty pi05_base wskazują licencję: gemmaApache 2.0 (openpi, dokumentacja LeRobot)przeczytaj oba, są sprzeczne
SmolVLAbrak pola licencji na karcie smolvla_baseApache 2.0 (LeRobot)kod tak, wagi nieokreślone
ACTbrak bazowych wagApache 2.0 (LeRobot)tak

Wiersz Pi0.5 wymaga uwagi. Dokumentacja LeRobot pi05 podaje Apache 2.0, co jest zgodne z openpi, podczas gdy karta Hub dla lerobot/pi05_base zawiera license: gemma. Obie są aktywne. GR00T N1.7 ma łagodniejszą wersję: plik README Isaac-GR00T mimochodem wspomina, że N1.7 jest w pełni licencjonowalny komercyjnie na podstawie Apache 2.0, podczas gdy jego własna sekcja licencyjna i karta modelu umieszczają tylko kod pod Apache 2.0, a wagi pod NVIDIA Open Model License.

Domyślne ustawienia, które faktycznie uruchomisz

Każda forma trenera dostarcza domyślne ustawienia, które nie są przypadkowe. Ustawienia ACT są własnymi ustawieniami LeRobot: batch 8, lr 1e-5, 100000 kroki treningowe, rozmiar chunka 100, pasujący do ACTConfig upstream i k=100 z artykułu ACT. Jedna kolumna poniżej to pułapka.

PolitykaPartiaLRMaks. krokiGrad accumDotyczy?Dodatkowe parametry
GR00T N1.7321e-4200001taksaveSteps
GR00T N1.511e-5200016taksaveSteps
Pi0.515e-53000016nie (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008nieseed, logFreq
ACT81e-51000001niechunkSize, nActionSteps, seed, logFreq
Powtarzalność, stan na sierpień 2026

Punkt wejścia do dostrajania GR00T (launch_finetune.py, CLI tyro) nie posiada pola seed w swojej klasie danych konfiguracyjnych, więc uruchomienia nie są odtwarzalne bit po bicie. Repozytorium ostrzega również przed 5 do 6 procentową wariancją między uruchomieniami wynikającą z niedeterministycznych augmentacji obrazu, co jest większe niż większość różnic w benchmarkach, o których dyskutuje się online. Domyślne ziarno LeRobot to 1000. Kolumna grad-accum opisuje lerobot 0.5.1; upstream 0.6.2 udostępnia ją jako --accelerator.gradient_accumulation.steps.

Parametr, który ma większe znaczenie niż wybór modelu

Jest to fragment akcji. Dłuższe fragmenty zapewniają płynniejszy ruch i mniej narastających błędów, ale polityka jest zatwierdzona podczas wykonywania bloku, więc reaguje późno na wszystko, co się porusza: pewna siebie na statycznej kostce, beznadziejna na toczącej się. Jeśli przekroczy cel, skrócenie wykonanej części jest lepsze niż ponowne szkolenie i jest darmowe. Staw, który zatrzymuje się za wcześnie, to inny problem; zobacz .

  • ACT: ACTConfig domyślnie używa chunk_size 100 i n_action_steps 100. Ensembling czasowy jest wyłączony i wymaga n_action_steps 1.
  • GR00T N1.7: wewnętrzny horyzont wzrósł z 16 do 40, jednak przykład SO-101 LeRobota nadal działa z --policy.chunk_size=16 --policy.n_action_steps=16. Flaga rollout została zmieniona na --execution-horizon.
  • Pi0.5: fragment 50-krokowy, z którego przepis LIBERO LeRobota wykonuje 10 za pomocą --policy.n_action_steps=10; z --policy.pretrained_path wraca do 50, jeśli pominiesz flagę.
  • SmolVLA: 50-akcyjne fragmenty, oba parametry dostępne.

Jak przetestować wszystkich pięć w jedno popołudnie

Najtańsza odpowiedź to nie więcej czytania. Wydaj około 15 USD i pozwól ramieniu ci powiedzieć: nagraj raz, najpierw wytrenuj tani model, a następnie eskaluj, gdy dane okażą się poprawne. Struktura przewyższa objętość, co jest celem i .

  1. 1
    Nagraj 50 epizodów raz

    Pięćdziesiąt przygotowuje grunt dla GR00T, Pi0.5 i ACT, oraz 30 dla SmolVLA. Powtórz każdą wariację, zamiast rozpraszać się: 50 epizodów w 5 pozycjach kostki, gdzie 25 nie było trenowanych. Zobacz nagrywanie pierwszego zbioru danych.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Najpierw wytrenuj ACT, ponieważ nie może cię okłamać

    Brak wstępnie wytrenowanych wag, więc jeśli w ogóle wykonuje zadanie, twój zbiór danych zawiera to zadanie. Jeśli ACT nie działa, napraw dane. 1 do 3 USD, 2 do 5 godzin na karcie 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Uruchom SmolVLA na tym samym zbiorze danych, bez zmian

    Te same dane, to samo ramię, 450 M parametrów zamiast 80 M, plus warunkowanie językowe. LeRobot szacuje uruchomienie 20 tys. kroków na około 4 godziny na jednym A100. To właśnie mówi ci, czy wstępne trenowanie cokolwiek daje.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Konwertuj do v2.1 zanim zaczniesz używać GR00T

    GR00T odczytuje wariant formatu LeRobot v2 plus dodatkowy plik meta/modality.json mapujący, jak połączone tablice stanu i akcji dzielą się na nazwane pola. Zbiór danych w wersji v3.0 powoduje awarię tego ładowania, ponieważ v3.0 pakuje wiele epizodów do współdzielonych plików, podczas gdy v2 zapisywało jeden na epizod. Isaac-GR00T dostarcza pomocnika do obniżania wersji jako scripts/lerobot_conversion/convert_v3_to_v2.py; strona odrzucenia v3 to szybka ścieżka.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Przejdź na GR00T N1.7 tylko wtedy, gdy pierwsze dwa rozwiązania nie przyniosły pełnych rezultatów

    Poprzez CLI NVIDIA, pokazane tutaj, lub typ polityki groot LeRobot. NVIDIA zaleca 40 GB lub więcej VRAM do dostrajania, 16 GB do wnioskowania. W przypadku OOM, zobacz stronę OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dwa sposoby na przeprowadzenie tego wstępnego testu

Trzy środowiska, ponieważ łańcuchy narzędzi nie współistnieją. LeRobot na głównym to 0.6.2 i wymaga Pythona 3.12 lub nowszego; Isaac-GR00T i openpi to oddzielne repozytoria zarządzane przez uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T przypina torchcodec 0.8.0 jako swój jedyny backend wideo, wymagający FFmpeg 4 do 7. FFmpeg 8 nie jest obsługiwany, AV1 nie jest gwarantowany.
  • Minimalne wymagania pamięci openpi: wnioskowanie powyżej 8 GB, LoRA powyżej 22.5 GB, pełne dostrajanie powyżej 70 GB. To ostatnie jest powodem, dla którego Pi0.5 to zadanie dla A100.
  • Wynajmij GPU samodzielnie, zniszcz je później, ręcznie uzgodnij trzy zestawy ścieżek punktów kontrolnych.

Model bazowy czy od podstaw

Prawdziwy dylemat nie polega na wyborze modelu 3 B. Chodzi o to, czy w ogóle używać wstępnie wytrenowanego VLA, biorąc pod uwagę, że ACT nauczył się sześciu rzeczywistych zadań bimanualnych z około dziesięciu minut demonstracji każdego, z 80 milionami parametrów i niczym niewytrenowanym.

Dostrajanie wstępnie wytrenowanego VLA zamiast trenowania ACT od podstaw
Co zyskujesz
  • Warunkowanie językowe. ACT nie ma żadnego; jeden punkt kontrolny ACT wykonuje jedno zadanie.
  • Lepsze na obiektach nieobecnych w Twoich demonstracjach: na SO-101, 50% w porównaniu do 40% ACT poza dystrybucją.
  • W ogóle wielozadaniowość: SmolVLA osiąga 78.3% w trzech zadaniach SO-100 z jednym punktem kontrolnym; ACT był uruchamiany tylko jako jednorazowe zadanie.
Co Cię to kosztuje
  • 7.6x do 24x większe opóźnienie: 152 do 485 ms na krok akcji w porównaniu do 20 ms ACT.
  • 4 do 12 USD za uruchomienie zamiast 1 do 3, i warstwa A100 zamiast dowolnej karty 24 GB.
  • Ryzyko licencyjne, plus tryb awarii z powodu zamkniętego repozytorium, który nie istnieje przy tworzeniu od podstaw.
  • Wstępnie wytrenowane wagi mogą maskować zły zbiór danych. Dostrojenie, które działa w połowie na uszkodzonych danych, kosztuje tydzień, zanim spojrzysz na dane.

Przypadek odtwarzania starego uruchomienia

Dążenie do punktu kontrolnego z 2025 roku sprawia, że wybór modelu jest dokonany za Ciebie i zmienia problem w przypinanie wersji: obecny LeRobot odrzuca N1.5, więc przypinasz lerobot==0.5.1. Bez pola seed i z 5 do 6 procentową wariancją między uruchomieniami, reprodukcja jest z założenia przybliżona. i mają stronę platformy.

Strona porównawcza AY-Robots dla GR00T N1.7 kontra Pi0.5, pokazująca obok siebie liczbę parametrów, wymagania GPU, opóźnienie wnioskowania, format zbioru danych i minimalną liczbę epizodów
Porównanie bezpośrednie na /compare/groot-n1-7-vs-pi0-5. Dwa modele 3 B wyglądają na zamienne w arkuszu specyfikacji, ale takie nie są: jeden wymaga LeRobot v2.1, drugi v3.0.

Zostały dwa? ACT kontra GR00T N1.7 i GR00T N1.7 kontra SmolVLA. Surowe wiersze znajdują się w wpisach areny: GR00T N1.7, Pi0.5, SmolVLA i ACT.

W czym ta platforma Ci nie pomoże

  • Nie może przyspieszyć zdalnego wnioskowania. Pętla od 20 do 485 ms należy do modelu; podróże w obie strony przez internet dodają do tego czasu.
  • Nie może dostroić GR00T ani Pi0.5 na Twoim własnym sprzęcie. Oba są tutaj tylko w chmurze; tylko SmolVLA i ACT działają lokalnie.
  • Nie może naprawić zbioru danych. Spadek straty, ale polityka nic nie robi to problem z danymi, polityka, która działa tylko w jednej konfiguracji to problem z pokryciem.
  • Nie może sprawić, że uruchomienia GR00T będą powtarzalne: konfiguracja nadrzędna nie ma pola seed.

85 modeli, 332 wyniki benchmarków, każda liczba połączona ze źródłem

Wersja tabel na tej stronie z możliwością sortowania: 85 modeli wizualno-językowo-akcyjnych, 332 wyniki benchmarków, każdy z linkiem do odpowiedniej pracy naukowej lub karty modelu.

Otwórz arenę

Wybieramy jeden i idziemy dalej

Jedna domyślna opcja: nagraj 50 epizodów, trenuj ACT za 1 do 3 USD, aby udowodnić przydatność zbioru danych, a następnie SmolVLA na tych samych danych. Razem poniżej 6 USD, a odpowiedzą na kluczowe pytanie: czy wstępne szkolenie tutaj pomaga, czy wąskim gardłem są dane. Przejdź na GR00T N1.7 dla zadań wieloetapowych z bogatym kontaktem, na Pi0.5, gdy zmienia się scena.

Przewodnik po platformie: trenuj swoją pierwszą politykę, a następnie uruchom swoją pierwszą politykę. Dokumentacja dotycząca szkolenia oraz dotycząca zbiorów danych obejmuje formę i format; strona SO-100 oraz kompletny przewodnik po SO-100 obejmują budowę i kalibrację. Tło: przegląd VLA oraz artykuł o dopasowywaniu przepływu Pi0. Ten, który zwiększy Twój wskaźnik sukcesu, to przewodnik po jakości danych.

Którą politykę VLA powinienem najpierw trenować na SO-100?

ACT, następnie SmolVLA. ACT trenuje od podstaw, więc nie może maskować złego zbioru danych, a uruchomienie kosztuje od 1 do 3 USD na karcie 24 GB. Jeśli ACT w ogóle wykona zadanie, 4 do 12 USD za uruchomienie GR00T N1.7 lub Pi0.5 nie zostanie zmarnowane.

Czy GR00T N1.7 jest faktycznie lepszy od Pi0.5?

Na LIBERO mieszczą się w granicach szumu: 97.0% w czterech zestawach dla GR00T N1.7, 96.85% dla Pi0.5 przy 30 tys. kroków w openpi, 97.5% dla portu LeRobot, wszystkie z różnych uprzęży. Rzeczywiste różnice to 152 ms na krok akcji wobec 485 ms, zbiory danych v2.1 wobec v3.0 oraz dokładność benchmarku wobec generalizacji w otwartym świecie.

Czy mogę dostroić którykolwiek z nich na pojedynczej karcie RTX 4090?

SmolVLA i ACT, tak; oba są wymienione dla RTX 4090 lub dowolnej karty 24 GB i działają lokalnie. GR00T N1.7, N1.5 i Pi0.5 wymagają A100 lub H100 80 GB i są tutaj dostępne tylko w chmurze. NVIDIA zaleca 40 GB lub więcej dla dostrajania GR00T; minimalne wymagania openpi to ponad 70 GB dla pełnego dostrojenia Pi0.5, 22.5 GB dla LoRA.

Które z tych pięciu mogę wykorzystać komercyjnie?

Wagi GR00T N1.7 podlegają umowie licencyjnej NVIDIA Open Model License Agreement, która według karty obejmuje użytek komercyjny. Wagi N1.5 są niekomercyjne. Kod SmolVLA to Apache 2.0 w LeRobot, ale karta lerobot/smolvla_base nie zawiera pola licencji, więc wagi są nieokreślone. ACT nie ma wag bazowych do licencjonowania. Pi0.5 jest niejednoznaczny: dokumentacja LeRobot mówi Apache 2.0, a metadane karty wskazują licencję: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started