
GR00T N1.7, Pi0.5, SmolVLA, ACT czy GR00T N1.5? Tabela decyzyjna dopasowana do rzeczywistych sytuacji, z opublikowanymi wynikami benchmarków, opóźnieniem, kosztem uruchomienia i licencjami stojącymi za każdym wyborem.
Pięć polityk można dziś trenować na ramieniu klasy SO-100. Różnią się one czynnikiem 24 w inferencji opóźnienia, 37 w liczbie parametrów i 12 w koszcie uruchomienia, oraz w tym, czy można wysłać wynik. Pięć kart modeli tego nie rozstrzygnie: żadna nie odpowiada na pytanie, które masz, którą uruchomić najpierw?
Każda liczba poniżej została odczytana z artykułów, repozytoriów i kart w sierpniu 2026. Numery platform pochodzą z katalogu polityk AY-Robots; tam, gdzie się różnią, pokazane są obie.
Wersja skrócona
- •Trenuj ACT najpierw, jeśli wątpisz w swój zbiór danych: 1 do 3 USD za uruchomienie, nic wstępnie wytrenowanego, aby zakryć złe dane.
- •GR00T N1.7 i Pi0.5 mieszczą się w granicach pół punktu na LIBERO, 97.0 wobec 96.85 do 97.5. To nie jest powód, aby wybrać którąkolwiek.
- •Pi0.5 to gra na generalizację, nie na dokładność, i najwolniejsza z 485 ms.
- •SmolVLA, z 450 M parametrami, to jedyny VLA tutaj, który dostraja się na jednej karcie 24 GB.
- •ACT z 20 ms to jedyna opcja dla szybkiego ruchu reaktywnego. Licencje decydują o reszcie.
Tabela decyzyjna
| Twoja sytuacja | Trenuj to | Dlaczego |
|---|---|---|
| Nieudowodniona jakość zbioru danych | ACT | Żaden wstępnie wytrenowany model nie ukryje uszkodzonego zbioru danych, a niepowodzenie kosztuje od 1 do 3 USD. |
| Bogate w kontakt, wieloetapowe, warunkowane językowo | GR00T N1.7 | 97,0% w czterech pakietach LIBERO, plus względna przestrzeń akcji efektora końcowego. |
| Szybki ruch reaktywny, wnioskowanie na serwach | ACT | 20 ms. Następny najszybszy jest 7,6 razy wolniejszy. |
| Nowe obiekty, nowa scena, otwarty świat | Pi0.5 | Zbudowany dla zachowań poza rozkładem, w maksymalnie 104 lokalizacjach. |
| Jedna karta 24 GB, nadal chcesz języka | SmolVLA | 450 M parametrów, minimum 30 epizodów, działa lokalnie. |
| Odtwarzanie przebiegu zarejestrowanego w 2025 roku | GR00T N1.5 | Tylko jeśli musisz: LeRobot teraz to odrzuca, wagi są niekomercyjne. |
| To zostanie wysłane jako produkt | N1.7, SmolVLA or ACT | N1.5 jest niekomercyjny, Pi0.5 podlega warunkom Gemma, karta SmolVLA nie określa żadnych. |
Pięciu kandydatów
Wszystkie pięć to polityki: klatki z kamery, pozycje przegubów oraz, dla czterech z nich, instrukcja językowa, mapowana na fragment przyszłych celów przegubów. To, co je różni, to ile zostało nauczone, zanim się pojawiłeś.
| Polityka | Parametry | Opóźnienie | Poziom GPU | Lokalnie? | Min. epizodów | Format | Koszt |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Obecny model wizualno-językowo-akcyjny firmy NVIDIA, około 3 mld parametrów, z czego około 40 mln wytrenowano podczas dostrajania. Repozytorium wymienia różnice w stosunku do N1.6: szkielet z modelu Eagle dostarczonego przez dostawcę do Cosmos-Reason2-2B na Qwen3-VL, warstwy dyfuzyjne z 32 do 16, wymiary stanu i akcji z 29 do 132, horyzont akcji z 16 do 40.
W przypadku małego ramienia liczy się względna przestrzeń akcji efektora końcowego: N1.7 przewiduje delty od aktualnej pozycji, co pozwala na przeniesienie 20 tysięcy godzin ludzkich nagrań wideo EgoScale do polityki robota. Specyfikacja na stronie N1.7, procedura w przewodniku N1.7 na SO-100.
Plik README Isaac-GR00T deklaruje N1.7 jako wydanie Ogólnej Dostępności, z pełnymi testami porównawczymi i wsparciem. Karta Hugging Face nie została jeszcze zaktualizowana: pole Model Version nadal wyświetla GR00T N1.7 EA. Repozytorium jest nowszym dokumentem.
GR00T N1.5
Ta sama skala 3 B, rdzeń Eagle 2, SigLip2 i T5, głowica DiT z dopasowaniem przepływu. Istnieje, aby rozszerzyć , który już posiadasz. Dwie rzeczy sprawiają, że jest to słaby wybór domyślny: wagi posiadają jednostronną, niekomercyjną licencję NVIDIA, a obecne wydania LeRobot usunęły wsparcie dla N1.5. Zobacz .
Pi0.5
VLA firmy Physical Intelligence z , typ polityki pi05. Artykuł przedstawia VLM o rozmiarze 2 B zainicjowany z PaliGemma plus eksperta akcji 300 M, sterującego robotem z częstotliwością 50 Hz; konfiguracja pi05 LeRobot domyślnie używa 50-krokowego fragmentu, jednej sekundy przy tej szybkości. Główną zaletą są nieznane miejsca: około 400 godzin mobilnej manipulacji w prawdziwych domach oraz badanie skalowania obejmujące 3, 12, 22, 53, 82 i 104 lokalizacje, gdzie model ze 104 lokalizacji dorównał kontroli wytrenowanej na samych domach testowych.
Jedno ograniczenie, podane na karcie lerobot/pi05_base: port przenosi tylko dopasowującą przepływ głowicę akcji. Przewidywanie podzadań, tokenizacja akcji i RL nie zostały udostępnione upstream, a openpi mówi to samo o swoim własnym repozytorium. Strona Pi0.5 i przewodnik Pi0.5 na SO-100 zawierają resztę.
Pi0.5 wymaga tokenizatora google/paligemma-3b-pt-224 z bramką (gated: manual, choć Google twierdzi, że żądania są przetwarzane natychmiast). Bez zaakceptowania go i uruchomienia hf auth login w środowisku treningowym, zadanie uruchamia się, pobiera przez chwilę, a następnie kończy się błędem autoryzacji, który wygląda jak awaria sieci. nvidia/GR00T-N1.7-3B nie ma bramki, ale jego rdzeń nvidia/Cosmos-Reason2-2B ma (gated: auto). Wyczyść oba przed dodaniem do kolejki; jeśli uruchomienie pozostaje bezczynne, strona z zablokowaną kolejką wymienia, co należy sprawdzić.
SmolVLA
450 M parametrów, około 100 M w ekspercie akcji, na SmolVLM-2 z zamrożonym VLM i tylko jego pierwsze 16 warstw modelu językowego. Wstępne szkolenie opierało się na danych społeczności: 481 zbiorów danych, 10.6 M klatek, z tych samych tanich ramion, których używasz. Jedyny VLA tutaj, który mieści się na jednej karcie 24 GB, i jedyny z progiem 30 epizodów. Zobacz stronę SmolVLA.
ACT
Nie jest to model podstawowy. Action Chunking Transformer z ALOHA to około 80 M parametrów trenowanych od podstaw dla każdego zadania, na 50 demonstracjach przy 50 Hz. Artykuł opisuje sześć rzeczywistych zadań dwuręcznych, z około dziesięciu minut demonstracji każde, osiągając 80 do 90 procent na przykładach, które podkreśla. Jego idea, action chunking, jest obecna w każdym modelu na tej stronie, a jego ablacja nadal mierzy najlepiej efekt: w dwóch symulowanych zadaniach z wyłączonym ensemblingiem czasowym, sukces wzrasta z 1 procenta przy k=1 do 44 procent przy k=100. Strona ACT zawiera resztę.
Co faktycznie mówią benchmarki
LIBERO to jeden z benchmarków, o którym raportują trzy z tych pięciu: zadania warunkowane językowo na symulowanym robocie Franka Panda, podzielone na cztery poniższe zestawy po dziesięć zadań każdy. NVIDIA przeprowadziła 200 prób dla każdego zestawu.
| Model | Przestrzenne | Obiektowe | Celowe | 10 (Długie) | Średnia |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Każda liczba pochodzi z innego zestawu testowego i budżetu. GR00T działał przez 20 tys. kroków przy globalnej partii 640; wartość openpi to punkt kontrolny 30 tys.; port LeRobot dodał 6 tys. kroków do modelu bazowego LIBERO. SmolVLA to dalsze niedopasowanie: jego artykuł trenuje ten wiersz na LIBERO od zera, bez wstępnego trenowania VLA, podczas gdy trzy powyżej dostrajają wstępnie wytrenowane punkty kontrolne. Traktuj 96.85 do 97.5 jako jedną grupę, a lukę do 87.3% jako rzeczywistą, ale uzyskaną kosztem 6.7x większej liczby parametrów.
SimplerEnv pokazuje rozrzut, czego nie robi LIBERO. NVIDIA porównuje N1.7 z N1.6, co jest najbliższą publiczną rzeczą do generational delta..
| Zestaw SimplerEnv | Średnia N1.6 | Średnia N1.7 | Najlepsza zmiana | Najgorsza zmiana |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
Wiersz Bridge jest tym użytecznym: średnio 5.7 punktu zysku, podczas gdy put_eggplant_in_basket stracił 36, a put_eggplant_in_sink spadł z 33 do 2. Nowa generacja przesuwa rozkład zamiast go podnosić, więc jeśli twoje zadanie znajduje się tam, gdzie N1.7 zanotował regres, średnia nic nie mówi.

Spośród pięciu, tylko publikacja SmolVLA raportuje o ramieniu klasy SO-100: 78.3 procent dla SmolVLA i 61.7 dla Pi0 w trzech zadaniach, oba wielozadaniowe, w porównaniu do 48.3 dla ACT trenowanego jednorazowo, co nie jest porównaniem jeden do jednego. Czyste porównanie to oba jednorazowe zadania na SO-101 typu pick-and-place: 90 do 70 w dystrybucji, 50 do 40 poza nią. Porównaj na ACT kontra SmolVLA i Pi0.5 kontra SmolVLA, lub przeglądaj arenę.
Opóźnienie i koszt decydują o wdrożeniu
Opóźnienie wnioskowania to ograniczenie, które ludzie odkrywają na końcu i żałują jako pierwsze. Polityka o pięć punktów lepsza w benchmarku, ale zajmująca pół sekundy na krok akcji, wygląda gorzej na Twoim biurku: dynamika kontaktu nie czeka.
Jedna uwaga: dane GR00T nie zgadzają się z kartą NVIDIA, która mierzy 4 kroki odszumiania i jedną kamerę na 85.8 ms na H100 w trybie eager, 48.6 ms z torch.compile, 27.9 ms przez pełny TensorRT. Wartość 152 ms tutaj to wynik dla całego stosu, uwzględniający narzut serwowania i więcej niż jedną kamerę, a nie tylko przejście w przód.
Pętla od 20 do 485 ms należy do modelu, a do tego dochodzą czasy podróży w obie strony przez publiczny internet. Zdalne wnioskowanie jest wykonalne dla wolnego podnoszenia i odkładania (pick-and-place), ale nie dla szybkiego ruchu reaktywnego. Jeśli Twoje zadanie wymaga szybkości, wnioskowanie odbywa się obok serwomechanizmów: ACT lub SmolVLA, lokalnie. Powiązane: polityka zawiesza się w trakcie ruchu.
Jednym ze sposobów na zaoszczędzenie czasu bez zmiany modelu jest to, że artykuł SmolVLA mierzy wykonanie synchroniczne, gdzie polityka kończy fragment przed przewidzeniem następnego, w porównaniu do asynchronicznego, gdzie przewidywanie nakłada się na wykonanie. Sukces jest podobny, 78.3 wobec 73.3, ale to samo zadanie podnoszenia i odkładania zajmuje 9.7 sekundy zamiast 13.75, a w ustalonym oknie robot wykonuje 19 cykli zamiast 9.
Licencje, sprawdzone bo nikt ich nie sprawdza
| Model | Licencja wag | Licencja kodu | Użycie komercyjne |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; karta zezwala na użycie komercyjne | Apache 2.0 | tak |
| GR00T N1.5 | Jednostronna licencja niekomercyjna NVIDIA | Apache 2.0 | nie |
| Pi0.5 | metadane karty pi05_base wskazują licencję: gemma | Apache 2.0 (openpi, dokumentacja LeRobot) | przeczytaj oba, są sprzeczne |
| SmolVLA | brak pola licencji na karcie smolvla_base | Apache 2.0 (LeRobot) | kod tak, wagi nieokreślone |
| ACT | brak bazowych wag | Apache 2.0 (LeRobot) | tak |
Wiersz Pi0.5 wymaga uwagi. Dokumentacja LeRobot pi05 podaje Apache 2.0, co jest zgodne z openpi, podczas gdy karta Hub dla lerobot/pi05_base zawiera license: gemma. Obie są aktywne. GR00T N1.7 ma łagodniejszą wersję: plik README Isaac-GR00T mimochodem wspomina, że N1.7 jest w pełni licencjonowalny komercyjnie na podstawie Apache 2.0, podczas gdy jego własna sekcja licencyjna i karta modelu umieszczają tylko kod pod Apache 2.0, a wagi pod NVIDIA Open Model License.
Domyślne ustawienia, które faktycznie uruchomisz
Każda forma trenera dostarcza domyślne ustawienia, które nie są przypadkowe. Ustawienia ACT są własnymi ustawieniami LeRobot: batch 8, lr 1e-5, 100000 kroki treningowe, rozmiar chunka 100, pasujący do ACTConfig upstream i k=100 z artykułu ACT. Jedna kolumna poniżej to pułapka.
| Polityka | Partia | LR | Maks. kroki | Grad accum | Dotyczy? | Dodatkowe parametry |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | tak | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | tak | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | nie (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | nie | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | nie | chunkSize, nActionSteps, seed, logFreq |
Punkt wejścia do dostrajania GR00T (launch_finetune.py, CLI tyro) nie posiada pola seed w swojej klasie danych konfiguracyjnych, więc uruchomienia nie są odtwarzalne bit po bicie. Repozytorium ostrzega również przed 5 do 6 procentową wariancją między uruchomieniami wynikającą z niedeterministycznych augmentacji obrazu, co jest większe niż większość różnic w benchmarkach, o których dyskutuje się online. Domyślne ziarno LeRobot to 1000. Kolumna grad-accum opisuje lerobot 0.5.1; upstream 0.6.2 udostępnia ją jako --accelerator.gradient_accumulation.steps.
Parametr, który ma większe znaczenie niż wybór modelu
Jest to fragment akcji. Dłuższe fragmenty zapewniają płynniejszy ruch i mniej narastających błędów, ale polityka jest zatwierdzona podczas wykonywania bloku, więc reaguje późno na wszystko, co się porusza: pewna siebie na statycznej kostce, beznadziejna na toczącej się. Jeśli przekroczy cel, skrócenie wykonanej części jest lepsze niż ponowne szkolenie i jest darmowe. Staw, który zatrzymuje się za wcześnie, to inny problem; zobacz .
- ACT: ACTConfig domyślnie używa
chunk_size 100in_action_steps 100. Ensembling czasowy jest wyłączony i wymagan_action_steps 1. - GR00T N1.7: wewnętrzny horyzont wzrósł z 16 do 40, jednak przykład SO-101 LeRobota nadal działa z
--policy.chunk_size=16 --policy.n_action_steps=16. Flaga rollout została zmieniona na--execution-horizon. - Pi0.5: fragment 50-krokowy, z którego przepis LIBERO LeRobota wykonuje 10 za pomocą
--policy.n_action_steps=10; z--policy.pretrained_pathwraca do 50, jeśli pominiesz flagę. - SmolVLA: 50-akcyjne fragmenty, oba parametry dostępne.
Jak przetestować wszystkich pięć w jedno popołudnie
Najtańsza odpowiedź to nie więcej czytania. Wydaj około 15 USD i pozwól ramieniu ci powiedzieć: nagraj raz, najpierw wytrenuj tani model, a następnie eskaluj, gdy dane okażą się poprawne. Struktura przewyższa objętość, co jest celem i .
- 1Nagraj 50 epizodów raz
Pięćdziesiąt przygotowuje grunt dla GR00T, Pi0.5 i ACT, oraz 30 dla SmolVLA. Powtórz każdą wariację, zamiast rozpraszać się: 50 epizodów w 5 pozycjach kostki, gdzie 25 nie było trenowanych. Zobacz nagrywanie pierwszego zbioru danych.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Najpierw wytrenuj ACT, ponieważ nie może cię okłamać
Brak wstępnie wytrenowanych wag, więc jeśli w ogóle wykonuje zadanie, twój zbiór danych zawiera to zadanie. Jeśli ACT nie działa, napraw dane. 1 do 3 USD, 2 do 5 godzin na karcie 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Uruchom SmolVLA na tym samym zbiorze danych, bez zmian
Te same dane, to samo ramię, 450 M parametrów zamiast 80 M, plus warunkowanie językowe. LeRobot szacuje uruchomienie 20 tys. kroków na około 4 godziny na jednym A100. To właśnie mówi ci, czy wstępne trenowanie cokolwiek daje.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Konwertuj do v2.1 zanim zaczniesz używać GR00T
GR00T odczytuje wariant formatu LeRobot v2 plus dodatkowy plik
meta/modality.jsonmapujący, jak połączone tablice stanu i akcji dzielą się na nazwane pola. Zbiór danych w wersji v3.0 powoduje awarię tego ładowania, ponieważ v3.0 pakuje wiele epizodów do współdzielonych plików, podczas gdy v2 zapisywało jeden na epizod. Isaac-GR00T dostarcza pomocnika do obniżania wersji jakoscripts/lerobot_conversion/convert_v3_to_v2.py; strona odrzucenia v3 to szybka ścieżka.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Przejdź na GR00T N1.7 tylko wtedy, gdy pierwsze dwa rozwiązania nie przyniosły pełnych rezultatów
Poprzez CLI NVIDIA, pokazane tutaj, lub typ polityki
grootLeRobot. NVIDIA zaleca 40 GB lub więcej VRAM do dostrajania, 16 GB do wnioskowania. W przypadku OOM, zobacz stronę OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dwa sposoby na przeprowadzenie tego wstępnego testu
Trzy środowiska, ponieważ łańcuchy narzędzi nie współistnieją. LeRobot na głównym to 0.6.2 i wymaga Pythona 3.12 lub nowszego; Isaac-GR00T i openpi to oddzielne repozytoria zarządzane przez uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T przypina
torchcodec0.8.0 jako swój jedyny backend wideo, wymagający FFmpeg 4 do 7. FFmpeg 8 nie jest obsługiwany, AV1 nie jest gwarantowany. - Minimalne wymagania pamięci openpi: wnioskowanie powyżej 8 GB, LoRA powyżej 22.5 GB, pełne dostrajanie powyżej 70 GB. To ostatnie jest powodem, dla którego Pi0.5 to zadanie dla A100.
- Wynajmij GPU samodzielnie, zniszcz je później, ręcznie uzgodnij trzy zestawy ścieżek punktów kontrolnych.
Te same pięć modeli, jedna forma. Wybierz model, zbiór danych i hiperparametry; backend wynajmuje GPU o rozmiarze wymaganego VRAM, uruchamia trener i zapisuje punkty kontrolne do pamięci obiektowej.
- Macierz treningowa to pięć modeli na cztery ramiona, każda komórka to przewodnik: SmolVLA na SO-100, ACT na SO-101.
- Pody wnioskowania są automatycznie udostępniane przez
/api/inference/podz nadzorcą bezczynności, więc zapomniany pod nie nalicza opłat w tle. - Bazowe punkty kontrolne pochodzą od dostawców:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT nie ma żadnych. - Te same operacje z CLI i od agentów AI poprzez serwer MCP.
- Brak sprzętu? Ramię na żywo streamuje fizyczne SO-100 bez rejestracji; strona próbna pokazuje sposoby dostępu.
Model bazowy czy od podstaw
Prawdziwy dylemat nie polega na wyborze modelu 3 B. Chodzi o to, czy w ogóle używać wstępnie wytrenowanego VLA, biorąc pod uwagę, że ACT nauczył się sześciu rzeczywistych zadań bimanualnych z około dziesięciu minut demonstracji każdego, z 80 milionami parametrów i niczym niewytrenowanym.
- Warunkowanie językowe. ACT nie ma żadnego; jeden punkt kontrolny ACT wykonuje jedno zadanie.
- Lepsze na obiektach nieobecnych w Twoich demonstracjach: na SO-101, 50% w porównaniu do 40% ACT poza dystrybucją.
- W ogóle wielozadaniowość: SmolVLA osiąga 78.3% w trzech zadaniach SO-100 z jednym punktem kontrolnym; ACT był uruchamiany tylko jako jednorazowe zadanie.
- 7.6x do 24x większe opóźnienie: 152 do 485 ms na krok akcji w porównaniu do 20 ms ACT.
- 4 do 12 USD za uruchomienie zamiast 1 do 3, i warstwa A100 zamiast dowolnej karty 24 GB.
- Ryzyko licencyjne, plus tryb awarii z powodu zamkniętego repozytorium, który nie istnieje przy tworzeniu od podstaw.
- Wstępnie wytrenowane wagi mogą maskować zły zbiór danych. Dostrojenie, które działa w połowie na uszkodzonych danych, kosztuje tydzień, zanim spojrzysz na dane.
Przypadek odtwarzania starego uruchomienia
Dążenie do punktu kontrolnego z 2025 roku sprawia, że wybór modelu jest dokonany za Ciebie i zmienia problem w przypinanie wersji: obecny LeRobot odrzuca N1.5, więc przypinasz lerobot==0.5.1. Bez pola seed i z 5 do 6 procentową wariancją między uruchomieniami, reprodukcja jest z założenia przybliżona. i mają stronę platformy.

Zostały dwa? ACT kontra GR00T N1.7 i GR00T N1.7 kontra SmolVLA. Surowe wiersze znajdują się w wpisach areny: GR00T N1.7, Pi0.5, SmolVLA i ACT.
W czym ta platforma Ci nie pomoże
- Nie może przyspieszyć zdalnego wnioskowania. Pętla od 20 do 485 ms należy do modelu; podróże w obie strony przez internet dodają do tego czasu.
- Nie może dostroić GR00T ani Pi0.5 na Twoim własnym sprzęcie. Oba są tutaj tylko w chmurze; tylko SmolVLA i ACT działają lokalnie.
- Nie może naprawić zbioru danych. Spadek straty, ale polityka nic nie robi to problem z danymi, polityka, która działa tylko w jednej konfiguracji to problem z pokryciem.
- Nie może sprawić, że uruchomienia GR00T będą powtarzalne: konfiguracja nadrzędna nie ma pola seed.
85 modeli, 332 wyniki benchmarków, każda liczba połączona ze źródłem
Wersja tabel na tej stronie z możliwością sortowania: 85 modeli wizualno-językowo-akcyjnych, 332 wyniki benchmarków, każdy z linkiem do odpowiedniej pracy naukowej lub karty modelu.
Otwórz arenęWybieramy jeden i idziemy dalej
Jedna domyślna opcja: nagraj 50 epizodów, trenuj ACT za 1 do 3 USD, aby udowodnić przydatność zbioru danych, a następnie SmolVLA na tych samych danych. Razem poniżej 6 USD, a odpowiedzą na kluczowe pytanie: czy wstępne szkolenie tutaj pomaga, czy wąskim gardłem są dane. Przejdź na GR00T N1.7 dla zadań wieloetapowych z bogatym kontaktem, na Pi0.5, gdy zmienia się scena.
Przewodnik po platformie: trenuj swoją pierwszą politykę, a następnie uruchom swoją pierwszą politykę. Dokumentacja dotycząca szkolenia oraz dotycząca zbiorów danych obejmuje formę i format; strona SO-100 oraz kompletny przewodnik po SO-100 obejmują budowę i kalibrację. Tło: przegląd VLA oraz artykuł o dopasowywaniu przepływu Pi0. Ten, który zwiększy Twój wskaźnik sukcesu, to przewodnik po jakości danych.
Którą politykę VLA powinienem najpierw trenować na SO-100?▾
ACT, następnie SmolVLA. ACT trenuje od podstaw, więc nie może maskować złego zbioru danych, a uruchomienie kosztuje od 1 do 3 USD na karcie 24 GB. Jeśli ACT w ogóle wykona zadanie, 4 do 12 USD za uruchomienie GR00T N1.7 lub Pi0.5 nie zostanie zmarnowane.
Czy GR00T N1.7 jest faktycznie lepszy od Pi0.5?▾
Na LIBERO mieszczą się w granicach szumu: 97.0% w czterech zestawach dla GR00T N1.7, 96.85% dla Pi0.5 przy 30 tys. kroków w openpi, 97.5% dla portu LeRobot, wszystkie z różnych uprzęży. Rzeczywiste różnice to 152 ms na krok akcji wobec 485 ms, zbiory danych v2.1 wobec v3.0 oraz dokładność benchmarku wobec generalizacji w otwartym świecie.
Czy mogę dostroić którykolwiek z nich na pojedynczej karcie RTX 4090?▾
SmolVLA i ACT, tak; oba są wymienione dla RTX 4090 lub dowolnej karty 24 GB i działają lokalnie. GR00T N1.7, N1.5 i Pi0.5 wymagają A100 lub H100 80 GB i są tutaj dostępne tylko w chmurze. NVIDIA zaleca 40 GB lub więcej dla dostrajania GR00T; minimalne wymagania openpi to ponad 70 GB dla pełnego dostrojenia Pi0.5, 22.5 GB dla LoRA.
Które z tych pięciu mogę wykorzystać komercyjnie?▾
Wagi GR00T N1.7 podlegają umowie licencyjnej NVIDIA Open Model License Agreement, która według karty obejmuje użytek komercyjny. Wagi N1.5 są niekomercyjne. Kod SmolVLA to Apache 2.0 w LeRobot, ale karta lerobot/smolvla_base nie zawiera pola licencji, więc wagi są nieokreślone. ACT nie ma wag bazowych do licencjonowania. Pi0.5 jest niejednoznaczny: dokumentacja LeRobot mówi Apache 2.0, a metadane karty wskazują licencję: gemma.
Sources
- Repozytorium NVIDIA Isaac-GR00T: status GA, zmiany z N1.6 na N1.7, wymagania sprzętowe, ograniczenia torchcodec i FFmpeg, launch_finetune.py, zmienność między uruchomieniami
- Karta modelu nvidia/GR00T-N1.7-3B: rdzeń Cosmos-Reason2-2B, 3 mld parametrów, tabela czasów wnioskowania, licencja NVIDIA Open Model License, pole Model Version
- Karta modelu nvidia/GR00T-N1.5-3B: odniesienie do Eagle 2, SigLip2 i T5, flow matching DiT, jednostronna licencja niekomercyjna
- Przykład Isaac-GR00T LIBERO: wskaźniki sukcesu dla każdego zestawu przy 20 tys. kroków i rozmiarze partii 640, 200 prób na zestaw
- Przykład Isaac-GR00T SimplerEnv: wskaźniki sukcesu dla zadań Bridge i Fractal, GR00T N1.6 kontra N1.7
- pi0.5: Model Wizualno-Językowo-Akcyjny z Generalizacją w Otwartym Świecie (2 mld VLM plus 300 mln ekspert akcji, sterowanie 50 Hz, około 400 godzin manipulacji mobilnej, badanie skalowania w 3 do 104 lokalizacjach)
- Repozytorium openpi: minimalne wymagania pamięci GPU, zakres tylko dla flow-matching-head, oraz wyniki Pi0.5 LIBERO w examples/libero
- Karta modelu lerobot/pi05_base: zakres portu LeRobot, metadane licencji: gemma, użycie lerobot-train
- Dokumentacja LeRobot pi0.5: tokenizator PaliGemma z bramkowaniem, tabela reprodukcji LIBERO, pułapka awaryjna n_action_steps, oświadczenie Apache 2.0
- SmolVLA: Model Wizualno-Językowo-Akcyjny dla Przystępnej i Wydajnej Robotyki (450 mln parametrów, tabele LIBERO i Meta-World, wyniki SO-100 i SO-101, asynchroniczne wnioskowanie)
- Dokumentacja LeRobot SmolVLA: 50 epizodów w 5 pozycjach wobec 25, 20 tys. kroków w około 4 godziny na A100
- Uczenie Precyzyjnej Manipulacji Dwuręcznej z Niskokosztowym Sprzętem (ACT i ALOHA): 6 zadań na poziomie 80-90 procent, ablacja rozmiaru chunka od k=1 do k=100
- LeRobot 0.6.2: domyślne ustawienia ACTConfig i SmolVLAConfig, domyślne ziarno 1000, --accelerator.gradient_accumulation.steps, wymaganie Python 3.12, Apache 2.0
- Dokumentacja LeRobot GR00T: typ polityki groot, usunięto wsparcie dla N1.5, przypięcie lerobot==0.5.1, przykład rozmiaru chunka SO-101
- Karta modelu lerobot/smolvla_base: bazowy punkt kontrolny SmolVLA używany przez --policy.path, oraz jego metadane karty, które nie zawierają pola licencji
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started