
Rzeczywiste ceny GPU na rynku spot, jak długo działa każda z pięciu polityk, ile kosztuje ramię i demonstracje, oraz cztery miejsca, gdzie pieniądze cicho znikają.
Wersja skrócona
- •Uruchomienie na poziomie A100 80 GB lub H100 trwa od 3 do 6 godzin i kosztuje około 4 do 12 USD. Na poziomie RTX 4090 trwa od 2 do 5 godzin i kosztuje około 1 do 3 USD.
- •Zmierzono na vast.ai o 13:44 UTC 23 sierpnia 2026: pełny RTX 4090 na żądanie za 0.13 do 0.38 USD/h, A100 80 GB za 0.44 do 0.67, H100 80 GB za 1.34 do 2.34. Pełne karty 80 GB są rzadkie, odpowiednio dwie i pięć ofert pojedynczych kart.
- •GPU to najtańsza pozycja. Zestawienie materiałów SO-ARM100 wycenia parę lidera i naśladowcy na 229.88 USD, co odpowiada 77 do 230 uruchomieniom na poziomie 24 GB.
- •Dwie godziny nagrywania 50 epizodów przez jedną osobę kosztują więcej niż uruchomienie treningowe, które te epizody zasilają.
- •Pieniądze znikają w czterech miejscach: uruchomienia na uszkodzonych danych, modele 3B dla zadań obsługiwanych przez politykę 80M, GPU, których nikt nie zniszczył, oraz ponowne uruchomienia wyniku, którego nie udało się zachować.
- •AY-Robots dobiera kartę według potrzebnej modelowi pamięci VRAM i wynajmuje ją na tym samym rynku spot, więc koszt uruchomienia jest kosztem rynkowym.
Rachunek ma cztery pozycje, a GPU jest najmniejszą z nich
Kiedy ludzie pytają, ile kosztuje dostrojenie modelu wizualno-językowo-akcyjnego dla SO-100, prawie zawsze mają na myśli wynajem GPU. To jest liczba, która pojawia się jako obciążenie na karcie, więc to ona wydaje się realna. Jest to również, z dużą przewagą, najmniejsza z czterech liczb, które decydują o tym, ile faktycznie kosztuje działająca polityka faktycznie kosztuje.
| Pozycja | Co to jest | Typowa wielkość dla jednej działającej polityki |
|---|---|---|
| Czas GPU | wynajem karty na uruchomienie | 1 do 12 USD za uruchomienie, a wykonasz od 3 do 5 |
| Robot | serwa, wydrukowana rama, kamery, kable, zasilanie | jednorazowo, 110 do 500 EUR za ramię |
| Godziny pracy człowieka | osoba sterująca ramieniem do nagrywania demonstracji | 1 do 4 godzin na zestaw danych, powtarzane dla każdego zadania |
| Marnotrawstwo | złe dane, zbyt duże modele, zapomniane pody | nieograniczone i jedyna pozycja, którą kontrolujesz |
Poniższe czasy szkolenia pochodzą z własnych artykułów i repozytoriów pięciu modeli, koszt sprzętu z opublikowanego zestawienia materiałów, a dane platformy z AY-Robots katalogu polityk i strony z cennikiem. Tam, gdzie platforma nie pomaga, artykuł o tym wspomina.
Ile faktycznie kosztuje godzina GPU na rynku spot
Nie ma jednej ceny za godzinę A100. Na platformie takiej jak vast.ai każdy host ustala własną stawkę, a uruchomienie szkolenia, które uruchamiasz, trafia na maszynę, która jest tania i wolna w danej chwili. Uczciwa odpowiedź to rozkład. Oto on, zmierzony 23 sierpnia 2026 o 13:44 UTC: pojedyncze pełne karty, na żądanie, filtrowane według rzeczywistej pamięci VRAM.
| Karta | vast.ai na żądanie USD/h (niska / mediana / wysoka) | Oferty pełnych kart | vast.ai cena minimalna | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | nieoferowane |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | nieoferowane |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 jako przestrzeń |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 jako punkt końcowy |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | nieoferowane |
Oferty na żądanie dla pojedynczego pełnego GPU (gpu_frac == 1.0) z publicznego API pakietów vast.ai, które nie wymaga konta, filtrowane według gpu_ram, tak aby tylko prawdziwe karty 80 GB trafiały do wierszy 80 GB. Ten filtr ma znaczenie: w tym odczycie wszystkie trzy oferty pojedynczych kart A100 SXM4 były częściami 40 GB, podobnie jak dwie z czterech ofert A100 PCIE, więc połączenie ich w jeden wiersz „A100” zmniejszyłoby o połowę cenę podaną tutaj. Kolumna Hugging Face łączy dwa produkty: 2.50 USD/h to sprzęt Nvidia A100 - large Spaces, a 4.50 USD/h to pojedynczy H100 80 GB w ramach Inference Endpoints, czego Spaces nie oferuje. Traktuj mediany jako orientacyjne: wiersz A100 80 GB opiera się na dwóch ofertach, a wiersz H100 na pięciu, a identyczne zapytanie 36 sekund później zwróciło inną liczbę 4090 i inną najwyższą cenę w trzech z pięciu wierszy. Ceny katalogowe RunPod są bardziej stabilną liczbą do planowania.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Dlaczego modele 3B nie mogą używać taniej karty
Godzina pracy na 4090 i godzina pracy na H100 80 GB różnią się mniej więcej sześciokrotnie, biorąc pod uwagę powyższe mediany. To, co zmusza do użycia droższej karty, to nie szybkość, lecz pamięć. openpi określa minimalne wymagania dla pełnego Pi0.5 dostrajania na 70 GB, a NVIDIA zaleca 40 GB lub więcej dla GR00T. Zauważ, czym nie jest liczba dla GR00T. Jego konfiguracja dostrajania domyślnie zamraża model językowy i koder wizualny (tune_llm i tune_visual są ustawione na False, a projektor i głowica dyfuzyjna na True), dlatego katalog wymienia około 40 M wytrenowanych parametrów z 3 B. 40 GB to nie stan optymalizatora dla wag 3 B, to zamrożony szkielet plus aktywacje. Warianty o zmniejszonym zakresie wymagają mniej: ścieżka LoRA openpi wymaga 22.5 GB i wskazuje na 4090, a przepływ pracy NVIDIA Isaac Lab Arena wymienia opcję 24 GB na pojedynczej karcie GPU dla GR00T po treningu. Platforma dzieli się na poziomy w oparciu o minimalne wymagania, które każdy dostawca publikuje dla konfiguracji, którą faktycznie uruchamia. Opis dopasowania przepływu pi0 wyjaśnia, skąd bierze się ten dopasowania przepływu ślad.
| Zadanie | Pamięć wymagana przez projekt źródłowy | Źródło |
|---|---|---|
| pi0 / pi0.5 wnioskowanie | more than 8 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 dostrajanie LoRA | more than 22.5 GB, example RTX 4090 | openpi |
| pi0 / pi0.5 pełne dostrajanie | more than 70 GB, example A100 80 GB or H100 | openpi |
| GR00T N1.7 wnioskowanie | 1 GPU with 16 GB or more | Isaac-GR00T |
| GR00T N1.7 dostrajanie | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| GR00T dostrajanie, co trenuje | projector and diffusion head; LLM and visual encoder frozen by default | finetune_config.py |
| GR00T po treningu, zredukowane | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| SmolVLA dostrajanie | single A100 for the reference 20,000-step run | lerobot docs |
| ACT trening | a single 11 GB RTX 2080 Ti | ACT paper |
Ta tabela wyjaśnia, dlaczego platforma dzieli pięć modeli na dwa poziomy. GR00T N1.7, GR00T N1.5 i Pi0.5 działają na A100 80 GB lub H100, ponieważ tego wymagają dostawcy. SmolVLA i ACT działają na RTX 4090 lub dowolnej karcie 24 GB, ponieważ to jest naprawdę wystarczające.
Uruchomienie GR00T lub Pi0.5 na karcie 24 GB nie kończy się niepowodzeniem w zerowej sekundzie. Pobiera bazowy punkt kontrolny, buduje indeks zbioru danych, rozpoczyna pierwsze przejście w przód i umiera po kilkuset krokach z błędem CUDA out-of-memory. Zapłaciłeś za pobieranie i konfigurację, a nie otrzymałeś nic. Rozwiązania: brak pamięci podczas treningu.
Jak długo faktycznie działa każdy z pięciu modeli
Czas działania to druga połowa kosztu: 2.00 USD za godzinę jest nieistotne, jeśli zadanie trwa 40 minut, a rujnujące, jeśli trwa 40 godzin. Oto domyślne wartości, które AY-Robots faktycznie wysyła do trenera, wraz z oknem działania i kosztem dla każdej warstwy.
| Polityka | Warstwa GPU | Domyślna maks. liczba kroków | Domyślna partia (akumulacja gradientu) | Okno działania | Koszt za uruchomienie |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

Skąd pochodzą te okna uruchomieniowe z wyższego poziomu
- SmolVLA: dokumentacja lerobot podaje, że 20 000 kroków zajmuje około 4 godzin na pojedynczym A100. Platforma wykonuje te same 20 000 kroków na tańszej warstwie 24 GB, stąd okno czasowe zamiast stałych 4 godzin.
- ACT: oryginalna praca ALOHA podaje około 5 godzin na pojedynczej karcie 11 GB RTX 2080 Ti dla modelu z 80 milionami parametrów. Karta 4090 jest o kilka generacji nowsza, ale platforma przewiduje 100 000 kroków, więc okno czasowe wypada w tym samym miejscu.
- GR00T: referencyjny przepływ pracy NVIDIA dla generacji N1.6 podaje około 4 do 8 godzin dla 20 000 kroków przy partii 24 na ośmiu kartach L40S oraz 2 do 3 godzin dla 30 000 kroków przy partii 16 na pojedynczej karcie Ada 6000. Dostrajanie modelu 3B VLA na jednej karcie w ciągu kilku godzin jest normalne, a nie optymistyczne.
- Pi0.5: openpi nie publikuje danych dotyczących czasu rzeczywistego, ale podaje minimalne wymaganie 70 GB dla pełnego dostrojenia, co określa wymaganą kartę, a tym samym szybkość.
Warto zatrzymać się nad liczbą, za którą nie płacisz. Artykuł GR00T N1 podaje około 50 000 godzin GPU H100 na wstępne trenowanie modelu 2.2B, na klastrze do 1024 GPU, przy rozmiarze partii wstępnego trenowania 16 384 dla 200 000 kroków gradientowych. Przy zmierzonej powyżej stawce 1.34 do 2.34 USD za godzinę, daje to koszt wynajętych zasobów obliczeniowych rzędu 67 000 do 117 000 USD. Artykuł SmolVLA szacuje swój projekt na około 30 000 godzin GPU w ramach 481 zbiorów danych społeczności, 22.9K epizodów i 10.6M klatek. Dziedziczysz to wszystko za cenę pobrania; twoje 8 USD kupuje ostatnie 20 000 kroków. Dlaczego modele VLA są budowane w ten sposób obejmuje ten podział.
Ramię: jednorazowy koszt, który przyćmiewa rachunek za GPU
Przebieg treningowy kosztuje mniej niż lunch. Robot nie. Dlatego SO-100 ma znaczenie: to najtańsze ramię, które cała uczenie przez imitację toolchain faktycznie obsługuje.
| Ramię | Serwa | Napięcie | Koszt części | Wsparcie na AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | pełne, referencyjne ramię |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | pełne |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | kompatybilne |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | kompatybilne |
Nadrzędna lista materiałów w repozytorium SO-ARM100 jest bardziej szczegółowa i warto ją sprawdzić pod kątem swojego regionu: jej Części na Dwa Ramiona lista sumuje się do 229.88 USD lub 226.30 EUR dla konfiguracji lidera plus naśladowcy, a jej Części na Jedno Ramię Naśladowcy lista sumuje się do 121.94 USD lub 124.30 EUR. Sześć serw STS3215 po 13.89 USD każde to 83.34 z tych 121.94, więc serwa to ramię. Przy 1 do 3 USD za przebieg SmolVLA lub ACT, jedna para ramion jest warta od 77 do 230 przebiegów treningowych. Jeśli nadal wybierasz, SO-100 kontra SO-101 to porównanie, które ma znaczenie, ponieważ te dwa są na tyle podobne, że decyzja dotyczy dostępności, a nie możliwości.
STS3215 jest dostępny w wariancie 7.4 V i 12 V; repozytorium zauważa, że część 12 V wymaga również zasilania 12 V 5 A zamiast 5 V, więc te dwa nie są wymienne. Podanie 12 V do serw 7.4 V niszczy je, a sześć serw to dwie trzecie kosztu części ramienia naśladowcy. Sprawdź etykietę na każdym serwie przed pierwszym uruchomieniem. Jeśli serwa już zachowują się dziwnie: serwo nie reaguje, ramię drga, a następnie opada.
Godziny pracy człowieka: pozycja, której nikt nie umieszcza w arkuszu kalkulacyjnym
To jest liczba, która wywraca dyskusję o kosztach do góry nogami. Nagrywanie demonstracji to osoba poruszająca ramieniem robota, jeden epizod na raz, w czasie rzeczywistym. Nie ma tu możliwości przetwarzania wsadowego ani wynajmowania na sekundy. Rejestrator zbioru danych LeRobot jest dostarczany z domyślnymi ustawieniami, które ułatwiają obliczenia, wszystkie trzy potwierdzone w DatasetRecordConfig: 60 sekund na epizod, 60 sekund na zresetowanie sceny, 50 epizodów. Kolumna z pieniędzmi poniżej zakłada 15 USD za godzinę czyjejś pracy, co jest raczej założeniem niż liczbą platformy. Podstaw swoją własną stawkę; chodzi o proporcje.
- 1Nagraj zbiór danych z domyślnymi ustawieniami, za które faktycznie zostaniesz obciążony
To jest lerobot 0.6.1, wersja na PyPI z 3 sierpnia 2026. Zwróć uwagę na kształt CLI: nagrywanie odbywa się poprzez punkt wejścia konsoli
lerobot-record(lerobot.scripts.lerobot_record), a nie starą ścieżkę modułupython -m lerobot.scripts.record. AY-Robots celuje w wersję 0.5.1, a pakiet 0.5.1 deklaruje te same punkty wejścialerobot-recordilerobot-train, więc poniższy kształt jest stabilny dla obu. Trzy flagi czasowe to domyślne ustawienia upstream, więc jest to również polecenie, które zakłada arytmetyka w następnej tabeli.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Sprawdź, co nagrałeś, zanim wynajmiesz choćby minutę GPU
Inspekcja zbioru danych kosztuje zero USD za godzinę. Odkrycie tego samego problemu na podstawie krzywej strat kosztuje 2.00 USD za godzinę na poziomie H100 i informuje o tym cztery godziny za późno. Wypchnij zbiór danych i przejrzyj go w przeglądarce LeRobot, lub przeglądaj katalog zbiorów danych AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Trenuj i upewnij się, że punkt kontrolny przetrwa poda
Wynajęta maszyna jest z definicji tymczasowa, więc zapisuj punkty kontrolne w trwałym miejscu podczas działania. Dwie flagi decydują o tym, czy zachowasz to, za co zapłaciłeś.
--save_freqdomyślnie wynosi 20 000 kroków, więc domyślne uruchomienie SmolVLA na 20 000 kroków zapisuje swój pierwszy punkt kontrolny, gdy uruchomienie jest już zakończone; obniż tę wartość, zanim wynajmiesz cokolwiek przerywalnego.--save_checkpoint_to_hubwymaga--policy.repo_idi nie istnieje w lerobot 0.5.1, więc w tej wersji musisz samodzielnie skopiować katalog wyjściowy z maszyny. Poniższy rozmiar partii jest przykładem z dokumentacji upstream; formularz AY-Robots wysyła 2 dla SmolVLA i zapisuje do pamięci obiektowej w miarę pojawiania się punktów kontrolnych.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Epizody | Nagrywanie po 60 s | Resetowanie po 60 s | Czas rzeczywisty | Plus 20 procent ponownych nagrań | Przy 15 USD za godzinę pracy człowieka |
|---|---|---|---|---|---|
| 30, minimum dla SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, pozostałe cztery minima | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, komfortowy zbiór danych | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
Porównaj prawą kolumnę z kosztem uruchomienia wynoszącym od 1 do 12 USD. Przy tej założonej stawce, zestaw danych składający się z 50 epizodów kosztuje od dwóch do siedmiu razy więcej, aby go nagrać, niż aby na nim trenować, zanim uwzględnimy kalibrację, konfigurację kamery i epizody, które odrzucasz. Dlatego ma bezpośrednią wartość finansową. Przewodnik lerobot sugeruje co najmniej 50 epizodów, po 10 na każdą lokalizację obiektu; dokumentacja SmolVLA podaje, że 25-epizodowa wersja tego samego zadania była niewystarczająca.
Gdzie faktycznie uciekają pieniądze
1. Uruchomienia na danych, które nigdy nie miały szans zadziałać
Uruchomienie GR00T z 20 000 krokami na zestawie danych z dwoma zamienionymi strumieniami kamery kosztuje tyle samo, co na czystym zestawie danych, zajmuje tyle samo czasu i generuje krzywą strat, która wygląda dobrze. Błąd pojawia się na ramieniu, wiele godzin później. są rozliczane godzinowo, a diagnoza w dniach. Dwa objawy warte zapamiętania: zazwyczaj oznacza, że obserwacje nie zawierają tego, czego wymaga zadanie, oraz oznacza, że zestaw danych miał mniej wariacji, niż sądziłeś.
2. Płacenie cen modeli fundamentalnych za zadanie ze stałą kamerą
ACT ma około 80M parametrów i został zaprojektowany do trenowania od podstaw na 50 demonstracjach jednego zadania. GR00T N1.7 ma około 3B parametrów z wstępnie wytrenowanym szkieletem. Dla kamery zamocowanej na stałe, stałego stołu i jednego obiektu, model 80M często osiąga cel, działa z prędkością około 20 ms na krok akcji zamiast 152 ms i kosztuje od 1 do 3 USD za uruchomienie zamiast od 4 do 12. Wydaj 3 USD, aby sprawdzić, czy tani model działa, zanim wydasz 12 USD na drogi. ACT kontra SmolVLA i GR00T N1.7 kontra Pi0.5 pokazują, gdzie każdy z nich przestaje być właściwą odpowiedzią; arena modeli ma 85 modeli i 332 wyniki testów porównawczych.
3. Karta graficzna, o której zapomniałeś
Najtańszy błąd do uniknięcia i najczęstszy do popełnienia. Instancja uruchomiona w piątek w celu debugowania czegoś nalicza opłaty przez cały weekend w takiej samej stawce jak rzeczywiste uruchomienie.
| Karta | Mediana stawki w migawce | Bezczynność przez 24 h | Bezczynność przez 7 dni | To jest warte |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | około 27 uruchomień SmolVLA lub ACT po 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | około 12 uruchomień GR00T po 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | około 38 uruchomień GR00T po 8 USD |
W AY-Robots ta awaria jest wyeliminowana dla wnioskowania: pody udostępnione przez API wnioskowania posiadają mechanizm nadzoru bezczynności i niszczą się po okresie bezczynności. Jeśli wynajmujesz kartę samodzielnie, ten mechanizm nadzoru to Twoje przypomnienie w kalendarzu.
4. Płacenie dwukrotnie za tę samą odpowiedź
Punkt wejścia do dostrajania GR00T to interfejs CLI tyro, który nie ujawnia ziarna. Nie jest to ograniczenie platformy, lecz narzędzie nadrzędne: nie ma pola ziarna w gr00t/configs/finetune_config.py, a własne wskazówki dotyczące treningu w repozytorium ostrzegają, że uruchomienia różnią się o 5 do 6 procent, ponieważ augmentacje obrazu są niedeterministyczne. lerobot domyślnie używa ziarna 1000 zarówno w wersji 0.5.1, jak i 0.6.1, więc uruchomienia ACT, SmolVLA i Pi0.5 mogą przynajmniej zostać ponownie uruchomione z tą samą inicjalizacją i kolejnością danych. Nie jest to obietnica bitowo identycznych wag na GPU, ale to różnica między ponownym uruchomieniem a nowym eksperymentem. Jeśli uruchomienie GR00T wytworzy działającą politykę, a Ty nie zachowałeś punkt kontrolny, płacisz pełną cenę za wynik, który może różnić się bardziej niż różnica, którą ścigałeś. Istnieje drugi sposób na utratę punktu kontrolnego, za który zapłaciłeś: CLI domyślnie używa --save-total-limit 5, udokumentowanego jako maksymalna liczba punktów kontrolnych przechowywanych przed usunięciem starszych. Przechowywanie kosztuje centy; ponowne uruchomienie to 4 do 12 USD i sześć godzin.
Powyższe progi licytacji stanowią ułamek stawki na żądanie, a vast.ai twierdzi, że system licytacji może obniżyć koszty klienta o pięćdziesiąt procent lub więcej. Haczyk, ich własnymi słowami: instancja przerywalna może zostać wstrzymana w dowolnym momencie, jeśli inny użytkownik zaoferuje wyższą stawkę lub zostanie utworzone wynajęcie na żądanie dla tych samych zasobów, a ta pauza "zatrzymuje wszystkie uruchomione procesy". Na żądanie zawsze ma pierwszeństwo. Dobre dla uruchomienia, które zapisuje punkt kontrolny co kilkaset kroków, całkowita strata dla takiego, które zapisuje na końcu, co dokładnie dają domyślne ustawienia: Isaac-GR00T CLI zapisuje co --save-steps (domyślnie 1000), ale --save_freq lerobota domyślnie wynosi 20 000 kroków, więc domyślne uruchomienie SmolVLA zapisuje punkt kontrolny raz, na mecie. Obniż to, albo nie licytuj. Formularz szkoleniowy AY-Robots udostępnia pokrętło GR00T jako saveSteps.
- Najniższa dostępna stawka godzinowa.
- Pełna kontrola nad obrazem, wersją CUDA, rewizją lerobot lub Isaac-GR00T i każdą flagą.
- Licytacja przerywalna obniża stawkę o połowę, jeśli Twoje uruchomienie zapisuje punkty kontrolne wystarczająco często, aby przetrwać pauzę.
- Nic nie jest abstrahowane, więc gdy uruchomienie zachowuje się dziwnie, możesz zobaczyć dlaczego.
- Konfiguracja jest rozliczana według stawek GPU: sterowniki, zależności, wielogigabajtowy bazowy punkt kontrolny i pobieranie zestawu danych kosztują tyle samo za godzinę co szkolenie.
- Przebita instancja przerywalna zostaje wstrzymana, a jej procesy zakończone. Niezapisane uruchomienie to spalone pieniądze, a domyślne ustawienie lerobota zapisuje swój pierwszy punkt kontrolny na kroku 20 000.
- Nic nie niszczy poda za Ciebie. Powyższa tabela przestoju to rachunek za zapomnienie.
- Podaż pojedynczych pełnych kart 80 GB jest niewielka: w tym odczycie dwie oferty A100 80 GB i pięć H100 80 GB pełnych kart. Lista również się zmienia, więc najtańsza podana cena i cena, za którą faktycznie można wynająć, nie są tą samą liczbą.
- Każda godzina spędzona na infrastrukturze to godzina nie poświęcona na nagrywanie epizodów, które decydują o tym, czy polityka działa.
Robienie tego samodzielnie kontra wynajmowanie karty przez platformę
Wybierasz maszynę, budujesz środowisko i niszczysz poda. Stawka godzinowa to powyższa stawka rynkowa; wszystko inne to Twój czas.
- Znajdź kartę odpowiadającą wymaganej przez model pamięci VRAM: 24 GB dla ACT i SmolVLA, 80 GB dla GR00T i Pi0.5.
- Wynajmij na żądanie, jeśli uruchomienie nie może przetrwać pauzy, lub z możliwością przerwania, jeśli często tworzy punkty kontrolne.
- Zainstaluj zestaw narzędzi: lerobot dla ACT, SmolVLA i Pi0.5, repozytorium Isaac-GR00T z własnym launcherem tyro dla GR00T.
- W razie potrzeby przekonwertuj zbiór danych. Zbiór danych LeRobot v3.0 powoduje awarię loadera GR00T i musi zostać przekonwertowany do wersji v2.1.
- Uruchom, obserwuj stratę, przesyłaj punkty kontrolne w trwałe miejsce w miarę ich zapisywania.
- Zniszcz instancję, a następnie sprawdź, czy ją zniszczyłeś.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Realistyczny koszt jednego uruchomienia GR00T: 3 do 6 godzin na H100 80 GB po 1.34 do 2.34 USD za godzinę to 4 do 14 USD, plus 20 do 40 minut konfiguracji, która również jest płatna, plus Twój własny czas.
Wybierasz model, zbiór danych i hiperparametry w formularzu. Backend wynajmuje spot GPU o rozmiarze odpowiadającym wymaganej przez model pamięci VRAM, uruchamia trener i zapisuje punkty kontrolne do pamięci obiektowej.
- Wybierz swoją kombinację w matrycy treningowej: pięć modeli, cztery ramiona, jeden przewodnik na komórkę.
- Wskaż zbiór danych: nagrany za pomocą klienta desktopowego, identyfikator repozytorium Hugging Face, lub z własnej maszyny.
- Zaakceptuj wartości domyślne lub je dostosuj. Powyższa tabela przedstawia to, co faktycznie jest wysyłane do trenera.
- Backend wybiera kartę na podstawie wymaganej pamięci VRAM, więc nigdy nie musisz szukać GPU.
- Punkty kontrolne trafiają do pamięci obiektowej w miarę ich zapisywania, więc przerwane uruchomienie nie jest uruchomieniem straconym.
| Poziom | Modele | Czas uruchomienia | Koszt za uruchomienie |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | about 1 to 3 USD |
Czego nie robi: nie poprawia złego zbioru danych, nie nadaje GR00T seeda, którego nigdy nie miał, ani nie usuwa opisanego poniżej limitu opóźnień. Usuwa konieczność szukania GPU, budowania środowiska i poda, którego zapomniałeś zniszczyć. Mechanika znajduje się w dokumentacji treningowej.
Co platforma pobiera i jak wybiera kartę
Logika jest celowo nudna. Każdy model w katalogu, deklaruje poziom GPU; backend pobiera wymaganą pamięć VRAM i wynajmuje pasującą kartę na tym samym rynku spot, mierzoną powyżej. Dlatego podany koszt jest zakresem, a nie ceną. GR00T i Pi0.5 są tutaj dostępne tylko w chmurze ze względu na minimalne wymagania 40 GB i 70 GB. SmolVLA i ACT działają również lokalnie na Twojej własnej karcie 24 GB, gdzie koszt chmury wynosi zero, a energia elektryczna jest Twoim problemem.

Jedna opcja zasługuje na ostrzeżenie. Akumulacja gradientu faktycznie ma zastosowanie dla obu wariantów GR00T, więc jej zwiększenie pozwala na uzyskanie większej efektywnej partii na tej samej karcie. Dla Pi0.5 i SmolVLA nie ma ona zastosowania wcale: lerobot 0.5.1 nie ma opcji akumulacji gradientu w swojej konfiguracji treningowej, więc ustawienie tego pola na 16 nic nie kosztuje i nic nie daje. Jeśli zadanie w kolejce nigdy się nie uruchamia, strona o zadaniach zablokowanych w kolejce, opisuje, co należy sprawdzić; jeśli zestaw danych zostanie odrzucony przed rozpoczęciem uruchomienia, jest to prawie zawsze problem z formatem v3.0.
Wynajęta karta graficzna (GPU) obsługująca Twoją politykę przez publiczny internet dodaje opóźnienia do pętli sterowania, która już wynosi od 20 do 485 ms na krok akcji. Dobre dla wolnego podnoszenia i odkładania (pick-and-place), nie dla szybkiego ruchu reaktywnego. Wnioskowanie w chmurze dobrze ocenia punkt kontrolny, ale źle wykonuje manipulację produkcyjną: jeśli zadanie wymaga szybkości, obliczenia muszą znajdować się obok serwomechanizmów, a to jest koszt, którego ten artykuł nie może sprawić, że zniknie. Zobacz opóźnienie wnioskowania.
Opracowany budżet dla pierwszej działającej polityki
Wszystkie cztery linie razem, zaczynając od zera. Całkowity koszt GPU zakłada 3 do 5 uruchomień: pierwsze dowodzi, że potok działa, drugie ujawnia problem z danymi, trzecie lub czwarte to to, które zachowujesz.
| Linia | Ścieżka oszczędna | Ścieżka komfortowa |
|---|---|---|
| Ramię | Tylko SO-100 follower, 121.94 USD w BOM | leader plus follower, 229.88 USD w BOM |
| Model | SmolVLA lub ACT, warstwa 24 GB | GR00T N1.7, A100 80 GB lub H100 tier |
| Nagrane epizody | 30, minimum dla SmolVLA | 50 do 100 |
| Czas ludzki na nagrywanie | około 1 godz. 12 min | 2 do 4 godzin |
| Koszt jednego uruchomienia | 1 do 3 USD | 4 do 12 USD |
| Uruchomienia przed zadziałaniem | 3 do 5 | 3 do 5 |
| Całkowity wydatek na GPU | 3 do 15 USD | 12 do 60 USD |
| Największa pozycja na rachunku | ramię, potem Twój czas | ramię, potem Twój czas |
W przypadku robotów tej wielkości schemat się utrzymuje: obliczenia to błąd zaokrąglenia, sprzęt to rzeczywisty jednorazowy koszt, a godziny pracy ludzkiej to koszt cykliczny. Aby przetestować część szkoleniową przed zakupem czegokolwiek, punkty wejścia bez sprzętu pozwalają porównywać modele i wynająć GPU bez ramienia, a ramię na żywo to fizyczny SO-100, którym możesz sterować w przeglądarce bez rejestracji. Aby uzyskać pełny potok od początku do końca, kompletny przewodnik po SO-100 obejmuje konfigurację, teleoperację i szkolenie, a szkolenie pierwszej polityki to krótka wersja.

Ile kosztuje jedno pełne uruchomienie dostrajania VLA?▾
Około 4 do 12 USD dla GR00T N1.7, GR00T N1.5 lub Pi0.5 na poziomie A100 80 GB lub H100 (3 do 6 godzin po 1.20 do 2.00 USD za godzinę), oraz około 1 do 3 USD dla SmolVLA lub ACT na poziomie RTX 4090 (2 do 5 godzin po 0.30 do 0.60 USD za godzinę). Wynajęcie karty samodzielnie mieści się w tym samym zakresie po uwzględnieniu czasu konfiguracji, ponieważ jest rozliczane według stawki szkoleniowej.
Czy warto płacić za H100 zamiast A100 80 GB?▾
Dla pojedynczej polityki SO-100, zazwyczaj nie. Obie karty spełniają minimalne wymagania pamięciowe GR00T i Pi0.5, a w odczycie z 23 sierpnia 2026 roku pełna A100 80 GB kosztowała 0.44 USD za godzinę w porównaniu do 1.34 USD za H100 80 GB. H100 kończy pracę szybciej, więc część stawki wraca w postaci mniejszej liczby godzin, ale całkowity koszt jest nadal wyższy dla tak małego uruchomienia. Prawdziwym argumentem za H100 jest dostępność: pięć ofert pojedynczych H100 80 GB na tym rynku w porównaniu do dwóch A100 80 GB, a karta, której nie można wynająć, nie ma ceny.
Ile uruchomień potrzeba, zanim polityka faktycznie zadziała?▾
Zaplanuj od trzech do pięciu. Pierwsze potwierdza, że potok jest prawidłowo podłączony. Drugie zazwyczaj ujawnia problem z zestawem danych, taki jak strumień z kamery, który przestał działać w trakcie. Trzecie lub czwarte to to, które zatrzymasz.
Czy mogę trenować SmolVLA lub ACT na własnym GPU zamiast wynajmować?▾
Tak. Oba są obsługiwane lokalnie na AY-Robots i oba mieszczą się komfortowo w 24 GB; oryginalny artykuł ACT trenował swój model 80M w około 5 godzin na 11 GB RTX 2080 Ti. GR00T i Pi0.5 są tutaj tylko w chmurze, ponieważ udokumentowane minimalne wymagania dostrajania od dostawców to 40 GB i 70 GB, a największa karta konsumencka na rynku to 32 GB RTX 5090.
Dlaczego ta sama liczba kroków kosztuje różnie w zależności od modelu?▾
Kroki nie są porównywalne między politykami. ACT domyślnie używa 100 000 kroków w partii 8 na karcie 24 GB; GR00T N1.5 domyślnie używa 2 000 kroków w partii 1 z akumulacją gradientu 16 na karcie 80 GB. Rachunek to godziny pomnożone przez stawkę karty, na którą zmusza Cię zapotrzebowanie na pamięć, a nie licznik kroków.
Sprawdź, ile kosztowałoby Twoje uruchomienie, zanim je rozpoczniesz
Każda z pięciu polityk wymienia swój poziom GPU, czas uruchomienia i cenę za uruchomienie, a zaplecze szkoleniowe wynajmuje kartę na tym samym rynku spot, na którym mierzono te liczby.
Sprawdź cenySources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started