Tabela kosztów AY-Robots pokazująca, jakiego GPU potrzebuje każda z pięciu polityk, typowy czas działania i cena za uruchomienie, oraz ile epizodów jest potrzebnych, zanim polityka stanie się użyteczna
Szkolenie VLAKoszty GPUSO-100DostrajanieUczenie robotówBudżetowanie

Koszt szkolenia VLA: Ile naprawdę kosztuje uruchomienie dostrajania

AY-Robots ResearchAugust 23, 202623 min czytania

Rzeczywiste ceny GPU na rynku spot, jak długo działa każda z pięciu polityk, ile kosztuje ramię i demonstracje, oraz cztery miejsca, gdzie pieniądze cicho znikają.

Wersja skrócona

  • Uruchomienie na poziomie A100 80 GB lub H100 trwa od 3 do 6 godzin i kosztuje około 4 do 12 USD. Na poziomie RTX 4090 trwa od 2 do 5 godzin i kosztuje około 1 do 3 USD.
  • Zmierzono na vast.ai o 13:44 UTC 23 sierpnia 2026: pełny RTX 4090 na żądanie za 0.13 do 0.38 USD/h, A100 80 GB za 0.44 do 0.67, H100 80 GB za 1.34 do 2.34. Pełne karty 80 GB są rzadkie, odpowiednio dwie i pięć ofert pojedynczych kart.
  • GPU to najtańsza pozycja. Zestawienie materiałów SO-ARM100 wycenia parę lidera i naśladowcy na 229.88 USD, co odpowiada 77 do 230 uruchomieniom na poziomie 24 GB.
  • Dwie godziny nagrywania 50 epizodów przez jedną osobę kosztują więcej niż uruchomienie treningowe, które te epizody zasilają.
  • Pieniądze znikają w czterech miejscach: uruchomienia na uszkodzonych danych, modele 3B dla zadań obsługiwanych przez politykę 80M, GPU, których nikt nie zniszczył, oraz ponowne uruchomienia wyniku, którego nie udało się zachować.
  • AY-Robots dobiera kartę według potrzebnej modelowi pamięci VRAM i wynajmuje ją na tym samym rynku spot, więc koszt uruchomienia jest kosztem rynkowym.

Rachunek ma cztery pozycje, a GPU jest najmniejszą z nich

Kiedy ludzie pytają, ile kosztuje dostrojenie modelu wizualno-językowo-akcyjnego dla SO-100, prawie zawsze mają na myśli wynajem GPU. To jest liczba, która pojawia się jako obciążenie na karcie, więc to ona wydaje się realna. Jest to również, z dużą przewagą, najmniejsza z czterech liczb, które decydują o tym, ile faktycznie kosztuje działająca polityka faktycznie kosztuje.

PozycjaCo to jestTypowa wielkość dla jednej działającej polityki
Czas GPUwynajem karty na uruchomienie1 do 12 USD za uruchomienie, a wykonasz od 3 do 5
Robotserwa, wydrukowana rama, kamery, kable, zasilaniejednorazowo, 110 do 500 EUR za ramię
Godziny pracy człowiekaosoba sterująca ramieniem do nagrywania demonstracji1 do 4 godzin na zestaw danych, powtarzane dla każdego zadania
Marnotrawstwozłe dane, zbyt duże modele, zapomniane podynieograniczone i jedyna pozycja, którą kontrolujesz

Poniższe czasy szkolenia pochodzą z własnych artykułów i repozytoriów pięciu modeli, koszt sprzętu z opublikowanego zestawienia materiałów, a dane platformy z AY-Robots katalogu polityk i strony z cennikiem. Tam, gdzie platforma nie pomaga, artykuł o tym wspomina.

Ile faktycznie kosztuje godzina GPU na rynku spot

Nie ma jednej ceny za godzinę A100. Na platformie takiej jak vast.ai każdy host ustala własną stawkę, a uruchomienie szkolenia, które uruchamiasz, trafia na maszynę, która jest tania i wolna w danej chwili. Uczciwa odpowiedź to rozkład. Oto on, zmierzony 23 sierpnia 2026 o 13:44 UTC: pojedyncze pełne karty, na żądanie, filtrowane według rzeczywistej pamięci VRAM.

Kartavast.ai na żądanie USD/h (niska / mediana / wysoka)Oferty pełnych kartvast.ai cena minimalnaRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74nieoferowane
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99nieoferowane
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 jako przestrzeń
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 jako punkt końcowy
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19nieoferowane
Jak wykonano tę migawkę i czym ona nie jest

Oferty na żądanie dla pojedynczego pełnego GPU (gpu_frac == 1.0) z publicznego API pakietów vast.ai, które nie wymaga konta, filtrowane według gpu_ram, tak aby tylko prawdziwe karty 80 GB trafiały do wierszy 80 GB. Ten filtr ma znaczenie: w tym odczycie wszystkie trzy oferty pojedynczych kart A100 SXM4 były częściami 40 GB, podobnie jak dwie z czterech ofert A100 PCIE, więc połączenie ich w jeden wiersz „A100” zmniejszyłoby o połowę cenę podaną tutaj. Kolumna Hugging Face łączy dwa produkty: 2.50 USD/h to sprzęt Nvidia A100 - large Spaces, a 4.50 USD/h to pojedynczy H100 80 GB w ramach Inference Endpoints, czego Spaces nie oferuje. Traktuj mediany jako orientacyjne: wiersz A100 80 GB opiera się na dwóch ofertach, a wiersz H100 na pięciu, a identyczne zapytanie 36 sekund później zwróciło inną liczbę 4090 i inną najwyższą cenę w trzech z pięciu wierszy. Ceny katalogowe RunPod są bardziej stabilną liczbą do planowania.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Dokładne zapytanie stojące za powyższą tabelą, uruchomione dwukrotnie podczas pisania tej sekcji. Uruchom je, zanim zaufasz jakiemukolwiek artykułowi o cenach GPU, w tym temu.
Tabela kosztów AY-Robots pokazująca, jakiego GPU potrzebuje każda polityka, typowy czas działania i cena za uruchomienie oraz ile epizodów jest potrzebnych, zanim polityka stanie się użyteczna
Tabela kosztów na /try: karta, czas działania, cena za uruchomienie i minimalna liczba epizodów na politykę.

Dlaczego modele 3B nie mogą używać taniej karty

Godzina pracy na 4090 i godzina pracy na H100 80 GB różnią się mniej więcej sześciokrotnie, biorąc pod uwagę powyższe mediany. To, co zmusza do użycia droższej karty, to nie szybkość, lecz pamięć. openpi określa minimalne wymagania dla pełnego Pi0.5 dostrajania na 70 GB, a NVIDIA zaleca 40 GB lub więcej dla GR00T. Zauważ, czym nie jest liczba dla GR00T. Jego konfiguracja dostrajania domyślnie zamraża model językowy i koder wizualny (tune_llm i tune_visual są ustawione na False, a projektor i głowica dyfuzyjna na True), dlatego katalog wymienia około 40 M wytrenowanych parametrów z 3 B. 40 GB to nie stan optymalizatora dla wag 3 B, to zamrożony szkielet plus aktywacje. Warianty o zmniejszonym zakresie wymagają mniej: ścieżka LoRA openpi wymaga 22.5 GB i wskazuje na 4090, a przepływ pracy NVIDIA Isaac Lab Arena wymienia opcję 24 GB na pojedynczej karcie GPU dla GR00T po treningu. Platforma dzieli się na poziomy w oparciu o minimalne wymagania, które każdy dostawca publikuje dla konfiguracji, którą faktycznie uruchamia. Opis dopasowania przepływu pi0 wyjaśnia, skąd bierze się ten dopasowania przepływu ślad.

ZadaniePamięć wymagana przez projekt źródłowyŹródło
pi0 / pi0.5 wnioskowaniemore than 8 GB, example RTX 4090openpi
pi0 / pi0.5 dostrajanie LoRAmore than 22.5 GB, example RTX 4090openpi
pi0 / pi0.5 pełne dostrajaniemore than 70 GB, example A100 80 GB or H100openpi
GR00T N1.7 wnioskowanie1 GPU with 16 GB or moreIsaac-GR00T
GR00T N1.7 dostrajanie40 GB or more recommended, H100 or L40 nodesIsaac-GR00T
GR00T dostrajanie, co trenujeprojector and diffusion head; LLM and visual encoder frozen by defaultfinetune_config.py
GR00T po treningu, zredukowane1 GPU with 24 GB, language model frozenIsaac Lab Arena
SmolVLA dostrajaniesingle A100 for the reference 20,000-step runlerobot docs
ACT treninga single 11 GB RTX 2080 TiACT paper

Ta tabela wyjaśnia, dlaczego platforma dzieli pięć modeli na dwa poziomy. GR00T N1.7, GR00T N1.5 i Pi0.5 działają na A100 80 GB lub H100, ponieważ tego wymagają dostawcy. SmolVLA i ACT działają na RTX 4090 lub dowolnej karcie 24 GB, ponieważ to jest naprawdę wystarczające.

Pułapka, która pochłania dzień: wynajmowanie taniej karty dla dużego modelu

Uruchomienie GR00T lub Pi0.5 na karcie 24 GB nie kończy się niepowodzeniem w zerowej sekundzie. Pobiera bazowy punkt kontrolny, buduje indeks zbioru danych, rozpoczyna pierwsze przejście w przód i umiera po kilkuset krokach z błędem CUDA out-of-memory. Zapłaciłeś za pobieranie i konfigurację, a nie otrzymałeś nic. Rozwiązania: brak pamięci podczas treningu.

Jak długo faktycznie działa każdy z pięciu modeli

Czas działania to druga połowa kosztu: 2.00 USD za godzinę jest nieistotne, jeśli zadanie trwa 40 minut, a rujnujące, jeśli trwa 40 godzin. Oto domyślne wartości, które AY-Robots faktycznie wysyła do trenera, wraz z oknem działania i kosztem dla każdej warstwy.

PolitykaWarstwa GPUDomyślna maks. liczba krokówDomyślna partia (akumulacja gradientu)Okno działaniaKoszt za uruchomienie
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Tabela porównawcza pięciu trenowalnych polityk w AY-Robots przedstawiająca liczbę parametrów, wymagane GPU, opóźnienie wnioskowania i minimalną liczbę epizodów
Pięć polityk obok siebie: parametry, warstwa GPU, opóźnienie na krok akcji, minimalna liczba epizodów.

Skąd pochodzą te okna uruchomieniowe z wyższego poziomu

  • SmolVLA: dokumentacja lerobot podaje, że 20 000 kroków zajmuje około 4 godzin na pojedynczym A100. Platforma wykonuje te same 20 000 kroków na tańszej warstwie 24 GB, stąd okno czasowe zamiast stałych 4 godzin.
  • ACT: oryginalna praca ALOHA podaje około 5 godzin na pojedynczej karcie 11 GB RTX 2080 Ti dla modelu z 80 milionami parametrów. Karta 4090 jest o kilka generacji nowsza, ale platforma przewiduje 100 000 kroków, więc okno czasowe wypada w tym samym miejscu.
  • GR00T: referencyjny przepływ pracy NVIDIA dla generacji N1.6 podaje około 4 do 8 godzin dla 20 000 kroków przy partii 24 na ośmiu kartach L40S oraz 2 do 3 godzin dla 30 000 kroków przy partii 16 na pojedynczej karcie Ada 6000. Dostrajanie modelu 3B VLA na jednej karcie w ciągu kilku godzin jest normalne, a nie optymistyczne.
  • Pi0.5: openpi nie publikuje danych dotyczących czasu rzeczywistego, ale podaje minimalne wymaganie 70 GB dla pełnego dostrojenia, co określa wymaganą kartę, a tym samym szybkość.

Warto zatrzymać się nad liczbą, za którą nie płacisz. Artykuł GR00T N1 podaje około 50 000 godzin GPU H100 na wstępne trenowanie modelu 2.2B, na klastrze do 1024 GPU, przy rozmiarze partii wstępnego trenowania 16 384 dla 200 000 kroków gradientowych. Przy zmierzonej powyżej stawce 1.34 do 2.34 USD za godzinę, daje to koszt wynajętych zasobów obliczeniowych rzędu 67 000 do 117 000 USD. Artykuł SmolVLA szacuje swój projekt na około 30 000 godzin GPU w ramach 481 zbiorów danych społeczności, 22.9K epizodów i 10.6M klatek. Dziedziczysz to wszystko za cenę pobrania; twoje 8 USD kupuje ostatnie 20 000 kroków. Dlaczego modele VLA są budowane w ten sposób obejmuje ten podział.

Ramię: jednorazowy koszt, który przyćmiewa rachunek za GPU

Przebieg treningowy kosztuje mniej niż lunch. Robot nie. Dlatego SO-100 ma znaczenie: to najtańsze ramię, które cała uczenie przez imitację toolchain faktycznie obsługuje.

RamięSerwaNapięcieKoszt częściWsparcie na AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURpełne, referencyjne ramię
SO-101Feetech STS32157.4 V130 to 170 EURpełne
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURkompatybilne
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURkompatybilne

Nadrzędna lista materiałów w repozytorium SO-ARM100 jest bardziej szczegółowa i warto ją sprawdzić pod kątem swojego regionu: jej Części na Dwa Ramiona lista sumuje się do 229.88 USD lub 226.30 EUR dla konfiguracji lidera plus naśladowcy, a jej Części na Jedno Ramię Naśladowcy lista sumuje się do 121.94 USD lub 124.30 EUR. Sześć serw STS3215 po 13.89 USD każde to 83.34 z tych 121.94, więc serwa to ramię. Przy 1 do 3 USD za przebieg SmolVLA lub ACT, jedna para ramion jest warta od 77 do 230 przebiegów treningowych. Jeśli nadal wybierasz, SO-100 kontra SO-101 to porównanie, które ma znaczenie, ponieważ te dwa są na tyle podobne, że decyzja dotyczy dostępności, a nie możliwości.

7.4 V, nie 12 V

STS3215 jest dostępny w wariancie 7.4 V i 12 V; repozytorium zauważa, że część 12 V wymaga również zasilania 12 V 5 A zamiast 5 V, więc te dwa nie są wymienne. Podanie 12 V do serw 7.4 V niszczy je, a sześć serw to dwie trzecie kosztu części ramienia naśladowcy. Sprawdź etykietę na każdym serwie przed pierwszym uruchomieniem. Jeśli serwa już zachowują się dziwnie: serwo nie reaguje, ramię drga, a następnie opada.

Godziny pracy człowieka: pozycja, której nikt nie umieszcza w arkuszu kalkulacyjnym

To jest liczba, która wywraca dyskusję o kosztach do góry nogami. Nagrywanie demonstracji to osoba poruszająca ramieniem robota, jeden epizod na raz, w czasie rzeczywistym. Nie ma tu możliwości przetwarzania wsadowego ani wynajmowania na sekundy. Rejestrator zbioru danych LeRobot jest dostarczany z domyślnymi ustawieniami, które ułatwiają obliczenia, wszystkie trzy potwierdzone w DatasetRecordConfig: 60 sekund na epizod, 60 sekund na zresetowanie sceny, 50 epizodów. Kolumna z pieniędzmi poniżej zakłada 15 USD za godzinę czyjejś pracy, co jest raczej założeniem niż liczbą platformy. Podstaw swoją własną stawkę; chodzi o proporcje.

  1. 1
    Nagraj zbiór danych z domyślnymi ustawieniami, za które faktycznie zostaniesz obciążony

    To jest lerobot 0.6.1, wersja na PyPI z 3 sierpnia 2026. Zwróć uwagę na kształt CLI: nagrywanie odbywa się poprzez punkt wejścia konsoli lerobot-record (lerobot.scripts.lerobot_record), a nie starą ścieżkę modułu python -m lerobot.scripts.record. AY-Robots celuje w wersję 0.5.1, a pakiet 0.5.1 deklaruje te same punkty wejścia lerobot-record i lerobot-train, więc poniższy kształt jest stabilny dla obu. Trzy flagi czasowe to domyślne ustawienia upstream, więc jest to również polecenie, które zakłada arytmetyka w następnej tabeli.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Sprawdź, co nagrałeś, zanim wynajmiesz choćby minutę GPU

    Inspekcja zbioru danych kosztuje zero USD za godzinę. Odkrycie tego samego problemu na podstawie krzywej strat kosztuje 2.00 USD za godzinę na poziomie H100 i informuje o tym cztery godziny za późno. Wypchnij zbiór danych i przejrzyj go w przeglądarce LeRobot, lub przeglądaj katalog zbiorów danych AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Trenuj i upewnij się, że punkt kontrolny przetrwa poda

    Wynajęta maszyna jest z definicji tymczasowa, więc zapisuj punkty kontrolne w trwałym miejscu podczas działania. Dwie flagi decydują o tym, czy zachowasz to, za co zapłaciłeś. --save_freq domyślnie wynosi 20 000 kroków, więc domyślne uruchomienie SmolVLA na 20 000 kroków zapisuje swój pierwszy punkt kontrolny, gdy uruchomienie jest już zakończone; obniż tę wartość, zanim wynajmiesz cokolwiek przerywalnego. --save_checkpoint_to_hub wymaga --policy.repo_id i nie istnieje w lerobot 0.5.1, więc w tej wersji musisz samodzielnie skopiować katalog wyjściowy z maszyny. Poniższy rozmiar partii jest przykładem z dokumentacji upstream; formularz AY-Robots wysyła 2 dla SmolVLA i zapisuje do pamięci obiektowej w miarę pojawiania się punktów kontrolnych.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
EpizodyNagrywanie po 60 sResetowanie po 60 sCzas rzeczywistyPlus 20 procent ponownych nagrańPrzy 15 USD za godzinę pracy człowieka
30, minimum dla SmolVLA30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, pozostałe cztery minima50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, komfortowy zbiór danych100 min100 min3 h 20 min4 h 00 minabout 60 USD

Porównaj prawą kolumnę z kosztem uruchomienia wynoszącym od 1 do 12 USD. Przy tej założonej stawce, zestaw danych składający się z 50 epizodów kosztuje od dwóch do siedmiu razy więcej, aby go nagrać, niż aby na nim trenować, zanim uwzględnimy kalibrację, konfigurację kamery i epizody, które odrzucasz. Dlatego ma bezpośrednią wartość finansową. Przewodnik lerobot sugeruje co najmniej 50 epizodów, po 10 na każdą lokalizację obiektu; dokumentacja SmolVLA podaje, że 25-epizodowa wersja tego samego zadania była niewystarczająca.

Gdzie faktycznie uciekają pieniądze

1. Uruchomienia na danych, które nigdy nie miały szans zadziałać

Uruchomienie GR00T z 20 000 krokami na zestawie danych z dwoma zamienionymi strumieniami kamery kosztuje tyle samo, co na czystym zestawie danych, zajmuje tyle samo czasu i generuje krzywą strat, która wygląda dobrze. Błąd pojawia się na ramieniu, wiele godzin później. są rozliczane godzinowo, a diagnoza w dniach. Dwa objawy warte zapamiętania: zazwyczaj oznacza, że obserwacje nie zawierają tego, czego wymaga zadanie, oraz oznacza, że zestaw danych miał mniej wariacji, niż sądziłeś.

2. Płacenie cen modeli fundamentalnych za zadanie ze stałą kamerą

ACT ma około 80M parametrów i został zaprojektowany do trenowania od podstaw na 50 demonstracjach jednego zadania. GR00T N1.7 ma około 3B parametrów z wstępnie wytrenowanym szkieletem. Dla kamery zamocowanej na stałe, stałego stołu i jednego obiektu, model 80M często osiąga cel, działa z prędkością około 20 ms na krok akcji zamiast 152 ms i kosztuje od 1 do 3 USD za uruchomienie zamiast od 4 do 12. Wydaj 3 USD, aby sprawdzić, czy tani model działa, zanim wydasz 12 USD na drogi. ACT kontra SmolVLA i GR00T N1.7 kontra Pi0.5 pokazują, gdzie każdy z nich przestaje być właściwą odpowiedzią; arena modeli ma 85 modeli i 332 wyniki testów porównawczych.

3. Karta graficzna, o której zapomniałeś

Najtańszy błąd do uniknięcia i najczęstszy do popełnienia. Instancja uruchomiona w piątek w celu debugowania czegoś nalicza opłaty przez cały weekend w takiej samej stawce jak rzeczywiste uruchomienie.

KartaMediana stawki w migawceBezczynność przez 24 hBezczynność przez 7 dniTo jest warte
RTX 40900.32 USD/h7.68 USD53.76 USDokoło 27 uruchomień SmolVLA lub ACT po 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDokoło 12 uruchomień GR00T po 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDokoło 38 uruchomień GR00T po 8 USD

W AY-Robots ta awaria jest wyeliminowana dla wnioskowania: pody udostępnione przez API wnioskowania posiadają mechanizm nadzoru bezczynności i niszczą się po okresie bezczynności. Jeśli wynajmujesz kartę samodzielnie, ten mechanizm nadzoru to Twoje przypomnienie w kalendarzu.

4. Płacenie dwukrotnie za tę samą odpowiedź

Punkt wejścia do dostrajania GR00T to interfejs CLI tyro, który nie ujawnia ziarna. Nie jest to ograniczenie platformy, lecz narzędzie nadrzędne: nie ma pola ziarna w gr00t/configs/finetune_config.py, a własne wskazówki dotyczące treningu w repozytorium ostrzegają, że uruchomienia różnią się o 5 do 6 procent, ponieważ augmentacje obrazu są niedeterministyczne. lerobot domyślnie używa ziarna 1000 zarówno w wersji 0.5.1, jak i 0.6.1, więc uruchomienia ACT, SmolVLA i Pi0.5 mogą przynajmniej zostać ponownie uruchomione z tą samą inicjalizacją i kolejnością danych. Nie jest to obietnica bitowo identycznych wag na GPU, ale to różnica między ponownym uruchomieniem a nowym eksperymentem. Jeśli uruchomienie GR00T wytworzy działającą politykę, a Ty nie zachowałeś punkt kontrolny, płacisz pełną cenę za wynik, który może różnić się bardziej niż różnica, którą ścigałeś. Istnieje drugi sposób na utratę punktu kontrolnego, za który zapłaciłeś: CLI domyślnie używa --save-total-limit 5, udokumentowanego jako maksymalna liczba punktów kontrolnych przechowywanych przed usunięciem starszych. Przechowywanie kosztuje centy; ponowne uruchomienie to 4 do 12 USD i sześć godzin.

Przerywalna pojemność jest o połowę tańsza i zakończy Twoje uruchomienie

Powyższe progi licytacji stanowią ułamek stawki na żądanie, a vast.ai twierdzi, że system licytacji może obniżyć koszty klienta o pięćdziesiąt procent lub więcej. Haczyk, ich własnymi słowami: instancja przerywalna może zostać wstrzymana w dowolnym momencie, jeśli inny użytkownik zaoferuje wyższą stawkę lub zostanie utworzone wynajęcie na żądanie dla tych samych zasobów, a ta pauza "zatrzymuje wszystkie uruchomione procesy". Na żądanie zawsze ma pierwszeństwo. Dobre dla uruchomienia, które zapisuje punkt kontrolny co kilkaset kroków, całkowita strata dla takiego, które zapisuje na końcu, co dokładnie dają domyślne ustawienia: Isaac-GR00T CLI zapisuje co --save-steps (domyślnie 1000), ale --save_freq lerobota domyślnie wynosi 20 000 kroków, więc domyślne uruchomienie SmolVLA zapisuje punkt kontrolny raz, na mecie. Obniż to, albo nie licytuj. Formularz szkoleniowy AY-Robots udostępnia pokrętło GR00T jako saveSteps.

Wynajmowanie karty samodzielnie
Zalety
  • Najniższa dostępna stawka godzinowa.
  • Pełna kontrola nad obrazem, wersją CUDA, rewizją lerobot lub Isaac-GR00T i każdą flagą.
  • Licytacja przerywalna obniża stawkę o połowę, jeśli Twoje uruchomienie zapisuje punkty kontrolne wystarczająco często, aby przetrwać pauzę.
  • Nic nie jest abstrahowane, więc gdy uruchomienie zachowuje się dziwnie, możesz zobaczyć dlaczego.
Wady
  • Konfiguracja jest rozliczana według stawek GPU: sterowniki, zależności, wielogigabajtowy bazowy punkt kontrolny i pobieranie zestawu danych kosztują tyle samo za godzinę co szkolenie.
  • Przebita instancja przerywalna zostaje wstrzymana, a jej procesy zakończone. Niezapisane uruchomienie to spalone pieniądze, a domyślne ustawienie lerobota zapisuje swój pierwszy punkt kontrolny na kroku 20 000.
  • Nic nie niszczy poda za Ciebie. Powyższa tabela przestoju to rachunek za zapomnienie.
  • Podaż pojedynczych pełnych kart 80 GB jest niewielka: w tym odczycie dwie oferty A100 80 GB i pięć H100 80 GB pełnych kart. Lista również się zmienia, więc najtańsza podana cena i cena, za którą faktycznie można wynająć, nie są tą samą liczbą.
  • Każda godzina spędzona na infrastrukturze to godzina nie poświęcona na nagrywanie epizodów, które decydują o tym, czy polityka działa.

Robienie tego samodzielnie kontra wynajmowanie karty przez platformę

Wybierasz maszynę, budujesz środowisko i niszczysz poda. Stawka godzinowa to powyższa stawka rynkowa; wszystko inne to Twój czas.

  1. Znajdź kartę odpowiadającą wymaganej przez model pamięci VRAM: 24 GB dla ACT i SmolVLA, 80 GB dla GR00T i Pi0.5.
  2. Wynajmij na żądanie, jeśli uruchomienie nie może przetrwać pauzy, lub z możliwością przerwania, jeśli często tworzy punkty kontrolne.
  3. Zainstaluj zestaw narzędzi: lerobot dla ACT, SmolVLA i Pi0.5, repozytorium Isaac-GR00T z własnym launcherem tyro dla GR00T.
  4. W razie potrzeby przekonwertuj zbiór danych. Zbiór danych LeRobot v3.0 powoduje awarię loadera GR00T i musi zostać przekonwertowany do wersji v2.1.
  5. Uruchom, obserwuj stratę, przesyłaj punkty kontrolne w trwałe miejsce w miarę ich zapisywania.
  6. Zniszcz instancję, a następnie sprawdź, czy ją zniszczyłeś.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Aktualny punkt wejścia do fine-tuningu Isaac-GR00T, zgodny z poleceniem w pliku README repozytorium. Ten interfejs CLI nie posiada flagi seed, więc uruchomienia GR00T nie są odtwarzalne bit po bicie.

Realistyczny koszt jednego uruchomienia GR00T: 3 do 6 godzin na H100 80 GB po 1.34 do 2.34 USD za godzinę to 4 do 14 USD, plus 20 do 40 minut konfiguracji, która również jest płatna, plus Twój własny czas.

Co platforma pobiera i jak wybiera kartę

Logika jest celowo nudna. Każdy model w katalogu, deklaruje poziom GPU; backend pobiera wymaganą pamięć VRAM i wynajmuje pasującą kartę na tym samym rynku spot, mierzoną powyżej. Dlatego podany koszt jest zakresem, a nie ceną. GR00T i Pi0.5 są tutaj dostępne tylko w chmurze ze względu na minimalne wymagania 40 GB i 70 GB. SmolVLA i ACT działają również lokalnie na Twojej własnej karcie 24 GB, gdzie koszt chmury wynosi zero, a energia elektryczna jest Twoim problemem.

Strona z cennikiem AY-Robots pokazująca koszt uruchomienia treningu i dostępu do platformy
Strona z cennikiem. Kwoty za uruchomienie śledzą rynek spot, a nie stałą cenę katalogową.

Jedna opcja zasługuje na ostrzeżenie. Akumulacja gradientu faktycznie ma zastosowanie dla obu wariantów GR00T, więc jej zwiększenie pozwala na uzyskanie większej efektywnej partii na tej samej karcie. Dla Pi0.5 i SmolVLA nie ma ona zastosowania wcale: lerobot 0.5.1 nie ma opcji akumulacji gradientu w swojej konfiguracji treningowej, więc ustawienie tego pola na 16 nic nie kosztuje i nic nie daje. Jeśli zadanie w kolejce nigdy się nie uruchamia, strona o zadaniach zablokowanych w kolejce, opisuje, co należy sprawdzić; jeśli zestaw danych zostanie odrzucony przed rozpoczęciem uruchomienia, jest to prawie zawsze problem z formatem v3.0.

Limit, którego ta platforma nie rozwiązuje: opóźnienie

Wynajęta karta graficzna (GPU) obsługująca Twoją politykę przez publiczny internet dodaje opóźnienia do pętli sterowania, która już wynosi od 20 do 485 ms na krok akcji. Dobre dla wolnego podnoszenia i odkładania (pick-and-place), nie dla szybkiego ruchu reaktywnego. Wnioskowanie w chmurze dobrze ocenia punkt kontrolny, ale źle wykonuje manipulację produkcyjną: jeśli zadanie wymaga szybkości, obliczenia muszą znajdować się obok serwomechanizmów, a to jest koszt, którego ten artykuł nie może sprawić, że zniknie. Zobacz opóźnienie wnioskowania.

Opracowany budżet dla pierwszej działającej polityki

Wszystkie cztery linie razem, zaczynając od zera. Całkowity koszt GPU zakłada 3 do 5 uruchomień: pierwsze dowodzi, że potok działa, drugie ujawnia problem z danymi, trzecie lub czwarte to to, które zachowujesz.

LiniaŚcieżka oszczędnaŚcieżka komfortowa
RamięTylko SO-100 follower, 121.94 USD w BOMleader plus follower, 229.88 USD w BOM
ModelSmolVLA lub ACT, warstwa 24 GBGR00T N1.7, A100 80 GB lub H100 tier
Nagrane epizody30, minimum dla SmolVLA50 do 100
Czas ludzki na nagrywanieokoło 1 godz. 12 min2 do 4 godzin
Koszt jednego uruchomienia1 do 3 USD4 do 12 USD
Uruchomienia przed zadziałaniem3 do 53 do 5
Całkowity wydatek na GPU3 do 15 USD12 do 60 USD
Największa pozycja na rachunkuramię, potem Twój czasramię, potem Twój czas

W przypadku robotów tej wielkości schemat się utrzymuje: obliczenia to błąd zaokrąglenia, sprzęt to rzeczywisty jednorazowy koszt, a godziny pracy ludzkiej to koszt cykliczny. Aby przetestować część szkoleniową przed zakupem czegokolwiek, punkty wejścia bez sprzętu pozwalają porównywać modele i wynająć GPU bez ramienia, a ramię na żywo to fizyczny SO-100, którym możesz sterować w przeglądarce bez rejestracji. Aby uzyskać pełny potok od początku do końca, kompletny przewodnik po SO-100 obejmuje konfigurację, teleoperację i szkolenie, a szkolenie pierwszej polityki to krótka wersja.

Macierz szkoleniowa AY-Robots z pięcioma politykami jako wierszami i czterema ramionami robotycznymi jako kolumnami, gdzie każda komórka łączy się z konkretnym przewodnikiem szkoleniowym
Macierz /train: wiersz dla Twojego budżetu, kolumna dla Twojego ramienia, komórka dla przewodnika z domyślnymi ustawieniami i kosztami dla tej pary.
Ile kosztuje jedno pełne uruchomienie dostrajania VLA?

Około 4 do 12 USD dla GR00T N1.7, GR00T N1.5 lub Pi0.5 na poziomie A100 80 GB lub H100 (3 do 6 godzin po 1.20 do 2.00 USD za godzinę), oraz około 1 do 3 USD dla SmolVLA lub ACT na poziomie RTX 4090 (2 do 5 godzin po 0.30 do 0.60 USD za godzinę). Wynajęcie karty samodzielnie mieści się w tym samym zakresie po uwzględnieniu czasu konfiguracji, ponieważ jest rozliczane według stawki szkoleniowej.

Czy warto płacić za H100 zamiast A100 80 GB?

Dla pojedynczej polityki SO-100, zazwyczaj nie. Obie karty spełniają minimalne wymagania pamięciowe GR00T i Pi0.5, a w odczycie z 23 sierpnia 2026 roku pełna A100 80 GB kosztowała 0.44 USD za godzinę w porównaniu do 1.34 USD za H100 80 GB. H100 kończy pracę szybciej, więc część stawki wraca w postaci mniejszej liczby godzin, ale całkowity koszt jest nadal wyższy dla tak małego uruchomienia. Prawdziwym argumentem za H100 jest dostępność: pięć ofert pojedynczych H100 80 GB na tym rynku w porównaniu do dwóch A100 80 GB, a karta, której nie można wynająć, nie ma ceny.

Ile uruchomień potrzeba, zanim polityka faktycznie zadziała?

Zaplanuj od trzech do pięciu. Pierwsze potwierdza, że potok jest prawidłowo podłączony. Drugie zazwyczaj ujawnia problem z zestawem danych, taki jak strumień z kamery, który przestał działać w trakcie. Trzecie lub czwarte to to, które zatrzymasz.

Czy mogę trenować SmolVLA lub ACT na własnym GPU zamiast wynajmować?

Tak. Oba są obsługiwane lokalnie na AY-Robots i oba mieszczą się komfortowo w 24 GB; oryginalny artykuł ACT trenował swój model 80M w około 5 godzin na 11 GB RTX 2080 Ti. GR00T i Pi0.5 są tutaj tylko w chmurze, ponieważ udokumentowane minimalne wymagania dostrajania od dostawców to 40 GB i 70 GB, a największa karta konsumencka na rynku to 32 GB RTX 5090.

Dlaczego ta sama liczba kroków kosztuje różnie w zależności od modelu?

Kroki nie są porównywalne między politykami. ACT domyślnie używa 100 000 kroków w partii 8 na karcie 24 GB; GR00T N1.5 domyślnie używa 2 000 kroków w partii 1 z akumulacją gradientu 16 na karcie 80 GB. Rachunek to godziny pomnożone przez stawkę karty, na którą zmusza Cię zapotrzebowanie na pamięć, a nie licznik kroków.

Sprawdź, ile kosztowałoby Twoje uruchomienie, zanim je rozpoczniesz

Każda z pięciu polityk wymienia swój poziom GPU, czas uruchomienia i cenę za uruchomienie, a zaplecze szkoleniowe wynajmuje kartę na tym samym rynku spot, na którym mierzono te liczby.

Sprawdź ceny

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started