Таблица с разходите на AY-Robots, показваща кой GPU е необходим за всяка от петте политики, типичното време за изпълнение и цена на изпълнение, и колко епизода са необходими, преди политиката да стане полезна
VLA обучениеРазходи за GPUSO-100фино настройванероботизирано обучениебюджетиране

Разходи за обучение на VLA: Какво наистина струва едно фино настройване

AY-Robots ResearchAugust 23, 202623 мин четене

Реални цени на GPU на спот пазара, колко време работи всяка от петте политики, колко струват ръката и демонстрациите, и четирите места, където парите тихо изчезват.

Кратката версия

  • Изпълнение на ниво A100 80 GB или H100 отнема 3 до 6 часа и струва около 4 до 12 щатски долара. На ниво RTX 4090 е 2 до 5 часа и около 1 до 3 щатски долара.
  • Измерено на vast.ai в 13:44 UTC на 23 август 2026 г.: пълен RTX 4090 при поискване за 0.13 до 0.38 USD/ч, A100 80 GB за 0.44 до 0.67, H100 80 GB за 1.34 до 2.34. Пълните 80 GB карти са оскъдни, съответно две и пет оферти за единични карти.
  • GPU е най-евтината позиция. Спецификацията на SO-ARM100 оценява двойка лидер плюс последовател на 229.88 щатски долара, което е 77 до 230 изпълнения на ниво 24 GB.
  • Два часа запис на 50 епизода от човек струват повече от тренировъчното изпълнение, което тези епизоди захранват.
  • Парите изчезват на четири места: изпълнения с повредени данни, 3B модели за задачи, които 80M политика обработва, GPU-та, които никой не е унищожил, и повторни изпълнения на резултат, който не сте успели да запазите.
  • AY-Robots оразмерява картата според VRAM, от която моделът се нуждае, и я наема на същия спот пазар, така че цената на изпълнението е пазарната цена.

Сметката има четири позиции, а GPU е най-малката

Когато хората питат колко струва фино настройване на модел за визия-език-действие за SO-100, те почти винаги имат предвид наема на GPU. Това е числото, което се появява като такса по карта, така че то е това, което изглежда реално. То е също така, с голяма разлика, най-малкото от четирите числа, които определят колко всъщност струва една работеща политика всъщност ви струва.

ПозицияКакво представляваТипичен размер за една работеща политика
Време за GPUнаемане на карта за изпълнението1 до 12 щатски долара на изпълнение, и ще направите 3 до 5
Роботътсервота, отпечатана рамка, камери, кабели, захранванееднократно, 110 до 500 EUR на ръка
Човекочасовечовек, управляващ ръката за запис на демонстрации1 до 4 часа на набор от данни, повтаря се за всяка задача
Отпадъцилоши данни, преоразмерени модели, забравени подовенеограничени, и единствената позиция, която контролирате

Времената за обучение по-долу идват от собствените статии и хранилища на петте модела, цената на хардуера от публикуваната спецификация на материалите, а платформените данни от AY-Robots каталог с политики и страница с цени. Когато платформата не помага, тази статия го отбелязва.

Какво всъщност струва един GPU час на спот пазара

Няма единна цена за час A100. На пазар като vast.ai всеки хост определя собствена тарифа, а обучителният процес който стартирате, попада на която и да е машина, която е евтина и свободна в този момент. Честният отговор е разпределение. Ето го, измерено на 23 август 2026 г. в 13:44 UTC: единични пълни карти, при поискване, филтрирани по реална VRAM.

Картаvast.ai при поискване USD/ч (ниска / средна / висока)Оферти за цели картиМинимална оферта vast.aiRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74не се предлага
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99не се предлага
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 като Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 като крайна точка
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19не се предлага
Как е направена тази моментна снимка и какво не е тя

Предложения при поискване за един пълен GPU (gpu_frac == 1.0) от публичния API на vast.ai, който не изисква акаунт, филтрирани по gpu_ram, така че само истински 80 GB карти да попадат в редовете за 80 GB. Този филтър е важен: при това четене всичките три предложения за единична карта A100 SXM4 бяха 40 GB части, както и две от четирите предложения за A100 PCIE, така че обединяването им в един ред „A100“ би намалило наполовина цената, отчетена тук. Колоната Hugging Face смесва два продукта: 2.50 USD/h е хардуерът Nvidia A100 - large Spaces, а 4.50 USD/h е един H100 80 GB под Inference Endpoints, което Spaces не предлага. Третирайте медианите като индикативни: редът за A100 80 GB се основава на две предложения, а редът за H100 – на пет, като идентичната заявка 36 секунди по-късно върна различен брой 4090 и различна най-висока цена за три от петте реда. Цените по каталог на RunPod са по-стабилното число, спрямо което да се планира.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Точната заявка зад горната таблица, изпълнена два пъти при писането на този раздел. Изпълнете я, преди да се доверите на която и да е статия за ценообразуване на GPU, включително тази.
Таблица с разходите на AY-Robots, показваща кой GPU е необходим за всяка политика, типично време за изпълнение и цена на изпълнение, както и колко епизода са необходими, преди политиката да стане полезна.
Таблицата с разходите на /try: карта, време за изпълнение, цена на изпълнение и минимален брой епизоди на политика.

Защо 3B моделите не могат да използват евтината карта

Един час на 4090 и един час на H100 80 GB се различават приблизително шест пъти при посочените медиани. Това, което ви принуждава да използвате скъпата карта, не е скоростта, а паметта. openpi определя минимума за пълно Pi0.5 фина настройка, при 70 GB, а NVIDIA препоръчва 40 GB или повече за GR00T. Обърнете внимание какво не е числото за GR00T. Неговата конфигурация за фина настройка замразява езиковия модел и визуалния енкодер по подразбиране (tune_llm и tune_visual са False, а проекторът и дифузионната глава са True), поради което каталогът изброява приблизително 40 M обучени параметри от 3 B. 40 GB не е състояние на оптимизатора за 3 B тегла, а замразената основа плюс активациите. Вариантите с намален обхват изискват по-малко: пътят LoRA на openpi изисква 22.5 GB и посочва 4090, а работният процес Isaac Lab Arena на NVIDIA изброява опция за една GPU с 24 GB за GR00T след обучение. Платформата се базира на минимума, който всеки доставчик публикува за конфигурацията, която действително изпълнява. Описанието на pi0 flow-matching обяснява откъде идва този flow-matching отпечатък.

ЗадачаПамет, изисквана от проектаИзточник
pi0 / pi0.5 инференцияповече от 8 GB, например RTX 4090openpi
pi0 / pi0.5 LoRA фина настройкаповече от 22.5 GB, например RTX 4090openpi
pi0 / pi0.5 пълна фина настройкаповече от 70 GB, например A100 80 GB или H100openpi
GR00T N1.7 инференция1 GPU с 16 GB или повечеIsaac-GR00T
GR00T N1.7 фина настройкапрепоръчително 40 GB или повече, H100 или L40 възлиIsaac-GR00T
GR00T фина настройка, какво обучавапроектор и дифузионна глава; LLM и визуален енкодер замразени по подразбиранеfinetune_config.py
GR00T след обучение, редуциран1 GPU с 24 GB, езиков модел замразенIsaac Lab Arena
SmolVLA фина настройкаедин A100 за референтния 20 000-стъпков цикълlerobot docs
ACT обучениеедин 11 GB RTX 2080 TiACT paper

Тази таблица е причината платформата да разделя петте модела на две нива. GR00T N1.7, GR00T N1.5 и Pi0.5 работят на A100 80 GB или H100, защото това е, което доставчиците изискват. SmolVLA и ACT работят на RTX 4090 или всяка 24 GB карта, защото това е наистина достатъчно.

Капанът, който изяжда един ден: наемане на евтина карта за големия модел

Изпълнение на GR00T или Pi0.5 на 24 GB карта не се проваля в нулева секунда. То изтегля базовия контролен пункт, изгражда индекса на набора от данни, стартира първия forward pass и умира след няколкостотин стъпки с грешка CUDA out-of-memory. Платили сте за изтеглянето и настройката и не сте получили нищо. Корекции: недостатъчна памет по време на обучение.

Колко дълго всъщност работи всеки от петте модела

Времето за изпълнение е другата половина от цената: 2.00 USD на час е без значение, ако задачата е 40 минути, и разорително, ако е 40 часа. Това са настройките по подразбиране, които AY-Robots изпраща към обучителя, заедно с прозореца за изпълнение и цената за всяко ниво.

ПолитикаНиво на GPUМакс. стъпки по подразбиранеПакет по подразбиране (натрупване на градиент)Прозорец за изпълнениеЦена на изпълнение
GR00T N1.7, ~3BA100 80 GB or H10020,00032, accum 1, applies3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, accum 16, applies3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, accum 16, no effect3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, accum 8, no effect2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, accum 12 to 5 h1 to 3 USD
Сравнителна таблица на петте обучими политики на AY-Robots, показваща броя на параметрите, необходимото GPU, латентността на извода и минималния брой епизоди
Петте политики една до друга: параметри, ниво на GPU, латентност на стъпка на действие, минимален брой епизоди.

Откъде идват тези времеви прозорци за изпълнение нагоре по веригата

  • SmolVLA: документацията на lerobot посочва, че 20 000 стъпки отнемат приблизително 4 часа на един A100. Платформата изпълнява същите 20 000 стъпки на по-евтиния 24 GB клас, откъдето идва и времеви прозорец, а не фиксирани 4 часа.
  • ACT: оригиналният документ ALOHA съобщава за около 5 часа на една 11 GB RTX 2080 Ti за модел с 80 милиона параметри. 4090 е няколко поколения по-нова, но платформата предвижда 100 000 стъпки, така че времевият прозорец попада на същото място.
  • GR00T: референтният работен процес на NVIDIA за поколението N1.6 цитира приблизително 4 до 8 часа за 20 000 стъпки при пакет 24 на осем L40S карти и 2 до 3 часа за 30 000 стъпки при пакет 16 на една Ada 6000. Фина настройка на 3B VLA с една карта за няколко часа е нормално, не е оптимистично.
  • Pi0.5: openpi не публикува данни за реално време, но публикува долната граница от 70 GB за пълна фина настройка, което определя картата и оттам скоростта.

Струва си да се спрем на числото, което не плащате. Документът GR00T N1 съобщава за приблизително 50 000 H100 GPU часа за предварително обучение на 2.2B модела, на клъстер от до 1024 GPU, при размер на пакета за предварително обучение от 16 384 за 200 000 градиентни стъпки. При измерените по-горе 1.34 до 2.34 USD на час, това е от порядъка на 67 000 до 117 000 USD за нает изчислителен ресурс. Документът SmolVLA оценява проекта си на приблизително 30 000 GPU часа над 481 общностни набора от данни, 22.9K епизода и 10.6M кадъра. Вие наследявате всичко това на цената на едно изтегляне; вашите 8 USD купуват последните 20 000 стъпки. Защо VLA са изградени по този начин обхваща това разделение.

Ръката: еднократна цена, която засенчва сметката за GPU

Едно обучение струва по-малко от обяд. Роботът не. Ето защо SO-100 е важен: това е най-евтината ръка, която цялата обучение чрез имитация верига от инструменти всъщност поддържа.

РъкаСервомоториНапрежениеЦена на частитеПоддръжка на AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURпълен, референтна ръка
SO-101Feetech STS32157.4 V130 to 170 EURпълен
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURсъвместим
LeKiwiFeetech STS3215 ръка, колесна база7.4 V arm, 12 V base400 to 500 EURсъвместим

Списъкът с материали в хранилището SO-ARM100 е по-детайлен и си струва да бъде проверен спрямо вашия регион: неговият Части за две ръце списък възлиза на 229.88 USD или 226.30 EUR за конфигурация с лидер и последовател, а неговият Части за една ръка-последовател списък възлиза на 121.94 USD или 124.30 EUR. Шест сервомотора STS3215 по 13.89 USD всеки са 83.34 от тези 121.94, така че сервомоторите са ръката. При 1 до 3 USD за едно изпълнение на SmolVLA или ACT, един чифт ръце струва между 77 и 230 обучения. Ако все още избирате, SO-100 срещу SO-101 е сравнението, което има значение, защото двете са достатъчно близки, че решението е по-скоро за наличност, отколкото за възможности.

7.4 V, не 12 V

STS3215 се предлага във вариант 7.4 V и 12 V; хранилището отбелязва, че 12 V частта също се нуждае от 12 V 5 A захранване вместо 5 V, така че двете не са взаимозаменяеми. Подаването на 12 V към 7.4 V сервомотори ги унищожава, а шест сервомотора са две трети от цената на частите на една ръка-последовател. Проверете етикета на всеки сервомотор преди първото включване. Ако сервомоторите вече се държат странно: сервомоторът не реагира, ръката потрепва, след което увисва.

Човекочасове: редът, който никой не вписва в електронната таблица

Това е числото, което преобръща дискусията за разходите. Записването на демонстрации е човек, който движи роботизирана ръка, епизод по епизод, в реално време. Няма пакетна обработка и няма наемане на секунда. набор от данни LeRobot рекордерът идва с настройки по подразбиране, които улесняват аритметиката, като и трите са потвърдени в DatasetRecordConfig: 60 секунди на епизод, 60 секунди за нулиране на сцената, 50 епизода. Колоната за пари по-долу приема 15 USD за час от времето на някого, което е предположение, а не число от платформата. Заместете със собствената си ставка; съотношението е същественото.

  1. 1
    Запишете набора от данни с настройките по подразбиране, за които действително ще бъдете таксувани

    Това е lerobot 0.6.1, версията в PyPI към 3 август 2026 г. Обърнете внимание на формата на CLI: записването се извършва чрез входната точка на конзолата lerobot-record (lerobot.scripts.lerobot_record), а не по стария път на модула python -m lerobot.scripts.record. AY-Robots е насочен към 0.5.1, а wheel-ът на 0.5.1 декларира същите входни точки lerobot-record и lerobot-train, така че формата по-долу е стабилна и за двете. Трите флага за време са настройките по подразбиране, така че това е и командата, която аритметиката в следващата таблица приема.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Вижте какво сте записали, преди да наемете и една минута GPU

    Проверката на набор от данни струва нула USD на час. Откриването на същия проблем от крива на загуби струва 2.00 USD на час на ниво H100 и ви казва четири часа по-късно. Качете набора от данни и го прегледайте във LeRobot прегледачката, или разгледайте директорията с набори от данни на AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Обучете и се уверете, че контролната точка надживява пода

    Наетата машина е временна по дефиниция, така че записвайте контролни точки някъде трайно по време на изпълнението. Два флага решават дали запазвате това, за което сте платили. --save_freq по подразбиране е 20 000 стъпки, така че изпълнение по подразбиране на SmolVLA от 20 000 стъпки записва първата си контролна точка, когато изпълнението вече е приключило; намалете го, преди да наемете нещо прекъсваемо. --save_checkpoint_to_hub изисква --policy.repo_id и не съществува в lerobot 0.5.1, така че на тази версия копирате изходната директория от машината сами. Размерът на пакета по-долу е пример от документацията; формата на AY-Robots изпраща 2 за SmolVLA и записва в обектно хранилище, когато се появят контролни точки.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
ЕпизодиЗаписване при 60 секНулиране при 60 секРеално времеПлюс 20 процента повторни записиПри 15 USD на човекочас
30, минимумът за SmolVLA30 мин30 мин1 ч 00 мин1 ч 12 миноколо 18 USD
50, другите четири минимума50 мин50 мин1 ч 40 мин2 ч 00 миноколо 30 USD
100, удобен набор от данни100 мин100 мин3 ч 20 мин4 ч 00 миноколо 60 USD

Сравнете дясната колона с 1 до 12 USD, които струва изпълнението. При тази приета ставка, набор от данни от 50 епизода струва два до седем пъти повече за запис, отколкото за обучение, преди калибриране, настройка на камерата и епизодите, които изхвърляте. Ето защо получаването на правилните данни от първия път има пряка доларова стойност. Ръководството на LeRobot предлага поне 50 епизода с 10 на местоположение на обект; документацията на SmolVLA съобщава, че версия от 25 епизода на същата задача не е била достатъчна.

Къде всъщност изчезват парите

1. Изпълнения с данни, които никога нямаше да проработят

Изпълнение на GR00T от 20 000 стъпки върху набор от данни с два разменени потока от камери струва същото като това върху чист набор от данни, отнема същото време и произвежда крива на загубите, която изглежда добре. Неуспехът се проявява на ръката, часове по-късно. Стъпки на обучение се таксуват на час, а диагностиката се таксува в дни. Два симптома, които си струва да запомните: загубата пада, но политиката не прави нищо обикновено означава, че наблюденията не съдържат това, от което се нуждае задачата, и политиката работи само в една настройка означава, че наборът от данни е имал по-малко вариации, отколкото сте си мислили.

2. Плащане на цени за фундаментални модели за задача с фиксирана камера

ACT е приблизително 80M параметъра и е проектиран да се обучава от нулата върху 50 демонстрации на една задача. GR00T N1.7 е приблизително 3B с предварително обучен гръбнак. За камера, закрепена с болтове, фиксирана маса и един обект, моделът от 80M често постига целта, работи с около 20 ms на стъпка на действие вместо 152 ms и струва от 1 до 3 USD на изпълнение вместо от 4 до 12. Похарчете 3 USD, за да разберете дали евтиният модел работи, преди да похарчите 12 USD за скъпия. ACT срещу SmolVLA и GR00T N1.7 срещу Pi0.5 показват къде всеки престава да бъде правилният отговор; арената на модели има 85 модела и 332 резултата от бенчмаркове.

3. GPU-то, за което забравихте

Най-евтината грешка за предотвратяване и най-често срещаната за допускане. Инстанция, стартирана в петък за отстраняване на грешки, се таксува през уикенда със същата скорост като реално изпълнение.

КартаМедианна ставка в моментната снимкаНеактивна за 24 чНеактивна за 7 дниТова се равнява на
RTX 40900.32 USD/h7.68 USD53.76 USDоколо 27 изпълнения на SmolVLA или ACT по 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDоколо 12 изпълнения на GR00T по 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDоколо 38 изпълнения на GR00T по 8 USD

В AY-Robots този проблем е елиминиран за инференция: подове, осигурени от API за инференция, носят неактивен watchdog и се самоунищожават след период на неактивност. Ако наемете картата сами, този watchdog е вашето напомняне в календара.

4. Плащане два пъти за един и същ отговор

Входната точка за фино настройване на GR00T е tyro CLI, който не разкрива seed. Това не е ограничение на платформата, а е инструментът нагоре по веригата: няма поле за seed в gr00t/configs/finetune_config.py, а собствените съвети за обучение на хранилището предупреждават, че изпълненията варират с 5 до 6 процента, защото увеличенията на изображенията са недетерминистични. lerobot по подразбиране използва seed 1000 както във версии 0.5.1, така и 0.6.1, така че изпълненията на ACT, SmolVLA и Pi0.5 поне могат да бъдат повторени от същата инициализация и ред на данните. Това не е обещание за битово идентични тегла на GPU, но е разликата между повторно изпълнение и нов експеримент. Ако изпълнение на GR00T произведе работеща политика и не сте запазили контролна точка, плащате пълна цена за резултат, който може да се различава повече от разликата, която сте преследвали. Има втори начин да загубите контролна точка, за която сте платили: CLI по подразбиране използва --save-total-limit 5, документирано като максимален брой контролни точки, които се запазват, преди по-старите да бъдат изтрити. Съхранението струва центове; повторно изпълнение е 4 до 12 USD и шест часа.

Прекъсваемият капацитет е на половин цена и ще прекъсне изпълнението ви

Горните минимални цени са част от цената при поискване, а vast.ai твърди, че системата за наддаване може да намали разходите на клиентите с петдесет или повече процента. Уловката, по техните собствени думи: прекъсваема инстанция може да бъде поставена на пауза по всяко време, ако друг потребител наддаде по-високо или бъде създаден наем при поискване за същите ресурси, и тази пауза "спира всички работещи процеси". При поискване винаги има предимство. Добре е за изпълнение, което записва контролна точка на всеки няколкостотин стъпки, пълна загуба за такова, което записва в края, което е точно това, което ви дават настройките по подразбиране: Isaac-GR00T CLI записва на всеки --save-steps (по подразбиране 1000), но --save_freq на lerobot по подразбиране е 20,000 стъпки, така че стандартно изпълнение на SmolVLA записва контролна точка веднъж, на финала. Намалете го, или не наддавайте. Формулярът за обучение на AY-Robots излага настройката GR00T като saveSteps.

Наемане на картата от вас
Предимства
  • Най-ниската почасова ставка, която съществува.
  • Пълен контрол върху образа, версията на CUDA, ревизията на lerobot или Isaac-GR00T и всеки флаг.
  • Наддаването за прекъсваем капацитет намалява ставката наполовина, ако вашето изпълнение записва контролни точки достатъчно често, за да оцелее при пауза.
  • Нищо не е абстрахирано, така че когато едно изпълнение се държи странно, можете да видите защо.
Компромиси
  • Настройката се таксува по цени за GPU: драйвери, зависимости, многогигабайтовата базова контролна точка и изтеглянето на набора от данни струват същото на час като обучението.
  • Наддадена прекъсваема инстанция се поставя на пауза и нейните процеси се прекратяват. Незапазено изпълнение е изгорени пари, а настройката по подразбиране на lerobot записва първата си контролна точка на стъпка 20,000.
  • Нищо не унищожава пода вместо вас. Горната таблица за престой е сметката за забравяне.
  • Предлагането на единични пълни 80 GB карти е оскъдно: две A100 80 GB и пет H100 80 GB предложения за пълни карти в това четене. Списъкът също се променя, така че най-евтината обявена цена и цената, на която всъщност можете да наемете, не са едно и също число.
  • Всеки час, прекаран в инфраструктура, е час, който не е прекаран в записване на епизодите, които решават дали политиката работи.

Да го направите сами срещу да оставите платформата да наеме картата

Вие избирате машината, изграждате средата и унищожавате пода. Почасовата ставка е пазарната ставка по-горе; всичко останало е ваше време.

  1. Намерете карта, съответстваща на VRAM, от която се нуждае моделът: 24 GB за ACT и SmolVLA, 80 GB за GR00T и Pi0.5.
  2. Наемете при поискване, ако изпълнението не може да оцелее при пауза, прекъсваемо, ако записва контролни точки често.
  3. Инсталирайте инструментариума: lerobot за ACT, SmolVLA и Pi0.5, хранилището Isaac-GR00T със собствен tyro стартер за GR00T.
  4. Конвертирайте набора от данни, ако е необходимо. Набор от данни LeRobot v3.0 срива GR00T зареждача и трябва да бъде конвертиран до v2.1.
  5. Стартирайте, наблюдавайте загубата, избутвайте контролни точки някъде трайно, докато се записват.
  6. Унищожете инстанцията, след което проверете дали сте я унищожили.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Текущата входна точка за фино настройване на Isaac-GR00T, съответстваща на командата в README на хранилището. Този CLI няма флаг за seed, така че изпълненията на GR00T не са възпроизводими бит по бит.

Реалистична цена за едно изпълнение на GR00T: 3 до 6 часа на H100 80 GB при 1.34 до 2.34 USD на час е 4 до 14 USD, плюс 20 до 40 минути настройка, която също се таксува, плюс вашето собствено време.

Какво таксува платформата и как избира картата

Логиката е умишлено скучна. Всеки модел в каталога, декларира ниво на GPU; бекендът взема необходимата VRAM и наема съответна карта на същия спот пазар, измерен по-горе. Ето защо посочената цена е диапазон, а не фиксирана цена. GR00T и Pi0.5 са само в облака тук поради изискванията от 40 GB и 70 GB. SmolVLA и ACT също работят локално на вашата собствена 24 GB карта, където облачната цена е нула, а електричеството е ваш проблем.

Страницата с цените на AY-Robots, показваща цената на едно обучение и достъпа до платформата
Страницата с цените. Цифрите за всяко изпълнение следят спот пазара, а не фиксирана каталожна цена.

Една настройка заслужава предупреждение. Натрупването на градиенти наистина се прилага за двата варианта на GR00T, така че увеличаването му осигурява по-голям ефективен пакет на същата карта. За Pi0.5 и SmolVLA то изобщо не се прилага: lerobot 0.5.1 няма опция за натрупване на градиенти в конфигурацията си за обучение, така че задаването на полето на 16 не струва нищо и не носи нищо. Ако задача в опашката никога не стартира, страницата за заседнали в опашката задачи обяснява какво да проверите; ако наборът от данни бъде отхвърлен преди стартирането на изпълнението, това почти винаги е проблемът с формата v3.0.

Ограничението, което тази платформа не решава: латентност

Нает GPU, обслужващ вашата политика през публичния интернет, добавя допълнителни цикли към контролен контур, който вече е 20 до 485 ms на стъпка на действие. Добре за бавно вземане и поставяне, но не и за бързо реактивно движение. Облачният инференс оценява добре контролна точка, но изпълнява лошо производствени манипулации: ако задачата изисква скорост, изчислителната мощност трябва да е до сервомоторите, а това е разход, който тази статия не може да премахне. Вижте латентност на инференса.

Разработен бюджет за първа работеща политика

Всичките четири реда заедно, започвайки от нищото. Общата сума за GPU предполага 3 до 5 изпълнения: първото доказва, че конвейерът работи, второто разкрива проблем с данните, а третото или четвъртото е това, което запазвате.

РедИкономичен пътКомфортен път
РъкаСамо SO-100 follower, 121.94 USD в BOMleader плюс follower, 229.88 USD в BOM
МоделSmolVLA или ACT, 24 GB нивоGR00T N1.7, A100 80 GB или H100 ниво
Записани епизоди30, минимумът за SmolVLA50 до 100
Човешко време за записоколо 1 ч 12 мин2 до 4 часа
Цена на едно изпълнение1 до 3 USD4 до 12 USD
Изпълнения преди да заработи3 до 53 до 5
Общи разходи за GPU3 до 15 USD12 до 60 USD
Най-голям ред в сметкатаръката, след това вашето времеръката, след това вашето време

Моделът се запазва и при този размер робот: изчисленията са грешка при закръгляване, хардуерът е реална еднократна цена, човекочасовете са повтарящ се разход. За да тествате тренировъчната част, преди да купите каквото и да било, ви позволяват да сравнявате модели и да наемете GPU без робот, а е физически SO-100, който можете да управлявате в браузъра без регистрация. За целия процес от край до край, обхваща настройката, и обучението, а е кратката версия.

Матрицата за обучение на AY-Robots с пет политики като редове и четири роботски ръце като колони, като всяка клетка води до конкретно ръководство за обучение
Матрицата /train: ред за вашия бюджет, колона за вашия робот, клетка за ръководството с настройките по подразбиране и цената за тази комбинация.
Колко струва едно VLA фино настройване от край до край?

Около 4 до 12 USD за GR00T N1.7, GR00T N1.5 или Pi0.5 на ниво A100 80 GB или H100 (3 до 6 часа при 1.20 до 2.00 USD на час), и около 1 до 3 USD за SmolVLA или ACT на ниво RTX 4090 (2 до 5 часа при 0.30 до 0.60 USD на час). Наемането на картата от вас попада в същия диапазон, след като се отчете времето за настройка, тъй като се таксува по тарифата за обучение.

Струва ли си да се плаща за H100 вместо за A100 80 GB?

За една SO-100 политика, обикновено не. И двете покриват минималните изисквания за памет на GR00T и Pi0.5, а към 23 август 2026 г. пълна A100 80 GB започваше от 0.44 USD на час срещу 1.34 за H100 80 GB. H100 завършва по-бързо, така че част от цената се възстановява като по-малко часове, но общата сума все още е по-висока за толкова малък цикъл. Истинският аргумент за H100 е наличността: пет оферти за единичен H100 80 GB на този пазар срещу две за A100 80 GB, а карта, която не можете да наемете, няма цена.

Колко цикъла са необходими, преди една политика наистина да заработи?

Планирайте три до пет. Първият доказва, че процесът е свързан правилно. Вторият често разкрива проблем с набора от данни, като например прекъснат видео поток от камера. Третият или четвъртият е този, който запазвате.

Мога ли да обуча SmolVLA или ACT на собствения си GPU, вместо да наемам?

Да. И двете се поддържат локално на AY-Robots и двете се побират удобно в 24 GB; оригиналният ACT документ обучава своя 80M модел за около 5 часа на 11 GB RTX 2080 Ti. GR00T и Pi0.5 са само в облак тук, защото документираните минимални изисквания за фина настройка на доставчиците са 40 GB и 70 GB, а най-голямата потребителска карта на пазара е 32 GB RTX 5090.

Защо един и същ брой стъпки струва различни суми при различните модели?

Стъпките не са сравними между политиките. ACT по подразбиране е 100,000 стъпки при пакет 8 на 24 GB карта; GR00T N1.5 по подразбиране е 2,000 стъпки при пакет 1 с натрупване на градиент 16 на 80 GB карта. Сметката е часове, умножени по тарифата на картата, към която ви принуждава отпечатъкът на паметта, а не броячът на стъпки.

Вижте колко ще струва вашият цикъл, преди да го стартирате

Всяка от петте политики изброява своето GPU ниво, време за изпълнение и цена на цикъл, а тренировъчният бекенд наема картата на същия спот пазар, на който са измерени тези числа.

Проверете цените

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started