
Реални цени на GPU на спот пазара, колко време работи всяка от петте политики, колко струват ръката и демонстрациите, и четирите места, където парите тихо изчезват.
Кратката версия
- •Изпълнение на ниво A100 80 GB или H100 отнема 3 до 6 часа и струва около 4 до 12 щатски долара. На ниво RTX 4090 е 2 до 5 часа и около 1 до 3 щатски долара.
- •Измерено на vast.ai в 13:44 UTC на 23 август 2026 г.: пълен RTX 4090 при поискване за 0.13 до 0.38 USD/ч, A100 80 GB за 0.44 до 0.67, H100 80 GB за 1.34 до 2.34. Пълните 80 GB карти са оскъдни, съответно две и пет оферти за единични карти.
- •GPU е най-евтината позиция. Спецификацията на SO-ARM100 оценява двойка лидер плюс последовател на 229.88 щатски долара, което е 77 до 230 изпълнения на ниво 24 GB.
- •Два часа запис на 50 епизода от човек струват повече от тренировъчното изпълнение, което тези епизоди захранват.
- •Парите изчезват на четири места: изпълнения с повредени данни, 3B модели за задачи, които 80M политика обработва, GPU-та, които никой не е унищожил, и повторни изпълнения на резултат, който не сте успели да запазите.
- •AY-Robots оразмерява картата според VRAM, от която моделът се нуждае, и я наема на същия спот пазар, така че цената на изпълнението е пазарната цена.
Сметката има четири позиции, а GPU е най-малката
Когато хората питат колко струва фино настройване на модел за визия-език-действие за SO-100, те почти винаги имат предвид наема на GPU. Това е числото, което се появява като такса по карта, така че то е това, което изглежда реално. То е също така, с голяма разлика, най-малкото от четирите числа, които определят колко всъщност струва една работеща политика всъщност ви струва.
| Позиция | Какво представлява | Типичен размер за една работеща политика |
|---|---|---|
| Време за GPU | наемане на карта за изпълнението | 1 до 12 щатски долара на изпълнение, и ще направите 3 до 5 |
| Роботът | сервота, отпечатана рамка, камери, кабели, захранване | еднократно, 110 до 500 EUR на ръка |
| Човекочасове | човек, управляващ ръката за запис на демонстрации | 1 до 4 часа на набор от данни, повтаря се за всяка задача |
| Отпадъци | лоши данни, преоразмерени модели, забравени подове | неограничени, и единствената позиция, която контролирате |
Времената за обучение по-долу идват от собствените статии и хранилища на петте модела, цената на хардуера от публикуваната спецификация на материалите, а платформените данни от AY-Robots каталог с политики и страница с цени. Когато платформата не помага, тази статия го отбелязва.
Какво всъщност струва един GPU час на спот пазара
Няма единна цена за час A100. На пазар като vast.ai всеки хост определя собствена тарифа, а обучителният процес който стартирате, попада на която и да е машина, която е евтина и свободна в този момент. Честният отговор е разпределение. Ето го, измерено на 23 август 2026 г. в 13:44 UTC: единични пълни карти, при поискване, филтрирани по реална VRAM.
| Карта | vast.ai при поискване USD/ч (ниска / средна / висока) | Оферти за цели карти | Минимална оферта vast.ai | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | не се предлага |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | не се предлага |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 като Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 като крайна точка |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | не се предлага |
Предложения при поискване за един пълен GPU (gpu_frac == 1.0) от публичния API на vast.ai, който не изисква акаунт, филтрирани по gpu_ram, така че само истински 80 GB карти да попадат в редовете за 80 GB. Този филтър е важен: при това четене всичките три предложения за единична карта A100 SXM4 бяха 40 GB части, както и две от четирите предложения за A100 PCIE, така че обединяването им в един ред „A100“ би намалило наполовина цената, отчетена тук. Колоната Hugging Face смесва два продукта: 2.50 USD/h е хардуерът Nvidia A100 - large Spaces, а 4.50 USD/h е един H100 80 GB под Inference Endpoints, което Spaces не предлага. Третирайте медианите като индикативни: редът за A100 80 GB се основава на две предложения, а редът за H100 – на пет, като идентичната заявка 36 секунди по-късно върна различен брой 4090 и различна най-висока цена за три от петте реда. Цените по каталог на RunPod са по-стабилното число, спрямо което да се планира.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Защо 3B моделите не могат да използват евтината карта
Един час на 4090 и един час на H100 80 GB се различават приблизително шест пъти при посочените медиани. Това, което ви принуждава да използвате скъпата карта, не е скоростта, а паметта. openpi определя минимума за пълно Pi0.5 фина настройка, при 70 GB, а NVIDIA препоръчва 40 GB или повече за GR00T. Обърнете внимание какво не е числото за GR00T. Неговата конфигурация за фина настройка замразява езиковия модел и визуалния енкодер по подразбиране (tune_llm и tune_visual са False, а проекторът и дифузионната глава са True), поради което каталогът изброява приблизително 40 M обучени параметри от 3 B. 40 GB не е състояние на оптимизатора за 3 B тегла, а замразената основа плюс активациите. Вариантите с намален обхват изискват по-малко: пътят LoRA на openpi изисква 22.5 GB и посочва 4090, а работният процес Isaac Lab Arena на NVIDIA изброява опция за една GPU с 24 GB за GR00T след обучение. Платформата се базира на минимума, който всеки доставчик публикува за конфигурацията, която действително изпълнява. Описанието на pi0 flow-matching обяснява откъде идва този flow-matching отпечатък.
| Задача | Памет, изисквана от проекта | Източник |
|---|---|---|
| pi0 / pi0.5 инференция | повече от 8 GB, например RTX 4090 | openpi |
| pi0 / pi0.5 LoRA фина настройка | повече от 22.5 GB, например RTX 4090 | openpi |
| pi0 / pi0.5 пълна фина настройка | повече от 70 GB, например A100 80 GB или H100 | openpi |
| GR00T N1.7 инференция | 1 GPU с 16 GB или повече | Isaac-GR00T |
| GR00T N1.7 фина настройка | препоръчително 40 GB или повече, H100 или L40 възли | Isaac-GR00T |
| GR00T фина настройка, какво обучава | проектор и дифузионна глава; LLM и визуален енкодер замразени по подразбиране | finetune_config.py |
| GR00T след обучение, редуциран | 1 GPU с 24 GB, езиков модел замразен | Isaac Lab Arena |
| SmolVLA фина настройка | един A100 за референтния 20 000-стъпков цикъл | lerobot docs |
| ACT обучение | един 11 GB RTX 2080 Ti | ACT paper |
Тази таблица е причината платформата да разделя петте модела на две нива. GR00T N1.7, GR00T N1.5 и Pi0.5 работят на A100 80 GB или H100, защото това е, което доставчиците изискват. SmolVLA и ACT работят на RTX 4090 или всяка 24 GB карта, защото това е наистина достатъчно.
Изпълнение на GR00T или Pi0.5 на 24 GB карта не се проваля в нулева секунда. То изтегля базовия контролен пункт, изгражда индекса на набора от данни, стартира първия forward pass и умира след няколкостотин стъпки с грешка CUDA out-of-memory. Платили сте за изтеглянето и настройката и не сте получили нищо. Корекции: недостатъчна памет по време на обучение.
Колко дълго всъщност работи всеки от петте модела
Времето за изпълнение е другата половина от цената: 2.00 USD на час е без значение, ако задачата е 40 минути, и разорително, ако е 40 часа. Това са настройките по подразбиране, които AY-Robots изпраща към обучителя, заедно с прозореца за изпълнение и цената за всяко ниво.
| Политика | Ниво на GPU | Макс. стъпки по подразбиране | Пакет по подразбиране (натрупване на градиент) | Прозорец за изпълнение | Цена на изпълнение |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, applies | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, applies | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, no effect | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, no effect | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

Откъде идват тези времеви прозорци за изпълнение нагоре по веригата
- SmolVLA: документацията на lerobot посочва, че 20 000 стъпки отнемат приблизително 4 часа на един A100. Платформата изпълнява същите 20 000 стъпки на по-евтиния 24 GB клас, откъдето идва и времеви прозорец, а не фиксирани 4 часа.
- ACT: оригиналният документ ALOHA съобщава за около 5 часа на една 11 GB RTX 2080 Ti за модел с 80 милиона параметри. 4090 е няколко поколения по-нова, но платформата предвижда 100 000 стъпки, така че времевият прозорец попада на същото място.
- GR00T: референтният работен процес на NVIDIA за поколението N1.6 цитира приблизително 4 до 8 часа за 20 000 стъпки при пакет 24 на осем L40S карти и 2 до 3 часа за 30 000 стъпки при пакет 16 на една Ada 6000. Фина настройка на 3B VLA с една карта за няколко часа е нормално, не е оптимистично.
- Pi0.5: openpi не публикува данни за реално време, но публикува долната граница от 70 GB за пълна фина настройка, което определя картата и оттам скоростта.
Струва си да се спрем на числото, което не плащате. Документът GR00T N1 съобщава за приблизително 50 000 H100 GPU часа за предварително обучение на 2.2B модела, на клъстер от до 1024 GPU, при размер на пакета за предварително обучение от 16 384 за 200 000 градиентни стъпки. При измерените по-горе 1.34 до 2.34 USD на час, това е от порядъка на 67 000 до 117 000 USD за нает изчислителен ресурс. Документът SmolVLA оценява проекта си на приблизително 30 000 GPU часа над 481 общностни набора от данни, 22.9K епизода и 10.6M кадъра. Вие наследявате всичко това на цената на едно изтегляне; вашите 8 USD купуват последните 20 000 стъпки. Защо VLA са изградени по този начин обхваща това разделение.
Ръката: еднократна цена, която засенчва сметката за GPU
Едно обучение струва по-малко от обяд. Роботът не. Ето защо SO-100 е важен: това е най-евтината ръка, която цялата обучение чрез имитация верига от инструменти всъщност поддържа.
| Ръка | Сервомотори | Напрежение | Цена на частите | Поддръжка на AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | пълен, референтна ръка |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | пълен |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | съвместим |
| LeKiwi | Feetech STS3215 ръка, колесна база | 7.4 V arm, 12 V base | 400 to 500 EUR | съвместим |
Списъкът с материали в хранилището SO-ARM100 е по-детайлен и си струва да бъде проверен спрямо вашия регион: неговият Части за две ръце списък възлиза на 229.88 USD или 226.30 EUR за конфигурация с лидер и последовател, а неговият Части за една ръка-последовател списък възлиза на 121.94 USD или 124.30 EUR. Шест сервомотора STS3215 по 13.89 USD всеки са 83.34 от тези 121.94, така че сервомоторите са ръката. При 1 до 3 USD за едно изпълнение на SmolVLA или ACT, един чифт ръце струва между 77 и 230 обучения. Ако все още избирате, SO-100 срещу SO-101 е сравнението, което има значение, защото двете са достатъчно близки, че решението е по-скоро за наличност, отколкото за възможности.
STS3215 се предлага във вариант 7.4 V и 12 V; хранилището отбелязва, че 12 V частта също се нуждае от 12 V 5 A захранване вместо 5 V, така че двете не са взаимозаменяеми. Подаването на 12 V към 7.4 V сервомотори ги унищожава, а шест сервомотора са две трети от цената на частите на една ръка-последовател. Проверете етикета на всеки сервомотор преди първото включване. Ако сервомоторите вече се държат странно: сервомоторът не реагира, ръката потрепва, след което увисва.
Човекочасове: редът, който никой не вписва в електронната таблица
Това е числото, което преобръща дискусията за разходите. Записването на демонстрации е човек, който движи роботизирана ръка, епизод по епизод, в реално време. Няма пакетна обработка и няма наемане на секунда. набор от данни LeRobot рекордерът идва с настройки по подразбиране, които улесняват аритметиката, като и трите са потвърдени в DatasetRecordConfig: 60 секунди на епизод, 60 секунди за нулиране на сцената, 50 епизода. Колоната за пари по-долу приема 15 USD за час от времето на някого, което е предположение, а не число от платформата. Заместете със собствената си ставка; съотношението е същественото.
- 1Запишете набора от данни с настройките по подразбиране, за които действително ще бъдете таксувани
Това е lerobot 0.6.1, версията в PyPI към 3 август 2026 г. Обърнете внимание на формата на CLI: записването се извършва чрез входната точка на конзолата
lerobot-record(lerobot.scripts.lerobot_record), а не по стария път на модулаpython -m lerobot.scripts.record. AY-Robots е насочен към 0.5.1, а wheel-ът на 0.5.1 декларира същите входни точкиlerobot-recordиlerobot-train, така че формата по-долу е стабилна и за двете. Трите флага за време са настройките по подразбиране, така че това е и командата, която аритметиката в следващата таблица приема.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Вижте какво сте записали, преди да наемете и една минута GPU
Проверката на набор от данни струва нула USD на час. Откриването на същия проблем от крива на загуби струва 2.00 USD на час на ниво H100 и ви казва четири часа по-късно. Качете набора от данни и го прегледайте във LeRobot прегледачката, или разгледайте директорията с набори от данни на AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Обучете и се уверете, че контролната точка надживява пода
Наетата машина е временна по дефиниция, така че записвайте контролни точки някъде трайно по време на изпълнението. Два флага решават дали запазвате това, за което сте платили.
--save_freqпо подразбиране е 20 000 стъпки, така че изпълнение по подразбиране на SmolVLA от 20 000 стъпки записва първата си контролна точка, когато изпълнението вече е приключило; намалете го, преди да наемете нещо прекъсваемо.--save_checkpoint_to_hubизисква--policy.repo_idи не съществува в lerobot 0.5.1, така че на тази версия копирате изходната директория от машината сами. Размерът на пакета по-долу е пример от документацията; формата на AY-Robots изпраща 2 за SmolVLA и записва в обектно хранилище, когато се появят контролни точки.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Епизоди | Записване при 60 сек | Нулиране при 60 сек | Реално време | Плюс 20 процента повторни записи | При 15 USD на човекочас |
|---|---|---|---|---|---|
| 30, минимумът за SmolVLA | 30 мин | 30 мин | 1 ч 00 мин | 1 ч 12 мин | около 18 USD |
| 50, другите четири минимума | 50 мин | 50 мин | 1 ч 40 мин | 2 ч 00 мин | около 30 USD |
| 100, удобен набор от данни | 100 мин | 100 мин | 3 ч 20 мин | 4 ч 00 мин | около 60 USD |
Сравнете дясната колона с 1 до 12 USD, които струва изпълнението. При тази приета ставка, набор от данни от 50 епизода струва два до седем пъти повече за запис, отколкото за обучение, преди калибриране, настройка на камерата и епизодите, които изхвърляте. Ето защо получаването на правилните данни от първия път има пряка доларова стойност. Ръководството на LeRobot предлага поне 50 епизода с 10 на местоположение на обект; документацията на SmolVLA съобщава, че версия от 25 епизода на същата задача не е била достатъчна.
Къде всъщност изчезват парите
1. Изпълнения с данни, които никога нямаше да проработят
Изпълнение на GR00T от 20 000 стъпки върху набор от данни с два разменени потока от камери струва същото като това върху чист набор от данни, отнема същото време и произвежда крива на загубите, която изглежда добре. Неуспехът се проявява на ръката, часове по-късно. Стъпки на обучение се таксуват на час, а диагностиката се таксува в дни. Два симптома, които си струва да запомните: загубата пада, но политиката не прави нищо обикновено означава, че наблюденията не съдържат това, от което се нуждае задачата, и политиката работи само в една настройка означава, че наборът от данни е имал по-малко вариации, отколкото сте си мислили.
2. Плащане на цени за фундаментални модели за задача с фиксирана камера
ACT е приблизително 80M параметъра и е проектиран да се обучава от нулата върху 50 демонстрации на една задача. GR00T N1.7 е приблизително 3B с предварително обучен гръбнак. За камера, закрепена с болтове, фиксирана маса и един обект, моделът от 80M често постига целта, работи с около 20 ms на стъпка на действие вместо 152 ms и струва от 1 до 3 USD на изпълнение вместо от 4 до 12. Похарчете 3 USD, за да разберете дали евтиният модел работи, преди да похарчите 12 USD за скъпия. ACT срещу SmolVLA и GR00T N1.7 срещу Pi0.5 показват къде всеки престава да бъде правилният отговор; арената на модели има 85 модела и 332 резултата от бенчмаркове.
3. GPU-то, за което забравихте
Най-евтината грешка за предотвратяване и най-често срещаната за допускане. Инстанция, стартирана в петък за отстраняване на грешки, се таксува през уикенда със същата скорост като реално изпълнение.
| Карта | Медианна ставка в моментната снимка | Неактивна за 24 ч | Неактивна за 7 дни | Това се равнява на |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | около 27 изпълнения на SmolVLA или ACT по 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | около 12 изпълнения на GR00T по 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | около 38 изпълнения на GR00T по 8 USD |
В AY-Robots този проблем е елиминиран за инференция: подове, осигурени от API за инференция, носят неактивен watchdog и се самоунищожават след период на неактивност. Ако наемете картата сами, този watchdog е вашето напомняне в календара.
4. Плащане два пъти за един и същ отговор
Входната точка за фино настройване на GR00T е tyro CLI, който не разкрива seed. Това не е ограничение на платформата, а е инструментът нагоре по веригата: няма поле за seed в gr00t/configs/finetune_config.py, а собствените съвети за обучение на хранилището предупреждават, че изпълненията варират с 5 до 6 процента, защото увеличенията на изображенията са недетерминистични. lerobot по подразбиране използва seed 1000 както във версии 0.5.1, така и 0.6.1, така че изпълненията на ACT, SmolVLA и Pi0.5 поне могат да бъдат повторени от същата инициализация и ред на данните. Това не е обещание за битово идентични тегла на GPU, но е разликата между повторно изпълнение и нов експеримент. Ако изпълнение на GR00T произведе работеща политика и не сте запазили контролна точка, плащате пълна цена за резултат, който може да се различава повече от разликата, която сте преследвали. Има втори начин да загубите контролна точка, за която сте платили: CLI по подразбиране използва --save-total-limit 5, документирано като максимален брой контролни точки, които се запазват, преди по-старите да бъдат изтрити. Съхранението струва центове; повторно изпълнение е 4 до 12 USD и шест часа.
Горните минимални цени са част от цената при поискване, а vast.ai твърди, че системата за наддаване може да намали разходите на клиентите с петдесет или повече процента. Уловката, по техните собствени думи: прекъсваема инстанция може да бъде поставена на пауза по всяко време, ако друг потребител наддаде по-високо или бъде създаден наем при поискване за същите ресурси, и тази пауза "спира всички работещи процеси". При поискване винаги има предимство. Добре е за изпълнение, което записва контролна точка на всеки няколкостотин стъпки, пълна загуба за такова, което записва в края, което е точно това, което ви дават настройките по подразбиране: Isaac-GR00T CLI записва на всеки --save-steps (по подразбиране 1000), но --save_freq на lerobot по подразбиране е 20,000 стъпки, така че стандартно изпълнение на SmolVLA записва контролна точка веднъж, на финала. Намалете го, или не наддавайте. Формулярът за обучение на AY-Robots излага настройката GR00T като saveSteps.
- Най-ниската почасова ставка, която съществува.
- Пълен контрол върху образа, версията на CUDA, ревизията на lerobot или Isaac-GR00T и всеки флаг.
- Наддаването за прекъсваем капацитет намалява ставката наполовина, ако вашето изпълнение записва контролни точки достатъчно често, за да оцелее при пауза.
- Нищо не е абстрахирано, така че когато едно изпълнение се държи странно, можете да видите защо.
- Настройката се таксува по цени за GPU: драйвери, зависимости, многогигабайтовата базова контролна точка и изтеглянето на набора от данни струват същото на час като обучението.
- Наддадена прекъсваема инстанция се поставя на пауза и нейните процеси се прекратяват. Незапазено изпълнение е изгорени пари, а настройката по подразбиране на lerobot записва първата си контролна точка на стъпка 20,000.
- Нищо не унищожава пода вместо вас. Горната таблица за престой е сметката за забравяне.
- Предлагането на единични пълни 80 GB карти е оскъдно: две A100 80 GB и пет H100 80 GB предложения за пълни карти в това четене. Списъкът също се променя, така че най-евтината обявена цена и цената, на която всъщност можете да наемете, не са едно и също число.
- Всеки час, прекаран в инфраструктура, е час, който не е прекаран в записване на епизодите, които решават дали политиката работи.
Да го направите сами срещу да оставите платформата да наеме картата
Вие избирате машината, изграждате средата и унищожавате пода. Почасовата ставка е пазарната ставка по-горе; всичко останало е ваше време.
- Намерете карта, съответстваща на VRAM, от която се нуждае моделът: 24 GB за ACT и SmolVLA, 80 GB за GR00T и Pi0.5.
- Наемете при поискване, ако изпълнението не може да оцелее при пауза, прекъсваемо, ако записва контролни точки често.
- Инсталирайте инструментариума: lerobot за ACT, SmolVLA и Pi0.5, хранилището Isaac-GR00T със собствен tyro стартер за GR00T.
- Конвертирайте набора от данни, ако е необходимо. Набор от данни LeRobot v3.0 срива GR00T зареждача и трябва да бъде конвертиран до v2.1.
- Стартирайте, наблюдавайте загубата, избутвайте контролни точки някъде трайно, докато се записват.
- Унищожете инстанцията, след което проверете дали сте я унищожили.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Реалистична цена за едно изпълнение на GR00T: 3 до 6 часа на H100 80 GB при 1.34 до 2.34 USD на час е 4 до 14 USD, плюс 20 до 40 минути настройка, която също се таксува, плюс вашето собствено време.
Вие избирате модела, набора от данни и хиперпараметрите във формуляр. Бекендът наема спот GPU, оразмерен според VRAM, от която се нуждае моделът, изпълнява обучителя и записва контролни точки в обектно хранилище.
- Изберете вашата комбинация в матрицата за обучение: пет модела, четири ръце, едно ръководство на клетка.
- Насочете го към набор от данни: записан с настолния клиент, Hugging Face repo id, или такъв от вашата собствена машина.
- Приемете настройките по подразбиране или ги коригирайте. Горната таблица показва какво всъщност се изпраща на обучителя.
- Бекендът избира картата според необходимата VRAM, така че никога не пазарувате за GPU.
- Контролните точки се записват в обектно хранилище, докато се пишат, така че прекъснато изпълнение не е загубено изпълнение.
| Ниво | Модели | Време за изпълнение | Цена на изпълнение |
|---|---|---|---|
| A100 80 GB or H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 to 6 hours | about 4 to 12 USD |
| RTX 4090 or any 24 GB card | SmolVLA, ACT | 2 to 5 hours | about 1 to 3 USD |
Какво не прави: не прави лош набор от данни добър, не дава на GR00T seed, който никога не е имал, или не премахва ограничението на латентността, описано по-долу. То премахва пазаруването на GPU, изграждането на средата и пода, който сте забравили да унищожите. Механиката е в документацията за обучение.
Какво таксува платформата и как избира картата
Логиката е умишлено скучна. Всеки модел в каталога, декларира ниво на GPU; бекендът взема необходимата VRAM и наема съответна карта на същия спот пазар, измерен по-горе. Ето защо посочената цена е диапазон, а не фиксирана цена. GR00T и Pi0.5 са само в облака тук поради изискванията от 40 GB и 70 GB. SmolVLA и ACT също работят локално на вашата собствена 24 GB карта, където облачната цена е нула, а електричеството е ваш проблем.

Една настройка заслужава предупреждение. Натрупването на градиенти наистина се прилага за двата варианта на GR00T, така че увеличаването му осигурява по-голям ефективен пакет на същата карта. За Pi0.5 и SmolVLA то изобщо не се прилага: lerobot 0.5.1 няма опция за натрупване на градиенти в конфигурацията си за обучение, така че задаването на полето на 16 не струва нищо и не носи нищо. Ако задача в опашката никога не стартира, страницата за заседнали в опашката задачи обяснява какво да проверите; ако наборът от данни бъде отхвърлен преди стартирането на изпълнението, това почти винаги е проблемът с формата v3.0.
Нает GPU, обслужващ вашата политика през публичния интернет, добавя допълнителни цикли към контролен контур, който вече е 20 до 485 ms на стъпка на действие. Добре за бавно вземане и поставяне, но не и за бързо реактивно движение. Облачният инференс оценява добре контролна точка, но изпълнява лошо производствени манипулации: ако задачата изисква скорост, изчислителната мощност трябва да е до сервомоторите, а това е разход, който тази статия не може да премахне. Вижте латентност на инференса.
Разработен бюджет за първа работеща политика
Всичките четири реда заедно, започвайки от нищото. Общата сума за GPU предполага 3 до 5 изпълнения: първото доказва, че конвейерът работи, второто разкрива проблем с данните, а третото или четвъртото е това, което запазвате.
| Ред | Икономичен път | Комфортен път |
|---|---|---|
| Ръка | Само SO-100 follower, 121.94 USD в BOM | leader плюс follower, 229.88 USD в BOM |
| Модел | SmolVLA или ACT, 24 GB ниво | GR00T N1.7, A100 80 GB или H100 ниво |
| Записани епизоди | 30, минимумът за SmolVLA | 50 до 100 |
| Човешко време за запис | около 1 ч 12 мин | 2 до 4 часа |
| Цена на едно изпълнение | 1 до 3 USD | 4 до 12 USD |
| Изпълнения преди да заработи | 3 до 5 | 3 до 5 |
| Общи разходи за GPU | 3 до 15 USD | 12 до 60 USD |
| Най-голям ред в сметката | ръката, след това вашето време | ръката, след това вашето време |
Моделът се запазва и при този размер робот: изчисленията са грешка при закръгляване, хардуерът е реална еднократна цена, човекочасовете са повтарящ се разход. За да тествате тренировъчната част, преди да купите каквото и да било, ви позволяват да сравнявате модели и да наемете GPU без робот, а е физически SO-100, който можете да управлявате в браузъра без регистрация. За целия процес от край до край, обхваща настройката, и обучението, а е кратката версия.

Колко струва едно VLA фино настройване от край до край?▾
Около 4 до 12 USD за GR00T N1.7, GR00T N1.5 или Pi0.5 на ниво A100 80 GB или H100 (3 до 6 часа при 1.20 до 2.00 USD на час), и около 1 до 3 USD за SmolVLA или ACT на ниво RTX 4090 (2 до 5 часа при 0.30 до 0.60 USD на час). Наемането на картата от вас попада в същия диапазон, след като се отчете времето за настройка, тъй като се таксува по тарифата за обучение.
Струва ли си да се плаща за H100 вместо за A100 80 GB?▾
За една SO-100 политика, обикновено не. И двете покриват минималните изисквания за памет на GR00T и Pi0.5, а към 23 август 2026 г. пълна A100 80 GB започваше от 0.44 USD на час срещу 1.34 за H100 80 GB. H100 завършва по-бързо, така че част от цената се възстановява като по-малко часове, но общата сума все още е по-висока за толкова малък цикъл. Истинският аргумент за H100 е наличността: пет оферти за единичен H100 80 GB на този пазар срещу две за A100 80 GB, а карта, която не можете да наемете, няма цена.
Колко цикъла са необходими, преди една политика наистина да заработи?▾
Планирайте три до пет. Първият доказва, че процесът е свързан правилно. Вторият често разкрива проблем с набора от данни, като например прекъснат видео поток от камера. Третият или четвъртият е този, който запазвате.
Мога ли да обуча SmolVLA или ACT на собствения си GPU, вместо да наемам?▾
Да. И двете се поддържат локално на AY-Robots и двете се побират удобно в 24 GB; оригиналният ACT документ обучава своя 80M модел за около 5 часа на 11 GB RTX 2080 Ti. GR00T и Pi0.5 са само в облак тук, защото документираните минимални изисквания за фина настройка на доставчиците са 40 GB и 70 GB, а най-голямата потребителска карта на пазара е 32 GB RTX 5090.
Защо един и същ брой стъпки струва различни суми при различните модели?▾
Стъпките не са сравними между политиките. ACT по подразбиране е 100,000 стъпки при пакет 8 на 24 GB карта; GR00T N1.5 по подразбиране е 2,000 стъпки при пакет 1 с натрупване на градиент 16 на 80 GB карта. Сметката е часове, умножени по тарифата на картата, към която ви принуждава отпечатъкът на паметта, а не броячът на стъпки.
Вижте колко ще струва вашият цикъл, преди да го стартирате
Всяка от петте политики изброява своето GPU ниво, време за изпълнение и цена на цикъл, а тренировъчният бекенд наема картата на същия спот пазар, на който са измерени тези числа.
Проверете ценитеSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started