
Реальные цены на GPU на спотовом рынке, сколько времени занимает выполнение каждой из пяти политик, сколько стоят манипулятор и демонстрации, и четыре места, куда незаметно уходят деньги.
Краткая версия
- •Запуск на уровне A100 80 ГБ или H100 занимает от 3 до 6 часов и стоит примерно от 4 до 12 долларов США. На уровне RTX 4090 это от 2 до 5 часов и примерно от 1 до 3 долларов США.
- •Измерено на vast.ai в 13:44 UTC 23 августа 2026 года: полная RTX 4090 по запросу за 0.13 до 0.38 USD/ч, A100 80 ГБ за 0.44 до 0.67, H100 80 ГБ за 1.34 до 2.34. Полные карты на 80 ГБ дефицитны, соответственно два и пять предложений по одной карте.
- •GPU — это самая дешевая статья расходов. Смета SO-ARM100 оценивает пару «лидер плюс последователь» в 229.88 долларов США, что эквивалентно 77–230 запускам на уровне 24 ГБ.
- •Два часа записи 50 эпизодов человеком стоят дороже, чем обучающий запуск, для которого эти эпизоды используются.
- •Деньги исчезают в четырех местах: запуски на поврежденных данных, 3B модели для задач, с которыми справляется 80M политика, GPU, которые никто не уничтожил, и повторные запуски результата, который вы не сохранили.
- •AY-Robots подбирает карту по объему VRAM, необходимому модели, и арендует ее на том же спотовом рынке, поэтому стоимость запуска соответствует рыночной.
Смета состоит из четырех статей, и GPU — самая маленькая из них
Когда люди спрашивают, сколько стоит дообучение визуально-языковой модели действий для SO-100, они почти всегда имеют в виду аренду GPU. Это число, которое отображается как списание с карты, поэтому оно кажется реальным. Это также, с большим отрывом, наименьшее из четырех чисел, которые определяют, сколько на самом деле стоит работающая политика на самом деле вам обходится.
| Статья | Что это | Типичный размер для одной работающей политики |
|---|---|---|
| Время GPU | аренда карты для запуска | от 1 до 12 долларов США за запуск, и вы сделаете от 3 до 5 |
| Робот | сервоприводы, напечатанная рама, камеры, кабели, питание | единовременно, от 110 до 500 евро за манипулятор |
| Человеко-часы | человек, управляющий манипулятором для записи демонстраций | от 1 до 4 часов на набор данных, повторяется для каждой задачи |
| Потери | плохие данные, слишком большие модели, забытые поды | неограниченно, и это единственная статья, которую вы контролируете |
Время обучения, указанное ниже, взято из собственных статей и репозиториев пяти моделей, стоимость оборудования — из опубликованной спецификации, а данные по платформам — из AY-Robots каталог политик и страница цен. В тех случаях, когда платформа не помогает, это указано в данной статье.
Сколько на самом деле стоит час GPU на спотовом рынке
Единой цены за час A100 не существует. На таких торговых площадках, как vast.ai, каждый хост устанавливает свою собственную ставку, и запуск обучения , который вы запускаете, попадает на ту машину, которая в данный момент дешева и свободна. Честный ответ — это распределение. Вот оно, измерено 23 августа 2026 года в 13:44 UTC: одиночные полнофункциональные карты, по запросу, отфильтрованные по реальной VRAM.
| Карта | vast.ai по запросу USD/ч (низкая / медианная / высокая) | Предложения по полной карте | Минимальная ставка vast.ai | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | не предлагается |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | не предлагается |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | не предлагается |
Предложения по запросу для одной полной GPU (gpu_frac == 1.0) из публичного API пакетов vast.ai, не требующего учетной записи, отфильтрованные по gpu_ram, чтобы только подлинные карты на 80 ГБ попадали в строки 80 ГБ. Этот фильтр важен: в этом отчете все три предложения по одной карте A100 SXM4 были на 40 ГБ, как и два из четырех предложений A100 PCIE, поэтому объединение их в одну строку "A100" уменьшило бы указанную здесь цену вдвое. Столбец Hugging Face объединяет два продукта: 2.50 USD/h — это оборудование Nvidia A100 - large Spaces, а 4.50 USD/h — это одна H100 80 ГБ в рамках Inference Endpoints, которую Spaces не предлагает. Медианные значения следует рассматривать как ориентировочные: строка A100 80 ГБ основана на двух предложениях, а строка H100 — на пяти, и идентичный запрос 36 секунд спустя вернул другое количество 4090 и другую максимальную цену по трем из пяти строк. Цены RunPod являются более стабильным показателем для планирования.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Почему модели 3B не могут использовать дешевую карту
Час работы 4090 и час работы H100 80 ГБ отличаются примерно в шесть раз по указанным выше медианным значениям. Что вынуждает использовать дорогую карту, так это не скорость, а память. openpi устанавливает минимальный порог для полной Pi0.5 тонкой настройки в 70 ГБ, а NVIDIA рекомендует 40 ГБ или более для GR00T. Обратите внимание, чем не является число для GR00T. Его конфигурация тонкой настройки по умолчанию замораживает языковую модель и визуальный кодировщик (tune_llm и tune_visual являются False, а проектор и диффузионная головка True), поэтому в каталоге указано примерно 40 млн обученных параметров из 3 млрд. 40 ГБ — это не состояние оптимизатора для 3 млрд весов, это замороженный бэкбон плюс активации. Варианты с уменьшенным объемом требуют меньше: путь LoRA от openpi запрашивает 22.5 ГБ и указывает 4090, а рабочий процесс Isaac Lab Arena от NVIDIA перечисляет опцию с одной GPU на 24 ГБ для GR00T после обучения. Платформа разделяет уровни в зависимости от минимальных требований, которые каждый поставщик публикует для фактически используемой им конфигурации. Описание pi0 flow-matching объясняет, откуда берется этот след сопоставления потоков.
| Задача | Требуемая память для вышестоящего проекта | Источник |
|---|---|---|
| Инференс pi0 / pi0.5 | более 8 ГБ, например RTX 4090 | openpi |
| Тонкая настройка pi0 / pi0.5 LoRA | более 22.5 ГБ, например RTX 4090 | openpi |
| Полная тонкая настройка pi0 / pi0.5 | более 70 ГБ, например A100 80 ГБ или H100 | openpi |
| Инференс GR00T N1.7 | 1 GPU с 16 ГБ или более | Isaac-GR00T |
| Тонкая настройка GR00T N1.7 | рекомендуется 40 ГБ или более, узлы H100 или L40 | Isaac-GR00T |
| Тонкая настройка GR00T, что она обучает | проектор и диффузионная головка; LLM и визуальный кодировщик заморожены по умолчанию | finetune_config.py |
| GR00T после обучения, сокращенный | 1 GPU с 24 ГБ, языковая модель заморожена | Isaac Lab Arena |
| Тонкая настройка SmolVLA | одна A100 для эталонного запуска на 20 000 шагов | lerobot docs |
| Обучение ACT | одна 11 ГБ RTX 2080 Ti | ACT paper |
Эта таблица объясняет, почему платформа разделяет пять моделей на два уровня. GR00T N1.7, GR00T N1.5 и Pi0.5 используют A100 80 ГБ или H100, потому что именно это требуют поставщики. SmolVLA и ACT используют RTX 4090 или любую карту с 24 ГБ, потому что этого действительно достаточно.
Запуск GR00T или Pi0.5 на карте с 24 ГБ не завершается ошибкой на нулевой секунде. Он скачивает базовый чекпоинт, строит индекс набора данных, начинает первый прямой проход и умирает через несколько сотен шагов с ошибкой CUDA out-of-memory. Вы заплатили за скачивание и настройку, но ничего не получили. Решения: нехватка памяти во время обучения.
Сколько времени фактически работает каждая из пяти моделей
Время выполнения — это вторая половина стоимости: 2.00 USD в час не имеет значения, если работа занимает 40 минут, и разорительно, если она длится 40 часов. Это параметры по умолчанию, которые AY-Robots фактически отправляет тренеру, с окном выполнения и стоимостью для каждого уровня.
| Политика | Уровень GPU | Максимальное количество шагов по умолчанию | Размер пакета по умолчанию (накопление градиента) | Окно выполнения | Стоимость за выполнение |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, накопление 1, применяется | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, накопление 16, применяется | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, накопление 16, без эффекта | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, накопление 8, без эффекта | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, накопление 1 | 2 to 5 h | 1 to 3 USD |

Откуда берутся эти временные окна выполнения
- SmolVLA: документация LeRobot утверждает, что 20 000 шагов занимают примерно 4 часа на одной A100. Платформа выполняет те же 20 000 шагов на более дешевом уровне с 24 ГБ, отсюда и окно, а не фиксированные 4 часа.
- ACT: в оригинальной статье ALOHA сообщается о примерно 5 часах на одной 11 ГБ RTX 2080 Ti для модели с 80 миллионами параметров. 4090 на несколько поколений новее, но платформа выделяет бюджет на 100 000 шагов, поэтому окно попадает в то же место.
- GR00T: эталонный рабочий процесс NVIDIA для поколения N1.6 указывает примерно от 4 до 8 часов для 20 000 шагов при размере пакета 24 на восьми картах L40S, и от 2 до 3 часов для 30 000 шагов при размере пакета 16 на одной Ada 6000. Тонкая настройка 3B VLA на одной карте за несколько часов — это нормально, а не оптимистично.
- Pi0.5: openpi не публикует данные о реальном времени выполнения, но указывает минимальный объем в 70 ГБ для полной тонкой настройки, что определяет карту и, следовательно, скорость.
Стоит остановиться на цифре, за которую вы не платите. В статье GR00T N1 сообщается о примерно 50 000 часах работы GPU H100 для предварительного обучения модели 2.2B на кластере до 1024 GPU, при размере пакета предварительного обучения 16 384 для 200 000 шагов градиента. При стоимости от 1.34 до 2.34 USD в час, измеренной выше, это составляет порядка от 67 000 до 117 000 USD арендованных вычислительных мощностей. В статье SmolVLA указывается, что проект занял примерно 30 000 часов работы GPU на 481 общедоступном наборе данных, 22.9K эпизодах и 10.6M кадрах. Вы наследуете все это по цене загрузки; ваши 8 USD покупают последние 20 000 шагов. Почему VLA строятся таким образом охватывает это разделение.
Манипулятор: единовременные затраты, которые затмевают счет за GPU
Один тренировочный запуск стоит меньше обеда. Робот — нет. Вот почему SO-100 важен: это самый дешевый манипулятор, который фактически поддерживает вся обучающаяся имитация цепочка инструментов.
| Манипулятор | Сервоприводы | Напряжение | Стоимость деталей | Поддержка на AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | полный, эталонный манипулятор |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | полный |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | совместимый |
| LeKiwi | манипулятор Feetech STS3215, колесная база | манипулятор 7.4 В, база 12 В | 400 to 500 EUR | совместимый |
Исходная спецификация в репозитории SO-ARM100 более детализирована и стоит того, чтобы свериться с вашим регионом: ее Детали для двух манипуляторов список составляет 229.88 USD или 226.30 EUR для конфигурации «лидер плюс ведомый», а ее Детали для одного ведомого манипулятора список составляет 121.94 USD или 124.30 EUR. Шесть сервоприводов STS3215 по 13.89 USD каждый составляют 83.34 из этих 121.94, так что сервоприводы — это и есть манипулятор. При стоимости от 1 до 3 USD за один запуск SmolVLA или ACT, одна пара манипуляторов стоит от 77 до 230 тренировочных запусков. Если вы все еще выбираете, SO-100 против SO-101 — это сравнение, которое имеет значение, потому что эти два манипулятора достаточно близки, чтобы решение зависело от доступности, а не от возможностей.
STS3215 поставляется в вариантах на 7.4 В и 12 В; в репозитории отмечается, что для детали на 12 В также требуется источник питания 12 В 5 А вместо 5 В, поэтому эти два варианта не взаимозаменяемы. Подача 12 В на сервоприводы 7.4 В уничтожает их, а шесть сервоприводов составляют две трети стоимости деталей ведомого манипулятора. Проверьте этикетку на каждом сервоприводе перед первым включением. Если сервоприводы уже ведут себя странно: сервопривод не отвечает, манипулятор дергается, затем провисает.
Человеко-часы: строка, которую никто не вносит в таблицу
Это число, которое переворачивает обсуждение стоимости с ног на голову. Запись демонстраций — это человек, перемещающий роботизированную руку, по одному эпизоду за раз, в реальном времени. Здесь нет пакетной обработки и почасовой аренды. LeRobot набор данных рекордер поставляется с настройками по умолчанию, которые упрощают арифметику, все три подтверждены в DatasetRecordConfig: 60 секунд на эпизод, 60 секунд на сброс сцены, 50 эпизодов. Столбец с деньгами ниже предполагает 15 USD за час чьего-либо времени, что является предположением, а не числом платформы. Подставьте свою собственную ставку; главное — это соотношение.
- 1Запишите набор данных с настройками по умолчанию, за которые вы фактически будете платить
Это lerobot 0.6.1, версия на PyPI по состоянию на 3 августа 2026 года. Обратите внимание на форму CLI: запись выполняется через точку входа консоли
lerobot-record(lerobot.scripts.lerobot_record), а не старый путь модуляpython -m lerobot.scripts.record. AY-Robots ориентируется на 0.5.1, и колесо 0.5.1 объявляет те же точки входаlerobot-recordиlerobot-train, поэтому форма ниже стабильна для обеих версий. Три флага времени являются стандартными для вышестоящей версии, поэтому это также команда, которую предполагает арифметика в следующей таблице.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Посмотрите, что вы записали, прежде чем арендовать хотя бы одну минуту GPU
Проверка набора данных стоит ноль USD в час. Обнаружение той же проблемы по кривой потерь стоит 2.00 USD в час на уровне H100 и сообщает вам об этом на четыре часа позже. Загрузите набор данных и просмотрите его в LeRobot просмотрщике, или просмотрите AY-Robots каталог наборов данных.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Обучайте и убедитесь, что контрольная точка переживет под
Арендованная машина по определению временна, поэтому записывайте контрольные точки где-нибудь в надежном месте во время выполнения. Два флага определяют, сохраните ли вы то, за что заплатили.
--save_freqпо умолчанию составляет 20 000 шагов, поэтому стандартный запуск SmolVLA на 20 000 шагов записывает свою первую контрольную точку, когда выполнение уже завершено; уменьшите его, прежде чем арендовать что-либо прерываемое.--save_checkpoint_to_hubтребует--policy.repo_idи не существует в lerobot 0.5.1, поэтому в этой версии вы копируете выходной каталог с машины самостоятельно. Размер пакета ниже является примером из документации вышестоящей версии; форма AY-Robots отправляет 2 для SmolVLA и записывает в объектное хранилище по мере появления контрольных точек.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Эпизоды | Запись по 60 с | Сброс по 60 с | Реальное время | Плюс 20 процентов перезаписей | По 15 USD за человеко-час |
|---|---|---|---|---|---|
| 30, минимум SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, остальные четыре минимума | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, комфортный набор данных | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
Сравните правый столбец со стоимостью запуска от 1 до 12 USD. При такой предполагаемой ставке набор данных из 50 эпизодов стоит в два-семь раз дороже для записи, чем для обучения, до калибровки, настройки камеры и отбрасываемых эпизодов. Вот почему имеет прямую денежную ценность. Руководство lerobot предлагает не менее 50 эпизодов по 10 на каждое местоположение объекта; документация SmolVLA сообщает, что версии той же задачи из 25 эпизодов было недостаточно.
Куда на самом деле уходят деньги
1. Запуски на данных, которые изначально не могли сработать
Запуск GR00T на 20 000 шагов на наборе данных с двумя перепутанными потоками камеры стоит столько же, сколько и на чистом наборе данных, занимает то же время и дает кривую потерь, которая выглядит нормально. Сбой проявляется на манипуляторе, спустя часы. оплачиваются почасово, а диагностика — посуточно. Два симптома, которые стоит запомнить: обычно означает, что наблюдения не содержат того, что требуется для задачи, и означает, что набор данных имел меньше вариаций, чем вы думали.
2. Оплата цен базовых моделей для задачи с фиксированной камерой
ACT имеет примерно 80 миллионов параметров и был разработан для обучения с нуля на 50 демонстрациях одной задачи. GR00T N1.7 имеет примерно 3 миллиарда параметров с предварительно обученной основой. Для закрепленной камеры, фиксированного стола и одного объекта модель с 80 миллионами параметров часто справляется, работает со скоростью около 20 мс на шаг действия вместо 152 мс и стоит от 1 до 3 долларов США за запуск вместо от 4 до 12. Потратьте 3 доллара США, чтобы выяснить, работает ли дешевая модель, прежде чем тратить 12 долларов США на дорогую. ACT против SmolVLA и GR00T N1.7 против Pi0.5 показывают, где каждый из них перестает быть правильным решением; арена моделей содержит 85 моделей и 332 результата бенчмарков.
3. Графический процессор, о котором вы забыли
Самая дешевая ошибка, которую можно предотвратить, и самая распространенная. Инстанс, запущенный в пятницу для отладки чего-либо, будет тарифицироваться в течение выходных по той же ставке, что и реальный запуск.
| Карта | Медианная ставка в снимке | Простой 24 ч | Простой 7 дней | Это эквивалентно |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | примерно 27 запусков SmolVLA или ACT по 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | примерно 12 запусков GR00T по 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | примерно 38 запусков GR00T по 8 USD |
На AY-Robots эта проблема устранена для инференса: поды, предоставляемые API инференса, имеют сторожевой таймер простоя и самоуничтожаются после периода бездействия. Если вы арендуете карту самостоятельно, этот сторожевой таймер — ваше напоминание в календаре.
4. Двойная оплата за один и тот же результат
Точка входа для дообучения GR00T — это CLI tyro, который не предоставляет сид. Это не ограничение платформы, а инструмент вышестоящего уровня: в gr00t/configs/finetune_config.py, а собственные советы по обучению репозитория предупреждают, что результаты запусков могут отличаться на 5-6 процентов из-за недетерминированных аугментаций изображений. lerobot по умолчанию использует сид 1000 как в версии 0.5.1, так и в 0.6.1, поэтому запуски ACT, SmolVLA и Pi0.5 могут быть как минимум повторно выполнены с той же инициализацией и порядком данных. Это не обещание побитово идентичных весов на GPU, но это разница между повторным запуском и новым экспериментом. Если запуск GR00T создает работающую политику, а вы не сохранили контрольную точку, вы платите полную цену за результат, который может отличаться больше, чем та разница, которую вы искали. Есть второй способ потерять оплаченную контрольную точку: CLI по умолчанию использует --save-total-limit 5, что документировано как максимальное количество сохраняемых контрольных точек до удаления старых. Хранение стоит центы; повторный запуск — это 4–12 USD и шесть часов.
Указанные выше минимальные ставки составляют лишь часть от тарифа по требованию, и vast.ai утверждает, что система торгов может сократить расходы клиентов на пятьдесят процентов или более. Подвох, по их собственным словам: прерываемый экземпляр может быть приостановлен в любое время, если другой пользователь предложит более высокую ставку или будет создана аренда по требованию для тех же ресурсов, и эта пауза «останавливает все запущенные процессы». По требованию всегда имеет приоритет. Это хорошо для запуска, который записывает контрольную точку каждые несколько сотен шагов, но полная потеря для того, который записывает в конце, что именно и дают вам настройки по умолчанию: CLI Isaac-GR00T записывает каждые --save-steps (по умолчанию 1000), но --save_freq lerobot по умолчанию составляет 20 000 шагов, поэтому стандартный запуск SmolVLA создает контрольную точку один раз, на финише. Уменьшите его, или не делайте ставок. Форма обучения AY-Robots предоставляет параметр GR00T как saveSteps.
- Самая низкая почасовая ставка.
- Полный контроль над образом, версией CUDA, ревизией lerobot или Isaac-GR00T и каждым флагом.
- Прерываемые торги вдвое снижают ставку, если ваш запуск достаточно часто создает контрольные точки, чтобы пережить паузу.
- Ничто не абстрагировано, поэтому, когда запуск ведет себя странно, вы можете понять, почему.
- Настройка оплачивается по тарифам GPU: драйверы, зависимости, многогигабайтный базовый чекпоинт и загрузка набора данных — все это стоит столько же в час, сколько и обучение.
- Прерываемый экземпляр, ставка по которому была перебита, приостанавливается, а его процессы завершаются. Несохраненный запуск — это потраченные впустую деньги, а lerobot по умолчанию записывает свою первую контрольную точку на шаге 20 000.
- Ничто не уничтожает под за вас. Приведенная выше таблица простоя — это счет за забывчивость.
- Предложение одиночных полноразмерных карт на 80 ГБ ограничено: в этом обзоре два предложения A100 80 ГБ и пять H100 80 ГБ. Список также постоянно меняется, поэтому самая низкая указанная цена и цена, по которой вы можете фактически арендовать, не совпадают.
- Каждый час, потраченный на инфраструктуру, — это час, не потраченный на запись эпизодов, которые определяют, работает ли политика.
Делать это самостоятельно или позволить платформе арендовать карту
Вы выбираете машину, создаете окружение и уничтожаете под. Почасовая ставка — это рыночная ставка, указанная выше; все остальное — ваше время.
- Найдите карту, соответствующую VRAM, необходимой модели: 24 ГБ для ACT и SmolVLA, 80 ГБ для GR00T и Pi0.5.
- Арендуйте по требованию, если запуск не может пережить паузу, или прерываемый, если он часто создает контрольные точки.
- Установите инструментарий: lerobot для ACT, SmolVLA и Pi0.5, репозиторий Isaac-GR00T с собственным tyro-лаунчером для GR00T.
- При необходимости преобразуйте набор данных. Набор данных LeRobot v3.0 вызывает сбой загрузчика GR00T и должен быть преобразован до версии v2.1.
- Запустите, следите за потерями, сохраняйте контрольные точки в надежное хранилище по мере их записи.
- Уничтожьте экземпляр, затем убедитесь, что вы его уничтожили.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Реалистичная стоимость одного запуска GR00T: от 3 до 6 часов на H100 80 ГБ по цене от 1.34 до 2.34 USD в час составляет от 4 до 14 USD, плюс от 20 до 40 минут настройки, которая также оплачивается, плюс ваше собственное время.
Вы выбираете модель, набор данных и гиперпараметры в форме. Бэкенд арендует спотовый GPU, размер которого определяется необходимой модели VRAM, запускает тренажер и записывает контрольные точки в объектное хранилище.
- Выберите свою комбинацию в матрице обучения: пять моделей, четыре руки, одно руководство на ячейку.
- Укажите набор данных: записанный с помощью настольного клиента, идентификатор репозитория Hugging Face или набор данных с вашей собственной машины.
- Примите значения по умолчанию или настройте их. Таблица выше показывает, что фактически отправляется тренеру.
- Бэкенд выбирает карту по требуемой VRAM, поэтому вам никогда не придется искать GPU.
- Контрольные точки попадают в объектное хранилище по мере их записи, поэтому прерванный запуск не является потерянным.
| Уровень | Модели | Время выполнения | Стоимость за запуск |
|---|---|---|---|
| A100 80 ГБ или H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | от 3 до 6 часов | около 4 до 12 USD |
| RTX 4090 или любая карта на 24 ГБ | SmolVLA, ACT | от 2 до 5 часов | около 1 до 3 USD |
Что он не делает: не делает плохой набор данных хорошим, не дает GR00T seed, которого у него никогда не было, и не снимает ограничение задержки, описанное ниже. Он избавляет от поиска GPU, создания окружения и пода, который вы забыли уничтожить. Механика описана в документации по обучению.
Что платформа взимает и как она выбирает карту
Логика намеренно проста. Каждая модель в каталоге объявляет уровень GPU; бэкенд берет требуемую VRAM и арендует подходящую карту на том же спотовом рынке, измеренном выше. Вот почему указанная стоимость является диапазоном, а не фиксированной ценой. GR00T и Pi0.5 доступны здесь только в облаке из-за минимальных требований в 40 ГБ и 70 ГБ соответственно. SmolVLA и ACT также работают локально на вашей собственной 24 ГБ карте, где облачная стоимость равна нулю, а электричество — ваша проблема.

Один параметр заслуживает предупреждения. Накопление градиента действительно применимо для обоих вариантов GR00T, поэтому его увеличение позволяет получить больший эффективный пакет на той же карте. Для Pi0.5 и SmolVLA оно не применимо вовсе: lerobot 0.5.1 не имеет опции накопления градиента в своей конфигурации обучения, поэтому установка этого поля в 16 ничего не стоит и ничего не дает. Если задание в очереди так и не запускается, страница о застрявшем в очереди задании описывает, что проверить; если набор данных отклоняется до начала выполнения, это почти всегда проблема с форматом v3.0.
Арендованный GPU, обслуживающий вашу политику через публичный интернет, добавляет задержки в контур управления, который уже составляет от 20 до 485 мс на шаг действия. Это хорошо для медленных операций типа «взять и положить», но не для быстрых реактивных движений. Облачный инференс хорошо оценивает контрольную точку, но плохо справляется с производственными манипуляциями: если задача требует скорости, вычисления должны находиться рядом с сервоприводами, и это затраты, которые данная статья не может устранить. См. задержка инференса.
Проработанный бюджет для первой рабочей политики
Все четыре строки вместе, начиная с нуля. Общая сумма GPU предполагает от 3 до 5 запусков: первый доказывает работоспособность конвейера, второй выявляет проблему с данными, третий или четвертый — это тот, который вы сохраняете.
| Позиция | Экономный путь | Комфортный путь |
|---|---|---|
| Манипулятор | только SO-100 follower, 121.94 USD в спецификации | leader плюс follower, 229.88 USD в спецификации |
| Модель | SmolVLA или ACT, уровень 24 ГБ | GR00T N1.7, уровень A100 80 ГБ или H100 |
| Записано эпизодов | 30, минимум для SmolVLA | от 50 до 100 |
| Время человека на запись | около 1 ч 12 мин | от 2 до 4 часов |
| Стоимость одного запуска | от 1 до 3 USD | от 4 до 12 USD |
| Запусков до работоспособности | от 3 до 5 | от 3 до 5 |
| Общие затраты на GPU | от 3 до 15 USD | от 12 до 60 USD |
| Наибольшая статья расходов | манипулятор, затем ваше время | манипулятор, затем ваше время |
Эта закономерность сохраняется и для роботов такого размера: вычисления — это погрешность округления, оборудование — реальные единовременные затраты, человеко-часы — повторяющиеся расходы. Чтобы протестировать обучающую часть до покупки чего-либо, точки входа без оборудования позволяют сравнивать модели и арендовать GPU без манипулятора, а живой манипулятор — это физический SO-100, которым можно управлять в браузере без регистрации. Для всего конвейера от начала до конца полное руководство по SO-100 охватывает настройку, телеуправление и обучение, а обучите свою первую политику — это краткая версия.

Сколько стоит один полный цикл тонкой настройки VLA?▾
Примерно от 4 до 12 USD для GR00T N1.7, GR00T N1.5 или Pi0.5 на уровне A100 80 ГБ или H100 (от 3 до 6 часов по 1.20 до 2.00 USD в час), и примерно от 1 до 3 USD для SmolVLA или ACT на уровне RTX 4090 (от 2 до 5 часов по 0.30 до 0.60 USD в час). Аренда карты самостоятельно обойдется в ту же сумму, если учесть время на настройку, поскольку она оплачивается по тарифу обучения.
Стоит ли платить за H100 вместо A100 80 ГБ?▾
Для одной политики SO-100 — обычно нет. Обе карты удовлетворяют минимальным требованиям по памяти для GR00T и Pi0.5, и по состоянию на 23 августа 2026 года полная A100 80 ГБ стоила от 0.44 USD в час против 1.34 за H100 80 ГБ. H100 завершает работу быстрее, поэтому часть стоимости компенсируется меньшим количеством часов, но общая сумма все равно выше для такого небольшого запуска. Настоящий аргумент в пользу H100 — это доступность: пять предложений по H100 80 ГБ на этом рынке против двух A100 80 ГБ, а карта, которую нельзя арендовать, не имеет цены.
Сколько запусков требуется, прежде чем политика действительно заработает?▾
Планируйте от трех до пяти. Первый доказывает, что конвейер настроен правильно. Второй обычно выявляет проблему с набором данных, например, прерванный поток с камеры. Третий или четвертый — это тот, который вы сохраните.
Могу ли я обучать SmolVLA или ACT на своем собственном GPU вместо аренды?▾
Да. Оба поддерживаются локально на AY-Robots и оба комфортно помещаются в 24 ГБ; в оригинальной статье ACT ее модель 80M обучалась примерно за 5 часов на 11 ГБ RTX 2080 Ti. GR00T и Pi0.5 здесь доступны только в облаке, потому что задокументированные минимальные требования поставщиков для тонкой настройки составляют 40 ГБ и 70 ГБ, а самая большая потребительская карта на рынке — это 32 ГБ RTX 5090.
Почему одинаковое количество шагов стоит по-разному для разных моделей?▾
Шаги не сопоставимы между политиками. ACT по умолчанию использует 100 000 шагов с пакетом 8 на карте 24 ГБ; GR00T N1.5 по умолчанию использует 2 000 шагов с пакетом 1 и накоплением градиента 16 на карте 80 ГБ. Счет выставляется за часы, умноженные на тариф карты, на которую вас вынуждает объем памяти, а не по счетчику шагов.
Узнайте, сколько будет стоить ваш запуск, прежде чем начать
Каждая из пяти политик указывает свой уровень GPU, время выполнения и цену за запуск, а бэкенд обучения арендует карту на том же спотовом рынке, на котором были измерены эти показатели.
Проверить ценыSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started