Таблица затрат AY-Robots, показывающая, какой GPU требуется для каждой из пяти политик, типичное время выполнения и цена за запуск, а также сколько эпизодов необходимо, прежде чем политика станет полезной
Обучение VLAЗатраты на GPUSO-100ДообучениеОбучение роботовБюджетирование

Стоимость обучения VLA: Сколько на самом деле стоит один запуск дообучения

AY-Robots ResearchAugust 23, 202623 мин чтения

Реальные цены на GPU на спотовом рынке, сколько времени занимает выполнение каждой из пяти политик, сколько стоят манипулятор и демонстрации, и четыре места, куда незаметно уходят деньги.

Краткая версия

  • Запуск на уровне A100 80 ГБ или H100 занимает от 3 до 6 часов и стоит примерно от 4 до 12 долларов США. На уровне RTX 4090 это от 2 до 5 часов и примерно от 1 до 3 долларов США.
  • Измерено на vast.ai в 13:44 UTC 23 августа 2026 года: полная RTX 4090 по запросу за 0.13 до 0.38 USD/ч, A100 80 ГБ за 0.44 до 0.67, H100 80 ГБ за 1.34 до 2.34. Полные карты на 80 ГБ дефицитны, соответственно два и пять предложений по одной карте.
  • GPU — это самая дешевая статья расходов. Смета SO-ARM100 оценивает пару «лидер плюс последователь» в 229.88 долларов США, что эквивалентно 77–230 запускам на уровне 24 ГБ.
  • Два часа записи 50 эпизодов человеком стоят дороже, чем обучающий запуск, для которого эти эпизоды используются.
  • Деньги исчезают в четырех местах: запуски на поврежденных данных, 3B модели для задач, с которыми справляется 80M политика, GPU, которые никто не уничтожил, и повторные запуски результата, который вы не сохранили.
  • AY-Robots подбирает карту по объему VRAM, необходимому модели, и арендует ее на том же спотовом рынке, поэтому стоимость запуска соответствует рыночной.

Смета состоит из четырех статей, и GPU — самая маленькая из них

Когда люди спрашивают, сколько стоит дообучение визуально-языковой модели действий для SO-100, они почти всегда имеют в виду аренду GPU. Это число, которое отображается как списание с карты, поэтому оно кажется реальным. Это также, с большим отрывом, наименьшее из четырех чисел, которые определяют, сколько на самом деле стоит работающая политика на самом деле вам обходится.

СтатьяЧто этоТипичный размер для одной работающей политики
Время GPUаренда карты для запускаот 1 до 12 долларов США за запуск, и вы сделаете от 3 до 5
Роботсервоприводы, напечатанная рама, камеры, кабели, питаниеединовременно, от 110 до 500 евро за манипулятор
Человеко-часычеловек, управляющий манипулятором для записи демонстрацийот 1 до 4 часов на набор данных, повторяется для каждой задачи
Потериплохие данные, слишком большие модели, забытые подынеограниченно, и это единственная статья, которую вы контролируете

Время обучения, указанное ниже, взято из собственных статей и репозиториев пяти моделей, стоимость оборудования — из опубликованной спецификации, а данные по платформам — из AY-Robots каталог политик и страница цен. В тех случаях, когда платформа не помогает, это указано в данной статье.

Сколько на самом деле стоит час GPU на спотовом рынке

Единой цены за час A100 не существует. На таких торговых площадках, как vast.ai, каждый хост устанавливает свою собственную ставку, и запуск обучения , который вы запускаете, попадает на ту машину, которая в данный момент дешева и свободна. Честный ответ — это распределение. Вот оно, измерено 23 августа 2026 года в 13:44 UTC: одиночные полнофункциональные карты, по запросу, отфильтрованные по реальной VRAM.

Картаvast.ai по запросу USD/ч (низкая / медианная / высокая)Предложения по полной картеМинимальная ставка vast.aiRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74не предлагается
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99не предлагается
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19не предлагается
Как был сделан этот снимок, и чем он не является

Предложения по запросу для одной полной GPU (gpu_frac == 1.0) из публичного API пакетов vast.ai, не требующего учетной записи, отфильтрованные по gpu_ram, чтобы только подлинные карты на 80 ГБ попадали в строки 80 ГБ. Этот фильтр важен: в этом отчете все три предложения по одной карте A100 SXM4 были на 40 ГБ, как и два из четырех предложений A100 PCIE, поэтому объединение их в одну строку "A100" уменьшило бы указанную здесь цену вдвое. Столбец Hugging Face объединяет два продукта: 2.50 USD/h — это оборудование Nvidia A100 - large Spaces, а 4.50 USD/h — это одна H100 80 ГБ в рамках Inference Endpoints, которую Spaces не предлагает. Медианные значения следует рассматривать как ориентировочные: строка A100 80 ГБ основана на двух предложениях, а строка H100 — на пяти, и идентичный запрос 36 секунд спустя вернул другое количество 4090 и другую максимальную цену по трем из пяти строк. Цены RunPod являются более стабильным показателем для планирования.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
Точный запрос, лежащий в основе таблицы выше, выполненный дважды при написании этого раздела. Запустите его, прежде чем доверять любой статье о ценах на GPU, включая эту.
Таблица стоимости AY-Robots, показывающая, какая GPU требуется для каждой политики, типичное время выполнения и цена за выполнение, а также сколько эпизодов необходимо, прежде чем политика станет полезной
Таблица стоимости на /try: карта, время выполнения, цена за выполнение и минимальное количество эпизодов на политику.

Почему модели 3B не могут использовать дешевую карту

Час работы 4090 и час работы H100 80 ГБ отличаются примерно в шесть раз по указанным выше медианным значениям. Что вынуждает использовать дорогую карту, так это не скорость, а память. openpi устанавливает минимальный порог для полной Pi0.5 тонкой настройки в 70 ГБ, а NVIDIA рекомендует 40 ГБ или более для GR00T. Обратите внимание, чем не является число для GR00T. Его конфигурация тонкой настройки по умолчанию замораживает языковую модель и визуальный кодировщик (tune_llm и tune_visual являются False, а проектор и диффузионная головка True), поэтому в каталоге указано примерно 40 млн обученных параметров из 3 млрд. 40 ГБ — это не состояние оптимизатора для 3 млрд весов, это замороженный бэкбон плюс активации. Варианты с уменьшенным объемом требуют меньше: путь LoRA от openpi запрашивает 22.5 ГБ и указывает 4090, а рабочий процесс Isaac Lab Arena от NVIDIA перечисляет опцию с одной GPU на 24 ГБ для GR00T после обучения. Платформа разделяет уровни в зависимости от минимальных требований, которые каждый поставщик публикует для фактически используемой им конфигурации. Описание pi0 flow-matching объясняет, откуда берется этот след сопоставления потоков.

ЗадачаТребуемая память для вышестоящего проектаИсточник
Инференс pi0 / pi0.5более 8 ГБ, например RTX 4090openpi
Тонкая настройка pi0 / pi0.5 LoRAболее 22.5 ГБ, например RTX 4090openpi
Полная тонкая настройка pi0 / pi0.5более 70 ГБ, например A100 80 ГБ или H100openpi
Инференс GR00T N1.71 GPU с 16 ГБ или болееIsaac-GR00T
Тонкая настройка GR00T N1.7рекомендуется 40 ГБ или более, узлы H100 или L40Isaac-GR00T
Тонкая настройка GR00T, что она обучаетпроектор и диффузионная головка; LLM и визуальный кодировщик заморожены по умолчаниюfinetune_config.py
GR00T после обучения, сокращенный1 GPU с 24 ГБ, языковая модель замороженаIsaac Lab Arena
Тонкая настройка SmolVLAодна A100 для эталонного запуска на 20 000 шаговlerobot docs
Обучение ACTодна 11 ГБ RTX 2080 TiACT paper

Эта таблица объясняет, почему платформа разделяет пять моделей на два уровня. GR00T N1.7, GR00T N1.5 и Pi0.5 используют A100 80 ГБ или H100, потому что именно это требуют поставщики. SmolVLA и ACT используют RTX 4090 или любую карту с 24 ГБ, потому что этого действительно достаточно.

Ловушка, которая отнимает день: аренда дешевой карты для большой модели

Запуск GR00T или Pi0.5 на карте с 24 ГБ не завершается ошибкой на нулевой секунде. Он скачивает базовый чекпоинт, строит индекс набора данных, начинает первый прямой проход и умирает через несколько сотен шагов с ошибкой CUDA out-of-memory. Вы заплатили за скачивание и настройку, но ничего не получили. Решения: нехватка памяти во время обучения.

Сколько времени фактически работает каждая из пяти моделей

Время выполнения — это вторая половина стоимости: 2.00 USD в час не имеет значения, если работа занимает 40 минут, и разорительно, если она длится 40 часов. Это параметры по умолчанию, которые AY-Robots фактически отправляет тренеру, с окном выполнения и стоимостью для каждого уровня.

ПолитикаУровень GPUМаксимальное количество шагов по умолчаниюРазмер пакета по умолчанию (накопление градиента)Окно выполненияСтоимость за выполнение
GR00T N1.7, ~3BA100 80 GB or H10020,00032, накопление 1, применяется3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, накопление 16, применяется3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, накопление 16, без эффекта3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, накопление 8, без эффекта2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, накопление 12 to 5 h1 to 3 USD
Сравнительная таблица пяти обучаемых политик на AY-Robots, показывающая количество параметров, требуемый GPU, задержку вывода и минимальное количество эпизодов.
Пять политик рядом: параметры, уровень GPU, задержка на шаг действия, минимальное количество эпизодов.

Откуда берутся эти временные окна выполнения

  • SmolVLA: документация LeRobot утверждает, что 20 000 шагов занимают примерно 4 часа на одной A100. Платформа выполняет те же 20 000 шагов на более дешевом уровне с 24 ГБ, отсюда и окно, а не фиксированные 4 часа.
  • ACT: в оригинальной статье ALOHA сообщается о примерно 5 часах на одной 11 ГБ RTX 2080 Ti для модели с 80 миллионами параметров. 4090 на несколько поколений новее, но платформа выделяет бюджет на 100 000 шагов, поэтому окно попадает в то же место.
  • GR00T: эталонный рабочий процесс NVIDIA для поколения N1.6 указывает примерно от 4 до 8 часов для 20 000 шагов при размере пакета 24 на восьми картах L40S, и от 2 до 3 часов для 30 000 шагов при размере пакета 16 на одной Ada 6000. Тонкая настройка 3B VLA на одной карте за несколько часов — это нормально, а не оптимистично.
  • Pi0.5: openpi не публикует данные о реальном времени выполнения, но указывает минимальный объем в 70 ГБ для полной тонкой настройки, что определяет карту и, следовательно, скорость.

Стоит остановиться на цифре, за которую вы не платите. В статье GR00T N1 сообщается о примерно 50 000 часах работы GPU H100 для предварительного обучения модели 2.2B на кластере до 1024 GPU, при размере пакета предварительного обучения 16 384 для 200 000 шагов градиента. При стоимости от 1.34 до 2.34 USD в час, измеренной выше, это составляет порядка от 67 000 до 117 000 USD арендованных вычислительных мощностей. В статье SmolVLA указывается, что проект занял примерно 30 000 часов работы GPU на 481 общедоступном наборе данных, 22.9K эпизодах и 10.6M кадрах. Вы наследуете все это по цене загрузки; ваши 8 USD покупают последние 20 000 шагов. Почему VLA строятся таким образом охватывает это разделение.

Манипулятор: единовременные затраты, которые затмевают счет за GPU

Один тренировочный запуск стоит меньше обеда. Робот — нет. Вот почему SO-100 важен: это самый дешевый манипулятор, который фактически поддерживает вся обучающаяся имитация цепочка инструментов.

МанипуляторСервоприводыНапряжениеСтоимость деталейПоддержка на AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURполный, эталонный манипулятор
SO-101Feetech STS32157.4 V130 to 170 EURполный
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURсовместимый
LeKiwiманипулятор Feetech STS3215, колесная базаманипулятор 7.4 В, база 12 В400 to 500 EURсовместимый

Исходная спецификация в репозитории SO-ARM100 более детализирована и стоит того, чтобы свериться с вашим регионом: ее Детали для двух манипуляторов список составляет 229.88 USD или 226.30 EUR для конфигурации «лидер плюс ведомый», а ее Детали для одного ведомого манипулятора список составляет 121.94 USD или 124.30 EUR. Шесть сервоприводов STS3215 по 13.89 USD каждый составляют 83.34 из этих 121.94, так что сервоприводы — это и есть манипулятор. При стоимости от 1 до 3 USD за один запуск SmolVLA или ACT, одна пара манипуляторов стоит от 77 до 230 тренировочных запусков. Если вы все еще выбираете, SO-100 против SO-101 — это сравнение, которое имеет значение, потому что эти два манипулятора достаточно близки, чтобы решение зависело от доступности, а не от возможностей.

7.4 В, не 12 В

STS3215 поставляется в вариантах на 7.4 В и 12 В; в репозитории отмечается, что для детали на 12 В также требуется источник питания 12 В 5 А вместо 5 В, поэтому эти два варианта не взаимозаменяемы. Подача 12 В на сервоприводы 7.4 В уничтожает их, а шесть сервоприводов составляют две трети стоимости деталей ведомого манипулятора. Проверьте этикетку на каждом сервоприводе перед первым включением. Если сервоприводы уже ведут себя странно: сервопривод не отвечает, манипулятор дергается, затем провисает.

Человеко-часы: строка, которую никто не вносит в таблицу

Это число, которое переворачивает обсуждение стоимости с ног на голову. Запись демонстраций — это человек, перемещающий роботизированную руку, по одному эпизоду за раз, в реальном времени. Здесь нет пакетной обработки и почасовой аренды. LeRobot набор данных рекордер поставляется с настройками по умолчанию, которые упрощают арифметику, все три подтверждены в DatasetRecordConfig: 60 секунд на эпизод, 60 секунд на сброс сцены, 50 эпизодов. Столбец с деньгами ниже предполагает 15 USD за час чьего-либо времени, что является предположением, а не числом платформы. Подставьте свою собственную ставку; главное — это соотношение.

  1. 1
    Запишите набор данных с настройками по умолчанию, за которые вы фактически будете платить

    Это lerobot 0.6.1, версия на PyPI по состоянию на 3 августа 2026 года. Обратите внимание на форму CLI: запись выполняется через точку входа консоли lerobot-record (lerobot.scripts.lerobot_record), а не старый путь модуля python -m lerobot.scripts.record. AY-Robots ориентируется на 0.5.1, и колесо 0.5.1 объявляет те же точки входа lerobot-record и lerobot-train, поэтому форма ниже стабильна для обеих версий. Три флага времени являются стандартными для вышестоящей версии, поэтому это также команда, которую предполагает арифметика в следующей таблице.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Посмотрите, что вы записали, прежде чем арендовать хотя бы одну минуту GPU

    Проверка набора данных стоит ноль USD в час. Обнаружение той же проблемы по кривой потерь стоит 2.00 USD в час на уровне H100 и сообщает вам об этом на четыре часа позже. Загрузите набор данных и просмотрите его в LeRobot просмотрщике, или просмотрите AY-Robots каталог наборов данных.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Обучайте и убедитесь, что контрольная точка переживет под

    Арендованная машина по определению временна, поэтому записывайте контрольные точки где-нибудь в надежном месте во время выполнения. Два флага определяют, сохраните ли вы то, за что заплатили. --save_freq по умолчанию составляет 20 000 шагов, поэтому стандартный запуск SmolVLA на 20 000 шагов записывает свою первую контрольную точку, когда выполнение уже завершено; уменьшите его, прежде чем арендовать что-либо прерываемое. --save_checkpoint_to_hub требует --policy.repo_id и не существует в lerobot 0.5.1, поэтому в этой версии вы копируете выходной каталог с машины самостоятельно. Размер пакета ниже является примером из документации вышестоящей версии; форма AY-Robots отправляет 2 для SmolVLA и записывает в объектное хранилище по мере появления контрольных точек.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
ЭпизодыЗапись по 60 сСброс по 60 сРеальное времяПлюс 20 процентов перезаписейПо 15 USD за человеко-час
30, минимум SmolVLA30 min30 min1 h 00 min1 h 12 minabout 18 USD
50, остальные четыре минимума50 min50 min1 h 40 min2 h 00 minabout 30 USD
100, комфортный набор данных100 min100 min3 h 20 min4 h 00 minabout 60 USD

Сравните правый столбец со стоимостью запуска от 1 до 12 USD. При такой предполагаемой ставке набор данных из 50 эпизодов стоит в два-семь раз дороже для записи, чем для обучения, до калибровки, настройки камеры и отбрасываемых эпизодов. Вот почему имеет прямую денежную ценность. Руководство lerobot предлагает не менее 50 эпизодов по 10 на каждое местоположение объекта; документация SmolVLA сообщает, что версии той же задачи из 25 эпизодов было недостаточно.

Куда на самом деле уходят деньги

1. Запуски на данных, которые изначально не могли сработать

Запуск GR00T на 20 000 шагов на наборе данных с двумя перепутанными потоками камеры стоит столько же, сколько и на чистом наборе данных, занимает то же время и дает кривую потерь, которая выглядит нормально. Сбой проявляется на манипуляторе, спустя часы. оплачиваются почасово, а диагностика — посуточно. Два симптома, которые стоит запомнить: обычно означает, что наблюдения не содержат того, что требуется для задачи, и означает, что набор данных имел меньше вариаций, чем вы думали.

2. Оплата цен базовых моделей для задачи с фиксированной камерой

ACT имеет примерно 80 миллионов параметров и был разработан для обучения с нуля на 50 демонстрациях одной задачи. GR00T N1.7 имеет примерно 3 миллиарда параметров с предварительно обученной основой. Для закрепленной камеры, фиксированного стола и одного объекта модель с 80 миллионами параметров часто справляется, работает со скоростью около 20 мс на шаг действия вместо 152 мс и стоит от 1 до 3 долларов США за запуск вместо от 4 до 12. Потратьте 3 доллара США, чтобы выяснить, работает ли дешевая модель, прежде чем тратить 12 долларов США на дорогую. ACT против SmolVLA и GR00T N1.7 против Pi0.5 показывают, где каждый из них перестает быть правильным решением; арена моделей содержит 85 моделей и 332 результата бенчмарков.

3. Графический процессор, о котором вы забыли

Самая дешевая ошибка, которую можно предотвратить, и самая распространенная. Инстанс, запущенный в пятницу для отладки чего-либо, будет тарифицироваться в течение выходных по той же ставке, что и реальный запуск.

КартаМедианная ставка в снимкеПростой 24 чПростой 7 днейЭто эквивалентно
RTX 40900.32 USD/h7.68 USD53.76 USDпримерно 27 запусков SmolVLA или ACT по 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDпримерно 12 запусков GR00T по 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDпримерно 38 запусков GR00T по 8 USD

На AY-Robots эта проблема устранена для инференса: поды, предоставляемые API инференса, имеют сторожевой таймер простоя и самоуничтожаются после периода бездействия. Если вы арендуете карту самостоятельно, этот сторожевой таймер — ваше напоминание в календаре.

4. Двойная оплата за один и тот же результат

Точка входа для дообучения GR00T — это CLI tyro, который не предоставляет сид. Это не ограничение платформы, а инструмент вышестоящего уровня: в gr00t/configs/finetune_config.py, а собственные советы по обучению репозитория предупреждают, что результаты запусков могут отличаться на 5-6 процентов из-за недетерминированных аугментаций изображений. lerobot по умолчанию использует сид 1000 как в версии 0.5.1, так и в 0.6.1, поэтому запуски ACT, SmolVLA и Pi0.5 могут быть как минимум повторно выполнены с той же инициализацией и порядком данных. Это не обещание побитово идентичных весов на GPU, но это разница между повторным запуском и новым экспериментом. Если запуск GR00T создает работающую политику, а вы не сохранили контрольную точку, вы платите полную цену за результат, который может отличаться больше, чем та разница, которую вы искали. Есть второй способ потерять оплаченную контрольную точку: CLI по умолчанию использует --save-total-limit 5, что документировано как максимальное количество сохраняемых контрольных точек до удаления старых. Хранение стоит центы; повторный запуск — это 4–12 USD и шесть часов.

Прерываемая мощность вдвое дешевле и может прервать ваш запуск

Указанные выше минимальные ставки составляют лишь часть от тарифа по требованию, и vast.ai утверждает, что система торгов может сократить расходы клиентов на пятьдесят процентов или более. Подвох, по их собственным словам: прерываемый экземпляр может быть приостановлен в любое время, если другой пользователь предложит более высокую ставку или будет создана аренда по требованию для тех же ресурсов, и эта пауза «останавливает все запущенные процессы». По требованию всегда имеет приоритет. Это хорошо для запуска, который записывает контрольную точку каждые несколько сотен шагов, но полная потеря для того, который записывает в конце, что именно и дают вам настройки по умолчанию: CLI Isaac-GR00T записывает каждые --save-steps (по умолчанию 1000), но --save_freq lerobot по умолчанию составляет 20 000 шагов, поэтому стандартный запуск SmolVLA создает контрольную точку один раз, на финише. Уменьшите его, или не делайте ставок. Форма обучения AY-Robots предоставляет параметр GR00T как saveSteps.

Аренда карты самостоятельно
Преимущества
  • Самая низкая почасовая ставка.
  • Полный контроль над образом, версией CUDA, ревизией lerobot или Isaac-GR00T и каждым флагом.
  • Прерываемые торги вдвое снижают ставку, если ваш запуск достаточно часто создает контрольные точки, чтобы пережить паузу.
  • Ничто не абстрагировано, поэтому, когда запуск ведет себя странно, вы можете понять, почему.
Компромиссы
  • Настройка оплачивается по тарифам GPU: драйверы, зависимости, многогигабайтный базовый чекпоинт и загрузка набора данных — все это стоит столько же в час, сколько и обучение.
  • Прерываемый экземпляр, ставка по которому была перебита, приостанавливается, а его процессы завершаются. Несохраненный запуск — это потраченные впустую деньги, а lerobot по умолчанию записывает свою первую контрольную точку на шаге 20 000.
  • Ничто не уничтожает под за вас. Приведенная выше таблица простоя — это счет за забывчивость.
  • Предложение одиночных полноразмерных карт на 80 ГБ ограничено: в этом обзоре два предложения A100 80 ГБ и пять H100 80 ГБ. Список также постоянно меняется, поэтому самая низкая указанная цена и цена, по которой вы можете фактически арендовать, не совпадают.
  • Каждый час, потраченный на инфраструктуру, — это час, не потраченный на запись эпизодов, которые определяют, работает ли политика.

Делать это самостоятельно или позволить платформе арендовать карту

Вы выбираете машину, создаете окружение и уничтожаете под. Почасовая ставка — это рыночная ставка, указанная выше; все остальное — ваше время.

  1. Найдите карту, соответствующую VRAM, необходимой модели: 24 ГБ для ACT и SmolVLA, 80 ГБ для GR00T и Pi0.5.
  2. Арендуйте по требованию, если запуск не может пережить паузу, или прерываемый, если он часто создает контрольные точки.
  3. Установите инструментарий: lerobot для ACT, SmolVLA и Pi0.5, репозиторий Isaac-GR00T с собственным tyro-лаунчером для GR00T.
  4. При необходимости преобразуйте набор данных. Набор данных LeRobot v3.0 вызывает сбой загрузчика GR00T и должен быть преобразован до версии v2.1.
  5. Запустите, следите за потерями, сохраняйте контрольные точки в надежное хранилище по мере их записи.
  6. Уничтожьте экземпляр, затем убедитесь, что вы его уничтожили.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
Текущая точка входа для тонкой настройки Isaac-GR00T, соответствующая команде в README репозитория. Этот CLI не имеет флага seed, поэтому запуски GR00T не являются побитово воспроизводимыми.

Реалистичная стоимость одного запуска GR00T: от 3 до 6 часов на H100 80 ГБ по цене от 1.34 до 2.34 USD в час составляет от 4 до 14 USD, плюс от 20 до 40 минут настройки, которая также оплачивается, плюс ваше собственное время.

Что платформа взимает и как она выбирает карту

Логика намеренно проста. Каждая модель в каталоге объявляет уровень GPU; бэкенд берет требуемую VRAM и арендует подходящую карту на том же спотовом рынке, измеренном выше. Вот почему указанная стоимость является диапазоном, а не фиксированной ценой. GR00T и Pi0.5 доступны здесь только в облаке из-за минимальных требований в 40 ГБ и 70 ГБ соответственно. SmolVLA и ACT также работают локально на вашей собственной 24 ГБ карте, где облачная стоимость равна нулю, а электричество — ваша проблема.

Страница цен AY-Robots, показывающая стоимость обучающего запуска и доступа к платформе
Страница с ценами. Показатели за запуск отслеживают спотовый рынок, а не фиксированную прейскурантную цену.

Один параметр заслуживает предупреждения. Накопление градиента действительно применимо для обоих вариантов GR00T, поэтому его увеличение позволяет получить больший эффективный пакет на той же карте. Для Pi0.5 и SmolVLA оно не применимо вовсе: lerobot 0.5.1 не имеет опции накопления градиента в своей конфигурации обучения, поэтому установка этого поля в 16 ничего не стоит и ничего не дает. Если задание в очереди так и не запускается, страница о застрявшем в очереди задании описывает, что проверить; если набор данных отклоняется до начала выполнения, это почти всегда проблема с форматом v3.0.

Ограничение, которое эта платформа не решает: задержка

Арендованный GPU, обслуживающий вашу политику через публичный интернет, добавляет задержки в контур управления, который уже составляет от 20 до 485 мс на шаг действия. Это хорошо для медленных операций типа «взять и положить», но не для быстрых реактивных движений. Облачный инференс хорошо оценивает контрольную точку, но плохо справляется с производственными манипуляциями: если задача требует скорости, вычисления должны находиться рядом с сервоприводами, и это затраты, которые данная статья не может устранить. См. задержка инференса.

Проработанный бюджет для первой рабочей политики

Все четыре строки вместе, начиная с нуля. Общая сумма GPU предполагает от 3 до 5 запусков: первый доказывает работоспособность конвейера, второй выявляет проблему с данными, третий или четвертый — это тот, который вы сохраняете.

ПозицияЭкономный путьКомфортный путь
Манипулятортолько SO-100 follower, 121.94 USD в спецификацииleader плюс follower, 229.88 USD в спецификации
МодельSmolVLA или ACT, уровень 24 ГБGR00T N1.7, уровень A100 80 ГБ или H100
Записано эпизодов30, минимум для SmolVLAот 50 до 100
Время человека на записьоколо 1 ч 12 минот 2 до 4 часов
Стоимость одного запускаот 1 до 3 USDот 4 до 12 USD
Запусков до работоспособностиот 3 до 5от 3 до 5
Общие затраты на GPUот 3 до 15 USDот 12 до 60 USD
Наибольшая статья расходовманипулятор, затем ваше времяманипулятор, затем ваше время

Эта закономерность сохраняется и для роботов такого размера: вычисления — это погрешность округления, оборудование — реальные единовременные затраты, человеко-часы — повторяющиеся расходы. Чтобы протестировать обучающую часть до покупки чего-либо, точки входа без оборудования позволяют сравнивать модели и арендовать GPU без манипулятора, а живой манипулятор — это физический SO-100, которым можно управлять в браузере без регистрации. Для всего конвейера от начала до конца полное руководство по SO-100 охватывает настройку, телеуправление и обучение, а обучите свою первую политику — это краткая версия.

Матрица обучения AY-Robots с пятью политиками в строках и четырьмя роботизированными манипуляторами в столбцах, каждая ячейка ссылается на конкретное руководство по обучению
Матрица /train: строка для вашего бюджета, столбец для вашего манипулятора, ячейка для руководства с настройками по умолчанию и стоимостью для этой пары.
Сколько стоит один полный цикл тонкой настройки VLA?

Примерно от 4 до 12 USD для GR00T N1.7, GR00T N1.5 или Pi0.5 на уровне A100 80 ГБ или H100 (от 3 до 6 часов по 1.20 до 2.00 USD в час), и примерно от 1 до 3 USD для SmolVLA или ACT на уровне RTX 4090 (от 2 до 5 часов по 0.30 до 0.60 USD в час). Аренда карты самостоятельно обойдется в ту же сумму, если учесть время на настройку, поскольку она оплачивается по тарифу обучения.

Стоит ли платить за H100 вместо A100 80 ГБ?

Для одной политики SO-100 — обычно нет. Обе карты удовлетворяют минимальным требованиям по памяти для GR00T и Pi0.5, и по состоянию на 23 августа 2026 года полная A100 80 ГБ стоила от 0.44 USD в час против 1.34 за H100 80 ГБ. H100 завершает работу быстрее, поэтому часть стоимости компенсируется меньшим количеством часов, но общая сумма все равно выше для такого небольшого запуска. Настоящий аргумент в пользу H100 — это доступность: пять предложений по H100 80 ГБ на этом рынке против двух A100 80 ГБ, а карта, которую нельзя арендовать, не имеет цены.

Сколько запусков требуется, прежде чем политика действительно заработает?

Планируйте от трех до пяти. Первый доказывает, что конвейер настроен правильно. Второй обычно выявляет проблему с набором данных, например, прерванный поток с камеры. Третий или четвертый — это тот, который вы сохраните.

Могу ли я обучать SmolVLA или ACT на своем собственном GPU вместо аренды?

Да. Оба поддерживаются локально на AY-Robots и оба комфортно помещаются в 24 ГБ; в оригинальной статье ACT ее модель 80M обучалась примерно за 5 часов на 11 ГБ RTX 2080 Ti. GR00T и Pi0.5 здесь доступны только в облаке, потому что задокументированные минимальные требования поставщиков для тонкой настройки составляют 40 ГБ и 70 ГБ, а самая большая потребительская карта на рынке — это 32 ГБ RTX 5090.

Почему одинаковое количество шагов стоит по-разному для разных моделей?

Шаги не сопоставимы между политиками. ACT по умолчанию использует 100 000 шагов с пакетом 8 на карте 24 ГБ; GR00T N1.5 по умолчанию использует 2 000 шагов с пакетом 1 и накоплением градиента 16 на карте 80 ГБ. Счет выставляется за часы, умноженные на тариф карты, на которую вас вынуждает объем памяти, а не по счетчику шагов.

Узнайте, сколько будет стоить ваш запуск, прежде чем начать

Каждая из пяти политик указывает свой уровень GPU, время выполнения и цену за запуск, а бэкенд обучения арендует карту на том же спотовом рынке, на котором были измерены эти показатели.

Проверить цены

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started