Tabla de costos de AY-Robots que muestra qué GPU necesita cada una de las cinco políticas, el tiempo de ejecución típico y el precio por ejecución, y cuántos episodios se necesitan antes de que la política sea útil
entrenamiento VLAcostos de GPUSO-100ajuste finoaprendizaje robóticopresupuesto

Costo de Entrenamiento VLA: Lo que Realmente Cuesta una Ejecución de Ajuste Fino

AY-Robots ResearchAugust 23, 202623 min de lectura

Precios reales de GPU en el mercado spot, cuánto tiempo se ejecuta cada una de las cinco políticas, el costo del brazo y las demostraciones, y los cuatro lugares donde el dinero desaparece silenciosamente.

La versión corta

  • Una ejecución en el nivel A100 de 80 GB o H100 tarda de 3 a 6 horas y cuesta entre 4 y 12 USD. En el nivel RTX 4090, tarda de 2 a 5 horas y cuesta entre 1 y 3 USD.
  • Medido en vast.ai a las 13:44 UTC del 23 de agosto de 2026: una RTX 4090 completa bajo demanda por 0.13 a 0.38 USD/h, una A100 de 80 GB por 0.44 a 0.67, una H100 de 80 GB por 1.34 a 2.34. Las tarjetas completas de 80 GB son escasas, con dos y cinco ofertas de tarjeta única respectivamente.
  • La GPU es la línea más económica. La lista de materiales del SO-ARM100 sitúa un par líder más seguidor en 229.88 USD, lo que equivale a entre 77 y 230 ejecuciones en el nivel de 24 GB.
  • Dos horas de una persona grabando 50 episodios cuestan más que la ejecución de entrenamiento a la que alimentan esos episodios.
  • El dinero desaparece en cuatro lugares: ejecuciones con datos defectuosos, modelos 3B en tareas que una política 80M puede manejar, GPUs que nadie destruyó y repeticiones de un resultado que no lograste conservar.
  • AY-Robots dimensiona la tarjeta según la VRAM que necesita el modelo y la alquila en el mismo mercado spot, por lo que el costo de la ejecución es el costo de mercado.

La factura tiene cuatro líneas, y la GPU es la más pequeña

Cuando la gente pregunta cuánto cuesta ajustar un modelo de visión-lenguaje-acción para un SO-100, casi siempre se refieren al alquiler de la GPU. Ese es el número que aparece como cargo en una tarjeta, por lo que es el que se siente real. También es, por un amplio margen, el más pequeño de los cuatro números que deciden lo que realmente cuesta una política en funcionamiento.

LíneaQué esTamaño típico para una política en funcionamiento
Tiempo de GPUalquilar una tarjeta para la ejecución1 a 12 USD por ejecución, y harás de 3 a 5
El robotservos, estructura impresa, cámaras, cables, alimentaciónuna vez, 110 a 500 EUR por brazo
Horas humanasuna persona manejando el brazo para grabar demostraciones1 a 4 horas por conjunto de datos, repetido por tarea
Desperdiciodatos defectuosos, modelos sobredimensionados, pods olvidadosilimitado, y la única línea que controlas

Los tiempos de entrenamiento a continuación provienen de los propios artículos y repositorios de los cinco modelos, el costo del hardware del listado de materiales publicado, los números de la plataforma de AY-Robots catálogo de políticas y página de precios. Cuando la plataforma no ayuda, este artículo lo indica.

Lo que realmente cuesta una hora de GPU en el mercado spot

No hay un precio único para una hora de A100. En un marketplace como vast.ai, cada host establece su propia tarifa, y la ejecución de entrenamiento que lanzas aterriza en la máquina que esté barata y libre en ese segundo. La respuesta honesta es una distribución. Aquí está, medida el 23 de agosto de 2026 a las 13:44 UTC: tarjetas completas individuales, bajo demanda, filtradas por VRAM real.

Tarjetavast.ai bajo demanda USD/h (bajo / medio / alto)Ofertas de tarjeta completaPrecio mínimo de oferta vast.aiRunPod Community / SecureHugging Face
RTX 4090, 24 GB0.13 / 0.32 / 0.38240.110.34 / 0.74no ofrecido
RTX 5090, 32 GB0.34 / 0.40 / 0.47290.190.69 / 0.99no ofrecido
A100 80 GB, PCIe or SXM40.44 / 0.56 / 0.6720.131.19 PCIe, 1.39 SXM / 1.39, 1.592.50 as a Space
H100 80 GB, SXM or PCIe1.34 / 1.80 / 2.3450.441.99 PCIe, 2.69 SXM / 2.89, 3.294.50 as an endpoint
H100 NVL, 94 GB1.47 / 1.47 / 2.6440.402.59 / 3.19no ofrecido
Cómo se tomó esta instantánea y qué no es

Ofertas bajo demanda para una única GPU completa (gpu_frac == 1.0) de la API de paquetes públicos de vast.ai, que no requiere cuenta, filtradas por gpu_ram para que solo las tarjetas genuinas de 80 GB aparezcan en las filas de 80 GB. Este filtro es importante: en esta lectura, las tres ofertas de tarjeta única A100 SXM4 eran de 40 GB, al igual que dos de las cuatro ofertas de A100 PCIE, por lo que agruparlas en una sola fila de "A100" habría reducido a la mitad el precio aquí reportado. La columna Hugging Face mezcla dos productos: 2.50 USD/h es el hardware Nvidia A100 - large Spaces y 4.50 USD/h es una única H100 de 80 GB bajo Inference Endpoints, que Spaces no ofrece. Trate las medianas como indicativas: la fila de A100 de 80 GB se basa en dos ofertas y la fila de H100 en cinco, y la consulta idéntica 36 segundos después arrojó un recuento de 4090 diferente y un precio máximo diferente en tres de las cinco filas. Los precios de lista de RunPod son el número más estable para planificar.

bash
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request

def offers(name, min_ram):
    q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
         "order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
    url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
    with urllib.request.urlopen(url, timeout=60) as r:
        return [o for o in json.load(r)["offers"]
                if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]

groups = {
    "RTX 4090 24 GB": (["RTX 4090"], 24000),
    "RTX 5090 32 GB": (["RTX 5090"], 30000),
    "A100 80 GB":     (["A100 PCIE", "A100 SXM4"], 80000),
    "H100 80 GB":     (["H100 SXM", "H100 PCIE"], 80000),
    "H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
    o = [x for n in names for x in offers(n, min_ram)]
    if not o:
        print(label, "no offers"); continue
    p = sorted(x["dph_total"] for x in o)
    b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
    bid = f"{b[0]:.2f}" if b else "n/a"
    print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
          f' USD/h | bid floor {bid}')
PY
La consulta exacta detrás de la tabla anterior, ejecutada dos veces mientras se escribía esta sección. Ejecútela antes de confiar en cualquier artículo sobre precios de GPU, incluido este.
Tabla de costos de AY-Robots que muestra qué GPU necesita cada política, el tiempo de ejecución típico y el precio por ejecución, y cuántos episodios se necesitan antes de que la política sea útil
La tabla de costos en /try: tarjeta, tiempo de ejecución, precio por ejecución y episodios mínimos por política.

Por qué los modelos 3B no pueden usar la tarjeta barata

Una hora de 4090 y una hora de H100 de 80 GB difieren en aproximadamente seis veces en las medianas anteriores. Lo que te obliga a usar la tarjeta cara no es la velocidad, es la memoria. openpi establece el mínimo para un Pi0.5 completo ajuste fino en 70 GB, y NVIDIA recomienda 40 GB o más para GR00T. Nótese lo que el número de GR00T no es. Su configuración de ajuste fino congela el modelo de lenguaje y el codificador visual por defecto (tune_llm y tune_visual son False, el proyector y el cabezal de difusión True), razón por la cual el catálogo lista aproximadamente 40 M de parámetros entrenados de un total de 3 B. Los 40 GB no son el estado del optimizador para 3 B de pesos, es el backbone congelado más las activaciones. Las variantes de alcance reducido requieren menos: la ruta LoRA de openpi necesita 22.5 GB y menciona la 4090, y el flujo de trabajo Isaac Lab Arena de NVIDIA lista una opción de GPU única de 24 GB para el post-entrenamiento de GR00T. La plataforma se basa en los mínimos que cada proveedor publica para la configuración que realmente ejecuta. El artículo sobre flow-matching de pi0 explica de dónde viene esa coincidencia de flujo huella.

TareaMemoria requerida por el proyecto originalFuente
Inferencia de pi0 / pi0.5more than 8 GB, example RTX 4090openpi
Ajuste fino LoRA de pi0 / pi0.5more than 22.5 GB, example RTX 4090openpi
Ajuste fino completo de pi0 / pi0.5more than 70 GB, example A100 80 GB or H100openpi
Inferencia de GR00T N1.71 GPU with 16 GB or moreIsaac-GR00T
Ajuste fino de GR00T N1.740 GB or more recommended, H100 or L40 nodesIsaac-GR00T
Ajuste fino de GR00T, lo que entrenaprojector and diffusion head; LLM and visual encoder frozen by defaultfinetune_config.py
Post-entrenamiento de GR00T, reducido1 GPU with 24 GB, language model frozenIsaac Lab Arena
Ajuste fino de SmolVLAsingle A100 for the reference 20,000-step runlerobot docs
Entrenamiento de ACTa single 11 GB RTX 2080 TiACT paper

Esa tabla es la razón por la que la plataforma divide los cinco modelos en dos niveles. GR00T N1.7, GR00T N1.5 y Pi0.5 se ejecutan en A100 de 80 GB o H100 porque eso es lo que los proveedores solicitan. SmolVLA y ACT se ejecutan en una RTX 4090 o cualquier tarjeta de 24 GB porque eso es realmente suficiente.

La trampa que consume un día: alquilar la tarjeta barata para el modelo grande

Una ejecución de GR00T o Pi0.5 en una tarjeta de 24 GB no falla al segundo cero. Descarga el punto de control base, construye el índice del conjunto de datos, inicia la primera pasada hacia adelante y muere unos cientos de pasos después con un error de memoria CUDA agotada. Pagaste por la descarga y la configuración y no obtuviste nada. Soluciones: memoria agotada durante el entrenamiento.

¿Cuánto tiempo se ejecuta realmente cada uno de los cinco modelos?

El tiempo de ejecución es la otra mitad del costo: 2.00 USD por hora es irrelevante si el trabajo dura 40 minutos y ruinoso si dura 40 horas. Estos son los valores predeterminados que AY-Robots realmente envía al entrenador, con la ventana de ejecución y el costo para cada nivel.

PolíticaNivel de GPUPasos máximos predeterminadosLote predeterminado (acum. gradiente)Ventana de ejecuciónCosto por ejecución
GR00T N1.7, ~3BA100 80 GB or H10020,00032, acum. 1, aplica3 to 6 h4 to 12 USD
GR00T N1.5, ~3BA100 80 GB or H1002,0001, acum. 16, aplica3 to 6 h4 to 12 USD
Pi0.5, ~3BA100 80 GB or H10030,0001, acum. 16, sin efecto3 to 6 h4 to 12 USD
SmolVLA, ~450MRTX 4090 or any 24 GB20,0002, acum. 8, sin efecto2 to 5 h1 to 3 USD
ACT, ~80MRTX 4090 or any 24 GB100,0008, acum. 12 to 5 h1 to 3 USD
Tabla comparativa de las cinco políticas entrenables en AY-Robots mostrando el recuento de parámetros, la GPU requerida, la latencia de inferencia y el recuento mínimo de episodios
Las cinco políticas una al lado de la otra: parámetros, nivel de GPU, latencia por paso de acción, episodios mínimos.

De dónde provienen esos rangos de tiempo de ejecución

  • SmolVLA: la documentación de lerobot indica que 20,000 pasos tardan aproximadamente 4 horas en una sola A100. La plataforma ejecuta los mismos 20,000 pasos en el nivel más económico de 24 GB, de ahí un rango de tiempo en lugar de 4 horas exactas.
  • ACT: el artículo original de ALOHA reporta alrededor de 5 horas en una sola RTX 2080 Ti de 11 GB para un modelo de 80 millones de parámetros. Una 4090 es varias generaciones más nueva, pero la plataforma presupuesta 100,000 pasos, por lo que el rango de tiempo se mantiene en el mismo lugar.
  • GR00T: el flujo de trabajo de referencia de NVIDIA para la generación N1.6 cita aproximadamente de 4 a 8 horas para 20,000 pasos con un tamaño de lote de 24 en ocho tarjetas L40S, y de 2 a 3 horas para 30,000 pasos con un tamaño de lote de 16 en una sola Ada 6000. El ajuste fino de una VLA de 3B en una sola tarjeta en unas pocas horas es normal, no optimista.
  • Pi0.5: openpi no publica una cifra de tiempo real, pero sí publica el requisito mínimo de 70 GB para un ajuste fino completo, lo que determina la tarjeta y, por lo tanto, la tasa.

Vale la pena detenerse en el número que no está pagando. El artículo de GR00T N1 reporta aproximadamente 50,000 horas de GPU H100 para preentrenar el modelo 2.2B, en un clúster de hasta 1024 GPUs, con un tamaño de lote de preentrenamiento de 16,384 para 200,000 pasos de gradiente. Al precio de 1.34 a 2.34 USD por hora medido anteriormente, eso representa un costo de computación alquilada del orden de 67,000 a 117,000 USD. El artículo de SmolVLA sitúa su proyecto en aproximadamente 30,000 horas de GPU a lo largo de 481 conjuntos de datos comunitarios, 22.9K episodios y 10.6M fotogramas. Usted hereda todo esto por el precio de una descarga; sus 8 USD compran los últimos 20,000 pasos. Por qué las VLA se construyen de esta manera cubre esa división.

El brazo: un costo único que empequeñece la factura de la GPU

Una ejecución de entrenamiento cuesta menos que un almuerzo. El robot no. Por eso el SO-100 importa: es el brazo más barato que toda la aprendizaje por imitación cadena de herramientas realmente soporta.

BrazoServosVoltajeCosto de piezasSoporte en AY-Robots
SO-100Feetech STS3215 bus servos7.4 V110 to 150 EURcompleto, brazo de referencia
SO-101Feetech STS32157.4 V130 to 170 EURcompleto
Koch v1.1Dynamixel XL330 / XL4305 V and 12 V rails250 to 350 EURcompatible
LeKiwiFeetech STS3215 arm, wheeled base7.4 V arm, 12 V base400 to 500 EURcompatible

La lista de materiales upstream en el repositorio SO-ARM100 es más granular y vale la pena verificarla según tu región: su Piezas para dos brazos lista suma 229.88 USD o 226.30 EUR para una configuración de líder más seguidor, y su Piezas para un brazo seguidor lista suma 121.94 USD o 124.30 EUR. Seis servos STS3215 a 13.89 USD cada uno son 83.34 de esos 121.94, por lo que los servos son el brazo. A 1 to 3 USD por ejecución de SmolVLA o ACT, un par de brazos vale entre 77 y 230 ejecuciones de entrenamiento. Si aún estás eligiendo, SO-100 contra SO-101 es la comparación que importa, porque los dos son lo suficientemente parecidos como para que la decisión sea sobre disponibilidad en lugar de capacidad.

7.4 V, no 12 V

El STS3215 se envía en una variante de 7.4 V y otra de 12 V; el repositorio señala que la pieza de 12 V también necesita una fuente de alimentación de 12 V 5 A en lugar de la de 5 V, por lo que las dos no son intercambiables. Alimentar servos de 7.4 V con 12 V los destruye, y seis servos son dos tercios del costo de las piezas de un brazo seguidor. Verifica la etiqueta de cada servo antes del primer encendido. Si los servos ya se comportan de forma extraña: servo no responde, el brazo se contrae y luego cede.

Horas humanas: la línea que nadie pone en la hoja de cálculo

Este es el número que pone patas arriba la discusión sobre los costos. Grabar demostraciones implica que una persona mueva un brazo robótico, un episodio a la vez, en tiempo real. No se puede procesar por lotes ni alquilar por segundos. El conjunto de datos de LeRobot grabador se envía con valores predeterminados que facilitan la aritmética, los tres confirmados en DatasetRecordConfig: 60 segundos por episodio, 60 segundos para reiniciar la escena, 50 episodios. La columna de dinero a continuación asume 15 USD por una hora del tiempo de una persona, lo cual es una suposición en lugar de un número de plataforma. Sustituya su propia tarifa; la proporción es lo importante.

  1. 1
    Grabe el conjunto de datos con los valores predeterminados por los que realmente se le facturará

    Esta es la versión 0.6.1 de lerobot, la versión en PyPI a partir del 3 de agosto de 2026. Observe la forma de la CLI: la grabación se ejecuta a través del punto de entrada de la consola lerobot-record (lerobot.scripts.lerobot_record), no la antigua ruta del módulo python -m lerobot.scripts.record. AY-Robots apunta a la versión 0.5.1, y el paquete 0.5.1 declara los mismos puntos de entrada lerobot-record y lerobot-train, por lo que la forma a continuación es estable en ambas. Las tres banderas de tiempo son los valores predeterminados de origen, por lo que este es también el comando que asume la aritmética en la siguiente tabla.

    bash
    lerobot-record \
        --robot.type=so100_follower \
        --robot.port=/dev/ttyACM0 \
        --robot.id=my_follower_arm \
        --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \
        --teleop.type=so100_leader \
        --teleop.port=/dev/ttyACM1 \
        --teleop.id=my_leader_arm \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --dataset.num_episodes=50 \
        --dataset.episode_time_s=60 \
        --dataset.reset_time_s=60 \
        --dataset.single_task="Grab the black cube and put it in the bin"
  2. 2
    Mire lo que grabó antes de alquilar un solo minuto de GPU

    Inspeccionar un conjunto de datos cuesta cero USD por hora. Descubrir el mismo problema a partir de una curva de pérdida cuesta 2.00 USD por hora en el nivel H100 y le informa con cuatro horas de retraso. Suba el conjunto de datos y revíselo en el visor de LeRobot, o explore el directorio de conjuntos de datos de AY-Robots.

    bash
    # the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False
    echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube
    
    # then open https://huggingface.co/spaces/lerobot/visualize_dataset
    # and scrub through episodes: are both camera streams alive on every episode?
    # is the gripper actually closing? does the arm sit at a joint limit?
  3. 3
    Entrene y asegúrese de que el punto de control sobreviva al pod

    Una máquina alquilada es temporal por definición, así que escriba los puntos de control en algún lugar duradero durante la ejecución. Dos banderas deciden si conserva lo que pagó. --save_freq tiene un valor predeterminado de 20,000 pasos, por lo que una ejecución predeterminada de SmolVLA de 20,000 pasos escribe su primer punto de control cuando la ejecución ya ha terminado; bájelo antes de alquilar cualquier cosa interrumpible. --save_checkpoint_to_hub requiere --policy.repo_id y no existe en lerobot 0.5.1, por lo que en esa versión debe copiar el directorio de salida de la máquina usted mismo. El tamaño de lote a continuación es el ejemplo del documento de origen; el formulario de AY-Robots envía 2 para SmolVLA y escribe en el almacenamiento de objetos a medida que aparecen los puntos de control.

    bash
    lerobot-train \
        --policy.path=lerobot/smolvla_base \
        --dataset.repo_id=${HF_USER}/pick-place-cube \
        --batch_size=64 \
        --steps=20000 \
        --save_freq=2000 \
        --output_dir=outputs/train/my_smolvla \
        --job_name=my_smolvla_training \
        --policy.device=cuda \
        --policy.repo_id=${HF_USER}/my_smolvla \
        --save_checkpoint_to_hub=true
EpisodiosGrabación a 60 sReinicio a 60 sTiempo realMás 20 por ciento de regrabacionesA 15 USD por hora humana
30, el mínimo de SmolVLA30 min30 min1 h 00 min1 h 12 minaproximadamente 18 USD
50, los otros cuatro mínimos50 min50 min1 h 40 min2 h 00 minaproximadamente 30 USD
100, un conjunto de datos cómodo100 min100 min3 h 20 min4 h 00 minaproximadamente 60 USD

Compare la columna de la derecha con los 1 a 12 USD que cuesta la ejecución. A esa tasa asumida, un conjunto de datos de 50 episodios cuesta de dos a siete veces más grabar que entrenar, antes de la calibración, la configuración de la cámara y los episodios que se descartan. Por eso tiene un valor monetario directo. La guía de lerobot sugiere al menos 50 episodios con 10 por ubicación de objeto; la documentación de SmolVLA informa que una versión de 25 episodios de la misma tarea no fue suficiente.

Dónde se pierde realmente el dinero

1. Ejecuciones con datos que nunca iban a funcionar

Una ejecución de GR00T de 20.000 pasos en un conjunto de datos con dos flujos de cámara intercambiados cuesta lo mismo que una en un conjunto de datos limpio, toma el mismo tiempo y produce una curva de pérdida que parece correcta. El fallo aparece en el brazo, horas después. se facturan por hora y el diagnóstico se factura en días. Dos síntomas que vale la pena memorizar: usualmente significa que las observaciones no contienen lo que la tarea necesita, y significa que el conjunto de datos tenía menos variación de la que pensabas.

2. Pagar precios de modelo fundacional para una tarea de cámara fija

ACT tiene aproximadamente 80M de parámetros y fue diseñado para entrenar desde cero con 50 demostraciones de una tarea. GR00T N1.7 tiene aproximadamente 3B con un backbone preentrenado. Para una cámara atornillada, una mesa fija y un objeto, el modelo de 80M frecuentemente lo logra, se ejecuta a unos 20 ms por paso de acción en lugar de 152 ms, y cuesta de 1 a 3 USD por ejecución en lugar de 4 a 12. Gaste 3 USD en averiguar si el modelo barato funciona antes de gastar 12 USD en el caro. ACT contra SmolVLA y GR00T N1.7 contra Pi0.5 muestran dónde cada uno deja de ser la respuesta correcta; la arena de modelos tiene 85 modelos y 332 resultados de benchmark.

3. La GPU que olvidaste

El error más barato de prevenir y el más común de cometer. Una instancia iniciada un viernes para depurar algo factura durante el fin de semana a la misma tarifa que una ejecución real.

TarjetaTarifa media en la instantáneaInactiva durante 24 hInactiva durante 7 díasEquivale a
RTX 40900.32 USD/h7.68 USD53.76 USDaproximadamente 27 ejecuciones de SmolVLA o ACT a 2 USD
A100 80 GB0.56 USD/h13.44 USD94.08 USDaproximadamente 12 ejecuciones de GR00T a 8 USD
H100 80 GB1.80 USD/h43.20 USD302.40 USDaproximadamente 38 ejecuciones de GR00T a 8 USD

En AY-Robots, este fallo se ha eliminado para la inferencia: los pods aprovisionados por la API de inferencia incluyen un vigilante de inactividad y se autodestruyen después de un período de inactividad. Si alquilas la tarjeta tú mismo, ese vigilante es tu recordatorio del calendario.

4. Pagar dos veces por la misma respuesta

El punto de entrada de ajuste fino de GR00T es una CLI de tyro que no expone ninguna semilla. Eso no es una limitación de la plataforma, es la herramienta original: no hay un campo de semilla en gr00t/configs/finetune_config.py, y los propios consejos de entrenamiento del repositorio advierten que las ejecuciones varían entre un 5 y un 6 por ciento porque las aumentaciones de imagen no son deterministas. lerobot utiliza por defecto la semilla 1000 tanto en 0.5.1 como en 0.6.1, por lo que las ejecuciones de ACT, SmolVLA y Pi0.5 pueden al menos ser repetidas desde la misma inicialización y orden de datos. Eso no es una promesa de pesos idénticos bit a bit en una GPU, pero es la diferencia entre una repetición y un nuevo experimento. Si una ejecución de GR00T produce una política que funciona y no guardaste el punto de control, pagas el precio completo por un resultado que puede diferir más de la diferencia que buscabas. Hay una segunda forma de perder un punto de control por el que pagaste: la CLI utiliza por defecto --save-total-limit 5, documentado como el número máximo de puntos de control que se conservan antes de que se eliminen los más antiguos. El almacenamiento cuesta céntimos; una repetición cuesta de 4 a 12 USD y seis horas.

La capacidad interrumpible cuesta la mitad y detendrá tu ejecución

Los precios mínimos de puja anteriores son una fracción de la tarifa bajo demanda, y vast.ai afirma que el sistema de pujas puede reducir los costes del cliente en un cincuenta por ciento o más. La trampa, en sus propias palabras: una instancia interrumpible puede pausarse en cualquier momento si otro usuario puja más alto o se crea un alquiler bajo demanda para los mismos recursos, y esa pausa "detiene todos los procesos en ejecución". La demanda siempre tiene prioridad. Está bien para una ejecución que escribe un punto de control cada pocos cientos de pasos, una pérdida total para una que escribe al final, que es exactamente lo que te dan los valores predeterminados: la CLI de Isaac-GR00T escribe cada --save-steps (predeterminado 1000), pero --save_freq de lerobot por defecto es de 20,000 pasos, por lo que una ejecución predeterminada de SmolVLA guarda un punto de control una vez, en la línea de meta. Bájalo, o no pujes. El formulario de entrenamiento de AY-Robots expone el control de GR00T como saveSteps.

Alquilar la tarjeta tú mismo
Ventajas
  • La tarifa por hora más baja que existe.
  • Control total de la imagen, la versión de CUDA, la revisión de lerobot o Isaac-GR00T y cada flag.
  • La puja interrumpible reduce la tarifa a la mitad si tu ejecución guarda puntos de control con la frecuencia suficiente para sobrevivir a una pausa.
  • Nada está abstraído, así que cuando una ejecución se comporta de forma extraña puedes ver por qué.
Inconvenientes
  • La configuración se factura a tarifas de GPU: los controladores, las dependencias, el punto de control base de varios gigabytes y la descarga del conjunto de datos cuestan lo mismo por hora que el entrenamiento.
  • Una instancia interrumpible superada en la puja se pausa y sus procesos se detienen. Una ejecución no guardada es dinero quemado, y el valor predeterminado de lerobot escribe su primer punto de control en el paso 20,000.
  • Nada destruye el pod por ti. La tabla de inactividad anterior es la factura por el olvido.
  • La oferta de tarjetas individuales completas de 80 GB es escasa: dos ofertas de A100 de 80 GB y cinco de H100 de 80 GB de tarjeta completa en esta lectura. La lista también cambia constantemente, por lo que el precio más barato listado y el precio que realmente puedes alquilar no son el mismo número.
  • Cada hora en infraestructura es una hora no dedicada a registrar los episodios que deciden si la política funciona.

Hacerlo tú mismo versus dejar que la plataforma alquile la tarjeta

Tú eliges la máquina, construyes el entorno y destruyes el pod. La tarifa por hora es la tarifa de mercado anterior; todo lo demás es tu tiempo.

  1. Encuentra una tarjeta que coincida con la VRAM que necesita el modelo: 24 GB para ACT y SmolVLA, 80 GB para GR00T y Pi0.5.
  2. Alquila bajo demanda si la ejecución no puede sobrevivir a una pausa, interrumpible si guarda puntos de control a menudo.
  3. Instala la cadena de herramientas: lerobot para ACT, SmolVLA y Pi0.5, el repositorio de Isaac-GR00T con su propio lanzador tyro para GR00T.
  4. Convierte el conjunto de datos si es necesario. Un conjunto de datos de LeRobot v3.0 bloquea el cargador de GR00T y debe convertirse a v2.1.
  5. Lanza, observa la pérdida, sube los puntos de control a un lugar duradero a medida que se escriben.
  6. Destruye la instancia y luego verifica que la hayas destruido.
bash
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
    --base-model-path nvidia/GR00T-N1.7-3B \
    --dataset-path demo_data/cube_to_bowl_5 \
    --embodiment-tag NEW_EMBODIMENT \
    --modality-config-path examples/SO100/so100_config.py \
    --num-gpus 1 \
    --output-dir ./so100-checkpoints \
    --max-steps 20000 \
    --global-batch-size 32 \
    --dataloader-num-workers 4

# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>
El punto de entrada actual de ajuste fino de Isaac-GR00T, que coincide con el comando en el README del repositorio. Esta CLI no tiene flag de semilla, por lo que las ejecuciones de GR00T no son reproducibles bit a bit.

Costo realista para una ejecución de GR00T: de 3 a 6 horas en una H100 de 80 GB a 1.34 a 2.34 USD por hora son de 4 a 14 USD, más de 20 a 40 minutos de configuración que también se facturan, más tu propio tiempo.

¿Qué cobra la plataforma y cómo elige la tarjeta?

La lógica es deliberadamente sencilla. Cada modelo en el catálogo, declara un nivel de GPU; el backend toma la VRAM requerida y alquila una tarjeta compatible en el mismo mercado spot medido anteriormente. Por eso el costo cotizado es un rango, no un precio. GR00T y Pi0.5 son solo para la nube aquí debido a los límites inferiores de 40 GB y 70 GB. SmolVLA y ACT también se ejecutan localmente en su propia tarjeta de 24 GB, donde el costo de la nube es cero y la electricidad es su problema.

La página de precios de AY-Robots mostrando el costo de una ejecución de entrenamiento y el acceso a la plataforma
La página de precios. Las cifras por ejecución siguen el mercado spot en lugar de un precio de lista fijo.

Un ajuste merece una advertencia. La acumulación de gradientes se aplica genuinamente a ambas variantes de GR00T, por lo que aumentarla permite un tamaño de lote efectivo mayor en la misma tarjeta. Para Pi0.5 y SmolVLA no se aplica en absoluto: lerobot 0.5.1 no tiene opción de acumulación de gradientes en su configuración de entrenamiento, por lo que establecer el campo en 16 no cuesta nada y no aporta nada. Si un trabajo en cola nunca comienza, la página de trabajos atascados en cola, cubre qué verificar; si el conjunto de datos es rechazado antes de que comience la ejecución, casi siempre es el problema del formato v3.0.

El límite que esta plataforma no resuelve: la latencia

Una GPU alquilada que sirve su política a través de internet público añade viajes de ida y vuelta a un bucle de control que ya es de 20 a 485 ms por paso de acción. Está bien para tareas lentas de pick-and-place, no para movimientos reactivos rápidos. La inferencia en la nube evalúa bien un punto de control y ejecuta mal la manipulación en producción: si la tarea requiere velocidad, la computación debe estar junto a los servos, y ese es un costo que este artículo no puede hacer desaparecer. Ver latencia de inferencia.

Un presupuesto detallado para una primera política funcional

Las cuatro líneas juntas, empezando de cero. El total de GPU asume de 3 a 5 ejecuciones: la primera prueba que el pipeline funciona, la segunda expone un problema de datos, la tercera o cuarta es la que se conserva.

PartidaRuta económicaRuta cómoda
BrazoSolo seguidor SO-100, 121.94 USD en la lista de materialeslíder más seguidor, 229.88 USD en la lista de materiales
ModeloSmolVLA o ACT, nivel de 24 GBGR00T N1.7, A100 de 80 GB o nivel H100
Episodios grabados30, el mínimo de SmolVLA50 a 100
Tiempo humano para grabaraproximadamente 1 h 12 min2 a 4 horas
Costo de una ejecución1 a 3 USD4 a 12 USD
Ejecuciones antes de que funcione3 a 53 a 5
Gasto total en GPU3 a 15 USD12 a 60 USD
Partida más grande en la facturael brazo, luego su tiempoel brazo, luego su tiempo

El patrón se mantiene para este tamaño de robot: la computación es un error de redondeo, el hardware es un costo único real, las horas humanas son el gasto recurrente. Para probar la parte de entrenamiento antes de comprar nada, le permiten comparar modelos y alquilar una GPU sin un brazo, y es un SO-100 físico que puede controlar en el navegador sin necesidad de registrarse. Para la pipeline completa de principio a fin, la cubre la configuración, la y el entrenamiento, y es la versión corta.

La matriz de entrenamiento de AY-Robots con cinco políticas como filas y cuatro brazos robóticos como columnas, cada celda enlazando a una guía de entrenamiento específica
La matriz /train: fila para su presupuesto, columna para su brazo, celda para la guía con los valores predeterminados y el costo de esa combinación.
¿Cuánto cuesta una ejecución completa de ajuste fino de VLA?

Entre 4 y 12 USD para GR00T N1.7, GR00T N1.5 o Pi0.5 en el nivel A100 80 GB o H100 (3 a 6 horas a 1.20 a 2.00 USD por hora), y entre 1 y 3 USD para SmolVLA o ACT en el nivel RTX 4090 (2 a 5 horas a 0.30 a 0.60 USD por hora). Alquilar la tarjeta usted mismo se sitúa en el mismo rango una vez que se cuenta el tiempo de configuración, ya que se factura a la tarifa de entrenamiento.

¿Vale la pena pagar por una H100 en lugar de una A100 80 GB?

Para una única política SO-100, normalmente no. Ambas superan el requisito mínimo de memoria que GR00T y Pi0.5 necesitan, y en la lectura del 23 de agosto de 2026, una A100 80 GB completa comenzó en 0.44 USD por hora frente a 1.34 para una H100 80 GB. La H100 termina antes, por lo que parte de la tarifa se recupera en menos horas, pero el total sigue siendo más alto para una ejecución tan pequeña. El verdadero argumento a favor de la H100 es la disponibilidad: cinco ofertas de H100 80 GB individuales en ese mercado frente a dos A100 80 GB, y una tarjeta que no se puede alquilar no tiene precio.

¿Cuántas ejecuciones se necesitan antes de que una política funcione realmente?

Planee de tres a cinco. La primera demuestra que la pipeline está correctamente cableada. La segunda comúnmente expone un problema con el conjunto de datos, como una transmisión de cámara que se interrumpió a mitad de camino. La tercera o cuarta es la que se queda.

¿Puedo entrenar SmolVLA o ACT en mi propia GPU en lugar de alquilarla?

Sí. Ambos son compatibles localmente en AY-Robots y ambos caben cómodamente en 24 GB; el artículo original de ACT entrenó su modelo de 80M en aproximadamente 5 horas en una RTX 2080 Ti de 11 GB. GR00T y Pi0.5 son solo para la nube aquí porque los requisitos mínimos de ajuste fino documentados por los proveedores son 40 GB y 70 GB, y la tarjeta de consumo más grande del mercado es la RTX 5090 de 32 GB.

¿Por qué el mismo número de pasos cuesta diferentes cantidades entre modelos?

Los pasos no son comparables entre políticas. ACT por defecto usa 100,000 pasos con un batch de 8 en una tarjeta de 24 GB; GR00T N1.5 por defecto usa 2,000 pasos con un batch de 1 y acumulación de gradiente de 16 en una tarjeta de 80 GB. La factura es el número de horas multiplicado por la tarifa de la tarjeta a la que el uso de memoria le obliga, no el contador de pasos.

Vea cuánto costaría su ejecución antes de iniciarla

Cada una de las cinco políticas enumera su nivel de GPU, tiempo de ejecución y precio por ejecución, y el backend de entrenamiento alquila la tarjeta en el mismo mercado spot donde se midieron estos números.

Consultar precios

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started