
Precios reales de GPU en el mercado spot, cuánto tiempo se ejecuta cada una de las cinco políticas, el costo del brazo y las demostraciones, y los cuatro lugares donde el dinero desaparece silenciosamente.
La versión corta
- •Una ejecución en el nivel A100 de 80 GB o H100 tarda de 3 a 6 horas y cuesta entre 4 y 12 USD. En el nivel RTX 4090, tarda de 2 a 5 horas y cuesta entre 1 y 3 USD.
- •Medido en vast.ai a las 13:44 UTC del 23 de agosto de 2026: una RTX 4090 completa bajo demanda por 0.13 a 0.38 USD/h, una A100 de 80 GB por 0.44 a 0.67, una H100 de 80 GB por 1.34 a 2.34. Las tarjetas completas de 80 GB son escasas, con dos y cinco ofertas de tarjeta única respectivamente.
- •La GPU es la línea más económica. La lista de materiales del SO-ARM100 sitúa un par líder más seguidor en 229.88 USD, lo que equivale a entre 77 y 230 ejecuciones en el nivel de 24 GB.
- •Dos horas de una persona grabando 50 episodios cuestan más que la ejecución de entrenamiento a la que alimentan esos episodios.
- •El dinero desaparece en cuatro lugares: ejecuciones con datos defectuosos, modelos 3B en tareas que una política 80M puede manejar, GPUs que nadie destruyó y repeticiones de un resultado que no lograste conservar.
- •AY-Robots dimensiona la tarjeta según la VRAM que necesita el modelo y la alquila en el mismo mercado spot, por lo que el costo de la ejecución es el costo de mercado.
La factura tiene cuatro líneas, y la GPU es la más pequeña
Cuando la gente pregunta cuánto cuesta ajustar un modelo de visión-lenguaje-acción para un SO-100, casi siempre se refieren al alquiler de la GPU. Ese es el número que aparece como cargo en una tarjeta, por lo que es el que se siente real. También es, por un amplio margen, el más pequeño de los cuatro números que deciden lo que realmente cuesta una política en funcionamiento.
| Línea | Qué es | Tamaño típico para una política en funcionamiento |
|---|---|---|
| Tiempo de GPU | alquilar una tarjeta para la ejecución | 1 a 12 USD por ejecución, y harás de 3 a 5 |
| El robot | servos, estructura impresa, cámaras, cables, alimentación | una vez, 110 a 500 EUR por brazo |
| Horas humanas | una persona manejando el brazo para grabar demostraciones | 1 a 4 horas por conjunto de datos, repetido por tarea |
| Desperdicio | datos defectuosos, modelos sobredimensionados, pods olvidados | ilimitado, y la única línea que controlas |
Los tiempos de entrenamiento a continuación provienen de los propios artículos y repositorios de los cinco modelos, el costo del hardware del listado de materiales publicado, los números de la plataforma de AY-Robots catálogo de políticas y página de precios. Cuando la plataforma no ayuda, este artículo lo indica.
Lo que realmente cuesta una hora de GPU en el mercado spot
No hay un precio único para una hora de A100. En un marketplace como vast.ai, cada host establece su propia tarifa, y la ejecución de entrenamiento que lanzas aterriza en la máquina que esté barata y libre en ese segundo. La respuesta honesta es una distribución. Aquí está, medida el 23 de agosto de 2026 a las 13:44 UTC: tarjetas completas individuales, bajo demanda, filtradas por VRAM real.
| Tarjeta | vast.ai bajo demanda USD/h (bajo / medio / alto) | Ofertas de tarjeta completa | Precio mínimo de oferta vast.ai | RunPod Community / Secure | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | no ofrecido |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | no ofrecido |
| A100 80 GB, PCIe or SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 as a Space |
| H100 80 GB, SXM or PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 as an endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | no ofrecido |
Ofertas bajo demanda para una única GPU completa (gpu_frac == 1.0) de la API de paquetes públicos de vast.ai, que no requiere cuenta, filtradas por gpu_ram para que solo las tarjetas genuinas de 80 GB aparezcan en las filas de 80 GB. Este filtro es importante: en esta lectura, las tres ofertas de tarjeta única A100 SXM4 eran de 40 GB, al igual que dos de las cuatro ofertas de A100 PCIE, por lo que agruparlas en una sola fila de "A100" habría reducido a la mitad el precio aquí reportado. La columna Hugging Face mezcla dos productos: 2.50 USD/h es el hardware Nvidia A100 - large Spaces y 4.50 USD/h es una única H100 de 80 GB bajo Inference Endpoints, que Spaces no ofrece. Trate las medianas como indicativas: la fila de A100 de 80 GB se basa en dos ofertas y la fila de H100 en cinco, y la consulta idéntica 36 segundos después arrojó un recuento de 4090 diferente y un precio máximo diferente en tres de las cinco filas. Los precios de lista de RunPod son el número más estable para planificar.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Por qué los modelos 3B no pueden usar la tarjeta barata
Una hora de 4090 y una hora de H100 de 80 GB difieren en aproximadamente seis veces en las medianas anteriores. Lo que te obliga a usar la tarjeta cara no es la velocidad, es la memoria. openpi establece el mínimo para un Pi0.5 completo ajuste fino en 70 GB, y NVIDIA recomienda 40 GB o más para GR00T. Nótese lo que el número de GR00T no es. Su configuración de ajuste fino congela el modelo de lenguaje y el codificador visual por defecto (tune_llm y tune_visual son False, el proyector y el cabezal de difusión True), razón por la cual el catálogo lista aproximadamente 40 M de parámetros entrenados de un total de 3 B. Los 40 GB no son el estado del optimizador para 3 B de pesos, es el backbone congelado más las activaciones. Las variantes de alcance reducido requieren menos: la ruta LoRA de openpi necesita 22.5 GB y menciona la 4090, y el flujo de trabajo Isaac Lab Arena de NVIDIA lista una opción de GPU única de 24 GB para el post-entrenamiento de GR00T. La plataforma se basa en los mínimos que cada proveedor publica para la configuración que realmente ejecuta. El artículo sobre flow-matching de pi0 explica de dónde viene esa coincidencia de flujo huella.
| Tarea | Memoria requerida por el proyecto original | Fuente |
|---|---|---|
| Inferencia de pi0 / pi0.5 | more than 8 GB, example RTX 4090 | openpi |
| Ajuste fino LoRA de pi0 / pi0.5 | more than 22.5 GB, example RTX 4090 | openpi |
| Ajuste fino completo de pi0 / pi0.5 | more than 70 GB, example A100 80 GB or H100 | openpi |
| Inferencia de GR00T N1.7 | 1 GPU with 16 GB or more | Isaac-GR00T |
| Ajuste fino de GR00T N1.7 | 40 GB or more recommended, H100 or L40 nodes | Isaac-GR00T |
| Ajuste fino de GR00T, lo que entrena | projector and diffusion head; LLM and visual encoder frozen by default | finetune_config.py |
| Post-entrenamiento de GR00T, reducido | 1 GPU with 24 GB, language model frozen | Isaac Lab Arena |
| Ajuste fino de SmolVLA | single A100 for the reference 20,000-step run | lerobot docs |
| Entrenamiento de ACT | a single 11 GB RTX 2080 Ti | ACT paper |
Esa tabla es la razón por la que la plataforma divide los cinco modelos en dos niveles. GR00T N1.7, GR00T N1.5 y Pi0.5 se ejecutan en A100 de 80 GB o H100 porque eso es lo que los proveedores solicitan. SmolVLA y ACT se ejecutan en una RTX 4090 o cualquier tarjeta de 24 GB porque eso es realmente suficiente.
Una ejecución de GR00T o Pi0.5 en una tarjeta de 24 GB no falla al segundo cero. Descarga el punto de control base, construye el índice del conjunto de datos, inicia la primera pasada hacia adelante y muere unos cientos de pasos después con un error de memoria CUDA agotada. Pagaste por la descarga y la configuración y no obtuviste nada. Soluciones: memoria agotada durante el entrenamiento.
¿Cuánto tiempo se ejecuta realmente cada uno de los cinco modelos?
El tiempo de ejecución es la otra mitad del costo: 2.00 USD por hora es irrelevante si el trabajo dura 40 minutos y ruinoso si dura 40 horas. Estos son los valores predeterminados que AY-Robots realmente envía al entrenador, con la ventana de ejecución y el costo para cada nivel.
| Política | Nivel de GPU | Pasos máximos predeterminados | Lote predeterminado (acum. gradiente) | Ventana de ejecución | Costo por ejecución |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, acum. 1, aplica | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, acum. 16, aplica | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, acum. 16, sin efecto | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, acum. 8, sin efecto | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, acum. 1 | 2 to 5 h | 1 to 3 USD |

De dónde provienen esos rangos de tiempo de ejecución
- SmolVLA: la documentación de lerobot indica que 20,000 pasos tardan aproximadamente 4 horas en una sola A100. La plataforma ejecuta los mismos 20,000 pasos en el nivel más económico de 24 GB, de ahí un rango de tiempo en lugar de 4 horas exactas.
- ACT: el artículo original de ALOHA reporta alrededor de 5 horas en una sola RTX 2080 Ti de 11 GB para un modelo de 80 millones de parámetros. Una 4090 es varias generaciones más nueva, pero la plataforma presupuesta 100,000 pasos, por lo que el rango de tiempo se mantiene en el mismo lugar.
- GR00T: el flujo de trabajo de referencia de NVIDIA para la generación N1.6 cita aproximadamente de 4 a 8 horas para 20,000 pasos con un tamaño de lote de 24 en ocho tarjetas L40S, y de 2 a 3 horas para 30,000 pasos con un tamaño de lote de 16 en una sola Ada 6000. El ajuste fino de una VLA de 3B en una sola tarjeta en unas pocas horas es normal, no optimista.
- Pi0.5: openpi no publica una cifra de tiempo real, pero sí publica el requisito mínimo de 70 GB para un ajuste fino completo, lo que determina la tarjeta y, por lo tanto, la tasa.
Vale la pena detenerse en el número que no está pagando. El artículo de GR00T N1 reporta aproximadamente 50,000 horas de GPU H100 para preentrenar el modelo 2.2B, en un clúster de hasta 1024 GPUs, con un tamaño de lote de preentrenamiento de 16,384 para 200,000 pasos de gradiente. Al precio de 1.34 a 2.34 USD por hora medido anteriormente, eso representa un costo de computación alquilada del orden de 67,000 a 117,000 USD. El artículo de SmolVLA sitúa su proyecto en aproximadamente 30,000 horas de GPU a lo largo de 481 conjuntos de datos comunitarios, 22.9K episodios y 10.6M fotogramas. Usted hereda todo esto por el precio de una descarga; sus 8 USD compran los últimos 20,000 pasos. Por qué las VLA se construyen de esta manera cubre esa división.
El brazo: un costo único que empequeñece la factura de la GPU
Una ejecución de entrenamiento cuesta menos que un almuerzo. El robot no. Por eso el SO-100 importa: es el brazo más barato que toda la aprendizaje por imitación cadena de herramientas realmente soporta.
| Brazo | Servos | Voltaje | Costo de piezas | Soporte en AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | completo, brazo de referencia |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | completo |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | compatible |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | compatible |
La lista de materiales upstream en el repositorio SO-ARM100 es más granular y vale la pena verificarla según tu región: su Piezas para dos brazos lista suma 229.88 USD o 226.30 EUR para una configuración de líder más seguidor, y su Piezas para un brazo seguidor lista suma 121.94 USD o 124.30 EUR. Seis servos STS3215 a 13.89 USD cada uno son 83.34 de esos 121.94, por lo que los servos son el brazo. A 1 to 3 USD por ejecución de SmolVLA o ACT, un par de brazos vale entre 77 y 230 ejecuciones de entrenamiento. Si aún estás eligiendo, SO-100 contra SO-101 es la comparación que importa, porque los dos son lo suficientemente parecidos como para que la decisión sea sobre disponibilidad en lugar de capacidad.
El STS3215 se envía en una variante de 7.4 V y otra de 12 V; el repositorio señala que la pieza de 12 V también necesita una fuente de alimentación de 12 V 5 A en lugar de la de 5 V, por lo que las dos no son intercambiables. Alimentar servos de 7.4 V con 12 V los destruye, y seis servos son dos tercios del costo de las piezas de un brazo seguidor. Verifica la etiqueta de cada servo antes del primer encendido. Si los servos ya se comportan de forma extraña: servo no responde, el brazo se contrae y luego cede.
Horas humanas: la línea que nadie pone en la hoja de cálculo
Este es el número que pone patas arriba la discusión sobre los costos. Grabar demostraciones implica que una persona mueva un brazo robótico, un episodio a la vez, en tiempo real. No se puede procesar por lotes ni alquilar por segundos. El conjunto de datos de LeRobot grabador se envía con valores predeterminados que facilitan la aritmética, los tres confirmados en DatasetRecordConfig: 60 segundos por episodio, 60 segundos para reiniciar la escena, 50 episodios. La columna de dinero a continuación asume 15 USD por una hora del tiempo de una persona, lo cual es una suposición en lugar de un número de plataforma. Sustituya su propia tarifa; la proporción es lo importante.
- 1Grabe el conjunto de datos con los valores predeterminados por los que realmente se le facturará
Esta es la versión 0.6.1 de lerobot, la versión en PyPI a partir del 3 de agosto de 2026. Observe la forma de la CLI: la grabación se ejecuta a través del punto de entrada de la consola
lerobot-record(lerobot.scripts.lerobot_record), no la antigua ruta del módulopython -m lerobot.scripts.record. AY-Robots apunta a la versión 0.5.1, y el paquete 0.5.1 declara los mismos puntos de entradalerobot-recordylerobot-train, por lo que la forma a continuación es estable en ambas. Las tres banderas de tiempo son los valores predeterminados de origen, por lo que este es también el comando que asume la aritmética en la siguiente tabla.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Mire lo que grabó antes de alquilar un solo minuto de GPU
Inspeccionar un conjunto de datos cuesta cero USD por hora. Descubrir el mismo problema a partir de una curva de pérdida cuesta 2.00 USD por hora en el nivel H100 y le informa con cuatro horas de retraso. Suba el conjunto de datos y revíselo en el visor de LeRobot, o explore el directorio de conjuntos de datos de AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Entrene y asegúrese de que el punto de control sobreviva al pod
Una máquina alquilada es temporal por definición, así que escriba los puntos de control en algún lugar duradero durante la ejecución. Dos banderas deciden si conserva lo que pagó.
--save_freqtiene un valor predeterminado de 20,000 pasos, por lo que una ejecución predeterminada de SmolVLA de 20,000 pasos escribe su primer punto de control cuando la ejecución ya ha terminado; bájelo antes de alquilar cualquier cosa interrumpible.--save_checkpoint_to_hubrequiere--policy.repo_idy no existe en lerobot 0.5.1, por lo que en esa versión debe copiar el directorio de salida de la máquina usted mismo. El tamaño de lote a continuación es el ejemplo del documento de origen; el formulario de AY-Robots envía 2 para SmolVLA y escribe en el almacenamiento de objetos a medida que aparecen los puntos de control.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episodios | Grabación a 60 s | Reinicio a 60 s | Tiempo real | Más 20 por ciento de regrabaciones | A 15 USD por hora humana |
|---|---|---|---|---|---|
| 30, el mínimo de SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | aproximadamente 18 USD |
| 50, los otros cuatro mínimos | 50 min | 50 min | 1 h 40 min | 2 h 00 min | aproximadamente 30 USD |
| 100, un conjunto de datos cómodo | 100 min | 100 min | 3 h 20 min | 4 h 00 min | aproximadamente 60 USD |
Compare la columna de la derecha con los 1 a 12 USD que cuesta la ejecución. A esa tasa asumida, un conjunto de datos de 50 episodios cuesta de dos a siete veces más grabar que entrenar, antes de la calibración, la configuración de la cámara y los episodios que se descartan. Por eso tiene un valor monetario directo. La guía de lerobot sugiere al menos 50 episodios con 10 por ubicación de objeto; la documentación de SmolVLA informa que una versión de 25 episodios de la misma tarea no fue suficiente.
Dónde se pierde realmente el dinero
1. Ejecuciones con datos que nunca iban a funcionar
Una ejecución de GR00T de 20.000 pasos en un conjunto de datos con dos flujos de cámara intercambiados cuesta lo mismo que una en un conjunto de datos limpio, toma el mismo tiempo y produce una curva de pérdida que parece correcta. El fallo aparece en el brazo, horas después. se facturan por hora y el diagnóstico se factura en días. Dos síntomas que vale la pena memorizar: usualmente significa que las observaciones no contienen lo que la tarea necesita, y significa que el conjunto de datos tenía menos variación de la que pensabas.
2. Pagar precios de modelo fundacional para una tarea de cámara fija
ACT tiene aproximadamente 80M de parámetros y fue diseñado para entrenar desde cero con 50 demostraciones de una tarea. GR00T N1.7 tiene aproximadamente 3B con un backbone preentrenado. Para una cámara atornillada, una mesa fija y un objeto, el modelo de 80M frecuentemente lo logra, se ejecuta a unos 20 ms por paso de acción en lugar de 152 ms, y cuesta de 1 a 3 USD por ejecución en lugar de 4 a 12. Gaste 3 USD en averiguar si el modelo barato funciona antes de gastar 12 USD en el caro. ACT contra SmolVLA y GR00T N1.7 contra Pi0.5 muestran dónde cada uno deja de ser la respuesta correcta; la arena de modelos tiene 85 modelos y 332 resultados de benchmark.
3. La GPU que olvidaste
El error más barato de prevenir y el más común de cometer. Una instancia iniciada un viernes para depurar algo factura durante el fin de semana a la misma tarifa que una ejecución real.
| Tarjeta | Tarifa media en la instantánea | Inactiva durante 24 h | Inactiva durante 7 días | Equivale a |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | aproximadamente 27 ejecuciones de SmolVLA o ACT a 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | aproximadamente 12 ejecuciones de GR00T a 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | aproximadamente 38 ejecuciones de GR00T a 8 USD |
En AY-Robots, este fallo se ha eliminado para la inferencia: los pods aprovisionados por la API de inferencia incluyen un vigilante de inactividad y se autodestruyen después de un período de inactividad. Si alquilas la tarjeta tú mismo, ese vigilante es tu recordatorio del calendario.
4. Pagar dos veces por la misma respuesta
El punto de entrada de ajuste fino de GR00T es una CLI de tyro que no expone ninguna semilla. Eso no es una limitación de la plataforma, es la herramienta original: no hay un campo de semilla en gr00t/configs/finetune_config.py, y los propios consejos de entrenamiento del repositorio advierten que las ejecuciones varían entre un 5 y un 6 por ciento porque las aumentaciones de imagen no son deterministas. lerobot utiliza por defecto la semilla 1000 tanto en 0.5.1 como en 0.6.1, por lo que las ejecuciones de ACT, SmolVLA y Pi0.5 pueden al menos ser repetidas desde la misma inicialización y orden de datos. Eso no es una promesa de pesos idénticos bit a bit en una GPU, pero es la diferencia entre una repetición y un nuevo experimento. Si una ejecución de GR00T produce una política que funciona y no guardaste el punto de control, pagas el precio completo por un resultado que puede diferir más de la diferencia que buscabas. Hay una segunda forma de perder un punto de control por el que pagaste: la CLI utiliza por defecto --save-total-limit 5, documentado como el número máximo de puntos de control que se conservan antes de que se eliminen los más antiguos. El almacenamiento cuesta céntimos; una repetición cuesta de 4 a 12 USD y seis horas.
Los precios mínimos de puja anteriores son una fracción de la tarifa bajo demanda, y vast.ai afirma que el sistema de pujas puede reducir los costes del cliente en un cincuenta por ciento o más. La trampa, en sus propias palabras: una instancia interrumpible puede pausarse en cualquier momento si otro usuario puja más alto o se crea un alquiler bajo demanda para los mismos recursos, y esa pausa "detiene todos los procesos en ejecución". La demanda siempre tiene prioridad. Está bien para una ejecución que escribe un punto de control cada pocos cientos de pasos, una pérdida total para una que escribe al final, que es exactamente lo que te dan los valores predeterminados: la CLI de Isaac-GR00T escribe cada --save-steps (predeterminado 1000), pero --save_freq de lerobot por defecto es de 20,000 pasos, por lo que una ejecución predeterminada de SmolVLA guarda un punto de control una vez, en la línea de meta. Bájalo, o no pujes. El formulario de entrenamiento de AY-Robots expone el control de GR00T como saveSteps.
- La tarifa por hora más baja que existe.
- Control total de la imagen, la versión de CUDA, la revisión de lerobot o Isaac-GR00T y cada flag.
- La puja interrumpible reduce la tarifa a la mitad si tu ejecución guarda puntos de control con la frecuencia suficiente para sobrevivir a una pausa.
- Nada está abstraído, así que cuando una ejecución se comporta de forma extraña puedes ver por qué.
- La configuración se factura a tarifas de GPU: los controladores, las dependencias, el punto de control base de varios gigabytes y la descarga del conjunto de datos cuestan lo mismo por hora que el entrenamiento.
- Una instancia interrumpible superada en la puja se pausa y sus procesos se detienen. Una ejecución no guardada es dinero quemado, y el valor predeterminado de lerobot escribe su primer punto de control en el paso 20,000.
- Nada destruye el pod por ti. La tabla de inactividad anterior es la factura por el olvido.
- La oferta de tarjetas individuales completas de 80 GB es escasa: dos ofertas de A100 de 80 GB y cinco de H100 de 80 GB de tarjeta completa en esta lectura. La lista también cambia constantemente, por lo que el precio más barato listado y el precio que realmente puedes alquilar no son el mismo número.
- Cada hora en infraestructura es una hora no dedicada a registrar los episodios que deciden si la política funciona.
Hacerlo tú mismo versus dejar que la plataforma alquile la tarjeta
Tú eliges la máquina, construyes el entorno y destruyes el pod. La tarifa por hora es la tarifa de mercado anterior; todo lo demás es tu tiempo.
- Encuentra una tarjeta que coincida con la VRAM que necesita el modelo: 24 GB para ACT y SmolVLA, 80 GB para GR00T y Pi0.5.
- Alquila bajo demanda si la ejecución no puede sobrevivir a una pausa, interrumpible si guarda puntos de control a menudo.
- Instala la cadena de herramientas: lerobot para ACT, SmolVLA y Pi0.5, el repositorio de Isaac-GR00T con su propio lanzador tyro para GR00T.
- Convierte el conjunto de datos si es necesario. Un conjunto de datos de LeRobot v3.0 bloquea el cargador de GR00T y debe convertirse a v2.1.
- Lanza, observa la pérdida, sube los puntos de control a un lugar duradero a medida que se escriben.
- Destruye la instancia y luego verifica que la hayas destruido.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Costo realista para una ejecución de GR00T: de 3 a 6 horas en una H100 de 80 GB a 1.34 a 2.34 USD por hora son de 4 a 14 USD, más de 20 a 40 minutos de configuración que también se facturan, más tu propio tiempo.
Eliges el modelo, el conjunto de datos y los hiperparámetros en un formulario. El backend alquila una GPU spot dimensionada por la VRAM que necesita el modelo, ejecuta el entrenador y escribe los puntos de control en el almacenamiento de objetos.
- Elige tu combinación en la matriz de entrenamiento: cinco modelos, cuatro brazos, una guía por celda.
- Apúntalo a un conjunto de datos: uno grabado con el cliente de escritorio, un ID de repositorio de Hugging Face, o uno de tu propia máquina.
- Acepta los valores predeterminados o ajústalos. La tabla anterior es lo que realmente se envía al entrenador.
- El backend elige la tarjeta según la VRAM requerida, por lo que nunca tienes que buscar GPUs.
- Los puntos de control se guardan en el almacenamiento de objetos a medida que se escriben, por lo que una ejecución interrumpida no es una ejecución perdida.
| Nivel | Modelos | Tiempo de ejecución | Costo por ejecución |
|---|---|---|---|
| A100 80 GB o H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 a 6 horas | aproximadamente 4 a 12 USD |
| RTX 4090 o cualquier tarjeta de 24 GB | SmolVLA, ACT | 2 a 5 horas | aproximadamente 1 a 3 USD |
Lo que no hace: mejorar un conjunto de datos malo, darle a GR00T una semilla que nunca tuvo, o eliminar el límite de latencia descrito a continuación. Elimina la búsqueda de GPU, la construcción del entorno y el pod que olvidaste destruir. La mecánica está en la documentación de entrenamiento.
¿Qué cobra la plataforma y cómo elige la tarjeta?
La lógica es deliberadamente sencilla. Cada modelo en el catálogo, declara un nivel de GPU; el backend toma la VRAM requerida y alquila una tarjeta compatible en el mismo mercado spot medido anteriormente. Por eso el costo cotizado es un rango, no un precio. GR00T y Pi0.5 son solo para la nube aquí debido a los límites inferiores de 40 GB y 70 GB. SmolVLA y ACT también se ejecutan localmente en su propia tarjeta de 24 GB, donde el costo de la nube es cero y la electricidad es su problema.

Un ajuste merece una advertencia. La acumulación de gradientes se aplica genuinamente a ambas variantes de GR00T, por lo que aumentarla permite un tamaño de lote efectivo mayor en la misma tarjeta. Para Pi0.5 y SmolVLA no se aplica en absoluto: lerobot 0.5.1 no tiene opción de acumulación de gradientes en su configuración de entrenamiento, por lo que establecer el campo en 16 no cuesta nada y no aporta nada. Si un trabajo en cola nunca comienza, la página de trabajos atascados en cola, cubre qué verificar; si el conjunto de datos es rechazado antes de que comience la ejecución, casi siempre es el problema del formato v3.0.
Una GPU alquilada que sirve su política a través de internet público añade viajes de ida y vuelta a un bucle de control que ya es de 20 a 485 ms por paso de acción. Está bien para tareas lentas de pick-and-place, no para movimientos reactivos rápidos. La inferencia en la nube evalúa bien un punto de control y ejecuta mal la manipulación en producción: si la tarea requiere velocidad, la computación debe estar junto a los servos, y ese es un costo que este artículo no puede hacer desaparecer. Ver latencia de inferencia.
Un presupuesto detallado para una primera política funcional
Las cuatro líneas juntas, empezando de cero. El total de GPU asume de 3 a 5 ejecuciones: la primera prueba que el pipeline funciona, la segunda expone un problema de datos, la tercera o cuarta es la que se conserva.
| Partida | Ruta económica | Ruta cómoda |
|---|---|---|
| Brazo | Solo seguidor SO-100, 121.94 USD en la lista de materiales | líder más seguidor, 229.88 USD en la lista de materiales |
| Modelo | SmolVLA o ACT, nivel de 24 GB | GR00T N1.7, A100 de 80 GB o nivel H100 |
| Episodios grabados | 30, el mínimo de SmolVLA | 50 a 100 |
| Tiempo humano para grabar | aproximadamente 1 h 12 min | 2 a 4 horas |
| Costo de una ejecución | 1 a 3 USD | 4 a 12 USD |
| Ejecuciones antes de que funcione | 3 a 5 | 3 a 5 |
| Gasto total en GPU | 3 a 15 USD | 12 a 60 USD |
| Partida más grande en la factura | el brazo, luego su tiempo | el brazo, luego su tiempo |
El patrón se mantiene para este tamaño de robot: la computación es un error de redondeo, el hardware es un costo único real, las horas humanas son el gasto recurrente. Para probar la parte de entrenamiento antes de comprar nada, le permiten comparar modelos y alquilar una GPU sin un brazo, y es un SO-100 físico que puede controlar en el navegador sin necesidad de registrarse. Para la pipeline completa de principio a fin, la cubre la configuración, la y el entrenamiento, y es la versión corta.

¿Cuánto cuesta una ejecución completa de ajuste fino de VLA?▾
Entre 4 y 12 USD para GR00T N1.7, GR00T N1.5 o Pi0.5 en el nivel A100 80 GB o H100 (3 a 6 horas a 1.20 a 2.00 USD por hora), y entre 1 y 3 USD para SmolVLA o ACT en el nivel RTX 4090 (2 a 5 horas a 0.30 a 0.60 USD por hora). Alquilar la tarjeta usted mismo se sitúa en el mismo rango una vez que se cuenta el tiempo de configuración, ya que se factura a la tarifa de entrenamiento.
¿Vale la pena pagar por una H100 en lugar de una A100 80 GB?▾
Para una única política SO-100, normalmente no. Ambas superan el requisito mínimo de memoria que GR00T y Pi0.5 necesitan, y en la lectura del 23 de agosto de 2026, una A100 80 GB completa comenzó en 0.44 USD por hora frente a 1.34 para una H100 80 GB. La H100 termina antes, por lo que parte de la tarifa se recupera en menos horas, pero el total sigue siendo más alto para una ejecución tan pequeña. El verdadero argumento a favor de la H100 es la disponibilidad: cinco ofertas de H100 80 GB individuales en ese mercado frente a dos A100 80 GB, y una tarjeta que no se puede alquilar no tiene precio.
¿Cuántas ejecuciones se necesitan antes de que una política funcione realmente?▾
Planee de tres a cinco. La primera demuestra que la pipeline está correctamente cableada. La segunda comúnmente expone un problema con el conjunto de datos, como una transmisión de cámara que se interrumpió a mitad de camino. La tercera o cuarta es la que se queda.
¿Puedo entrenar SmolVLA o ACT en mi propia GPU en lugar de alquilarla?▾
Sí. Ambos son compatibles localmente en AY-Robots y ambos caben cómodamente en 24 GB; el artículo original de ACT entrenó su modelo de 80M en aproximadamente 5 horas en una RTX 2080 Ti de 11 GB. GR00T y Pi0.5 son solo para la nube aquí porque los requisitos mínimos de ajuste fino documentados por los proveedores son 40 GB y 70 GB, y la tarjeta de consumo más grande del mercado es la RTX 5090 de 32 GB.
¿Por qué el mismo número de pasos cuesta diferentes cantidades entre modelos?▾
Los pasos no son comparables entre políticas. ACT por defecto usa 100,000 pasos con un batch de 8 en una tarjeta de 24 GB; GR00T N1.5 por defecto usa 2,000 pasos con un batch de 1 y acumulación de gradiente de 16 en una tarjeta de 80 GB. La factura es el número de horas multiplicado por la tarifa de la tarjeta a la que el uso de memoria le obliga, no el contador de pasos.
Vea cuánto costaría su ejecución antes de iniciarla
Cada una de las cinco políticas enumera su nivel de GPU, tiempo de ejecución y precio por ejecución, y el backend de entrenamiento alquila la tarjeta en el mismo mercado spot donde se midieron estos números.
Consultar preciosSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started