
Preços reais de GPUs no mercado spot, quanto tempo cada uma das cinco políticas leva para rodar, o custo do braço robótico e das demonstrações, e os quatro lugares onde o dinheiro desaparece silenciosamente.
A versão resumida
- •Uma execução no nível A100 80 GB ou H100 leva de 3 a 6 horas e custa cerca de 4 a 12 USD. No nível RTX 4090, são de 2 a 5 horas e cerca de 1 a 3 USD.
- •Medido em vast.ai às 13:44 UTC de 23 de agosto de 2026: uma RTX 4090 completa sob demanda por 0.13 a 0.38 USD/h, uma A100 80 GB por 0.44 a 0.67, uma H100 80 GB por 1.34 a 2.34. Placas de 80 GB completas são escassas, com duas e cinco ofertas de placa única, respectivamente.
- •A GPU é a linha mais barata. A lista de materiais do SO-ARM100 avalia um par líder mais seguidor em 229.88 USD, o que equivale a 77 a 230 execuções no nível de 24 GB.
- •Duas horas de uma pessoa gravando 50 episódios custam mais do que a execução de treinamento que esses episódios alimentam.
- •O dinheiro desaparece em quatro lugares: execuções com dados corrompidos, modelos 3B em tarefas que uma política 80M consegue lidar, GPUs que ninguém destruiu e reexecuções de um resultado que você não conseguiu manter.
- •A AY-Robots dimensiona a placa pela VRAM que o modelo precisa e a aluga no mesmo mercado spot, então o custo da execução é o custo de mercado.
A conta tem quatro linhas, e a GPU é a menor delas
Quando as pessoas perguntam quanto custa ajustar um modelo de visão-linguagem-ação para um SO-100, elas quase sempre se referem ao aluguel da GPU. Esse é o número que aparece como cobrança no cartão, então é o que parece real. É também, por uma ampla margem, o menor dos quatro números que decidem o custo real de uma política funcional.
| Linha | O que é | Tamanho típico para uma política funcional |
|---|---|---|
| Tempo de GPU | alugar uma placa para a execução | 1 a 12 USD por execução, e você fará de 3 a 5 |
| O robô | servos, estrutura impressa, câmeras, cabos, energia | uma vez, 110 a 500 EUR por braço |
| Horas humanas | uma pessoa operando o braço para gravar demonstrações | 1 a 4 horas por conjunto de dados, repetido por tarefa |
| Desperdício | dados ruins, modelos superdimensionados, pods esquecidos | ilimitado, e a única linha que você controla |
Os tempos de treinamento abaixo vêm dos próprios artigos e repositórios dos cinco modelos, o custo de hardware da lista de materiais publicada, os números da plataforma dos catálogo de políticas e página de preços da AY-Robots. Onde a plataforma não ajuda, este artigo o indica.
Quanto custa realmente uma hora de GPU no mercado spot
Não há um preço único para uma hora de A100. Em um marketplace como vast.ai, cada host define sua própria taxa, e a execução de treinamento que você inicia cai na máquina que estiver barata e livre naquele segundo. A resposta honesta é uma distribuição. Aqui está, medida em 23 de agosto de 2026 às 13:44 UTC: placas completas únicas, sob demanda, filtradas por VRAM real.
| Placa | vast.ai sob demanda USD/h (mínimo / mediano / máximo) | Ofertas de placa completa | Preço mínimo de lance vast.ai | RunPod Comunidade / Seguro | Hugging Face |
|---|---|---|---|---|---|
| RTX 4090, 24 GB | 0.13 / 0.32 / 0.38 | 24 | 0.11 | 0.34 / 0.74 | não oferecido |
| RTX 5090, 32 GB | 0.34 / 0.40 / 0.47 | 29 | 0.19 | 0.69 / 0.99 | não oferecido |
| A100 80 GB, PCIe ou SXM4 | 0.44 / 0.56 / 0.67 | 2 | 0.13 | 1.19 PCIe, 1.39 SXM / 1.39, 1.59 | 2.50 como um Space |
| H100 80 GB, SXM ou PCIe | 1.34 / 1.80 / 2.34 | 5 | 0.44 | 1.99 PCIe, 2.69 SXM / 2.89, 3.29 | 4.50 como um endpoint |
| H100 NVL, 94 GB | 1.47 / 1.47 / 2.64 | 4 | 0.40 | 2.59 / 3.19 | não oferecido |
Ofertas sob demanda para uma única GPU completa (gpu_frac == 1.0) da API de pacote público vast.ai, que não requer conta, filtradas por gpu_ram para que apenas placas genuínas de 80 GB apareçam nas linhas de 80 GB. Esse filtro é importante: nesta leitura, todas as três ofertas de placa única A100 SXM4 eram de 40 GB, assim como duas das quatro ofertas A100 PCIE, então agrupá-las em uma única linha "A100" teria reduzido pela metade o preço aqui relatado. A coluna Hugging Face mistura dois produtos: 2.50 USD/h é o hardware Nvidia A100 - large Spaces e 4.50 USD/h é uma única H100 80 GB sob Inference Endpoints, que o Spaces não oferece. Trate as medianas como indicativas: a linha A100 80 GB baseia-se em duas ofertas e a linha H100 em cinco, e a consulta idêntica 36 segundos depois retornou uma contagem diferente de 4090 e um preço máximo diferente em três das cinco linhas. Os preços de tabela da RunPod são o número mais estável para planejar.
# Live, full-card, single-GPU, on-demand offers from the vast.ai public bundle API.
# No account and no API key needed. gpu_ram is in MB, so an 80 GB card is >= 80000.
python3 - <<'PY'
import json, statistics, urllib.parse, urllib.request
def offers(name, min_ram):
q = {"rentable": {"eq": True}, "num_gpus": {"eq": 1}, "gpu_name": {"eq": name},
"order": [["dph_total", "asc"]], "limit": 500, "type": "on-demand"}
url = "https://console.vast.ai/api/v0/bundles/?q=" + urllib.parse.quote(json.dumps(q))
with urllib.request.urlopen(url, timeout=60) as r:
return [o for o in json.load(r)["offers"]
if o["gpu_frac"] == 1.0 and o["gpu_ram"] >= min_ram]
groups = {
"RTX 4090 24 GB": (["RTX 4090"], 24000),
"RTX 5090 32 GB": (["RTX 5090"], 30000),
"A100 80 GB": (["A100 PCIE", "A100 SXM4"], 80000),
"H100 80 GB": (["H100 SXM", "H100 PCIE"], 80000),
"H100 NVL 94 GB": (["H100 NVL"], 90000),
}
for label, (names, min_ram) in groups.items():
o = [x for n in names for x in offers(n, min_ram)]
if not o:
print(label, "no offers"); continue
p = sorted(x["dph_total"] for x in o)
b = sorted(x["min_bid"] for x in o if x.get("min_bid"))
bid = f"{b[0]:.2f}" if b else "n/a"
print(f'{label}: n={len(p)} | {p[0]:.2f} / {statistics.median(p):.2f} / {p[-1]:.2f}'
f' USD/h | bid floor {bid}')
PY
Por que os modelos 3B não podem usar a placa barata
Uma hora de 4090 e uma hora de H100 80 GB diferem em aproximadamente seis vezes nas medianas acima. O que o força a usar a placa mais cara não é a velocidade, é a memória. openpi estabelece o mínimo para um Pi0.5 completo ajuste fino em 70 GB, e a NVIDIA recomenda 40 GB ou mais para o GR00T. Observe o que o número do GR00T não é. Sua configuração de ajuste fino congela o modelo de linguagem e o codificador visual por padrão (tune_llm e tune_visual são False, o projetor e o cabeçalho de difusão True), razão pela qual o catálogo lista aproximadamente 40 M de parâmetros treinados de um total de 3 B. Os 40 GB não são o estado do otimizador para pesos de 3 B, é o backbone congelado mais as ativações. Variantes de escopo reduzido exigem menos: o caminho LoRA do openpi requer 22.5 GB e menciona a 4090, e o fluxo de trabalho Isaac Lab Arena da NVIDIA lista uma opção de GPU única de 24 GB para o pós-treinamento do GR00T. A plataforma se baseia no mínimo que cada fornecedor publica para a configuração que realmente executa. O artigo sobre flow-matching do pi0 explica de onde vem essa correspondência de fluxo pegada.
| Tarefa | Memória exigida pelo projeto upstream | Fonte |
|---|---|---|
| Inferência pi0 / pi0.5 | mais de 8 GB, exemplo RTX 4090 | openpi |
| Ajuste fino LoRA pi0 / pi0.5 | mais de 22.5 GB, exemplo RTX 4090 | openpi |
| Ajuste fino completo pi0 / pi0.5 | mais de 70 GB, exemplo A100 80 GB ou H100 | openpi |
| Inferência GR00T N1.7 | 1 GPU com 16 GB ou mais | Isaac-GR00T |
| Ajuste fino GR00T N1.7 | 40 GB ou mais recomendado, nós H100 ou L40 | Isaac-GR00T |
| Ajuste fino GR00T, o que ele treina | projetor e cabeçalho de difusão; LLM e codificador visual congelados por padrão | finetune_config.py |
| Pós-treinamento GR00T, reduzido | 1 GPU com 24 GB, modelo de linguagem congelado | Isaac Lab Arena |
| Ajuste fino SmolVLA | uma única A100 para a execução de referência de 20.000 passos | lerobot docs |
| Treinamento ACT | uma única RTX 2080 Ti de 11 GB | ACT paper |
Essa tabela é a razão pela qual a plataforma divide os cinco modelos em dois níveis. GR00T N1.7, GR00T N1.5 e Pi0.5 usam A100 80 GB ou H100 porque é isso que os fornecedores pedem. SmolVLA e ACT usam uma RTX 4090 ou qualquer placa de 24 GB porque isso é realmente suficiente.
Uma execução de GR00T ou Pi0.5 em uma placa de 24 GB não falha no segundo zero. Ela baixa o checkpoint base, constrói o índice do dataset, inicia a primeira passagem forward e morre algumas centenas de passos depois com um erro de CUDA out-of-memory. Você pagou pelo download e pela configuração e não obteve nada. Soluções: falta de memória durante o treinamento.
Tempo de execução real de cada um dos cinco modelos
O tempo de execução é a outra metade do custo: 2.00 USD por hora é irrelevante se o trabalho for de 40 minutos e ruinoso se for de 40 horas. Estes são os padrões que a AY-Robots realmente envia para o treinador, com a janela de execução e o custo para cada nível.
| Política | Nível de GPU | Máximo de passos padrão | Batch padrão (acum. grad.) | Janela de execução | Custo por execução |
|---|---|---|---|---|---|
| GR00T N1.7, ~3B | A100 80 GB or H100 | 20,000 | 32, accum 1, aplica-se | 3 to 6 h | 4 to 12 USD |
| GR00T N1.5, ~3B | A100 80 GB or H100 | 2,000 | 1, accum 16, aplica-se | 3 to 6 h | 4 to 12 USD |
| Pi0.5, ~3B | A100 80 GB or H100 | 30,000 | 1, accum 16, sem efeito | 3 to 6 h | 4 to 12 USD |
| SmolVLA, ~450M | RTX 4090 or any 24 GB | 20,000 | 2, accum 8, sem efeito | 2 to 5 h | 1 to 3 USD |
| ACT, ~80M | RTX 4090 or any 24 GB | 100,000 | 8, accum 1 | 2 to 5 h | 1 to 3 USD |

De onde vêm essas janelas de execução a montante
- SmolVLA: a documentação do lerobot afirma que 20.000 passos levam aproximadamente 4 horas em uma única A100. A plataforma executa os mesmos 20.000 passos na camada mais barata de 24 GB, daí uma janela em vez de 4 horas fixas.
- ACT: o artigo original do ALOHA relata cerca de 5 horas em uma única RTX 2080 Ti de 11 GB para um modelo de 80M parâmetros. Uma 4090 é várias gerações mais nova, mas a plataforma orça 100.000 passos, então a janela se encaixa no mesmo lugar.
- GR00T: o fluxo de trabalho de referência da NVIDIA para a geração N1.6 cita aproximadamente 4 a 8 horas para 20.000 passos com batch 24 em oito placas L40S, e 2 a 3 horas para 30.000 passos com batch 16 em uma única Ada 6000. O ajuste fino de um VLA de 3B em uma única placa em poucas horas é normal, não otimista.
- Pi0.5: a openpi não publica um valor de tempo real, mas publica o limite mínimo de 70 GB para um ajuste fino completo, o que define a placa e, portanto, a taxa.
Vale a pena refletir sobre o valor que você não está pagando. O artigo GR00T N1 relata aproximadamente 50.000 horas de GPU H100 para pré-treinar o modelo de 2.2B, em um cluster de até 1024 GPUs, com um tamanho de batch de pré-treinamento de 16.384 para 200.000 passos de gradiente. Com o custo de 1.34 a 2.34 USD por hora medido acima, isso representa algo em torno de 67.000 a 117.000 USD em computação alugada. O artigo SmolVLA estima seu projeto em aproximadamente 30.000 horas de GPU em 481 conjuntos de dados da comunidade, 22.9K episódios e 10.6M frames. Você herda tudo isso pelo preço de um download; seus 8 USD compram os últimos 20.000 passos. Por que os VLAs são construídos dessa forma aborda essa divisão.
O braço: um custo único que anula a conta da GPU
Uma execução de treinamento custa menos que o almoço. O robô não. É por isso que o SO-100 importa: é o braço mais barato que toda a cadeia de ferramentas de aprendizagem por imitação realmente suporta.
| Braço | Servos | Tensão | Custo das peças | Suporte em AY-Robots |
|---|---|---|---|---|
| SO-100 | Feetech STS3215 bus servos | 7.4 V | 110 to 150 EUR | completo, braço de referência |
| SO-101 | Feetech STS3215 | 7.4 V | 130 to 170 EUR | completo |
| Koch v1.1 | Dynamixel XL330 / XL430 | 5 V and 12 V rails | 250 to 350 EUR | compatível |
| LeKiwi | Feetech STS3215 arm, wheeled base | 7.4 V arm, 12 V base | 400 to 500 EUR | compatível |
A lista de materiais upstream no repositório SO-ARM100 é mais granular e vale a pena verificar para a sua região: a sua lista Peças Para Dois Braços totaliza 229.88 USD ou 226.30 EUR para uma configuração líder mais seguidor, e a sua lista Peças para Um Braço Seguidor totaliza 121.94 USD ou 124.30 EUR. Seis servos STS3215 a 13.89 USD cada são 83.34 desse 121.94, então os servos são o braço. A 1 a 3 USD por execução SmolVLA ou ACT, um par de braços vale entre 77 e 230 execuções de treinamento. Se ainda estiver a escolher, SO-100 versus SO-101 é a comparação que importa, porque os dois são suficientemente próximos para que a decisão seja sobre disponibilidade e não sobre capacidade.
O STS3215 é fornecido numa variante de 7.4 V e 12 V; o repositório observa que a peça de 12 V também precisa de uma fonte de alimentação de 12 V 5 A em vez da de 5 V, então as duas não são intercambiáveis. Alimentar servos de 7.4 V com 12 V destrói-os, e seis servos representam dois terços do custo das peças de um braço seguidor. Verifique a etiqueta em cada servo antes da primeira ligação. Se os servos já se comportam de forma estranha: servo não responde, braço treme e depois cede.
Horas humanas: a linha que ninguém coloca na planilha
Este é o número que vira a discussão de custos de cabeça para baixo. Gravar demonstrações é uma pessoa movendo um braço robótico, um episódio por vez, em tempo real. Não há como processar em lote nem alugar por segundo. O conjunto de dados LeRobot gravador vem com padrões que facilitam a aritmética, todos os três confirmados em DatasetRecordConfig: 60 segundos por episódio, 60 segundos para redefinir a cena, 50 episódios. A coluna de dinheiro abaixo assume 15 USD por uma hora do tempo de alguém, o que é uma suposição e não um número da plataforma. Substitua pela sua própria taxa; a proporção é o ponto.
- 1Grave o conjunto de dados com os padrões pelos quais você será realmente cobrado
Esta é a versão lerobot 0.6.1, a versão no PyPI a partir de 3 de agosto de 2026. Observe o formato da CLI: a gravação é executada através do ponto de entrada do console
lerobot-record(lerobot.scripts.lerobot_record), não o antigo caminho do módulopython -m lerobot.scripts.record. AY-Robots visa a versão 0.5.1, e o wheel 0.5.1 declara os mesmos pontos de entradalerobot-recordelerobot-train, então o formato abaixo é estável em ambos. As três flags de tempo são os padrões upstream, então este é também o comando que a aritmética na próxima tabela assume.bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM0 \ --robot.id=my_follower_arm \ --robot.cameras="{ front: {type: opencv, index_or_path: 0, width: 640, height: 480, fps: 30} }" \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM1 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --dataset.num_episodes=50 \ --dataset.episode_time_s=60 \ --dataset.reset_time_s=60 \ --dataset.single_task="Grab the black cube and put it in the bin" - 2Veja o que você gravou antes de alugar um único minuto de GPU
Inspecionar um conjunto de dados custa zero USD por hora. Descobrir o mesmo problema a partir de uma curva de perda custa 2.00 USD por hora no nível H100 e informa você com quatro horas de atraso. Envie o conjunto de dados e revise-o no visualizador LeRobot, ou navegue pelo diretório de conjuntos de dados da AY-Robots.
bash# the recorder pushes to the Hub by default; disable with --dataset.push_to_hub=False echo https://huggingface.co/datasets/${HF_USER}/pick-place-cube # then open https://huggingface.co/spaces/lerobot/visualize_dataset # and scrub through episodes: are both camera streams alive on every episode? # is the gripper actually closing? does the arm sit at a joint limit? - 3Treine e certifique-se de que o checkpoint sobreviva ao pod
Uma máquina alugada é temporária por definição, então grave os checkpoints em algum lugar durável durante a execução. Duas flags decidem se você mantém o que pagou.
--save_freqtem como padrão 20.000 passos, então uma execução padrão de 20.000 passos do SmolVLA grava seu primeiro checkpoint quando a execução já terminou; diminua-o antes de alugar qualquer coisa que possa ser interrompida.--save_checkpoint_to_hubrequer--policy.repo_ide não existe no lerobot 0.5.1, então nessa versão você copia o diretório de saída da máquina por conta própria. O tamanho do lote abaixo é o exemplo da documentação upstream; o formulário AY-Robots envia 2 para SmolVLA e grava no armazenamento de objetos à medida que os checkpoints aparecem.bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-cube \ --batch_size=64 \ --steps=20000 \ --save_freq=2000 \ --output_dir=outputs/train/my_smolvla \ --job_name=my_smolvla_training \ --policy.device=cuda \ --policy.repo_id=${HF_USER}/my_smolvla \ --save_checkpoint_to_hub=true
| Episódios | Gravação a 60 s | Reinicialização a 60 s | Tempo real | Mais 20 por cento de regravações | A 15 USD por hora humana |
|---|---|---|---|---|---|
| 30, o mínimo do SmolVLA | 30 min | 30 min | 1 h 00 min | 1 h 12 min | about 18 USD |
| 50, os outros quatro mínimos | 50 min | 50 min | 1 h 40 min | 2 h 00 min | about 30 USD |
| 100, um conjunto de dados confortável | 100 min | 100 min | 3 h 20 min | 4 h 00 min | about 60 USD |
Compare a coluna da direita com os 1 a 12 USD que a execução custa. A essa taxa assumida, um conjunto de dados de 50 episódios custa de duas a sete vezes mais para gravar do que para treinar, antes da calibração, configuração da câmera e dos episódios que você descarta. É por isso que tem um valor monetário direto. O guia lerobot sugere pelo menos 50 episódios com 10 por localização de objeto; a documentação do SmolVLA relata que uma versão de 25 episódios da mesma tarefa não foi suficiente.
Onde o dinheiro realmente desaparece
1. Execuções em dados que nunca funcionariam
Uma execução GR00T de 20.000 passos em um conjunto de dados com dois fluxos de câmera trocados custa o mesmo que uma em um conjunto de dados limpo, leva o mesmo tempo e produz uma curva de perda que parece boa. A falha aparece no braço, horas depois. são cobrados por hora e o diagnóstico é cobrado em dias. Dois sintomas que valem a pena memorizar: geralmente significa que as observações não contêm o que a tarefa precisa, e significa que o conjunto de dados tinha menos variação do que você pensava.
2. Pagando preços de modelo de fundação para uma tarefa de câmera fixa
ACT tem aproximadamente 80M parâmetros e foi projetado para treinar do zero com 50 demonstrações de uma tarefa. GR00T N1.7 tem aproximadamente 3B com um backbone pré-treinado. Para uma câmera fixa, uma mesa fixa e um objeto, o modelo de 80M frequentemente funciona, executa a cerca de 20 ms por etapa de ação em vez de 152 ms, e custa de 1 a 3 USD por execução em vez de 4 a 12. Gaste 3 USD para descobrir se o modelo barato funciona antes de gastar 12 USD no caro. ACT contra SmolVLA e GR00T N1.7 contra Pi0.5 mostram onde cada um deixa de ser a resposta certa; a arena de modelos tem 85 modelos e 332 resultados de benchmark.
3. A GPU que você esqueceu
O erro mais barato de prevenir e o mais comum de cometer. Uma instância iniciada numa sexta-feira para depurar algo é cobrada durante o fim de semana à mesma taxa de uma execução real.
| Placa | Taxa mediana no snapshot | Ociosa por 24 h | Ociosa por 7 dias | Isso equivale a |
|---|---|---|---|---|
| RTX 4090 | 0.32 USD/h | 7.68 USD | 53.76 USD | cerca de 27 execuções de SmolVLA ou ACT a 2 USD |
| A100 80 GB | 0.56 USD/h | 13.44 USD | 94.08 USD | cerca de 12 execuções de GR00T a 8 USD |
| H100 80 GB | 1.80 USD/h | 43.20 USD | 302.40 USD | cerca de 38 execuções de GR00T a 8 USD |
Na AY-Robots, essa falha é eliminada para inferência: os pods provisionados pela API de inferência carregam um watchdog de ociosidade e se autodestroem após um período de inatividade. Se você alugar a placa por conta própria, esse watchdog é o seu lembrete no calendário.
4. Pagar duas vezes pela mesma resposta
O ponto de entrada de fine-tuning do GR00T é uma CLI tyro que não expõe nenhuma seed. Isso não é uma limitação da plataforma, é a ferramenta upstream: não há campo de seed em gr00t/configs/finetune_config.py, e as próprias dicas de treinamento do repositório alertam que as execuções variam de 5 a 6 por cento porque as aumentações de imagem não são determinísticas. lerobot padroniza a seed 1000 em 0.5.1 e 0.6.1, então as execuções de ACT, SmolVLA e Pi0.5 podem pelo menos ser reexecutadas a partir da mesma inicialização e ordem de dados. Isso não é uma promessa de pesos bit-idênticos em uma GPU, mas é a diferença entre uma reexecução e um novo experimento. Se uma execução de GR00T produzir uma política que funciona e você não manteve o ponto de verificação, você paga o preço total por um resultado que pode diferir em mais do que a diferença que você estava buscando. Há uma segunda maneira de perder um ponto de verificação pelo qual você pagou: a CLI padroniza para --save-total-limit 5, documentado como o número máximo de pontos de verificação mantidos antes que os mais antigos sejam excluídos. O armazenamento custa centavos; uma reexecução custa de 4 a 12 USD e seis horas.
Os lances mínimos acima são uma fração da taxa sob demanda, e a vast.ai afirma que o sistema de lances pode reduzir os custos do cliente em cinquenta por cento ou mais. A ressalva, em suas próprias palavras: uma instância interrompível pode ser pausada a qualquer momento se outro usuário fizer um lance mais alto ou se um aluguel sob demanda for criado para os mesmos recursos, e essa pausa "interrompe todos os processos em execução". Sob demanda sempre tem precedência. Ótimo para uma execução que escreve um checkpoint a cada poucas centenas de passos, uma perda total para uma que escreve no final, que é exatamente o que os padrões oferecem: o CLI Isaac-GR00T escreve a cada --save-steps (padrão 1000), mas o --save_freq do lerobot tem como padrão 20.000 passos, então uma execução padrão do SmolVLA faz checkpoint uma vez, na linha de chegada. Diminua-o, ou não faça lances. O formulário de treinamento AY-Robots expõe o controle GR00T como saveSteps.
- A menor taxa horária disponível.
- Controle total da imagem, versão CUDA, revisão do lerobot ou Isaac-GR00T e de cada flag.
- O lance interrompível reduz a taxa pela metade se sua execução fizer checkpoints com frequência suficiente para sobreviver a uma pausa.
- Nada é abstraído, então quando uma execução se comporta de forma estranha você pode ver o porquê.
- A configuração é cobrada a taxas de GPU: drivers, dependências, o checkpoint base de vários gigabytes e o download do dataset custam o mesmo por hora que o treinamento.
- Uma instância interrompível superada em lance é pausada e seus processos são encerrados. Uma execução não salva é dinheiro queimado, e o padrão do lerobot escreve seu primeiro checkpoint no passo 20.000.
- Nada destrói o pod para você. A tabela de ociosidade acima é a conta por esquecer.
- A oferta de placas únicas de 80 GB é escassa: duas ofertas de A100 80 GB e cinco de H100 80 GB de placa completa nesta leitura. A listagem também muda, então o preço listado mais barato e o preço que você pode realmente alugar não são o mesmo número.
- Cada hora na infraestrutura é uma hora não gasta gravando os episódios que decidem se a política funciona.
Fazendo você mesmo versus deixando a plataforma alugar a placa
Você escolhe a máquina, constrói o ambiente e destrói o pod. A taxa horária é a taxa de mercado acima; todo o resto é o seu tempo.
- Encontre uma placa que corresponda à VRAM que o modelo precisa: 24 GB para ACT e SmolVLA, 80 GB para GR00T e Pi0.5.
- Alugue sob demanda se a execução não puder sobreviver a uma pausa, interrompível se fizer checkpoints frequentemente.
- Instale a toolchain: lerobot para ACT, SmolVLA e Pi0.5, o repositório Isaac-GR00T com seu próprio launcher tyro para GR00T.
- Converta o dataset se necessário. Um dataset LeRobot v3.0 trava o carregador GR00T e deve ser convertido para v2.1.
- Inicie, observe a perda, envie os checkpoints para algum lugar durável à medida que são escritos.
- Destrua a instância e, em seguida, verifique se a destruiu.
# GR00T N1.7, single GPU, Isaac-GR00T as of August 2026.
# Note the entry point: gr00t/experiment/launch_finetune.py, a tyro CLI.
# scripts/gr00t_finetune.py does not exist in this repository; tutorials that
# still reference it are stale. The per-embodiment walkthrough is
# getting_started/finetune_new_embodiment.md.
CUDA_VISIBLE_DEVICES=0 uv run python gr00t/experiment/launch_finetune.py \
--base-model-path nvidia/GR00T-N1.7-3B \
--dataset-path demo_data/cube_to_bowl_5 \
--embodiment-tag NEW_EMBODIMENT \
--modality-config-path examples/SO100/so100_config.py \
--num-gpus 1 \
--output-dir ./so100-checkpoints \
--max-steps 20000 \
--global-batch-size 32 \
--dataloader-num-workers 4
# v3.0 dataset? Convert it down first or the loader will crash. The helper
# has its own pyproject and must be installed in its own environment:
cd scripts/lerobot_conversion
uv venv && source .venv/bin/activate
uv pip install -e .
python convert_v3_to_v2.py --repo-id <DATASET_REPO_ID>Custo realista para uma execução GR00T: 3 a 6 horas em uma H100 80 GB a 1.34 a 2.34 USD por hora é 4 a 14 USD, mais 20 a 40 minutos de configuração que também são cobrados, mais o seu próprio tempo.
Você escolhe o modelo, o dataset e os hiperparâmetros em um formulário. O backend aluga uma GPU spot dimensionada pela VRAM que o modelo precisa, executa o treinador e escreve checkpoints para o armazenamento de objetos.
- Escolha sua combinação na matriz de treinamento: cinco modelos, quatro braços, um guia por célula.
- Aponte-o para um dataset: um gravado com o cliente desktop, um repo id do Hugging Face, ou um da sua própria máquina.
- Aceite os padrões ou ajuste-os. A tabela acima é o que realmente é enviado ao treinador.
- O backend escolhe a placa pela VRAM necessária, então você nunca precisa procurar GPUs.
- Os checkpoints são armazenados em object storage à medida que são escritos, então uma execução interrompida não é uma execução perdida.
| Nível | Modelos | Tempo de execução | Custo por execução |
|---|---|---|---|
| A100 80 GB ou H100 | GR00T N1.7, GR00T N1.5, Pi0.5 | 3 a 6 horas | cerca de 4 a 12 USD |
| RTX 4090 ou qualquer placa de 24 GB | SmolVLA, ACT | 2 a 5 horas | cerca de 1 a 3 USD |
O que ele não faz: tornar um dataset ruim bom, dar ao GR00T uma seed que ele nunca teve, ou remover o limite de latência descrito abaixo. Ele remove a busca por GPU, a construção do ambiente e o pod que você esqueceu de destruir. A mecânica está na documentação de treinamento.
O que a plataforma cobra e como ela escolhe a placa
A lógica é propositadamente simples. Cada modelo no catálogo, declara um nível de GPU; o backend pega a VRAM necessária e aluga uma placa correspondente no mesmo mercado spot medido acima. É por isso que o custo cotado é um intervalo, não um preço. GR00T e Pi0.5 são apenas para nuvem aqui por causa dos limites mínimos de 40 GB e 70 GB. SmolVLA e ACT também rodam localmente na sua própria placa de 24 GB, onde o custo da nuvem é zero e a eletricidade é seu problema.

Um ajuste merece um aviso. A acumulação de gradiente realmente se aplica a ambas as variantes do GR00T, então aumentá-la compra um lote efetivo maior na mesma placa. Para Pi0.5 e SmolVLA, não se aplica de forma alguma: lerobot 0.5.1 não tem opção de acumulação de gradiente em sua configuração de treinamento, então definir o campo para 16 não custa nada e não compra nada. Se um trabalho em fila nunca inicia, a página de trabalho travado na fila cobre o que verificar; se o conjunto de dados for rejeitado antes do início da execução, é quase sempre o problema de formato v3.0.
Uma GPU alugada que serve sua política pela internet pública adiciona idas e vindas a um ciclo de controle que já é de 20 a 485 ms por etapa de ação. Ótimo para operações lentas de pegar e colocar, mas não para movimentos reativos rápidos. A inferência na nuvem avalia bem um checkpoint e executa mal a manipulação em produção: se a tarefa exige velocidade, o processamento precisa estar próximo aos servos, e esse é um custo que este artigo não pode fazer desaparecer. Veja latência de inferência.
Um orçamento detalhado para uma primeira política funcional
Todas as quatro linhas juntas, começando do zero. O total da GPU assume de 3 a 5 execuções: a primeira prova que o pipeline funciona, a segunda expõe um problema de dados, a terceira ou quarta é a que você mantém.
| Linha | Caminho enxuto | Caminho confortável |
|---|---|---|
| Braço | apenas seguidor SO-100, 121.94 USD na BOM | líder mais seguidor, 229.88 USD na BOM |
| Modelo | SmolVLA ou ACT, nível de 24 GB | GR00T N1.7, nível A100 80 GB ou H100 |
| Episódios gravados | 30, o mínimo para SmolVLA | 50 a 100 |
| Tempo humano para gravar | cerca de 1 h 12 min | 2 a 4 horas |
| Custo de uma execução | 1 a 3 USD | 4 a 12 USD |
| Execuções antes de funcionar | 3 a 5 | 3 a 5 |
| Gasto total com GPU | 3 a 15 USD | 12 a 60 USD |
| Maior item na conta | o braço, depois seu tempo | o braço, depois seu tempo |
O padrão se mantém para este tamanho de robô: o processamento é um erro de arredondamento, o hardware é um custo único real, as horas humanas são a despesa recorrente. Para testar a parte de treinamento antes de comprar qualquer coisa, os pontos de entrada sem hardware permitem comparar modelos e alugar uma GPU sem um braço, e o braço ao vivo é um SO-100 físico que você pode controlar no navegador sem necessidade de cadastro. Para todo o pipeline de ponta a ponta, o guia completo do SO-100 cobre a configuração, teleoperação e o treinamento, e treine sua primeira política é a versão resumida.

Quanto custa uma execução completa de fine-tuning VLA?▾
Cerca de 4 a 12 USD para GR00T N1.7, GR00T N1.5 ou Pi0.5 no nível A100 80 GB ou H100 (3 a 6 horas a 1.20 a 2.00 USD por hora), e cerca de 1 a 3 USD para SmolVLA ou ACT no nível RTX 4090 (2 a 5 horas a 0.30 a 0.60 USD por hora). Alugar a placa você mesmo resulta na mesma faixa de preço, uma vez que o tempo de configuração é contabilizado, já que é cobrado à taxa de treinamento.
Vale a pena pagar por uma H100 em vez de uma A100 80 GB?▾
Para uma única política SO-100, geralmente não. Ambas superam o limite de memória que GR00T e Pi0.5 precisam, e na leitura de 23 de agosto de 2026, uma A100 80 GB completa custava 0.44 USD por hora contra 1.34 para uma H100 80 GB. A H100 termina mais cedo, então parte da taxa é compensada por menos horas, mas o total ainda é maior para uma execução tão pequena. O verdadeiro argumento para a H100 é a disponibilidade: cinco ofertas de H100 80 GB individuais nesse mercado contra duas A100 80 GB, e uma placa que você não pode alugar não tem preço.
Quantas execuções são necessárias antes que uma política realmente funcione?▾
Planeje de três a cinco. A primeira prova que o pipeline está configurado corretamente. A segunda geralmente expõe um problema no conjunto de dados, como um fluxo de câmera que parou no meio do caminho. A terceira ou quarta é a que você mantém.
Posso treinar SmolVLA ou ACT na minha própria GPU em vez de alugar?▾
Sim. Ambos são suportados localmente em AY-Robots e ambos cabem confortavelmente em 24 GB; o artigo original do ACT treinou seu modelo 80M em cerca de 5 horas em uma RTX 2080 Ti de 11 GB. GR00T e Pi0.5 são apenas para nuvem aqui porque os limites de fine-tuning documentados pelos fornecedores são 40 GB e 70 GB, e a maior placa de consumidor no mercado é a RTX 5090 de 32 GB.
Por que o mesmo número de passos custa valores diferentes entre os modelos?▾
Os passos não são comparáveis entre as políticas. ACT usa como padrão 100.000 passos com batch 8 em uma placa de 24 GB; GR00T N1.5 usa como padrão 2.000 passos com batch 1 e acumulação de gradiente 16 em uma placa de 80 GB. A fatura é o número de horas multiplicado pela taxa da placa que a pegada de memória o força a usar, não o contador de passos.
Veja quanto custaria sua execução antes de iniciá-la
Cada uma das cinco políticas lista seu nível de GPU, tempo de execução e preço por execução, e o backend de treinamento aluga a placa no mesmo mercado spot onde esses números foram medidos.
Verificar os preçosSources
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT / ALOHA)
- pi-0.5: a Vision-Language-Action Model with Open-World Generalization
- NVIDIA Isaac-GR00T: hardware requirements, launch_finetune.py and finetune_config.py defaults
- huggingface/lerobot: CLI entry points, policies and LeRobotDataset v3
- Physical Intelligence openpi: GPU memory requirements for pi0 and pi0.5
- SO-ARM100 / SO-101 bill of materials and STS3215 voltage variants
- LeRobot docs: fine-tuning SmolVLA, 20k steps in about 4 hours on one A100
- LeRobot docs: lerobot-record defaults, episode and reset times, dataset advice
- RunPod GPU pricing: Community Cloud and Secure Cloud hourly rates per card
- Vast.ai: on-demand versus interruptible rentals, bidding and what a pause does to your processes
- Hugging Face pricing: Spaces hardware hourly rates, A100 80 GB at 2.50 USD/h
- Isaac Lab Arena: GR00T N1.6 post-training hardware options and wall-clock reference figures
- lerobot on PyPI, version 0.6.1 released 3 August 2026
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started