
GR00T N1.7, Pi0.5, SmolVLA, ACT ou GR00T N1.5? Uma tabela de decisão adaptada a situações reais, com os números de benchmark publicados, latência, custo por execução e licenças por trás de cada escolha.
Cinco políticas são treináveis em um braço da classe SO-100 hoje. Elas diferem por um fator de 24 na inferência latência, 37 na contagem de parâmetros e 12 no custo de uma execução, e se você pode enviar o resultado. Cinco cartões de modelo não resolverão isso: nenhum responde à pergunta que você tem, qual devo executar primeiro?
Cada número abaixo foi lido nos artigos, repositórios e cartões em agosto de 2026. Os números da plataforma vêm do catálogo de políticas AY-Robots; onde os dois discordam, ambos são mostrados.
A versão resumida
- •Treine ACT primeiro se você duvida do seu conjunto de dados: 1 a 3 USD por execução, nada pré-treinado para encobrir dados ruins.
- •GR00T N1.7 e Pi0.5 estão dentro de meio ponto no LIBERO, 97.0 contra 96.85 a 97.5. Essa não é uma razão para escolher um ou outro.
- •Pi0.5 é a aposta na generalização, não na precisão, e o mais lento com 485 ms.
- •SmolVLA, com 450 M parâmetros, é o único VLA aqui que faz fine-tuning em uma placa de 24 GB.
- •ACT a 20 ms é a única opção para movimento reativo rápido. As licenças decidem o resto.
A tabela de decisão
| Sua situação | Treine este | Porquê |
|---|---|---|
| Qualidade do conjunto de dados não comprovada | ACT | Nada pré-treinado esconde um conjunto de dados quebrado, e falhar custa 1 a 3 USD. |
| Rico em contato, multi-etapas, condicionado por linguagem | GR00T N1.7 | 97,0% em quatro suítes LIBERO, mais um espaço de ação relativo do efetor final. |
| Movimento reativo rápido, inferência nos servos | ACT | 20 ms. O próximo mais rápido é 7,6 vezes mais lento. |
| Novos objetos, nova cena, mundo aberto | Pi0.5 | Construído para comportamento fora da distribuição, em até 104 locais. |
| Uma placa de 24 GB, ainda quer linguagem | SmolVLA | 450 M parâmetros, um mínimo de 30 episódios, executa localmente. |
| Reproduzindo uma execução gravada em 2025 | GR00T N1.5 | Só se for necessário: LeRobot agora o rejeita, pesos não comerciais. |
| Isto será lançado como produto | N1.7, SmolVLA ou ACT | N1.5 é não comercial, Pi0.5 carrega termos Gemma, a placa de SmolVLA não declara nenhum. |
Os cinco candidatos
Todos os cinco são políticas: quadros de câmera, posições de junta e, para quatro deles, uma instrução de linguagem, mapeada para um conjunto de alvos de junta futuros. O que os separa é o quanto foi aprendido antes de você chegar.
| Política | Parâmetros | Latência | Nível de GPU | Local? | Mín. episódios | Formato | Custo |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
O atual modelo de visão-linguagem-ação da NVIDIA, com cerca de 3 bilhões de parâmetros, aproximadamente 40 milhões treinados durante ajuste fino. O repositório lista as diferenças em relação ao N1.6: backbone de um modelo Eagle fornecido para Cosmos-Reason2-2B no Qwen3-VL, camadas de difusão de 32 para 16, dimensões de estado e ação de 29 para 132, horizonte de ação de 16 para 40.
O que importa em um braço pequeno é o espaço de ação relativo do efetor final: o N1.7 prevê as diferenças em relação à pose atual, o que permite que 20 mil horas de vídeo humano EgoScale sejam transferidas para uma política de robô. Especificações na página do N1.7, procedimento no guia N1.7 no SO-100.
O README do Isaac-GR00T declara o N1.7 uma versão de Disponibilidade Geral, com benchmarks e suporte completos. Seu cartão Hugging Face não foi atualizado: o campo Model Version ainda exibe GR00T N1.7 EA. O repositório é o documento mais recente.
GR00T N1.5
Mesma escala de 3 B, backbone Eagle 2, SigLip2 e T5, cabeça DiT de flow-matching. Existe para estender um que você já possui. Duas coisas o tornam uma opção padrão ruim: os pesos carregam a licença não comercial unidirecional da NVIDIA, e as versões atuais do LeRobot removeram o suporte ao N1.5. Veja .
Pi0.5
O VLA de Physical Intelligence com VLA, tipo de política pi05. O artigo apresenta um VLM de 2 B inicializado a partir de PaliGemma mais um especialista em ação de 300 M, controlando o robô a 50 Hz; a configuração pi05 do LeRobot assume um bloco de 50 passos por padrão, um segundo nessa taxa. O ponto de venda são lugares nunca vistos: cerca de 400 horas de manipulação móvel em casas reais, e um estudo de escalonamento em 3, 12, 22, 53, 82 e 104 locais, onde o modelo de 104 locais correspondeu a um controle treinado nas próprias casas de teste.
Um limite, declarado no lerobot/pi05_base cartão: a porta transporta apenas o cabeçalho de ação correspondente ao fluxo. A previsão de subtarefas, a tokenização de ações e o RL não foram lançados upstream, e o openpi diz o mesmo sobre seu próprio repositório. A página do Pi0.5 e o guia do Pi0.5 no SO-100 têm o resto.
O Pi0.5 precisa do tokenizador restrito google/paligemma-3b-pt-224 (gated: manual, embora o Google diga que as solicitações são processadas imediatamente). Sem aceitá-lo e executar hf auth login no ambiente de treinamento, o trabalho inicia, faz o download por um tempo e depois morre com um erro de autorização que parece uma falha de rede. nvidia/GR00T-N1.7-3B não é restrito, mas seu backbone nvidia/Cosmos-Reason2-2B é (gated: auto). Limpe ambos antes de enfileirar; se uma execução ficar ociosa, a página de fila travada lista o que verificar.
SmolVLA
450 M parâmetros, cerca de 100 M no especialista em ação, no SmolVLM-2 com o VLM congelado e apenas suas primeiras 16 camadas do modelo de linguagem usadas. O pré-treinamento foi feito com dados da comunidade: 481 conjuntos de dados, 10.6 M quadros, dos mesmos braços baratos que você usa. O único VLA aqui que cabe em uma placa de 24 GB, e o único com um piso de 30 episódios. Veja a página do SmolVLA.
ACT
Não é um modelo de base. O Action Chunking Transformer da ALOHA tem cerca de 80 M de parâmetros treinados do zero por tarefa, em 50 demonstrações a 50 Hz. O artigo relata seis tarefas bimanuais reais de aproximadamente dez minutos de demonstrações cada, com 80 a 90 por cento nos exemplos que destaca. A sua ideia, agrupamento de ações, está presente em todos os modelos desta página, e a sua ablação ainda mede o efeito melhor: em duas tarefas simuladas com o agrupamento temporal desativado, o sucesso aumenta de 1 por cento em k=1 para 44 por cento em k=100. A página do ACT tem o resto.
O que os benchmarks realmente dizem
LIBERO é o único benchmark sobre o qual três destes cinco relatam: tarefas condicionadas por linguagem em um Franka Panda simulado, dividido nas quatro suítes abaixo, com dez tarefas cada. A NVIDIA executou 200 testes por suíte.
| Modelo | Espacial | Objeto | Meta | 10 (Longo) | Média |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Cada número provém de um conjunto de testes e orçamento diferentes. GR00T executou 20K passos com um batch global de 640; o valor openpi é um checkpoint de 30K; a porta LeRobot adicionou 6K passos a um modelo base LIBERO. SmolVLA é uma incompatibilidade adicional: seu artigo treina essa linha no LIBERO do zero, sem pré-treinamento VLA, enquanto os três acima ajustam checkpoints pré-treinados. Trate 96.85 a 97.5 como um único cluster, e a diferença para 87.3% como real, mas obtida com 6.7x os parâmetros.
SimplerEnv mostra a dispersão, o que LIBERO não faz. NVIDIA compara N1.7 com N1.6, o mais próximo publicamente de um "delta geracional".
| Conjunto SimplerEnv | Média N1.6 | Média N1.7 | Melhor variação | Pior variação |
|---|---|---|---|---|
| Bridge (WidowX), 7 tarefas | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tarefas | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | nenhum, todas as tarefas melhoraram |
A linha Bridge é a útil: 5.7 pontos ganhos em média enquanto put_eggplant_in_basket perdeu 36 e put_eggplant_in_sink caiu de 33 para 2. Uma nova geração move a distribuição em vez de erguê-la, então se sua tarefa se encontra onde N1.7 regrediu, a média não diz nada.

Dos cinco, apenas o artigo SmolVLA relata um braço da classe SO-100: 78.3 por cento para SmolVLA e 61.7 para Pi0 em três tarefas, ambos multi-tarefa, contra 48.3 para ACT treinado em tarefa única, o que não é comparável. O emparelhamento limpo é ambos em tarefa única em SO-101 pick-and-place: 90 contra 70 em distribuição, 50 contra 40 fora dela. Compare em ACT contra SmolVLA e Pi0.5 contra SmolVLA, ou navegue a arena.
Latência e custo decidem a implantação
Latência de inferência é a restrição que as pessoas descobrem por último e se arrependem primeiro. Uma política cinco pontos melhor em um benchmark, mas meio segundo por etapa de ação, parece pior na sua mesa: a dinâmica de contato não espera.
Uma ressalva: o valor do GR00T diverge da placa da NVIDIA, que mede 4 etapas de denoising e uma câmera a 85.8 ms em uma H100 no modo eager, 48.6 ms com torch.compile, 27.9 ms através do TensorRT completo. Os 152 ms aqui são um valor de pilha completa com sobrecarga de serviço e mais de uma câmera, não uma passagem direta (forward pass).
O loop de 20 a 485 ms é do modelo, e as viagens de ida e volta pela internet pública se somam a isso. A inferência remota é viável para tarefas lentas de pick-and-place, não para movimento reativo rápido. Se sua tarefa exige velocidade, a inferência fica ao lado dos servos: ACT ou SmolVLA, localmente. Relacionado: a política congela no meio do movimento.
Uma maneira de ganhar tempo sem mudar o modelo: o artigo do SmolVLA mede a execução síncrona, onde a política termina um bloco antes de prever o próximo, em comparação com a assíncrona, onde a previsão se sobrepõe à execução. O sucesso é similar, 78.3 contra 73.3, mas o mesmo pick-and-place leva 9.7 segundos em vez de 13.75, e em uma janela fixa o robô gerencia 19 ciclos em vez de 9.
Licenças, verificadas porque ninguém as verifica
| Modelo | Licença dos pesos | Licença do código | Uso comercial |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; o cartão permite uso comercial | Apache 2.0 | sim |
| GR00T N1.5 | Licença não comercial unidirecional da NVIDIA | Apache 2.0 | não |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | leia ambos, eles discordam |
| SmolVLA | nenhum campo de licença no cartão smolvla_base | Apache 2.0 (LeRobot) | código sim, pesos não declarados |
| ACT | não existem pesos base | Apache 2.0 (LeRobot) | sim |
A linha Pi0.5 requer atenção. A documentação LeRobot pi05 declara Apache 2.0 consistente com openpi, enquanto o cartão do Hub para lerobot/pi05_base contém license: gemma. Ambos estão ativos. GR00T N1.7 tem uma versão mais branda: o README do Isaac-GR00T menciona de passagem que N1.7 é totalmente licenciável comercialmente sob Apache 2.0, enquanto sua própria seção de licença e o cartão do modelo colocam apenas o código sob Apache 2.0 e os pesos sob a NVIDIA Open Model License.
Os padrões que você realmente executará
Cada formulário de treinador vem com um padrão, e eles não são arbitrários. Os do ACT são próprios do LeRobot: batch 8, lr 1e-5, 100000 passos de treinamento, tamanho do chunk 100, correspondendo ao ACTConfig upstream e k=100 do artigo ACT. Uma coluna abaixo é uma armadilha.
| Política | Batch | LR | Máx. passos | Acúmulo de grad. | Aplica-se? | Controles extras |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | sim | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | sim | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | não (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | não | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | não | chunkSize, nActionSteps, seed, logFreq |
O ponto de entrada de fine-tuning do GR00T (launch_finetune.py, um CLI tyro) não possui campo de seed em sua dataclass de configuração, portanto, as execuções não são reproduzíveis bit a bit. O repositório também alerta para uma variância de 5 a 6 por cento entre as execuções devido a aumentos de imagem não determinísticos, maior do que a maioria das lacunas de benchmark discutidas online. A seed padrão do LeRobot é 1000. A coluna de acúmulo de grad. descreve lerobot 0.5.1; o upstream 0.6.2 o expõe como --accelerator.gradient_accumulation.steps.
O controle que importa mais do que a escolha do modelo
É o bloco de ação. Blocos mais longos proporcionam movimento mais suave e menos erros cumulativos, mas a política é comprometida enquanto o bloco executa, então ela reage tardiamente a qualquer coisa que se move: confiante em um cubo estático, inútil em um que rola. Se ele ultrapassar, encurtar a porção executada é melhor do que retreinar e é gratuito. Uma junta que para antes do tempo é um problema diferente; veja .
- ACT: ACTConfig assume
chunk_size 100en_action_steps 100por padrão. O agrupamento temporal está desativado e requern_action_steps 1. - GR00T N1.7: o horizonte interno passou de 16 para 40, mas o exemplo SO-101 do LeRobot ainda executa
--policy.chunk_size=16 --policy.n_action_steps=16. A flag de rollout foi renomeada para--execution-horizon. - Pi0.5: um bloco de 50 passos, dos quais a receita LIBERO do LeRobot executa 10 via
--policy.n_action_steps=10; com--policy.pretrained_pathele volta para 50 se você omitir a flag. - SmolVLA: blocos de 50 ações, ambos os controles expostos.
Como testar todos os cinco em uma tarde
A resposta mais barata não é mais leitura. Gaste cerca de 15 USD e deixe o braço te dizer: grave uma vez, treine o modelo barato primeiro, escale depois que ele provar que os dados são sólidos. A estrutura supera o volume, o objetivo da e o .
- 1Grave 50 episódios uma vez
Cinquenta libera o caminho para GR00T, Pi0.5 e ACT, e 30 para SmolVLA. Repita cada variação em vez de dispersar: 50 episódios em 5 posições de cubo treinadas onde 25 não foram. Veja grave seu primeiro conjunto de dados.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Treine o ACT primeiro, porque ele não pode mentir para você
Sem pesos pré-treinados, então se ele realizar a tarefa, seu conjunto de dados contém a tarefa. Se o ACT estagnar, corrija os dados. 1 a 3 USD, 2 a 5 horas em uma placa de 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Execute SmolVLA no mesmo conjunto de dados, inalterado
Mesmos dados, mesmo braço, 450 M parâmetros em vez de 80 M, mais condicionamento de linguagem. LeRobot estima uma execução de 20K passos em aproximadamente 4 horas em uma A100. Isso é o que lhe diz se o pré-treinamento traz algum benefício.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Converta para v2.1 antes de usar GR00T
GR00T lê uma variação do formato LeRobot v2 mais um
meta/modality.jsonextra que mapeia como os arrays concatenados de estado e ação se dividem em campos nomeados. Um conjunto de dados v3.0 trava esse carregador, porque o v3.0 empacota muitos episódios em arquivos compartilhados onde o v2 escrevia um por episódio. Isaac-GR00T fornece o auxiliar de downgrade comoscripts/lerobot_conversion/convert_v3_to_v2.py; a página de rejeição v3 é o caminho rápido.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Escale para GR00T N1.7 apenas se os dois primeiros deixaram algo a desejar
Através da CLI da NVIDIA, mostrada aqui, ou do tipo de política
grootdo LeRobot. A NVIDIA recomenda 40 GB ou mais de VRAM para fine-tuning, 16 GB para inferência. Em caso de OOM, consulte a página de OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Duas maneiras de executar essa triagem
Três ambientes, porque as cadeias de ferramentas não coexistem. LeRobot no main é 0.6.2 e precisa de Python 3.12 ou mais recente; Isaac-GR00T e openpi são repositórios separados gerenciados por uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fixa
torchcodec0.8.0 como seu único backend de vídeo, necessitando de FFmpeg 4 a 7. FFmpeg 8 não é suportado, AV1 não é garantido. - Limites de memória do openpi: inferência acima de 8 GB, LoRA acima de 22.5 GB, fine-tuning completo acima de 70 GB. Este último é o motivo pelo qual Pi0.5 é uma tarefa para A100.
- Alugue a GPU você mesmo, destrua-a depois, concilie três conjuntos de caminhos de checkpoint manualmente.
Os mesmos cinco modelos, um formulário. Escolha o modelo, o conjunto de dados e os hiperparâmetros; o backend aluga uma GPU dimensionada pela VRAM necessária, executa o treinador e escreve pontos de verificação para o armazenamento de objetos.
- A matriz de treinamento é de cinco modelos por quatro braços, cada célula um guia: SmolVLA no SO-100, ACT no SO-101.
- Os pods de inferência são auto-provisionados por
/api/inference/podcom um watchdog de inatividade, para que um pod esquecido não gere cobranças silenciosamente. - Os checkpoints base são dos próprios fornecedores:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT não tem nenhum. - Mesmas operações da CLI e de agentes de IA via o servidor MCP.
- Sem hardware? O braço ao vivo transmite um SO-100 físico sem necessidade de inscrição; a página de teste mostra as formas de acesso.
Modelo de fundação ou do zero
A verdadeira questão não é qual modelo 3 B escolher. É se deve usar um VLA pré-treinado, dado que o ACT aprendeu seis tarefas bimanuais reais a partir de cerca de dez minutos de demonstrações cada, com 80 M parâmetros e nada pré-treinado.
- Condicionamento de linguagem. O ACT não tem nenhum; um checkpoint do ACT realiza uma tarefa.
- Melhor em objetos ausentes de suas demonstrações: em SO-101, 50% contra 40% do ACT fora da distribuição.
- Multitarefa em geral: SmolVLA atinge 78.3% em três tarefas SO-100 com um checkpoint; o ACT foi executado apenas em tarefa única.
- 7.6x a 24x a latência: 152 a 485 ms por passo de ação contra 20 ms do ACT.
- 4 a 12 USD por execução em vez de 1 a 3, e um nível A100 em vez de qualquer placa de 24 GB.
- Exposição a licenças, além de um modo de falha de repositório restrito que não existe do zero.
- Pesos pré-treinados podem mascarar um conjunto de dados ruim. Um ajuste fino que funciona pela metade em dados corrompidos custa uma semana antes de você analisar os dados.
O caso de reprodução de uma execução antiga
Perseguir um checkpoint de 2025 faz a escolha do modelo por você e transforma o problema em fixação de versão: o LeRobot atual rejeita N1.5, então você fixa lerobot==0.5.1. Sem campo de seed e com 5 a 6 por cento de variância entre as execuções, a reprodução é aproximada por construção. O guia N1.5 no SO-100 e a página da política N1.5 têm o lado da plataforma.

Reduzido a dois? ACT contra GR00T N1.7 e GR00T N1.7 contra SmolVLA. As linhas brutas estão nas entradas da arena: GR00T N1.7, Pi0.5, SmolVLA e ACT.
Onde esta plataforma não o ajuda
- Não consegue tornar a inferência remota rápida. O ciclo de 20 a 485 ms pertence ao modelo; as viagens de ida e volta pela internet somam-se a isso.
- Não consegue fazer o fine-tuning de GR00T ou Pi0.5 no seu próprio hardware. Ambos são apenas na nuvem aqui; apenas SmolVLA e ACT correm localmente.
- Não consegue corrigir um conjunto de dados. A perda diminui, mas a política não faz nada é um problema de dados, uma política que só funciona numa configuração é um problema de cobertura.
- Não consegue tornar as execuções de GR00T reproduzíveis: a configuração upstream não tem um campo de seed.
85 modelos, 332 resultados de benchmark, cada número linkado à sua fonte
A versão classificável das tabelas nesta página: 85 modelos de visão-linguagem-ação, 332 resultados de benchmark, cada um linkado ao seu artigo ou cartão de modelo.
Abrir a arenaEscolhendo um e seguindo em frente
Um padrão: grave 50 episódios, treine ACT por 1 a 3 USD para provar o conjunto de dados, depois SmolVLA nos mesmos dados. Por menos de 6 USD no total, e eles respondem à pergunta que importa: se o pré-treinamento ajuda aqui, ou se o gargalo são os dados. Escale para GR00T N1.7 para tarefas multi-passo com muito contato, para Pi0.5 quando a cena muda.
Visita guiada à plataforma: treine sua primeira política, depois execute sua primeira política. Os documentos de treinamento e documentos de conjunto de dados cobrem forma e formato; a página do SO-100 e o guia completo do SO-100 cobrem construção e calibração. Contexto: a visão geral de VLA e o artigo de flow-matching do Pi0. O que realmente aumentará sua taxa de sucesso é o guia de qualidade de dados.
Qual política VLA devo treinar primeiro em um SO-100?▾
ACT, depois SmolVLA. O ACT treina do zero, então não consegue mascarar um conjunto de dados ruim, e uma execução custa 1 a 3 USD em uma placa de 24 GB. Se o ACT realizar a tarefa, os 4 a 12 USD para uma execução de GR00T N1.7 ou Pi0.5 não serão desperdiçados.
O GR00T N1.7 é realmente melhor que o Pi0.5?▾
No LIBERO, eles estão dentro do ruído: 97.0% em quatro suítes para GR00T N1.7, 96.85% para Pi0.5 em 30k passos no openpi, 97.5% para a porta LeRobot, todos de diferentes estruturas de teste. As diferenças reais são 152 ms por passo de ação contra 485 ms, conjuntos de dados v2.1 contra v3.0, e precisão de benchmark contra generalização em mundo aberto.
Posso fazer fine-tuning de algum destes em uma única RTX 4090?▾
SmolVLA e ACT, sim; ambos são listados para uma RTX 4090 ou qualquer placa de 24 GB e rodam localmente. GR00T N1.7, N1.5 e Pi0.5 precisam de uma A100 ou H100 de 80 GB e são apenas para nuvem aqui. A NVIDIA recomenda 40 GB ou mais para fine-tuning de GR00T; o limite mínimo do openpi é acima de 70 GB para um fine-tune completo de Pi0.5, 22.5 GB para LoRA.
Qual destes cinco posso usar comercialmente?▾
Os pesos do GR00T N1.7 estão sob o Acordo de Licença de Modelo Aberto da NVIDIA, que a placa indica cobrir uso comercial. Os pesos do N1.5 são não comerciais. O código do SmolVLA é Apache 2.0 no LeRobot, mas a placa lerobot/smolvla_base não possui campo de licença, então os pesos não são declarados. O ACT não tem pesos base para licenciar. O Pi0.5 é ambíguo: a documentação do LeRobot diz Apache 2.0, seus metadados da placa indicam license: gemma.
Sources
- Repositório NVIDIA Isaac-GR00T: status GA, mudanças de N1.6 para N1.7, requisitos de hardware, restrições de torchcodec e FFmpeg, launch_finetune.py, variância entre execuções
- Cartão do modelo nvidia/GR00T-N1.7-3B: backbone Cosmos-Reason2-2B, 3 B parâmetros, tabela de tempo de inferência, Licença de Modelo Aberto NVIDIA, campo Versão do Modelo
- Cartão do modelo nvidia/GR00T-N1.5-3B: referência Eagle 2, SigLip2 e T5, flow matching DiT, licença não comercial de sentido único
- Exemplo Isaac-GR00T LIBERO: taxas de sucesso por suíte em 20K passos e tamanho de lote 640, 200 tentativas por suíte
- Exemplo Isaac-GR00T SimplerEnv: taxas de sucesso por tarefa Bridge e Fractal, GR00T N1.6 contra N1.7
- pi0.5: um Modelo de Visão-Linguagem-Ação com Generalização em Mundo Aberto (VLM de 2 B mais especialista em ação de 300 M, controle de 50 Hz, cerca de 400 horas de manipulação móvel, estudo de escala em 3 a 104 locais)
- Repositório openpi: limites mínimos de memória da GPU, escopo apenas de flow-matching-head, e os resultados do Pi0.5 LIBERO em examples/libero
- Cartão do modelo lerobot/pi05_base: escopo da porta LeRobot, metadados license: gemma, uso de lerobot-train
- Documentação LeRobot pi0.5: tokenizador PaliGemma com gate, tabela de reprodução LIBERO, armadilha de fallback n_action_steps, declaração Apache 2.0
- SmolVLA: Um Modelo de Visão-Linguagem-Ação para Robótica Acessível e Eficiente (450 M parâmetros, tabelas LIBERO e Meta-World, resultados SO-100 e SO-101, inferência assíncrona)
- Documentação LeRobot SmolVLA: 50 episódios em 5 posições contra 25, 20k passos em cerca de 4 horas em uma A100
- Aprendendo Manipulação Bimanual Detalhada com Hardware de Baixo Custo (ACT e ALOHA): 6 tarefas com 80-90 por cento, ablação de tamanho de chunk de k=1 a k=100
- LeRobot 0.6.2: padrões ACTConfig e SmolVLAConfig, seed padrão 1000, --accelerator.gradient_accumulation.steps, requisito Python 3.12, Apache 2.0
- Documentação LeRobot GR00T: tipo de política groot, suporte N1.5 removido, pin lerobot==0.5.1, exemplo de tamanho de chunk SO-101
- Cartão do modelo lerobot/smolvla_base: o checkpoint base SmolVLA usado por --policy.path, e seus metadados do cartão, que não possuem campo de licença
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started