A tabela de comparação de políticas AY-Robots mostrando GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA e ACT lado a lado com contagens de parâmetros, nível de GPU, latência de inferência e contagens mínimas de episódios
modelos-vlatreinamento-de-políticaseleção-de-modelolerobotso-100

Qual Política VLA Você Deve Treinar em 2026?

AY-Robots ResearchAugust 23, 202618 min de leitura

GR00T N1.7, Pi0.5, SmolVLA, ACT ou GR00T N1.5? Uma tabela de decisão adaptada a situações reais, com os números de benchmark publicados, latência, custo por execução e licenças por trás de cada escolha.

Cinco políticas são treináveis em um braço da classe SO-100 hoje. Elas diferem por um fator de 24 na inferência latência, 37 na contagem de parâmetros e 12 no custo de uma execução, e se você pode enviar o resultado. Cinco cartões de modelo não resolverão isso: nenhum responde à pergunta que você tem, qual devo executar primeiro?

Cada número abaixo foi lido nos artigos, repositórios e cartões em agosto de 2026. Os números da plataforma vêm do catálogo de políticas AY-Robots; onde os dois discordam, ambos são mostrados.

A versão resumida

  • Treine ACT primeiro se você duvida do seu conjunto de dados: 1 a 3 USD por execução, nada pré-treinado para encobrir dados ruins.
  • GR00T N1.7 e Pi0.5 estão dentro de meio ponto no LIBERO, 97.0 contra 96.85 a 97.5. Essa não é uma razão para escolher um ou outro.
  • Pi0.5 é a aposta na generalização, não na precisão, e o mais lento com 485 ms.
  • SmolVLA, com 450 M parâmetros, é o único VLA aqui que faz fine-tuning em uma placa de 24 GB.
  • ACT a 20 ms é a única opção para movimento reativo rápido. As licenças decidem o resto.

A tabela de decisão

Sua situaçãoTreine estePorquê
Qualidade do conjunto de dados não comprovadaACTNada pré-treinado esconde um conjunto de dados quebrado, e falhar custa 1 a 3 USD.
Rico em contato, multi-etapas, condicionado por linguagemGR00T N1.797,0% em quatro suítes LIBERO, mais um espaço de ação relativo do efetor final.
Movimento reativo rápido, inferência nos servosACT20 ms. O próximo mais rápido é 7,6 vezes mais lento.
Novos objetos, nova cena, mundo abertoPi0.5Construído para comportamento fora da distribuição, em até 104 locais.
Uma placa de 24 GB, ainda quer linguagemSmolVLA450 M parâmetros, um mínimo de 30 episódios, executa localmente.
Reproduzindo uma execução gravada em 2025GR00T N1.5Só se for necessário: LeRobot agora o rejeita, pesos não comerciais.
Isto será lançado como produtoN1.7, SmolVLA ou ACTN1.5 é não comercial, Pi0.5 carrega termos Gemma, a placa de SmolVLA não declara nenhum.

Os cinco candidatos

Todos os cinco são políticas: quadros de câmera, posições de junta e, para quatro deles, uma instrução de linguagem, mapeada para um conjunto de alvos de junta futuros. O que os separa é o quanto foi aprendido antes de você chegar.

PolíticaParâmetrosLatênciaNível de GPULocal?Mín. episódiosFormatoCusto
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

O atual modelo de visão-linguagem-ação da NVIDIA, com cerca de 3 bilhões de parâmetros, aproximadamente 40 milhões treinados durante ajuste fino. O repositório lista as diferenças em relação ao N1.6: backbone de um modelo Eagle fornecido para Cosmos-Reason2-2B no Qwen3-VL, camadas de difusão de 32 para 16, dimensões de estado e ação de 29 para 132, horizonte de ação de 16 para 40.

O que importa em um braço pequeno é o espaço de ação relativo do efetor final: o N1.7 prevê as diferenças em relação à pose atual, o que permite que 20 mil horas de vídeo humano EgoScale sejam transferidas para uma política de robô. Especificações na página do N1.7, procedimento no guia N1.7 no SO-100.

GA no repositório, EA no cartão do modelo

O README do Isaac-GR00T declara o N1.7 uma versão de Disponibilidade Geral, com benchmarks e suporte completos. Seu cartão Hugging Face não foi atualizado: o campo Model Version ainda exibe GR00T N1.7 EA. O repositório é o documento mais recente.

GR00T N1.5

Mesma escala de 3 B, backbone Eagle 2, SigLip2 e T5, cabeça DiT de flow-matching. Existe para estender um que você já possui. Duas coisas o tornam uma opção padrão ruim: os pesos carregam a licença não comercial unidirecional da NVIDIA, e as versões atuais do LeRobot removeram o suporte ao N1.5. Veja .

Pi0.5

O VLA de Physical Intelligence com VLA, tipo de política pi05. O artigo apresenta um VLM de 2 B inicializado a partir de PaliGemma mais um especialista em ação de 300 M, controlando o robô a 50 Hz; a configuração pi05 do LeRobot assume um bloco de 50 passos por padrão, um segundo nessa taxa. O ponto de venda são lugares nunca vistos: cerca de 400 horas de manipulação móvel em casas reais, e um estudo de escalonamento em 3, 12, 22, 53, 82 e 104 locais, onde o modelo de 104 locais correspondeu a um controle treinado nas próprias casas de teste.

Um limite, declarado no lerobot/pi05_base cartão: a porta transporta apenas o cabeçalho de ação correspondente ao fluxo. A previsão de subtarefas, a tokenização de ações e o RL não foram lançados upstream, e o openpi diz o mesmo sobre seu próprio repositório. A página do Pi0.5 e o guia do Pi0.5 no SO-100 têm o resto.

A armadilha que consome uma tarde: repositórios restritos

O Pi0.5 precisa do tokenizador restrito google/paligemma-3b-pt-224 (gated: manual, embora o Google diga que as solicitações são processadas imediatamente). Sem aceitá-lo e executar hf auth login no ambiente de treinamento, o trabalho inicia, faz o download por um tempo e depois morre com um erro de autorização que parece uma falha de rede. nvidia/GR00T-N1.7-3B não é restrito, mas seu backbone nvidia/Cosmos-Reason2-2B é (gated: auto). Limpe ambos antes de enfileirar; se uma execução ficar ociosa, a página de fila travada lista o que verificar.

SmolVLA

450 M parâmetros, cerca de 100 M no especialista em ação, no SmolVLM-2 com o VLM congelado e apenas suas primeiras 16 camadas do modelo de linguagem usadas. O pré-treinamento foi feito com dados da comunidade: 481 conjuntos de dados, 10.6 M quadros, dos mesmos braços baratos que você usa. O único VLA aqui que cabe em uma placa de 24 GB, e o único com um piso de 30 episódios. Veja a página do SmolVLA.

ACT

Não é um modelo de base. O Action Chunking Transformer da ALOHA tem cerca de 80 M de parâmetros treinados do zero por tarefa, em 50 demonstrações a 50 Hz. O artigo relata seis tarefas bimanuais reais de aproximadamente dez minutos de demonstrações cada, com 80 a 90 por cento nos exemplos que destaca. A sua ideia, agrupamento de ações, está presente em todos os modelos desta página, e a sua ablação ainda mede o efeito melhor: em duas tarefas simuladas com o agrupamento temporal desativado, o sucesso aumenta de 1 por cento em k=1 para 44 por cento em k=100. A página do ACT tem o resto.

O que os benchmarks realmente dizem

LIBERO é o único benchmark sobre o qual três destes cinco relatam: tarefas condicionadas por linguagem em um Franka Panda simulado, dividido nas quatro suítes abaixo, com dez tarefas cada. A NVIDIA executou 200 testes por suíte.

ModeloEspacialObjetoMeta10 (Longo)Média
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Estas linhas não são estritamente comparáveis

Cada número provém de um conjunto de testes e orçamento diferentes. GR00T executou 20K passos com um batch global de 640; o valor openpi é um checkpoint de 30K; a porta LeRobot adicionou 6K passos a um modelo base LIBERO. SmolVLA é uma incompatibilidade adicional: seu artigo treina essa linha no LIBERO do zero, sem pré-treinamento VLA, enquanto os três acima ajustam checkpoints pré-treinados. Trate 96.85 a 97.5 como um único cluster, e a diferença para 87.3% como real, mas obtida com 6.7x os parâmetros.

SimplerEnv mostra a dispersão, o que LIBERO não faz. NVIDIA compara N1.7 com N1.6, o mais próximo publicamente de um "delta geracional".

Conjunto SimplerEnvMédia N1.6Média N1.7Melhor variaçãoPior variação
Bridge (WidowX), 7 tarefas56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tarefas52.0%72.5%open_drawer 0.0 to 65.0nenhum, todas as tarefas melhoraram

A linha Bridge é a útil: 5.7 pontos ganhos em média enquanto put_eggplant_in_basket perdeu 36 e put_eggplant_in_sink caiu de 33 para 2. Uma nova geração move a distribuição em vez de erguê-la, então se sua tarefa se encontra onde N1.7 regrediu, a média não diz nada.

O placar da arena AY-Robots, uma tabela classificável de 85 modelos de visão-linguagem-ação com 332 resultados de benchmark, cada valor vinculado ao artigo ou cartão de modelo de onde veio
A arena contém 85 modelos VLA e 332 resultados de benchmark, cada um vinculado ao seu artigo ou cartão de modelo. Útil para verificar se um número citado em uma postagem de blog é real.

Dos cinco, apenas o artigo SmolVLA relata um braço da classe SO-100: 78.3 por cento para SmolVLA e 61.7 para Pi0 em três tarefas, ambos multi-tarefa, contra 48.3 para ACT treinado em tarefa única, o que não é comparável. O emparelhamento limpo é ambos em tarefa única em SO-101 pick-and-place: 90 contra 70 em distribuição, 50 contra 40 fora dela. Compare em ACT contra SmolVLA e Pi0.5 contra SmolVLA, ou navegue a arena.

Latência e custo decidem a implantação

Latência de inferência é a restrição que as pessoas descobrem por último e se arrependem primeiro. Uma política cinco pontos melhor em um benchmark, mas meio segundo por etapa de ação, parece pior na sua mesa: a dinâmica de contato não espera.

Uma ressalva: o valor do GR00T diverge da placa da NVIDIA, que mede 4 etapas de denoising e uma câmera a 85.8 ms em uma H100 no modo eager, 48.6 ms com torch.compile, 27.9 ms através do TensorRT completo. Os 152 ms aqui são um valor de pilha completa com sobrecarga de serviço e mais de uma câmera, não uma passagem direta (forward pass).

Inferência remota tem um limite rígido

O loop de 20 a 485 ms é do modelo, e as viagens de ida e volta pela internet pública se somam a isso. A inferência remota é viável para tarefas lentas de pick-and-place, não para movimento reativo rápido. Se sua tarefa exige velocidade, a inferência fica ao lado dos servos: ACT ou SmolVLA, localmente. Relacionado: a política congela no meio do movimento.

Uma maneira de ganhar tempo sem mudar o modelo: o artigo do SmolVLA mede a execução síncrona, onde a política termina um bloco antes de prever o próximo, em comparação com a assíncrona, onde a previsão se sobrepõe à execução. O sucesso é similar, 78.3 contra 73.3, mas o mesmo pick-and-place leva 9.7 segundos em vez de 13.75, e em uma janela fixa o robô gerencia 19 ciclos em vez de 9.

Licenças, verificadas porque ninguém as verifica

ModeloLicença dos pesosLicença do códigoUso comercial
GR00T N1.7NVIDIA Open Model License; o cartão permite uso comercialApache 2.0sim
GR00T N1.5Licença não comercial unidirecional da NVIDIAApache 2.0não
Pi0.5pi05_base card metadata reads license: gemmaApache 2.0 (openpi, LeRobot docs)leia ambos, eles discordam
SmolVLAnenhum campo de licença no cartão smolvla_baseApache 2.0 (LeRobot)código sim, pesos não declarados
ACTnão existem pesos baseApache 2.0 (LeRobot)sim

A linha Pi0.5 requer atenção. A documentação LeRobot pi05 declara Apache 2.0 consistente com openpi, enquanto o cartão do Hub para lerobot/pi05_base contém license: gemma. Ambos estão ativos. GR00T N1.7 tem uma versão mais branda: o README do Isaac-GR00T menciona de passagem que N1.7 é totalmente licenciável comercialmente sob Apache 2.0, enquanto sua própria seção de licença e o cartão do modelo colocam apenas o código sob Apache 2.0 e os pesos sob a NVIDIA Open Model License.

Os padrões que você realmente executará

Cada formulário de treinador vem com um padrão, e eles não são arbitrários. Os do ACT são próprios do LeRobot: batch 8, lr 1e-5, 100000 passos de treinamento, tamanho do chunk 100, correspondendo ao ACTConfig upstream e k=100 do artigo ACT. Uma coluna abaixo é uma armadilha.

PolíticaBatchLRMáx. passosAcúmulo de grad.Aplica-se?Controles extras
GR00T N1.7321e-4200001simsaveSteps
GR00T N1.511e-5200016simsaveSteps
Pi0.515e-53000016não (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008nãoseed, logFreq
ACT81e-51000001nãochunkSize, nActionSteps, seed, logFreq
Reprodutibilidade, datado de agosto de 2026

O ponto de entrada de fine-tuning do GR00T (launch_finetune.py, um CLI tyro) não possui campo de seed em sua dataclass de configuração, portanto, as execuções não são reproduzíveis bit a bit. O repositório também alerta para uma variância de 5 a 6 por cento entre as execuções devido a aumentos de imagem não determinísticos, maior do que a maioria das lacunas de benchmark discutidas online. A seed padrão do LeRobot é 1000. A coluna de acúmulo de grad. descreve lerobot 0.5.1; o upstream 0.6.2 o expõe como --accelerator.gradient_accumulation.steps.

O controle que importa mais do que a escolha do modelo

É o bloco de ação. Blocos mais longos proporcionam movimento mais suave e menos erros cumulativos, mas a política é comprometida enquanto o bloco executa, então ela reage tardiamente a qualquer coisa que se move: confiante em um cubo estático, inútil em um que rola. Se ele ultrapassar, encurtar a porção executada é melhor do que retreinar e é gratuito. Uma junta que para antes do tempo é um problema diferente; veja .

  • ACT: ACTConfig assume chunk_size 100 e n_action_steps 100 por padrão. O agrupamento temporal está desativado e requer n_action_steps 1.
  • GR00T N1.7: o horizonte interno passou de 16 para 40, mas o exemplo SO-101 do LeRobot ainda executa --policy.chunk_size=16 --policy.n_action_steps=16. A flag de rollout foi renomeada para --execution-horizon.
  • Pi0.5: um bloco de 50 passos, dos quais a receita LIBERO do LeRobot executa 10 via --policy.n_action_steps=10; com --policy.pretrained_path ele volta para 50 se você omitir a flag.
  • SmolVLA: blocos de 50 ações, ambos os controles expostos.

Como testar todos os cinco em uma tarde

A resposta mais barata não é mais leitura. Gaste cerca de 15 USD e deixe o braço te dizer: grave uma vez, treine o modelo barato primeiro, escale depois que ele provar que os dados são sólidos. A estrutura supera o volume, o objetivo da e o .

  1. 1
    Grave 50 episódios uma vez

    Cinquenta libera o caminho para GR00T, Pi0.5 e ACT, e 30 para SmolVLA. Repita cada variação em vez de dispersar: 50 episódios em 5 posições de cubo treinadas onde 25 não foram. Veja grave seu primeiro conjunto de dados.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Treine o ACT primeiro, porque ele não pode mentir para você

    Sem pesos pré-treinados, então se ele realizar a tarefa, seu conjunto de dados contém a tarefa. Se o ACT estagnar, corrija os dados. 1 a 3 USD, 2 a 5 horas em uma placa de 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Execute SmolVLA no mesmo conjunto de dados, inalterado

    Mesmos dados, mesmo braço, 450 M parâmetros em vez de 80 M, mais condicionamento de linguagem. LeRobot estima uma execução de 20K passos em aproximadamente 4 horas em uma A100. Isso é o que lhe diz se o pré-treinamento traz algum benefício.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Converta para v2.1 antes de usar GR00T

    GR00T lê uma variação do formato LeRobot v2 mais um meta/modality.json extra que mapeia como os arrays concatenados de estado e ação se dividem em campos nomeados. Um conjunto de dados v3.0 trava esse carregador, porque o v3.0 empacota muitos episódios em arquivos compartilhados onde o v2 escrevia um por episódio. Isaac-GR00T fornece o auxiliar de downgrade como scripts/lerobot_conversion/convert_v3_to_v2.py; a página de rejeição v3 é o caminho rápido.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Escale para GR00T N1.7 apenas se os dois primeiros deixaram algo a desejar

    Através da CLI da NVIDIA, mostrada aqui, ou do tipo de política groot do LeRobot. A NVIDIA recomenda 40 GB ou mais de VRAM para fine-tuning, 16 GB para inferência. Em caso de OOM, consulte a página de OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Duas maneiras de executar essa triagem

Três ambientes, porque as cadeias de ferramentas não coexistem. LeRobot no main é 0.6.2 e precisa de Python 3.12 ou mais recente; Isaac-GR00T e openpi são repositórios separados gerenciados por uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T fixa torchcodec 0.8.0 como seu único backend de vídeo, necessitando de FFmpeg 4 a 7. FFmpeg 8 não é suportado, AV1 não é garantido.
  • Limites de memória do openpi: inferência acima de 8 GB, LoRA acima de 22.5 GB, fine-tuning completo acima de 70 GB. Este último é o motivo pelo qual Pi0.5 é uma tarefa para A100.
  • Alugue a GPU você mesmo, destrua-a depois, concilie três conjuntos de caminhos de checkpoint manualmente.

Modelo de fundação ou do zero

A verdadeira questão não é qual modelo 3 B escolher. É se deve usar um VLA pré-treinado, dado que o ACT aprendeu seis tarefas bimanuais reais a partir de cerca de dez minutos de demonstrações cada, com 80 M parâmetros e nada pré-treinado.

Ajustar um VLA pré-treinado em vez de treinar o ACT do zero
O que você ganha
  • Condicionamento de linguagem. O ACT não tem nenhum; um checkpoint do ACT realiza uma tarefa.
  • Melhor em objetos ausentes de suas demonstrações: em SO-101, 50% contra 40% do ACT fora da distribuição.
  • Multitarefa em geral: SmolVLA atinge 78.3% em três tarefas SO-100 com um checkpoint; o ACT foi executado apenas em tarefa única.
O que isso lhe custa
  • 7.6x a 24x a latência: 152 a 485 ms por passo de ação contra 20 ms do ACT.
  • 4 a 12 USD por execução em vez de 1 a 3, e um nível A100 em vez de qualquer placa de 24 GB.
  • Exposição a licenças, além de um modo de falha de repositório restrito que não existe do zero.
  • Pesos pré-treinados podem mascarar um conjunto de dados ruim. Um ajuste fino que funciona pela metade em dados corrompidos custa uma semana antes de você analisar os dados.

O caso de reprodução de uma execução antiga

Perseguir um checkpoint de 2025 faz a escolha do modelo por você e transforma o problema em fixação de versão: o LeRobot atual rejeita N1.5, então você fixa lerobot==0.5.1. Sem campo de seed e com 5 a 6 por cento de variância entre as execuções, a reprodução é aproximada por construção. O guia N1.5 no SO-100 e a página da política N1.5 têm o lado da plataforma.

A página de comparação direta da AY-Robots para GR00T N1.7 contra Pi0.5, mostrando contagens de parâmetros, requisitos de GPU, latência de inferência, formato do conjunto de dados e contagens mínimas de episódios lado a lado
Comparativo em /compare/groot-n1-7-vs-pi0-5. Os dois modelos de 3 B parecem intercambiáveis numa folha de especificações e não são: um requer LeRobot v2.1, o outro v3.0.

Reduzido a dois? ACT contra GR00T N1.7 e GR00T N1.7 contra SmolVLA. As linhas brutas estão nas entradas da arena: GR00T N1.7, Pi0.5, SmolVLA e ACT.

Onde esta plataforma não o ajuda

  • Não consegue tornar a inferência remota rápida. O ciclo de 20 a 485 ms pertence ao modelo; as viagens de ida e volta pela internet somam-se a isso.
  • Não consegue fazer o fine-tuning de GR00T ou Pi0.5 no seu próprio hardware. Ambos são apenas na nuvem aqui; apenas SmolVLA e ACT correm localmente.
  • Não consegue corrigir um conjunto de dados. A perda diminui, mas a política não faz nada é um problema de dados, uma política que só funciona numa configuração é um problema de cobertura.
  • Não consegue tornar as execuções de GR00T reproduzíveis: a configuração upstream não tem um campo de seed.

85 modelos, 332 resultados de benchmark, cada número linkado à sua fonte

A versão classificável das tabelas nesta página: 85 modelos de visão-linguagem-ação, 332 resultados de benchmark, cada um linkado ao seu artigo ou cartão de modelo.

Abrir a arena

Escolhendo um e seguindo em frente

Um padrão: grave 50 episódios, treine ACT por 1 a 3 USD para provar o conjunto de dados, depois SmolVLA nos mesmos dados. Por menos de 6 USD no total, e eles respondem à pergunta que importa: se o pré-treinamento ajuda aqui, ou se o gargalo são os dados. Escale para GR00T N1.7 para tarefas multi-passo com muito contato, para Pi0.5 quando a cena muda.

Visita guiada à plataforma: treine sua primeira política, depois execute sua primeira política. Os documentos de treinamento e documentos de conjunto de dados cobrem forma e formato; a página do SO-100 e o guia completo do SO-100 cobrem construção e calibração. Contexto: a visão geral de VLA e o artigo de flow-matching do Pi0. O que realmente aumentará sua taxa de sucesso é o guia de qualidade de dados.

Qual política VLA devo treinar primeiro em um SO-100?

ACT, depois SmolVLA. O ACT treina do zero, então não consegue mascarar um conjunto de dados ruim, e uma execução custa 1 a 3 USD em uma placa de 24 GB. Se o ACT realizar a tarefa, os 4 a 12 USD para uma execução de GR00T N1.7 ou Pi0.5 não serão desperdiçados.

O GR00T N1.7 é realmente melhor que o Pi0.5?

No LIBERO, eles estão dentro do ruído: 97.0% em quatro suítes para GR00T N1.7, 96.85% para Pi0.5 em 30k passos no openpi, 97.5% para a porta LeRobot, todos de diferentes estruturas de teste. As diferenças reais são 152 ms por passo de ação contra 485 ms, conjuntos de dados v2.1 contra v3.0, e precisão de benchmark contra generalização em mundo aberto.

Posso fazer fine-tuning de algum destes em uma única RTX 4090?

SmolVLA e ACT, sim; ambos são listados para uma RTX 4090 ou qualquer placa de 24 GB e rodam localmente. GR00T N1.7, N1.5 e Pi0.5 precisam de uma A100 ou H100 de 80 GB e são apenas para nuvem aqui. A NVIDIA recomenda 40 GB ou mais para fine-tuning de GR00T; o limite mínimo do openpi é acima de 70 GB para um fine-tune completo de Pi0.5, 22.5 GB para LoRA.

Qual destes cinco posso usar comercialmente?

Os pesos do GR00T N1.7 estão sob o Acordo de Licença de Modelo Aberto da NVIDIA, que a placa indica cobrir uso comercial. Os pesos do N1.5 são não comerciais. O código do SmolVLA é Apache 2.0 no LeRobot, mas a placa lerobot/smolvla_base não possui campo de licença, então os pesos não são declarados. O ACT não tem pesos base para licenciar. O Pi0.5 é ambíguo: a documentação do LeRobot diz Apache 2.0, seus metadados da placa indicam license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started