La tabla comparativa de políticas de AY-Robots mostrando GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA y ACT lado a lado con el recuento de parámetros, nivel de GPU, latencia de inferencia y recuento mínimo de episodios
vla-modelspolicy-trainingmodel-selectionlerobotso-100

¿Qué política VLA deberías entrenar en 2026?

AY-Robots ResearchAugust 23, 202618 min de lectura

¿GR00T N1.7, Pi0.5, SmolVLA, ACT o GR00T N1.5? Una tabla de decisión adaptada a situaciones reales, con los números de referencia publicados, latencia, coste por ejecución y licencias detrás de cada elección.

Actualmente, cinco políticas son entrenables en un brazo de clase SO-100. Difieren en un factor de 24 en la inferencia latencia, 37 en el recuento de parámetros y 12 en lo que cuesta una ejecución, y en si se puede enviar el resultado. Cinco tarjetas de modelo no lo resolverán: ninguna responde a la pregunta que tienes, ¿cuál ejecuto primero?

Cada número a continuación fue extraído de los documentos, repositorios y tarjetas en agosto de 2026. Los números de plataforma provienen from the catálogo de políticas de AY-Robots; donde los dos difieren, se muestran ambos.

La versión corta

  • Entrene ACT primero si duda de su conjunto de datos: de 1 a 3 USD por ejecución, nada preentrenado para encubrir datos deficientes.
  • GR00T N1.7 y Pi0.5 se sitúan a medio punto en LIBERO, 97.0 frente a 96.85 a 97.5. Esa no es una razón para elegir ninguno de los dos.
  • Pi0.5 es la apuesta por la generalización, no por la precisión, y el más lento con 485 ms.
  • SmolVLA, con 450 M de parámetros, es el único VLA aquí que se ajusta en una tarjeta de 24 GB.
  • ACT con 20 ms es la única opción para un movimiento reactivo rápido. Las licencias deciden el resto.

La tabla de decisiones

Tu situaciónEntrena estoPor qué
Calidad del conjunto de datos no probadaACTNada preentrenado oculta un conjunto de datos defectuoso, y fallar cuesta de 1 a 3 USD.
Rico en contacto, multi-paso, condicionado por lenguajeGR00T N1.797.0% en cuatro suites LIBERO, más un espacio de acción relativo del efector final.
Movimiento reactivo rápido, inferencia en los servosACT20 ms. El siguiente más rápido es 7.6 veces más lento.
Nuevos objetos, nueva escena, mundo abiertoPi0.5Diseñado para comportamientos fuera de distribución, en hasta 104 ubicaciones.
Una tarjeta de 24 GB, aún se desea lenguajeSmolVLA450 M parámetros, un mínimo de 30 episodios, se ejecuta localmente.
Reproduciendo una ejecución grabada en 2025GR00T N1.5Solo si es estrictamente necesario: LeRobot ahora lo rechaza, pesos no comerciales.
Esto se enviará como productoN1.7, SmolVLA or ACTN1.5 no es comercial, Pi0.5 incluye términos de Gemma, la tarjeta de SmolVLA no especifica ninguno.

Los cinco candidatos

Los cinco son políticas: fotogramas de cámara, posiciones de articulaciones y, para cuatro de ellas, una instrucción de lenguaje, mapeada a un segmento de futuros objetivos de articulación. Lo que las diferencia es cuánto fue aprendido antes de que llegaras.

PolíticaParámetrosLatenciaNivel de GPU¿Local?Episodios mínimosFormatoCosto
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

El modelo actual de NVIDIA modelo de visión-lenguaje-acción, de aproximadamente 3 mil millones de parámetros, con unos 40 millones entrenados durante ajuste fino. El repositorio enumera las diferencias con N1.6: el backbone pasó de un modelo Eagle propietario a Cosmos-Reason2-2B en Qwen3-VL, las capas de difusión de 32 a 16, las dimensiones de estado y acción de 29 a 132, y el horizonte de acción de 16 a 40.

Lo que importa en un brazo pequeño es el espacio de acción relativo del efector final: N1.7 predice las diferencias desde la pose actual, lo que permite que 20 mil horas de video humano de EgoScale se transfieran a una política de robot. Las especificaciones están en la página de N1.7, el procedimiento en la guía de N1.7 en SO-100.

GA en el repositorio, EA en la tarjeta del modelo

El README de Isaac-GR00T declara N1.7 como una versión de Disponibilidad General, con benchmarks y soporte completos. Su tarjeta de Hugging Face no se ha actualizado: el campo Model Version todavía muestra GR00T N1.7 EA. El repositorio es el documento más reciente.

GR00T N1.5

Misma escala de 3 B, backbone Eagle 2, SigLip2 y T5, cabezal DiT de flow-matching. Existe para extender un que ya tienes. Dos cosas lo convierten en una mala opción por defecto: los pesos conllevan la licencia no comercial unidireccional de NVIDIA, y las versiones actuales de LeRobot eliminaron el soporte para N1.5. Consulta .

Pi0.5

VLA de Physical Intelligence, , tipo de política undefined. El artículo presenta un VLM de 2 B inicializado a partir de PaliGemma más un experto en acciones de 300 M, que impulsa el robot a 50 Hz; la configuración pi05 de LeRobot por defecto utiliza un fragmento de 50 pasos, un segundo a esa velocidad. El punto fuerte son los lugares no vistos: aproximadamente 400 horas de manipulación móvil en hogares reales, y un estudio de escalado sobre 3, 12, 22, 53, 82 y 104 ubicaciones, donde el modelo de 104 ubicaciones igualó a un control entrenado en los propios hogares de prueba.

Un límite, indicado en la lerobot/pi05_base tarjeta: el puerto solo transporta el cabezal de acción de coincidencia de flujo. La predicción de subtareas, la tokenización de acciones y el RL no fueron lanzados upstream, y openpi dice lo mismo de su propio repositorio. La página de Pi0.5 y la guía de Pi0.5 en SO-100 tienen el resto.

La trampa que consume una tarde: repositorios restringidos

Pi0.5 necesita el tokenizador restringido google/paligemma-3b-pt-224 (gated: manual, aunque Google dice que las solicitudes se procesan inmediatamente). Sin aceptarlo y ejecutar hf auth login en el entorno de entrenamiento, el trabajo comienza, descarga por un tiempo y luego falla con un error de autorización que parece un fallo de red. nvidia/GR00T-N1.7-3B no está restringido, pero su backbone nvidia/Cosmos-Reason2-2B sí lo está (gated: auto). Despeje ambos antes de poner en cola; si una ejecución permanece inactiva, la página de cola atascada enumera qué verificar.

SmolVLA

450 M parámetros, aproximadamente 100 M en el experto de acción, en SmolVLM-2 con el VLM congelado y solo sus primeras 16 capas del modelo de lenguaje utilizadas. El preentrenamiento se realizó con datos de la comunidad: 481 conjuntos de datos, 10.6 M fotogramas, de los mismos brazos económicos que usted utiliza. El único VLA aquí que cabe en una tarjeta de 24 GB, y el único con un mínimo de 30 episodios. Consulte la página de SmolVLA.

ACT

No es un modelo fundacional. El Action Chunking Transformer de ALOHA tiene aproximadamente 80 millones de parámetros entrenados desde cero por tarea, en 50 demostraciones a 50 Hz. El artículo informa sobre seis tareas bimanuales reales de aproximadamente diez minutos de demostraciones cada una, con un 80 a 90 por ciento en los ejemplos que destaca. Su idea, fragmentación de acciones, está en cada modelo de esta página, y su ablación aún mide el efecto mejor: en dos tareas simuladas con el ensamble temporal desactivado, el éxito aumenta del 1 por ciento en k=1 al 44 por ciento en k=100. La página de ACT tiene el resto.

Lo que realmente dicen los benchmarks

LIBERO es el único benchmark sobre el que informan tres de estos cinco: tareas condicionadas por lenguaje en un Franka Panda simulado, dividido en las cuatro suites siguientes con diez tareas cada una. NVIDIA ejecutó 200 pruebas por suite.

ModeloEspacialObjetoObjetivo10 (Largo)Promedio
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
Estas filas no son estrictamente comparables

Cada número proviene de un arnés y presupuesto diferentes. GR00T ejecutó 20K pasos con un lote global de 640; la cifra de openpi es un punto de control de 30K; el puerto de LeRobot añadió 6K pasos a un modelo base LIBERO. SmolVLA es una discrepancia adicional: su artículo entrena esa fila en LIBERO desde cero, sin preentrenamiento VLA, mientras que los tres anteriores ajustan puntos de control preentrenados. Trate 96.85 a 97.5 como un solo grupo, y la brecha a 87.3% como real pero obtenida con 6.7 veces los parámetros.

SimplerEnv muestra la dispersión, lo que LIBERO no hace. NVIDIA compara N1.7 con N1.6, lo más cercano públicamente a un delta generacional.

Suite SimplerEnvPromedio N1.6Promedio N1.7Mejor oscilaciónPeor oscilación
Bridge (WidowX), 7 tareas56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tareas52.0%72.5%open_drawer 0.0 to 65.0ninguno, todas las tareas mejoraron

La fila Bridge es la útil: 5.7 puntos ganados en promedio mientras put_eggplant_in_basket perdió 36 y put_eggplant_in_sink cayó de 33 a 2. Una nueva generación mueve la distribución en lugar de elevarla, así que si tu tarea se encuentra donde N1.7 retrocedió, el promedio no dice nada.

La tabla de clasificación de la arena AY-Robots, una tabla ordenable de 85 modelos de visión-lenguaje-acción con 332 resultados de benchmarks, cada valor vinculado al artículo o tarjeta de modelo de donde proviene
La arena contiene 85 modelos VLA y 332 resultados de benchmarks, cada uno vinculado a su artículo o tarjeta de modelo. Útil para verificar si un número citado en una publicación de blog es real.

De los cinco, solo el artículo de SmolVLA informa sobre un brazo de clase SO-100: 78.3 por ciento para SmolVLA y 61.7 para Pi0 en tres tareas, ambas multitarea, frente a 48.3 para ACT entrenado en una sola tarea, lo cual no es comparable. El emparejamiento limpio es ambos en una sola tarea en SO-101 pick-and-place: 90 contra 70 en distribución, 50 contra 40 fuera de ella. Compara en ACT contra SmolVLA y Pi0.5 contra SmolVLA, o navega por la arena.

La latencia y el costo deciden la implementación

Latencia de inferencia es la restricción que la gente descubre al final y lamenta primero. Una política cinco puntos mejor en un benchmark pero medio segundo por paso de acción se ve peor en tu escritorio: la dinámica de contacto no espera.

Una advertencia: la cifra de GR00T no concuerda con la tarjeta de NVIDIA, que mide 4 pasos de denoising y una cámara a 85.8 ms en una H100 en modo eager, 48.6 ms con torch.compile, 27.9 ms a través de TensorRT completo. Los 152 ms aquí son una cifra de pila completa con sobrecarga de servicio y más de una cámara, no un pase hacia adelante.

La inferencia remota tiene un límite estricto

El bucle de 20 a 485 ms es del modelo, y los viajes de ida y vuelta por internet público se suman a él. La inferencia remota es viable para tareas lentas de pick-and-place, no para movimientos reactivos rápidos. Si tu tarea necesita velocidad, la inferencia se sitúa junto a los servos: ACT o SmolVLA, localmente. Relacionado: la política se congela a mitad de movimiento.

Una forma de ganar tiempo sin cambiar el modelo: el artículo de SmolVLA mide la ejecución síncrona, donde la política termina un fragmento antes de predecir el siguiente, frente a la asíncrona, donde la predicción se superpone a la ejecución. El éxito es similar, 78.3 frente a 73.3, pero el mismo pick-and-place tarda 9.7 segundos en lugar de 13.75, y en una ventana fija el robot gestiona 19 ciclos en lugar de 9.

Licencias, revisadas porque nadie las revisa

ModeloLicencia de pesosLicencia de códigoUso comercial
GR00T N1.7NVIDIA Open Model License; la tarjeta permite uso comercialApache 2.0
GR00T N1.5Licencia no comercial unidireccional de NVIDIAApache 2.0no
Pi0.5pi05_base card metadata reads license: gemmaApache 2.0 (openpi, LeRobot docs)leer ambos, no concuerdan
SmolVLAno hay campo de licencia en la tarjeta smolvla_baseApache 2.0 (LeRobot)código sí, pesos no declarados
ACTno existen pesos baseApache 2.0 (LeRobot)

La fila de Pi0.5 requiere atención. La documentación de LeRobot pi05 establece Apache 2.0, consistente con openpi, mientras que la tarjeta del Hub para lerobot/pi05_base contiene license: gemma. Ambos están activos. GR00T N1.7 tiene una versión más suave: el README de Isaac-GR00T menciona de pasada que N1.7 es totalmente licenciable comercialmente bajo Apache 2.0, mientras que su propia sección de licencia y la tarjeta del modelo colocan solo el código bajo Apache 2.0 y los pesos bajo la NVIDIA Open Model License.

Los valores predeterminados que realmente ejecutará

Cada formulario de entrenador incluye un valor predeterminado, y no son arbitrarios. Los de ACT son propios de LeRobot: batch 8, lr 1e-5, 100000 pasos de entrenamiento, tamaño de chunk 100, coincidiendo con ACTConfig upstream y k=100 del paper de ACT. Una columna a continuación es una trampa.

PolíticaLoteLRPasos máximosAcumulación de gradiente¿Aplica?Controles adicionales
GR00T N1.7321e-4200001saveSteps
GR00T N1.511e-5200016saveSteps
Pi0.515e-53000016no (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008noseed, logFreq
ACT81e-51000001nochunkSize, nActionSteps, seed, logFreq
Reproducibilidad, con fecha de agosto de 2026

El punto de entrada de ajuste fino de GR00T (launch_finetune.py, una CLI de tyro) no tiene campo de semilla en su dataclass de configuración, por lo que las ejecuciones no son reproducibles bit a bit. El repositorio también advierte de una varianza del 5 al 6 por ciento entre ejecuciones debido a aumentos de imagen no deterministas, mayor que la mayoría de las diferencias de benchmark discutidas en línea. La semilla predeterminada de LeRobot es 1000. La columna de acumulación de gradiente describe lerobot 0.5.1; la versión upstream 0.6.2 lo expone como --accelerator.gradient_accumulation.steps.

El control que importa más que la elección del modelo

Es el fragmento de acción. Los fragmentos más largos proporcionan un movimiento más suave y menos errores acumulativos, pero la política se compromete mientras el bloque se ejecuta, por lo que reacciona tarde a cualquier cosa que se mueva: confiada en un cubo estático, inútil en uno rodante. Si se excede, acortar la porción ejecutada es mejor que reentrenar y es gratis. Una articulación que se detiene antes de tiempo es un problema diferente; consulte .

  • ACT: ACTConfig por defecto usa chunk_size 100 y n_action_steps 100. El ensamblaje temporal está desactivado y requiere n_action_steps 1.
  • GR00T N1.7: el horizonte interno pasó de 16 a 40, sin embargo, el ejemplo SO-101 de LeRobot todavía ejecuta --policy.chunk_size=16 --policy.n_action_steps=16. El flag de rollout fue renombrado a --execution-horizon.
  • Pi0.5: un fragmento de 50 pasos, de los cuales la receta LIBERO de LeRobot ejecuta 10 a través de --policy.n_action_steps=10; con --policy.pretrained_path vuelve a 50 si omite el flag.
  • SmolVLA: fragmentos de 50 acciones, ambos parámetros expuestos.

¿Cómo evaluar los cinco en una tarde?

La respuesta más barata no es leer más. Gaste alrededor de 15 USD y deje que el brazo le diga: grabe una vez, entrene el modelo barato primero, escale una vez que haya demostrado que los datos son sólidos. La estructura supera el volumen, el objetivo de y el .

  1. 1
    Grabe 50 episodios una vez

    Cincuenta despeja el camino para GR00T, Pi0.5 y ACT, y 30 para SmolVLA. Repita cada variación en lugar de dispersarse: 50 episodios en 5 posiciones de cubo entrenadas donde 25 no lo hicieron. Consulte cómo grabar su primer conjunto de datos.

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    Entrene ACT primero, porque no puede mentirle

    Sin pesos preentrenados, así que si realiza la tarea, su conjunto de datos contiene la tarea. Si ACT se estanca, corrija los datos. De 1 a 3 USD, de 2 a 5 horas en una tarjeta de 24 GB.

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    Ejecute SmolVLA en el mismo conjunto de datos, sin cambios

    Mismos datos, mismo brazo, 450 M de parámetros en lugar de 80 M, más condicionamiento de lenguaje. LeRobot estima una ejecución de 20K pasos en aproximadamente 4 horas en una A100. Esto es lo que le indica si el preentrenamiento aporta algún beneficio.

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    Convierta a v2.1 antes de usar GR00T

    GR00T lee una variante del formato LeRobot v2 más un archivo meta/modality.json adicional que mapea cómo los arrays concatenados de estado y acción se dividen en campos nombrados. Un conjunto de datos v3.0 bloquea ese cargador, porque v3.0 empaqueta muchos episodios en archivos compartidos donde v2 escribía uno por episodio. Isaac-GR00T incluye la herramienta de degradación como scripts/lerobot_conversion/convert_v3_to_v2.py; la página de rechazo de v3 es la vía rápida.

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    Escale a GR00T N1.7 solo si los dos primeros dejaron algo pendiente

    A través de la CLI de NVIDIA, que se muestra aquí, o el tipo de política groot de LeRobot. NVIDIA recomienda 40 GB o más de VRAM para el ajuste fino, 16 GB para la inferencia. En caso de OOM, consulte la página de OOM.

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

Dos formas de ejecutar esa pasada de cribado

Tres entornos, porque las cadenas de herramientas no coexisten. LeRobot en main es 0.6.2 y necesita Python 3.12 o posterior; Isaac-GR00T y openpi son repositorios separados gestionados por uv.

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T fija torchcodec 0.8.0 como su único backend de video, requiriendo FFmpeg 4 a 7. FFmpeg 8 no es compatible, AV1 no está garantizado.
  • Requisitos mínimos de memoria de openpi: inferencia por encima de 8 GB, LoRA por encima de 22.5 GB, ajuste fino completo por encima de 70 GB. Este último es el motivo por el que Pi0.5 es un trabajo para A100.
  • Alquile la GPU usted mismo, destrúyala después, concilie tres conjuntos de rutas de puntos de control manualmente.

Modelo fundacional o desde cero

La verdadera disyuntiva no es qué modelo 3 B elegir. Es si usar un VLA preentrenado en absoluto, dado que ACT aprendió seis tareas bimanuales reales de aproximadamente diez minutos de demostraciones cada una, con 80 M de parámetros y nada preentrenado.

Ajustar un VLA preentrenado en lugar de entrenar ACT desde cero
Lo que ganas
  • Condicionamiento del lenguaje. ACT no tiene ninguno; un punto de control de ACT realiza una tarea.
  • Mejor en objetos ausentes de tus demostraciones: en SO-101, 50% frente al 40% de ACT fuera de distribución.
  • Multitarea en absoluto: SmolVLA alcanza el 78.3% en tres tareas SO-100 con un punto de control; ACT solo se ejecutó en una sola tarea.
Lo que te cuesta
  • De 7.6x a 24x la latencia: de 152 a 485 ms por paso de acción frente a los 20 ms de ACT.
  • De 4 a 12 USD por ejecución en lugar de 1 a 3, y un nivel A100 en lugar de cualquier tarjeta de 24 GB.
  • Exposición a licencias, además de un modo de fallo de repositorio restringido que no existe desde cero.
  • Los pesos preentrenados pueden enmascarar un conjunto de datos deficiente. Un ajuste fino que funciona a medias con datos defectuosos cuesta una semana antes de que revises los datos.

El caso de la reproducción de una ejecución antigua

Perseguir un punto de control de 2025 decide la elección del modelo por ti y convierte el problema en la fijación de versiones: LeRobot actual rechaza N1.5, así que fijas lerobot==0.5.1. Sin campo de semilla y con una varianza del 5 al 6 por ciento entre ejecuciones, la reproducción es aproximada por construcción. y tienen el lado de la plataforma.

La página de comparación directa de AY-Robots para GR00T N1.7 contra Pi0.5, mostrando el recuento de parámetros, requisitos de GPU, latencia de inferencia, formato del conjunto de datos y recuento mínimo de episodios lado a lado.
Head to head on /compare/groot-n1-7-vs-pi0-5. Los dos modelos de 3 B parecen intercambiables en una hoja de especificaciones y no lo son: uno requiere LeRobot v2.1, el otro v3.0.

Quedan dos? y . Las filas de datos brutos se encuentran en las entradas de la arena: , , y .

Dónde esta plataforma no te ayuda

  • No puede acelerar la inferencia remota. El bucle de 20 a 485 ms pertenece al modelo; los viajes de ida y vuelta por internet se suman a ello.
  • No puede ajustar GR00T o Pi0.5 en tu propio hardware. Ambos son solo en la nube aquí; solo SmolVLA y ACT se ejecutan localmente.
  • No puede arreglar un conjunto de datos. La pérdida disminuye pero la política no hace nada es un problema de datos, una política que solo funciona en una configuración es un problema de cobertura.
  • No puede hacer que las ejecuciones de GR00T sean reproducibles: la configuración ascendente no tiene un campo de semilla.

85 modelos, 332 resultados de benchmarks, cada número vinculado a su fuente

La versión ordenable de las tablas en esta página: 85 modelos de visión-lenguaje-acción, 332 resultados de benchmarks, cada uno vinculado a su artículo o tarjeta de modelo.

Abrir la arena

Elegir uno y seguir adelante

Una configuración predeterminada: grabe 50 episodios, entrene ACT por 1 a 3 USD para probar el conjunto de datos, luego SmolVLA con los mismos datos. Por menos de 6 USD en total, y responden la pregunta importante: si el preentrenamiento ayuda aquí, o si el cuello de botella son los datos. Escalar a GR00T N1.7 para tareas de varios pasos con contacto, a Pi0.5 cuando la escena cambia.

Recorrido por la plataforma: entrene su primera política, luego ejecute su primera política. La documentación de entrenamiento y la documentación de conjuntos de datos cubren la forma y el formato; la página del SO-100 y la guía completa del SO-100 cubren la construcción y la calibración. Antecedentes: la visión general de VLA y el artículo de Pi0 sobre flow-matching. El que aumentará su tasa de éxito es la guía de calidad de datos.

¿Qué política VLA debería entrenar primero en un SO-100?

ACT, luego SmolVLA. ACT entrena desde cero, por lo que no puede enmascarar un conjunto de datos deficiente, y una ejecución cuesta de 1 a 3 USD en una tarjeta de 24 GB. Si ACT realiza la tarea, los 4 a 12 USD de una ejecución de GR00T N1.7 o Pi0.5 no se desperdician.

¿Es GR00T N1.7 realmente mejor que Pi0.5?

En LIBERO están dentro del ruido: 97.0% en cuatro suites para GR00T N1.7, 96.85% para Pi0.5 en 30k pasos en openpi, 97.5% para el puerto de LeRobot, todos de diferentes arneses. Las diferencias reales son 152 ms por paso de acción frente a 485 ms, conjuntos de datos v2.1 frente a v3.0, y precisión de benchmark frente a generalización en el mundo real.

¿Puedo ajustar cualquiera de estos en una sola RTX 4090?

SmolVLA y ACT, sí; ambos están listados para una RTX 4090 o cualquier tarjeta de 24 GB y se ejecutan localmente. GR00T N1.7, N1.5 y Pi0.5 necesitan una A100 o H100 de 80 GB y aquí son solo en la nube. NVIDIA recomienda 40 GB o más para el ajuste fino de GR00T; el mínimo de openpi está por encima de 70 GB para un ajuste fino completo de Pi0.5, 22.5 GB para LoRA.

¿Cuál de estos cinco puedo usar comercialmente?

Los pesos de GR00T N1.7 están bajo el Acuerdo de Licencia de Modelo Abierto de NVIDIA, que la tarjeta indica que cubre el uso comercial. Los pesos de N1.5 no son comerciales. El código de SmolVLA es Apache 2.0 en LeRobot, pero la tarjeta lerobot/smolvla_base no tiene un campo de licencia, por lo que los pesos no están declarados. ACT no tiene pesos base para licenciar. Pi0.5 es ambiguo: la documentación de LeRobot dice Apache 2.0, sus metadatos de tarjeta leen license: gemma.

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started