
¿GR00T N1.7, Pi0.5, SmolVLA, ACT o GR00T N1.5? Una tabla de decisión adaptada a situaciones reales, con los números de referencia publicados, latencia, coste por ejecución y licencias detrás de cada elección.
Actualmente, cinco políticas son entrenables en un brazo de clase SO-100. Difieren en un factor de 24 en la inferencia latencia, 37 en el recuento de parámetros y 12 en lo que cuesta una ejecución, y en si se puede enviar el resultado. Cinco tarjetas de modelo no lo resolverán: ninguna responde a la pregunta que tienes, ¿cuál ejecuto primero?
Cada número a continuación fue extraído de los documentos, repositorios y tarjetas en agosto de 2026. Los números de plataforma provienen from the catálogo de políticas de AY-Robots; donde los dos difieren, se muestran ambos.
La versión corta
- •Entrene ACT primero si duda de su conjunto de datos: de 1 a 3 USD por ejecución, nada preentrenado para encubrir datos deficientes.
- •GR00T N1.7 y Pi0.5 se sitúan a medio punto en LIBERO, 97.0 frente a 96.85 a 97.5. Esa no es una razón para elegir ninguno de los dos.
- •Pi0.5 es la apuesta por la generalización, no por la precisión, y el más lento con 485 ms.
- •SmolVLA, con 450 M de parámetros, es el único VLA aquí que se ajusta en una tarjeta de 24 GB.
- •ACT con 20 ms es la única opción para un movimiento reactivo rápido. Las licencias deciden el resto.
La tabla de decisiones
| Tu situación | Entrena esto | Por qué |
|---|---|---|
| Calidad del conjunto de datos no probada | ACT | Nada preentrenado oculta un conjunto de datos defectuoso, y fallar cuesta de 1 a 3 USD. |
| Rico en contacto, multi-paso, condicionado por lenguaje | GR00T N1.7 | 97.0% en cuatro suites LIBERO, más un espacio de acción relativo del efector final. |
| Movimiento reactivo rápido, inferencia en los servos | ACT | 20 ms. El siguiente más rápido es 7.6 veces más lento. |
| Nuevos objetos, nueva escena, mundo abierto | Pi0.5 | Diseñado para comportamientos fuera de distribución, en hasta 104 ubicaciones. |
| Una tarjeta de 24 GB, aún se desea lenguaje | SmolVLA | 450 M parámetros, un mínimo de 30 episodios, se ejecuta localmente. |
| Reproduciendo una ejecución grabada en 2025 | GR00T N1.5 | Solo si es estrictamente necesario: LeRobot ahora lo rechaza, pesos no comerciales. |
| Esto se enviará como producto | N1.7, SmolVLA or ACT | N1.5 no es comercial, Pi0.5 incluye términos de Gemma, la tarjeta de SmolVLA no especifica ninguno. |
Los cinco candidatos
Los cinco son políticas: fotogramas de cámara, posiciones de articulaciones y, para cuatro de ellas, una instrucción de lenguaje, mapeada a un segmento de futuros objetivos de articulación. Lo que las diferencia es cuánto fue aprendido antes de que llegaras.
| Política | Parámetros | Latencia | Nivel de GPU | ¿Local? | Episodios mínimos | Formato | Costo |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
El modelo actual de NVIDIA modelo de visión-lenguaje-acción, de aproximadamente 3 mil millones de parámetros, con unos 40 millones entrenados durante ajuste fino. El repositorio enumera las diferencias con N1.6: el backbone pasó de un modelo Eagle propietario a Cosmos-Reason2-2B en Qwen3-VL, las capas de difusión de 32 a 16, las dimensiones de estado y acción de 29 a 132, y el horizonte de acción de 16 a 40.
Lo que importa en un brazo pequeño es el espacio de acción relativo del efector final: N1.7 predice las diferencias desde la pose actual, lo que permite que 20 mil horas de video humano de EgoScale se transfieran a una política de robot. Las especificaciones están en la página de N1.7, el procedimiento en la guía de N1.7 en SO-100.
El README de Isaac-GR00T declara N1.7 como una versión de Disponibilidad General, con benchmarks y soporte completos. Su tarjeta de Hugging Face no se ha actualizado: el campo Model Version todavía muestra GR00T N1.7 EA. El repositorio es el documento más reciente.
GR00T N1.5
Misma escala de 3 B, backbone Eagle 2, SigLip2 y T5, cabezal DiT de flow-matching. Existe para extender un que ya tienes. Dos cosas lo convierten en una mala opción por defecto: los pesos conllevan la licencia no comercial unidireccional de NVIDIA, y las versiones actuales de LeRobot eliminaron el soporte para N1.5. Consulta .
Pi0.5
VLA de Physical Intelligence, , tipo de política undefined. El artículo presenta un VLM de 2 B inicializado a partir de PaliGemma más un experto en acciones de 300 M, que impulsa el robot a 50 Hz; la configuración pi05 de LeRobot por defecto utiliza un fragmento de 50 pasos, un segundo a esa velocidad. El punto fuerte son los lugares no vistos: aproximadamente 400 horas de manipulación móvil en hogares reales, y un estudio de escalado sobre 3, 12, 22, 53, 82 y 104 ubicaciones, donde el modelo de 104 ubicaciones igualó a un control entrenado en los propios hogares de prueba.
Un límite, indicado en la lerobot/pi05_base tarjeta: el puerto solo transporta el cabezal de acción de coincidencia de flujo. La predicción de subtareas, la tokenización de acciones y el RL no fueron lanzados upstream, y openpi dice lo mismo de su propio repositorio. La página de Pi0.5 y la guía de Pi0.5 en SO-100 tienen el resto.
Pi0.5 necesita el tokenizador restringido google/paligemma-3b-pt-224 (gated: manual, aunque Google dice que las solicitudes se procesan inmediatamente). Sin aceptarlo y ejecutar hf auth login en el entorno de entrenamiento, el trabajo comienza, descarga por un tiempo y luego falla con un error de autorización que parece un fallo de red. nvidia/GR00T-N1.7-3B no está restringido, pero su backbone nvidia/Cosmos-Reason2-2B sí lo está (gated: auto). Despeje ambos antes de poner en cola; si una ejecución permanece inactiva, la página de cola atascada enumera qué verificar.
SmolVLA
450 M parámetros, aproximadamente 100 M en el experto de acción, en SmolVLM-2 con el VLM congelado y solo sus primeras 16 capas del modelo de lenguaje utilizadas. El preentrenamiento se realizó con datos de la comunidad: 481 conjuntos de datos, 10.6 M fotogramas, de los mismos brazos económicos que usted utiliza. El único VLA aquí que cabe en una tarjeta de 24 GB, y el único con un mínimo de 30 episodios. Consulte la página de SmolVLA.
ACT
No es un modelo fundacional. El Action Chunking Transformer de ALOHA tiene aproximadamente 80 millones de parámetros entrenados desde cero por tarea, en 50 demostraciones a 50 Hz. El artículo informa sobre seis tareas bimanuales reales de aproximadamente diez minutos de demostraciones cada una, con un 80 a 90 por ciento en los ejemplos que destaca. Su idea, fragmentación de acciones, está en cada modelo de esta página, y su ablación aún mide el efecto mejor: en dos tareas simuladas con el ensamble temporal desactivado, el éxito aumenta del 1 por ciento en k=1 al 44 por ciento en k=100. La página de ACT tiene el resto.
Lo que realmente dicen los benchmarks
LIBERO es el único benchmark sobre el que informan tres de estos cinco: tareas condicionadas por lenguaje en un Franka Panda simulado, dividido en las cuatro suites siguientes con diez tareas cada una. NVIDIA ejecutó 200 pruebas por suite.
| Modelo | Espacial | Objeto | Objetivo | 10 (Largo) | Promedio |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Cada número proviene de un arnés y presupuesto diferentes. GR00T ejecutó 20K pasos con un lote global de 640; la cifra de openpi es un punto de control de 30K; el puerto de LeRobot añadió 6K pasos a un modelo base LIBERO. SmolVLA es una discrepancia adicional: su artículo entrena esa fila en LIBERO desde cero, sin preentrenamiento VLA, mientras que los tres anteriores ajustan puntos de control preentrenados. Trate 96.85 a 97.5 como un solo grupo, y la brecha a 87.3% como real pero obtenida con 6.7 veces los parámetros.
SimplerEnv muestra la dispersión, lo que LIBERO no hace. NVIDIA compara N1.7 con N1.6, lo más cercano públicamente a un delta generacional.
| Suite SimplerEnv | Promedio N1.6 | Promedio N1.7 | Mejor oscilación | Peor oscilación |
|---|---|---|---|---|
| Bridge (WidowX), 7 tareas | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tareas | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | ninguno, todas las tareas mejoraron |
La fila Bridge es la útil: 5.7 puntos ganados en promedio mientras put_eggplant_in_basket perdió 36 y put_eggplant_in_sink cayó de 33 a 2. Una nueva generación mueve la distribución en lugar de elevarla, así que si tu tarea se encuentra donde N1.7 retrocedió, el promedio no dice nada.

De los cinco, solo el artículo de SmolVLA informa sobre un brazo de clase SO-100: 78.3 por ciento para SmolVLA y 61.7 para Pi0 en tres tareas, ambas multitarea, frente a 48.3 para ACT entrenado en una sola tarea, lo cual no es comparable. El emparejamiento limpio es ambos en una sola tarea en SO-101 pick-and-place: 90 contra 70 en distribución, 50 contra 40 fuera de ella. Compara en ACT contra SmolVLA y Pi0.5 contra SmolVLA, o navega por la arena.
La latencia y el costo deciden la implementación
Latencia de inferencia es la restricción que la gente descubre al final y lamenta primero. Una política cinco puntos mejor en un benchmark pero medio segundo por paso de acción se ve peor en tu escritorio: la dinámica de contacto no espera.
Una advertencia: la cifra de GR00T no concuerda con la tarjeta de NVIDIA, que mide 4 pasos de denoising y una cámara a 85.8 ms en una H100 en modo eager, 48.6 ms con torch.compile, 27.9 ms a través de TensorRT completo. Los 152 ms aquí son una cifra de pila completa con sobrecarga de servicio y más de una cámara, no un pase hacia adelante.
El bucle de 20 a 485 ms es del modelo, y los viajes de ida y vuelta por internet público se suman a él. La inferencia remota es viable para tareas lentas de pick-and-place, no para movimientos reactivos rápidos. Si tu tarea necesita velocidad, la inferencia se sitúa junto a los servos: ACT o SmolVLA, localmente. Relacionado: la política se congela a mitad de movimiento.
Una forma de ganar tiempo sin cambiar el modelo: el artículo de SmolVLA mide la ejecución síncrona, donde la política termina un fragmento antes de predecir el siguiente, frente a la asíncrona, donde la predicción se superpone a la ejecución. El éxito es similar, 78.3 frente a 73.3, pero el mismo pick-and-place tarda 9.7 segundos en lugar de 13.75, y en una ventana fija el robot gestiona 19 ciclos en lugar de 9.
Licencias, revisadas porque nadie las revisa
| Modelo | Licencia de pesos | Licencia de código | Uso comercial |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; la tarjeta permite uso comercial | Apache 2.0 | sí |
| GR00T N1.5 | Licencia no comercial unidireccional de NVIDIA | Apache 2.0 | no |
| Pi0.5 | pi05_base card metadata reads license: gemma | Apache 2.0 (openpi, LeRobot docs) | leer ambos, no concuerdan |
| SmolVLA | no hay campo de licencia en la tarjeta smolvla_base | Apache 2.0 (LeRobot) | código sí, pesos no declarados |
| ACT | no existen pesos base | Apache 2.0 (LeRobot) | sí |
La fila de Pi0.5 requiere atención. La documentación de LeRobot pi05 establece Apache 2.0, consistente con openpi, mientras que la tarjeta del Hub para lerobot/pi05_base contiene license: gemma. Ambos están activos. GR00T N1.7 tiene una versión más suave: el README de Isaac-GR00T menciona de pasada que N1.7 es totalmente licenciable comercialmente bajo Apache 2.0, mientras que su propia sección de licencia y la tarjeta del modelo colocan solo el código bajo Apache 2.0 y los pesos bajo la NVIDIA Open Model License.
Los valores predeterminados que realmente ejecutará
Cada formulario de entrenador incluye un valor predeterminado, y no son arbitrarios. Los de ACT son propios de LeRobot: batch 8, lr 1e-5, 100000 pasos de entrenamiento, tamaño de chunk 100, coincidiendo con ACTConfig upstream y k=100 del paper de ACT. Una columna a continuación es una trampa.
| Política | Lote | LR | Pasos máximos | Acumulación de gradiente | ¿Aplica? | Controles adicionales |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | sí | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | sí | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | no (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | no | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | no | chunkSize, nActionSteps, seed, logFreq |
El punto de entrada de ajuste fino de GR00T (launch_finetune.py, una CLI de tyro) no tiene campo de semilla en su dataclass de configuración, por lo que las ejecuciones no son reproducibles bit a bit. El repositorio también advierte de una varianza del 5 al 6 por ciento entre ejecuciones debido a aumentos de imagen no deterministas, mayor que la mayoría de las diferencias de benchmark discutidas en línea. La semilla predeterminada de LeRobot es 1000. La columna de acumulación de gradiente describe lerobot 0.5.1; la versión upstream 0.6.2 lo expone como --accelerator.gradient_accumulation.steps.
El control que importa más que la elección del modelo
Es el fragmento de acción. Los fragmentos más largos proporcionan un movimiento más suave y menos errores acumulativos, pero la política se compromete mientras el bloque se ejecuta, por lo que reacciona tarde a cualquier cosa que se mueva: confiada en un cubo estático, inútil en uno rodante. Si se excede, acortar la porción ejecutada es mejor que reentrenar y es gratis. Una articulación que se detiene antes de tiempo es un problema diferente; consulte .
- ACT: ACTConfig por defecto usa
chunk_size 100yn_action_steps 100. El ensamblaje temporal está desactivado y requieren_action_steps 1. - GR00T N1.7: el horizonte interno pasó de 16 a 40, sin embargo, el ejemplo SO-101 de LeRobot todavía ejecuta
--policy.chunk_size=16 --policy.n_action_steps=16. El flag de rollout fue renombrado a--execution-horizon. - Pi0.5: un fragmento de 50 pasos, de los cuales la receta LIBERO de LeRobot ejecuta 10 a través de
--policy.n_action_steps=10; con--policy.pretrained_pathvuelve a 50 si omite el flag. - SmolVLA: fragmentos de 50 acciones, ambos parámetros expuestos.
¿Cómo evaluar los cinco en una tarde?
La respuesta más barata no es leer más. Gaste alrededor de 15 USD y deje que el brazo le diga: grabe una vez, entrene el modelo barato primero, escale una vez que haya demostrado que los datos son sólidos. La estructura supera el volumen, el objetivo de y el .
- 1Grabe 50 episodios una vez
Cincuenta despeja el camino para GR00T, Pi0.5 y ACT, y 30 para SmolVLA. Repita cada variación en lugar de dispersarse: 50 episodios en 5 posiciones de cubo entrenadas donde 25 no lo hicieron. Consulte cómo grabar su primer conjunto de datos.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Entrene ACT primero, porque no puede mentirle
Sin pesos preentrenados, así que si realiza la tarea, su conjunto de datos contiene la tarea. Si ACT se estanca, corrija los datos. De 1 a 3 USD, de 2 a 5 horas en una tarjeta de 24 GB.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Ejecute SmolVLA en el mismo conjunto de datos, sin cambios
Mismos datos, mismo brazo, 450 M de parámetros en lugar de 80 M, más condicionamiento de lenguaje. LeRobot estima una ejecución de 20K pasos en aproximadamente 4 horas en una A100. Esto es lo que le indica si el preentrenamiento aporta algún beneficio.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Convierta a v2.1 antes de usar GR00T
GR00T lee una variante del formato LeRobot v2 más un archivo
meta/modality.jsonadicional que mapea cómo los arrays concatenados de estado y acción se dividen en campos nombrados. Un conjunto de datos v3.0 bloquea ese cargador, porque v3.0 empaqueta muchos episodios en archivos compartidos donde v2 escribía uno por episodio. Isaac-GR00T incluye la herramienta de degradación comoscripts/lerobot_conversion/convert_v3_to_v2.py; la página de rechazo de v3 es la vía rápida.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Escale a GR00T N1.7 solo si los dos primeros dejaron algo pendiente
A través de la CLI de NVIDIA, que se muestra aquí, o el tipo de política
grootde LeRobot. NVIDIA recomienda 40 GB o más de VRAM para el ajuste fino, 16 GB para la inferencia. En caso de OOM, consulte la página de OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Dos formas de ejecutar esa pasada de cribado
Tres entornos, porque las cadenas de herramientas no coexisten. LeRobot en main es 0.6.2 y necesita Python 3.12 o posterior; Isaac-GR00T y openpi son repositorios separados gestionados por uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T fija
torchcodec0.8.0 como su único backend de video, requiriendo FFmpeg 4 a 7. FFmpeg 8 no es compatible, AV1 no está garantizado. - Requisitos mínimos de memoria de openpi: inferencia por encima de 8 GB, LoRA por encima de 22.5 GB, ajuste fino completo por encima de 70 GB. Este último es el motivo por el que Pi0.5 es un trabajo para A100.
- Alquile la GPU usted mismo, destrúyala después, concilie tres conjuntos de rutas de puntos de control manualmente.
Los mismos cinco modelos, un solo formulario. Elija el modelo, el conjunto de datos y los hiperparámetros; el backend alquila una GPU dimensionada por la VRAM requerida, ejecuta el entrenador y escribe puntos de control en el almacenamiento de objetos.
- La matriz de entrenamiento es de cinco modelos por cuatro brazos, cada celda una guía: SmolVLA en SO-100, ACT en SO-101.
- Los pods de inferencia se aprovisionan automáticamente mediante
/api/inference/podcon un watchdog de inactividad, para que un pod olvidado no genere cargos silenciosamente. - Los puntos de control base son los propios de los proveedores:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT no tiene ninguno. - Las mismas operaciones desde la CLI y desde agentes de IA a través de el servidor MCP.
- ¿No tiene hardware? El brazo en vivo transmite un SO-100 físico sin necesidad de registrarse; la página de prueba muestra las formas de acceder.
Modelo fundacional o desde cero
La verdadera disyuntiva no es qué modelo 3 B elegir. Es si usar un VLA preentrenado en absoluto, dado que ACT aprendió seis tareas bimanuales reales de aproximadamente diez minutos de demostraciones cada una, con 80 M de parámetros y nada preentrenado.
- Condicionamiento del lenguaje. ACT no tiene ninguno; un punto de control de ACT realiza una tarea.
- Mejor en objetos ausentes de tus demostraciones: en SO-101, 50% frente al 40% de ACT fuera de distribución.
- Multitarea en absoluto: SmolVLA alcanza el 78.3% en tres tareas SO-100 con un punto de control; ACT solo se ejecutó en una sola tarea.
- De 7.6x a 24x la latencia: de 152 a 485 ms por paso de acción frente a los 20 ms de ACT.
- De 4 a 12 USD por ejecución en lugar de 1 a 3, y un nivel A100 en lugar de cualquier tarjeta de 24 GB.
- Exposición a licencias, además de un modo de fallo de repositorio restringido que no existe desde cero.
- Los pesos preentrenados pueden enmascarar un conjunto de datos deficiente. Un ajuste fino que funciona a medias con datos defectuosos cuesta una semana antes de que revises los datos.
El caso de la reproducción de una ejecución antigua
Perseguir un punto de control de 2025 decide la elección del modelo por ti y convierte el problema en la fijación de versiones: LeRobot actual rechaza N1.5, así que fijas lerobot==0.5.1. Sin campo de semilla y con una varianza del 5 al 6 por ciento entre ejecuciones, la reproducción es aproximada por construcción. y tienen el lado de la plataforma.

Quedan dos? y . Las filas de datos brutos se encuentran en las entradas de la arena: , , y .
Dónde esta plataforma no te ayuda
- No puede acelerar la inferencia remota. El bucle de 20 a 485 ms pertenece al modelo; los viajes de ida y vuelta por internet se suman a ello.
- No puede ajustar GR00T o Pi0.5 en tu propio hardware. Ambos son solo en la nube aquí; solo SmolVLA y ACT se ejecutan localmente.
- No puede arreglar un conjunto de datos. La pérdida disminuye pero la política no hace nada es un problema de datos, una política que solo funciona en una configuración es un problema de cobertura.
- No puede hacer que las ejecuciones de GR00T sean reproducibles: la configuración ascendente no tiene un campo de semilla.
85 modelos, 332 resultados de benchmarks, cada número vinculado a su fuente
La versión ordenable de las tablas en esta página: 85 modelos de visión-lenguaje-acción, 332 resultados de benchmarks, cada uno vinculado a su artículo o tarjeta de modelo.
Abrir la arenaElegir uno y seguir adelante
Una configuración predeterminada: grabe 50 episodios, entrene ACT por 1 a 3 USD para probar el conjunto de datos, luego SmolVLA con los mismos datos. Por menos de 6 USD en total, y responden la pregunta importante: si el preentrenamiento ayuda aquí, o si el cuello de botella son los datos. Escalar a GR00T N1.7 para tareas de varios pasos con contacto, a Pi0.5 cuando la escena cambia.
Recorrido por la plataforma: entrene su primera política, luego ejecute su primera política. La documentación de entrenamiento y la documentación de conjuntos de datos cubren la forma y el formato; la página del SO-100 y la guía completa del SO-100 cubren la construcción y la calibración. Antecedentes: la visión general de VLA y el artículo de Pi0 sobre flow-matching. El que aumentará su tasa de éxito es la guía de calidad de datos.
¿Qué política VLA debería entrenar primero en un SO-100?▾
ACT, luego SmolVLA. ACT entrena desde cero, por lo que no puede enmascarar un conjunto de datos deficiente, y una ejecución cuesta de 1 a 3 USD en una tarjeta de 24 GB. Si ACT realiza la tarea, los 4 a 12 USD de una ejecución de GR00T N1.7 o Pi0.5 no se desperdician.
¿Es GR00T N1.7 realmente mejor que Pi0.5?▾
En LIBERO están dentro del ruido: 97.0% en cuatro suites para GR00T N1.7, 96.85% para Pi0.5 en 30k pasos en openpi, 97.5% para el puerto de LeRobot, todos de diferentes arneses. Las diferencias reales son 152 ms por paso de acción frente a 485 ms, conjuntos de datos v2.1 frente a v3.0, y precisión de benchmark frente a generalización en el mundo real.
¿Puedo ajustar cualquiera de estos en una sola RTX 4090?▾
SmolVLA y ACT, sí; ambos están listados para una RTX 4090 o cualquier tarjeta de 24 GB y se ejecutan localmente. GR00T N1.7, N1.5 y Pi0.5 necesitan una A100 o H100 de 80 GB y aquí son solo en la nube. NVIDIA recomienda 40 GB o más para el ajuste fino de GR00T; el mínimo de openpi está por encima de 70 GB para un ajuste fino completo de Pi0.5, 22.5 GB para LoRA.
¿Cuál de estos cinco puedo usar comercialmente?▾
Los pesos de GR00T N1.7 están bajo el Acuerdo de Licencia de Modelo Abierto de NVIDIA, que la tarjeta indica que cubre el uso comercial. Los pesos de N1.5 no son comerciales. El código de SmolVLA es Apache 2.0 en LeRobot, pero la tarjeta lerobot/smolvla_base no tiene un campo de licencia, por lo que los pesos no están declarados. ACT no tiene pesos base para licenciar. Pi0.5 es ambiguo: la documentación de LeRobot dice Apache 2.0, sus metadatos de tarjeta leen license: gemma.
Sources
- Repositorio NVIDIA Isaac-GR00T: estado GA, cambios de N1.6 a N1.7, requisitos de hardware, restricciones de torchcodec y FFmpeg, launch_finetune.py, varianza entre ejecuciones
- Tarjeta de modelo nvidia/GR00T-N1.7-3B: backbone Cosmos-Reason2-2B, 3 B parámetros, tabla de tiempos de inferencia, Licencia de Modelo Abierto de NVIDIA, campo Versión del Modelo
- Tarjeta de modelo nvidia/GR00T-N1.5-3B: referencia Eagle 2, SigLip2 y T5, DiT de coincidencia de flujo, licencia unidireccional no comercial
- Ejemplo de Isaac-GR00T LIBERO: tasas de éxito por suite en 20K pasos y tamaño de lote 640, 200 pruebas por suite
- Ejemplo de Isaac-GR00T SimplerEnv: tasas de éxito por tarea Bridge y Fractal, GR00T N1.6 frente a N1.7
- pi0.5: un modelo de visión-lenguaje-acción con generalización en el mundo real (2 B VLM más 300 M experto en acción, control de 50 Hz, aproximadamente 400 horas de manipulación móvil, estudio de escalado en 3 a 104 ubicaciones)
- Repositorio openpi: mínimos de memoria GPU, alcance de solo cabezal de coincidencia de flujo, y los resultados de Pi0.5 LIBERO en examples/libero
- Tarjeta de modelo lerobot/pi05_base: alcance del puerto LeRobot, metadatos license: gemma, uso de lerobot-train
- Documentación de LeRobot pi0.5: tokenizador PaliGemma con acceso restringido, tabla de reproducción LIBERO, trampa de fallback n_action_steps, declaración Apache 2.0
- SmolVLA: un modelo de visión-lenguaje-acción para robótica asequible y eficiente (450 M parámetros, tablas LIBERO y Meta-World, resultados SO-100 y SO-101, inferencia asíncrona)
- Documentación de LeRobot SmolVLA: 50 episodios en 5 posiciones frente a 25, 20k pasos en aproximadamente 4 horas en una A100
- Aprendizaje de manipulación bimanual de grano fino con hardware de bajo costo (ACT y ALOHA): 6 tareas con un 80-90 por ciento, ablación del tamaño de chunk de k=1 a k=100
- LeRobot 0.6.2: valores predeterminados de ACTConfig y SmolVLAConfig, semilla predeterminada 1000, --accelerator.gradient_accumulation.steps, requisito de Python 3.12, Apache 2.0
- Documentación de LeRobot GR00T: tipo de política groot, soporte N1.5 eliminado, pin lerobot==0.5.1, ejemplo de tamaño de chunk SO-101
- Tarjeta de modelo lerobot/smolvla_base: el checkpoint base de SmolVLA utilizado por --policy.path, y sus metadatos de tarjeta, que no tienen campo de licencia
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started