
GR00T N1.7, Pi0.5, SmolVLA, ACT ou GR00T N1.5 ? Un tableau de décision adapté aux situations réelles, avec les chiffres de benchmark publiés, la latence, le coût par exécution et les licences derrière chaque choix.
Cinq politiques sont entraînables sur un bras de classe SO-100 aujourd'hui. Elles diffèrent par un facteur de 24 en latence d'inférence, 37 en nombre de paramètres et 12 en coût d'exécution, et selon que vous pouvez ou non livrer le résultat. Cinq fiches de modèle ne suffiront pas : aucune ne répond à la question que vous vous posez, laquelle dois-je exécuter en premier ?
Chaque chiffre ci-dessous a été extrait des articles, dépôts et fiches en août 2026. Les chiffres de la plateforme proviennent du catalogue de politiques AY-Robots; lorsque les deux sont en désaccord, les deux sont affichés.
La version courte
- •Entraînez ACT en premier si vous doutez de votre jeu de données : 1 à 3 USD par exécution, rien de pré-entraîné pour masquer les mauvaises données.
- •GR00T N1.7 et Pi0.5 se situent à moins d'un demi-point sur LIBERO, 97.0 contre 96.85 à 97.5. Ce n'est pas une raison pour choisir l'un ou l'autre.
- •Pi0.5 est la solution pour la généralisation, pas pour la précision, et le plus lent à 485 ms.
- •SmolVLA, avec 450 M de paramètres, est le seul VLA ici qui s'affine sur une seule carte de 24 Go.
- •ACT à 20 ms est la seule option pour un mouvement réactif rapide. Les licences décident du reste.
Le tableau de décision
| Votre situation | Entraîner ceci | Pourquoi |
|---|---|---|
| Qualité du jeu de données non prouvée | ACT | Aucun pré-entraînement ne masque un jeu de données défectueux, et l'échec coûte 1 à 3 USD. |
| Riche en contacts, multi-étapes, conditionné par le langage | GR00T N1.7 | 97,0 % sur quatre suites LIBERO, plus un espace d'action relatif de l'effecteur final. |
| Mouvement réactif rapide, inférence au niveau des servomoteurs | ACT | 20 ms. Le suivant le plus rapide est 7,6 fois plus lent. |
| Nouveaux objets, nouvelle scène, monde ouvert | Pi0.5 | Conçu pour un comportement hors distribution, sur jusqu'à 104 emplacements. |
| Une carte de 24 Go, toujours besoin de langage | SmolVLA | 450 M de paramètres, un minimum de 30 épisodes, fonctionne localement. |
| Reproduire une exécution enregistrée en 2025 | GR00T N1.5 | Seulement si vous y tenez : LeRobot le rejette désormais, poids non commerciaux. |
| Ceci sera livré comme un produit | N1.7, SmolVLA ou ACT | N1.5 est non commercial, Pi0.5 est soumis aux conditions de Gemma, la carte de SmolVLA n'en mentionne aucune. |
Les cinq candidats
Les cinq sont des : des images de caméra, des positions d'articulations et, pour quatre d'entre elles, une instruction linguistique, mappée à un ensemble de cibles d'articulations futures. Ce qui les distingue, c'est la quantité de connaissances acquises avant votre arrivée.
| Politique | Paramètres | Latence | Niveau GPU | Local ? | Épisodes min. | Format | Coût |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
Le modèle actuel de NVIDIA, modèle vision-langage-action, d'environ 3 milliards de paramètres, dont environ 40 millions ont été entraînés pendant le fine-tuning. Le dépôt liste les deltas par rapport à N1.6 : le backbone est passé d'un modèle Eagle fourni à Cosmos-Reason2-2B sur Qwen3-VL, les couches de diffusion de 32 à 16, les dimensions d'état et d'action de 29 à 132, et l'horizon d'action de 16 à 40.
Ce qui importe sur un petit bras est l'espace d'action relatif de l'effecteur final : N1.7 prédit les deltas à partir de la pose actuelle, ce qui permet à 20K heures de vidéo humaine EgoScale d'être transférées dans une politique de robot. Les spécifications sont sur la page N1.7, la procédure dans le guide N1.7 sur SO-100.
Le README d'Isaac-GR00T déclare N1.7 comme une version Disponibilité Générale, avec des benchmarks et un support complets. Sa carte Hugging Face n'a pas été mise à jour : le champ Model Version indique toujours GR00T N1.7 EA. Le dépôt est le document le plus récent.
GR00T N1.5
Même échelle 3 B, architecture Eagle 2, SigLip2 et T5, tête DiT de flow-matching. Il existe pour étendre un que vous possédez déjà. Deux choses en font un mauvais choix par défaut : les poids sont soumis à la licence non commerciale à sens unique de NVIDIA, et les versions actuelles de LeRobot ont supprimé le support de N1.5. Voir .
Pi0.5
Le VLA de Physical Intelligence utilisant le VLA, de type de politique pi05. L'article décrit un VLM de 2 B initialisé à partir de PaliGemma, plus un expert d'action de 300 M, pilotant le robot à 50 Hz ; la configuration pi05 de LeRobot utilise par défaut un segment de 50 étapes, soit une seconde à ce rythme. L'argument de vente est la capacité à opérer dans des lieux inconnus : environ 400 heures de manipulation mobile dans de vraies maisons, et une étude de mise à l'échelle sur 3, 12, 22, 53, 82 et 104 emplacements, où le modèle à 104 emplacements a égalé un contrôle entraîné sur les maisons de test elles-mêmes.
Une limite, indiquée sur la lerobot/pi05_base carte : le port ne transporte que la tête d'action de correspondance de flux. La prédiction de sous-tâches, la tokenisation d'actions et le RL n'ont pas été publiés en amont, et openpi dit la même chose de son propre dépôt. La page Pi0.5 et le guide Pi0.5 sur SO-100 contiennent le reste.
Pi0.5 nécessite le tokenizer google/paligemma-3b-pt-224 à accès restreint (gated: manual, bien que Google affirme que les requêtes sont traitées immédiatement). Sans l'accepter et exécuter hf auth login dans l'environnement d'entraînement, la tâche démarre, télécharge pendant un certain temps, puis échoue sur une erreur d'autorisation qui ressemble à une panne réseau. nvidia/GR00T-N1.7-3B n'est pas à accès restreint, mais son backbone nvidia/Cosmos-Reason2-2B l'est (gated: auto). Videz les deux avant de les mettre en file d'attente ; si une exécution reste inactive, la page des tâches bloquées en file d'attente liste ce qu'il faut vérifier.
SmolVLA
450 M paramètres, dont environ 100 M dans l'expert d'action, sur SmolVLM-2 avec le VLM gelé et seulement ses 16 premières couches de modèle linguistique utilisées. Le pré-entraînement a été effectué sur des données communautaires : 481 jeux de données, 10,6 M de cadres, provenant des mêmes bras bon marché que vous utilisez. Le seul VLA ici qui tient sur une carte de 24 Go, et le seul avec un plancher de 30 épisodes. Voir la page SmolVLA.
ACT
Pas un modèle de fondation. L'Action Chunking Transformer d'ALOHA est d'environ 80 M de paramètres entraînés à partir de zéro par tâche, sur 50 démonstrations à 50 Hz. L'article rapporte six tâches bimanuelle réelles à partir d'environ dix minutes de démonstrations chacune, avec 80 à 90 pour cent sur les exemples qu'il met en évidence. Son idée, découpage d'actions, est présente dans chaque modèle de cette page, et son ablation mesure toujours le meilleur effet : sur deux tâches simulées avec l'ensemblage temporel désactivé, le succès passe de 1 pour cent à k=1 à 44 pour cent à k=100. La page ACT contient le reste.
Ce que disent réellement les benchmarks
LIBERO est le seul benchmark sur lequel trois de ces cinq modèles rapportent : des tâches conditionnées par le langage sur un Franka Panda simulé, divisées en les quatre suites ci-dessous, avec dix tâches chacune. NVIDIA a effectué 200 essais par suite.
| Modèle | Spatial | Objet | Objectif | 10 (Long) | Moyenne |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
Chaque chiffre provient d'un banc d'essai et d'un budget différents. GR00T a effectué 20K étapes avec un lot global de 640; le chiffre openpi est un point de contrôle de 30K; le port LeRobot a ajouté 6K étapes à un modèle de base LIBERO. SmolVLA présente un autre décalage: son article entraîne cette ligne sur LIBERO à partir de zéro, sans pré-entraînement VLA, tandis que les trois au-dessus affinent des points de contrôle pré-entraînés. Considérez 96.85 à 97.5 comme un seul groupe, et l'écart à 87.3% comme réel mais obtenu avec 6.7x les paramètres.
SimplerEnv montre la dispersion, ce que LIBERO ne fait pas. NVIDIA compare N1.7 à N1.6, ce qui est le plus proche publiquement d'un delta générationnel.
| Suite SimplerEnv | Moyenne N1.6 | Moyenne N1.7 | Meilleure variation | Pire variation |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
La ligne Bridge est la plus utile : 5,7 points gagnés en moyenne tandis que put_eggplant_in_basket a perdu 36 et put_eggplant_in_sink est tombé de 33 à 2. Une nouvelle génération déplace la distribution plutôt que de la soulever, donc si votre tâche se situe là où N1.7 a régressé, la moyenne ne dit rien.

Parmi les cinq, seul l'article SmolVLA rapporte un bras de classe SO-100 : 78,3 pour cent pour SmolVLA et 61,7 pour Pi0 sur trois tâches, toutes deux multi-tâches, contre 48,3 pour ACT entraîné en tâche unique, ce qui n'est pas comparable. Le jumelage propre est en tâche unique sur SO-101 pick-and-place : 90 contre 70 en distribution, 50 contre 40 hors de celle-ci. Comparez sur ACT contre SmolVLA et Pi0.5 contre SmolVLA, ou parcourez l'arène.
La latence et le coût décident du déploiement
Latence d'inférence est la contrainte que l'on découvre en dernier et que l'on regrette en premier. Une politique cinq points meilleure sur un benchmark mais qui prend une demi-seconde par étape d'action semble pire sur votre bureau : la dynamique de contact n'attend pas.
Une mise en garde : le chiffre de GR00T est en désaccord avec la carte de NVIDIA, qui chronomètre 4 étapes de débruitage et une caméra à 85,8 ms sur un H100 en mode eager, 48,6 ms avec torch.compile, 27,9 ms via TensorRT complet. Les 152 ms ici sont un chiffre de pile complète avec la surcharge de service et plus d'une caméra, pas un passage avant.
La boucle de 20 à 485 ms est celle du modèle, et les allers-retours sur l'internet public s'y ajoutent. L'inférence à distance est viable pour les tâches lentes de pick-and-place, pas pour les mouvements réactifs rapides. Si votre tâche nécessite de la vitesse, l'inférence se trouve à côté des servomoteurs : ACT ou SmolVLA, localement. Lié : la politique se fige en plein mouvement.
Une façon de gagner du temps sans changer de modèle : l'article SmolVLA mesure l'exécution synchrone, où la politique termine un bloc avant de prédire le suivant, par rapport à l'asynchrone, où la prédiction chevauche l'exécution. Le succès est similaire, 78.3 contre 73.3, mais le même pick-and-place prend 9.7 secondes au lieu de 13.75, et dans une fenêtre fixe, le robot gère 19 cycles au lieu de 9.
Licences, vérifiées parce que personne ne les vérifie
| Modèle | Licence des poids | Licence du code | Utilisation commerciale |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; la carte autorise l'utilisation commerciale | Apache 2.0 | oui |
| GR00T N1.5 | Licence non commerciale unidirectionnelle NVIDIA | Apache 2.0 | non |
| Pi0.5 | les métadonnées de la carte pi05_base indiquent la licence : gemma | Apache 2.0 (openpi, LeRobot docs) | lire les deux, ils sont en désaccord |
| SmolVLA | aucun champ de licence sur la carte smolvla_base | Apache 2.0 (LeRobot) | code oui, poids non spécifiés |
| ACT | aucun poids de base n'existe | Apache 2.0 (LeRobot) | oui |
La ligne Pi0.5 nécessite une attention particulière. La documentation LeRobot pi05 indique Apache 2.0, ce qui est cohérent avec openpi, tandis que la carte du Hub pour lerobot/pi05_base contient license: gemma. Les deux sont actifs. GR00T N1.7 a une version plus souple : le README d'Isaac-GR00T indique en passant que N1.7 est entièrement commercialisable sous licence Apache 2.0, tandis que sa propre section de licence et la carte du modèle ne placent que le code sous Apache 2.0 et les poids sous la NVIDIA Open Model License.
Les valeurs par défaut que vous exécuterez réellement
Chaque formulaire d'entraînement est livré avec une valeur par défaut, et celles-ci ne sont pas arbitraires. Celles d'ACT sont propres à LeRobot : batch 8, lr 1e-5, 100000 étapes d'entraînement, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. Une colonne ci-dessous est un piège.
| Politique | Batch | LR | Étapes max | Accumulation de gradient | S'applique ? | Paramètres supplémentaires |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | oui | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | oui | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | non (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | non | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | non | chunkSize, nActionSteps, seed, logFreq |
Le point d'entrée de fine-tuning de GR00T (launch_finetune.py, une CLI tyro) n'a pas de champ seed dans sa dataclass de configuration, donc les exécutions ne sont pas reproductibles bit par bit. Le dépôt avertit également d'une variance de 5 à 6 pour cent entre les exécutions due à des augmentations d'images non déterministes, plus importante que la plupart des écarts de benchmark débattus en ligne. Le seed par défaut de LeRobot est 1000. La colonne d'accumulation de gradient décrit lerobot 0.5.1; la version amont 0.6.2 l'expose comme --accelerator.gradient_accumulation.steps.
Le paramètre qui compte plus que le choix du modèle
C'est le bloc d'action. Des blocs plus longs donnent un mouvement plus fluide et moins d'erreurs cumulatives, mais la politique est engagée pendant l'exécution du bloc, elle réagit donc tardivement à tout ce qui bouge : confiante sur un cube statique, désespérée sur un cube roulant. Si elle dépasse, raccourcir la portion exécutée est préférable au réentraînement et est gratuit. Une articulation qui s'arrête trop tôt est un problème différent ; voir .
- ACT: ACTConfig utilise par défaut
chunk_size 100etn_action_steps 100. L'ensemble temporel est désactivé et nécessiten_action_steps 1. - GR00T N1.7: l'horizon interne est passé de 16 à 40, pourtant l'exemple SO-101 de LeRobot exécute toujours
--policy.chunk_size=16 --policy.n_action_steps=16. Le flag de déploiement a été renommé en--execution-horizon. - Pi0.5: un bloc de 50 étapes, dont la recette LIBERO de LeRobot exécute 10 via
--policy.n_action_steps=10; avec--policy.pretrained_pathil revient à 50 si vous omettez le flag. - SmolVLA: blocs de 50 actions, les deux paramètres sont exposés.
Comment passer les cinq au crible en un après-midi
La réponse la moins chère n'est pas de lire davantage. Dépensez environ 15 USD et laissez le bras vous dire : enregistrez une fois, entraînez d'abord le modèle bon marché, puis intensifiez une fois qu'il a prouvé la validité des données. La structure l'emporte sur le volume, c'est le but de et du .
- 1Enregistrer 50 épisodes une seule fois
Cinquante épisodes ouvrent la voie à GR00T, Pi0.5 et ACT, et aux 30 de SmolVLA. Répétez chaque variation plutôt que de vous disperser : 50 épisodes sur 5 positions de cube entraînés là où 25 ne l'ont pas été. Voir enregistrer votre premier jeu de données.
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2Entraînez ACT en premier, car il ne peut pas vous mentir
Pas de poids pré-entraînés, donc si la tâche est effectuée, votre jeu de données contient la tâche. Si ACT ne progresse pas, corrigez les données. 1 à 3 USD, 2 à 5 heures sur une carte de 24 Go.
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3Exécutez SmolVLA sur le même jeu de données, inchangé
Mêmes données, même bras, 450 M de paramètres au lieu de 80 M, plus le conditionnement linguistique. LeRobot estime une exécution de 20K étapes à environ 4 heures sur une A100. C'est ce qui vous indique si le pré-entraînement apporte un avantage.
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4Convertissez vers la v2.1 avant d'utiliser GR00T
GR00T lit une variante du format LeRobot v2 avec un fichier supplémentaire
meta/modality.jsonqui mappe la façon dont les tableaux d'état et d'action concaténés se divisent en champs nommés. Un jeu de données v3.0 fait planter ce chargeur, car v3.0 regroupe de nombreux épisodes dans des fichiers partagés là où v2 écrivait un fichier par épisode. Isaac-GR00T fournit l'outil de rétrogradation sous la forme descripts/lerobot_conversion/convert_v3_to_v2.py; la page de rejet v3 est le chemin rapide.text# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5Passez à GR00T N1.7 uniquement si les deux premiers n'ont pas donné de résultats satisfaisants
Via l'interface CLI de NVIDIA, présentée ici, ou le type de politique
grootde LeRobot. NVIDIA recommande 40 Go ou plus de VRAM pour le fine-tuning, 16 Go pour l'inférence. En cas d'OOM, consultez la page OOM.bashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
Deux façons d'exécuter ce passage de sélection
Trois environnements, car les chaînes d'outils ne coexistent pas. LeRobot sur main est en version 0.6.2 et nécessite Python 3.12 ou plus récent ; Isaac-GR00T et openpi sont des dépôts séparés gérés par uv.
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T épingle
torchcodec0.8.0 comme seul backend vidéo, nécessitant FFmpeg 4 à 7. FFmpeg 8 n'est pas pris en charge, AV1 non garanti. - Exigences mémoire d'openpi : inférence au-dessus de 8 Go, LoRA au-dessus de 22.5 Go, fine-tuning complet au-dessus de 70 Go. Cette dernière est la raison pour laquelle Pi0.5 est une tâche pour A100.
- Louez le GPU vous-même, détruisez-le après, réconciliez trois ensembles de chemins de checkpoints à la main.
Mêmes cinq modèles, un seul formulaire. Choisissez le modèle, le jeu de données et les hyperparamètres ; le backend loue un GPU dimensionné par la VRAM requise, exécute l'entraîneur et écrit les points de contrôle vers le stockage d'objets.
- La matrice d'entraînement est de cinq modèles par quatre bras, chaque cellule est un guide : SmolVLA sur SO-100, ACT sur SO-101.
- Les pods d'inférence sont auto-provisionnés par
/api/inference/podavec un watchdog d'inactivité, de sorte qu'un pod oublié ne facture pas silencieusement. - Les points de contrôle de base sont ceux des fournisseurs :
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_base. ACT n'en a pas. - Mêmes opérations depuis l'interface CLI et depuis les agents IA via le serveur MCP.
- Pas de matériel ? Le bras en direct diffuse un SO-100 physique sans inscription ; la page d'essai montre les différentes façons d'accéder.
Modèle de fondation ou à partir de zéro
Le vrai dilemme n'est pas de choisir quel modèle 3B. Il s'agit de savoir s'il faut utiliser un VLA pré-entraîné, étant donné qu'ACT a appris six tâches bimanuales réelles à partir d'environ dix minutes de démonstrations chacune, avec 80 M de paramètres et rien de pré-entraîné.
- Conditionnement linguistique. ACT n'en a pas ; un checkpoint ACT effectue une seule tâche.
- Meilleur sur les objets absents de vos démonstrations : sur SO-101, 50% contre 40% pour ACT hors distribution.
- Multi-tâches : SmolVLA atteint 78,3% sur trois tâches SO-100 avec un seul checkpoint ; ACT n'a été exécuté qu'en tâche unique.
- 7,6x à 24x la latence : 152 à 485 ms par étape d'action contre 20 ms pour ACT.
- 4 à 12 USD par exécution au lieu de 1 à 3, et un niveau A100 au lieu de n'importe quelle carte de 24 Go.
- Exposition aux licences, plus un mode de défaillance de dépôt restreint qui n'existe pas à partir de zéro.
- Les poids pré-entraînés peuvent masquer un mauvais jeu de données. Un affinage qui fonctionne à moitié sur des données corrompues coûte une semaine avant d'examiner les données.
Le cas de la reproduction d'une ancienne exécution
Poursuivre un checkpoint de 2025 fait le choix du modèle pour vous et transforme le problème en épinglage de version : LeRobot actuel rejette N1.5, vous épinglez donc lerobot==0.5.1. Sans champ de graine et avec 5 à 6 pour cent de variance entre les exécutions, la reproduction est approximative par construction. et gèrent le côté plateforme.

Réduit à deux ? ACT contre GR00T N1.7 et GR00T N1.7 contre SmolVLA. Les entrées brutes se trouvent dans les arènes : GR00T N1.7, Pi0.5, SmolVLA et ACT.
Où cette plateforme ne vous aide pas
- Elle ne peut pas accélérer l'inférence à distance. La boucle de 20 à 485 ms appartient au modèle ; les allers-retours internet s'y ajoutent.
- Elle ne peut pas affiner GR00T ou Pi0.5 sur votre propre matériel. Les deux sont uniquement disponibles dans le cloud ici ; seuls SmolVLA et ACT s'exécutent localement.
- Elle ne peut pas corriger un jeu de données. La perte diminue mais la politique ne fait rien est un problème de données, une politique qui ne fonctionne que dans une seule configuration est un problème de couverture.
- Elle ne peut pas rendre les exécutions de GR00T reproductibles : la configuration en amont n'a pas de champ de graine.
85 modèles, 332 résultats de benchmark, chaque chiffre lié à sa source
La version triable des tableaux de cette page : 85 modèles vision-langage-action, 332 résultats de benchmark, chacun lié à son article ou à sa fiche modèle.
Ouvrir l'arèneEn choisir un et passer à l'étape suivante
Un défaut : enregistrer 50 épisodes, entraîner ACT pour 1 à 3 USD afin de prouver le jeu de données, puis SmolVLA sur les mêmes données. Moins de 6 USD au total, et ils répondent à la question qui compte : si le pré-entraînement aide ici, ou si le goulot d'étranglement est les données. Passer à GR00T N1.7 pour les tâches multi-étapes riches en contact, à Pi0.5 lorsque la scène change.
Présentation de la plateforme : entraîner votre première politique, puis exécuter votre première politique. Les documents de formation et les documents sur les jeux de données couvrent la forme et le format ; la page du SO-100 et le guide complet du SO-100 couvrent la construction et la calibration. Contexte : l'aperçu VLA et l'article sur le flow-matching Pi0. Celui qui fera progresser votre taux de réussite est le guide de qualité des données.
Quelle politique VLA devrais-je entraîner en premier sur un SO-100 ?▾
ACT, puis SmolVLA. ACT s'entraîne à partir de zéro, il ne peut donc pas masquer un mauvais jeu de données, et une exécution coûte 1 à 3 USD sur une carte de 24 GB. Si ACT parvient à effectuer la tâche, les 4 à 12 USD pour une exécution de GR00T N1.7 ou Pi0.5 ne sont pas gaspillés.
GR00T N1.7 est-il réellement meilleur que Pi0.5 ?▾
Sur LIBERO, ils sont dans la marge de bruit : 97.0% sur quatre suites pour GR00T N1.7, 96.85% pour Pi0.5 à 30k étapes dans openpi, 97.5% pour le port LeRobot, tous provenant de différents bancs d'essai. Les vraies différences sont 152 ms par étape d'action contre 485 ms, les jeux de données v2.1 contre v3.0, et la précision des benchmarks contre la généralisation en monde ouvert.
Puis-je affiner l'un de ces modèles sur une seule RTX 4090 ?▾
SmolVLA et ACT, oui ; les deux sont listés pour une RTX 4090 ou toute carte de 24 GB et s'exécutent localement. GR00T N1.7, N1.5 et Pi0.5 nécessitent une A100 ou H100 80 GB et sont uniquement disponibles dans le cloud ici. NVIDIA recommande 40 GB ou plus pour l'affinage de GR00T ; le seuil d'openpi est supérieur à 70 GB pour un affinage complet de Pi0.5, 22.5 GB pour LoRA.
Lequel de ces cinq puis-je utiliser commercialement ?▾
Les poids de GR00T N1.7 sont sous l'accord de licence NVIDIA Open Model License Agreement, qui, selon la carte, couvre l'utilisation commerciale. Les poids de N1.5 sont non-commerciaux. Le code de SmolVLA est Apache 2.0 dans LeRobot, mais la carte lerobot/smolvla_base ne contient pas de champ de licence, donc les poids ne sont pas spécifiés. ACT n'a pas de poids de base à licencier. Pi0.5 est ambigu : la documentation de LeRobot indique Apache 2.0, ses métadonnées de carte lisent license: gemma.
Sources
- Dépôt NVIDIA Isaac-GR00T : statut GA, changements de N1.6 à N1.7, exigences matérielles, contraintes torchcodec et FFmpeg, launch_finetune.py, variance d'exécution à exécution
- Carte de modèle nvidia/GR00T-N1.7-3B : backbone Cosmos-Reason2-2B, 3 B paramètres, tableau des temps d'inférence, NVIDIA Open Model License, champ Model Version
- Carte de modèle nvidia/GR00T-N1.5-3B : référence Eagle 2, SigLip2 et T5, DiT de correspondance de flux, licence non-commerciale unidirectionnelle
- Exemple Isaac-GR00T LIBERO : taux de succès par suite à 20K étapes et taille de lot 640, 200 essais par suite
- Exemple Isaac-GR00T SimplerEnv : taux de succès Bridge et Fractal par tâche, GR00T N1.6 contre N1.7
- pi0.5 : un modèle Vision-Langage-Action avec généralisation en monde ouvert (2 B VLM plus 300 M expert d'action, contrôle à 50 Hz, environ 400 heures de manipulation mobile, étude de mise à l'échelle sur 3 à 104 emplacements)
- Dépôt openpi : seuils de mémoire GPU, portée flow-matching-head-only, et les résultats Pi0.5 LIBERO dans examples/libero
- Carte de modèle lerobot/pi05_base : portée du port LeRobot, métadonnées license: gemma, utilisation de lerobot-train
- Documentation LeRobot pi0.5 : tokenizer PaliGemma à accès contrôlé, tableau de reproduction LIBERO, piège de repli n_action_steps, déclaration Apache 2.0
- SmolVLA : un modèle Vision-Langage-Action pour une robotique abordable et efficace (450 M paramètres, tables LIBERO et Meta-World, résultats SO-100 et SO-101, inférence asynchrone)
- Documentation LeRobot SmolVLA : 50 épisodes sur 5 positions contre 25, 20k étapes en environ 4 heures sur une A100
- Apprentissage de la manipulation bimanuelle fine avec du matériel à faible coût (ACT et ALOHA) : 6 tâches à 80-90 pour cent, ablation de la taille de chunk de k=1 à k=100
- LeRobot 0.6.2 : valeurs par défaut ACTConfig et SmolVLAConfig, seed par défaut 1000, --accelerator.gradient_accumulation.steps, exigence Python 3.12, Apache 2.0
- Documentation LeRobot GR00T : type de politique groot, support N1.5 supprimé, pin lerobot==0.5.1, exemple de taille de chunk SO-101
- Carte de modèle lerobot/smolvla_base : le checkpoint de base SmolVLA utilisé par --policy.path, et ses métadonnées de carte, qui ne contiennent pas de champ de licence
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started