
GR00T N1.7, Pi0.5, SmolVLA, ACT หรือ GR00T N1.5? ตารางการตัดสินใจที่ตรงกับสถานการณ์จริง พร้อมด้วยตัวเลขเกณฑ์มาตรฐานที่เผยแพร่, ความหน่วง, ค่าใช้จ่ายต่อการรัน และใบอนุญาตที่อยู่เบื้องหลังแต่ละตัวเลือก
ปัจจุบันมีนโยบายห้าแบบที่สามารถฝึกได้บนแขนกล SO-100 พวกมันแตกต่างกันด้วยปัจจัย 24 ในการอนุมานเวลาแฝง, 37 ในจำนวนพารามิเตอร์ และ 12 ในค่าใช้จ่ายของการรันแต่ละครั้ง รวมถึงว่าคุณสามารถจัดส่งผลลัพธ์ได้หรือไม่ โมเดลการ์ดห้าใบจะไม่ช่วยตัดสินใจ: ไม่มีใบใดตอบคำถามที่คุณมีว่า ฉันควรจะรันอันไหนก่อน?
ตัวเลขทุกตัวด้านล่างนี้ถูกอ่านมาจากเอกสาร, รีโพสิทอรี และการ์ดต่างๆ ในเดือนสิงหาคม 2026 ตัวเลขแพลตฟอร์มมาจากจาก แค็ตตาล็อกนโยบายของ AY-Robots; หากทั้งสองไม่ตรงกัน จะแสดงทั้งคู่
ฉบับย่อ
- •ฝึก ACT ก่อนหากคุณสงสัยในชุดข้อมูลของคุณ: 1 ถึง 3 USD ต่อการรันหนึ่งครั้ง, ไม่มีโมเดลที่ฝึกมาล่วงหน้าเพื่อปกปิดข้อมูลที่ไม่ดี
- •GR00T N1.7 และ Pi0.5 มีคะแนนห่างกันไม่ถึงครึ่งจุดบน LIBERO, 97.0 เทียบกับ 96.85 ถึง 97.5 นั่นไม่ใช่เหตุผลที่จะเลือกอันใดอันหนึ่ง
- •Pi0.5 เน้นการสรุปผลทั่วไป ไม่ใช่ความแม่นยำ และช้าที่สุดที่ 485 ms
- •SmolVLA ที่มีพารามิเตอร์ 450 M เป็น VLA เพียงตัวเดียวที่สามารถปรับแต่งละเอียดบนการ์ด 24 GB เพียงใบเดียว
- •ACT ที่ 20 ms เป็นตัวเลือกเดียวสำหรับการเคลื่อนไหวตอบสนองที่รวดเร็ว ใบอนุญาตจะเป็นตัวตัดสินส่วนที่เหลือ
ตารางการตัดสินใจ
| สถานการณ์ของคุณ | ฝึกโมเดลนี้ | เหตุผล |
|---|---|---|
| คุณภาพชุดข้อมูลยังไม่ได้รับการพิสูจน์ | ACT | ไม่มีโมเดลที่ผ่านการฝึกมาก่อนใดจะปกปิดชุดข้อมูลที่เสียหายได้ และความล้มเหลวมีค่าใช้จ่าย 1 ถึง 3 USD |
| มีการสัมผัสมาก, หลายขั้นตอน, ควบคุมด้วยภาษา | GR00T N1.7 | 97.0% ในชุด LIBERO สี่ชุด พร้อมพื้นที่การกระทำของ End-effector แบบสัมพัทธ์ |
| การเคลื่อนไหวตอบสนองที่รวดเร็ว, การอนุมานที่เซอร์โว | ACT | 20 ms โมเดลที่เร็วที่สุดถัดไปช้ากว่า 7.6 เท่า |
| วัตถุใหม่, ฉากใหม่, โลกเปิด | Pi0.5 | สร้างขึ้นสำหรับพฤติกรรมนอกการกระจายตัว ครอบคลุมสูงสุด 104 ตำแหน่ง |
| การ์ด 24 GB หนึ่งใบ, ยังต้องการภาษา | SmolVLA | พารามิเตอร์ 450 ล้านตัว, พื้นฐาน 30 ตอน, ทำงานในเครื่อง |
| การจำลองการทำงานที่บันทึกไว้ในปี 2025 | GR00T N1.5 | เฉพาะในกรณีที่คุณจำเป็น: LeRobot ปฏิเสธแล้ว, น้ำหนักโมเดลไม่เชิงพาณิชย์ |
| สิ่งนี้จะถูกจัดส่งเป็นผลิตภัณฑ์ | N1.7, SmolVLA or ACT | N1.5 ไม่เชิงพาณิชย์, Pi0.5 มีเงื่อนไข Gemma, การ์ดของ SmolVLA ระบุว่าไม่มี |
ผู้สมัครทั้งห้า
ทั้งห้าเป็น การเรียนรู้แบบเลียนแบบ นโยบาย: เฟรมกล้อง, ตำแหน่งข้อต่อ และ, สำหรับสี่ในห้า, คำสั่งภาษา, ที่ถูกแมปไปยังกลุ่มเป้าหมายข้อต่อในอนาคต สิ่งที่แยกความแตกต่างคือปริมาณที่ถูก เรียนรู้ก่อนที่คุณจะมาถึง
| นโยบาย | พารามิเตอร์ | ความหน่วง | ระดับ GPU | ในเครื่อง? | จำนวนตอนขั้นต่ำ | รูปแบบ | ค่าใช้จ่าย |
|---|---|---|---|---|---|---|---|
| ACT | ~80 M | 20 ms | 24 GB card | yes | 50 | v3.0 | 1 to 3 USD |
| SmolVLA | ~450 M | 245 ms | 24 GB card | yes | 30 | v3.0 | 1 to 3 USD |
| GR00T N1.7 | ~3 B, ~40 M tuned | 152 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| GR00T N1.5 | ~3 B | 165 ms | A100/H100 80 GB | no | 50 | v2.0/v2.1 | 4 to 12 USD |
| Pi0.5 | ~3 B, PaliGemma | 485 ms | A100/H100 80 GB | no | 50 | v3.0 | 4 to 12 USD |
GR00T N1.7
โมเดลปัจจุบันของ NVIDIA โมเดลการกระทำด้วยวิสัยทัศน์และภาษา, มีพารามิเตอร์ประมาณ 3 พันล้านตัว โดยประมาณ 40 ล้านตัวได้รับการฝึกฝนระหว่าง การปรับแต่งอย่างละเอียด. ที่เก็บโค้ดระบุความแตกต่างจาก N1.6: โครงสร้างหลักจากโมเดล Eagle ที่เป็นของบุคคลที่สามเปลี่ยนเป็น Cosmos-Reason2-2B บน Qwen3-VL, เลเยอร์การแพร่กระจายจาก 32 เป็น 16, มิติของสถานะและการกระทำจาก 29 เป็น 132, ขอบเขตการกระทำจาก 16 เป็น 40.
สิ่งที่สำคัญสำหรับแขนกลขนาดเล็กคือพื้นที่การกระทำของปลายแขนกลสัมพัทธ์: N1.7 ทำนายความแตกต่างจาก ท่าปัจจุบัน ซึ่งเป็นสิ่งที่ทำให้วิดีโอของมนุษย์ EgoScale 20,000 ชั่วโมงสามารถถ่ายทอดไปสู่นโยบายหุ่นยนต์ได้ ข้อมูลจำเพาะบน หน้า N1.7, ขั้นตอนใน คู่มือ N1.7 บน SO-100.
ไฟล์ README ของ Isaac-GR00T ประกาศว่า N1.7 เป็นเวอร์ชัน General Availability ที่เผยแพร่ พร้อมการวัดประสิทธิภาพและการสนับสนุนที่สมบูรณ์ การ์ด Hugging Face ของมันยังไม่อัปเดต: ฟิลด์ Model Version ยังคงแสดง GR00T N1.7 EA. ที่เก็บโค้ดเป็นเอกสารที่ใหม่กว่า.
GR00T N1.5
ขนาด 3 พันล้านพารามิเตอร์เท่ากัน, ใช้ Eagle 2 เป็นโครงสร้างหลัก, SigLip2 และ T5, ส่วนหัว DiT แบบ flow-matching มีอยู่เพื่อขยาย ที่คุณมีอยู่แล้ว มีสองสิ่งทำให้มันเป็นค่าเริ่มต้นที่ไม่ดี: น้ำหนักโมเดลมาพร้อมกับ ใบอนุญาตแบบไม่เชิงพาณิชย์ทางเดียวของ NVIDIA และ LeRobot รุ่นปัจจุบันได้ถอดการรองรับ N1.5 ออกแล้ว ดู .
Pi0.5
VLA ของ Physical Intelligence แบบ , ประเภทนโยบาย pi05. บทความนี้ระบุ VLM ขนาด 2 พันล้านพารามิเตอร์ที่เริ่มต้นจาก PaliGemma พร้อมผู้เชี่ยวชาญด้านการกระทำ 300 ล้านพารามิเตอร์ ซึ่งขับเคลื่อนหุ่นยนต์ที่ 50 Hz; การกำหนดค่า pi05 ของ LeRobot มีค่าเริ่มต้นเป็น 50 ขั้นตอนต่อช่วงเวลา ซึ่งเท่ากับหนึ่งวินาทีในอัตรานั้น จุดเด่นคือสถานที่ที่ไม่เคยเห็นมาก่อน: การจัดการเคลื่อนที่ประมาณ 400 ชั่วโมงในบ้านจริง และการศึกษาการปรับขนาดใน 3, 12, 22, 53, 82 และ 104 สถานที่ โดยที่โมเดล 104 สถานที่สามารถจับคู่กับการควบคุมที่ฝึกฝนในบ้านทดสอบเหล่านั้นได้
ข้อจำกัดหนึ่งที่ระบุไว้บน lerobot/pi05_base การ์ด: พอร์ตจะส่งเฉพาะ ส่วนหัวการจับคู่โฟลว์เท่านั้น การคาดการณ์งานย่อย การแปลงการกระทำเป็นโทเค็น และ RL ไม่ได้ถูกเผยแพร่จากต้นน้ำ และ openpi ก็กล่าวเช่นเดียวกันสำหรับ ที่เก็บของตนเอง หน้า Pi0.5 และ คู่มือ Pi0.5 บน SO-100 มีข้อมูลส่วนที่เหลือ
Pi0.5 ต้องการโทเคไนเซอร์แบบมีเกต google/paligemma-3b-pt-224 (gated: manual, แม้ว่า Google จะระบุว่าคำขอจะได้รับการประมวลผลทันที) หากไม่ยอมรับและรัน hf auth login ในสภาพแวดล้อมการฝึกอบรม งานจะเริ่ม ดาวน์โหลดสักพัก แล้วหยุดทำงานเนื่องจากข้อผิดพลาดในการอนุญาตที่ดูเหมือนข้อผิดพลาดของเครือข่าย nvidia/GR00T-N1.7-3B ไม่ได้ถูกจำกัด แต่แบ็คโบน nvidia/Cosmos-Reason2-2B ของมันถูกจำกัด (gated: auto) ล้างทั้งสองอย่างก่อนเข้าคิว หากการรันหยุดนิ่ง หน้าคิวค้าง จะแสดงรายการสิ่งที่ต้องตรวจสอบ
SmolVLA
พารามิเตอร์ 450 ล้านตัว โดยประมาณ 100 ล้านตัวอยู่ในผู้เชี่ยวชาญด้านการกระทำ บน SmolVLM-2 โดยที่ VLM ถูกตรึงและใช้เพียง 16 เลเยอร์แรกของโมเดลภาษาเท่านั้น การฝึกอบรมล่วงหน้ามาจากข้อมูลชุมชน: 481 ชุดข้อมูล, 10.6 ล้านเฟรม, จาก แขนหุ่นยนต์ราคาถูกแบบเดียวกับที่คุณใช้ VLA เพียงตัวเดียวที่นี่ที่สามารถใส่การ์ด 24 GB ได้หนึ่งใบ และเป็นเพียง VLA เดียวที่มี 30 ตอน เป็นเกณฑ์ขั้นต่ำ ดู หน้า SmolVLA.
ACT
ไม่ใช่โมเดลพื้นฐาน Action Chunking Transformer จาก ALOHA มีพารามิเตอร์ประมาณ 80 ล้านตัวที่ได้รับการฝึกฝน ตั้งแต่เริ่มต้นสำหรับแต่ละงาน โดยใช้การสาธิต 50 ครั้งที่ 50 Hz. รายงานฉบับนี้ระบุงานสองมือจริงหกงานจากการสาธิตประมาณสิบ นาทีในแต่ละงาน โดยมีอัตราความสำเร็จ 80 ถึง 90 เปอร์เซ็นต์ในตัวอย่างที่เน้นย้ำ แนวคิดของมันคือ การแบ่งกลุ่มการกระทำ, มีอยู่ในทุกโมเดลในหน้านี้ และการวิเคราะห์แบบ Ablation ของมันยังคงวัด ผลกระทบได้ดีที่สุด: ในงานจำลองสองงานที่ปิดการรวมกลุ่มตามเวลา (temporal ensembling) ความสำเร็จเพิ่มขึ้นจาก 1 เปอร์เซ็นต์ที่ k=1 เป็น 44 เปอร์เซ็นต์ที่ k=100. หน้า ACT มีข้อมูลส่วนที่เหลือ
สิ่งที่เกณฑ์มาตรฐานกล่าวไว้จริง ๆ
LIBERO เป็นเกณฑ์มาตรฐานหนึ่งในห้าที่สามในจำนวนนี้รายงาน: งานที่กำหนดเงื่อนไขด้วยภาษาบนการจำลอง Franka Panda ซึ่งแบ่งออกเป็นสี่ชุดด้านล่าง ชุดละสิบงาน NVIDIA ดำเนินการทดลอง 200 ครั้งต่อชุด
| โมเดล | เชิงพื้นที่ | วัตถุ | เป้าหมาย | 10 (ระยะยาว) | เฉลี่ย |
|---|---|---|---|---|---|
| GR00T N1.7 (Isaac-GR00T) | 97.65% | 98.45% | 97.5% | 94.35% | 97.0% |
| Pi0.5 at 30k (openpi) | 98.8% | 98.2% | 98.0% | 92.4% | 96.85% |
| Pi0.5, LeRobot port | 97.0% | 99.0% | 98.0% | 96.0% | 97.5% |
| SmolVLA 0.45B (paper) | 90% | 96% | 92% | 71% | 87.3% |
| OpenVLA 7B (paper) | 84.7% | 88.4% | 79.2% | 53.7% | 76.5% |
ตัวเลขทุกตัวมาจากชุดทดสอบและงบประมาณที่แตกต่างกัน GR00T รัน 20K สเต็ปที่ global batch 640; ตัวเลข openpi คือเช็คพอยต์ 30K; พอร์ต LeRobot เพิ่ม 6K สเต็ปให้กับโมเดลพื้นฐาน LIBERO SmolVLA มีความไม่ตรงกันเพิ่มเติม: เอกสารของมันฝึกแถวนั้นบน LIBERO ตั้งแต่เริ่มต้น โดยไม่มีการฝึก VLA ล่วงหน้า ในขณะที่สามตัวข้างบนปรับแต่งเช็คพอยต์ที่ฝึกไว้ล่วงหน้า พิจารณา 96.85 ถึง 97.5 เป็นกลุ่มเดียวกัน และช่องว่างถึง 87.3% เป็นของจริงแต่แลกมาด้วยพารามิเตอร์ที่มากกว่า 6.7 เท่า
SimplerEnv แสดงให้เห็นถึงการกระจายตัว ซึ่ง LIBERO ไม่ได้แสดง NVIDIA เปรียบเทียบ N1.7 กับ N1.6 ซึ่งเป็นสิ่งที่ใกล้เคียงที่สุดกับ ความแตกต่างระหว่างรุ่น
| ชุด SimplerEnv | N1.6 เฉลี่ย | N1.7 เฉลี่ย | การแกว่งที่ดีที่สุด | การแกว่งที่แย่ที่สุด |
|---|---|---|---|---|
| Bridge (WidowX), 7 tasks | 56.6% | 62.3% | stack_cube 5.0 to 48.0 | put_eggplant_in_basket 89.0 to 53.0 |
| Fractal (Google Robot), 6 tasks | 52.0% | 72.5% | open_drawer 0.0 to 65.0 | none, every task improved |
แถว Bridge เป็นแถวที่มีประโยชน์: ได้คะแนนเฉลี่ย 5.7 แต้ม ในขณะที่ put_eggplant_in_basket เสียไป 36 แต้ม และ put_eggplant_in_sink ลดลงจาก 33 เหลือ 2. โมเดลรุ่นใหม่จะปรับการกระจายตัวแทนที่จะ ยกมันขึ้น ดังนั้น หากงานของคุณอยู่ในจุดที่ N1.7 ถดถอย ค่าเฉลี่ยก็ไม่ได้บอกอะไรเลย

ในบรรดาห้าตัว มีเพียงเอกสาร SmolVLA เท่านั้นที่รายงานเกี่ยวกับแขนหุ่นยนต์ระดับ SO-100: 78.3 เปอร์เซ็นต์สำหรับ SmolVLA และ 61.7 สำหรับ Pi0 ในสามงาน ซึ่งเป็นแบบหลายงานทั้งคู่ เทียบกับ 48.3 สำหรับ ACT ที่ฝึกแบบงานเดียว ซึ่งไม่เหมือนกัน ทีเดียว. การจับคู่ที่ชัดเจนคือทั้งสองแบบเป็นงานเดียวบน SO-101 pick-and-place: 90 เทียบกับ 70 ในการกระจายตัว, 50 เทียบกับ 40 นอกเหนือจากนั้น. เปรียบเทียบที่ ACT เทียบกับ SmolVLA และ Pi0.5 เทียบกับ SmolVLA, หรือเรียกดู สนามประลอง.
ความหน่วงและต้นทุนเป็นตัวตัดสินการนำไปใช้งาน
เวลาแฝงของการอนุมาน เป็นข้อจำกัดที่คนมักจะค้นพบเป็นอันดับสุดท้ายและ เสียใจเป็นอันดับแรก นโยบายที่ทำคะแนนได้ดีกว่าห้าจุดในการทดสอบมาตรฐาน แต่ใช้เวลาครึ่งวินาทีต่อขั้นตอนการกระทำนั้นดูแย่กว่าเมื่ออยู่บนโต๊ะทำงานของคุณ: พลวัตการสัมผัสไม่รอใคร
ข้อควรระวัง: ตัวเลขของ GR00T ไม่ตรงกับข้อมูลของ NVIDIA ซึ่งระบุว่าใช้เวลา 4 ขั้นตอนการลดสัญญาณรบกวนและ กล้องหนึ่งตัวใช้เวลา 85.8 ms บน H100 ในโหมด eager, 48.6 ms เมื่อใช้ torch.compile, 27.9 ms เมื่อใช้ TensorRT เต็มรูปแบบ ตัวเลข 152 ms ในที่นี้เป็นตัวเลขรวมทั้งระบบที่มีค่าใช้จ่ายในการให้บริการและกล้องมากกว่าหนึ่งตัว ไม่ใช่แค่การส่งผ่านไปข้างหน้า
ลูป 20 ถึง 485 ms เป็นของโมเดล และการเดินทางไปกลับผ่านอินเทอร์เน็ตสาธารณะก็เพิ่มเวลาเข้าไปอีก การอนุมานระยะไกลสามารถทำได้สำหรับงานหยิบและวางที่ช้า แต่ไม่เหมาะสำหรับการเคลื่อนไหวตอบสนองที่รวดเร็ว หากงานของคุณต้องการความเร็ว การอนุมานควรอยู่ใกล้กับเซอร์โว: ACT หรือ SmolVLA, ทำงานในเครื่อง ที่เกี่ยวข้อง: นโยบายหยุดชะงักกลางคัน.
วิธีหนึ่งในการประหยัดเวลาโดยไม่ต้องเปลี่ยนโมเดล: เอกสาร SmolVLA วัดผลการทำงานแบบซิงโครนัส ซึ่ง นโยบายจะทำงานเสร็จสิ้นเป็นส่วนๆ ก่อนที่จะคาดการณ์ส่วนถัดไป เทียบกับการทำงานแบบอะซิงโครนัส ซึ่งการคาดการณ์จะทับซ้อนกับการทำงาน ความสำเร็จใกล้เคียงกัน, 78.3 เทียบกับ 73.3, แต่งานหยิบและวางแบบเดียวกันใช้เวลา 9.7 วินาที แทนที่จะเป็น 13.75 วินาที และใน ช่วงเวลาที่กำหนด หุ่นยนต์สามารถจัดการได้ 19 รอบ แทนที่จะเป็น 9 รอบ
ใบอนุญาต ตรวจสอบแล้วเพราะไม่มีใครตรวจสอบ
| โมเดล | ใบอนุญาตน้ำหนักโมเดล | ใบอนุญาตโค้ด | การใช้งานเชิงพาณิชย์ |
|---|---|---|---|
| GR00T N1.7 | NVIDIA Open Model License; การ์ดอนุญาตให้ใช้งานเชิงพาณิชย์ | Apache 2.0 | ใช่ |
| GR00T N1.5 | ใบอนุญาตแบบไม่เชิงพาณิชย์ทางเดียวของ NVIDIA | Apache 2.0 | ไม่ |
| Pi0.5 | ข้อมูลเมตาของการ์ด pi05_base ระบุใบอนุญาต: gemma | Apache 2.0 (openpi, เอกสาร LeRobot) | อ่านทั้งสองแล้วไม่ตรงกัน |
| SmolVLA | ไม่มีช่องใบอนุญาตบนการ์ด smolvla_base | Apache 2.0 (LeRobot) | โค้ดใช่, น้ำหนักโมเดลไม่ได้ระบุ |
| ACT | ไม่มีน้ำหนักโมเดลพื้นฐานอยู่ | Apache 2.0 (LeRobot) | ใช่ |
แถว Pi0.5 ต้องระมัดระวัง เอกสาร LeRobot pi05 ระบุ Apache 2.0 ซึ่งสอดคล้องกับ openpi, ในขณะที่การ์ด Hub สำหรับ lerobot/pi05_base ระบุ license: gemma. ทั้งสองยังใช้งานอยู่ GR00T N1.7 มี เวอร์ชันที่ผ่อนปรนกว่า: README ของ Isaac-GR00T กล่าวโดยบังเอิญว่า N1.7 สามารถให้ใบอนุญาตเชิงพาณิชย์ได้อย่างสมบูรณ์ภายใต้ Apache 2.0, ในขณะที่ส่วนใบอนุญาตของมันเองและการ์ดโมเดลระบุว่าโค้ดอยู่ภายใต้ Apache 2.0 และน้ำหนักโมเดลอยู่ภายใต้ NVIDIA Open Model License.
ค่าเริ่มต้นที่คุณจะใช้งานจริง
แต่ละฟอร์มเทรนเนอร์มาพร้อมค่าเริ่มต้น และค่าเหล่านี้ไม่ใช่ค่าสุ่ม ACT's เป็นของ LeRobot เอง: batch 8, lr 1e-5, 100000 ขั้นตอนการฝึก, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. คอลัมน์หนึ่งด้านล่างนี้คือกับดัก
| นโยบาย | แบทช์ | LR | จำนวนขั้นตอนสูงสุด | การสะสมเกรเดียนต์ | ใช้ได้หรือไม่? | ตัวปรับแต่งเพิ่มเติม |
|---|---|---|---|---|---|---|
| GR00T N1.7 | 32 | 1e-4 | 20000 | 1 | ใช่ | saveSteps |
| GR00T N1.5 | 1 | 1e-5 | 2000 | 16 | ใช่ | saveSteps |
| Pi0.5 | 1 | 5e-5 | 30000 | 16 | ไม่ (lerobot 0.5.1) | seed, logFreq |
| SmolVLA | 2 | 1e-4 | 20000 | 8 | ไม่ | seed, logFreq |
| ACT | 8 | 1e-5 | 100000 | 1 | ไม่ | chunkSize, nActionSteps, seed, logFreq |
จุดเริ่มต้นการปรับแต่ง (fine-tuning) ของ GR00T (launch_finetune.py, ซึ่งเป็น tyro CLI) ไม่มีฟิลด์ seed ใน config dataclass ทำให้การรันไม่สามารถทำซ้ำได้แบบบิตต่อบิต รีโพซิทยังเตือนถึง ความแปรปรวน 5 ถึง 6 เปอร์เซ็นต์ระหว่างการรัน จากการเพิ่มประสิทธิภาพรูปภาพที่ไม่เป็นไปตามกำหนด ซึ่งมีขนาดใหญ่กว่าช่องว่างของเกณฑ์มาตรฐานส่วนใหญ่ที่ถกเถียงกันทางออนไลน์ ค่า seed เริ่มต้นของ LeRobot คือ 1000 คอลัมน์ grad-accum อธิบายถึง lerobot 0.5.1; ส่วนเวอร์ชัน 0.6.2 ที่อยู่ต้นน้ำเปิดเผยเป็น --accelerator.gradient_accumulation.steps
ตัวปรับแต่งที่สำคัญกว่าการเลือกรุ่นโมเดล
นี่คือส่วนของชุดการกระทำ (action chunk) ชุดการกระทำที่ยาวขึ้นจะให้การเคลื่อนไหวที่ราบรื่นขึ้นและมีข้อผิดพลาดสะสมน้อยลง แต่ นโยบายจะถูกผูกมัดในขณะที่บล็อกทำงาน ดังนั้นจึงตอบสนองช้าต่อสิ่งใดก็ตามที่เคลื่อนไหว: มั่นใจเมื่ออยู่บน ลูกบาศก์ที่อยู่นิ่ง แต่ไร้หวังเมื่ออยู่บนลูกบาศก์ที่กำลังกลิ้ง หากมีการเคลื่อนที่เกินเป้าหมาย การลดความยาวของส่วนที่ดำเนินการจะดีกว่าการฝึกใหม่ และไม่มีค่าใช้จ่าย ข้อต่อที่หยุดสั้นเป็นปัญหาที่แตกต่างกัน; ดู .
- ACT: ACTConfig มีค่าเริ่มต้นเป็น
chunk_size 100และn_action_steps 100. การรวมแบบชั่วคราว (Temporal ensembling) ถูกปิดและต้องใช้n_action_steps 1. - GR00T N1.7: internal horizon เปลี่ยนจาก 16 เป็น 40 แต่ตัวอย่าง SO-101 ของ LeRobot ยังคงรัน
--policy.chunk_size=16 --policy.n_action_steps=16. แฟล็ก rollout ถูกเปลี่ยนชื่อเป็น--execution-horizon. - Pi0.5: ชุดการกระทำ 50 ขั้นตอน ซึ่งสูตร LIBERO ของ LeRobot ดำเนินการ 10 ขั้นตอนผ่าน
--policy.n_action_steps=10; ด้วย--policy.pretrained_pathมันจะกลับไปใช้ 50 หากคุณละเว้นแฟล็กนี้. - SmolVLA: ชุดการกระทำ 50 ขั้นตอน โดยมีตัวปรับแต่งทั้งสองเปิดเผย.
วิธีคัดกรองทั้งห้าแบบในบ่ายวันเดียว
คำตอบที่ถูกที่สุดไม่ใช่การอ่านเพิ่มเติม ใช้เงินประมาณ 15 USD และให้แขนหุ่นยนต์บอกคุณ: บันทึกข้อมูลเพียงครั้งเดียว ฝึกโมเดลราคาถูกก่อน แล้วค่อยขยายผลเมื่อข้อมูลได้รับการพิสูจน์ว่าถูกต้อง โครงสร้างสำคัญกว่าปริมาณ ซึ่งเป็นจุดประสงค์ของ และ .
- 1บันทึก 50 ตอนในครั้งเดียว
50 ตอนช่วยให้ GR00T, Pi0.5 และ ACT รวมถึง SmolVLA 30 ตอนมีพื้นที่ทำงาน ทำซ้ำแต่ละรูปแบบแทนที่จะกระจายบางๆ: 50 ตอนใน 5 ตำแหน่งลูกบาศก์ที่ได้รับการฝึกฝน ในขณะที่ 25 ตอนไม่ได้ฝึก ดู บันทึกชุดข้อมูลแรกของคุณ
bashlerobot-record \ --robot.type=so100_follower \ --robot.port=/dev/ttyACM1 \ --robot.id=my_follower_arm \ --teleop.type=so100_leader \ --teleop.port=/dev/ttyACM0 \ --teleop.id=my_leader_arm \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --dataset.num_episodes=50 \ --dataset.single_task="Put the lego brick into the box" - 2ฝึก ACT ก่อน เพราะมันโกหกคุณไม่ได้
ไม่มีน้ำหนักที่ฝึกไว้ล่วงหน้า ดังนั้นหากมันทำงานได้เลย แสดงว่าชุดข้อมูลของคุณมีงานนั้นอยู่แล้ว หาก ACT ไม่ตอบสนอง ให้แก้ไขข้อมูล ใช้เวลา 1 ถึง 3 USD, 2 ถึง 5 ชั่วโมงบนการ์ด 24 GB
bashlerobot-train \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --policy.type=act \ --policy.device=cuda \ --batch_size=8 \ --steps=100000 \ --seed=1000 \ --output_dir=outputs/train/act_pickplace \ --job_name=act_pickplace - 3รัน SmolVLA บนชุดข้อมูลเดิม โดยไม่มีการเปลี่ยนแปลง
ข้อมูลเดิม แขนเดิม พารามิเตอร์ 450 M แทนที่จะเป็น 80 M พร้อมกับการปรับสภาพภาษา LeRobot ใช้เวลาประมาณ 4 ชั่วโมงสำหรับการรัน 20K ขั้นตอนบน A100 หนึ่งตัว นี่คือสิ่งที่บอกคุณว่าการฝึกอบรมล่วงหน้ามีประโยชน์หรือไม่
bashlerobot-train \ --policy.path=lerobot/smolvla_base \ --dataset.repo_id=${HF_USER}/pick-place-50 \ --batch_size=64 \ --steps=20000 \ --policy.device=cuda \ --output_dir=outputs/train/smolvla_pickplace \ --job_name=smolvla_pickplace - 4แปลงเป็น v2.1 ก่อนที่คุณจะใช้ GR00T
GR00T อ่านรูปแบบ LeRobot v2 พร้อมกับไฟล์
meta/modality.jsonเพิ่มเติมที่แมปวิธีการแยกอาร์เรย์สถานะและการกระทำที่เชื่อมต่อกันออกเป็นฟิลด์ที่มีชื่อ ชุดข้อมูล v3.0 จะทำให้ตัวโหลดนั้นขัดข้อง เนื่องจาก v3.0 บรรจุหลายตอนลงในไฟล์ที่ใช้ร่วมกัน ในขณะที่ v2 เขียนหนึ่งไฟล์ต่อหนึ่งตอน Isaac-GR00T มีตัวช่วยดาวน์เกรดเป็นscripts/lerobot_conversion/convert_v3_to_v2.py; หน้าการปฏิเสธ v3 คือเส้นทางที่รวดเร็วtext# GR00T expects this layout, not the v3.0 file-based one my_dataset/ meta/ info.json episodes.jsonl # episode index and lengths tasks.jsonl # language task descriptions modality.json # GR00T-specific: state/action/video key mapping data/chunk-000/ # parquet, state and action per timestep videos/chunk-000/ # one mp4 per episode - 5ยกระดับไปใช้ GR00T N1.7 ก็ต่อเมื่อสองวิธีแรกยังไม่สมบูรณ์
ผ่าน CLI ของ NVIDIA ที่แสดงที่นี่ หรือประเภทนโยบาย
grootของ LeRobot NVIDIA แนะนำ VRAM 40 GB ขึ้นไปสำหรับการปรับแต่งละเอียด และ 16 GB สำหรับการอนุมาน หากเกิด OOM โปรดดู หน้า OOMbashCUDA_VISIBLE_DEVICES=0 uv run python \ gr00t/experiment/launch_finetune.py \ --base-model-path nvidia/GR00T-N1.7-3B \ --dataset-path demo_data/cube_to_bowl_5 \ --embodiment-tag NEW_EMBODIMENT \ --modality-config-path examples/SO100/so100_config.py \ --num-gpus 1 \ --output-dir /tmp/test_finetune \ --max-steps 2000 \ --global-batch-size 32 \ --dataloader-num-workers 4
สองวิธีในการรันการคัดกรองนั้น
สามสภาพแวดล้อม เนื่องจากชุดเครื่องมือไม่สามารถทำงานร่วมกันได้ LeRobot บน main คือ 0.6.2 และต้องการ Python 3.12 หรือใหม่กว่า; Isaac-GR00T และ openpi เป็น repo ที่จัดการด้วย uv แยกต่างหาก
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"
# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T
# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi- GR00T กำหนดให้
torchcodec0.8.0 เป็นแบ็กเอนด์วิดีโอเดียว โดยต้องการ FFmpeg 4 ถึง 7 FFmpeg 8 ไม่รองรับ, AV1 ไม่รับประกัน - ข้อกำหนดหน่วยความจำของ openpi: การอนุมานสูงกว่า 8 GB, LoRA สูงกว่า 22.5 GB, การปรับแต่งละเอียดเต็มรูปแบบสูงกว่า 70 GB เหตุผลสุดท้ายนี้คือทำไม Pi0.5 จึงเป็นงานของ A100
- เช่า GPU ด้วยตัวเอง ทำลายทิ้งหลังจากนั้น ประสานเส้นทางจุดตรวจสอบสามชุดด้วยตนเอง
ห้าโมเดลเดิม รูปแบบเดียว เลือกโมเดล ชุดข้อมูล และไฮเปอร์พารามิเตอร์; แบ็กเอนด์จะเช่า GPU ที่มีขนาดตาม VRAM ที่ต้องการ รันตัวฝึก และเขียน จุดตรวจสอบ ไปยังที่เก็บอ็อบเจกต์
- The เมทริกซ์การฝึก คือห้าโมเดลกับสี่แขน แต่ละเซลล์เป็นคู่มือ: SmolVLA บน SO-100, ACT บน SO-101
- พ็อดอนุมานจะถูกจัดเตรียมโดยอัตโนมัติโดย
/api/inference/podพร้อมกับตัวเฝ้าระวังการไม่ได้ใช้งาน ดังนั้นพ็อดที่ถูกลืมจะไม่ถูกเรียกเก็บเงินโดยไม่รู้ตัว - จุดตรวจสอบพื้นฐานเป็นของผู้ขายเอง:
nvidia/GR00T-N1.7-3B,nvidia/GR00T-N1.5-3B,lerobot/pi05_baseACT ไม่มี - การดำเนินการเดียวกันจาก CLI และจากเอเจนต์ AI ผ่าน เซิร์ฟเวอร์ MCP
- ไม่มีฮาร์ดแวร์? แขนจริง สตรีม SO-100 ทางกายภาพโดยไม่ต้องลงทะเบียน; หน้าลองใช้งาน แสดงวิธีการเข้าถึง
โมเดลพื้นฐานหรือสร้างใหม่ตั้งแต่ต้น
ทางแยกที่แท้จริงไม่ใช่การเลือกรุ่น 3B ใด แต่เป็นการตัดสินใจว่าจะใช้ VLA ที่ผ่านการฝึกอบรมล่วงหน้าเลยหรือไม่ เมื่อพิจารณาว่า ACT เรียนรู้งานสองมือจริงหกงานจากข้อมูลสาธิตประมาณสิบนาทีต่อชิ้น โดยมีพารามิเตอร์ 80M และ ไม่มีการฝึกอบรมล่วงหน้าเลย
- การปรับสภาพด้วยภาษา ACT ไม่มีสิ่งนี้; หนึ่งเช็คพอยต์ของ ACT ทำงานได้หนึ่งงาน
- ดีกว่าสำหรับวัตถุที่ไม่มีอยู่ในข้อมูลสาธิตของคุณ: บน SO-101, 50% เทียบกับ 40% ของ ACT ที่อยู่นอกการกระจาย
- ทำงานหลายอย่างได้ทั้งหมด: SmolVLA ทำได้ 78.3% ในสามงาน SO-100 ด้วยเช็คพอยต์เดียว; ACT ถูกรันแบบงานเดียวเท่านั้น
- ความหน่วง 7.6 ถึง 24 เท่า: 152 ถึง 485 มิลลิวินาทีต่อขั้นตอนการดำเนินการ เทียบกับ 20 มิลลิวินาทีของ ACT
- ค่าใช้จ่าย 4 ถึง 12 USD ต่อการรัน แทนที่จะเป็น 1 ถึง 3 USD และต้องใช้ A100 แทนการ์ด 24 GB ใดๆ
- ความเสี่ยงด้านใบอนุญาต รวมถึงโหมดความล้มเหลวของ gated-repo ที่ไม่มีอยู่ในการสร้างตั้งแต่เริ่มต้น
- น้ำหนักที่ผ่านการฝึกอบรมล่วงหน้าสามารถบดบังชุดข้อมูลที่ไม่ดีได้ การปรับแต่งที่ทำงานได้ครึ่งๆ กลางๆ กับข้อมูลที่เสียหายจะใช้เวลาหนึ่งสัปดาห์ก่อนที่คุณจะตรวจสอบข้อมูล
กรณีการจำลองการรันเก่า
การไล่ตามเช็คพอยต์ปี 2025 ทำให้คุณไม่ต้องเลือกรุ่นโมเดล และเปลี่ยนปัญหาเป็นการตรึงเวอร์ชัน: LeRobot ปัจจุบันปฏิเสธ N1.5 ดังนั้นคุณจึงตรึง lerobot==0.5.1. โดยไม่มีฟิลด์ seed และมีความแปรปรวน 5 ถึง 6 เปอร์เซ็นต์ ระหว่างการรัน การจำลองจึงเป็นเพียงค่าประมาณโดยธรรมชาติ และ มีส่วนของแพลตฟอร์ม

เหลือสองตัวเลือกแล้วใช่ไหม? ACT กับ GR00T N1.7 และ GR00T N1.7 กับ SmolVLA. ข้อมูลดิบอยู่ในรายการอารีน่า: GR00T N1.7, Pi0.5, SmolVLA และ ACT.
แพลตฟอร์มนี้ไม่สามารถช่วยคุณได้ในเรื่องใดบ้าง
- ไม่สามารถทำให้การอนุมานระยะไกลรวดเร็วได้ ลูป 20 ถึง 485 ms เป็นของโมเดล; การเดินทางไปกลับทางอินเทอร์เน็ตจะเพิ่มเวลาเข้าไปอีก
- ไม่สามารถปรับแต่ง GR00T หรือ Pi0.5 บนฮาร์ดแวร์ของคุณเองได้ ทั้งสองโมเดลนี้เป็นแบบคลาวด์เท่านั้น; มีเพียง SmolVLA และ ACT เท่านั้นที่ทำงานแบบโลคอล
- ไม่สามารถแก้ไขชุดข้อมูลได้ Loss ลดลงแต่ policy ไม่ทำงาน เป็นปัญหาข้อมูล, policy ที่ทำงานได้เพียงในการตั้งค่าเดียว เป็นปัญหาความครอบคลุม
- ไม่สามารถทำให้การรัน GR00T สามารถทำซ้ำได้: การกำหนดค่าต้นน้ำไม่มีฟิลด์ seed
85 โมเดล, 332 ผลลัพธ์การวัดประสิทธิภาพ, ทุกตัวเลขเชื่อมโยงไปยังแหล่งที่มา
ตารางที่สามารถจัดเรียงได้ในหน้านี้: โมเดลวิสัยทัศน์-ภาษา-การกระทำ 85 แบบ, ผลลัพธ์การวัดประสิทธิภาพ 332 รายการ, แต่ละรายการเชื่อมโยงกลับไปยังเอกสารหรือการ์ดโมเดลของมัน
เปิดอารีน่าการเลือกหนึ่งและดำเนินการต่อ
ค่าเริ่มต้นหนึ่งอย่าง: บันทึก 50 ตอน, ฝึก ACT ด้วยค่าใช้จ่าย 1 ถึง 3 USD เพื่อพิสูจน์ชุดข้อมูล, จากนั้นใช้ SmolVLA กับ ข้อมูลเดียวกัน. รวมกันไม่เกิน 6 USD และสิ่งเหล่านี้จะตอบคำถามที่สำคัญ: การฝึกอบรมล่วงหน้าช่วยได้หรือไม่ หรือ คอขวดอยู่ที่ข้อมูล. ยกระดับไปใช้ GR00T N1.7 สำหรับงานหลายขั้นตอนที่ต้องมีการสัมผัส, ไปใช้ Pi0.5 เมื่อ ฉากเปลี่ยนไป.
คำแนะนำการใช้งานแพลตฟอร์ม: ฝึกนโยบายแรกของคุณ, จากนั้น รันนโยบายแรกของคุณ. เอกสารการฝึกอบรม และ เอกสารชุดข้อมูล ครอบคลุมรูปแบบและโครงสร้าง; หน้า SO-100 และ คู่มือ SO-100 ฉบับสมบูรณ์ ครอบคลุมการสร้างและการปรับเทียบ. ข้อมูลพื้นฐาน: ภาพรวม VLA และ บทความ Pi0 flow-matching. สิ่งที่จะช่วยเพิ่มอัตราความสำเร็จของคุณคือ คู่มือคุณภาพข้อมูล.
ฉันควรฝึกนโยบาย VLA ใดก่อนบน SO-100?▾
ACT ตามด้วย SmolVLA. ACT ฝึกจากศูนย์ จึงไม่สามารถปกปิดชุดข้อมูลที่ไม่ดีได้ และการรันหนึ่งครั้งมีค่าใช้จ่าย 1 ถึง 3 USD บนการ์ด 24 GB หาก ACT สามารถทำงานได้สำเร็จ ค่าใช้จ่าย 4 ถึง 12 USD สำหรับการรัน GR00T N1.7 หรือ Pi0.5 ก็จะไม่สูญเปล่า
GR00T N1.7 ดีกว่า Pi0.5 จริงหรือ?▾
บน LIBERO ผลลัพธ์อยู่ในช่วงความคลาดเคลื่อน: 97.0% ในสี่ชุดสำหรับ GR00T N1.7, 96.85% สำหรับ Pi0.5 ที่ 30k สเต็ปใน openpi, 97.5% สำหรับพอร์ต LeRobot ซึ่งทั้งหมดมาจากชุดทดสอบที่แตกต่างกัน ความแตกต่างที่แท้จริงคือ 152 ms ต่อขั้นตอนการกระทำ เทียบกับ 485 ms, ชุดข้อมูล v2.1 เทียบกับ v3.0, และความแม่นยำของเกณฑ์มาตรฐานเทียบกับการสรุปผลในโลกเปิด
ฉันสามารถปรับแต่งโมเดลเหล่านี้บน RTX 4090 เพียงเครื่องเดียวได้หรือไม่?▾
SmolVLA และ ACT ได้ครับ/ค่ะ ทั้งสองระบุว่าใช้ได้กับ RTX 4090 หรือการ์ด 24 GB ใดๆ และรันได้ในเครื่อง GR00T N1.7, N1.5 และ Pi0.5 ต้องการ A100 หรือ H100 80 GB และใช้งานได้เฉพาะบนคลาวด์เท่านั้น NVIDIA แนะนำ 40 GB หรือมากกว่าสำหรับการปรับแต่ง GR00T; openpi ต้องการพื้นที่มากกว่า 70 GB สำหรับการปรับแต่ง Pi0.5 เต็มรูปแบบ และ 22.5 GB สำหรับ LoRA
ฉันสามารถใช้โมเดลห้าตัวนี้ในเชิงพาณิชย์ได้หรือไม่?▾
น้ำหนักของ GR00T N1.7 อยู่ภายใต้ข้อตกลงใบอนุญาต NVIDIA Open Model License Agreement ซึ่งระบุว่าครอบคลุมการใช้งานเชิงพาณิชย์ น้ำหนักของ N1.5 ไม่ใช่เชิงพาณิชย์ โค้ดของ SmolVLA เป็น Apache 2.0 ใน LeRobot แต่การ์ด lerobot/smolvla_base ไม่มีฟิลด์ใบอนุญาต ดังนั้นน้ำหนักจึงไม่ได้ระบุไว้ ACT ไม่มีน้ำหนักพื้นฐานที่ต้องมีใบอนุญาต Pi0.5 ยังคลุมเครือ: เอกสารของ LeRobot ระบุว่าเป็น Apache 2.0 แต่เมตาดาต้าของการ์ดอ่านว่า license: gemma
Sources
- ที่เก็บ NVIDIA Isaac-GR00T: สถานะ GA, การเปลี่ยนแปลงจาก N1.6 เป็น N1.7, ข้อกำหนดฮาร์ดแวร์, ข้อจำกัดของ torchcodec และ FFmpeg, launch_finetune.py, ความแปรปรวนของการรันแต่ละครั้ง
- การ์ดโมเดล nvidia/GR00T-N1.7-3B: โครงสร้างหลัก Cosmos-Reason2-2B, พารามิเตอร์ 3 B, ตารางเวลาการอนุมาน, NVIDIA Open Model License, ฟิลด์ Model Version
- การ์ดโมเดล nvidia/GR00T-N1.5-3B: การอ้างอิง Eagle 2, SigLip2 และ T5, flow matching DiT, ใบอนุญาตแบบไม่เชิงพาณิชย์ทางเดียว
- ตัวอย่าง Isaac-GR00T LIBERO: อัตราความสำเร็จต่อชุดที่ 20K สเต็ปและขนาดแบตช์ 640, 200 การทดลองต่อชุด
- ตัวอย่าง Isaac-GR00T SimplerEnv: อัตราความสำเร็จของ Bridge และ Fractal ต่อภารกิจ, GR00T N1.6 เทียบกับ N1.7
- pi0.5: โมเดล Vision-Language-Action ที่มีความสามารถในการสรุปผลในโลกเปิด (VLM 2 B บวกผู้เชี่ยวชาญด้านการกระทำ 300 M, การควบคุม 50 Hz, การจัดการเคลื่อนที่ประมาณ 400 ชั่วโมง, การศึกษาการปรับขนาดใน 3 ถึง 104 ตำแหน่ง)
- ที่เก็บ openpi: ขีดจำกัดหน่วยความจำ GPU, ขอบเขตเฉพาะ flow-matching-head, และผลลัพธ์ Pi0.5 LIBERO ใน examples/libero
- การ์ดโมเดล lerobot/pi05_base: ขอบเขตของพอร์ต LeRobot, เมตาดาต้า license: gemma, การใช้งาน lerobot-train
- เอกสาร LeRobot pi0.5: gated PaliGemma tokenizer, ตารางการจำลอง LIBERO, n_action_steps fallback trap, คำแถลง Apache 2.0
- SmolVLA: โมเดล Vision-Language-Action สำหรับหุ่นยนต์ราคาประหยัดและมีประสิทธิภาพ (พารามิเตอร์ 450 M, ตาราง LIBERO และ Meta-World, ผลลัพธ์ SO-100 และ SO-101, การอนุมานแบบอะซิงโครนัส)
- เอกสาร LeRobot SmolVLA: 50 ตอนใน 5 ตำแหน่ง เทียบกับ 25, 20k สเต็ปในเวลาประมาณ 4 ชั่วโมงบน A100
- การเรียนรู้การจัดการแบบสองมือที่มีรายละเอียดสูงด้วยฮาร์ดแวร์ราคาประหยัด (ACT และ ALOHA): 6 งานที่ 80-90 เปอร์เซ็นต์, การตัดขนาดชิ้นส่วนจาก k=1 ถึง k=100
- LeRobot 0.6.2: ค่าเริ่มต้น ACTConfig และ SmolVLAConfig, ค่าเริ่มต้น seed 1000, --accelerator.gradient_accumulation.steps, ข้อกำหนด Python 3.12, Apache 2.0
- เอกสาร LeRobot GR00T: ประเภทนโยบาย groot, การสนับสนุน N1.5 ถูกลบออก, pin lerobot==0.5.1, ตัวอย่างขนาดชิ้นส่วน SO-101
- การ์ดโมเดล lerobot/smolvla_base: จุดตรวจสอบพื้นฐาน SmolVLA ที่ใช้โดย --policy.path, และเมตาดาต้าของการ์ด ซึ่งไม่มีฟิลด์ใบอนุญาต
Sources
- NVIDIA Isaac-GR00T repository: GA status, N1.6 to N1.7 changes, hardware requirements, torchcodec and FFmpeg constraints, launch_finetune.py, run-to-run variance
- nvidia/GR00T-N1.7-3B model card: Cosmos-Reason2-2B backbone, 3 B parameters, inference timing table, NVIDIA Open Model License, Model Version field
- nvidia/GR00T-N1.5-3B model card: Eagle 2 reference, SigLip2 and T5, flow matching DiT, one-way non-commercial licence
- Isaac-GR00T LIBERO example: per-suite success rates at 20K steps and batch size 640, 200 trials per suite
- Isaac-GR00T SimplerEnv example: per-task Bridge and Fractal success rates, GR00T N1.6 against N1.7
- pi0.5: a Vision-Language-Action Model with Open-World Generalization (2 B VLM plus 300 M action expert, scaling study over 3 to 104 locations)
- Physical Intelligence: pi0.5 write-up, 50-step one-second action chunk, about 400 hours of mobile manipulation, about 100 training environments
- openpi repository: GPU memory floors, flow-matching-head-only scope, and the Pi0.5 LIBERO results in examples/libero
- lerobot/pi05_base model card: scope of the LeRobot port, license: gemma metadata, lerobot-train usage
- LeRobot pi0.5 documentation: gated PaliGemma tokenizer, LIBERO reproduction table, n_action_steps fallback trap, Apache 2.0 statement
- SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics (450 M parameters, LIBERO and Meta-World tables, SO-100 and SO-101 results, async inference)
- LeRobot SmolVLA documentation: 50 episodes across 5 positions against 25, 20k steps in about 4 hours on an A100
- Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware (ACT and ALOHA): 6 tasks at 80-90 percent, chunk size ablation from k=1 to k=100
- LeRobot 0.6.2: ACTConfig defaults, default seed 1000, Python 3.12 requirement, dataset v3.0 documentation, Apache 2.0
- LeRobot GR00T documentation: policy type groot, N1.5 support removed, pin lerobot==0.5.1, SO-101 chunk size example
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started