ตารางเปรียบเทียบนโยบายของ AY-Robots ที่แสดง GR00T N1.7, GR00T N1.5, Pi0.5, SmolVLA และ ACT เคียงข้างกัน พร้อมจำนวนพารามิเตอร์, ระดับ GPU, ความหน่วงในการอนุมาน และจำนวนตอนขั้นต่ำ
โมเดล VLAการฝึกนโยบายการเลือกโมเดลlerobotso-100

คุณควรฝึก VLA Policy ตัวไหนในปี 2026?

AY-Robots ResearchAugust 23, 202618 นาทีในการอ่าน

GR00T N1.7, Pi0.5, SmolVLA, ACT หรือ GR00T N1.5? ตารางการตัดสินใจที่ตรงกับสถานการณ์จริง พร้อมด้วยตัวเลขเกณฑ์มาตรฐานที่เผยแพร่, ความหน่วง, ค่าใช้จ่ายต่อการรัน และใบอนุญาตที่อยู่เบื้องหลังแต่ละตัวเลือก

ปัจจุบันมีนโยบายห้าแบบที่สามารถฝึกได้บนแขนกล SO-100 พวกมันแตกต่างกันด้วยปัจจัย 24 ในการอนุมานเวลาแฝง, 37 ในจำนวนพารามิเตอร์ และ 12 ในค่าใช้จ่ายของการรันแต่ละครั้ง รวมถึงว่าคุณสามารถจัดส่งผลลัพธ์ได้หรือไม่ โมเดลการ์ดห้าใบจะไม่ช่วยตัดสินใจ: ไม่มีใบใดตอบคำถามที่คุณมีว่า ฉันควรจะรันอันไหนก่อน?

ตัวเลขทุกตัวด้านล่างนี้ถูกอ่านมาจากเอกสาร, รีโพสิทอรี และการ์ดต่างๆ ในเดือนสิงหาคม 2026 ตัวเลขแพลตฟอร์มมาจากจาก แค็ตตาล็อกนโยบายของ AY-Robots; หากทั้งสองไม่ตรงกัน จะแสดงทั้งคู่

ฉบับย่อ

  • ฝึก ACT ก่อนหากคุณสงสัยในชุดข้อมูลของคุณ: 1 ถึง 3 USD ต่อการรันหนึ่งครั้ง, ไม่มีโมเดลที่ฝึกมาล่วงหน้าเพื่อปกปิดข้อมูลที่ไม่ดี
  • GR00T N1.7 และ Pi0.5 มีคะแนนห่างกันไม่ถึงครึ่งจุดบน LIBERO, 97.0 เทียบกับ 96.85 ถึง 97.5 นั่นไม่ใช่เหตุผลที่จะเลือกอันใดอันหนึ่ง
  • Pi0.5 เน้นการสรุปผลทั่วไป ไม่ใช่ความแม่นยำ และช้าที่สุดที่ 485 ms
  • SmolVLA ที่มีพารามิเตอร์ 450 M เป็น VLA เพียงตัวเดียวที่สามารถปรับแต่งละเอียดบนการ์ด 24 GB เพียงใบเดียว
  • ACT ที่ 20 ms เป็นตัวเลือกเดียวสำหรับการเคลื่อนไหวตอบสนองที่รวดเร็ว ใบอนุญาตจะเป็นตัวตัดสินส่วนที่เหลือ

ตารางการตัดสินใจ

สถานการณ์ของคุณฝึกโมเดลนี้เหตุผล
คุณภาพชุดข้อมูลยังไม่ได้รับการพิสูจน์ACTไม่มีโมเดลที่ผ่านการฝึกมาก่อนใดจะปกปิดชุดข้อมูลที่เสียหายได้ และความล้มเหลวมีค่าใช้จ่าย 1 ถึง 3 USD
มีการสัมผัสมาก, หลายขั้นตอน, ควบคุมด้วยภาษาGR00T N1.797.0% ในชุด LIBERO สี่ชุด พร้อมพื้นที่การกระทำของ End-effector แบบสัมพัทธ์
การเคลื่อนไหวตอบสนองที่รวดเร็ว, การอนุมานที่เซอร์โวACT20 ms โมเดลที่เร็วที่สุดถัดไปช้ากว่า 7.6 เท่า
วัตถุใหม่, ฉากใหม่, โลกเปิดPi0.5สร้างขึ้นสำหรับพฤติกรรมนอกการกระจายตัว ครอบคลุมสูงสุด 104 ตำแหน่ง
การ์ด 24 GB หนึ่งใบ, ยังต้องการภาษาSmolVLAพารามิเตอร์ 450 ล้านตัว, พื้นฐาน 30 ตอน, ทำงานในเครื่อง
การจำลองการทำงานที่บันทึกไว้ในปี 2025GR00T N1.5เฉพาะในกรณีที่คุณจำเป็น: LeRobot ปฏิเสธแล้ว, น้ำหนักโมเดลไม่เชิงพาณิชย์
สิ่งนี้จะถูกจัดส่งเป็นผลิตภัณฑ์N1.7, SmolVLA or ACTN1.5 ไม่เชิงพาณิชย์, Pi0.5 มีเงื่อนไข Gemma, การ์ดของ SmolVLA ระบุว่าไม่มี

ผู้สมัครทั้งห้า

ทั้งห้าเป็น การเรียนรู้แบบเลียนแบบ นโยบาย: เฟรมกล้อง, ตำแหน่งข้อต่อ และ, สำหรับสี่ในห้า, คำสั่งภาษา, ที่ถูกแมปไปยังกลุ่มเป้าหมายข้อต่อในอนาคต สิ่งที่แยกความแตกต่างคือปริมาณที่ถูก เรียนรู้ก่อนที่คุณจะมาถึง

นโยบายพารามิเตอร์ความหน่วงระดับ GPUในเครื่อง?จำนวนตอนขั้นต่ำรูปแบบค่าใช้จ่าย
ACT~80 M20 ms24 GB cardyes50v3.01 to 3 USD
SmolVLA~450 M245 ms24 GB cardyes30v3.01 to 3 USD
GR00T N1.7~3 B, ~40 M tuned152 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
GR00T N1.5~3 B165 msA100/H100 80 GBno50v2.0/v2.14 to 12 USD
Pi0.5~3 B, PaliGemma485 msA100/H100 80 GBno50v3.04 to 12 USD

GR00T N1.7

โมเดลปัจจุบันของ NVIDIA โมเดลการกระทำด้วยวิสัยทัศน์และภาษา, มีพารามิเตอร์ประมาณ 3 พันล้านตัว โดยประมาณ 40 ล้านตัวได้รับการฝึกฝนระหว่าง การปรับแต่งอย่างละเอียด. ที่เก็บโค้ดระบุความแตกต่างจาก N1.6: โครงสร้างหลักจากโมเดล Eagle ที่เป็นของบุคคลที่สามเปลี่ยนเป็น Cosmos-Reason2-2B บน Qwen3-VL, เลเยอร์การแพร่กระจายจาก 32 เป็น 16, มิติของสถานะและการกระทำจาก 29 เป็น 132, ขอบเขตการกระทำจาก 16 เป็น 40.

สิ่งที่สำคัญสำหรับแขนกลขนาดเล็กคือพื้นที่การกระทำของปลายแขนกลสัมพัทธ์: N1.7 ทำนายความแตกต่างจาก ท่าปัจจุบัน ซึ่งเป็นสิ่งที่ทำให้วิดีโอของมนุษย์ EgoScale 20,000 ชั่วโมงสามารถถ่ายทอดไปสู่นโยบายหุ่นยนต์ได้ ข้อมูลจำเพาะบน หน้า N1.7, ขั้นตอนใน คู่มือ N1.7 บน SO-100.

GA ในที่เก็บโค้ด, EA บนการ์ดโมเดล

ไฟล์ README ของ Isaac-GR00T ประกาศว่า N1.7 เป็นเวอร์ชัน General Availability ที่เผยแพร่ พร้อมการวัดประสิทธิภาพและการสนับสนุนที่สมบูรณ์ การ์ด Hugging Face ของมันยังไม่อัปเดต: ฟิลด์ Model Version ยังคงแสดง GR00T N1.7 EA. ที่เก็บโค้ดเป็นเอกสารที่ใหม่กว่า.

GR00T N1.5

ขนาด 3 พันล้านพารามิเตอร์เท่ากัน, ใช้ Eagle 2 เป็นโครงสร้างหลัก, SigLip2 และ T5, ส่วนหัว DiT แบบ flow-matching มีอยู่เพื่อขยาย ที่คุณมีอยู่แล้ว มีสองสิ่งทำให้มันเป็นค่าเริ่มต้นที่ไม่ดี: น้ำหนักโมเดลมาพร้อมกับ ใบอนุญาตแบบไม่เชิงพาณิชย์ทางเดียวของ NVIDIA และ LeRobot รุ่นปัจจุบันได้ถอดการรองรับ N1.5 ออกแล้ว ดู .

Pi0.5

VLA ของ Physical Intelligence แบบ , ประเภทนโยบาย pi05. บทความนี้ระบุ VLM ขนาด 2 พันล้านพารามิเตอร์ที่เริ่มต้นจาก PaliGemma พร้อมผู้เชี่ยวชาญด้านการกระทำ 300 ล้านพารามิเตอร์ ซึ่งขับเคลื่อนหุ่นยนต์ที่ 50 Hz; การกำหนดค่า pi05 ของ LeRobot มีค่าเริ่มต้นเป็น 50 ขั้นตอนต่อช่วงเวลา ซึ่งเท่ากับหนึ่งวินาทีในอัตรานั้น จุดเด่นคือสถานที่ที่ไม่เคยเห็นมาก่อน: การจัดการเคลื่อนที่ประมาณ 400 ชั่วโมงในบ้านจริง และการศึกษาการปรับขนาดใน 3, 12, 22, 53, 82 และ 104 สถานที่ โดยที่โมเดล 104 สถานที่สามารถจับคู่กับการควบคุมที่ฝึกฝนในบ้านทดสอบเหล่านั้นได้

ข้อจำกัดหนึ่งที่ระบุไว้บน lerobot/pi05_base การ์ด: พอร์ตจะส่งเฉพาะ ส่วนหัวการจับคู่โฟลว์เท่านั้น การคาดการณ์งานย่อย การแปลงการกระทำเป็นโทเค็น และ RL ไม่ได้ถูกเผยแพร่จากต้นน้ำ และ openpi ก็กล่าวเช่นเดียวกันสำหรับ ที่เก็บของตนเอง หน้า Pi0.5 และ คู่มือ Pi0.5 บน SO-100 มีข้อมูลส่วนที่เหลือ

กับดักที่กินเวลาช่วงบ่าย: ที่เก็บแบบมีเกต

Pi0.5 ต้องการโทเคไนเซอร์แบบมีเกต google/paligemma-3b-pt-224 (gated: manual, แม้ว่า Google จะระบุว่าคำขอจะได้รับการประมวลผลทันที) หากไม่ยอมรับและรัน hf auth login ในสภาพแวดล้อมการฝึกอบรม งานจะเริ่ม ดาวน์โหลดสักพัก แล้วหยุดทำงานเนื่องจากข้อผิดพลาดในการอนุญาตที่ดูเหมือนข้อผิดพลาดของเครือข่าย nvidia/GR00T-N1.7-3B ไม่ได้ถูกจำกัด แต่แบ็คโบน nvidia/Cosmos-Reason2-2B ของมันถูกจำกัด (gated: auto) ล้างทั้งสองอย่างก่อนเข้าคิว หากการรันหยุดนิ่ง หน้าคิวค้าง จะแสดงรายการสิ่งที่ต้องตรวจสอบ

SmolVLA

พารามิเตอร์ 450 ล้านตัว โดยประมาณ 100 ล้านตัวอยู่ในผู้เชี่ยวชาญด้านการกระทำ บน SmolVLM-2 โดยที่ VLM ถูกตรึงและใช้เพียง 16 เลเยอร์แรกของโมเดลภาษาเท่านั้น การฝึกอบรมล่วงหน้ามาจากข้อมูลชุมชน: 481 ชุดข้อมูล, 10.6 ล้านเฟรม, จาก แขนหุ่นยนต์ราคาถูกแบบเดียวกับที่คุณใช้ VLA เพียงตัวเดียวที่นี่ที่สามารถใส่การ์ด 24 GB ได้หนึ่งใบ และเป็นเพียง VLA เดียวที่มี 30 ตอน เป็นเกณฑ์ขั้นต่ำ ดู หน้า SmolVLA.

ACT

ไม่ใช่โมเดลพื้นฐาน Action Chunking Transformer จาก ALOHA มีพารามิเตอร์ประมาณ 80 ล้านตัวที่ได้รับการฝึกฝน ตั้งแต่เริ่มต้นสำหรับแต่ละงาน โดยใช้การสาธิต 50 ครั้งที่ 50 Hz. รายงานฉบับนี้ระบุงานสองมือจริงหกงานจากการสาธิตประมาณสิบ นาทีในแต่ละงาน โดยมีอัตราความสำเร็จ 80 ถึง 90 เปอร์เซ็นต์ในตัวอย่างที่เน้นย้ำ แนวคิดของมันคือ การแบ่งกลุ่มการกระทำ, มีอยู่ในทุกโมเดลในหน้านี้ และการวิเคราะห์แบบ Ablation ของมันยังคงวัด ผลกระทบได้ดีที่สุด: ในงานจำลองสองงานที่ปิดการรวมกลุ่มตามเวลา (temporal ensembling) ความสำเร็จเพิ่มขึ้นจาก 1 เปอร์เซ็นต์ที่ k=1 เป็น 44 เปอร์เซ็นต์ที่ k=100. หน้า ACT มีข้อมูลส่วนที่เหลือ

สิ่งที่เกณฑ์มาตรฐานกล่าวไว้จริง ๆ

LIBERO เป็นเกณฑ์มาตรฐานหนึ่งในห้าที่สามในจำนวนนี้รายงาน: งานที่กำหนดเงื่อนไขด้วยภาษาบนการจำลอง Franka Panda ซึ่งแบ่งออกเป็นสี่ชุดด้านล่าง ชุดละสิบงาน NVIDIA ดำเนินการทดลอง 200 ครั้งต่อชุด

โมเดลเชิงพื้นที่วัตถุเป้าหมาย10 (ระยะยาว)เฉลี่ย
GR00T N1.7 (Isaac-GR00T)97.65%98.45%97.5%94.35%97.0%
Pi0.5 at 30k (openpi)98.8%98.2%98.0%92.4%96.85%
Pi0.5, LeRobot port97.0%99.0%98.0%96.0%97.5%
SmolVLA 0.45B (paper)90%96%92%71%87.3%
OpenVLA 7B (paper)84.7%88.4%79.2%53.7%76.5%
แถวเหล่านี้ไม่สามารถเปรียบเทียบกันได้อย่างเคร่งครัด

ตัวเลขทุกตัวมาจากชุดทดสอบและงบประมาณที่แตกต่างกัน GR00T รัน 20K สเต็ปที่ global batch 640; ตัวเลข openpi คือเช็คพอยต์ 30K; พอร์ต LeRobot เพิ่ม 6K สเต็ปให้กับโมเดลพื้นฐาน LIBERO SmolVLA มีความไม่ตรงกันเพิ่มเติม: เอกสารของมันฝึกแถวนั้นบน LIBERO ตั้งแต่เริ่มต้น โดยไม่มีการฝึก VLA ล่วงหน้า ในขณะที่สามตัวข้างบนปรับแต่งเช็คพอยต์ที่ฝึกไว้ล่วงหน้า พิจารณา 96.85 ถึง 97.5 เป็นกลุ่มเดียวกัน และช่องว่างถึง 87.3% เป็นของจริงแต่แลกมาด้วยพารามิเตอร์ที่มากกว่า 6.7 เท่า

SimplerEnv แสดงให้เห็นถึงการกระจายตัว ซึ่ง LIBERO ไม่ได้แสดง NVIDIA เปรียบเทียบ N1.7 กับ N1.6 ซึ่งเป็นสิ่งที่ใกล้เคียงที่สุดกับ ความแตกต่างระหว่างรุ่น

ชุด SimplerEnvN1.6 เฉลี่ยN1.7 เฉลี่ยการแกว่งที่ดีที่สุดการแกว่งที่แย่ที่สุด
Bridge (WidowX), 7 tasks56.6%62.3%stack_cube 5.0 to 48.0put_eggplant_in_basket 89.0 to 53.0
Fractal (Google Robot), 6 tasks52.0%72.5%open_drawer 0.0 to 65.0none, every task improved

แถว Bridge เป็นแถวที่มีประโยชน์: ได้คะแนนเฉลี่ย 5.7 แต้ม ในขณะที่ put_eggplant_in_basket เสียไป 36 แต้ม และ put_eggplant_in_sink ลดลงจาก 33 เหลือ 2. โมเดลรุ่นใหม่จะปรับการกระจายตัวแทนที่จะ ยกมันขึ้น ดังนั้น หากงานของคุณอยู่ในจุดที่ N1.7 ถดถอย ค่าเฉลี่ยก็ไม่ได้บอกอะไรเลย

ลีดเดอร์บอร์ดสนามประลอง AY-Robots ซึ่งเป็นตารางที่จัดเรียงได้ของโมเดลวิสัยทัศน์-ภาษา-การกระทำ 85 แบบ พร้อมผลการทดสอบมาตรฐาน 332 รายการ โดยแต่ละค่าเชื่อมโยงไปยังเอกสารวิจัยหรือโมเดลการ์ดที่มาของมัน
สนามประลองนี้มีโมเดล VLA 85 แบบ และผลการทดสอบมาตรฐาน 332 รายการ ซึ่งแต่ละรายการเชื่อมโยงกลับไปยังเอกสารวิจัยหรือโมเดลการ์ดของมัน มีประโยชน์สำหรับการตรวจสอบว่าตัวเลขที่อ้างถึงในบล็อกโพสต์นั้นเป็นจริงหรือไม่

ในบรรดาห้าตัว มีเพียงเอกสาร SmolVLA เท่านั้นที่รายงานเกี่ยวกับแขนหุ่นยนต์ระดับ SO-100: 78.3 เปอร์เซ็นต์สำหรับ SmolVLA และ 61.7 สำหรับ Pi0 ในสามงาน ซึ่งเป็นแบบหลายงานทั้งคู่ เทียบกับ 48.3 สำหรับ ACT ที่ฝึกแบบงานเดียว ซึ่งไม่เหมือนกัน ทีเดียว. การจับคู่ที่ชัดเจนคือทั้งสองแบบเป็นงานเดียวบน SO-101 pick-and-place: 90 เทียบกับ 70 ในการกระจายตัว, 50 เทียบกับ 40 นอกเหนือจากนั้น. เปรียบเทียบที่ ACT เทียบกับ SmolVLA และ Pi0.5 เทียบกับ SmolVLA, หรือเรียกดู สนามประลอง.

ความหน่วงและต้นทุนเป็นตัวตัดสินการนำไปใช้งาน

เวลาแฝงของการอนุมาน เป็นข้อจำกัดที่คนมักจะค้นพบเป็นอันดับสุดท้ายและ เสียใจเป็นอันดับแรก นโยบายที่ทำคะแนนได้ดีกว่าห้าจุดในการทดสอบมาตรฐาน แต่ใช้เวลาครึ่งวินาทีต่อขั้นตอนการกระทำนั้นดูแย่กว่าเมื่ออยู่บนโต๊ะทำงานของคุณ: พลวัตการสัมผัสไม่รอใคร

ข้อควรระวัง: ตัวเลขของ GR00T ไม่ตรงกับข้อมูลของ NVIDIA ซึ่งระบุว่าใช้เวลา 4 ขั้นตอนการลดสัญญาณรบกวนและ กล้องหนึ่งตัวใช้เวลา 85.8 ms บน H100 ในโหมด eager, 48.6 ms เมื่อใช้ torch.compile, 27.9 ms เมื่อใช้ TensorRT เต็มรูปแบบ ตัวเลข 152 ms ในที่นี้เป็นตัวเลขรวมทั้งระบบที่มีค่าใช้จ่ายในการให้บริการและกล้องมากกว่าหนึ่งตัว ไม่ใช่แค่การส่งผ่านไปข้างหน้า

การอนุมานระยะไกลมีข้อจำกัดที่ชัดเจน

ลูป 20 ถึง 485 ms เป็นของโมเดล และการเดินทางไปกลับผ่านอินเทอร์เน็ตสาธารณะก็เพิ่มเวลาเข้าไปอีก การอนุมานระยะไกลสามารถทำได้สำหรับงานหยิบและวางที่ช้า แต่ไม่เหมาะสำหรับการเคลื่อนไหวตอบสนองที่รวดเร็ว หากงานของคุณต้องการความเร็ว การอนุมานควรอยู่ใกล้กับเซอร์โว: ACT หรือ SmolVLA, ทำงานในเครื่อง ที่เกี่ยวข้อง: นโยบายหยุดชะงักกลางคัน.

วิธีหนึ่งในการประหยัดเวลาโดยไม่ต้องเปลี่ยนโมเดล: เอกสาร SmolVLA วัดผลการทำงานแบบซิงโครนัส ซึ่ง นโยบายจะทำงานเสร็จสิ้นเป็นส่วนๆ ก่อนที่จะคาดการณ์ส่วนถัดไป เทียบกับการทำงานแบบอะซิงโครนัส ซึ่งการคาดการณ์จะทับซ้อนกับการทำงาน ความสำเร็จใกล้เคียงกัน, 78.3 เทียบกับ 73.3, แต่งานหยิบและวางแบบเดียวกันใช้เวลา 9.7 วินาที แทนที่จะเป็น 13.75 วินาที และใน ช่วงเวลาที่กำหนด หุ่นยนต์สามารถจัดการได้ 19 รอบ แทนที่จะเป็น 9 รอบ

ใบอนุญาต ตรวจสอบแล้วเพราะไม่มีใครตรวจสอบ

โมเดลใบอนุญาตน้ำหนักโมเดลใบอนุญาตโค้ดการใช้งานเชิงพาณิชย์
GR00T N1.7NVIDIA Open Model License; การ์ดอนุญาตให้ใช้งานเชิงพาณิชย์Apache 2.0ใช่
GR00T N1.5ใบอนุญาตแบบไม่เชิงพาณิชย์ทางเดียวของ NVIDIAApache 2.0ไม่
Pi0.5ข้อมูลเมตาของการ์ด pi05_base ระบุใบอนุญาต: gemmaApache 2.0 (openpi, เอกสาร LeRobot)อ่านทั้งสองแล้วไม่ตรงกัน
SmolVLAไม่มีช่องใบอนุญาตบนการ์ด smolvla_baseApache 2.0 (LeRobot)โค้ดใช่, น้ำหนักโมเดลไม่ได้ระบุ
ACTไม่มีน้ำหนักโมเดลพื้นฐานอยู่Apache 2.0 (LeRobot)ใช่

แถว Pi0.5 ต้องระมัดระวัง เอกสาร LeRobot pi05 ระบุ Apache 2.0 ซึ่งสอดคล้องกับ openpi, ในขณะที่การ์ด Hub สำหรับ lerobot/pi05_base ระบุ license: gemma. ทั้งสองยังใช้งานอยู่ GR00T N1.7 มี เวอร์ชันที่ผ่อนปรนกว่า: README ของ Isaac-GR00T กล่าวโดยบังเอิญว่า N1.7 สามารถให้ใบอนุญาตเชิงพาณิชย์ได้อย่างสมบูรณ์ภายใต้ Apache 2.0, ในขณะที่ส่วนใบอนุญาตของมันเองและการ์ดโมเดลระบุว่าโค้ดอยู่ภายใต้ Apache 2.0 และน้ำหนักโมเดลอยู่ภายใต้ NVIDIA Open Model License.

ค่าเริ่มต้นที่คุณจะใช้งานจริง

แต่ละฟอร์มเทรนเนอร์มาพร้อมค่าเริ่มต้น และค่าเหล่านี้ไม่ใช่ค่าสุ่ม ACT's เป็นของ LeRobot เอง: batch 8, lr 1e-5, 100000 ขั้นตอนการฝึก, chunk size 100, matching ACTConfig upstream and k=100 from the ACT paper. คอลัมน์หนึ่งด้านล่างนี้คือกับดัก

นโยบายแบทช์LRจำนวนขั้นตอนสูงสุดการสะสมเกรเดียนต์ใช้ได้หรือไม่?ตัวปรับแต่งเพิ่มเติม
GR00T N1.7321e-4200001ใช่saveSteps
GR00T N1.511e-5200016ใช่saveSteps
Pi0.515e-53000016ไม่ (lerobot 0.5.1)seed, logFreq
SmolVLA21e-4200008ไม่seed, logFreq
ACT81e-51000001ไม่chunkSize, nActionSteps, seed, logFreq
ความสามารถในการทำซ้ำ, ลงวันที่สิงหาคม 2026

จุดเริ่มต้นการปรับแต่ง (fine-tuning) ของ GR00T (launch_finetune.py, ซึ่งเป็น tyro CLI) ไม่มีฟิลด์ seed ใน config dataclass ทำให้การรันไม่สามารถทำซ้ำได้แบบบิตต่อบิต รีโพซิทยังเตือนถึง ความแปรปรวน 5 ถึง 6 เปอร์เซ็นต์ระหว่างการรัน จากการเพิ่มประสิทธิภาพรูปภาพที่ไม่เป็นไปตามกำหนด ซึ่งมีขนาดใหญ่กว่าช่องว่างของเกณฑ์มาตรฐานส่วนใหญ่ที่ถกเถียงกันทางออนไลน์ ค่า seed เริ่มต้นของ LeRobot คือ 1000 คอลัมน์ grad-accum อธิบายถึง lerobot 0.5.1; ส่วนเวอร์ชัน 0.6.2 ที่อยู่ต้นน้ำเปิดเผยเป็น --accelerator.gradient_accumulation.steps

ตัวปรับแต่งที่สำคัญกว่าการเลือกรุ่นโมเดล

นี่คือส่วนของชุดการกระทำ (action chunk) ชุดการกระทำที่ยาวขึ้นจะให้การเคลื่อนไหวที่ราบรื่นขึ้นและมีข้อผิดพลาดสะสมน้อยลง แต่ นโยบายจะถูกผูกมัดในขณะที่บล็อกทำงาน ดังนั้นจึงตอบสนองช้าต่อสิ่งใดก็ตามที่เคลื่อนไหว: มั่นใจเมื่ออยู่บน ลูกบาศก์ที่อยู่นิ่ง แต่ไร้หวังเมื่ออยู่บนลูกบาศก์ที่กำลังกลิ้ง หากมีการเคลื่อนที่เกินเป้าหมาย การลดความยาวของส่วนที่ดำเนินการจะดีกว่าการฝึกใหม่ และไม่มีค่าใช้จ่าย ข้อต่อที่หยุดสั้นเป็นปัญหาที่แตกต่างกัน; ดู .

  • ACT: ACTConfig มีค่าเริ่มต้นเป็น chunk_size 100 และ n_action_steps 100. การรวมแบบชั่วคราว (Temporal ensembling) ถูกปิดและต้องใช้ n_action_steps 1.
  • GR00T N1.7: internal horizon เปลี่ยนจาก 16 เป็น 40 แต่ตัวอย่าง SO-101 ของ LeRobot ยังคงรัน --policy.chunk_size=16 --policy.n_action_steps=16. แฟล็ก rollout ถูกเปลี่ยนชื่อเป็น --execution-horizon.
  • Pi0.5: ชุดการกระทำ 50 ขั้นตอน ซึ่งสูตร LIBERO ของ LeRobot ดำเนินการ 10 ขั้นตอนผ่าน --policy.n_action_steps=10; ด้วย --policy.pretrained_path มันจะกลับไปใช้ 50 หากคุณละเว้นแฟล็กนี้.
  • SmolVLA: ชุดการกระทำ 50 ขั้นตอน โดยมีตัวปรับแต่งทั้งสองเปิดเผย.

วิธีคัดกรองทั้งห้าแบบในบ่ายวันเดียว

คำตอบที่ถูกที่สุดไม่ใช่การอ่านเพิ่มเติม ใช้เงินประมาณ 15 USD และให้แขนหุ่นยนต์บอกคุณ: บันทึกข้อมูลเพียงครั้งเดียว ฝึกโมเดลราคาถูกก่อน แล้วค่อยขยายผลเมื่อข้อมูลได้รับการพิสูจน์ว่าถูกต้อง โครงสร้างสำคัญกว่าปริมาณ ซึ่งเป็นจุดประสงค์ของ และ .

  1. 1
    บันทึก 50 ตอนในครั้งเดียว

    50 ตอนช่วยให้ GR00T, Pi0.5 และ ACT รวมถึง SmolVLA 30 ตอนมีพื้นที่ทำงาน ทำซ้ำแต่ละรูปแบบแทนที่จะกระจายบางๆ: 50 ตอนใน 5 ตำแหน่งลูกบาศก์ที่ได้รับการฝึกฝน ในขณะที่ 25 ตอนไม่ได้ฝึก ดู บันทึกชุดข้อมูลแรกของคุณ

    bash
    lerobot-record \
      --robot.type=so100_follower \
      --robot.port=/dev/ttyACM1 \
      --robot.id=my_follower_arm \
      --teleop.type=so100_leader \
      --teleop.port=/dev/ttyACM0 \
      --teleop.id=my_leader_arm \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --dataset.num_episodes=50 \
      --dataset.single_task="Put the lego brick into the box"
  2. 2
    ฝึก ACT ก่อน เพราะมันโกหกคุณไม่ได้

    ไม่มีน้ำหนักที่ฝึกไว้ล่วงหน้า ดังนั้นหากมันทำงานได้เลย แสดงว่าชุดข้อมูลของคุณมีงานนั้นอยู่แล้ว หาก ACT ไม่ตอบสนอง ให้แก้ไขข้อมูล ใช้เวลา 1 ถึง 3 USD, 2 ถึง 5 ชั่วโมงบนการ์ด 24 GB

    bash
    lerobot-train \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --policy.type=act \
      --policy.device=cuda \
      --batch_size=8 \
      --steps=100000 \
      --seed=1000 \
      --output_dir=outputs/train/act_pickplace \
      --job_name=act_pickplace
  3. 3
    รัน SmolVLA บนชุดข้อมูลเดิม โดยไม่มีการเปลี่ยนแปลง

    ข้อมูลเดิม แขนเดิม พารามิเตอร์ 450 M แทนที่จะเป็น 80 M พร้อมกับการปรับสภาพภาษา LeRobot ใช้เวลาประมาณ 4 ชั่วโมงสำหรับการรัน 20K ขั้นตอนบน A100 หนึ่งตัว นี่คือสิ่งที่บอกคุณว่าการฝึกอบรมล่วงหน้ามีประโยชน์หรือไม่

    bash
    lerobot-train \
      --policy.path=lerobot/smolvla_base \
      --dataset.repo_id=${HF_USER}/pick-place-50 \
      --batch_size=64 \
      --steps=20000 \
      --policy.device=cuda \
      --output_dir=outputs/train/smolvla_pickplace \
      --job_name=smolvla_pickplace
  4. 4
    แปลงเป็น v2.1 ก่อนที่คุณจะใช้ GR00T

    GR00T อ่านรูปแบบ LeRobot v2 พร้อมกับไฟล์ meta/modality.json เพิ่มเติมที่แมปวิธีการแยกอาร์เรย์สถานะและการกระทำที่เชื่อมต่อกันออกเป็นฟิลด์ที่มีชื่อ ชุดข้อมูล v3.0 จะทำให้ตัวโหลดนั้นขัดข้อง เนื่องจาก v3.0 บรรจุหลายตอนลงในไฟล์ที่ใช้ร่วมกัน ในขณะที่ v2 เขียนหนึ่งไฟล์ต่อหนึ่งตอน Isaac-GR00T มีตัวช่วยดาวน์เกรดเป็น scripts/lerobot_conversion/convert_v3_to_v2.py; หน้าการปฏิเสธ v3 คือเส้นทางที่รวดเร็ว

    text
    # GR00T expects this layout, not the v3.0 file-based one
    my_dataset/
      meta/
        info.json
        episodes.jsonl      # episode index and lengths
        tasks.jsonl         # language task descriptions
        modality.json       # GR00T-specific: state/action/video key mapping
      data/chunk-000/       # parquet, state and action per timestep
      videos/chunk-000/     # one mp4 per episode
  5. 5
    ยกระดับไปใช้ GR00T N1.7 ก็ต่อเมื่อสองวิธีแรกยังไม่สมบูรณ์

    ผ่าน CLI ของ NVIDIA ที่แสดงที่นี่ หรือประเภทนโยบาย groot ของ LeRobot NVIDIA แนะนำ VRAM 40 GB ขึ้นไปสำหรับการปรับแต่งละเอียด และ 16 GB สำหรับการอนุมาน หากเกิด OOM โปรดดู หน้า OOM

    bash
    CUDA_VISIBLE_DEVICES=0 uv run python \
      gr00t/experiment/launch_finetune.py \
      --base-model-path nvidia/GR00T-N1.7-3B \
      --dataset-path demo_data/cube_to_bowl_5 \
      --embodiment-tag NEW_EMBODIMENT \
      --modality-config-path examples/SO100/so100_config.py \
      --num-gpus 1 \
      --output-dir /tmp/test_finetune \
      --max-steps 2000 \
      --global-batch-size 32 \
      --dataloader-num-workers 4

สองวิธีในการรันการคัดกรองนั้น

สามสภาพแวดล้อม เนื่องจากชุดเครื่องมือไม่สามารถทำงานร่วมกันได้ LeRobot บน main คือ 0.6.2 และต้องการ Python 3.12 หรือใหม่กว่า; Isaac-GR00T และ openpi เป็น repo ที่จัดการด้วย uv แยกต่างหาก

bash
# 1. LeRobot: ACT, SmolVLA, Pi0.5 and GR00T N1.7 via --policy.type=groot
pip install "lerobot[smolvla]"
pip install "lerobot[pi]"
pip install "lerobot[groot]"

# 2. GR00T reference implementation and benchmark examples
git clone https://github.com/NVIDIA/Isaac-GR00T

# 3. Physical Intelligence reference implementation
git clone --recurse-submodules https://github.com/Physical-Intelligence/openpi
  • GR00T กำหนดให้ torchcodec 0.8.0 เป็นแบ็กเอนด์วิดีโอเดียว โดยต้องการ FFmpeg 4 ถึง 7 FFmpeg 8 ไม่รองรับ, AV1 ไม่รับประกัน
  • ข้อกำหนดหน่วยความจำของ openpi: การอนุมานสูงกว่า 8 GB, LoRA สูงกว่า 22.5 GB, การปรับแต่งละเอียดเต็มรูปแบบสูงกว่า 70 GB เหตุผลสุดท้ายนี้คือทำไม Pi0.5 จึงเป็นงานของ A100
  • เช่า GPU ด้วยตัวเอง ทำลายทิ้งหลังจากนั้น ประสานเส้นทางจุดตรวจสอบสามชุดด้วยตนเอง

โมเดลพื้นฐานหรือสร้างใหม่ตั้งแต่ต้น

ทางแยกที่แท้จริงไม่ใช่การเลือกรุ่น 3B ใด แต่เป็นการตัดสินใจว่าจะใช้ VLA ที่ผ่านการฝึกอบรมล่วงหน้าเลยหรือไม่ เมื่อพิจารณาว่า ACT เรียนรู้งานสองมือจริงหกงานจากข้อมูลสาธิตประมาณสิบนาทีต่อชิ้น โดยมีพารามิเตอร์ 80M และ ไม่มีการฝึกอบรมล่วงหน้าเลย

การปรับแต่ง VLA ที่ผ่านการฝึกอบรมล่วงหน้า แทนที่จะฝึก ACT ตั้งแต่เริ่มต้น
สิ่งที่คุณจะได้รับ
  • การปรับสภาพด้วยภาษา ACT ไม่มีสิ่งนี้; หนึ่งเช็คพอยต์ของ ACT ทำงานได้หนึ่งงาน
  • ดีกว่าสำหรับวัตถุที่ไม่มีอยู่ในข้อมูลสาธิตของคุณ: บน SO-101, 50% เทียบกับ 40% ของ ACT ที่อยู่นอกการกระจาย
  • ทำงานหลายอย่างได้ทั้งหมด: SmolVLA ทำได้ 78.3% ในสามงาน SO-100 ด้วยเช็คพอยต์เดียว; ACT ถูกรันแบบงานเดียวเท่านั้น
สิ่งที่คุณต้องเสีย
  • ความหน่วง 7.6 ถึง 24 เท่า: 152 ถึง 485 มิลลิวินาทีต่อขั้นตอนการดำเนินการ เทียบกับ 20 มิลลิวินาทีของ ACT
  • ค่าใช้จ่าย 4 ถึง 12 USD ต่อการรัน แทนที่จะเป็น 1 ถึง 3 USD และต้องใช้ A100 แทนการ์ด 24 GB ใดๆ
  • ความเสี่ยงด้านใบอนุญาต รวมถึงโหมดความล้มเหลวของ gated-repo ที่ไม่มีอยู่ในการสร้างตั้งแต่เริ่มต้น
  • น้ำหนักที่ผ่านการฝึกอบรมล่วงหน้าสามารถบดบังชุดข้อมูลที่ไม่ดีได้ การปรับแต่งที่ทำงานได้ครึ่งๆ กลางๆ กับข้อมูลที่เสียหายจะใช้เวลาหนึ่งสัปดาห์ก่อนที่คุณจะตรวจสอบข้อมูล

กรณีการจำลองการรันเก่า

การไล่ตามเช็คพอยต์ปี 2025 ทำให้คุณไม่ต้องเลือกรุ่นโมเดล และเปลี่ยนปัญหาเป็นการตรึงเวอร์ชัน: LeRobot ปัจจุบันปฏิเสธ N1.5 ดังนั้นคุณจึงตรึง lerobot==0.5.1. โดยไม่มีฟิลด์ seed และมีความแปรปรวน 5 ถึง 6 เปอร์เซ็นต์ ระหว่างการรัน การจำลองจึงเป็นเพียงค่าประมาณโดยธรรมชาติ และ มีส่วนของแพลตฟอร์ม

หน้าเปรียบเทียบแบบตัวต่อตัวของ AY-Robots สำหรับ GR00T N1.7 กับ Pi0.5 ซึ่งแสดงจำนวนพารามิเตอร์, ข้อกำหนด GPU, ความหน่วงในการอนุมาน, รูปแบบชุดข้อมูล และจำนวนตอนขั้นต่ำแบบเคียงข้างกัน
การเปรียบเทียบแบบตัวต่อตัวบน /compare/groot-n1-7-vs-pi0-5. โมเดล 3 B ทั้งสองดูเหมือนจะใช้แทนกันได้ในเอกสารสเปก แต่ไม่ใช่: โมเดลหนึ่งต้องการ LeRobot v2.1 อีกโมเดลต้องการ v3.0.

เหลือสองตัวเลือกแล้วใช่ไหม? ACT กับ GR00T N1.7 และ GR00T N1.7 กับ SmolVLA. ข้อมูลดิบอยู่ในรายการอารีน่า: GR00T N1.7, Pi0.5, SmolVLA และ ACT.

แพลตฟอร์มนี้ไม่สามารถช่วยคุณได้ในเรื่องใดบ้าง

  • ไม่สามารถทำให้การอนุมานระยะไกลรวดเร็วได้ ลูป 20 ถึง 485 ms เป็นของโมเดล; การเดินทางไปกลับทางอินเทอร์เน็ตจะเพิ่มเวลาเข้าไปอีก
  • ไม่สามารถปรับแต่ง GR00T หรือ Pi0.5 บนฮาร์ดแวร์ของคุณเองได้ ทั้งสองโมเดลนี้เป็นแบบคลาวด์เท่านั้น; มีเพียง SmolVLA และ ACT เท่านั้นที่ทำงานแบบโลคอล
  • ไม่สามารถแก้ไขชุดข้อมูลได้ Loss ลดลงแต่ policy ไม่ทำงาน เป็นปัญหาข้อมูล, policy ที่ทำงานได้เพียงในการตั้งค่าเดียว เป็นปัญหาความครอบคลุม
  • ไม่สามารถทำให้การรัน GR00T สามารถทำซ้ำได้: การกำหนดค่าต้นน้ำไม่มีฟิลด์ seed

85 โมเดล, 332 ผลลัพธ์การวัดประสิทธิภาพ, ทุกตัวเลขเชื่อมโยงไปยังแหล่งที่มา

ตารางที่สามารถจัดเรียงได้ในหน้านี้: โมเดลวิสัยทัศน์-ภาษา-การกระทำ 85 แบบ, ผลลัพธ์การวัดประสิทธิภาพ 332 รายการ, แต่ละรายการเชื่อมโยงกลับไปยังเอกสารหรือการ์ดโมเดลของมัน

เปิดอารีน่า

การเลือกหนึ่งและดำเนินการต่อ

ค่าเริ่มต้นหนึ่งอย่าง: บันทึก 50 ตอน, ฝึก ACT ด้วยค่าใช้จ่าย 1 ถึง 3 USD เพื่อพิสูจน์ชุดข้อมูล, จากนั้นใช้ SmolVLA กับ ข้อมูลเดียวกัน. รวมกันไม่เกิน 6 USD และสิ่งเหล่านี้จะตอบคำถามที่สำคัญ: การฝึกอบรมล่วงหน้าช่วยได้หรือไม่ หรือ คอขวดอยู่ที่ข้อมูล. ยกระดับไปใช้ GR00T N1.7 สำหรับงานหลายขั้นตอนที่ต้องมีการสัมผัส, ไปใช้ Pi0.5 เมื่อ ฉากเปลี่ยนไป.

คำแนะนำการใช้งานแพลตฟอร์ม: ฝึกนโยบายแรกของคุณ, จากนั้น รันนโยบายแรกของคุณ. เอกสารการฝึกอบรม และ เอกสารชุดข้อมูล ครอบคลุมรูปแบบและโครงสร้าง; หน้า SO-100 และ คู่มือ SO-100 ฉบับสมบูรณ์ ครอบคลุมการสร้างและการปรับเทียบ. ข้อมูลพื้นฐาน: ภาพรวม VLA และ บทความ Pi0 flow-matching. สิ่งที่จะช่วยเพิ่มอัตราความสำเร็จของคุณคือ คู่มือคุณภาพข้อมูล.

ฉันควรฝึกนโยบาย VLA ใดก่อนบน SO-100?

ACT ตามด้วย SmolVLA. ACT ฝึกจากศูนย์ จึงไม่สามารถปกปิดชุดข้อมูลที่ไม่ดีได้ และการรันหนึ่งครั้งมีค่าใช้จ่าย 1 ถึง 3 USD บนการ์ด 24 GB หาก ACT สามารถทำงานได้สำเร็จ ค่าใช้จ่าย 4 ถึง 12 USD สำหรับการรัน GR00T N1.7 หรือ Pi0.5 ก็จะไม่สูญเปล่า

GR00T N1.7 ดีกว่า Pi0.5 จริงหรือ?

บน LIBERO ผลลัพธ์อยู่ในช่วงความคลาดเคลื่อน: 97.0% ในสี่ชุดสำหรับ GR00T N1.7, 96.85% สำหรับ Pi0.5 ที่ 30k สเต็ปใน openpi, 97.5% สำหรับพอร์ต LeRobot ซึ่งทั้งหมดมาจากชุดทดสอบที่แตกต่างกัน ความแตกต่างที่แท้จริงคือ 152 ms ต่อขั้นตอนการกระทำ เทียบกับ 485 ms, ชุดข้อมูล v2.1 เทียบกับ v3.0, และความแม่นยำของเกณฑ์มาตรฐานเทียบกับการสรุปผลในโลกเปิด

ฉันสามารถปรับแต่งโมเดลเหล่านี้บน RTX 4090 เพียงเครื่องเดียวได้หรือไม่?

SmolVLA และ ACT ได้ครับ/ค่ะ ทั้งสองระบุว่าใช้ได้กับ RTX 4090 หรือการ์ด 24 GB ใดๆ และรันได้ในเครื่อง GR00T N1.7, N1.5 และ Pi0.5 ต้องการ A100 หรือ H100 80 GB และใช้งานได้เฉพาะบนคลาวด์เท่านั้น NVIDIA แนะนำ 40 GB หรือมากกว่าสำหรับการปรับแต่ง GR00T; openpi ต้องการพื้นที่มากกว่า 70 GB สำหรับการปรับแต่ง Pi0.5 เต็มรูปแบบ และ 22.5 GB สำหรับ LoRA

ฉันสามารถใช้โมเดลห้าตัวนี้ในเชิงพาณิชย์ได้หรือไม่?

น้ำหนักของ GR00T N1.7 อยู่ภายใต้ข้อตกลงใบอนุญาต NVIDIA Open Model License Agreement ซึ่งระบุว่าครอบคลุมการใช้งานเชิงพาณิชย์ น้ำหนักของ N1.5 ไม่ใช่เชิงพาณิชย์ โค้ดของ SmolVLA เป็น Apache 2.0 ใน LeRobot แต่การ์ด lerobot/smolvla_base ไม่มีฟิลด์ใบอนุญาต ดังนั้นน้ำหนักจึงไม่ได้ระบุไว้ ACT ไม่มีน้ำหนักพื้นฐานที่ต้องมีใบอนุญาต Pi0.5 ยังคลุมเครือ: เอกสารของ LeRobot ระบุว่าเป็น Apache 2.0 แต่เมตาดาต้าของการ์ดอ่านว่า license: gemma

Sources

Sources

Ready for high-quality robotics data?

AY-Robots connects your robots to skilled operators worldwide.

Get Started