
การจำลองสามารถเพิ่มจำนวนการสาธิตเพียงไม่กี่ครั้งให้กลายเป็นหลายพันครั้งได้ นี่คือสิ่งที่ตัวเลขที่เผยแพร่ระบุไว้จริง ๆ ช่องว่างระหว่าง sim-to-real ส่งผลกระทบอย่างไร และสิ่งที่ยังคงต้องบันทึก
ทุกๆ สองสามเดือน จะมีคนพบว่าการบันทึกห้าสิบ ตอน ด้วยมือเป็นเรื่องช้า และตั้งคำถามว่าเครื่องจำลองสามารถสร้างข้อมูลเหล่านี้แทนได้หรือไม่ เป็นคำถามที่สมเหตุสมผล คำตอบที่ตรงไปตรงมามีสามส่วน: ข้อมูลที่สร้างขึ้นช่วยได้จริง แต่ไม่สามารถทดแทนการบันทึกจริงได้ และอัตราส่วนระหว่างข้อเท็จจริงทั้งสองนี้ขึ้นอยู่กับประเภทของข้อมูลสังเคราะห์ที่คุณหมายถึงโดยสิ้นเชิง
หน้านี้จะอธิบายถึงสิ่งที่งานวิจัยที่ตีพิมพ์ได้วัดผลจริง สิ่งที่คุณสามารถใช้งานได้ในปัจจุบันบนแขนกลราคาประหยัด เช่น SO-100 และจุดที่ช่องว่างระหว่างการจำลองกับโลกจริง (sim-to-real gap) ทำให้ผลลัพธ์ลดลง สรุปสั้นๆ ก่อนลงรายละเอียด: ระบบที่รายงานตัวคูณที่ใหญ่ที่สุดจะเพิ่มจำนวนการสาธิตของมนุษย์จริงเพียงชุดเล็กๆ พวกมันไม่ได้กำจัดความจำเป็นในการสาธิตเหล่านั้นออกไป
สิ่งที่คุณต้องรู้
- •เทคนิคสี่อย่างที่ไม่เกี่ยวข้องกันถูกเรียกว่าข้อมูลสังเคราะห์ในการจัดการ: การเพิ่มจำนวนวิถีการเคลื่อนที่ (trajectory multiplication), การจำลองทางฟิสิกส์ (physics rollouts), โมเดลโลกจากวิดีโอ (video world models) และการเพิ่มข้อมูลในพื้นที่ภาพ (image-space augmentation) พวกมันล้มเหลวในรูปแบบที่แตกต่างกันและมีคุณค่าต่างกัน
- •MimicGen เปลี่ยนการสาธิตของมนุษย์ไม่ถึง 200 ครั้ง ให้กลายเป็นการสาธิตที่สร้างขึ้นมากกว่า 50,000 ครั้ง ใน 18 งาน สำหรับงาน Square D0 ของมัน การสาธิต 200 ครั้งที่สร้างจาก 10 การสาธิตของมนุษย์ ให้ผลสำเร็จ 79 เปอร์เซ็นต์ เทียบกับ 84 เปอร์เซ็นต์ สำหรับการสาธิตของมนุษย์จริง 200 ครั้ง
- •RoboCasa เป็นตัวอย่างที่ตรงกันข้าม: การสาธิตที่สร้างขึ้น 72,000 ครั้ง ได้คะแนน 47.6 เปอร์เซ็นต์ เทียบกับ 28.8 เปอร์เซ็นต์ สำหรับการสาธิตของมนุษย์ 1,250 ครั้ง นั่นคือความได้เปรียบด้านปริมาณ 58 เท่า ไม่ใช่การชนะแบบเทียบเท่ากัน
- •การศึกษาการฝึกร่วมกันระหว่างการจำลองและโลกจริง (sim-and-real co-training) รายงานการปรับปรุงประสิทธิภาพงานในโลกจริงโดยเฉลี่ย 38 เปอร์เซ็นต์ สูตรคือการฝึกร่วมกันบนข้อมูลผสม ไม่ใช่การถ่ายโอนจากการจำลองเพียงอย่างเดียว
- •GR00T N1 ใช้เส้นทางการจำลอง 780,000 เส้นทาง (เทียบเท่า 6,500 ชั่วโมง สร้างขึ้นใน 11 ชั่วโมง) และเส้นทางประสาท 827 ชั่วโมงที่พัฒนาจากการทำงานจริง 88 ชั่วโมง การทำงานจริง 88 ชั่วโมงเหล่านั้นยังคงเป็นจุดสูงสุดของพีระมิด
- •สำหรับ SO-101 มีไปป์ไลน์แบบเปิดที่ใช้งานได้ในปัจจุบัน: LeIsaac ภายใน Isaac Lab, ควบคุมระยะไกลด้วยแขนกลนำทางจริง, เพิ่มจำนวนด้วย Isaac Lab Mimic, ส่งออกเป็นรูปแบบ LeRobot, ปรับแต่ง GR00T
- •AY-Robots ไม่ได้สร้างข้อมูลสังเคราะห์ มันฝึกฝนจากชุดข้อมูล LeRobot ที่คุณมอบให้ ไม่ว่าชุดข้อมูลนั้นจะถูกสร้างขึ้นด้วยวิธีใด และผู้ฝึกสอนต้องการอย่างน้อย 30 ถึง 50 ตอน ขึ้นอยู่กับโมเดล
สี่สิ่งแตกต่างกันที่ถูกเรียกว่าข้อมูลสังเคราะห์
ก่อนที่จะเปรียบเทียบตัวเลข ควรแยกประเภทของงานออกเป็นกลุ่มๆ เพราะงานวิจัยที่รายงานตัวคูณ 100 เท่า และงานวิจัยที่รายงานการเพิ่มขึ้นของความสำเร็จ 5 จุด มักจะอธิบายไปป์ไลน์เดียวกันจากมุมมองที่ต่างกัน จุดร่วมคือบางสิ่งใน ชุดข้อมูล LeRobot ถูกสร้างขึ้นโดยเครื่องจักร แทนที่จะบันทึกจากแขนหุ่นยนต์จริง สิ่งที่แตกต่างกันคือส่วนไหน
| ประเภท | สิ่งที่ยังคงเป็นของจริง | สิ่งที่ถูกสร้างขึ้น | ตัวคูณที่รายงาน | โหมดความล้มเหลวหลัก |
|---|---|---|---|---|
| การเพิ่มจำนวนวิถีการเคลื่อนที่ (MimicGen, DexMimicGen, Isaac Lab Mimic) | การสาธิตของมนุษย์จำนวนหนึ่ง, โมเดลวัตถุ, เอนจินฟิสิกส์ | วิถีการเคลื่อนที่ใหม่ที่ปรับให้เข้ากับท่าทางวัตถุและการจัดวางฉากใหม่ | 10 human demos to 1,000 per reset distribution; 60 to 21,000; under 200 to over 50,000 | ความพยายามในการสร้างล้มเหลว Isaac Lab ระบุอัตราความสำเร็จของผู้สมัครสูงถึง 70 เปอร์เซ็นต์ในกรณีง่ายๆ และต่ำกว่า 1 เปอร์เซ็นต์ในกรณีที่ยาก |
| การจำลองฟิสิกส์ในโปรแกรมจำลองงาน (Isaac Lab, robosuite, RoboCasa) | เอนจินฟิสิกส์และไลบรารีสินทรัพย์ | ทั้งตอนที่ขับเคลื่อนโดยคอนโทรลเลอร์ที่เขียนสคริปต์, ผู้วางแผน หรือ RL | จำกัดด้วยชั่วโมงการใช้งาน GPU เท่านั้น | แขนจำลองไม่ใช่แขนของคุณ การสัมผัสและไดนามิกของเซอร์โวเป็นเพียงการประมาณค่า |
| โมเดลโลกวิดีโอ (DreamGen, Cosmos Transfer) | ตอนการควบคุมระยะไกลจริงบางส่วนที่ใช้เป็นเงื่อนไข | วิดีโอที่สมจริงของพฤติกรรมใหม่ พร้อมกับการกระทำเทียมที่กู้คืนได้ในภายหลัง | 88 hours to 827 hours in GR00T N1, about 10x | การกระทำถูกอนุมาน ไม่ได้วัดผล วิดีโอที่ดูน่าเชื่อถืออาจมีการกระทำที่ไม่น่าเชื่อถือ |
| การเพิ่มข้อมูลในพื้นที่ภาพ (random crop, colour jitter) | ทุกอย่างยกเว้นพิกเซล | มุมมองที่ถูกรบกวนของตอนที่คุณมีอยู่แล้ว | 1x, ไม่สร้างวิถีการเคลื่อนที่ใหม่ | การเพิ่มข้อมูลทางเรขาคณิตทำลายความเชื่อมโยงระหว่างภาพและป้ายกำกับการกระทำ |
มีเพียงสามประเภทแรกเท่านั้นที่เป็นข้อมูลสังเคราะห์ในความหมายของบทความนี้ ประเภทที่สี่ควรกล่าวถึงเพราะมักถูกรวมอยู่ในการสนทนาเดียวกัน และเป็นสิ่งที่ถูกที่สุดในรายการ หากคุณยังไม่ได้เปิดใช้งานการเพิ่มข้อมูลที่มาพร้อมกับเทรนเนอร์ของคุณ ให้ทำเช่นนั้นก่อนที่คุณจะติดตั้งโปรแกรมจำลอง
NVIDIA ได้เผยแพร่วิถีการเคลื่อนที่จำลองที่ใช้สำหรับการฝึกหลัง GR00T N1 เป็น nvidia/PhysicalAI-Robotics-GR00T-X-Embodiment-Sim บน Hugging Face ขนาดประมาณ 1.87 TB ภายใต้ใบอนุญาต cc-by-4.0 ซึ่งแบ่งออกเป็นวิถีการเคลื่อนที่ของ Panda และ GR1 แบบสองมือที่ข้ามร่าง 9,000 ชุด, วิถีการเคลื่อนที่ของหุ่นยนต์ฮิวแมนนอยด์บนโต๊ะ 240,000 ชุด, วิถีการเคลื่อนที่ของ Panda เดี่ยวในครัว 72,000 ชุด และวิถีการเคลื่อนที่แบบ loco-manipulation ของ Unitree G1 102 ชุด การดาวน์โหลดชุดย่อยหนึ่งด้วย huggingface-cli download --include "gr1_arms_only.CanSort/**" และดูบางตอนเป็นวิธีที่เร็วที่สุดในการปรับเทียบว่าวิถีการเคลื่อนที่ที่สร้างขึ้นมีลักษณะอย่างไร และไม่มีค่าใช้จ่ายใดๆ นอกจากแบนด์วิดท์
สิ่งที่ตัวเลขที่เผยแพร่ระบุไว้จริง ๆ
นี่คือฐานข้อมูลหลักฐาน โดยมีตัวเลขตามที่แหล่งที่มาระบุไว้ แทนที่จะเป็นสรุปจากข่าวประชาสัมพันธ์ แต่ละแถวด้านล่างมาจากเอกสารวิชาการหรือหน้าโครงการที่อ่านเมื่อวันที่ 23 สิงหาคม 2026
| ระบบ | ข้อมูลนำเข้า | ข้อมูลที่สร้างขึ้น | ผลลัพธ์ที่รายงาน |
|---|---|---|---|
| MimicGen, CoRL 2023 | การสาธิตโดยมนุษย์น้อยกว่า 200 ครั้ง; การสาธิตโดยมนุษย์ 10 ครั้งในการเปรียบเทียบแบบตัวต่อตัว | การสาธิตมากกว่า 50,000 ครั้ง, 18 งาน, แขนหุ่นยนต์สี่แบบ (Panda, Sawyer, IIWA, UR5e) | Square D0: 79 เปอร์เซ็นต์จากการสาธิต 200 ครั้งที่สร้างขึ้นจากการสาธิตโดยมนุษย์ 10 ครั้ง เทียบกับ 84 เปอร์เซ็นต์จากการสาธิตโดยมนุษย์ 200 ครั้ง |
| DexMimicGen, 2024 | การสาธิตโดยมนุษย์ที่เป็นแหล่งข้อมูล 60 ครั้ง | การสาธิต 21,000 ครั้งสำหรับหุ่นยนต์สองแขนที่มีความคล่องแคล่ว | งานที่ต้องใช้ความคล่องแคล่วสองแขนในการจำลอง รวมถึงการปรับใช้หุ่นยนต์ฮิวแมนนอยด์สำหรับการคัดแยกกระป๋องจากโลกจริงสู่การจำลองสู่โลกจริง |
| RoboCasa, 2024 | การสาธิตโดยมนุษย์ 1,250 ครั้ง (50 ครั้งต่องานจาก 25 งานย่อย), งานประเมิน 100 งาน, หมวดหมู่วัตถุมากกว่า 150 หมวดหมู่ | วิถีการเคลื่อนที่ MimicGen 100,000 ชุด; ชุดย่อยของการสาธิต 72,000 ครั้งเป็นตัวขับเคลื่อนการเปรียบเทียบหลัก | 28.8 เปอร์เซ็นต์โดยรวมในชุดข้อมูลมนุษย์ เทียบกับ 47.6 เปอร์เซ็นต์ในชุดข้อมูลที่สร้างขึ้นทั้งหมด ประเมินเฉพาะกับอินสแตนซ์วัตถุที่ไม่เคยเห็น |
| Sim-and-real co-training, 2025 | การสาธิตจริงบวกกับชุดข้อมูลจำลอง, สองโดเมน (แขนหุ่นยนต์และฮิวแมนนอยด์) | เป็นการผสมผสาน ไม่ใช่การทดแทน | ข้อมูลจำลองช่วยเพิ่มประสิทธิภาพงานในโลกจริงโดยเฉลี่ย 38 เปอร์เซ็นต์ |
| DreamGen, 2025 | ข้อมูลการควบคุมระยะไกลจากงานหยิบและวางเพียงงานเดียวในสภาพแวดล้อมเดียว | วิดีโอสังเคราะห์บวกกับการกระทำเทียมจากโมเดลการกระทำแฝงหรือโมเดลพลวัตผกผัน | พฤติกรรมใหม่ 22 อย่างบนหุ่นยนต์ฮิวแมนนอยด์ ทั้งในสภาพแวดล้อมที่เคยเห็นและไม่เคยเห็น |
| GR00T N1 data pyramid, 2025 | การควบคุมระยะไกล GR-1 ภายในองค์กร 88 ชั่วโมง | วิถีการเคลื่อนที่ของโครงข่ายประสาท 827 ชั่วโมง (ประมาณ 10 เท่า); วิถีการเคลื่อนที่จำลอง 780,000 ชุด, เทียบเท่า 6,500 ชั่วโมง, ผลิตภายใน 11 ชั่วโมง | วิถีการเคลื่อนที่ของโครงข่ายประสาทเพิ่ม 4.2, 8.8 และ 6.8 คะแนนบน RoboCasa ที่โหมดการสาธิต 30, 100 และ 300 ครั้งต่องาน และเฉลี่ย 5.8 คะแนนใน 8 งาน GR-1 จริง |
ตัวคูณคือจำนวนแถว การเปรียบเทียบแบบตัวต่อตัวของ MimicGen เองแสดงให้เห็นว่าข้อมูลที่สร้างขึ้นอยู่ ต่ำกว่า จำนวนข้อมูลมนุษย์ที่เท่ากันเล็กน้อย (79 เทียบกับ 84 เปอร์เซ็นต์) และการตัดส่วนของ GR00T N1 เพิ่มคะแนนเปอร์เซ็นต์หลักเดียวจากโมเดลที่มีชั่วโมงจริงอยู่แล้ว RoboCasa เอาชนะข้อมูลมนุษย์ได้ 47.6 เทียบกับ 28.8 เปอร์เซ็นต์ แต่ด้วยการสาธิตที่สร้างขึ้น 72,000 ครั้ง เทียบกับการสาธิตโดยมนุษย์ 1,250 ครั้ง ปริมาณซื้อความครอบคลุมได้ แต่ไม่ได้ซื้อข้อมูลที่การสาธิตของคุณไม่เคยมี
รูปแบบของการทดสอบ ablation ที่ซื่อสัตย์ทุกครั้งนั้นเหมือนกัน ข้อมูลสังเคราะห์ช่วยขยายขอบเขตการครอบคลุมได้ในราคาถูก มันไม่ได้สร้างข้อมูลเกี่ยวกับกริปเปอร์ของคุณ, การหย่อนของเซอร์โว, แสงสว่าง หรือความสูงของโต๊ะของคุณที่ไม่ได้มีอยู่ในการสาธิตจริงที่ใดที่หนึ่ง หาก นโยบาย ล้มเหลวเนื่องจาก ส่วนปลายแขนกล ปิดช้าไปครึ่งวินาที การจำลองความหลากหลายเท่าใดก็ไม่สามารถแก้ไขได้ นั่นคือ ปัญหาเรื่องเวลาของกริปเปอร์ ในการบันทึกจริง
ข้อค้นพบหนึ่งจาก MimicGen ที่ควรนำไปใช้ในการบันทึกข้อมูลของคุณเอง เพราะมันขัดแย้งกับคำแนะนำทั่วไป โครงการนี้สร้างชุดข้อมูลสองชุดบน Square D2 โดยชุดหนึ่งใช้ข้อมูลเริ่มต้น 10 การสาธิตจากผู้ปฏิบัติงานที่มีคุณภาพดีกว่า และอีกชุดใช้ข้อมูลเริ่มต้น 10 การสาธิตจากผู้ปฏิบัติงานที่มีคุณภาพด้อยกว่า ซึ่งทั้งสองชุดนำมาจากชุดข้อมูล robomimic multi-human Square นโยบายที่ฝึกจากแต่ละชุดข้อมูลให้ผลลัพธ์ที่เทียบเคียงกันได้ ซึ่งผู้เขียนตีความว่าเป็นสัญญาณว่าในระบบข้อมูลขนาดใหญ่ คุณภาพของข้อมูลอาจไม่สำคัญเท่าที่ควร โปรดอ่านอย่างละเอียด นั่นคือข้อความเกี่ยวกับข้อมูลเริ่มต้น 10 การสาธิต ไม่ใช่เกี่ยวกับ 50 ตอนจริงของคุณ นั่นหมายความว่าชุดข้อมูลเริ่มต้นที่อาจไม่สมบูรณ์เล็กน้อยไม่ใช่สิ่งที่จะขัดขวางคุณจากการสร้างชุดข้อมูลที่ใช้งานได้ มันไม่ได้หมายความว่าตอนจริงที่คุณใช้ร่วมฝึกสามารถไม่สมบูรณ์ได้ เพราะตอนเหล่านั้นคือส่วนที่บรรจุข้อมูลที่ตัวจำลองไม่มี

ช่องว่างระหว่างการจำลองกับความเป็นจริงอย่างเป็นรูปธรรม
ช่องว่างมักถูกกล่าวถึงในฐานะปริมาณเดียว ซึ่งไม่เป็นประโยชน์ อันที่จริงแล้วมันคือความไม่ตรงกันอย่างน้อยห้าประการ และแต่ละประการมีขนาดที่แตกต่างกันระหว่างแขนหุ่นยนต์สำหรับงานอดิเรกราคา 110 ถึง 150 EUR กับแขนหุ่นยนต์ Franka
- การสัมผัสและแรงเสียดทาน. Isaac Lab ระบุไว้อย่างชัดเจนว่า หากใช้ฮาร์ดแวร์เดียวกันและ Isaac Sim กับ PhysX เวอร์ชันเดียวกัน การจำลองสามารถทำซ้ำได้ แต่ผลลัพธ์จะแตกต่างกันไปในแต่ละการกำหนดค่าฮาร์ดแวร์เนื่องจากความแม่นยำของจุดทศนิยมและข้อผิดพลาดในการปัดเศษ และ PhysX ไม่รับประกันความแน่นอนสำหรับฉากใดๆ ที่มีวัตถุที่ไม่แข็ง เช่น ผ้าหรือวัตถุอ่อนนุ่ม
- การขับเคลื่อน. เซอร์โวบัส Feetech STS3215 ที่ทำงานที่ 7.4 V จะหย่อนคล้อยภายใต้ภาระ มีระยะฟรี และเปลี่ยนพฤติกรรมเมื่อร้อนขึ้น โมเดล MJCF สำหรับ SO-101 ยืมพารามิเตอร์มอเตอร์มาจากโปรเจกต์ที่ไม่เกี่ยวข้อง แทนที่จะระบุพารามิเตอร์เหล่านั้นบนแขนหุ่นยนต์ของคุณ
- การเรนเดอร์. สัญญาณรบกวนของกล้อง, rolling shutter, การเปิดรับแสงอัตโนมัติ และเฉดสีที่แท้จริงของโต๊ะของคุณไม่ได้อยู่ในภาพเรนเดอร์ นี่คือครึ่งหนึ่งของช่องว่างที่ Cosmos-Transfer1 ถูกสร้างขึ้นมาเพื่อปิด: เวิร์กโฟลว์การเสริมประสิทธิภาพหุ่นยนต์นี้จะแมปตัวอย่างสังเคราะห์ของหุ่นยนต์หนึ่งตัวอย่างไปยังตัวอย่างที่สมจริงหลายตัวอย่างจากการแบ่งส่วน, ความลึก หรือการปรับสภาพขอบ
- การจับเวลา. ซิมูเลเตอร์จะทำงานตามอัตราที่กำหนด วงจรควบคุมจริงไม่ได้เป็นเช่นนั้น และตัวโมเดลเองมีค่าใช้จ่าย 20 ถึง 485 ms ต่อขั้นตอนการกระทำ ขึ้นอยู่กับว่าคุณเลือกโมเดลใด ดู เวลาแฝงของการอนุมาน
- สถิติวัตถุ. ฉากจำลองถูกสุ่มตัวอย่างจากการกระจายที่ใครบางคนเขียนขึ้น โต๊ะในครัวของคุณไม่ได้เป็นเช่นนั้น
สิ่งที่ SO-100 จำลองรู้เกี่ยวกับแขนหุ่นยนต์ของคุณจริงๆ
นี่คือส่วนที่ตัดสินว่าสิ่งใดข้างต้นคุ้มค่ากับวันหยุดสุดสัปดาห์ของคุณหรือไม่ และความประหลาดใจแรกคือ SO-100 และ SO-101 ไม่ได้รับการสนับสนุนเท่าเทียมกัน ที่เก็บข้อมูล SO-ARM100 ของ TheRobotStudio เก็บสินทรัพย์การจำลองไว้ภายใต้ Simulation/. โฟลเดอร์ SO100 มีไฟล์ URDF เพียงไฟล์เดียวและไม่มีอะไรอื่น โฟลเดอร์ SO101 มีทั้งไฟล์ URDF และ MuJoCo: scene.xml, so101_new_calib.xml, so101_old_calib.xml, ไฟล์ URDF ที่ตรงกัน และ joints_properties.xml หากคุณต้องการโมเดลฟิสิกส์มากกว่าห่วงโซ่จลนศาสตร์ คุณจะต้องใช้ไฟล์ SO-101
สิ่งเหล่านี้ถูกสร้างขึ้นด้วยปลั๊กอิน onshape-to-robot จากโมเดล CAD ที่ออกแบบใน Onshape ซึ่งหมายความว่าจลนศาสตร์และตาข่ายภาพนั้นดีเท่ากับ CAD พลวัตเป็นอีกเรื่องหนึ่ง และ README ของ repository เองก็ระบุอย่างตรงไปตรงมาเกี่ยวกับสามสิ่ง ตาข่ายการชนของฐานถูกลบออกเนื่องจากพฤติกรรมการชนที่เป็นปัญหาในระหว่างการจำลองและการวางแผน คุณสมบัติของมอเตอร์ STS3215 ถูกปรับมาจากโปรเจกต์ Open Duck Mini แทนที่จะวัดจาก SO-101 และข้อตกลงของ LeRobot gripper ที่ 0 คือปิดสนิทและ 100 คือเปิดสุด ยังไม่ได้สะท้อนอย่างชัดเจนในไฟล์ URDF และ MuJoCo แต่ละจุดเหล่านี้คือที่ที่นโยบายที่ฝึกฝนในโมเดลนั้นอย่างเดียวจะทำงานแตกต่างกันบนโต๊ะของคุณ
มีข้อตกลงศูนย์สองแบบในไฟล์ MuJoCo ที่จัดส่งมา และ scene.xml จะเลือกใช้แบบใดแบบหนึ่งโดยพิจารณาจากไฟล์หุ่นยนต์ที่รวมอยู่ ใน so101_new_calib.xml ซึ่งเป็นค่าเริ่มต้น ศูนย์เสมือนของแต่ละข้อต่อจะอยู่ที่ กึ่งกลาง ของช่วงการเคลื่อนที่ของข้อต่อ ใน so101_old_calib.xml ศูนย์คือการกำหนดค่าที่หุ่นยนต์ยืดออกไปในแนวนอนจนสุด หากตอนจำลองของคุณใช้ข้อตกลงหนึ่ง และตอนจริงที่คุณบันทึกไว้ใช้อีกข้อตกลงหนึ่ง มุมข้อต่อทุกมุมในชุดข้อมูลผสมจะถูกชดเชยไปหลายสิบองศา ค่า loss ยังคงลดลง และนโยบายจะทำสิ่งที่ผิดพลาดอย่างมั่นใจ ตรวจสอบข้อตกลงทั้งสองด้านก่อนที่คุณจะร่วมฝึก และอ่าน การปรับเทียบ และ loss ลดลง แต่นโยบายไม่ทำอะไร ก่อน
การสุ่มโดเมน และสิ่งที่ไม่สามารถแก้ไขได้
คำตอบมาตรฐานสำหรับช่องว่างนี้คือการหยุดพยายามจับคู่ความเป็นจริง และหันไปฝึกฝนในชุดข้อมูลที่มีการกระจายกว้างพอที่ความเป็นจริงจะครอบคลุมอยู่ภายในนั้น Tobin และเพื่อนร่วมงานได้แสดงเวอร์ชันที่แข็งแกร่งของสิ่งนี้ในปี 2017: เครื่องตรวจจับวัตถุที่ฝึกฝนเฉพาะกับภาพจำลองที่มีพื้นผิวสุ่มที่ไม่สมจริง โดยไม่มีการฝึกฝนล่วงหน้าด้วยภาพจริงเลย สามารถระบุตำแหน่งวัตถุจริงได้อย่างแม่นยำถึง 1.5 ซม. และยังคงทนทานต่อสิ่งรบกวนและการบดบังบางส่วน
Isaac Lab นำเสนอแนวคิดเดียวกับเงื่อนไขเหตุการณ์ที่คุณแนบไปกับการกำหนดค่าสภาพแวดล้อม สิ่งเหล่านี้คือตัวปรับแต่ง โดยใช้ชื่อฟังก์ชันจริงใน isaaclab.envs.mdp เพื่อให้คุณสามารถไปอ่านได้แทนที่จะคาดเดา
| ฟังก์ชันเหตุการณ์ | สิ่งที่ถูกรบกวน |
|---|---|
| randomize_rigid_body_material | แรงเสียดทานจากการสัมผัสและการคืนตัว |
| randomize_rigid_body_mass, randomize_rigid_body_com | มวลของวัตถุและลิงก์, การชดเชยจุดศูนย์ถ่วง |
| randomize_actuator_gains | ความแข็งและแรงหน่วงของตัวควบคุมข้อต่อ |
| randomize_joint_parameters, randomize_fixed_tendon_parameters | แรงเสียดทานข้อต่อ, อาร์มาเจอร์ และขีดจำกัด |
| randomize_visual_texture_material, randomize_visual_color | ลักษณะที่ปรากฏ, ครึ่งหนึ่งของช่องว่างที่เกี่ยวข้องกับแสง |
| randomize_physics_scene_gravity | เวกเตอร์แรงโน้มถ่วง |
| apply_external_force_torque, push_by_setting_velocity | การรบกวนระหว่างรันไทม์ |
| reset_root_state_uniform, reset_joints_by_offset | การกระจายสถานะเริ่มต้นในการรีเซ็ตแต่ละตอน |
นี่คือข้อจำกัด และเป็นสิ่งที่ผู้คนมักจะพลาด การสุ่มช่วยขยายการกระจายที่นโยบายได้เห็นภายในโมเดลที่คุณสร้างขึ้น มันไม่สามารถนำเสนอผลกระทบทางกายภาพที่ตัวจำลองไม่ได้แสดง หาก PhysX ไม่ได้จำลองการคลอนตัวและการลดลงจากความร้อนของเซอร์โว STS3215 ของคุณ การสุ่มความแข็งของเซอร์โวนั้นก็ไม่ได้สอนอะไรแก่นโยบายเกี่ยวกับการคลอนตัว นั่นคือเหตุผลว่าทำไมแขนที่ ภายใต้นโยบายที่ฝึกฝนด้วยการจำลองจึงไม่ใช่ปัญหาเรื่องงบประมาณการสุ่ม แต่เป็นปัญหาเรื่องการสร้างแบบจำลอง
เส้นทางแบบแมนนวล: การสร้างข้อมูลใน Isaac Lab
Isaac Gym เป็นซอฟต์แวร์รุ่นเก่า หน้าเว็บของ NVIDIA เองมีหัวข้อว่า "Isaac Gym - ตอนนี้เลิกใช้แล้ว" และระบุว่านักพัฒนาสามารถดาวน์โหลดและใช้งานต่อไปได้ แต่จะไม่ได้รับการสนับสนุนอีกต่อไป โดยแนะนำให้ใช้ Isaac Lab แทน หากคุณต้องการทราบประวัติ เราได้ครอบคลุมทั้งสองอย่างแล้ว: และ . สำหรับงานใหม่ในปี 2026 ให้เริ่มต้นที่ Isaac Lab.
- 1ติดตั้ง Isaac Sim และ Isaac Lab
หน้าการติดตั้ง pip ระบุว่าคำแนะนำนี้สำหรับ Isaac Sim 5.X ซึ่งต้องใช้ Python 3.11 การโคลนซอร์สโค้ดจะให้สคริปต์ที่จำเป็นสำหรับขั้นตอนถัดไป
bashpip install "isaacsim[all,extscache]==5.1.0" \ --extra-index-url https://pypi.nvidia.com git clone https://github.com/isaac-sim/IsaacLab.git --branch main cd IsaacLab sudo apt install cmake build-essential ./isaaclab.sh --install # smoke test ./isaaclab.sh -p scripts/tutorials/00_sim/create_empty.py - 2บันทึกการสาธิตโดยมนุษย์ประมาณสิบครั้ง
เอกสารประกอบของ Isaac Lab ระบุไว้อย่างชัดเจนว่า ต้องมีการสาธิตที่สำเร็จประมาณ 10 ครั้งเพื่อให้ขั้นตอนต่อไปสำเร็จ เคล็ดลับก็เฉพาะเจาะจงเช่นกัน: ทำให้การสาธิตสั้นเข้าไว้ เลือกเส้นทางตรงแทนที่จะเคลื่อนที่ไปตามแกนที่กำหนดเอง และอย่าหยุดชั่วคราว เพราะนโยบายไม่สามารถเข้าใจได้ว่าทำไมและเมื่อใดควรหยุด
bash./isaaclab.sh -p scripts/tools/record_demos.py \ --task Isaac-Stack-Cube-Franka-IK-Rel-v0 \ --device cpu \ --teleop_device spacemouse \ --dataset_file ./datasets/dataset.hdf5 \ --num_demos 10 - 3ใส่คำอธิบายประกอบขอบเขตงานย่อย
Mimic จะแบ่งการสาธิตที่ป้อนเข้าเป็นงานย่อย เพื่อให้สามารถปรับเวลาและกำหนดเป้าหมายส่วนต่างๆ ใหม่ได้ แฟล็ก --auto จะดำเนินการนี้โดยไม่ต้องมีมนุษย์เข้ามาเกี่ยวข้องสำหรับงานที่กำหนดการใส่คำอธิบายประกอบอัตโนมัติ หากไม่มีแฟล็กนี้ คุณจะหยุดชั่วคราวด้วย B, ดำเนินการต่อด้วย N และทำเครื่องหมายขอบเขตด้วย S โปรดทราบว่า ID งานจะได้รับส่วนต่อท้าย -Mimic
bash./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/annotate_demos.py \ --device cpu \ --task Isaac-Stack-Cube-Franka-IK-Rel-Mimic-v0 \ --auto \ --input_file ./datasets/dataset.hdf5 \ --output_file ./datasets/annotated_dataset.hdf5 - 4สร้างชุดข้อมูลที่เพิ่มจำนวน
นี่คือขั้นตอนที่เปลี่ยน 10 เป็น 1000 Mimic ใช้เกณฑ์ความสำเร็จแบบบูลีนกับผู้สมัครแต่ละราย และเก็บเฉพาะผู้ที่ทำงานสำเร็จเท่านั้น ดังนั้นจำนวนผลลัพธ์จึงน้อยกว่าจำนวนการทดลอง เอกสารระบุว่าอัตราความสำเร็จของผู้สมัครสูงถึง 70 เปอร์เซ็นต์ในกรณีง่ายๆ และต่ำกว่า 1 เปอร์เซ็นต์สำหรับงานที่ยากและหุ่นยนต์ที่ซับซ้อน: ประมาณ 50 เปอร์เซ็นต์สำหรับการวางลูกบาศก์ของ Franka และ 65 ถึง 80 เปอร์เซ็นต์สำหรับการหยิบและวางของ GR1T2 โดยที่การสาธิต 1000 ครั้งใช้เวลา 18 ถึง 40 นาที (19 นาทีบน RTX ADA 6000 ที่ 80 เปอร์เซ็นต์)
bash./isaaclab.sh -p scripts/imitation_learning/isaaclab_mimic/generate_dataset.py \ --device cpu \ --num_envs 10 \ --generation_num_trials 1000 \ --headless \ --input_file ./datasets/annotated_dataset.hdf5 \ --output_file ./datasets/generated_dataset.hdf5 - 5แปลง HDF5 เป็นชุดข้อมูล LeRobot
ทุกสิ่งที่กล่าวมาข้างต้นสร้าง robomimic-flavoured HDF5 และ Isaac Lab core ไม่มีตัวแปลง LeRobot ของตัวเอง: เอกสารระบุเพียงว่าคุณสามารถแปลงชุดข้อมูลที่สร้างขึ้นเป็นรูปแบบ LeRobot ได้ มีสองโปรเจกต์ที่จัดหาตัวแปลงจริง IsaacLab-Arena มีตัวแปลงที่มุ่งเป้าไปที่ GR00T ซึ่งขับเคลื่อนโดยการกำหนดค่า YAML ทั้งหมด และ LeIsaac มีคู่ของตัวเองสำหรับเส้นทาง SO-101 (ดูด้านล่าง)
bash# IsaacLab-Arena, GR00T LeRobot format python isaaclab_arena_gr00t/lerobot/convert_hdf5_to_lerobot.py \ --yaml_file isaaclab_arena_gr00t/lerobot/config/gr1_manip_config.yaml
ในวันที่ 23 สิงหาคม 2026 เอกสารประกอบของ Isaac Lab สำหรับ main มีป้าย Isaac Sim 6.0.1 และนำเสนอ release/3.0.0 และ v3.0.0-beta2 ในตัวสลับเวอร์ชันควบคู่ไปกับ v2.3.2 ในขณะที่หน้าการติดตั้ง pip บนโครงสร้างเดียวกันยังคงตรึง isaacsim[all,extscache]==5.1.0 และอธิบายคำแนะนำว่าสำหรับ Isaac Sim 5.X คอนเทนเนอร์พิมพ์เขียว synthetic-manipulation-motion-generation ของ NVIDIA เก่ากว่าอีก: Isaac Lab 2.0.2 บน Isaac Sim 4.5.0 ตารางความเข้ากันได้ของ LeIsaac เองจับคู่ Isaac Sim 5.1 กับ Isaac Lab v2.3.0 โครงสร้างเหล่านี้เคลื่อนที่เร็วกว่าที่เอกสารจะปรับให้เข้ากันได้ เลือกเวอร์ชันเดียว จดบันทึกไว้ และคาดว่าเส้นทางสคริปต์และชื่อแฟล็กจะเปลี่ยนไปหากคุณทำตามบทช่วยสอนที่เขียนเมื่อสามเดือนที่แล้ว
เหตุใดความพยายามในการสร้างจึงล้มเหลว และสิ่งที่ต้องเปลี่ยนแปลง
อัตราความสำเร็จของผู้สมัครที่แกว่งไปมาระหว่าง 70 เปอร์เซ็นต์และต่ำกว่า 1 เปอร์เซ็นต์ไม่ใช่เรื่องลึกลับ และ Isaac Lab ได้บันทึกข้อผิดพลาดทั่วไปไว้ แทนที่จะปล่อยให้คุณคาดเดา ข้อผิดพลาดเหล่านี้เป็นสิ่งที่คุณควบคุมได้ในขณะบันทึก ซึ่งเป็นเหตุผลว่าทำไมจึงควรศึกษาข้อมูลในรายการนี้ก่อนที่คุณจะบันทึกการสาธิตเริ่มต้นทั้งสิบครั้ง แทนที่จะเป็นหลังจากรันการสร้างครั้งแรกที่น่าผิดหวัง
- การสาธิตยาวเกินไป ขอบเขตเวลาที่ยาวขึ้นทำให้ policy เรียนรู้ได้ยากขึ้น เริ่มต้นใกล้กับวัตถุแรกและลดการเคลื่อนไหวให้เหลือน้อยที่สุด
- การสาธิตไม่ราบรื่น การเคลื่อนไหวที่ไม่สม่ำเสมอทำให้ policy ตีความได้ยาก และฮาร์ดแวร์ teleoperation ที่ดีขึ้นจะให้ข้อมูลที่ดีขึ้น: เอกสารระบุไว้อย่างชัดเจนว่า SpaceMouse ดีกว่าคีย์บอร์ด
- การหยุดชั่วคราว การหยุดชั่วคราวเป็นเรื่องยากที่จะเรียนรู้ เพราะ policy ไม่สามารถเข้าใจได้ชัดเจนว่าทำไมและเมื่อใดควรหยุดชั่วคราว รักษาการเคลื่อนไหวให้ต่อเนื่อง
- มีงานย่อยมากเกินไป งานย่อยที่มากขึ้นหมายถึงการเชื่อมต่อระหว่างส่วนของวิถีการเคลื่อนที่มากขึ้น ซึ่งส่งผลให้การเคลื่อนไหวไม่ราบรื่นและอัตราความสำเร็จในการสร้างต่ำลง กำหนดขอบเขตที่แขนไม่น่าจะชนกับสิ่งใดๆ
- ไม่มี action noise Action noise ทำให้ policy ที่ได้มีความทนทานมากขึ้น
- การบันทึกถูกตัดสั้นเกินไป หากการบันทึกหยุดลงที่เฟรมที่เงื่อนไขความสำเร็จทำงานพอดี อาจไม่ทำงานซ้ำระหว่างการเล่นซ้ำ ให้เว้นบัฟเฟอร์ไว้ที่ส่วนท้าย
- การเล่นซ้ำที่ไม่สามารถคาดเดาได้ ฟิสิกส์ใน Isaac Lab ไม่สามารถทำซ้ำได้อย่างแม่นยำเมื่อมีการรีเซ็ตสภาพแวดล้อม (env.reset) ดังนั้นการสาธิตของมนุษย์บางส่วนจึงล้มเหลวในการเล่นซ้ำ รวบรวมให้มากกว่าที่ต้องการและเก็บเฉพาะส่วนที่ผ่านการระบุข้อมูล ทุกสิ่งที่อยู่ในไฟล์ HDF5 ที่สร้างโดย Mimic ถือเป็นการสาธิตที่สำเร็จและสามารถใช้สำหรับการฝึกอบรมได้ แม้ว่าการเล่นซ้ำจะล้มเหลวในภายหลังก็ตาม
ขั้นตอนการประมาณค่าในช่วงระหว่างส่วนของงานย่อยที่เชื่อมต่อกันมีปุ่มปรับแต่งของตัวเอง และจำนวนขั้นตอนการประมาณค่าที่คุณต้องการจะปรับตามความเร็วในการเคลื่อนที่ของหุ่นยนต์และความกว้างของการกระจายการรีเซ็ตวัตถุ งานที่ซับซ้อนซึ่งมีการกระจายการรีเซ็ตที่กว้างจะทำให้เกิดช่องว่างขนาดใหญ่ขึ้นระหว่างส่วนต่างๆ ซึ่งต้องใช้ขั้นตอนการประมาณค่าในช่วงมากขึ้นเพื่อให้ได้การเคลื่อนไหวที่ต่อเนื่อง หากวิดีโอที่คุณสร้างแสดงแขนหุ่นยนต์กระตุกระหว่างเฟส นั่นคือพารามิเตอร์ที่ควรพิจารณาก่อนที่คุณจะตำหนิการสาธิตเริ่มต้น
ไปป์ไลน์เดียวกันบน SO-101 พร้อมแขนผู้นำจริง
นี่เป็นสิ่งที่น่าสนใจสำหรับทุกคนที่อ่านหน้านี้ เพราะเป็นไปป์ไลน์แบบเปิดเพียงหนึ่งเดียวที่นำ เข้าไปใน Isaac Lab และให้คุณขับเคลื่อนมันด้วยแขนผู้นำทางกายภาพที่คุณมีอยู่แล้ว LeIsaac เวอร์ชัน 0.4.0 ณ เวลาที่เขียนนี้ เป็นสนามจำลองการเรียนรู้แบบเลียนแบบอย่างเป็นทางการที่รวมอยู่ใน EnvHub ของ LeRobot ตารางความเข้ากันได้ระบุชุดค่าผสมที่ใช้งานได้สามชุด; ชุดใหม่ล่าสุดจับคู่ Isaac Sim 5.1 กับ Isaac Lab v2.3.0, CUDA 12.8, PyTorch 2.7.0 และ Python 3.11 และเอกสารแนะนำ Isaac Sim 5.0 หรือใหม่กว่าสำหรับกราฟิกการ์ดซีรีส์ 50
git clone https://github.com/LightwheelAI/leisaac.git --recursive
conda create -n leisaac python=3.11 && conda activate leisaac
conda install -c "nvidia/label/cuda-12.8.1" cuda-toolkit
pip install -U torch==2.7.0 torchvision==0.22.0 \
--index-url https://download.pytorch.org/whl/cu128
pip install "isaacsim[all,extscache]==5.1.0" --extra-index-url https://pypi.nvidia.com
sudo apt install cmake build-essential
cd leisaac/dependencies/IsaacLab && ./isaaclab.sh --install && cd ../..
pip install -e source/leisaac
pip install -e "source/leisaac[lerobot]"
pip install numpy==1.26.0เมื่อติดตั้งแล้ว แขนผู้นำบน /dev/ttyACM0 จะขับเคลื่อนหุ่นยนต์ผู้ตามที่จำลองขึ้น และบันทึกข้อมูลลงใน HDF5 โดยตรง ลูปเป็นแบบเดียวกับที่คุณรู้จักจากการบันทึกจริง เพียงแต่ผู้ตามเป็นวัตถุแข็งเกร็งใน PhysX
python scripts/environments/teleoperation/teleop_se3_agent.py \
--task=LeIsaac-SO101-PickOrange-v0 \
--teleop_device=so101leader \
--port=/dev/ttyACM0 \
--num_envs=1 \
--device=cuda \
--enable_cameras \
--record \
--dataset_file=./datasets/dataset.hdf5| Environment ID | คำอธิบายงาน | หุ่นยนต์ |
|---|---|---|
| LeIsaac-SO101-PickOrange-v0 | หยิบส้มสามลูกใส่จาน จากนั้นปรับแขนกลับสู่ท่าพัก | Single-arm SO101 follower |
| LeIsaac-SO101-LiftCube-v0 | ยกกล่องสี่เหลี่ยมสีแดงขึ้น | Single-arm SO101 follower |
| LeIsaac-SO101-CleanToyTable-v0 | หยิบวัตถุรูปตัวอักษร e สองชิ้นใส่กล่อง จากนั้นปรับแขนกลับสู่ท่าพัก | Single-arm SO101 follower |
| LeIsaac-SO101-CleanToyTable-BiArm-v0 | งานเดียวกันแต่ใช้แขนสองข้าง | Bi-arm SO101 follower |
| LeIsaac-SO101-FoldCloth-BiArm-v0 | พับผ้า จากนั้นปรับแขนกลับสู่ท่าพัก เฉพาะ DirectEnv variant เท่านั้นที่รองรับ check_success | Bi-arm SO101 follower |
| LeIsaac-LeKiwi-CleanupTrash-v0 | เก็บขยะกระดาษทิชชูจากพื้นแล้วทิ้งลงถังขยะ | LeKiwi |
ID ส่วนใหญ่เหล่านี้ยังมีอยู่ในรูปแบบ -Direct-v0 variant และ python scripts/environments/list_envs.py จะแสดงรายการปัจจุบัน คุณยังสามารถข้ามการใช้ HDF5 ไปได้เลย และเขียนในรูปแบบ LeRobot ระหว่างการควบคุมระยะไกลโดยเพิ่มสามแฟล็ก ข้อควรระวังสองประการมาจากเอกสารประกอบเอง: ตัวบันทึกจะข้าม 5 เฟรมแรกของแต่ละตอนโดยอัตโนมัติเพื่อหลีกเลี่ยงความไม่เสถียรจากสถานะเริ่มต้น และอาจทำให้เกิดความล่าช้าเล็กน้อยในการควบคุมระยะไกล ซึ่งเป็นสิ่งที่เปลี่ยนแปลงลักษณะของการสาธิตของคุณอย่างเงียบๆ นอกจากนี้ยังจะบันทึกตอนที่งานถูกทำเครื่องหมายว่าสำเร็จเท่านั้น
python scripts/environments/teleoperation/teleop_se3_agent.py \
--task=LeIsaac-SO101-PickOrange-v0 \
--teleop_device=so101leader \
--port=/dev/ttyACM0 \
--num_envs=1 --device=cuda --enable_cameras --record \
--use_lerobot_recorder \
--lerobot_dataset_repo_id=<your-user>/<dataset-name> \
--lerobot_dataset_fps=30ขั้นตอนการคูณจะทำงานบนการบันทึกเหล่านั้น LeIsaac ห่อหุ้ม Isaac Lab Mimic ด้วยสี่คำสั่ง เนื่องจาก Mimic ทำให้วิถีการเคลื่อนที่ทั่วไปจากตำแหน่งปลายแขนและวัตถุ: แปลงการกระทำใน joint-space เป็นการกระทำแบบ IK, ใส่คำอธิบายประกอบ, สร้าง, จากนั้นแปลงกลับเป็น joint-space
python scripts/mimic/eef_action_process.py \
--input_file ./datasets/mimic-lift-cube-example.hdf5 \
--output_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
--to_ik --headless
python scripts/mimic/annotate_demos.py --device cuda \
--task LeIsaac-SO101-LiftCube-Mimic-v0 \
--input_file ./datasets/processed_mimic-lift-cube-example.hdf5 \
--output_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
--enable_cameras
python scripts/mimic/generate_dataset.py --device cuda \
--num_envs 1 --generation_num_trials 10 \
--input_file ./datasets/annotated_mimic-lift-cube-example.hdf5 \
--output_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
--enable_cameras
python scripts/mimic/eef_action_process.py \
--input_file ./datasets/generated_mimic-lift-cube-example.hdf5 \
--output_file ./datasets/final_generated_mimic-lift-cube-example.hdf5 \
--to_joint --headlessจากนั้นแปลงเป็น LeRobot นี่คือขั้นตอนที่กฎรูปแบบของแพลตฟอร์มมีผล และ LeIsaac ก็มีตัวแปลงสองตัวที่คุณต้องการพอดี: isaaclab2lerobot.py เขียน LeRobot v2 ซึ่งเป็นสิ่งที่ตัวโหลด GR00T ใช้ และ isaaclab2lerobotv3.py เขียน v3 สำหรับ Pi0.5, SmolVLA และ ACT. สคริปต์ทั้งสองใช้พารามิเตอร์เดียวกัน แต่กำหนดเวอร์ชัน lerobot ที่แตกต่างกัน และจะแปลงเฉพาะตอนที่สำเร็จเท่านั้น
pip install lerobot==0.3.3
pip install numpy==1.26.0
python scripts/convert/isaaclab2lerobot.py \
--task_name=LeIsaac-SO101-PickOrange-v0 \
--repo_id=<your-user>/so101_pick_orange_sim \
--hdf5_root=./datasets \
--hdf5_files=dataset.hdf5LeIsaac มีเอกสารเกี่ยวกับการรันสแต็กทั้งหมดบน NVIDIA Brev: deploy, คลิกที่ลิงก์พอร์ต 80 เพื่อเปิด VS Code Server ที่ทำงานบนเบราว์เซอร์ และขับเคลื่อนสี่สถานการณ์ที่ติดตั้งไว้ล่วงหน้าด้วย --kit_args="--no-window --enable omni.kit.livestream.webrtc" โดยดูผลลัพธ์ที่อยู่เดียวกันโดยเพิ่ม /viewer หากคุณไม่มีการ์ดเวิร์คสเตชันใต้โต๊ะ นั่นเป็นวิธีที่ถูกกว่าในการค้นหาว่าเวอร์ชันจำลองของงานของคุณใกล้เคียงหรือไม่ ก่อนที่คุณจะลงทุนกับฮาร์ดแวร์
สองเส้นทางสู่โมเดลนโยบายที่ผ่านการฝึกฝน
คุณสร้างฉาก, สร้างข้อมูล, เช่า GPU และตั้งค่าการให้บริการด้วยตัวเอง นี่เป็นทางเลือกที่เหมาะสมหากงานต้องการความหลากหลายของสภาพแวดล้อมที่คุณไม่สามารถจัดเตรียมได้จริง หรือหากคุณต้องการการประเมินที่ทำซ้ำได้
- ติดตั้ง Isaac Sim 5.1 และ Isaac Lab หรือ LeIsaac stack หากหุ่นยนต์ของคุณคือ SO-101
- สร้างโมเดลหรือนำเข้าฉาก ขั้นตอนนี้มักไม่มีใครตั้งงบประมาณไว้ และมักเป็นขั้นตอนที่ใช้เวลานานที่สุด
- บันทึกการสาธิตที่สะอาดประมาณ 10 ครั้งผ่านตัวติดตามจำลอง
- ระบุงานย่อย, รัน generate_dataset.py และยอมรับว่าความล้มเหลวจะถูกทิ้งไป
- แปลง HDF5 เป็นรูปแบบ LeRobot โดยเลือก v2 สำหรับ GR00T และ v3 สำหรับรุ่นอื่นๆ
- บันทึกเหตุการณ์จริงบนแขนกลจริงอยู่ดี จากนั้นฝึกฝนร่วมกันบนข้อมูลผสม
- เช่า GPU, รันการปรับแต่งละเอียด, ให้บริการ checkpoint ถัดจากแขนกล
| ทรัพยากร | สิ่งที่แหล่งข้อมูลระบุ |
|---|---|
| GPU สำหรับการจำลองในเครื่อง | พิมพ์เขียวการจัดการสังเคราะห์ของ NVIDIA กำหนดให้ใช้ Ubuntu 22.04 และ NVIDIA RTX A6000 ที่มี VRAM 48 GB |
| โหนดโมเดลโลก | พิมพ์เขียวเดียวกันกำหนดให้ใช้ H100 หรือสูงกว่าที่มี 80 GB บนโหนดที่แยกจากการจำลอง Isaac Lab |
| เวอร์ชันคอนเทนเนอร์ | Isaac Lab 2.0.2 บน Isaac Sim 4.5.0 ภายในอิมเมจพิมพ์เขียวนั้น |
| ปริมาณงานการสร้าง | Isaac Lab รายงานการสาธิตการหยิบและวาง GR1T2 จำนวน 1000 ครั้งใน 18 ถึง 40 นาที, 19 นาทีบน RTX ADA 6000 ที่มีอัตราความสำเร็จ 80 เปอร์เซ็นต์ |
| ค่าใช้จ่ายวิถีประสาท | GR00T N1 รายงานประมาณ 105,000 ชั่วโมง GPU L40 หรือประมาณ 1.5 วันบน L40 จำนวน 3,600 ตัว สำหรับ 827 ชั่วโมงแห่งความฝัน |
การสร้างวิถี 1000 เส้นใช้เวลาช่วงบ่าย การทำให้ฉากของคุณ, ค่า extrinsics ของกล้อง, mesh ของวัตถุ และโมเดลเซอร์โวของคุณใกล้เคียงกันมากพอที่วิถีเหล่านั้นจะถ่ายโอนได้คือส่วนที่ใช้เวลาหลายสัปดาห์ ตั้งงบประมาณสำหรับการสร้างโมเดล ไม่ใช่การสุ่มตัวอย่าง
แพลตฟอร์มนี้ถูกออกแบบมาให้จำกัดขอบเขตโดยเฉพาะ ไม่ได้รันตัวจำลองและไม่ได้สร้างข้อมูลสังเคราะห์ สิ่งที่ทำคือรับชุดข้อมูล LeRobot ไม่ว่าคุณจะสร้างมันขึ้นมาด้วยวิธีใด และเปลี่ยนให้เป็น ผลลัพธ์จาก Isaac Lab ของคุณถือเป็นอินพุตที่ถูกต้องตราบใดที่สามารถแปลงได้อย่างสะอาด
- 1นำชุดข้อมูลมา
บันทึกด้วย ไคลเอนต์เดสก์ท็อป โดยตรงจากการควบคุมระยะไกล, ชี้ไปที่ Hugging Face repo id หรืออัปโหลดไฟล์ส่งออกที่แปลงแล้วจากตัวจำลอง
- 2เลือกรุ่นและแขนกล
เมทริกซ์บน /train จะจับคู่โมเดลนโยบายที่ฝึกฝนได้ทั้งห้าตัวกับแขนกลที่รองรับแต่ละตัว และเชื่อมโยงไปยังคู่มือที่ถูกต้อง
- 3ให้แบ็กเอนด์เช่า GPU
ผู้ฝึกจะเลือก GPU ในตลาดแบบ spot ตาม VRAM ที่ต้องการ, รันงาน และเขียนเช็คพอยต์ไปยังที่เก็บวัตถุ ไม่ต้องมีคลัสเตอร์ที่ต้องดูแล
- 4ให้บริการกลับไปยังแขนกล
พ็อดสำหรับการอนุมานจะถูกจัดเตรียมโดยอัตโนมัติ, ไคลเอนต์หุ่นยนต์ในเครื่องจะสื่อสารกับปลายทางนั้น และ watchdog ที่ไม่ได้ใช้งานจะทำลายพ็อดเพื่อไม่ให้มีค่าใช้จ่ายเกิดขึ้นโดยไม่รู้ตัว
| Model | ระดับ GPU | จำนวนตอนขั้นต่ำ | รูปแบบชุดข้อมูล | ค่าใช้จ่ายในการรันโดยทั่วไป |
|---|---|---|---|---|
| GR00T N1.7 | A100 80 GB or H100 80 GB | 50 | LeRobot v2.0 or v2.1 | 4 to 12 USD |
| GR00T N1.5 | A100 80 GB or H100 80 GB | 50 | LeRobot v2.0 or v2.1 | 4 to 12 USD |
| Pi0.5 | A100 80 GB or H100 80 GB | 50 | LeRobot v3.0 | 4 to 12 USD |
| SmolVLA | RTX 4090 or any 24 GB card | 30 | LeRobot v3.0 | 1 to 3 USD |
| ACT | RTX 4090 or any 24 GB card | 50 | LeRobot v3.0 | 1 to 3 USD |
โปรดสังเกตคอลัมน์รูปแบบ และโปรดทราบว่าเป็นเหตุผลที่ LeIsaac มีตัวแปลงสองตัว ชุดข้อมูล LeRobot v3.0 จะทำให้ GR00T loader หยุดทำงานและต้องถูกแปลงเป็น v2.1 ก่อน ซึ่งเป็นการปฏิเสธที่พบบ่อยที่สุด หากคุณพบปัญหานี้ คือหน้าสำหรับปัญหานั้น
โมเดลโลกวิดีโอ: เลเยอร์ใหม่ล่าสุด และมีการวัดผลน้อยที่สุด
แนวคิดเบื้องหลัง DreamGen คือโมเดลสร้างวิดีโอที่ปรับให้เข้ากับรูปร่างของหุ่นยนต์เป้าหมาย สามารถจินตนาการถึงเหตุการณ์ที่เป็นไปได้ในฉากที่คุณไม่เคยไปเยี่ยมชมได้ กระบวนการนี้มีสี่ขั้นตอน: ปรับแต่งโมเดลโลกวิดีโอ, สร้างวิดีโอหุ่นยนต์สังเคราะห์ที่สมจริง, กู้คืนลำดับการกระทำเทียมด้วยโมเดลการกระทำแฝงหรือโมเดลพลวัตผกผัน จากนั้นฝึกฝนโมเดลนโยบายหุ่นยนต์จากผลลัพธ์ NVIDIA's GR00T-dreams repository ได้นำแนวคิดนี้ไปใช้จริง
ผลลัพธ์หลักเป็นของจริงและควรพิจารณาอย่างจริงจัง: ข้อมูลการควบคุมระยะไกลจากงานหยิบและวางเพียงงานเดียวในสภาพแวดล้อมเดียว สร้างพฤติกรรมใหม่ 22 อย่างบนหุ่นยนต์ฮิวแมนนอยด์ ทั้งในสภาพแวดล้อมที่เคยเห็นและไม่เคยเห็น ข้อควรระวังก็เป็นของจริงเช่นกันและอยู่ในขั้นตอนที่สาม
- พวกมันปรับขนาดได้ตามแกนที่มีค่าใช้จ่ายสูงอย่างแท้จริงในโลกแห่งความเป็นจริง: ฉากใหม่, การจัดเรียงวัตถุใหม่, การกำหนดคำสั่งใหม่
- GR00T-dreams ระบุการใช้งานที่รองรับสี่แบบสำหรับสคริปต์การสกัดการกระทำและการปรับแต่ง: franka, gr1, robocasa และ so100 นี่ไม่ใช่เทคนิคสำหรับหุ่นยนต์ฮิวแมนนอยด์เท่านั้น
- Cosmos-Transfer1 โจมตีครึ่งหนึ่งของช่องว่างด้านโฟโตเมตริกโดยตรง โดยการแมปตัวอย่างสังเคราะห์ทางหุ่นยนต์หนึ่งตัวอย่างไปยังตัวอย่างที่สมจริงหลายตัวอย่างจากการแบ่งส่วน, ความลึก หรือการปรับสภาพขอบ Isaac Lab เองก็มีเครื่องมือพร้อมท์สำหรับสิ่งนี้ภายใต้ scripts/tools/cosmos
- งาน DreamGen มาพร้อมกับ DreamGen Bench ซึ่งเป็นเกณฑ์มาตรฐานการสร้างวิดีโอที่แสดงความสัมพันธ์ที่แข็งแกร่งระหว่างประสิทธิภาพของเกณฑ์มาตรฐานและความสำเร็จของนโยบายปลายน้ำ ดังนั้นคุณสามารถคัดกรองการสร้างก่อนที่จะนำไปฝึก
- การกระทำถูกกู้คืนโดยโมเดล ไม่ได้วัดโดยตัวเข้ารหัส วิดีโอที่ดูถูกต้องอาจมีวิถีการเคลื่อนที่ของข้อต่อที่แขนของคุณไม่สามารถทำตามได้
- การสร้างมีค่าใช้จ่ายสูง GR00T N1 รายงานว่าใช้เวลาสองนาทีในการสร้างวิดีโอหนึ่งวินาทีบน L40 ซึ่งประมาณ 105,000 ชั่วโมง GPU ของ L40 หรือประมาณ 1.5 วันบน GPU L40 จำนวน 3,600 ตัว สำหรับวิถีประสาท 827 ชั่วโมง
- ผลกำไรที่วัดได้อยู่ในหลักหน่วย: 4.2, 8.8 และ 6.8 คะแนนบน RoboCasa ในสามระบอบข้อมูล และ 5.8 คะแนนโดยเฉลี่ยจากงาน GR-1 จริง 8 งาน นอกเหนือจากโมเดลที่มีข้อมูลจริงอยู่แล้ว
- ไม่มีสูตรที่เผยแพร่ใดยืนยันสิ่งนี้สำหรับแขนเซอร์โวงานอดิเรก 7.4 V แบบครบวงจร คุณจะต้องทำการพอร์ต ไม่ใช่แค่ทำตาม
ไม่เกี่ยวข้องกับการจำลอง แต่เป็นเรื่องที่เกิดขึ้นเมื่อใดก็ตามที่มีคนย้ายจากแขนจำลองไปสู่แขนจริงและปรับปรุงแหล่งจ่ายไฟ แขน SO-100, SO-101 และ LeKiwi ทั้งหมดใช้เซอร์โว Feetech STS3215 ที่ 7.4 V การป้อนไฟ 12 V จะทำลายพวกมัน และ LeKiwi เป็นกับดักโดยเฉพาะเนื่องจากรางฐานของมันคือ 12 V โปรดดู หน้าฮาร์ดแวร์ SO-100 ก่อนที่คุณจะทำการต่อสายใดๆ
การฝึกร่วมเป็นสูตรที่แสดงให้เห็นถึงผลกำไรที่แท้จริง
หากคุณจะนำบทเรียนการปฏิบัติงานจากงานวิจัยไปใช้ ให้เลือกบทเรียนนี้ การศึกษาการฝึกร่วมกันระหว่างการจำลองและโลกจริง (Maddukuri และคณะ, 2025) ได้พยายามหาสูตรสำเร็จง่ายๆ สำหรับการใช้ข้อมูลการจำลองเพื่อแก้ไขงานการควบคุมหุ่นยนต์ที่ใช้การมองเห็น ในสองโดเมน ได้แก่ แขนหุ่นยนต์และหุ่นยนต์ฮิวแมนนอยด์ และข้อสรุปคือคุณควรฝึกด้วยข้อมูลผสม ข้อมูลการจำลองช่วยเพิ่มประสิทธิภาพของงานในโลกจริงโดยเฉลี่ย 38 เปอร์เซ็นต์ และงานวิจัยระบุไว้อย่างชัดเจนว่าสิ่งนี้ยังคงเป็นจริงแม้จะมีความแตกต่างที่เห็นได้ชัดระหว่างข้อมูลการจำลองและข้อมูลในโลกจริง
ข้อความสุดท้ายนั้นสำคัญกว่า 38 เปอร์เซ็นต์ หมายความว่าการจำลองไม่จำเป็นต้องเป็นดิจิทัลทวินที่สมบูรณ์แบบจึงจะมีประโยชน์ โดยมีเงื่อนไขว่าข้อมูลจริงต้องอยู่ในส่วนผสมเพื่อเป็นจุดยึด การถ่ายโอนจากการจำลองเพียงอย่างเดียวเป็นเส้นทางที่สิ้นเปลือง: งานวิจัยเดียวกันระบุว่าการฝึกนโยบายเฉพาะในการจำลองและถ่ายโอนไปยังโลกจริงมักต้องใช้ความพยายามของมนุษย์อย่างมากเพื่อเชื่อมช่องว่างความเป็นจริง การฝึกร่วมกันช่วยลดความพยายามส่วนใหญ่โดยไม่เคยขอให้นโยบายปิดช่องว่างด้วยตัวเอง

ในทางปฏิบัติ บนแพลตฟอร์มนี้ การฝึกร่วมกันหมายถึงสิ่งเดียว: ใส่ชุดตอนทั้งสองชุดลงใน ชุดข้อมูล LeRobot โดยมีคีย์กล้องที่สอดคล้องกัน ลำดับข้อต่อที่สอดคล้องกัน และหน่วยที่สอดคล้องกัน จากนั้นเรียกใช้ การปรับแต่งอย่างละเอียด. ไม่มีปุ่มปรับน้ำหนักส่วนผสมในแบบฟอร์มการฝึก หากคุณต้องการอัตราส่วนการจำลองต่อโลกจริง 3:1 คุณสามารถระบุได้ด้วยจำนวนตอนของแต่ละประเภทที่คุณใส่ในชุดข้อมูล
ชัยชนะที่ง่ายที่สุดจากการจำลองไม่ใช่ข้อมูลการฝึกอบรม
มันคือการประเมินผล การทดลองจริงหลายสิบครั้งต่อภารกิจเพื่อเปรียบเทียบ ใช้เวลาหนึ่งวันในการทำงานของแขนกล และแขนกลก็มีการเคลื่อนที่ระหว่างการทดลอง SIMPLER (Li และคณะ, 2024) ได้สร้างสภาพแวดล้อมจำลองที่มีวัตถุประสงค์เพื่อประเมินนโยบายจริงแทนที่จะฝึกอบรม และจากนั้นก็วัดว่าการจัดอันดับจากการจำลองสามารถทำนายผลจริงได้ดีเพียงใด สภาพแวดล้อม SIMPLER เพียงหนึ่งเดียวสามารถเรนเดอร์ได้ 3,500 ขั้นตอนการจำลองต่อวินาทีบนการ์ดจอ RTX 4090 สำหรับผู้บริโภคที่ความละเอียด 640 x 512 ซึ่งภายใต้ความถี่การจำลอง 500 Hz จะเร็วกว่าการประเมินผลจริงถึง 7 เท่า
| โปรโตคอลการประเมิน | MMRV (ค่ายิ่งต่ำยิ่งดี) | Pearson r (ค่ายิ่งสูงยิ่งดี) |
|---|---|---|
| Validation MSE | 0.375 | 0.308 |
| SIMPLER, การรวมตัวแปร | 0.143 | 0.778 |
| SIMPLER, การจับคู่ด้วยภาพ | 0.056 | 0.924 |
ค่าเหล่านี้เป็นค่าเฉลี่ยจากกลุ่มงาน Google Robot สามกลุ่มสำหรับเช็คพอยต์โอเพนซอร์สทั่วไปหกรายการ: เช็คพอยต์ RT-1 สามรายการในขั้นตอนการฝึกอบรมที่แตกต่างกัน, RT-1-X, RT-2-X และ Octo-Base ฝั่งการทดลองจริงไม่ใช่จำนวนการทดลองที่สม่ำเสมอ ซึ่งเป็นสิ่งสำคัญที่ควรทราบก่อนนำไปอ้างอิง: 75 การทดลองสำหรับการหยิบกระป๋องโค้ก, 60 สำหรับการเคลื่อนย้ายเข้าใกล้, 54 สำหรับงานเปิดและปิดลิ้นชัก และ 27 สำหรับงานลิ้นชักและแอปเปิลที่ยาวกว่า การเปรียบเทียบกับ Validation MSE เป็นส่วนที่มีประโยชน์ การเลือกโมเดลโดยใช้ Validation Loss จัดอันดับเช็คพอยต์เหล่านี้ได้ไม่ดี และค่า Pearson r ที่ 0.924 ภายใต้การจับคู่ด้วยภาพหมายความว่า หากเช็คพอยต์ใดได้คะแนนดีกว่าใน SIMPLER ก็มีแนวโน้มสูงมากที่จะได้คะแนนดีกว่าในการทดสอบจริง นั่นคือกระดานคะแนนที่สามารถทำซ้ำได้ข้ามคืน และไม่จำเป็นต้องเชื่อสิ่งใดเกี่ยวกับการถ่ายโอนการฝึกอบรมจากจำลองสู่จริง

หากคุณต้องการบริบทที่กว้างขึ้นว่าตัวเลขการทดสอบมาตรฐานเหล่านี้บอกอะไรและไม่บอกอะไรเกี่ยวกับ , เราได้เขียนอธิบายแยกไว้ใน .
แพลตฟอร์มนี้ไม่สามารถช่วยคุณได้ในเรื่องใดบ้าง
การระบุขอบเขตให้ชัดเจนช่วยประหยัดเวลาของทุกคน AY-Robots เป็นแพลตฟอร์มสำหรับการบันทึก การฝึกอบรม และการให้บริการ ไม่มีโปรแกรมจำลองอยู่ในตัว
- ไม่มี Isaac Lab, ไม่มี MimicGen, ไม่มีโมเดลโลก, ไม่มีเครื่องมือสร้างฉาก หากคุณต้องการข้อมูลที่สร้างขึ้น คุณต้องสร้างมันจากที่อื่นแล้วนำผลลัพธ์มาใช้
- เทรนเนอร์ใช้ชุดข้อมูล LeRobot เท่านั้น การส่งออกข้อมูลจากโปรแกรมจำลองจะต้องถูกแปลงก่อนที่จะนำมาเป็นอินพุต และต้องเป็นเวอร์ชันที่ถูกต้อง: v2.0 หรือ v2.1 สำหรับ GR00T N1.5 และ N1.7, v3.0 สำหรับ Pi0.5, SmolVLA และ ACT
- จุดเริ่มต้นของการปรับแต่ง GR00T คือ tyro CLI ที่ไม่เปิดเผย seed ทำให้การรัน GR00T ไม่สามารถทำซ้ำได้แบบ bit-for-bit หากคุณกำลังทำการทดลอง ablation ระหว่าง sim กับ real อย่างระมัดระวัง นี่คือข้อจำกัดที่สำคัญ seed เริ่มต้นของ lerobot คือ 1000 และฟอร์มของ ACT, SmolVLA และ Pi0.5 ก็เปิดเผยฟิลด์ seed
- การสะสม Gradient จะถูกนำไปใช้จริงสำหรับเทรนเนอร์ GR00T สองตัวเท่านั้น สำหรับ Pi0.5 และ SmolVLA ฟิลด์นี้มีอยู่ในฟอร์ม แต่ lerobot 0.5.1 ไม่มีแฟล็กดังกล่าว จึงไม่มีผลใดๆ
- การอนุมานต้องอยู่ใกล้กับเซอร์โวสำหรับงานที่รวดเร็ว ลูปควบคุมใช้เวลา 20 ถึง 485 ms ต่อขั้นตอนการกระทำ ขึ้นอยู่กับโมเดล และการเพิ่มการเดินทางไปกลับผ่านอินเทอร์เน็ตสาธารณะจะเปลี่ยนนโยบายที่ทำงานได้ให้กลายเป็นนโยบายที่ลังเล การอนุมานระยะไกลสามารถทำได้สำหรับงานหยิบและวางที่ช้า แต่ไม่เหมาะสำหรับการเคลื่อนไหวตอบสนองที่รวดเร็ว
บันทึกข้อมูลจริงครึ่งหนึ่งของการผสมผสานการฝึกร่วมกันโดยไม่ต้องเป็นเจ้าของแขนกล /live สตรีม SO-100 ทางกายภาพโดยไม่ต้องลงทะเบียน ใช้ระบบคิว และ โปรแกรมผู้ควบคุม มีอยู่เพราะต้องมีคนขับเคลื่อนมัน หากปัญหาคอขวดของคุณคือคุณมีโปรแกรมจำลองแต่ไม่มีเหตุการณ์จริง นี่คือช่องว่างที่แพลตฟอร์มนี้จะช่วยปิดได้
งบประมาณที่คุณสามารถปกป้องได้
นำสองเส้นทางมาเปรียบเทียบกันพร้อมกับตัวเลขที่แต่ละเส้นทางเผยแพร่ออกมาจริง และการตัดสินใจมักจะเกิดขึ้นเองสำหรับโครงการงานเดียวบนแขนกลราคาประหยัด
| รายการ | จำลองก่อน | บันทึกก่อน |
|---|---|---|
| การสร้างแบบจำลองเบื้องต้น | ฉาก, เมช, การจัดวางกล้อง, โมเดลเซอร์โว ใช้เวลาหลายวันถึงหลายสัปดาห์ | ไม่มี |
| การเก็บข้อมูล | สาธิตประมาณ 10 ครั้งในการจำลอง จากนั้นสร้างข้อมูล | 30 ถึง 50 ตอนจริง, การควบคุมระยะไกลไม่กี่ชั่วโมง |
| ฮาร์ดแวร์ที่ต้องมี | การ์ด 48 GB สำหรับพิมพ์เขียว Isaac Lab, 80 GB สำหรับ Cosmos stage | แขนหุ่นยนต์และแล็ปท็อป |
| ค่าใช้จ่ายในการฝึก | เท่ากับคอลัมน์ขวา ผู้ฝึกไม่สนใจว่าข้อมูลมาจากไหน | 1 ถึง 3 USD สำหรับ 4090 tier, 4 ถึง 12 USD สำหรับ A100 หรือ H100 tier |
| หลักฐานที่ดีที่สุดของผลตอบแทน | เพิ่มขึ้นเฉลี่ย 38 เปอร์เซ็นต์ในโลกจริงเมื่อฝึกร่วมกัน, 4 ถึง 9 จุดจากวิถีประสาท | ค่าพื้นฐานที่ใช้วัดทุกอย่างข้างต้น |
| ล้มเหลวเมื่อ | งานของคุณขึ้นอยู่กับการสัมผัส, วัตถุที่เปลี่ยนรูปได้ หรือการปฏิบัติตามเซอร์โว | คุณต้องการความหลากหลายของสภาพแวดล้อมที่คุณไม่สามารถจัดฉากทางกายภาพได้ |
สำหรับการสร้างนโยบายแรกบน SO-100 ให้บันทึกข้อมูล และ จะพาคุณไปสู่จุดตรวจสอบที่พร้อมใช้งานในราคาเท่ากาแฟหนึ่งแก้ว และคุณจะมีข้อมูลจริงครึ่งหนึ่งสำหรับการฝึกร่วมกันในอนาคต ใช้เครื่องจำลองเมื่อคุณมีค่าพื้นฐานที่ใช้งานได้และข้อผิดพลาดในการสรุปผลที่เฉพาะเจาะจงที่คุณสามารถระบุได้ เช่น นโยบายที่ .
ยังไม่มีแขนหุ่นยนต์บนโต๊ะของคุณใช่ไหม?
ควบคุม SO-100 จริงในเบราว์เซอร์ แบบใช้คิว ไม่ต้องลงทะเบียน และดูว่าตอนจริงมีลักษณะอย่างไรก่อนที่คุณจะใช้เวลาช่วงสุดสัปดาห์ในการสร้างแบบจำลองในเครื่องจำลอง
ควบคุมแขนหุ่นยนต์จริงสูตรที่เคารพหลักฐาน
- 1บันทึกข้อมูลพื้นฐานจริงก่อน
30 episodes for SmolVLA, 50 for ACT, GR00T N1.7 and Pi0.5. ฝึกฝนเพียงครั้งเดียว สิ่งที่นโยบายนั้นล้มเหลวคือข้อกำหนดของคุณสำหรับข้อมูลสังเคราะห์
- 2ระบุความล้มเหลวในการสรุปผล
ท่าทางของวัตถุ? แสง? ความสูงของโต๊ะ? สิ่งรบกวน? การใช้คำสั่งที่แตกต่างกัน? ข้อมูลสังเคราะห์จะดีเยี่ยมสำหรับสิ่งเหล่านี้เพียงอย่างเดียวในแต่ละครั้ง และจะไร้ประโยชน์หากคุณไม่สามารถระบุได้ว่าคืออะไร
- 3เลือกกลุ่มวิธีที่ประหยัดที่สุดที่ครอบคลุม
ความหลากหลายของท่าทางและการจัดวาง: การเพิ่มจำนวนวิถีการเคลื่อนที่ แสงและพื้นผิว: การเพิ่มประสิทธิภาพรูปภาพก่อน ตามด้วยโมเดลโลก ฉากใหม่ทั้งหมด: การจำลองทางฟิสิกส์ และยอมรับค่าใช้จ่ายในการสร้างโมเดล
- 4สร้างแล้วทิ้งส่วนที่ไม่ต้องการอย่างเด็ดขาด
ความพยายามในการสร้างข้อมูลล้มเหลว และอัตราความสำเร็จของผู้สมัครของ Isaac Lab เองก็มีตั้งแต่ 70 เปอร์เซ็นต์ลงไปจนถึงต่ำกว่า 1 เปอร์เซ็นต์ ขึ้นอยู่กับงาน เก็บเฉพาะวิถีการเคลื่อนที่ที่สำเร็จและทำงานเสร็จสมบูรณ์ และตรวจสอบตัวอย่างเป็นวิดีโอก่อนที่คุณจะเชื่อถือชุดข้อมูล
bashpython scripts/mimic/generate_dataset.py --device cuda \ --num_envs 8 --generation_num_trials 500 \ --input_file ./datasets/annotated.hdf5 \ --output_file ./datasets/generated.hdf5 --enable_cameras - 5ฝึกฝนร่วมกัน ไม่ใช่การแทนที่
รวมตอนที่สร้างขึ้นกับตอนจริงเข้าด้วยกันเป็นชุดข้อมูล LeRobot ชุดเดียว โดยมีคีย์กล้องและการจัดเรียงข้อต่อที่เหมือนกัน ตัวเลข 38 เปอร์เซ็นต์เป็นตัวเลขของการฝึกฝนร่วมกัน
- 6ประเมินผลบนแขนกลจริง และที่นั่นเท่านั้น
การประเมินผลจากการจำลองเป็นสัญญาณการจัดอันดับที่ดี (ค่า Pearson r 0.924 ในการตั้งค่าการจับคู่ภาพของ SIMPLER) แต่ไม่ใช่การทดสอบการยอมรับ รันจุดตรวจสอบบนแท่นทดสอบก่อนที่คุณจะเชื่อถือ
หากคุณต้องการเริ่มต้นจากรายการตรวจสอบสำหรับการบันทึกจริง ครอบคลุมการจัดวางกล้อง, ผลกระทบและโหมดความล้มเหลวที่ทำให้ ชุดข้อมูลไม่สามารถใช้งานได้ รายละเอียดเกี่ยวกับรูปแบบข้อมูลอยู่ใน , และด้านไฮเปอร์พารามิเตอร์อยู่ใน .
ฉันสามารถฝึกนโยบายหุ่นยนต์ด้วยข้อมูลสังเคราะห์ทั้งหมดได้หรือไม่?▾
สำหรับงานการจัดการบนแขนกลจริงนั้น ไม่น่าเชื่อถือ ผลลัพธ์ที่เผยแพร่ทั้งหมดที่มีตัวเลขที่แข็งแกร่งล้วนเป็นผลลัพธ์จากการฝึกฝนร่วมกัน หรือการเพิ่มประสิทธิภาพบนข้อมูลจริง การเปรียบเทียบของ MimicGen เองระบุว่าการสาธิตที่สร้างขึ้น 200 รายการได้ 79 เปอร์เซ็นต์ เทียบกับ 84 เปอร์เซ็นต์สำหรับการสาธิตโดยมนุษย์ 200 รายการในงานเดียวกัน และเอกสารการฝึกฝนร่วมกันระหว่างการจำลองและของจริงในปี 2025 ระบุว่าการฝึกฝนเฉพาะในการจำลองและถ่ายโอนมักต้องการความพยายามอย่างมากจากมนุษย์เพื่อเชื่อมช่องว่างระหว่างความเป็นจริง RoboCasa แสดงให้เห็นว่าข้อมูลที่สร้างขึ้นสามารถเอาชนะข้อมูลของมนุษย์ได้ที่ 47.6 เทียบกับ 28.8 เปอร์เซ็นต์ แต่เฉพาะกับการสาธิตที่สร้างขึ้น 72,000 รายการ เทียบกับการสาธิตโดยมนุษย์ 1,250 รายการ ภายในโปรแกรมจำลองที่สร้างทั้งสองอย่าง
ฉันยังคงต้องการตอนจริงกี่ตอน หากฉันสร้างตอนสังเคราะห์ขึ้นมา?▾
บน AY-Robots ผู้ฝึกสอนต้องการอย่างน้อย 30 ตอนสำหรับ SmolVLA และ 50 ตอนสำหรับ ACT, GR00T N1.5, GR00T N1.7 และ Pi0.5 โดยไม่คำนึงว่าตอนเหล่านั้นมาจากไหน เอกสาร Mimic ของ Isaac Lab ระบุว่าต้องการการสาธิตโดยมนุษย์ที่สำเร็จประมาณ 10 ครั้งเพื่อเป็นจุดเริ่มต้นในการสร้างข้อมูล ตัวเลขเหล่านี้แตกต่างกันและตอบคำถามที่ต่างกัน: 10 คือสิ่งที่ตัวสร้างข้อมูลต้องการ ส่วน 30 ถึง 50 คือสิ่งที่ผู้ฝึกสอนต้องการ
ข้อมูลจำลองต้องอยู่ในรูปแบบ LeRobot หรือไม่?▾
หากต้องการฝึกฝนบนแพลตฟอร์มนี้ ใช่ Isaac Lab และ LeIsaac ทั้งคู่สร้าง robomimic-flavoured HDF5. Isaac Lab core ไม่มีตัวแปลง LeRobot แต่ LeIsaac มี isaaclab2lerobot.py สำหรับ LeRobot v2 และ isaaclab2lerobotv3.py สำหรับ v3 และ IsaacLab-Arena มี convert_hdf5_to_lerobot.py ที่มุ่งเป้าไปที่ GR00T ซึ่งขับเคลื่อนด้วยการกำหนดค่า YAML โปรดสังเกตเวอร์ชัน: GR00T N1.5 และ N1.7 ใช้ LeRobot v2.0 หรือ v2.1 ในขณะที่ Pi0.5, SmolVLA และ ACT ใช้ v3.0 ชุดข้อมูล v3.0 จะทำให้ตัวโหลด GR00T ขัดข้องและต้องถูกแปลงกลับเป็น v2.1
Isaac Gym ยังคงเป็นสิ่งที่ถูกต้องที่จะเรียนรู้ในปี 2026 หรือไม่?▾
ไม่ หน้าผลิตภัณฑ์ของ NVIDIA เองมีหัวข้อว่า "Isaac Gym - ตอนนี้เลิกใช้แล้ว" และระบุว่าเป็นซอฟต์แวร์รุ่นเก่าที่นักพัฒนาสามารถดาวน์โหลดและใช้งานต่อไปได้ แต่ไม่ได้รับการสนับสนุนอีกต่อไป และชี้ไปที่ Isaac Lab เป็นตัวแทน Isaac Lab มีคู่มือการย้ายข้อมูลจาก IsaacGymEnvs, จาก OmniIsaacGymEnvs และจาก Orbit ดังนั้นสภาพแวดล้อมที่มีอยู่จึงสามารถพกพาได้แทนที่จะสูญหายไป
ฉันสามารถนำ SO-100 หรือ SO-101 เข้าไปใน Isaac Lab ได้หรือไม่?▾
สำหรับ SO-101 ใช่ สามารถทำได้อย่างถูกต้อง คลังเก็บข้อมูล TheRobotStudio มีทั้งไฟล์ URDF และ MJCF สำหรับ SO-101 ซึ่งสร้างขึ้นด้วย onshape-to-robot จากโมเดล CAD ของ Onshape และ LeIsaac มีงาน Isaac Lab ที่พร้อมใช้งาน เช่น LeIsaac-SO101-PickOrange-v0 พร้อมการควบคุมระยะไกลจากแขนนำ SO101 จริง สำหรับ SO-100 คลังเก็บข้อมูลเดียวกันนี้มีเพียงไฟล์ URDF เดียวและไม่มีโมเดล MuJoCo โปรดทราบถึงข้อจำกัดที่ระบุไว้ใน README ของ SO-101 ไม่ว่าในกรณีใด: ตาข่ายการชนของฐานถูกลบออกเนื่องจากพฤติกรรมการชนที่มีปัญหา คุณสมบัติของมอเตอร์ STS3215 ถูกปรับมาจากโปรเจกต์ Open Duck Mini แทนที่จะระบุจาก SO-101 และข้อตกลงการจับจาก 0-ปิด ถึง 100-เปิด ยังไม่สะท้อนในไฟล์โมเดล
แพลตฟอร์มนี้รันการจำลองให้ฉันหรือไม่?▾
ไม่ AY-Robots บันทึกชุดข้อมูล LeRobot จากการควบคุมระยะไกลจริง ปรับแต่งนโยบายที่รองรับทั้งห้าบน GPU ที่เช่า และส่งจุดตรวจสอบที่ได้กลับไปยังแขนกล ไม่มีโปรแกรมจำลอง ไม่มีการสร้างข้อมูลสังเคราะห์ และไม่มีการสร้างฉากในนั้น หากคุณสร้างข้อมูลจากที่อื่นและแปลงเป็นชุดข้อมูล LeRobot ที่ถูกต้อง ผู้ฝึกสอนจะยอมรับมันเหมือนกับการบันทึกจริงทุกประการ
Sources
- MimicGen project page (CoRL 2023): fewer than 200 human demos to over 50,000 across 18 tasks, Panda/Sawyer/IIWA/UR5e, Square D0 79 percent generated against 84 percent human
- DexMimicGen: Automated Data Generation for Bimanual Dexterous Manipulation via Imitation Learning (Jiang et al., 2024), 21K demos from 60 source human demos
- RoboCasa: Large-Scale Simulation of Everyday Tasks for Generalist Robots (Nasiriany et al., 2024), 100 tasks, 150+ object categories, 100K MimicGen trajectories, 28.8 vs 47.6 percent
- Sim-and-Real Co-Training: A Simple Recipe for Vision-Based Robotic Manipulation (Maddukuri et al., 2025), average 38 percent real-world improvement
- GR00T N1: An Open Foundation Model for Generalist Humanoid Robots (NVIDIA, 2025), data pyramid, 780,000 sim trajectories in 11 hours, 88 to 827 hours of neural trajectories, ablations
- DreamGen: Unlocking Generalization in Robot Learning through Video World Models (Jang et al., 2025), 22 new behaviours from one task, DreamGen Bench
- Evaluating Real-World Robot Manipulation Policies in Simulation (SIMPLER, Li et al., 2024), MMRV and Pearson r for visual matching and variant aggregation, 7x speedup over real eval
- Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World (Tobin et al., 2017), 1.5 cm real-world localisation from random textures
- Isaac Lab docs: record_demos.py, annotate_demos.py, generate_dataset.py, the about-10-demos guidance and the candidate success rates, read 23 Aug 2026
- Isaac Lab pip installation: isaacsim[all,extscache]==5.1.0, Isaac Sim 5.X requires Python 3.11, ./isaaclab.sh --install
- Isaac Lab reproducibility and determinism: identical on identical hardware, varies across hardware, no determinism guarantee for non-rigid bodies
- Isaac Lab events API: randomize_rigid_body_material, randomize_actuator_gains, randomize_visual_texture_material and the related randomisation terms
- NVIDIA Isaac Gym product page: now deprecated, legacy software, no longer supported, Isaac Lab is the replacement
- LeIsaac documentation: installation and compatibility table, SO101 teleoperation, available environments, LeRobot recorder, MimicGen env, isaaclab2lerobot converters, NVIDIA Brev
- SO-ARM100 Simulation/SO101: scene.xml, so101_new_calib.xml, so101_old_calib.xml, onshape-to-robot origin, borrowed Open Duck Mini motor parameters, gripper mapping caveat
Ready for high-quality robotics data?
AY-Robots connects your robots to skilled operators worldwide.
Get Started