Blog
Insights on robotics, AI, and data collection

Запуск циклу DAgger на SO-100 з VLA-політикою
Послідовний опис одного циклу DAgger з людською гавернкою на рукаві SO-100: запустити політику та записати її, захопити управління, якщо щось пішло не так, зареєструвати запуск як коригування, скомпонувати змішаний набір даних та продовжити навчання з контрольної точки. Включає шлях захоплення клавіатури та слайдерів для людей без лідер-руки та чотири помилки, які роблять цикл марним.

Вимірювання цикла DAgger: рівень втручання, протокол оцінювання та пастки посередині
Рівень втручання - кадри втручання поділені на кадри запуску - це найдешевший чесний сигнал прогресу, який має цикл DAgger керований людиною. Ця стаття визначає його так, щоб дві люди обчислили одне й те саме значення, показує, як його логувати, і розбирає чотири способи, якими він вас вводить в оман: привичка оператора, дрейфуюча установка оцінювання, навчання лише на виправленнях і людина, яка виправляє по-іншому у вівторок, ніж у понеділок.

HG-DAgger та керовані варіанти: Хто вирішує, коли взяти керування політикою робота
Простий DAgger просить людину позначити стани, поки робот все ще їде. На реальній апаратурі це небезпечно і дає погані позначки. Керовані варіанти замінюють сліпу розмітку на шлюз, який має утримувати хтось: людина в HG-DAgger, класифікатор безпеки в SafeDAgger, розбіжність ансамблю в EnsembleDAgger, кошторисна оцінка новизни та ризику в ThriftyDAgger. У цій статті порівнюються варіанти за тим, хто керує шлюзом, який сигнал його відкриває та що це коштує кожному — і чому форма з керуванням людини та єдина, яка витримує контакт з реальною рукою.

DAgger пояснено: Чому Behavior Cloning дрейфує та що насправді доводить Dataset Aggregation
Behavior cloning тренується на розподілі стану експерта та потім розгортається самостійно. Розрив між цими двома розподілами – це причина, чому política, що виглядає добре в валідації, падає зі столу на кроці 300. Це теоретичний розділ нашої серії DAgger: звідки бере початок квадратичний член помилки, що змінює dataset aggregation, що припускає доказ без жалю та яку частину рахунку повинен оплатити людський експерт.

Використання DROID, BridgeData V2 та Open X на SO-100
DROID, BridgeData V2 та Open X-Embodiment перетворюються на 7-вимірні дії кінцевого ефектора на 6- та 7-ступеневих маніпуляторах. SO-100 приймає 6 позицій суглобів. Що передається, що ні, і що робити замість цього.

Синтетичні дані для політик роботів: Де допомагає симуляція
Симуляція може перетворити кілька демонстрацій на тисячі. Ось що насправді говорять опубліковані цифри, де проявляється розрив між симуляцією та реальністю, і що ще потрібно записати.

Малі моделі VLA: TinyVLA, SmolVLA та випадок до 1 мільярда параметрів
TinyVLA та SmolVLA розміщують робочий VLA з менш ніж 1 мільярдом параметрів. Реальні цифри з обох статей, налаштування за замовчуванням LeRobot, виміряна затримка та вартість запуску на карті 24 ГБ.

Запуск висновку GR00T без локального графічного процесора
Ваша роботизована машина не має графічного процесора. Розмістіть сервер політик GR00T на орендованому хмарному графічному процесорі, передавайте фрагменти дій до маніпулятора і дізнайтеся, скільки саме коштує вам мережа.

Як тренувати ACT на SO-100 з нуля
Тренуйте Action Chunking Transformer з нуля на SO-100 за допомогою lerobot: конфігурація act, chunk_size та n_action_steps, розклад на 100000 кроків, висновок за 20 мс.

Яку політику VLA варто тренувати у 2026 році?
GR00T N1.7, Pi0.5, SmolVLA, ACT чи GR00T N1.5? Таблиця рішень, адаптована до реальних ситуацій, з опублікованими бенчмарками, затримкою, вартістю за запуск та ліцензіями для кожного вибору.

Вартість навчання VLA: Скільки насправді коштує один запуск доналаштування
Реальні ціни на GPU на спотовому ринку, скільки часу працює кожна з п'яти політик, скільки коштує рука та демонстрації, і чотири місця, куди тихо зникають гроші.

Запишіть свій перший набір даних LeRobot за допомогою SO-100
Запишіть придатний для використання набір даних LeRobot за допомогою SO-100: калібрування, телеоперація за принципом «лідер-послідовник», справжні прапорці та значення за замовчуванням lerobot-record, налаштування камери, кількість епізодів та дефекти, що псують запуск.

Як тренувати SmolVLA на 24 ГБ GPU (lerobot 0.6.1)
SmolVLA — це VLA з 450 мільйонами параметрів, який доопрацьовується на одній 24 ГБ карті. Справжні команди lerobot 0.6.1, фактичні значення за замовчуванням, пастки, що коштували цілий день, і вартість одного запуску.

Як тренувати Pi0.5 на власних даних робота
Додатково налаштуйте Pi0.5, VLA з зіставленням потоків від Physical Intelligence, на власних даних робота. Реальні команди для openpi та lerobot pi05, пастки формату набору даних, обмеження VRAM та затримки.

Як навчити GR00T N1.7 на власному наборі даних SO-100
Перевірений покроковий посібник для доопрацювання NVIDIA GR00T N1.7 на наборі даних LeRobot SO-100: реальні прапорці, modality.json, вимога v2.1, скільки коштує запуск та підводні камені.
RT-2: Як моделі зору-мови-дії переносять веб-знання в керування роботами
Дізнайтеся, як модель зору-мови-дії RT-2 від Google революціонізує керування роботами, переносячи веб-знання у фізичні дії. Ознайомтеся з її архітектурою, методами навчання, новими можливостями та наслідками для робототехнічних компаній та операторів, включаючи інтеграцію з телеоперацією для ефективного навчання ШІ.
RoboTurk: Краудсорсингове навчання роботів через віддалену телеоперацію
Дізнайтеся, як RoboTurk революціонізує навчання роботів шляхом краудсорсингу високоякісних даних через віддалену телеоперацію, що дозволяє створювати масштабовані набори даних для моделей ШІ в робототехніці. Дослідіть його вплив на навчання імітації, моделі VLA та ROI для компаній, що займаються робототехнікою.
Політики роботів Pi-Zero на основі узгодження потоків: Революція в спритному управлінні за допомогою ініціалізації VLM
Дізнайтеся, як техніка узгодження потоків Pi-Zero, у поєднанні з ініціалізацією VLM, трансформує політики роботів-універсалів для спритного управління. Дізнайтеся про її переваги над традиційними методами, ефективність даних навчання ШІ для робототехніки та наслідки для масштабованого розгортання роботів у промисловості.
Isaac Lab: Next-Generation GPU Simulation for Multi-Modal Robot Learning
Discover how NVIDIA's Isaac Lab revolutionizes multi-modal robot learning through GPU-accelerated simulations, enabling faster AI training, scalable deployment, and optimized ROI for robotics researchers and companies.
Isaac Gym: GPU-Native Physics Simulation for Robot Learning - Scaling Thousands of Parallel Environments
Discover how Isaac Gym revolutionizes robot learning with GPU-native physics simulation, enabling thousands of parallel environments for rapid reinforcement learning, VLA models training, and efficient AI robot teleoperation. Explore benchmarks, integration with PyTorch, and real-world applications that bridge the sim-to-real gap.
BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning - What Scale Really Means
Дізнайтеся, як BC-Z революціонізує роботизоване імітаційне навчання, дозволяючи узагальнювати завдання zero-shot за допомогою масштабованих демонстраційних даних. Відкрийте для себе закони масштабування, моделі VLA, найкращі практики телеоперацій і переваги ROI для компаній, що займаються робототехнікою, та інженерів зі штучного інтелекту.
RT-2: Чому високоякісні дані для навчання роботів перевершують алгоритми – революційні ідеї Google DeepMind
Дізнайтеся, як модель RT-2 від Google DeepMind революціонізує AI-робототехніку, наголошуючи на вирішальній ролі високоякісних даних для навчання над передовими алгоритмами. У цій статті розглядаються експерименти, які демонструють, чому ефективний збір даних є важливим для реальної роботи роботів. Дізнайтеся, як платформи, такі як AY-Robots, можуть допомогти подолати розрив у даних для навчання для майбутніх інновацій.
RT-2 від Google DeepMind: Як ця модель зору-мови-дії трансформує навчання роботів
Дізнайтеся, як модель зору-мови-дії (VLA) RT-2 від Google змінює навчання роботів, інтегруючи візуальні дані, природну мову та дії в реальному часі. Ця інноваційна технологія штучного інтелекту покращує збір даних для телеоператорів і підвищує ефективність у робототехнічних застосуваннях. Дослідіть її потенційний вплив на майбутнє роботів на основі штучного інтелекту на AY-Robots.