Пока другие роботы учатся годами, XR-1 освоил бытовые задачи за несколько часов.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/676;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Большие языковые и визуальные модели обычно улучшаются, когда получают больше качественных данных, параметров и вычислительных ресурсов. В робототехнике тот же принцип долго не удавалось проверить: физические машины собирают обучающие записи медленно и дорого. Для работы нужны помещение, предметы, исправное оборудование, операторы и постоянный контроль, а ошибка может повредить технику или остановить сессию. Из-за нехватки крупных наборов данных разработчики не знали, насколько далеко можно масштабировать модели управления роботами.
Xiaomi попыталась обойти дефицит записей с помощью Xiaomi-Robotics-1, или XR-1. Сначала модель обучают на большом массиве траекторий UMI, не привязанных к устройству конкретного робота, а затем настраивают на меньшем количестве записей с физических машин. Разработчики хотели выяснить, будет ли качество предсказания действий расти вместе с объёмом данных и числом параметров.
UMI расшифровывается как Universal Manipulation Interface, или универсальный интерфейс манипуляций. Метод фиксирует движения захвата и перемещения предметов без участия конкретной роботизированной платформы. Собирать примеры физических действий таким способом проще, чем записывать каждую демонстрацию на настоящей машине.
Для предварительного обучения подготовили 100 тысяч часов UMI-траекторий, охватывающих более 1700 сценариев. Записи сделали в жилых домах, коммерческих помещениях, на промышленных объектах и открытых площадках. Набор включает бытовые, складские и производственные операции с разными предметами, поверхностями и способами захвата.
Разметить весь архив вручную невозможно, поэтому разработчики автоматизировали процесс. Длинные записи разделили на отрезки одинаковой продолжительности, после чего визуально-языковая модель описала изменения в каждом фрагменте. Система отмечала движение захвата, положение предметов до и после операции, а также объекты, которых он касался.
Вместо общей подписи вроде «робот убирает кухню» фрагмент получал точное описание действия. Например, захват приблизился к чашке, поднял её со стола и переставил на полку. XR-1 училась по описанию результата подбирать движения, которые переводят сцену из исходного состояния в нужное.
Так модель осваивает базовые принципы обращения с предметами: приближается к объекту, выбирает точку контакта, удерживает вещь при переносе и избегает столкновений. XR-1 связывает требуемый результат с последовательностью действий, а не запоминает одну команду для определённой комнаты.
Однако UMI-траектории сами по себе не готовят модель к управлению физической машиной. Общие движения нужно сопоставить с приводами, суставами, камерами, захватом и мобильной платформой конкретного робота. Кроме того, при предварительном обучении XR-1 получает подробное описание изменения сцены, тогда как человек обычно даёт короткую команду: убрать вещи, загрузить бельё или сложить предметы в коробку.
Для следующего этапа объединили собственные записи Xiaomi, отобранные открытые данные с разных роботизированных платформ и дополнительную подборку качественных UMI-траекторий. На физических машинах собрали более 7200 часов демонстраций в настоящих жилых помещениях. Роботы приводили в порядок диваны, сортировали обувь в шкафах и убирали кухонные принадлежности.
Подобные задания требуют распознать предмет, определить его положение, подъехать на подходящее расстояние, спланировать движение манипулятора и выполнить захват. После этого робот должен перенести вещь, не задев мебель и соседние объекты, а затем положить её в нужное место.
UMI-записи для дообучения размечали вручную. Специалисты указывали временные границы операций и составляли инструкции. В предварительном наборе автоматические подписи объясняли, как изменилась сцена, а ручная разметка учила XR-1 понимать обычные команды и самостоятельно раскладывать их на отдельные движения.
Во время дообучения общие двигательные навыки связывали с устройством реального робота. Модель учитывала геометрию манипулятора, допустимые углы поворота суставов, положение камер, форму захвата и возможности мобильной базы. Одновременно XR-1 училась выполнять команды на естественном языке без подробного перечисления промежуточных этапов.
Проверка предварительного обучения показала устойчивую зависимость. С увеличением объёма данных и размера модели ошибка предсказания действий последовательно снижалась. Кривая не вышла на заметное плато, поэтому дополнительные записи и параметры продолжали улучшать результат.
Затем XR-1 испытали на физических роботах в незнакомых помещениях и с новыми экземплярами предметов. Чем больше данных и параметров использовали на предварительном этапе, тем чаще машины успешно завершали задания после одинакового дообучения. Навыки, полученные на UMI-траекториях, переносились на реальные движения и обстановку, которой не было в обучающем наборе.
Рост успешности также не замедлился до заметного предела. Результаты показывают, что разработчикам не обязательно собирать весь обучающий массив на дорогих физических машинах. Основную часть примеров можно записать без привязки к определённому роботу, а затем адаптировать модель к нужной платформе.
После дообучения XR-1 выполняет разные виды мобильных манипуляций без отдельной настройки под каждую комнату или экземпляр предмета. Способность быстро осваивать незнакомые операции проверили на упаковке телефонов, пополнении бумаги в принтере, загрузке белья и укладке предметов в коробки. Для каждой задачи использовали лишь несколько часов демонстраций с реальным роботом.
При среднем объёме менее десяти часов записей на задачу общая успешность XR-1 достигла 75%, а модель π0.5 при том же бюджете получила 40%. XR-1 упаковывала телефоны с результатом 70% против 30%, пополняла бумагу в принтере с результатом 70% против 20%, загружала бельё с результатом 80% против 40% и складывала предметы в коробки с результатом 80% против 70%.
Когда средний объём демонстраций увеличили до менее чем 40 часов на задачу, общая успешность XR-1 поднялась до 85%, а показатель π0.5 составил 53%. При упаковке телефонов модели набрали 80% и 40%, при пополнении принтера 60% и 20%, при загрузке белья 100% и 50%. Обе системы без ошибок справились с укладкой предметов в коробки.
Дополнительные данные улучшили средний результат XR-1, хотя показатель на задаче с принтером снизился с 70% до 60%. Следовательно, увеличение числа демонстраций не гарантировало рост качества в каждой отдельной операции.
XR-1 также проверили в четырёх симуляционных наборах для робототехники: RoboCasa, RoboCasa365, VLABench и RoboDojo. Устоявшихся русских названий у них нет. Испытания измеряют среднюю долю успешно выполненных заданий и проверяют, насколько хорошо модель переносит навыки на новые сцены и условия.
В RoboCasa XR-1 набрала 74,5%, а ближайший соперник 72,6%. Относительная разница составила 2,6%. В RoboCasa365 показатели достигли 57,4% и 46,6%, что дало XR-1 преимущество в 23,2%.
В VLABench XR-1 получила 59,1% против 53,2% у ближайшего конкурента. Относительная разница составила 11,1%. Самый большой отрыв зафиксировали в RoboDojo: 13,93% против 8,80%, или 58,3%.
Низкие абсолютные показатели RoboDojo указывают на сложность заданий: даже лучшая модель справилась лишь с небольшой их частью. Данные таблиц RoboCasa365 и RoboDojo были актуальны на 15 июля 2026 года.
Метод по-прежнему требует записей с настоящих роботов. Без них модель не сможет учесть механику оборудования, задержки приводов, погрешности датчиков, ограничения захвата и неоднозначность человеческих команд. Однако объём реальных демонстраций составил 7200 часов против 100 тысяч часов UMI-траекторий. Большую часть опыта XR-1 получила до адаптации к конкретной машине.
Разработчики завершили презентацию непрерывной записью упаковки багажа. Робот выполнил всю последовательность без монтажа и скрытых склеек.
<div class="articl-text-cover" style="position:relative;width:100%;max-width:800px;margin-left:auto;margin-right:auto;aspect-ratio:1200/676;margin-bottom:2rem;overflow:hidden">
<div itemprop="articleBody">Большие языковые и визуальные модели обычно улучшаются, когда получают больше качественных данных, параметров и вычислительных ресурсов. В робототехнике тот же принцип долго не удавалось проверить: физические машины собирают обучающие записи медленно и дорого. Для работы нужны помещение, предметы, исправное оборудование, операторы и постоянный контроль, а ошибка может повредить технику или остановить сессию. Из-за нехватки крупных наборов данных разработчики не знали, насколько далеко можно масштабировать модели управления роботами.
Xiaomi попыталась обойти дефицит записей с помощью Xiaomi-Robotics-1, или XR-1. Сначала модель обучают на большом массиве траекторий UMI, не привязанных к устройству конкретного робота, а затем настраивают на меньшем количестве записей с физических машин. Разработчики хотели выяснить, будет ли качество предсказания действий расти вместе с объёмом данных и числом параметров.
UMI расшифровывается как Universal Manipulation Interface, или универсальный интерфейс манипуляций. Метод фиксирует движения захвата и перемещения предметов без участия конкретной роботизированной платформы. Собирать примеры физических действий таким способом проще, чем записывать каждую демонстрацию на настоящей машине.
Для предварительного обучения подготовили 100 тысяч часов UMI-траекторий, охватывающих более 1700 сценариев. Записи сделали в жилых домах, коммерческих помещениях, на промышленных объектах и открытых площадках. Набор включает бытовые, складские и производственные операции с разными предметами, поверхностями и способами захвата.
Разметить весь архив вручную невозможно, поэтому разработчики автоматизировали процесс. Длинные записи разделили на отрезки одинаковой продолжительности, после чего визуально-языковая модель описала изменения в каждом фрагменте. Система отмечала движение захвата, положение предметов до и после операции, а также объекты, которых он касался.
Вместо общей подписи вроде «робот убирает кухню» фрагмент получал точное описание действия. Например, захват приблизился к чашке, поднял её со стола и переставил на полку. XR-1 училась по описанию результата подбирать движения, которые переводят сцену из исходного состояния в нужное.
Так модель осваивает базовые принципы обращения с предметами: приближается к объекту, выбирает точку контакта, удерживает вещь при переносе и избегает столкновений. XR-1 связывает требуемый результат с последовательностью действий, а не запоминает одну команду для определённой комнаты.
Однако UMI-траектории сами по себе не готовят модель к управлению физической машиной. Общие движения нужно сопоставить с приводами, суставами, камерами, захватом и мобильной платформой конкретного робота. Кроме того, при предварительном обучении XR-1 получает подробное описание изменения сцены, тогда как человек обычно даёт короткую команду: убрать вещи, загрузить бельё или сложить предметы в коробку.
Для следующего этапа объединили собственные записи Xiaomi, отобранные открытые данные с разных роботизированных платформ и дополнительную подборку качественных UMI-траекторий. На физических машинах собрали более 7200 часов демонстраций в настоящих жилых помещениях. Роботы приводили в порядок диваны, сортировали обувь в шкафах и убирали кухонные принадлежности.
Подобные задания требуют распознать предмет, определить его положение, подъехать на подходящее расстояние, спланировать движение манипулятора и выполнить захват. После этого робот должен перенести вещь, не задев мебель и соседние объекты, а затем положить её в нужное место.
UMI-записи для дообучения размечали вручную. Специалисты указывали временные границы операций и составляли инструкции. В предварительном наборе автоматические подписи объясняли, как изменилась сцена, а ручная разметка учила XR-1 понимать обычные команды и самостоятельно раскладывать их на отдельные движения.
Во время дообучения общие двигательные навыки связывали с устройством реального робота. Модель учитывала геометрию манипулятора, допустимые углы поворота суставов, положение камер, форму захвата и возможности мобильной базы. Одновременно XR-1 училась выполнять команды на естественном языке без подробного перечисления промежуточных этапов.
Проверка предварительного обучения показала устойчивую зависимость. С увеличением объёма данных и размера модели ошибка предсказания действий последовательно снижалась. Кривая не вышла на заметное плато, поэтому дополнительные записи и параметры продолжали улучшать результат.
Затем XR-1 испытали на физических роботах в незнакомых помещениях и с новыми экземплярами предметов. Чем больше данных и параметров использовали на предварительном этапе, тем чаще машины успешно завершали задания после одинакового дообучения. Навыки, полученные на UMI-траекториях, переносились на реальные движения и обстановку, которой не было в обучающем наборе.
Рост успешности также не замедлился до заметного предела. Результаты показывают, что разработчикам не обязательно собирать весь обучающий массив на дорогих физических машинах. Основную часть примеров можно записать без привязки к определённому роботу, а затем адаптировать модель к нужной платформе.
После дообучения XR-1 выполняет разные виды мобильных манипуляций без отдельной настройки под каждую комнату или экземпляр предмета. Способность быстро осваивать незнакомые операции проверили на упаковке телефонов, пополнении бумаги в принтере, загрузке белья и укладке предметов в коробки. Для каждой задачи использовали лишь несколько часов демонстраций с реальным роботом.
При среднем объёме менее десяти часов записей на задачу общая успешность XR-1 достигла 75%, а модель π0.5 при том же бюджете получила 40%. XR-1 упаковывала телефоны с результатом 70% против 30%, пополняла бумагу в принтере с результатом 70% против 20%, загружала бельё с результатом 80% против 40% и складывала предметы в коробки с результатом 80% против 70%.
Когда средний объём демонстраций увеличили до менее чем 40 часов на задачу, общая успешность XR-1 поднялась до 85%, а показатель π0.5 составил 53%. При упаковке телефонов модели набрали 80% и 40%, при пополнении принтера 60% и 20%, при загрузке белья 100% и 50%. Обе системы без ошибок справились с укладкой предметов в коробки.
Дополнительные данные улучшили средний результат XR-1, хотя показатель на задаче с принтером снизился с 70% до 60%. Следовательно, увеличение числа демонстраций не гарантировало рост качества в каждой отдельной операции.
XR-1 также проверили в четырёх симуляционных наборах для робототехники: RoboCasa, RoboCasa365, VLABench и RoboDojo. Устоявшихся русских названий у них нет. Испытания измеряют среднюю долю успешно выполненных заданий и проверяют, насколько хорошо модель переносит навыки на новые сцены и условия.
В RoboCasa XR-1 набрала 74,5%, а ближайший соперник 72,6%. Относительная разница составила 2,6%. В RoboCasa365 показатели достигли 57,4% и 46,6%, что дало XR-1 преимущество в 23,2%.
В VLABench XR-1 получила 59,1% против 53,2% у ближайшего конкурента. Относительная разница составила 11,1%. Самый большой отрыв зафиксировали в RoboDojo: 13,93% против 8,80%, или 58,3%.
Низкие абсолютные показатели RoboDojo указывают на сложность заданий: даже лучшая модель справилась лишь с небольшой их частью. Данные таблиц RoboCasa365 и RoboDojo были актуальны на 15 июля 2026 года.
Метод по-прежнему требует записей с настоящих роботов. Без них модель не сможет учесть механику оборудования, задержки приводов, погрешности датчиков, ограничения захвата и неоднозначность человеческих команд. Однако объём реальных демонстраций составил 7200 часов против 100 тысяч часов UMI-траекторий. Большую часть опыта XR-1 получила до адаптации к конкретной машине.
Разработчики завершили презентацию непрерывной записью упаковки багажа. Робот выполнил всю последовательность без монтажа и скрытых склеек.
- Источник новости
- www.securitylab.ru