Статья:

МЕТОД ACTYOLO ДЛЯ РЕШЕНИЯ МНОГОМОДАЛЬНЫХ ЗАДАЧ УПРАВЛЕНИЯ РОБОТОМ НА ОСНОВЕ ТРАНСФОРМЕРНЫХ ПОЛИТИК

Журнал: Научный журнал «Студенческий форум» выпуск №25(376)

Рубрика: Физико-математические науки

Выходные данные
Фильченков М.А., Героев А.С. МЕТОД ACTYOLO ДЛЯ РЕШЕНИЯ МНОГОМОДАЛЬНЫХ ЗАДАЧ УПРАВЛЕНИЯ РОБОТОМ НА ОСНОВЕ ТРАНСФОРМЕРНЫХ ПОЛИТИК // Студенческий форум: электрон. научн. журн. 2026. № 25(376). URL: https://nauchforum.ru/journal/stud/376/189200 (дата обращения: 26.07.2026).
Журнал опубликован
Мне нравится
на печатьскачать .pdfподелиться

МЕТОД ACTYOLO ДЛЯ РЕШЕНИЯ МНОГОМОДАЛЬНЫХ ЗАДАЧ УПРАВЛЕНИЯ РОБОТОМ НА ОСНОВЕ ТРАНСФОРМЕРНЫХ ПОЛИТИК

Фильченков Михаил Александрович
аспирант, Федеральное государственное автономное образовательное учреждение высшего образования «Московский политехнический университет», РФ, г. Москва
Героев Александр Сергеевич
аспирант, Федеральное государственное бюджетное учреждение науки «Институт проблем управления им. В. А. Трапезникова Российской академии наук», РФ, г. Москва

 

ACTYOLO METHOD FOR SOLVING MULTIMODAL ROBOT CONTROL TASKS BASED ON TRANSFORMER POLICIES

 

Filchenkov Mikhail Alexandrovich

Postgraduate student, Federal State Autonomous Educational Institution of Higher Education «Moscow Polytechnic University», Russia, Moscow

Geroyev Alexander Sergeevich

Postgraduate student, Federal State Autonomous Educational Institution of Higher Education «Moscow Polytechnic University», Russia, Moscow

 

Аннотация. Статья посвящена проблеме применения архитектуры Action Chunking with Transformers (ACT) в многомодальных задачах управления роботом, где одно целевое состояние может быть достигнуто несколькими последовательностями действий. Экспериментально показано, что стандартный ACT усредняет моды распределения, что делает политику неспособной решать задачи перекладывания нескольких идентичных объектов. Предложен метод ActYOLO, в котором визуальный энкодер ResNet18 заменён на нейросеть сегментации YOLO с последующей фильтрацией по наибольшей маске и проекцией признаков. Введён механизм временного трекера для повышения робастности. Эксперименты на роботе ARM95 в задаче поочерёдного взятия двух одинаковых объектов показали, что предложенный метод достигает успешности более 80 % при 0 % успеха исходного ACT.

Abstract. The article addresses the problem of applying the Action Chunking with Transformers (ACT) architecture in multimodal robot control tasks where the same target state can be achieved by several action sequences. It is experimentally shown that standard ACT averages distribution modes, making the policy unable to solve object stacking tasks with multiple identical objects. The ActYOLO method is proposed, where the visual ResNet18 encoder is replaced by a YOLO-based segmentation network with subsequent largest‑mask filtering and feature projection. A temporal tracker is introduced to improve robustness. Experiments on an ARM95 robot in a sequential picking task with two identical objects show that the proposed method achieves over 80 % success versus 0 % for the original ACT.

 

Ключевые слова: имитационное обучение, робототехника, трансформеры, многомодальность, детекция объектов, Action Chunking Transformer, ActYOLO, YOLO, компьютерное зрение.

Keywords: imitation learning, robotics, transformers, multimodality, object detection, Action Chunking Transformer, ActYOLO, YOLO, computer vision.

 

1. Введение

Современные методы имитационного обучения (Imitation Learning) широко применяются в роботизированной манипуляции [1]. Одним из перспективных подходов является архитектура Action Chunking with Transformers (ACT), предложенная Zhao и соавторами [2]. ACT эффективно решает точные манипуляционные задачи: вставка батарейки, натяжение стяжки, открывание контейнера. Однако в реальных сценариях часто встречаются многомодальные задачи: например, на столе лежат два одинаковых предмета, и робот должен взять их по очереди — порядок не важен, но существует два равноценных решения. Экспериментально установлено, что стандартный ACT в таких ситуациях усредняет моды распределения, пытаясь схватить точку «между» предметами, что сводит вероятность успеха к нулю. Актуальной является разработка метода, позволяющего использовать унимодальные политики для многомодальных сценариев путём модификации только входного визуального энкодера.

Цель работы — модификация архитектуры ACT для решения многомодальных задач. Научная новизна заключается в интеграции визуального энкодера на базе нейросети сегментации YOLO и механизма временного трекера.

2. Базовый метод ACT

Архитектура ACT основана на использвании нейросетей-трансформеров [3]. В стандартной реализации (см. рисунок 1) изображения с камер обрабатываются ResNet18, формируя карты признаков. Для каждого шага генерируется «чанк» — блок последовательности действий, вычисляемой по формуле (1):

В процессе обучения ACT минимизирует ошибку восстановления последовательности действий согласно формуле (2):

 

Рисунок 1. Архитектура стандартного метода ACT

 

Основное преимущество ACT — снижение ошибки накопления благодаря предсказанию блоков действий. Однако при наличии обучающего набора данных с примерами случайной манипуляции несколькими одинаковыми объектами эксперт действий начинает генерировать усреднённые по модам последовательности действий, что приводит к генерации усреднённой траектории робота, которая всегда приводит в среднюю точку между всеми объектами манипулирования.

3. Формализация многомодальности в контексте имитационного обучения

Пусть на рабочей поверхности присутствует множество объектов . Целевое поведение заключается в успешном взаимодействии со всеми объектами. Общее множество допустимых решений представляет собой объединение всех возможных перестановок, как показано в формуле (3):

где  множество всех перестановок  объектов. Такое распределение решений является многомодальным. Критерий успешности определяется как способность агента последовательно взаимодействовать со всеми объектами независимо от порядка выбора.

4. Предлагаемый метод ActYOLO

Для преодоления описанных ограничений предлагается метод ActYOLO, архитектура которого представлена на рисунке 2. Основная идея заключается в замене визуального кодера ResNet18 на детектор объектов YOLO [4].

 

Рисунок 2. Архитектура предлагаемого метода ActYOLO

 

В ActYOLO визуальный кодер ResNet18 заменён на предобученную модель YOLO для сегментации объектов.

Основные шаги:

1. Детекция и сегментация всех объектов на сцене.

2. Выбор объекта с наибольшей площадью маски (selection_strategy = 'largest_area').

3. Наложение маски на исходное RGB-изображение (пиксели вне маски обнуляются).

4. Проекция замаскированного изображения через свёрточную сеть в тензор признаков размерности , который подаётся в трансформер ACT.

Проектор — два свёрточных слоя с шагом 2, BatchNorm и ReLU (таблица 1). Веса YOLO заморожены, проектор и трансформер обучаются совместно.

Таблица 1.

Архитектура проектора (входное изображение 3×128×128)

Слой

Тип слоя

Параметры

Вход  Выход (каналы)

1

Conv2d

3×3, stride=1, padding=1

 64

2

BatchNorm2d + ReLU

64  64

3

Conv2d

3×3, stride=2, padding=1

64  128

4

BatchNorm2d + ReLU

128  128

5

Conv2d

3×3, stride=2, padding=1

128  256

6

BatchNorm2d + ReLU

256  256

 

5. Механизм временного трекера

Для повышения робастности введён трекер с параметром tracker_miss_frames (M). Состояние трекера определяется по формуле (4):

В режиме удержания положение объекта экстраполируется с постоянной скоростью. Оптимальное  получено эмпирически.

6. Гиперпараметры метода

Ключевые параметры (таблица 2) выбраны на основе валидационной выборки.

Таблица 2.

Основные гиперпараметры метода ActYOLO

Параметр

Обозначение

Диапазон

Значение по умолчанию

Стратегия выбора объекта

selection_strategy

'largest_area' / 'closest_to_center'

'largest_area'

Число кадров удержания

tracker_miss_frames

5…30

10

Режим маскирования

mask_mode

'blur' / 'binary' / 'zero'

'blur'

Порог уверенности YOLO

confidence_threshold

0.3…0.7

0.5

 

Обучение: оптимизатор Adam200 эпох, батч-размер 8, градиентное клиппирование на уровне 1.0.

7. Экспериментальная проверка

Эксперименты проведены на роботе-манипуляторе ARM95 с камерой 640×480 (30 Гц). Задача: на столе два одинаковых мотка скотча; робот должен взять их оба в любом порядке. Обучающая выборка — 100 демонстраций (50 с порядком «левый→правый», 50 — «правый→левый»). Тестирование — 100 новых эпизодов для каждой конфигурации. Метрика — доля успешных полных выполнений (захват и перенос обоих объектов).

Сравнивались четыре конфигурации: оригинальный ACT, ActYOLO без трекера, ActYOLO с трекером (M=10). Результаты в таблице 3.

Таблица 3.

Успешность выполнения задачи (%) для различных конфигураций

ACT (оригинальный)

0

0,0

ActYOLO (без трекера)

62

5,4

ActYOLO (с трекером, M=10)

83

3,8

ActYOLO (с трекером, M=20)

79

4,2

 

Оригинальный ACT даёт 0 % из-за усреднения мод. Добавление трекера повышает успешность с 62 % до 83 %. Оптимальность M=10 подтверждается зависимостью (рисунок 1): максимум достигается в диапазоне 10–12.

На задаче с одним объектом успешность ACT — 92 % ± 2,1 %, ActYOLO — 91 % ± 2,4 % (разница статистически незначима, p>0.05). Следовательно, предложенная модификация не ухудшает работу на классических задачах.

Среднее время инференса на кадр (GPU RTX 3060): ACT — 20,5 мс, ActYOLO — 30,4 мс (увеличение на 48 %). Это приемлемо для работы с частотой 30 Гц (период 33,3 мс).

Из 17 неудачных эпизодов (при M=10) основные причины: перекрытие объектов (53 %), потеря после заслона (29 %), ошибка калибровки (18 %). Это определяет направления дальнейшего улучшения.

8. Заключение

Предложен метод ActYOLO, расширяющий применимость трансформерных политик ACT на многомодальные задачи. Ключевые результаты:

  • разработана архитектура с заменой визуального кодера на YOLO и проектором;
  • введён механизм трекера с оптимальным параметром M = 10 M=10;
  • экспериментально достигнута успешность 83 % на задаче с двумя одинаковыми объектами (против 0 % у исходного ACT);
  • показано, что метод не ухудшает работу на унимодальных задачах.

Рекомендуемые настройки: selection_strategy = 'largest_area', tracker_miss_frames = 10, mask_mode = 'masked_image', confidence_threshold = 0.5.

Перспективы: адаптация к переменному числу объектов, использование RGB-D камер для разделения перекрытий, тестирование на физическом роботе.

 

Список литературы:
1. Mandlekar A., Xu D., Wong J., et al. What Matters in Learning from Offline Human Demonstrations for Robot Manipulation // Proceedings of the NeurIPS Workshop on Offline Reinforcement Learning. – 2021. URL: https://arxiv.org/abs/2108.03298
2. Zhao T.Z., Kumar V., Levine S., Finn C. Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware // arXiv preprint arXiv:2304.13705. – 2023. URL: https://arxiv.org/abs/2304.13705
3. Vaswani A., Shazeer N., Parmar N., et al. Attention Is All You Need // Advances in Neural Information Processing Systems (NIPS). – 2017. URL: https://arxiv.org/abs/1706.03762
4. Redmon J., Farhadi A. YOLOv3: An Incremental Improvement // arXiv preprint arXiv:1804.02767. – 2018. URL: https://arxiv.org/abs/1804.02767
5. Urain J., Mandlekar A., Du Y., et al. Deep Generative Models in Robotics: A Survey on Learning from Multimodal Demonstrations // arXiv preprint arXiv:2408.04380. – 2024. URL: https://arxiv.org/abs/2408.04380
6. He K., Gkioxari G., Dollár P., Girshick R. Mask R-CNN // Proceedings of the IEEE International Conference on Computer Vision (ICCV). – 2017. – P. 2961–2969. URL: https://arxiv.org/abs/1703.06870
7. Snoek J., Larochelle H., Adams R.P. Practical Bayesian Optimization of Machine Learning Algorithms // Advances in Neural Information Processing Systems (NIPS). – 2012. – Vol. 25. URL: https://arxiv.org/abs/1206.2944
8. Welch G., Bishop G. An Introduction to the Kalman Filter // University of North Carolina at Chapel Hill, TR 95-041. – 1995. URL: https://www.cs.unc.edu/~welch/media/pdf/kalman_intro.pdf