Разработан метод обучения роботов для эффективного сотрудничества с людьми
>
11 сен 2026

Разработан метод обучения роботов для эффективного сотрудничества с людьми

Людей моделировать трудно. Мы мыслим быстро и сложно, а наши точные действия предсказать невозможно. Как же тогда обучить роботов работать с нами бок о бок?

Обычно в средах обучения на основе симуляции человек выступает фиксированным входным параметром. Проще говоря, он совершает последовательные и предсказуемые действия, которые мало похожи на реальное поведение людей.

Хао Чжан, постдокторант-исследователь в лаборатории безопасного ИИ Дина Чжао, работает над улучшением взаимодействия человека и робота с помощью HALO - оптимизации политики Ляпунова для гетерогенных агентов.

Что такое HALO

HALO - это фреймворк, который использует мультиагентное обучение с подкреплением, чтобы роботы самостоятельно учились взаимодействовать и сотрудничать с людьми.

Во время симуляции методика представляет партнёра-человека как обучаемого робота. Так обе стороны учатся взаимодействовать друг с другом с нуля - без фиксированного ввода и без прописанных сценариев.

"Эффективное сотрудничество человека и робота должно снижать, а не создавать дополнительные требования к обучению людей", - говорит Чжао, доцент кафедры машиностроения.

"Люди-партнёры естественно различаются по тому, как они двигаются, общаются и принимают решения. Поэтому если заставлять всех следовать предписанному шаблону взаимодействия, это ограничит полезность робота".

Постепенно они учатся сотрудничать друг с другом. И вот, когда человек ведёт себя необычно или неожиданно, робот уже знает, как адаптироваться и реагировать на незнакомые движения.

Взаимодействие человекоподобного робота и человека. Фото: Инженерный колледж, Университет Карнеги - Меллона

Обучение без прописанных людей

"Вместо того чтобы учить человека вести себя определённым образом ради робота, мы обучаем робота в условиях открытого взаимодействия, где могут проявляться разные модели поведения партнёра", - говорит Чжан, постдокторант-исследователь кафедры машиностроения.

В спасательной операции или больничной палате критично, чтобы транспортировка и другой ручной труд выполнялись безопасно и надёжно. Если роботы перевозят пациента в больнице, они должны точно реагировать друг на друга и на всех остальных участников, чтобы обеспечить безопасный и эффективный уход.

"Когда вы что-то транспортируете, вы физически связаны с партнёром через объект", - говорит Чжан. "Даже небольшие расхождения в timing или движении могут привести к тому, что процессы обучения агентов начнут мешать друг другу, и эффективному сотрудничеству станет трудно научиться. Стабильность критична в процессе обучения".

Где ломается координация

Исследователи показали: с помощью HALO эти роботы умеют обходить мебель и стены, таща при этом крупные и неудобные предметы. Они быстро и точно реагируют на смещение веса или неожиданные движения человека - меняют стойку, чтобы лучше распределить нагрузку, или поворачиваются сильнее либо слабее, чем предполагали, подстраиваясь под траекторию напарника.

Но в процессе обучения всплывает проблема - разрыв в рациональности. Цель у обоих одна, а учатся они порознь. И вот каждый вырабатывает своё представление о том, как лучше взаимодействовать. Стратегия, разумная с точки зрения одного участника, может совсем не подходить команде в целом.

Взять хотя бы диван, который надо протащить за угол. Один попробует завалить его на бок, чтобы встал вертикально. Другой в это время старается держать диван горизонтально и двигать вперёд. Оба в итоге хотят переместить один и тот же предмет в одну и ту же сторону - а задача затягивается, потому что методы мешают друг другу.

Проверка безопасности для командной работы

Чтобы с этим справиться, Чжан применяет теорию устойчивости Ляпунова. Это гарантия безопасности: она обеспечивает сходимость процессов обучения у каждого участника и перенаправление к траектории, оптимальной для всей команды. Проще говоря, каждый наблюдает за движениями другого, анализирует их и подстраивает своё поведение, чтобы прийти к согласию.

В лаборатории всё начали с компьютеров и двух роботов - как и в большинстве других симуляций. Так исключали проблему неправдоподобного, запрограммированного поведения человека. Когда роботы научились гладко работать друг с другом, одного заменили на живого человека.

«В HALO изменчивость человека становится частью процесса обучения робота - груз адаптации перекладывается с человека на машину», - поясняет Чжао.

Сейчас они продолжают доказывать масштабируемость своего метода. Планы такие: постепенно вводить всё больше роботов и людей, которые взаимодействуют между собой. К сентябрю до четырёх роботов должны научиться работать сообща.

Теги: human-robot collaboration, HALO, multi-agent reinforcement learning, Lyapunov stability, Carnegie Mellon University, Hao Zhang, Ding Zhao