Чтобы преодолеть это ограничение, авторы предложили алгоритм MAPF-GPT-DDG с активным режимом дообучения. В итеративном процессе система сама выявляет сцены, которые решает плохо (например, сложные разведения агентов в лабиринтах), и запрашивает у экспертного планировщика-оракула правильные примеры поведения. Полученные сэмплы добавляются в обучающую выборку, после чего трансформер доучивается, проходя файн-тюнинг (SFT), но с целенаправленным отбором наиболее трудных образцов.
«Оказалось, что для мультиагентного случая недостаточно стандартных приёмов вроде GRPO для обучения с подкреплением или обычного файн-тюнинга. Приходится придумывать активный режим дообучения. Мы не формируем сразу всю дополнительную выборку с участием эксперта, а запрашиваем только те примеры, которые оказываются сложными для текущей модели», — пояснил Александр Панов.
Именно такой подход позволил не только адаптировать модель к принципиально иному классу задач, но и установить абсолютный рекорд. В тестах на карте размером 2048×2048 система успешно координировала более 524 тысяч агентов со 100-процентной успешностью, а при миллионе агентов успешность составила 99,9%. Скорость принятия решений достигала 163 микросекунд на одного агента. При этом модель с двумя миллионами параметров после дообучения по методу DDG показала качество решений, сопоставимое с исходной моделью, имевшей 85 миллионов параметров.
«Наша разработка впервые среди обучаемых систем успешно скоординировала движение миллиона виртуальных агентов на одной карте — это абсолютный рекорд для этого класса задач. Классические подходы либо не масштабируются, либо требуют огромных вычислительных ресурсов. MAPF-GPT-DDG эту проблему решил», — рассказал соавтор работы Александр Панов.
Практическая значимость метода напрямую связана с автоматизацией крупных логистических центров. Задача MAPF уже сейчас решается для сотен и тысяч роботов на сортировочных пунктах Amazon, Почты России и других компаний, где плоские мобильные платформы перевозят стойки с товарами. Умение в реальном времени строить траектории и оперативно исправлять ошибки критически важно для таких складов. Эксперименты с миллионом роботов были прежде всего научным вызовом, однако не лишены и футурологической перспективы.
«С практической точки зрения миллионы роботов сейчас менее актуальны. Но когда-нибудь в будущем, когда появится огромный сортировочный центр — на всю планету или на несколько планет Солнечной системы, — тогда и миллион роботов во флоте тоже пригодится», — добавил учёный.
Источник: https://scientificrussia.ru/articles/nejroset-naucili-upravlat-millionom-robotov-metod-aktivnogo-doo...
Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!