Современные роботы все чаще используют модели класса Vision-Language-Action (VLA), которые анализируют изображение с камер, интерпретируют текстовую команду и формируют последовательность управляющих действий. Однако вычисление каждого нового набора команд требует времени, из-за чего робот вынужден регулярно останавливаться для повторного планирования, что приводит к рывкам и снижению скорости работы.
Разработанная в MIT система VLASH решает эту проблему за счет прогнозирования будущего состояния самого робота. Пока исполнительный механизм завершает текущий фрагмент движения, модель уже рассчитывает следующий, ориентируясь не на текущее, а на ожидаемое положение манипулятора.
В отличие от существующих методов, которые строят план на основе уже устаревающих данных, VLASH использует информацию о траектории выполняемого движения и заранее оценивает, где окажется робот после завершения текущего действия. Это позволяет непрерывно готовить следующую последовательность команд и практически устранить паузы между операциями.
Еще одним элементом технологии стало квантование действий (Action Quantization). Вместо большого количества коротких команд робот выполняет более крупные фрагменты траектории. Хотя такой подход незначительно снижает точность отдельных движений, общая производительность возрастает в 2–3 раза при сохранении высокой надежности выполнения задач.Для обеспечения стабильной работы исследователи также разработали специальную методику обучения моделей. Вместо использования только текущих наблюдений робот обучается принимать решения, опираясь на информацию о своем будущем состоянии. Такой подход позволил ускорить процесс дообучения моделей примерно в пять раз без дополнительных вычислительных затрат.
Испытания показали, что VLASH более чем в 30 раз сокращает задержку реакции между последовательными действиями. В экспериментах роботизированные манипуляторы вдвое быстрее выполняли операции pick-and-place, сортировку и укладку объектов, сохраняя точность на уровне 90 %. Технология также успешно продемонстрировала эффективность в динамических задачах, включая настольный теннис и игру Whac-A-Mole («Ударь крота»).
По мнению авторов работы, новая архитектура особенно перспективна для мобильных роботов, работающих в быстро меняющейся среде, включая поисково-спасательные комплексы, системы аварийного реагирования, автономные производственные линии и складскую робототехнику. Возможность непрерывного планирования также позволит роботам быстрее восстанавливаться после ошибок и эффективнее взаимодействовать с человеком.
Следующим этапом исследований станет интеграция VLASH с так называемыми мировыми моделями (World Models) — генеративными системами искусственного интеллекта, способными прогнозировать изменение окружающей среды. По мнению разработчиков, сочетание предсказания будущего состояния робота и моделирования будущего окружающего мира позволит существенно повысить автономность и интеллектуальные возможности робототехнических систем нового поколения.Источник: https://news.mit.edu/2026/making-robots-faster-helping-them-think-ahead-0728
Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!