Когда физик Вольфганг Паули сталкивался с научной работой, построенной, по его мнению, на ошибочных рассуждениях, ему приписывают знаменитую реплику: «Это не только неверно. Это даже не неправильно».
С современными системами генеративного искусственного интеллекта возникает похожее ощущение. Большие языковые модели (LLM) способны выдавать убедительные ответы, которые выглядят логичными, но при проверке оказываются ошибочными. Причём проблема заключается не только в хорошо известных галлюцинациях — выдуманных фактах, ссылках и событиях. Гораздо сложнее обнаружить ситуацию, когда модель получает правильный ответ по неправильной причине.
Именно этот класс ошибок становится особенно важным по мере того, как LLM перестают быть исключительно чат-ботами и превращаются в компоненты автономных агентов. Модель уже не просто отвечает пользователю: она может выбирать инструменты, формировать следующие действия, корректировать собственные запросы и последовательно выполнять поставленную задачу.
В таком режиме цена ошибки резко возрастает. Если система не имеет внешнего механизма проверки, она может последовательно развивать ошибочную интерпретацию ситуации, каждый следующий шаг которой будет выглядеть правдоподобным относительно предыдущего.
Опасность «коротких путей» рассуждения
Эта проблема стала одной из тем летней школы по нейросимволическому ИИ, организованной Centaur AI Institute. В программе мероприятия был отдельный доклад Эмануэле Марконато из Университета Тренто под названием Reasoning Shortcuts — «короткие пути рассуждения».
Суть проблемы хорошо объясняется на примере систем компьютерного зрения. Нейросеть может научиться связывать определённый набор визуальных признаков с нужным ответом, не формируя при этом того представления о мире, которое человек считает естественным.
Условно представим автомобиль, который должен распознать ситуацию на дороге. Если в обучающих данных пешеход часто оказывается рядом с красным сигналом светофора, модель может научиться использовать корреляцию между этими признаками вместо полноценного распознавания объектов.
Пока система работает в привычной ситуации, результат может выглядеть правильным. Но достаточно изменить контекст — например, автомобиль находится в США и приближается к перекрёстку, где разрешён поворот направо на красный сигнал после остановки, — и скрытая ошибка классификации может проявиться уже в принятии решения.
Именно поэтому правильный ответ сам по себе ещё не доказывает, что модель правильно поняла ситуацию.
Так называемые shortcuts — «короткие пути» — позволяют нейросетевой системе получать хороший результат на известных данных, но не гарантируют обобщения на новые ситуации. Для критически важных систем это принципиальная проблема: разработчику необходимо знать не только что решила модель, но и хотя бы понимать, на каких признаках и промежуточных выводах основано решение.
Заставить модель объяснять свои решения
Один из подходов заключается в том, чтобы сделать промежуточные рассуждения модели доступными для анализа.
Именно в этом направлении развивается NVIDIA Alpamayo — семейство технологий для автономного вождения, в котором модель Alpamayo-R1 сочетает визуально-языковое рассуждение с прогнозированием траектории. NVIDIA описывает систему как vision-language-action model, способную генерировать связанные с дорожной ситуацией reasoning traces — последовательности рассуждений, связанные с принимаемым решением и поведением автомобиля.
Для автономного автомобиля это особенно важно. Если модель не просто выдаёт команду «повернуть», а формирует промежуточное объяснение того, какие объекты она обнаружила, как интерпретировала дорожную ситуацию и почему выбрала определённую траекторию, эти данные можно использовать как дополнительный слой контроля.
Однако здесь тоже нет универсального решения. Текстовое или структурированное объяснение модели не становится автоматически доказательством правильности её решения. Оно само может содержать ошибки. Поэтому следующий шаг — независимая проверка полученного результата.
И здесь нейросимволический подход получает особенно интересное преимущество.
Никакой «серебряной пули»
На конференции AGI в Сан-Франциско в конце июля директор NVIDIA по исследованиям автономных транспортных средств Марко Павоне сформулировал проблему предельно практично: универсального способа исправить ошибки LLM не существует. Вместо одной «серебряной пули» приходится использовать множество ограничений и механизмов контроля.
Это меняет саму постановку задачи.
Вместо попытки добиться от одной нейронной модели безошибочного поведения разработчики могут построить систему из нескольких компонентов. Нейронная сеть распознаёт и предлагает решение, а внешние механизмы проверяют его соответствие правилам, ограничениям или формальной модели предметной области.
Идея не нова. Фактически она возвращает в современный ИИ некоторые принципы символического искусственного интеллекта, который пережил пик популярности ещё в 1980-е годы.
Возвращение символического ИИ
Экспертные системы прошлого строились вокруг баз знаний, формализованных правил и логических механизмов вывода. Их сильной стороной была предсказуемость: при заданных входных данных и правилах можно было проследить, почему система пришла к определённому выводу.
Но была и фундаментальная проблема. Создание и поддержание больших баз знаний требовало огромного объёма ручной работы. Специалистам приходилось формализовать предметную область, создавать онтологии, описывать правила и поддерживать их в актуальном состоянии.
Масштабирование такого подхода оказалось слишком дорогим и трудоёмким. В результате символический ИИ уступил место статистическим методам машинного обучения.
Сегодня ситуация изменилась. LLM могут автоматизировать часть той самой работы, которая раньше требовала ручного описания знаний.
Получается своеобразный круг: нейронные модели помогают создавать и обрабатывать символические структуры, а символические системы, в свою очередь, проверяют результаты нейронных моделей.
Lean: когда доказательство должен принять компьютер
Особенно наглядно эта идея проявилась в математике.
Формальные системы доказательств, такие как Lean, позволяют представить математическое доказательство в машиночитаемой форме и затем проверить его с помощью программного средства. В этом случае LLM может предложить доказательство, но окончательное решение о его формальной корректности принимает не сама языковая модель.
Схема принципиально отличается от обычного диалога с чат-ботом:
LLM → гипотеза или доказательство → формальный проверяющий → принято / отклонено → новая попытка LLM.
Если доказательство не проходит проверку, модель получает возможность изменить его и попробовать снова.
Это важное архитектурное различие. Нейросеть здесь отвечает за поиск возможного решения, а формальная система — за проверку его допустимости.
Именно подобный подход оказался одним из важных элементов современного развития ИИ для математического рассуждения: система может быть вероятностной при поиске решения, но финальная проверка остаётся формальной.
От математических доказательств к агентам
Тот же принцип постепенно выходит за пределы математики.
DARPA в рамках программы CODORD исследует сочетание логического представления знаний, правил и больших языковых моделей. Программа возглавляется Бенджамином Грософом, чьи исследовательские интересы включают нейросимволический ИИ, представление знаний, объяснимость, доверенность и автономные системы. Среди опубликованных в рамках программы работ есть исследования логического заземления LLM, рассуждения по правилам и использования агентных механизмов для формального рассуждения.
Здесь возникает принципиально новый цикл.
LLM получает документы на естественном языке и помогает преобразовать их в формализованные правила. Затем эти правила проверяются и уточняются человеком. После этого символическая система может использовать их как ограничения для поведения агента.
То есть LLM оказывается не только пользователем базы знаний, но и инструментом её создания.
В долгосрочной перспективе это может значительно сократить трудозатраты на формализацию знаний. Но человеческая проверка при этом не исчезает: если исходное правило сформулировано неправильно, формальный механизм будет безупречно проверять уже неправильную модель мира.
AWS уже переносит эту идею в коммерческие системы
Похожий принцип реализуется и в Amazon Bedrock.
Amazon Bedrock Guardrails традиционно использует набор политик и фильтров для проверки входных данных и ответов моделей. Но AWS развивает отдельный механизм Automated Reasoning checks, который использует формальную логику для проверки соответствия ответа заранее заданной политике.
В такой архитектуре естественно-языковое описание требований преобразуется в формальную модель. Затем ответ LLM проверяется относительно этой модели.
Важно, однако, понимать ограничение. Формальная проверка не способна доказать истинность утверждения за пределами той модели знаний и тех правил, которые были заданы системе. AWS прямо указывает, что утверждения, не охваченные переменными и правилами политики, не проходят такую проверку. Кроме того, сложные или противоречивые правила могут создавать проблемы при переводе в формальную логику.
Иными словами, формальная проверка не превращает LLM в непогрешимый интеллект. Она делает более надёжным конкретный участок пространства решений, для которого разработчик сумел сформулировать проверяемые правила.
Символические системы могут ещё и экономить вычисления
У нейросимволического подхода есть ещё одно интересное преимущество.
Не всякая задача требует миллиардов операций на GPU. Если часть решения можно свести к поиску по относительно небольшому графу знаний или к проверке набора формальных правил, вычислительную нагрузку можно перенести на CPU.
Это особенно интересно для встроенных систем, роботов и других устройств с ограниченными энергетическими и вычислительными ресурсами.
При этом LLM может выполнять роль навигатора: не перебирать весь граф знаний, а определить, какие его фрагменты с большей вероятностью содержат необходимую информацию. После этого символический механизм выполняет более точную проверку.
Получается своеобразное разделение труда:
нейронная модель ищет и предлагает; символическая система проверяет и ограничивает.
И наоборот: LLM может строить графы знаний
Но движение идёт и в обратную сторону.
Если раньше создание базы знаний было почти полностью ручной процедурой, то сегодня LLM способны извлекать из документов сущности, отношения и правила и преобразовывать их в более формализованное представление.
Именно такой подход исследуется в программе DARPA CODORD. В этом сценарии языковая модель фактически выступает инструментом перевода с естественного языка на формальный язык знаний, после чего полученная структура проверяется и уточняется человеком.
Это может оказаться одним из наиболее практичных способов возрождения символических методов: не заставлять инженеров вручную описывать каждое правило, а использовать LLM для первичной формализации и человека — для контроля результата.
Где правила уже не спасают
Но у нейросимволической архитектуры есть фундаментальное ограничение.
Мир нельзя полностью описать набором заранее известных правил.
Автомобиль, движущийся по оживлённой улице в поисках места для парковки, одновременно сталкивается с правилами дорожного движения, физическими ограничениями, поведением других участников движения, погодой, неполными данными и случайными событиями.
Более того, правила могут конфликтовать.
Система может одновременно стремиться обеспечить безопасность, не нарушить правила дорожного движения, не создать препятствие другим участникам движения и выполнить задачу пользователя. В конкретной ситуации эти требования могут оказаться несовместимыми.
Поэтому создание гигантской базы правил не решает проблему полностью.
Здесь появляются другие подходы — вероятностные модели, байесовские методы принятия решений и архитектуры, в которых система оценивает не только допустимость действия, но и степень уверенности в имеющихся данных.
Получается ещё одна комбинация: нейронная модель работает с неопределённостью и сложными сигналами окружающего мира, символическая часть задаёт жёсткие ограничения, а вероятностный механизм помогает выбирать между несколькими допустимыми действиями.
ИИ будущего, похоже, будет гибридным
Всё это приводит к достаточно неожиданному выводу.
Несколько лет назад казалось, что масштабирование нейронных сетей постепенно позволит отказаться от значительной части прежних подходов к искусственному интеллекту. Сегодня становится всё очевиднее, что для критически важных задач одной большой нейронной модели может быть недостаточно.
Вместо этого формируется архитектура, в которой разные методы выполняют разные функции.
LLM хорошо работает с естественным языком, неструктурированной информацией и генерацией гипотез. Нейронные системы компьютерного зрения распознают сложные образы. Символические движки проверяют формальные ограничения. Формальные верификаторы подтверждают корректность доказательств. Вероятностные модели позволяют принимать решения там, где полной определённости нет.
Это уже не возвращение к экспертным системам 1980-х годов и не отказ от нейросетевого ИИ.
Скорее, речь идёт о попытке объединить преимущества двух миров.
И здесь особенно интересно то, что нейросимволический ИИ перестаёт быть исключительно академической концепцией. NVIDIA использует связанные с рассуждением модели в системах автономного вождения, DARPA финансирует проекты на стыке LLM и логического представления знаний, а AWS уже предлагает формальные Automated Reasoning checks для проверки результатов генеративных моделей.
Главный вопрос теперь заключается не в том, удастся ли заставить LLM перестать ошибаться. Вероятно, правильнее исходить из того, что ошибки неизбежны, а архитектура системы должна быть построена так, чтобы ошибка одной модели не автоматически превращалась в действие всей системы.
И тогда происходит интересный сдвиг: разработчики всё меньше пытаются научить ИИ всегда выдавать правильный ответ и всё больше учат его работать внутри пространства, где неправильные действия можно обнаружить, ограничить или отклонить.
Получается своеобразный возврат к старой идее, но уже на новом технологическом уровне: не один «умный» ИИ принимает все решения, а несколько специализированных механизмов контролируют друг друга.
Возможно, именно здесь и проходит граница между просто генеративным ИИ и действительно надёжным агентным ИИ. Но не окажется ли, что чем больше ограничений, проверяющих модулей и символических правил мы добавляем к LLM, тем меньше смысла вообще говорить об автономности такой системы? А что об этом думаете вы?
Источник: https://www.newelectronics.co.uk/content/features/righting-wrongs
Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!

