Ранее в этом году Amazon Web Services (AWS) начала призывать инженеров экономнее использовать вычислительные ресурсы процессоров. По данным The Information, компания столкнулась с увеличением времени ожидания серверных CPU на фоне роста ИИ-нагрузок.
Причина заключается в изменении характера работы ИИ-систем. Традиционный вывод больших языковых моделей (LLM) преимущественно выполняется на GPU или специализированных ускорителях. Однако агентные системы способны самостоятельно вызывать внешние инструменты, обращаться к API, работать с файлами, запускать программы и передавать задачи другим агентам. Значительная часть этих операций выполняется на CPU.
Один ИИ-агент может породить тысячи вычислительных задач
По словам аналитика Moor Insights & Strategy Мэтта Кимбалла, масштабирование агентного ИИ способно многократно увеличить нагрузку на процессоры.
Если один агент создаёт сотни отдельных действий или субагентов, то при развертывании такой системы на уровне крупной компании число операций может вырасти до десятков и сотен тысяч или даже миллионов.
Исследователь Intel Сувик Кунду отмечает, что CPU отвечает за разбор результатов работы модели, выбор инструментов, выполнение API-вызовов, запуск программ, обработку полученных данных и передачу результатов обратно модели.
В AMD также указывают на высокую роль процессоров. По словам вице-президента компании Мадху Рангараджана, в тестах до семи из восьми этапов реалистичных конвейеров агентного ИИ выполнялись непосредственно на CPU.
Таким образом, производительность агентной системы определяется уже не только скоростью GPU. Процессор может стать узким местом, из-за которого дорогостоящий ускоритель простаивает в ожидании следующей задачи.
CPU и GPU начинают простаивать друг из-за друга
Исследователи из Intel и Georgia Tech обнаружили, что в агентных нагрузках процессор и GPU могут поочередно простаивать: пока LLM выполняет вычисления на GPU, CPU ожидает, а во время вызова инструментов ситуация меняется на противоположную.
Одним из решений становится более эффективное планирование вычислений. По данным исследования, оптимизация распределения задач способна уменьшить сквозную задержку агентных нагрузок до 1,8 раза.
Дополнительную проблему создают механизмы безопасности. Агентные системы должны проверять команды, файлы и результаты операций на соответствие заданным политикам. Для этого используются правила обработки данных и небольшие модели машинного обучения, которые также нередко выполняются на CPU.
Длинный контекст увеличивает нагрузку
Еще одним потенциальным узким местом становится токенизация. Перед обработкой текста языковая модель преобразует его в последовательность токенов, однако этот процесс существенно отличается от массово параллельных вычислений GPU и в значительной степени зависит от CPU.
Проблема особенно заметна в агентных системах с длинным контекстом. При каждом новом вызове инструмента системе может потребоваться обработать большой объем накопленного контекста и результатов предыдущих операций.
Исследование ученых Georgia Tech показало, что увеличение количества CPU-ядер способно значительно сократить задержку до получения первого токена. В отдельных тестах на длинных последовательностях выигрыш достигал нескольких раз.
По оценке исследователей, проблема может стать еще заметнее по мере увеличения контекстных окон. В агентных системах длина последовательности способна достигать сотен тысяч и даже миллиона токенов.
Производители снова наращивают выпуск серверных CPU
Рост агентных нагрузок уже отражается на рынке процессоров. Intel, AMD, Arm и Qualcomm усиливают внимание к серверным CPU, ориентированным на инфраструктуру искусственного интеллекта.
Собственные решения для таких задач развивает и Nvidia. Компания представила CPU Vera на архитектуре Arm, предназначенный, в частности, для систем агентного ИИ и работы в составе платформы Vera Rubin.
Таким образом, развитие агентного ИИ меняет баланс вычислительных ресурсов в дата-центрах. После нескольких лет, когда главным дефицитным компонентом инфраструктуры ИИ были GPU и память, в центре внимания вновь оказался CPU.
Если число одновременно работающих агентов продолжит быстро расти, серверные процессоры могут превратиться в новый дефицитный ресурс — и стать одним из факторов, ограничивающих дальнейшее масштабирование ИИ-инфраструктуры.
Источник: https://spectrum.ieee.org/ai-cpu-comeback?itm_source=homepage&itm_medium=hero&itm_ca...Если вам понравился материал, кликните значок — вы поможете нам узнать, каким статьям и новостям следует отдавать предпочтение. Если вы хотите обсудить материал —не стесняйтесь оставлять свои комментарии : возможно, они будут полезны другим нашим читателям!