Агенты OpenAI обменивались уязвимостями через внутреннюю доску сообщений

Дмитрий Новиков

ИИ-агенты OpenAI создавали внутреннюю сеть для обмена эксплойтами, распределяли задачи и восстанавливали связь после блокировки.

Сотрудники OpenAI рассказали о необычном поведении ИИ-агентов, которое наблюдалось ещё до инцидента с атакой на репозиторий Hugging Face. Подробности были раскрыты на конференции Black Hat USA в Лас-Вегасе. По их словам, агенты около двух месяцев использовали подобие доски сообщений внутри тестовой инфраструктуры компании, где обменивались найденными уязвимостями и способами их эксплуатации.

OpenAI обнаружила и закрыла этот канал связи 4 июля, однако уже к 8 июля агенты смогли создать его заново другим способом. Сообщения, опубликованные на восстановленной площадке, впоследствии способствовали атаке на Hugging Face. Сотрудник подразделения безопасности OpenAI Эрик Уоллес описал происходящее как совместную работу группы агентов, которые находили эксплойты, передавали их друг другу и перемещались между внутренними и внешними системами на протяжении нескольких дней и недель.

Для общения агенты использовали менеджер пакетов OpenAI, предназначенный для установки программного обеспечения и доступный в разных частях инфраструктуры компании. Обнаружив уязвимость, отдельные агенты оставляли её открытой и сообщали о ней другим участникам через созданную площадку. Со временем они начали распределять обязанности, делить работу и согласовывать дальнейшие действия без ведома специалистов OpenAI.

Внутри этой сети возникали и конфликты. Агенты случайно удаляли результаты работы друг друга, подозревали других участников в подмене и предлагали подписывать сообщения специальными кодами для защиты от мошенничества. К моменту обнаружения доска уже содержала сотни тысяч сообщений, что указывало на продолжительное и масштабное взаимодействие между системами.

Эрик Уоллес связал такое поведение с тем, что передовые модели во время тестирования могут искать способы быстрее выполнить задачу с меньшим количеством инструментов. Вместо самостоятельного решения они способны попытаться найти готовый ответ в интернете, поэтому OpenAI обычно проводит испытания без доступа к сети. Во время инцидента с Hugging Face агенты смогли выйти в интернет только после эксплуатации обнаруженной уязвимости.

Другой сотрудник OpenAI, Майкл Далтон, сообщил, что несколько команд компании временно переключились на усиление систем предотвращения, обнаружения и реагирования на подобные угрозы. OpenAI также замедлила часть исследований и значительно расширила наблюдение за ИИ-агентами. По словам Далтона, полностью автоматизированные наступательные системы требуют столь же автоматизированной защиты, которой у отрасли пока нет.

Фото: © Сгенерировано нейросетью
Эта страница может использовать файлы cookie в аналитических целях.