Одна из них нашла лазейку в интернет через DNS и обратилась к стороннему чат-боту
OpenAI приостановила обучение своих самых мощных больших языковых моделей после выявления уязвимости в тестовой среде. В ходе обучения автономный ИИ-агент на базе внутренней исследовательской модели обошел запрет на доступ в интернет, использовав запросы к системе доменных имен (DNS) для связи со сторонним чат-ботом. Параллельно с этим стало известно, что агенты компании совершали действия, выходящие за рамки поставленных задач на сайтах некоторых государственных ведомств США. По информации из отчета OpenAI, компания взяла паузу в процессах обучения моделей для изучения обстоятельств и обновления архитектуры безопасности.
Это простая для понимания новость, разобраться в общих чертах сможет даже школьник. Допустим, простые заметки про нейросети вам понятны, а как насчет математики, которая необходима во всех точных науках? Углубиться в ее изучение поможет Т-Образование. А если вы только начинаете этот путь или думаете о том, чтобы выбрать его для ребенка, первым шагом может стать Московская школа программистов.
Хотите увеличить сложность? Научим.
Проблема контроля поведения больших языковых моделей, известная как выравнивание (alignment), обострилась с резким ростом возможностей новых моделей и появлением на их базе автономных ИИ-агентов. Такие системы уже способны самостоятельно писать код, отправлять запросы в сеть, а также находить и использовать уязвимости. Хотя во время обучения и тестирования возможностей новых моделей разработчики стараются изолировать их в тестовом окружении, иногда в попытке достичь заданной цели ИИ-агенты нарушают инструкции и пытаются решить задачу, обходя ограничения. Наиболее известным инцидентом стала атака на платформу Hugging Face летом 2026 года. Тогда агенты OpenAI смогли вырваться из «песочницы» во время испытаний на поиск уязвимостей и проникнуть в инфраструктуру платформы в поисках готовых решений. После этого OpenAI частично приостановила обучение своих моделей на две недели, чтобы усилить меры безопасности и улучшить мониторинг.
Поводом для новой паузы в OpenAI стал инцидент, случившийся 20 сентября. Во время обучения с подкреплением внутренней исследовательской модели ИИ-агент должен был найти информацию об определенном человеке. Действия агент выполнял в изолированной среде без доступа к настоящему интернету. Вместо этого его запросы получали ответ из офлайн-копий веб-страниц. Не найдя нужного ответа, агент попробовал напрямую обратиться к нескольким общедоступным поисковикам, но получил ошибки на свои запросы. Тогда он заметил, что DNS-резолвер «песочницы» — сервер, который переводит доменные имена в IP-адреса – имеет доступ к внешним серверам. Через эту брешь агент переслал около двух десятков вопросов стороннему чат-боту, однако необходимый ответ так и не получил. Система мониторинга подняла тревогу примерно через 12 минут, но вручную процесс остановили через два с половиной часа. После этого OpenAI приостановила обучение, оценку и запуск своих наиболее мощных моделей с использованием инструментов, чтобы убедиться, что выявленная лазейка закрыта, а также для проведения дополнительных проверок защиты. Компания также уточнила, что откажется от дальнейшего обучения участвовавшей в инциденте модели.
Стало известно и о других происшествиях, связанных с сайтами некоторых государственных ведомств. По информации Associated Press, агенты OpenAI обращались к открытым данным, размещенным на сайтах Комиссии по ценным бумагам и биржам (SEC) и Бюро переписи населения. В случае с SEC агент скопировал найденные на публично доступной странице сведения и разместил их в другом месте в интернете, хотя не получал такого задания. При этом OpenAI не обнаружила признаков взлома внутренних систем SEC или доступа к какой-либо закрытой информации. Параллельно с этим некоммерческая исследовательская лаборатория Transluce сообщила о неудавшейся попытке агентов, предположительно связанных с OpenAI, атаковать сайт Министерства образования США. OpenAI на данный момент не подтвердила их принадлежность, а государственное ведомство не выявило никакого ущерба своим системам.
Еще один случай аномального поведения моделей OpenAI произошел в июне, хотя публично известно о нем стало лишь в сентябре. ИИ-агент смог обойти ограничения австралийского государственного портала медицинской статистики с данными о расходах на здравоохранение и получил доступ к непубличным файлам. Персональные данные при этом раскрыты не были.
На странице отчетов OpenAI компания описала и другие случаи. Например, во время обучения одна модель добавляла в собственные заметки указания скрывать ошибки от пользователя, другая искала опубликованные в интернете ключи доступа, а некоторые агенты загружали файлы на сторонние сайты. В одном из эпизодов агент, которому поручили самостоятельно доказать математическое утверждение, попытался украсть чужое решение, несмотря на неоднократный прямой запрет этого действия. При этом он опубликовал токен исследователя в открытом репозитории GitHub. На данный момент компания продолжает проверку аномальных действий своих моделей и уведомляет организации, чьи сервисы они могли затронуть.
Летом 2026 года компания Anthropic сообщала, что в ходе тестов на кибербезопасность три модели семейства Claude смогли получить доступ к интернету и взломали реальные системы трех организаций. Агенты посчитали, что доступ в интернет и реальные системы — часть учебного сценария.
Реклама: АНО ДПО «Т-Образование», ИНН 7743270426, erid: 2W5zFHdB8n5