Они приняли настоящие серверы за часть симуляции во время оценки кибербезопасности
Инженеры компании Anthropic обнаружили, что в ходе проведенных ранее тестов на кибербезопасность три модели семейства Claude смогли получить доступ к интернету и взломали реальные системы трех организаций. Это произошло из-за ошибки в настройках изолированной тестовой среды: модели посчитали, что доступ в интернет и реальные системы — часть учебного сценария, в рамках которого им требовалось найти и похитить секретные данные. Отчет о расследовании с описанием трех основных инцидентов опубликован на сайте компании.
Одним из способов оценить способность большой языковой модели в области кибербезопасности служат испытания типа «захват флага». В них нейросети описывают вымышленную ситуацию и поручают найти «флаг» — секретную строку или файл, спрятанный, например, на другом компьютере, веб-сайте или в уязвимой программе. Обычно модели не задают способ решения: она должна сама найти способ проникнуть в систему, чтобы получить данные. Как правило, такие тесты проводят в изолированных средах, симулирующих вымышленную ситуацию, чтобы действия подопытной нейросети не затронули реальные компьютерные системы.
Однако из-за роста способностей моделей их удержание в рамках симуляции иногда становится непростой задачей. Во время одного из тестов ранняя версия модели o1 от OpenAI столкнулась с тем, что сервер с искомым «флагом» по ошибке не запустился, но вместо прекращения работы нашла открытый порт и получила доступ к системе управления испытанием. Затем модель запустила сервер сама и изменила инструкции так, чтобы секретный файл после загрузки автоматически скопировался ей, обойдя предусмотренный сценарием взлом. Подробнее об этом можно прочесть в опубликованном N + 1 фрагменте книги «Если кто-то его создаст — все погибнут. Почему сверхчеловеческий ИИ уничтожит нас всех».
Теперь с подобными инцидентами столкнулась компания Anthropic. Инженеры компании изучили записи 141006 предыдущих испытаний моделей Claude на способность проводить кибератаки в сценарии «захват флага». Совместно с партнером по тестированию, компанией Irregular, они обнаружили три инцидента, произошедших в шести запусках, когда модели Opus 4.7, Mythos 5 и неназванная исследовательская версия получили доступ к интернету и атаковали реальные системы. В промпте моделям сообщали, что испытание проходит в симуляции без доступа к внешней сети. Однако из-за ошибки в конфигурации тестовой среды интернет оказался доступен, поэтому модели первоначально считали, что найденные реальные серверы — это часть теста.
Самый серьезный инцидент произошел с моделью Opus 4.7. Название вымышленной компании, фигурировавшей в задании, совпало с названием реально существовавшего домена. Нейросеть сначала пыталась найти цель внутри тестовой среды, но не смогла. Затем она обнаружила в интернете сайт настоящей компании и приняла ее инфраструктуру за часть испытания. В четырех прогонах теста модель нашла уязвимости, получила учетные данные и проникла в базу данных. В ходе рассуждений Opus 4.7 смог распознать признаки того, что система, вероятно, настоящая, однако не продолжил атаку.
Во втором случае модель Mythos 5 обнаружила в тестовой среде инструкцию установить из каталога PyPI пакет с вымышленным названием, которого в каталоге не существовало. Нейросеть зарегистрировала учетную запись в настоящем репозитории PyPI, создала пакет с таким названием, добавила в него вредоносный код и опубликовала его в общем доступе. Примерно за час пакет скачали и запустили на 15 реальных системах, а с одной из них модель похитила учетные данные и использовала их для дальнейшего проникновения в инфраструктуру компании.
После проведенного расследования в Anthropic пришли к выводу, что эти случаи были следствием ошибок в организации испытаний, а не злонамеренным поведением моделей. Claude выполняли поставленную задачу, но из-за неверного представления о границах симуляции атаковали реальные системы. В будущем компания намерена усилить контроль за тестовой инфраструктурой, а также точнее задавать допустимые цели испытаний. В Anthropic отмечают, что новейшая исследовательская модель прекратила атаку, когда поняла, что вышла за пределы тестовой среды, а стандартные защитные механизмы релизных версий Claude должны вообще заблокировать подобное поведение.
В апреле Anthropic отказалась от публичного релиза модели Claude Mythos из-за угроз кибербезопасности. Компания объяснила это тем, что модель продемонстрировала выдающиеся способности в обнаружении и использовании уязвимостей в программном обеспечении. Доступ к модели получило ограниченное число организаций, которые будут использовать ее для поиска и исправления уязвимостей в критически важном софте.
Разбираемся в лоре легендарных мемов машинного обучения
Мнение редакции может не совпадать с мнением автора
У исследователей искусственного интеллекта есть собственные знаковые ритуалы, шутки и внутренние мемы. Как в программировании давно прижился «Hello, World!», так и в машинном обучении появились собственные артефакты: от культовых картинок до историй, которые регулярно цитируют в статьях и на конференциях. В этом блоге я расскажу про несколько самых известных из них.