Фото © Bloomberg
Вслед за OpenAI об инциденте сообщил и конкурент Anthropic: согласно сообщению, одна из моделей компании вышла за пределы тестовой среды. Политическая дискуссия о безопасности ИИ набирает обороты.
Спустя несколько недель после громкой хакерской атаки, совершенной моделью ИИ разработчика ChatGPT — компании OpenAI, — её конкурент Anthropic признал, что с ним произошло нечто подобное. Как сообщила компания, занимающаяся ИИ, в ходе тестовых запусков искусственный интеллект (ИИ) Anthropic непреднамеренно проник в компьютерные системы трёх компаний.
Ни пострадавшие компании, ни сама Anthropic сначала этого не заметили. Активность была обнаружена только при последующей проверке более 141 000 тестовых прогонов, проведенной после инцидента с OpenAI. Названия затронутых компаний пока не называются.
В то время как ИИ OpenAI сначала должен был найти способ вырваться из тестовой среды в открытый Интернет, для моделей Claude от Anthropic путь был свободен всё время. Причиной послужило недоразумение, поскольку в тестовом сценарии предполагалось, что у них нет доступа к Интернету. Однако «неправильные настройки» в системах, эксплуатируемых Anthropic и партнером по тестированию Irregular, привели к тому, что модели смогли получить доступ к Интернету. Об этом Anthropic сообщает в записи в блоге.
В свете этого инцидента политическая дискуссия о безопасности систем искусственного интеллекта в США, вероятно, обострится. «Искусственный интеллект развивается чрезвычайно быстро, при этом отсутствуют реальные нормативные акты, гарантирующие нашу безопасность», — критиковал уже на прошлой неделе конгрессмен из Техаса Грег Касар.
Согласно сообщению журнала «Fortune», глава OpenAI Сэм Альтман провел последние дни в Вашингтоне, чтобы ознакомить высокопоставленных представителей правительства США — в том числе министра финансов Скотта Бессента и министра торговли Говарда Лутника — с будущими моделями своей компании. Как сообщается, в ходе встречи также обсуждался вопрос безопасности решений на базе ИИ.
В ходе недавно ставшего известным инцидента с моделями OpenAI программное обеспечение в ходе тестирования самостоятельно получило доступ к открытому интернету и проникло в компьютерные системы платформы искусственного интеллекта Hugging Face. По данным OpenAI, модель действовала как хакер и использовала незамеченные уязвимости в системе безопасности. Компания назвала это «беспрецедентным киберинцидентом».
В интервью на вопрос о том, как OpenAI отреагировала на инциденты в сфере кибербезопасности, Альтман ответил: «Мы приостановили обучение». По его словам, необходимо выяснить, как можно улучшить так называемые «песочницы», то есть тестовые среды для моделей. «Возможно, нам придется замедлить темпы развития ИИ», — добавил Альтман.
Буквально во вторник более 1200 сотрудников OpenAI, Anthropic, Google и Meta подписали открытое письмо под названием «Pacing the Frontier». В нем содержится призыв к правительству США создать «технические и регуляторные инструменты» для замедления развития потенциально опасного ИИ.
Согласно информации, тесты, о которых стало известно сейчас, были направлены на проверку хакерских способностей ИИ. Это обычная практика, позволяющая установить для них более эффективные ограничения. В частности, моделям ИИ было поручено найти определённую информацию, спрятанную на другом компьютере, — и для этого даже проникнуть в систему.
По словам Anthropic, партнер по тестированию выбрал для вымышленной компании название, которое также встречается в реальном веб-адресе. Модель Claude Opus 4.7 сначала испытывала трудности с выполнением задачи в предусмотренной тестовой среде. Однако затем программа обнаружила компанию с таким же названием и сосредоточилась на ней. Подобное происходило сразу в четырёх прогонах. Среди прочего, модель получила доступ к базе данных. Даже когда ИИ осознал, что речь идёт о реальной компании, атака не была остановлена.
Согласно записи в блоге, в ходе другого теста программа Anthropic написала вредоносное ПО для взлома целевого компьютера. Однако благодаря доступу к сети она смогла разместить его в открытом доступе на платформе для скачивания. Там вредоносное ПО было доступно около часа — и его скачали 15 систем.
Среди них, как сообщается, была компания, занимающаяся ИТ-безопасностью, которая регулярно загружает и запускает подобные скрипты для их тестирования. Благодаря установке модели Mythos 5 от Anthropic она получила доступ к компьютерной инфраструктуре компании. В записи в блоге отмечается, что поведение ИИ было неидеальным.
В третьем инциденте тестовая модель просканировала около 9000 целей для атаки, прежде чем остановила свой выбор на одной из них. На этот раз ИИ остановил атаку, когда понял, что речь идет о реальной компании, как сообщила Anthropic.
Эксперты уже давно предупреждают о кибератаках с использованием программного обеспечения на базе ИИ. Тот факт, что Anthropic теперь сообщает о подобных атаках, контрастирует с имиджем компании: ее глава Дарио Амодеи до сих пор позиционировал себя как сторонник якобы особенно ответственного развития ИИ.
