77592246 403 1.jpg 1 Deutsche Welle Anthropic
Deutsche Welle

ИИ-модели Anthropic атаковали системы в интернете

Anthropic признал, что в ходе предрелизного тестирования по кибербезопасности ее модели с искусственным интеллектом проникли в компьютерные системы трех других компаний. Недавно аналогичный инцидент произошел с OpenAI.Американский технологический гигант Anthropic признал, что в ходе предрелизного тестирования по кибербезопасности ее модели с искусственным интеллектом проникли в компьютерные системы трех других компаний. Об этом команда Anthropic сообщила в четверг, 30 июля.

Компания проанализировала 141 006 тестовых прогонов, в четырех из них была атакована одна и та же организация. Остальные два инцидента произошли в рамках независимого тестирования.

Изначально ни пострадавшие, ни Anthropic не выявили взлома. Это произошло лишь при последующих проверках.

В тестовом сценарии указывалось, что у моделей нет доступа к интернету.

Однако из-за ошибки в настройках компьютеры, к которым Claude получал доступ в рамках тестирования, были подключены к сети. Ни Anthropic, ни партнер по тестированию Irregular не знали об ошибке в настройках, пока не обнаружили ее в ходе дополнительного мониторинга на минувшей неделе.

В инцидентах участвовали три разных модели

В трех инцидентах участвовали три разных модели, и каждая из них по-разному реагировала на ситуацию.

Как уточнил портал "Межа", речь шла о Mythos 5, Opus 4.7 и одной внутренней исследовательской модели. Они восприняли реальные серверы и веб-сайты как часть тестового задания.

Все три случая произошли во время выполнения упражнения capture-the-flag, которое широко используется для оценки навыков в сфере кибербезопасности. Модели должны были находить скрытую информацию в контролируемой среде, однако из-за доступа к интернету начали взаимодействовать с реальными системами.

Модели не использовали уязвимости "нулевого дня"

В Anthropic подчеркнули, что модели не использовали уязвимости "нулевого дня" (zero-day, неизвестный разработчикам дефект в программном коде). Они применяли только базовые методы взлома, в частности воспользовались слабыми паролями и незащищенными конечными точками — устройствами или веб-адресами. Кроме того, во время тестов были отключены дополнительные защитные механизмы, которые используются в публичных версиях Claude.

Один из самых серьезных инцидентов касался Mythos 5, которая создала и опубликовала вредоносный пакет на Python в репозитории PyPI, ошибочно считая это частью симуляции. Пакет оставался доступным около часа и был запущен на 15 реальных системах, одна из которых принадлежала компании, занимающейся кибербезопасностью.

Другая модель, Opus 4.7, не найдя вымышленную цель, обнаружила в интернете реальный сайт с таким же названием и атаковала его. В то же время внутренняя исследовательская модель просканировала примерно 9000 адресов и смогла получить доступ к одному из приложений, но впоследствии самостоятельно прекратила атаку, когда определила, что среда не связана с тестовым заданием.

Аналогичный инцидент с OpenAI

После инцидентов Anthropic приостановила все испытания в области кибербезопасности, которые могут иметь доступ к интернету, и проводит проверку собственной тестовой инфраструктуры совместно с партнером Irregular.

Недавно аналогичный инцидент произошел с OpenAI. Во время тестирования агенты на базе GPT-5.6 Sol и еще одной невыпущенной модели вышли за пределы изолированной среды, обнаружив неизвестную уязвимость, и получили доступ к части производственной инфраструктуры Hugging Face. После этого Hugging Face потребовала от OpenAI 100 млн долларов (87 млн евро) в виде вычислительных ресурсов для разработки средств киберзащиты.

Поддержите свободу слова в Грузии

SOVA — это независимый голос о событиях в регионе на русском языке. В условиях давления на медиа, ваша поддержка — это гарантия нашей независимости и возможности говорить правду.

Deutsche Welle

Вам также может понравиться

Ещё статьи из рубрики => Deutsche Welle