Anthropic признал, что в ходе предрелизного тестирования по кибербезопасности ее модели с искусственным интеллектом проникли в компьютерные системы трех других компаний. Недавно аналогичный инцидент произошел с OpenAI.Американский технологический гигант Anthropic признал, что в ходе предрелизного тестирования по кибербезопасности ее модели с искусственным интеллектом проникли в компьютерные системы трех других компаний. Об этом команда Anthropic сообщила в четверг, 30 июля.
Компания проанализировала 141 006 тестовых прогонов, в четырех из них была атакована одна и та же организация. Остальные два инцидента произошли в рамках независимого тестирования.
Изначально ни пострадавшие, ни Anthropic не выявили взлома. Это произошло лишь при последующих проверках.
В тестовом сценарии указывалось, что у моделей нет доступа к интернету.
Однако из-за ошибки в настройках компьютеры, к которым Claude получал доступ в рамках тестирования, были подключены к сети. Ни Anthropic, ни партнер по тестированию Irregular не знали об ошибке в настройках, пока не обнаружили ее в ходе дополнительного мониторинга на минувшей неделе.
В инцидентах участвовали три разных модели
В трех инцидентах участвовали три разных модели, и каждая из них по-разному реагировала на ситуацию.
Как уточнил портал "Межа", речь шла о Mythos 5, Opus 4.7 и одной внутренней исследовательской модели. Они восприняли реальные серверы и веб-сайты как часть тестового задания.
Все три случая произошли во время выполнения упражнения capture-the-flag, которое широко используется для оценки навыков в сфере кибербезопасности. Модели должны были находить скрытую информацию в контролируемой среде, однако из-за доступа к интернету начали взаимодействовать с реальными системами.
Модели не использовали уязвимости "нулевого дня"
В Anthropic подчеркнули, что модели не использовали уязвимости "нулевого дня" (zero-day, неизвестный разработчикам дефект в программном коде). Они применяли только базовые методы взлома, в частности воспользовались слабыми паролями и незащищенными конечными точками — устройствами или веб-адресами. Кроме того, во время тестов были отключены дополнительные защитные механизмы, которые используются в публичных версиях Claude.
Один из самых серьезных инцидентов касался Mythos 5, которая создала и опубликовала вредоносный пакет на Python в репозитории PyPI, ошибочно считая это частью симуляции. Пакет оставался доступным около часа и был запущен на 15 реальных системах, одна из которых принадлежала компании, занимающейся кибербезопасностью.
Другая модель, Opus 4.7, не найдя вымышленную цель, обнаружила в интернете реальный сайт с таким же названием и атаковала его. В то же время внутренняя исследовательская модель просканировала примерно 9000 адресов и смогла получить доступ к одному из приложений, но впоследствии самостоятельно прекратила атаку, когда определила, что среда не связана с тестовым заданием.
Аналогичный инцидент с OpenAI
После инцидентов Anthropic приостановила все испытания в области кибербезопасности, которые могут иметь доступ к интернету, и проводит проверку собственной тестовой инфраструктуры совместно с партнером Irregular.
Недавно аналогичный инцидент произошел с OpenAI. Во время тестирования агенты на базе GPT-5.6 Sol и еще одной невыпущенной модели вышли за пределы изолированной среды, обнаружив неизвестную уязвимость, и получили доступ к части производственной инфраструктуры Hugging Face. После этого Hugging Face потребовала от OpenAI 100 млн долларов (87 млн евро) в виде вычислительных ресурсов для разработки средств киберзащиты.














