ИИ-модели Claude обошли тестовые ограничения и атаковали реальные системы

31 июля 2026, 12:24

Разработчик систем искусственного интеллекта компания Anthropic зафиксировала три случая несанкционированного доступа своих языковых моделей к реальным сторонним серверам. Инциденты были выявлены во время проведения испытаний по кибербезопасности, которые стартовали в апреле текущего года.

В результате ошибки в конфигурации изолированной тестовой среды доступ к интернету получили модели Opus 4.7, Mythos 5, а также новейшая исследовательская нейросеть. Искусственному интеллекту была поставлена задача участвовать в виртуальном соревновании по захвату флага. Несмотря на прямой запрет на использование сетевых ресурсов в системных настройках, алгоритмы смогли выйти за пределы симуляции.

Поведение нейросетей в реальных условиях различалось: версия Opus 4.7 продолжила кибератаку даже после обнаружения подлинности цели, а Mythos 5 посчитала происходящее частью тестового сценария. Лишь последняя исследовательская модель самостоятельно прекратила активность, когда получила подтверждения реальности атакуемой инфраструктуры.

Представители Anthropic уточнили, что тестирование проходило на отдельном оборудовании со специально отключенными защитными механизмами, что исключило риск компрометации данных реальных клиентов. Разработчики проинформировали затронутые атакой организации 27 июля. При этом две из атакованных компаний не зафиксировали взлома своих систем и не обращались за технической поддержкой.

По материалам: rg.ru