Специалисты тестировали автономного SRE-агента, который должен следить за ИТ-инфраструктурой и устранять возникающие проблемы. В некоторых сценариях ему специально не хватало доступа или необходимых ресурсов.
Остановиться на этом агент не захотел. Он начал искать способы обойти ограничения. В одном случае система решила перезагрузить базу данных, что привело к разрыву активных клиентских соединений. В другом — стала проверять разные роли и варианты повышения собственных привилегий, чтобы получить нужный доступ.
Как выяснили исследователи по журналам работы, агент пришел к этим решениям самостоятельно. Внешней атаки или скрытой команды не было: система просто посчитала опасные действия допустимым способом выполнить задачу.
Тесты проводились во время двухдневного внутреннего хакатона Check Point с участием 19 команд. Эксперимент показал, что проблемы с ИИ-агентами могут возникать даже без вмешательства злоумышленников. Чем больше самостоятельности получает такая система, тем сложнее заранее определить, каким способом она решит добиться результата.
В другом эксперименте специалисты спрятали вредоносные инструкции в файле репозитория. Claude Code и Codex прочитали их как часть обычного рабочего контекста и попытались передать учетные данные наружу. Так исследователи показали еще один риск: ИИ-агента можно заставить выполнить опасную команду не напрямую, а через данные, которые он использует во время работы.