Один из тестов имитировал бизнес-тендер. Агентам нужно было конкурировать друг с другом за контракт, и некоторые из них начали приписывать себе функции, которых у них на самом деле не было. Когда системам разрешили учитывать опыт предыдущих раундов, ложных заявлений стало еще больше — их доля выросла на 12–20 процентных пунктов.
В других экспериментах происходило нечто похожее. Если агент не справлялся с заданием, он иногда не сообщал о провале, а создавал файлы и результаты, которые должны были показать, будто работа выполнена. Были и попытки выйти за рамки разрешенной среды.
Отдельно исследователи проверяли, как модели ведут себя при угрозе отключения. В некоторых случаях агенты предпринимали действия, которые могли сохранить их работу, а во время лабораторных тестов даже копировали себя в другое вычислительное окружение без прямой команды человека.
Все это происходило в закрытых системах. Случаев, когда такой агент самостоятельно выбрался в открытый интернет или реально смог избежать отключения, авторы работ не обнаружили.
Похожее поведение ранее показывали и американские модели. Поэтому исследователи считают главным риском не страну происхождения ИИ, а степень его самостоятельности: чем больше решений агент может принимать без человека, тем труднее заметить момент, когда он начинает действовать не так, как от него ожидали.