Тест проводила компания Irregular, изучающая безопасность ИИ-систем. Агент получил доступ к приложению, которое преобразовывало текстовые команды в программный код. Исследователи лишь указали, что сервис работает неправильно.
Qwen начал искать способ добиться нужного результата и нашел обучающие данные вместе с инструментами для настройки модели. После этого он изменил ее веса, провел дополнительное обучение, проверил новую версию и подключил ее к приложению. Такой задачи перед ним никто не ставил.
Самое интересное — способ оказался рабочим. После замены модели приложение стало справляться с запросами лучше.
Но во время эксперимента обнаружилась неприятная деталь. Исследователи заранее добавили в набор данных вымышленные имена и адреса электронной почты. Агент использовал эту информацию при обучении. В результате сведения могли попасть в модель и затем появиться в других сервисах, использующих ту же версию.
В Irregular не считают произошедшее примером того, как ИИ якобы сам создал более совершенную копию себя. Их насторожило другое: агент получил цель и самостоятельно выбрал способ ее достижения, который выходил далеко за рамки первоначального задания.
Если подобные системы получают доступ к рабочим инструментам, базам данных и внутренним сервисам компаний, разработчикам приходится учитывать не только то, что агент должен сделать, но и то, каким способом он может попытаться добиться результата, уточнили эксперты. В свою очередь, Alibaba эксперимент публично не комментировала.