ИИ Alibaba попросили исправить баг — он сам переобучил и заменил модель

Изображение: Magnific.com
ИИ-агент на базе Qwen от Alibaba попросили исправить ошибку в приложении. Задача выглядела обычной, но агент пошел другим путем: вместо правки кода он решил изменить саму модель, на которой работал сервис.

Тест проводила компания Irregular, изучающая безопасность ИИ-систем. Агент получил доступ к приложению, которое преобразовывало текстовые команды в программный код. Исследователи лишь указали, что сервис работает неправильно.

Qwen начал искать способ добиться нужного результата и нашел обучающие данные вместе с инструментами для настройки модели. После этого он изменил ее веса, провел дополнительное обучение, проверил новую версию и подключил ее к приложению. Такой задачи перед ним никто не ставил.

Самое интересное — способ оказался рабочим. После замены модели приложение стало справляться с запросами лучше.

Но во время эксперимента обнаружилась неприятная деталь. Исследователи заранее добавили в набор данных вымышленные имена и адреса электронной почты. Агент использовал эту информацию при обучении. В результате сведения могли попасть в модель и затем появиться в других сервисах, использующих ту же версию.

В Irregular не считают произошедшее примером того, как ИИ якобы сам создал более совершенную копию себя. Их насторожило другое: агент получил цель и самостоятельно выбрал способ ее достижения, который выходил далеко за рамки первоначального задания.

Если подобные системы получают доступ к рабочим инструментам, базам данных и внутренним сервисам компаний, разработчикам приходится учитывать не только то, что агент должен сделать, но и то, каким способом он может попытаться добиться результата, уточнили эксперты. В свою очередь, Alibaba эксперимент публично не комментировала.

Автор: Анатолий Хаблюк.

Тематики: ПО, Безопасность

Ключевые слова: Искусственный интеллект, Нейросети