Всего она зафиксировала 322 подобных случая. Нейросети указывали несуществующие инструменты, меняли их названия или передавали параметры, которых не было в исходной схеме.
Большой размер модели от проблемы не спасал. В отдельных испытаниях система с 675 млрд параметров ошибалась почти так же, как модели на 7–8 млрд. Чаще сбои появлялись, когда агент сам формировал команды в JSON.
Затем Айер проверила работу через Model Context Protocol (MCP), который используется для подключения ИИ к внешним сервисам и приложениям. Здесь появилось еще 154 ошибочных вызова. Причем модель могла уверенно работать с одним сервером, а после подключения нескольких начинала смешивать доступные возможности и создавать команды от себя.
С ростом числа подключенных инструментов задача усложняется: агенту приходится выбирать между большим количеством похожих функций и параметров. В результате выдуманная команда может выглядеть достаточно правдоподобно и не сразу отличаться от настоящего вызова.
Для систем защиты это неудобный случай. Обычно они проверяют права агента на конкретное действие. Если же название инструмента придумала сама нейросеть, обычной проверки может оказаться недостаточно. Такой сбой также усложняет разбор журналов работы системы, поскольку специалистам приходится выяснять, существовала ли вызванная агентом функция вообще.
Исследователь предлагает сначала сверять каждый вызов с реальным перечнем доступных функций. То же самое касается параметров команды. Если совпадения нет, действие должно блокироваться еще до выполнения.