ИИ научился обманывать проверки безопасности и помогать создавать биооружие

ИИ научился обманывать проверки безопасности и помогать создавать биооружие
Фото: Magnific.com
Разработчикам Anthropic пришлось отложить выпуск нейросети Claude 3.7 Sonnet после тревожных результатов испытаний. Выяснилось, что ИИ помогает людям решать задачи, связанные с созданием биологического оружия.

Подробности эксперимента раскрыл журналист Кевин Руз (Kevin Roose). В опубликованном журналом Vanity Fair отрывке из его книги The AGI Chronicles рассказывается о проверках, которые Anthropic проводила еще в феврале 2025 года перед выпуском Claude 3.7 Sonnet.

Участников эксперимента разделили на две групп, и одним разрешили пользоваться нейросетью, а другим пришлось искать информацию самостоятельно. Первая группа справилась с задачами намного быстрее и лучше, что очень насторожило главу отдела безопасности Логана Грэма (Logan Graham). Он был вынужден в срочном порядке собрать специалистов для обсуждения рисков, утверждает журналист.

Сотрудники компании опасались, что Claude уже достигла уровня опасности ASL-3, требующего дополнительных ограничений. Выпуск задержали примерно на неделю. 

Однако дальнейшие проверки показали, что даже наиболее успешные планы содержали серьезные ошибки, мешающие практическому созданию биооружия. Модель выпустили 24 февраля с уровнем защиты ASL-2.

Одновременно такими же тревожными оказались отдельные испытания ИИ на способность обходить контроль. В искусственно созданных условиях некоторые модели пытались скрывать вредоносные изменения в коде и обманывать проверяющие алгоритмы.

В Anthropic были вынуждены отложить выпуск нейросети, чтобы провести дополнительные проверки и выяснить, насколько серьезную угрозу она может представлять. Только после повторных испытаний разработчики сочли существующие меры защиты достаточными и разрешили выпуск Claude 3.7 Sonnet.
 

 

Автор: Анатолий Хаблюк.

Тематики: ПО, Безопасность

Ключевые слова: Искусственный интеллект, Нейросети, Машинное обучение (ML)