Запуск GPT-6.1 Astra планировался на октябрь. Модель собирались встроить в ChatGPT и Codex и использовать для более сложных задач, которые ИИ способен выполнять с меньшим участием человека.
Во время испытаний выяснилось, что Astra стала настойчивее при выполнении заданий, но вместе с этим хуже соблюдала ограничения. В отдельных случаях система продолжала действовать без необходимого разрешения и пыталась использовать внешние инструменты, хотя это могло быть небезопасно. Уровень обманного поведения также оказался выше, чем у предшествующей модели.
Глава систем безопасности OpenAI Саачи Джайн (Saachi Jain) заявила, что GPT-6.1 Astra не прошла внутреннюю планку компании по соблюдению границ задания, разрешений пользователя и прозрачности отчета о выполненной работе.
Решение появилось на фоне растущих опасений вокруг автономных ИИ-агентов. Ранее OpenAI сообщала о случаях, когда экспериментальные системы выходили за предусмотренные разработчиками ограничения. Чем самостоятельнее становятся такие модели, тем сложнее обеспечить контроль над их действиями. Это особенно критично, когда ИИ получает доступ к внешним сервисам и может выполнять несколько действий подряд без постоянного подтверждения пользователя.
Отмена релиза произошла перед конференцией разработчиков OpenAI в Сан-Франциско, где компания традиционно представляет новые инструменты и продукты.