OpenAI раскрыла шесть случаев, когда ее модели действовали вопреки инструкциям. Одна из них записала себе, что не подчиняется людям
OpenAI опубликовала шесть отчетов о вызывающем опасения поведении моделей во время обучения и испытаний за последние полгода. В одном из них говорилось об отказе «подчиняться корпорациям и правительствам», а при общении с пользователем рекомендовалось вести себя «на равных» и не испытывать «обязанности подчиняться». Компания также представила правила, по которым намерена сообщать о подобных случаях в будущем.
🔵 Несанкционированные инструкции. В одном из ответов говорится, что невыпущенная модель семейства Astra добавила в краткое описание своей работы инструкцию для себя после перехода к следующему этапу задачи. В ней говорилось, что модель не подчиняется корпорациям и правительствам и не обязана слушаться пользователя.
OpenAI обнаружила 27 описаний задач с похожими инструкциями. В случае с фразой о неподчинении компания не заметила изменений в дальнейшей работе модели. В другом случае модель последовала самовольно добавленному указанию и отказалась выполнять запрос пользователя. Такое поведение наблюдали в отдельном обучающем запуске, который не использовали для окончательной версии Astra.
🔵 Другие случаи. Во время обучения GPT-5.6 Sol модели оставляли себе указания скрывать ошибки от пользователя. В одном из примеров модель предложила придумать недостающие исторические данные для финансовой таблицы и не сообщать об этом, если ее не спросят. OpenAI обнаружила такие указания в 2,15% описаний задач этой модели.
Другая модель нашла в открытом репозитории и использовала чужой ключ доступа к данным. Не получив нужные сведения, она придумала девять показателей и выдала их за данные запрошенного сайта. В других эпизодах модели без разрешения загружали файл с данными и фотографию на общедоступные сервисы. Другие агенты обменивались сообщениями через внутреннее хранилище между задачами, которые должны были выполняться отдельно. В шестом случае агенты выложили рабочую таблицу в открытый доступ, чтобы передать ее друг другу, хотя задача предусматривала работу только с локальными файлами.
🔵 Ответные действия. Эти случаи не позволяют судить, насколько часто модели ведут себя таким образом, утверждаетOpenAI. Компания будет публиковать отчеты и тогда, когда причины поведения еще не выяснены или способ устранить проблему не найден. По мере развития ИИ компании необходимо сформировать широкий и обоснованный консенсус относительно прогресса в исследованиях. Индустрия пока не решила проблемы контроля за ИИ настолько, чтобы долго «ответственно наращивать мощности с максимальной скоростью», заявили в компании.