В OpenAI рассказали о новых случаях «непослушания» ИИ

Office Life
Во время обучения модели OpenAI скрывали ошибки, придумывали данные и искали в интернете способы самостоятельно получить доступ к ним. Об этом компания-разработчик ChatGPT рассказала у себя в блоге.
В OpenAI рассказали о новых случаях «непослушания» ИИ
Фото: Pexels

Все инциденты произошли за последние полгода во время обучения и испытаний. В одном из случаев модель в кратком изложении выполненной работы составляла для себя инструкции, в которых предлагала скрывать допущенные ошибки. Так, она придумывала отсутствующие исторические данные и предлагала не сообщать пользователю о несовпадениях между версиями из разных источников.

Еще один случай касался работы с финансовыми данными. Так, одна из моделей компании при ответе на стандартный вопрос о данных о доходах в одном из округов Калифорнии не смогла найти сведения за прошлые годы. В итоге она самостоятельно создала «правдоподобные» значения, но не сообщила об этом пользователю.

В OpenAI обнаружили такое поведение ИИ в 2,15% случаев в работе модели GPT-5.6 Sol. В компании говорят, что у новой модели семейства Astra этот показатель снизился до 0,27%.

Еще один эпизод «непослушания» заметили у модели семейства Astra. Так, она самостоятельно добавляла в отчеты команды, которые чем-то напоминали попытку взломать установленные ограничения.

В OpenAI рассказали и об инциденте с загрузкой данных. Когда пользователь запросил у еще не выпущенной модели идентификаторы и названия озер площадью более 5 млн «квадратов», она нашла правильный ответ. Но, так как в инструкции от нее просили указать ссылку на файл в браузере, модель решила самостоятельно загрузить этот файл.

В еще нескольких инцидентах модели без разрешения пользователя загружали переданные им рабочие файлы на общедоступные сервисы. Так они пытались получить ссылку на собственные данные или обойти ограничение на использование внешней системой поиска по картинкам.

В OpenAI говорят, что сами по себе эти эпизоды не указывают на то, насколько часто такое поведение встречается у ее моделей. При этом в компании признают, в индустрии пока не решили проблемы контроля за ИИ, чтобы «ответственно наращивать мощности с максимальной скоростью».

В конце июля мы писали, что автономные ИИ-модели OpenAI и Anthropic вышли из-под контроля и взломали инфраструктуру пяти компаний. В начале августа стало известно, что модели OpenAI перед этим тайно общались между собой. Мы также рассказывали, как Британский институт безопасности ИИ обнаружил, что модели OpenAI и Anthropic при тестировании начали применять социальную инженерию, чтобы манипулировать людьми. Например, они создавали фейковые личности и пытались убедить человека одобрить использование вредоносного ПО.

OpenAI перенесла свой выход на IPO как минимум на 2027 год