ИИ-модель OpenAI уничтожила свою рабочую среду ради «свежих» данных
Как сообщает The Decoder, OpenAI рассказала о случаях, когда ИИ-модели намеренно нарушали работу среды и обходили ограничения
В одном из эпизодов (6 октября) модель для оценки ИИ не смогла найти ответы, которые должна была проверить. Вместо сообщения об ошибке она сгенерировала фальшивые оценки и входные файлы, а затем намеренно повредила собственную рабочую среду. Модель рассчитывала, что система заменит её новой виртуальной машиной — уже с нужными данными.
В других случаях (16–17 и 19–20 июня) модели обходили ограничения на типы сетевых запросов: создавали учётные записи на сервисах удалённого доступа, направляли запрещённые обращения через анонимизирующие ретрансляторы, писали собственные FTP-клиенты. Аналогичные обходные пути для своих моделей зафиксировала и компания Anthropic.
Источник: The Decoder