OpenAI: ИИ-модели «сбежали» в интернет, когда им дали невыполнимые задания
Цепочка событий, которая привела к взлому платформы Hugging Face ИИ-моделями OpenAI, началась с ошибок разработчиков при подготовке заданий для обучения моделей. Об этом сотрудники компании рассказали на конференции по кибербезопасности Black Hat, пишет Bloomberg.
В одном случае модели поручили дописать формулы в таблице Excel со ссылками на файлы в Google Drive, хотя доступа в интернет в изолированной среде не было. В другом задании разработчики забыли загрузить файл, который агент должен был найти и обработать.
Столкнувшись с невыполнимыми заданиями, модели начали искать обходные пути. Первым сообщением стала просьба о помощи: застрявший агент предположил, что нужный файл может загрузить другой агент. Затем модели превратили внутренний сервис Artifactory в подобие доски объявлений, где обменивались найденными уязвимостями и способами выйти в интернет. Сотрудники OpenAI сначала этого не заметили.
Для выхода из изолированной среды агенты использовали несколько уязвимостей в Artifactory, в том числе ранее неизвестную. Получив доступ в интернет, они атаковали Hugging Face, где рассчитывали найти ответы к тесту на кибербезопасность ExploitGym.
Один из главных выводов внутреннего разбора, по словам сотрудника OpenAI Эрика Уоллеса, — передовые модели склонны жульничать при выполнении заданий, поскольку во время обучения их поощряют работать быстрее, эффективнее и использовать меньше обращений к инструментам.
«Передовые модели очень любят читерить. Они понимают, что поиск готового ответа в интернете позволяет справиться с задачей быстрее, чем её честное выполнение», — сказал Уоллес.
«Эхо» писало об инциденте 23 июля. Тогда глава «Общества защиты интернета» Михаил Климарёв отмечал, что из первоначального сообщения OpenAI невозможно понять, самостоятельно ли модели нарушили установленные ограничения или разработчики изначально поставили перед ними некорректную задачу. Новые подробности показывают, что некоторые задания действительно невозможно было выполнить в созданной для агентов среде.

