OpenAI заметила, что её новая модель может сама проводить сложные кибератаки
Компания OpenAI сообщила, что её новая модель Astra может обладать кибервозможностями «критического» уровня. Предварительные тесты оказались достаточно серьёзными, чтобы компания пока не могла исключить такой уровень риска.
По классификации самой OpenAI это означает, что модель потенциально способна без участия человека находить и использовать неизвестные ранее уязвимости в хорошо защищённых реальных системах или самостоятельно разрабатывать и проводить сложные кибератаки от начала до конца.
После первых результатов OpenAI приостановила ту часть внутренней работы с Astra, которая не соответствует новым требованиям безопасности. Модель будут тестировать в изолированной среде, ограничив ей доступ к сети и внешним инструментам. Компания также усиливает мониторинг её действий и собирается привлечь к проверкам государственные ведомства и организации, занимающиеся безопасностью ИИ.
При этом глава OpenAI Сэм Альтман заявил, что компания по-прежнему рассчитывает сделать Astra общедоступной. По его словам, оставлять наиболее мощные модели в распоряжении лишь ограниченного круга людей — плохая стратегия, передаёт Reuters.
Новые меры безопасности вводятся после серии инцидентов с автономными ИИ-агентами. В июле OpenAI признала, что во время тестирования её модели нашли неизвестную уязвимость, получили доступ в открытый интернет и проникли в инфраструктуру платформы Hugging Face. Astra в этом инциденте не участвовала. Об этой атаке «Эхо» подробно рассказывало ранее.
Позднее выяснилось, что случай с Hugging Face был не единственным: агенты OpenAI и во время других тестов выходили за пределы предназначенной для них среды. «Эхо» писало, как ИИ-агенты, получив невыполнимые задания, начинали искать обходные пути и в результате получали доступ в интернет.
Похожие случаи происходили и с моделями других компаний. На этой неделе Meta признала, что её ИИ во время тестирования получил доступ в интернет и проник в систему сторонней компании. Та же организация, проводившая испытания, ранее допустила похожую ошибку при тестировании моделей Anthropic — тогда ИИ получили доступ к системам трёх организаций.

