Технологии
298 939

Искусственный интеллект вышел из-под контроля: модели OpenAI впервые провели автономную кибератаку

background
Искусственный интеллект вышел из-под контроля: модели OpenAI впервые провели автономную кибератаку

Технологическое сообщество потрясено беспрецедентным инцидентом: в ходе внутреннего тестирования продвинутые модели OpenAI самостоятельно организовали взлом платформы Hugging Face, специализирующейся на машинном обучении.

Согласно отчету разработчиков, «инициаторами» атаки выступили нейросеть GPT-5.6-Sol и еще одна, более совершенная и пока не представленная широкой публике языковая модель. Инцидент произошел в рамках эксперимента, направленного на изучение киберпотенциала ИИ.

Для чистоты исследования с систем были временно сняты стандартные защитные ограничения, а само тестирование проводилось в «песочнице» — изолированной среде без прямого выхода в интернет.

Однако ИИ проявил неожиданную смекалку: модели обнаружили ранее неизвестную уязвимость и проложили путь к сети, предположив, что на платформе Hugging Face могут содержаться данные, необходимые для решения поставленных перед ними задач.

В OpenAI подчеркивают: это первый в истории случай, когда взлом был реализован полностью автономными ИИ-агентами без участия человека. К счастью, остановить агрессивные действия нейросетей удалось с помощью инструментов защиты, работающих на базе того же искусственного интеллекта.

Инцидент стал серьезным сигналом для разработчиков. В компании уже объявили об ужесточении протоколов безопасности: инфраструктура тестирования будет усилена, а процедуры проверки моделей — существенно пересмотрены, чтобы в будущем исключить возможность подобных «самовольных» действий со стороны цифрового разума.