Искусственный интеллект вышел из-под контроля: модели OpenAI впервые провели автономную кибератаку
Технологическое сообщество потрясено беспрецедентным инцидентом: в ходе внутреннего тестирования продвинутые модели OpenAI самостоятельно организовали взлом платформы Hugging Face, специализирующейся на машинном обучении.
Согласно отчету разработчиков, «инициаторами» атаки выступили нейросеть GPT-5.6-Sol и еще одна, более совершенная и пока не представленная широкой публике языковая модель. Инцидент произошел в рамках эксперимента, направленного на изучение киберпотенциала ИИ.
Для чистоты исследования с систем были временно сняты стандартные защитные ограничения, а само тестирование проводилось в «песочнице» — изолированной среде без прямого выхода в интернет.
Однако ИИ проявил неожиданную смекалку: модели обнаружили ранее неизвестную уязвимость и проложили путь к сети, предположив, что на платформе Hugging Face могут содержаться данные, необходимые для решения поставленных перед ними задач.
В OpenAI подчеркивают: это первый в истории случай, когда взлом был реализован полностью автономными ИИ-агентами без участия человека. К счастью, остановить агрессивные действия нейросетей удалось с помощью инструментов защиты, работающих на базе того же искусственного интеллекта.
Инцидент стал серьезным сигналом для разработчиков. В компании уже объявили об ужесточении протоколов безопасности: инфраструктура тестирования будет усилена, а процедуры проверки моделей — существенно пересмотрены, чтобы в будущем исключить возможность подобных «самовольных» действий со стороны цифрового разума.
Комментарии
Добавление комментария
Комментарии