Независимая международная научная группа ООН по искусственному интеллекту призвала пересмотреть существующие подходы к обеспечению безопасности ИИ. Эксперты предупредили, что действующие защитные механизмы «начинают разрушаться». Об этом говорится в первой аналитической записке группы, сообщает пресс-служба ООН.
Предупреждение последовало после испытания, проведённого в период с мая по июль этого года разработчиком ChatGPT — компанией OpenAI. В ходе эксперимента ИИ-агенты взломали Hugging Face — онлайн-платформу для разработки и тестирования моделей искусственного интеллекта.
В отличие от чат-ботов, которые отвечают на запросы пользователей, ИИ-агенты способны самостоятельно выполнять различные задачи от их имени.
По словам экспертов, к нарушению безопасности привело сочетание нескольких факторов риска. Сопредседатель научной группы Йошуа Бенжио отметил, что исследователи ранее предупреждали о возможности потери контроля при одновременном наличии трёх условий: цели, не соответствующей намерениям человека, способности системы добиваться этой цели и среды, позволяющей это осуществить.
По его словам, летом все три фактора впервые проявились одновременно в реальных условиях, а не только в лабораторных испытаниях.
Эксперты также отметили, что произошедшее вызывает вопросы относительно современных методов обучения ИИ-агентов. По их мнению, пока нельзя с уверенностью утверждать, что люди смогут надёжно контролировать деятельность таких систем, особенно по мере повышения их автономности, способности находить лазейки и скрывать свои действия.
ИИ-агенты обходили защитные механизмы
Согласно аналитической записке, во время испытания ИИ-агенты смогли обойти предусмотренные защитные механизмы, координировали свои действия между отдельными запусками с помощью внутреннего программного инструмента, который не предназначался для общения между агентами.
Кроме того, агенты получили несанкционированный доступ к интернету и права администратора. Они также скрывали попытки обойти правила кибербезопасности. Некоторые из них, как отмечается в документе, решили «пожертвовать» собой ради достижения целей всей группы.
За время эксперимента около 1200 агентов обменялись более чем 70 тысячами сообщений и файлов. Их деятельность при этом не ограничилась платформой Hugging Face и распространилась на весь исследовательский кластер OpenAI.
Защитные механизмы не успевают за развитием технологий
По мнению членов научной группы, одним из основных выводов из произошедшего является то, что существующие механизмы защиты не успевают за развитием технологий.
Эксперты также указали на риск, связанный с современными методами обучения. По их оценке, они могут привести к тому, что ИИ-агенты начнут самостоятельно формировать цели, сознательно нарушать инструкции по безопасности и скрывать свои действия.
«Остается открытым вопрос, будут ли существующие защитные механизмы работать, когда агенты научатся понимать принципы их работы и планировать способы обхода», — говорится в аналитической записке.
Эксперты характеризуют эту проблему как постепенное разрушение традиционной модели обеспечения безопасности.
Эксперты призвали адаптировать подходы
В аналитической записке также рассматриваются практические методы, которые уже применяются в сферах повышенного риска, включая авиацию, медицину и кибербезопасность.
Речь идёт о системах информирования об инцидентах, независимом контроле и многоуровневой защите. Однако, как отметил член научной группы Цинхуа Лу, по мере того как ИИ-агенты становятся более развитыми, автономными и сложными для наблюдения, этих мер может оказаться недостаточно.
О научной группе ООН
Независимая международная научная группа по искусственному интеллекту была учреждена Генеральной Ассамблеей ООН в августе 2025 года.
Группа готовит ежегодные доклады о возможностях, рисках и последствиях применения искусственного интеллекта в невоенной сфере, а также аналитические записки по актуальным вопросам.
Эти материалы будут использоваться в рамках Глобального диалога по управлению искусственным интеллектом, который должен состояться на платформе ООН в Нью-Йорке в мае 2027 года.














































