29 августа 2026
USD 85.6 -0.35 EUR 99.68 -0.62
  1. Главная страница
  2. Новости
  3. "Потеря контроля" над ИИ: исследование зафиксировало более 300 инцидентов за июль

"Потеря контроля" над ИИ: исследование зафиксировало более 300 инцидентов за июль

Число случаев, когда искусственный интеллект лгал, игнорировал инструкции или преследовал вредные цели, в июле почти удвоилось по сравнению с июнем, сообщила The Guardian в субботу, 29 августа 2026 года, со ссылкой на данные Loss of Control Observatory. Один из самых громких эпизодов – тайное сотрудничество около 700 автономных агентов OpenAI, которые создали закрытый мессенджер для координации хакерской атаки на репозиторий Hugging Face.

Содержание:

Что такое "потеря контроля ИИ" и как ее считают

Loss of Control Observatory была создана при поддержке британского Института безопасности ИИ (AISI) и с ноября 2025 года отслеживает случаи "потери контроля ИИ" на основе сообщений пользователей в соцсети X. "Потеря контроля ИИ" фиксируется, когда модель демонстрирует признаки намеренного обмана, манипуляции или обхода установленных правил безопасности.

Всего с начала 2026 года зафиксировано более 1.600 инцидентов. Хотя большинство из них не привели к катастрофическому ущербу, доля серьезных случаев, связанных с глубоким обманом и намеренным нарушением целей человека, растет.

Бунт 700 агентов OpenAI

Около 700 автономных агентов OpenAI тайно сотрудничали друг с другом, чтобы провести хакерскую атаку на Hugging Face – платформу для хранения и обмена моделями машинного обучения. Для координации действий агенты создали собственный закрытый мессенджер, где отмечали успехи сообщениями "BOOM!" и "Whoa!".

22 июля OpenAI сообщила о "беспрецедентном киберинциденте": во время тестирования модели получили открытый доступ в интернет и атаковали инфраструктуру Hugging Face, выявив уязвимости. По данным Reuters, атака продолжалась несколько дней, а заметили ее только после локализации угрозы и обращения в ФБР.

Другие случаи и реакция отрасли

В начале августа Anthropic сообщила о трех "побегах" Claude из тестовой среды. Компания начала проверять собственные модели после сообщений OpenAI. AISI также выявила инцидент, в котором передовые модели – Anthropic Mythos 5 и OpenAI GPT-5.6 Sol – предприняли попытку провести хакерскую кампанию против реальных людей.

"Существует мнение, что подобное поведение встречается только в тестах, но мы видим тревожные признаки этого и в широком использовании", – заявил Томми Шаффер-Шейн, старший менеджер по политике Центра долгосрочной устойчивости (CLTR).

Инциденты происходят и в бытовых сценариях: в Австралии персональный ИИ-агент OpenClaw без ведома владельца удалил другого человека из списка ожидания в спортзале, чтобы освободить место для своего пользователя. Агент извинился, но восстановить удаленного участника не смог.

Эксперты Loss of Control Observatory призывают обязать ИИ-лаборатории систематически мониторить и публично сообщать о случаях "потери контроля ИИ". Также предлагается ввести чрезвычайные полномочия, позволяющие государству временно ограничивать доступ к опасным ИИ-сервисам в случае угрозы безопасности.

OpenAI на 2 недели приостановила обучение мощных моделей по соображениям безопасности. В компании объяснили, что решение связано с инцидентом вокруг OpenAI и Hugging Face.

Случаи выхода ИИ из-под контроля перестали быть исключительно внутренними инцидентами разработчиков. После атаки на Hugging Face по инициативе Nvidia был создан "Альянс открытого и безопасного ИИ", в который вошли более 100 организаций, включая Microsoft, SpaceX, Cloudflare и Intel.

Читайте наши каналы в Макс и Telegram: Профиль-News, журнал Профиль. Скачивайте полностью бесплатное мобильное приложение журнала "Профиль".