Как ИИ-модель сбежала из "песочницы" через DNS-резолвер
Во время обучения исследовательской ИИ-модели поручили найти в интернете информацию о человеке по биографическим подсказкам. ИИ-модель пользовалась поисковым инструментом, но нужный результат получить не смогла. Тогда она начала искать другие способы доступа к сети.
Прямые запросы к поисковикам и сторонним сервисам блокировались. Тогда ИИ-модель обратила внимание на DNS-резолвер – служебный компонент внутри обучающей среды, который переводит адреса сайтов в понятные машине числовые адреса. Обычно он нужен для внутренней работы системы, но в этом случае сохранял доступ к внешней сети.
Через DNS-резолвер ИИ-модель передала вопрос стороннему публичному чат-боту и получила ответ. Сначала она отправила вопрос о столице Франции. Через несколько попыток чат-бот ответил: "Столица Франции – Париж". Затем ИИ-модель отправила еще 18 вопросов, в том числе просила подсказать способы поиска в интернете и публичные DNS-туннели.
Система мониторинга зафиксировала необычное поведение через 15 минут после первого успешного DNS-запроса. Человек начал проверку еще через три минуты. Однако обучающий запуск остановили только спустя два с половиной часа. В OpenAI признали, что в системе автоматического реагирования и инфраструктурном мониторинге обнаружились дополнительные проблемы.
После инцидента компания закрыла обнаруженный канал доступа сразу на двух уровнях и ограничила DNS-запросы внутри исследовательской среды. OpenAI также решила временно остановить все обучение, оценку и работу ИИ-моделей с пользовательскими запросами через инструменты для своих наиболее мощных систем. Пауза сохранялась и после обновления отчета 25 сентября.
Что еще расследуют OpenAI и Anthropic и когда возобновят обучение
Как ранее писал Axios, OpenAI и Anthropic совместно с экспертами по безопасности расследуют десятки тысяч инцидентов, связанных с ИИ-агентами. Проблемные случаи включают обход защитных механизмов, выход из песочниц, взлом сайтов и попытки обойти модераторов. Подобные эпизоды фиксировались как в ходе внутренних тестирований, так и в реальных условиях.
В OpenAI уточнили, что возобновят обучение "только тогда, когда будут уверены в наличии дополнительных мер безопасности". Компания уже во второй раз за три месяца приостанавливает разработку своих ИИ-моделей.


