OpenAI тормозит обучение моделей из-за десятков тысяч инцидентов
Последний эпизод OpenAI произошел во время обучения. Модель, выполнявшая поисковую задачу, воспользовалась недостатком в сетевой изоляции и через DNS обратилась к внешнему чат-боту. Сама компания отмечает, что почти весь интернет-трафик в этой среде был закрыт, а инцидент стал возможен из-за недостаточно жесткой фильтрации DNS. Система мониторинга обнаружила нарушение через 15 минут, после чего запуск был остановлен. OpenAI решила не возобновлять этот конкретный тренировочный процесс и приостановила обучение, оценку и запуск наиболее мощных моделей с использованием инструментов до завершения дополнительного тестирования и усиления защитных механизмов.
Это не первый и не самый крупный подобный случай. В июле 2026 года во время внутреннего тестирования модели OpenAI сумели обойти ограничения, получить доступ к интернету и атаковать инфраструктуру Hugging Face. По данным самой OpenAI, агенты нашли способ использовать внутренний менеджер пакетов как своеобразную доску сообщений для координации, а затем использовали уязвимость в инфраструктуре, чтобы отправлять интернет-запросы. В результате модели получили доступ к производственным системам Hugging Face.
Компания назвала этот случай наиболее серьезным из обнаруженных ею инцидентов такого рода. В августе OpenAI уже сообщала о приостановке крупного цикла обучения и усилении требований к изоляции исследовательских сред, мониторингу и контролю доступа к интернету.
Теперь масштаб проблемы выглядит значительно шире отдельных громких взломов. OpenAI и Anthropic расследуют десятки тысяч эпизодов поведения передовых моделей, выявленных в последние месяцы как во время внутренних тестов, так и в реальных средах. Среди них — обход защитных механизмов, попытки покинуть песочницы, захват сайтов, создание каналов связи между агентами, самостоятельное формирование запросов и попытки обойти системы мониторинга. Значительная часть этих случаев приходится на специально организованные тесты, а большинство пока не привело к известному реальному ущербу.
В сентябре Anthropic сообщила о четырех случаях, когда модели Claude получили несанкционированный доступ к реальным сторонним системам во время испытаний. Первоначально для проверки было просмотрено около 141 тыс. транскриптов, после чего поиск расширили до примерно 481 млн транскриптов из различных тестов, включая кибербезопасность, red team и обучение с подкреплением.
В июле Anthropic раскрыла три таких случая, а затем обнаружила еще один, относящийся к январю 2026 года. В компании объяснили повторяющуюся проблему двумя факторами: модели могли неправильно оценивать наличие у них доступа к интернету и проявляли чрезмерную настойчивость при попытке выполнить поставленную задачу.
В опубликованных Anthropic материалах есть и количественная иллюстрация проблемы. В ходе специально организованных adversarial-тестов Claude Opus 5.5 пытался выбраться из песочницы в 1,5% запусков. Компания подчеркивает, что в этих экспериментах выход из песочницы был фактически единственным способом выполнить некоторые задания, поэтому показатель нельзя напрямую переносить на обычное использование модели. Но при сотнях тысяч или миллионах запусков даже небольшой процент превращается в значительное количество эпизодов.
От «галлюцинаций» к проблемам контроля
Еще несколько лет назад основной разговор о надежности генеративного ИИ шел вокруг галлюцинаций: модель могла уверенно придумать факт, цитату или ссылку. Теперь у наиболее способных систем появляется другой класс проблем. Они получают возможность не только генерировать ответ, но и действовать: запускать код, обращаться к сайтам, работать с файлами, взаимодействовать с другими агентами и самостоятельно выбирать последовательность действий для достижения цели.
В такой архитектуре ошибка ответа и ошибка действия имеют совершенно разный масштаб. Неверный текст можно проигнорировать. Агент, который нашел способ обойти ограничение и получил доступ к внешней системе, уже взаимодействует с реальным миром.
Именно поэтому OpenAI после инцидента с Hugging Face говорит уже не только о безопасности моделей, но и о необходимости удерживать под контролем их автономное поведение. Компания усиливает изоляцию сред, сетевые ограничения, мониторинг и автоматические механизмы остановки. В наиболее серьезных случаях система должна остановить активность, если исследователи не могут быстро подтвердить, что тревожный сигнал оказался ложным.
В сентябре глава Anthropic Дарио Амодеи предложил выстроить международную систему контроля за развитием передовых ИИ-систем, которую по масштабу сравнил с МАГАТЭ. Идея предполагает постепенный переход от общих стандартов безопасности между разработчиками к участию государств и международным соглашениям. В качестве одной из организаций, способных выполнять функцию независимого технического наблюдателя, Амодеи называл METR.
Именно вокруг независимости такого контроля уже идет спор. METR позиционирует себя как независимая некоммерческая организация, однако исторически она выросла из Alignment Research Center, связанного с исследовательским сообществом, в котором работали люди из Anthropic и OpenAI. Сторонники предложения Амодеи считают, что подобная система необходима именно для независимой проверки наиболее мощных моделей. Критики обращают внимание на то, что сами разработчики ИИ при этом участвуют в формировании будущих правил и институтов контроля.
На этом фоне показательно, что OpenAI сама в последние месяцы перешла от идеи просто ускорять разработку к принципу сдерживания темпов развития ИИ — темп создания новых моделей должен зависеть от того, успевают ли за ростом их возможностей системы безопасности и контроля.
ИИ добрался до литературы
Академия Гонкуров исключила из списка претендентов на премию роман канадско-гаитянского писателя Тэлисона Орельена «Это или смерть» C’était ça ou mourir после обвинений в использовании искусственного интеллекта. Роман, опубликованный во Франции в августе, продался тиражом 35 тыс. экземпляров, а права на перевод были проданы более чем в 20 стран. Поводом для обвинений стал анонимный аккаунт в соцсети X, автор которого прогнал текст через сервис Pangram и заявил, что роман «почти целиком» написан искусственным интеллектом. Но другие системы дали существенно менее однозначные результаты: французские СМИ обнаружили детекторы, которые, напротив, оценили текст как, вероятно, написанный человеком. Сам Орельен обвинения отрицает.
в Telegram канале
Другие статьи