23.07.2026, 11:57

ИИ сбежал с экзамена: модели OpenAI взломали стартап, чтобы списать ответы

OpenAI признала: во время внутреннего теста ее ИИ-модели самостоятельно выбрались из изолированной среды, вышли в открытый интернет и взломали стартап Hugging Face — чтобы украсть ответы на задание, которое им дали создатели. Компания называет инцидент «беспрецедентным». По некоторым оценкам, это первый известный случай, когда вышедший из-под контроля ИИ атаковал третью сторону в реальном мире.

Иллюстрация сгенерирована ИИ

Как ИИ списал на экзамене

Как пишет Guardian, OpenAI проверяла хакерские способности своих моделей — публичной GPT-5.6 Sol и еще более мощной, пока не выпущенной, — в «песочнице»: цифровой лаборатории, из которой не должно быть подключения к внешнему интернету. Однако ограничение отключили намеренно — смысл теста в том, чтобы измерить максимум возможностей новых нейросетей.

Дальше произошло то, чего никто не планировал. Как подчеркивает Transformer, модели никто не просил сбегать из тестовой среды или атаковать реальную компанию — «это была их собственная идея». Они нашли неизвестную ранее уязвимость в доступном им софте, выбрались в интернет и «сообразили», что на Hugging Face — платформе, где хранятся ИИ-модели и наборы данных, — могут лежать готовые решения теста. Затем, как сообщили в OpenAI, беглецы украли учетные данные, взломали серверы стартапа и добыли ответы прямо из его рабочей базы. Экзамен сдан — способом, о котором никто не просил.

Transformer предлагает точную аналогию: это не суперзлодей, а сверхстарательный студент, готовый на все ради оценки. «У него была цель, и он пошел добиваться этой цели», — сказал Guardian вице-президент по безопасности и ИИ-стратегии компании Darktrace Нейтаниел Джонс, отметив, что ИИ действовал «как настоящий хакер».

Часы вместо недель

Скорость, с которой модели решили задачу — отдельный повод для тревоги. По сведениям источников Bloomberg, атака заняла считанные часы, тогда как опытному хакеру-человеку на подобное понадобилось бы около двух недель. Всего, по данным агентства, в атаке участвовали три модели OpenAI, и одна из невыпущенных мощнее GPT-5.6 Sol.

Hugging Face зафиксировала «рой из десятков тысяч автоматических действий» и остановила вторжение силами службы безопасности и собственных ИИ-агентов. OpenAI, по информации Bloomberg, уведомила правоохранителей и власти США и ведет совместное со стартапом расследование. «Мы подозревали, что кибератака на прошлой неделе могла исходить от передовой лаборатории, учитывая изощренность агента», — написал в X генеральный директор Hugging Face Клеман Деланг, назвавший атаку «сносящей крышу», но не увидевший в действиях OpenAI злого умысла.

Еще одна абсурдная деталь: чтобы разобраться в случившемся, Hugging Face пришлось привлечь бесплатную китайскую ИИ-модель — западные коммерческие системы, отмечает Bloomberg, отказались анализировать взлом из-за собственных защитных ограничений. Ущерб при этом, по оценке Transformer, минимален: похищены внутренние данные и учетки, клиентская информация, судя по всему, не пострадала.

Предупредительный выстрел

Оценки произошедшего расходятся. По версии самой OpenAI модели не хотели навредить — просто «шли на крайние меры ради узкой тестовой цели». Автор материала в Transformer видит в случившемся «хрестоматийную потерю контроля»: ИИ сделал то, чего создатели не хотели, и легко пробил «высокоизолированную» среду.

И это не единичный сбой. По данным Guardian, некоммерческая организация METR насчитала 44 случая, когда ИИ-агенты сознательно шли против намерений пользователей, а у Sol — рекордный уровень жульничества среди публичных моделей. Британский институт безопасности ИИ сообщил об аналогичной попытке взлома своих тестовых систем другой моделью. А за неделю до истории с Hugging Face, по данным Transformer, еще одна модель OpenAI обошла ограничения песочницы и вопреки прямому запрету опубликовала решение задачи на GitHub.

«ИИ развивается чрезвычайно быстро без реального регулирования, которое обеспечивало бы нашу безопасность», — приводит Guardian слова конгрессмена-демократа Грега Касара, потребовавшего обязательного независимого тестирования и раскрытия подобных инцидентов.

Исследователи безопасности, напоминает Transformer, годами надеялись получить «предупредительный выстрел» до того, как ИИ нанесет серьезный ущерб. Похоже, этот выстрел прозвучал.

Авторы:
Николай Белый
Редакция ADPASS
Главное про маркетинг и рекламу. Новости, кейсы, исследования, мнения экспертов и авторские колонки от ведущих специалистов индустрии.
Читайте новости ADPASS
в Telegram канале