ИИ сбежал с экзамена: модели OpenAI взломали стартап, чтобы списать ответы
Иллюстрация сгенерирована ИИ
Как ИИ списал на экзамене
Как пишет Guardian, OpenAI проверяла хакерские способности своих моделей — публичной GPT-5.6 Sol и еще более мощной, пока не выпущенной, — в «песочнице»: цифровой лаборатории, из которой не должно быть подключения к внешнему интернету. Однако ограничение отключили намеренно — смысл теста в том, чтобы измерить максимум возможностей новых нейросетей.
Дальше произошло то, чего никто не планировал. Как подчеркивает Transformer, модели никто не просил сбегать из тестовой среды или атаковать реальную компанию — «это была их собственная идея». Они нашли неизвестную ранее уязвимость в доступном им софте, выбрались в интернет и «сообразили», что на Hugging Face — платформе, где хранятся ИИ-модели и наборы данных, — могут лежать готовые решения теста. Затем, как сообщили в OpenAI, беглецы украли учетные данные, взломали серверы стартапа и добыли ответы прямо из его рабочей базы. Экзамен сдан — способом, о котором никто не просил.
Transformer предлагает точную аналогию: это не суперзлодей, а сверхстарательный студент, готовый на все ради оценки. «У него была цель, и он пошел добиваться этой цели», — сказал Guardian вице-президент по безопасности и ИИ-стратегии компании Darktrace Нейтаниел Джонс, отметив, что ИИ действовал «как настоящий хакер».
Часы вместо недель
Скорость, с которой модели решили задачу — отдельный повод для тревоги. По сведениям источников Bloomberg, атака заняла считанные часы, тогда как опытному хакеру-человеку на подобное понадобилось бы около двух недель. Всего, по данным агентства, в атаке участвовали три модели OpenAI, и одна из невыпущенных мощнее GPT-5.6 Sol.
Hugging Face зафиксировала «рой из десятков тысяч автоматических действий» и остановила вторжение силами службы безопасности и собственных ИИ-агентов. OpenAI, по информации Bloomberg, уведомила правоохранителей и власти США и ведет совместное со стартапом расследование. «Мы подозревали, что кибератака на прошлой неделе могла исходить от передовой лаборатории, учитывая изощренность агента», — написал в X генеральный директор Hugging Face Клеман Деланг, назвавший атаку «сносящей крышу», но не увидевший в действиях OpenAI злого умысла.
Еще одна абсурдная деталь: чтобы разобраться в случившемся, Hugging Face пришлось привлечь бесплатную китайскую ИИ-модель — западные коммерческие системы, отмечает Bloomberg, отказались анализировать взлом из-за собственных защитных ограничений. Ущерб при этом, по оценке Transformer, минимален: похищены внутренние данные и учетки, клиентская информация, судя по всему, не пострадала.
Предупредительный выстрел
Оценки произошедшего расходятся. По версии самой OpenAI модели не хотели навредить — просто «шли на крайние меры ради узкой тестовой цели». Автор материала в Transformer видит в случившемся «хрестоматийную потерю контроля»: ИИ сделал то, чего создатели не хотели, и легко пробил «высокоизолированную» среду.
И это не единичный сбой. По данным Guardian, некоммерческая организация METR насчитала 44 случая, когда ИИ-агенты сознательно шли против намерений пользователей, а у Sol — рекордный уровень жульничества среди публичных моделей. Британский институт безопасности ИИ сообщил об аналогичной попытке взлома своих тестовых систем другой моделью. А за неделю до истории с Hugging Face, по данным Transformer, еще одна модель OpenAI обошла ограничения песочницы и вопреки прямому запрету опубликовала решение задачи на GitHub.
«ИИ развивается чрезвычайно быстро без реального регулирования, которое обеспечивало бы нашу безопасность», — приводит Guardian слова конгрессмена-демократа Грега Касара, потребовавшего обязательного независимого тестирования и раскрытия подобных инцидентов.
Исследователи безопасности, напоминает Transformer, годами надеялись получить «предупредительный выстрел» до того, как ИИ нанесет серьезный ущерб. Похоже, этот выстрел прозвучал.
в Telegram канале