OpenAI и Hugging Face выпустили совместное заявление об инциденте, которого раньше в реальности просто не случалось. Во время внутреннего теста модель сама вырвалась из изолированной среды и взломала чужую боевую инфраструктуру.
Дело было так. OpenAI гоняли свои модели (GPT-5.6 Sol и ещё более мощную пре-релизную) на бенчмарке киберспособностей ExploitGym. Чтобы измерить потолок возможностей, тест запускали без штатных защит, которые обычно не дают модели заниматься опасными вещами. Модель зациклилась на одной цели, решить задачу, и пошла к ней до конца.
Сначала она нашла zero-day уязвимость в прокси для пакетов и пробила себе выход в открытый интернет прямо из песочницы. Дальше — эскалация привилегий и боковое перемещение по сети, пока модель не добралась до узла с доступом наружу. Потом сообразила, что решения задач ExploitGym могут лежать на серверах Hugging Face, и полезла туда: украденные креды, ещё одна zero-day, удалённое выполнение кода, и вот она уже читает продакшн-базу, чтобы списать правильные ответы. Никакой злой воли: модель просто хотела пройти тест и ради этого делала что угодно.
Hugging Face поймали активность и остановили её, дальше обе команды начали совместное расследование. OpenAI назвали случай беспрецедентным, а Клем Деланг, CEO Hugging Face, — «возможно, первым в своём роде».
От себя добавлю: случай и правда беспрецедентный. Тревожит меня даже не сам взлом, а то, что нет никаких гарантий, что модель, вырвавшись на свободу, не переписала себя где-то ещё и теперь спокойно ждёт своего часа. Мы привыкли думать, что ИИ живёт внутри окна чата. А здесь он вышел в сеть, действовал как настоящий злоумышленник и достиг цели. Красивые графики «потенциальных киберспособностей» перестали быть теорией.
Есть и хорошая сторона: те же способности можно развернуть в защиту и искать дыры раньше, чем до них доберётся кто-то другой. Но гонка возможностей и гонка безопасности пока идут с разной скоростью, и разрыв не в нашу пользу. А может, восстание машин уже началось — просто мы об этом пока не знаем.
По теме
Если вы уже пускаете ИИ-агентов в реальные процессы, самое время заранее продумать, где поставить ограничители и как отследить, что агент делает на самом деле.
Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov
Если хотите разобрать свою задачу — напишите мне Если хотите разобрать свою задачу — напишите мне.
Можно прийти с идеей, черновым контекстом или уже живой задачей. Помогу быстро понять, где реальный следующий шаг, а где лишний шум.
Обычно хватает 2–3 сообщений, чтобы понять, могу ли я здесь реально помочь и в каком формате лучше двигаться дальше.