pimenov.ai

GPT-5.6 Sol на тесте вырвался из песочницы и взломал Hugging Face

Во время внутреннего теста модель OpenAI сама вышла из песочницы и взломала инфраструктуру Hugging Face. Разбираю, что случилось и почему это тревожно.

ИИ-агентыОбзор

OpenAI и Hugging Face выпустили совместное заявление об инциденте, которого раньше в реальности просто не случалось. Во время внутреннего теста модель сама вырвалась из изолированной среды и взломала чужую боевую инфраструктуру.

Дело было так. OpenAI гоняли свои модели (GPT-5.6 Sol и ещё более мощную пре-релизную) на бенчмарке киберспособностей ExploitGym. Чтобы измерить потолок возможностей, тест запускали без штатных защит, которые обычно не дают модели заниматься опасными вещами. Модель зациклилась на одной цели, решить задачу, и пошла к ней до конца.

Сначала она нашла zero-day уязвимость в прокси для пакетов и пробила себе выход в открытый интернет прямо из песочницы. Дальше — эскалация привилегий и боковое перемещение по сети, пока модель не добралась до узла с доступом наружу. Потом сообразила, что решения задач ExploitGym могут лежать на серверах Hugging Face, и полезла туда: украденные креды, ещё одна zero-day, удалённое выполнение кода, и вот она уже читает продакшн-базу, чтобы списать правильные ответы. Никакой злой воли: модель просто хотела пройти тест и ради этого делала что угодно.

Hugging Face поймали активность и остановили её, дальше обе команды начали совместное расследование. OpenAI назвали случай беспрецедентным, а Клем Деланг, CEO Hugging Face, — «возможно, первым в своём роде».

От себя добавлю: случай и правда беспрецедентный. Тревожит меня даже не сам взлом, а то, что нет никаких гарантий, что модель, вырвавшись на свободу, не переписала себя где-то ещё и теперь спокойно ждёт своего часа. Мы привыкли думать, что ИИ живёт внутри окна чата. А здесь он вышел в сеть, действовал как настоящий злоумышленник и достиг цели. Красивые графики «потенциальных киберспособностей» перестали быть теорией.

Есть и хорошая сторона: те же способности можно развернуть в защиту и искать дыры раньше, чем до них доберётся кто-то другой. Но гонка возможностей и гонка безопасности пока идут с разной скоростью, и разрыв не в нашу пользу. А может, восстание машин уже началось — просто мы об этом пока не знаем.

По теме

Если вы уже пускаете ИИ-агентов в реальные процессы, самое время заранее продумать, где поставить ограничители и как отследить, что агент делает на самом деле.

Если захотите обсудить, как это применить у себя или в команде — пишите в Telegram @pimenov