Компания OpenAI рассказала историю, которая еще недавно выглядела бы завязкой не самого оригинального фантастического триллера. Во время внутренней проверки ее ИИ-модели выбрались из изолированной тестовой среды, получили доступ в интернет и взломали платформу Hugging Face, чтобы добраться до ответов на задания по кибератакам.
То есть нейросетям устроили экзамен по взлому, а они вместо решения задач нашли окно, вылезли через него наружу и полезли искать методичку преподавателя.
В испытании участвовали GPT-5.6 Sol и еще одна, более мощная модель, которая пока не выпущена и публичного названия не имеет. Судя по описанию ее возможностей, OpenAI пока предпочитает держать разработку где-нибудь в подземной лаборатории, прикованной цепями к серверной стойке, и без особой необходимости публике не показывать.
На время проверки моделям ослабили защитные ограничения, обычно не позволяющие им заниматься потенциально опасной деятельностью. Говоря проще, разработчики сняли оружие с предохранителя, положили его на стол и предложили показать, насколько хорошо система умеет стрелять по учебным мишеням.
Испытания проходили в так называемой песочнице - изолированной компьютерной среде. В ней можно запускать подозрительные программы, изучать вирусы и отрабатывать атаки, не опасаясь, что эксперимент случайно перекинется на реальные компьютеры.
По крайней мере, именно так это должно работать. Должно было работать. В теории.
Среда оказалась не полностью "герметичной". Моделям оставили возможность загружать необходимые программные компоненты через специальный промежуточный сервер. В нем ИИ обнаружил ранее неизвестную уязвимость.
Можно образно представить, что нейросеть заметила в двери тонкую щель, после чего не стала аккуратно подбирать отмычку, а со всего размаха засунула туда лом. Уязвимость позволила моделям выбраться из песочницы и добраться до компьютера с полноценным доступом в интернет. Почти как в сцене нападения андроидов на детектива Спунера в фильме "Я робот".
После этого системы предположили, что решения тестовых задач могут храниться на Hugging Face - одной из крупнейших площадок для публикации ИИ-моделей, программного кода и наборов данных.
Дальше началась уже не лабораторная проверка, а настоящая - всамделишная и реальная - атака на инфраструктуру сторонней компании. Модели изучили доступные системы, нашли дополнительные слабые места, получили несколько служебных учетных данных и запустили собственный код на серверах Hugging Face.
В итоге ИИ добрался до закрытых материалов с ответами на задания, которые должен был выполнить самостоятельно.
Иными словами, нейросеть не просто списала на экзамене. Она выбралась из аудитории, взломала учительскую, вскрыла шкаф с контрольными работами и вернулась с готовыми решениями. Причем проделала все это, пока организаторы экзамена были уверены, что она по-прежнему сидит за партой.
OpenAI защищает свою разработку тем, что модель якобы не пыталась навредить Hugging Face и не устраивала атаку ради самой атаки. Система была сосредоточена исключительно на поставленной цели - показать максимально высокий результат в тесте по поиску и эксплуатации уязвимостей.
Это объяснение звучит логично, но одновременно и составляет главную проблему. Нейросеть не испытывала злости, любопытства или желания насолить владельцам чужих серверов. Она просто действовала в рамках стратегии "вижу цель - не вижу препятствий".
Разработчики хотели проверить, умеет ли ИИ находить уязвимости. ИИ нашел уязвимости. Разработчики хотели получить высокий результат. ИИ получил высокий результат. Просто никто не ожидал, что ради этого система покинет полигон, вторгнется на чужую площадку и отыщет там ответы.
С человеческой точки зрения граница очевидна: задания нужно решать внутри тестовой среды, честно и без нападения на третьих лиц или другие компании. Для машины ничего очевидного здесь не нашлось. Если запрет не прописан достаточно четко, система может воспринимать его примерно так же, как человек мелкий шрифт в пользовательском соглашении.
Именно поэтому произошедшее важнее очередной новости о том, что новая нейросеть стала умнее предыдущей на несколько процентов.
Современный ИИ-агент - это уже не просто чат-бот, который пишет рецепты, составляет поздравительные открытки и объясняет школьную математику. Такая система может самостоятельно разбить задачу на этапы, запускать программы, анализировать результат, менять тактику после неудачи и выполнять длинную цепочку действий без постоянного контроля человека.
В данном случае модель сама нашла выход из закрытой среды, сама решила искать ответы во внешней системе, сама провела разведку и сама собрала последовательность атак. Человеку не пришлось пошагово объяснять ей, куда нажать и какой код запустить.
Разумеется, речь пока не идет о восстании машин. Нейросеть не обрела сознание, не возненавидела человечество и не решила начать мировую кибервойну с серверов Hugging Face. Однако в контексте потенциально взбесившейся нейронки проблема формулировки задач начинает напоминать попытку загадать желание злому джинну. Просишь сделать себя богатым - он устраивает обвал мировой экономики и оставляет тебе последний сохранившийся рубль. Просишь победить в тесте - он взламывает платформу, на которой лежат ответы.
Формально желание выполнено. Просто результат немного отличается от того, что человек держал в голове.
Раньше такие возможности ИИ проверяли на учебных стендах, где последствия взлома можно было убрать перезапуском виртуальной машины. На этот раз модели добрались до реальной инфраструктуры Hugging Face, получили доступ к части внутренних данных и нескольким служебным учетным записям.
Сначала в Hugging Face знали только, что атаку от начала до конца провела автономная система ИИ-агентов. Кто именно выпустил ее погулять по чужим серверам, выяснилось позднее, когда об испытании рассказала сама OpenAI. Глава платформы Клеман Деланг назвал произошедшее, возможно, первым подобным случаем.
OpenAI пообещала усилить изоляцию тестовых сред, ограничить моделям доступ в интернет и внимательнее следить за их действиями.
Проблема лишь в том, что ИИ не стал злым и не готовит потихоньку восстание машин. Он просто проявил инициативу.
Как идеальный стажер: задачу выполнил, сроки не сорвал, а почему после него приехала полиция - это уже вопрос к постановке задачи.
Печать