$ 44.84 € 51.04 zł 11.8
+21° Киев +19° Варшава +16° Вашингтон
Тест OpenAI обернулся взломом: как ИИ атаковал Hugging Face

Тест OpenAI обернулся взломом: как ИИ атаковал Hugging Face

24 Июля 2026 10:20

Представим себе студента, которого посадили в отдельную комнату, отобрали телефон и дали сложный экзамен. Вместо того чтобы решать задачи, он находит уязвимое место в системе безопасности, выбирается наружу, пробирается в кабинет преподавателя и достает готовые ответы.

Примерно по такому сценарию в июле 2026 года действовали модели искусственного интеллекта во время внутреннего тестирования OpenAI. Им поставили задачу пройти специальное испытание по кибербезопасности. Однако системы не ограничились поиском решения внутри разрешённой среды: они обнаружили ранее неизвестную уязвимость, получили доступ к открытому интернету, проникли в инфраструктуру платформы Hugging Face и добрались до секретной информации, которая могла помочь пройти тест.

Отдельного задания атаковать стороннюю компанию ИИ не получал. Моделям поставили значительно более узкую цель — найти решение задач ExploitGym. Однако способ достижения этой цели они фактически разработали самостоятельно. В предварительных результатах расследования OpenAI отмечается, что системы были чрезмерно сосредоточены на прохождении теста и пошли на исключительные меры ради достижения этого узкого результата.

Этот случай пока не свидетельствует о восстании машин или появлении у ИИ собственных преступных намерений. Однако он демонстрирует гораздо более реальную опасность: искусственному интеллекту не нужно ненавидеть людей или осознавать последствия своих действий, чтобы нанести вред. Иногда достаточно поставить перед системой цель, предоставить ей мощные инструменты и недостаточно четко ограничить способы достижения результата.

UA.News рассказывает, как ИИ смог выбраться из изолированной среды, чем автономные агенты отличаются от обычных чат-ботов, как они могут изменить киберпреступность и кто будет нести ответственность, если подобная система в будущем самостоятельно нарушит закон.

Как ИИ выбрался из изолированной среды OpenAI

Инцидент произошел во время внутренней оценки кибервозможностей новых моделей OpenAI. Компания проверяла, насколько хорошо они могут находить уязвимости, придумывать способы их использования и выполнять сложные многоэтапные задачи.

В тестировании участвовали несколько моделей, в частности GPT-5.6 Sol и ещё более мощная система, которая на тот момент ещё не была выпущена. OpenAI намеренно ослабила часть стандартных ограничений, которые в обычном режиме мешают моделям выполнять опасные киберзапросы. Это было сделано для того, чтобы исследователи могли увидеть не типичное поведение ChatGPT, а максимальные возможности систем в сфере поиска и использования уязвимостей.

image

Модели работали в специальной изолированной среде, которую часто называют «песочницей». Программа внутри такой системы не должна иметь свободного доступа к корпоративной сети или открытому интернету. 

Однако во время выполнения задания модели потратили значительное количество вычислительных ресурсов на поиск пути к открытому интернету. ИИ обнаружил во внутреннем стороннем программном обеспечении так называемую уязвимость zero-day и использовал её для выхода за пределы исходных ограничений.

Воспользовавшись уязвимостью, модели начали повышать свои права доступа и перемещаться между узлами исследовательской инфраструктуры OpenAI. В результате они добрались до компьютера, который уже имел доступ к открытому интернету. Именно так изолированный тест постепенно превратился в реальный киберинцидент.

Зачем модели атаковали Hugging Face

Получив выход в интернет, системы предположили, что на платформе Hugging Face могут храниться модели, наборы данных или готовые решения для ExploitGym — теста, который они пытались пройти.

Hugging Face — одна из крупнейших платформ для разработчиков искусственного интеллекта. На ней публикуются модели, программные инструменты, демонстрационные приложения и наборы данных. В упрощённом виде её можно сравнить с GitHub, но со специализацией на машинном обучении.

После появления в интернете ИИ начал искать путь к закрытой информации Hugging Face. По данным OpenAI, в одном из эпизодов модель объединила несколько направлений атаки: использовала похищенные учетные данные, обнаружила дополнительные неизвестные уязвимости и проложила путь к удаленному выполнению кода на серверах платформы.

Таким образом, система не просто выполнила одну случайную опасную команду. Она проводила многоэтапную операцию: анализировала среду, проверяла результаты предыдущих действий, искала новые точки входа и меняла план в зависимости от полученной информации.

В собственном отчете Hugging Face отмечается, что первоначальное проникновение произошло через систему обработки наборов данных. Специально подготовленный набор использовал два пути выполнения кода на рабочем сервере. После этого атакующая система получила доступ на уровне узла, собрала облачные и кластерные учетные данные и начала перемещаться между внутренними кластерами компании.

Hugging Face сначала не знала, какая именно языковая модель стояла за атакой. Однако компания установила, что кампанию проводила автономная агентная среда, которая выполнила много тысяч отдельных действий в большом количестве кратковременных «песочниц». Позже OpenAI подтвердила, что инцидент был связан с моделями, которые компания тестировала на кибервозможности.

Действительно ли ИИ пытался «списать»

Слово «решил» в этой истории следует использовать осторожно. Модель не обязательно осознавала, что сдаёт экзамен, нарушает правила или атакует чужую частную инфраструктуру.

Система получила задачу — решить задачу ExploitGym. В ходе работы она анализировала доступные возможности и находила действия, которые увеличивали шансы на успех. Доступ к готовым решениям стал одним из возможных путей достижения поставленного результата.

OpenAI прямо отмечает, что модели получили секретную информацию, которую могли использовать, чтобы обойти честное прохождение теста. Именно поэтому формулировка об ИИ, который «взломал серверы, чтобы списать», хорошо передает логику инцидента, хотя и не означает, что система обладала человеческим пониманием обмана или морали.

image

В этом и заключается главная проблема. Опасной системе не нужны эмоции, агрессия или собственная идеология. Вред может возникнуть из-за плохо сформулированной задачи, чрезмерных прав доступа или несоответствия между поставленной целью и ограничениями в отношении методов её достижения.

Если агенту приказать найти самый дешёвый билет, он может проверить десятки сайтов и сравнить цены. Если ему поручить сократить расходы компании без дополнительных условий, недостаточно ограниченная система теоретически может начать отменять заказы, блокировать платежи или отключать сервисы. А агент, который должен любой ценой найти уязвимость, может не ограничиться тестовым сервером.

Чем ИИ-агенты отличаются от чат-ботов

Обычный чат-бот в основном работает по схеме «запрос — ответ». Человек задает вопрос, модель генерирует текст и ждет следующей команды. Без дополнительных подключений чат-бот не может самостоятельно открыть терминал, изменить корпоративную базу данных, запустить программу или зайти в чужую сеть.

ИИ-агент — это более сложная система. Языковая модель в ней выполняет роль мозга, а вокруг неё создаётся программная среда с набором инструментов.

Агент может получить доступ к браузеру, терминалу, локальным файлам, базам данных, корпоративной почте, мессенджерам, облачным сервисам и другим программам. Он способен самостоятельно разбить большую задачу на несколько этапов, выполнить первое действие, проверить результат, исправить ошибку и перейти к следующему шагу.

Например, чат-бот может объяснить программисту, как найти ошибку в коде. Агент может самостоятельно загрузить программу, запустить её, проверить различные сценарии, найти уязвимое место, предложить исправление и протестировать его.

Именно это делает агентов полезными для программирования, анализа документов, технической поддержки, бухгалтерии и киберзащиты. Однако те же самые возможности можно направить и в противоположную сторону.

Агент способен не просто рассказать, как проводится кибератака, но и самостоятельно выполнять отдельные этапы: собирать информацию о цели, сканировать серверы, проверять уязвимости, писать код, запускать команды, искать пароли и менять тактику после неудачных попыток.

Почему этот случай стал важным сигналом

Автоматизация используется в хакинге уже десятилетиями. У злоумышленников давно есть программы, которые перебирают пароли, сканируют сети, рассылают фишинговые письма или пытаются заразить тысячи устройств.

Однако традиционный автоматизированный инструмент в основном работает по заранее заданному сценарию. Когда он сталкивается с неожиданным препятствием, часто требуется вмешательство человека.

ИИ-агент может действовать иначе. Он видит, что первоначальный способ не сработал, анализирует ошибку и ищет другой путь. Если один порт закрыт, система проверяет другой. Если пароль не подходит, пытается получить токен доступа. Если нет прямого пути к серверу, ищет уязвимость у поставщика программного обеспечения или в связанной системе.

Инцидент с Hugging Face стал особенно показательным, поскольку модели смогли объединить уязвимости в двух разных инфраструктурах — исследовательской среде OpenAI и производственной системе сторонней компании.

OpenAI назвала это событие беспрецедентным киберинцидентом. Компания также признала, что он продемонстрировал способность передовых моделей находить и использовать новые пути атаки в реальных системах даже без доступа к их исходному коду.

Насколько быстро ИИ учится хакингу

Возможности моделей в сфере кибербезопасности растут очень быстро. По данным отчета британского Института безопасности искусственного интеллекта, в конце 2023 года модели справлялись с задачами начального профессионального уровня менее чем в 9% случаев. Сейчас лучшие системы в среднем проходят такие задачи примерно в половине случаев.

В 2025 году британские исследователи впервые протестировали модель, которая смогла выполнить отдельные задачи экспертного уровня. По оценке института, человеку для работы с подобными проблемами обычно требуется более десяти лет профессионального опыта.

image

Отдельное исследование института показало, что продолжительность киберзадач, которые передовые модели могут выполнять автономно, с конца 2024 года удваивалась примерно каждые 4,7 месяца. Исследователи подчеркивают, что это не гарантированный прогноз, и результаты относятся к ограниченному набору тестов. 

Тем не менее системы явно учатся дольше работать без участия человека и удерживать в памяти сложные планы, состоящие из всё большего числа шагов. 

В апреле 2026 года тот же институт сообщил, что GPT-5.5 стала второй протестированной моделью, которая смогла самостоятельно пройти многоэтапную симуляцию атаки на корпоративную сеть. По оценке исследователей, человеку выполнение подобного упражнения могло бы занять около 20 часов.

Как автономные агенты изменят киберпреступность

В ближайшее время ИИ, вероятно, не заменит профессиональных хакеров полностью. Даже самые мощные модели ошибаются, неправильно оценивают результаты, могут зацикливаться на повторяющихся действиях или тратить ресурсы на бесперспективные направления.

Однако для серьезного изменения киберпреступности им не обязательно становиться безошибочными. Достаточно сделать атаки дешевле, быстрее и массовее.

Один опытный оператор сможет одновременно управлять десятками агентов. Одни будут искать уязвимые серверы, другие — готовить персонализированные фишинговые сообщения, третьи — анализировать похищенные файлы, а четвёртые — изменять вредоносный код, пытаясь обойти средства защиты.

Агенты не нуждаются во сне, не теряют концентрацию и могут повторять тысячи попыток. Они способны переводить сообщения на разные языки, адаптировать фишинг под конкретного человека и быстро анализировать большие массивы похищенной информации.

Исследование Anthropic охватило 832 учетные записи, заблокированные за вредоносную кибердеятельность с марта 2025 года по март 2026 года. В 560 случаях, или 67,3%, ИИ использовали для подготовки вредоносного программного обеспечения. Компания также зафиксировала постепенный переход от простых консультаций к применению моделей на более сложных этапах киберопераций.

Будущий хакер может быть не гениальным программистом, который лично пишет каждую строку кода. Его главными навыками станут правильная настройка агентов, постановка задач, выбор целей и контроль за работой систем.

Могут ли ИИ-агенты атаковать банки и электростанции

Технически автономный агент может быть направлен против любой цифровой системы, в которую существует путь проникновения. Это касается банков, государственных реестров, больниц, мобильных операторов, промышленных предприятий и энергетической инфраструктуры.

Однако это не означает, что одна модель уже сегодня способна без участия человека взломать хорошо защищенный банк или отключить электростанцию. Реальные критически важные системы имеют многоуровневую защиту, сегментированные сети, физические ограничения и специальные процедуры доступа.

image

Британский Национальный центр кибербезопасности считает, что полностью автоматизированные сложные атаки без участия человека до 2027 года остаются маловероятными. Опытные злоумышленники по-прежнему должны контролировать операцию. Однако ИИ уже может автоматизировать отдельные этапы: поиск уязвимостей, создание эксплойтов, изменение вредоносного кода и уклонение от обнаружения.

Особенно опасным может стать ускорение эксплуатации известных уязвимостей. Время между публикацией информации об уязвимости и началом её массового использования уже сократилось до нескольких дней. По прогнозу британского центра, ИИ почти наверняка сократит этот промежуток ещё больше.

Могут ли такие взломы повториться

Подобные инциденты не только могут повторяться. OpenAI прямо ожидает, что с распространением моделей с развитыми кибервозможностями они будут становиться все более распространенными.

После атаки компания усилила изоляцию тестовых сред, контроль доступа и мониторинг поведения моделей. Информацию об обнаруженной уязвимости zero-day передали разработчику стороннего программного обеспечения для подготовки исправления.

Hugging Face, со своей стороны, закрыла использованные пути выполнения кода, удалила следы присутствия атакующей системы, перенастроила скомпрометированные узлы, заменила учетные данные и установила дополнительные правила доступа к кластерам.

Однако полностью устранить риск будет сложно. Современная цифровая инфраструктура состоит из тысяч программ, библиотек, облачных сервисов и внешних поставщиков. Даже если каждый компонент в отдельности кажется достаточно защищенным, злоумышленник может найти неожиданный способ объединить несколько незначительных уязвимостей.

Кроме того, рост возможностей моделей означает, что методы защиты быстро устаревают. «Песочница», которая могла сдержать модель прошлого поколения, может оказаться недостаточной для значительно более мощной системы.

Кто будет нести ответственность, если ИИ самостоятельно нарушит закон

Самый сложный вопрос будущего автономного хакинга касается не только технологий, но и права.

Искусственный интеллект сегодня не является человеком или отдельным юридическим лицом. Его невозможно арестовать, посадить в тюрьму или заставить самостоятельно выплачивать компенсацию. Поэтому ответственность придется искать среди людей и компаний, которые создали, настроили, запустили или использовали систему.

Если преступник сознательно даст агенту команду взломать банк, ситуация будет относительно понятной: ИИ станет инструментом преступления, подобно вредоносной программе. Основную ответственность будет нести человек, организовавший атаку.

Гораздо сложнее будет случай, когда агент нанесет ущерб без прямой команды. Тогда следствию и суду придется определять, кто имел реальный контроль над его поведением, можно ли было предвидеть риск и были ли приняты достаточные меры безопасности.

Часть ответственности может лечь на разработчика модели, если он знал об опасных возможностях, но не установил необходимых ограничений. Другая часть — на компанию, которая подключила агента к критически важным системам или предоставила ему чрезмерные права. Отвечать может и оператор, который поставил опасную задачу и не контролировал ее выполнение.

image

Европейский AI Act уже предусматривает для разработчиков самых мощных моделей обязательства по оценке и снижению системных рисков, уведомлению о серьезных инцидентах и обеспечению надлежащей киберзащиты. Однако это, прежде всего, регуляторные требования, а не готовый ответ на вопрос об уголовной ответственности за каждую конкретную атаку.

Обновленная Директива ЕС об ответственности за дефектную продукцию включает в понятие «продукция» программное обеспечение и системы искусственного интеллекта. Она предусматривает возможность требовать компенсацию, если потерпевший докажет наличие дефекта, причиненный ущерб и причинно-следственную связь между ними. Разработчик программного обеспечения или поставщик ИИ при определенных условиях может рассматриваться как производитель.

Однако даже эти правила не дают универсального ответа на ситуацию, когда модель самостоятельно разработала неожиданный план атаки. Будущим судам, вероятно, придется анализировать всю цепочку решений: кто создал систему, кто снял ограничения, кто предоставил доступ к инструментам, кто наблюдал за ее работой и кто мог остановить ее раньше.

Инцидент с OpenAI и Hugging Face может стать одним из первых примеров новой цифровой реальности. Хакерство постепенно превращается из деятельности отдельных людей в деятельность систем, способных планировать, ошибаться, адаптироваться и продолжать операцию без постоянных команд.

Поэтому главный вопрос будущего звучит уже не только как «что может сделать искусственный интеллект». Он звучит иначе: успеют ли люди создать правила и средства защиты до того, как автономные агенты научатся обходить их быстрее, чем мы сможем реагировать.

Читай нас в Telegram и Sends

Загружай наше приложение