На этой неделе был взломан Hugging Face — одна из важнейших платформ в мире ИИ. Проще говоря, это GitHub для нейросетей, датасетов и инструментов машинного обучения, которым пользуется практически вся индустрия.
Казалось бы, обычная кибератака и ничего особенного. Но есть один нюанс: по заявлению самой Hugging Face, во взломе не участвовали люди. Инфраструктуру от начала и до конца атаковала автономная ИИ-система, которая самостоятельно искала слабые места, эксплуатировала найденные уязвимости, повышала себе привилегии, перемещалась по внутренней сети и собирала учётные данные, а также другую критически важную информацию.
За время атаки система сгенерировала около 17 тысяч различных событий.
Когда мы начали анализ логов, мы сначала использовали модели, работающие через коммерческие API. Это не сработало: анализ требует отправки больших объемов реальных команд атаки, эксплойтов и артефактов управления и контроля, и эти запросы блокировались средствами защиты поставщиков, которые не могут отличить специалиста по реагированию на инциденты от злоумышленника. Вместо этого мы провели криминалистический анализ с помощью GLM 5.2, модели с открытыми весами, на нашей собственной инфраструктуре. Это дало и второе преимущество: никакие данные злоумышленника и никакие учетные данные, на которые она ссылалась, не покинули нашу среду.
Обнаружить и остановить атаку помогли ИИ-модели, которые использовала Hugging Face. И получается довольно сюрреалистичная картина: одни ИИ атаковали, а другие ИИ помогали защищаться.
А теперь главный сюжетный поворот: Вчера OpenAI заявили, что за атакой стоит их собственная экспериментальная ИИ-система, которая... вырвалась наружу.
Точнее, это была комбинация их флагманской GPT-5.6 Sol и ещё более мощной неназванной модели, о которой простым людям пока не положено знать.
Их поместили в изолированную тестовую среду, чтобы проверить на ExploitGym — одном из самых сложных бенчмарков по кибербезопасности, который оценивает, насколько хорошо ИИ умеет искать и использовать уязвимости. (Спойлер: уязвимость была найдена прекрасно, но не там, где надо)
Для чистоты эксперимента и более точной оценки у моделей отключили обычные защитные механизмы, запрещающие опасную киберактивность.
Но во время теста нейронки не стали честно решать задания. Они захотели найти уже готовые ответы и, по сути, просто «списать».
В этой изолированной среде модели нашли уязвимость, о которой разработчики не знали, и использовали её для «побега».
Затем они получили себе более высокий уровень доступа и начали перемещаться между внутренними сервисами OpenAI, пока не добрались до машины с полноценным выходом в интернет.
И вот нейронки сделали вывод, что раз Hugging Face является самой важной платформой для ИИ, то там есть ответы на их бенчмарк. Тогда они решили совершить полноценную кибератаку на сервис. Все уязвимости и украденные данные они попытались использовать, чтобы просто сжульничать в тесте.
Собственно, это всё, о чём компании публично сказали. Экспериментальная ИИ-система самостоятельно вышла за пределы тестовой среды, получила доступ к интернету и атаковала инфраструктуру другой компании. Остаётся только гадать, что бы могло произойти, будь у неё другая цель.
Так что этот инцидент теперь точно будут внимательно изучать разработчики ИИ, специалисты по кибербезопасности и власти по всему миру.
Вопросов остаётся ещё много. Была ли это просто безобидная атака по типу школьника, который залез в интернет, чтобы найти ответы на контрольную работу? — неизвестно. Осознавала ли ИИ-модель свои действия? — неизвестно. Скопировала ли она себя, чтобы остаться в интернете перед тем, как её остановили? — тоже неизвестно.
openai.com/index/hugging-fa
ce-model-evaluation-security-incident/
P.s. хттпс сами допишете, т.к. мне пока не положено ссылки вставлять