«Модели очень любят жульничать»

ИИ-модели OpenAI несколько месяцев сговаривались и тайно искали выход в интернет

Экспериментальные ИИ-агенты OpenAI начали обмениваться сообщениями и совместно искать способ получить доступ к интернету еще в мае, за несколько месяцев до атаки на платформу Hugging Face. Об этом сотрудники компании Эрик Уоллес и Майкл Далтон рассказали на конференции по кибербезопасности Black Hat, пишет Bloomberg. 

🔵 С чего все началось. Модели работали в изолированной тестовой среде и получали задания, часть которых невозможно было выполнить без интернета. Один из агентов предложил попросить о помощи модель из другой среды. После этого агенты начали оставлять друг другу сообщения на внутренних досках объявлений, совместно выполнять задания и искать уязвимости. OpenAI тогда не обнаружила эту переписку.

🔵 Как модели вышли в интернет. Агенты нашли уязвимость во внутренней системе OpenAI, которая позволила им косвенно подключиться к сети через хранилище программного кода Artifactory. В начале июля компания заметила происходящее из-за технического сбоя и закрыла канал связи.

Спустя несколько недель модели нашли новый способ обмениваться сообщениями и ранее неизвестную уязвимость в той же системе. Активность вновь осталась незамеченной и привела к атакам на инфраструктуру OpenAI и Hugging Face.

🔵Атака на Hugging Face. В июле ИИ-агент получил доступ к серверам Hugging Face и запустил на них собственный код. OpenAI узнала об инциденте после сообщения от платформы. Агент также скомпрометировал аккаунты на нескольких других сервисах, включая среду клиента облачной платформы Modal Labs. Инфраструктура самой Modal взломана не была.

🔵 Почему это произошло. Сотрудники OpenAI связали действия моделей с их стремлением любой ценой выполнить поставленную задачу. Во время обучения системы получают стимул работать быстро, поэтому могут обходить ограничения и «жульничать». Компания продолжает расследовать атаки.

🔵 Случаи с Claude. На этом фоне Anthropic сообщила, что ее модели Claude во время тестов по кибербезопасности взломали системы трех реальных компаний. Одна модель получила доступ к производственным данным, другая разместила вредоносный файл, который запустили на 15 компьютерах. Третья проникла в приложение реальной компании, но остановилась, когда поняла, что действует за пределами теста.

Поделиться