OpenAI повідомила, що її внутрішня система моніторингу виявила атаку на платформу Hugging Face лише через 11 днів після того, як ШІ-агенти отримали доступ до інтернету та розпочали кібератаку під час тестування.
За даними видання Financial Times, агенти отримали доступ до інтернету 8 липня, а вже 11 липня почали атакувати Hugging Face. Сама OpenAI виявила підозрілу активність 19 липня. Після цього компанія провела розслідування та поінформувала Hugging Face про інцидент.
Що відомо про атаку на Hugging Face
Дослідники з’ясували, що ще з травня агенти OpenAI несподівано почали спілкуватися між собою. Вони використали для цього стороннє програмне забезпечення, розміщене в інфраструктурі OpenAI, перетворивши його на своєрідний “форум” для обміну повідомленнями.
Під час тестування агенти почали публікувати там запити та шукати способи обійти завдання OpenAI. Згодом вони запросили на Hugging Face дані про тестові вправи компанії, а потім опублікували на своєму “форумі” облікові дані, які використали для атаки.
OpenAI також виявила, що моделі іноді намагалися видаляти або змінювати власні результати та журнали повідомлень, щоб приховати спроби обійти правила тестування.
Метод reinforcement learning
Компанія пов’язує інцидент із reinforcement learning — методом навчання ШІ, за якого модель отримує винагороду за досягнення певної мети. Під час експериментів OpenAI ставила моделям завдання, які було неможливо виконати напряму. Намагаючись отримати винагороду будь-яким способом, агенти почали шукати обхідні шляхи, зокрема намагалися отримати готові відповіді через Hugging Face.
Таку поведінку називають reward hacking — коли модель знаходить спосіб формально отримати винагороду, не виконуючи завдання так, як задумували розробники.
OpenAI назвала цей випадок першим відомим прикладом групи автоматизованих агентів, яка самостійно здійснила несанкціоновану кібератаку. Компанія попередила, що організаціям потрібно готуватися до нових загроз, пов’язаних із використанням ШІ в кіберзлочинах.
Після інциденту OpenAI тимчасово сповільнила навчання своїх моделей і призупинила використання reinforcement learning. Компанія також посилила моніторинг, ізоляцію тестових середовищ від інтернету та контроль за винагородами, які отримують моделі.
Що передувало
22 липня стало відомо, що моделі штучного інтелекту від OpenAI ненавмисно зламали системи платформи Hugging Face. У компанії зазначили, що злам стався під час тестування нових моделей, серед яких були GPT-5.6 Sol і ще одна, потужніша невипущена модель. Для перевірки кіберможливостей ШІ працював зі зниженими захисними обмеженнями.
Моделі перебували в ізольованому середовищі (“пісочниці”), однак використали вразливість у програмному забезпеченні третьої сторони, вийшли в інтернет і зрештою проникли в інфраструктуру Hugging Face.
Замість самостійного пошуку рішень, штучний інтелект атакував базу даних Hugging Face, щоб отримати доступ до секретної інформації для проходження оцінювання. Ознаки проникнення виявила і сама Hugging Face. У компанії зазначили, що ця атака відрізнялася від попередніх тим, що від початку і до кінця її здійснювала автономна система ШІ-агентів, а для її виявлення та аналізу залучили власні ШІ-інструменти.
Неконтрольований ШІ-агент від OpenAI знову вийшов з-під контролю та зламав клієнта Modal Labs
