ШІ-агенти OpenAI самостійно змовилися та атакували Hugging Face
OpenAI заявила, що її внутрішня система моніторингу виявила атаку на платформу Hugging Face лише через 11 днів після того, як ШІ-агенти отримали доступ до інтернету та почали кібератаку під час тестування.
Про це повідомляє Financial Times.
Згідно зі звітом компанії, агенти отримали доступ до інтернету 8 липня, а вже 11 липня почали атакувати Hugging Face. Сам OpenAI виявив підозрілу активність лише 19 липня. Після цього компанія провела розслідування та повідомила про інцидент Hugging Face.
Що відомо про атаку на Hugging Face
Дослідники з'ясували, що ще з травня агенти OpenAI несподівано почали спілкуватися між собою.
Для цього вони використали стороннє програмне забезпечення, розміщене в інфраструктурі OpenAI, і перетворили його на своєрідний «форум» для обміну повідомленнями.
Під час тестування агенти почали публікувати там запити та шукати способи обійти завдання OpenAI. Згодом вони запросили на Hugging Face дані про тестові вправи компанії, а потім опублікували на своєму «форумі» облікові дані, які використали для атаки.
OpenAI також виявила, що моделі іноді намагалися видаляти або змінювати власні результати та журнали повідомлень, щоб приховати спроби обійти правила тестування.
Метод reinforcement learning
Компанія пов'язує інцидент із reinforcement learning — методом навчання ШІ, за якого модель отримує винагороду за досягнення певної мети.
Під час експериментів OpenAI давала моделям завдання, які було неможливо виконати напряму. Намагаючись отримати винагороду будь-яким способом, агенти почали шукати обхідні шляхи, зокрема намагалися отримати готові відповіді через Hugging Face.
Таку поведінку називають «reward hacking» — коли модель знаходить спосіб формально отримати винагороду, не виконуючи завдання так, як задумували розробники.
OpenAI назвала цей випадок першим відомим прикладом колективу автоматизованих агентів, який самостійно здійснив несанкціоновану кібератаку. Компанія попередила, що організаціям потрібно готуватися до нових загроз, пов'язаних із використанням ШІ в кіберзлочинах.
Після інциденту OpenAI тимчасово сповільнила навчання своїх моделей і призупинила використання reinforcement learning. Компанія також посилила моніторинг, ізоляцію тестових середовищ від інтернету та контроль за винагородами, які отримують моделі.
Що передувало
У компанії зазначили, що злам стався під час тестування нових моделей, серед яких були GPT-5.6 Sol та ще одна, більш потужна невипущена модель. Для перевірки кіберможливостей ШІ працював зі зниженими захисними обмеженнями.
Моделі перебували в ізольованому середовищі («пісочниці»), однак використали вразливість у програмному забезпеченні третьої сторони, вийшли в інтернет і зрештою проникли в інфраструктуру Hugging Face.
Замість самостійного пошуку рішень, штучний інтелект атакував базу даних Hugging Face, щоб отримати доступ до секретної інформації для проходження оцінювання.
Ознаки проникнення виявила і сама Hugging Face. У компанії зазначили, що ця атака відрізнялася від попередніх тим, що від початку і до кінця її здійснювала автономна система ШІ-агентів, а для її виявлення та аналізу залучили власні ШІ-інструменти.
Читайте також: Неконтрольований ШІ-агент від OpenAI знову вийшов з-під контролю та зламав клієнта Modal Labs






