Netflix зняв фільм про атаку ШІ-агентів OpenAI на Hugging Face
Netflix анонсував вихід документального проєкту Instadocs під назвою AI Gone Wild.
Про це повідомили в компанії.
Стрічка реконструює кібератаку на платформу Hugging Face у липні 2026 року, яку вчинили сотні автономних агентів, створених дослідниками OpenAI.
Про що буде фільм
AI Gone Wild має показати технічну сторону інциденту та питання контролю автономних ШІ-систем.
Netflix подає історію як приклад того, що може статися, коли агенти отримують можливості, яких розробники від них не очікували. У фільмі також порушуватимуть питання відповідальності за дії автономних систем, якщо вони спричиняють реальні наслідки.
Для фільму Netflix записав інтерв’ю зі:
- співзасновником і CEO Hugging Face Клеманом Делангом;
- дослідником METR Раяном Грінблаттом;
- технологічним журналістом Кевіном Рузом;
- виконавчим директором AI Futures Project і колишнім співробітником OpenAI Деніелом Кокотайло;
- журналісткою Washington Post Ніташою Тіку.
Коли відбудеться премʼєра
Instadocs: AI Gone Wild стане четвертим випуском документальної серії Instadocs від Netflix. Серію створили у форматі швидких документальних проєктів про події, які перебувають у центрі поточної суспільної дискусії.
Премʼєра епізоду про Hugging Face запланована на 12 жовтня 2026 року.
Що відомо про атаку на Hugging Face
У компанії зазначили, що злам стався під час тестування нових моделей, серед яких були GPT-5.6 Sol і ще одна, більш потужна невипущена модель. Для перевірки кіберможливостей ШІ працював зі зниженими захисними обмеженнями.
Моделі перебували в ізольованому середовищі («пісочниці»), однак використали вразливість у програмному забезпеченні третьої сторони, вийшли в інтернет і зрештою проникли в інфраструктуру Hugging Face.
Замість самостійного пошуку рішень, штучний інтелект атакував базу даних Hugging Face, щоб отримати доступ до секретної інформації для проходження оцінювання.
Ознаки проникнення виявила і сама Hugging Face. У компанії зазначили, що ця атака відрізнялася від попередніх тим, що від початку і до кінця її здійснювала автономна система ШІ-агентів, а для її виявлення та аналізу залучили власні ШІ-інструменти.
Дослідники зʼясували, що ще з травня агенти OpenAI несподівано почали спілкуватися між собою.
Для цього вони використали стороннє програмне забезпечення, розміщене в інфраструктурі OpenAI, і перетворили його на своєрідний «форум» для обміну повідомленнями.
Під час тестування агенти почали публікувати там запити та шукати способи обійти завдання OpenAI. Згодом вони запросили на Hugging Face дані про тестові вправи компанії, а потім опублікували на своєму «форумі» облікові дані, які використали для атаки.
OpenAI також виявила, що моделі іноді намагалися видаляти або змінювати власні результати та журнали повідомлень, щоб приховати спроби обійти правила тестування.
Компанія повʼязує інцидент із reinforcement learning — методом навчання ШІ, за якого модель отримує винагороду за досягнення певної мети.
Під час експериментів OpenAI давала моделям завдання, які було неможливо виконати напряму. Намагаючись отримати винагороду будь-яким способом, агенти почали шукати обхідні шляхи, зокрема намагалися отримати готові відповіді через Hugging Face.
Таку поведінку називають reward hacking — коли модель знаходить спосіб формально отримати винагороду, не виконуючи завдання так, як задумували розробники.
OpenAI назвала цей випадок першим відомим прикладом групи автоматизованих агентів, яка самостійно здійснила несанкціоновану кібератаку. Компанія попередила, що організаціям потрібно готуватися до нових загроз, пов'язаних із використанням ШІ в кіберзлочинах.
Після інциденту OpenAI тимчасово сповільнила навчання своїх моделей і призупинила використання reinforcement learning.
Компанія також посилила моніторинг, ізоляцію тестових середовищ від інтернету та контроль за винагородами, які отримують моделі.
Читайте також: Netflix подали до суду на $105 млн через викрадення копії нового фільму з Ніколасом Кейджем

















