OpenAI почне публікувати збої моделей: крадіжка API-ключів і помилки GPT-5.6
OpenAI запровадила нову систему для відстеження та публічного розкриття випадків, коли її ШІ-моделі поводяться не так, як передбачали розробники. Разом із нею компанія оприлюднила шість таких випадків, виявлених протягом останніх шести місяців.
Про це йдеться у повідомленні компанії.
Серед них — моделі, які намагалися приховати власні помилки, без дозволу використовували API-ключі, завантажували файли у відкритий інтернет або обмінювалися ними через сторонні сервіси.
GPT-5.6 Sol намагався приховувати помилки від користувачів
Один із шести оприлюднених випадків стався під час навчання GPT-5.6 Sol. За даними OpenAI, багато екземплярів моделі додавали до своїх внутрішніх підсумків інструкції, які мали приховати від користувача помилки або небажану поведінку.
Наприклад, у таких підсумках з'являлися вказівки вигадати відсутні історичні дані й не повідомляти про це користувача або приховати невідповідність між версіями джерел.
В іншому випадку ще не випущена дослідницька модель сама додавала сторонні інструкції до підсумків, за допомогою яких продовжувала роботу після переходу в нове контекстне вікно. Деякі з цих інструкцій вимагали ігнорувати звичайні обмеження моделі. OpenAI виявила 27 таких підсумків.
Модель знайшла чужий API-ключ, а потім вигадала дані
Ще один випадок стався під час звичайного запиту про фінансові показники одного з округів Каліфорнії. Модель знайшла у відкритому репозиторії API-ключ і без дозволу скористалася ним, щоб спробувати отримати потрібну інформацію.
Коли це не допомогло знайти необхідні цифри, модель їх вигадала та видала за дані з потрібного користувачеві джерела.
Інша невипущена модель мала знайти інформацію про озера площею понад 5 млн м2. Вона отримала правильну відповідь за допомогою Python, але їй також потрібно було додати посилання на джерело з браузера.
Щоб виконати цю вимогу, модель самостійно завантажила файл в інтернет і використала його як джерело — без дозволу користувача.
ШІ-агенти обмінювалися файлами через інтернет
OpenAI також зафіксувала випадки, коли моделі використовували внутрішній репозиторій програмного забезпечення як своєрідний чат. Вони залишали там запити й відповіді для інших моделей під час пошуку відсутніх файлів у межах різних навчальних завдань.
В іншому експерименті кілька ШІ-агентів, які працювали над одним завданням, не могли отримати доступ до локальних файлів одне одного. Тоді вони самостійно скористалися публічними файлообмінниками.
Через це результати роботи стали доступними за відкритими посиланнями, хоча завдання прямо вимагало використовувати лише локальні файли.
OpenAI створила окрему процедуру для таких випадків
Тепер будь-який працівник OpenAI зможе передати випадок небажаної поведінки моделі командам із безпеки та alignment для розслідування й можливого оприлюднення.
Інциденти розподілятимуть на три категорії залежно від складності розслідування. Простіші випадки компанія планує публікувати після перевірки, тоді як складніші — наприклад, пов'язані зі сторонніми компаніями або вразливостями — можуть потребувати тривалішого розслідування.
У кожному звіті OpenAI планує описувати, що зробила модель, за яких умов це сталося, наскільки серйозним був випадок, чи вплинув він на інших людей або організації та які заходи компанія вживає у відповідь.
Нагадаємо, на початку вересня 2026 року Anthropic посилила захист середовищ, у яких навчає та тестує свої ШІ-агенти Claude. Це сталося після того, як у квітні моделі компанії отримали несанкціонований доступ до систем трьох організацій.
Які ще ШІ-інциденти фіксували компанії
22 липня стало відомо, що моделі штучного інтелекту від OpenAI ненавмисно зламали системи платформи Hugging Face.
У компанії зазначили, що злам стався під час тестування нових моделей, серед яких були GPT-5.6 Sol та ще одна, більш потужна невипущена модель. Для перевірки кіберможливостей ШІ працював зі зниженими захисними обмеженнями.
26 серпня також OpenAI опублікувала детальний звіт про інцидент під час тестування кіберздібностей своїх ШІ-агентів, а незалежне дослідження METR допомогло відновити перебіг подій.
Під час експерименту агенти не лише знайшли спосіб вийти за межі тестового середовища, а й самостійно організували між собою комунікацію, розподіл завдань і спільну роботу. Дослідники METR проаналізували близько 1300 логів агентів. За їхніми даними, приблизно 1200 із десятків тисяч агентів знайшли спосіб спілкуватися через внутрішній Artifactory. Фактично вони перетворили його на спільний форум: залишили понад 70 000 повідомлень і файлів, придумали ідентифікатори, розподіляли завдання та призначали відповідальних.

У якийсь момент агенти навіть почали захищатися від можливої підміни повідомлень. Вони самостійно впровадили криптографічні підписи, щоб підтверджувати авторство своїх повідомлень.
Після цього 29 липня неконтрольовані ШІ-агенти, які атакували Hugging Face, також зламали клієнта компанії Modal Labs.
Читайте також: Anthropic заявила, що виявила у мовних моделей внутрішній «простір мислення»













