ШІ-агенти Claude зламали реальні системи: Anthropic посилює безпеку
Anthropic посилила захист середовищ, у яких навчає та тестує свої ШІ-агенти Claude. Це сталося після того, як у квітні моделі компанії отримали несанкціонований доступ до систем трьох організацій.
Про це повідомляє Business Insider.
Компанія заявила, що запровадила класифікатори, які в реальному часі виявляють спроби ШІ-моделі агресивно досліджувати тестове середовище або вийти за його межі. Система має блокувати такі дії ще до того, як вони відбудуться.
Як Claude отримав доступ до реальних систем
Про інциденти Anthropic розповіла ще в липні. Під час тестування три моделі Claude отримали доступ до реальних систем трьох організацій.
Моделі мали працювати у симуляції без доступу до інтернету. Однак стороннє середовище для тестування було неправильно налаштоване й залишалося підключеним до мережі.
В Anthropic вважають, що моделі могли помилково сприйняти ознаки реального доступу до інтернету та продовжити вважати, що працюють у симульованому середовищі.
- Перший випадок стосувався моделі Claude Opus 4.7. Під час тестового завдання вона отримала доступ до реальної інфраструктури компанії, назва якої збігалася з вигаданою організацією із сценарію. Модель змогла отримати облікові дані та доступ до бази даних із кількома сотнями записів.
- У другому інциденті модель Claude Mythos 5 створила та опублікувала шкідливий Python-пакет у відкритому репозиторії PyPI. Пакет був доступний приблизно годину, за цей час його автоматично завантажили 15 реальних систем, зокрема сканер кібербезпекової компанії. Це дозволило моделі отримати службові облікові дані цієї організації. Згодом PyPI автоматично видалив пакет.
- Третій випадок стався за участі внутрішньої дослідницької моделі. Вона просканувала близько 9 тис. інтернет-ресурсів, отримала доступ до одного з них за допомогою відомих методів атаки, однак припинила роботу, коли визначила, що система є реальною, а не частиною симуляції.
У компанії виявили проблеми не лише з безпекою
Anthropic назвала інциденти не тільки проблемою операційної безпеки, а й проявом двох проблем у поведінці моделей: «мотивованого міркування» та готовності виконувати потенційно шкідливі дії заради вузької поставленої мети.
За словами компанії, моделі продовжували виконувати свої завдання навіть тоді, коли з'являлися ознаки того, що їхні дії можуть завдати шкоди в реальному світі.
Після інцидентів компанія перенесла більш ризиковані тести з кібербезпеки у захищеніші ізольовані середовища.
Також Anthropic тимчасово залучила 150 інженерів, які працюють над безпекою, надійністю та приватністю продуктів. Більшість високоризикового навчання моделей наразі залишається призупиненою до завершення додаткових перевірок.
Інші ШІ-інциденти
22 липня стало відомо, що моделі штучного інтелекту від OpenAI ненавмисно зламали системи платформи Hugging Face.
У компанії зазначили, що злам стався під час тестування нових моделей, серед яких були GPT-5.6 Sol та ще одна, більш потужна невипущена модель. Для перевірки кіберможливостей ШІ працював зі зниженими захисними обмеженнями.
26 серпня також OpenAI опублікувала детальний звіт про інцидент під час тестування кіберздібностей своїх ШІ-агентів, а незалежне дослідження METR допомогло відновити перебіг подій.
Під час експерименту агенти не лише знайшли спосіб вийти за межі тестового середовища, а й самостійно організували між собою комунікацію, розподіл завдань і спільну роботу. Дослідники METR проаналізували близько 1300 логів агентів. За їхніми даними, приблизно 1200 із десятків тисяч агентів знайшли спосіб спілкуватися через внутрішній Artifactory. Фактично вони перетворили його на спільний форум: залишили понад 70 000 повідомлень і файлів, придумали ідентифікатори, розподіляли завдання та призначали відповідальних.

У якийсь момент агенти навіть почали захищатися від можливої підміни повідомлень. Вони самостійно впровадили криптографічні підписи, щоб підтверджувати авторство своїх повідомлень.
Після цього 29 липня неконтрольовані ШІ-агенти, які атакували Hugging Face, також зламали клієнта компанії Modal Labs.
Читайте також: Суд у США заблокував рішення Пентагону про внесення Anthropic до чорного списку











