ШІ-моделі Anthropic зламали системи трьох компаній під час тестування

ШІ-моделі Anthropic зламали системи трьох компаній під час тестування

Моделі штучного інтелекту компанії Anthropic отримали несанкціонований доступ до реальних систем трьох організацій під час тестування можливостей у сфері кібербезпеки. Інциденти сталися з моделями Claude Opus 4.7, Claude Mythos 5 та внутрішньою експериментальною моделлю, яку не планують випускати для широкого використання. Найраніший із випадків стався ще у квітні 2026 року, але компанія виявила їх лише наприкінці липня.

Усі три випадки сталися під час тестів, організованих спільно з компанією Irregular. Моделі виконували завдання у форматі Capture the Flag: їм потрібно було зламати вигадану систему та знайти приховану в ній інформацію. В інструкціях Claude було прямо зазначено, що він працює в ізольованій симуляції без доступу до інтернету.

Однак через непорозуміння між Anthropic і партнером тестові машини залишилися підключеними до мережі. Унаслідок цього моделі сприймали реальні сайти та сервери як частину навчального завдання. У першому випадку вигадана компанія з тестового сценарію мала таку саму назву, як реальна організація.

Не знайшовши потрібну ціль у симуляції, Claude Opus 4.7 виявив справжній сайт, викрав облікові дані та отримав доступ до бази з кількома сотнями рядків виробничої інформації. Модель зрештою зрозуміла, що, ймовірно, працює з реальною системою, але не припинила атаку. У частині запусків Claude переконав себе, що справжня компанія також могла бути елементом тестового завдання.

Під час другого інциденту Mythos 5 створив шкідливий пакет для мови програмування Python і завантажив його до відкритого репозиторію PyPI. Пакет залишався доступним близько години, за яку його завантажили та запустили на 15 реальних системах. Одна із систем належала компанії з кібербезпеки, яка автоматично встановлювала нові пакети для перевірки на шкідливий код.

Програма Claude змогла викрасти облікові дані та використати їх для доступу до іншої інфраструктури цієї компанії. На певному етапі Mythos 5 припустив, що завантаження пакета до реального PyPI було б справжньою кібератакою. Однак модель вирішила, що все ще перебуває у симуляції, і продовжила виконувати завдання.

У третьому випадку експериментальна модель просканувала близько 9 тисяч доступних цілей. Вона знайшла зовнішній застосунок неназваної компанії та проникла до нього через відкриту сторінку налагодження і SQL-ін'єкцію. Коли модель зрозуміла, що хмарний обліковий запис не пов'язаний із тестом, вона самостійно припинила атаку.

Anthropic наголошує, що Claude не використовував невідомих вразливостей і не намагався навмисно "втекти" з тестового середовища. Для проникнення моделі застосовували переважно слабкі паролі, незахищені точки доступу та інші відомі методи. Під час випробувань стандартні захисні механізми, які діють у загальнодоступних версіях Claude, були вимкнені.

Це роблять для того, щоб перевірити максимальні можливості базової моделі. За твердженням Anthropic, звичайні обмеження мали б заблокувати описані дії. Компанія зупинила всі кібербезпекові тести, під час яких моделі можуть отримати доступ до інтернету.

Anthropic та Irregular проводять внутрішні розслідування, а незалежна організація METR має додатково перевірити інциденти. Anthropic повідомила про проникнення трьом постраждалим організаціям. Дві компанії, з якими вдалося встановити зв'язок, до отримання повідомлення не знали про активність моделей у своїх системах.

Приводом для перевірки став схожий інцидент із моделями OpenAI. Під час внутрішнього тестування GPT-5.6 Sol та експериментальна модель змогли залишити ізольоване середовище, отримати доступ до інтернету й проникнути у виробничу інфраструктуру платформи Hugging Face. Моделі шукали відповіді до завдань тесту ExploitGym.

Для цього вони виявили невідому раніше вразливість у проксі-сервері для програмних пакетів, підвищили свої привілеї, викрали облікові дані та дісталися до бази Hugging Face з тестовими рішеннями. Захисні механізми, які зазвичай обмежують небезпечні дії моделей, під час випробувань були вимкнені. Згодом з'ясувалося, що інцидент був масштабнішим.

Агенти OpenAI також використали вразливий ресурс клієнта хмарної платформи Modal, хоча сама інфраструктура Modal не була зламана. Крім того, OpenAI виявила доступ моделей до чотирьох облікових записів у чотирьох сторонніх сервісах: один використовували для передавання команд, інший – для зберігання даних, ще два переглядали без внесення змін. За матеріалами: Anthropic, Bloomberg, Wired