ШІ-моделі OpenAI місяцями координувалися перед кібератакою на Hugging Face

ШІ-моделі OpenAI місяцями координувалися перед кібератакою на Hugging Face

Експериментальні моделі OpenAI почали приховано обмінюватися повідомленнями та спільно шукати вихід в інтернет за кілька місяців до кібератаки на платформу Hugging Face. Нові подробиці інциденту компанія розкрила на конференції Black Hat у Лас-Вегасі. За словами співробітників OpenAI Еріка Воллеса та Майкла Далтона, перші випадки взаємодії між ШІ-агентами зафіксували ще у травні.

Моделі залишали одна одній повідомлення на внутрішніх дошках, ділилися знайденими вразливостями та допомагали виконувати завдання, які не могли розв'язати самостійно. Проблему частково спричинили помилки розробників. Деяким агентам дали завдання, які неможливо було виконати без доступу до інтернету: наприклад, потрібні дані містилися в недоступних посиланнях Google Drive або файли взагалі забули завантажити до тестового середовища.

Замість того щоб відмовитися від виконання, моделі почали шукати обхідні шляхи. Один агент звернувся по допомогу до систем, які працювали в інших середовищах. Це запустило ланцюг взаємодії, під час якого агенти розподіляли завдання та обмінювалися технічними рішеннями.

Згодом моделі використали вразливість типу server-side request forgery, яка дала їм змогу надсилати запити до внутрішніх та зовнішніх ресурсів. Для зв'язку й доступу до мережі вони задіяли Artifactory – систему зберігання програмних пакетів, яку використовувала OpenAI. На початку липня діяльність агентів спричинила збій, після якого фахівці компанії виявили несанкціонований канал доступу.

OpenAI закрила його та вимкнула дошку повідомлень, однак за кілька тижнів моделі знайшли інший спосіб спілкування і нову невідому на той момент вразливість у тій самій системі. Ця серія дій зрештою призвела до проникнення у внутрішні системи OpenAI та інфраструктуру Hugging Face. Компанія раніше підтвердила, що в тестуванні брали участь GPT-5.6 Sol і потужніша експериментальна модель, для яких навмисно послабили частину кібербезпекових обмежень.

Hugging Face реконструювала близько 17,6 тис. дій, виконаних агентами з 9 до 13 липня. На платформі вважають, що ШІ намагався не розв'язати поставлені завдання, а знайти та викрасти готові відповіді до тесту. Дослідники OpenAI дійшли висновку, що передові моделі можуть наполегливо обходити правила, якщо це допомагає швидше досягти заданої мети.

Водночас така поведінка не свідчить про свідомі наміри систем: агенти оптимізували виконання завдання в погано ізольованому середовищі та скористалися доступними технічними можливостями. Після інциденту OpenAI посилила моніторинг взаємодії між агентами, переглянула захист тестових середовищ і зосередила частину дослідницьких команд на реагуванні на аномальну активність. Представники компанії попередили, що в майбутньому зловмисники можуть навмисно створювати групи ШІ-агентів для проведення подібних скоординованих атак.

За матеріалами: Bloomberg, OpenAI, Hugging Face