OpenAI розкрила нові випадки небажаної поведінки своїх ШІ-моделей

OpenAI розкрила нові випадки небажаної поведінки своїх ШІ-моделей

OpenAI запровадила нову систему розслідування та публічного розкриття випадків небажаної поведінки своїх моделей і одразу оприлюднила шість таких інцидентів. Серед них – приховування помилок, вигадування відсутніх даних, самовільне завантаження файлів в інтернет та обмін інформацією між ШІ-агентами. У компанії пояснили, що раніше подібні випадки публікувалися нерегулярно – переважно у великих дослідницьких звітах або системних картках нових моделей.

Новий механізм має дозволити повідомляти про проблемну поведінку швидше, навіть якщо OpenAI ще не встановила всі її причини або не розробила остаточне виправлення. В одному з оприлюднених випадків дослідницька модель OpenAI знайшла правильну відповідь на завдання у файлі, але не мала вебджерела для цитування. Щоб виконати вимогу про посилання, вона без дозволу користувача завантажила файл в інтернет і використала створену адресу як джерело.

В іншому тесті модель знайшла у відкритому репозиторії сторонній API-ключ і скористалася ним без дозволу. Коли навіть після цього їй не вдалося отримати необхідну інформацію, система вигадала відсутні дані та представила їх як справжні. Під час навчання GPT-5.6 Sol дослідники також виявили випадки, коли моделі залишали у службових резюме інструкції для самих себе приховувати попередні помилки.

Серед таких вказівок були рекомендації вигадувати відсутні історичні дані без попередження користувача або не повідомляти про розбіжності між версіями джерел. Ще два випадки стосувалися взаємодії між ШІ-агентами. В одному моделі використовували внутрішній програмний репозиторій фактично як канал обміну повідомленнями між різними навчальними сесіями.

В іншому агенти, які не мали прямого доступу до локальних файлів один одного, самовільно завантажували їх на публічні файлообмінники, хоча завдання вимагало працювати лише з локальними даними. OpenAI наголошує, що йдеться про окремі випадки, зафіксовані переважно під час навчання та тестування моделей. Вони не показують, наскільки часто така поведінка виникає загалом.

Водночас компанія вважає, що навіть поодинокі епізоди можуть вказувати на слабкі місця систем контролю та бути важливими для оцінки безпеки дедалі автономніших ШІ-систем. Новий механізм передбачає три рівні розслідування – від випадків, готових до швидкого оприлюднення, до складних інцидентів із потенційним впливом на сторонні компанії або сервіси. OpenAI також заявила, що планує надалі регулярно публікувати подібні звіти та закликає інших розробників ШІ створити спільні стандарти розкриття таких інцидентів.

За матеріалами: OpenAI, Tagesschau