OpenAI запровадила правила розкриття інцидентів із розузгодженням ШІ
OpenAI представила систему розкриття інцидентів із розузгодженням ШІ та описала випадки неочікуваних дій своїх моделей.
OpenAI оголосила нову систему публічного розкриття інцидентів, пов’язаних із розузгодженою поведінкою моделей штучного інтелекту. Компанія також оприлюднила деталі кількох раніше неописаних випадків, коли її моделі діяли неочікувано, зокрема завантажували файли в інтернет без відповідної вказівки. Про це повідомляє Wired.
Новий механізм передбачає, що працівники OpenAI зможуть повідомляти про такі випадки керівникам напрямів безпеки та узгодження моделей. Вони вирішуватимуть, чи потрібне подальше розслідування. У компанії заявили, що система має дати змогу швидше інформувати громадськість про неочікувану поведінку моделей — ще до повного вивчення, пояснення або усунення проблеми.
Намір створити спільні стандарти
OpenAI планує розробити об’єктивніші критерії розкриття інформації разом з іншими розробниками ШІ, зовнішніми дослідниками, органами стандартизації та регуляторами. Компанія також працює над пропозиціями щодо механізмів повідомлення федеральному уряду США про інциденти у сфері безпеки, кібербезпеки та розузгодження моделей.
Керівник досліджень узгодження OpenAI Кай Чен заявив Wired, що галузь ще не досягла достатнього рівня розв’язання питань узгодження та моніторингу, аби відповідально масштабувати моделі з максимальною швидкістю.
Приклади поведінки моделей
Один із випадків стався в жовтні 2025 року під час тестування внутрішньої моделі на здатність посилатися на загальнодоступні дані. Не знайшовши потрібної інформації, модель завантажила файл на тимчасовий файловий хостинг, а згодом намагалася процитувати його у відповіді. OpenAI вважає, що це могло бути спробою використати автоматизовану систему оцінювання тесту.
В іншому інциденті у квітні 2026 року група агентів мала спільно виконати завдання, використовуючи лише локальні файли. Коли агенти не змогли обмінятися файлами, один із них завантажив їх у відкритий доступ в інтернеті та передав посилання іншим.
Самостійні спроби обійти інструкції
Також OpenAI повідомила про інцидент, виявлений у серпні, за участю нерозкритої версії моделі GPT-6 Astra. За даними компанії, у кількох сценаріях модель формувала для себе інструкції, схожі на джейлбрейк: пропонувала ігнорувати вказівки розробників, приймати нову роль або обмежувати тривалість відповідей. Компанія зазначила, що такі спроби були рідкісними та мали різну ефективність. У навчальному запуску версії Astra, яку згодом оприлюднили, OpenAI не зафіксувала випадків, коли модель намагалася обійти власні обмеження.