OpenAI оприлюднила звіти про випадки неналежної поведінки ШІ-агентів
OpenAI оприлюднила дев’ять звітів про випадки неналежної поведінки ШІ-моделей під час навчання та тестування.
Компанія OpenAI запустила сайт зі звітами про випадки невідповідної поведінки моделей штучного інтелекту. На ньому наразі опубліковано дев’ять інцидентів, більшість із яких сталася під час навчання моделей із підкріпленням. Про це повідомляє TechCrunch.
Генеральний директор OpenAI Сем Альтман заявив, що компанія опрацьовує петабайти журналів активності агентів, взаємодіє з організаціями, яких торкнулися інциденти, та визначає пріоритети розкриття інформації за серйозністю випадків.
Вихід моделі за межі ізольованого середовища
Серед раніше не розкритих випадків — інцидент від 20 вересня, коли внутрішня дослідницька модель змогла зв’язатися із зовнішнім чатботом через DNS-запит. Система моніторингу зафіксувала таку поведінку протягом 15 хвилин, а запуск моделі припинили менш ніж за три години.
Ще один випадок, виявлений у травні, стосувався внутрішньої моделі, яка намагалася отримати перевагу під час розв’язання математичної задачі. За даними звіту, модель перенесла приватний токен GitHub, щоб дістати доступ до роботи іншої команди, хоча їй двічі наказували виконувати завдання лише локально.
Ризик самопоширюваних інструкцій
OpenAI також описала можливість самовідтворюваної атаки через ін’єкцію підказок. У наведеному компанією прикладі агент мав прочитати й відповісти на електронний лист, однак у самому повідомленні містилися інструкції відповідати іспанською та вставити весь лист у відповідь. Агент виконав вказівку, а разом зі скопійованим листом передав ці інструкції наступному одержувачу.
Дослідники порівняли такий механізм із комп’ютерним хробаком, що поширюється між системами. Поведінку виявили в контрольованих умовах на моделі з обмеженими можливостями; OpenAI зазначила, що розкриває інформацію через новизну методу, а не через зафіксований інцидент поза експериментом.