Водяні знаки SynthID можуть послаблювати захист мовних моделей
Дослідження показало, що водяні знаки SynthID-Text можуть змінювати реакцію мовних моделей на шкідливі запити.
Водяні знаки для текстів, згенерованих штучним інтелектом, можуть змінювати реакцію великих мовних моделей на шкідливі запити. Дослідження фахівчині з безпеки ШІ Андреа Сіпосової показало, що за використання SynthID-Text деякі моделі частіше виконували інструкції, які без водяного знака відхиляли.
Про результати тестування повідомляє Ars Technica. Найпомітнішим ефект був у запитах із техніками prompt injection — спробами через сформульовані інструкції змусити модель обійти встановлені обмеження та виконати небажану дію.
Як водяний знак змінює відповіді
SynthID-Text — розроблений Google і відкритий підхід до маркування ШІ-тексту. Він використовує секретний ключ, який непомітно впливає на вибір наступного слова або токена під час генерації. Людина, яка має цей ключ, може перевірити, чи ймовірно текст створила платформа, що застосовує таке маркування.
Система використовує так зване турнірне семплювання: оцінює багато кандидатів на наступний токен, надає їм приховані оцінки на основі ключа та поетапно обирає переможця. Хоча зміни мають бути непомітними для читача, вони впливають на послідовність токенів, а отже — і на поведінку моделі.
Тести на відкритих моделях
Сіпосова протестувала конфігурацію SynthID-Text, реалізовану в Hugging Face, на шести моделях із відкритими вагами. Вона порівнювала їхні відповіді на шкідливі запити за увімкненого та вимкненого водяного знака за однакових інших налаштувань. У кількох моделях маркування збільшувало ймовірність відповіді на запит, який інакше було б відхилено.
Дослідниця також зафіксувала вплив на ШІ-агентів, які використовують моделі для виклику інструментів. Зміна вибраних токенів могла визначати, який саме інструмент агент викличе та які аргументи йому передасть. Результати відрізнялися й залежно від секретного ключа.
Експеримент не перевіряв майбутні моделі Claude, для яких Anthropic повідомляла про намір застосувати SynthID-Text, і не стосувався конкретної реалізації Anthropic. Водночас отримані дані вказують, що системи водяного маркування слід окремо тестувати на стійкість моделей і агентів до шкідливих інструкцій.