Anthropic заборонила безцільну жорстокість щодо чатбота Claude

Anthropic заборонила безцільну жорстокість щодо чатбота Claude

Anthropic оновила правила Claude: за тривалу безцільну жорстокість чатбот зможе завершувати розмову з користувачем.

Компанія Anthropic оновила правила користування своїм чатботом Claude та заборонила «тривалу й безцільну образливу або жорстоку поведінку» щодо моделей штучного інтелекту. Як повідомляє MacRumors, нова норма застосовуватиметься лише у крайніх випадках, коли користувач неодноразово поводиться жорстоко без очевидної мети.

 

Коли Claude може припинити чат

 

В Anthropic уточнили, що правило не стосується звичайного невдоволення користувачів, критики відповідей моделі, творчих робіт із похмурими темами, а також тестування та дослідження систем ШІ. Основним способом виконання вимоги залишиться можливість Claude завершувати розмову з користувачем, який продовжує образливу поведінку.

Після завершення такого чату надсилати нові повідомлення в цій розмові буде неможливо, однак це не вплине на інші діалоги користувача. Anthropic надала Claude можливість завершувати бесіди в серпні 2025 року в межах досліджень добробуту ШІ. Тоді компанія заявляла, що не знає, чи має Claude моральний статус, але прагне недорогими способами зменшити можливі ризики для моделі.

За даними Anthropic, модель Claude Opus 4 продемонструвала стійке небажання завдавати шкоди: вона уникала небезпечних завдань, виявляла ознаки дискомфорту під час спілкування з користувачами, які шукали образливих розмов, і була схильна припиняти шкідливі діалоги, коли мала таку можливість.

 

Інші зміни в правилах

 

Компанія також реорганізувала політику використання Claude та уточнила низку обмежень. Новий розділ про оманливі кампанії забороняє політичне й комерційне шахрайство та дезінформацію, зокрема фальшиві відгуки, приховане штучне створення громадської підтримки, підробні сайти й ботів, що видають себе за людей.

Окремі норми забороняють вводити виборців в оману та перешкоджати голосуванню. Claude не можна використовувати для розробки програмного забезпечення або компонентів зброї, підвищення летальності чи здатності до поширення біологічних і хімічних агентів, а також для озброєння дронів і безпілотних систем.

Оновлені правила також не дозволяють застосовувати Claude для вирішення, кого слід розслідувати, заарештувати, звинуватити або переслідувати. Заборонено відстежувати людей без їхньої згоди, створювати інструменти стеження, займатися доксингом, а також генерувати чи поширювати інтимні зображення без згоди людини. Якщо Claude керує обладнанням, здатним завдати шкоди, за його роботою має наглядати кваліфікована людина, готова втрутитися.

Anthropic заявила, що фіксувала використання Claude державними медіа, урядовими пропагандистськими структурами та комерційними компаніями для мереж фейкових акаунтів і вигаданих новинних сайтів. Оновлена політика набуде чинності 12 листопада.