У Nature описали ШІ Ataraxos для гри в Stratego з прихованою інформацією

У Nature описали ШІ Ataraxos для гри в Stratego з прихованою інформацією

Дослідники описали систему Ataraxos, що навчається грати у Stratego з прихованою інформацією за допомогою самогри.

У журналі Nature описали систему штучного інтелекту Ataraxos, призначену для ухвалення рішень у Stratego — настільній стратегічній грі з прихованою інформацією. Система навчається через гру проти себе та окремо опановує розстановку фігур на початку партії і вибір ходів під час гри.

У Stratego кожен гравець на старті таємно розставляє 40 фігур на чотирьох рядах свого боку дошки. Суперник не знає типів цих фігур, доки вони не вступають у бій. Перемогу здобувають захопленням прапора опонента або позбавленням його можливості зробити легальний хід.

 

Дві моделі для різних фаз гри

 

Ataraxos використовує дві трансформерні нейромережі: одну для формування початкової розстановки, іншу — для вибору ходів. Ці процеси тренуються окремо, але взаємопов’язані: розстановка визначає стартові позиції для моделі ходів, а результати партій використовують для оновлення обох моделей.

Для пошуку під час гри система також застосовує мережу переконань, яка за доступною гравцеві інформацією прогнозує типи прихованих фігур суперника. Перед ходом Ataraxos створює можливі варіанти поточного стану дошки, моделює з них продовження партії та оцінює кандидатні ходи. Після цього вона оновлює розподіл імовірностей вибору ходу й випадково обирає дію з оновленої політики.

 

Параметри навчання

 

Основний запуск навчання з підкріпленням тривав тиждень і використовував 16 графічних процесорів NVIDIA H100. За цей час система завершила 163 млн партій, виконала 208 млрд кроків у середовищі гри, а також 8,56 млн кроків оновлення для мережі ходів і 99,5 тис. — для мережі розстановки.

Навчання мережі переконань здійснювали на чотирьох NVIDIA H100 протягом чотирьох днів. Автори зазначили, що порівняно з попередньою роботою, яка не досягла рівня провідних людей-гравців, цей запуск потребував приблизно 1/500 обчислювальних витрат, 1/30 кількості партій із самогрою та 1/100 навчальних прикладів.