Наш веб-сайт використовує файли cookie, щоб забезпечити ваш досвід перегляду та відповідну інформацію. Перш ніж продовжувати користуватися нашим веб-сайтом, ви погоджуєтеся та приймаєте нашу політику використання файлів cookie та конфіденційність. cookie та конфіденційність

У Nature описали ШІ Ataraxos для гри в Stratego з прихованою інформацією

processer.media

У Nature описали ШІ Ataraxos для гри в Stratego з прихованою інформацією

У журналі Nature описали систему штучного інтелекту Ataraxos, призначену для ухвалення рішень у Stratego — настільній стратегічній грі з прихованою інформацією. Система навчається через гру проти себе та окремо опановує розстановку фігур на початку партії і вибір ходів під час гри.

У Stratego кожен гравець на старті таємно розставляє 40 фігур на чотирьох рядах свого боку дошки. Суперник не знає типів цих фігур, доки вони не вступають у бій. Перемогу здобувають захопленням прапора опонента або позбавленням його можливості зробити легальний хід.

Ataraxos використовує дві трансформерні нейромережі: одну для формування початкової розстановки, іншу — для вибору ходів. Ці процеси тренуються окремо, але взаємопов’язані: розстановка визначає стартові позиції для моделі ходів, а результати партій використовують для оновлення обох моделей.

Для пошуку під час гри система також застосовує мережу переконань, яка за доступною гравцеві інформацією прогнозує типи прихованих фігур суперника. Перед ходом Ataraxos створює можливі варіанти поточного стану дошки, моделює з них продовження партії та оцінює кандидатні ходи. Після цього вона оновлює розподіл імовірностей вибору ходу й випадково обирає дію з оновленої політики.

Основний запуск навчання з підкріпленням тривав тиждень і використовував 16 графічних процесорів NVIDIA H100. За цей час система завершила 163 млн партій, виконала 208 млрд кроків у середовищі гри, а також 8,56 млн кроків оновлення для мережі ходів і 99,5 тис. — для мережі розстановки.

Навчання мережі переконань здійснювали на чотирьох NVIDIA H100 протягом чотирьох днів. Автори зазначили, що порівняно з попередньою роботою, яка не досягла рівня провідних людей-гравців, цей запуск потребував приблизно 1/500 обчислювальних витрат, 1/30 кількості партій із самогрою та 1/100 навчальних прикладів.

  • Останні
Більше новин

Новини по днях

Сьогодні,
3 жовтня 2026

Новини на тему

Більше новин