Мой блог
Как нейросеть оценивает длинные нарды: разбор движка и ошибок игроков
Нейросетевой движок для онлайн-платформы нард проанализировал более 170 тысяч реальных ходов, сыгранных пользователями. На основе этих данных удалось выяснить, как алгоритм оценивает позиции в длинных нардах, почему правила этой дисциплины создают трудности для генераторов и где чаще всего ошибаются люди. Полученные результаты позволяют по-новому взглянуть на стратегию в начале партии и в эндшпиле.



Анализ партий в длинные нарды
Нейросетевой движок для онлайн-платформы нард проанализировал более 170 тысяч реальных ходов, сыгранных пользователями. На основе этих данных удалось выяснить, как алгоритм оценивает позиции в длинных нардах, почему правила этой дисциплины создают трудности для генераторов и где чаще всего ошибаются люди. Полученные результаты позволяют по-новому взглянуть на стратегию в начале партии и в эндшпиле.


Как нейросетевой движок выбирает ход
С начала 1990-х годов нейросетевая оценка позиций стала стандартом для компьютерных программ в настольных играх. Современные движки используют универсальный алгоритм для поиска лучшего решения. На первом этапе система формирует полный список допустимых ходов для текущей расстановки и выпавших костей. Затем программа строит итоговые позиции для каждого варианта и оценивает их с точки зрения выгодности.


Важной особенностью работы генератора является сравнение именно позиций, а не самих ходов. Поскольку разные последовательности шагов могут приводить к абсолютно одинаковому расположению фишек на доске, движок схлопывает идентичные варианты. После этого специальная функция оценки анализирует расстановку фишек глазами соперника, возвращая ожидаемый результат партии. В мощных программных решениях эту задачу решает нейросеть.


Особенности правил длинных нард для генератора
Правила длинных нард существенно отличаются от коротких аналогов. Здесь отсутствует взятие фишек и отправка их на бар, а главным инструментом защиты становится блокирование соперника с помощью непрерывных цепей из фишек. Позиция на доске никогда не откатывается назад, поэтому неудачное расположение фишек влияет на ход игры на протяжении десятков ходов.


Особое внимание в коде уделяется стартовой позиции, где все 15 фишек находятся на «голове». За один ход разрешается брать только одну фишку, за исключением специальных исключений для первого броска второго игрока. При дублях вроде 3-3, 4-4 или 6-6 вторая фишка используется как средство преодоления препятствия, когда первая упирается в голову противника на 12-м пункте. Кроме того, программное обеспечение строго контролирует запрет на построение глухого забора из шести пунктов, если у соперника нет ни одной прошедшей вперед фишки.

Оценка исходов и метрики качества игры
В отличие от коротких нард, в длинных нардах фиксируются три основные ступени победы: оин (обычная победа с очком), марс (проигравший не снял ни одной фишки) и кокс (дополнительно хотя бы одна фишка осталась в стартовой четверти). Нейросеть возвращает вероятность каждого исхода, на основе чего рассчитывается суммарное математическое ожидание в очках, называемое эквити.


Качество игры человека измеряется через отклонение выбранного им хода от эталонного решения движка. Полученная разница в очках умножается на 500 для получения показателя PR (performance rating). Чем ниже этот показатель, тем точнее действует игрок. Для проверки точности оценок в спорных ситуациях применяются ролл-ауты — многократные доигрывания позиции до конца с генерацией случайных бросков.


Статистика ошибок и поведение игроков
Анализ выборки показал, что люди выбирают оптимальный ход движка лишь в 42,6% случаев. При этом львиная доля потерь концентрируется в небольшой части ходов: худшие 5% вариантов приносят почти 44% всех потерянных очков. Большинство ошибок совершается на начальной стадии, пока фишки еще не сошли с головы. Ошибка «не снял с головы» встречается регулярно и обходится игрокам очень дорого.


Сильные игроки реже совершают грубые промахи и чаще находят оптимальные ходы, однако середина партии вызывает трудности даже у опытных участников. Кроме того, значительная часть суммарных потерь приходится на неправильное использование куба удвоения, где игроки чаще пропускают выгодное удвоение ставки или излишне рискуют.

