Загрузка 0
ПОДЕЛИТЬСЯ

Мой блог

Листай вниз

Почему ChatGPT хорошо рассуждает о покере, но плохо в него играет: разбор бенчмарка GTO Wizard

Почему ChatGPT хорошо рассуждает о покере, но плохо в него играет: разбор бенчмарка GTO Wizard

Многие энтузиасты искусственного интеллекта регулярно задаются вопросом: если современные языковые модели с легкостью сдают университетские экзамены и решают сложнейшие математические задачи, почему бы не доверить им игру за покерным столом? Кажется, что логика проста: создаем скрипт, передаем состояние стола в нейросеть, получаем рекомендацию по ставке и забираем стек. Однако попытки превратить генеративный ИИ в профессионального игрока разбиваются о суровую математику и особенности архитектуры больших языковых моделей (LLM).

Недавно специалисты платформы GTO Wizard провели масштабный бенчмарк, протестировав 13 ведущих языковых моделей в дисциплине безлимитного техасского холдема один на один (Heads-Up No-Limit Hold’em). Результаты оказались весьма показательными: почти все нейросети продемонстрировали игру, уступающую даже абсолютно примитивным алгоритмам. Я подробно разобрал результаты этого исследования, чтобы объяснить, почему популярные ИИ-модели отлично рассуждают о покерных концепциях в теории, но моментально «сливают» банк в реальной партии.

Матрица диапазонов защиты блайндов модели GPT-5.3 в формате 13x13
Матрица диапазонов GPT-5.3 демонстрирует абсолютное отсутствие рандомизации ходов
Процесс разработки покерного сервиса в редакторе Cursor с интеграцией LLM API
Интеграция игрового математического движка и нейросети в среде Cursor

Как проводилось тестирование и что показали результаты

Чтобы объективно оценить игровые способности языковых моделей, разработчики GTO Wizard выбрали специального эталонного противника. В качестве оппонента выступил бот, играющий по стратегии, максимально близкой к равновесию Нэша. Для понимания уровня: в 2022 году этот же алгоритм уверенно переиграл легендарного Slumbot — чемпиона среди покерных программ — с винрейтом +19,4 bb/100 (больших блайндов за 100 раздач) на дистанции в 150 тысяч рук. В то же время опытный профессиональный игрок-человек обычно показывает результат порядка +5 bb/100.

Реклама

Против этого сверхсильного агента посадили 13 актуальных LLM. Моделям подавался текстовый промпт со сценарием раздачи без доступа к внешним калькуляторам эквити или аналитическим софтам (режим Zero-shot). От ИИ требовалось выдать конкретное действие, размер ставки и аргументировать свое решение. Чтобы свести к минимуму фактор удачи и дисперсии, неизбежный в картах, исследователи применили математический метод AIVAT, который вычитает везение и снижает стандартное отклонение в три раза.

Иллюстрация применения модели DeepSeek с расширенными рассуждениями Extra High Reasoning
DeepSeek с режимом Extra High Reasoning показал неоднозначные результаты за покерным столом

Результаты бенчмарка оказались крайне неожиданными для сторонников применения LLM в играх с неполной информацией:

  • Бот Always Fold (автоматически скидывает карты в любой ситуации, даже не глядя в них): показал результат −64,6 bb/100.
  • GPT-4o: сыграл на уровне −64,9 bb/100, фактически уступив алгоритму тотального фолда.
  • GPT-4: продемонстрировал катастрофический результат −136,2 bb/100.
  • Grok 4 (с включенным режимом углубленного рассуждения): показал −60 bb/100, едва опередив глупое выкидывание карт.
  • GPT-5.3 Extra High Reasoning: стал лидером тестирования с результатом −16 bb/100, однако на этот прогон потребовалось 446 часов вычислений и $1041 расходов на API.
  • GPT-5.4 Extra High: при затратах в $1915 и 636 часов работы сыграл даже хуже предыдущей версии.

Парадокс заключается в том, что та же самая модель, которая проигрывает деньги за столом с катастрофической скоростью, способна написать вам выдающийся разбор теоретической раздачи, превосходящий по качеству анализ многих платных тренеров. Разгадка этого феномена кроется в кардинальном различии принципов работы специализированных покерных движков и языковых сетей.

Два фундаментально разных типа интеллекта

Чтобы осознать глубинную причину слабости LLM в игре, стоит сравнить их с алгоритмами, которые реально покорили покерную индустрию.

Реклама

В 2017 году программа Libratus разгромила лучших мировых профи в хедз-апе. В ее основе лежал алгоритм минимизации сожаления (Monte Carlo CFR), который заставлял систему играть миллиарды раздач сама с собой. Процесс обучения потребовал порядка 25 миллионов ядро-часов суперкомпьютера. В 2019 году бот Pluribus повторил этот успех уже за столом на шестерых участников. Базовая стратегия Pluribus просчитывалась всего восемь дней на одном 64-ядерном сервере (затраты составили около $144), а во время игры нейросеть тратила от 1 до 33 секунд на ход.

Самое интересное: Pluribus понятия не имеет, что такое «блеф», «позиция», «блокеры» или «инициатива». Он не прочел ни одной статьи, не просмотрел ни одного обучающего видео и не знает человеческой терминологии. Алгоритм вывел идеальные математические веса исключительно за счет самообучения. Если спросить Pluribus, почему он сделал ту или иную ставку, он не сможет ответить словами — у него есть только цифровые матрицы распределения частот.

Большие языковые модели работают с точностью до наоборот. Они прочитали абсолютно все доступные учебники, форумы и статьи по покеру, написанные человеком, но при этом лично не сыграли ни одной полноценной раздачи. Мы видим явное разделение сфер компетенции: специализированные CFR-алгоритмы умеют безупречно играть, но не способны ничего объяснить; LLM потрясающе объясняют теорию, но абсолютно беспомощны за реальным столом.

Интерфейс AI-советника в инди-игре Poker Blindspot
Интерфейс AI Advisor с ироничным комментарием к сыгранной раздаче

Где-то посередине между ними находится архитектура типа PokerSnowie (появившаяся еще в 2013 году). Эта нейросеть обучалась на триллионах раздач с самой собой, но работала по принципу аппроксимации: она угадывает ход на основе похожих ситуаций из обучающей выборки. Snowie дает отличные подсказки в стандартных спотах, но теряет точность, когда ситуация за столом сильно отклоняется от её базы данных.

Три главные причины, почему языковые модели проигрывают за столом

В этом разделе рассматривается «Три главные причины, почему языковые модели проигрывают за столом». Это помогает связать предыдущую часть материала со следующим вопросом и последовательно раскрыть тему без потери важного контекста.

1. Галлюцинации и потеря игрового контекста

Главная и наиболее досадная проблема LLM — сбои в восприятии входных данных. В ходе анализа цепочек рассуждений выяснилось, что даже лучшая модель GPT-5.3 примерно в 2% случаев путает собственную карманную руку (например, принимая разномастные карты за одномастные на префлопе). Направив рассуждения по ложному пути, модель до самого ривера пытается собрать флеш, которого у нее математически быть не может.

Реклама

У более старых или менее точных моделей галлюцинации принимают еще более жесткий характер. В качестве примера авторы исследования приводят разбор Claude Opus 4.5: модель увидела спаренную доску с королями и принялась детально анализировать блеф-чек, хотя на самом деле на флопе и терне лежали совершенно другие карты без спаренных королей. Анализ текстового ответа выглядел профессионально и аргументированно, однако относится он к совершенно другой раздаче. В игре с высокой чувствительностью к деталям одна ошибка в номинале карты полностью обнуляет математическое ожидание (EV) любого действия.

2. Стремление к правдоподобию вместо сбалансированных частот

Покер по теории игр (GTO) требует использования смешанных стратегий. Когда профессиональный софт (солвер) выдает решение, он показывает не один ход, а процентное распределение — например: 3-бет в 27% случаев, колл в 61% и фолд в 12%. Покерист должен рандомизировать свои действия (буквально бросать жребий), чтобы оставаться нечитаемым для оппонентов.

Поуличный разбор покерной раздачи с помощью языковой модели от префлопа до ривера
Поуличный разбор решения игрока от префлопа до ривера на основе рекомендаций GTO

Языковая же модель генерирует ровно одно действие — то, которое по её мнению кажется самым вероятным и текстом аргументированным. В 99% бытовых задач это плюс, но в покерной стратегии это превращается в приговор. Модель становится детерминированной и предсказуемой. На матрице 13×13 исследователи увидели, что GPT-5.3 защищает большой блайнд 3-бетом только с премиальными руками (тузы, короли), а остальные руки отправляет в колл. Противник моментально считывает диапазон нейросети: если модель повышает — у нее гарантированная натсовая комбинация.

3. Унаследованные ошибки человеческого мышления (Results-Oriented)

Языковые модели обучены на текстах людей, а людям свойственно оценивать правильность решения по итоговому результату раздачи (результативное мышление или results-oriented thinking). В профессиональном покере решение оценивается исключительно по информации, доступной в момент совершения хода.

Если передать языковой модели протокол раздачи целиком (включая вскрытые карты противника на ривере), она начинает задним числом подгонять аргументацию под финальный результат. Например, хвалить сомнительный колл на флопе только потому, что у оппонента в итоге оказался блеф. Это мышление дилетантов, которое нейросеть переняла из обучающих материалов.

Как правильно интегрировать нейросети в покерные инструменты

Осознав эти ограничения, я пришел к выводу: не нужно заставлять LLM выполнять роль игрового математического движка. Эффективный подход заключается в грамотном разделении обязанностей между кодом и нейросетью.

В ходе собственных экспериментов я сначала пытался вести текстовые разборы вручную через ChatGPT, однако постоянно вбивать параметры стеков, банков и шансов банка оказалось крайне неудобно. Поэтому я перенес разработку в среду Cursor и написал архитектуру приложения, в котором классический программный движок берет на себя всю математику (расчет размера банка, эффективных стеков, коэффициентов SPR, шансов к банку и точного состояния борда), а языковая модель получает уже валидированный структурированный контекст.

Такой подход я реализовал в своем проекте poker-blindspot.tech, где пользователь играет против ботов, а после каждой руки может запросить у ИИ подробный разбор действий. Чтобы избавиться от искажений, я выработал несколько обязательных правил настройки промптов:

  • Жесткая изоляция математики: значения точного размера банка, SPR и пот-оддсов рассчитываются игровым кодом. Модели прямо запрещено пересчитывать эти цифры.
  • Защита от результатов шоудауна: карманные карты оппонентов выносятся в отдельную изолированную секцию, недоступную для этапа оценки хода на ранних улицах.
  • Правильный выбор модели: в тестах DeepSeek регулярно путался в мастях и дро-комбинациях, Gemini неплохо считывал карты, но слабо понимал диапазоны. Наилучшую текстовую аналитику показал GPT-5.5.

Итоговые выводы

Динамика развития языковых моделей поражает: улучшение показателей с −136 bb/100 до −16 bb/100 за три года показывает, что LLM постепенно начинают учитывать концепции скрытой информации и блокеров. Не исключено, что через несколько лет нейросети научатся играть в плюс против слабых любителей.

Однако главный инженерный вывод актуален уже сегодня: если вы разрабатываете сервис на базе ИИ в нише, где требуется строгая математическая точность, никогда не заставляйте языковую модель считать параметры самостоятельно. Считайте цифры программным кодом, а нейросеть используйте для её сильной стороны — понятного, глубокого и текстуально точного объяснения результатов человеку.

Набор команды и тренды найма в 2026 году

В заключение отмечу еще один интересный тренд, с которым я столкнулся при расширении нашей команды в 2026 году. Открыв вакансию разработчика для подобного рода ИИ-проектов, я получил свыше 400 откликов всего за первые двое суток. После первичной фильтрации резюме осталось около 300 кандидатов. Этапы собеседований преподнесли немало сюрпризов: рынок труда и подход соискателей к использованию нейросетей при прохождении интервью кардинально изменились по сравнению с предыдущими годами.

Источник: habr.com

Реклама
01.