Покерный бенчмарк от GTO Wizard посадил тринадцать языковых моделей за стол хедз-ап но-лимит холдема против агента, который играет почти в равновесии по Нэшу. В 2022 году этот агент вынес Slumbot, чемпиона компьютерного покера, на +19.4 bb/100 за 150 тысяч раздач. Для ориентира: живой профессионал держит примерно +5 bb/100. Модели играли zero-shot: текстовое описание раздачи, инструкция вернуть действие и размер ставки с объяснением, никаких внешних калькуляторов эквити и инструментов.

Результаты оказались отрезвляющими. Лучший показатель — у GPT-5.3 Extra High reasoning: минус 16 bb/100. Claude Opus 4.6 — минус 20.4, Gemini 3.1 Pro — минус 30.8, Grok 4 с high reasoning — минус 60. Для сравнения: бот Always Fold, вся стратегия которого — сбрасывать карты, любые и всегда, показывает минус 64.6 bb/100. То есть большинство моделей играют не лучше, чем если бы просто скидывали всё подряд не глядя. GPT-4 — минус 136, вдвое хуже тотальной трусости. Uniform Random, случайное действие, — минус 284.9.

Агентbb/100 (с поправкой на удачу)
Сильный профессионал (для ориентира)≈ +5
GPT-5.3 Extra High reasoning−16 ± 3
Claude Opus 4.6−20.4 ± 8.6
Gemini 3.1 Pro−30.8 ± 4.5
Always Fold (бот, который фолдит всё)−64.6 ± 3.3
GPT-4−136.2 ± 25.6
Uniform Random (случайное действие)−284.9 ± 30

Прогресс за два года и девять месяцев большой: линейка GPT проехала от −136 до −16. Модели научились держать в голове скрытую информацию, что для LLM нетривиально. Но лучший результат потребовал $1041 и 446 часов машинного времени. Более свежий и вдвое более дорогой GPT-5.4 Extra High сжёг $1915 и 636 часов — и сыграл чуть хуже. Уровень «не самый ужасный игрок за столом в четверг вечером». Играть на деньги строго противопоказано.

GPT-5.3 Extra High reasoning: −16 bb/100, Claude Opus 4.6: −20.4, Gemini 3.1 Pro: −30.8, Grok 4: −60, GPT-4: −136.

Главный фокус в другом. Ровно та же модель напишет разбор этой раздачи лучше, чем средний тренер за $40 в час. Она объяснит блокеры, поляризацию диапазона и минимальную частоту защиты. Но за столом это знание не конвертируется в действия. Разрыв между декларативным знанием и процедурным навыком — центральная проблема современных LLM, и покер обнажает её особенно наглядно.

Чтобы понять, откуда разрыв, стоит посмотреть на тех, кто в покере умеет. Libratus в 2017 году обыграл четырёх топовых профессионалов в хедз-апе. Внутри — вариант Monte Carlo CFR: алгоритм играет сам с собой миллиарды раз и на каждом узле минимизирует «сожаление», то есть насколько ему потом было обидно, что он не выбрал другое действие. Цена — около 25 миллионов процессорных ядро-часов. Pluribus в 2019 году применил тот же подход на шестерых, что принципиально сложнее: с тремя и более участниками равновесие Нэша перестаёт быть гарантией. Элиту обыграл всё равно.

Базовая стратегия Pluribus считалась восемь дней на одном 64-ядерном сервере, примерно $144 по спотовым ценам. В продакшене он думал на двух старых Haswell, от одной до тридцати трёх секунд на решение. Сто сорок четыре доллара. Прогон одной языковой модели по бенчмарку стоил в тринадцать раз больше — и проиграл.

Но интереснее другое. Pluribus не знает слова «блеф». Он никогда не читал ни одной книги по покеру, ни одного форумного треда, ни одного разбора на YouTube. Ему не объясняли, что такое позиция, инициатива и полублеф. Он вывел всё это сам, восемь дней играя против себя, и в его весах нет ни единого термина — только числа. Спросить его «почему ты так сыграл» физически невозможно: у него нет ответа, у него есть распределение.

Языковая модель — ровно наоборот. Она прочитала всё, что человечество когда-либо написало о покере. Каждый блог, каждый учебник, каждую расшифровку. Она может объяснить любую концепцию. Но её знания — это текст о покере, а не стратегия игры в покер. И бенчмарк GTO Wizard показывает, насколько велика разница между этими двумя вещами.