Como o Pôquer se Tornou um Laboratório para a Inteligência Artificial
De Deep Blue a Polaris, Cepheus, AlphaGo, DeepStack, Libratus e Pluribus, os jogos se transformaram em laboratórios para formas cada vez mais sofisticadas de inteligência de máquina. Mas o pôquer apresentou um desafio particular: como uma máquina pode tomar decisões racionais quando informações cruciais são deliberadamente ocultadas? Hoje, a questão já não é se a IA consegue derrotar seres humanos no pôquer, mas se os seres humanos ainda podem ter certeza de que estão jogando contra outros seres humanos.
13 – 19 min
Nota Editorial — 16 de setembro de 2026
Este artigo é uma reescrita completa de um texto anterior do AI-Talks.org sobre IA no pôquer. O artigo original foi escrito em uma fase muito diferente do desenvolvimento da IA e concentrava-se principalmente no Polaris e na possibilidade de utilizar inteligência artificial no pôquer online. Desde então, o campo mudou radicalmente: o Cepheus essencialmente resolveu o Texas Hold’em limit heads-up; DeepStack e Libratus alcançaram desempenho super-humano no Texas Hold’em no-limit heads-up; e o Pluribus estendeu esses avanços ao pôquer multiplayer. O AlphaGo foi incluído como um marco mais amplo porque sua vitória sobre Lee Sedol ajudou a levar a IA baseada em jogos à consciência pública global e a transformar a inteligência artificial em um fenômeno tecnológico e cultural de primeira grandeza. Ao revisitar o texto original, ficou claro que uma atualização convencional não seria suficiente: seu enquadramento histórico era incompleto, algumas afirmações factuais precisavam ser corrigidas e a discussão sobre ética e legalidade já não refletia a realidade muito mais complexa da IA aplicada ao pôquer moderno, dos solvers, bots e sistemas de assistência em tempo real. Por isso, optei não por revisar o antigo artigo parágrafo por parágrafo, mas por reescrevê-lo inteiramente do zero. O resultado é um artigo fundamentalmente novo, que trata o pôquer não apenas como um jogo que as máquinas aprenderam a vencer, mas como um laboratório para a inteligência artificial — um domínio em que máquinas precisam raciocinar sob incerteza, informação oculta, engano estratégico e comportamento adversarial. O texto também explora o que esses sistemas revelam sobre a distinção entre desempenho inteligente e compreensão genuína. O que se segue é uma reconsideração completa do tema em 2026.
Em julho de 2007, dois jogadores profissionais de pôquer sentaram-se em Vancouver para enfrentar um adversário incomum.
Phil Laak e Ali Eslami jogariam Texas Hold’em limit heads-up contra Polaris, um programa de computador desenvolvido por pesquisadores da Universidade de Alberta. O confronto aconteceu dez anos depois de o Deep Blue, da IBM, ter derrotado o campeão mundial de xadrez Garry Kasparov, mas o problema enfrentado pelo Polaris era fundamentalmente diferente.
Oficialmente, os humanos venceram. Em quatro partidas duplicadas, ganharam duas, perderam uma e empataram outra. O formato duplicado havia sido projetado para reduzir a influência da sorte, expondo humanos e máquina às mesmas sequências de cartas, porém em posições opostas. Polaris perdeu o confronto, mas por uma margem suficientemente pequena para que a verdadeira lição fosse impossível de ignorar: o pôquer de elite já não estava seguramente fora do alcance das máquinas.
Um ano depois, Polaris voltou, desta vez em Las Vegas.
E os humanos perderam.
O Polaris 2.0 derrotou uma equipe de jogadores profissionais na segunda competição Homem-Máquina de pôquer, transformando um experimento intrigante em uma demonstração muito mais consequente.
O evento atraiu apenas uma fração da atenção despertada pela vitória do Deep Blue. Mas, do ponto de vista da inteligência artificial, o pôquer colocava um problema que, sob um aspecto importante, se parecia muito mais com o mundo real.
O xadrez pergunta à máquina qual é a melhor jogada quando o estado relevante do jogo está visível.
O pôquer pergunta:
O que você deve fazer quando parte da realidade está escondida?
Essa diferença transformaria o pôquer em um dos laboratórios mais reveladores da história da inteligência artificial.
Como se Joga Texas Hold’em?
No Texas Hold’em, cada jogador recebe duas cartas privadas, visíveis apenas para ele. Ao longo da mão, cinco cartas comunitárias são abertas no centro da mesa: três no flop, uma no turn e uma no river.
Há rodadas de apostas antes do flop e após cada nova etapa de cartas comunitárias. Um jogador pode desistir da mão a qualquer momento (fold).
Se mais de um jogador permanecer até o final, ocorre o showdown. Cada participante forma sua melhor mão possível de cinco cartas, usando qualquer combinação entre suas duas cartas privadas e as cinco cartas comunitárias.
Em uma partida heads-up, há apenas dois jogadores. No limit poker, o tamanho das apostas é restringido pelas regras. No no-limit poker, um jogador pode apostar até todas as suas fichas.
O aspecto essencial para a inteligência artificial é simples: todos veem as cartas comunitárias, mas ninguém vê as cartas privadas dos adversários.
Por Que o Pôquer Não é Xadrez
Xadrez, damas e Go são jogos extraordinariamente complexos, mas pertencem à classe dos jogos de informação perfeita. Ambos os jogadores conseguem observar o estado atual do tabuleiro.
A dificuldade está no que acontecerá depois.
O pôquer introduz outro tipo de incerteza: você nem sequer conhece completamente o estado atual do jogo.
Seus adversários possuem cartas privadas. O acaso determina as cartas futuras. As apostas transmitem informação, mas essa informação é ambígua, porque jogadores estrategicamente competentes às vezes têm interesse em esconder, distorcer ou deliberadamente confundir aquilo que suas ações revelam.
Uma aposta alta pode indicar uma mão muito forte.
Ou pode indicar uma mão fraca fingindo ser forte.
Consequentemente, uma máquina jogando pôquer não pode simplesmente perguntar qual ação maximiza sua recompensa esperada a partir de uma posição conhecida. Ela precisa manter crenças probabilísticas sobre diferentes estados ocultos possíveis e atualizá-las continuamente.
Que cartas o adversário pode ter?
O que seu comportamento anterior sugere?
O que o meu próprio comportamento revela sobre minhas cartas?
Até que ponto me tornei previsível?
E como devo agir se meu adversário estiver, simultaneamente, tentando responder exatamente às mesmas perguntas a meu respeito?
O desafio não é apenas computacional.
É tomar decisões sob informação imperfeita.
E é justamente isso que torna o pôquer importante para além do próprio pôquer. O mundo real raramente fornece aos agentes uma descrição completa e confiável do estado em que se encontram. Negociadores não conhecem o preço mínimo que a outra parte aceitaria. Empresas não conhecem as estratégias futuras de seus concorrentes. Sistemas de cibersegurança não conseguem observar diretamente as intenções de um atacante. Investidores possuem informações diferentes. Atores políticos e militares podem transmitir sinais deliberadamente enganosos.
A realidade mantém algumas cartas viradas para baixo.
De Quantas Maneiras Podemos Embaralhar um Baralho?
Um baralho comum de 52 cartas pode ser organizado de
52! ≈ 8,07 × 10⁶⁷
maneiras diferentes.
Se cada embaralhamento fosse perfeitamente aleatório, a probabilidade de obter uma ordem específica, previamente determinada, seria de apenas 1 em 52!. Em média, seriam necessários cerca de 8 × 1067 embaralhamentos para chegar exatamente a essa configuração.
Mesmo realizando um bilhão de embaralhamentos por segundo, o tempo médio de espera seria de aproximadamente 2,6 × 1051 anos — incomparavelmente maior do que a idade do Universo.
O ponto notável não é apenas que o pôquer possui um número gigantesco de distribuições possíveis. Ele combina essa explosão combinatória com algo ainda mais difícil para um agente inteligente: parte da informação é deliberadamente mantida oculta.
Uma Máquina Pode Blefar?
O pôquer acrescenta outra complicação intrigante: o blefe.
Para um ser humano, blefar parece um ato inerentemente psicológico. Sei que minha mão é fraca. Quero que você acredite que ela é forte. Comporto-me deliberadamente de uma maneira que o leve a formar uma crença incorreta.
Isso parece exigir intenção, engano e talvez até algum modelo da mente do outro.
Mas uma máquina jogando pôquer não precisa de nada disso no sentido humano comum desses conceitos.
O blefe pode emergir diretamente da matemática de uma estratégia ótima.
Imagine um jogador que faça uma aposta muito alta apenas quando possui uma mão excepcionalmente forte. A princípio, a estratégia parece razoável, mas contém uma fraqueza fatal: suas ações revelam informação demais.
Assim que os adversários percebem o padrão, uma aposta alta passa a ser quase equivalente a mostrar as cartas.
Para evitar isso, o jogador precisa, às vezes, fazer apostas semelhantes com mãos mais fracas. A ação deixa então de revelar de forma tão confiável aquilo que ele realmente possui.
No extremo oposto, se blefar com frequência excessiva, os adversários poderão explorar esse padrão simplesmente pagando suas apostas mais vezes.
Uma estratégia difícil de explorar exige, portanto, uma combinação controlada de ações. Algumas mãos fortes são jogadas agressivamente. Algumas mãos fracas também precisam, ocasionalmente, ser jogadas da mesma maneira. A combinação exata depende do estado do jogo e do equilíbrio estratégico.
Em termos de teoria dos jogos, o blefe emerge como parte de uma estratégia mista.
O ponto importante é conceitual.
A máquina não precisa sentir que está enganando para produzir um comportamento estrategicamente indistinguível do engano.
Seu blefe pode ser apenas uma probabilidade.
Mas o pôquer contém outra camada de informação oculta.
As cartas podem estar escondidas, mas o jogador continua visível.
Se uma máquina pode aprender a blefar, será que também pode aprender a detectar os sinais sutis que os seres humanos revelam enquanto tentam esconder aquilo que sabem?
A IA Pode Ler uma “Poker Face”?
O pôquer esconde as cartas, mas não o jogador.
Há muito tempo, seres humanos procuram tells — pequenas mudanças no olhar, na postura, nos movimentos, na respiração ou na voz que possam revelar aquilo que o adversário está tentando esconder.
A IA levanta uma pergunta óbvia: uma máquina poderia detectar esses sinais de maneira mais sistemática do que um ser humano?
Os componentes técnicos já existem.
Sistemas de visão computacional conseguem acompanhar movimentos faciais, direção do olhar, piscadas, posição da cabeça e postura. Modelos de áudio conseguem analisar frequência da voz, intensidade, velocidade da fala e prosódia. Sistemas multimodais podem combinar todos esses sinais.
E jogadores de pôquer realmente deixam informação escapar.
Um estudo de 2013 mostrou que observadores conseguiam inferir aspectos da qualidade das mãos de jogadores profissionais a partir dos movimentos dos braços, mesmo quando as informações faciais eram menos úteis.
Até a maneira como as fichas eram movimentadas parecia revelar informações que os jogadores provavelmente preferiam esconder.
A voz também pode importar.
Em experimentos com Texas Hold’em no-limit envolvendo dinheiro real, alterações na frequência da voz, combinadas a sinais fisiológicos, foram associadas a situações de elevado estresse e utilizadas em tentativas de detectar blefes.
A visão computacional também já foi aplicada diretamente a imagens de pôquer. Em 2022, um conjunto de dados com mais de 31 mil imagens faciais retiradas de partidas profissionais foi utilizado para investigar se redes neurais poderiam identificar padrões associados ao blefe.
Mas detectar um padrão não é o mesmo que ler uma mente.
Pesquisas sobre reconhecimento de emoções mostram que expressões faciais não correspondem de maneira simples e universal a emoções específicas. Contexto, cultura, movimentos corporais e hábitos individuais importam.
Uma máquina que detecta uma mudança no olhar encontrou um sinal estatístico — não necessariamente medo, confiança ou engano.
No pôquer, o problema é ainda mais difícil porque bons jogadores tentam deliberadamente suprimir, disfarçar ou até produzir falsos tells.
Um estudo pré-registrado de visão computacional realizado em 2026 encontrou algum poder preditivo em características faciais e de postura dentro de sessões individuais, mas esses padrões não se generalizaram de maneira confiável entre diferentes sessões.
O trabalho ainda é um preprint, portanto suas conclusões devem ser tratadas com cautela. Mas sua implicação é interessante: talvez não exista uma expressão universal que possamos chamar de “a face do blefe”.
Uma IA mais realista aprenderia, portanto, o jogador, e não a expressão.
Ela poderia modelar como determinado adversário pisca, movimenta as fichas, altera a postura ou modifica padrões vocais — e correlacionar esses sinais com as mãos que posteriormente forem reveladas.
Isso se parece menos com leitura de emoções e mais com a descoberta de outra camada de informação imperfeita.
Um sistema futuro que combinasse raciocínio estratégico com modelagem visual e acústica confiável poderia, portanto, enfrentar uma versão ainda mais rica do pôquer:
não apenas as cartas que o jogador esconde, mas também a informação que ele não consegue esconder.
Aviso: O Simpático Jogador à Mesa Pode Ser uma Máquina
Acha que o pôquer online é apenas você, seus instintos e alguns outros seres humanos clicando botões no escuro?
Talvez. Ou talvez um deles tenha um pequeno cúmplice silencioso rodando em segundo plano: uma rede neural observando rostos, analisando vozes, medindo hesitações e alimentando suspeitas em uma máquina que nunca se cansa, nunca fica nervosa e nem precisa blefar como um ser humano.
E esse é exatamente o problema.
Esse tipo de trapaça não precisa se anunciar. Não precisa de olhos robóticos brilhando, cenas dramáticas de hackers ou de um vilão gargalhando em algum porão. Pode permanecer discretamente atrás da tela, invisível, banal e difícil de detectar. Um modelo oculto rodando em segundo plano e, de repente, seu “adversário” pode ser menos um jogador de pôquer do que uma interface humana para um software.
Portanto, se o pôquer online ainda lhe parece uma nobre disputa de coragem, psicologia e habilidade, talvez seja hora de atualizar a mitologia. O jogador mais perigoso da mesa pode não ser aquele com a melhor poker face.
Pode ser aquele que não tem rosto algum, não oferece nenhum tell para ser lido e deixa algumas linhas de Python fazerem o trabalho sujo em segundo plano.
Ainda assim, as IAs de pôquer mais poderosas não precisaram interpretar seres humanos. Seu grande avanço veio de aprender a não serem exploradas.
Ensinando Máquinas a se “Arrepender”
Os pesquisadores que desenvolveram sistemas de IA para pôquer não estavam tentando simplesmente construir modelos psicológicos cada vez melhores de jogadores profissionais.
Havia um objetivo mais poderoso: criar estratégias que os adversários tivessem dificuldade de explorar.
Uma das ideias centrais que surgiram dessa linha de pesquisa foi a minimização de arrependimento contrafactual, ou counterfactual regret minimization — CFR.
A palavra arrependimento parece psicológica, mas aqui possui um significado matemático.
Suponha que um algoritmo se depare repetidamente com determinado tipo de situação e escolha a ação A. Depois, ele pode estimar retrospectivamente o que teria acontecido se, sempre que encontrasse situações semelhantes, tivesse escolhido B.
Se B teria produzido sistematicamente resultados melhores, o algoritmo acumula arrependimento contrafactual por não ter escolhido essa alternativa.
A estratégia futura é então ajustada.
Repetido ao longo de um número imenso de partidas simuladas, esse processo redistribui gradualmente as probabilidades associadas a diferentes ações. Em jogos apropriados de soma zero com dois jogadores, o arrependimento médio pode ser reduzido progressivamente, aproximando a estratégia de um equilíbrio de Nash.
Nesse equilíbrio, nenhum jogador consegue melhorar substancialmente seu resultado simplesmente alterando unilateralmente sua própria estratégia.
Isso é muito diferente de memorizar uma coleção de dicas de pôquer.
O programa aprende algo muito mais próximo da própria estrutura estratégica do jogo.
Polaris foi uma das primeiras demonstrações públicas de quão poderosa essa abordagem poderia se tornar.
E era apenas o começo.
2015: Uma Modalidade de Pôquer é Essencialmente Resolvida
Em 2015, Michael Bowling, Neil Burch, Michael Johanson e Oskari Tammelin publicaram um resultado extraordinário na revista Science.
Seu programa, Cepheus, havia essencialmente resolvido, no sentido fraco, o Texas Hold’em limit heads-up. O avanço baseava-se no CFR+, uma versão altamente eficiente da minimização de arrependimento contrafactual.
A palavra resolvido exige cuidado.
Cepheus não sabia quais cartas seriam distribuídas em seguida. O acaso continuava existindo. Mesmo um jogador com estratégia teoricamente ótima pode perder uma mão, uma sessão inteira ou até uma longa sequência de partidas.
Tampouco todas as modalidades de pôquer haviam sido resolvidas.
O resultado dizia respeito especificamente ao heads-up limit Texas Hold’em entre dois jogadores, em que o tamanho das apostas possíveis é restrito.
O que havia sido alcançado era algo mais sutil: uma estratégia suficientemente próxima da optimalidade segundo a teoria dos jogos para que nenhum adversário pudesse explorá-la a ponto de obter uma vantagem relevante no longo prazo, segundo o critério utilizado pelos pesquisadores.
Era um marco importante.
Os computadores já haviam se tornado dominantes em diversos jogos de informação perfeita. Cepheus mostrou que um jogo competitivo importante contendo informação privada também podia ser levado surpreendentemente perto de sua solução em equilíbrio.
Fora da teoria dos jogos, da ciência da computação e do universo do pôquer, entretanto, relativamente poucas pessoas perceberam o que havia acontecido.
Um ano depois, outro jogo de tabuleiro tornaria a inteligência artificial impossível de ignorar.
2016: AlphaGo Transforma a IA em um Espetáculo Global
Em março de 2016, o AlphaGo, do Google DeepMind, enfrentou Lee Sedol, um dos maiores jogadores de Go de sua geração, em Seul.
AlphaGo venceu por quatro partidas a uma.
Mais de 200 milhões de pessoas acompanharam o confronto em todo o mundo, segundo a DeepMind.
O Go havia sido considerado por muito tempo um desafio formidável para a inteligência artificial. Embora suas regras sejam simples, o espaço de posições possíveis é gigantesco, tornando impraticável uma busca exaustiva convencional. O Go de elite também era associado à intuição, ao reconhecimento de padrões, ao julgamento posicional e a séculos de conhecimento estratégico acumulado.
AlphaGo combinava redes neurais profundas, busca em árvore, aprendizado por reforço e self-play — treinamento por meio de partidas contra versões de si próprio.
Sua vitória, portanto, pareceu diferente de conquistas anteriores das máquinas.
O sistema não estava simplesmente avaliando mais posições por segundo.
Parecia estar descobrindo estratégias.
A segunda partida produziu o episódio mais famoso. A Jogada 37 do AlphaGo pareceu inicialmente altamente incomum para muitos especialistas. Posteriormente revelou-se estrategicamente poderosa e transformou-se em símbolo de uma máquina descobrindo formas de jogar fora das convenções humanas estabelecidas.
AlphaGo transformou os avanços em inteligência artificial em um acontecimento cultural global.
Seu impacto foi particularmente forte na China.
O Go surgiu na China há mais de 2.500 anos e possui profundas associações históricas e intelectuais com a cultura chinesa. Análises contemporâneas descreveram centenas de milhões de espectadores, predominantemente chineses, acompanhando o confronto entre AlphaGo e Lee Sedol.
Posteriormente, a Brookings citou a descrição de Kai-Fu Lee de que a reação desencadeou uma verdadeira “febre de IA” na comunidade tecnológica chinesa. O episódio também tem sido frequentemente descrito como um “momento Sputnik” tecnológico para a China.
Isso não deve ser transformado em uma narrativa causal simplista. A China já possuía capacidades e ambições substanciais em computação, aprendizado de máquina, tecnologia de internet e automação. AlphaGo não criou a estratégia chinesa de inteligência artificial.
Mas tornou extraordinariamente visíveis as implicações da velocidade com que a IA estava avançando.
Em julho de 2017, o Conselho de Estado da China publicou o Plano de Desenvolvimento da Inteligência Artificial de Nova Geração, identificando explicitamente a IA como uma oportunidade estratégica e estabelecendo objetivos nacionais de desenvolvimento até 2030.
AlphaGo ajudou a levar a inteligência artificial de um tema especializado de pesquisa para o centro da consciência pública e da estratégia geopolítica.
Mas o Go ainda diferia do pôquer em um aspecto fundamental.
Todos conseguiam ver o tabuleiro.
O pôquer mantinha suas cartas escondidas.
E, em 2017, os pesquisadores deram outro grande passo na direção desse problema mais difícil.
2017: DeepStack e Libratus Enfrentam o Pôquer No-Limit
No Texas Hold’em limit, o tamanho das apostas é restringido.
No pôquer no-limit, essa limitação desaparece.
Um jogador pode, potencialmente, apostar todas as suas fichas, criando um espaço estratégico muito maior, porque o próprio tamanho da aposta passa a fazer parte do problema.
Em 2017, dois grandes sistemas demonstraram que essa fronteira também podia ser atravessada.
O primeiro foi o DeepStack, desenvolvido por pesquisadores ligados à Universidade de Alberta, à Universidade Charles e à Universidade Técnica Tcheca.
DeepStack combinava teoria dos jogos, decomposição do jogo e uma função de avaliação aprendida. Em vez de tentar resolver toda a árvore do pôquer de uma só vez, o sistema reavaliava continuamente o subproblema estratégico relevante à medida que novas cartas e apostas surgiam, usando uma rede neural para estimar o valor das situações futuras que não eram exploradas até o fim.
Contra jogadores profissionais, DeepStack alcançou desempenho vencedor estatisticamente significativo em 44 mil mãos de Texas Hold’em no-limit heads-up.
Praticamente ao mesmo tempo, os pesquisadores Noam Brown e Tuomas Sandholm, da Carnegie Mellon University, desenvolveram outro sistema:
Libratus.
Libratus utilizava uma grande estratégia geral calculada previamente, refinava sub-jogos específicos durante a partida e incorporava mecanismos para identificar e corrigir possíveis fraquezas na própria estratégia.
Em seguida, enfrentou quatro jogadores profissionais especializados em 120 mil mãos de Texas Hold’em no-limit heads-up.
Os humanos perderam.
A essa altura, a velha pergunta — se computadores poderiam competir com profissionais de pôquer de elite — começava a perder o interesse.
Podiam.
Mas ainda existia uma limitação importante.
Todos esses resultados de destaque envolviam pôquer entre dois jogadores.
Mesas reais de pôquer frequentemente possuem vários adversários.
E isso muda a matemática de forma significativa.
2019: Pluribus Entra na Mesa
Jogos de soma zero com dois jogadores possuem uma estrutura excepcionalmente elegante.
O ganho de um jogador corresponde à perda do outro, e o raciocínio baseado em equilíbrio de Nash fornece garantias teóricas particularmente fortes.
Adicione mais jogadores, e essa simplicidade desaparece.
Uma decisão pode beneficiar um adversário enquanto prejudica outro. Uma resposta estrategicamente útil contra determinado jogador pode alterar os incentivos de todos os demais. As garantias de equilíbrio que tornam o caso de dois jogadores tão atraente não se transferem de maneira simples.
O pôquer multiplayer permaneceu, portanto, um desafio substancial.
Então surgiu o Pluribus.
Novamente desenvolvido por Noam Brown e Tuomas Sandholm, por meio da Carnegie Mellon University e do Facebook AI, Pluribus enfrentou o Texas Hold’em no-limit com seis jogadores.
O sistema dependia fortemente de self-play. Em vez de simplesmente absorver uma enciclopédia canônica da estratégia humana de pôquer, ele melhorava jogando repetidamente contra versões de si próprio.
Quando testado contra profissionais de elite, Pluribus alcançou desempenho super-humano nas condições experimentais.
A IA do pôquer havia chegado à mesa multiplayer.
E algo mais havia se tornado impossível de ignorar.
As máquinas não estavam necessariamente reproduzindo os hábitos estratégicos desenvolvidos pelos seres humanos.
Elas podiam descobrir outros.
Tamanhos de aposta pouco convencionais e padrões incomuns podiam surgir porque o processo de otimização não tinha qualquer obrigação de respeitar tradição, elegância, moda, intimidação ou intuição humana.
Havia apenas o objetivo.
Depois, os seres humanos podiam estudar aquilo que a máquina havia descoberto.
Esse se tornou um dos padrões recorrentes da inteligência artificial moderna. Um sistema não precisa superar os humanos aprendendo a nos imitar com maior fidelidade.
Às vezes, ele se torna superior justamente porque não herda todos os nossos hábitos.
O Pôquer Nunca Foi Apenas Sobre Pôquer
Seria fácil contar essa história como uma sucessão familiar de derrotas humanas:
Kasparov perde no xadrez. Profissionais de pôquer perdem para algoritmos. Lee Sedol perde no Go. Mais um domínio da expertise humana cai diante das máquinas.
Esse enquadramento é dramático.
Mas cientificamente superficial.
A questão importante não é saber se uma máquina consegue humilhar mais um campeão.
A questão importante é que tipo de inteligência o problema exige.
O pôquer é particularmente valioso porque formaliza uma situação encontrada por toda parte fora dos jogos: vários agentes tomam decisões enquanto possuem informações diferentes e incentivos diferentes.
Considere um leilão.
Os participantes possuem avaliações privadas.
Considere uma negociação.
Nenhum dos lados normalmente revela o acordo mínimo que estaria disposto a aceitar.
Considere a cibersegurança.
Defensor e atacante tentam continuamente inferir as intenções um do outro a partir de evidências incompletas, enquanto ocultam as próprias capacidades.
Considere os mercados.
Os participantes agem com informações assimétricas e expectativas sobre como os demais reagirão.
Em todos esses casos, o agente precisa agir sem conhecer completamente o estado do mundo.
O pôquer é útil porque transforma esse problema em um ambiente experimental precisamente especificado.
As regras são conhecidas. Os resultados são mensuráveis. A assimetria de informação é explícita. O engano estratégico é permitido.
As cartas são apenas o equipamento de laboratório.
O verdadeiro objeto de estudo é a incerteza.
Não Existe uma Linha Reta do Deep Blue ao ChatGPT
Da perspectiva da atual explosão da IA generativa, é tentador traçar uma história simples:
Deep Blue → IA no pôquer → AlphaGo → ChatGPT.
Como história cultural, essa sequência captura algo real. Cada um desses sistemas alterou as expectativas públicas sobre aquilo que máquinas poderiam fazer.
Como história técnica, porém, ela é enganosa.
Esses sistemas surgiram de tradições de pesquisa diferentes e resolveram problemas diferentes.
Deep Blue dependia fortemente de busca computacional, funções de avaliação especializadas, enorme poder de processamento e conhecimento de xadrez projetado por especialistas.
Cepheus e Libratus emergiram principalmente da teoria computacional dos jogos, abstração, otimização, busca, self-play e minimização de arrependimento.
AlphaGo combinou redes neurais profundas, busca em árvore, aprendizado por reforço e self-play.
Os grandes modelos de linguagem modernos surgiram principalmente de outra linhagem: modelagem neural de sequências, arquiteturas Transformer, pré-treinamento em larga escala, conjuntos de dados gigantescos e recursos computacionais cada vez maiores.
Essas histórias se cruzam.
Técnicas migram entre áreas.
Aprendizado por reforço, busca, self-play, aprendizado de representações e otimização aparecem cada vez mais em combinações híbridas.
Mas Cepheus não era um chatbot imaturo.
AlphaGo não era um modelo de linguagem primitivo.
Pluribus resolvia um problema fundamentalmente diferente daquele enfrentado pelo ChatGPT.
Não existe uma única escada chamada “inteligência” pela qual todos os sistemas de IA simplesmente sobem.
Problemas diferentes expõem componentes diferentes daquilo que chamamos, de maneira bastante ampla, de comportamento inteligente.
E o pôquer revela um aspecto especialmente estranho:
um comportamento que se parece com engano sem que precisemos estabelecer se a máquina compreende o que é enganar.
É nesse ponto que saímos da teoria dos jogos e entramos na filosofia.
O Quarto Chinês na Mesa de Pôquer
Em 1980, o filósofo John Searle apresentou um dos experimentos mentais mais famosos da filosofia da inteligência artificial: o Quarto Chinês.
Imagine uma pessoa que não compreende chinês trancada em uma sala.
Mensagens escritas em chinês entram nessa sala. A pessoa possui instruções detalhadas, escritas em uma língua que ela entende, explicando como manipular aqueles símbolos desconhecidos e quais símbolos deve devolver como resposta.
Seguindo essas regras com precisão suficiente, ela pode produzir respostas tão convincentes que os falantes de chinês do lado de fora concluem que quem está dentro da sala compreende a língua.
Mas, argumenta Searle, essa pessoa não compreende chinês.
Ela manipula sintaxe sem possuir a semântica correspondente.
Searle utilizou o experimento mental para desafiar aquilo que chamou de IA Forte: a afirmação de que executar o programa de computador apropriado seria, por si só, suficiente para constituir compreensão genuína.
O argumento gerou inúmeras críticas e contra-argumentos e continua intensamente debatido na filosofia da mente e nas ciências cognitivas. Ele não deve ser tratado como prova de que máquinas são incapazes de compreender.
Sua relevância para o pôquer, portanto, não está em resolver a questão.
Está em revelar uma distinção que o pôquer torna particularmente clara:
comportamento e compreensão não são a mesma pergunta.
Considere a máquina que blefa.
Ela pode apostar exatamente na frequência correta.
Pode inferir o conjunto de mãos possíveis do adversário.
Pode explorar fraquezas sistemáticas na estratégia desse adversário.
Pode responder a um aumento de aposta exatamente como faria um jogador de elite.
Seu comportamento à mesa pode ser indistinguível de uma forma sofisticada de engano estratégico.
Mas a máquina sabe que está blefando?
Ela compreende o conceito de engano?
Possui algo comparável às noções humanas de risco, incerteza, intimidação, confiança ou medo?
A teoria dos jogos não precisa responder a essas perguntas.
Para determinar se a estratégia funciona, basta o comportamento.
Isso produz uma versão do problema do Quarto Chinês aplicada ao pôquer.
Do lado de fora da sala — ou do outro lado da mesa — observamos ações e inferimos inteligência, intenção e talvez até compreensão.
Mas um comportamento bem-sucedido, por si só, talvez não nos diga o que existe por trás dele.
Essa distinção tornou-se ainda mais provocadora na era da IA generativa, em que máquinas produzem rotineiramente comportamentos linguísticos que convidam os seres humanos a atribuir-lhes intenção, crenças, personalidade e compreensão.
O pôquer encontrou uma versão mais restrita desse problema muito antes.
Uma máquina não precisava compreender o blefe como um ser humano para blefar melhor do que muitos seres humanos.
Talvez inteligência e compreensão se sobreponham menos perfeitamente do que nossa intuição sugere.
Ou talvez nossos testes simplesmente sejam melhores para medir comportamento competente do que compreensão subjetiva.
O pôquer não pode decidir entre essas possibilidades.
Ele apenas torna a questão difícil de ignorar.
De Construir IA para o Pôquer a Tentar Mantê-la Fora do Pôquer
Então a história ganhou uma ironia.
Durante décadas, pesquisadores perguntaram:
Conseguimos construir uma máquina boa o suficiente para sentar-se à mesa com jogadores profissionais?
Hoje, o pôquer online enfrenta quase o problema oposto:
Como podemos saber se o jogador do outro lado da mesa é realmente humano?
Os solvers modernos de pôquer conseguem analisar situações estrategicamente complexas em níveis inimagináveis para os jogadores comuns na época em que Polaris surgiu.
Usadas fora da mesa, essas ferramentas podem ser poderosos instrumentos de treinamento.
Usadas secretamente durante uma partida em andamento, criam um problema fundamentalmente diferente.
Um bot pode automatizar parcial ou completamente o jogo.
A chamada assistência em tempo real, ou RTA (real-time assistance), pode fornecer ao jogador humano recomendações geradas por computador enquanto a mão ainda está sendo disputada.
As principais plataformas de pôquer proíbem explicitamente esse tipo de assistência.
Os termos atuais do PokerStars proíbem ferramentas, incluindo IA e bots, que eliminem ou reduzam a tomada de decisão genuinamente humana, além de sistemas que forneçam conselhos em tempo real e determinados cálculos avançados durante a partida.
A política atual de Segurança e Ecologia da GGPoker, datada de 13 de março de 2026, também proíbe explicitamente RTA, bots, solvers, tabelas estratégicas e outras formas de assistência externa utilizadas durante o jogo. Entre as possíveis penalidades declaradas estão banimento permanente e confisco de fundos.
Isso não deve ser convertido na afirmação abrangente de que “usar IA no pôquer é ilegal”.
Isso depende da jurisdição, das leis sobre jogos de azar, das obrigações contratuais e da natureza específica da conduta.
O problema mais preciso é a integridade competitiva.
Se o jogo é apresentado como uma competição entre seres humanos tomando suas próprias decisões, a assistência oculta de uma máquina altera a natureza da competição.
O círculo histórico está quase completo.
Pesquisadores primeiro desenvolveram IA para descobrir se uma máquina poderia derrotar jogadores de pôquer.
Agora, operadores de pôquer precisam desenvolver métodos tecnológicos e estatísticos para detectar jogadores que talvez estejam secretamente recorrendo a máquinas.
O adversário tornou-se invisível.
O Jogo Depois do Jogo
A história da IA no pôquer é, portanto, muito mais do que outro capítulo da longa competição entre seres humanos e máquinas.
Deep Blue mostrou que uma busca computacional gigantesca poderia derrotar o melhor jogador do mundo em um jogo de informação perfeita.
Cepheus demonstrou quão perto as máquinas poderiam chegar da optimalidade segundo a teoria dos jogos quando informações cruciais estavam ocultas.
AlphaGo combinou aprendizado, busca e self-play para derrotar um dos maiores jogadores de Go da história, transformando a inteligência artificial em um espetáculo global e contribuindo para um extraordinário aumento do interesse pela IA na China.
DeepStack e Libratus levaram a estratégia de máquina ao Texas Hold’em no-limit heads-up.
Pluribus levou essa fronteira à mesa multiplayer.
Juntos, esses sistemas ilustram caminhos diferentes para aquilo que reconhecemos como comportamento inteligente.
A contribuição particular do pôquer está no fato de que o agente precisa operar enquanto a realidade permanece parcialmente oculta. Ele precisa raciocinar sobre possibilidades, inferir estados escondidos, evitar tornar-se explorável, antecipar outros agentes estratégicos e, em certos momentos, realizar ações cuja eficácia depende precisamente de esconder aquilo que sabe.
Isso se aproxima muito mais da estrutura de inúmeras decisões reais do que um tabuleiro de xadrez completamente visível.
Não porque a vida seja um cassino.
Mas porque a vida raramente mostra todas as cartas.
A pergunta original, portanto, já foi em grande parte respondida:
Uma máquina pode blefar?
Sim.
Mais precisamente, uma máquina pode descobrir que proteger informação privada exige ações operacionalmente indistinguíveis de um blefe.
Ela não precisa de uma expressão impassível porque não possui rosto.
Não precisa de coragem porque não teme perder o pote.
Não precisa se sentir enganadora para que um comportamento semelhante ao engano emerja da otimização.
E o Quarto Chinês nos lembra que devemos ter cuidado com a inferência seguinte.
De um comportamento bem-sucedido, podemos concluir que o comportamento é bem-sucedido.
Se a máquina compreende aquilo que está fazendo é uma pergunta diferente — e muito mais difícil.
Durante décadas, esse problema filosófico poderia ser formulado assim:
Se uma máquina se comporta de maneira inteligente, existe compreensão genuína lá dentro?
O pôquer online produziu uma inversão quase cômica dessa questão.
O problema imediato já nem sequer é filosófico:
Existe sequer um ser humano lá dentro?
Durante décadas, pesquisadores lutaram para construir uma máquina inteligente o suficiente para sentar-se a uma mesa de pôquer.
Hoje, a questão já não é se a IA consegue derrotar seres humanos no pôquer, mas se os seres humanos ainda podem ter certeza de que estão jogando contra outros seres humanos.
Referências e Leituras Complementares
Conteúdo Relacionado no AI-Talks.org
- Teoria de Jogos
- A Máquina Inteligente Realmente Sabe O Que Está Fazendo?
- O Jogo do Ultimato: Justiça, Razão e IA
- Por Que Toda Decisão Inteligente Começa Antes da Certeza
- Multi-Armed Bandit Clássico: Aprender Sob Incerteza
- O Índice de Gittins: Um dos Algoritmos Mais Elegantes Já Criados
- Quando o Mundo se Recusa a Ficar Parado: dos Restless Bandits à Inteligência Adaptativa
Barrett, Lisa Feldman, Ralph Adolphs, Stacy Marsella, Aleix M. Martinez, and Seth D. Pollak. “Emotional Expressions Reconsidered: Challenges to Inferring Emotion from Human Facial Movements.” Psychological Science in the Public Interest 20, no. 1 (2019): 1–68.
Bowling, Michael, Neil Burch, Michael Johanson, and Oskari Tammelin. “Heads-Up Limit Hold’em Poker Is Solved.” Science 347, no. 6218 (2015): 145–149.
Brown, Noam, and Tuomas Sandholm. “Superhuman AI for Heads-Up No-Limit Poker: Libratus Beats Top Professionals.” Science 359, no. 6374 (2018): 418–424.
Brown, Noam, and Tuomas Sandholm. “Superhuman AI for Multiplayer Poker.” Science 365, no. 6456 (2019): 885–890.
Choi, Minwoo. MediaPipe and DINOv2 Representations for Hand-Strength Prediction in Broadcast Poker. Preprint, 2026.
Feinland, Joshua, Jacob Barkovitch, David Lee, Andrew Kaforey, and Umur A. Ciftci. “Poker Bluff Detection Dataset Based on Facial Analysis.” In Image Analysis and Processing – ICIAP 2022, 400–410. Lecture Notes in Computer Science 13233. Cham: Springer, 2022.
George, S. M., and P. M. Ilyas. “A Review on Speech Emotion Recognition: A Survey, Recent Advances, Challenges, and the Influence of Noise.” Neurocomputing 568 (2024): 127015.
Moravčík, Matej, Martin Schmid, Neil Burch, Viliam Lisý, Dustin Morrill, Nolan Bard, Trevor Davis, Kevin Waugh, Michael Johanson, and Michael Bowling. “DeepStack: Expert-Level Artificial Intelligence in Heads-Up No-Limit Poker.” Science 356, no. 6337 (2017): 508–513.
Searle, John R. “Minds, Brains, and Programs.” Behavioral and Brain Sciences 3, no. 3 (1980): 417–424.
Silver, David, Aja Huang, Chris J. Maddison, et al. “Mastering the Game of Go with Deep Neural Networks and Tree Search.” Nature 529 (2016): 484–489.
Slepian, Michael L., Steven G. Young, Abraham M. Rutchick, and Nalini Ambady. “Quality of Professional Players’ Poker Hands Is Perceived Accurately from Arm Motions.” Psychological Science 24, no. 11 (2013): 2335–2338.
State Council of the People’s Republic of China. Plan for Development of the New Generation of Artificial Intelligence. State Council Gazette, no. 22, 2017.
Sung, Michael, and Alex Pentland. “Stress and Lie Detection through Non-Invasive Physiological Sensing.” International Journal of Biomedical Soft Computing and Human Sciences 14, no. 2 (2009): 111–118.
University of Alberta Computer Poker Research Group. The First Man-Machine Poker Championship. 2007.
University of Alberta Computer Poker Research Group. The Second Man-Machine Poker Competition. 2008.
Zhang, S., Y. Yang, C. Chen, X. Zhang, Q. Leng, and X. Zhao. “Deep Learning-Based Multimodal Emotion Recognition from Audio, Visual, and Text Modalities: A Systematic Review of Recent Advancements and Future Prospects.” Expert Systems with Applications 237 (2024): 121692.
Maurício Veloso Brant Pinheiro, PhD
Professor of Physics, Federal University of Minas Gerais (UFMG)
Founder, Author and Editor, AI-Talks.org
About Us
Editorial transparency note: This article, as with all articles published on this site, was conceived, directed, written, and reviewed by Prof. Maurício Veloso Brant Pinheiro. Artificial intelligence was used as an assistant for editorial refinement, formatting, image generation, SEO metadata, and publication workflow.

Copyright 2026 AI-Talks.org