No sábado, a AlphaGo derrotou Lee Sedol pela terceira vez consecutiva, vencendo um encontro de cinco jogos contra um dos jogadores de Go mais fortes do mundo e ultrapassando um limite que muitos investigadores de inteligência artificial acreditavam estar a anos de distância.

Lee desistiu após 176 lances em Seul, dando ao programa desenvolvido pela unidade DeepMind da Google uma vantagem insuperável de 3-0 com duas partidas restantes. O resultado é mais do que apenas mais uma vitória de uma máquina num jogo de tabuleiro. O enorme número de posições possíveis no Go e a sua dependência do julgamento sobre a forma, influência e equilíbrio a longo prazo resistiram às técnicas de força bruta que conquistaram o xadrez.

A Reuters noticiou a partir de Seul que a vitória surpreendeu até os criadores do AlphaGo e levou Lee a pedir desculpa pelo que chamou de performance sem poder. O campeão sul-coreano, de 33 anos, conta com 18 títulos internacionais e entrou na partida confiante de que a experiência e a intuição humanas revelariam as limitações do software.

Um tabuleiro de Go tem 19 linhas por 19 linhas, criando 361 posições possíveis para o lance inicial e um espaço astronómico de configurações posteriores. Ao contrário do xadrez, o jogo não oferece uma contagem simples de peças para avaliar quem está em vantagem. Um grupo de pedras pode estar vivo, vulnerável, influente ou descartável, dependendo dos desenvolvimentos em todo o tabuleiro. Os jogadores fortes descrevem frequentemente as suas escolhas como intuitivas, pois um cálculo exaustivo é impossível.

Isto fez do Go um teste excepcionalmente exigente para a computação. Os sistemas tradicionais de jogos de tabuleiro pesquisam uma árvore de movimentos possíveis e pontuam as posições resultantes. No Go, a árvore expande-se muito rapidamente e as posições são muito difíceis de avaliar com precisão. Os programas tinham melhorado através de métodos de Monte Carlo — amostrando muitas sequelas possíveis — mas até há pouco tempo não conseguiam derrotar os melhores profissionais sem uma vantagem.

O AlphaGo combina a busca com o julgamento aprendido. O sistema descrito no artigo da DeepMind publicado em janeiro na revista Nature utiliza uma "rede de políticas" para selecionar movimentos promissores e uma "rede de valor" para estimar a probabilidade de vitória a partir de uma determinada posição. Estas redes restringem a pesquisa, permitindo que o programa gaste computação em linhas de jogada que a experiência lhe ensinou serem plausíveis.

A experiência decorreu em duas etapas. Em primeiro lugar, o AlphaGo aprendeu padrões a partir de partidas gravadas jogadas por jogadores humanos experientes. Depois, jogou milhões de jogos contra versões de si mesmo, usando a aprendizagem por reforço para melhorar com vitórias e derrotas. O método permite-lhe descobrir estratégias eficazes mesmo quando não se assemelham ao jogo profissional convencional.

Três jogos alargam as evidências

A primeira partida mostrou que o AlphaGo era capaz de suportar a pressão de um confronto ao vivo contra um campeão de 9 dan. Lee desistiu ao fim de aproximadamente três horas e meia. A notícia da Reuters sobre a partida de abertura, na quarta-feira, referiu que Lee detinha as pedras negras e que dezenas de milhares de pessoas assistiram à transmissão em direto online enquanto a máquina encontrava repetidamente as respostas corretas.

A segunda partida foi mais perturbadora para os profissionais, pois o AlphaGo apresentou jogadas que inicialmente pareceram questionáveis, mas que posteriormente se revelaram poderosas. Um golpe de ombro no início da partida, executado na quinta linha, surpreendeu os comentadores habituados aos princípios estabelecidos de abertura. A análise da Wired sobre a segunda partida descreveu o jogo do programa como criativo, e não meramente preciso, uma distinção importante para um sistema frequentemente retratado como uma calculadora.

A terceira partida de sábado testou uma fraqueza diferente. Lee procurou complicações e iniciou uma luta de ko, uma batalha tática recorrente na qual os jogadores têm de responder a ameaças noutras partes do tabuleiro. Estas posições exigem julgamento global e podem gerar sequências longas e ramificadas. O AlphaGo manteve o controlo, simplificou onde era vantajoso e forçou a desistência de Lee.

O relato da Wired sobre a partida decisiva enfatizou que o programa não só sobreviveu à complexidade tática; superou-a, mantendo uma posição geral favorável. Este desempenho enfraquece a teoria de que um campeão humano poderia derrotar o sistema levando o jogo à desordem.

A intuição das máquinas é estatística, mas ainda assim poderosa

Chamar o AlphaGo de intuitivo não significa que ele pense ou viva o jogo como uma pessoa. As suas redes codificam relações estatísticas entre as posições no tabuleiro, os movimentos e os resultados. Não atribui significado cultural ao Go, não sente pressão de um adversário nem compreende porque é que os espectadores o consideram um movimento bonito.

Contudo, esta distinção não torna as suas decisões menos consequentes. A perícia humana depende também do reconhecimento de padrões construído através da exposição repetida, embora esteja integrada na linguagem, na emoção, na experiência corporal e no raciocínio consciente. O AlphaGo demonstra que um sistema mais restrito pode reproduzir uma parte crucial do julgamento especializado com precisão suficiente para superar um mestre num domínio onde as regras explícitas não especificam uma boa estratégia.

pela Google antes do início do jogo apresentava o confronto como o desafio máximo para um programa que já tinha derrotado o campeão europeu Fan Hui por cinco jogos a zero. Lee representava um nível muito mais elevado. Vencer os três primeiros jogos fornece, portanto, evidências de que o método é aplicável a adversários diferentes dos utilizados para validar a investigação original.

O objetivo do sistema também difere subtilmente do desejo humano de dominar o tabuleiro. O AlphaGo escolhe jogadas que maximizam a sua probabilidade estimada de vitória, e não a magnitude da sua vantagem final. Uma jogada cautelosa que preserve uma vantagem pequena, mas segura, pode ser preferível a uma jogada agressiva que ofereça mais pontos com maior risco. Isto pode fazer com que o seu jogo pareça conservador num momento e surpreendentemente pouco convencional no seguinte.

Dos jogos à aprendizagem de propósito geral

A principal alegação da DeepMind é que as técnicas por detrás do AlphaGo podem resolver problemas em que as decisões úteis não podem ser totalmente programadas antecipadamente. As redes neuronais já são utilizadas em sistemas de reconhecimento de fala, classificação de imagens e recomendação. A aprendizagem por reforço oferece uma forma de o software melhorar através do feedback, em vez de depender apenas de exemplos rotulados.

O jogo de Go continua a ser um ambiente delimitado: as regras são claras, cada movimento é visível e o sucesso é definido pela vitória. O diagnóstico médico, a robótica, a gestão de energia e a investigação científica envolvem dados incertos, objetivos variáveis ​​e consequências que não podem ser reduzidas a uma pontuação. O AlphaGo não prova que um único sistema possa passar diretamente de um tabuleiro para estas tarefas.

Contudo, demonstra que uma combinação de representações aprendidas, experiência simulada e busca seletiva pode lidar com um problema que antes se acreditava exigir intuição exclusivamente humana. A reportagem do The Guardian após o Jogo Um captou a comparação histórica imediata com o Deep Blue da IBM, mas o avanço técnico aqui é diferente: o AlphaGo depende menos da enumeração de possibilidades e mais da aprendizagem de quais as possibilidades que importam.

Faltam dois jogos, e Lee afirmou que deseja pelo menos uma vitória. O resultado poderá revelar vulnerabilidades no programa ou outros exemplos de estratégias incomuns. O resultado principal, porém, já está garantido. Uma máquina derrotou um humano de elite numa competição que exigia julgamento num contexto de complexidade avassaladora, e fê-lo não por acaso, mas três vezes consecutivas.