O AlphaGo conquistou uma vitória por 4-1 sobre Lee Sedol na terça-feira, recuperando de um erro inicial na partida final e derrotando um dos jogadores de Go mais fortes do mundo num jogo que demonstrou tanto o alcance da aprendizagem automática moderna como o valor de a expor a um adversário humano criativo.
O programa desenvolvido pela unidade DeepMind da Google tinha garantido a série ao vencer os três primeiros jogos. Lee conquistou então uma extraordinária vitória na quarta partida, forçando a AlphaGo a cometer uma série de erros antes de a máquina recuperar e vencer uma tensa quinta partida. O resultado é mais revelador do que teria sido uma vitória por 3-0: o AlphaGo provou ser dominante em diversas situações, mas não invulnerável.
A Reuters noticiou que o resultado final foi definido após um quinto jogo, no qual Lee aproveitou um erro inicial do adversário antes de o AlphaGo retomar a iniciativa. Todas as cinco partidas foram disputadas em Seul, em condições profissionais, com um prémio de 1 milhão de dólares e transmissão em direto para todo o mundo.
Quatro vitórias comprovam mais do que força tática
O jogo de Go é visto há muito tempo como uma fronteira para a inteligência artificial, uma vez que resiste a cálculos exaustivos. O seu tabuleiro de 19 por 19 produz sequências de movimentos muito mais plausíveis do que até os computadores poderosos conseguem enumerar, e avaliar uma posição exige discernimento sobre influência, território, vida e morte, que não pode ser reduzido à contagem de peças.
O AlphaGo ultrapassa estas limitações aprendendo quais as posições e movimentos que merecem atenção. A arquitetura descrita no artigo de investigação da DeepMind na Nature combina redes de políticas, que classificam movimentos promissores, com uma rede de valor que estima a probabilidade de uma posição gerar uma vitória. A pesquisa em árvore de Monte Carlo examina então as variações selecionadas, em vez de tentar calcular tudo.
As redes aprenderam primeiro com partidas de jogadores humanos experientes e depois melhoraram através de repetidas partidas contra si próprias. Esta segunda etapa é importante porque o software não se limita a imitar as convenções. Consegue descobrir jogadas que os profissionais raramente escolhem, avaliar as suas consequências através de experiência simulada e reter estratégias que aumentam a probabilidade de vitória.
A partida demonstrou a eficácia do método em vários testes. O AlphaGo venceu jogos estratégicos tranquilos, lidou com complexidades táticas e, na final, recuperou de uma desvantagem. O relatório da Nature sobre a série completa considerou o resultado de 4-1 como uma confirmação de que a vitória anterior sobre o campeão europeu Fan Hui não representava o limite da capacidade do sistema.
A quarta vitória de Lee torna-se um evento diagnóstico
Após três derrotas, Lee venceu o quarto jogo de domingo jogando com as peças brancas. O seu lance 78 — uma cunha no centro da posição do AlphaGo — surpreendeu inicialmente os comentadores e parece ter prejudicado a avaliação do programa. O AlphaGo reagiu mal, agravou o problema e acabou por desistir.
O relato da Time sobre a vitória de Lee descreveu o triunfo como uma vindicação para um campeão que entrou na partida prevendo um claro sucesso, mas que se deparou com um jogo mais forte e imprevisível do que esperava. Para os investigadores, a importância reside menos em restaurar uma pontuação humana do que em encontrar a posição em que o julgamento aprendido pelo sistema falhou.
Os sistemas de aprendizagem automática podem falhar de forma diferente do software convencional. Um programa escrito manualmente comporta-se frequentemente de forma incorreta porque uma regra ou implementação está errada. Uma rede neural pode ter um desempenho excecional em distribuições familiares de exemplos e, em seguida, fazer um mau julgamento quando se depara com um padrão invulgar. A sua representação interna é distribuída por muitos parâmetros aprendidos, tornando difícil determinar a razão precisa para um erro.
A jogada de Lee parece ter gerado este tipo de surpresa. Uma vez que a posição do AlphaGo se deteriorou, as escolhas posteriores pareceram incoerentes para os especialistas, sugerindo que as estimativas de valor que orientavam a sua procura se tinham tornado pouco fiáveis. A análise da Wired sobre o Jogo Quatro observou que a máquina cometeu uma série de erros após a inesperada jogada em cunha, oferecendo a evidência mais clara da partida de que as jogadas criativas poderiam levá-la a um julgamento menos criterioso.
O jogo final testa a recuperação
A partida de terça-feira ofereceu uma lição complementar. O AlphaGo cometeu um erro notável logo no início e ficou para trás, mas não se desmoronou. Ganhou influência no centro, defendeu-se dos ataques de Lee e recuperou gradualmente até que este desistiu após aproximadamente cinco horas.
A reportagem da Wired sobre a partida final enfatizou a reviravolta. Um sistema treinado para maximizar a probabilidade de vitória não tem de jogar de forma impecável; necessita de identificar um caminho a partir da posição em que se encontra. A recuperação contra um adversário de elite sugere que a força do AlphaGo não se limita a executar padrões preferenciais a partir de uma vantagem inicial.
Ao mesmo tempo, o resultado não deve ser confundido com adaptação durante a partida no sentido humano. A DeepMind não retreinou o AlphaGo entre combates para incorporar o que Lee tinha mostrado. A versão jogada na terça-feira era essencialmente o mesmo sistema. Lee, por outro lado, estudou as tendências do programa, mudou a sua abordagem e pediu para jogar de pretas na final porque considerou este o teste mais difícil.
O relato final do The Guardian descreveu a vitória apertada após a forte abertura de Lee. A partida equilibrada reforça uma ideia mais ampla: considerando cinco confrontos, o AlphaGo foi decisivamente mais forte, mas as partidas individuais permaneceram sensíveis a novidades, erros e escolhas estratégicas.
O que se transfere para além do Conselho de Administração
As técnicas por detrás do AlphaGo têm potencial em todas as áreas onde as decisões envolvem grandes espaços de pesquisa e padrões demasiado complexos para serem especificados manualmente. As redes neuronais já auxiliam no reconhecimento de fala e imagens. A aprendizagem por reforço pode contribuir para a robótica, a gestão de recursos e a descoberta científica, permitindo que os sistemas melhorem através de feedback estruturado.
Mas o Go é um ambiente excecionalmente limpo. Cada ação legal é definida, todas as informações relevantes do tabuleiro são visíveis e o sucesso tem uma medida inequívoca. Os sistemas reais têm de lidar com dados em falta, objetivos conflituantes, valores humanos e condições variáveis. Uma recomendação médica ou uma máquina autónoma não podem simplesmente explorar os erros através de milhões de tentativas de jogo sem consequências.
O relato da Google sobre o desafio apresenta a partida como uma demonstração de sistemas de aprendizagem a confrontar um problema que antes exigia intuição humana. Os jogos corroboram esta afirmação, mas também mostram porque é que os testes devem incluir condições adversas e incomuns. O desempenho mediano pode ocultar pontos fracos que apenas um adversário criativo descobre.
Lee prestou exatamente esse serviço. A sua vitória isolada não diminui o resultado de 4-1; pelo contrário, enriquece cientificamente a conquista. O AlphaGo demonstrou uma capacidade de julgamento estratégico superior à dos programas de jogo anteriores, enquanto o Jogo Quatro expôs uma falha que os seus criadores podem analisar, em vez de apenas especular.
A partida termina, portanto, sem um simples confronto entre a inteligência humana e o cálculo da máquina. O AlphaGo aprendeu com as partidas humanas, aprimorou-se através do auto-jogo e produziu jogadas que ensinaram aos profissionais novas possibilidades. Lee adaptou-se à máquina e descobriu uma fraqueza que não tinha revelado a si própria. O legado mais produtivo é talvez esta troca: sistemas de aprendizagem poderosos desafiados por pessoas capazes de os surpreender.