LAS VEGAS — A Google está a expandir a sua estratégia de silício personalizado para centros de dados, indo além dos aceleradores de inteligência artificial, com o lançamento da sua primeira unidade central de processamento (CPU) baseada em Arm, concebida internamente para computação em nuvem de utilização geral. O novo chip, denominado Axion, foi apresentado na terça-feira no Google Cloud Next, à medida que a empresa procura reduzir a dependência dos processadores x86 convencionais e melhorar o desempenho e a eficiência energética das cargas de trabalho que são executadas na sua cloud. A Google afirma que as instâncias Axion oferecerão um desempenho até 30% superior às instâncias de cloud baseadas em Arm de utilização geral mais rápidas atualmente disponíveis e um desempenho até 50% superior, com uma eficiência energética até 60% superior, em comparação com as instâncias x86 de geração atual equivalentes. O anúncio informa que os processadores são construídos com base na arquitectura Neoverse V2 da Arm e suportarão serviços como o Google Compute Engine, Google Kubernetes Engine e Dataproc.

A iniciativa coloca a Google mais diretamente ao lado da Amazon Web Services, que passou anos a expandir os seus processadores Graviton Arm, e da Microsoft, que anunciou o seu próprio CPU Cobalt em 2023. A Reuters noticiou que o lançamento da Google reflete um esforço mais amplo dos maiores fornecedores de cloud para conceber chips à medida para a sua própria infraestrutura, melhorando a rentabilidade e reduzindo a dependência de um pequeno número de fornecedores de semicondutores.

Os CPUs personalizados deixam de ser uma opção de nicho para se tornarem uma estratégia de cloud

Durante décadas, a computação de servidores de uso geral foi dominada pelos processadores x86 da Intel e da AMD. Os designs da Arm ganharam força inicialmente nos dispositivos móveis devido à sua eficiência energética e têm migrado cada vez mais para os data centers. Os fornecedores de cloud estão numa posição privilegiada para acelerar esta transição, uma vez que controlam tanto o parque de hardware como a camada de software oferecida aos clientes. Um cliente de cloud não precisa de comprar um servidor Arm físico; pode escolher um tipo de instância e deixar que o fornecedor faça a gestão da máquina subjacente.

A Google afirma que o Axion irá executar cargas de trabalho já utilizadas internamente por serviços como publicidade no YouTube, BigTable e partes do Google Earth Engine. A empresa planeia uma disponibilidade mais ampla para os clientes ainda este ano. A sua atualização de infraestrutura no Next 2024 posiciona o Axion como parte de um esforço maior para oferecer aos clientes mais opções de processadores para serviços web, aplicações contentorizadas, bases de dados e análise de dados.

A procura por IA está a remodelar toda a infraestrutura de data centers

O Axion chegou juntamente com grandes adições à infraestrutura de IA da Google. A Google Cloud anunciou que o TPU v5p, a sua geração mais poderosa de Unidades de Processamento Tensorial (TPU), já está disponível para o público em geral. Um pod de TPU v5p pode ser escalado para até 8.960 chips e oferece mais do dobro das operações de ponto flutuante e três vezes mais memória de alta largura de banda por chip do que o TPU v4, de acordo com a atualização da Google sobre Hipercomputadores de IA. A empresa está também a integrar GPUs da Nvidia na mesma arquitetura mais ampla, atendendo à procura dos clientes tanto pelos aceleradores proprietários da Google como pelo hardware padrão da Nvidia.

A Google detalhou pela primeira vez o TPU v5p num anúncio, apresentando o chip como infraestrutura para o treino de modelos generativos muito grandes. O marco da disponibilidade geral é importante porque os fornecedores de cloud estão a correr para garantir capacidade computacional suficiente para os clientes cujas cargas de trabalho de IA exigem milhares de aceleradores em execução paralela.

A Gemini aprofunda os serviços de cloud empresarial

A Google aproveitou ainda a conferência para aprofundar a integração dos seus modelos Gemini no Vertex AI, a sua plataforma de aprendizagem automática gerida. O Gemini 1.5 Pro está a entrar em pré-visualização pública com uma janela de contexto de até 1 milhão de tokens, permitindo ao modelo processar grandes quantidades de texto, vídeo, áudio e código num único pedido. A atualização de produtos de IA também destacou novas capacidades de geração de imagens, ferramentas de gestão de modelos e controlos empresariais.

A janela de contexto de 1 milhão de tokens é estrategicamente importante porque as aplicações de IA empresariais têm frequentemente de analisar documentos extensos, repositórios de software, transcrições de chamadas ou ficheiros multimédia. Um contexto maior não garante um melhor raciocínio, mas reduz a necessidade de dividir a informação em muitas etapas de recuperação mais pequenas. A Google está a posicionar esta capacidade como um diferencial em relação aos modelos concorrentes da OpenAI, Anthropic e outros.

Uma cloud verticalmente integrada pode otimizar custos e desempenho

A estratégia da Google assemelha-se cada vez mais a uma pilha de computação em camadas que controla desde o chip até ao modelo. O Axion lida com computação de propósito geral, as TPUs aceleram a aprendizagem automática, os GPUs da Nvidia continuam disponíveis para compatibilidade e o Gemini fornece os principais modelos de IA da empresa. O resumo da apresentação do Google Cloud Next apresenta estes componentes como uma única plataforma, em vez de produtos isolados.

A lógica económica é simples. As empresas de cloud operam enormes centros de dados, pelo que mesmo melhorias modestas no desempenho por watt podem traduzir-se em poupanças significativas nos custos de eletricidade, refrigeração e equipamentos. Os chips proprietários também dão aos fornecedores um maior poder de negociação em relação às aquisições e permitem que o hardware seja otimizado para o seu software. A contrapartida é a compatibilidade com o ecossistema: os clientes têm décadas de software otimizado para x86, e a migração de cargas de trabalho para Arm pode exigir testes ou recompilação.

A corrida aos chips está a transformar-se numa corrida pelas plataformas em nuvem

O Graviton da Amazon, o Cobalt da Microsoft e o Axion da Google mostram que o design dos CPUs está a tornar-se parte da competição na cloud. Ao mesmo tempo, o AWS Trainium e o Inferentia, os TPUs da Google e o acelerador Maia da Microsoft desafiam a suposição de que a Nvidia ou os fornecedores tradicionais de CPUs fornecerão todos os chips importantes nos futuros centros de dados. Nenhum destes processadores proprietários elimina a necessidade de fornecedores externos, mas cada um oferece ao proprietário da cloud mais uma forma de controlar os custos, a capacidade e a diferenciação dos produtos.

Para os clientes, a consequência imediata é uma maior variedade de opções, aliada a uma maior complexidade. As empresas podem otimizar as cargas de trabalho em x86, Arm, GPUs e aceleradores especializados, mas as decisões de arquitetura afetam cada vez mais a portabilidade entre nuvens. Uma carga de trabalho otimizada para um acelerador proprietário pode ser mais barata ou mais rápida numa plataforma, mas torna-se mais difícil de migrar para outra.

Até sábado, o Axion ainda se aproximava da ampla disponibilidade para os clientes, em vez de substituir os processadores de servidor estabelecidos da noite para o dia. Mas o anúncio da Google marca uma mudança estrutural: os maiores fornecedores de cloud do mundo veem cada vez mais o design de semicondutores como uma capacidade essencial da sua plataforma de software. Na era da IA, a concorrência já não se resume a qual o melhor modelo ou qual a cloud que oferece mais serviços. Trata-se também de quem consegue construir a infraestrutura de computação mais eficiente.