A Google apresentou o Gemini, uma nova família de modelos de inteligência artificial concebida para processar texto, imagens, áudio, vídeo e código, e está a implementar imediatamente o modelo Gemini Pro, de tamanho médio, no Bard. A empresa afirma que a sua versão maior, o Gemini Ultra, supera o desempenho de topo atual em 30 dos 32 benchmarks académicos amplamente utilizados, embora este modelo permaneça em fase de testes de segurança e avaliação limitada até ao próximo ano.

O lançamento a 6 de dezembro é a resposta técnica mais direta da Google até à data à rápida adoção do GPT-4 e do ChatGPT da OpenAI. Em vez de lançar um único modelo para todas as utilizações, a Google criou três versões: Ultra para as tarefas mais complexas, Pro para uma utilização generalizada na cloud e Nano para uma computação eficiente em dispositivos.

Três modelos são dirigidos a diferentes ambientes computacionais

De acordo com o Google DeepMind, o Gemini foi concebido desde o início como um sistema multimodal, em vez de um modelo de texto com componentes separados adicionados posteriormente. A empresa afirma que esta abordagem permite aos modelos raciocinar sobre combinações de linguagem escrita, imagens, áudio e vídeo, bem como executar tarefas de programação. A descrição do lançamento do Gemini 1.0 pela Google define-o como treinado em larga escala na infraestrutura de Unidades de Processamento de Tensores (TPU) da empresa.

O Gemini Pro é a versão que a maioria dos utilizadores pode experimentar atualmente. A Google disponibilizou uma versão em inglês especialmente otimizada para o Bard em mais de 170 países e territórios. A empresa afirma que a atualização melhora o raciocínio, o planeamento e a compreensão. Um comunicado do Bard informa que o acesso ao Gemini Ultra será disponibilizado posteriormente através de uma experiência mais avançada do Bard, após uma avaliação adicional.

O Gemini Nano é direcionado para dispositivos móveis. A atualização do Google Pixel afirma que o Pixel 8 Pro utiliza o Nano para funcionalidades como o resumo na aplicação Gravador e a Resposta Inteligente no Gboard. A execução de algumas funções de IA generativa localmente pode reduzir a latência, permitir a utilização offline e manter algumas informações no dispositivo em vez de as enviar para um centro de dados remoto.

O Google faz afirmações ambiciosas sobre os seus parâmetros de referência

O aspeto mais impressionante do anúncio é a afirmação da Google de que o Gemini Ultra estabelece novos resultados num conjunto alargado de testes. A empresa afirma que o Ultra supera os resultados de ponta existentes em 30 dos 32 benchmarks utilizados para grandes modelos de linguagem e sistemas multimodais. Reporta uma pontuação de 90% no MMLU, um referencial que abrange 57 áreas, como matemática, física, história, direito, medicina e ética.

Estes resultados devem ser tratados como dados de referência divulgados pela empresa, e não como evidência de utilização pública em larga escala. O Gemini Ultra ainda não está disponível para o público em geral, o que significa que os programadores e investigadores externos não podem reproduzir de forma independente o conjunto completo de alegações numa implementação comum. O Ars Technica referiu que a Google afirma que o Ultra supera os resultados associados ao GPT-4 em muitos testes, mas também enfatizou que as comparações de desempenho entre modelos proprietários podem ser influenciadas por estímulos, métodos de avaliação e acesso ao modelo.

The Guardian noticiou que a Google afirma que o Ultra superou os sistemas concorrentes em 30 dos 32 testes destacados. A empresa reconheceu ainda que as alucinações — respostas falsas ou sem fundamento geradas com base na confiança — continuam a ser um problema de investigação não resolvido. Esta ressalva é importante porque a robustez dos benchmarks não elimina as limitações de fiabilidade que afetaram todos os principais sistemas de IA generativa.

Ultra permanece atrás de um portão de segurança

A Google não está a lançar o seu modelo mais poderoso para todos os utilizadores no lançamento. A empresa afirma que o Gemini Ultra está a ser submetido a testes de segurança externos, avaliação de segurança, ajustes e aprendizagem por reforço com base no feedback humano. Clientes selecionados, programadores e especialistas receberão acesso antecipado antes de um lançamento mais alargado, planeado para o início de 2024.

A abordagem gradual reflete o crescente escrutínio dos sistemas de IA de ponta. A ordem executiva de outubro do presidente Joe Biden exige que os desenvolvedores de determinados modelos altamente capazes forneçam ao governo federal informações sobre os testes de segurança em condições específicas. A Google afirma que pretende cooperar com os esforços governamentais de segurança e está também a discutir a avaliação com o novo Instituto de Segurança de IA do Reino Unido.

De acordo com a empresa, o Gemini Pro estará disponível para programadores e clientes empresariais através do Google AI Studio e da Vertex AI a partir de 13 de dezembro. Esta estratégia de distribuição faz do Gemini não apenas uma atualização de chatbot para o consumidor final, mas uma plataforma tecnológica destinada a competir por software empresarial, computação em nuvem e desenvolvimento de aplicações.

A disputa competitiva estende-se por todo o portfólio de produtos da Google

A Google apresenta vantagens invulgares na distribuição de um novo modelo de infraestrutura, uma vez que controla serviços amplamente utilizados pelos consumidores, como o Android, o Chrome, a Pesquisa e uma importante plataforma na nuvem. A empresa afirma que o Gemini estará eventualmente presente na Pesquisa, nos Anúncios, no Chrome e noutros produtos. As experiências iniciais na Pesquisa reduziram a latência na sua Experiência Generativa de Pesquisa, de acordo com os materiais de lançamento da Google.

Esta abrangência também aumenta a pressão. A Microsoft integrou a tecnologia da OpenAI no Bing, no GitHub e no seu software empresarial, enquanto a OpenAI construiu uma grande base de utilizadores diretos através do ChatGPT. A Google precisa de demonstrar não só que o Gemini tem um bom desempenho em testes controlados, mas também que pode melhorar os produtos utilizados por milhares de milhões de pessoas sem introduzir problemas inaceitáveis ​​de fiabilidade, privacidade ou segurança.

O lançamento inicial cria, portanto, um teste em duas etapas. O Gemini Pro e o Nano já podem começar a recolher provas práticas através de dispositivos Bard e Pixel. O Gemini Ultra, modelo que apresenta as melhores alegações de desempenho da empresa, precisa primeiro de passar por análises internas e externas adicionais.

O anúncio da Google estabelece o Gemini como a arquitetura central de IA da empresa daqui para a frente. Se isto alterará o equilíbrio competitivo dependerá menos de uma única tabela de benchmarks do que do desempenho dos três tamanhos de modelo quando os programadores, as empresas e os consumidores os utilizarem em larga escala. A partir desta semana, iniciou-se este processo para o Pro e o Nano; as alegações mais relevantes relacionadas com o Ultra ainda precisam de ser testadas fora do Google.