A Google apresentou o Gemini, uma nova família de modelos de inteligência artificial concebida para processar texto, imagens, áudio, vídeo e código, e está a implementar imediatamente o modelo Gemini Pro, de tamanho médio, no Bard. A empresa afirma que a sua versão maior, o Gemini Ultra, supera o desempenho de topo atual em 30 dos 32 benchmarks académicos amplamente utilizados, embora este modelo permaneça em fase de testes de segurança e avaliação limitada até ao próximo ano.
O lançamento a 6 de dezembro é a resposta técnica mais direta da Google até à data à rápida adoção do GPT-4 e do ChatGPT da OpenAI. Em vez de lançar um único modelo para todas as utilizações, a Google criou três versões: Ultra para as tarefas mais complexas, Pro para uma utilização generalizada na cloud e Nano para uma computação eficiente em dispositivos.
Três modelos são dirigidos a diferentes ambientes computacionais
De acordo com o Google DeepMind, o Gemini foi concebido desde o início como um sistema multimodal, em vez de um modelo de texto com componentes separados adicionados posteriormente. A empresa afirma que esta abordagem permite aos modelos raciocinar sobre combinações de linguagem escrita, imagens, áudio e vídeo, bem como executar tarefas de programação. A descrição do lançamento do Gemini 1.0 pela Google define-o como treinado em larga escala na infraestrutura de Unidades de Processamento de Tensores (TPU) da empresa.
O Gemini Pro é a versão que a maioria dos utilizadores pode experimentar atualmente. A Google disponibilizou uma versão em inglês especialmente otimizada para o Bard em mais de 170 países e territórios. A empresa afirma que a atualização melhora o raciocínio, o planeamento e a compreensão. Um comunicado do Bard informa que o acesso ao Gemini Ultra será disponibilizado posteriormente através de uma experiência mais avançada do Bard, após uma avaliação adicional.
O Gemini Nano é direcionado para dispositivos móveis. A atualização do Google Pixel afirma que o Pixel 8 Pro utiliza o Nano para funcionalidades como o resumo na aplicação Gravador e a Resposta Inteligente no Gboard. A execução de algumas funções de IA generativa localmente pode reduzir a latência, permitir a utilização offline e manter algumas informações no dispositivo em vez de as enviar para um centro de dados remoto.
O Google faz afirmações ambiciosas sobre os seus parâmetros de referência
O aspeto mais impressionante do anúncio é a afirmação da Google de que o Gemini Ultra estabelece novos resultados num conjunto alargado de testes. A empresa afirma que o Ultra supera os resultados de ponta existentes em 30 dos 32 benchmarks utilizados para grandes modelos de linguagem e sistemas multimodais. Reporta uma pontuação de 90% no MMLU, um referencial que abrange 57 áreas, como matemática, física, história, direito, medicina e ética.
Estes resultados devem ser tratados como dados de referência divulgados pela empresa, e não como evidência de utilização pública em larga escala. O Gemini Ultra ainda não está disponível para o público em geral, o que significa que os programadores e investigadores externos não podem reproduzir de forma independente o conjunto completo de alegações numa implementação comum. O Ars Technica referiu que a Google afirma que o Ultra supera os resultados associados ao GPT-4 em muitos testes, mas também enfatizou que as comparações de desempenho entre modelos proprietários podem ser influenciadas por estímulos, métodos de avaliação e acesso ao modelo.
The Guardian noticiou que a Google afirma que o Ultra superou os sistemas concorrentes em 30 dos 32 testes destacados. A empresa reconheceu ainda que as alucinações — respostas falsas ou sem fundamento geradas com base na confiança — continuam a ser um problema de investigação não resolvido. Esta ressalva é importante porque a robustez dos benchmarks não elimina as limitações de fiabilidade que afetaram todos os principais sistemas de IA generativa.
Ultra permanece atrás de um portão de segurança
A Google não está a lançar o seu modelo mais poderoso para todos os utilizadores no lançamento. A empresa afirma que o Gemini Ultra está a ser submetido a testes de segurança externos, avaliação de segurança, ajustes e aprendizagem por reforço com base no feedback humano. Clientes selecionados, programadores e especialistas receberão acesso antecipado antes de um lançamento mais alargado, planeado para o início de 2024.
A abordagem gradual reflete o crescente escrutínio dos sistemas de IA de ponta. A ordem executiva de outubro do presidente Joe Biden exige que os desenvolvedores de determinados modelos altamente capazes forneçam ao governo federal informações sobre os testes de segurança em condições específicas. A Google afirma que pretende cooperar com os esforços governamentais de segurança e está também a discutir a avaliação com o novo Instituto de Segurança de IA do Reino Unido.
De acordo com a empresa, o Gemini Pro estará disponível para programadores e clientes empresariais através do Google AI Studio e da Vertex AI a partir de 13 de dezembro. Esta estratégia de distribuição faz do Gemini não apenas uma atualização de chatbot para o consumidor final, mas uma plataforma tecnológica destinada a competir por software empresarial, computação em nuvem e desenvolvimento de aplicações.
A disputa competitiva estende-se por todo o portfólio de produtos da Google
A Google apresenta vantagens invulgares na distribuição de um novo modelo de infraestrutura, uma vez que controla serviços amplamente utilizados pelos consumidores, como o Android, o Chrome, a Pesquisa e uma importante plataforma na nuvem. A empresa afirma que o Gemini estará eventualmente presente na Pesquisa, nos Anúncios, no Chrome e noutros produtos. As experiências iniciais na Pesquisa reduziram a latência na sua Experiência Generativa de Pesquisa, de acordo com os materiais de lançamento da Google.
Esta abrangência também aumenta a pressão. A Microsoft integrou a tecnologia da OpenAI no Bing, no GitHub e no seu software empresarial, enquanto a OpenAI construiu uma grande base de utilizadores diretos através do ChatGPT. A Google precisa de demonstrar não só que o Gemini tem um bom desempenho em testes controlados, mas também que pode melhorar os produtos utilizados por milhares de milhões de pessoas sem introduzir problemas inaceitáveis de fiabilidade, privacidade ou segurança.
O lançamento inicial cria, portanto, um teste em duas etapas. O Gemini Pro e o Nano já podem começar a recolher provas práticas através de dispositivos Bard e Pixel. O Gemini Ultra, modelo que apresenta as melhores alegações de desempenho da empresa, precisa primeiro de passar por análises internas e externas adicionais.
O anúncio da Google estabelece o Gemini como a arquitetura central de IA da empresa daqui para a frente. Se isto alterará o equilíbrio competitivo dependerá menos de uma única tabela de benchmarks do que do desempenho dos três tamanhos de modelo quando os programadores, as empresas e os consumidores os utilizarem em larga escala. A partir desta semana, iniciou-se este processo para o Pro e o Nano; as alegações mais relevantes relacionadas com o Ultra ainda precisam de ser testadas fora do Google.