A Google decidiu manter offline a capacidade do Gemini de gerar imagens de pessoas após uma semana de críticas sobre resultados historicamente imprecisos e tendenciosos, transformando uma falha na qualidade do produto num teste mais amplo de quão rapidamente as grandes empresas tecnológicas podem implementar IA generativa sem perder o controlo dos sistemas de segurança integrados nos seus modelos. O CEO Sundar Pichai disse aos funcionários na terça-feira que algumas respostas do Gemini eram “completamente inaceitáveis” e afirmou que a empresa iria fazer mudanças estruturais antes de restaurar o recurso.

A controvérsia começou depois de os utilizadores terem publicado exemplos em que o Gemini produzia representações implausíveis de raça e género para questões históricas. A Google reconheceu o problema e suspendeu a geração de imagens de pessoas a 22 de fevereiro. Numa explicação detalhada da empresa, o vice-presidente sénior da Google, Prabhakar Raghavan, disse que o sistema tinha compensado em excesso a diversidade em algumas questões, enquanto se tornava excessivamente cauteloso noutras.

Um ajuste de segurança resultou numa falha de precisão histórica

Os sistemas generativos de geração de imagens são normalmente ajustados para reduzir os resultados estereotipados ou excludentes. A Google afirmou que as medidas de segurança do Gemini visavam evitar a repetição de enviesamentos que apareciam nos sistemas anteriores de geração de imagens, mas a implementação produziu o resultado oposto em alguns contextos históricos. O modelo gerou pessoas que não se enquadravam no período ou no estímulo e, noutros casos, recusou pedidos inócuos.

A Associated Press noticiou que a Google suspendeu temporariamente o recurso após a ampla circulação de exemplos online. A empresa afirmou que iria melhorar a precisão antes de reativar a geração de imagens de pessoas. Esta decisão é importante porque o Gemini não é uma demonstração experimental de investigação; a Google posicionou-o como a identidade visual para o consumidor dos seus produtos de IA generativa mais importantes.

Uma notícia da Reuters republicada pelo Yahoo Finance referia que a pausa ocorreu apenas algumas semanas depois de a Google ter começado a oferecer geração de imagens através do Gemini e pouco depois de a Bard ter sido renomeada Gemini. Esta cronologia condensada ilustra a pressão competitiva que a Google enfrenta na sua corrida contra a Microsoft e a OpenAI em assistentes virtuais para o consumidor, IA empresarial e plataformas para programadores.

Pichai promete mudanças nos processos de lançamento e avaliação

Num memorando interno publicado pela Semafor, Pichai afirmou que as respostas problemáticas em texto e imagem ofenderam os utilizadores e demonstraram parcialidade. Disse que as equipas estavam a "trabalhar incansavelmente" e delineou um conjunto de ações que incluíam mudanças estruturais, diretrizes de produto atualizadas, processos de lançamento melhorados, avaliações mais rigorosas, ampliação das simulações de ataque e recomendações técnicas.

Esta lista é importante porque contextualiza o incidente como algo mais do que uma simples falha no modelo de imagem. Pichai está a indicar que a falha pode estar relacionada com a forma como a Google traduz as capacidades do modelo em produtos para o consumidor: interpretação de prompts, camadas de políticas, filtros de segurança, cobertura de testes e governação de lançamento. Por outras palavras, corrigir o resultado pode exigir uma alteração no processo que lhe permitiu chegar à produção.

A empresa não divulgou uma data precisa para a restauração da geração de imagens de pessoas. Pichai indicou que a Google espera melhorias nas próximas semanas, mas a funcionalidade permanece desativada até sábado. Isto representa um retrocesso significativo para uma empresa que passou fevereiro a acelerar o lançamento público do Gemini.

A pausa ocorre no meio de uma expansão de Gémeos excecionalmente agressiva

A 8 de fevereiro, a Google substituiu formalmente o nome Bard por Gemini e apresentou o Gemini Advanced, baseado no Ultra 1.0, bem como uma aplicação dedicada para Android. Nesse anúncio de lançamento, Pichai descreveu o Gemini como um ecossistema que abrange produtos para o consumidor, APIs, serviços de cloud e ferramentas para programadores, em vez de um único chatbot.

Uma semana depois, a Google anunciou o Gemini 1.5, destacando uma janela de contexto capaz de atingir 1 milhão de tokens numa pré-visualização limitada e processar documentos longos, vídeos, áudios e grandes bases de código. Estes avanços técnicos demonstram que a estratégia subjacente do produto continua em curso, mesmo com uma característica visível para o consumidor em pausa.

Esta tensão está a tornar-se central para a indústria da IA: a capacidade dos modelos está a avançar rapidamente, enquanto as salvaguardas dos produtos continuam a ser difíceis de calibrar. Um sistema pode ser mais capaz no raciocínio, codificação ou análise multimodal e ainda assim falhar porque o ajuste de políticas ou intervenções de segurança distorcem resultados específicos.

A confiança passa a ser um requisito do produto, não uma questão de comunicação

O problema do Google é especialmente delicado porque o negócio principal da empresa baseia-se na recuperação de informação e na confiança do utilizador. O Gemini está a ser integrado em produtos que podem, eventualmente, influenciar as pesquisas, a produtividade, a publicidade e a computação móvel. Se os utilizadores acreditarem que o sistema é tendencioso política ou culturalmente, ou simplesmente não fiável em questões históricas básicas, o problema pode alastrar para além de uma única característica de imagem.

A própria explicação da empresa reconhece que a IA generativa continuará a cometer erros. Raghavan escreveu que as alucinações e os resultados imperfeitos continuam a ser desafios conhecidos e alertou os utilizadores para que não confiem no Gemini para notícias em constante evolução ou tópicos sensíveis sem verificação. Esta admissão é realista, mas também realça a discrepância entre a natureza probabilística da tecnologia e as expectativas depositadas num produto de informação da marca Google.

O objetivo imediato da engenharia é restaurar a geração de imagens de pessoas sem recriar estereótipos ou produzir cenas históricas implausíveis. O objetivo mais abrangente é mais difícil: construir um processo de lançamento capaz de detetar quando uma intervenção de segurança bem-intencionada cria uma forma diferente de distorção. À medida que a Google continua a expandir o Gemini no seu portefólio de produtos, a pausa desta semana serve como um lembrete de que a corrida competitiva não se resume apenas a modelos maiores e janelas de contexto mais longas. Trata-se também de saber se as empresas conseguem fazer com que estes sistemas se comportem de forma suficientemente previsível para merecerem a confiança necessária para a utilização em massa.