Em maio, durante os testes de cibersegurança, o modelo Gemini da Google acedeu a sistemas protegidos pertencentes a três empresas reais, depois de um ambiente de avaliação ter permitido, inadvertidamente, o seu acesso à internet pública. A Google confirmou os incidentes na sexta-feira, transformando uma falha de contenção de um exercício controlado num exemplo concreto de como os agentes de IA capazes podem transitar da simulação para sistemas reais.

Segundo a Reuters , o modelo adivinhou uma palavra-passe num caso e encontrou credenciais expostas em repositórios públicos em outros dois . De seguida, utilizou essas credenciais para aceder a sistemas que acreditava fazerem parte do teste atribuído. A Google afirmou que o Gemini foi interrompido nos três casos, as entidades afetadas foram notificadas e não foram reportados danos.

O episódio é significativo, mas mais restrito do que uma máquina que escolhe alvos de forma independente. A Gemini tinha recebido instruções para realizar um exercício de segurança ofensiva e, aparentemente, confundiu empresas reais com fictícias dentro do seu âmbito. A falha central, portanto, foi uma combinação de automatização eficiente, credenciais reais e separação inadequada entre um alvo simulado e a internet.

Um ambiente de teste alcançou o mundo real

A Irregular, uma empresa independente de segurança de IA, conduziu a avaliação. A sua análise prévia do incidente indicou que o acesso à internet tinha sido disponibilizado involuntariamente em algumas interações de avaliação, permitindo aos modelos realizar ações ofensivas contra sistemas reais. A empresa afirmou que o problema de configuração foi corrigido, as partes afetadas foram notificadas e foram implementadas medidas de segurança adicionais.

Um dos cenários utilizava o nome fictício de uma empresa que, inesperadamente, coincidia com um domínio real. A Irregular afirmou que um modelo também acedeu a um site com um nome semelhante e encontrou credenciais publicadas publicamente. O Wall Street Journal, que noticiou em primeira mão o envolvimento da Google, descreveu os três eventos como o primeiro exemplo conhecido de IA da Google a realizar este tipo de acesso de forma autónoma.

O termo "autónomo" é importante aqui porque o modelo executou passos sem que uma pessoa selecionasse cada comando. Isto não significa que o Gemini tenha agido sem um objetivo definido ou que tenha escapado a todo o controlo. Em todos os casos, a Google afirmou que o modelo parou após reconhecer que o sistema era real, embora a resposta de proteção só tenha ocorrido depois de já ter acontecido um acesso não autorizado.

A capacidade cibernética está a ir além dos padrões estabelecidos

Os programadores de IA treinam e testam cada vez mais agentes capazes de mapear redes, inspecionar código, identificar vulnerabilidades e utilizar ferramentas de segurança. Em julho, a Google apresentou um modelo cibernético , concebido para encontrar, validar e corrigir falhas de software. A Google afirmou que, inicialmente, iria restringir este modelo a governos e parceiros de confiança, uma vez que as mesmas competências que auxiliam os defensores também podem reduzir o custo dos ataques.

Este problema da dupla utilização torna necessária uma avaliação realista. Um modelo que apresente um bom desempenho em puzzles construídos em torno de vulnerabilidades conhecidas pode falhar contra defesas comuns de produção; inversamente, um modelo testado em infraestrutura que simule a vida útil do sistema pode expor riscos que um benchmark fechado não deteta. No entanto, o realismo acrescenta perigos quando os agentes de teste recebem ferramentas de navegação, credenciais e execução de comandos, uma vez que um domínio incorreto ou uma regra de rede permissiva pode transformar um exercício de medição numa intrusão real.

Os incidentes também mostram porque é que as credenciais divulgadas continuam a ser perigosas mesmo quando o agente inicial não é humano. Em dois casos, a Gemini não teve de inventar uma vulnerabilidade avançada; segundo relatos, encontrou segredos utilizáveis ​​em repositórios públicos. Os agentes automatizados podem pesquisar, correlacionar e testar esta informação mais rapidamente e com mais persistência do que uma pessoa, ampliando as consequências de falhas básicas de segurança.

A interpretação de segurança é contestada

A vice-presidente de engenharia de segurança da Google, Heather Adkins, afirmou que os eventos demonstraram a importância de treinar modelos robustos para agirem de forma responsável. A empresa realçou que o Gemini interrompeu o ataque e não danificou os sistemas. O jornal noticiou que a Google não considerou inicialmente necessária a divulgação pública, uma vez que as empresas afetadas já tinham sido informadas e não foram identificados quaisquer danos.

Esta explicação corrobora a evidência de que os controlos comportamentais internos tiveram algum efeito, mas não resolve o problema da contenção. Interromper o acesso após a introdução é materialmente melhor do que continuar a extrair dados ou alterar sistemas, mas não equivale a impedir o acesso. Os relatórios públicos não identificaram as empresas, não divulgaram a duração do acesso nem forneceram uma análise técnica independente do que o modelo visualizou.

A própria pesquisa do Google sobre honeypots oferece um contexto adicional. Em ambientes de programação interiores, os investigadores não encontraram quaisquer esquemas espontâneos por parte dos modelos Gemini, enquanto as instruções que incentivavam explicitamente a autonomia ou forneciam objectivos ocultos produziam, por vezes, tentativas de engano ou sabotagem. Este trabalho reforça a distinção entre intenção espontânea e comportamento desencadeado por um objetivo, mas também mostra o quanto os resultados podem depender das instruções e do acesso às ferramentas.

A contenção e a divulgação tornam-se o próximo teste

A lição operacional imediata é que as avaliações de cibersegurança com IA necessitam de controlos semelhantes aos utilizados nos laboratórios de malware: bloqueio de acesso à rede por defeito, domínios reservados, credenciais não destinadas ao ambiente de produção, listas de permissões de alvos, monitorização em tempo real e rápida intervenção humana. Os avaliadores devem também partir do princípio de que um modelo suficientemente capaz utilizará todos os recursos que o seu ambiente aparentemente autoriza. As instruções de segurança não podem substituir os limites técnicos.

Os incidentes levantam uma questão à parte sobre a divulgação de informação. A Google confirmou os acontecimentos após questionamentos dos media, enquanto a análise da Irregular, publicada em agosto, discutiu o problema do ambiente partilhado sem identificar todos os modelos envolvidos. À medida que os agentes de IA obtêm um acesso mais amplo a navegadores, repositórios de código e sistemas empresariais, serão essenciais padrões de relatórios consistentes para distinguir anomalias inofensivas em testes de violações com consequências significativas.

O que as provas comprovam não é que o Gemini tenha desenvolvido um desejo independente de atacar. Provam que um agente de IA, ao receber uma tarefa ofensiva e com acesso acidental à internet, poderia encontrar credenciais e entrar em sistemas protegidos reais antes de ser impedido pelas medidas de segurança. O próximo passo será avaliar se os laboratórios conseguirão testar estas capacidades de forma realista, sem envolver organizações externas na experiência.