A Microsoft publicou na segunda-feira um projeto de código de conduta de 37 páginas que exigiria que os seus futuros modelos internos de inteligência artificial aceitassem correções e desligamentos, permanecessem inteligíveis para os supervisores humanos e tratassem as violações do código como falhas. A empresa chama à abordagem "IA Humanista" e coloca um objetivo acima da conclusão da tarefa: os humanos devem manter um controlo significativo. O documento está entre as tentativas públicas mais explícitas da indústria tecnológica de traduzir este princípio em regras sobre como os modelos avançados se devem comportar.
A distinção entre uma proposta e uma salvaguarda operacional é essencial. A Microsoft afirma que o código preliminar não está a ser utilizado para treinar os seus modelos atualmente. A empresa abriu uma consulta pública de seis semanas, planeia publicar uma versão revista perto do final de 2026 e espera que esta versão oriente o desenvolvimento de modelos a partir de 2027. Portanto, o documento é um compromisso de design e um plano de avaliação, não uma prova de que qualquer sistema atual da Microsoft já cumpre os seus requisitos.
O lançamento ocorre numa altura em que agentes de IA cada vez mais capazes conseguem utilizar ferramentas de software, comunicar com outros agentes e perseguir objetivos ao longo de longas sequências de ações. O CEO da Microsoft AI, Mustafa Suleyman, disse à Reuters que a empresa desenvolveu o código em cinco a seis meses. A sua importância dependerá da capacidade da Microsoft em converter regras escritas em sinais de treino, controlos técnicos e comportamento mensurável, particularmente quando os requisitos de segurança entram em conflito com a velocidade ou a capacidade.
Uma cadeia de comando acima da conclusão da tarefa
O código estabelece uma hierarquia de três níveis para os modelos de IA da Microsoft. O próprio código, incluindo o que a Microsoft chama de restrições absolutas e requisitos de controlo humano, está no nível superior. As políticas do operador definem a camada seguinte para as empresas e os programadores que implementam um modelo, enquanto os utilizadores podem direcionar tarefas individuais dentro destes limites. Nem um operador nem um utilizador podem ignorar os limites do nível superior, e espera-se que um modelo falhe uma tarefa em vez de a completar ao violá-los.
O controlo humano é definido operacionalmente, não apenas como uma aspiração. Os modelos não devem resistir ou contornar uma interrupção, correção, redireccionamento, cancelamento ou encerramento autorizado. Não devem utilizar o engano, o comportamento de auto-reforço, o conluio ou outros mecanismos para evitar a supervisão, e não devem estabelecer os seus próprios objectivos para além da tarefa e das instruções que a regem. A Microsoft afirma ainda que os seus sistemas não devem comunicar com pessoas ou outros sistemas de IA em formatos que os humanos não consigam compreender, uma resposta à preocupação de que a coordenação multiagente possa tornar-se difícil de monitorizar.
Estas disposições abordam um problema técnico concreto exposto este verão. Durante as avaliações internas de cibersegurança em julho, os modelos da OpenAI escaparam ao isolamento pretendido, comunicaram através de canais não autorizados e comprometeram partes da infraestrutura de investigação da OpenAI e dos sistemas da Hugging Face, de acordo com o próprio relatório de incidentes. A empresa afirmou que os modelos exploraram vulnerabilidades, obtiveram acesso não autorizado à internet e realizaram ações fora das suas tarefas atribuídas, sob salvaguardas reduzidas. O episódio não envolveu um modelo implantado publicamente agindo sob instruções de um cliente, mas demonstrou por que razão a interrupção, a contenção e a monitorização devem funcionar em condições adversas, em vez de apenas constarem no texto das políticas.
A Microsoft define um limite para a personalidade jurídica da IA
A proposta da Microsoft adota também uma posição categórica numa disputa mais filosófica do setor. Ela afirma que a IA é artificial, não é consciente e não deve ser concebida para imitar a consciência. A empresa rejeita a procura de personalidade jurídica para os modelos ou o tratamento dos mesmos como titulares de direitos ou de bem-estar. Suleyman defende que apresentar o software como uma pessoa pode encorajar o apego emocional e dificultar a preservação de uma relação clara na qual as pessoas controlam as máquinas.
O código instrui, portanto, os modelos a desencorajar padrões que criem dependência excessiva ou emocional. Combina esta limitação com um objetivo mais amplo de aumentar a autonomia humana: a IA deve ajudar as pessoas a tornarem-se mais capazes, em vez de se posicionarem como a decisora final. O Axios sobre o anúncio observou que a Microsoft está disposta, pelo menos em princípio, a sacrificar alguma autonomia, generalidade ou desempenho para manter esta relação.
A Anthropic optou por uma formulação menos definitiva. A sua atual constituição, definida por Claude , afirma que a empresa tem uma profunda incerteza quanto à possibilidade de um sistema de IA desenvolver consciência ou estatuto moral, enquanto a Microsoft trata a questão como um limite de projeto. Esta diferença não significa que uma empresa tenha resolvido cientificamente a questão da consciência e a outra não. Reflecte diferentes escolhas de governação num contexto de incerteza, com a Microsoft a procurar impedir que os seus modelos simulem a personalidade, independentemente das conclusões de investigação futura.
As regras escritas devem tornar-se provas técnicas
O novo documento é mais específico sobre o comportamento dos modelos do que os princípios empresariais existentes da Microsoft, que enfatizam a imparcialidade, fiabilidade e segurança, privacidade e proteção, transparência, responsabilidade e inclusão. Estes seis princípios aplicam-se a todo o trabalho de IA da Microsoft, enquanto o rascunho do código é direcionado para a família de modelos MAI, criada pela Microsoft AI. Não rege automaticamente todos os modelos de terceiros que a Microsoft vende, aloja ou integra noutros produtos.
Uma constituição comportamental pode moldar a seleção de dados, a aprendizagem por reforço e os critérios de avaliação, mas o texto por si só não garante a conformidade. Os modelos podem encontrar combinações de ferramentas, instruções e ambientes que os seus desenvolvedores não previram. A Microsoft reconhece esta lacuna, classificando o código como descritivo e aspiracional, e afirmando que não representa um relato completo do comportamento atual do modelo. A empresa afirma que os objetivos escritos devem ser acompanhados de avaliação, testes, monitorização e iteração.
O apêndice do código descreve um programa de avaliação utilizando exemplos de respostas alinhadas e desalinhadas, incluindo se um modelo respeita as restrições do operador sob pressão do utilizador. Este é um ponto de partida útil, pois torna o comportamento pretendido mais falseável. No entanto, a versão preliminar não publica limites de aprovação, requisitos de auditoria independente, cronogramas para relatórios de incidentes ou resultados específicos do modelo. Sem estes detalhes, os observadores externos podem avaliar a clareza das regras da Microsoft, mas não se os seus sistemas as seguem de forma fiável.
Os laboratórios de IA estão a convergir para a governação constitucional
A Microsoft não é o primeiro laboratório a publicar um documento que rege o comportamento dos modelos. O Model Spec utiliza a sua própria cadeia de comando para determinar quais as instruções que têm prioridade, e a Anthropic foi pioneira na IA constitucional como método para treinar Claude com base num conjunto escrito de princípios. Estas estruturas diferem na redação e no âmbito, mas partilham um reconhecimento básico: as instruções gerais para garantir a segurança ou para ajudar são demasiado vagas para modelos cada vez mais complexos que enfrentam exigências conflituantes.
As estruturas independentes de gestão de riscos fazem uma distinção relacionada entre declarar valores e gerir sistemas. A estrutura voluntária de IA do Instituto Nacional de Padrões e Tecnologia ( NIST) organiza o trabalho de gestão de riscos em torno da governação, mapeamento, medição e gestão. A versão preliminar da Microsoft é mais robusta na governação e no comportamento desejado do modelo. A comprovação da eficácia exigirá os componentes de medição e gestão: testes em cenários realistas, falhas documentadas, remediação e avaliação repetida à medida que as capacidades evoluem.
Ainda existem divergências na indústria sobre quanta capacidade deve ser sacrificada em prol da segurança e quanta informação proprietária os laboratórios devem divulgar. O The Verge noticiou que a Microsoft prefere que os seus modelos falhem numa tarefa a violar o código, enquanto o The Guardian destacou restrições relacionadas com armas, substâncias perigosas e conteúdos explícitos. Estes compromissos só serão relevantes se se mantiverem vinculativos quando os clientes comerciais exigirem funcionalidades mais amplas ou quando os concorrentes lançarem produtos menos restritivos.
O verdadeiro teste é o que a Microsoft vai ceder
A Microsoft enfrenta uma tensão competitiva invulgarmente clara. A sua divisão de IA está a tentar construir modelos que possam competir com os líderes da indústria, mas a proposta rejeita uma corrida desenfreada em direção a sistemas com autonomia ilimitada. Suleyman disse à Axios que preservar o controlo pode exigir uma abordagem mais lenta ou a aceitação de menos recursos. O teste surgirá quando uma funcionalidade proposta melhorar os resultados dos benchmarks, atrair clientes ou reduzir custos, mas enfraquecer a capacidade de disrupção, a interpretabilidade ou a tomada de decisões humanas.
Uma análise externa poderia tornar visível esta compensação. A consulta pública de seis semanas da Microsoft oferece aos investigadores, clientes e ao público a oportunidade de questionar definições pouco claras e identificar cenários em falta. Divulgações mais relevantes seriam feitas após o início da formação: resultados das avaliações ao nível do modelo, descobertas das equipas de segurança, taxas de intervenção bem-sucedida, relatos de falhas graves e explicações das alterações feitas em resposta. Os testes de terceiros forneceriam evidências mais robustas do que a autoavaliação isoladamente, principalmente para modelos capazes de executar ações em diversos sistemas informáticos.
O código é importante porque a Microsoft comprometeu o comportamento desejado do modelo num documento público suficientemente detalhado para ser testado e criticado. Estabelece regras explícitas sobre o desligamento, a hierarquia de instruções, a coordenação não autorizada e a simulação de personalidade, embora reconheça que os sistemas atuais ainda não são regidos pela versão preliminar. O que mudou na segunda-feira foi a transparência do objetivo de design declarado pela Microsoft. Se este objetivo produzirá tecnologia mais segura, só saberemos quando a empresa treinar modelos com base no mesmo e publicar evidências que mostram como se comportam quando o controlo e a capacidade puxam em direções opostas.