Na quinta-feira, a Meta lançou os primeiros modelos da sua família Llama 3, apresentando versões com 8 mil milhões e 70 mil milhões de parâmetros, treinadas com mais de 15 triliões de tokens, e inserindo-as imediatamente numa das competições mais dinâmicas da indústria tecnológica: a corrida para tornar a inteligência artificial generativa cada vez mais capaz amplamente disponível para os programadores e consumidores. O comunicado técnico refere que os dois modelos iniciais estão disponíveis em versões pré-treinadas e ajustadas por instruções, enquanto um modelo muito maior, com mais de 400 mil milhões de parâmetros, continua em formação.

O lançamento é significativo porque a Meta está a seguir dois caminhos de distribuição em simultâneo. Está a disponibilizar o Llama 3 aos programadores sob a licença comunitária da empresa, ao mesmo tempo que o utiliza para impulsionar um assistente de IA da Meta mais completo no Facebook, Instagram, WhatsApp, Messenger e numa experiência web independente. O anúncio de lançamento da Meta, a 18 de abril, refere que o assistente está a expandir-se para além dos Estados Unidos, chegando a mais de uma dúzia de países e levando o Llama 3 a produtos de consumo com milhares de milhões de utilizadores já existentes.

Dois tamanhos de modelo, um conjunto de treino muito maior

A versão inicial do Llama 3 consiste nos modelos 8B e 70B, cada um oferecido em variantes base e otimizadas para instruções. O cartão oficial do modelo 8B descreve um transformador autorregressivo treinado numa nova combinação de dados online disponíveis publicamente, com um comprimento de contexto de 8.000 tokens e mais de 15 triliões de tokens de pré-treino. O modelo de instruções 70B utiliza a mesma arquitetura global, com ajuste fino supervisionado e aprendizagem por reforço a partir de feedback humano aplicado à versão otimizada.

A Meta refere que o corpus de pré-treino é mais de sete vezes maior do que o utilizado para o Llama 2 e inclui quatro vezes mais código. A empresa introduziu também um tokenizador com um vocabulário de 128.000 tokens, concebido para codificar a linguagem de forma mais eficiente, e treinou os modelos em dois clusters personalizados com 24.000 GPUs cada. Estas escolhas de engenharia são importantes porque a qualidade do modelo depende não só da quantidade de parâmetros, mas também do volume e da composição dos dados de treino, da tokenização, dos métodos de pós-treino e da infraestrutura disponível para executar experiências em larga escala.

Os parceiros de distribuição independentes agiram rapidamente. A nota de lançamento da Hugging Face, divulgada na mesma altura, informava que todas as quatro variantes principais — dois modelos básicos e dois modelos com ajustes de instruções — estavam disponíveis na sua plataforma de modelos no dia do lançamento, juntamente com o Llama Guard 2. A Amazon Web Services também disponibilizou o Llama 3 através do SageMaker JumpStart no dia 18 de abril, com um anúncio da AWS a listar a disponibilidade inicial nas regiões dos EUA, Europa e Ásia.

A Meta transforma o seu assistente de IA num motor de distribuição

A estratégia para o consumidor pode ser tão importante como o próprio lançamento do modelo. A Meta AI está a ser integrada diretamente nas caixas de pesquisa, chats e feeds nas principais aplicações da empresa. Os utilizadores podem acionar a assistente sem sair do WhatsApp ou do Messenger, fazer perguntas enquanto navegam no Facebook ou no Instagram e gerar imagens através da funcionalidade Imagine da Meta. A empresa está também a lançar um website para a Meta AI, oferecendo uma interface direta mais comparável aos assistentes independentes de outras empresas de IA.

Esta distribuição confere à Meta uma vantagem invulgar: não tem de convencer os utilizadores a instalar uma nova aplicação antes de os apresentar ao modelo. Em vez disso, o Llama 3 pode chegar integrado aos serviços que as pessoas já utilizam. A Meta refere que o assistente fornecerá informações em tempo real da web e estará disponível inicialmente em inglês em mercados como Austrália, Canadá, Gana, Jamaica, Malawi, Nova Zelândia, Nigéria, Paquistão, Singapura, África do Sul, Uganda, Zâmbia e Zimbabué.

Esta abordagem também cria um ciclo de feedback entre as estratégias dos programadores e dos consumidores da Meta. Os programadores podem adaptar os modelos subjacentes às suas próprias aplicações, enquanto a Meta pode operar a mesma família de modelos a uma escala enorme para o consumidor. Isto contrasta com uma estratégia de modelo puramente proprietária, na qual o acesso é limitado principalmente à aplicação ou API do próprio fornecedor.

As ferramentas de segurança passam a fazer parte do pacote de lançamento

A Meta está a integrar os novos modelos com ferramentas de segurança adicionais. A sua descrição de lançamento responsável detalha as medidas tomadas antes do lançamento e enfatiza as características para os programadores destinadas a reduzir utilizações inseguras. A versão técnica do Llama 3 introduz o Llama Guard 2, o Code Shield e o CyberSec Eval 2, ferramentas que visam, respetivamente, classificar conteúdos inseguros, identificar código inseguro e avaliar riscos de cibersegurança.

Os cartões de modelo da empresa também descrevem as limitações que os programadores devem ter em conta. A versão de abril foi concebida principalmente para textos em inglês, e os modelos têm limites de conhecimento fixos — março de 2023 para a versão de 8 bits e dezembro de 2023 para a versão de 70 bits. Tal como outros modelos de linguagem de grande dimensão, podem produzir resultados incorretos ou enganadores, e os programadores que os utilizam posteriormente continuam a ser responsáveis ​​por testar o comportamento nos ambientes específicos em que os implementam.

O modelo de licenciamento é amplo, mas não é irrestrito. A licença comunitária do Llama 3 da Meta permite a utilização comercial e para investigação sob condições específicas, ao mesmo tempo que impõe requisitos adicionais a plataformas muito grandes e proíbe utilizações que violem a política de utilização aceitável da empresa. Esta estrutura dá continuidade ao esforço da Meta em posicionar o Llama como amplamente acessível sem o tornar de domínio público.

A questão da concorrência passa do acesso ao desempenho

A alegação imediata da Meta é que as versões otimizadas para instruções são competitivas com os principais modelos disponíveis publicamente em benchmarks comuns de raciocínio, codificação e seguimento de instruções. Os resultados dos benchmarks são indicadores úteis, mas incompletos, do desempenho no mundo real, especialmente porque os sistemas práticos dependem da recuperação, dicas, afinação, latência, custo e controlos de segurança, para além das pontuações do modelo.

Ainda assim, a combinação da disponibilidade e distribuição do modelo altera o panorama competitivo. Os programadores podem descarregar ou implementar o Llama 3 através de vários fornecedores de infraestrutura, em vez de depender de uma única API alojada. O suporte do AWS SageMaker no mesmo dia e a integração de lançamento do Hugging Face reduzem o trabalho operacional necessário para testar os modelos. A Meta afirma que planeia ampliar a disponibilidade através do Microsoft Azure, Google Cloud, Databricks, IBM WatsonX, NVIDIA NIM, Snowflake e outros parceiros.

A questão mais importante é o que acontecerá após os lançamentos do 8B e do 70B. A Meta afirma que um modelo com mais de 400 mil milhões de parâmetros ainda está a ser treinado e que o primeiro lançamento do Llama 3 é apenas o início da família. Até sábado, o desenvolvimento mensurável já era substancial: a Meta lançou dois novos tamanhos de modelo, disponibilizou-os a um amplo ecossistema de programadores e, simultaneamente, colocou o Llama 3 atrás de um assistente de IA integrado nas suas plataformas de consumo. A próxima etapa testará se esta combinação de distribuição aberta, implantação em larga escala e iteração rápida do modelo se pode traduzir numa vantagem duradoura na IA generativa.