A OpenAI aproveitou a sua primeira conferência para programadores para revelar uma ampla expansão da sua plataforma, liderada pelo GPT-4 Turbo com uma janela de contexto de 128.000 tokens, preços de API mais baixos, novas ferramentas para programadores e um sistema para os utilizadores criarem versões personalizadas do ChatGPT sem escrever código. O anúncio feito pela empresa no DevDay na segunda-feira marca o seu esforço mais ambicioso até à data para transformar a tecnologia por detrás do ChatGPT numa plataforma de software de utilização geral.

O GPT-4 Turbo consegue processar muito mais material num único comando do que os modelos GPT-4 padrão disponíveis no início deste ano. Além disso, a OpenAI afirma que o modelo é também mais capaz de seguir instruções e trabalhar com saídas estruturadas. A empresa reduziu o preço dos tokens de entrada do GPT-4 Turbo para um terço do custo do GPT-4 e o dos tokens de saída para metade do preço anterior, uma mudança diretamente dirigida aos programadores que procuram criar aplicações comercialmente viáveis ​​em torno de grandes modelos de linguagem.

Uma janela de contexto maior altera o que os programadores podem tentar

A janela de contexto de 128K é aproximadamente equivalente a centenas de páginas de texto, permitindo aos programadores incluir documentos, bases de código ou conversas muito maiores num pedido de modelo. Isto não garante a recuperação perfeita de todos os tokens, mas alarga o limite prático para a análise de documentos, fluxos de trabalho de recuperação e aplicações de longa duração.

A OpenAI está também a adicionar o modo JSON, chamadas de função melhoradas, saídas reproduzíveis através de um parâmetro de semente e acesso a probabilidades de registo. Estas características são menos visíveis do que um novo nome de modelo, mas são importantes para as equipas de software porque facilitam a integração do comportamento do modelo na lógica das aplicações comuns. O lançamento do GPT-4 em março estabeleceu a base multimodal e de raciocínio; o GPT-4 Turbo foi concebido para tornar esta capacidade mais barata e fácil de utilizar em larga escala.

A empresa lançou também uma API de Assistentes com ferramentas integradas de recuperação de dados, execução de código e chamada de funções. Em vez de exigir que os programadores criem eles próprios cada componente de uma aplicação conversacional, a OpenAI está a oferecer diretamente uma maior parte da camada de orquestração.

Os GPT personalizados impulsionam o ChatGPT para um mercado de aplicações

Para os consumidores e organizações, o anúncio mais visível são os GPTs: versões personalizadas do ChatGPT configuradas com instruções, conhecimento carregado e características selecionadas. Num anúncio de produto, a OpenAI afirmou que os utilizadores dos planos Plus e Enterprise podem criar GPTs para tarefas específicas e partilhá-los com outras pessoas. A empresa planeia lançar uma Loja de GPTs ainda este mês, onde poderão ser encontrados GPTs públicos.

A ideia reduz a barreira entre a utilização de um assistente de IA e a criação de uma pequena aplicação. Um professor pode configurar um GPT de tutoria com base num currículo, uma empresa pode criar um assistente de políticas internas ou um especialista pode combinar instruções com material de referência proprietário. As notas de lançamento do ChatGPT descrevem a implementação a 6 de novembro como uma nova forma de personalizar o ChatGPT para trabalho, casa e tarefas especializadas.

A estratégia alarga também a direção empresarial anunciada pela OpenAI em agosto. O ChatGPT Enterprise adicionou controlos administrativos, compromissos de privacidade mais robustos, contexto mais amplo e acesso ilimitado e de alta velocidade ao GPT-4 para organizações. Os GPT oferecem agora mais uma camada de personalização que pode permanecer interna à empresa ou ser partilhada publicamente.

As ferramentas multimodais passam a fazer parte do mesmo conjunto de ferramentas de desenvolvimento

O DevDay integra também o GPT-4 Turbo com a visão por computador, a geração de imagens DALL·E 3 e a conversão de texto em voz à API. Isto possibilita que uma única aplicação combine raciocínio textual, compreensão de imagens, geração de imagens e saída de voz, utilizando uma infraestrutura comum de fornecedor e conta.

A OpenAI tem vindo a caminhar nesta convergência há meses. O seu anúncio do DALL·E 3 descreveu um modelo de imagem concebido para seguir instruções detalhadas de linguagem de forma mais fiel e para funcionar em estreita colaboração com o ChatGPT como uma interface de refinamento de prompts. Abrir o DALL·E 3 e as capacidades de visão de forma mais ampla para os programadores transforma estas capacidades orientadas para o consumidor em componentes essenciais para produtos externos.

A plataforma expandida é também acompanhada pelo Copyright Shield, através do qual a OpenAI afirma que defenderá os clientes e suportará os custos incorridos em determinadas reclamações de violação de direitos de autor envolvendo sistemas OpenAI de utilização geral. O compromisso aplica-se ao ChatGPT Enterprise e à API, mas não a todas as utilizações ou modificações.

O preço torna-se uma arma competitiva

O impacto comercial mais imediato pode advir da fixação de preços. As aplicações de modelos de linguagem de grande dimensão podem tornar-se dispendiosas quando processam grandes quantidades de dados, servem muitos utilizadores ou chamam modelos repetidamente dentro do mesmo fluxo de trabalho. Reduzir o preço dos tokens diminui o custo da experimentação e torna algumas aplicações anteriormente consideradas marginais mais viáveis.

do TechCrunch sobre o DevDay destacou tanto as atualizações do modelo como as alterações de preços, juntamente com um programa experimental para o ajuste fino do GPT-4. A OpenAI está também a aumentar os limites de taxa para os clientes já registados da API do GPT-4, outro sinal de que a empresa se está a preparar para uma utilização em produção de maior volume.

Os anúncios pressionam os fornecedores de modelos concorrentes a competir não só em desempenho de benchmark, mas também em extensão de contexto, ferramentas de desenvolvimento, fiabilidade, controlos de dados e custo. Ao mesmo tempo, a OpenAI está a assumir mais responsabilidade pela própria camada de aplicação. Ao fornecer recuperação de dados, execução de código, assistentes personalizados e um mercado de GPT (Genetic Search Processing), aproxima-se de áreas onde muitas startups têm desenvolvido produtos com base nos seus modelos.

De fornecedora de modelos a empresa de plataforma

A mensagem principal do DevDay é que a OpenAI já não quer ser avaliada apenas pela inteligência do seu modelo mais recente. Está a reunir os componentes de uma plataforma: modelos, ferramentas, armazenamento e recuperação de dados, APIs multimodais, controlos empresariais, personalização, um canal de distribuição e custos unitários mais baixos.

Esta mudança pode tornar a OpenAI mais integrada no desenvolvimento de software, mas também aumenta as exigências de execução. Os programadores irão avaliar a plataforma com base no tempo de atividade, na estabilidade das versões, na previsibilidade dos preços, na privacidade e na utilidade das novas abstrações à medida que os modelos mudam.

Para já, a janela de contexto de 128 mil palavras e o preço mais acessível do GPT-4 Turbo representam mudanças técnicas substanciais, enquanto os GPT representam uma aposta de que milhões de utilizadores podem tornar-se programadores de aplicações leves. Juntos, estes fatores fazem com que o primeiro DevDay da empresa seja menos uma atualização de produto e mais uma declaração de que a IA generativa está a tornar-se uma plataforma de aplicações por si só.