A OpenAI apresentou esta semana o Sora, um modelo generativo de inteligência artificial capaz de produzir vídeos até 60 segundos a partir de instruções escritas, alargando o trabalho da empresa, que antes se limitava a textos e imagens estáticas, para cenas em movimento mais longas e altamente detalhadas. O modelo permanece em fase de investigação, e não como um produto público, com acesso restrito a artistas visuais, cineastas, designers e testadores de segurança selecionados, enquanto a OpenAI avalia as suas capacidades e riscos.
Num relatório técnico divulgado na quinta-feira, a OpenAI descreve o Sora como um transformador de difusão treinado conjuntamente com vídeos e imagens de diferentes durações, resoluções e proporções. A empresa afirma que o seu modelo mais robusto pode gerar um minuto de vídeo de alta fidelidade, além de animar imagens estáticas, estender os vídeos existentes para a frente ou para trás e executar algumas tarefas de edição de vídeo.
De tokens linguísticos a patches visuais
A arquitetura do Sora inspira-se numa ideia central de grandes modelos de linguagem: representar informação diversa em unidades padronizadas que podem ser processadas em larga escala. Em vez de tokens de texto, o modelo representa dados visuais comprimidos como "patches espaço-temporais". A OpenAI afirma que isto permite que um único sistema aprenda com vídeos e imagens de múltiplas dimensões, em vez de estar limitado a clipes de duração fixa ou a uma única resolução.
A descrição do sistema Sora , da empresa, refere que este combina um processo de difusão com uma arquitetura de transformador. O processo inicia-se com ruído visual e transforma-o progressivamente em vídeo, processando múltiplos fotogramas de forma a preservar os objetos mesmo quando estes saem temporariamente do campo de visão da câmara.
A OpenAI também utiliza uma técnica de relegendagem desenvolvida para o DALL·E 3. Um modelo de legendagem cria descrições mais ricas para os vídeos de formação, e o GPT pode expandir uma breve instrução do utilizador em instruções mais detalhadas antes da geração. O objetivo é melhorar a capacidade do modelo de seguir instruções que envolvam o motivo, o cenário, o movimento da câmara e o estilo visual.
A geração de um minuto eleva o nível da competitividade
Os sistemas de conversão de texto em vídeo já existem em empresas como a Runway, Meta e Google, mas os primeiros exemplos da Sora destacam-se pela sua duração e aparente coerência visual. A antevisão publicada pela Wired a 15 de fevereiro descreveu o modelo como capaz de produzir sequências fotorrealistas de até um minuto de duração, sublinhando que está a ser apresentado apenas a um pequeno grupo de criadores e investigadores de segurança.
A reportagem da Engadget destacou exemplos que vão desde cenas urbanas nevadas a mamutes lanosos, bem como a capacidade do modelo de gerar uma sequência completa em vez de simplesmente juntar pequenos trechos. As demonstrações sugerem um progresso significativo na consistência temporal, um dos principais problemas técnicos na geração de vídeos.
Este progresso não deve ser confundido com compreensão física. O próprio relatório da OpenAI refere que o Sora pode falhar em conceitos básicos de causa e efeito, permanência do objeto e física do mundo real. Uma pessoa gerada pode morder a comida sem deixar as marcas esperadas, os objetos podem aparecer espontaneamente e as interações complexas podem tornar-se incoerentes. O sistema consegue criar cenas visualmente convincentes, mesmo sem compreender a mecânica do que representa.
O produto ainda não foi divulgado ao público, propositadamente
A OpenAI está a adotar uma abordagem de lançamento mais cautelosa do que a utilizada com o ChatGPT. Os relatórios da Associated Press referem que o Sora não está disponível ao público em geral e que a empresa divulgou informações limitadas sobre o conjunto de treino subjacente. O público está a ver exemplos selecionados, não um serviço que qualquer pessoa possa testar livremente.
A empresa afirma estar a dar acesso a equipas de cibersegurança com experiência em desinformação, conteúdo de ódio e viés, bem como a artistas e cineastas cujo feedback pode identificar tanto aplicações criativas como falhas. A OpenAI está a desenvolver um classificador de deteção destinado a reconhecer vídeos gerados pela Sora e afirma que poderá utilizar padrões de origem, como os metadados C2PA, caso o modelo seja implementado num produto.
O momento é delicado, pois chegam vídeos sintéticos realistas durante um ano de eleições importantes em todo o mundo. O risco não se limita aos discursos políticos fabricados. As imagens geradas podem ser utilizadas para falsificação de identidade, fraude, assédio, fabricação de provas ou representações enganosas de acontecimentos reais. A notícia de lançamento do The Guardian referiu que a OpenAI está a tentar testar estes riscos antes do lançamento em larga escala.
Os dados de formação e os direitos de autor permanecem questões não resolvidas
Sora também se encontra num debate jurídico ainda indefinido sobre o material utilizado para treinar modelos generativos. A OpenAI não forneceu um inventário detalhado dos vídeos e imagens utilizados para o Sora. Reportagens recentes referem que a empresa descreveu o conjunto de dados em termos gerais, incluindo material disponível publicamente e licenciado.
É provável que isto atraia a atenção de cineastas, fotógrafos, editores e outros detentores de direitos de autor. As empresas de IA generativa já enfrentam processos judiciais questionando se o material protegido por direitos de autor pode ser utilizado para formação sem permissão e se os resultados dos modelos podem reproduzir expressões protegidas. O vídeo acrescenta outra camada de complexidade, uma vez que o material de formação pode incluir cinematografia, performances, personagens, música e outros direitos.
O potencial criativo do modelo é, no entanto, substancial. Um cineasta poderia prototipar cenas antes de uma filmagem, um publicitário poderia gerar vídeos conceptuais, um estúdio de jogos poderia testar ambientes ou um educador poderia visualizar situações difíceis de filmar. Sora pode também aceitar imagens e vídeos existentes como entradas, sugerindo utilizações que vão para além da simples geração de vídeo a partir de texto.
Uma antevisão da investigação com implicações que vão além do vídeo
A OpenAI apresenta o Sora como algo mais do que uma ferramenta de media. Os seus investigadores defendem que a escalabilidade dos vídeos generativos pode ser um caminho para modelos que aprendam representações úteis do mundo físico. O artigo científico aponta para comportamentos emergentes, como movimentos de câmara consistentes e algumas formas de interação com objetos, embora reconheça cuidadosamente que estas capacidades ainda estão incompletas.
Esta afirmação exigirá testes independentes substanciais. Gerar pixéis plausíveis não é o mesmo que compreender física, causalidade ou intenção humana, e os erros visualmente convincentes de Sora podem dificultar a perceção destas distinções por parte dos utilizadores. O modelo pode parecer experiente mesmo quando a simulação subjacente está errada.
Por ora, a importância do Sora reside na lacuna que parece preencher entre clipes curtos e instáveis de IA e sequências cinematográficas mais longas. A OpenAI demonstrou um sistema capaz de gerar um minuto de vídeo a partir da linguagem e está a restringir o acesso alargado enquanto testa as consequências. O sucesso do Sora como plataforma criativa dependerá não só da qualidade visual, mas também do custo, da rapidez, das leis de direitos de autor, da proveniência e da capacidade dos sistemas de segurança para acompanhar a crescente persuasão dos meios sintéticos.