A Stability AI, desenvolvedora de tecnologias de inteligência artificial, lançou uma nova ferramenta que promete revolucionar o campo da arte generativa. O produto, chamado Stable Video Diffusion, está atualmente em fase de pré-visualização de pesquisa e possibilita aos usuários criar vídeos a partir de uma única imagem. Segundo comunicado da empresa, essa inovação reflete um avanço significativo na missão de desenvolver modelos de IA acessíveis a todos os tipos de usuários.
O Stable Video Diffusion oferece dois modelos de conversão de imagem para vídeo, capazes de produzir sequências de 14 a 25 quadros, com velocidades que variam entre 3 e 30 quadros por segundo e resolução de 576 × 1024. A ferramenta permite a síntese multivisual a partir de um único quadro e foi ajustada para tal uso em datasets multivisuais. Em testes externos de avaliação, a Stability AI afirma que o desempenho desses modelos superou o dos principais modelos fechados do mercado, em termos de preferência dos usuários, fazendo uma comparação direta com as plataformas de texto para vídeo da Runway e Pika Labs.
Por enquanto, o Stable Video Diffusion está disponível somente para fins de pesquisa e não para aplicações comerciais ou do mundo real. Interessados podem se inscrever em uma lista de espera para um futuro acesso a uma 'experiência web' que contará com uma interface de texto para vídeo. A empresa destaca que a ferramenta tem potencial para ser aplicada em diversos setores, como publicidade, educação e entretenimento.
Os exemplos de vídeo divulgados demonstram uma qualidade comparável aos sistemas gerativos concorrentes, embora a Stability AI reconheça algumas limitações, como a geração de vídeos relativamente curtos (menos de 4 segundos), a falta de fotorealismo perfeito, a incapacidade de realizar movimentos de câmera complexos, ausência de controle de texto, dificuldade em gerar textos legíveis e possíveis falhas na reprodução correta de rostos e pessoas.
A ferramenta foi treinada utilizando um dataset de milhões de vídeos e posteriormente ajustada com um conjunto menor de dados. A Stability AI mencionou apenas que utilizou vídeos publicamente disponíveis para fins de pesquisa. A procedência dos dados é um ponto crucial, principalmente após a empresa ter sido processada pela Getty Images por utilizar suas imagens sem autorização.
O vídeo é um objetivo fundamental para a IA generativa pela sua capacidade de simplificar a criação de conteúdo. Contudo, também representa um campo com grande potencial de abuso, como deepfakes e violações de direitos autorais. A Stability AI, diferentemente da OpenAI com seu produto ChatGPT, teve menos sucesso na comercialização de seu produto Stable Diffusion e enfrentou um alto consumo de caixa, conforme apontado pela TechCrunch. Na semana passada, Ed Newton-Rex, vice-presidente de áudio da Stability AI, renunciou devido ao uso de conteúdo protegido por direitos autorais no treinamento de modelos de IA generativos.
?rel=0
Confira os últimos vídeos publicados no canal