VideoPoet est un modèle de recherche de Google qui transforme des prompts texte en vidéos réalistes ou stylisées. Il repose sur un large modèle de langage adapté à la génération de vidéos en zero-shot, ce qui lui permet de gérer différentes tâches sans être entraîné pour chacune d’entre elles.
Modes de génération
VideoPoet prend en charge plusieurs façons de créer du contenu vidéo :
Génération texte vers vidéo à partir d’un prompt rédigé
Génération image vers vidéo qui anime une image fixe unique
Courtes scènes et extraits narratifs visuels à partir d’une entrée minimale
Édition et stylisation
En plus de générer des vidéos à partir de zéro, VideoPoet peut modifier des séquences existantes :
Stylisation pour changer l’apparence visuelle d’une scène
Modifications de style au niveau de la scène pour des variations créatives
Inpainting pour remplir, remplacer ou redessiner des parties d’une vidéo
À qui cela s’adresse
VideoPoet est principalement une démonstration d’une nouvelle approche : utiliser un modèle de langage auto-régressif pour नियंत्रer la génération de vidéos. Il s’adresse aux chercheurs, développeurs et passionnés qui explorent les modèles multimodaux et les workflows créatifs avec l’IA.

