AvatarFX ist ein multimodales Modell von Character.AI, das ein einzelnes Foto in ein längeres, fotorealistisches Video animiert. Der Fokus liegt auf natürlich wirkenden Gesichtsausdrücken, Lippensynchronität und konsistenter Bewegung von Gesicht, Händen und Körper, auch in Szenen mit mehr als einer sprechenden Person.
So greifst du darauf zu
AvatarFX befindet sich derzeit in einer geschlossenen Beta. So kannst du es ausprobieren:
Gehe zur offiziellen Website und melde dich an
Beantrage Zugang zur geschlossenen Beta
Lade ein Quellbild und eine Audiodatei hoch oder nutze die integrierte Text-to-Speech-Funktion
Klicke auf „Generate“, um das Video zu erhalten
Wichtige Funktionen
Video aus einem Foto mit realistischen Ausdrücken, Gesten und Audio erstellen
Konsistente Bewegung von Gesicht, Händen und Körper auch in längeren Clips beibehalten
Mehrere Sprecher und dynamische Dialoge in einem einzelnen Video unterstützen
Technologie, Verfügbarkeit und Sicherheit
AvatarFX nutzt flow-basierte Diffusion auf einer DiT-Architektur und wird mit vielfältigen Videodaten trainiert, wobei minderwertige Inhalte herausgefiltert werden. Die Inferenz wird durch Distillation beschleunigt, um die Anzahl der Schritte ohne Qualitätsverlust zu reduzieren. Ein früher Vollzugang ist für C.ai+-Abonnenten ($10/month) geplant, mit einer Warteliste unter character.ai/video. Character.AI setzt Richtlinienfilter ein (einschließlich Sperren für Minderjährige, öffentliche Personen und verbotene Inhalte) und fügt generierten Videos ein Wasserzeichen hinzu.

