Chinesische KI-Tools finden zunehmend Beachtung, und das keineswegs zu Unrecht. Diesmal hat Alibaba eine neue Lösung zur Videogenerierung vorgestellt, der wir unter anderem die Qwen-Modelle verdanken; deren neueste Version „ “ feierte Anfang des Monats ihr Debüt unter.
Wan3.0 ist ein Modell für multimodale Videogenerierung und -bearbeitung, das aus großen Mengen an Eingabedaten (Video, Bild, Ton, Text) dynamische Videoinhalte mit einer Länge von bis zu 30 Sekunden erstellen kann. Die Entwickler haben das Modell bereits ausdrücklich so konzipiert, dass es für den alltäglichen Einsatz möglichst gut geeignet ist. Im Sinne der multimodalen Funktionsweise kann es daher sogar PDF-, PowerPoint- oder andere Dokumente verarbeiten, und es können ihm auch Links zu Webseiten bereitgestellt werden.
Derzeit ist Wan3.0 noch als Beta-Version verfügbar, was jedoch angesichts des harten Wettbewerbs völlig normal ist. Alibaba ist vor allem stolz darauf, wie lange Videos das Modell am Stück erstellen kann – beim Vorgängermodell Wan2.7-Video lag die Obergrenze noch bei 15 Sekunden. Die Nutzer können nun komplexe Kamerabewegungen und detailreich geplante Szenen erstellen, was die Arbeit erheblich beschleunigen kann. Kurze Werbespots kann Wan3.0 bereits eins zu eins erstellen.
Die Entwickler bieten ab sofort auch eine intelligente Videolängenbestimmung an, was bedeutet, dass das System anhand der Eingabeaufforderung und der eingegebenen Informationen erkennen kann, wie lang die Szene sein soll. Es wird jedoch nicht einfach mehr Inhalt „hervorzaubern“, nur um die gewünschte Länge unbedingt zu erreichen. Parallel dazu steht auch eine Verlängerungsfunktion zur Verfügung, mit der sichergestellt werden kann, dass ausreichend lange und wirklich inhaltsreiche Videos entstehen.
Wie bei allen KI-generierten Inhalten treten auch in den Videos häufig visuelle Ungenauigkeiten und Verzerrungen auf. Um diese zu beseitigen, gewährleistet Wan3.0 eine hohe visuelle Kontinuität. Das Modell ist in der Lage, äußerst realistische menschliche Gesichter mit synchronisierten Gesichtsbewegungen zu erzeugen und nachzubilden. Es kann natürliche, mehrsprachige Stimmen erzeugen und ist sogar in der Lage, Software-Benutzeroberflächen und animierte Grafiken innerhalb der Videos stabil darzustellen.
Das Modell kann Referenzmaterialien bis ins kleinste Detail wiedergeben und dabei wichtige Punkte, räumliche Beziehungen sowie die Konsistenz der Töne genauestens berücksichtigen. Dadurch eignet es sich hervorragend für die Erstellung von Werbe- und Marketingmaterialien für hochwertige Produkte.
Laut Alibaba erhalten Filmemacher und Content-Ersteller mit Wan3.0 ein leistungsstarkes Werkzeug an die Hand, das ihre Arbeit vereinfachen und die Erstellung spannenderer Inhalte ermöglichen kann. Das Modell könnte sich sogar im Bildungsbereich als nützlich erweisen, da Kinder damit visuelle Lehrmaterialien erstellen können. Mehr noch: Man geht davon aus, dass diese Technologie bereits geeignet ist, realistische Videos und Simulationen zu erstellen, die beispielsweise für das Training selbstfahrender Autos genutzt werden können. So können Automobilhersteller und Zulieferer dem System beispielsweise ganz einfach Unfälle vorführen.
Der Zugriff auf die Wan3.0-API wird bald möglich sein, doch dafür muss man sich noch ein wenig gedulden. Das neue KI-basierte Modell zur Videogenerierung und -bearbeitung wird bereits bei einer Auflösung von 480p für nur 0,05 Dollar pro Minute einsetzbar sein, und mit steigender Auflösung verdoppelt sich der Preis. Dementsprechend lassen sich damit 720p-HD-Videos zum Preis von 0,1 Dollar pro Minute erstellen, während für die Produktion von Full-HD-Materialien ein Preis von 0,2 Dollar pro Minute berechnet wird.