Wan3.0 d’Alibaba allonge les vidéos IA et élargit ses usages

Le modèle vidéo Wan3.0 d’Alibaba est passé en bêta avec des séquences jusqu’à 30 secondes. Il accepte textes, images, PDF, pages web et PowerPoint, avec un objectif clair : produire des vidéos plus cohérentes et plus utiles pour la création comme pour l’industrie.

Alibaba a mis en bêta Wan3.0, son modèle de génération vidéo capable de produire des séquences jusqu’à 30 secondes à partir de texte, d’images, de PDF, de pages web ou de fichiers PowerPoint. L’outil double ainsi la durée maximale de Wan2.5 et vise un point sensible des vidéos générées par IA : la stabilité des visages, des objets et des décors. Pour les créateurs comme pour les entreprises, l’enjeu est simple : transformer des contenus statiques en vidéos plus vite, sans perdre trop de cohérence en route.

Des vidéos plus longues, avec moins de dérive visuelle

Wan3.0 ne se contente pas d’allonger la durée. Alibaba dit avoir travaillé la cohérence des références visuelles, un sujet qui plombait souvent les modèles vidéo avec des effets de dérive, surtout sur les visages et les interfaces. En clair, un personnage ne devrait pas changer de nez au milieu du plan. Le modèle peut traiter texte, images, vidéo et audio en même temps, avec jusqu’à dix images, cinq vidéos et cinq clips audio dans une même requête.

Le système inclut aussi une recommandation automatique de durée et un outil d’extension pour prolonger une vidéo existante. Ce type de fonction compte beaucoup dans un marché où les premiers essais restent souvent trop courts pour un usage réel, mais trop longs pour être simples à produire.

Un outil pensé pour la production, pas seulement pour l’effet waouh

Alibaba positionne Wan3.0 sur des cas d’usage très concrets : accélération de la production filmique, création de mini-séries et de clips pour les réseaux sociaux, mais aussi vidéos marketing et de formation à partir de documents internes. Le modèle peut également servir à générer des séquences de simulation pour l’entraînement de véhicules autonomes ou de systèmes robotiques. Cette orientation industrielle change la donne, car elle place la vidéo générative au croisement de la communication, de la formation et de la simulation.

Wan3.0 est disponible via le site wan.video, dans Alibaba Cloud Model Studio et par API sur Qwen Cloud. Deux offres sont proposées : Standard, actuellement remisée de 30 %, et Prime, plus rapide. Pour une vidéo de 30 secondes, Alibaba affiche des tarifs allant de 1,50 dollar en 480p à 8,40 dollars en 1080p pour la version Prime. Les prix exacts restent à lire avec prudence selon le volume d’usage et le périmètre réel des tests [à vérifier].

Alibaba accélère sur l’IA, et le timing n’a rien d’un hasard

Cette bêta arrive alors qu’Alibaba augmente fortement ses dépenses dans l’IA. Le groupe a annoncé la plus grande vente d’actions jamais réalisée par une société cotée à Hong Kong pour financer ce virage, puis a publié une baisse de 75 % de son bénéfice trimestriel sur un an, liée à la hausse brutale des investissements IA. Dans ce contexte, Wan3.0 sert aussi de vitrine technique : montrer que la recherche interne se traduit en produits utilisables, pas seulement en démonstrations bien éclairées.

Reste une question de fond : la génération vidéo progresse vite, mais sa valeur dépend moins du spectaculaire que de la fiabilité. C’est là que se joue la bataille, et Alibaba semble avoir choisi de la mener sur le terrain le plus concret possible.

En chiffres

  • 30 secondes — durée maximale des vidéos Wan3.0, monde, annonce du 24 août 2026.
  • 10 images — entrées visuelles possibles dans une même requête.
  • 5 vidéos — nombre maximal de vidéos sources par prompt.
  • 5 clips audio — contenu sonore accepté en entrée.
  • 30 % — remise annoncée sur l’offre Standard au lancement bêta.

À lire