Introduction
La vidéo générée par IA a atteint un stade où une simple démo ne prouve pratiquement rien. N’importe lequel de ces systèmes peut produire dix secondes de séquence qui semblent abouties sur l’écran d’un téléphone. La différence apparaît dès qu’une personne traverse le cadre, qu’une caméra commence à se déplacer, que deux objets entrent en collision ou qu’une commande demande que plusieurs événements se produisent simultanément. C’est là que la qualité cesse d’être une image fixe pour devenir un comportement.
Seedance 2.5, MiniMax H3 et Wan 3 sont ici considérés comme des moteurs de génération vidéo soumis à une charge de travail, et non comme des produits marketing. Trois indicateurs rapides définissent le contexte de la confrontation avant le début des rounds. MiniMax H3 détient actuellement la meilleure position vérifiable en termes de qualité, car c’est le seul des trois à disposer d’un classement public en temps réel et de poids téléchargeables.
Seedance 2.5 possède le meilleur pedigree en matière de mouvement et de narration, hérité d’une gamme Seedance qui a dominé les classements vidéo publics. Wan 3 offre le profil le plus controversé de tous : un point de terminaison commercial en direct et une durée phare, enveloppés dans un brouillard de spécifications que son propre fabricant n’a jamais publiées.
Le vainqueur n’est pas encore connu. Ce sont les manches qui le détermineront, et les données sont suffisamment inégales pour qu’aucun des trois ne puisse être noté sur la qualité.
Seedance 2.5, ByteDance
ByteDance a lancé Seedance 2.5 le 31 juillet 2026, le déployant via Jimeng (Dreamina) et le niveau Pro de Doubao après une avant-première lors de la conférence Volcano Engine FORCE le 23 juin. Sa fonctionnalité phare est la génération native d’audio-vidéo en un seul passage de 30 secondes, avec une extension en plusieurs itérations pour des séquences plus longues, et un plafond d’entrée pouvant atteindre 50 références multimodales (30 images, 10 clips vidéo, 10 clips audio), soit le budget de références le plus large de la catégorie. Les poids sont fermés. Au moment de la rédaction de cet article, l’API publique n’était pas encore disponible : ByteDance a orienté les développeurs vers BytePlus ModelArk, dont l’accès devrait s’ouvrir début août. Il n’existe pas encore de benchmarks indépendants pour la version 2.5, bien que son prédécesseur, Seedance 2.0, figure parmi les meilleurs classements publics.
MiniMax H3, également appelé Hailuo 3.0
MiniMax a rendu H3 accessible au public le 31 juillet 2026, le même jour que Seedance 2.5, après une présentation en avant-première lors de la WAIC le 17 juillet. Le nom officiel du modèle est MiniMax H3 ; Hailuo 3.0 est le nom de l’application utilisé par la plupart des créateurs. Il génère des clips de 4 à 15 secondes en résolution native 2K (2 560 × 1 440) à 24 images par seconde, avec un son stéréo à 32 kHz produit en une seule passe, et un système de référence omnidirectionnel pouvant prendre en compte jusqu’à 9 images, 3 clips vidéo et 3 clips audio. Dans les classements d’Artificial Analysis, il occupe la deuxième place dans la catégorie « texte vers vidéo », la troisième dans la catégorie « image vers vidéo » et la première dans le montage vidéo. Le 3 août 2026, MiniMax a publié ses poids ouverts (un transformateur de 33 milliards de paramètres) sur Hugging Face, avec une réserve importante qui sera abordée plus loin : la licence communautaire exclut plusieurs juridictions majeures du déploiement local.
Wan 3, Alibaba
La plateforme tout-en-un pour un référencement efficace
Derrière chaque entreprise prospère se cache une solide campagne de référencement. Mais avec d'innombrables outils et techniques d'optimisation parmi lesquels choisir, il peut être difficile de savoir par où commencer. Eh bien, n'ayez crainte, car j'ai ce qu'il vous faut pour vous aider. Voici la plateforme tout-en-un Ranktracker pour un référencement efficace.
Nous avons enfin ouvert l'inscription à Ranktracker de manière totalement gratuite !
Créer un compte gratuitOu connectez-vous en utilisant vos informations d'identification
Wan 3 est actuellement le modèle le plus sur-décrit dans le domaine de la vidéo IA. Ce qui est vérifiable :
Alibaba le répertorie sur sa propre plateforme Qwen Cloud sous le nom de wan3.0-video, avec un point de terminaison DashScope actif, une tarification à la seconde publiée et une durée maximale de 30 secondes pour les entrées texte, image, audio et vidéo. Ce qui est faux, bien que cela domine la première page des résultats de recherche : il ne s’agit pas de 4K (la grille tarifaire ne propose que des niveaux 480p, 720p et 1080p), il n’est pas open-weight (le dernier produit phare Wan publié sous licence Apache 2.0 était Wan 2.2, il y a plus d’un an), et il ne figure dans aucun classement de performance indépendant.
Un ensemble de domaines ressemblants publie des tableaux de spécifications présentés avec assurance (4K natif, une architecture « mixture-of-experts » de 27B ou 60B, une sortie en open source prévue en avril 2026) qui ne renvoient à aucune source officielle et se contredisent les uns les autres. Un modèle proposant la capacité 4K serait commercialisé à un prix correspondant à cette capacité. L’absence de ce niveau constitue une preuve plus solide que n’importe quelle affirmation marketing. Dans cette confrontation, Wan 3 se présente comme un produit « callable » doté d’un plafond de durée réel et d’une qualité inconnue.
Le tableau de bord
Sept dimensions constituent l’ensemble de la comparaison. Chaque dimension est notée sur une échelle de 100 points, et les chiffres ne sont pas calculés mécaniquement à partir des spécifications. Ils représentent la force des preuves disponibles, ce qui explique pourquoi des fourchettes apparaissent à la place de chiffres uniques, et pourquoi elles s’élargissent fortement pour le Wan 3. Les scores serrés ne sont pas des mesures de laboratoire. Leur seul rôle est de rendre les différences comparatives lisibles d’un seul coup d’œil.
| Critères d’évaluation | Seedance 2.5 | MiniMax H3 | Wan 3 (provisoire) |
| Qualité d’image | 86 à 91 | 89 à 93 | 77 à 88 |
| Mouvement | 85 à 90 | de 84 à 89 | de 76 à 86 |
| Stabilité de la scène | 85 à 90 | 85 à 90 | 79 à 88 |
| Rapidité d'exécution | 85 à 90 | 87 à 92 | 77 à 87 |
| Comportement de la caméra | 85 à 90 | 84 à 89 | 77 à 86 |
| Cohérence humaine | 86 à 91 | de 86 à 91 | de 77 à 87 |
| Gamme créative | 84 à 89 | de 87 à 92 | 78 à 88 |
Tableau 1. Tableau de bord initial. Les fourchettes reflètent le niveau de confiance des données, et non la précision des mesures.

Figure 2. Le même tableau de bord sous forme de fourchettes horizontales. Le point marque le milieu de chaque fourchette. Les barres de Wan 3 sont larges car très peu de ses qualités sont confirmées.

La plateforme tout-en-un pour un référencement efficace
Derrière chaque entreprise prospère se cache une solide campagne de référencement. Mais avec d'innombrables outils et techniques d'optimisation parmi lesquels choisir, il peut être difficile de savoir par où commencer. Eh bien, n'ayez crainte, car j'ai ce qu'il vous faut pour vous aider. Voici la plateforme tout-en-un Ranktracker pour un référencement efficace.
Nous avons enfin ouvert l'inscription à Ranktracker de manière totalement gratuite !
Créer un compte gratuitOu connectez-vous en utilisant vos informations d'identification
Figure 3. Représentation des capacités à l’aide des points médians des fourchettes. Seedance 2.5 penche vers le mouvement et le travail de caméra ; MiniMax H3 penche vers l’image, le script et la gamme ; Wan 3 est à la traîne sur tous les axes par manque de données probantes, et non en raison d’une faiblesse avérée.
1er tour : le test de beauté en plan unique
Le défi est volontairement simple : une personne sous un éclairage cinématographique, un paysage, un intérieur luxueux, un gros plan lent. L’objectif est de déterminer quel modèle produit la première image la plus convaincante et conserve ensuite cette qualité pendant toute la durée du plan. La netteté n’est pas synonyme de réalisme. Une peau trop retouchée, des micro-détails artificiels et des textures instables peuvent tous paraître impressionnants sur une vignette, mais s’effondrer une fois en mouvement.
C’est MiniMax H3 qui présente ici les résultats les plus nets. La sortie native en 2K est une spécification documentée plutôt qu’une simple affirmation, et sa deuxième place au classement « texte-vidéo » repose en partie sur l’aspect des plans uniques finis. Seedance 2.5 vise clairement lui aussi une imagerie haut de gamme, et son héritage laisse présager de bons résultats, mais ByteDance n’a pas publié de chiffre correspondant à une résolution 2K pour la version 2.5 lors de son lancement ; sa netteté maximale est donc supposée plutôt que confirmée. Wan 3 plafonne à une résolution documentée de 1080p, un cran en dessous.
**Vainqueur du round : MiniMax H3. **Pretendant le plus proche : Seedance 2.5. La raison est simple et honnête : le H3 l’emporte grâce à une résolution officiellement indiquée, et non grâce à une image manifestement plus belle.
2e manche : des personnes qui bougent réellement
La difficulté augmente. Marcher, tourner, courir, danser, s’asseoir, se lever, ramasser des objets, faire passer un objet d’une main à l’autre. Ce round récompense la qualité temporelle, et non la beauté des images. Les signes d’échec sont l’instabilité articulaire, des pieds qui glissent ou qui posent mal, une déformation soudaine des membres et un transfert de poids inexistant.
Un test comparatif publié est l’élément de preuve le plus utile de ce round. Dans celui-ci, Seedance 2.5 est resté plus facile à suivre lors des mouvements les plus rapides, et un sujet en tenue blanche aux cheveux roux est resté identifiable pendant que la caméra effectuait un balayage. H3 a opté pour une variété de plans plus audacieuse et des coupes plus nettes, ce qui donne une impression d’énergie mais relève d’un autre atout. Aucun des deux résultats n’a résolu le problème de la chorégraphie : les positions de garde dérivaient et certaines réactions manquaient de cause visible. Sur la question précise de savoir si les mouvements semblent intentionnels plutôt que simplement animés, Seedance l’emporte de justesse.
**Vainqueur du round : Seedance 2.5. **La lisibilité du mouvement à grande vitesse est l’héritage de la gamme Seedance, et la seule comparaison directe disponible le confirme.
3e manche : la caméra se met en mouvement
Suivi, zooms avant, zooms arrière, orbites, panoramiques, inclinaisons, déplacements en contre-plongée, suivi d’un sujet en mouvement. Le test consiste à vérifier si la scène reste structurellement stable lorsque le point de vue change, et si le mouvement de caméra correspond bien à celui demandé par la consigne, plutôt qu’à une dérive cinématographique aléatoire qui se trouve avoir un aspect « cinématographique ».
Seedance 2.5 reprend le contrôle explicite de la caméra par IA de son prédécesseur et ajoute les modifications du point de vue et de la caméra comme commandes de premier ordre. La même séquence de test de combat montrait un sujet conservant son identité malgré un mouvement de balayage, ce qui correspond exactement au problème de reconstruction de l’arrière-plan ciblé par ce tour. H3 gère bien le mouvement et met en avant des mouvements au rythme cinématographique, mais ses commandes sont décrites en termes plus généraux. La distinction entre comportement de caméra demandé et comportement fortuit favorise le modèle qui expose explicitement la direction de la caméra.
**Vainqueur de ce tour : Seedance 2.5. **Les commandes de caméra documentées l’emportent sur une promesse générale de mouvements cinématographiques.
Manche 4 : trop d’actions simultanées
Ce tour vise à mettre les modèles à rude épreuve. Trois personnes ou plus, des foules, des rues animées, des restaurants, des usines, des festivals, des marchés, la circulation. Les critères d’évaluation sont l’organisation de la scène, la persistance des sujets, la cohérence de l’arrière-plan, le nombre d’objets, et la capacité du modèle à maintenir plusieurs instructions simultanées. Un superbe clip qui omet discrètement la moitié de la scène demandée ne devrait pas marquer de points.
Ici, les preuves deviennent évidentes. ByteDance note lui-même que les mouvements physiques complexes et les scènes comportant un très grand nombre de sujets en interaction peuvent encore être améliorés, ce qui constitue un aveu rare et utile concernant Seedance. H3 ne dispose d’aucun benchmark spécifique aux foules sur lequel s’appuyer, et ses points forts s’illustrent dans des plans plus serrés. Rien dans les résultats ne permet de distinguer les deux modèles avec certitude sur des scènes denses, et les deux peinent visiblement.
**Résultat du round : match nul. **La gestion des foules reste un problème non résolu pour les deux, et prétendre le contraire reviendrait à tomber dans le piège de la démo flatteuse que cet article cherche justement à éviter.
5e manche : mains, objets et contact
L’une des sections les plus difficiles. Verser une boisson, ouvrir une boîte, tenir un téléphone, utiliser un outil, cuisiner, écrire, passer un objet, toucher une autre personne, manipuler un petit produit. Le moment à observer est l’interaction physique : mutation des doigts, fusion d’objets, objets qui disparaissent ou changent de forme, contacts impossibles, prises qui se rompent. C’est ce round qui détermine si les séquences publicitaires et de produits sont utilisables sans retouche importante.
Aucune source crédible ne démontre un contact main-objet fiable de la part de l’un des trois systèmes sur des consignes variées. Un seul clip réussi ne prouve rien, car c’est au niveau du contact que la variance est la plus élevée et qu’il est le plus facile de sélectionner les meilleurs exemples. Les testeurs de H3 font état de résultats satisfaisants sur des plans spécifiques ; l’édition au niveau des régions de Seedance 2.5 offre une solution de secours lorsque le contact échoue, ce qui constitue un avantage en termes de flux de travail plutôt qu’un avantage de génération. Aucun des deux ne remporte une victoire incontestable.
**Résultat du round : match nul, avec prudence. **La réussite sur un seul extrait ne garantit pas la fiabilité sur l’ensemble d’une campagne.
6e manche : la physique sous pression
Éclaboussures d’eau, fumée, feu, tissus, cheveux au vent, objets en chute, voitures qui tournent, balles qui rebondissent, liquide versé, matériaux qui se brisent, vent. La vidéo générative produit couramment des mouvements qui semblent plausibles sans modéliser la physique le moins du monde ; le jugement porte donc sur la crédibilité physique perçue : élan, gravité, comportement en cas de collision, continuité des fluides, comportement réel des matériaux.
Il s’agit ici d’une analyse, et non d’une promotion, et il faut reconnaître honnêtement qu’aucun des trois n’a publié d’évaluation physique. L’expérience de Seedance en matière de mouvement laisse entrevoir un avantage en termes d’élan et de fluidité, tandis que la mise en garde de ByteDance concernant les mouvements physiques complexes tempère cette impression. Le comportement physique de H3 n’a pas été démontré à grande échelle. Quant à Wan 3, il n’a fait l’objet d’aucune mesure.
**Résultat du round : match nul. **La crédibilité physique reste le point le plus faible de toute la catégorie, et aucun concurrent n’a réussi à s’imposer sur ce plan.
7e manche : l’identité des personnages
Un personnage reste-t-il reconnaissable tout au long d’un clip, et plus difficile encore, d’une génération à l’autre ? Structure du visage, cheveux, vêtements, accessoires, âge apparent, proportions, peau. C’est là que se joue la réussite ou l’échec d’une série courte, car une mâchoire qui se déplace d’un demi-centimètre au quatrième plan fait perdre le spectateur.
Les deux modèles s’attaquent à ce problème à l’aide de systèmes de référence, et c’est là que les résultats penchent discrètement en faveur de H3. Un testeur pratique ayant mené un projet réel via le système de référence omnidirectionnel de H3, avec des images, un extrait vidéo et de l’audio, a signalé une cohérence des personnages nettement meilleure que prévu et un texte à l’écran net ; H3 occupe par ailleurs la première place en montage vidéo, domaine étroitement lié à la préservation de l’identité. Seedance 2.5 riposte avec un budget de référence bien plus important, pouvant aller jusqu’à 50 éléments, et un positionnement de cohérence de niveau professionnel, mais pour la version 2.5, cela reste une affirmation du fournisseur plutôt qu’un résultat attesté. Une plus grande capacité de référence est prometteuse ; le résultat confirmé par un testeur est plus probant.
**Vainqueur du round : MiniMax H3. **Une cohérence attestée l’emporte sur un plafond de référence plus élevé mais non vérifié. Le contrôle des images de référence modifie les résultats pour les deux solutions, et il ne faut pas supposer que l’une ou l’autre conserve l’identité sans ce contrôle.
8e manche : obéissance immédiate
Différentes formes de consignes récompensent différents modèles : une simple ligne visuelle, un récit, un brief axé sur la caméra, un brief axé sur l’action, une description cinématographique dense et une consigne comportant plusieurs actions séquentielles. L’évaluation porte sur la mémorisation des instructions, la précision du sujet et des actions, l’environnement, le style, le respect des consignes de prise de vue et l’ordre chronologique. Une vidéo époustouflante qui ignore le brief est un échec, pas un triomphe.
H3 présente deux avantages concrets. Sa deuxième place au classement « texte-vidéo » est en soi un indicateur du respect des instructions, et son API prévoit un budget de 7 000 caractères pour les consignes, ce qui laisse une marge suffisante pour des directives véritablement nuancées. Seedance 2.5 suit bien les instructions et offre une prise en charge multilingue solide ; son contrôle des horodatages est excellent pour le cas particulier des actions séquentielles qui doivent se produire à des moments précis. En matière d’obéissance générale, quel que soit le format de la consigne, le modèle évalué arrive en tête ; pour les séquences d’actions codées dans le temps en particulier, Seedance est l’outil le plus performant.
**Vainqueur du round : MiniMax H3. **Une capacité mesurée à suivre les invites associée à un budget d’invite très important ; Seedance s’impose lorsque les actions doivent être synchronisées au rythme.
9e manche : l’instinct cinématographique
Les qualités non mesurables : composition du plan, choix d’éclairage, atmosphère, sens de l’échelle, rythme de la caméra, relations entre les couleurs, intensité dramatique, narration visuelle. Une véritable question se cache derrière ce round. Certains modèles embellissent discrètement une consigne simple ; d’autres suivent les instructions à la lettre. L’amélioration automatique est un atout lorsque le brief est vague, mais un inconvénient lorsqu’il est précis et que le modèle passe outre.
L’héritage de Seedance est profondément ancré dans la production cinématographique, et ses outils explicites de caméra et de point de vue permettent au créateur de diriger le rythme plutôt que d’accepter ce que le modèle préfère. H3 produit de beaux résultats au rythme cinématographique et penche vers une finition automatique, ce qui met en valeur les consignes simples mais peut poser problème face à une consigne exigeante. Pour les créateurs qui souhaitent que la caméra obéisse à un plan, la facilité de mise en scène fait pencher la balance en faveur de Seedance.
**Vainqueur du round : Seedance 2,5. **Un contrôle cinématographique, pas seulement un rendu cinématographique.
Round 10 : contenu stylisé
Le photoréalisme n’est pas le seul critère. Anime, illustration, fantastique, scènes surréalistes, animation en pâte à modeler, animation 3D, visuels de bande dessinée, vidéo picturale. La véritable question est de savoir si le mouvement reste cohérent lorsque les règles visuelles sont délibérément irréalistes, et quel modèle va le plus loin au-delà des séquences réalistes.
H3 est conçu comme un modèle de génération polyvalent et omnimodal plutôt que comme un moteur vidéo axé avant tout sur le réalisme, et c’est précisément cette approche qui répond aux exigences d’une large gamme stylistique. Seedance 2.5 se positionne comme un système de production visant le réalisme commercial et narratif, ce qui constitue un atout dans d’autres domaines mais représente ici une légère limitation. En termes de couverture des styles non réalistes, le modèle généraliste offre une plus grande marge de manœuvre.
**Vainqueur du round : MiniMax H3. **Une conception polyvalente couvre un éventail stylistique plus large qu’une conception optimisée pour la production.
11e manche : vidéo publicitaire
Évaluation du point de vue d’un créatif rémunéré. Publicité pour un parfum, spot pour des baskets, promotion alimentaire, automobile, campagne de mode, lancement de produit technologique, spot de voyage. Les critères sont l’intégrité du produit, le contrôle des mouvements, l’esthétique luxueuse, la réutilisabilité et le niveau de post-production requis par le résultat. Le texte constitue le véritable point d’achoppement : on ne peut compter sur aucun de ces modèles pour préserver de manière fiable la typographie ou un logo ; tout élément de marque à l’écran doit donc être incrusté ultérieurement plutôt que généré.
Seedance 2.5 est conçu pour cela. L’édition au niveau des zones redessine une partie d’une image tout en conservant intacts les rendements et l’éclairage, le montage sur fond vert permet de remplacer l’arrière-plan pendant que le sujet reste immobile, et le contrôle du modèle blanc bloque un plan avec une géométrie sans texture avant l’éclairage. Il s’agit d’une suite de contrôle commerciale, et non d’un simple générateur. H3 répond avec une résolution native de 2K, un texte net dans les rapports de test et des montages basés sur des instructions qui évitent de devoir refaire entièrement la prise, ce qui est vrai, mais la suite d’outils de Seedance correspond plus directement à la manière dont les plans publicitaires sont réellement construits et révisés.
**Vainqueur du round : Seedance 2.5. **Le montage par zone, l’écran vert et le blocage par modèle blanc sont des contrôles de production que les équipes publicitaires intègrent déjà dans leur réflexion.
Round 12 : formats courts pour les réseaux sociaux
Utilité pour TikTok, Reels, Shorts, les publicités verticales et les séquences d’illustration des créateurs. Les critères sont la rapidité, l’accroche visuelle, le cadrage vertical, le mouvement rapide, la facilité à produire de nombreuses variantes et la cohérence au sein d’un lot. Ce round peut couronner un vainqueur différent de celui du format cinématographique, ce qui est bienvenu plutôt qu’une contradiction.
La conception de H3 correspond presque parfaitement au format court : les clips de 4 à 15 secondes correspondent à la durée native du format, la résolution 2K permet de recadrer en vertical, l’audio est enregistré en une seule prise, et les montages basés sur des instructions permettent au créateur d’itérer des variantes sans avoir à repartir de zéro. La prise unique de 30 secondes de Seedance 2.5 dépasse les besoins de la plupart des formats courts, et sa puissance est destinée à des travaux plus longs et plus dirigés. Pour une production verticale à grande échelle, le H3 est le choix le plus naturel.
**Vainqueur de ce round : MiniMax H3. **Durée native des clips courts, marge de recadrage en 2K, audio en une seule passe et création rapide de variantes.
Bilan de la manche, et pourquoi cela ne règle pas tout
Les douze manches ont donné lieu à un résultat serré. MiniMax H3 en a remporté cinq, Seedance 2.5 quatre, trois se sont soldées par un match nul sur des problèmes véritablement ouverts, et Wan 3 n’en a remporté aucune. La colonne vide de Wan 3 ne signifie pas qu’il est faible. Cela signifie simplement que sa qualité n’est pas prouvée : aucune manche ne pouvait être attribuée à un modèle sans preuve vérifiable de sa qualité, et inventer des victoires pour équilibrer le bilan trahirait la méthode.

Figure 4. Bilan des manches. Les victoires de H3 se concentrent sur des atouts vérifiables (résolution, cohérence attestée, respect mesuré des consignes, portée, format court) ; celles de Seedance 2.5 se concentrent sur la maîtrise des mouvements et les outils de contrôle commercial.
Il existe une réelle tension qui mérite d’être soulignée. Sur plusieurs des manches techniques les plus difficiles – mouvement, caméra et contrôle commercial –, Seedance 2.5 apparaît comme le moteur vidéo pur le plus performant. Pourtant, le titre général, attribué ultérieurement en fonction du poids des preuves, ne découle pas simplement du décompte des manches. Les manches mesurent les domaines dans lesquels les preuves et le positionnement de chaque fournisseur sont les plus solides. Le championnat détermine quelle qualité est réellement vérifiée et quel accès est réellement effectif.
Où chaque modèle présente encore des failles
Chaque modèle de vidéo générative présente des failles récurrentes. Il s’agit là des signatures d’échec les plus cohérentes avec les preuves disponibles, et non de faiblesses inventées de toutes pièces pour imposer un équilibre artificiel.
Seedance 2.5
Les deux points faibles les plus crédibles proviennent du cadre défini par ByteDance lui-même et de l’historique plus large : les scènes denses comportant de nombreux sujets en interaction et les mouvements physiques complexes, deux domaines pour lesquels le développeur reconnaît qu’il y a matière à amélioration. Le contact entre les mains et les objets reste peu fiable selon les différentes consignes, comme c’est le cas dans ce domaine. Et un échec pratique qui n’a rien à voir avec les pixels : au moment de la rédaction de cet article, l’API publique n’avait pas encore été mise à disposition, ce qui bloquait toute intégration dans un pipeline automatisé, quelle que soit la qualité du résultat.
MiniMax H3
Le principal risque réside davantage dans un problème de licence que dans un problème de rendu. Les poids ouverts excluent les États-Unis, l’Union européenne, le Royaume-Uni et la Corée du déploiement local, et la plus petite configuration locale fonctionnelle s’exécute en natif à 768 pixels sur le côté le plus court, la véritable résolution 2K n’étant accessible que via un passage de régénération hébergé qui n’était pas inclus dans la version téléchargeable. En ce qui concerne la sortie elle-même, les foules et la physique n’ont pas été testées, les contacts ne sont pas fiables et la durée des clips est limitée à 15 secondes en mode natif, ce qui est court pour un travail narratif.
Wan 3
La faiblesse principale est d’ordre épistémique. L’absence de benchmark indépendant, de rapport technique, de fiche technique et de classement signifie que toutes les allégations de qualité concernant Wan 3 restent invérifiées. Tout cela est entouré d’une couche de spécifications inventées de toutes pièces (4K, poids ouverts, nombres de paramètres exotiques) qu’un lecteur attentif doit activement écarter. Le seul fait commercial avéré est défavorable : en 1080p, son prix s’avère plus élevé que celui de tous les modèles testés classés au-dessus du Wan 2.7 d’Alibaba dans les classements publics.
Les spécifications, remises à leur place
Ce n’est qu’après l’analyse de qualité que les chiffres ont leur place sur la page, et plusieurs d’entre eux sont signalés comme incertains car leurs fabricants ne les ont pas précisés. Les spécifications décrivent le potentiel, pas les performances.
| Caractéristique | Seedance 2,5 | MiniMax H3 | Wan 3 |
| Résolution maximale | Non publiée pour la version 2.5 | 2K (2560 x 1440) | 1080p (selon la fiche tarifaire) |
| Durée maximale | 30 s en un seul passage | 4 à 15 s (extensible) | 30 s |
| Audio natif | Oui | Oui, stéréo à 32 kHz | Oui |
| Références d'images | Jusqu'à 30 | Jusqu'à 9 | Omnimodal, non précisé |
| Références vidéo / audio | 10 vidéos, 10 fichiers audio | 3 vidéos, 3 fichiers audio | Prise en charge, non précisée |
| Première / dernière image | Prise en charge | Oui (les deux images) | Prise en charge |
| Extension vidéo | Extension multi-tours | Extensible jusqu’à environ 30 s | Modes d’édition / de pilotage |
| Disponibilité de l'API | En attente (ModelArk) | En direct | En direct (Qwen Cloud) |
| Poids ouverts | Non | Oui, avec des exceptions | Non |
| Indice de référence indépendant | Aucun (2,0 est un score élevé) | N° 2 pour T2V, n° 1 pour le montage | Aucun |
Tableau 2. Référence technique. Les champs laissés vides par le fournisseur sont signalés comme tels plutôt que remplis d’estimations plausibles.
Se procurer les modèles
La disponibilité distingue ces trois modèles aussi nettement que n’importe quel indicateur de qualité. MiniMax H3 est le plus facile d’accès et le plus simple à automatiser : une API active, une application publique et des poids téléchargeables pour les équipes situées en dehors des juridictions exclues, avec la précision importante que la génération locale est native en 768 pixels et que la véritable résolution 2K reste hébergée. Wan 3 dispose d’un point de terminaison commercial actif sur le Qwen Cloud d’Alibaba, avec des tarifs publiés et des limites de concurrence modestes (deux requêtes simultanées, une file d’attente asynchrone de 50 tâches, 30 requêtes par minute) ; il est donc possible de s’en servir dès aujourd’hui, en acceptant le risque lié à la qualité. Seedance 2.5 représente le cas le plus compliqué : accessible via Jimeng et Doubao pour une création manuelle, mais sans API publique à l’heure où nous écrivons ces lignes, ce qui bloque tout workflow de développement jusqu’à ce que ByteDance ouvre l’accès à ModelArk.
La question cruciale pour une équipe de production est de savoir si un modèle peut être intégré dans un pipeline classique. Deux des trois répondent aujourd’hui par l’affirmative. Seedance 2.5 répond « pas encore », aussi performants que soient ses résultats.
Le coût réel s’évalue par clip exploitable
Les prix d’abonnement et au seconde ne constituent pas une bonne base de comparaison. Le chiffre qui importe est le coût par résultat utilisable. Un modèle moins cher devient rapidement onéreux si un créateur doit effectuer dix générations pour obtenir un clip acceptable, tandis qu’un modèle plus coûteux présentant un taux élevé de plans utilisables peut s’avérer être le choix le plus économique dans la pratique. Aucun chiffre honnête par clip réussi ne peut être publié pour aucun de ces modèles, car les taux de plans utilisables ne sont pas mesurés ; ce principe doit donc être appliqué de manière qualitative.

La plateforme tout-en-un pour un référencement efficace
Derrière chaque entreprise prospère se cache une solide campagne de référencement. Mais avec d'innombrables outils et techniques d'optimisation parmi lesquels choisir, il peut être difficile de savoir par où commencer. Eh bien, n'ayez crainte, car j'ai ce qu'il vous faut pour vous aider. Voici la plateforme tout-en-un Ranktracker pour un référencement efficace.
Nous avons enfin ouvert l'inscription à Ranktracker de manière totalement gratuite !
Créer un compte gratuitOu connectez-vous en utilisant vos informations d'identification
Figure 5. Prix catalogue vérifiés par minute générée. Seedance 2.5 n’apparaît pas car ByteDance n’avait publié aucun prix via l’API au moment de la rédaction ; seuls des crédits de plateforme existaient.
Sur la base des prix catalogue publiés, MiniMax H3 est la solution la moins chère parmi celles évaluées, à 7,80 dollars par minute en 2K. Wan 3 s’établit à 12,00 dollars par minute en 1080p, soit environ un tiers de plus que le Wan 2.7 d’Alibaba et plus cher que tous les modèles classés au-dessus du Wan 2.7 dans le classement public, tout en n’offrant aucun benchmark propre. Cette combinaison, à un prix supérieur à celui des autres options évaluées et dont la qualité est inconnue, constitue la mise en garde commerciale la plus forte de cette comparaison. Seedance 2.5 ne peut pas encore être placé sur l’axe, car seules des unités de crédit de la plateforme étaient disponibles au moment de la rédaction. D’un point de vue qualitatif, le faible prix du H3, associé à une qualité attestée, lui confère le meilleur rapport coût par clip utilisable, tandis que le prix élevé du Wan 3, pour une qualité non prouvée, lui confère le plus faible.
Choix rapides par type de projet
Pour les plans de type cinématographique
Seedance 2.5, avec MiniMax H3 comme alternative. Les commandes de caméra et de point de vue orientables, associées à une lignée cinématographique, conviennent au travail plan par plan. H3 est la solution de repli lorsque l’obtention d’une image 2K vérifiée et d’une API en temps réel prime sur une direction de caméra précise.
Pour les scènes à mouvement rapide
Seedance 2.5, avec MiniMax H3 comme alternative. La seule comparaison de mouvement direct a donné l’avantage à Seedance pour sa lisibilité à grande vitesse. Le montage plus net du H3 constitue un atout stylistique plutôt qu’un avantage en termes de stabilité du mouvement.
Pour la publicité
Seedance 2.5, avec MiniMax H3 comme alternative, une fois que son API sera disponible. L’édition par zone, l’utilisation de l’écran vert et le blocage des modèles blancs correspondent à la manière dont les spots sont créés et révisés. Le texte à l’écran plus net de H3 et sa disponibilité immédiate en font le choix pragmatique tant que l’API de Seedance n’est pas encore disponible.
Pour les personnages humains
MiniMax H3, avec Seedance 2.5 comme alternative. La cohérence omni-référentielle confirmée par un testeur et son classement parmi les meilleurs en matière de montage l’emportent sur le budget de référence plus important, mais non vérifié, de Seedance. Seedance prend le relais lorsque la continuité sur une longue séquence comportant plusieurs plans est la priorité.
Pour les visuels expérimentaux
MiniMax H3, avec Wan 3 comme alternative lointaine. Une conception omnimodale polyvalente couvre plus aisément les travaux stylisés et surréalistes qu’un système de production axé sur le réalisme.
Pour les développeurs
MiniMax H3, avec Wan 3 comme alternative. H3 offre une API en temps réel, des paramètres documentés et des poids respectant les limites autorisées. Wan 3 est d’ores et déjà disponible pour les équipes qui ont besoin d’une prise unique de 30 secondes et peuvent accepter une qualité non mesurée ; Seedance 2.5 est exclu jusqu’à l’ouverture de son API.
Pour un contrôle local
MiniMax H3 lorsque la licence le permet ; sinon, Wan 2.2 reste la solution honnête à poids ouverts pour l’auto-hébergement. Ni Seedance 2.5 ni Wan 3 ne fournissent de poids, ce qui rend impossible leur déploiement sur site.
Le classement final
Revenons aux sept dimensions, désormais sous forme de totaux. Comme le tableau de bord mesure la force des preuves plutôt que l’ambition des fournisseurs, la position vérifiée de MiniMax H3 lui permet de devancer de justesse Seedance 2.5, dont les preuves spécifiques à la version 2.5 sont moins solides. Les fourchettes se chevauchent, ce qui indique clairement que, sur le plan technique, les deux premiers sont au coude à coude. Wan 3 se retrouve loin derrière, avec la fourchette la plus large et le niveau de confiance le plus bas.
| Modèle | Total (sur 700) | Confiance | Meilleure / pire catégorie |
| MiniMax H3 | 602 à 636 | Moyen-élevé | Points forts : image, portée / Point faible : appareil photo |
| Note : 2,5 | 596 à 631 | Moyenne | Points forts : mouvements, caméra / Points faibles : foule |
| Wan 3 | 541 à 610 | Faible | Points forts : durée / Points faibles : qualité non vérifiée |
Tableau 3. Classement final. Les totaux correspondent à la somme des fourchettes des sept dimensions pondérées par les preuves.

Figure 6. Fourchettes de scores totaux avec niveau de confiance. Le chevauchement entre les deux premiers est déterminant : le titre dépend du poids des preuves, et non d’une avance écrasante.
Vainqueur, deuxième et choix des spécialistes
Champion toutes catégories : MiniMax H3
H3 l’emporte car c’est le seul concurrent dont la qualité est vérifiée et non simplement promise. Il occupe une place de référence publique, active et de premier plan, fournit des poids téléchargeables, fonctionne dès aujourd’hui sur une API opérationnelle et présente le profil de coût le plus clair parmi les moteurs évalués. Il a également démontré une cohérence attestée des caractères et un rendu textuel impeccable à l’écran lors d’utilisations pratiques réelles. Il ne remporte pas toutes les manches, et ce n’est pas manifestement le moteur le plus esthétique ou le plus cinématographique. Il remporte toutefois le test propre à cette confrontation : une fois les belles démos mises de côté, c’est le modèle dont les performances reproductibles peuvent réellement être confirmées.
Deuxième place : Seedance 2.5
Seedance 2.5 présente le plus grand potentiel et les arguments techniques les plus solides : une meilleure lisibilité des mouvements lors de la seule comparaison directe, un contrôle explicite de la caméra, la suite de montage commerciale la plus complète et le budget de référence le plus important de la catégorie, soutenu par une lignée qui a dominé les classements vidéo publics. Il perd le titre pour deux raisons que la méthode ne peut ignorer : sa qualité spécifique à la version 2.5 n’a pas encore été mesurée de manière indépendante, et son API publique n’avait pas encore été mise à disposition au moment de la rédaction de cet article. Dès que cette API sera accessible et que des tests de performance indépendants seront publiés, ce classement pourrait s’inverser.
Choix des spécialistes : Wan 3
Wan 3 remporte l’adhésion des spécialistes grâce à un avantage concret et vérifiable : une API en production dès aujourd’hui qui génère une prise complète de 30 secondes en un seul passage, ce qui convient à une équipe ayant besoin d’un spot entier généré d’un seul coup et ne pouvant pas attendre le point de terminaison de Seedance. Cet avantage tient à la disponibilité d’une fonctionnalité spécifique, et non à une qualité démontrée ; ce choix doit donc être fait en toute connaissance de cause, plutôt que de privilégier le modèle d’Alibaba, dont le prix a été mesuré mais dont les performances ne sont pas encore confirmées dans le classement. Il s’agit d’un outil destiné à une tâche très spécifique, et non d’une recommandation générale.
Verdict
Si les trois sont capables de produire une belle démo, celui qui continue à être performant lorsque la scène devient difficile est celui dont les performances face à la complexité sont réellement vérifiées. D’après les éléments dont nous disposons aujourd’hui, il s’agit de MiniMax H3 : mesuré, téléchargeable, accessible par API et abordable, même s’il n’est pas le moteur le plus spectaculaire du marché. Seedance 2.5 est le modèle vidéo le plus prometteur sur le plan technique et pourrait bien remporter la palme une fois que son API et ses benchmarks seront disponibles, ce qui en fait un outil à surveiller plutôt qu’un choix à privilégier cette semaine. Wan 3 est un véritable produit utilisable, mais noyé sous des spécifications exagérées ; il ne vaut la peine d’être utilisé que pour sa capacité à réaliser des prises uniques de 30 secondes, et doit être abordé avec un scepticisme de mise dans tous les autres cas. La recommandation varie en fonction du projet : optez pour Seedance lorsque la réalisation cinématographique et le montage publicitaire sont prioritaires, optez pour H3 lorsque la qualité vérifiée, le travail sur les personnages, le volume de formats courts ou un pipeline en direct sont prioritaires, et optez pour Wan 3 uniquement lorsqu’un seul plan séquence long, disponible dès aujourd’hui, est l’exigence spécifique. Surtout, ne payez pas pour la 4K sur Wan 3. Elle n’est pas au menu.

