v1 (par défaut) : Photo fixe — rapide, bon photoréalisme.
v2 : Vidéo (1–5 min de discours naturel, 16:9, éclairage uniforme, caméra stable, audio clair) ou photo — qualité maximale, jusqu'à plusieurs heures de génération.
Exigences photo : Visage de face avec yeux, nez, bouche et lèvres visibles. Cadrage taille haute 16:9, éclairage uniforme, une seule personne.
Ne fonctionne pas : Pas de visage, visage partiellement caché, art abstrait. Couvertures faciales religieuses/culturelles : La bouche doit être visible — soumettre un ticket.
Génération asynchrone : Les erreurs apparaissent à la prochaine ouverture de l'éditeur. Artefacts verts : Réimportez avec un fond uni clair.