1. Abstract
LongCat-Video-Avatar est un modèle de génération vidéo d’avatar (humain virtuel) piloté par l’audio basé sur l’architecture LongCat-Video, adapté à des scénarios de « longue séquence temporelle, forte cohérence, réaliste et dynamique ». Il prend en charge nativement l’Audio-Texte-Verse-Vidéo (AT2V), Audio-Texte-Image-Verse-Vidéo (ATI2V) et la Continuation Vidéo, et met l’accent sur la stabilité et la cohérence d’identité dans la génération de vidéos multi-caractères et de longue durée.
2. Caractéristiques principales
1. Intégration de trois modes natifs : le même cadre couvre AT2V, ATI2V et la continuation vidéo, et convient à une seule ou plusieurs personnes et à une ou plusieurs entrées audio.
2. Qualité d’image stable pour les longues vidéos : le stitching latent en croix réduit la dégradation des pixels et l’accumulation d’erreurs dans les longues séquences en diminuant les boucles répétées de décodage-encodage VAE entre segments, améliorant ainsi la qualité du stitching sans couture.
3. Cohérence d’identité à long terme : Saut d’attention par référence supprime la sensation rigide de copier-coller causée par la « fuite conditionnelle de l’image » tout en conservant les caractéristiques d’identification du caractère.
4. Dynamiques humaines plus naturelles : Grâce au découplage du guidage inconditionnel, les signaux de parole et les dynamiques d’action sont plus raisonnablement séparés, réduisant ainsi le phénomène anormal de « mouvement de la bouche mais raideur ».
5. Alignement de l’évaluation avec la perception réelle : La fiche modèle affiche les résultats d’évaluation humaine basée sur EvalTalker, utilisée pour mesurer la naturalité et le réalisme d’une ou plusieurs personnes (la conclusion spécifique dépend du rapport officiel et de l’expérience de reproduction).
3. Installation
- Cloner le code et créer un environnement :
- git clone --single-branch --branch principal https://github.com/meituan-longcat/LongCat-Video
- Environnement recommandé pour Python 3.10 +
- Conda 2. Installer les dépendances (sélectionner la torche correspondante selon la version CUDA) :
- Installer torch/torchvision/torchaudio
- et installer flash-attn (FlashAttention-2 est activé par défaut dans la configuration du modèle, qui peut être commuté si besoin).
- pip install -r requirements.txt
- Avatar Dépendances supplémentaires : librosa, ffmpeg, pip install -r requirements_avatar.txt
- 3. Poids en téléchargement : Utilisez huggingface-cli pour connecter LongCat-Video avec LongCat-Video-Avatar Téléchargez dans l’annuaire local des poids.
4. Cas d’usage typiques
- Ancrage virtuel/diffusion orale : Générer de longues vidéos avec des formes et expressions de lèvres stables basées sur l’audio et les scripts.
- Podcast/interview : Soutenir la prise de parole à long terme et plusieurs personnes pour alterner leurs discours, en mettant l’accent sur la cohérence identitaire et le splicing naturel.
- Chant/performance scénique : Rendre le rythme de l’action plus synchronisé avec le chant, adapté à la génération continue de courts clips à longs paragraphes.
- Explication du service client/ventes : Transition plus naturelle entre paragraphes silencieux et pauses pour réduire l’apparence et la sensation de « bloqué ».
- Continuation vidéo : Extension de la génération à l’épissage multi-paragraphes, adaptée à la production de contenu de « longueur illimitée » et au montage itératif.
5. Écologie et concurrents
- Écologie : LongCat-Video offre des capacités de conversion texte/image et d’écriture ; Avatar complète le pilote audio et la génération vidéo de conversations multi-personnes, et fournit des scripts d’inférence rapides et des suggestions de paramètres grâce à la carte modèle Hugging Face.
- Produits concurrents/directions associées : InfiniteTalk (image longue doublée par image clairsemée), StableAvatar (mettant l’accent sur la longueur infinie et le bout à bout), MultiTalk (génération de dialogues multi-personnes) et d’autres solutions mettent leur propre accent sur la « préservation de l’identité, la stabilité des longues séquences et l’interaction multi-personnes ». Les différences entre LongCat-Video-Avatar se concentrent davantage sur le mécanisme de stabilisation intersegment et la manière dont l’information de référence est injectée.
6. Limitations et précautions
- Les vidéos longues et les caractères multiples exigent de grandes exigences en mémoire vidéo et en puissance de calcul, et la vitesse d’inférence est fortement liée à la résolution/fréquence/nombre de segments.
- Le mode multi-audio doit être aligné en longueur ou assemblé selon les règles, et une mauvaise organisation des entrées affectera la naturalité de la synchronisation labiale et de la rotation.
- La vidéo générative peut présenter des dérives de détail, une forme de lèvre parfois inexacte ou des défauts dans des zones à haute fréquence comme les mains ou les dents, il est donc recommandé de revoir manuellement et de retoucher les clips de touches.
- Les applications impliquant des portraits et des voix doivent respecter les exigences de confidentialité, d’autorisation et de conformité au contenu, en particulier dans les scénarios de diffusion commerciale et publique.
7. Adresse
du projet https ://github.com/meituan-longcat/LongCat-Video
8. Question FAQ
: LongCat-Video-Avatar est-il pris en charge ? AT2V (Audio + Texte en vidéo) ?
Réponse : Oui, le modèle fournit nativement une entrée d’inférence AT2V et suggère d’ajouter des indices d’action clairs comme « parler/parler » à l’invite pour améliorer la synchronisation labiale et la dynamique.
Question : À quels scénarios l’ATI2V (Audio + Texte + Image vers Vidéo) de LongCat-Video-Avatar est-elle adaptée ?
Réponse : Il convient à la génération virtuelle d’humains qui doit corriger l’image ou le style vestimentaire du personnage, améliorant ainsi la cohérence entre l’ID et l’apparence grâce à des diagrammes de référence.
Question : Comment LongCat-Video-Avatar peut-il réduire le problème des longues vidéos qui deviennent de plus en plus floues ?
Réponse : Son point latent en croix est conçu pour réduire les boucles VAE qui se répètent entre les segments, ce qui entraîne une dégradation des pixels et une accumulation d’erreurs moindres.
Question : LongCat-Video-Avatar peut-il dialoguer plusieurs personnages et se relayer ?
Réponse : Le mode multijoueur et plusieurs formats d’entrée audio sont pris en charge, mais ils doivent être configurés selon les paramètres et l’organisation audio du script officiel pour obtenir un effet de rotation plus naturel.
Q : Quelle est la différence fondamentale entre LongCat-Video-Avatar et InfiniteTalk ?
Réponse : InfiniteTalk est plutôt enclin à suivre la voie du « doublage/alignement des vidéos existantes depuis longtemps » ; LongCat-Video-Avatar met l’accent sur la génération et la continuation pilotées par l’audio sous une architecture unifiée, et améliore la cohérence des longues séquences grâce à la stabilisation en cross-clip.