1. Abstract
LongCat-Video-Avatar ist ein audiogetriebenes Avatar-(virtueller Mensch-)Video-Generierungsmodell, das auf der LongCat-Video-Architektur basiert und sich für "lange Zeitsequenzen, starke Konsistenz, realistische und dynamische" Szenarien eignet. Es unterstützt nativ Audio-Text-to-Video (AT2V), Audio-Text-Bild-zu-Video (ATI2V) und Video Continuation und legt Wert auf Stabilität und Identitätskonsistenz bei der Mehrzeichen- und Langform-Videogenerierung.
2. Kernmerkmale
1. Integration von drei nativen Modi: Dasselbe Framework deckt AT2V, ATI2V und Videofortsetzung ab und eignet sich für einzelne/mehrere Personen sowie einzelne/mehrere Audioeingänge.
2. Stabile Bildqualität für lange Videos: Cross-Chunk Latent Stitching reduziert Pixeldegradation und Fehleransammlung in langen Sequenzen, indem wiederholte VAE-Dekodierungsschleifen über Segmente reduziert werden und so die Qualität nahtloser Stitching verbessert wird.
3. Langfristige Identitätskonsistenz: Reference Skip Attention unterdrückt das steife Copy-Paste-Gefühl, das durch "bedingte Bildleckage" verursacht wird, während die Charakter-ID-Eigenschaften erhalten bleiben.
4. Natürlichere menschliche Dynamiken: Durch die Entkopplung bedingungsloser Führung werden Sprachsignale und Handlungsdynamiken vernünftiger voneinander getrennt, wodurch das unnatürliche Phänomen der "Mundbewegung, aber Steifheit" reduziert wird.
5. Ausrichtung der Bewertung mit der realen Wahrnehmung: Die Modellkarte zeigt menschliche Bewertungsergebnisse basierend auf EvalTalker, das verwendet wird, um die Natürlichkeit und Realismus von einzelnen/mehreren Personen zu messen (die konkrete Schlussfolgerung unterliegt dem offiziellen Bericht und dem Fortpflanzungsexperiment).
3. Installation
- Code klonen und eine Umgebung erstellen:
- git-klon --einzel-branch --branch main https://github.com/meituan-longcat/LongCat-Video
- Empfohlene Python 3.10 + Conda-Umgebung
- 2. Installiere Abhängigkeiten (wähle den entsprechenden Torch gemäß der CUDA-Version):
- Installiere torch/torchvision/torchaudio
- und installiere flash-attn (FlashAttention-2 ist standardmäßig in der Modellkonfiguration aktiviert, das bei Bedarf gewechselt werden kann).
- pip install -r requirements.txt
- Avatar Weitere Abhängigkeiten: librosa, ffmpeg, pip install -r requirements_avatar.txt
- 3. Download-Gewicht: Verwenden Sie huggingface-cli, um LongCat-Video mit LongCat-Video-Avatar zu verbinden Laden Sie sie in das lokale Gewichteverzeichnis herunter.
4. Typische Anwendungsfälle
- Virtueller Moderator/mündliche Übertragung: Lange Videos mit stabilen Lippenformen und -ausdrücken basierend auf Audio und Skripten generieren.
- Podcast/Interview: Unterstützen Sie langfristige Gespräche und mehrere Personen zum Austausch der Reden, wobei Identitätskonsistenz und natürliches Schneiden betont werden.
- Gesang/Bühnenauftritt: Den Rhythmus der Handlung besser mit dem Gesang synchronisieren, geeignet für die kontinuierliche Erzeugung von kurzen Clips zu langen Absätzen.
- Erklärung zum Kundenservice/Vertrieb: Wechseln Sie natürlicher zwischen stillen Absätzen und Pausen, um das Aussehen und Gefühl von "festgefahren" zu reduzieren.
- Videofortsetzung: Erweitere die Generierung auf mehrteiliges Schneiden, geeignet für die Produktion von Inhalten in unbegrenzter Länge und iterative Bearbeitung.
5. Ökologie und Wettbewerber
- Ökologie: LongCat-Video bietet Text-/Bild-zu-Video- und Schreibmöglichkeiten; Avatar ergänzt den Audiotreiber und die Mehrpersonen-Gesprächsvideo-Generierung und liefert schnelle Inferenzskripte und Parametervorschläge mit der Hugging Face Modellkarte.
- Konkurrierende Produkte/verwandte Richtungen: InfiniteTalk (spärliche Frames als Long Video gedubbt), StableAvatar (mit Schwerpunkt auf unendlicher Länge und End-to-End), MultiTalk (Mehrpersonen-Dialoggenerierung) und andere Lösungen legen ihren eigenen Schwerpunkt auf "Identitätsbewahrung, Stabilität langer Sequenzen und Mehrpersoneninteraktion". Die Unterschiede zwischen LongCat-Video-Avatar konzentrieren sich stärker auf den Cross-Segment-Stabilisierungsmechanismus und die Art und Weise, wie die Referenzinformationen eingeschleust werden.
6. Einschränkungen und Vorsichtsmaßnahmen
- Lange Videos und mehrere Zeichen stellen hohe Anforderungen an Videospeicher und Rechenleistung, und die Schlussgeschwindigkeit hängt stark mit Auflösung/Bildrate/Anzahl der Segmente zusammen.
- Der Multi-Audio-Modus muss in der Länge ausgerichtet oder gemäß Regeln zusammengeschnitten werden, und eine unsachgemäße Eingabeorganisation beeinträchtigt die Natürlichkeit von Lippensynchronisation und Rotation.
- Generatives Video kann Detailabweichungen, gelegentlich ungenaue Lippenformen oder Defekte in hochfrequenten Bereichen wie Händen/Zähnen aufweisen, daher wird empfohlen, die Tastenclips manuell zu überprüfen und nach der Retusche zu überprüfen.
- Anwendungen mit Porträts und Stimmen müssen Datenschutz-, Autorisierungs- und Inhaltsanforderungen erfüllen, insbesondere in kommerziellen und öffentlichen Veröffentlichungsszenarien.
7. Projektadresse
https://github.com/meituan-longcat/LongCat-Video
8. FAQ-Frage
: Wird LongCat-Video-Avatar unterstützt? AT2V (Audio + Text zu Video)?
Antwort: Ja, das Modell bietet nativ einen AT2V-Inferenzeintrag und schlägt vor, klare Aktionssignale wie "sprechen/sprechen" zum Prompt hinzuzufügen, um das Lippensynchronisieren und die Dynamik zu verbessern.
Frage: Für welche Szenarien eignet sich LongCat-Video-Avatars ATI2V (Audio + Text + Bild zu Video)?
Antwort: Es eignet sich für die virtuelle menschliche Generierung, die das Bild/den Kleidungsstil der Figur anpassen und die Konsistenz zwischen ID und Aussehen durch Referenzdiagramme verbessern muss.
Frage: Wie reduziert LongCat-Video-Avatar das Problem, dass lange Videos immer verschwommener werden?
Antwort: Sein Cross-Chunk Latent Stitching ist darauf ausgelegt, VAE-Schleifen zu reduzieren, die sich über Segmente hinweg wiederholen, was zu geringerer Pixeldegradierung und Fehlerakkumulation führt.
Frage: Kann LongCat-Video-Avatar Dialoge mit mehreren Charakteren führen und abwechseln?
Antwort: Der Mehrspielermodus und mehrere Audioeingabeformate werden unterstützt, müssen aber entsprechend den Parametern und der Audioorganisation des offiziellen Skripts konfiguriert werden, um einen natürlicheren Rotationseffekt zu erzielen.
F: Was ist der Hauptunterschied zwischen LongCat-Video-Avatar und InfiniteTalk?
Antwort: InfiniteTalk neigt eher dazu, bestehende Videos seit langem zu synchronisieren und auszurichten; LongCat-Video-Avatar legt großen Wert auf audiogesteuerte Erzeugung und Fortsetzung unter einer einheitlichen Architektur und verbessert die Konsistenz langer Sequenzen durch Cross-Clip-Stabilisierung.