1. Abstract
LongCat-Video-Avatarは、LongCat-Videoアーキテクチャに基づく音声駆動型アバター(仮想人間)ビデオ生成モデルで、「長時間のシーケンス、強い一貫性、リアルかつ動的な」シナリオに適しています。 ネイティブに音声テキストからビデオ(AT2V)、音声テキスト画像変換(ATI2V)、ビデオ継続に対応しており、多文字および長尺動画生成における安定性とアイデンティティの一貫性を強調しています。
2. コア機能
1. 3つのネイティブモードの統合:同じフレームワークでAT2V、ATI2V、ビデオ継続をカバーし、単一・複数人および単一・複数音声入力に適しています。
2. 長尺動画の安定した画質:クロスチャンク・ラテントスティッチングは、セグメント間のVAEデコードループを繰り返すことで、長距離シーケンスにおけるピクセル劣化や誤りの蓄積を減らし、シームレスステッチの品質を向上させます。
3. 長期的な同一性:参照スキップ注意は「条件付き画像漏れ」による硬いコピー&ペースト感を抑えつつ、文字IDの特徴は保持します。
4. より自然な人間の動態:無条件の誘導を切り離すことで、音声信号と行動のダイナミクスがより合理的に分離され、「口の動きと硬さ」という不自然な現象が減少します。
5. 評価と実際の知覚の整合性:モデルカードはEvalTalkerに基づく人間の評価結果を示し、単独または複数の人の自然さやリアリズムを測定するために使われます(具体的な結論は公式報告および再現実験の対象となります)。
3. インストール
- コードをクローンし、環境を作成する:
- git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
- 推奨Python 3.10 + Conda環境
- 2. 依存関係をインストールする(CUDAバージョンに応じて対応するトーチを選択してください):
- torch/torchvision/torchaudioをインストールし
- 、flash-attnをインストールします(モデル設定ではFlashAttention-2がデフォルトで有効で、必要に応じて切り替え可能です)。
- pip install -r requirements.txt
- Avatar 追加の依存関係:librosa、ffmpeg、pip install -r requirements_avatar.txt
- 3. Download weight: huggingface-cli を使って LongCat-Video と LongCat-Video-Avatar を接続してください 地元のウェイトディレクトリにダウンロードできます。
4. 典型的なユースケース
- バーチャルアンカー/口頭放送:音声や台本を基に安定した唇の形や表情を持つ長尺動画を生成する。
- ポッドキャスト/インタビュー:長期的なスピーチと複数人のスピーチをローテーションで行う支援を行い、アイデンティティの一貫性と自然なスプライシングを重視します。
- 歌唱/舞台パフォーマンス:アクションのリズムをよりボーカルと同期させ、短いクリップから長い段落までの連続生成に適しています。
- カスタマーサービス/営業説明:「詰まった」という印象や雰囲気を和らげるために、無言の段落と間の間の移行をより自然に行う。
- ビデオ継続:生成を複数段落のスプライシングに拡大し、「無制限の長さ」のコンテンツ制作や反復編集に適しています。
5. 生態学と競合
- 生態学:LongCat-Videoはテキスト/画像から動画への変換および書き込み機能を提供します。 Avatarはオーディオドライバーや複数人会話動画生成を補完し、Hugging Faceモデルカードで迅速な推論スクリプトやパラメータ提案を提供します。
- 競合製品/関連方向:InfiniteTalk(スパースフレームに長尺動画と吹き替え)、StableAvatar(無限長とエンドツーエンドを重視)、MultiTalk(複数人ダイアログ生成)など、それぞれが「アイデンティティ保持、長いシーケンスの安定性、多人数対話」に重点を置いています。 LongCat-Video-Avatarの違いは、クロスセグメントの安定化メカニズムと参照情報の注入方法により焦点が当てられています。
6. 制限と注意事項
- 長い動画や複数文字はビデオメモリと計算能力に高い要求があり、推論速度は解像度/フレームレート/セグメント数と強く関連しています。
- マルチオーディオモードは長さを合わせるか、ルールに従ってスプライスする必要があり、入力の整理が不適切なとリップシンクや回転の自然さに影響します。
- 生成動画にはディテールドリフト、時折唇の形が不正確、手や歯などの高周波部分に欠陥がある可能性があるため、手動で確認し、リタッチ後のキークリップを確認することが推奨されます。
- 肖像画や声を含むアプリケーションは、特に商業および公開の場面でプライバシー、認可、コンテンツ準拠の要件を満たす必要があります。
7. プロジェクトアドレス
https://github.com/meituan-longcat/LongCat-Video
8. よくある
質問:LongCat-Video-Avatarはサポートされていますか? AT2V(音声+テキストからビデオへの変換)?
回答:はい、モデルはネイティブにAT2Vの推論エントリを提供し、リップシンクやダイナミクスを改善するために「話す/話す」などの明確なアクションキューをプロンプトに追加することを提案しています。
質問:LongCat-Video-AvatarのATI2V(音声+テキスト+画像から映像)はどのようなシナリオに適していますか?
回答:キャラクターのイメージや服装スタイルを固定し、IDと外見の一貫性を高めるために参照図を使っている仮想人間生成に適しています。
質問:LongCat-Video-Avatarは、長い動画がどんどんぼやけていく問題をどのように軽減していますか?
回答:クロスチャンク潜在ステッチングはセグメント間で繰り返されるVAEループを減らすために設計されており、ピクセル劣化や誤りの蓄積を抑える効果があります。
質問:LongCat-Video-Avatarは複数キャラクターの会話をして交代をこなせますか?
回答:マルチプレイヤーモードと複数の音声入力フォーマットはサポートしていますが、より自然な回転効果を得るためには、公式スクリプトのパラメータや音声構成に合わせて設定する必要があります。
Q: LongCat-Video-AvatarとInfiniteTalkの核心的な違いは何ですか?
回答:InfiniteTalkは「既存の動画を長期間に吹き替えたり整列したりする」方向性が強いです。 LongCat-Video-Avatarは、統一アーキテクチャの下で音声駆動の生成と継続を強調し、クロスクリップの安定化によって長いシーケンスの一貫性を向上させます。