一、摘要
LongCat-Video-Avatar 是基于 LongCat-Video 架构打造的音频驱动 Avatar(虚拟人)视频生成模型,面向“长时序、强一致性、写实动态”场景。它将音频与文本(可选参考图)作为条件,原生支持 Audio-Text-to-Video(AT2V)、Audio-Text-Image-to-Video(ATI2V)以及视频续写(Video Continuation),并强调多人物与长视频生成的稳定性与身份一致性。
二、核心特性
1、三种原生模式一体化:同一套框架覆盖 AT2V、ATI2V 与视频续写,适配单人/多人以及单路/多路音频输入。
2、长视频画质稳定:Cross-Chunk Latent Stitching 通过减少跨片段重复的 VAE decode-encode 循环,降低长序列像素退化与误差累积,提升无缝拼接质量。
3、长期身份一致性:Reference Skip Attention 在保留人物 ID 特征的同时,抑制“条件图像泄漏”导致的生硬复制粘贴感。
4、更自然的人体动态:通过解耦式的 unconditional guidance,让语音信号与动作动态更合理分离,减少“嘴动但人僵”的不自然现象。
5、评测对齐真实观感:模型卡提供了基于 EvalTalker 的人评结果展示,用于衡量单人/多人的自然度与写实度(具体结论以官方报告与复现实验为准)。
三、安装
1、克隆代码并创建环境:
- git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
- 建议 Python 3.10 + Conda 环境
- 2、安装依赖(按 CUDA 版本选择对应 torch):
- 安装 torch/torchvision/torchaudio
- 安装 flash-attn(模型配置默认启用 FlashAttention-2,可按需切换)
- pip install -r requirements.txt
- Avatar 额外依赖:librosa、ffmpeg、pip install -r requirements_avatar.txt
- 3、下载权重:使用 huggingface-cli 将 LongCat-Video 与 LongCat-Video-Avatar 下载到本地 weights 目录。
四、典型用例
1、虚拟主播/口播:根据音频与脚本生成稳定口型与表情的长段视频。
2、播客/访谈:支持长时长说话与多人轮换发言,强调身份一致与拼接自然。
3、唱演/舞台表演:让动作节奏与人声更同步,适合短片段到长段落的连续生成。
4、客服/销售讲解:对静音段落与停顿进行更自然的姿态过渡,减少“卡住”的观感。
5、视频续写:将生成扩展到多段落拼接,适合“无限长度”式内容生产与迭代编辑。
五、生态与竞品
1、生态:基座 LongCat-Video 提供文本/图像到视频与续写能力;Avatar 在此之上补齐音频驱动与多人对话视频生成,并以 Hugging Face 模型卡给出快速推理脚本与参数建议。
2、竞品/相关方向:InfiniteTalk(稀疏帧配音式长视频)、StableAvatar(强调无限长度与端到端)、MultiTalk(多人对话生成)等方案在“身份保持、长序列稳定、多人交互”上各有侧重。LongCat-Video-Avatar 的差异点更集中在跨片段稳定机制与参考信息注入方式上。
六、局限与注意事项
1、长视频与多人物对显存与算力要求高,推理速度与分辨率/帧率/段数强相关。
2、多音频模式需要对齐长度或按规则拼接,输入组织不当会影响口型同步与轮换自然度。
3、生成式视频可能出现细节漂移、口型偶发不准或手部/牙齿等高频区域瑕疵,建议对关键片段人工复核与后期修饰。
4、涉及肖像与声音的应用需遵守隐私、授权与内容合规要求,尤其是商业化与公开发布场景。
七、项目地址
https://github.com/meituan-longcat/LongCat-Video
八、常见问题
问题:LongCat-Video-Avatar 是否支持 AT2V(音频+文本到视频)?
回答:支持,模型原生提供 AT2V 推理入口,并建议在提示词中加入清晰的“说话/对话”等动作线索以改善口型与动态。
问题:LongCat-Video-Avatar 的 ATI2V(音频+文本+图像到视频)适合什么场景?
回答:适合需要固定人物形象/服饰风格的虚拟人生成,通过参考图增强 ID 与外观一致性。
问题:LongCat-Video-Avatar 如何减少长视频越生成越糊的问题?
回答:其 Cross-Chunk Latent Stitching 设计用于减少跨片段重复的 VAE 循环,从而降低像素退化与误差累积。
问题:LongCat-Video-Avatar 能做多人物对话与轮流说话吗?
回答:支持多人模式与多音频输入形态,但需要按官方脚本的参数与音频组织方式配置,才能获得更自然的轮换效果。
问题:LongCat-Video-Avatar 与 InfiniteTalk 的核心差别是什么?
回答:InfiniteTalk 更偏“对已有视频做长时序配音/对齐”的路径;LongCat-Video-Avatar 更强调在统一架构下做音频驱动生成与续写,并通过跨片段稳定机制提升长序列观感一致性。