1. 추상
적인 롱캣-비디오-아바타는 롱캣-비디오 아키텍처를 기반으로 한 오디오 기반 아바타(가상 인간) 비디오 생성 모델로, "긴 시간 시퀀스, 강한 일관성, 현실적이고 동적인" 상황에 적합합니다. 이 시스템은 오디오-텍스트-비디오(AT2V), 오디오-텍스트-이미지-비디오(ATI2V), 비디오 연속 기능을 기본적으로 지원하며, 다중 문자 및 장기 비디오 생성에서 안정성과 정체성 일관성을 강조합니다.
2. 핵심 기능
1. 세 가지 네이티브 모드 통합: 동일한 프레임워크가 AT2V, ATI2V, 비디오 연속 기능을 포함하며, 단일 또는 다중 사용자 및 단일 또는 다중 오디오 입력에 적합합니다.
2. 긴 영상의 안정적인 화질: 크로스청크 잠재 스티칭은 장기 시퀀스에서 픽셀 열화와 오류 누적을 줄여 세그먼트 간 반복되는 VAE 디코딩-인코딩 루프를 줄여 매끄러운 스티칭 품질을 향상시킵니다.
3. 장기 정체성 일관성: 참조 건너뛰기 주의는 문자 ID 특성을 유지하면서 '조건부 이미지 누출'로 인한 딱딱한 복사-붙여넣기 느낌을 억제합니다.
4. 보다 자연스러운 인간 역학: 무조건적 안내를 분리함으로써 음성 신호와 행동 역학이 보다 합리적으로 분리되어 '입 움직임은 있지만 뻣뻣함'이라는 비자연스러운 현상이 줄어듭니다.
5. 평가와 실제 인식의 일치: 모델 카드는 EvalTalker를 기반으로 한 인간 평가 결과를 보여주며, 이는 단일 또는 다중 인물의 자연성과 현실성을 측정하는 데 사용됩니다(구체적인 결론은 공식 보고서 및 재현 실험에 따라 달라집니다).
3. 설치
- 코드를 복제하고 환경 생성:
- git clone --single-branch --branch main https://github.com/meituan-longcat/LongCat-Video
- 권장 Python 3.10 + Conda 환경
- 2. 의존성 설치 (CUDA 버전에 따라 해당 토치 선택):
- torch/torchvision/torchaudio 설치
- 및 flash-attn(모델 구성에서 FlashAttention-2는 기본적으로 활성화되어 필요 시 전환 가능).
- pip install -r requirements.txt
- Avatar 추가 의존성: librosa, ffmpeg, pip install -r requirements_avatar.txt
- 3. 다운로드 무게: huggingface-cli를 사용하여 LongCat-Video와 LongCat-Video-Avatar를 연결합니다 지역 체중 측정 디렉토리에서 다운로드하세요.
4. 일반적인 사용 사례
- 가상 앵커/구술 방송: 오디오와 대본을 바탕으로 안정적인 입술 모양과 표정을 가진 긴 영상을 생성합니다.
- 팟캐스트/인터뷰: 장기 연설과 여러 사람이 연설을 순환하며 연설을 순환하도록 지원하며, 정체성 일관성과 자연스러운 스플라이어싱을 강조합니다.
- 노래/무대 공연: 행동의 리듬을 보컬과 더 동기화하여 짧은 클립부터 긴 단락까지 연속적으로 생성하는 데 적합하도록 만든다.
- 고객 서비스/영업 설명: 무언의 단락과 일시정지 사이의 전환을 더 자연스럽게 하여 'stuck'의 느낌을 줄이세요.
- 비디오 연속성: 생성 범위를 확장하여 "무제한 길이" 콘텐츠 제작과 반복 편집에 적합한 다중 단락 스플라이싱으로 확장합니다.
5. 생태학과 경쟁자
- 생태학: LongCat-Video는 텍스트/이미지-비디오와 글쓰기 기능을 제공합니다; 아바타는 오디오 드라이버와 다인 대화 영상 생성을 보완하며, Hugging Face 모델 카드로 빠른 추론 스크립트와 매개변수 제안을 제공합니다.
- 경쟁 제품/관련 방향: InfiniteTalk(희소한 프레임에 긴 영상), StableAvatar(무한 길이와 끝 간 대화 생성 강조), MultiTalk(다중 사용자 대화 생성) 등 다양한 솔루션들은 "정체성 보존, 긴 시퀀스 안정성, 다인자 상호작용"에 중점을 두고 있습니다. LongCat-Video-Avatar의 차이는 교차 안정화 메커니즘과 참조 정보 주입 방식에 더 집중되어 있습니다.
6. 제한 및 주의사항
- 긴 비디오와 다중 문자는 비디오 메모리와 연산 능력에 높은 요구가 있으며, 추론 속도는 해상도/프레임 속도/세그먼트 수와 밀접하게 연관되어 있습니다.
- 멀티 오디오 모드는 길이를 맞추거나 규칙에 따라 스플라이어스해야 하며, 입력 조직이 부적절하면 립싱크와 회전의 자연스러움에 영향을 줄 수 있습니다.
- 생성형 비디오는 디테일 드리프트, 가끔 부정확한 입술 모양, 손/치아 등 고주파 영역에 결함이 있을 수 있으므로, 키 클립을 수동으로 검토하고 리터칭 후 편집하는 것이 권장됩니다.
- 초상화와 목소리가 관련된 애플리케이션은 특히 상업적 및 공개 공개 시나리오에서 개인정보 보호, 승인 및 콘텐츠 준수 요건을 준수해야 합니다.
7. 프로젝트 주소
https://github.com/meituan-longcat/LongCat-Video
8. 자주 묻는
질문: LongCat-Video-Avatar가 지원되나요? AT2V(오디오 + 텍스트 비디오 변환)?
답변: 네, 모델은 기본적으로 AT2V 추론 항목을 제공하며, 립싱크와 다이내믹을 개선하기 위해 "말하기/말하기" 같은 명확한 행동 신호를 프롬프트에 추가할 것을 권장합니다.
질문: LongCat-Video-Avatar의 ATI2V(오디오 + 텍스트 + 이미지-비디오)는 어떤 시나리오에 적합한가요?
답변: 캐릭터의 이미지/의상 스타일을 고정하고, 참조 다이어그램을 통해 ID와 외모 간의 일관성을 강화해야 하는 가상 인간 생성에 적합합니다.
질문: LongCat-Video-Avatar는 어떻게 긴 영상이 점점 흐릿해지는 문제를 줄여주나요?
답변: 크로스청크 잠재 스티칭은 세그먼트 간에 반복되는 VAE 루프를 줄여 픽셀 열화와 오류 누적을 줄이도록 설계되었습니다.
질문: 롱캣-비디오-아바타가 다중 캐릭터 대화를 하고 번갈아 가며 할 수 있나요?
답변: 멀티플레이어 모드와 여러 오디오 입력 포맷을 지원하지만, 더 자연스러운 회전 효과를 내려면 공식 스크립트의 파라미터와 오디오 구성에 맞게 설정해야 합니다.
Q: LongCat-Video-Avatar와 InfiniteTalk의 핵심 차이점은 무엇인가요?
답변: InfiniteTalk은 '오랜 기간 기존 영상을 더빙/정렬'하는 쪽에 더 기울어 있습니다; LongCat-Video-Avatar는 통합 아키텍처 하에서 오디오 기반 생성과 연속성을 강조하며, 교차 클립 안정화를 통해 긴 시퀀스의 일관성을 향상시킵니다.