- Abstract
PE-AV (Perception Encoder Audiovisual) est la famille d’encodeurs audio-visuels open source conjoints de Meta, qui ajoute des capacités audio natives sur la base de Perception Encoder pour aligner la représentation vidéo, audio, audio, vidéo et texte avec un espace d’intégration unifié. Il est utilisé pour soutenir des composants clés de l’audio SAM et dirige plusieurs benchmarks de recherche et de compréhension audio/vidéo.
- Caractéristiques principales
- Intégration unifiée multimodale : Elle prend en charge l’encodage des caractéristiques et le calcul de similarité de l’audio, de la vidéo, de l’audio-vidéo et du texte simultanément.
- Recherche audio et vidéo et alignement : Il peut effectuer une recherche intermodale comme « texte pour trouver le son/image » et « écran pour trouver le son ».
- Poids multi-taille/multi-versions : Petit/base/grand, ainsi que des configurations telles que « 16 images » et « toutes les images », sont disponibles pour faciliter les compromis entre effets et puissance de calcul.
- Réutilisabilité en ingénierie : Publié dans le même entrepôt que l’écosystème perception_models, ce qui est pratique pour la collaboration avec la série PE et les applications multimodales en aval.
- Installation
- Cloner le code : git clone https://github.com/facebookresearch/perception_models
- Créer un environnement et installer des dépendances : installer selon les instructions du dépôt requirements.txt / setup.py (les dépendances peuvent varier selon les plateformes).
- Obtenir des poids : Lors de l’exécution de l’exemple, il tirera le point de contrôle correspondant de Hugging Face (comme pe-av-large, etc.).
- Cas d’usage typiques
- Recherche audio et vidéo : Utilisez une phrase pour trouver des « extraits de dialogue avec sirènes » dans la vidéothèque.
- Compréhension assistée par les indices sonores : Combinez l’image pour améliorer la reconnaissance des sources sonores et la description des scènes dans les scènes bruitées.
- Perception en amont de la séparation/montage audio : Fournit une représentation plus forte de l’alignement audio-vidéo pour une séparation interactive comme SAM Audio.
- Annotation des données et inspection qualité : utiliser la similarité intermodale pour des échantillons d’écran avec « image et son incohérents ».
- Écologie et produits concurrents
- Écologie : PE-AV est un perception_models de Meta ; Les poids des modèles sont publiés sous forme de collections dans Hugging Face pour une facilité de reproductibilité et d’intégration.
- Idées de produits concurrentes : Comparé aux encodeurs audio ou vidéo uniquement, PE-AV se concentre sur l’espace unifié de « l’apprentissage par correspondance audiovisuelle » ; Comparé à la méthode CLIP, elle s’étend à la caractérisation conjointe de l’audio et de l’audio et de la vidéo, qui se rapproche davantage de la tâche vidéo réelle.
- Limitations et précautions
- Puissance de calcul et débit : La configuration du taux d’images vidéo aura un impact significatif sur la mémoire et la vitesse vidéo, et il faut choisir la stratégie petite/base/grande et la stratégie d’images en fonction du service.
- Décalage du domaine des données : Dans certaines langues, certains types d’audio ou des conditions sonores fortes, l’alignement intermodal peut diminuer, il est donc recommandé une vérification à petite échelle.
- Droits d’auteur et vie privée : Lors du traitement de conversations publiques vidéo/audio avec des personnes, les exigences de conformité et d’autorisation des données doivent être respectées.
- Adresse du projet
https://github.com/facebookresearch/perception_models
- FAQ
(modèle open source PE-AV) Quelles modalités d’entrée sont prises en charge ?
Les réponses
prennent en charge l’audio, la vidéo, l’audio, la vidéo et le texte, et produisent des représentations intégrées pouvant être utilisées pour les calculs de similarité.
Question (installation PE-AV) D’où les poids sont-ils téléchargés, et doivent-ils être placés manuellement ?
Les réponses
sont généralement automatiquement tirées en Câlinant Visage pour tirer le point de contrôle correspondant ; Pour les environnements hors ligne, il faut télécharger et configurer manuellement le chemin selon les instructions du dépôt.
Question (PE-AV vs. SAM Audio) Quelle est la relation entre les deux ?
Réponse
:PE-AV est le moteur de perception/encodage qui pilote plusieurs composants fondamentaux de SAM Audio, offrant un alignement audiovisuel amélioré.
Question (point de contrôle PE-AV) : Dois-je choisir pe-av-small/base/large ou 16 images ?
Plus la réponse est grande
, plus l’effet est fort mais plus la puissance de calcul est importante ; Les 16 images économisent davantage en ressources, et toutes les images exploitent mieux les informations vidéo, il est donc recommandé de mener des expériences comparatives basées sur les contraintes de vitesse et de coût du service.