Retour à L’IA est open source
PE-AV (Perception Encoder Audiovisuel) Open Source Interpretation : Le moteur de séparation audio qui alimente l’audio SAM

PE-AV (Perception Encoder Audiovisuel) Open Source Interpretation : Le moteur de séparation audio qui alimente l’audio SAM

L’IA est open source Admin 99 vues
  1. Abstract

PE-AV (Perception Encoder Audiovisual) est la famille d’encodeurs audio-visuels open source conjoints de Meta, qui ajoute des capacités audio natives sur la base de Perception Encoder pour aligner la représentation vidéo, audio, audio, vidéo et texte avec un espace d’intégration unifié. Il est utilisé pour soutenir des composants clés de l’audio SAM et dirige plusieurs benchmarks de recherche et de compréhension audio/vidéo.


  1. Caractéristiques principales
  1. Intégration unifiée multimodale : Elle prend en charge l’encodage des caractéristiques et le calcul de similarité de l’audio, de la vidéo, de l’audio-vidéo et du texte simultanément.
  2. Recherche audio et vidéo et alignement : Il peut effectuer une recherche intermodale comme « texte pour trouver le son/image » et « écran pour trouver le son ».
  3. Poids multi-taille/multi-versions : Petit/base/grand, ainsi que des configurations telles que « 16 images » et « toutes les images », sont disponibles pour faciliter les compromis entre effets et puissance de calcul.
  4. Réutilisabilité en ingénierie : Publié dans le même entrepôt que l’écosystème perception_models, ce qui est pratique pour la collaboration avec la série PE et les applications multimodales en aval.


  1. Installation
  1. Cloner le code : git clone https://github.com/facebookresearch/perception_models
  2. Créer un environnement et installer des dépendances : installer selon les instructions du dépôt requirements.txt / setup.py (les dépendances peuvent varier selon les plateformes).
  3. Obtenir des poids : Lors de l’exécution de l’exemple, il tirera le point de contrôle correspondant de Hugging Face (comme pe-av-large, etc.).


  1. Cas d’usage typiques
  1. Recherche audio et vidéo : Utilisez une phrase pour trouver des « extraits de dialogue avec sirènes » dans la vidéothèque.
  2. Compréhension assistée par les indices sonores : Combinez l’image pour améliorer la reconnaissance des sources sonores et la description des scènes dans les scènes bruitées.
  3. Perception en amont de la séparation/montage audio : Fournit une représentation plus forte de l’alignement audio-vidéo pour une séparation interactive comme SAM Audio.
  4. Annotation des données et inspection qualité : utiliser la similarité intermodale pour des échantillons d’écran avec « image et son incohérents ».


  1. Écologie et produits concurrents
  1. Écologie : PE-AV est un perception_models de Meta ; Les poids des modèles sont publiés sous forme de collections dans Hugging Face pour une facilité de reproductibilité et d’intégration.
  2. Idées de produits concurrentes : Comparé aux encodeurs audio ou vidéo uniquement, PE-AV se concentre sur l’espace unifié de « l’apprentissage par correspondance audiovisuelle » ; Comparé à la méthode CLIP, elle s’étend à la caractérisation conjointe de l’audio et de l’audio et de la vidéo, qui se rapproche davantage de la tâche vidéo réelle.


  1. Limitations et précautions
  1. Puissance de calcul et débit : La configuration du taux d’images vidéo aura un impact significatif sur la mémoire et la vitesse vidéo, et il faut choisir la stratégie petite/base/grande et la stratégie d’images en fonction du service.
  2. Décalage du domaine des données : Dans certaines langues, certains types d’audio ou des conditions sonores fortes, l’alignement intermodal peut diminuer, il est donc recommandé une vérification à petite échelle.
  3. Droits d’auteur et vie privée : Lors du traitement de conversations publiques vidéo/audio avec des personnes, les exigences de conformité et d’autorisation des données doivent être respectées.


  1. Adresse du projet

https://github.com/facebookresearch/perception_models


  1. FAQ

(modèle open source PE-AV) Quelles modalités d’entrée sont prises en charge ?

Les réponses

prennent en charge l’audio, la vidéo, l’audio, la vidéo et le texte, et produisent des représentations intégrées pouvant être utilisées pour les calculs de similarité.

Question (installation PE-AV) D’où les poids sont-ils téléchargés, et doivent-ils être placés manuellement ?

Les réponses

sont généralement automatiquement tirées en Câlinant Visage pour tirer le point de contrôle correspondant ; Pour les environnements hors ligne, il faut télécharger et configurer manuellement le chemin selon les instructions du dépôt.

Question (PE-AV vs. SAM Audio) Quelle est la relation entre les deux ?

Réponse

:

PE-AV est le moteur de perception/encodage qui pilote plusieurs composants fondamentaux de SAM Audio, offrant un alignement audiovisuel amélioré.

Question (point de contrôle PE-AV) : Dois-je choisir pe-av-small/base/large ou 16 images ?

Plus la réponse est grande

, plus l’effet est fort mais plus la puissance de calcul est importante ; Les 16 images économisent davantage en ressources, et toutes les images exploitent mieux les informations vidéo, il est donc recommandé de mener des expériences comparatives basées sur les contraintes de vitesse et de coût du service.

Analyse complète de l’encodeur articulé audio et vidéo PE-AV open source de Meta PE-AV est un espace d’intégration unifié qui aligne le texte audio et vidéo Meta PE-AV aide à améliorer les capacités de séparation audio SAM L’encodage multimodal PE-AV prend en charge l’entrée audio, vidéo et texte PE-AV est utilisé pour la recherche de sons textuels et la récupération de sons d’image Le PE-AV fournit des poids multi-versions à base petite et grande PE-AV prend en charge les stratégies de trames 16 images et toutes les trames Le PE-AV est intégré à l’écosystème perception_models pour une réutilisation facile Guide d’installation PE-AV Clonage du dépôt et configuration des dépendances Les poids PE-AV sont automatiquement tirés en faisant un câlin. Cas d’usage typiques de PE-AV : Récupération intermodale des bibliothèques audio et vidéo Le PE-AV utilise des indices sonores de sirène pour localiser les extraits de dialogue Le PE-AV aide à identifier les sources sonores dans les scènes bruyantes à l’aide d’images PE-AV en tant que SAM Moteur de perception audio en amont Le PE-AV est utilisé pour la séparation audio interactive et le montage Le PE-AV a filtré des échantillons avec similarité pour des incohérences dans le son et l’image Le PE-AV est utilisé pour l’inspection de la qualité des annotations de données et l’assistance à la revue de contenu L’apprentissage de l’alignement PE-AV est plus proche des tâches vidéo réelles Le PE-AV comprend mieux les indices d’image que les encodeurs audio purs Le PE-AV comprend mieux la sémantique sonore que les encodeurs vidéo purs Comparé à CLIP, le PE-AV est étendu à la représentation audio et audio et vidéo Le PE-AV prend en charge l’audio, la vidéo, l’audio-vidéo SMS L’intégration de sortie PE-AV peut effectuer directement des calculs de similarité Le PE-AV peut être utilisé pour la récupération sonore et la détection d’événements sonores Le PE-AV peut être utilisé pour la compréhension et l’analyse de scènes audio et vidéo La conclusion principale du PE-AV repose sur la carte modèle papier Les déploiements PE-AV doivent évaluer le débit mémoire par rapport aux fréquences d’images PE-AV sélectionne tous Les trames améliorent l’utilisation de l’information mais consomment plus de puissance de calcul PE-AV sélectionne 16 trames pour réduire les coûts et convient au traitement par lots Le PE-AV choisit de grand pour améliorer l’effet, mais nécessite une puissance de calcul plus élevée PE-AV sélectionne petit pour l’inférence des arêtes ou légère Le PE-AV s’aligne ou tombe sous un fort décalage du domaine du bruit Il est recommandé de PE-AV de faire une vérification à petite échelle avant de s’étendre Le traitement PE-AV de la vidéo publique est soumis aux exigences de droits d’auteur et de licence Le dialogue de caractères sur le traitement PE-AV nécessite un accent sur la confidentialité et la conformité L’intégration en ingénierie PE-AV dépend des exigences et des différences de plateforme Dans l’environnement hors ligne PE-AV, vous devez télécharger manuellement les poids et les chemins de configuration Adresse au projet PE-AV sur facebookresearch/perception_models L’exemple PE-AV exécute un téléchargement automatique de poids tels que pe-av-large PE-AV prend en charge les politiques d’image vidéo qui affectent la vitesse et l’utilisation de la mémoire PE-AV est utilisé pour créer des recherches de matériel média à travers des recherches modales Le PE-AV est utilisé pour le criblage de données d’entraînement à la similarité multimodale PE-AV est une base unifiée de caractérisation pour les tâches de compréhension vidéo PE-AV fournit des composants de récupération multimodale pour la sécurité du divertissement d’entreprise La relation PE-AV et SAM Audio est un composant clé du codage perceptif FAQ PE-AV Modalités d’entrée et instructions d’acquisition des poids La sélection du PE-AV est recommandée de la comparer en trois dimensions selon le coût, la rapidité et l’effet Guide des poids du code de ressources open source PE-AV et Guide d’acquisition des cartes de modèles Lisez l’article PE-AV de l’installation aux cas d’usage en passant par les limitations

Outils Recommandés

Plus