AI chez Meta, une filiale de Meta, a annoncé le Perception Encoder Audiovisual (PE-AV) open source et l’a positionné comme un moteur technologique clé pour piloter SAM Audio afin d’obtenir des effets de séparation audio de pointe. Basé sur l’ancien système Perception Encoder, PE-AV intègre nativement la perception audio et visuelle pour aligner les informations audio, vidéo (ou clips audio et vidéo) et texte dans le même espace de représentation.
Selon les informations publiques, PE-AV met l’accent sur des capacités multimodales, qui peuvent être utilisées pour la récupération sonore, la détection sonore et une compréhension plus riche des scènes audio et vidéo, et a atteint des performances de premier plan dans de nombreux benchmarks audio et vidéo. En termes de ressources de support, le code est open source sur GitHub ; Les poids des modèles sont publiés sur Hugging Face à plusieurs échelles, ce qui facilite leur réutilisation pour les développeurs dans la séparation audio, la récupération intermodale et la compréhension des tâches. Il convient de noter que les paramètres de comparaison spécifiques et les détails reproductibles de la conclusion officielle « benchmark leading » sont toujours soumis à la divulgation des documents et des cartes modèles.
FAQ
Q : Quelle est la composante technique du PE-AV ?
R : PE-AV est un encodeur multimodal audiovisuel utilisé pour mapper audio, vidéo et texte dans un espace d’intégration unifié afin de soutenir la séparation et la compréhension en aval.
Q : Quelle est la relation entre PE-AV et SAM Audio ?
R : PE-AV est décrit comme un moteur technologique important pour SAM Audio afin d’obtenir des effets de séparation audio de pointe, qui peuvent être utilisés pour améliorer l’alignement audiovisuel et les capacités liées à la séparation.
Q : Quels scénarios quotidiens ou applicatifs le PE-AV peut-il gérer ?
R : Le PE-AV peut être utilisé pour la détection sonore, la récupération intermodale (trouver le son à partir du texte ou des images), ainsi que pour une compréhension et une analyse plus complètes des scènes audio et vidéo.
Q : Où puis-je trouver le code et le modèle du PE-AV ?
R : Le code est disponible publiquement dans le dépôt facebookresearch/perception_models de GitHub, et les poids des modèles sont disponibles en plusieurs versions à l’échelle via l’organisation Facebook de Hugging Face.
Q : Quelles sont les limites dont je dois être conscient lors de l’utilisation du PE-AV ?
R : Différents poids et ensembles de données peuvent avoir leurs propres licences et conditions d’utilisation, et certains modèles peuvent devoir demander un accès côté plateforme.