ToolNavs KI-Tools entdecken
Tool einreichen Anmelden
Zurück zu KI ist Open Source
PE-AV (Perception Encoder Audiovisual) Open Source Interpretation: Die Audiotrennungs-Engine, die SAM Audio antreibt

PE-AV (Perception Encoder Audiovisual) Open Source Interpretation: Die Audiotrennungs-Engine, die SAM Audio antreibt

KI ist Open Source Admin 116 Aufrufe
  1. Abstract

PE-AV (Perception Encoder Audiovisual) ist Metas Open-Source-Audio-Visual-Gemeinschaftsencoder-Familie, die auf Basis des Perception Encoder native Audiofunktionen hinzufügt, um Video, Audio, Audio sowie Video- und Textrepräsentation mit einem einheitlichen Embedding-Raum in Einklang zu bringen. Es wird verwendet, um zentrale Komponenten von SAM Audio zu untermauern und führt zu mehreren Audio-/Video-Abrufen und Verständnis-Benchmarks.


  1. Kernfunktionen
  1. Multimodale einheitliche Einbettung: Sie unterstützt die Feature-Codierung und die Berechnung von Ähnlichkeiten von Audio, Video, Audio-Video und Text gleichzeitig.
  2. Audio- und Videoabruf und -ausrichtung: Es kann intermodale Suche wie "Text zum Finden von Ton/Bild" und "Bildschirm zum Finden von Ton" durchführen.
  3. Multi-Size/Multi-Version-Gewichte: Klein/Basis/groß sowie Konfigurationen wie "16-Frames" und "All Frames" sind verfügbar, um Abwägungen zwischen Effekten und Rechenleistung zu erleichtern.
  4. Technische Wiederverwendbarkeit: Veröffentlicht im selben Warehouse wie das perception_models-Ökosystem, was für die Zusammenarbeit mit PE-Serien und nachgelagerten multimodalen Anwendungen praktisch ist.


  1. Installation
  1. Code klonen: Git-Klonen https://github.com/facebookresearch/perception_models
  2. Eine Umgebung erstellen und Abhängigkeiten installieren: Installieren Sie gemäß den Anweisungen des Repositorys requirements.txt / setup.py (Abhängigkeiten können je nach Plattform variieren).
  3. Hol Gewichte: Beim Ausführen des Beispiels zieht es den entsprechenden Checkpoint von Hugging Face (wie pe-av-large usw.).


  1. Typische Anwendungsfälle
  1. Audio- und Videosuche: Verwenden Sie einen Satz, um "Dialogclips mit Sirenen" aus der Videobibliothek zu finden.
  2. Tonsignalunterstütztes Verständnis: Kombinieren Sie das Bild, um die Tonquellenerkennung und Szenenbeschreibung in lauten Szenen zu verbessern.
  3. Upstream-Wahrnehmung von Audiotrennung/-bearbeitung: Bietet eine stärkere Audio-Video-Ausrichtung für interaktive Trennung wie SAM Audio.
  4. Datenannotation und Qualitätskontrolle: Verwenden Sie intermodale Ähnlichkeit mit Bildschirmproben mit "inkonsistenten Bild- und Ton".


  1. Ökologie und konkurrierende Produkte
  1. Ökologie: PE-AV ist ein perception_models von Meta; Modellgewichte werden als Sammlungen in Hugging Face veröffentlicht, um eine einfache Reproduzierbarkeit und Integration zu gewährleisten.
  2. Konkurrierende Produktideen: Im Vergleich zu Audio-Encodern oder nur Video-Encodern konzentriert sich PE-AV auf den einheitlichen Raum des "audiovisuellen Korrespondenzlernens"; Im Vergleich zur CLIP-Methode wird sie auf die gemeinsame Charakterisierung von Audio, Audio und Video ausgeweitet, die der echten Video-Aufgabe näherkommt.


  1. Einschränkungen und Vorsichtsmaßnahmen
  1. Rechenleistung und Durchsatz: Die Konfiguration der Videobildrate beeinflusst den Videospeicher und die Geschwindigkeit erheblich, und Sie müssen je nach Dienst die Strategie klein/basis/groß und Bildrate wählen.
  2. Datendomänenverschiebung: In bestimmten Sprachen, bestimmten Audiotypen oder starken Rauschbedingungen kann die Cross-Modal-Ausrichtung abnehmen, daher wird eine Verifikation im kleinen Maßstab empfohlen.
  3. Urheberrecht und Privatsphäre: Bei der Verarbeitung öffentlicher Video-/Audiogespräche mit Personen müssen Anforderungen an die Einhaltung von Daten und Genehmigungen eingehalten werden.


  1. Projektadresse

https://github.com/facebookresearch/perception_models


  1. FAQ

(PE-AV Open-Source-Modell) Welche Eingabemodalitäten werden unterstützt?

Answers

unterstützen Audio, Video, Audio, Video und Text und geben eingebettete Darstellungen aus, die für Ähnlichkeitsberechnungen verwendet werden können.

Frage (PE-AV-Installation) Woher werden die Gewichte heruntergeladen und müssen sie manuell platziert werden?

Antworten

werden normalerweise automatisch von Hugging Face gezogen, um den entsprechenden Checkpoint zu ziehen; Für Offline-Umgebungen musst du den Pfad manuell gemäß den Anweisungen des Repositorys herunterladen und konfigurieren.

Frage (PE-AV vs. SAM Audio): Was ist die Beziehung zwischen den beiden?

Antwort

:

PE-AV ist die Wahrnehmungs-/Codierungs-Engine, die mehrere Kernkomponenten von SAM Audio antreibt und eine verbesserte audiovisuelle Ausrichtung ermöglicht.

Frage (PE-AV-Kontrollpunkt) Sollte ich PE-av-klein/basis/groß oder 16-Frame wählen?

Je größer die Antwort

, desto stärker der Effekt, aber desto mehr Rechenleistung; 16-Bilder sparen Ressourcen und alle Frames nutzen Videoinformationen besser, daher wird empfohlen, vergleichende Experimente basierend auf Geschwindigkeits- und Kostenbeschränkungen des Dienstes durchzuführen.

Empfohlene Tools

Mehr