KI bei Meta, einer Tochtergesellschaft von Meta, kündigte den Open-Source-Perception Encoder Audiovisual (PE-AV) an und positionierte ihn als Schlüsseltechnologie-Engine, um SAM Audio zu modernen Audio-Trenneffekten voranzutreiben. Basierend auf dem früheren Perception Encoder-System integriert PE-AV nativ Audio- und Bildwahrnehmung, um Audio, Video (oder Audio- und Videoclips) und Textinformationen im selben Darstellungsraum auszurichten.
Laut öffentlichen Informationen konzentriert sich PE-AV auf multimodale Fähigkeiten, die für die Geräuschrückgewinnung, Tondetektion sowie ein umfassenderes Verständnis von Audio- und Videoszenen genutzt werden können und in einer Reihe von Audio- und Video-Benchmarks führende Ergebnisse erzielt haben. Was die unterstützenden Ressourcen angeht, ist der Code Open Source auf GitHub; Modellgewichte werden auf Hugging Face in mehreren Maßstäben veröffentlicht, was es Entwicklern erleichtert, sie in Audiotrennung, crossmodaler Abrufung und Verständnisaufgaben wiederzuverwenden. Es sollte beachtet werden, dass die spezifischen Vergleichseinstellungen und reproduzierbaren Details des offiziellen "Benchmark Leading"-Schlusses weiterhin der Offenlegung von Papieren und Modellkarten unterliegen.
FAQ
F: Was ist die technische Komponente von PE-AV?
A: PE-AV ist ein audiovisueller multimodaler Wahrnehmungsencoder, der verwendet wird, um Audio, Video und Text in einen einheitlichen Einbettungsraum zu mappen, um nachgelagerte Trennungs- und Verständnisaufgaben zu unterstützen.
F: Wie ist die Beziehung zwischen PE-AV und SAM Audio?
A: PE-AV wird als wichtige Technologie-Engine für SAM Audio beschrieben, um modernste Audiotrenneffekte zu erzielen, die zur Verbesserung der audiovisuellen Ausrichtung und der separationbezogenen Fähigkeiten genutzt werden können.
F: Welche täglichen oder Anwendungsszenarien kann PE-AV erledigen?
A: PE-AV kann für die Geräuscherkennung, das intermodale Abruf (das Erkennen von Tönen aus Text oder Bildern) sowie für das umfassendere Verständnis und die Analyse von Audio- und Videoszenen verwendet werden.
F: Wo kann ich den Code und das Modell von PE-AV bekommen?
A: Der Code ist öffentlich im Facebookresearch/perception_models-Repository von GitHub verfügbar, und Modellgewichte sind in mehreren Maßstabsversionen unter der Facebook-Organisation von Hugging Face verfügbar.
F: Welche Einschränkungen muss ich bei der Nutzung von PE-AV beachten?
A: Unterschiedliche Gewichtungen und Datensätze können eigene Lizenzen und Nutzungsbedingungen haben, und einige Modelle müssen möglicherweise einen Antrag auf der Plattformseite auf dem Zugriff stellen.