Meta旗下AI at Meta宣布开源Perception Encoder Audiovisual(PE-AV),并将其定位为推动SAM Audio达到前沿音频分离效果的关键技术引擎。PE-AV基于更早发布的Perception Encoder体系,将音频与视觉感知进行原生融合,用于在同一表示空间中对齐音频、视频(或音视频片段)与文本信息。
公开信息显示,PE-AV主打多模态能力,可用于声音检索、声音检测、以及更丰富的音视频场景理解,并在多项音频与视频基准上取得领先表现。配套资源方面,代码已在GitHub开源;模型权重以多个规模在Hugging Face发布,方便开发者在音频分离、跨模态检索与理解任务中复用。需要注意的是,官方“基准领先”结论的具体对比设置与可复现细节,仍以论文与模型卡披露为准。
常见问题
Q:PE-AV是什么技术组件?
A:PE-AV是一个音频-视觉多模态感知编码器,用于将音频、视频与文本映射到统一嵌入空间,支撑下游分离与理解任务。
Q:PE-AV与SAM Audio是什么关系?
A:PE-AV被描述为SAM Audio达到前沿音频分离效果的重要技术引擎,可用于提升音视对齐与分离相关能力。
Q:PE-AV能做哪些日常或应用场景?
A:PE-AV可用于声音检测、跨模态检索(以文字或画面找声音)、以及更完整的音视频场景理解与分析。
Q:PE-AV的代码和模型在哪里获取?
A:代码在GitHub的facebookresearch/perception_models仓库公开,模型权重在Hugging Face的facebook组织下提供多个规模版本。
Q:使用PE-AV需要注意哪些限制?
A:不同权重与数据集可能有各自许可与使用条款,部分模型可能需要在平台侧申请访问权限,部署前应核对模型卡与仓库说明。