PE-AV(Perception Encoder Audiovisual)开源解读:驱动 SAM Audio 的音频分离引擎
一、摘要 PE-AV(Perception Encoder Audiovisual)是 Meta 开源的音频-视觉联合编码器家族,在 Perception Encoder 基础上加入原生音频能力,用统一嵌入空间对齐视频、音频、音视频与文本表征。它被用于支撑 SAM Audio 的关键组件,并在多项音...
一、摘要 PE-AV(Perception Encoder Audiovisual)是 Meta 开源的音频-视觉联合编码器家族,在 Perception Encoder 基础上加入原生音频能力,用统一嵌入空间对齐视频、音频、音视频与文本表征。它被用于支撑 SAM Audio 的关键组件,并在多项音...
一、摘要 HY World 1.5(WorldPlay)是腾讯混元团队开源的实时世界模型框架,核心是一个支持流式生成的视频扩散模型。该系统可根据文本或图像输入,实时生成并更新可交互的 3D 世界,支持用户以第一人称或第三人称视角自由行走、观察和操作。其目标是解决当前世界模型在生成速度、长期一致性与上...
一、摘要 MiMo-V2-Flash 是小米 MiMo 团队开源的混合专家(MoE)大语言模型,总参数约 309B、推理时激活参数约 15B,主打在较低推理成本下兼顾推理、编程与智能体(Agent)工作流。它强调长上下文能力(最高 256K)与推理效率之间的平衡,并提供可复现的技术报告、权重与推理部...
一、摘要 LongCat-Video-Avatar 是基于 LongCat-Video 架构打造的音频驱动 Avatar(虚拟人)视频生成模型,面向“长时序、强一致性、写实动态”场景。它将音频与文本(可选参考图)作为条件,原生支持 Audio-Text-to-Video(AT2V)、Audio-Te...
一、摘要 阿里通义语音团队(FunAudioLLM)开源两类音频模型:面向语音合成的 Fun-CosyVoice3-0.5B-2512(TTS),以及面向语音识别的 Fun-ASR-Nano-2512(ASR)。前者强调多语种、零样本声音克隆与低延迟流式合成;后者强调 31 语种识别、方言口音覆盖与...
一、摘要 GLM-TTS 是面向工业级语音生成的开源 TTS 系统,支持仅 3 秒语音样本的音色克隆,并提供可控的情绪表达能力。其架构采用两阶段生成流程,并引入基于 GRPO 的强化学习机制,在字符错误率(CER)与情感维度达到开源领先水平。项目强调低训练成本与高可扩展性,适用于教育、电子书、有声内...
一、摘要 Open-AutoGLM 是智谱AI开源的手机智能体(Agent)框架,核心模型为 AutoGLM-Phone-9B。它通过理解手机屏幕内容并模拟真实用户操作,实现“看得懂界面、听得懂指令、点得动手机”。框架主要面向 Android 场景,适合构建手机助手、自动化运营、测试等多种应用。 二...
一、摘要 LongCat-Image 是美团 LongCat 团队开源的中英双语图像生成与编辑模型,参数约 6B,采用混合 DiT 架构,在多项公开基准上可比肩甚至超过部分 20B 级别开源模型。项目重点提升多语言文本渲染、图像一致性和写实效果,并兼顾推理速度与显存占用,适合研究与业务落地。 二、核...