Genspark 宣布在其 App 内推出 Photo Genius,定位为“语音控制的 AI 照片编辑器”。官方介绍称,该功能将 OpenAI Realtime 语音技术与 Nano-Banana 图像模型结合,用户可直接用自然语音下达编辑需求,涵盖妆容与发型、服饰风格、背景替换、姿势微调以及常见“救片”处理等场景。相较传统图像工具,Photo Genius 以“免教程、可对话”的方式降低了编辑门槛,面向日常修图与创意改造双场景。
Nano-Banana 为近期走红的图像编辑模型,强调对人物与场景的一致性与可控性,并在 Gemini 生态中配套可溯源水印等安全机制。此次接入使 Genspark 的多模态工作流进一步完善:语音口述目标 → 实时理解 → 图像级编辑与替换。官方尚未披露更细的计费与使用配额信息;功能细节与适用平台以 Genspark 公告与应用商店页面为准。
常见问题
Q:Photo Genius 的核心能力是什么?
A:以语音指令驱动 Nano-Banana 的图像编辑,支持妆发/服饰/姿势调整、背景替换与“救片”等。
Q:是否真的“全球首个”语音控制 AI 照片编辑器?
A:该表述来自官方宣传,行业内也有语音+图像的尝试,严格比较仍取决于定义与功能边界。
Q:隐私与溯源如何保障?
A:Nano-Banana 在 Gemini 侧支持可识别的数字水印(如 SynthID)与合规指引;在 Genspark 内的具体实现与数据处理以其隐私与产品政策为准。
Q:在哪里可以体验?
A:Genspark App 内。具体入口与资格以其官方页面、应用商店说明与社媒公告为准。