让Sora东京女郎唱歌、高启强变声罗翔,阿里人物口型视频生成绝了


有了阿里的 emo,ai 生成或真实的图像「动起来说话或唱歌」变得更容易了。

最近,以 OpenAI Sora 为代表的文生视频模型又火了起来。

除了文本生成视频,以人为中心的视频合成一直备受关注。比如,专注于“说话人头部”的视频生成,其目标是根据用户提供的音频片段生成面部表情。

在技术层面上,生成表情需要准确捕捉说话者微妙且多样化的面部动作,这对于类似视频合成任务而言是一个巨大的挑战。

传统方法通常会施加一些限制以简化视频生成任务。例如,有些方法利用3D模型来约束面部关键点,另一些方法则从原始视频中提取头部运动序列以引导整体运动。尽管这些限制降低了视频生成的复杂性,但也会限制最终面部表情的丰富度和自然度。

最近在阿里智能计算研究院发表的一篇论文中,研究者着重探讨了音频提示与面部动作之间微妙的关联,以提高说话人头部视频的真实性、自然度和表现力。

研究者发现,传统方法通常无法充分捕捉不同说话人的面部表情和独特风格。因此,他们提出了 EMO(Emote Portrait Alive)框架,该框架通过音频 - 视频合成方法直接呈现面部表情,无需使用中间的3D模型或面部标志。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

  • 论文标题:EMO: Emote Portrait Alive- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions

  • 论文地址:https://arxiv.org/pdf/2402.17485.pdf

  • 项目主页:https://humanaigc.github.io/emote-portrait-alive/

就效果而言,阿里的方法可以确保整个视频的无缝帧过渡,并保持身份一致,进而产生表现力强和更加逼真的角色化身视频,在表现力和真实感方面显著优于当前 SOTA 方法。

比如 EMO 可以让 Sora 生成的东京女郎角色开口唱歌,歌曲为英国 / 阿尔巴尼亚双国籍女歌手 Dua Lipa 演唱的《Don't Start Now》。EMO 支持包括英文、中文在内等不同语言的歌曲,可以直观地识别音频的音调变化,生成动态、表情丰富的 AI 角色化身。比如让 AI 绘画模型 ChilloutMix 生成的小姐姐唱陶喆的《Melody》。 

EMO 还能让角色化身跟上快节奏的 Rap 歌曲,比如让小李子来一段美国说唱歌手 Eminem 的《哥斯拉》(Godzilla)。当然,EMO 不仅仅能让角色开口唱歌,还支持各种语言的口语音频,将不同风格的肖像画、绘画以及 3D 模型和 AI 生成的内容制作成栩栩如生的动画视频。比如奥黛丽赫本的谈话。 

最后,EMO 还能实现不同角色之间的联动,比如《狂飙》高启强联动罗翔老师。

方法概览

给定人物肖像的单张参考图像,本文方法可以生成与输入语音音频片段同步的视频,还能保留人物非常自然的头部运动和生动的表情,并且与所提供的声音音频的音调变化相协调。通过创建一系列无缝的级联视频,该模型有助于生成具有一致身份和连贯运动的长时间说话肖像视频,这对于现实应用至关重要。

网络 Pipeline

方法概览如下图所示。主干网络接收多帧噪声潜在输入,并尝试在每个时间步骤中将它们去噪为连续的视频帧,主干网络具有与原始 SD 1.5 版本相似的 UNet 结构配置,具体而言

  1. 与之前的工作相似,为了确保生成帧之间的连续性,主干网络嵌入了时间模块。

  2. 为了保持生成帧中人像的 ID 一致性,研究者部署了一个与主干网络并行的 UNet 结构,称为 ReferenceNet,它输入参考图像以获取参考特征。

  3. 为了驱动角色说话时的动作,研究者使用了音频层来编码声音特征。

  4. 为了使说话角色的动作可控且稳定,研究者使用脸部定位器和速度层提供弱条件。

对于主干网络,研究者没有使用提示嵌入,因此,他们将 SD 1.5 UNet 结构中的交叉注意力层调整为参考注意力层。这些修改后的层将从 ReferenceNet 获取的参考特征作为输入,而非文本嵌入。

训练策略

训练过程分为三个阶段:

第一阶段是图像预训练,其中主干网络、ReferenceNet 和面部定位器被纳入训练过程中,在这个阶段,主干网络以单一帧作为输入,而 ReferenceNet 处理来自同一视频剪辑的不同的、随机选择的帧。主干网络和 ReferenceNet 都从原始 SD 初始化权重。

在第二阶段,研究者引入了视频训练,并且加入了时间模块和音频层,从视频剪辑中采样 n+f 个连续帧,其中起始的 n 帧为运动帧。时间模块从 AnimateDiff 初始化权重。

最后一个阶段集成了速度层,研究者只在这个阶段训练时间模块和速度层。这种做法是为了故意忽略训练过程中的音频层。因为说话人的表情、嘴部运动和头部运动的频率主要受音频的影响。因此,这些元素之间似乎存在相关性,模型可能会根据速度信号而不是音频来驱动角色的运动。实验结果表明,同时训练速度层和音频层削弱了音频对角色运动的驱动能力。

实验结果

实验过程中参与比较的方法包括 Wav2Lip、SadTalker、DreamTalk。

图 3 展示了本文方法与先前方法的比较结果。可以观察到,当提供单个参考图像作为输入时,Wav2Lip 通常会合成模糊的嘴部区域并生成以静态头部姿态和最小眼部运动为特征的视频。就 DreamTalk 而言,其结果可能会扭曲原始面孔,也会限制面部表情和头部运动的范围。与 SadTalker 和 DreamTalk 相比,该研究提出的方法能够生成更大范围的头部运动和更生动的面部表情。

该研究进一步探索了各种肖像风格的头像视频生成,如现实、动漫和 3D。这些角色使用相同的声音音频输入进行动画处理,结果显示,生成的视频在不同风格之间产生大致一致的唇形同步。

图 5 表明本文方法在处理具有明显音调特征的音频时能够生成更丰富的面部表情和动作。例如下图第三行,高音调会引发角色更强烈、更生动的表情。此外,借助运动帧还可以扩展生成的视频,即根据输入音频的长度生成持续时间较长的视频。如图 5 和图 6 所示,本文方法即使在大幅运动中也能在扩展序列中保留角色的身份。

表 1 结果表明本文方法在视频质量评估方面具有显著优势:


# github  # https  # 也会  # 过程中  # 还能  # 定位器  # 能让  # 所示  # 阿尔巴尼亚  # 是一个  # 有一  # 更生动 


相关栏目: 【 Google疑问12 】 【 Facebook疑问10 】 【 网络优化91478 】 【 技术知识72672 】 【 云计算0 】 【 GEO优化84317 】 【 优选文章0 】 【 营销推广36048 】 【 网络运营41350 】 【 案例网站102563 】 【 AI智能45237


相关推荐: 研究学者如何利用现有资源提升学术影响力  MagicAnimate怎么让图片动起来 字节跳动MagicAnimate配置及用法【教程】  Google Gemini 对复杂物理解题过程的逐步解析  百度AI对话助手入口 智能聊天机器人入口  CanvaAI抠图怎样调整色彩_CanvaAI色彩校正与滤镜叠加方法【攻略】  3步教你用AI将你的照片变成乐高积木风格  AI网页生成工具有哪些_一键生成企业官网的AI工具推荐  怎么用AI帮你设计一套个性化的手机App图标?  佐糖AI抠图能否识别商品白底_佐糖AI电商白底图自动处理流程【教程】  AI赋能建筑合同管理:ChatGPT实用案例深度解析  使用 ChatGPT 自动生成月度财务分析报告  Kling AI 2.5 Turbo:视频生成领域的颠覆者,深度评测与对比  P&ID图全解析:工艺流程图解读与应用指南  AI时代生存指南:掌握软实力,成为不可替代的人  DeepSeek写简历怎么用_DeepSeek写简历使用方法详细指南【教程】  数据集中化:提升AI效率,节省企业时间与成本的终极指南  GoHighLevel AI Agent:终极指南,释放你的CRM潜力  唐库AI拆书工具如何批量导出笔记_唐库AI拆书工具批量导出与格式转换【方法】  百度ai助手通知栏怎么关 百度ai助手通知消息屏蔽  AI驱动法律文件分类:效率提升与战略决策的新纪元  斑马AI能否查看孩子学习报告_斑马AI报告查看与数据解读【方法】  文心一言辅助学习方法 解决难题与知识点梳理使用指南  EdrawMax AI:项目管理和创意专业人士的终极图表工具  AI测试面试准备:提升你的面试技巧与知识储备  如何通过豆包 AI 进行每日新闻简报的个性化定制  百度浏览器ai助手怎么关闭 百度浏览器ai功能禁用  Logic Pro 11更新全面解析:免费升级、AI功能与音乐制作流程  百度输入法怎么去除ai模块 百度输入法纯净版安装教程  清洁扫地机器人传感器:解决导航和充电难题  乐高积木重现约拿的故事:圣经故事趣味解读  美图秀秀AI抠图如何换背景_美图秀秀AI背景替换与贴纸添加【攻略】  Tune AI: 革新音乐创作,AI音乐平台深度测评  AI|直播|话术生成工具有哪些_一键生成带货话术的AI工具推荐  DeepSeek网页版怎么用_DeepSeek网页版使用方法详细指南【教程】  使用AI代码生成器轻松构建Web应用程序:Beela vs. Google AI Studio  SteosVoice:电报语音克隆终极教程  千问怎么用提示词生成演讲稿_千问演讲稿提示词框架与开场【教程】  Elon Musk会解决X平台上的机器人问题吗?塔罗牌预测  如何用 ChatGPT 批量处理 Excel 复杂公式  ChatGPT 4o 辅助学生复习 GRE 词汇的方法  Descript音频编辑终极指南:技巧、AI工具与专业效果  grokai如何生成动态图表_grokai动态图表生成工具使用及数据可视化技巧  2025年QA工程师必备:五款AI自动化测试工具深度解析  现代集团CES 2026首秀机器人Atlas 发布AI机器人战略  Azure AI 文本分类指南:自定义模型,提高文本分析精度  今日头条AI怎样推荐抢票工具_今日头条AI抢票工具推荐算法与筛选【技巧】  VHEER AI:免费在线AI图像生成器终极指南  摆脱情歌魔咒:告别心碎,拥抱新生的情感之旅  深度学习姿态估计:技术、应用与未来趋势全解析  GTA Online: 2025最新无限隐形套装防消失技巧 

 2024-03-01

了解您产品搜索量及市场趋势,制定营销计划

同行竞争及网站分析保障您的广告效果

点击免费数据支持

提交您的需求,1小时内享受我们的专业解答。

南京市珐之弘网络技术有限公司


南京市珐之弘网络技术有限公司

南京市珐之弘网络技术有限公司专注海外推广十年,是谷歌推广.Facebook广告全球合作伙伴,我们精英化的技术团队为企业提供谷歌海外推广+外贸网站建设+网站维护运营+Google SEO优化+社交营销为您提供一站式海外营销服务。

 87067657

 13565296790

 87067657@qq.com

Notice

We and selected third parties use cookies or similar technologies for technical purposes and, with your consent, for other purposes as specified in the cookie policy.
You can consent to the use of such technologies by closing this notice, by interacting with any link or button outside of this notice or by continuing to browse otherwise.