Up主已经开始鬼畜,腾讯开源「AniPortrait」让照片唱歌说话


aniportrait 模型是开源的,可以自由畅玩。


「小破站鬼畜区的新质生产力工具。」

近日,腾讯开源发布的一个新项目在推上获得了如此评价。这个项目是 AniPortrait,其可基于音频和一张参考图像生成高质量动画人像。

话不说多,我们先看看可能会被律师函警告的 demo:
动漫图像也能轻松开口说话:
该项目刚上线几天,就已经收获了广泛好评:GitHub Star 数已经突破 2800。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

下面我们来看看 AniPortrait 的创新之处。

  • 论文标题:AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation
  • 论文地址:https://arxiv.org/pdf/2403.17694.pdf
  • 代码地址:https://github.com/Zejun-Yang/AniPortrait

AniPortrait

腾讯新提出的 AniPortrait 框架包含两个模块:Audio2Lmk 和 Lmk2Video。

Audio2Lmk 的作用是提取 Landmark 序列,其能从音频输入捕获复杂的面部表情和嘴唇动作。Lmk2Video 是利用这种 Landmark 序列来生成时间上稳定一致的高质量人像视频。

图 1 给出了 AniPortrait 框架的概况。

Audio2Lmk

对于一段语音片段序列,这里的目标是预测对应的 3D 人脸网格序列和姿势序列。

该团队采用了预训练的 wav2vec 来提取音频特征。该模型具有很好的泛化性能,并且可以准确识别音频中的发音和语调 —— 这对生成具有真实感的人脸动画来说至关重要。通过利用所获得的鲁棒的语音特征,使用一种包含两个 fc 层的简单架构就可以有效地将它们转换成 3D 人脸网格。该团队观察到,这种简单直接的设计不仅能确保准确度,而且还能提升推理过程的效率。

在将音频转换成姿势的任务中,该团队使用的骨干网络依然是同样的 wav2vec。但是,这一个网络的权重不同于音频到网格模块的网络。这是因为:姿势与音频中的节奏和音调的关联更加紧密,而音频到网格任务关注的重点(发音和语调)却不一样。为了将之前状态的影响纳入考量,该团队采用了一个 transformer 解码器来解码姿势序列。在这个过程中,该模块使用交叉注意力机制将音频特征整合进解码器。对于上述两个模块,训练使用的损失函数都是简单的 L1 损失。

在获得了网格和姿势序列之后,再使用透视投影将它们转换为 2D 的人脸 Landmark 序列。这些 Landmark 是下一阶段的输入信号。

Lmk2Video

给定一张参考人像和一个人脸 Landmark 序列,该团队提出的 Lmk2Video 可以创建具有时间一致性的人像动画。这个动画过程是将动作与 Landmark 序列对齐,同时维持与参考图像一致的外观。该团队采取的思路是将人像动画表示成一个人像帧构成的序列。

Lmk2Video 的这种网络结构设计的灵感来自 AnimateAnyone。其中的骨干网络是 SD1.5,其整合了一个时间运动模块,能有效地将多帧噪声输入转换成一个视频帧序列。

另外,他们还使用了一个 ReferenceNet,其同样采用了 SD1.5 的结构,作用是提取参考图像的外观信息并将其整合进骨干网络中。这一策略设计可确保人脸 ID 在整个输出视频中保持一致。

不同于 AnimateAnyone,这里提升了 PoseGuider 的设计的复杂性。原来的版本只是集成了几个卷积层,之后 Landmark 特征与骨干网络的输入层的隐含特征融合。而腾讯的这个团队发现,这种初级设计无法捕获嘴唇的复杂运动。因此,他们采用了 ControlNet 的多尺度策略:将相应尺度的 Landmark 特征整合进骨干网络的不同模块。尽管有这些改进,但最终模型的参数数量依然相当低。

该团队还引入了另一项改进:将参考图像的 Landmark 用作一个额外的输入。PoseGuider 的交叉注意力模块能促进参考 Landmark 和每一帧的目标 Landmark 之间的互动。这一过程能为网络提供额外的线索,使其能够理解人脸 Landmark 和外观之间的关联,由此可帮助人像动画生成更精准的动作。
 
实验

实现细节

Audio2Lmk 阶段使用的骨干网络是 wav2vec2.0。用于提取 3D 网格和 6D 姿势的工具是 MediaPipe。Audio2Mesh 的训练数据来自腾讯的内部数据集,其中包含接近一个小时的来自单个说话人的高质量语音数据。

为了确保 MediaPipe 提取出的 3D 网格的稳定性,在记录期间,表演者头部位置稳定并且面向相机。训练 Audio2Pose 使用的是 HDTF。所有的训练操作都在单台 A100 上执行,使用了 Adam 优化器,学习率设置为 1e-5.

Lmk2Video 过程则采用了一种两步式训练方法。

起始步骤阶段关注的重点是训练骨干网络 ReferenceNet 以及 PoseGuider 的 2D 组件,而不管运动模块。在后续步骤,则会冻结其它所有组件,专注于训练运动模块。为了训练模型,这里使用了两个大规模高质量人脸视频数据集:VFHQ 和 CelebV-HQ。所有数据都经由 MediaPipe 来提取 2D 人脸 Landmark。为了提升网络对嘴唇运动的敏感性,该团队的做法是在根据 2D Landmark 渲染姿势图像时,给上下唇标注不同的颜色。

所有图像的分辨率都重新调整成了 512x512。该模型的训练使用了 4 台 A100 GPU,每一步都耗时 2 天。优化器是 AdamW,学习率固定为 1e-5。

实验结果

如图 2 所示,新方法得到的动画在质量和真实度上都非常出色。

此外,用户还可以编辑其中间的 3D 表征,从而对最终输出进行修改。举个例子,用户可从某个源提取 Landmark 并修改其 ID 信息,从而实现面部重现效果,如下视频所示:更多细节请参考原论文。 


# 腾讯  # 架构  # animation  # github  # transformer  # https  # 采用了  # 这一  # 高质量  # 的人  # 转换成  # 使用了  # 有效地  # 所示  # 开源 


相关栏目: 【 Google疑问12 】 【 Facebook疑问10 】 【 网络优化91478 】 【 技术知识72672 】 【 云计算0 】 【 GEO优化84317 】 【 优选文章0 】 【 营销推广36048 】 【 网络运营41350 】 【 案例网站102563 】 【 AI智能45237


相关推荐: AI Buildr: 构建 AI 应用的终极指南  怎么用AI制作数字人短视频?3步教你创建虚拟主播  ChatGPT 提示词工程:结构化指令编写指南  打造AI Jarvis:停止功能、联网、中文与人脸集成  告别噪音:使用Adobe Podcast提升录音质量  百度输入法怎么去除ai模块 百度输入法纯净版安装教程  Hugging Face Transformers:文本分类的完整指南  CareerCraft AI:提升大学生实习就业的智能平台  微信AI数字人能否识别语音消息_微信AI数字人语音识别与回复设置【教程】  CanvaAI抠图怎么批量处理_CanvaAI批量抠图与团队协作功能【指南】  使用文心一言进行高质量的唐诗宋词创意改编  Foocus:免费AI图像生成器终极指南及 OnlyFans 替代方案  DeepSeek 辅助进行硬件描述语言 Verilog 调试  即梦ai能否生成国风插画_即梦ai国风元素调用与文化符号添加【技巧】  Sim.AI教程:构建智能客户支持助手  豆包AI怎么做数据分析 豆包AI数据处理入门教程  Character AI终极指南:构建你的人工智能伴侣,探索无限可能  通义千问怎样优化提示词合需求_通义千问需求契合技巧【步骤】  DeepSeek 在量化交易策略回测中的实战教程  谷歌 Nano Banana:免费AI图像生成的强大工具  豆包AI里的智能体有什么用_不同类型智能体使用场景介绍  利用AI自动化生成电子书:Make.com的终极教程  AI Sales Assistant:提升销售效率与客户互动的终极指南  百度AI搜索怎样设置搜索偏好_百度AI搜索偏好设置与个性化推荐【技巧】  豆包Ai官网在线入口_豆包Ai网页版访问方式  Fiverr网站审计终极指南:免费工具、SEO技巧和实战案例  Google Gemini 在跨境电商选品分析中的实战  AI电子书写作终极指南:ChatGPT和Canva实战教程  如何用AI帮你设计调查问卷?科学提问,精准收集反馈  通义千问怎样优化提示词效果_通义千问提示词优化技巧【攻略】  Lovart AI设计助手:AI驱动设计,零成本开启创意新纪元  苹果手机百度ai怎么关 iPhone百度输入法ai关闭  AI海报设计终极指南:免费智能工具,手机轻松搞定!  EcoFlow Delta 3 Max Plus:打造你的智能电力生态系统  研究学者如何利用现有资源提升学术影响力  lovemo官网直达链接 lovemo网页版在线  AI动画制作终极指南:让你的图片和人物栩栩如生  理论框架写作指南:3步构建研究基石  利用AI在五分钟内高效生成潜在客户:UpLead深度教程  Gacha Club反应视频解析:探索热门角色和独特剧情  斑马AI能否查看孩子学习报告_斑马AI报告查看与数据解读【方法】  AI驱动的潜在客户挖掘:15分钟搭建营销机构并获利  百度APP搜索框ai怎么关 百度APP搜索框ai图标去除  豆包AI怎么关闭消息推送_通知与提醒管理设置教程  AI工作流程详解:概念到生产的完整指南  lovemo网页版地址 lovemo官网手机登录  Brevio AI:利用AI代理提升电商营销效果  文本分类:生成模型与朴素贝叶斯算法的全面指南  AI赋能保险销售:提升邮件营销效果的终极指南  ChatGPT多轮对话技巧分享 引导AI深入探讨复杂问题的方法 

 2024-04-07

了解您产品搜索量及市场趋势,制定营销计划

同行竞争及网站分析保障您的广告效果

点击免费数据支持

提交您的需求,1小时内享受我们的专业解答。

南京市珐之弘网络技术有限公司


南京市珐之弘网络技术有限公司

南京市珐之弘网络技术有限公司专注海外推广十年,是谷歌推广.Facebook广告全球合作伙伴,我们精英化的技术团队为企业提供谷歌海外推广+外贸网站建设+网站维护运营+Google SEO优化+社交营销为您提供一站式海外营销服务。

 87067657

 13565296790

 87067657@qq.com

Notice

We and selected third parties use cookies or similar technologies for technical purposes and, with your consent, for other purposes as specified in the cookie policy.
You can consent to the use of such technologies by closing this notice, by interacting with any link or button outside of this notice or by continuing to browse otherwise.