FastTalkingHead:一种面向实时说话人脸合成的高效端到端框架

沈伟林, 虞钉钉, 冯绚, 陈亮, 欧阳丽敏

数学建模及其应用 ›› 2026, Vol. 15 ›› Issue (2) : 1 -10.

数学建模及其应用 ›› 2026, Vol. 15 ›› Issue (2) : 1 -10. DOI: 10.19943/j.2095-3070.jmmia.2026.02.01

FastTalkingHead:一种面向实时说话人脸合成的高效端到端框架

    沈伟林, 虞钉钉, 冯绚, 陈亮, 欧阳丽敏
作者信息 +

Author information +
文章历史 +

摘要

音频驱动的说话人脸生成旨在根据语音合成唇音同步且逼真的面部视频.本文提出了FastTalkingHead,一种用于该任务的新颖单阶段框架.不同于依赖中间面部表示或复杂自回归设计的方法,本模型采用掩码修复(masked inpainting)范式,引入了并行的音视频Transformer结构.具体而言,视觉Transformer编码未被遮挡的上半脸区域以提取上下文信息(如姿态、身份),而音频Transformer则编码语音以表征唇部动态.这两种独立编码的特征通过逐元素相加进行融合,并解码以修复被遮挡的嘴部区域.这种非自回归设计在简洁架构下实现了高精度的唇音同步与实时合成.实验表明,FastTalkingHead在唇音同步精度上优于现有方法,推理速度高达390 FPS以上,在像素级指标上虽未达到最优,但整体视觉自然度仍具竞争力.模型的简洁性使其易于高效训练与部署,适用于实时应用场景.

关键词

说话人脸合成 / 音频驱动合成 / 实时动画 / 掩码图像修复 / 非自回归生成

Key words

引用本文

引用格式 ▾
沈伟林, 虞钉钉, 冯绚, 陈亮, 欧阳丽敏. FastTalkingHead:一种面向实时说话人脸合成的高效端到端框架[J]. 数学建模及其应用, 2026, 15(2): 1-10 DOI:10.19943/j.2095-3070.jmmia.2026.02.01

登录浏览全文

4963

注册一个新账户 忘记密码

参考文献

AI Summary AI Mindmap

4

访问

0

被引

详细

导航
相关文章

AI思维导图

/