Files
digital-human-lipsync-service/docs/model-selection.md
T
2026-06-20 17:16:11 +08:00

1.2 KiB

模型选型备忘

1. 数字人模型是什么

这里的“数字人”不是大语言模型,也不是单纯图片处理模型。它属于:

  • 音频驱动人脸动画
  • 口型同步
  • 视频生成 / 视频重绘
  • 计算机视觉 + 音频特征处理

输入是人物视频和语音,输出是口型跟随语音的新视频。

2. 推荐路线

快速验证:Wav2Lip / Wav2Lip-HQ

优点:资料多、命令行方式成熟、适合先跑通。

缺点:高清和复杂动作效果有限。

效果优先:MuseTalk

优点:现代方案,效果潜力更好。

缺点:部署更重,需要更认真处理依赖和预处理。

项目一致性:LstmSync

优点:主项目已有 resources/lstmsync 配置,功能定位最贴近。

缺点:需要确认权重、环境和推理脚本是否完整可迁移。

3. 硬件建议

  • 最低尝试:RTX 3060 12GB。
  • 更稳妥:16GB+ 显存。
  • 长视频或高清:建议 24GB+ 显存,或做切片处理。

4. 不建议第一版做的事

  • 不要一开始就训练模型。
  • 不要一开始就做多模型动态切换 UI。
  • 不要一开始就接公网鉴权和计费。
  • 不要把模型权重放进 Git。

先跑通一个真实模型,再做工程化。