1.2 KiB
1.2 KiB
模型选型备忘
1. 数字人模型是什么
这里的“数字人”不是大语言模型,也不是单纯图片处理模型。它属于:
- 音频驱动人脸动画
- 口型同步
- 视频生成 / 视频重绘
- 计算机视觉 + 音频特征处理
输入是人物视频和语音,输出是口型跟随语音的新视频。
2. 推荐路线
快速验证:Wav2Lip / Wav2Lip-HQ
优点:资料多、命令行方式成熟、适合先跑通。
缺点:高清和复杂动作效果有限。
效果优先:MuseTalk
优点:现代方案,效果潜力更好。
缺点:部署更重,需要更认真处理依赖和预处理。
项目一致性:LstmSync
优点:主项目已有 resources/lstmsync 配置,功能定位最贴近。
缺点:需要确认权重、环境和推理脚本是否完整可迁移。
3. 硬件建议
- 最低尝试:RTX 3060 12GB。
- 更稳妥:16GB+ 显存。
- 长视频或高清:建议 24GB+ 显存,或做切片处理。
4. 不建议第一版做的事
- 不要一开始就训练模型。
- 不要一开始就做多模型动态切换 UI。
- 不要一开始就接公网鉴权和计费。
- 不要把模型权重放进 Git。
先跑通一个真实模型,再做工程化。