# 模型选型备忘 ## 1. 数字人模型是什么 这里的“数字人”不是大语言模型,也不是单纯图片处理模型。它属于: - 音频驱动人脸动画 - 口型同步 - 视频生成 / 视频重绘 - 计算机视觉 + 音频特征处理 输入是人物视频和语音,输出是口型跟随语音的新视频。 ## 2. 推荐路线 ### 快速验证:Wav2Lip / Wav2Lip-HQ 优点:资料多、命令行方式成熟、适合先跑通。 缺点:高清和复杂动作效果有限。 ### 效果优先:MuseTalk 优点:现代方案,效果潜力更好。 缺点:部署更重,需要更认真处理依赖和预处理。 ### 项目一致性:LstmSync 优点:主项目已有 `resources/lstmsync` 配置,功能定位最贴近。 缺点:需要确认权重、环境和推理脚本是否完整可迁移。 ## 3. 硬件建议 - 最低尝试:RTX 3060 12GB。 - 更稳妥:16GB+ 显存。 - 长视频或高清:建议 24GB+ 显存,或做切片处理。 ## 4. 不建议第一版做的事 - 不要一开始就训练模型。 - 不要一开始就做多模型动态切换 UI。 - 不要一开始就接公网鉴权和计费。 - 不要把模型权重放进 Git。 先跑通一个真实模型,再做工程化。