Initial lip-sync service with command backend
This commit is contained in:
@@ -0,0 +1,47 @@
|
||||
# 模型选型备忘
|
||||
|
||||
## 1. 数字人模型是什么
|
||||
|
||||
这里的“数字人”不是大语言模型,也不是单纯图片处理模型。它属于:
|
||||
|
||||
- 音频驱动人脸动画
|
||||
- 口型同步
|
||||
- 视频生成 / 视频重绘
|
||||
- 计算机视觉 + 音频特征处理
|
||||
|
||||
输入是人物视频和语音,输出是口型跟随语音的新视频。
|
||||
|
||||
## 2. 推荐路线
|
||||
|
||||
### 快速验证:Wav2Lip / Wav2Lip-HQ
|
||||
|
||||
优点:资料多、命令行方式成熟、适合先跑通。
|
||||
|
||||
缺点:高清和复杂动作效果有限。
|
||||
|
||||
### 效果优先:MuseTalk
|
||||
|
||||
优点:现代方案,效果潜力更好。
|
||||
|
||||
缺点:部署更重,需要更认真处理依赖和预处理。
|
||||
|
||||
### 项目一致性:LstmSync
|
||||
|
||||
优点:主项目已有 `resources/lstmsync` 配置,功能定位最贴近。
|
||||
|
||||
缺点:需要确认权重、环境和推理脚本是否完整可迁移。
|
||||
|
||||
## 3. 硬件建议
|
||||
|
||||
- 最低尝试:RTX 3060 12GB。
|
||||
- 更稳妥:16GB+ 显存。
|
||||
- 长视频或高清:建议 24GB+ 显存,或做切片处理。
|
||||
|
||||
## 4. 不建议第一版做的事
|
||||
|
||||
- 不要一开始就训练模型。
|
||||
- 不要一开始就做多模型动态切换 UI。
|
||||
- 不要一开始就接公网鉴权和计费。
|
||||
- 不要把模型权重放进 Git。
|
||||
|
||||
先跑通一个真实模型,再做工程化。
|
||||
Reference in New Issue
Block a user