feat: VRSub 单体应用(WOV 单机版)初始提交
为视频生成 VR 双眼字幕的单体实现:FastAPI 后端、调度器与全部节点 (提音/转写/翻译/ASS/抽帧/OCR/LLM 过滤)在单进程内运行。 - 节点协议(wov_sdk 数据模型)与分布式版保持一致,预留回退桥梁 - 工作流即数据:DAG 存于 workflows/*.json,模型/链路改动只改数据 - 调度器:拓扑顺序执行、断点续跑(产物重建)、任务暂停/继续 - 抽帧按帧间隔(select 按帧号精确取帧),VLM OCR 与 LLM 过滤使用 自适应线程池弹性并发,并打印数据处理速度进度日志 - 100% 行覆盖率(pytest --cov-fail-under=100)
This commit is contained in:
@@ -0,0 +1,45 @@
|
||||
# VRSub
|
||||
|
||||
为视频生成 **VR 双眼字幕**的单体应用:API、调度器与全部节点在同一进程内运行,
|
||||
单仓库、单环境、单命令启动。由原分布式 WOV 多仓库合并而来,详细约定见
|
||||
[AGENTS.md](./AGENTS.md)。
|
||||
|
||||
## 快速开始
|
||||
|
||||
```bash
|
||||
uv sync
|
||||
uv run uvicorn wov_app.main:app --reload
|
||||
```
|
||||
|
||||
访问 `http://127.0.0.1:8000/` 上传视频,自动执行"提音 → 转写 → 翻译 → ASS"。
|
||||
|
||||
- 模型权重本地优先:把 whisper 模型放在 `model/faster-whisper-large-v3`
|
||||
(含 `model.bin`)即可完全离线运行。
|
||||
- LLM 翻译默认使用 SiliconFlow(`Qwen/Qwen3.6-35B-A3B`),API Key 放在
|
||||
gitignored 的 `.env`(`LLM_API_KEY=sk-...`),启动时自动加载;也可用
|
||||
`LLM_API_BASE` / `LLM_MODEL` 环境变量覆盖。
|
||||
|
||||
## 目录
|
||||
|
||||
| 路径 | 说明 |
|
||||
| --- | --- |
|
||||
| `src/wov_sdk/` | 协议数据模型(与分布式版兼容) |
|
||||
| `src/wov_app/` | 应用层:API、注册表、调度器、数据库 |
|
||||
| `nodes/` | 进程内节点实现(echo/ffmpeg/whisper/llm/ass) |
|
||||
| `manifests/` | 节点清单 JSON |
|
||||
| `web/` | 静态前端 |
|
||||
| `model/` | 本地模型权重(gitignored) |
|
||||
| `data/` | SQLite 与存储(gitignored) |
|
||||
| `tests/` | 测试(100% 行覆盖率) |
|
||||
|
||||
## 测试
|
||||
|
||||
```bash
|
||||
uv run pytest
|
||||
```
|
||||
|
||||
## 与分布式版的关系
|
||||
|
||||
- 协议数据模型、工作流 DAG 数据化、调度拓扑执行保持不变。
|
||||
- 已移除:子进程节点、节点 HTTP 协议、节点注册/实例管理、TTL 回收。
|
||||
- 未来回退分布式时,只需为 `registry.invoke` 重新加上进程边界。
|
||||
Reference in New Issue
Block a user