Files
vrsub/README.md
T
cat-shark 4746e0363f feat: VRSub 单体应用(WOV 单机版)初始提交
为视频生成 VR 双眼字幕的单体实现:FastAPI 后端、调度器与全部节点
(提音/转写/翻译/ASS/抽帧/OCR/LLM 过滤)在单进程内运行。

- 节点协议(wov_sdk 数据模型)与分布式版保持一致,预留回退桥梁
- 工作流即数据:DAG 存于 workflows/*.json,模型/链路改动只改数据
- 调度器:拓扑顺序执行、断点续跑(产物重建)、任务暂停/继续
- 抽帧按帧间隔(select 按帧号精确取帧),VLM OCR 与 LLM 过滤使用
  自适应线程池弹性并发,并打印数据处理速度进度日志
- 100% 行覆盖率(pytest --cov-fail-under=100)
2026-08-16 23:58:25 +08:00

46 lines
1.5 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# VRSub
为视频生成 **VR 双眼字幕**的单体应用:API、调度器与全部节点在同一进程内运行,
单仓库、单环境、单命令启动。由原分布式 WOV 多仓库合并而来,详细约定见
[AGENTS.md](./AGENTS.md)。
## 快速开始
```bash
uv sync
uv run uvicorn wov_app.main:app --reload
```
访问 `http://127.0.0.1:8000/` 上传视频,自动执行"提音 → 转写 → 翻译 → ASS"。
- 模型权重本地优先:把 whisper 模型放在 `model/faster-whisper-large-v3`
(含 `model.bin`)即可完全离线运行。
- LLM 翻译默认使用 SiliconFlow`Qwen/Qwen3.6-35B-A3B`),API Key 放在
gitignored 的 `.env``LLM_API_KEY=sk-...`),启动时自动加载;也可用
`LLM_API_BASE` / `LLM_MODEL` 环境变量覆盖。
## 目录
| 路径 | 说明 |
| --- | --- |
| `src/wov_sdk/` | 协议数据模型(与分布式版兼容) |
| `src/wov_app/` | 应用层:API、注册表、调度器、数据库 |
| `nodes/` | 进程内节点实现(echo/ffmpeg/whisper/llm/ass |
| `manifests/` | 节点清单 JSON |
| `web/` | 静态前端 |
| `model/` | 本地模型权重(gitignored |
| `data/` | SQLite 与存储(gitignored |
| `tests/` | 测试(100% 行覆盖率) |
## 测试
```bash
uv run pytest
```
## 与分布式版的关系
- 协议数据模型、工作流 DAG 数据化、调度拓扑执行保持不变。
- 已移除:子进程节点、节点 HTTP 协议、节点注册/实例管理、TTL 回收。
- 未来回退分布式时,只需为 `registry.invoke` 重新加上进程边界。