d0d96a8f8934de1993e03c62831ef62f786fcf4c
背景:实测 CJOD-255 全程 BGM 覆盖(56% 低能量、几乎无静音),固定 VAD 参数把音乐当语音 → whisper 全段解码 → 80% 碎片化 + 32% 漏句 + 敏感段丢失。 实现 nodes/vad_profiler.py: - profile_audio:1s 能量网格分析 → 静音比例/BGM 覆盖/长停顿识别 - suggest_vad_parameters:按信号特征推荐 threshold/min_silence/speech_pad (BGM 覆盖 -> 降 threshold 增人声敏感;长停顿 -> 降 speech_pad 防时间漂移; 静音占比高 -> 升 threshold 剔虚警) - score_transcript:启发式评分(不用参考字幕,符合部署实际)—— 碎片率 + 幻觉词(感谢观看/晚安/音乐)扣分 + 平均字数适中 - vad_parameters_for_audio:信号分析 + 可选片段网格验证,选最优参数 - _grid_search_vad / _candidate_params:候选网格搜索与异常回退 测试 tests/test_vad_profiler.py:19 个用例覆盖信号分析、四个建议分支、 幻觉词/碎片评分、网格选优、异常回退、空音频/低采样率、候选展开。
VRSub
为视频生成 VR 双眼字幕的单体应用:API、调度器与全部节点在同一进程内运行, 单仓库、单环境、单命令启动。由原分布式 WOV 多仓库合并而来,详细约定见 AGENTS.md。
快速开始
uv sync
uv run uvicorn wov_app.main:app --reload
访问 http://127.0.0.1:8000/ 上传视频,自动执行"提音 → 转写 → 翻译 → ASS"。
- 模型权重本地优先:把 whisper 模型放在
model/faster-whisper-large-v3(含model.bin)即可完全离线运行。 - LLM 翻译默认使用 SiliconFlow(
Qwen/Qwen3.6-35B-A3B),API Key 放在 gitignored 的.env(LLM_API_KEY=sk-...),启动时自动加载;也可用LLM_API_BASE/LLM_MODEL环境变量覆盖。
目录
| 路径 | 说明 |
|---|---|
src/wov_sdk/ |
协议数据模型(与分布式版兼容) |
src/wov_app/ |
应用层:API、注册表、调度器、数据库 |
nodes/ |
进程内节点实现(echo/ffmpeg/whisper/llm/ass) |
manifests/ |
节点清单 JSON |
web/ |
静态前端 |
model/ |
本地模型权重(gitignored) |
data/ |
SQLite 与存储(gitignored) |
tests/ |
测试(100% 行覆盖率) |
测试
uv run pytest
与分布式版的关系
- 协议数据模型、工作流 DAG 数据化、调度拓扑执行保持不变。
- 已移除:子进程节点、节点 HTTP 协议、节点注册/实例管理、TTL 回收。
- 未来回退分布式时,只需为
registry.invoke重新加上进程边界。
Languages
Python
92.6%
JavaScript
5%
HTML
1.4%
CSS
1%