cat-shark f2895ee103 feat: 字幕领域纠错模块(通用领域词表 + 有效上下文,不过拟合)
背景:成人视频 ASR 常把性器官(チンポ/マンコ)听错成近音词(手先/
チェーンバー 等),翻译逐字直译导致与画面严重不符。

实验结论:
- 硬编码 ASR 误听例子(手先→肉棒)过拟合——换视频的误听词就失效;
- 通用领域词表(只列性器官的常见日文词+中文)+ 有效上下文 + 通用引导
  可泛化——对从没见过的误听(バナナ/マンゴー→性器官)也能按语境推断。

实现 nodes/subtitle_correction.py:
- PROPER_SESSION_WORDS:通用性器官领域词表(不含 ASR 误听噪声词)
- _is_fragment:纯语气词/碎片过滤
- _build_context:目标 ±60s 有效上下文(过滤碎片,保留动作链)
- _system_prompt:通用引导(无具体误听例子)
- _extract_target_line:从 LLM 输出解析目标行译文
- invoke:逐条领域纠错,产出 corrected.srt

测试 tests/test_subtitle_correction.py(12 个):
- 碎片判定/上下文过滤/目标解析/提示词无噪声例子(9 快速单测)
- 真实 LLM 泛化回归(对未出现误听词也能推断性器官)+ 端到端 invoke
2026-09-06 10:44:09 +08:00

VRSub

为视频生成 VR 双眼字幕的单体应用:API、调度器与全部节点在同一进程内运行, 单仓库、单环境、单命令启动。由原分布式 WOV 多仓库合并而来,详细约定见 AGENTS.md

快速开始

uv sync
uv run uvicorn wov_app.main:app --reload

访问 http://127.0.0.1:8000/ 上传视频,自动执行"提音 → 转写 → 翻译 → ASS"。

  • 模型权重本地优先:把 whisper 模型放在 model/faster-whisper-large-v3 (含 model.bin)即可完全离线运行。
  • LLM 翻译默认使用 SiliconFlowQwen/Qwen3.6-35B-A3B),API Key 放在 gitignored 的 .envLLM_API_KEY=sk-...),启动时自动加载;也可用 LLM_API_BASE / LLM_MODEL 环境变量覆盖。

目录

路径 说明
src/wov_sdk/ 协议数据模型(与分布式版兼容)
src/wov_app/ 应用层:API、注册表、调度器、数据库
nodes/ 进程内节点实现(echo/ffmpeg/whisper/llm/ass
manifests/ 节点清单 JSON
web/ 静态前端
model/ 本地模型权重(gitignored
data/ SQLite 与存储(gitignored
tests/ 测试(100% 行覆盖率)

测试

uv run pytest

与分布式版的关系

  • 协议数据模型、工作流 DAG 数据化、调度拓扑执行保持不变。
  • 已移除:子进程节点、节点 HTTP 协议、节点注册/实例管理、TTL 回收。
  • 未来回退分布式时,只需为 registry.invoke 重新加上进程边界。
S
Description
No description provided
Readme
3.6 MiB
Languages
Python 92.6%
JavaScript 5%
HTML 1.4%
CSS 1%