5c12bbcb74e1b6325a590ebba2bb399870efa0db
根因(真实任务 run_51242078d76e): 1. LLM 按 CHUNK_SIZE=20 分批翻译时,对语义碎片句(如单独的助词/名词/ 语气词)偶发多拆/少拆一行,translate_lines 无条件 extend 导致: - 多行 -> 后续所有字幕文本整体错位,时间戳从原文复制、文本却错贴时间; - 少行 -> invoke 末尾补空导致该条内容缺失。 程序按时戳看不出问题,实际"内容对错时间"(如第756条"好像喜欢害羞 的样子"错贴 3805s,实为"恥ずかしいのが好きみたいなので"的译文)。 2. system_prompt 圆括号内出现 f-string 赋值导致隐式字符串拼接失效, 整体变成 tuple,json 序列化后 content 是数组 -> LLM API 400。 修复: - 提示词强化:逐行独立翻译 + 碎片句按语境独立成行 + 禁止合并/拆分; - _repair_batch:多行末尾合并到前一行、少行重试该批(最多3次)仍不足 补空串占位(宁缺勿错位),保证译文与原文逐条时间对齐; - system_prompt 显式 + 拼接为单个字符串。 测试(先红后绿): - test_translate_lines_aligns_extra_line:多行合并对齐 - test_translate_lines_aligns_missing_line:少行重试补齐 - test_translate_lines_pads_after_retries_exhausted:重试耗尽补空 - test_pipeline_zh_cn_timetext_alignment:真实 LLM 完整 1440 行逐条对齐 pyproject.toml: 注册 integration marker
VRSub
为视频生成 VR 双眼字幕的单体应用:API、调度器与全部节点在同一进程内运行, 单仓库、单环境、单命令启动。由原分布式 WOV 多仓库合并而来,详细约定见 AGENTS.md。
快速开始
uv sync
uv run uvicorn wov_app.main:app --reload
访问 http://127.0.0.1:8000/ 上传视频,自动执行"提音 → 转写 → 翻译 → ASS"。
- 模型权重本地优先:把 whisper 模型放在
model/faster-whisper-large-v3(含model.bin)即可完全离线运行。 - LLM 翻译默认使用 SiliconFlow(
Qwen/Qwen3.6-35B-A3B),API Key 放在 gitignored 的.env(LLM_API_KEY=sk-...),启动时自动加载;也可用LLM_API_BASE/LLM_MODEL环境变量覆盖。
目录
| 路径 | 说明 |
|---|---|
src/wov_sdk/ |
协议数据模型(与分布式版兼容) |
src/wov_app/ |
应用层:API、注册表、调度器、数据库 |
nodes/ |
进程内节点实现(echo/ffmpeg/whisper/llm/ass) |
manifests/ |
节点清单 JSON |
web/ |
静态前端 |
model/ |
本地模型权重(gitignored) |
data/ |
SQLite 与存储(gitignored) |
tests/ |
测试(100% 行覆盖率) |
测试
uv run pytest
与分布式版的关系
- 协议数据模型、工作流 DAG 数据化、调度拓扑执行保持不变。
- 已移除:子进程节点、节点 HTTP 协议、节点注册/实例管理、TTL 回收。
- 未来回退分布式时,只需为
registry.invoke重新加上进程边界。
Languages
Python
92.6%
JavaScript
5%
HTML
1.4%
CSS
1%