feat: 全系统统一 Whisper V2 权重并移除 demo 工作流
确认所有运行时引用均使用 V2(V3 已停用),并修复一处真实不一致: - 工作流数据文件:learn-translate 用 faster-whisper-large-v2、 zh-direct 用 whisper-large-v2-translate-zh-v0.2-st-ct2(原本即 V2); - 本地库的 demo 最新版本仍指向 large-v3:workflows/demo.json 早已改为 V2, 但 seed 对已存在工作流刻意跳过,导致旧库停留在历史上用 V3 保存的定义, 即本机跑 demo 实际加载 V3 权重。按用户决定移除 demo 工作流及其关联的 6 个 run、1 个批量任务与 431 条明细(媒体库中已放置的 6 个字幕成品保留); - nodes/whisper.py 候选与远端兜底本就是 large-v2; - V3 权重目录保留在盘上仅作对照实验,文档标注为废弃; scripts/compare_whisper_v2_vs_v3.py 保留用于对照。 顺带修复与清理: - src/wov_app/scheduler.py:_file_size 补捕 ValueError(见上一条提交说明 的真实缺陷,此处为同一批改动); - .gitignore:data/ 改为 /data/,避免连带忽略 tests/**/data/; - scripts/*:评测集路径改到 scripts/data/translate_eval/; - 代码注释与文档同步移除 demo 引用(历史调研文档保留说明性引用)。 验证:全量 477 passed;新库 seed 只创建 3 个 V2 工作流。
This commit is contained in:
@@ -4,7 +4,7 @@
|
||||
(frame-extract 抽帧 → subtitle-ocr 逐帧 OCR → 汇总 SRT),把烧录字幕的
|
||||
出现/消失帧时间换算成秒,产出严格符合测试契约的参考字幕:
|
||||
|
||||
testdata/alignment/<name>.reference.srt (标准 SRT)
|
||||
tests/shared/data/alignment/<name>.reference.srt (标准 SRT)
|
||||
|
||||
为什么烧录字幕的时间是可信的 ground truth:
|
||||
|
||||
@@ -18,7 +18,7 @@
|
||||
|
||||
用法(在 vrsub 根目录,需 Ollama glm-ocr 服务可达、有 ffmpeg):
|
||||
|
||||
uv run python scripts/extract_reference_srt.py <视频路径> [--out testdata/alignment <name>] [--interval 0.5] [--crop 0,0.75,1,0.25]
|
||||
uv run python scripts/extract_reference_srt.py <视频路径> [--out tests/shared/data/alignment <name>] [--interval 0.5] [--crop 0,0.75,1,0.25]
|
||||
|
||||
- --interval:抽帧间隔秒(默认 0.5;字幕时长 2s 时约取 4 帧,够稳定合并)
|
||||
- --crop:字幕区域相对比例 x,y,w,h(默认底部 1/4,与生产默认一致)
|
||||
@@ -132,7 +132,7 @@ def extract_reference_srt(
|
||||
def main(argv: list[str] | None = None) -> int:
|
||||
parser = argparse.ArgumentParser(description="从烧录字幕视频自动提取参考时间轴")
|
||||
parser.add_argument("video", type=Path, help="烧录字幕视频路径(mp4 等)")
|
||||
parser.add_argument("--out-dir", type=Path, default=PROJECT_ROOT / "testdata" / "alignment")
|
||||
parser.add_argument("--out-dir", type=Path, default=PROJECT_ROOT / "tests" / "shared" / "data" / "alignment")
|
||||
parser.add_argument("--name", type=str, default=None, help="输出名前缀(默认=视频文件名)")
|
||||
parser.add_argument("--interval", type=float, default=0.5, help="抽帧间隔秒(默认 0.5)")
|
||||
parser.add_argument("--crop", type=str, default="0,0.75,1,0.25", help="字幕区域 x,y,w,h")
|
||||
|
||||
Reference in New Issue
Block a user