feat: 全系统统一 Whisper V2 权重并移除 demo 工作流
确认所有运行时引用均使用 V2(V3 已停用),并修复一处真实不一致: - 工作流数据文件:learn-translate 用 faster-whisper-large-v2、 zh-direct 用 whisper-large-v2-translate-zh-v0.2-st-ct2(原本即 V2); - 本地库的 demo 最新版本仍指向 large-v3:workflows/demo.json 早已改为 V2, 但 seed 对已存在工作流刻意跳过,导致旧库停留在历史上用 V3 保存的定义, 即本机跑 demo 实际加载 V3 权重。按用户决定移除 demo 工作流及其关联的 6 个 run、1 个批量任务与 431 条明细(媒体库中已放置的 6 个字幕成品保留); - nodes/whisper.py 候选与远端兜底本就是 large-v2; - V3 权重目录保留在盘上仅作对照实验,文档标注为废弃; scripts/compare_whisper_v2_vs_v3.py 保留用于对照。 顺带修复与清理: - src/wov_app/scheduler.py:_file_size 补捕 ValueError(见上一条提交说明 的真实缺陷,此处为同一批改动); - .gitignore:data/ 改为 /data/,避免连带忽略 tests/**/data/; - scripts/*:评测集路径改到 scripts/data/translate_eval/; - 代码注释与文档同步移除 demo 引用(历史调研文档保留说明性引用)。 验证:全量 477 passed;新库 seed 只创建 3 个 V2 工作流。
This commit is contained in:
@@ -42,7 +42,7 @@ from contextlib import contextmanager
|
||||
from pathlib import Path
|
||||
|
||||
PROJECT_ROOT = Path(__file__).resolve().parent.parent
|
||||
# 所有评测产物落在 data/experiments(gitignored),不污染 testdata。
|
||||
# 所有评测产物落在 data/experiments(gitignored),不污染测试数据。
|
||||
OUT_ROOT = PROJECT_ROOT / "data/experiments/translate_models"
|
||||
|
||||
# 评测输入:run_d386ccf124f7 的日语 ASR(与 run_479b411f299d 同音轨,已核对
|
||||
@@ -226,7 +226,7 @@ def _window_rows(tags: list[str], limit: int, only: str | None, emit: str | None
|
||||
eval_set: str | None = None) -> None:
|
||||
"""打印/写出评测窗口的多模型译文对照表(人工 review 用)。
|
||||
|
||||
默认使用人工确认的评测集 testdata/translate_eval/eval_set.jsonl(124 个窗口,
|
||||
默认使用人工确认的评测集 scripts/data/translate_eval/eval_set.jsonl(124 个窗口,
|
||||
按时间分层抽样);未提供时回退到候选池 windows.jsonl。
|
||||
|
||||
stdout 与 markdown 文件**共用同一批文本行**(单一出口):此前两套格式
|
||||
@@ -235,9 +235,9 @@ def _window_rows(tags: list[str], limit: int, only: str | None, emit: str | None
|
||||
"""
|
||||
from nodes.srt import parse_srt
|
||||
|
||||
source = Path(eval_set) if eval_set else PROJECT_ROOT / "testdata/translate_eval/eval_set.jsonl"
|
||||
source = Path(eval_set) if eval_set else PROJECT_ROOT / "scripts/data/translate_eval/eval_set.jsonl"
|
||||
if not source.is_file():
|
||||
source = PROJECT_ROOT / "testdata/translate_eval/windows.jsonl"
|
||||
source = PROJECT_ROOT / "scripts/data/translate_eval/windows.jsonl"
|
||||
windows = [json.loads(line) for line in source.read_text(encoding="utf-8").splitlines()]
|
||||
ja_cues = parse_srt(DEFAULT_INPUT.read_text(encoding="utf-8"))
|
||||
# 每个 tag 读 cn.srt,按"时间戳 -> 译文"建索引(翻译不改变时间戳;被幻觉
|
||||
|
||||
Reference in New Issue
Block a user