feat: 批量分块流水线、本地模型显存让渡与任务列表分工
批量引擎改为「分块流水线」:视频按 WOV_BATCH_STAGE_GROUP_SIZE(默认 8)分组, 组内按 DAG 拓扑序跑完全部视频(全部 extract → 全部 ASR → 全部翻译 → 全部 ASS) 再进入下一组,本地模型每组只加载一次、卸载一次,而不是每个视频来回加载卸载; 产物仍按组增量落到视频旁。调度器新增 execute_run(run_id, stop_after=节点): 该节点完成后任务保持 RUNNING 不收尾,下一次调用从产物表跳过已完成节点继续, 用于实现阶段边界。 - nodes/llm.py:翻译节点结束释放本机 Ollama 显存(node 参数 unload_after > LLM_UNLOAD_AFTER > 本机 loopback 端点默认卸载,云端端点不卸载;卸载失败只告警), 新增 keep_model.flag 语义(阶段内保持常驻)与 release_local_model(); 新增节点内暂停(按批 20 行检查 paused.flag,抛 PauseRequested,调度器保持 PAUSED)。 - src/wov_app/batch.py:分组阶段执行与阶段末统一释放显存;失败视频只在它失败 节点的那个阶段重试(避免 LLM 已常驻时重跑 ASR 抢显存);任务没有明细时保持 QUEUED 等登记完成、仍有未完成视频时置回 QUEUED 自愈(原先留 RUNNING 会卡死: 引擎只拾取 QUEUED,任务停在“运行中但没人推进”);无失败视频时删除任务级空目录; 每个阶段开始前清理 paused.flag / keep_model.flag,避免强杀残留影响后续阶段。 - src/wov_app/config.py:新增 WOV_BATCH_STAGE_GROUP_SIZE(设为 1 即旧的每视频全链路)。 - 任务列表与批量页分工:GET /api/runs 默认排除 source=batch(一个批量任务会产生 N 条单视频 run,会把 20 条窗口占满;且任务管理页的暂停/重试/删除对批量 run 语义不成立),需要排查时用 include_batch=1;作为补偿批量页详情新增阶段列 (阶段 i/N · 中文标签,由该视频 run 的 current_node_id 在 DAG 拓扑序中的位置 推导,节点类型映射中文标签)。阶段只有节点边界粒度,句级进度不落库、只在日志。 - 顺带纳入此前未提交的批量僵尸状态恢复:recover_interrupted_batch_jobs 除 RUNNING 外也把「COMPLETED 但仍含未结束视频」的任务置回 QUEUED;fix_zombie_batch_jobs.py 改为按条件扫描并支持 --apply 预览;批量页明细只列本批真正处理过的视频。 测试新增/更新:分块流水线调用顺序(组内按节点跑完再下一组)、每组只释放一次模型、 阶段内保持常驻标志、翻译按批暂停、失败视频不跨阶段推进、任务无明细/中途登记视频时 置回 QUEUED、任务工作空间与残留信号清理、任务列表默认过滤批量 run、详情阶段字段、 前端阶段列渲染;全量 507 passed(唯一失败为既有素材缺失的 integration 用例)。
This commit is contained in:
@@ -116,6 +116,72 @@ def test_topological_sort_diamond() -> None:
|
||||
assert set(order[1:3]) == {"b", "c"}
|
||||
|
||||
|
||||
def test_execute_run_stop_after_leaves_run_running_and_resumes(tmp_path: Path) -> None:
|
||||
"""分阶段执行:stop_after 指定阶段节点后停下(保持 RUNNING、不收尾),再次调用续跑完成。"""
|
||||
# 数据:a → b → c 三段 echo 链 + 最终别名。
|
||||
definition = _definition(
|
||||
nodes=[
|
||||
{"id": "a", "node_type": "echo", "inputs": {"file_uri": "input.video_uri"}},
|
||||
{"id": "b", "node_type": "echo", "inputs": {"file_uri": "a.file_uri"}},
|
||||
{"id": "c", "node_type": "echo", "inputs": {"file_uri": "b.file_uri"}},
|
||||
],
|
||||
edges=[{"from": "a", "to": "b"}, {"from": "b", "to": "c"}],
|
||||
final_outputs={"result": "c.file_uri"},
|
||||
)
|
||||
storage = tmp_path / "storage"
|
||||
db = _db_with_workflow(tmp_path, definition)
|
||||
source = tmp_path / "input.txt"
|
||||
source.write_text("分阶段内容", encoding="utf-8")
|
||||
db.create_run(_run("run-stage", str(source)))
|
||||
registry.register_all()
|
||||
scheduler = _scheduler(db, storage)
|
||||
|
||||
# 测试过程:第一阶段只执行到 b 为止。
|
||||
scheduler.execute_run("run-stage", stop_after="b")
|
||||
|
||||
# 验证结果:任务保持 RUNNING 未收尾,a/b 产物已登记,c 与最终别名都没有。
|
||||
staged = db.get_run("run-stage")
|
||||
assert staged["status"] == "RUNNING"
|
||||
assert staged["current_node_id"] == "b"
|
||||
names = {artifact["name"] for artifact in db.list_artifacts("run-stage")}
|
||||
assert {"a.file_uri", "b.file_uri"} <= names
|
||||
assert "c.file_uri" not in names
|
||||
assert "result" not in names
|
||||
|
||||
# 测试过程:不传 stop_after 时整条 DAG 跑完并收尾。
|
||||
scheduler.execute_run("run-stage")
|
||||
|
||||
# 验证结果:完成、进度 1.0、最终别名登记。
|
||||
finished = db.get_run("run-stage")
|
||||
assert finished["status"] == "COMPLETED"
|
||||
assert finished["progress"] == 1.0
|
||||
assert "result" in {artifact["name"] for artifact in db.list_artifacts("run-stage")}
|
||||
|
||||
|
||||
def test_execute_run_stop_after_unknown_node_marks_failed(tmp_path: Path) -> None:
|
||||
"""stop_after 指向不存在的节点时任务标 FAILED(不留下永远 RUNNING 的任务)。"""
|
||||
# 数据:单 echo 节点任务。
|
||||
definition = _definition(
|
||||
nodes=[{"id": "step", "node_type": "echo", "inputs": {"file_uri": "input.video_uri"}}],
|
||||
edges=[],
|
||||
final_outputs={"result": "step.file_uri"},
|
||||
)
|
||||
storage = tmp_path / "storage"
|
||||
db = _db_with_workflow(tmp_path, definition)
|
||||
source = tmp_path / "input.txt"
|
||||
source.write_text("内容", encoding="utf-8")
|
||||
db.create_run(_run("run-bad-stage", str(source)))
|
||||
registry.register_all()
|
||||
|
||||
# 测试过程
|
||||
_scheduler(db, storage).execute_run("run-bad-stage", stop_after="nope")
|
||||
|
||||
# 验证结果:FAILED 且错误说明阶段节点不存在。
|
||||
stored = db.get_run("run-bad-stage")
|
||||
assert stored["status"] == "FAILED"
|
||||
assert "stop_after" in (stored["error"] or "")
|
||||
|
||||
|
||||
# ---------------------------------------------------------------------------
|
||||
# 执行:成功路径
|
||||
# ---------------------------------------------------------------------------
|
||||
|
||||
Reference in New Issue
Block a user