feat: 批量分块流水线、本地模型显存让渡与任务列表分工

批量引擎改为「分块流水线」:视频按 WOV_BATCH_STAGE_GROUP_SIZE(默认 8)分组,
组内按 DAG 拓扑序跑完全部视频(全部 extract → 全部 ASR → 全部翻译 → 全部 ASS)
再进入下一组,本地模型每组只加载一次、卸载一次,而不是每个视频来回加载卸载;
产物仍按组增量落到视频旁。调度器新增 execute_run(run_id, stop_after=节点):
该节点完成后任务保持 RUNNING 不收尾,下一次调用从产物表跳过已完成节点继续,
用于实现阶段边界。

- nodes/llm.py:翻译节点结束释放本机 Ollama 显存(node 参数 unload_after >
  LLM_UNLOAD_AFTER > 本机 loopback 端点默认卸载,云端端点不卸载;卸载失败只告警),
  新增 keep_model.flag 语义(阶段内保持常驻)与 release_local_model();
  新增节点内暂停(按批 20 行检查 paused.flag,抛 PauseRequested,调度器保持 PAUSED)。
- src/wov_app/batch.py:分组阶段执行与阶段末统一释放显存;失败视频只在它失败
  节点的那个阶段重试(避免 LLM 已常驻时重跑 ASR 抢显存);任务没有明细时保持
  QUEUED 等登记完成、仍有未完成视频时置回 QUEUED 自愈(原先留 RUNNING 会卡死:
  引擎只拾取 QUEUED,任务停在“运行中但没人推进”);无失败视频时删除任务级空目录;
  每个阶段开始前清理 paused.flag / keep_model.flag,避免强杀残留影响后续阶段。
- src/wov_app/config.py:新增 WOV_BATCH_STAGE_GROUP_SIZE(设为 1 即旧的每视频全链路)。
- 任务列表与批量页分工:GET /api/runs 默认排除 source=batch(一个批量任务会产生
  N 条单视频 run,会把 20 条窗口占满;且任务管理页的暂停/重试/删除对批量 run
  语义不成立),需要排查时用 include_batch=1;作为补偿批量页详情新增阶段列
  (阶段 i/N · 中文标签,由该视频 run 的 current_node_id 在 DAG 拓扑序中的位置
  推导,节点类型映射中文标签)。阶段只有节点边界粒度,句级进度不落库、只在日志。
- 顺带纳入此前未提交的批量僵尸状态恢复:recover_interrupted_batch_jobs 除 RUNNING
  外也把「COMPLETED 但仍含未结束视频」的任务置回 QUEUED;fix_zombie_batch_jobs.py
  改为按条件扫描并支持 --apply 预览;批量页明细只列本批真正处理过的视频。

测试新增/更新:分块流水线调用顺序(组内按节点跑完再下一组)、每组只释放一次模型、
阶段内保持常驻标志、翻译按批暂停、失败视频不跨阶段推进、任务无明细/中途登记视频时
置回 QUEUED、任务工作空间与残留信号清理、任务列表默认过滤批量 run、详情阶段字段、
前端阶段列渲染;全量 507 passed(唯一失败为既有素材缺失的 integration 用例)。
This commit is contained in:
2026-09-18 10:31:52 +08:00
parent 7a7212f70c
commit dcdc5e8604
25 changed files with 1606 additions and 192 deletions
+24 -7
View File
@@ -132,12 +132,13 @@ function PathBase(path) {
return String(path).split(/[\\/]/).pop() || path;
}
// 拉取任务详情并渲染视频明细表:文件、状态、错误与产物下载链接。
async function videoDetailHtml(jobId) {
const job = await api(`/api/batch/jobs/${encodeURIComponent(jobId)}`);
const videos = job.videos || [];
if (!videos.length) return "(暂无视频)";
const rows = videos
// 渲染视频明细表:文件、状态、阶段、错误与产物下载链接。
// 只列本批真正处理过的视频:SKIPPED 表示视频旁已有字幕、本次未被处理,
// 展示出来会让用户误以为它被处理过。
function videoDetailTable(jobId, videos) {
const pending = (videos || []).filter((video) => video.status !== "SKIPPED");
if (!pending.length) return '<span class="muted">无待处理视频</span>';
const rows = pending
.map((video) => {
const finals = video.finals || {};
const links = Object.keys(finals)
@@ -146,16 +147,27 @@ async function videoDetailHtml(jobId) {
`<a class="download-link" href="/api/batch/jobs/${encodeURIComponent(jobId)}/videos/${encodeURIComponent(video.id)}/download?alias=${encodeURIComponent(alias)}">${escapeHtml(alias)}</a>`,
)
.join(" ");
// 阶段来自该视频 run 的当前节点(例:阶段 2/4 · 转写);未开始显示 -。
const stage = video.stage_label
? `阶段 ${video.stage_index}/${video.stage_total} · ${video.stage_label}`
: "-";
return `
<tr>
<td>${escapeHtml(PathBase(video.video_path))}</td>
<td>${badge(video.status)}</td>
<td>${escapeHtml(stage)}</td>
<td title="${escapeHtml(video.error || "")}">${escapeHtml(video.error || "-")}</td>
<td>${links || "-"}</td>
</tr>`;
})
.join("");
return `<table class="inner-table"><thead><tr><th>视频</th><th>状态</th><th>错误</th><th>产物</th></tr></thead><tbody>${rows}</tbody></table>`;
return `<table class="inner-table"><thead><tr><th>视频</th><th>状态</th><th>阶段</th><th>错误</th><th>产物</th></tr></thead><tbody>${rows}</tbody></table>`;
}
// 拉取任务详情并渲染视频明细表。
async function videoDetailHtml(jobId) {
const job = await api(`/api/batch/jobs/${encodeURIComponent(jobId)}`);
return videoDetailTable(jobId, job.videos || []);
}
// 暂停批量任务:当前 run 在分块/帧边界停下,后续视频不再开始。
@@ -351,3 +363,8 @@ document.addEventListener("DOMContentLoaded", async () => {
await loadBatchJobs();
setInterval(loadBatchJobs, 2000);
});
// 供测试在 Node 中调用纯渲染函数(浏览器下无 module,不执行)。
if (typeof module !== "undefined" && module.exports) {
module.exports = { videoDetailTable };
}