调度与状态机: - 修复 PAUSED 任务被拾起后复活执行(点击暂停反而开始任务):next_queued_run 只取 QUEUED,execute_run 以 PAUSED 进入直接返回,暂停必须显式 resume - 重启恢复:启动时 recover_interrupted_runs 把遗留 RUNNING 置 QUEUED(保留产物) - 暂停信号 paused.flag:暂停接口写、继续/重试清除,OCR 逐帧检查秒级中断, 节点内被暂停保持 PAUSED 不误报 FAILED - 调度轮询容错:_loop 异常不杀死线程(曾致任务永久停留 QUEUED) subtitle-ocr 节点级断点: - ocr_partial.jsonl 逐帧存档,重启/暂停后只处理未处理帧,产物与一次跑完一致 - 进度日志携带窗口平均耗时与线程数;取消后抑制进度日志井喷 llm-filter 过滤质量与限流自适应: - 上下文净化:喂给 LLM 的是过滤后的字幕(规则层垃圾从上下文剔除) - 正则确定性过滤:裸网址域名、HTML/水印模式直接删除 - 429/5xx 指数退避重试;worker 限流错误 report_failure 内存临时降最大线程数 并缩容(无错误窗口回升),失败条目降并发后重试一轮 - 保留长文本保护(noise 不删 ≥min_keep_len 文本,LLM 判定不稳的必要兜底) 前端: - 工作流编排页支持选择工作流编辑(加载最新/历史版本)、版本历史面板、 新建/编辑双模式;管理后台编辑跳转 workflow.html?edit=<id> 工作流:ocr-subtitle v7(filter pool_max_workers=20、pool_fast_threshold=1)
68 lines
1.5 KiB
JSON
68 lines
1.5 KiB
JSON
{
|
|
"id": "ocr-subtitle",
|
|
"name": "字幕OCR提取",
|
|
"description": "抽帧并 OCR 提取视频烧录字幕,经 LLM 过滤无意义内容后生成带时间轴的 SRT 基准数据。",
|
|
"version": 7,
|
|
"definition": {
|
|
"name": "字幕OCR提取",
|
|
"version": 7,
|
|
"nodes": [
|
|
{
|
|
"id": "extract",
|
|
"node_type": "frame-extract",
|
|
"params": {
|
|
"interval_seconds": 0.5,
|
|
"crop": [
|
|
0,
|
|
0.82,
|
|
1,
|
|
0.18
|
|
]
|
|
},
|
|
"inputs": {
|
|
"video_uri": "input.video_uri"
|
|
}
|
|
},
|
|
{
|
|
"id": "ocr",
|
|
"node_type": "subtitle-ocr",
|
|
"params": {
|
|
"prompt": "提取图像中的文字,不要描述图片中的内容",
|
|
"pool_min_workers": 1,
|
|
"pool_max_workers": 20
|
|
},
|
|
"inputs": {
|
|
"frames_manifest": "extract.frames_manifest"
|
|
}
|
|
},
|
|
{
|
|
"id": "filter",
|
|
"node_type": "llm-filter",
|
|
"params": {
|
|
"pool_min_workers": 1,
|
|
"pool_max_workers": 20,
|
|
"pool_fast_threshold": 1
|
|
},
|
|
"inputs": {
|
|
"srt_uri": "ocr.srt_uri"
|
|
}
|
|
}
|
|
],
|
|
"edges": [
|
|
{
|
|
"from": "extract",
|
|
"to": "ocr"
|
|
},
|
|
{
|
|
"from": "ocr",
|
|
"to": "filter"
|
|
}
|
|
],
|
|
"entry_inputs": {
|
|
"video_uri": "file"
|
|
},
|
|
"final_outputs": {
|
|
"srt": "filter.srt_uri"
|
|
}
|
|
}
|
|
} |