feat: llm-filter 节点级断点存档

- 每条 LLM 判定成功立即追加 filter_partial.jsonl(多线程加锁串行化)
- 失败/中断后重跑只重判未判定条目,已判定结果复用,与 OCR 存档同机制
- 附带上下文净化回归重跑脚本(run_011d01f19999)
This commit is contained in:
2026-08-23 16:25:13 +08:00
parent cc707dda75
commit 3b5bd42b60
3 changed files with 182 additions and 6 deletions
+26
View File
@@ -0,0 +1,26 @@
"""一次性脚本:用上下文净化后的 llm_filter 重跑 run_011d01f19999 的 filter 节点。
目的:验证"上下文净化"修复对误删真实对话的恢复效果(对比原输出 885 保留 / 805 删除)。
"""
from pathlib import Path
from dotenv import load_dotenv
load_dotenv(Path(".env"))
from nodes.llm_filter import invoke # noqa: E402
from wov_sdk.models import InvokeRequest # noqa: E402
run_root = Path("data/storage/runs/run_011d01f19999/steps")
out_dir = run_root / "filter_rerun_v2"
resp = invoke(
InvokeRequest(
run_id="run_011d01f19999",
node_instance_id="",
inputs={"srt_uri": str(run_root / "ocr/subtitle.srt")},
params={"pool_min_workers": 8, "pool_max_workers": 8},
output_dir=str(out_dir),
)
)
print("status:", resp.status, "| error:", resp.error)
print("outputs:", resp.outputs)