feat: llm-filter 节点级断点存档
- 每条 LLM 判定成功立即追加 filter_partial.jsonl(多线程加锁串行化) - 失败/中断后重跑只重判未判定条目,已判定结果复用,与 OCR 存档同机制 - 附带上下文净化回归重跑脚本(run_011d01f19999)
This commit is contained in:
@@ -0,0 +1,26 @@
|
||||
"""一次性脚本:用上下文净化后的 llm_filter 重跑 run_011d01f19999 的 filter 节点。
|
||||
|
||||
目的:验证"上下文净化"修复对误删真实对话的恢复效果(对比原输出 885 保留 / 805 删除)。
|
||||
"""
|
||||
from pathlib import Path
|
||||
from dotenv import load_dotenv
|
||||
|
||||
load_dotenv(Path(".env"))
|
||||
|
||||
from nodes.llm_filter import invoke # noqa: E402
|
||||
from wov_sdk.models import InvokeRequest # noqa: E402
|
||||
|
||||
run_root = Path("data/storage/runs/run_011d01f19999/steps")
|
||||
out_dir = run_root / "filter_rerun_v2"
|
||||
|
||||
resp = invoke(
|
||||
InvokeRequest(
|
||||
run_id="run_011d01f19999",
|
||||
node_instance_id="",
|
||||
inputs={"srt_uri": str(run_root / "ocr/subtitle.srt")},
|
||||
params={"pool_min_workers": 8, "pool_max_workers": 8},
|
||||
output_dir=str(out_dir),
|
||||
)
|
||||
)
|
||||
print("status:", resp.status, "| error:", resp.error)
|
||||
print("outputs:", resp.outputs)
|
||||
Reference in New Issue
Block a user