fix: 批量任务残留PENDING仍误标COMPLETED——置完成前校验无残留+崩溃恢复批量任务
事故(batch_969fabe74b83 等 3 个任务实测):批量引擎串行处理到 9.9GB 大视频时中断,_run_job 无条件收尾把任务置 COMPLETED,留下"N 个 PENDING 待处理却已完成"的僵尸状态——3 个任务遗留的 PENDING 完全相同(kiwvr-887/ mdvr-413/savr-1077 共 10 个大视频),且均卡在大文件前从未被真正处理。 - batch.py: _run_job 置 COMPLETED 前校验全部非 SKIPPED 视频已结束 (无 PENDING/PAUSED 残留),否则保持 RUNNING 交引擎下一轮续跑 - db.py/main.py: 新增 recover_interrupted_batch_jobs,重启时把 RUNNING 批量任务恢复 QUEUED(否则停在 RUNNING 永远不会被再次拾起) - tests: 新增 2 条 TDD 回归(残留 PENDING 不置 COMPLETED、批量崩溃恢复) - scripts/fix_zombie_batch_jobs.py: 历史僵尸数据修复脚本(置回 QUEUED 续跑) - AGENTS.md: 补充完成任务判定与崩溃恢复约定
This commit is contained in:
@@ -408,8 +408,31 @@ class BatchWorker:
|
||||
|
||||
# 全部视频处理完成:先用明细实时对齐汇总(done 只计实际完成的,
|
||||
# 不含 SKIPPED),再置 COMPLETED。
|
||||
#
|
||||
# 置 COMPLETED 前必须校验**没有未处理完的视频残留**:若本轮循环因
|
||||
# 视频处理中断/异常(_process_video 返回但视频仍 PENDING,等同进程
|
||||
# 在处理中被杀)而没有真正处理完所有 PENDING,就**不能**标完成——
|
||||
# 否则会出现"明细还有 N 个待处理、任务却已完成"的僵尸状态
|
||||
# (batch_969fabe74b83 等 3 个任务真实发生:引擎串行处理到 9.9GB
|
||||
# 大视频时中断,10 个视频留 PENDING 却被无条件置 COMPLETED)。
|
||||
# 此时保持 RUNNING,让引擎下一轮(重启后重新拾起 RUNNING 任务)
|
||||
# 继续处理剩余 PENDING,全部结束才真正置 COMPLETED。
|
||||
self.db.sync_batch_job_progress(job_id)
|
||||
job = self.db.get_batch_job(job_id)
|
||||
if job is None:
|
||||
return
|
||||
leftovers = [
|
||||
v for v in self.db.list_batch_videos(job_id)
|
||||
if v["status"] not in ("SKIPPED", "COMPLETED", "FAILED")
|
||||
]
|
||||
if leftovers:
|
||||
# 有未处理完的视频(PENDING/PAUSED/QUEUED 等):保持 RUNNING,
|
||||
# 由引擎下一轮续跑;记录日志便于排查中断位置。
|
||||
logger.warning(
|
||||
"批量任务 %s 仍有 %d 个视频未处理完(%s…),保持 RUNNING 待续跑,不置 COMPLETED",
|
||||
job_id, len(leftovers), Path(leftovers[0]["video_path"]).name,
|
||||
)
|
||||
return
|
||||
done = int(job["done"]) if job else 0
|
||||
failed = int(job["failed"]) if job else 0
|
||||
self.db.update_batch_job(
|
||||
|
||||
Reference in New Issue
Block a user