docs: 归档翻译上下文/字幕审校方案的评审结论与实测数据

- 待办:会话式长上下文方案标记为已技术评审且不实施;补记问题 A 的阶段性结论(暂缓)
- 新增 docs/实验数据-字幕审校定位与修复实验.md:LLM 定位触发率/召回、合成正样本、逐条修复前后对照、成本与复现方式
- 新增 docs/实验数据-字幕重生成成本与耗时.md:单价口径、功率画像、全量推算
- decisions:补充两条决策(会话式长上下文否决、审校定位+定向修复暂缓)
- scripts:归档一次性探测脚本 probe_subtitle_review_stage0.py(含 rebuild 子步骤)
- AGENTS/README:补充实验与改动许可规则、文档索引
This commit is contained in:
2026-09-19 18:33:28 +08:00
parent 2c8bbb6469
commit 5b263171f2
7 changed files with 1187 additions and 0 deletions
@@ -0,0 +1,109 @@
# 实验数据:字幕重生成的成本与耗时
本文件汇总 2026-09-18 ~ 09-19 媒体库字幕重生成(`/mnt/fnOS/123`)的**实测**资源与
费用口径,供后续推算与对比复用。原始数据见文末"数据来源"。
---
## 一、口径与单价
| 项 | 值 | 来源 |
| --- | --- | --- |
| 翻译模型 | SiliconFlow `Qwen/Qwen3.5-35B-A3B``enable_thinking=false` | `.env` 线上配置 |
| 输入单价 | ¥0.400 / M tokens<128k 档) | 用户提供的价目表 |
| 输出单价 | ¥3.200 / M tokens<128k 档) | 同上 |
| 电价 | ¥0.5 / 度(kWh | 用户口径 |
| 本地卡 | RTX 3090350W 上限,24GB | `nvidia-smi` |
| 输入/输出拆分 | 按批输入 ≈529 tokens 实测回推,其余计输出 | 单批预检实测 |
## 二、功率画像(实测)
| 状态 | GPU 功率 | 说明 |
| --- | --- | --- |
| 空闲(提音/线上翻译阶段) | 1920 W | GPU 显存 272 MiB |
| 转写(faster-whisper large-v2 | 270290 W | 显存约 3.64.6 GB |
| 本机 LLMOllama `qwen3:30b-a3b` | 348 W | 显存约 21 GB |
| 整机(电表校验) | **413 W 平均** | 第二批样本 58.1 分钟窗口,电表 1.6→2.0 度 = 0.40 kWh |
| 整机非 GPU 部分 | ≈137 W(本地 LLM 轮) / ≈100 W(云端轮估) | 由上面两项相减估算 |
## 三、三轮样本实测对照
| 轮次 | LLM | 素材 | 结果 | 挂钟 | 速度 | GPU 耗电 | API 费用 |
| --- | --- | --- | --- | --- | --- | --- | --- |
| ① `batch_204b2e4f0cf4` | 本地 | 6.54 h / 10 个 | 10/10 | 77.7 min | 11.9 min/素材小时 | 0.375 kWh(均 289.6W,峰 349.2W | — |
| ② `batch_9ef5d063612b` | 本地 | 6.73 h / 10 个 | 9/101 个 API 失败后重试成功) | 58.1 min | 8.6 min/素材小时 | 0.267 kWh(均 275.6W);**电表整机 0.40 kWh** | — |
| ③ `batch_2dff6b79283f` | 云端 | 6.36 h / 10 个 | 10/10 | 41.5 min | 6.5 min/素材小时 | 0.077 kWh(均 111.7WGPU 空闲占比 64% | **¥0.186**124,423 tokens |
第三轮明细:翻译 2,761 行 / 143 批 / 纯 LLM 17.4 分钟;输入≈75.6k、输出≈48.8k tokens。
## 四、单素材小时指标(可直接乘算)
| 口径 | 值 |
| --- | --- |
| API(云端轮 ③) | 19,563 tokens/素材小时 → **¥0.0293/素材小时**(每视频 ¥0.0186 |
| API28 视频修复轮,见五) | 33,136 tokens/素材小时 → **¥0.0504/素材小时** |
| APINKKVR-175 A 单视频) | 17,400 tokens/素材小时 → **¥0.0258/素材小时** |
| 电耗(云端 + 新流水线) | ≈0.030 kWh/素材小时(GPU 0.021 + 系统 0.009 |
| 电耗(本地 LLM,电表实测) | **0.059 kWh/素材小时** |
| 成本合计(云端方案) | ¥0.015 电费 + ¥0.030.05 API = **¥0.0450.065/素材小时** |
## 五、28 视频损坏修复轮(2026-09-19
| 项 | 值 |
| --- | --- |
| 规模 | 28 个视频 / **16.87 小时**素材(27 个新字幕损坏 + 1 个命名特例) |
| 结果 | 26/28 一次成功;2 个云端 API 600s 读超时失败,重跑后 2/2 成功 |
| 挂钟 | 00:43 → 03:19 = **2.6 小时**9.2 分钟/素材小时) |
| API | 558,940 tokens → **¥0.850**(输入≈335k / 输出≈224k |
| 电耗 | GPU 0.598 kWh(均 230W、忙碌占比 80%)→ 整机估 0.858 kWh = ¥0.43 |
## 六、流水线与 HST 的耗时影响
- **新流水线(非 GPU 阶段并行)** 实测重叠:`kiwvr-886/887` 那轮里 B 视频的云端翻译
22:51:08→22:52:37)与 A 视频的转写(22:51:08→22:54:42)完全重叠;串行实现下这段
GPU 会空转。
- **extract 可与转写并行**8 个视频提音约 7.8 分钟(GPU 空闲),流水线里被转写掩盖。
- **HST`hallucination_silence_threshold=2.0` + `word_timestamps`** 让转写变慢:
同一段 120 秒音频 **15.4s → 25.4s1.8×)**;换来片头 120 秒无对话段的字幕条数
15 → 4(且无套话幻觉残留)。
| 阶段(云端 + HST,8 个视频一组 / 5.1 小时素材) | 实测 |
| --- | --- |
| extract | ≈7.8 分钟(GPU 空闲,可并行) |
| ASR | ≈12.9 分钟 × 1.8HST ≈ 23 分钟(GPU 满载) |
| translate | ≈1517 分钟(GPU 空闲,与 ASR 重叠) |
| ASS | 秒级 |
## 七、全量推算(2026-09-19 状态)
待重生成:**349 个 / 187.86 小时素材**(媒体库共 524 个 / 287.27 小时)。
| 方案 | API | 电费 | 合计 | 挂钟 |
| --- | --- | --- | --- | --- |
| 云端 + HST(当前配置) | ¥5.59.4(按 ¥0.030.05/素材小时) | ≈¥2.8 | **¥1012** | 1720 小时 |
| 本地 LLM(对照) | — | ¥5.711.5 kWh | ¥5.7 | 2839 小时 |
敏感性:HST 关闭 → 电费约 ¥1.6、挂钟约 11 小时;HST 实测倍数升到 2.2× → 电费 ¥3.4、
挂钟约 21 小时。若翻译改成"会话式长上下文"(见
[待办-翻译上下文复用与语义纠错.md](./待办-翻译上下文复用与语义纠错.md)),
**输入 token 会大幅上升,上表 API 一列必须重算**
## 八、测量陷阱
- **任务行的 `updated_at` 不是完成时间**`GET /api/batch/jobs*` 会触发
`sync_batch_job_progress` 重写该字段;请用日志的"批量任务 … 完成"行、明细的
`updated_at`,或 `data/experiments/regen_plan/app_cloud_run.log` 的时间戳。
- GPU 采样用 `nvidia-smi --query-gpu=... -l 15`,能量按"采样均值 × 窗口时长"积分;
窗口边界要与起止时间对齐(脚本按时间过滤 CSV 行)。
## 九、数据来源(本机)
| 内容 | 路径 |
| --- | --- |
| 全量实测报告(9 节,含根因与 A/B) | `data/experiments/regen_plan/REPORT.md` |
| 数据量扫描与逐条明细 | `data/experiments/regen_plan/plan_2026-09-01.json``sample10*.txt` |
| 应用的运行日志(含每批 tokens 与阶段时序) | `data/experiments/regen_plan/app_cloud_run.log` |
| GPU 功耗采样 | `data/experiments/regen_plan/gpu_power_*.csv` |
| 质量对照(新旧字幕指标) | `data/experiments/regen_plan/quality_review.md` |
| 提示词快照(做实验用) | `data/experiments/regen_plan/prompt_dump/` |
| 资源调度设计笔记 | `data/experiments/regen_plan/design_gpu_resource_scheduling.md` |