Files
vrsub/docs/实验数据-字幕重生成成本与耗时.md
cat-shark 5b263171f2 docs: 归档翻译上下文/字幕审校方案的评审结论与实测数据
- 待办:会话式长上下文方案标记为已技术评审且不实施;补记问题 A 的阶段性结论(暂缓)
- 新增 docs/实验数据-字幕审校定位与修复实验.md:LLM 定位触发率/召回、合成正样本、逐条修复前后对照、成本与复现方式
- 新增 docs/实验数据-字幕重生成成本与耗时.md:单价口径、功率画像、全量推算
- decisions:补充两条决策(会话式长上下文否决、审校定位+定向修复暂缓)
- scripts:归档一次性探测脚本 probe_subtitle_review_stage0.py(含 rebuild 子步骤)
- AGENTS/README:补充实验与改动许可规则、文档索引
2026-09-19 18:33:28 +08:00

6.1 KiB
Raw Permalink Blame History

实验数据:字幕重生成的成本与耗时

本文件汇总 2026-09-18 ~ 09-19 媒体库字幕重生成(/mnt/fnOS/123)的实测资源与 费用口径,供后续推算与对比复用。原始数据见文末"数据来源"。


一、口径与单价

来源
翻译模型 SiliconFlow Qwen/Qwen3.5-35B-A3Benable_thinking=false .env 线上配置
输入单价 ¥0.400 / M tokens<128k 档) 用户提供的价目表
输出单价 ¥3.200 / M tokens<128k 档) 同上
电价 ¥0.5 / 度(kWh 用户口径
本地卡 RTX 3090350W 上限,24GB nvidia-smi
输入/输出拆分 按批输入 ≈529 tokens 实测回推,其余计输出 单批预检实测

二、功率画像(实测)

状态 GPU 功率 说明
空闲(提音/线上翻译阶段) 1920 W GPU 显存 272 MiB
转写(faster-whisper large-v2 270290 W 显存约 3.64.6 GB
本机 LLMOllama qwen3:30b-a3b 348 W 显存约 21 GB
整机(电表校验) 413 W 平均 第二批样本 58.1 分钟窗口,电表 1.6→2.0 度 = 0.40 kWh
整机非 GPU 部分 ≈137 W(本地 LLM 轮) / ≈100 W(云端轮估) 由上面两项相减估算

三、三轮样本实测对照

轮次 LLM 素材 结果 挂钟 速度 GPU 耗电 API 费用
batch_204b2e4f0cf4 本地 6.54 h / 10 个 10/10 77.7 min 11.9 min/素材小时 0.375 kWh(均 289.6W,峰 349.2W
batch_9ef5d063612b 本地 6.73 h / 10 个 9/10(1 个 API 失败后重试成功) 58.1 min 8.6 min/素材小时 0.267 kWh(均 275.6W);电表整机 0.40 kWh
batch_2dff6b79283f 云端 6.36 h / 10 个 10/10 41.5 min 6.5 min/素材小时 0.077 kWh(均 111.7WGPU 空闲占比 64% ¥0.186124,423 tokens

第三轮明细:翻译 2,761 行 / 143 批 / 纯 LLM 17.4 分钟;输入≈75.6k、输出≈48.8k tokens。

四、单素材小时指标(可直接乘算)

口径
API(云端轮 ③) 19,563 tokens/素材小时 → ¥0.0293/素材小时(每视频 ¥0.0186
API28 视频修复轮,见五) 33,136 tokens/素材小时 → ¥0.0504/素材小时
APINKKVR-175 A 单视频) 17,400 tokens/素材小时 → ¥0.0258/素材小时
电耗(云端 + 新流水线) ≈0.030 kWh/素材小时(GPU 0.021 + 系统 0.009
电耗(本地 LLM,电表实测) 0.059 kWh/素材小时
成本合计(云端方案) ¥0.015 电费 + ¥0.030.05 API = ¥0.0450.065/素材小时

五、28 视频损坏修复轮(2026-09-19

规模 28 个视频 / 16.87 小时素材(27 个新字幕损坏 + 1 个命名特例)
结果 26/28 一次成功;2 个云端 API 600s 读超时失败,重跑后 2/2 成功
挂钟 00:43 → 03:19 = 2.6 小时9.2 分钟/素材小时)
API 558,940 tokens → ¥0.850(输入≈335k / 输出≈224k
电耗 GPU 0.598 kWh(均 230W、忙碌占比 80%)→ 整机估 0.858 kWh = ¥0.43

六、流水线与 HST 的耗时影响

  • 新流水线(非 GPU 阶段并行) 实测重叠:kiwvr-886/887 那轮里 B 视频的云端翻译 22:51:08→22:52:37)与 A 视频的转写(22:51:08→22:54:42)完全重叠;串行实现下这段 GPU 会空转。
  • extract 可与转写并行:8 个视频提音约 7.8 分钟(GPU 空闲),流水线里被转写掩盖。
  • HSThallucination_silence_threshold=2.0 + word_timestamps 让转写变慢: 同一段 120 秒音频 15.4s → 25.4s1.8×);换来片头 120 秒无对话段的字幕条数 15 → 4(且无套话幻觉残留)。
阶段(云端 + HST,8 个视频一组 / 5.1 小时素材) 实测
extract ≈7.8 分钟(GPU 空闲,可并行)
ASR ≈12.9 分钟 × 1.8HST ≈ 23 分钟(GPU 满载)
translate ≈1517 分钟(GPU 空闲,与 ASR 重叠)
ASS 秒级

七、全量推算(2026-09-19 状态)

待重生成:349 个 / 187.86 小时素材(媒体库共 524 个 / 287.27 小时)。

方案 API 电费 合计 挂钟
云端 + HST(当前配置) ¥5.59.4(按 ¥0.030.05/素材小时) ≈¥2.8 ¥1012 1720 小时
本地 LLM(对照) ¥5.711.5 kWh ¥5.7 2839 小时

敏感性:HST 关闭 → 电费约 ¥1.6、挂钟约 11 小时;HST 实测倍数升到 2.2× → 电费 ¥3.4、 挂钟约 21 小时。若翻译改成"会话式长上下文"(见 待办-翻译上下文复用与语义纠错.md), 输入 token 会大幅上升,上表 API 一列必须重算

八、测量陷阱

  • 任务行的 updated_at 不是完成时间GET /api/batch/jobs* 会触发 sync_batch_job_progress 重写该字段;请用日志的"批量任务 … 完成"行、明细的 updated_at,或 data/experiments/regen_plan/app_cloud_run.log 的时间戳。
  • GPU 采样用 nvidia-smi --query-gpu=... -l 15,能量按"采样均值 × 窗口时长"积分; 窗口边界要与起止时间对齐(脚本按时间过滤 CSV 行)。

九、数据来源(本机)

内容 路径
全量实测报告(9 节,含根因与 A/B) data/experiments/regen_plan/REPORT.md
数据量扫描与逐条明细 data/experiments/regen_plan/plan_2026-09-01.jsonsample10*.txt
应用的运行日志(含每批 tokens 与阶段时序) data/experiments/regen_plan/app_cloud_run.log
GPU 功耗采样 data/experiments/regen_plan/gpu_power_*.csv
质量对照(新旧字幕指标) data/experiments/regen_plan/quality_review.md
提示词快照(做实验用) data/experiments/regen_plan/prompt_dump/
资源调度设计笔记 data/experiments/regen_plan/design_gpu_resource_scheduling.md