实验数据:字幕重生成的成本与耗时
本文件汇总 2026-09-18 ~ 09-19 媒体库字幕重生成(/mnt/fnOS/123)的实测资源与
费用口径,供后续推算与对比复用。原始数据见文末"数据来源"。
一、口径与单价
| 项 |
值 |
来源 |
| 翻译模型 |
SiliconFlow Qwen/Qwen3.5-35B-A3B(enable_thinking=false) |
.env 线上配置 |
| 输入单价 |
¥0.400 / M tokens(<128k 档) |
用户提供的价目表 |
| 输出单价 |
¥3.200 / M tokens(<128k 档) |
同上 |
| 电价 |
¥0.5 / 度(kWh) |
用户口径 |
| 本地卡 |
RTX 3090(350W 上限,24GB) |
nvidia-smi |
| 输入/输出拆分 |
按批输入 ≈529 tokens 实测回推,其余计输出 |
单批预检实测 |
二、功率画像(实测)
| 状态 |
GPU 功率 |
说明 |
| 空闲(提音/线上翻译阶段) |
19–20 W |
GPU 显存 272 MiB |
| 转写(faster-whisper large-v2) |
270–290 W |
显存约 3.6–4.6 GB |
本机 LLM(Ollama qwen3:30b-a3b) |
348 W |
显存约 21 GB |
| 整机(电表校验) |
413 W 平均 |
第二批样本 58.1 分钟窗口,电表 1.6→2.0 度 = 0.40 kWh |
| 整机非 GPU 部分 |
≈137 W(本地 LLM 轮) / ≈100 W(云端轮估) |
由上面两项相减估算 |
三、三轮样本实测对照
| 轮次 |
LLM |
素材 |
结果 |
挂钟 |
速度 |
GPU 耗电 |
API 费用 |
① batch_204b2e4f0cf4 |
本地 |
6.54 h / 10 个 |
10/10 |
77.7 min |
11.9 min/素材小时 |
0.375 kWh(均 289.6W,峰 349.2W) |
— |
② batch_9ef5d063612b |
本地 |
6.73 h / 10 个 |
9/10(1 个 API 失败后重试成功) |
58.1 min |
8.6 min/素材小时 |
0.267 kWh(均 275.6W);电表整机 0.40 kWh |
— |
③ batch_2dff6b79283f |
云端 |
6.36 h / 10 个 |
10/10 |
41.5 min |
6.5 min/素材小时 |
0.077 kWh(均 111.7W,GPU 空闲占比 64%) |
¥0.186(124,423 tokens) |
第三轮明细:翻译 2,761 行 / 143 批 / 纯 LLM 17.4 分钟;输入≈75.6k、输出≈48.8k tokens。
四、单素材小时指标(可直接乘算)
| 口径 |
值 |
| API(云端轮 ③) |
19,563 tokens/素材小时 → ¥0.0293/素材小时(每视频 ¥0.0186) |
| API(28 视频修复轮,见五) |
33,136 tokens/素材小时 → ¥0.0504/素材小时 |
| API(NKKVR-175 A 单视频) |
17,400 tokens/素材小时 → ¥0.0258/素材小时 |
| 电耗(云端 + 新流水线) |
≈0.030 kWh/素材小时(GPU 0.021 + 系统 0.009) |
| 电耗(本地 LLM,电表实测) |
0.059 kWh/素材小时 |
| 成本合计(云端方案) |
¥0.015 电费 + ¥0.03–0.05 API = ¥0.045–0.065/素材小时 |
五、28 视频损坏修复轮(2026-09-19)
| 项 |
值 |
| 规模 |
28 个视频 / 16.87 小时素材(27 个新字幕损坏 + 1 个命名特例) |
| 结果 |
26/28 一次成功;2 个云端 API 600s 读超时失败,重跑后 2/2 成功 |
| 挂钟 |
00:43 → 03:19 = 2.6 小时(9.2 分钟/素材小时) |
| API |
558,940 tokens → ¥0.850(输入≈335k / 输出≈224k) |
| 电耗 |
GPU 0.598 kWh(均 230W、忙碌占比 80%)→ 整机估 0.858 kWh = ¥0.43 |
六、流水线与 HST 的耗时影响
- 新流水线(非 GPU 阶段并行) 实测重叠:
kiwvr-886/887 那轮里 B 视频的云端翻译
(22:51:08→22:52:37)与 A 视频的转写(22:51:08→22:54:42)完全重叠;串行实现下这段
GPU 会空转。
- extract 可与转写并行:8 个视频提音约 7.8 分钟(GPU 空闲),流水线里被转写掩盖。
- HST(
hallucination_silence_threshold=2.0 + word_timestamps) 让转写变慢:
同一段 120 秒音频 15.4s → 25.4s(1.8×);换来片头 120 秒无对话段的字幕条数
15 → 4(且无套话幻觉残留)。
| 阶段(云端 + HST,8 个视频一组 / 5.1 小时素材) |
实测 |
| extract |
≈7.8 分钟(GPU 空闲,可并行) |
| ASR |
≈12.9 分钟 × 1.8(HST) ≈ 23 分钟(GPU 满载) |
| translate |
≈15–17 分钟(GPU 空闲,与 ASR 重叠) |
| ASS |
秒级 |
七、全量推算(2026-09-19 状态)
待重生成:349 个 / 187.86 小时素材(媒体库共 524 个 / 287.27 小时)。
| 方案 |
API |
电费 |
合计 |
挂钟 |
| 云端 + HST(当前配置) |
¥5.5–9.4(按 ¥0.03–0.05/素材小时) |
≈¥2.8 |
¥10–12 |
17–20 小时 |
| 本地 LLM(对照) |
— |
¥5.7(11.5 kWh) |
¥5.7 |
28–39 小时 |
敏感性:HST 关闭 → 电费约 ¥1.6、挂钟约 11 小时;HST 实测倍数升到 2.2× → 电费 ¥3.4、
挂钟约 21 小时。若翻译改成"会话式长上下文"(见
待办-翻译上下文复用与语义纠错.md),
输入 token 会大幅上升,上表 API 一列必须重算。
八、测量陷阱
- 任务行的
updated_at 不是完成时间:GET /api/batch/jobs* 会触发
sync_batch_job_progress 重写该字段;请用日志的"批量任务 … 完成"行、明细的
updated_at,或 data/experiments/regen_plan/app_cloud_run.log 的时间戳。
- GPU 采样用
nvidia-smi --query-gpu=... -l 15,能量按"采样均值 × 窗口时长"积分;
窗口边界要与起止时间对齐(脚本按时间过滤 CSV 行)。
九、数据来源(本机)
| 内容 |
路径 |
| 全量实测报告(9 节,含根因与 A/B) |
data/experiments/regen_plan/REPORT.md |
| 数据量扫描与逐条明细 |
data/experiments/regen_plan/plan_2026-09-01.json、sample10*.txt |
| 应用的运行日志(含每批 tokens 与阶段时序) |
data/experiments/regen_plan/app_cloud_run.log |
| GPU 功耗采样 |
data/experiments/regen_plan/gpu_power_*.csv |
| 质量对照(新旧字幕指标) |
data/experiments/regen_plan/quality_review.md |
| 提示词快照(做实验用) |
data/experiments/regen_plan/prompt_dump/ |
| 资源调度设计笔记 |
data/experiments/regen_plan/design_gpu_resource_scheduling.md |