feat: 优化学习视频转写与字幕清洗
This commit is contained in:
+1
-1
@@ -23,7 +23,7 @@
|
||||
"node_type": "faster-whisper",
|
||||
"params": {
|
||||
"language": "ja",
|
||||
"model_path": "faster-whisper-large-v3",
|
||||
"model_path": "faster-whisper-large-v2",
|
||||
"condition_on_previous_text": false,
|
||||
"chunk_seconds": 60,
|
||||
"vad_filter": true
|
||||
|
||||
@@ -26,7 +26,7 @@
|
||||
"node_type": "faster-whisper",
|
||||
"params": {
|
||||
"language": "ja",
|
||||
"model_path": "faster-whisper-large-v3",
|
||||
"model_path": "faster-whisper-large-v2",
|
||||
"decode_full": true,
|
||||
"condition_on_previous_text": false,
|
||||
"chunk_seconds": 60,
|
||||
@@ -37,7 +37,8 @@
|
||||
"_note_chunk_seconds": "60s 分块:内存/显存有界、失败粒度小,块偏移按 WAV 实际时长累积无漂移。正例:2 小时学习视频切成 120 块逐块转写,每块独立,某块失败只重跑该块。反例:chunk_seconds=0(不分块)在长视频上显存吃紧,且一旦中途异常整段重来。decode_full 模式下分块同样生效,幻觉清洗在合并后的整条 SRT 上执行。",
|
||||
"_note_condition_on_previous_text": "false(默认):每个 30s 窗口独立解码,避免长音频下 whisper 把前文错误延续成重复/漂移(官方建议长音频方案)。正例:讲解视频 1 小时,各窗口互不污染,无重复句。反例:设为 true 时,若某窗口误识别,会沿上文把错误放大成整段重复。",
|
||||
"_note_beam_size": "1(贪心解码):速度最快且对清晰讲解足够;学习视频人声清晰,不需要 beam search 的多候选。正例:清晰人声 + beam=1 已能稳定出句。反例:若遇多说话人/嘈杂环境想提升,可调 beam_size=5,但速度明显下降(RTX3090 上约慢 3-5 倍),对本场景收益低。",
|
||||
"_node_help": "faster-whisper 节点(asr):把 WAV 转写为日语 SRT。\n【关键参数与效果】\n- decode_full=true(默认 false):无 VAD 整段解码,救回被 silero 当非语音剔除的弱语音/快速讲解/呻吟/混叠人声。\n 正例:savr-1054 全片 115 条 -> 340 条,'说了的话不漏'。\n 反例(false):弱语音整句消失,字幕出现无端空洞。副作用=无语音段长套话幻觉,已由节点日语幻觉清洗自动移除(连带时间戳整条删除,非 '-' 占位)。\n- vad_filter:decode_full 下被强制 false;独立开启时靠 silero 切语音段,适合纯安静对话,但对 BGM/气声场景会误杀真话。\n- chunk_seconds=60:分块转写,显存有界、块偏移按实际时长累积不漂移、可断点。\n- condition_on_previous_text=false:长音频防重复/漂移(官方建议)。\n- beam_size=1:贪心最快,清晰讲解足够。\n正例:学习视频讲解者轻声带过关键词也能召回。\n反例:开启 VAD 且遇快速讲解/轻微 BGM,弱音节被吞 -> 字幕缺句。"
|
||||
"_note_short_moan_max_chars": "3(默认):短呻吟/喘息碎片过滤的'有效假名上限'——decode_full 救回的弱语音中混有大量纯语气词碎片(あ…/ん?/はぁ…/んふふ 等),全部字符 ∈ 纯呻吟集合且有效假名数 ≤ 此值即整条删除,字幕不再被呻吟噪声刷屏。正例:呻吟片段 あ…/ん? 被整条删除、字幕清爽;真实短对话 そこ/やばい/ねえ/やだ/えへへ 含非呻吟字符天然命中不了、完整保留(实测 savr-1054 600s:133 条中仅删 14 条纯呻吟,真实长句零误删)。反例:设为 0 则关闭过滤,呻吟碎片重新混入字幕。",
|
||||
"_node_help": "faster-whisper 节点(asr):把 WAV 转写为日语 SRT。\n【关键参数与效果】\n- decode_full=true(默认 false):无 VAD 整段解码,救回被 silero 当非语音剔除的弱语音/快速讲解/呻吟/混叠人声。\n 正例:savr-1054 全片 115 条 -> 340 条,'说了的话不漏'。\n 反例(false):弱语音整句消失,字幕出现无端空洞。副作用=无语音段长套话幻觉,已由节点日语幻觉清洗自动移除(连带时间戳整条删除,非 '-' 占位)。\n- vad_filter:decode_full 下被强制 false;独立开启时靠 silero 切语音段,适合纯安静对话,但对 BGM/气声场景会误杀真话。\n- chunk_seconds=60:分块转写,显存有界、块偏移按实际时长累积不漂移、可断点。\n- condition_on_previous_text=false:长音频防重复/漂移(官方建议)。\n- beam_size=1:贪心最快,清晰讲解足够。\n- short_moan_max_chars=3:短呻吟/喘息碎片过滤阈值(纯呻吟全字符命中且≤N假名才删,真实短对话不命中;0=关闭)。\n正例:学习视频讲解者轻声带过关键词也能召回。\n反例:开启 VAD 且遇快速讲解/轻微 BGM,弱音节被吞 -> 字幕缺句。"
|
||||
},
|
||||
"inputs": {
|
||||
"audio_uri": "extract.audio_uri"
|
||||
|
||||
Reference in New Issue
Block a user