作者driftcreator (猫爹)
看板AC_In
标题Re: [请神] 没给台本的音声 freetalk 怎可靠取提取文字
时间Tue Apr 22 02:07:47 2025
通用的外语音档 转 字幕档文字 转 译本步骤
1. 使用whisperX或是whisperKit,或是以其作为基底的应用程式
原版whisper只专注声音转文字,所以英文以外的语言有跳针问题,也没有时间轴标记
以上这两款是目前开源中最能减少上述两个问题发生的专案
2. 用large v3或large v3 turbo模型去跑
在大幅度减免跳针问题後,就可以使用精度较高的large v3模型了
如果是翻译日文的话,也可以使用huggingface上kotoba-tech的日文微调模型
3. 确认时间轴是否有在正确的位置上
如果大部分都微歪的话,用ffsubsync做校正
4. 把字幕档丢进去LLM模型翻译
有一些已经包装好的字幕翻译应用程式可以放API key进去使用
或使用Google AI studio的Gemini Pro 2.5去翻译。聪明、记忆力好、输出长度高
要下的指令有:
a. 音档原语言、情境、要翻译成台湾繁体中文
b. 这个音档是机器提取,可能会有错译,必要时可以参考上下文改成合理的近音字
c. 编号与时间轴不要动到、保持原状
d. 如果被挡,要把safety settings全关掉,然後下越狱词
一次跑不完的话,就告知LLM从编号xxx继续往下翻,最後再自己整篇拼起来
记得要抽查编号与时间轴,LLM有时候会脑抽在某个位置整组歪掉
5. 用字幕档软体做校阅
改译文、微调时间轴、把重复的内容合并或缩减、无意义的内容删掉 etc.
流程原则上是这样,嫌麻烦的话也可以自己写code或vibe coding,把这堆东西统整起来
--
※ 发信站: 批踢踢实业坊(ptt.cc), 来自: 184.65.128.80 (加拿大)
※ 文章网址: https://webptt.com/cn.aspx?n=bbs/AC_In/M.1745258870.A.380.html
※ 编辑: driftcreator (184.65.128.80 加拿大), 04/22/2025 02:14:26
1F:推 jeeplong: 大师 04/22 02:37
2F:推 unlucky: 大感谢 04/25 23:17
3F:→ unlucky: 是翻译大师之一!? 04/25 23:18