本帖最后由 州周 于 2024-5-20 21:20 编辑 ( A2 b4 b8 }6 j5 ?8 K) s
3 e' @0 F' ?; a起因:B站刷到了用Ai蚊子唱See you again的视频,正好我也用过这类Ai,又正好不会调音就想出来用Ai技术训练JR发车音乐,在理论上是可以这么做的。! Y R6 C5 m/ X" }/ ~) k$ D
$ Y0 v" @- y# ~. s( A& J
首先,选择哪种开源的vits。纯Vtis只能生成文本,对与音频方面无帮助。SVC(So-vits)音频生成音频。GPT-VITS也是音频生成音频,但是目前只能用中文训练,由于输入是纯音乐,所以大概率是不行的。综上我们选择So-vits。 s' d3 |8 R6 J
SVC和大部分模型一样使用Diffusion(扩散)的方式进行训练还有推理,大体方式:将例子音频加噪,用模型再一点点的去噪,生成出音频。
* ]/ _6 t0 l3 Z# _1 |
$ a7 A* e; d3 u# @" L- \5 G# O/ }准备音频环节,使用RVC5将发车音乐的主旋律提取出来,避免其他乐器影响主旋律音色导致模型质量下降,同时Adobe Audition做后期处理时控制电平、处理混响,避免不必要的东西音响模型质量。) y* z1 t# {$ W. c8 b9 n
训练步骤:
5 x$ X& k7 O9 Z5 `$ ustep0~1600 FP32 1e-5 控制ir值在30以下
7 n* \* n& O/ o/ ^step1600~3200 FP16 5e-4 模型基础已经打好,使用半精度加快训练进度,学习率降低补一点点缺失的内容,代价是ir率的上升 . I8 N# ~- d @2 y: r
step3200~4000 FP32 1e-3 最后调大学习率巩固内容,同时调回单精度不让模型质量下降,ir率下降到23~28时见好就收 噪声公式及学习率相关 0 ~; \0 f: x- w( k# \2 T
9 f' C" Y& l) e1 Y6 d# H$ o4 C# u
/ w+ e- Z9 m( D" O
5 W/ `5 E- }6 Y p9 s+ |- \# _% P& u' x$ H) n$ Z* d1 i% G
1 Z) h" p8 p+ U. u# }; X& }. Y; F+ [
|