![]()
事情的起因,是我刷到一条 AI 孙燕姿翻唱。
明明是周杰伦的歌,一开口却是孙燕姿的声线,气息和咬字居然也像那么回事。我当时脑子里的流程非常朴素:把人声和 BGM 分开,再把人声变成另一个人,不就完了?
于是目标也很快定了——让林俊杰唱《剑来》的主题曲《知我》。
下一秒我才想到一个很基础的问题:林俊杰的声音从哪来?
它到底是在“换”什么
这东西没我想的那么玄,但也不是给音频套一层“林俊杰滤镜”。RVC 不负责重新唱歌,它更像一个音色转换器:先拿到已经唱好的干声,保留旋律、节奏和大部分换气,再替换“谁在唱”这件事。
拿《知我》举例,原唱怎么唱,旋律、节奏、换气大体就怎么保留。模型要做的,是把“谁在唱”这件事换掉:原来是原唱的声线,换成目标歌手的声线。最后再把处理后的人声和伴奏合在一起,才是一首完整的歌。
所以原曲得先拆成“人声”和“伴奏”。整首歌直接送进去,鼓、贝斯和混响也会被卷进转换,最后很容易变成一锅带着金属味的粥。所谓干声,简单说就是尽量只留下人声的那条轨道。
歌和素材找齐了,模型没有
《知我》的原唱和伴奏,在 B 站都有,无损音源也让我翻出来了。训练素材我选了《修炼爱情》《关键词》《交换余生》《她说》,四首无损单曲,加起来 18 分钟。
到这里我还挺乐观。歌找齐、拆轨、整理素材,前后两个小时,进度条看起来已经走了一半。后来才知道,这一半主要是心理作用。
我先搜 GitHub 和 Hugging Face,又去模型站看,最后连 B 站那几个号称几百款音色的合集也翻了一遍。结果很干脆:在我能找到的公开来源里,林俊杰模型是 0 条。
一开始我还以为是自己搜法不对,换了几个地方以后才发现,这不是关键词的问题。真人歌手的音色模型被清理得差不多了,跟孙燕姿遇到的情况一样。模型文件本身不难理解,难的是你得先拿到一个能用的模型文件。
所以只剩自己训练这一条路。
看到 RVC 能从十几分钟素材里学音色时,我甚至还有点兴奋:这么牛?四首歌就能炼出一个模型?于是我选了本地训练。这个决定按下去的时候很轻,后面那个“预计十五小时”倒是很重。
网上那些“几分钟做一首 AI 翻唱”的教程,大多默认音色模型已经准备好了。我偏偏缺的就是这个,只能从训练开始。
十五个小时
我把“训练模型”和“使用模型”误当成了同一步。训练是在让机器从一批干净人声里学音色;拿现成模型处理一首歌,只是后面那段轻得多的工作。视频里几分钟出结果,往往是把最慢的上半段藏到镜头外了。
而我没有现成模型,只能从训练开始。

RVC 训练更适合显卡,我没有,只能让 Apple M5 的 CPU 硬扛。安静的电脑很快有了存在感。
每轮训练 5 到 6 分钟,一共 150 轮。我拿计算器一按:十五个小时。
我先怀疑自己算错了。再算一遍,还是十五个小时。很好,本地训练没有骗我,它只是非常诚实。
看着进度条,我就放弃了
我等了半小时,只跑完几轮。流程没错,素材也能用,日志甚至一片正常。唯一的问题是:它打算正常地跑到明天。
看到“预计 15 小时”,我终于承认路线选错了。我还没喜欢这首翻唱到愿意让电脑替它上一整夜班。停进程,删东西——Python 环境、RVC、训练数据、分离好的音频,加起来八个多 G,全删了。
有意思的是,删完东西风扇还在转。查了一下,是系统在后台重建索引,毕竟我刚删了八个 G 的文件。得,连放弃都要付利息。
回头看,RVC 和素材都没出问题。问题出在“本地还是云端”这个岔路口,我选了最有节目效果的一边。
云端方案后来也查清楚了:AutoDL 上的入门显卡按小时租,成本大致就是几块钱。具体多久还要看显卡和参数,但问题至少会从“电脑要不要转一整晚”,变成“愿不愿意花几块钱”。素材反正都能重新准备,下次再研究,我会直接上云。
真人音色模型还牵涉版权和本人意愿。找不到林俊杰的模型不完全是坏事,至少没有让我顺手拿一个来路不明的文件去发布。真要继续,我会先用自己的声音把流程跑通。
这次没有成品,连推理都没走到。流程倒是看明白了。下次再玩,先租显卡。